{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,15]],"date-time":"2026-05-15T00:12:38Z","timestamp":1778803958077,"version":"3.51.4"},"reference-count":75,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62306254"],"award-info":[{"award-number":["62306254"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100002920","name":"Research Grants Council, University Grants Committee","doi-asserted-by":"publisher","award":["T45-401\/22-N"],"award-info":[{"award-number":["T45-401\/22-N"]}],"id":[{"id":"10.13039\/501100002920","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Medical Image Analysis"],"published-print":{"date-parts":[[2026,6]]},"DOI":"10.1016\/j.media.2026.104060","type":"journal-article","created":{"date-parts":[[2026,4,1]],"date-time":"2026-04-01T07:03:09Z","timestamp":1775026989000},"page":"104060","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"C","title":["Towards generalizable pathology reports via a multimodal LLM with the multicenter in-context learning"],"prefix":"10.1016","volume":"111","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-7840-2611","authenticated-orcid":false,"given":"Yi","family":"Li","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zhihao","family":"Lin","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0002-3158-9471","authenticated-orcid":false,"given":"Qixiang","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xinpeng","family":"Ding","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0000-1804-6515","authenticated-orcid":false,"given":"Honglong","family":"Yang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Linjing","family":"Pi","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Wei","family":"Yuan","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yongqin","family":"Wen","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Linglang","family":"Guo","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Qingling","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-1105-8083","authenticated-orcid":false,"given":"Xiaomeng","family":"Li","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"78","reference":[{"key":"10.1016\/j.media.2026.104060_bib0001","unstructured":"Ahmed, F., Sellergren, A., Yang, L., Xu, S., Babenko, B., Ward, A., Olson, N., Mohtashamian, A., Matias, Y., Corrado, G. S., et al., 2024. Pathalign: a vision-language model for whole slide images in histopathology. arXiv preprint arXiv: 2406.19578."},{"key":"10.1016\/j.media.2026.104060_bib0002","doi-asserted-by":"crossref","first-page":"23716","DOI":"10.52202\/068431-1723","article-title":"Flamingo: a visual language model for few-shot learning","volume":"35","author":"Alayrac","year":"2022","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.media.2026.104060_bib0003","series-title":"International Conference on Smart City Applications","first-page":"1","article-title":"Automatic caption generation for medical images","author":"Allaouzi","year":"2018"},{"key":"10.1016\/j.media.2026.104060_bib0004","doi-asserted-by":"crossref","first-page":"291","DOI":"10.1016\/j.neucom.2018.05.080","article-title":"A survey on automatic image caption generation","volume":"311","author":"Bai","year":"2018","journal-title":"Neurocomputing"},{"key":"10.1016\/j.media.2026.104060_bib0005","unstructured":"Bai, Z., et al., 2024. Hallucination of multimodal large language models: a survey. arXiv preprint arXiv: 2404.18930."},{"key":"10.1016\/j.media.2026.104060_bib0006","doi-asserted-by":"crossref","first-page":"25005","DOI":"10.52202\/068431-1813","article-title":"Visual prompting via image inpainting","volume":"35","author":"Bar","year":"2022","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.media.2026.104060_bib0007","first-page":"1877","article-title":"Language models are few-shot learners","volume":"33","author":"Brown","year":"2020","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.media.2026.104060_bib0008","unstructured":"ChatGPT, https:\/\/openai.com\/index\/hello-gpt-4o."},{"key":"10.1016\/j.media.2026.104060_bib0009","series-title":"International Conference on Medical Image Computing and Computer-Assisted Intervention","first-page":"546","article-title":"Wsicaption: multiple instance generation of pathology reports for gigapixel whole-slide images","author":"Chen","year":"2024"},{"key":"10.1016\/j.media.2026.104060_bib0010","series-title":"Proceedings of the 2020 Conference on Empirical Methods in Natural Language Processing","article-title":"Generating radiology reports via memory-driven transformer","author":"Chen","year":"2020"},{"key":"10.1016\/j.media.2026.104060_bib0011","unstructured":"Chiang, W.-L., et al., 2023. Vicuna: an open-source chatbot impressing gpt-4 with 90%* chatgpt quality. See https:\/\/vicuna.lmsys.org (accessed 14 April 2023) 2 (3), 6."},{"key":"10.1016\/j.media.2026.104060_bib0012","series-title":"TNM classification of malignant tumours","author":"Sobin","year":"2011"},{"issue":"2","key":"10.1016\/j.media.2026.104060_bib0013","doi-asserted-by":"crossref","first-page":"304","DOI":"10.1093\/jamia\/ocv080","article-title":"Preparing a collection of radiology examinations for distribution and retrieval","volume":"23","author":"Demner-Fushman","year":"2016","journal-title":"J. Am. Med. Inf. Assoc."},{"key":"10.1016\/j.media.2026.104060_bib0014","doi-asserted-by":"crossref","DOI":"10.1016\/j.media.2024.103124","article-title":"Cross-scale multi-instance learning for pathological image diagnosis","volume":"94","author":"Deng","year":"2024","journal-title":"Med. Image Anal."},{"key":"10.1016\/j.media.2026.104060_bib0015","series-title":"Proceedings of the Sixth Workshop on Statistical Machine Translation","first-page":"85","article-title":"Meteor 1.3: automatic metric for reliable optimization and evaluation of machine translation systems","author":"Denkowski","year":"2011"},{"key":"10.1016\/j.media.2026.104060_bib0016","unstructured":"Ding, T., Wagner, S. J., Song, A. H., Chen, R. J., Lu, M. Y., Zhang, A., Vaidya, A. J., Jaume, G., Shaban, M., Kim, A., et al., 2024. Multimodal whole slide foundation model for pathology. arXiv preprint arXiv: 2411.19666."},{"key":"10.1016\/j.media.2026.104060_bib0017","unstructured":"Dong, Q., et al., 2022. A survey on in-context learning. arXiv preprint arXiv: 2301.00234."},{"key":"10.1016\/j.media.2026.104060_bib0018","series-title":"International Conference on Learning Representations","article-title":"An image is worth 16x16 words: transformers for image recognition at scale","author":"Dosovitskiy","year":"2021"},{"key":"10.1016\/j.media.2026.104060_bib0019","series-title":"International Conference on Learning Representations","article-title":"An image is worth 16x16 words: transformers for image recognition at scale","author":"Dosovitskiy","year":"2020"},{"key":"10.1016\/j.media.2026.104060_bib0020","doi-asserted-by":"crossref","DOI":"10.1016\/j.cviu.2022.103617","article-title":"Cross-domain multi-style merge for image captioning","volume":"228","author":"Duan","year":"2023","journal-title":"Comput. Vision Image Understand."},{"issue":"1","key":"10.1016\/j.media.2026.104060_bib0021","doi-asserted-by":"crossref","DOI":"10.1038\/s41467-024-51465-9","article-title":"In-context learning enables multimodal large language models to classify cancer pathology images","volume":"15","author":"Ferber","year":"2024","journal-title":"Nat. Commun."},{"issue":"7675","key":"10.1016\/j.media.2026.104060_bib0022","doi-asserted-by":"crossref","first-page":"204","DOI":"10.1038\/nature24277","article-title":"Genetic effects on gene expression across human tissues","volume":"550","author":"Fran\u00e7ois","year":"2017","journal-title":"Nature"},{"key":"10.1016\/j.media.2026.104060_bib0023","series-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition","first-page":"5630","article-title":"Semantic compositional networks for visual captioning","author":"Gan","year":"2017"},{"key":"10.1016\/j.media.2026.104060_bib0024","series-title":"Proceedings of the 61St Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","first-page":"4849","article-title":"Pre-training to learn in context","author":"Gu","year":"2023"},{"key":"10.1016\/j.media.2026.104060_bib0025","series-title":"International Conference on Medical Image Computing and Computer-Assisted Intervention","first-page":"189","article-title":"Histgen: histopathology report generation via local-global feature encoding and cross-modal context interaction","author":"Guo","year":"2024"},{"key":"10.1016\/j.media.2026.104060_bib0026","series-title":"Proceedings of the 61St Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","first-page":"1935","article-title":"Instruction induction: from few examples to natural language task descriptions","author":"Honovich","year":"2023"},{"key":"10.1016\/j.media.2026.104060_bib0027","doi-asserted-by":"crossref","first-page":"4462","DOI":"10.1109\/JSTARS.2020.3013818","article-title":"Toward remote sensing image retrieval under a deep image captioning perspective","volume":"13","author":"Hoxha","year":"2020","journal-title":"IEEE J. Sel. Top. Appl. Earth Obs. Remote Sens."},{"key":"10.1016\/j.media.2026.104060_bib0028","unstructured":"Hu, E. J., et al.,. LoRA: low-rank adaptation of large language models. In: International Conference on Learning Representations."},{"key":"10.1016\/j.media.2026.104060_bib0029","series-title":"Proceedings of the IEEE\/CVF International Conference on Computer Vision","first-page":"4634","article-title":"Attention on attention for image captioning","author":"Huang","year":"2019"},{"issue":"4","key":"10.1016\/j.media.2026.104060_bib0030","doi-asserted-by":"crossref","first-page":"778","DOI":"10.1002\/ijc.33588","article-title":"Cancer statistics for the year 2020: an overview","volume":"149","author":"Jacques","year":"2021","journal-title":"Int. J. Cancer"},{"issue":"1","key":"10.1016\/j.media.2026.104060_bib0031","doi-asserted-by":"crossref","first-page":"317","DOI":"10.1038\/s41597-019-0322-0","article-title":"Mimic-cxr, a de-identified publicly available database of chest radiographs with free-text reports","volume":"6","author":"Johnson","year":"2019","journal-title":"Sci. Data"},{"issue":"3","key":"10.1016\/j.media.2026.104060_bib0032","doi-asserted-by":"crossref","DOI":"10.1016\/j.patter.2024.100933","article-title":"Tcga-reports: a machine-readable pathology report resource for benchmarking text-based ai models","volume":"5","author":"Kefeli","year":"2024","journal-title":"Patterns"},{"key":"10.1016\/j.media.2026.104060_bib0033","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"14318","article-title":"Dual-stream multiple instance learning network for whole slide image classification with self-supervised contrastive learning","author":"Li","year":"2021"},{"key":"10.1016\/j.media.2026.104060_bib0034","article-title":"Llava-med: training a large language-and-vision assistant for biomedicine in one day","volume":"36","author":"Li","year":"2024","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.media.2026.104060_bib0035","series-title":"International Conference on Machine Learning","first-page":"19730","article-title":"Blip-2: bootstrapping language-image pre-training with frozen image encoders and large language models","author":"Li","year":"2023"},{"key":"10.1016\/j.media.2026.104060_bib0036","article-title":"An organ-aware diagnosis framework for radiology report generation","author":"Li","year":"2024","journal-title":"IEEE Trans. Med. Imaging"},{"key":"10.1016\/j.media.2026.104060_bib0037","series-title":"Text Summarization Branches Out","first-page":"74","article-title":"Rouge: a package for automatic evaluation of summaries","author":"Lin","year":"2004"},{"key":"10.1016\/j.media.2026.104060_bib0038","article-title":"Visual instruction tuning","volume":"36","author":"Liu","year":"2024","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.media.2026.104060_bib0039","series-title":"Proceedings of Deep Learning inside Out (DeeLIO 2022): The 3Rd Workshop on Knowledge Extraction and Integration for Deep Learning Architectures","first-page":"100","article-title":"What makes good in-context examples for GPT-3?","author":"Liu","year":"2022"},{"issue":"3","key":"10.1016\/j.media.2026.104060_bib0040","doi-asserted-by":"crossref","first-page":"863","DOI":"10.1038\/s41591-024-02856-4","article-title":"A visual-language foundation model for computational pathology","volume":"30","author":"Lu","year":"2024","journal-title":"Nat. Med."},{"issue":"6","key":"10.1016\/j.media.2026.104060_bib0041","doi-asserted-by":"crossref","DOI":"10.1093\/bib\/bbac409","article-title":"BioGPT: generative pre-trained transformer for biomedical text generation and mining","volume":"23","author":"Luo","year":"2022","journal-title":"Brief. Bioinformatics"},{"key":"10.1016\/j.media.2026.104060_bib0042","series-title":"2019 IEEE International Conference on Industrial Cyber Physical Systems","first-page":"827","article-title":"Visual image caption generation for service robotics and industrial applications","author":"Luo","year":"2019"},{"key":"10.1016\/j.media.2026.104060_bib0043","doi-asserted-by":"crossref","first-page":"335","DOI":"10.1007\/s00428-020-02894-6","article-title":"Number of pathologists in germany: comparison with european countries, USA, and canada","volume":"478","author":"M\u00e4rkl","year":"2021","journal-title":"Virchows Archiv"},{"issue":"5","key":"10.1016\/j.media.2026.104060_bib0044","article-title":"Trends in the US and canadian pathologist workforces from 2007 to 2017","volume":"2","author":"Metter David","year":"2019","journal-title":"JAMA Network open"},{"key":"10.1016\/j.media.2026.104060_bib0045","series-title":"Proceedings of the 2022 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies","first-page":"2791","article-title":"MetaICL: learning to learn in context","author":"Min","year":"2022"},{"key":"10.1016\/j.media.2026.104060_bib0046","series-title":"Machine Learning for Health (ML4H)","first-page":"353","article-title":"Med-flamingo: a multimodal medical few-shot learner","author":"Moor","year":"2023"},{"key":"10.1016\/j.media.2026.104060_bib0047","unstructured":"Nechaev, D., Pchelnikov, A., Ivanova, E., 2025. Histai: An open-source, large-scale whole slide image dataset for computational pathology. arXiv preprint arXiv: 2505.12120."},{"key":"10.1016\/j.media.2026.104060_bib0048","article-title":"Im2text: describing images using 1 million captioned photographs","volume":"24","author":"Ordonez","year":"2011","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.media.2026.104060_bib0049","series-title":"Proceedings of the 40Th Annual Meeting of the Association for Computational Linguistics","first-page":"311","article-title":"Bleu: a method for automatic evaluation of machine translation","author":"Papineni","year":"2002"},{"key":"10.1016\/j.media.2026.104060_bib0050","series-title":"Findings of the Association for Computational Linguistics: EMNLP 2024","first-page":"7441","article-title":"In-context learning with iterative demonstration selection","author":"Qin","year":"2024"},{"issue":"8","key":"10.1016\/j.media.2026.104060_bib0051","first-page":"9","article-title":"Language models are unsupervised multitask learners","volume":"1","author":"Radford","year":"2019","journal-title":"OpenAI blog"},{"key":"10.1016\/j.media.2026.104060_bib0052","series-title":"International Conference on Machine Learning","first-page":"8748","article-title":"Learning transferable visual models from natural language supervision","author":"Radford","year":"2021"},{"key":"10.1016\/j.media.2026.104060_bib0053","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"13183","article-title":"Quilt-LLaVA: visual instruction tuning by extracting localized narratives from open-source histopathology videos","author":"Seyfioglu","year":"2024"},{"key":"10.1016\/j.media.2026.104060_bib0054","unstructured":"Shaikovski, G., Casson, A., Severson, K., Zimmermann, E., Wang, Y. K., Kunz, J. D., Retamero, J. A., Oakley, G., Klimstra, D., Kanan, C., et al., 2024. Prism: a multi-modal generative foundation model for slide-level histopathology. arXiv preprint arXiv: 2405.10254."},{"key":"10.1016\/j.media.2026.104060_bib0055","unstructured":"Shen, L., et al., 2024. SegICL: a universal in-context learning framework for enhanced segmentation in medical imaging. arXiv preprint arXiv: 2403.16578."},{"key":"10.1016\/j.media.2026.104060_bib0056","series-title":"Proceedings of the IEEE\/CVF International Conference on Computer Vision","first-page":"10393","article-title":"Learning to caption images through a lifetime by asking questions","author":"Shen","year":"2019"},{"issue":"12","key":"10.1016\/j.media.2026.104060_bib0057","doi-asserted-by":"crossref","first-page":"930","DOI":"10.1038\/s44222-023-00096-8","article-title":"Artificial intelligence for digital and computational pathology","volume":"1","author":"Song Andrew","year":"2023","journal-title":"Nature Rev. Bioeng."},{"key":"10.1016\/j.media.2026.104060_bib0058","series-title":"International Conference on Medical Image Computing and Computer-Assisted Intervention","first-page":"25","article-title":"Clinical-grade multi-organ pathology report generation for multi-scale whole slide images via a semantically guided medical text foundation model","author":"Tan","year":"2024"},{"key":"10.1016\/j.media.2026.104060_bib0059","series-title":"International Conference on Machine Learning","first-page":"6105","article-title":"Efficientnet: rethinking model scaling for convolutional neural networks","author":"Tan","year":"2019"},{"key":"10.1016\/j.media.2026.104060_bib0060","unstructured":"G. Team, et al., 2023. Gemini: a family of highly capable multimodal models. arXiv preprint arXiv: 2312.11805."},{"key":"10.1016\/j.media.2026.104060_bib0061","unstructured":"Touvron, H., et al., 2023. Llama: open and efficient foundation language models. arXiv preprint arXiv: 2302.13971."},{"issue":"1","key":"10.1016\/j.media.2026.104060_bib0062","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1038\/s41467-025-60014-x","article-title":"Generating dermatopathology reports from gigapixel whole slide images with histoGPT","volume":"16","author":"Tran","year":"2025","journal-title":"Nat. Commun."},{"key":"10.1016\/j.media.2026.104060_bib0063","series-title":"International Conference on Medical Imaging with Deep Learning","first-page":"1235","article-title":"Inference of captions from histopathological patches","author":"Tsuneki","year":"2022"},{"key":"10.1016\/j.media.2026.104060_bib0064","unstructured":"Vaswani, A., 2017. Attention is all you need. arXiv preprint arXiv: 1706.03762."},{"key":"10.1016\/j.media.2026.104060_bib0065","series-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition","first-page":"3156","article-title":"Show and tell: a neural image caption generator","author":"Vinyals","year":"2015"},{"key":"10.1016\/j.media.2026.104060_bib0066","doi-asserted-by":"crossref","DOI":"10.1016\/j.media.2023.102890","article-title":"Multi-scale representation attention based deep multiple instance learning for gigapixel whole slide image analysis","volume":"89","author":"Xiang","year":"2023","journal-title":"Med. Image Anal."},{"key":"10.1016\/j.media.2026.104060_bib0067","unstructured":"Xie, S. M., Raghunathan, A., Liang, P., Ma, T.,. An explanation of in-context learning as implicit bayesian inference. In: International Conference on Learning Representations."},{"issue":"8015","key":"10.1016\/j.media.2026.104060_bib0068","doi-asserted-by":"crossref","first-page":"181","DOI":"10.1038\/s41586-024-07441-w","article-title":"A whole-slide foundation model for digital pathology from real-world data","volume":"630","author":"Xu","year":"2024","journal-title":"Nature"},{"issue":"8","key":"10.1016\/j.media.2026.104060_bib0069","doi-asserted-by":"crossref","first-page":"2211","DOI":"10.1109\/TMI.2023.3245608","article-title":"Attributed abnormality graph embedding for clinically accurate x-ray report generation","volume":"42","author":"Yan","year":"2023","journal-title":"IEEE Trans. Med. Imaging"},{"key":"10.1016\/j.media.2026.104060_bib0070","series-title":"Coling","article-title":"FaiMA: feature-aware in-context learning for multi-domain aspect-based sentiment analysis","author":"Yang","year":"2024"},{"key":"10.1016\/j.media.2026.104060_bib0071","series-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition","first-page":"4651","article-title":"Image captioning with semantic attention","author":"You","year":"2016"},{"key":"10.1016\/j.media.2026.104060_bib0072","unstructured":"Yu, J., Wang, Z., Vasudevan, V., Yeung, L., Seyedhosseini, M., Wu, Y., 2022. Coca: contrastive captioners are image-text foundation models. arXiv preprint arXiv: 2205.01917."},{"key":"10.1016\/j.media.2026.104060_bib0073","series-title":"Machine Learning for Healthcare Conference","first-page":"418","article-title":"Evaluating and interpreting caption prediction for histopathology images","author":"Zhang","year":"2020"},{"key":"10.1016\/j.media.2026.104060_bib0074","series-title":"Proceedings of the 2022 Conference on Empirical Methods in Natural Language Processing","first-page":"9134","article-title":"Active example selection for in-context learning","author":"Zhang","year":"2022"},{"key":"10.1016\/j.media.2026.104060_bib0075","series-title":"International Conference on Medical Image Computing and Computer-Assisted Intervention","first-page":"373","article-title":"Pathm3: a multimodal multi-task multiple instance learning framework for whole slide image classification and captioning","author":"Zhou","year":"2024"}],"container-title":["Medical Image Analysis"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S1361841526001283?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S1361841526001283?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,5,15]],"date-time":"2026-05-15T00:02:49Z","timestamp":1778803369000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S1361841526001283"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,6]]},"references-count":75,"alternative-id":["S1361841526001283"],"URL":"https:\/\/doi.org\/10.1016\/j.media.2026.104060","relation":{},"ISSN":["1361-8415"],"issn-type":[{"value":"1361-8415","type":"print"}],"subject":[],"published":{"date-parts":[[2026,6]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"Towards generalizable pathology reports via a multimodal LLM with the multicenter in-context learning","name":"articletitle","label":"Article Title"},{"value":"Medical Image Analysis","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.media.2026.104060","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Published by Elsevier B.V.","name":"copyright","label":"Copyright"}],"article-number":"104060"}}