{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,7]],"date-time":"2026-07-07T12:13:33Z","timestamp":1783426413311,"version":"3.54.6"},"reference-count":30,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,5,1]],"date-time":"2026-05-01T00:00:00Z","timestamp":1777593600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,5,1]],"date-time":"2026-05-01T00:00:00Z","timestamp":1777593600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,1,26]],"date-time":"2026-01-26T00:00:00Z","timestamp":1769385600000},"content-version":"vor","delay-in-days":0,"URL":"http:\/\/creativecommons.org\/licenses\/by-nc-nd\/4.0\/"}],"funder":[{"DOI":"10.13039\/501100003329","name":"Gobierno de Espa\u00f1a Ministerio de Econom\u00eda y Competitividad","doi-asserted-by":"publisher","award":["PID2022-140189OB-C21"],"award-info":[{"award-number":["PID2022-140189OB-C21"]}],"id":[{"id":"10.13039\/501100003329","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100003329","name":"Gobierno de Espa\u00f1a Ministerio de Econom\u00eda y Competitividad","doi-asserted-by":"publisher","award":["CIPROM\/2022\/20"],"award-info":[{"award-number":["CIPROM\/2022\/20"]}],"id":[{"id":"10.13039\/501100003329","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Medical Image Analysis"],"published-print":{"date-parts":[[2026,5]]},"DOI":"10.1016\/j.media.2026.103964","type":"journal-article","created":{"date-parts":[[2026,1,26]],"date-time":"2026-01-26T23:30:14Z","timestamp":1769470214000},"page":"103964","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"C","title":["MIL-Adapter: Coupling multiple instance learning and vision-language adapters for few-shot slide-level classification"],"prefix":"10.1016","volume":"110","author":[{"ORCID":"https:\/\/orcid.org\/0000-0001-7821-6168","authenticated-orcid":false,"given":"Pablo","family":"Meseguer","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-5342-2093","authenticated-orcid":false,"given":"Roc\u00edo","family":"del Amor","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-0181-3412","authenticated-orcid":false,"given":"Valery","family":"Naranjo","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.media.2026.103964_bib0001","doi-asserted-by":"crossref","DOI":"10.1038\/s41591-019-0508-1","article-title":"Clinical-grade computational pathology using weakly supervised deep learning on whole slide images","author":"Campanella","year":"2019","journal-title":"Nat. Med."},{"key":"10.1016\/j.media.2026.103964_bib0002","series-title":"Medical Image Computing and Computer Assisted Intervention\u2013MICCAI 2021: 24th International Conference, Strasbourg, France, September 27\u2013October 1, 2021, Proceedings, Part VIII 24","first-page":"339","article-title":"Whole slide images are 2D point clouds: context-aware survival prediction using patch-based graph convolutional networks","author":"Chen","year":"2021"},{"key":"10.1016\/j.media.2026.103964_bib0003","unstructured":"Chen, S., Campanella, G., Elmas, A., Stock, A., Zeng, J., Polydorides, A. D., Schoenfeld, A. J., Huang, K.-l., Houldsworth, J., Vanderbilt, C., et al., 2024. Benchmarking embedding aggregation methods in computational pathology: a clinical data perspective. arXiv: 2407.07841."},{"key":"10.1016\/j.media.2026.103964_bib0004","series-title":"International Conference on Medifcal Image Computing and Computer-Assisted Intervention","first-page":"285","article-title":"Low-shot prompt tuning for multiple instance learning based histology classification","author":"Chikontwe","year":"2024"},{"key":"10.1016\/j.media.2026.103964_bib0005","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1038\/s41591-025-03982-3","article-title":"A multimodal whole-slide foundation model for pathology","volume":"31","author":"Ding","year":"2025","journal-title":"Nat. Med."},{"key":"10.1016\/j.media.2026.103964_bib0006","unstructured":"Eslami, S., de Melo, G., Meinel, C., 2021. Does clip benefit visual question answering in the medical domain as much as it does in the general domain?arXiv: 2112.13906."},{"key":"10.1016\/j.media.2026.103964_bib0007","first-page":"1","article-title":"CLIP-adapter: better vision-language models with feature adapters","volume":"132","author":"Gao","year":"2023","journal-title":"Int. J. Comput. Vis."},{"key":"10.1016\/j.media.2026.103964_bib0008","series-title":"Proceedings of the Thirteenth International Conference on Artificial Intelligence and Statistics","first-page":"249","article-title":"Understanding the difficulty of training deep feedforward neural networks","author":"Glorot","year":"2010"},{"key":"10.1016\/j.media.2026.103964_bib0009","series-title":"International Conference on Machine Learning","first-page":"2790","article-title":"Parameter-efficient transfer learning for NLP","author":"Houlsby","year":"2019"},{"issue":"9","key":"10.1016\/j.media.2026.103964_bib0010","doi-asserted-by":"crossref","first-page":"2307","DOI":"10.1038\/s41591-023-02504-3","article-title":"A visual\u2013language foundation model for pathology image analysis using medical twitter","volume":"29","author":"Huang","year":"2023","journal-title":"Nat. Med."},{"key":"10.1016\/j.media.2026.103964_bib0011","doi-asserted-by":"crossref","unstructured":"Ikezogwo, W. O., Seyfioglu, M. S., Ghezloo, F., Geva, D. S. C., Mohammed, F. S., Anand, P. K., Krishna, R., Shapiro, L., 2023. Quilt-1M: one million image-text pairs for histopathology. arXiv: 2306.11207.","DOI":"10.52202\/075280-1654"},{"key":"10.1016\/j.media.2026.103964_bib0012","series-title":"International Conference on Machine Learning","first-page":"2127","article-title":"Attention-based deep multiple instance learning","author":"Ilse","year":"2018"},{"key":"10.1016\/j.media.2026.103964_bib0013","series-title":"European Conference on Computer Vision","first-page":"19","article-title":"Multistain pretraining for slide representation learning in pathology","author":"Jaume","year":"2025"},{"key":"10.1016\/j.media.2026.103964_bib0014","unstructured":"Krizhevsky, A., Sutskever, I., Hinton, G. E., 2012. ImageNet classification with deep convolutional neural networks. Pereira, F., Burges, C. J., Bottou, L., Weinberger, K. Q., Advances in Neural Information Processing Systems. Curran Associates, Inc., 25. https:\/\/proceedings.neurips.cc\/paper_files\/paper\/2012\/file\/c399862d3b9d6b76c8436e924a68c45b-Paper.pdf."},{"key":"10.1016\/j.media.2026.103964_bib0015","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"11323","article-title":"Dynamic graph representation with knowledge-aware attention for histopathology whole slide image analysis","author":"Li","year":"2024"},{"issue":"3","key":"10.1016\/j.media.2026.103964_bib0016","doi-asserted-by":"crossref","first-page":"863","DOI":"10.1038\/s41591-024-02856-4","article-title":"A visual-language foundation model for computational pathology","volume":"30","author":"Lu","year":"2024","journal-title":"Nat. Med."},{"key":"10.1016\/j.media.2026.103964_bib0017","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"19764","article-title":"Visual language pretrained multiple instance zero-shot transfer for histopathology images","author":"Lu","year":"2023"},{"key":"10.1016\/j.media.2026.103964_bib0018","unstructured":"C. Loeffler, J. N. Kather, Manual tumor annotations in TCGA (v0.1), 2021. 10.5281\/zenodo.5320076."},{"issue":"6","key":"10.1016\/j.media.2026.103964_bib0019","doi-asserted-by":"crossref","first-page":"555","DOI":"10.1038\/s41551-020-00682-w","article-title":"Data-efficient and weakly supervised computational pathology on whole-slide images","volume":"5","author":"Lu","year":"2021","journal-title":"Nat. Biomed. Eng."},{"key":"10.1016\/j.media.2026.103964_bib0020","series-title":"International Conference on Machine Learning","first-page":"8748","article-title":"Learning transferable visual models from natural language supervision","author":"Radford","year":"2021"},{"key":"10.1016\/j.media.2026.103964_bib0021","first-page":"2136","article-title":"TransMIL: transformer based correlated multiple instance learning for whole slide image classification","volume":"34","author":"Shao","year":"2021","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.media.2026.103964_bib0022","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"23681","article-title":"A closer look at the few-shot adaptation of large vision-language models","author":"Silva-Rodriguez","year":"2024"},{"key":"10.1016\/j.media.2026.103964_bib0023","doi-asserted-by":"crossref","DOI":"10.1016\/j.media.2020.101813","article-title":"Deep neural network models for computational histopathology: a survey","volume":"67","author":"Srinidhi","year":"2021","journal-title":"Med. Image Anal."},{"key":"10.1016\/j.media.2026.103964_bib0024","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"11343","article-title":"Feature re-embedding: towards foundation model-level performance in computational pathology","author":"Tang","year":"2024"},{"key":"10.1016\/j.media.2026.103964_bib0025","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"7959","article-title":"Robust fine-tuning of zero-shot models","author":"Wortsman","year":"2022"},{"key":"10.1016\/j.media.2026.103964_bib0026","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"10899","article-title":"Task residual for tuning vision-language models","author":"Yu","year":"2023"},{"key":"10.1016\/j.media.2026.103964_bib0027","unstructured":"Zhang, R., Fang, R., Zhang, W., Gao, P., Li, K., Dai, J., Qiao, Y., Li, H., 2021. Tip-adapter: training-free clip-adapter for better vision-language modeling. arXiv: 2111.03930."},{"key":"10.1016\/j.media.2026.103964_bib0028","unstructured":"Zhang, S., Xu, Y., Usuyama, N., Bagga, J., Tinn, R., Preston, S., Rao, R., Wei, M., Valluri, N., Wong, C., et al., 2023. Large-scale domain-specific pretraining for biomedical vision-language processing. arXiv: 2303.00915."},{"issue":"9","key":"10.1016\/j.media.2026.103964_bib0029","doi-asserted-by":"crossref","first-page":"2337","DOI":"10.1007\/s11263-022-01653-1","article-title":"Learning to prompt for vision-language models","volume":"130","author":"Zhou","year":"2022","journal-title":"Int. J. Comput. Vis."},{"key":"10.1016\/j.media.2026.103964_bib0030","unstructured":"Zhou, X., Sun, L., He, D., Guan, W., Wang, R., Wang, L., Sun, X., Sun, K., Zhang, Y., Wang, Y., et al., 2024. A knowledge-enhanced pathology vision-language foundation model for cancer diagnosis. arXiv: 2412.13126."}],"container-title":["Medical Image Analysis"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S1361841526000332?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S1361841526000332?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,7,7]],"date-time":"2026-07-07T11:15:03Z","timestamp":1783422903000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S1361841526000332"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,5]]},"references-count":30,"alternative-id":["S1361841526000332"],"URL":"https:\/\/doi.org\/10.1016\/j.media.2026.103964","relation":{},"ISSN":["1361-8415"],"issn-type":[{"value":"1361-8415","type":"print"}],"subject":[],"published":{"date-parts":[[2026,5]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"MIL-Adapter: Coupling multiple instance learning and vision-language adapters for few-shot slide-level classification","name":"articletitle","label":"Article Title"},{"value":"Medical Image Analysis","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.media.2026.103964","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 The Author(s). Published by Elsevier B.V.","name":"copyright","label":"Copyright"}],"article-number":"103964"}}