{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,8]],"date-time":"2026-07-08T04:59:00Z","timestamp":1783486740361,"version":"3.55.0"},"reference-count":52,"publisher":"Springer Science and Business Media LLC","issue":"1","license":[{"start":{"date-parts":[[2026,4,30]],"date-time":"2026-04-30T00:00:00Z","timestamp":1777507200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by-nc-nd\/4.0"},{"start":{"date-parts":[[2026,7,7]],"date-time":"2026-07-07T00:00:00Z","timestamp":1783382400000},"content-version":"vor","delay-in-days":68,"URL":"https:\/\/creativecommons.org\/licenses\/by-nc-nd\/4.0"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["npj Digit. Med."],"DOI":"10.1038\/s41746-026-02676-5","type":"journal-article","created":{"date-parts":[[2026,4,30]],"date-time":"2026-04-30T00:05:50Z","timestamp":1777507550000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":1,"title":["Key concept learning for medical vision language model with reasoning capabilities"],"prefix":"10.1038","volume":"9","author":[{"given":"Wei","family":"Lou","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yue","family":"Wu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Pusheng","family":"Xu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Weiyi","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xiaolan","family":"Chen","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jiancheng","family":"Yang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Mingguang","family":"He","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Danli","family":"Shi","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2026,4,30]]},"reference":[{"key":"2676_CR1","doi-asserted-by":"crossref","unstructured":"Liu, C. et al. Visual\u2013language foundation models in medicine. Vis. Comput. 41, 2953\u20132972 (2024).","DOI":"10.1007\/s00371-024-03579-w"},{"key":"2676_CR2","doi-asserted-by":"publisher","first-page":"3129","DOI":"10.1038\/s41591-024-03185-2","volume":"30","author":"K Zhang","year":"2024","unstructured":"Zhang, K. et al. A generalist vision\u2013language foundation model for diverse biomedical tasks. Nat. Med. 30, 3129\u20133141 (2024).","journal-title":"Nat. Med."},{"key":"2676_CR3","doi-asserted-by":"crossref","unstructured":"Li, C. et al. Llava-med: Training a large language-and-vision assistant for biomedicine in one day. Adv. Neural Inf. Process. Syst. 36, 28541\u201328564 (2024).","DOI":"10.52202\/075280-1240"},{"key":"2676_CR4","doi-asserted-by":"crossref","unstructured":"Chen, X. et al. ChatFFA: an ophthalmic chat system for unified vision-language understanding and question answering for fundus fluorescein angiography. iScience. 27, 110021 (2024).","DOI":"10.1016\/j.isci.2024.110021"},{"key":"2676_CR5","doi-asserted-by":"publisher","DOI":"10.1038\/s41746-024-01101-z","volume":"7","author":"X Chen","year":"2024","unstructured":"Chen, X. et al. FFA-GPT: an automated pipeline for fundus fluorescein angiography interpretation and question-answer. npj Digit. Med. 7, 111 (2024).","journal-title":"npj Digit. Med."},{"key":"2676_CR6","doi-asserted-by":"publisher","first-page":"e64318","DOI":"10.2196\/64318","volume":"13","author":"S Seo","year":"2025","unstructured":"Seo, S., Kim, K. & Yang, H. Performance assessment of large language models in medical consultation: comparative study. JMIR Med. Inform. 13, e64318\u2013e64318 (2025).","journal-title":"JMIR Med. Inform."},{"key":"2676_CR7","unstructured":"Bai, J. et al. Qwen-vl: a frontier large vision-language model with versatile abilities. arXiv preprint arXiv: https:\/\/arxiv.org\/abs\/2308.12966 (2023)."},{"key":"2676_CR8","doi-asserted-by":"crossref","unstructured":"Chen, X. et al. Evaluating large language models and agents in healthcare: key challenges in clinical applications. Intell. Med. 5, 151\u2013163 (2025).","DOI":"10.1016\/j.imed.2025.03.002"},{"key":"2676_CR9","doi-asserted-by":"crossref","unstructured":"Hu, Y. et al. Omnimedvqa: a new large-scale comprehensive evaluation benchmark for medical lvlm. in Proc. IEEE\/CVF Conference on Computer Vision and Pattern Recognition (IEEE, 2024).","DOI":"10.1109\/CVPR52733.2024.02093"},{"key":"2676_CR10","doi-asserted-by":"crossref","unstructured":"Liu, B. et al. Slake: a semantically-labeled knowledge-enhanced dataset for medical visual question answering. in Proc. IEEE 18th International Symposium on Biomedical Imaging (ISBI), 1650\u20131654-(IEEE, 2021).","DOI":"10.1109\/ISBI48211.2021.9434010"},{"key":"2676_CR11","doi-asserted-by":"crossref","unstructured":"He X. Towards visual question answering on pathology images. In Proc. 59th Annual Meeting of the Association for Computational Linguistics and the 11th International Joint Conference on Natural Language Processing, Vol. 2 (Association for Computational Linguistics, 2021).","DOI":"10.18653\/v1\/2021.acl-short.90"},{"key":"2676_CR12","doi-asserted-by":"crossref","unstructured":"Wu, C. et al. Towards generalist foundation model for radiology by leveraging web-scale 2d&3d medical data. Nat. Commun. 16, 7866 (2025).","DOI":"10.1038\/s41467-025-62385-7"},{"key":"2676_CR13","unstructured":"Chen, Z. et al. Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling. arXiv preprint arXiv: https:\/\/arxiv.org\/abs\/2412.05271 (2024)."},{"key":"2676_CR14","doi-asserted-by":"crossref","unstructured":"Chen, J. et al. Towards injecting medical visual knowledge into multimodal llms at scale. In Proc. 2024 conference on empirical methods in natural language processing (2024).","DOI":"10.18653\/v1\/2024.emnlp-main.418"},{"key":"2676_CR15","doi-asserted-by":"publisher","first-page":"259","DOI":"10.1038\/s41586-023-05881-4","volume":"616","author":"M Moor","year":"2023","unstructured":"Moor, M. et al. Foundation models for generalist medical artificial intelligence. Nature 616, 259\u2013265 (2023).","journal-title":"Nature"},{"key":"2676_CR16","unstructured":"Lin, T. et al. HealthGPT: A Medical Large Vision-Language Model for Unifying Comprehension and Generation via Heterogeneous Knowledge Adaptation. International Conference on Machine Learning. (PMLR, 2025)."},{"key":"2676_CR17","unstructured":"Yang, A. et al. Qwen2. 5 technical report. arXiv preprint arXiv: https:\/\/arxiv.org\/abs\/2412.15115 (2024)."},{"key":"2676_CR18","doi-asserted-by":"crossref","unstructured":"Xu, P. et al. DeepSeek-R1 outperforms Gemini 2.0 Pro, OpenAI o1, and o3-mini in bilingual complex ophthalmology reasoning. Advances in Ophthalmology Practice and Research 5, 189-195 (2025).","DOI":"10.1016\/j.aopr.2025.05.001"},{"key":"2676_CR19","unstructured":"Ankit, P., Logesh Kumar, U. & Malaikannan, S. MedMCQA: A Large-scale Multi-Subject Multi-Choice Dataset for Medical domain Question Answering. In Proc. of the Conference on Health, Inference, and Learning, (eds. Gerardo, F., George, H. C., Tom, P., Joyce, C. H. & Tristan, N.) Vol. 174, 248\u2013260. (PMLR, 2022)."},{"key":"2676_CR20","doi-asserted-by":"crossref","unstructured":"Zhang, X., Meng, Z., Lever, J. & Ho, E. S. L. Libra: Leveraging Temporal Images for Biomedical Radiology Analysis. 17275-17303 (Association for Computational Linguistics, Vienna, Austria 979-8-89176-256-5, 2025).","DOI":"10.18653\/v1\/2025.findings-acl.888"},{"key":"2676_CR21","doi-asserted-by":"crossref","unstructured":"Zhang, X. et al. Development of a large-scale medical visual question-answering dataset. Commun Med 4, 277 (2024).","DOI":"10.1038\/s43856-024-00709-2"},{"key":"2676_CR22","doi-asserted-by":"crossref","unstructured":"Ji, L., Xiao, S., Feng, J., Gao, W. & Zhang, H. Multimodal large model pretraining, adaptation and efficiency optimization. Neurocomputing 619, 129138 (2025).","DOI":"10.1016\/j.neucom.2024.129138"},{"key":"2676_CR23","doi-asserted-by":"publisher","DOI":"10.1038\/s41746-025-01772-2","volume":"8","author":"D Shi","year":"2025","unstructured":"Shi, D. et al. A multimodal visual\u2013language foundation model for computational ophthalmology. npj Digit. Med. 8, 381 (2025).","journal-title":"npj Digit. Med."},{"key":"2676_CR24","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1186\/s12938-019-0649-y","volume":"18","author":"A Diaz-Pinto","year":"2019","unstructured":"Diaz-Pinto, A. et al. CNNs for automatic glaucoma assessment using fundus images: an extensive validation. Biomed. Eng. online 18, 1\u201319 (2019).","journal-title":"Biomed. Eng. online"},{"key":"2676_CR25","doi-asserted-by":"publisher","first-page":"2828","DOI":"10.1109\/TMI.2022.3172773","volume":"41","author":"H Fang","year":"2022","unstructured":"Fang, H. et al. Adam challenge: Detecting age-related macular degeneration from fundus images. IEEE Trans. Med. imaging 41, 2828\u20132847 (2022).","journal-title":"IEEE Trans. Med. imaging"},{"key":"2676_CR26","unstructured":"Diabetic Retinopathy Arranged - Retina Images with Class Labels for Classification. https:\/\/tianchi.aliyun.com\/dataset\/93926 (2023)."},{"key":"2676_CR27","doi-asserted-by":"publisher","first-page":"046006","DOI":"10.1117\/1.JBO.19.4.046006","volume":"19","author":"U \u015eevik","year":"2014","unstructured":"\u015eevik, U., K\u00f6se, C., Berber, T. & Erd\u00f6l, H. Identification of suitable fundus images using automated quality assessment methods. J. Biomed. Opt. 19, 046006 (2014).","journal-title":"J. Biomed. Opt."},{"key":"2676_CR28","doi-asserted-by":"publisher","DOI":"10.1038\/s41467-021-25138-w","volume":"12","author":"L-P Cen","year":"2021","unstructured":"Cen, L.-P. et al. Automatic detection of 39 fundus diseases and conditions in retinal photographs using deep neural networks. Nat. Commun. 12, 4828 (2021).","journal-title":"Nat. Commun."},{"key":"2676_CR29","doi-asserted-by":"publisher","first-page":"1122","DOI":"10.1016\/j.cell.2018.02.010","volume":"172","author":"DS Kermany","year":"2018","unstructured":"Kermany, D. S. et al. Identifying medical diagnoses and treatable diseases by image-based deep learning. cell. 172, 1122\u20131131.e9 (2018).","journal-title":"cell"},{"key":"2676_CR30","doi-asserted-by":"publisher","first-page":"9201","DOI":"10.52202\/068431-0669","volume":"35","author":"M Prabhushankar","year":"2022","unstructured":"Prabhushankar, M. et al. Olives dataset: ophthalmic labels for investigating visual eye semantics. Adv. Neural Inf. Process. Syst. 35, 9201\u20139216 (2022).","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"2676_CR31","doi-asserted-by":"publisher","DOI":"10.1016\/j.imu.2023.101366","volume":"42","author":"W Zhang","year":"2023","unstructured":"Zhang, W. et al. Enhancing stability in cardiovascular disease risk prediction: a deep learning approach leveraging retinal images. Inform. Med. Unlocked 42, 101366 (2023).","journal-title":"Inform. Med. Unlocked"},{"key":"2676_CR32","unstructured":"Chest-CTscan. Chest CTscan Images Dataset. https:\/\/tianchi.aliyun.com\/dataset\/93929."},{"key":"2676_CR33","unstructured":"COVID-CT. COVID CT Dataset. https:\/\/tianchi.aliyun.com\/dataset\/106604."},{"key":"2676_CR34","unstructured":"Soares, E., Angelov, P., Biaso, S., Froes, M. H. & Abe, D. K. SARS-CoV-2 CT-scan dataset: A large dataset of real patients CT scans for SARS-CoV-2 identification. MedRxiv, 2020\u20132004 (2020)."},{"key":"2676_CR35","unstructured":"Asraf, A. & Islam, Z. COVID19, Pneumonia and Normal Chest X-ray PA Dataset, Mendeley Data, Vol. 1 (2021)."},{"key":"2676_CR36","doi-asserted-by":"crossref","unstructured":"Cohen, J. P. et al. COVID-19 Image Data Collection: Prospective Predictions are the Future. Mach. Learn. Biomed. Imaging 1, 1\u201338 (2020).","DOI":"10.59275\/j.melba.2020-48g7"},{"key":"2676_CR37","first-page":"30784984","volume":"1","author":"P Chen","year":"2018","unstructured":"Chen, P. Knee osteoarthritis severity grading dataset. Mendeley Data 1, 30784984\u201330784984 (2018).","journal-title":"Mendeley Data"},{"key":"2676_CR38","first-page":"375","volume":"1069","author":"J Suckling","year":"1994","unstructured":"Suckling, J. The Mammographic Images Analysis Society Digital Mammogram Database. Exerpta Med. Int. Congr. Ser. 1069, 375\u2013378 (1994).","journal-title":"Exerpta Med. Int. Congr. Ser."},{"key":"2676_CR39","unstructured":"Rajpurkar, P. et al. MURA Dataset: Towards Radiologist-Level Abnormality Detection in Musculoskeletal Radiographs. Medical Imaging with Deep Learning (2018)."},{"key":"2676_CR40","first-page":"475","volume":"4","author":"S Jaeger","year":"2014","unstructured":"Jaeger, S. et al. Two public chest X-ray datasets for computer-aided screening of pulmonary diseases. Quant. imaging Med. Surg. 4, 475\u2013475 (2014).","journal-title":"Quant. imaging Med. Surg."},{"key":"2676_CR41","unstructured":"X-ray hand small joint classification dataset (based on bone age scoring method rus-chn). https:\/\/aistudio.baidu.com\/datasetdetail\/69582\/0 (2023)."},{"key":"2676_CR42","doi-asserted-by":"publisher","first-page":"1455","DOI":"10.1109\/TBME.2015.2496264","volume":"63","author":"FA Spanhol","year":"2015","unstructured":"Spanhol, F. A., Oliveira, L. S., Petitjean, C. & Heutte, L. A dataset for breast cancer histopathological image classification. Ieee Trans. Biomed. Eng. 63, 1455\u20131462 (2015).","journal-title":"Ieee Trans. Biomed. Eng."},{"key":"2676_CR43","doi-asserted-by":"publisher","unstructured":"Kather, Jakob Nikolas, Niels Halama, and Alexander Marx. 100,000 histological images of human colorectal cancer and healthy tissue. Zenodo. https:\/\/doi.org\/10.5281\/zenodo.1214456 (2018).","DOI":"10.5281\/zenodo.1214456"},{"key":"2676_CR44","doi-asserted-by":"publisher","first-page":"1003","DOI":"10.1109\/TITB.2010.2050695","volume":"14","author":"NV Orlov","year":"2010","unstructured":"Orlov, N. V. et al. Automatic classification of lymphoma images with transform-based global features. IEEE Trans. Inf. Technol. Biomed. 14, 1003\u20131013 (2010).","journal-title":"IEEE Trans. Inf. Technol. Biomed."},{"key":"2676_CR45","unstructured":"Jaeger, S. & Yang, F. NLM\u2014Malaria data. https:\/\/lhncbc.nlm.nih.gov\/LHC-research\/LHC-projects\/image-processing\/malaria-datasheet.html (2024)."},{"key":"2676_CR46","doi-asserted-by":"crossref","unstructured":"Chen, Z. et al. How far are we to gpt-4v? Closing the gap to commercial multimodal models with open-source suites. Sci. China Inf. Sci. 67, 220101\u2013220101 (2024).","DOI":"10.1007\/s11432-024-4231-5"},{"key":"2676_CR47","unstructured":"Cai, Z. et al. Internlm2 technical report. arXiv preprint arXiv:2403.17297 (2024)."},{"key":"2676_CR48","doi-asserted-by":"crossref","unstructured":"Chen, L. et al. Sharegpt4v: Improving large multi-modal models with better captions. in European Conference on Computer Vision 370\u2013387 (2024).","DOI":"10.1007\/978-3-031-72643-9_22"},{"key":"2676_CR49","doi-asserted-by":"crossref","unstructured":"Liu, H., Li, C., Wu, Q. & Lee, Y.J. Visual instruction tuning. Advances in neural information processing systems 36, 34892\u201334916 (2023).","DOI":"10.52202\/075280-1516"},{"key":"2676_CR50","doi-asserted-by":"crossref","unstructured":"Antol, S. et al. Vqa: Visual question answering. in Proceedings of the IEEE international conference on computer vision 2425\u20132433 (2015).","DOI":"10.1109\/ICCV.2015.279"},{"key":"2676_CR51","unstructured":"Chen, X. et al. ICGA-GPT: report generation and question answering for indocyanine green angiography images. British Journal of Ophthalmology, bjo-2023-324446 (2024)."},{"key":"2676_CR52","doi-asserted-by":"crossref","unstructured":"Zhao, Z. et al. Slit Lamp Report Generation and Question Answering: Development and Validation of a Multimodal Transformer Model with Large Language Model Integration. J Med Internet Res 26, e54047 (2024).","DOI":"10.2196\/preprints.54047"}],"container-title":["npj Digital Medicine"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/www.nature.com\/articles\/s41746-026-02676-5","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/www.nature.com\/articles\/s41746-026-02676-5.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/www.nature.com\/articles\/s41746-026-02676-5.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,7,6]],"date-time":"2026-07-06T22:41:49Z","timestamp":1783377709000},"score":1,"resource":{"primary":{"URL":"https:\/\/www.nature.com\/articles\/s41746-026-02676-5"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,4,30]]},"references-count":52,"journal-issue":{"issue":"1","published-online":{"date-parts":[[2026,12]]}},"alternative-id":["2676"],"URL":"https:\/\/doi.org\/10.1038\/s41746-026-02676-5","relation":{},"ISSN":["2398-6352"],"issn-type":[{"value":"2398-6352","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026,4,30]]},"assertion":[{"value":"17 October 2025","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"15 April 2026","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"30 April 2026","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"The authors declare no competing interests.","order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Competing interests"}}],"article-number":"512"}}