{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,9]],"date-time":"2026-07-09T10:40:32Z","timestamp":1783593632171,"version":"3.55.0"},"reference-count":39,"publisher":"Springer Science and Business Media LLC","issue":"1","license":[{"start":{"date-parts":[[2026,1,22]],"date-time":"2026-01-22T00:00:00Z","timestamp":1769040000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0"},{"start":{"date-parts":[[2026,2,23]],"date-time":"2026-02-23T00:00:00Z","timestamp":1771804800000},"content-version":"vor","delay-in-days":32,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0"}],"funder":[{"name":"Shanghai Municipal Health Commission Research Project","award":["No. 20234Y0033"],"award-info":[{"award-number":["No. 20234Y0033"]}]},{"name":"National Key Research and Development Program of China","award":["No.2023YFF0722204"],"award-info":[{"award-number":["No.2023YFF0722204"]}]},{"name":"National Key Research and Development Program of China","award":["No.2023YFF1204804"],"award-info":[{"award-number":["No.2023YFF1204804"]}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"crossref","award":["No.8225024"],"award-info":[{"award-number":["No.8225024"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"crossref"}]},{"name":"Shanghai Municipal Commission of Science and Technology Explorer Program","award":["No.23TS1400400"],"award-info":[{"award-number":["No.23TS1400400"]}]},{"name":"Shanghai Jiaotong University, Medicine and engineering interdisciplinary program","award":["No.YG2024LC08"],"award-info":[{"award-number":["No.YG2024LC08"]}]},{"name":"Shanghai Key Clinical Specialty","award":["No. shslczdzk03203"],"award-info":[{"award-number":["No. shslczdzk03203"]}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["npj Digit. Med."],"abstract":"<jats:title>Abstract<\/jats:title>\n                  <jats:p>Automatically deriving radiological diagnoses from brain MRI report findings is challenging due to high complexity and domain expertise. This study evaluated 10 large language models (LLMs) in generating diagnoses from brain MRI report findings, using 4293 reports (9973 diagnostic labels) covering 15 brain disease categories from three medical centers. DeepSeek-R1 achieved the highest performance among the evaluated models on the full dataset and across different clinical scenarios and subgroups, particularly when provided with structured report findings and clinical information. A top three differential-diagnosis prompting strategy achieved superior performance, with 97.6% patient-level accuracy versus 87.1% for single-diagnosis prompting. The diagnostic performance of six radiologists was assessed with and without DeepSeek-R1 assistance on 500 reports. Integration of DeepSeek-R1 significantly improved diagnostic accuracy (AUPRC: 0.774\u20130.893) and reduced reading time (from 61 to 53\u2009s), with more pronounced benefits for junior radiologists. Our findings indicate that effective automated diagnostic impression generation in brain MRI reporting requires advanced large-scale LLMs like DeepSeek-R1. With optimized prompting and input strategies, this framework may serve as a supportive tool in drafting brain MRI reports and contribute to enhanced workflow efficiency in radiology practice.<\/jats:p>","DOI":"10.1038\/s41746-026-02380-4","type":"journal-article","created":{"date-parts":[[2026,1,22]],"date-time":"2026-01-22T17:06:03Z","timestamp":1769101563000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":2,"title":["Evaluation of large language models for diagnostic impression generation from brain MRI report findings: a multicenter benchmark and reader study"],"prefix":"10.1038","volume":"9","author":[{"given":"Ming-Liang","family":"Wang","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Rui-Peng","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Wen-Juan","family":"Wu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yu","family":"Lu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xiao-Er","family":"Wei","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zheng","family":"Sun","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Bao-Hui","family":"Guan","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jun-Jie","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xue","family":"Wu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Lei","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Tian-Le","family":"Wang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yue-Hua","family":"Li","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2026,1,22]]},"reference":[{"key":"2380_CR1","doi-asserted-by":"publisher","first-page":"81","DOI":"10.1001\/jamaneurol.2018.3122","volume":"76","author":"S Debette","year":"2019","unstructured":"Debette, S., Schilling, S., Duperron, M. G., Larsson, S. C. & Markus, H. S. Clinical significance of magnetic resonance imaging markers of vascular brain injury: a systematic review and meta-analysis. JAMA Neurol. 76, 81\u201394 (2019).","journal-title":"JAMA Neurol."},{"key":"2380_CR2","doi-asserted-by":"publisher","first-page":"875","DOI":"10.1136\/bmj.38771.583796.7C","volume":"332","author":"P Whiting","year":"2006","unstructured":"Whiting, P. et al. Accuracy of magnetic resonance imaging for the diagnosis of multiple sclerosis: systematic review. BMJ 332, 875\u2013884 (2006).","journal-title":"BMJ"},{"key":"2380_CR3","doi-asserted-by":"publisher","first-page":"709","DOI":"10.1002\/jmri.20704","volume":"24","author":"RJ Young","year":"2006","unstructured":"Young, R. J. & Knopp, E. A. Brain MRI: tumor evaluation. J. Magn. Reson. Imaging 24, 709\u2013724 (2006).","journal-title":"J. Magn. Reson. Imaging"},{"key":"2380_CR4","doi-asserted-by":"publisher","first-page":"5935","DOI":"10.1007\/s12035-022-02944-x","volume":"59","author":"K-R Li","year":"2022","unstructured":"Li, K.-R. et al. The key role of magnetic resonance imaging in the detection of neurodegenerative diseases-associated biomarkers: a review. Mol. Neurobiol. 59, 5935\u20135954 (2022).","journal-title":"Mol. Neurobiol."},{"key":"2380_CR5","doi-asserted-by":"publisher","first-page":"1284","DOI":"10.3174\/ajnr.A5215","volume":"38","author":"JY Chen","year":"2017","unstructured":"Chen, J. Y. & Lexa, F. J. Baseline survey of the neuroradiology work environment in the United States with reported trends in clinical work, nonclinical work, perceptions of trainees, and burnout metrics. AJNR 38, 1284\u20131291 (2017).","journal-title":"AJNR"},{"key":"2380_CR6","doi-asserted-by":"publisher","first-page":"110596","DOI":"10.1016\/j.ejrad.2022.110596","volume":"157","author":"Y-C Peng","year":"2022","unstructured":"Peng, Y.-C., Lee, W.-J., Chang, Y.-C., Chan, W. P. & Chen, S.-J. Radiologist burnout: trends in medical imaging utilization under the national health insurance system with the universal code bundling strategy in an academic tertiary medical centre. Eur. J. Radiol. 157, 110596 (2022).","journal-title":"Eur. J. Radiol."},{"key":"2380_CR7","doi-asserted-by":"publisher","first-page":"111032","DOI":"10.1016\/j.ejrad.2023.111032","volume":"167","author":"\u00d6 Kasalak","year":"2023","unstructured":"Kasalak, \u00d6. et al. Work overload and diagnostic errors in radiology. Eur. J. Radiol. 167, 111032 (2023).","journal-title":"Eur. J. Radiol."},{"key":"2380_CR8","doi-asserted-by":"publisher","first-page":"e241174","DOI":"10.1148\/radiol.241174","volume":"315","author":"B Siewert","year":"2025","unstructured":"Siewert, B. & Ayyala, R. Moral distress, moral injury, and burnout in radiology practice. Radiology 315, e241174 (2025).","journal-title":"Radiology"},{"key":"2380_CR9","doi-asserted-by":"publisher","first-page":"500","DOI":"10.1038\/s41568-018-0016-5","volume":"18","author":"A Hosny","year":"2018","unstructured":"Hosny, A., Parmar, C., Quackenbush, J., Schwartz, L. H. & Aerts, H. J. W. L. Artificial intelligence in radiology. Nat. Rev. Cancer 18, 500\u2013510 (2018).","journal-title":"Nat. Rev. Cancer"},{"key":"2380_CR10","doi-asserted-by":"publisher","first-page":"888","DOI":"10.1038\/s41586-025-08675-y","volume":"639","author":"VM Rao","year":"2025","unstructured":"Rao, V. M. et al. Multimodal generative AI for medical image interpretation. Nature 639, 888\u2013896 (2025).","journal-title":"Nature"},{"key":"2380_CR11","doi-asserted-by":"publisher","first-page":"e243378","DOI":"10.1148\/radiol.243378","volume":"316","author":"JCY Seah","year":"2025","unstructured":"Seah, J. C. Y., Tang, J. S. N. & Tran, A. Drafting the future: the dawn of AI report generation in radiology. Radiology 316, e243378 (2025).","journal-title":"Radiology"},{"key":"2380_CR12","doi-asserted-by":"publisher","first-page":"e65547","DOI":"10.2196\/65547","volume":"27","author":"D Hu","year":"2025","unstructured":"Hu, D., Zhang, S., Liu, Q., Zhu, X. & Liu, B. Large language models in summarizing radiology report impressions for lung cancer in Chinese: evaluation study. J. Med. Internet Res. 27, e65547 (2025).","journal-title":"J. Med. Internet Res."},{"key":"2380_CR13","doi-asserted-by":"publisher","first-page":"e70115","DOI":"10.1111\/liv.70115","volume":"45","author":"L Sheng","year":"2025","unstructured":"Sheng, L. et al. Large language models for diagnosing focal liver lesions from CT\/MRI reports: a comparative study with radiologists. Liver Int. 45, e70115 (2025).","journal-title":"Liver Int."},{"key":"2380_CR14","doi-asserted-by":"publisher","DOI":"10.1038\/s41746-025-01889-4","volume":"8","author":"F Dong","year":"2025","unstructured":"Dong, F., Nie, S., Chen, M., Xu, F. & Li, Q. Keyword-based AI assistance in the generation of radiology reports: a pilot study. npj Digit. Med. 8, 490 (2025).","journal-title":"npj Digit. Med."},{"key":"2380_CR15","doi-asserted-by":"publisher","first-page":"e240885","DOI":"10.1148\/radiol.240885","volume":"312","author":"L Zhang","year":"2024","unstructured":"Zhang, L. et al. Constructing a large language model to generate impressions from findings in radiology reports. Radiology 312, e240885 (2024).","journal-title":"Radiology"},{"key":"2380_CR16","doi-asserted-by":"publisher","DOI":"10.1186\/s12880-024-01435-w","volume":"24","author":"A Serapio","year":"2024","unstructured":"Serapio, A. et al. An open-source fine-tuned large language model for radiological impression generation: a multi-reader performance study. BMC Med. Imaging 24, 254 (2024).","journal-title":"BMC Med. Imaging"},{"key":"2380_CR17","doi-asserted-by":"publisher","first-page":"190","DOI":"10.1007\/s11604-023-01487-y","volume":"42","author":"T Nakaura","year":"2024","unstructured":"Nakaura, T. et al. Preliminary assessment of automated radiology report generation with generative pre-trained transformers: comparing results to radiologist-generated reports. Jpn. J. Radiol. 42, 190\u2013200 (2024).","journal-title":"Jpn. J. Radiol."},{"key":"2380_CR18","doi-asserted-by":"publisher","first-page":"e231259","DOI":"10.1148\/radiol.231259","volume":"307","author":"Z Sun","year":"2023","unstructured":"Sun, Z. et al. Evaluating GPT4 on impressions generation in radiology reports. Radiology 307, e231259 (2023).","journal-title":"Radiology"},{"key":"2380_CR19","doi-asserted-by":"publisher","first-page":"10","DOI":"10.1186\/s13244-019-0831-6","volume":"11","author":"JM Nobel","year":"2020","unstructured":"Nobel, J. M., Kok, E. M. & Robben, S. G. F. Redefining the structure of structured reporting in radiology. Insights Imaging 11, 10 (2020).","journal-title":"Insights Imaging"},{"key":"2380_CR20","doi-asserted-by":"publisher","first-page":"7496","DOI":"10.1007\/s00330-023-10050-2","volume":"33","author":"J Vosshenrich","year":"2023","unstructured":"Vosshenrich, J., Nesic, I., Boll, D. T. & Heye, T. Investigating the impact of structured reporting on the linguistic standardization of radiology reports through natural language processing over a 10-year period. Eur. Radiol. 33, 7496\u20137506 (2023).","journal-title":"Eur. Radiol."},{"key":"2380_CR21","doi-asserted-by":"publisher","first-page":"13","DOI":"10.1038\/d41586-025-00229-6","volume":"638","author":"E Gibney","year":"2025","unstructured":"Gibney, E. China\u2019s cheap, open AI model DeepSeek thrills scientists. Nature 638, 13\u201314 (2025).","journal-title":"Nature"},{"key":"2380_CR22","doi-asserted-by":"publisher","unstructured":"Sandmann, S. et al. Benchmark evaluation of DeepSeek large language models in clinical decision-making. Nat. Med. https:\/\/doi.org\/10.1038\/s41591-025-03727-2 (2025).","DOI":"10.1038\/s41591-025-03727-2"},{"key":"2380_CR23","doi-asserted-by":"publisher","first-page":"4056","DOI":"10.1097\/JS9.0000000000002386","volume":"111","author":"L Chan","year":"2025","unstructured":"Chan, L., Xu, X. & Lv, K. DeepSeek-R1 and GPT-4 are comparable in a complex diagnostic challenge: a historical control study. Int. J. Surg. 111, 4056\u20134059 (2025).","journal-title":"Int. J. Surg."},{"key":"2380_CR24","doi-asserted-by":"publisher","first-page":"230","DOI":"10.1186\/s13054-025-05468-7","volume":"29","author":"X Wu","year":"2025","unstructured":"Wu, X., Huang, Y. & He, Q. A large language model improves clinicians\u2019 diagnostic performance in complex critical illness cases. Crit. Care 29, 230 (2025).","journal-title":"Crit. Care"},{"key":"2380_CR25","doi-asserted-by":"publisher","DOI":"10.1073\/pnas.2311878121","volume":"121","author":"Y Bahri","year":"2024","unstructured":"Bahri, Y., Dyer, E., Kaplan, J., Lee, J. & Sharma, U. Explaining neural scaling laws. Proc. Natl. Acad. Sci. USA 121, e2311878121 (2024).","journal-title":"Proc. Natl. Acad. Sci. USA"},{"key":"2380_CR26","doi-asserted-by":"publisher","first-page":"107377","DOI":"10.1016\/j.neunet.2025.107377","volume":"187","author":"X Chen","year":"2025","unstructured":"Chen, X., Huang, X., Gao, Q., Huang, L. & Liu, G. Enhancing text-centric fake news detection via external knowledge distillation from LLMs. Neural Netw. 187, 107377 (2025).","journal-title":"Neural Netw."},{"key":"2380_CR27","doi-asserted-by":"publisher","first-page":"5690","DOI":"10.1109\/TPAMI.2025.3552309","volume":"47","author":"H Chen","year":"2025","unstructured":"Chen, H. et al. Impact of noisy supervision in foundation model learning. IEEE Trans. Pattern Anal. Mach. Intell. 47, 5690\u20135707 (2025).","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"2380_CR28","doi-asserted-by":"publisher","first-page":"464","DOI":"10.1148\/radiol.14140206","volume":"274","author":"OR Brook","year":"2015","unstructured":"Brook, O. R. et al. Structured reporting of multiphasic CT for pancreatic cancer: potential effect on staging and surgical planning. Radiology 274, 464\u2013472 (2015).","journal-title":"Radiology"},{"key":"2380_CR29","doi-asserted-by":"publisher","unstructured":"Pinto Dos Santos, D. et al. A proof of concept for epidemiological research using structured reporting with pulmonary embolism as a use case. Br. J. Radiol. 91, https:\/\/doi.org\/10.1259\/bjr.20170564 (2018).","DOI":"10.1259\/bjr.20170564"},{"key":"2380_CR30","doi-asserted-by":"publisher","first-page":"3702","DOI":"10.1007\/s00330-018-5340-3","volume":"28","author":"F Schoeppe","year":"2018","unstructured":"Schoeppe, F. et al. Structured reporting adds clinical value in primary CT staging of diffuse large B-cell lymphoma. Eur. Radiol. 28, 3702\u20133709 (2018).","journal-title":"Eur. Radiol."},{"key":"2380_CR31","doi-asserted-by":"publisher","DOI":"10.1016\/j.ejrad.2021.109954","volume":"144","author":"T Jorg","year":"2021","unstructured":"Jorg, T. et al. Structured reporting of CT scans of patients with trauma leads to faster, more detailed diagnoses: an experimental study. Eur. J. Radiol. 144, 109954 (2021).","journal-title":"Eur. J. Radiol."},{"key":"2380_CR32","doi-asserted-by":"publisher","DOI":"10.1148\/ryai.230520","volume":"6","author":"L Dai","year":"2024","unstructured":"Dai, L. et al. Boosting deep learning for interpretable brain MRI lesion detection through the integration of radiology report information. Radiol. Artif. Intell. 6, e230520 (2024).","journal-title":"Radiol. Artif. Intell."},{"key":"2380_CR33","doi-asserted-by":"publisher","first-page":"102516","DOI":"10.1016\/j.compmedimag.2025.102516","volume":"122","author":"J Lei","year":"2025","unstructured":"Lei, J. et al. UniBrain: universal brain MRI diagnosis with hierarchical knowledge-enhanced pre-training. Comput. Med. Imaging Graph. 122, 102516 (2025).","journal-title":"Comput. Med. Imaging Graph."},{"key":"2380_CR34","doi-asserted-by":"publisher","first-page":"e240689","DOI":"10.1148\/radiol.240689","volume":"314","author":"S Schramm","year":"2025","unstructured":"Schramm, S. et al. Impact of multimodal prompt elements on diagnostic performance of GPT-4V in challenging brain MRI cases. Radiology 314, e240689 (2025).","journal-title":"Radiology"},{"key":"2380_CR35","doi-asserted-by":"publisher","first-page":"e2426153122","DOI":"10.1073\/pnas.2426153122","volume":"122","author":"N Z\u00f6ller","year":"2025","unstructured":"Z\u00f6ller, N. et al. Human-AI collectives most accurately diagnose clinical vignettes. Proc. Natl. Acad. Sci. USA 122, e2426153122 (2025).","journal-title":"Proc. Natl. Acad. Sci. USA"},{"key":"2380_CR36","doi-asserted-by":"publisher","first-page":"1079","DOI":"10.1007\/s00259-023-06543-3","volume":"51","author":"R Toxopeus","year":"2024","unstructured":"Toxopeus, R. et al. Is work overload associated with diagnostic errors on (18)F-FDG-PET\/CT? Eur. J. Nucl. Med. Mol. imaging 51, 1079\u20131084 (2024).","journal-title":"Eur. J. Nucl. Med. Mol. imaging"},{"key":"2380_CR37","doi-asserted-by":"publisher","first-page":"563","DOI":"10.1136\/bmjqs-2023-016621","volume":"33","author":"S Mamede","year":"2024","unstructured":"Mamede, S. et al. Role of knowledge and reasoning processes as predictors of resident physicians\u2019 susceptibility to anchoring bias in diagnostic reasoning: a randomised controlled experiment. BMJ Qual. Saf. 33, 563\u2013572 (2024).","journal-title":"BMJ Qual. Saf."},{"key":"2380_CR38","doi-asserted-by":"publisher","first-page":"e240273","DOI":"10.1148\/radiol.240273","volume":"312","author":"PS Suh","year":"2024","unstructured":"Suh, P. S. et al. Comparing diagnostic accuracy of radiologists versus GPT-4V and Gemini Pro Vision using image inputs from diagnosis please cases. Radiology 312, e240273 (2024).","journal-title":"Radiology"},{"key":"2380_CR39","doi-asserted-by":"publisher","first-page":"1959","DOI":"10.1007\/s00330-024-11035-5","volume":"35","author":"D Brin","year":"2025","unstructured":"Brin, D. et al. Assessing GPT-4 multimodal performance in radiological image analysis. Eur. Radiol. 35, 1959\u20131965 (2025).","journal-title":"Eur. Radiol."}],"container-title":["npj Digital Medicine"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/www.nature.com\/articles\/s41746-026-02380-4","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/www.nature.com\/articles\/s41746-026-02380-4.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/www.nature.com\/articles\/s41746-026-02380-4.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,2,23]],"date-time":"2026-02-23T13:12:41Z","timestamp":1771852361000},"score":1,"resource":{"primary":{"URL":"https:\/\/www.nature.com\/articles\/s41746-026-02380-4"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,1,22]]},"references-count":39,"journal-issue":{"issue":"1","published-online":{"date-parts":[[2026,12]]}},"alternative-id":["2380"],"URL":"https:\/\/doi.org\/10.1038\/s41746-026-02380-4","relation":{},"ISSN":["2398-6352"],"issn-type":[{"value":"2398-6352","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026,1,22]]},"assertion":[{"value":"8 September 2025","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"15 January 2026","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"22 January 2026","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"The authors declare no competing interests.","order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Competing interests"}}],"article-number":"187"}}