{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,4]],"date-time":"2026-07-04T16:20:42Z","timestamp":1783182042673,"version":"3.54.6"},"reference-count":44,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/501100006683","name":"Xi&apos;an Jiaotong-Liverpool University","doi-asserted-by":"publisher","award":["RDF-23\\u201302\\u2013004"],"award-info":[{"award-number":["RDF-23\\u201302\\u2013004"]}],"id":[{"id":"10.13039\/501100006683","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["clinicalkey.com","clinicalkey.com.au","clinicalkey.es","clinicalkey.fr","clinicalkey.jp","elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Computerized Medical Imaging and Graphics"],"published-print":{"date-parts":[[2026,6]]},"DOI":"10.1016\/j.compmedimag.2026.102765","type":"journal-article","created":{"date-parts":[[2026,4,22]],"date-time":"2026-04-22T23:35:48Z","timestamp":1776900948000},"page":"102765","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"C","title":["Enhancing vision-language model with pretraining for reasoning medical applications"],"prefix":"10.1016","volume":"132","author":[{"ORCID":"https:\/\/orcid.org\/0009-0006-7025-7751","authenticated-orcid":false,"given":"Yu","family":"Zhang","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Shuihua","family":"Wang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jia","family":"Meng","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jiahe","family":"Hou","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Christopher","family":"Overton","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"John","family":"Moraros","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.compmedimag.2026.102765_bib1","doi-asserted-by":"crossref","first-page":"34892","DOI":"10.52202\/075280-1516","article-title":"Visual instruction tuning","volume":"36","author":"Liu","year":"2023","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.compmedimag.2026.102765_bib2","series-title":"International conference on machine learning","first-page":"19730","article-title":"\"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","author":"Li","year":"2023"},{"key":"10.1016\/j.compmedimag.2026.102765_bib3","doi-asserted-by":"crossref","first-page":"28541","DOI":"10.52202\/075280-1240","article-title":"Llava-med: training a large language-and-vision assistant for biomedicine in one day","volume":"36","author":"Li","year":"2023","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.compmedimag.2026.102765_bib4","series-title":"Machine Learning for Health (ML4H)","first-page":"353","article-title":"\"Med-flamingo: a multimodal medical few-shot learner","author":"Moor","year":"2023"},{"key":"10.1016\/j.compmedimag.2026.102765_bib5","series-title":"International conference on machine learning","first-page":"8748","article-title":"\"Learning transferable visual models from natural language supervision","author":"Radford","year":"2021"},{"key":"10.1016\/j.compmedimag.2026.102765_bib6","first-page":"9694","article-title":"Align before fuse: vision and language representation learning with momentum distillation","volume":"34","author":"Li","year":"2021","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.compmedimag.2026.102765_bib7","unstructured":"H. Touvron et al., \"Llama: Open and efficient foundation language models,\" arXiv preprint arXiv:2302.13971, 2023."},{"key":"10.1016\/j.compmedimag.2026.102765_bib8","series-title":"European Conference on Computer Vision","first-page":"370","article-title":"\"Sharegpt4v: Improving large multi-modal models with better captions","author":"Chen","year":"2024"},{"key":"10.1016\/j.compmedimag.2026.102765_bib9","unstructured":"B. Zhao, B. Wu, M. He, and T. Huang, \"Svit: Scaling up visual instruction tuning,\" arXiv preprint arXiv:2307.04087, 2023."},{"key":"10.1016\/j.compmedimag.2026.102765_bib10","doi-asserted-by":"crossref","unstructured":"K. Sun et al., \"Medical multimodal foundation models in clinical diagnosis and treatment: Applications, challenges, and future directions,\" arXiv preprint arXiv:2412.02621, 2024.","DOI":"10.1016\/j.artmed.2025.103265"},{"key":"10.1016\/j.compmedimag.2026.102765_bib11","unstructured":"S. Zhang et al., \"Biomedclip: a multimodal biomedical foundation model pretrained from fifteen million scientific image-text pairs,\" arXiv preprint arXiv:2303.00915, 2023."},{"key":"10.1016\/j.compmedimag.2026.102765_bib12","doi-asserted-by":"crossref","unstructured":"J. Chen et al., \"Huatuogpt-vision, towards injecting medical visual knowledge into multimodal llms at scale,\" arXiv preprint arXiv:2406.19280, 2024.","DOI":"10.18653\/v1\/2024.emnlp-main.418"},{"key":"10.1016\/j.compmedimag.2026.102765_bib13","unstructured":"T. Lin et al., \"Healthgpt: A medical large vision-language model for unifying comprehension and generation via heterogeneous knowledge adaptation,\" arXiv preprint arXiv:2502.09838, 2025."},{"key":"10.1016\/j.compmedimag.2026.102765_bib14","doi-asserted-by":"crossref","unstructured":"P.R. Bassi et al., \"Radgpt: Constructing 3d image-text tumor datasets,\" arXiv preprint arXiv:2501.04678, 2025.","DOI":"10.1109\/ICCV51701.2025.02202"},{"key":"10.1016\/j.compmedimag.2026.102765_bib15","article-title":"Biomedgpt: an open multimodal large language model for biomedicine","author":"Luo","year":"2024","journal-title":"IEEE J. Biomed. Health Inform."},{"issue":"11","key":"10.1016\/j.compmedimag.2026.102765_bib16","doi-asserted-by":"crossref","first-page":"3755","DOI":"10.1109\/TMI.2024.3398350","article-title":"ChatCAD+: toward a universal and reliable interactive CAD using LLMs","volume":"43","author":"Zhao","year":"2024","journal-title":"IEEE Trans. Med. Imaging"},{"key":"10.1016\/j.compmedimag.2026.102765_bib17","unstructured":"A. Zeng et al., \"Socratic models: Composing zero-shot multimodal reasoning with language,\" arXiv preprint arXiv:2204.00598, 2022."},{"key":"10.1016\/j.compmedimag.2026.102765_bib18","first-page":"11888","article-title":"Vipergpt: Visual inference via python execution for reasoning","author":"Sur\u00eds","year":"2023","journal-title":"Proc. IEEE\/CVF Int. Conf. Comput. Vis."},{"key":"10.1016\/j.compmedimag.2026.102765_bib19","series-title":"International Conference on Medical Image Computing and Computer-Assisted Intervention","first-page":"337","article-title":"\"Medvlm-r1: Incentivizing medical reasoning capability of vision-language models (vlms) via reinforcement learning","author":"Pan","year":"2025"},{"key":"10.1016\/j.compmedimag.2026.102765_bib20","doi-asserted-by":"crossref","unstructured":"Y. Lai, J. Zhong, M. Li, S. Zhao, and X. Yang, \"Med-r1: Reinforcement learning for generalizable medical reasoning in vision-language models, 2025,\" URL \u3008https:\/\/arxiv\u3009. org\/abs\/2503.13939.","DOI":"10.1109\/TMI.2026.3661001"},{"key":"10.1016\/j.compmedimag.2026.102765_bib21","first-page":"12289","article-title":"\"Fairclip: Harnessing fairness in vision-language learning","author":"Luo","year":"2024","journal-title":"Proc. IEEE\/CVF Conf. Comput. Vis. Pattern Recognit."},{"key":"10.1016\/j.compmedimag.2026.102765_bib22","series-title":"International Conference on Medical Image Computing and Computer-Assisted Intervention","first-page":"525","article-title":"\"Pmc-clip: Contrastive language-image pre-training using biomedical documents","author":"Lin","year":"2023"},{"key":"10.1016\/j.compmedimag.2026.102765_bib23","first-page":"3876","article-title":"Medclip: Contrastive learning from unpaired medical images and text","volume":"2022","author":"Wang","year":"2022","journal-title":"Proc. Conf. Empir. Methods Nat. Lang. Process. Conf. Empir. Methods Nat. Lang. Process."},{"key":"10.1016\/j.compmedimag.2026.102765_bib24","first-page":"3942","article-title":"Gloria: a multimodal global-local representation learning framework for label-efficient medical image recognition","author":"Huang","year":"2021","journal-title":"Proc. IEEE\/CVF Int. Conf. Comput. Vis."},{"key":"10.1016\/j.compmedimag.2026.102765_bib25","doi-asserted-by":"crossref","DOI":"10.1109\/JBHI.2025.3528196","article-title":"Medfilip: Medical fine-grained language-image pre-training","author":"Liang","year":"2025","journal-title":"IEEE J. Biomed. Health Inform."},{"key":"10.1016\/j.compmedimag.2026.102765_bib26","first-page":"4171","article-title":"Bert: Pre-training of deep bidirectional transformers for language understanding","author":"Devlin","year":"2019","journal-title":"Proc. 2019 Conf. North Am. Chapter Assoc. Comput. Linguist. Hum. Lang. Technol. Vol. 1 (Long. Short. Pap. )"},{"key":"10.1016\/j.compmedimag.2026.102765_bib27","first-page":"7661","article-title":"Understanding and constructing latent modality structures in multi-modal representation learning","author":"Jiang","year":"2023","journal-title":"Proc. IEEE\/CVF Conf. Comput. Vis. Pattern Recognit."},{"key":"10.1016\/j.compmedimag.2026.102765_bib28","first-page":"7482","article-title":"\"Multi-task learning using uncertainty to weigh losses for scene geometry and semantics","author":"Kendall","year":"2018","journal-title":"Proc. IEEE Conf. Comput. Vis. Pattern Recognit."},{"key":"10.1016\/j.compmedimag.2026.102765_bib29","series-title":"International conference on machine learning","first-page":"5583","article-title":"Vilt: Vision-and-language transformer without convolution or region supervision","author":"Kim","year":"2021"},{"key":"10.1016\/j.compmedimag.2026.102765_bib30","unstructured":"J. Bai et al., \"Qwen technical report,\" arXiv preprint arXiv:2309.16609, 2023."},{"key":"10.1016\/j.compmedimag.2026.102765_bib31","unstructured":"D. Guo et al., \"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning,\" arXiv preprint arXiv:2501.12948, 2025."},{"key":"10.1016\/j.compmedimag.2026.102765_bib32","doi-asserted-by":"crossref","unstructured":"X. He, Y. Zhang, L. Mou, E. Xing, and P. Xie, \"Pathvqa: 30000+ questions for medical visual question answering,\" arXiv preprint arXiv:2003.10286, 2020.","DOI":"10.36227\/techrxiv.13127537.v1"},{"key":"10.1016\/j.compmedimag.2026.102765_bib33","article-title":"\"Vqa-med: Overview of the medical visual question answering task at imageclef 2019,\"","author":"Ben Abacha","year":"2019","journal-title":"Proc. CLEF (Conf. Labs Eval. Forum) 2019 Work. Notes"},{"key":"10.1016\/j.compmedimag.2026.102765_bib34","unstructured":"X. Zhang et al., \"Pmc-vqa: Visual instruction tuning for medical visual question answering,\" arXiv preprint arXiv:2305.10415, 2023."},{"key":"10.1016\/j.compmedimag.2026.102765_bib35","unstructured":"J. Chen et al., \"Huatuogpt-o1, towards medical complex reasoning with llms,\" arXiv preprint arXiv:2412.18925, 2024."},{"issue":"2","key":"10.1016\/j.compmedimag.2026.102765_bib36","first-page":"3","article-title":"\"Lora: Low-rank adaptation of large language models","volume":"1","author":"Hu","year":"2022","journal-title":"ICLR"},{"issue":"14","key":"10.1016\/j.compmedimag.2026.102765_bib37","doi-asserted-by":"crossref","first-page":"6421","DOI":"10.3390\/app11146421","article-title":"\"What disease does this patient have? a large-scale open domain question answering dataset from medical exams","volume":"11","author":"Jin","year":"2021","journal-title":"Appl. Sci."},{"key":"10.1016\/j.compmedimag.2026.102765_bib38","doi-asserted-by":"crossref","unstructured":"Q. Jin, B. Dhingra, Z. Liu, W.W. Cohen, and X. Lu, \"Pubmedqa: A dataset for biomedical research question answering,\" arXiv preprint arXiv:1909.06146, 2019.","DOI":"10.18653\/v1\/D19-1259"},{"key":"10.1016\/j.compmedimag.2026.102765_bib39","series-title":"2021 IEEE 18th international symposium on biomedical imaging (ISBI)","first-page":"1650","article-title":"\"Slake: A semantically-labeled knowledge-enhanced dataset for medical visual question answering","author":"Liu","year":"2021"},{"issue":"1","key":"10.1016\/j.compmedimag.2026.102765_bib40","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1038\/sdata.2018.251","article-title":"\"A dataset of clinically generated visual questions and answers about radiology images","volume":"5","author":"Lau","year":"2018","journal-title":"Sci. data"},{"key":"10.1016\/j.compmedimag.2026.102765_bib41","first-page":"9556","article-title":"\"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","author":"Yue","year":"2024","journal-title":"Proc. IEEE\/CVF Conf. Comput. Vis. Pattern Recognit."},{"key":"10.1016\/j.compmedimag.2026.102765_bib42","doi-asserted-by":"crossref","first-page":"49250","DOI":"10.52202\/075280-2142","article-title":"\"Instructblip: Towards general-purpose vision-language models with instruction tuning","volume":"36","author":"Dai","year":"2023","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.compmedimag.2026.102765_bib43","unstructured":"A. Young et al., \"Yi: Open foundation models by 01. ai,\" arXiv preprint arXiv:2403.04652, 2024."},{"issue":"11","key":"10.1016\/j.compmedimag.2026.102765_bib44","doi-asserted-by":"crossref","first-page":"3129","DOI":"10.1038\/s41591-024-03185-2","article-title":"A generalist vision\u2013language foundation model for diverse biomedical tasks","volume":"30","author":"Zhang","year":"2024","journal-title":"Nat. Med."}],"container-title":["Computerized Medical Imaging and Graphics"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0895611126000686?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0895611126000686?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,7,4]],"date-time":"2026-07-04T15:57:36Z","timestamp":1783180656000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0895611126000686"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,6]]},"references-count":44,"alternative-id":["S0895611126000686"],"URL":"https:\/\/doi.org\/10.1016\/j.compmedimag.2026.102765","relation":{},"ISSN":["0895-6111"],"issn-type":[{"value":"0895-6111","type":"print"}],"subject":[],"published":{"date-parts":[[2026,6]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"Enhancing vision-language model with pretraining for reasoning medical applications","name":"articletitle","label":"Article Title"},{"value":"Computerized Medical Imaging and Graphics","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.compmedimag.2026.102765","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Elsevier Ltd. All rights are reserved, including those for text and data mining, AI training, and similar technologies.","name":"copyright","label":"Copyright"}],"article-number":"102765"}}