{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,8,7]],"date-time":"2026-08-07T16:57:44Z","timestamp":1786121864848,"version":"build-2736575974"},"reference-count":46,"publisher":"Springer Science and Business Media LLC","issue":"6","license":[{"start":{"date-parts":[[2026,6,23]],"date-time":"2026-06-23T00:00:00Z","timestamp":1782172800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by-nc-nd\/4.0"},{"start":{"date-parts":[[2026,8,7]],"date-time":"2026-08-07T00:00:00Z","timestamp":1786060800000},"content-version":"vor","delay-in-days":45,"URL":"https:\/\/creativecommons.org\/licenses\/by-nc-nd\/4.0"}],"funder":[{"DOI":"10.13039\/501100005047","name":"Natural Science Foundation of Liaoning Province","doi-asserted-by":"publisher","award":["2022-BS-104"],"award-info":[{"award-number":["2022-BS-104"]}],"id":[{"id":"10.13039\/501100005047","id-type":"DOI","asserted-by":"publisher"}]},{"name":"the 2024 Dalian Academy of Social Sciences Research Project","award":["2024dlsky030"],"award-info":[{"award-number":["2024dlsky030"]}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["J. King Saud Univ. Comput. Inf. Sci."],"published-print":{"date-parts":[[2026,8]]},"DOI":"10.1007\/s44443-026-00936-8","type":"journal-article","created":{"date-parts":[[2026,6,23]],"date-time":"2026-06-23T11:25:08Z","timestamp":1782213908000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["MVE-QGCAF: Multi-Grained visual evidence construction and question-guided gated cross-attention fusion for medical visual question answering"],"prefix":"10.1007","volume":"38","author":[{"given":"Yuhai","family":"Yu","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Lin","family":"Lu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jiana","family":"Meng","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jing","family":"Liu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Shan","family":"Lu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Long","family":"Li","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2026,6,23]]},"reference":[{"issue":"9","key":"936_CR1","doi-asserted-by":"publisher","first-page":"979","DOI":"10.3390\/bioengineering12090979","volume":"12","author":"A Abdusalomov","year":"2025","unstructured":"Abdusalomov A, Umirzakova S, Bekmirzaev O, Dauletov A, Buriboev A, Kutlimuratov A, Nishanov A, Nasimov R, Oh R (2025) From anatomy to genomics using a multi-task deep learning approach for comprehensive glioma profiling. Bioengineering 12(9):979. https:\/\/doi.org\/10.3390\/bioengineering12090979","journal-title":"Bioengineering"},{"key":"936_CR2","doi-asserted-by":"crossref","unstructured":"Arsalane W, Chikontwe P, Luna M, Kang M, Park SH (2024) Context-guided medical visual question answering. In: Meets Africa workshop. Springer, pp 245\u2013255","DOI":"10.1007\/978-3-031-79103-1_25"},{"key":"936_CR3","unstructured":"Ben\u00a0Abacha A, Hasan SA, Datla VV, Demner-Fushman D, M\u00fcller H (2019) Vqa-med: overview of the medical visual question answering task at imageclef 2019. In: Proceedings of CLEF (Conference and Labs of the Evaluation Forum) 2019 Working Notes. 9-12 September 2019"},{"key":"936_CR4","doi-asserted-by":"crossref","unstructured":"Bui DC, Le TV, Ngo BH (2024) C2t-net: channel-aware cross-fused transformer-style networks for pedestrian attribute recognition. In: Proceedings of the IEEE\/CVF winter conference on applications of computer vision (WACV) workshops, pp 351\u2013358","DOI":"10.1109\/WACVW60836.2024.00043"},{"key":"936_CR5","doi-asserted-by":"publisher","first-page":"111486","DOI":"10.1016\/j.patcog.2025.111486","volume":"164","author":"DC Bui","year":"2025","unstructured":"Bui DC, Le TV, Ngo BH, Choi TJ (2025) Clear: cross-transformers with pre-trained language model for person attribute recognition and retrieval. Pattern Recogn 164:111486. https:\/\/doi.org\/10.1016\/j.patcog.2025.111486","journal-title":"Pattern Recogn"},{"key":"936_CR6","doi-asserted-by":"crossref","unstructured":"Bui DC, Ngo BH, Pham HL, Nguyen K, Nguyen MK, Nakashima Y (2026) Mergeslide: continual model merging and task-to-class prompt-aligned inference for lifelong learning on whole slide images. In: Proceedings of the IEEE\/CVF winter conference on applications of computer vision (WACV), pp 4859\u20134868","DOI":"10.1109\/WACV61042.2026.00472"},{"key":"936_CR7","doi-asserted-by":"crossref","unstructured":"Chen Q, Hong Y (2024) Medblip: Bootstrapping language-image pre-training from 3d medical images and texts. In: Proceedings of the Asian conference on computer vision, pp 2404\u20132420","DOI":"10.1007\/978-981-96-0908-6_6"},{"key":"936_CR8","doi-asserted-by":"crossref","unstructured":"Chen Z, Li G, Wan X (2022) Align, reason and learn: Enhancing medical vision-and-language pre-training with knowledge. In: Proceedings of the 30th ACM international conference on multimedia, pp 5152\u20135161","DOI":"10.1145\/3503161.3547948"},{"key":"936_CR9","doi-asserted-by":"crossref","unstructured":"Chen Z, Du Y, Hu J, Liu Y, Li G, Wan X, Chang T-H (2022) Multi-modal masked autoencoders for medical vision-and-language pre-training. In: International conference on medical image computing and computer-assisted intervention. Springer, pp 679\u2013689","DOI":"10.1007\/978-3-031-16443-9_65"},{"key":"936_CR10","doi-asserted-by":"crossref","unstructured":"Chen X, Lai Z, Ruan K, Chen S, Liu J, Liu Z (2025) R-llava: improving med-vqa understanding through visual region of interest. In: 2025 International joint conference on neural networks (IJCNN). IEEE, pp 1\u201310","DOI":"10.1109\/IJCNN64981.2025.11227685"},{"key":"936_CR11","unstructured":"Cheng J, Ye J, Deng Z, Chen J, Li T, Wang H, Su Y, Huang Z, Chen J, Jiang L et al (2023) Sam-med2d. arXiv preprint arXiv:2308.16184"},{"key":"936_CR12","unstructured":"Chiang W-L, Li Z, Lin Z, Sheng Y, Wu Z, Zhang H, Zheng L, Zhuang S, Zhuang Y, Gonzalez JE et al (2023) Vicuna: an open-source chatbot impressing gpt-4 with 90%* chatgpt quality 2(3):6. See https:\/\/vicuna.lmsys.org (accessed 14 Apr 2023)"},{"key":"936_CR13","doi-asserted-by":"crossref","unstructured":"Dai W, Li J, Li D, Tiong A, Zhao J, Wang W, Li B, Fung PN, Hoi S (2023) Instructblip: towards general-purpose vision-language models with instruction tuning. In: Advances in neural information processing systems. Curran Associates, Inc, vol 36, pp 49250\u201349267","DOI":"10.52202\/075280-2142"},{"issue":"6","key":"936_CR14","doi-asserted-by":"publisher","first-page":"2983","DOI":"10.3390\/app15062983","volume":"15","author":"W Dong","year":"2025","unstructured":"Dong W, Shen S, Han Y, Tan T, Wu J, Xu H (2025) Generative models in medical visual question answering: a survey. Appl Sci 15(6):2983","journal-title":"Appl Sci"},{"key":"936_CR15","unstructured":"Dosovitskiy A, Beyer L, Kolesnikov A, Weissenborn D, Zhai X, Unterthiner T, Dehghani M, Minderer M, Heigold G, Gelly S, Uszkoreit J, Houlsby N (2020) An image is worth 16x16 words: transformers for image recognition at scale. arXiv preprint arXiv:2010.11929"},{"key":"936_CR16","doi-asserted-by":"publisher","DOI":"10.1016\/j.jbi.2025.104811","volume":"165","author":"S Du","year":"2025","unstructured":"Du S, Liang S, Gu Y (2025) A language-guided progressive fusion network with semantic density alignment for medical visual question answering. J Biomed Inform 165:104811","journal-title":"J Biomed Inform"},{"key":"936_CR17","doi-asserted-by":"crossref","unstructured":"Eslami S, Meinel C, De\u00a0Melo G (2023) Pubmedclip: How much does clip benefit visual question answering in the medical domain? In: Findings of the association for computational linguistics: EACL 2023, pp 1181\u20131193","DOI":"10.18653\/v1\/2023.findings-eacl.88"},{"key":"936_CR18","doi-asserted-by":"crossref","unstructured":"Gong H, Chen G, Liu S, Yu Y, Li G (2021) Cross-modal self-attention with multi-task pre-training for medical visual question answering. In: Proceedings of the 2021 international conference on multimedia retrieval, pp 456\u2013460","DOI":"10.1145\/3460426.3463584"},{"issue":"1","key":"936_CR19","first-page":"1","volume":"3","author":"Y Gu","year":"2021","unstructured":"Gu Y, Tinn R, Cheng H, Lucas M, Usuyama N, Liu X, Poon H (2021) Domain-specific language model pretraining for biomedical natural language processing. ACM Trans Comput Healthcare (HEALTH) 3(1):1\u201323","journal-title":"ACM Trans Comput Healthcare (HEALTH)"},{"key":"936_CR20","doi-asserted-by":"crossref","unstructured":"Gu T, Yang K, Liu D, Cai W (2024) Lapa: latent prompt assist model for medical visual question answering. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 4971\u20134980","DOI":"10.1109\/CVPRW63382.2024.00502"},{"issue":"2","key":"936_CR21","first-page":"3","volume":"1","author":"EJ Hu","year":"2022","unstructured":"Hu EJ, Shen Y, Wallis P, Allen-Zhu Z, Li Y, Wang S, Wang L, Chen W et al (2022) Lora: low-rank adaptation of large language models. ICLR 1(2):3","journal-title":"ICLR"},{"issue":"7","key":"936_CR22","doi-asserted-by":"publisher","first-page":"0324757","DOI":"10.1371\/journal.pone.0324757","volume":"20","author":"C Huang","year":"2025","unstructured":"Huang C, Hu Z (2025) A multimodal transformer-based visual question answering method integrating local and global information. PLoS ONE 20(7):0324757. https:\/\/doi.org\/10.1371\/journal.pone.0324757","journal-title":"PLoS ONE"},{"key":"936_CR23","doi-asserted-by":"crossref","unstructured":"Jiang S, Zheng T, Zhang Y, Jin Y, Yuan L, Liu Z (2024) Med-moe: mixture of domain-specific experts for lightweight medical vision-language models. In: Findings of the association for computational linguistics: EMNLP 2024, pp 3843\u20133860","DOI":"10.18653\/v1\/2024.findings-emnlp.221"},{"key":"936_CR24","doi-asserted-by":"crossref","unstructured":"Khare Y, Bagal V, Mathew M, Devi A, Priyakumar UD, Jawahar C (2021) Mmbert: multimodal bert pretraining for improved medical vqa. In: 2021 IEEE 18th international symposium on biomedical imaging (ISBI). IEEE, pp 1033\u20131036","DOI":"10.1109\/ISBI48211.2021.9434063"},{"key":"936_CR25","unstructured":"Kim J-H, Jun J, Zhang B-T (2018) Bilinear attention networks. Advances in Neural Information Processing Systems 31"},{"issue":"1","key":"936_CR26","doi-asserted-by":"publisher","first-page":"180251","DOI":"10.1038\/sdata.2018.251","volume":"5","author":"JJ Lau","year":"2018","unstructured":"Lau JJ, Gayen S, Ben Abacha A, Demner-Fushman D (2018) A dataset of clinically generated visual questions and answers about radiology images. Sci Data 5(1):180251","journal-title":"Sci Data"},{"key":"936_CR27","doi-asserted-by":"publisher","first-page":"28541","DOI":"10.52202\/075280-1240","volume":"36","author":"C Li","year":"2023","unstructured":"Li C, Wong C, Zhang S, Usuyama N, Liu H, Yang J, Naumann T, Poon H, Gao J (2023) Llava-med: training a large language-and-vision assistant for biomedicine in one day. Adv Neural Inf Process Syst 36:28541\u201328564","journal-title":"Adv Neural Inf Process Syst"},{"key":"936_CR28","doi-asserted-by":"crossref","unstructured":"Li P, Liu G, He J, Zhao Z, Zhong S (2023a) Masked vision and language pre-training with unimodal and multimodal contrastive losses for medical visual question answering. In: International conference on medical image computing and computer-assisted intervention. Springer, pp 374\u2013383","DOI":"10.1007\/978-3-031-43907-0_36"},{"key":"936_CR29","doi-asserted-by":"crossref","unstructured":"Li P, Liu G, Tan L, Liao J, Zhong S (2023b) Self-supervised vision-language pretraining for medial visual question answering. In: 2023 IEEE 20th international symposium on biomedical imaging (ISBI). IEEE, pp 1\u20135","DOI":"10.1109\/ISBI53787.2023.10230743"},{"issue":"6","key":"936_CR30","doi-asserted-by":"publisher","first-page":"1127","DOI":"10.1007\/s11633-025-1564-2","volume":"22","author":"Y Liang","year":"2025","unstructured":"Liang Y, Yang E, Guo G, Cai W, Jiang L, Zhao J, Wang X (2025) Answer semantics-enhanced medical visual question answering. Mach Intell Res 22(6):1127\u20131137","journal-title":"Mach Intell Res"},{"key":"936_CR31","doi-asserted-by":"publisher","first-page":"102611","DOI":"10.1016\/j.artmed.2023.102611","volume":"143","author":"Z Lin","year":"2023","unstructured":"Lin Z, Zhang D, Tao Q, Shi D, Haffari G, Wu Q, He M, Ge Z (2023) Medical visual question answering: a survey. Artif Intell Med 143:102611","journal-title":"Artif Intell Med"},{"key":"936_CR32","doi-asserted-by":"crossref","unstructured":"Liu B, Zhan L-M, Xu L, Ma L, Yang Y, Wu X-M (2021) Slake: A semantically-labeled knowledge-enhanced dataset for medical visual question answering. In: 2021 IEEE 18th international symposium on biomedical imaging (ISBI). IEEE, pp 1650\u20131654","DOI":"10.1109\/ISBI48211.2021.9434010"},{"issue":"5","key":"936_CR33","doi-asserted-by":"publisher","first-page":"1532","DOI":"10.1109\/TMI.2022.3232411","volume":"42","author":"B Liu","year":"2022","unstructured":"Liu B, Zhan L-M, Xu L, Wu X-M (2022) Medical visual question answering via conditional reasoning and contrastive learning. IEEE Trans Med Imaging 42(5):1532\u20131545","journal-title":"IEEE Trans Med Imaging"},{"key":"936_CR34","doi-asserted-by":"publisher","DOI":"10.1016\/j.jbi.2024.104748","volume":"160","author":"G Liu","year":"2024","unstructured":"Liu G, He J, Li P, Zhao Z, Zhong S (2024) Cross-modal self-supervised vision language pre-training with multiple objectives for medical visual question answering. J Biomed Inform 160:104748","journal-title":"J Biomed Inform"},{"key":"936_CR35","unstructured":"Loshchilov I, Hutter F (2017) Decoupled weight decay regularization. arXiv preprint arXiv:1711.05101"},{"key":"936_CR36","unstructured":"Moor M, Huang Q, Wu S, Yasunaga M, Dalmia Y, Leskovec J, Zakka C, Reis EP, Rajpurkar P (2023) Med-flamingo: a multimodal medical few-shot learner. In: Machine learning for health (ML4H). PMLR, pp 353\u2013367"},{"key":"936_CR37","doi-asserted-by":"crossref","unstructured":"Nguyen BD, Do T-T, Nguyen BX, Do T, Tjiputra E, Tran QD (2019) Overcoming data limitation in medical visual question answering. In: International conference on medical image computing and computer-assisted intervention. Springer, pp 522\u2013530","DOI":"10.1007\/978-3-030-32251-9_57"},{"key":"936_CR38","doi-asserted-by":"publisher","DOI":"10.1016\/j.compbiomed.2025.110195","volume":"192","author":"P Peng","year":"2025","unstructured":"Peng P, Fan W, Shen Y, Yang X, Zhou D (2025) A global visual information intervention model for medical visual question answering. Comput Biol Med 192:110195","journal-title":"Comput Biol Med"},{"key":"936_CR39","doi-asserted-by":"publisher","DOI":"10.1016\/j.knosys.2025.113672","volume":"324","author":"C Qiu","year":"2025","unstructured":"Qiu C, Huang K, Xie Z, Liu M, Gu J, Zong X (2025) Explainable medical visual question answering via chain of evidence. Knowl-Based Syst 324:113672","journal-title":"Knowl-Based Syst"},{"key":"936_CR40","unstructured":"Touvron H, Martin L, Stone K, Albert P, Almahairi A, Babaei Y, Bashlykov N, Batra S, Bhargava P, Bhosale S et al (2023) Llama 2: open foundation and fine-tuned chat models. arXiv preprint arXiv:2307.09288"},{"key":"936_CR41","doi-asserted-by":"crossref","unstructured":"Wang Y, Liu J, Gao S, Feng B, Tang Z, Gai X, Wu J, Liu Z (2025) V2t-cot: from vision to text chain-of-thought for medical reasoning and diagnosis. In: International conference on medical image computing and computer-assisted intervention. Springer, pp 658\u2013668","DOI":"10.1007\/978-3-032-04971-1_62"},{"key":"936_CR42","doi-asserted-by":"crossref","unstructured":"Xia H, Zhang Y, Jia H, Chen Y, Xu J, Li, S (2025) A medical visual question-answering model based on multi-scale feature fusion and question feature enhancement: H. xia, et al. Multimedia Syst 31(4):271","DOI":"10.1007\/s00530-025-01848-9"},{"key":"936_CR43","doi-asserted-by":"crossref","unstructured":"Yu T, Tong Z, Yu J, Zhang K (2025) Fine-grained adaptive visual prompt for generative medical visual question answering. In: Proceedings of the AAAI conference on artificial intelligence, vol 39, pp 9662\u20139670","DOI":"10.1609\/aaai.v39i9.33047"},{"key":"936_CR44","doi-asserted-by":"crossref","unstructured":"Zhan L-M, Liu B, Fan L, Chen J, Wu X-M (2020) Medical visual question answering via conditional reasoning. In: Proceedings of the 28th ACM international conference on multimedia, pp 2345\u20132354","DOI":"10.1145\/3394171.3413761"},{"key":"936_CR45","doi-asserted-by":"publisher","unstructured":"Zhang S, Xu Y, Usuyama N, Xu H, Bagga J, Tinn R, Preston S, Rao R, Wei M, Valluri N et al (2025) A multimodal biomedical foundation model trained from fifteen million image\u2013text pairs. Nejm Ai 2(1). https:\/\/doi.org\/10.1056\/AIoa2400640","DOI":"10.1056\/AIoa2400640"},{"issue":"1","key":"936_CR46","doi-asserted-by":"publisher","first-page":"277","DOI":"10.1038\/s43856-024-00709-2","volume":"4","author":"X Zhang","year":"2024","unstructured":"Zhang X, Wu C, Zhao Z, Lin W, Zhang Y, Wang Y, Xie W (2024) Development of a large-scale medical visual question-answering dataset. Commun Med 4(1):277. https:\/\/doi.org\/10.1038\/s43856-024-00709-2","journal-title":"Commun Med"}],"container-title":["Journal of King Saud University Computer and Information Sciences"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s44443-026-00936-8","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s44443-026-00936-8.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s44443-026-00936-8.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,8,7]],"date-time":"2026-08-07T06:44:52Z","timestamp":1786085092000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s44443-026-00936-8"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,6,23]]},"references-count":46,"journal-issue":{"issue":"6","published-print":{"date-parts":[[2026,8]]}},"alternative-id":["936"],"URL":"https:\/\/doi.org\/10.1007\/s44443-026-00936-8","relation":{},"ISSN":["1319-1578","2213-1248"],"issn-type":[{"value":"1319-1578","type":"print"},{"value":"2213-1248","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026,6,23]]},"assertion":[{"value":"3 May 2026","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"7 June 2026","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"23 June 2026","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"The authors declare no competing interests.","order":1,"name":"Ethics","label":"Competing Interests","group":{"name":"EthicsHeading","label":"Declarations"}}],"article-number":"524"}}