{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,15]],"date-time":"2026-06-15T14:55:49Z","timestamp":1781535349565,"version":"3.54.5"},"publisher-location":"New York, NY, USA","reference-count":34,"publisher":"ACM","license":[{"start":{"date-parts":[[2026,6,15]],"date-time":"2026-06-15T00:00:00Z","timestamp":1781481600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/legalcode"}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2026,6,16]]},"DOI":"10.1145\/3805622.3810670","type":"proceedings-article","created":{"date-parts":[[2026,6,15]],"date-time":"2026-06-15T14:42:57Z","timestamp":1781534577000},"page":"2760-2767","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":0,"title":["EC-RAG: Evidence-Centric Retrieval-Augmented Generation for Medical Visual Question Answering"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0009-0003-1705-0573","authenticated-orcid":false,"given":"Songming","family":"Li","sequence":"first","affiliation":[{"name":"Central South University, Changsha, hunan, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0003-2780-1115","authenticated-orcid":false,"given":"Jun","family":"Long","sequence":"additional","affiliation":[{"name":"Central South University, Changsha, hunan, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"320","published-online":{"date-parts":[[2026,6,15]]},"reference":[{"key":"e_1_3_3_1_2_2","doi-asserted-by":"crossref","unstructured":"Wenliang Dai Junnan Li Dongxu Li Anthony Tiong Junqi Zhao Weisheng Wang Boyang Li Pascale\u00a0N Fung and Steven Hoi. 2023. Instructblip: Towards general-purpose vision-language models with instruction tuning. Advances in neural information processing systems 36 (2023) 49250\u201349267.","DOI":"10.52202\/075280-2142"},{"key":"e_1_3_3_1_3_2","doi-asserted-by":"crossref","unstructured":"Dina Demner-Fushman Marc\u00a0D Kohli Marc\u00a0B Rosenman Sonya\u00a0E Shooshan Laritza Rodriguez Sameer Antani George\u00a0R Thoma and Clement\u00a0J McDonald. 2015. Preparing a collection of radiology examinations for distribution and retrieval. Journal of the American Medical Informatics Association 23 2 (2015) 304\u2013310.","DOI":"10.1093\/jamia\/ocv080"},{"key":"e_1_3_3_1_4_2","unstructured":"Peng Gao Jiaming Han Renrui Zhang Ziyi Lin Shijie Geng Aojun Zhou Wei Zhang Pan Lu Conghui He Xiangyu Yue et\u00a0al. 2023. Llama-adapter v2: Parameter-efficient visual instruction model. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2304.15010 (2023)."},{"key":"e_1_3_3_1_5_2","unstructured":"Yunfan Gao Yun Xiong Xinyu Gao Kangxiang Jia Jinliu Pan Yuxi Bi Yixin Dai Jiawei Sun Haofen Wang and Haofen Wang. 2023. Retrieval-augmented generation for large language models: A survey. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2312.10997 2 1 (2023)."},{"key":"e_1_3_3_1_6_2","unstructured":"Sunan He Yuxiang Nie Zhixuan Chen Zhiyuan Cai Hongmei Wang Shu Yang and Hao Chen. 2024. Meddr: Diagnosis-guided bootstrapping for large-scale medical vision-language learning. CoRR (2024)."},{"key":"e_1_3_3_1_7_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.02093"},{"key":"e_1_3_3_1_8_2","doi-asserted-by":"crossref","unstructured":"Minbyul Jeong Jiwoong Sohn Mujeen Sung and Jaewoo Kang. 2024. Improving medical reasoning through retrieval and self-reflection with retrieval-augmented large language models. Bioinformatics 40 Supplement_1 (2024) i119\u2013i129.","DOI":"10.1093\/bioinformatics\/btae238"},{"key":"e_1_3_3_1_9_2","doi-asserted-by":"crossref","unstructured":"Qiao Jin Won Kim Qingyu Chen Donald\u00a0C Comeau Lana Yeganova W\u00a0John Wilbur and Zhiyong Lu. 2023. Medcpt: Contrastive pre-trained transformers with large-scale pubmed search logs for zero-shot biomedical information retrieval. Bioinformatics 39 11 (2023) btad651.","DOI":"10.1093\/bioinformatics\/btad651"},{"key":"e_1_3_3_1_10_2","doi-asserted-by":"crossref","unstructured":"Alistair\u00a0EW Johnson Tom\u00a0J Pollard Nathaniel\u00a0R Greenbaum Matthew\u00a0P Lungren Chih-ying Deng Yifan Peng Zhiyong Lu Roger\u00a0G Mark Seth\u00a0J Berkowitz and Steven Horng. 2019. MIMIC-CXR-JPG a large publicly available database of labeled chest radiographs. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/1901.07042 (2019).","DOI":"10.1038\/s41597-019-0322-0"},{"key":"e_1_3_3_1_11_2","doi-asserted-by":"crossref","unstructured":"Bo Li Yuanhan Zhang Liangyu Chen Jinghao Wang Fanyi Pu Joshua\u00a0Adrian Cahyono Jingkang Yang Chunyuan Li and Ziwei Liu. 2025. Otter: A multi-modal model with in-context instruction tuning. IEEE Transactions on Pattern Analysis and Machine Intelligence (2025).","DOI":"10.1109\/TPAMI.2025.3571946"},{"key":"e_1_3_3_1_12_2","doi-asserted-by":"crossref","unstructured":"Chunyuan Li Cliff Wong Sheng Zhang Naoto Usuyama Haotian Liu Jianwei Yang Tristan Naumann Hoifung Poon and Jianfeng Gao. 2023. Llava-med: Training a large language-and-vision assistant for biomedicine in one day. Advances in Neural Information Processing Systems 36 (2023) 28541\u201328564.","DOI":"10.52202\/075280-1240"},{"key":"e_1_3_3_1_13_2","first-page":"19730","volume-title":"International conference on machine learning","author":"Li Junnan","year":"2023","unstructured":"Junnan Li, Dongxu Li, Silvio Savarese, and Steven Hoi. 2023. Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models. In International conference on machine learning. PMLR, 19730\u201319742."},{"key":"e_1_3_3_1_14_2","doi-asserted-by":"crossref","unstructured":"Haotian Liu Chunyuan Li Qingyang Wu and Yong\u00a0Jae Lee. 2023. Visual instruction tuning. Advances in neural information processing systems 36 (2023) 34892\u201334916.","DOI":"10.52202\/075280-1516"},{"key":"e_1_3_3_1_15_2","unstructured":"Cui Long Yongbin Liu Chunping Ouyang and Ying Yu. 2024. Bailicai: A Domain-Optimized Retrieval-Augmented Generation Framework for Medical Applications. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2407.21055 (2024)."},{"key":"e_1_3_3_1_16_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.01168"},{"key":"e_1_3_3_1_17_2","unstructured":"Michael Moor Qian Huang Shirley Wu Michihiro Yasunaga Cyril Zakka Yash Dalmia Eduardo\u00a0Pontes Reis Pranav Rajpurkar and Jure Leskovec. 2023. Med-flamingo: a multimodal medical few-shot learner (2023). URL: https:\/\/arxiv. org\/abs\/2307.15189 (2023)."},{"key":"e_1_3_3_1_18_2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.acl-long.585"},{"key":"e_1_3_3_1_19_2","doi-asserted-by":"crossref","unstructured":"Dimitri Roustan and Fran\u00e7ois Bastardot. 2025. The clinicians\u2019 guide to large language models: a general perspective with a focus on hallucinations. Interactive journal of medical research 14 1 (2025) e59823.","DOI":"10.2196\/59823"},{"key":"e_1_3_3_1_20_2","doi-asserted-by":"crossref","unstructured":"Karan Singhal Tao Tu Juraj Gottweis Rory Sayres Ellery Wulczyn Mohamed Amin Le Hou Kevin Clark Stephen\u00a0R Pfohl Heather Cole-Lewis et\u00a0al. 2025. Toward expert-level medical question answering with large language models. Nature Medicine 31 3 (2025) 943\u2013950.","DOI":"10.1038\/s41591-024-03423-7"},{"key":"e_1_3_3_1_21_2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2025.naacl-long.28"},{"key":"e_1_3_3_1_22_2","doi-asserted-by":"crossref","unstructured":"Arun\u00a0James Thirunavukarasu Darren Shu\u00a0Jeng Ting Kabilan Elangovan Laura Gutierrez Ting\u00a0Fang Tan and Daniel Shu\u00a0Wei Ting. 2023. Large language models in medicine. Nature medicine 29 8 (2023) 1930\u20131940.","DOI":"10.1038\/s41591-023-02448-8"},{"key":"e_1_3_3_1_23_2","unstructured":"Ashish Vaswani Noam Shazeer Niki Parmar Jakob Uszkoreit Llion Jones Aidan\u00a0N Gomez \u0141ukasz Kaiser and Illia Polosukhin. 2017. Attention is all you need. Advances in neural information processing systems 30 (2017)."},{"key":"e_1_3_3_1_24_2","doi-asserted-by":"crossref","unstructured":"Sheng Wang Zihao Zhao Xi Ouyang Tianming Liu Qian Wang and Dinggang Shen. 2024. Interactive computer-aided diagnosis on medical image using large language models. Communications Engineering 3 1 (2024) 133.","DOI":"10.1038\/s44172-024-00271-8"},{"key":"e_1_3_3_1_25_2","doi-asserted-by":"crossref","unstructured":"Chaoyi Wu Xiaoman Zhang Ya Zhang Hui Hui Yanfeng Wang and Weidi Xie. 2025. Towards generalist foundation model for radiology by leveraging web-scale 2d&3d medical data. Nature Communications 16 1 (2025) 7866.","DOI":"10.1038\/s41467-025-62385-7"},{"key":"e_1_3_3_1_26_2","unstructured":"Peng Xia Kangyu Zhu Haoran Li Tianze Wang Weijia Shi Sheng Wang Linjun Zhang James Zou and Huaxiu Yao. 2024. Mmed-rag: Versatile multimodal rag system for medical vision language models. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2410.13085 (2024)."},{"key":"e_1_3_3_1_27_2","doi-asserted-by":"crossref","unstructured":"Peng Xia Kangyu Zhu Haoran Li Hongtu Zhu Yun Li Gang Li Linjun Zhang and Huaxiu Yao. 2024. Rule: Reliable multimodal rag for factuality in medical vision language models. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2407.05131 (2024).","DOI":"10.18653\/v1\/2024.emnlp-main.62"},{"key":"e_1_3_3_1_28_2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.findings-acl.372"},{"key":"e_1_3_3_1_29_2","doi-asserted-by":"publisher","DOI":"10.1142\/9789819807024_0015"},{"key":"e_1_3_3_1_30_2","unstructured":"Zhiling Yan Kai Zhang Rong Zhou Lifang He Xiang Li and Lichao Sun. 2023. Multimodal chatgpt for medical applications: an experimental study of gpt-4v. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2310.19061 (2023)."},{"key":"e_1_3_3_1_31_2","unstructured":"Qinghao Ye Haiyang Xu Guohai Xu Jiabo Ye Ming Yan Yiyang Zhou Junyang Wang Anwen Hu Pengcheng Shi Yaya Shi et\u00a0al. 2023. mplug-owl: Modularization empowers large language models with multimodality. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2304.14178 (2023)."},{"key":"e_1_3_3_1_32_2","unstructured":"Ting Yu Binhui Ge Shuhui Wang Yan Yang Qingming Huang and Jun Yu. 2024. Consistency Conditioned Memory Augmented Dynamic Diagnosis Model for Medical Visual Question Answering. IEEE Journal of Biomedical and Health Informatics (2024)."},{"key":"e_1_3_3_1_33_2","doi-asserted-by":"crossref","unstructured":"Ao Zhang Hao Fei Yuan Yao Wei Ji Li Li Zhiyuan Liu and Tat-Seng Chua. 2023. Vpgtrans: Transfer visual prompt generator across llms. Advances in Neural Information Processing Systems 36 (2023) 20299\u201320319.","DOI":"10.52202\/075280-0891"},{"key":"e_1_3_3_1_34_2","unstructured":"Xiaoman Zhang Chaoyi Wu Ziheng Zhao Weixiong Lin Ya Zhang Yanfeng Wang and Weidi Xie. 2023. Pmc-vqa: Visual instruction tuning for medical visual question answering. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2305.10415 (2023)."},{"key":"e_1_3_3_1_35_2","unstructured":"Deyao Zhu Jun Chen Xiaoqian Shen Xiang Li and Mohamed Elhoseiny. 2023. Minigpt-4: Enhancing vision-language understanding with advanced large language models. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2304.10592 (2023)."}],"event":{"name":"ICMR '26: International Conference on Multimedia Retrieval","location":"Amsterdam The Netherlands","acronym":"ICMR '26","sponsor":["SIGMM ACM Special Interest Group on Multimedia"]},"container-title":["Proceedings of the 2026 International Conference on Multimedia Retrieval"],"original-title":[],"deposited":{"date-parts":[[2026,6,15]],"date-time":"2026-06-15T14:43:29Z","timestamp":1781534609000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3805622.3810670"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,6,15]]},"references-count":34,"alternative-id":["10.1145\/3805622.3810670","10.1145\/3805622"],"URL":"https:\/\/doi.org\/10.1145\/3805622.3810670","relation":{},"subject":[],"published":{"date-parts":[[2026,6,15]]},"assertion":[{"value":"2026-06-15","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}