{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,15]],"date-time":"2026-06-15T15:54:04Z","timestamp":1781538844816,"version":"3.54.5"},"publisher-location":"New York, NY, USA","reference-count":36,"publisher":"ACM","license":[{"start":{"date-parts":[[2026,6,15]],"date-time":"2026-06-15T00:00:00Z","timestamp":1781481600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/legalcode"}],"funder":[{"DOI":"10.13039\/501100004543","name":"China Scholarship Council","doi-asserted-by":"publisher","award":["202208330098"],"award-info":[{"award-number":["202208330098"]}],"id":[{"id":"10.13039\/501100004543","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2026,6,16]]},"DOI":"10.1145\/3805622.3810767","type":"proceedings-article","created":{"date-parts":[[2026,6,15]],"date-time":"2026-06-15T14:42:57Z","timestamp":1781534577000},"page":"2219-2227","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":0,"title":["Augmenting medical vision-language pretraining via domain-aware retrieval-augmented caption enrichment"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0009-0003-8861-0427","authenticated-orcid":false,"given":"Xiaoyang","family":"Wei","sequence":"first","affiliation":[{"name":"Universit\u00e9 Paris Cit\u00e9 - LIPADE, Paris, France"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-9254-7537","authenticated-orcid":false,"given":"Camille","family":"Kurtz","sequence":"additional","affiliation":[{"name":"Universit\u00e9 Paris Cit\u00e9 - LIPADE, Paris, France"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-4807-299X","authenticated-orcid":false,"given":"Florence","family":"Cloppet","sequence":"additional","affiliation":[{"name":"Universit\u00e9 Paris Cit\u00e9 - LIPADE, Paris, France"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"320","published-online":{"date-parts":[[2026,6,15]]},"reference":[{"key":"e_1_3_3_1_2_2","doi-asserted-by":"publisher","DOI":"10.1109\/WACV61041.2025.00042"},{"key":"e_1_3_3_1_3_2","doi-asserted-by":"crossref","unstructured":"Olivier Bodenreider. 2004. The unified medical language system (UMLS): integrating biomedical terminology. Nucleic acids research 32 suppl_1 (2004) D267\u2013D270.","DOI":"10.1093\/nar\/gkh061"},{"key":"e_1_3_3_1_4_2","unstructured":"Zhe Chen Yusheng Liao Shuyang Jiang Zhiyuan Zhu Haolin Li Yanfeng Wang and Yu Wang. 2025. HeteroRAG: A Heterogeneous Retrieval-Augmented Generation Framework for Medical Vision Language Tasks. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2508.12778 (2025)."},{"key":"e_1_3_3_1_5_2","doi-asserted-by":"crossref","unstructured":"Lijie Fan Dilip Krishnan Phillip Isola Dina Katabi and Yonglong Tian. 2023. Improving clip training with language rewrites. Advances in Neural Information Processing Systems 36 (2023) 35544\u201335575.","DOI":"10.52202\/075280-1544"},{"key":"e_1_3_3_1_6_2","doi-asserted-by":"publisher","DOI":"10.1007\/978-90-481-8847-5_10"},{"key":"e_1_3_3_1_7_2","doi-asserted-by":"crossref","unstructured":"Samir\u00a0Yitzhak Gadre Gabriel Ilharco Alex Fang Jonathan Hayase Georgios Smyrnis Thao Nguyen Ryan Marten Mitchell Wortsman Dhruba Ghosh Jieyu Zhang et\u00a0al. 2023. Datacomp: In search of the next generation of multimodal datasets. Advances in Neural Information Processing Systems 36 (2023) 27092\u201327112.","DOI":"10.52202\/075280-1179"},{"key":"e_1_3_3_1_8_2","unstructured":"Aaron Grattafiori Abhimanyu Dubey Abhinav Jauhri Abhinav Pandey Abhishek Kadian Ahmad Al-Dahle Aiesha Letman Akhil Mathur Alan Schelten Alex Vaughan et\u00a0al. 2024. The llama 3 herd of models. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2407.21783 (2024)."},{"key":"e_1_3_3_1_9_2","doi-asserted-by":"crossref","unstructured":"Yu Gu Robert Tinn Hao Cheng Michael Lucas Naoto Usuyama Xiaodong Liu Tristan Naumann Jianfeng Gao and Hoifung Poon. 2021. Domain-specific language model pretraining for biomedical natural language processing. ACM Transactions on Computing for Healthcare (HEALTH) 3 1 (2021) 1\u201323.","DOI":"10.1145\/3458754"},{"key":"e_1_3_3_1_10_2","unstructured":"Weiquan Huang Aoqi Wu Yifan Yang Xufang Luo Yuqing Yang Liang Hu Qi Dai Chunyu Wang Xiyang Dai Dongdong Chen et\u00a0al. 2024. Llm2clip: Powerful language model unlocks richer visual representation. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2411.04997 (2024)."},{"key":"e_1_3_3_1_11_2","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-42448-9_25"},{"key":"e_1_3_3_1_12_2","first-page":"1000","volume-title":"International Conference on Artificial Intelligence and Statistics","author":"Joshi Siddharth","year":"2024","unstructured":"Siddharth Joshi, Arnav Jain, Ali Payani, and Baharan Mirzasoleiman. 2024. Data-efficient contrastive language-image pretraining: Prioritizing data quality over quantity. In International Conference on Artificial Intelligence and Statistics. PMLR, 1000\u20131008."},{"key":"e_1_3_3_1_13_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7298932"},{"key":"e_1_3_3_1_14_2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2020.emnlp-main.550"},{"key":"e_1_3_3_1_15_2","doi-asserted-by":"crossref","unstructured":"Zeljko Kraljevic Thomas Searle Anthony Shek Lukasz Roguski Kawsar Noor Daniel Bean Aurelie Mascio Leilei Zhu Amos\u00a0A Folarin Angus Roberts et\u00a0al. 2021. Multi-domain clinical natural language processing with MedCAT: the medical concept annotation toolkit. Artificial intelligence in medicine 117 (2021) 102083.","DOI":"10.1016\/j.artmed.2021.102083"},{"key":"e_1_3_3_1_16_2","first-page":"111","volume-title":"European Conference on Computer Vision","author":"Lai Zhengfeng","year":"2024","unstructured":"Zhengfeng Lai, Haotian Zhang, Bowen Zhang, Wentao Wu, Haoping Bai, Aleksei Timofeev, Xianzhi Du, Zhe Gan, Jiulong Shan, Chen-Nee Chuah, et\u00a0al. 2024. Veclip: Improving clip training via visual-enriched captions. In European Conference on Computer Vision. Springer, 111\u2013127."},{"key":"e_1_3_3_1_17_2","doi-asserted-by":"publisher","DOI":"10.1117\/12.480677"},{"key":"e_1_3_3_1_18_2","unstructured":"Patrick Lewis Ethan Perez Aleksandra Piktus Fabio Petroni Vladimir Karpukhin Naman Goyal Heinrich K\u00fcttler Mike Lewis Wen-tau Yih Tim Rockt\u00e4schel et\u00a0al. 2020. Retrieval-augmented generation for knowledge-intensive nlp tasks. Advances in neural information processing systems 33 (2020) 9459\u20139474."},{"key":"e_1_3_3_1_19_2","first-page":"12888","volume-title":"International conference on machine learning","author":"Li Junnan","year":"2022","unstructured":"Junnan Li, Dongxu Li, Caiming Xiong, and Steven Hoi. 2022. Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation. In International conference on machine learning. PMLR, 12888\u201312900."},{"key":"e_1_3_3_1_20_2","doi-asserted-by":"crossref","unstructured":"Haotian Liu Chunyuan Li Qingyang Wu and Yong\u00a0Jae Lee. 2023. Visual instruction tuning. Advances in neural information processing systems 36 (2023) 34892\u201334916.","DOI":"10.52202\/075280-1516"},{"key":"e_1_3_3_1_21_2","unstructured":"Yanqing Liu Kai Wang Wenqi Shao Ping Luo Yu Qiao Mike\u00a0Zheng Shou Kaipeng Zhang and Yang You. 2023. Mllms-augmented visual-language representation learning. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2311.18765 (2023)."},{"key":"e_1_3_3_1_22_2","doi-asserted-by":"crossref","unstructured":"Karen Ka\u00a0Yan Ng Izuki Matsuba and Peter\u00a0Chengming Zhang. 2025. RAG in health care: a novel framework for improving communication and decision-making by addressing LLM limitations. Nejm Ai 2 1 (2025) AIra2400380.","DOI":"10.1056\/AIra2400380"},{"key":"e_1_3_3_1_23_2","doi-asserted-by":"crossref","unstructured":"Thao Nguyen Samir\u00a0Yitzhak Gadre Gabriel Ilharco Sewoong Oh and Ludwig Schmidt. 2023. Improving multimodal datasets with image captioning. Advances in Neural Information Processing Systems 36 (2023) 22047\u201322069.","DOI":"10.52202\/075280-0967"},{"key":"e_1_3_3_1_24_2","doi-asserted-by":"crossref","unstructured":"Thao Nguyen Gabriel Ilharco Mitchell Wortsman Sewoong Oh and Ludwig Schmidt. 2022. Quality not quantity: On the interaction between dataset design and robustness of clip. Advances in Neural Information Processing Systems 35 (2022) 21455\u201321469.","DOI":"10.52202\/068431-1559"},{"key":"e_1_3_3_1_25_2","first-page":"8748","volume-title":"International conference on machine learning","author":"Radford Alec","year":"2021","unstructured":"Alec Radford, Jong\u00a0Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, et\u00a0al. 2021. Learning transferable visual models from natural language supervision. In International conference on machine learning. PmLR, 8748\u20138763."},{"key":"e_1_3_3_1_26_2","unstructured":"Pranav Rajpurkar Jeremy Irvin Aarti Bagul Daisy Ding Tony Duan Hershel Mehta Brandon Yang Kaylie Zhu Dillon Laird Robyn\u00a0L Ball et\u00a0al. 2017. Mura: Large dataset for abnormality detection in musculoskeletal radiographs. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/1712.06957 (2017)."},{"key":"e_1_3_3_1_27_2","doi-asserted-by":"crossref","unstructured":"Christoph Schuhmann Romain Beaumont Richard Vencu Cade Gordon Ross Wightman Mehdi Cherti Theo Coombes Aarush Katta Clayton Mullis Mitchell Wortsman et\u00a0al. 2022. Laion-5b: An open large-scale dataset for training next generation image-text models. Advances in neural information processing systems 35 (2022) 25278\u201325294.","DOI":"10.52202\/068431-1833"},{"key":"e_1_3_3_1_28_2","unstructured":"Andrew Sellergren Sahar Kazemzadeh Tiam Jaroensri Atilla Kiraly Madeleine Traverse Timo Kohlberger Shawn Xu Fayaz Jamil C\u00edan Hughes Charles Lau et\u00a0al. 2025. Medgemma technical report. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2507.05201 (2025)."},{"key":"e_1_3_3_1_29_2","doi-asserted-by":"crossref","unstructured":"Sanjay Subramanian Lucy\u00a0Lu Wang Ben Bogin Sachin Mehta Madeleine van Zuylen Sravanthi Parasa Sameer Singh Matt Gardner and Hannaneh Hajishirzi. 2020. MedICaT: A Dataset of Medical Images Captions and Textual References. Findings of the Association for Computational Linguistics: EMNLP (2020).","DOI":"10.18653\/v1\/2020.findings-emnlp.191"},{"key":"e_1_3_3_1_30_2","doi-asserted-by":"crossref","unstructured":"Ryota Tanaka Taichi Iki Taku Hasegawa Kyosuke Nishida Kuniko Saito and Jun Suzuki. 2025. VDocRAG: Retrieval-Augmented Generation over Visually-Rich Documents. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2504.09795 (2025).","DOI":"10.1109\/CVPR52734.2025.02312"},{"key":"e_1_3_3_1_31_2","unstructured":"Hugo Touvron Thibaut Lavril Gautier Izacard Xavier Martinet Marie-Anne Lachaux Timoth\u00e9e Lacroix Baptiste Rozi\u00e8re Naman Goyal Eric Hambro Faisal Azhar et\u00a0al. 2023. Llama: Open and efficient foundation language models. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2302.13971 (2023)."},{"key":"e_1_3_3_1_32_2","doi-asserted-by":"crossref","unstructured":"Zografoula Vagena Xiaoyang Wei Camille Kurtz and Florence Cloppet. 2025. Semantic aware representation learning for optimizing image retrieval systems in radiology. Pattern Recognition 158 (2025) 111060.","DOI":"10.1016\/j.patcog.2024.111060"},{"key":"e_1_3_3_1_33_2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2022.emnlp-main.256"},{"key":"e_1_3_3_1_34_2","unstructured":"Xiaoyang Wei Camille Kurtz and Florence Cloppet. 2025. QwenCLIP: Boosting Medical Vision-Language Pretraining via LLM Embeddings and Prompt tuning. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2511.13876 (2025)."},{"key":"e_1_3_3_1_35_2","first-page":"351","volume-title":"International Conference on Image Analysis and Processing","author":"Wei Xiaoyang","year":"2025","unstructured":"Xiaoyang Wei, Camille Kurtz, and Florence Cloppet. 2025. A Semantically-Aware Relevance Measure for Content-Based Medical Image Retrieval Evaluation. In International Conference on Image Analysis and Processing. Springer, 351\u2013363."},{"key":"e_1_3_3_1_36_2","doi-asserted-by":"publisher","DOI":"10.1109\/ISBI56570.2024.10635576"},{"key":"e_1_3_3_1_37_2","unstructured":"Peng Xia Kangyu Zhu Haoran Li Tianze Wang Weijia Shi Sheng Wang Linjun Zhang James Zou and Huaxiu Yao. 2024. Mmed-rag: Versatile multimodal rag system for medical vision language models. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2410.13085 (2024)."}],"event":{"name":"ICMR '26: International Conference on Multimedia Retrieval","location":"Amsterdam The Netherlands","acronym":"ICMR '26","sponsor":["SIGMM ACM Special Interest Group on Multimedia"]},"container-title":["Proceedings of the 2026 International Conference on Multimedia Retrieval"],"original-title":[],"deposited":{"date-parts":[[2026,6,15]],"date-time":"2026-06-15T14:58:29Z","timestamp":1781535509000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3805622.3810767"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,6,15]]},"references-count":36,"alternative-id":["10.1145\/3805622.3810767","10.1145\/3805622"],"URL":"https:\/\/doi.org\/10.1145\/3805622.3810767","relation":{},"subject":[],"published":{"date-parts":[[2026,6,15]]},"assertion":[{"value":"2026-06-15","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}