{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,20]],"date-time":"2026-07-20T14:10:17Z","timestamp":1784556617815,"version":"3.55.0"},"publisher-location":"Cham","reference-count":35,"publisher":"Springer Nature Switzerland","isbn-type":[{"value":"9783032051844","type":"print"},{"value":"9783032051851","type":"electronic"}],"license":[{"start":{"date-parts":[[2025,9,20]],"date-time":"2025-09-20T00:00:00Z","timestamp":1758326400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2025,9,20]],"date-time":"2025-09-20T00:00:00Z","timestamp":1758326400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2026]]},"DOI":"10.1007\/978-3-032-05185-1_25","type":"book-chapter","created":{"date-parts":[[2025,9,19]],"date-time":"2025-09-19T23:46:27Z","timestamp":1758325587000},"page":"251-261","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["GoCa: Trustworthy Multi-modal RAG with\u00a0Explicit Thinking Distillation for\u00a0Reliable Decision-Making in\u00a0Med-LVLMs"],"prefix":"10.1007","author":[{"given":"Pengyu","family":"Dai","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yafei","family":"Ou","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yuqiao","family":"Yang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Ze","family":"Jin","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Kenji","family":"Suzuki","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2025,9,20]]},"reference":[{"key":"25_CR1","unstructured":"Achiam, J., Adler, S., Agarwal, S., Ahmad, L., et\u00a0al.: Gpt-4 technical report. arXiv preprint arXiv:2303.08774 (2023)"},{"key":"25_CR2","unstructured":"Anthropic: The claude 3 model family: Opus, sonnet, haiku. In: online (2024). https:\/\/api.semanticscholar.org\/CorpusID:268232499"},{"key":"25_CR3","unstructured":"Chuang, Y.S., Xie, Y., Luo, H., Kim, Y., Glass, J., He, P.: Dola: Decoding by contrasting layers improves factuality in large language models. arXiv preprint arXiv:2309.03883 (2023)"},{"issue":"2","key":"25_CR4","doi-asserted-by":"publisher","first-page":"304","DOI":"10.1093\/jamia\/ocv080","volume":"23","author":"D Demner-Fushman","year":"2016","unstructured":"Demner-Fushman, D., Kohli, M.D., Rosenman, M.B., et al.: Preparing a collection of radiology examinations for distribution and retrieval. J. Am. Med. Inform. Assoc. 23(2), 304\u2013310 (2016)","journal-title":"J. Am. Med. Inform. Assoc."},{"key":"25_CR5","unstructured":"Dosovitskiy, A., et al.: An image is worth 16x16 words: Transformers for image recognition at scale. In: International Conference on Learning Representations (2021)"},{"key":"25_CR6","doi-asserted-by":"publisher","unstructured":"Fan, L., Gong, X., Zheng, C., Tan, X., Li, J., Ou, Y.: Cycle-vqa: a cycle-consistent framework for robust medical visual question answering. Pattern Recogn. 165, 111609 (2025). https:\/\/doi.org\/10.1016\/j.patcog.2025.111609","DOI":"10.1016\/j.patcog.2025.111609"},{"key":"25_CR7","unstructured":"Gai, X., Zhou, C., Liu, J., Feng, Y., Wu, J., Liu, Z.: Medthink: Explaining medical visual question answering via multimodal decision-making rationale. CoRR (2024)"},{"key":"25_CR8","unstructured":"Guo, D., et\u00a0al.: Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning. arXiv preprint arXiv:2501.12948 (2025)"},{"key":"25_CR9","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., Sun, J.: Deep residual learning for image recognition. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 770\u2013778 (2016)","DOI":"10.1109\/CVPR.2016.90"},{"issue":"2","key":"25_CR10","first-page":"3","volume":"1","author":"EJ Hu","year":"2022","unstructured":"Hu, E.J., et al.: Lora: low-rank adaptation of large language models. ICLR 1(2), 3 (2022)","journal-title":"ICLR"},{"key":"25_CR11","doi-asserted-by":"crossref","unstructured":"Huang, Q., et al.: Opera: alleviating hallucination in multi-modal large language models via over-trust penalty and retrospection-allocation. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 13418\u201313427 (2024)","DOI":"10.1109\/CVPR52733.2024.01274"},{"key":"25_CR12","doi-asserted-by":"crossref","unstructured":"Johnson, A.E., Pollard, T.J., Greenbaum, N.R., Lungren, M.P., et\u00a0al.: Mimic-cxr-jpg, a large publicly available database of labeled chest radiographs. arXiv preprint arXiv:1901.07042 (2019)","DOI":"10.1038\/s41597-019-0322-0"},{"key":"25_CR13","doi-asserted-by":"crossref","unstructured":"Leng, S., Zhang, H., Chen, G., Li, X., Lu, S., Miao, C., Bing, L.: Mitigating object hallucinations in large vision-language models through visual contrastive decoding. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition. pp. 13872\u201313882 (2024)","DOI":"10.1109\/CVPR52733.2024.01316"},{"key":"25_CR14","unstructured":"Lewis, P., et al.: Retrieval-augmented generation for knowledge-intensive nlp tasks. Adv. Neural. Inf. Process. Syst. 33, 9459\u20139474 (2020)"},{"key":"25_CR15","doi-asserted-by":"publisher","first-page":"28541","DOI":"10.52202\/075280-1240","volume":"36","author":"C Li","year":"2023","unstructured":"Li, C., et al.: Llava-med: training a large language-and-vision assistant for biomedicine in one day. Adv. Neural. Inf. Process. Syst. 36, 28541\u201328564 (2023)","journal-title":"Adv. Neural. Inf. Process. Syst."},{"key":"25_CR16","doi-asserted-by":"publisher","first-page":"51991","DOI":"10.52202\/075280-2264","volume":"36","author":"G Li","year":"2023","unstructured":"Li, G., Hammoud, H., Itani, H., Khizbullin, D., Ghanem, B.: Camel: communicative agents for \u201cmind\u2019\u2019 exploration of large language model society. Adv. Neural. Inf. Process. Syst. 36, 51991\u201352008 (2023)","journal-title":"Adv. Neural. Inf. Process. Syst."},{"key":"25_CR17","unstructured":"Li, J., Cao, P., Chen, Y., Liu, K., Zhao, J.: Towards faithful chain-of-thought: Large language models are bridging reasoners. arXiv preprint arXiv:2405.18915 (2024)"},{"key":"25_CR18","unstructured":"Li, J., et al.: Llava-surg: towards multimodal surgical assistant via structured surgical video learning. arXiv preprint arXiv:2408.07981 (2024)"},{"key":"25_CR19","unstructured":"Li, X., et\u00a0al.: Rag-ddr: Optimizing retrieval-augmented generation using differentiable data rewards. arXiv preprint arXiv:2410.13509 (2024)"},{"key":"25_CR20","doi-asserted-by":"crossref","unstructured":"Luo, Y., et\u00a0al.: Fairclip: Harnessing fairness in vision-language learning. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 12289\u201312301 (2024)","DOI":"10.1109\/CVPR52733.2024.01168"},{"key":"25_CR21","unstructured":"Moor, M., et al.: Med-flamingo: a multimodal medical few-shot learner. In: Machine Learning for Health (ML4H), pp. 353\u2013367. PMLR (2023)"},{"key":"25_CR22","unstructured":"Radford, A., Kim, J.W., Hallacy, C., Ramesh, A., Goh, G., et\u00a0al.: Learning transferable visual models from natural language supervision. In: International Conference on Machine Learning, pp. 8748\u20138763. PmLR (2021)"},{"key":"25_CR23","doi-asserted-by":"publisher","first-page":"53728","DOI":"10.52202\/075280-2338","volume":"36","author":"R Rafailov","year":"2023","unstructured":"Rafailov, R., Sharma, A., Mitchell, E., Manning, C.D., Ermon, S., Finn, C.: Direct preference optimization: your language model is secretly a reward model. Adv. Neural. Inf. Process. Syst. 36, 53728\u201353741 (2023)","journal-title":"Adv. Neural. Inf. Process. Syst."},{"key":"25_CR24","unstructured":"Shi, C., Rezai, R., Yang, J., Dou, Q., Li, X.: A survey on trustworthiness in foundation models for medical image analysis. arXiv preprint arXiv:2407.15851 (2024)"},{"key":"25_CR25","doi-asserted-by":"publisher","first-page":"9460","DOI":"10.52202\/068431-0687","volume":"35","author":"J Skalse","year":"2022","unstructured":"Skalse, J., Howe, N., Krasheninnikov, D., Krueger, D.: Defining and characterizing reward gaming. Adv. Neural. Inf. Process. Syst. 35, 9460\u20139471 (2022)","journal-title":"Adv. Neural. Inf. Process. Syst."},{"key":"25_CR26","unstructured":"Sun, L., Zhao, J., Han, M., Xiong, C.: Fact-aware multimodal retrieval augmentation for accurate medical radiology report generation. arXiv preprint arXiv:2407.15268 (2024)"},{"key":"25_CR27","unstructured":"Sutskever, I., Vinyals, O., Le, Q.V.: Sequence to sequence learning with neural networks. Advances in neural information processing systems 27 (2014)"},{"issue":"3","key":"25_CR28","doi-asserted-by":"publisher","first-page":"257","DOI":"10.1007\/s12194-017-0406-5","volume":"10","author":"K Suzuki","year":"2017","unstructured":"Suzuki, K.: Overview of deep learning in medical imaging. Radiol. Phys. Technol. 10(3), 257\u2013273 (2017). https:\/\/doi.org\/10.1007\/s12194-017-0406-5","journal-title":"Radiol. Phys. Technol."},{"key":"25_CR29","unstructured":"Wang, Z., Liu, A., Lin, H., Li, J., Ma, X., Liang, Y.: Rat: Retrieval augmented thoughts elicit context-aware reasoning in long-horizon generation. arXiv preprint arXiv:2403.05313 (2024)"},{"key":"25_CR30","doi-asserted-by":"publisher","first-page":"24824","DOI":"10.52202\/068431-1800","volume":"35","author":"J Wei","year":"2022","unstructured":"Wei, J., et al.: Chain-of-thought prompting elicits reasoning in large language models. Adv. Neural. Inf. Process. Syst. 35, 24824\u201324837 (2022)","journal-title":"Adv. Neural. Inf. Process. Syst."},{"key":"25_CR31","unstructured":"Wu, T., Lan, J., Yuan, W., Jiao, J., Weston, J., Sukhbaatar, S.: Thinking llms: General instruction following with thought generation. arXiv preprint arXiv:2410.10630 (2024)"},{"key":"25_CR32","doi-asserted-by":"crossref","unstructured":"Xia, P., et\u00a0al.: CARES: a comprehensive benchmark of trustworthiness in medical vision language models. In: The Thirty-eight Conference on Neural Information Processing Systems Datasets and Benchmarks Track (2024)","DOI":"10.52202\/079017-4455"},{"key":"25_CR33","unstructured":"Xia, P., et al.: MMed-RAG: versatile multimodal RAG system for medical vision language models. In: The Thirteenth International Conference on Learning Representations (2025)"},{"key":"25_CR34","doi-asserted-by":"crossref","unstructured":"Xia, P., et al.: Rule: reliable multimodal rag for factuality in medical vision language models. In: Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing, pp. 1081\u20131093 (2024)","DOI":"10.18653\/v1\/2024.emnlp-main.62"},{"key":"25_CR35","unstructured":"Zhang, Z., Zhang, A., Li, M., Zhao, H., Karypis, G., Smola, A.: Multimodal chain-of-thought reasoning in language models. arXiv preprint arXiv:2302.00923 (2023)"}],"container-title":["Lecture Notes in Computer Science","Medical Image Computing and Computer Assisted Intervention \u2013 MICCAI 2025"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-032-05185-1_25","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,7,20]],"date-time":"2026-07-20T13:11:01Z","timestamp":1784553061000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-3-032-05185-1_25"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,9,20]]},"ISBN":["9783032051844","9783032051851"],"references-count":35,"URL":"https:\/\/doi.org\/10.1007\/978-3-032-05185-1_25","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,9,20]]},"assertion":[{"value":"20 September 2025","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"The authors declare no competing interests.","order":1,"name":"Ethics","label":"Disclosure of Interests","group":{"name":"EthicsHeading","label":"Ethics"}},{"value":"MICCAI","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"International Conference on Medical Image Computing and Computer-Assisted Intervention","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Daejeon","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Korea (Republic of)","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2025","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"23 September 2025","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"23 September 2025","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"28","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"miccai2025","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/conferences.miccai.org\/2025\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}