{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,2,16]],"date-time":"2026-02-16T12:29:42Z","timestamp":1771244982445,"version":"3.50.1"},"publisher-location":"Singapore","reference-count":27,"publisher":"Springer Nature Singapore","isbn-type":[{"value":"9789819569496","type":"print"},{"value":"9789819569502","type":"electronic"}],"license":[{"start":{"date-parts":[[2026,1,1]],"date-time":"2026-01-01T00:00:00Z","timestamp":1767225600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2026,1,1]],"date-time":"2026-01-01T00:00:00Z","timestamp":1767225600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2026]]},"DOI":"10.1007\/978-981-95-6950-2_26","type":"book-chapter","created":{"date-parts":[[2026,2,16]],"date-time":"2026-02-16T11:58:38Z","timestamp":1771243118000},"page":"364-378","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["M3RAG: Orchestrating Multi-agent Reasoning for\u00a0Multi-hop, Multi-modal Understanding"],"prefix":"10.1007","author":[{"given":"Haizhou","family":"Du","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Wenhao","family":"Li","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2026,2,17]]},"reference":[{"key":"26_CR1","unstructured":"OpenAI: GPT-4 Technical Report. CoRR abs\/2303.08774 (2023)"},{"key":"26_CR2","unstructured":"Neralla, V., de\u00a0Vroe, S.B.: Evaluating Poro-34B-Chat and Mistral-7B-Instruct-v0.1: LLM system description for ELOQUENT at CLEF 2024. In: Faggioli, G., Ferro, N., Galusc\u00e1kov\u00e1, P., de\u00a0Herrera, A.G.S. (eds.) CLEF. vol.\u00a03740, pp. 708\u2013711 (2024)"},{"key":"26_CR3","doi-asserted-by":"crossref","unstructured":"Elhady, A., Agirre, E., Artetxe, M.: Emergent abilities of large language models under continued pre-training for language adaptation. In: Che, W., Nabende, J., Shutova, E., Pilehvar, M.T. (eds.) ACL, pp. 32174\u201332186 (2025)","DOI":"10.18653\/v1\/2025.acl-long.1547"},{"key":"26_CR4","unstructured":"Shi, W., et al.: In-Context pretraining: language modeling beyond document boundaries. In: ICLR (2024)"},{"key":"26_CR5","doi-asserted-by":"crossref","unstructured":"Mallen, A., Asai, A., Zhong, V., Das, R., Khashabi, D., Hajishirzi, H.: When not to trust language models: investigating effectiveness of parametric and non-parametric memories. In: ACL, pp. 9802\u20139822 (2023)","DOI":"10.18653\/v1\/2023.acl-long.546"},{"key":"26_CR6","doi-asserted-by":"crossref","unstructured":"Yang, D., et al.: IM-RAG: multi-round retrieval-augmented generation through learning inner monologues. In: SIGIR, pp. 730\u2013740 (2024)","DOI":"10.1145\/3626772.3657760"},{"key":"26_CR7","doi-asserted-by":"crossref","unstructured":"Chang, C., et al.: MAIN-RAG: multi-agent filtering retrieval-augmented generation. In: ACL, pp. 2607\u20132622 (2025)","DOI":"10.18653\/v1\/2025.acl-long.131"},{"key":"26_CR8","doi-asserted-by":"crossref","unstructured":"Cheng, R., et al.: DualRAG: a dual-process approach to integrate reasoning and retrieval for multi-hop question answering. In: ACL, pp. 31877\u201331899 (2025)","DOI":"10.18653\/v1\/2025.acl-long.1539"},{"key":"26_CR9","doi-asserted-by":"crossref","unstructured":"Tanaka, R., Iki, T., Hasegawa, T., Nishida, K., Saito, K., Suzuki, J.: VDocRAG: retrieval-augmented generation over visually-rich documents. In: CVPR, pp. 24827\u201324837 (2025)","DOI":"10.1109\/CVPR52734.2025.02312"},{"key":"26_CR10","doi-asserted-by":"crossref","unstructured":"Shi, Z., et al.: Generate-then-ground in retrieval-augmented generation for multi-hop question answering. In: ACL, pp. 7339\u20137353 (2024)","DOI":"10.18653\/v1\/2024.acl-long.397"},{"key":"26_CR11","doi-asserted-by":"crossref","unstructured":"Maekawa, S., Iso, H., Gurajada, S., Bhutani, N.: Retrieval helps or hurts? a deeper dive into the efficacy of retrieval augmentation to language models. In: NAACL, pp. 5506\u20135521 (2024)","DOI":"10.18653\/v1\/2024.naacl-long.308"},{"key":"26_CR12","doi-asserted-by":"crossref","unstructured":"Ma, X., Lin, S., Li, M., Chen, W., Lin, J.: Unifying multimodal retrieval via document screenshot embedding. In: EMNLP, pp. 6492\u20136505 (2024)","DOI":"10.18653\/v1\/2024.emnlp-main.373"},{"key":"26_CR13","unstructured":"Yu, S., et al.: VisRAG: vision-based retrieval-augmented generation on multi-modality documents. In: ICLR (2025)"},{"key":"26_CR14","unstructured":"Faysse, M., et al.: Colpali: efficient document retrieval with vision language models. In: ICLR (2025)"},{"key":"26_CR15","doi-asserted-by":"crossref","unstructured":"Wang, Q., et al.: ViDoRAG: visual document retrieval-augmented generation via dynamic iterative reasoning agents. CoRR (2025)","DOI":"10.18653\/v1\/2025.emnlp-main.464"},{"key":"26_CR16","unstructured":"Cho, J., Mahata, D., Irsoy, O., He, Y., Bansal, M.: M3DocRAG: multi-modal retrieval is what you need for multi-page multi-document understanding. CoRR (2024)"},{"key":"26_CR17","doi-asserted-by":"crossref","unstructured":"Ma, X., Zhuang, S., Koopman, B., Zuccon, G., Chen, W., Lin, J.: VISA: retrieval augmented generation with visual source attribution. In: Che, W., Nabende, J., Shutova, E., Pilehvar, M.T. (eds.) ACL, pp. 30154\u201330169 (2025)","DOI":"10.18653\/v1\/2025.acl-long.1456"},{"key":"26_CR18","doi-asserted-by":"crossref","unstructured":"Peign\u00e9, P., et al.: Multi-Agent security tax: trading off security and collaboration capabilities in multi-agent systems. In: AAAI-25, pp. 27573\u201327581 (2025)","DOI":"10.1609\/aaai.v39i26.34970"},{"key":"26_CR19","unstructured":"Liu, Y., Cao, J., Li, Z., He, R., Tan, T.: Breaking mental set to improve reasoning through diverse multi-agent debate. In: ICLR (2025)"},{"key":"26_CR20","unstructured":"Nguyen, T., Chin, P., Tai, Y.: MA-RAG: multi-agent retrieval-augmented generation via collaborative chain-of-thought reasoning. CoRR abs\/2505.20096 (2025)"},{"key":"26_CR21","doi-asserted-by":"crossref","unstructured":"Wang, Z., Teo, S.X., Ouyang, J., Xu, Y., Shi, W.: M-RAG: reinforcing large language model performance through retrieval-augmented generation with multiple partitions. In: Ku, L., Martins, A., Srikumar, V. (eds.) ACL, pp. 1966\u20131978 (2024)","DOI":"10.18653\/v1\/2024.acl-long.108"},{"key":"26_CR22","doi-asserted-by":"crossref","unstructured":"Zhu, J., Yan, L., Shi, H., Yin, D., Sha, L.: ATM: adversarial tuning multi-agent system makes a robust retrieval-augmented generator. In: EMNLP, pp. 10902\u201310919 (2024)","DOI":"10.18653\/v1\/2024.emnlp-main.610"},{"key":"26_CR23","doi-asserted-by":"crossref","unstructured":"Zhang, N., et al.: SiReRAG: indexing similar and related information for multihop reasoning. In: ICLR (2025)","DOI":"10.32388\/93O2S3"},{"key":"26_CR24","unstructured":"Li, A., Xie, Y., Li, S., Tsung, F., Ding, B., Li, Y.: Agent-oriented planning in multi-agent systems. In: ICLR (2025)"},{"key":"26_CR25","unstructured":"Liu, Z., et al.: Benchmarking retrieval-augmented generation in multi-modal contexts. CoRR abs\/2502.17297 (2025)"},{"key":"26_CR26","unstructured":"Bai, S., et al.: Qwen2.5-VL technical report. CoRR abs\/2502.13923 (2025)"},{"key":"26_CR27","unstructured":"Qi, J., et al.: RoRA-VLM: robust retrieval-augmented vision language models. CoRR (2024)"}],"container-title":["Lecture Notes in Computer Science","MultiMedia Modeling"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-981-95-6950-2_26","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,2,16]],"date-time":"2026-02-16T11:58:43Z","timestamp":1771243123000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-981-95-6950-2_26"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026]]},"ISBN":["9789819569496","9789819569502"],"references-count":27,"URL":"https:\/\/doi.org\/10.1007\/978-981-95-6950-2_26","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026]]},"assertion":[{"value":"17 February 2026","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"MMM","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"International Conference on Multimedia Modeling","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Prague","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Czech Republic","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2026","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"29 January 2026","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"31 January 2026","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"32","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"mmm2026","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/mmm2026.cz\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}