{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,11]],"date-time":"2026-07-11T16:11:47Z","timestamp":1783786307279,"version":"3.55.0"},"publisher-location":"Singapore","reference-count":35,"publisher":"Springer Nature Singapore","isbn-type":[{"value":"9789819228553","type":"print"},{"value":"9789819228560","type":"electronic"}],"license":[{"start":{"date-parts":[[2026,7,12]],"date-time":"2026-07-12T00:00:00Z","timestamp":1783814400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2026,7,12]],"date-time":"2026-07-12T00:00:00Z","timestamp":1783814400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2027]]},"DOI":"10.1007\/978-981-92-2856-0_43","type":"book-chapter","created":{"date-parts":[[2026,7,11]],"date-time":"2026-07-11T15:15:25Z","timestamp":1783782925000},"page":"605-616","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["VC-MARAG: Visual-Context Augmented Retrieval and\u00a0Multi-agent Collaborative Generation for\u00a0VQA"],"prefix":"10.1007","author":[{"given":"Yijie","family":"Chen","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jiahao","family":"Chen","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Guannan","family":"Liu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Dongqing","family":"Li","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Shubin","family":"Cai","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zhong","family":"Ming","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2026,7,12]]},"reference":[{"key":"43_CR1","unstructured":"Radford, A.: Learning transferable visual models from natural language supervision. In: 38th ICML, vol. 139, pp. 8748\u20138763 (2021)"},{"key":"43_CR2","doi-asserted-by":"crossref","unstructured":"Khattab, O., Zaharia, M.: ColBERT: efficient and effective passage search via contextualized late interaction over BERT. In: 43rd ACM SIGIR, pp. 39\u201348 (2020)","DOI":"10.1145\/3397271.3401075"},{"key":"43_CR3","doi-asserted-by":"crossref","unstructured":"Lin, W., et al.: Fine-grained late-interaction multi-modal retrieval for retrieval augmented visual question answering. In: Advances in Neural Information Processing Systems, vol. 36, pp. 14389\u201314406. Curran Associates, Inc. (2023)","DOI":"10.52202\/075280-0990"},{"key":"43_CR4","doi-asserted-by":"crossref","unstructured":"Lin, W., et al.: PreFLMR: scaling up fine-grained late-interaction multi-modal retrievers. In: 62nd Annual Meeting of the Association for Computational Linguistics, vol. 1: Long Papers, pp. 5294\u20135316. Association for Computational Linguistics (2024)","DOI":"10.18653\/v1\/2024.acl-long.289"},{"key":"43_CR5","doi-asserted-by":"crossref","unstructured":"Gao, Y., Iqbal, S., et al.: Performance and power analysis of high-density multi-GPGPU architectures: a preliminary case study. In: IEEE 17th HPCC (2015)","DOI":"10.1109\/HPCC-CSS-ICESS.2015.68"},{"key":"43_CR6","doi-asserted-by":"publisher","first-page":"766","DOI":"10.1016\/j.future.2015.05.005","volume":"56","author":"H Zhao","year":"2016","unstructured":"Zhao, H., Chen, M., et al.: A novel pre-cache schema for high performance Android system. Futur. Gener. Comput. Syst. 56, 766\u2013772 (2016)","journal-title":"Futur. Gener. Comput. Syst."},{"issue":"4","key":"43_CR7","first-page":"443","volume":"68","author":"M Qiu","year":"2008","unstructured":"Qiu, M., Sha, E., et al.: minimization with loop fusion and multi-functional-unit scheduling for multidimensional DSP. JPDC 68(4), 443\u2013455 (2008)","journal-title":"JPDC"},{"key":"43_CR8","doi-asserted-by":"crossref","unstructured":"Gai, K., Du, Z., et al.: Efficiency-aware workload optimizations of heterogeneous cloud computing for capacity planning in financial industry. In: IEEE 2nd CSCloud (2015)","DOI":"10.1109\/CSCloud.2015.73"},{"key":"43_CR9","doi-asserted-by":"crossref","unstructured":"Gai, K., Qiu, M., Thuraisingham, B., Tao, L.: Proactive attribute-based secure data schema for mobile cloud in financial industry. In: IEEE 17th HPCC (2015)","DOI":"10.1109\/HPCC-CSS-ICESS.2015.250"},{"issue":"16","key":"43_CR10","doi-asserted-by":"publisher","first-page":"12610","DOI":"10.1109\/JIOT.2020.3014970","volume":"8","author":"L Chen","year":"2020","unstructured":"Chen, L., Xu, Y., et al.: IoT microservice deployment in edge-cloud hybrid environment using reinforcement learning. IEEE Internet of Things J. 8(16), 12610\u201312622 (2020)","journal-title":"IEEE Internet of Things J."},{"issue":"3","key":"43_CR11","first-page":"2124","volume":"17","author":"H Qiu","year":"2020","unstructured":"Qiu, H., Zheng, Q., et al.: Deep residual learning-based enhanced JPEG compression in the Internet of Things. IEEE TII 17(3), 2124\u20132133 (2020)","journal-title":"IEEE TII"},{"issue":"22","key":"43_CR12","doi-asserted-by":"publisher","first-page":"22123","DOI":"10.1109\/JIOT.2021.3086845","volume":"9","author":"W Liang","year":"2021","unstructured":"Liang, W., Xie, S., et al.: Deep neural network security collaborative filtering scheme for service recommendation in intelligent cyber-physical systems. IEEE Internet Things J. 9(22), 22123\u201322132 (2021)","journal-title":"IEEE Internet Things J."},{"issue":"2","key":"43_CR13","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/3682068","volume":"16","author":"X Liu","year":"2025","unstructured":"Liu, X., Zhue, R., et al.: Differentially private low-rank adaptation of large language model using federated learning. ACM Trans. Manag. Inf. Syst. 16(2), 1\u201324 (2025)","journal-title":"ACM Trans. Manag. Inf. Syst."},{"key":"43_CR14","doi-asserted-by":"crossref","unstructured":"Chen, W., et al.: MuRAG: multimodal retrieval-augmented generator for open question answering over images and text. In: Conference on Empirical Methods in Natural Language Processing, pp. 5558\u20135570. Association for Computational Linguistics (2022)","DOI":"10.18653\/v1\/2022.emnlp-main.375"},{"key":"43_CR15","doi-asserted-by":"crossref","unstructured":"Hu, Z., et al.: REVEAL: retrieval-augmented visual-language pre-training with multi-source multimodal knowledge. In: CVPR, pp. 23369\u201323379 (2023)","DOI":"10.1109\/CVPR52729.2023.02238"},{"key":"43_CR16","doi-asserted-by":"crossref","unstructured":"Marino, K., et al.: OK-VQA: a visual question answering benchmark requiring external knowledge. In: CVPR, pp. 3195\u20133204 (2019)","DOI":"10.1109\/CVPR.2019.00331"},{"key":"43_CR17","doi-asserted-by":"crossref","unstructured":"Chen, Y., et al.: Can pre-trained vision-language models answer visual information-seeking questions? In: Conference on Empirical Methods in Natural Language Processing, pp. 5399\u20135415. Association for Computational Linguistics (2023)","DOI":"10.18653\/v1\/2023.emnlp-main.925"},{"key":"43_CR18","doi-asserted-by":"crossref","unstructured":"Mensink, T., et al.: Encyclopedic VQA: visual questions about detailed properties of fine-grained categories. In: IEEE\/CVF International Conference on Computer Vision (ICCV), pp. 4323\u20134334 (2023)","DOI":"10.1109\/ICCV51070.2023.00289"},{"key":"43_CR19","doi-asserted-by":"crossref","unstructured":"Gui, L., et al.: KAT: a knowledge augmented transformer for vision-and-language. In: Proceedings of the 2022 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, pp. 1210\u20131224. Association for Computational Linguistics (2022)","DOI":"10.18653\/v1\/2022.naacl-main.70"},{"key":"43_CR20","doi-asserted-by":"crossref","unstructured":"Lin, W., et al.: Revive: regional visual representation matters in knowledge-based visual question answering. In: Advances in Neural Information Processing Systems, vol. 35, pp. 26034\u201326046. Curran Associates, Inc. (2022)","DOI":"10.52202\/068431-0767"},{"key":"43_CR21","doi-asserted-by":"publisher","unstructured":"Cai, S., Chen, H., Huang, Y., Ming, Z.: ComPAT: a compiler principles course assistant. In: KSEM 2024. Lecture Notes in Computer Science, vol. 14888, pp. 74\u201383. Springer, Singapore (2024). https:\/\/doi.org\/10.1007\/978-981-97-5489-2_7","DOI":"10.1007\/978-981-97-5489-2_7"},{"key":"43_CR22","doi-asserted-by":"crossref","unstructured":"Yan, Y., Xie, W.: EchoSight: advancing visual-language models with wiki knowledge. arXiv preprint arXiv:2407.12735 (2024)","DOI":"10.18653\/v1\/2024.findings-emnlp.83"},{"key":"43_CR23","doi-asserted-by":"crossref","unstructured":"Yang, W., et al.: OMGM: orchestrate multiple granularities and modalities for efficient multimodal retrieval. In: 63rd Annual Meeting of the Association for Computational Linguistics (ACL) (2025)","DOI":"10.18653\/v1\/2025.acl-long.1198"},{"key":"43_CR24","doi-asserted-by":"crossref","unstructured":"Hu, Z., et al.: AVIS: autonomous visual information seeking with large language model agent. In: Advances in Neural Information Processing Systems, vol. 36, pp. 50409\u201350428. Curran Associates, Inc. (2023)","DOI":"10.52202\/075280-0040"},{"key":"43_CR25","unstructured":"Zhang, T., et al.: mR$$^2$$AG: multimodal retrieval-reflection-augmented generation for knowledge-based VQA. arXiv preprint arXiv:2411.15041 (2024)"},{"key":"43_CR26","doi-asserted-by":"crossref","unstructured":"Cocchi, F., Moratelli, N., Cornia, M., Baraldi, L., Cucchiara, R.: Augmenting multimodal LLMs with self-reflective tokens for knowledge-based visual question answering. In: CVPR (2025)","DOI":"10.1109\/CVPR52734.2025.00859"},{"key":"43_CR27","unstructured":"Zhao, Y., et al.: Hindsight distillation reasoning with knowledge encouragement preference for knowledge-based visual question answering. arXiv preprint arXiv:2511.11132 (2025)"},{"key":"43_CR28","doi-asserted-by":"crossref","unstructured":"Huang, Y., et al.: Distribution-guided extraction for cross-platform educational knowledge graph construction. In: International Joint Conference on Neural Networks (IJCNN) (2025)","DOI":"10.1109\/IJCNN64981.2025.11228621"},{"key":"43_CR29","doi-asserted-by":"crossref","unstructured":"Sur\u00eds, D., Menon, S., Vondrick, C.: ViperGPT: visual inference via python execution for reasoning. In: IEEE\/CVF International Conference on Computer Vision (ICCV), pp. 11823\u201311833 (2023)","DOI":"10.1109\/ICCV51070.2023.01092"},{"key":"43_CR30","doi-asserted-by":"crossref","unstructured":"Shao, Z., et al.: Prompting large language models with answer heuristics for knowledge-based visual question answering. In: CVPR, pp. 15403\u201315413 (2023)","DOI":"10.1109\/CVPR52729.2023.01438"},{"key":"43_CR31","unstructured":"Alayrac, J. B., et al.: Flamingo: a visual language model for few-shot learning. In: Advances in Neural Information Processing Systems, vol. 35, pp. 23616\u201323632. Curran Associates, Inc. (2022)"},{"key":"43_CR32","doi-asserted-by":"crossref","unstructured":"Liu, H., et al.: Visual instruction tuning. In: Advances in Neural Information Processing Systems, vol. 36. Curran Associates, Inc. (2023)","DOI":"10.52202\/075280-1516"},{"issue":"6","key":"43_CR33","first-page":"16045","volume":"67","author":"S Yin","year":"2024","unstructured":"Yin, S., et al.: Woodpecker: hallucination correction for multimodal large language models. Sci. China Inf. Sci. 67(6), 16045 (2024)","journal-title":"Sci. China Inf. Sci."},{"key":"43_CR34","unstructured":"Zhang, Z., et al.: Multimodal chain-of-thought reasoning in language models. arXiv preprint arXiv:2302.00923 (2023)"},{"key":"43_CR35","doi-asserted-by":"crossref","unstructured":"Shao, Z., et al.: Enhancing text-to-SQL with question classification and multi-agent collaboration. In: Findings of the Association for Computational Linguistics: NAACL 2025, pp. 4340\u20134349. Association for Computational Linguistics (2025)","DOI":"10.18653\/v1\/2025.findings-naacl.245"}],"container-title":["Lecture Notes in Computer Science","Knowledge Science, Engineering and Management"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-981-92-2856-0_43","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,7,11]],"date-time":"2026-07-11T15:15:28Z","timestamp":1783782928000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-981-92-2856-0_43"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,7,12]]},"ISBN":["9789819228553","9789819228560"],"references-count":35,"URL":"https:\/\/doi.org\/10.1007\/978-981-92-2856-0_43","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026,7,12]]},"assertion":[{"value":"12 July 2026","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"KSEM","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"International Conference on Knowledge Science, Engineering and Management","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Beijing","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"China","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2026","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"17 July 2026","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"19 July 2026","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"19","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"ksem2026","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/ksem2026.rosc.org.cn\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}