{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,12,19]],"date-time":"2025-12-19T01:09:16Z","timestamp":1766106556807,"version":"3.48.0"},"reference-count":58,"publisher":"Springer Science and Business Media LLC","issue":"17","license":[{"start":{"date-parts":[[2025,11,1]],"date-time":"2025-11-01T00:00:00Z","timestamp":1761955200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2025,11,1]],"date-time":"2025-11-01T00:00:00Z","timestamp":1761955200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"funder":[{"name":"Shandong Province Science and Technology Small and Medium-sized Enterprise Innovation Capacity Enhancement Project","award":["2023TSGCO212"],"award-info":[{"award-number":["2023TSGCO212"]}]},{"DOI":"10.13039\/501100007129","name":"Natural Science Foundation of Shandong Province","doi-asserted-by":"publisher","award":["ZR2023MG069"],"award-info":[{"award-number":["ZR2023MG069"]}],"id":[{"id":"10.13039\/501100007129","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Appl Intell"],"published-print":{"date-parts":[[2025,11]]},"DOI":"10.1007\/s10489-025-06992-3","type":"journal-article","created":{"date-parts":[[2025,11,17]],"date-time":"2025-11-17T08:54:09Z","timestamp":1763369649000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["A multimodal fusion and symmetric dual-encoder based generation method for KB-VQA"],"prefix":"10.1007","volume":"55","author":[{"given":"Hongyan","family":"Zheng","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-2220-930X","authenticated-orcid":false,"given":"Tao","family":"Sun","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Hao","family":"Liu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zhiping","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zhi","family":"Yang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xiaoyu","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Gengchen","family":"Liu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2025,11,17]]},"reference":[{"key":"6992_CR1","doi-asserted-by":"crossref","unstructured":"Agrawal A, Lu J, Antol S, Mitchell M, Zitnick CL, Batra D, Parikh D (2016) VQA: visual question answering. arXiv:1505.00468","DOI":"10.1007\/s11263-016-0966-6"},{"key":"6992_CR2","doi-asserted-by":"crossref","unstructured":"Marino K, Rastegari M, Farhadi A, Mottaghi R (2019) OK-VQA: a visual question answering benchmark requiring external knowledge. arXiv:1906.00067","DOI":"10.1109\/CVPR.2019.00331"},{"key":"6992_CR3","doi-asserted-by":"crossref","unstructured":"Speer R, Chin J, Havasi C (2018) ConceptNet 5.5: an open multilingual graph of general knowledge. arXiv:1612.03975","DOI":"10.1609\/aaai.v31i1.11164"},{"key":"6992_CR4","doi-asserted-by":"crossref","unstructured":"Ding Y, Yu J, Liu B, Hu Y, Cui M, Wu Q (2022) MuKEA: multimodal knowledge extraction and accumulation for knowledge-based visual question answering. arXiv:2203.09138","DOI":"10.1109\/CVPR52688.2022.00503"},{"key":"6992_CR5","doi-asserted-by":"crossref","unstructured":"Gao F, Ping Q, Thattai G, Reganti A, Wu YN, Natarajan P (2022) Transform-retrieve-generate: natural language-centric outside-knowledge visual question answering. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 5067\u20135077","DOI":"10.1109\/CVPR52688.2022.00501"},{"key":"6992_CR6","doi-asserted-by":"crossref","unstructured":"Gui L, Wang B, Huang Q, Hauptmann A, Bisk Y, Gao J (2022) KAT: a knowledge augmented transformer for vision-and-language. arXiv:2112.08614","DOI":"10.18653\/v1\/2022.naacl-main.70"},{"key":"6992_CR7","doi-asserted-by":"publisher","unstructured":"You J, Yang Z, Li Q, Liu W (2023) A retriever-reader framework with visual entity linking for knowledge-based visual question answering. In: 2023 IEEE International Conference on Multimedia and Expo (ICME), pp 13\u201318. https:\/\/doi.org\/10.1109\/ICME55011.2023.00011","DOI":"10.1109\/ICME55011.2023.00011"},{"key":"6992_CR8","doi-asserted-by":"crossref","unstructured":"Si Q, Mo Y, Lin Z, Ji H, Wang W (2023) Combo of thinking and observing for outside-knowledge VQA. arXiv:2305.06407","DOI":"10.18653\/v1\/2023.acl-long.614"},{"key":"6992_CR9","doi-asserted-by":"crossref","unstructured":"Salemi A, Pizzorno JA, Zamani H (2023) A symmetric dual encoding dense retrieval framework for knowledge-intensive visual question answering. arXiv:2304.13649","DOI":"10.1145\/3539618.3591629"},{"issue":"3","key":"6992_CR10","doi-asserted-by":"publisher","first-page":"759","DOI":"10.28991\/HIJ-2024-05-03-015","volume":"5","author":"A Qatawneh","year":"2024","unstructured":"Qatawneh A, Lutfi A, Al Barrak T (2024) Effect of artificial intelligence (ai) on financial decision-making: mediating role of financial technologies (fin-tech). HighTech Innov J 5(3):759\u2013773","journal-title":"HighTech Innov J"},{"key":"6992_CR11","doi-asserted-by":"crossref","unstructured":"Tan H, Bansal M (2019) LXMERT: learning cross-modality encoder representations from transformers. arXiv:1908.07490","DOI":"10.18653\/v1\/D19-1514"},{"key":"6992_CR12","doi-asserted-by":"publisher","unstructured":"Gard\u00e8res F, Ziaeefard M, Abeloos B, Lecue F (2020) Conceptbert: concept-aware representation for visual question answering. In: Findings of the Association for Computational Linguistics: EMNLP 2020, pp 489\u2013498. https:\/\/doi.org\/10.18653\/v1\/2020.findings-emnlp.44","DOI":"10.18653\/v1\/2020.findings-emnlp.44"},{"key":"6992_CR13","doi-asserted-by":"crossref","unstructured":"Marino K, Chen X, Parikh D, Gupta A, Rohrbach M (2020) KRISP: integrating implicit and symbolic knowledge for open-domain knowledge-based VQA. arXiv:2012.11014","DOI":"10.1109\/CVPR46437.2021.01389"},{"key":"6992_CR14","doi-asserted-by":"crossref","unstructured":"Chen Z, Huang Y, Chen J, Geng Y, Fang Y, Pan J, Zhang N, Zhang W (2022) LaKo: knowledge-driven visual question answering via late knowledge-to-text injection. arXiv:2207.12888","DOI":"10.1145\/3579051.3579053"},{"key":"6992_CR15","doi-asserted-by":"publisher","unstructured":"Gao F, Ping Q, Thattai G, Reganti A, Wu YN, Natarajan P (2022) Transform-retrieve-generate: natural language-centric outside-knowledge visual question answering. In: 2022 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp 5057\u20135067. https:\/\/doi.org\/10.1109\/CVPR52688.2022.00501","DOI":"10.1109\/CVPR52688.2022.00501"},{"key":"6992_CR16","unstructured":"Brown TB, Mann B, Ryder N, Subbiah M, Kaplan J et al (2020) Language models are few-shot learners. arXiv:2005.14165"},{"issue":"10","key":"6992_CR17","doi-asserted-by":"publisher","first-page":"78","DOI":"10.1145\/2629489","volume":"57","author":"D Vrande\u010di\u0107","year":"2014","unstructured":"Vrande\u010di\u0107 D, Kr\u00f6tzsch M (2014) Wikidata: a free collaborative knowledgebase. Commun ACM 57(10):78\u201385. https:\/\/doi.org\/10.1145\/2629489","journal-title":"Commun ACM"},{"key":"6992_CR18","unstructured":"Lin Y, Xie Y, Chen D, Xu Y, Zhu C, Yuan L (2022) REVIVE: regional visual representation matters in knowledge-based visual question answering. arXiv:2206.01201"},{"key":"6992_CR19","doi-asserted-by":"crossref","unstructured":"Yang Z, Gan Z, Wang J, Hu X, Lu Y, Liu Z, Wang L (2022) An empirical study of GPT-3 for few-shot knowledge-based VQA. arXiv:2109.05014","DOI":"10.1609\/aaai.v36i3.20215"},{"key":"6992_CR20","unstructured":"Yu Z, Ouyang X, Shao Z, Wang M, Yu J (2023) Prophet: prompting large language models with complementary answer heuristics for knowledge-based visual question answering. arXiv:2303.01903"},{"issue":"2","key":"6992_CR21","doi-asserted-by":"publisher","first-page":"675","DOI":"10.28991\/ESJ-2024-08-02-019","volume":"8","author":"QZ Lim","year":"2024","unstructured":"Lim QZ, Lee CP, Lim KM, Ng JX, Ooi EH, Loh NKN (2024) Multilingual question answering for Malaysia history with transformer-based language model. Emerg Sci J 8(2):675\u2013686","journal-title":"Emerg Sci J"},{"key":"6992_CR22","unstructured":"Alayrac J-B, Donahue J, Luc P, Miech A, Barr I et al (2022) Flamingo: a visual language model for few-shot learning. arXiv:2204.14198"},{"key":"6992_CR23","unstructured":"Li J, Li D, Savarese S, Hoi S (2023) BLIP-2: bootstrapping language-image pre-training with frozen image encoders and large language models. arXiv:2301.12597"},{"key":"6992_CR24","unstructured":"Dai W, Li J, Li D, Tiong AMH, Zhao J, Wang W, Li B, Fung P, Hoi S (2023) InstructBLIP: towards general-purpose vision-language models with instruction tuning. arXiv:2305.06500"},{"key":"6992_CR25","unstructured":"Liu H, Li C, Wu Q, Lee YJ (2023) Visual instruction tuning. arXiv:2304.08485"},{"key":"6992_CR26","unstructured":"Zhu D, Chen J, Shen X, Li X, Elhoseiny M (2023) MiniGPT-4: enhancing vision-language understanding with advanced large language models. arXiv:2304.10592"},{"key":"6992_CR27","unstructured":"Chen X, Wang X, Changpinyo S, Piergiovanni A, Padlewski P, Salz D et al (2023) PaLI: a jointly-scaled multilingual language-image model. arXiv:2209.06794"},{"key":"6992_CR28","unstructured":"Chen X, Djolonga J, Padlewski P, Mustafa B, Changpinyo S, Wu J et al (2023) PaLI-X: on scaling up a multilingual vision and language model. arXiv:2305.18565"},{"key":"6992_CR29","unstructured":"Driess D, Xia F, Sajjadi MSM, Lynch C, Chowdhery A, Ichter B, Wahid A, Tompson J et al (2023) PaLM-E: an embodied multimodal language model. arXiv:2303.03378"},{"key":"6992_CR30","doi-asserted-by":"crossref","unstructured":"Li LH, Zhang P, Zhang H, Yang J, Li C, Zhong Y, Wang L et al (2022) Grounded Language-Image Pre-training. arXiv:2112.03857","DOI":"10.1109\/CVPR52688.2022.01069"},{"key":"6992_CR31","doi-asserted-by":"crossref","unstructured":"Zhang P, Li X, Hu X, Yang J, Zhang L, Wang L, Choi Y, Gao J (2021) VinVL: revisiting visual representations in vision-language models. arXiv:2101.00529","DOI":"10.1109\/CVPR46437.2021.00553"},{"key":"6992_CR32","unstructured":"Wang P, Yang A, Men R, Lin J, Bai S, Li Z, Ma J, Zhou C, Zhou J, Yang H (2022) OFA: unifying architectures, tasks, and modalities through a simple sequence-to-sequence learning framework. arXiv:2202.03052"},{"key":"6992_CR33","unstructured":"Radford A, Kim JW, Hallacy C, Ramesh A, Goh G, Agarwal S, Sastry G et al (2021) Learning transferable visual models from natural language supervision. arXiv:2103.00020"},{"issue":"3","key":"6992_CR34","doi-asserted-by":"publisher","first-page":"535","DOI":"10.1109\/TBDATA.2019.2921572","volume":"7","author":"J Johnson","year":"2019","unstructured":"Johnson J, Douze M, J\u00e9gou H (2019) Billion-scale similarity search with gpus. IEEE Trans Big Data 7(3):535\u2013547","journal-title":"IEEE Trans Big Data"},{"key":"6992_CR35","unstructured":"Raffel C, Shazeer N, Roberts A, Lee K, Narang S, Matena M, Zhou Y, Li W, Liu PJ (2023) Exploring the limits of transfer learning with a unified text-to-text transformer. arXiv:1910.10683"},{"issue":"1","key":"6992_CR36","doi-asserted-by":"publisher","first-page":"270","DOI":"10.28991\/ESJ-2024-08-01-019","volume":"8","author":"V Costa","year":"2024","unstructured":"Costa V, Coelho P, Castelli M (2024) Artificial intelligence for impact assessment of administrative burdens. Emerg Sci J 8(1):270\u2013282","journal-title":"Emerg Sci J"},{"key":"6992_CR37","unstructured":"Wang P, Wu Q, Shen C, Dick A, Hengel AVD (2016) Fvqa: fact-based visual question answering. IEEE Trans Pattern Anal Mach Intell (99):1\u20131"},{"key":"6992_CR38","unstructured":"Loshchilov I, Hutter F (2019) Decoupled weight decay regularization. arXiv:1711.05101"},{"key":"6992_CR39","doi-asserted-by":"crossref","unstructured":"Lee K, Chang M-W, Toutanova K (2019) Latent retrieval for weakly supervised open domain question answering. arXiv:1906.00300","DOI":"10.18653\/v1\/P19-1612"},{"key":"6992_CR40","doi-asserted-by":"publisher","unstructured":"Li G, Wang X, Zhu W (2020) Boosting visual question answering with context-aware knowledge aggregation. In: Proceedings of the 28th ACM international conference on multimedia, pp 1227\u20131235. https:\/\/doi.org\/10.1145\/3394171.3413943","DOI":"10.1145\/3394171.3413943"},{"key":"6992_CR41","doi-asserted-by":"crossref","unstructured":"Luo M, Zeng Y, Banerjee P, Baral C (2021) Weakly-supervised visual-retriever-reader for knowledge-based question answering. arXiv:2109.04014","DOI":"10.18653\/v1\/2021.emnlp-main.517"},{"key":"6992_CR42","unstructured":"Lewis P, Perez E, Piktus A, Petroni F, Karpukhin V, Goyal N, K\u00fcttler H, Lewis M, Yih W-t, Rockt\u00e4schel T, Riedel S, Kiela D (2021) Retrieval-augmented generation for knowledge-intensive NLP tasks. arXiv:2005.11401"},{"key":"6992_CR43","doi-asserted-by":"crossref","unstructured":"Lin W, Byrne B (2022) Retrieval augmented visual question answering with outside knowledge. arXiv:2210.03809","DOI":"10.18653\/v1\/2022.emnlp-main.772"},{"key":"6992_CR44","doi-asserted-by":"crossref","unstructured":"Hu Z, Iscen A, Sun C, Wang Z, Chang K-W, Sun Y, Schmid C, Ross DA, Fathi A (2023) REVEAL: retrieval-augmented visual-language pre-training with multi-source multimodal knowledge memory. arXiv:2212.05221","DOI":"10.1109\/CVPR52729.2023.02238"},{"key":"6992_CR45","doi-asserted-by":"crossref","unstructured":"Hu Y, Hua H, Yang Z, Shi W, Smith NA, Luo J (2023) PromptCap: prompt-guided task-aware image captioning. arXiv:2211.09699","DOI":"10.1109\/ICCV51070.2023.00277"},{"key":"6992_CR46","doi-asserted-by":"crossref","unstructured":"Fu X, Zhang S, Kwon G, Perera P, Zhu H, Zhang Y, Li AH, Wang WY, Wang Z, Castelli V, Ng P, Roth D, Xiang B (2023) Generate then select: open-ended visual question answering guided by world knowledge. arXiv:2305.18842","DOI":"10.18653\/v1\/2023.findings-acl.147"},{"key":"6992_CR47","unstructured":"Lu J, Yang J, Batra D, Parikh D (2016) Hierarchical question-image co-attention for visual question answering. Advances in neural information processing systems, vol 29"},{"key":"6992_CR48","doi-asserted-by":"crossref","unstructured":"Guo Y, Nie L, Wong Y, Liu Y, Cheng Z, Kankanhalli M (2022) A unified end-to-end retriever-reader framework for knowledge-based VQA. In: Proceedings of the 30th ACM international conference on multimedia, pp 2061\u20132069","DOI":"10.1145\/3503161.3547870"},{"key":"6992_CR49","doi-asserted-by":"crossref","unstructured":"Chen Z, Chen J, Geng Y, Pan JZ, Yuan Z, Chen H (2021) Zero-shot visual question answering using knowledge graph. In: The semantic web\u2013ISWC 2021: 20th International Semantic Web Conference, ISWC 2021, Virtual Event, October 24\u201328, 2021, Proceedings 20, pp 146\u2013162. Springer","DOI":"10.1007\/978-3-030-88361-4_9"},{"key":"6992_CR50","doi-asserted-by":"crossref","unstructured":"Khademi M, Yang Z, Frujeri F, Zhu C (2023) Mm-reasoner: a multi-modal knowledge-aware framework for knowledge-based visual question answering. In: Findings of the association for computational linguistics: EMNLP 2023, pp 6571\u20136581","DOI":"10.18653\/v1\/2023.findings-emnlp.437"},{"key":"6992_CR51","doi-asserted-by":"crossref","unstructured":"Narasimhan M, Schwing AG (2018) Straight to the facts: learning knowledge base retrieval for factual visual question answering. In: Proceedings of the European conference on Computer Vision (ECCV), pp 451\u2013468","DOI":"10.1007\/978-3-030-01237-3_28"},{"key":"6992_CR52","doi-asserted-by":"crossref","unstructured":"Li H, Wang P, Shen C, Hengel Avd (2019) Visual question answering as reading comprehension. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 6319\u20136328","DOI":"10.1109\/CVPR.2019.00648"},{"key":"6992_CR53","unstructured":"Narasimhan M, Lazebnik S, Schwing A (2018) Out of the box: Reasoning with graph convolution nets for factual visual question answering. Advances in neural information processing systems, vol 31"},{"key":"6992_CR54","doi-asserted-by":"crossref","unstructured":"Zhu Z, Yu J, Wang Y, Sun Y, Hu Y, Wu Q (2020) Mucko: multi-layer cross-modal knowledge reasoning for fact-based visual question answering. arXiv:2006.09073","DOI":"10.24963\/ijcai.2020\/153"},{"key":"6992_CR55","doi-asserted-by":"publisher","DOI":"10.1016\/j.patcog.2020.107563","volume":"108","author":"J Yu","year":"2020","unstructured":"Yu J, Zhu Z, Wang Y, Zhang W, Hu Y, Tan J (2020) Cross-modal knowledge reasoning for knowledge-based visual question answering. Pattern Recogn 108:107563","journal-title":"Pattern Recogn"},{"key":"6992_CR56","doi-asserted-by":"crossref","unstructured":"Li Y, Yu J, Gai K, Xiong G (2024) Iiu: independent inference units for knowledge-based visual question answering. In: International conference on knowledge science, engineering and management, pp 109\u2013120. Springer","DOI":"10.1007\/978-981-97-5501-1_9"},{"key":"6992_CR57","doi-asserted-by":"publisher","unstructured":"Hudson DA, Manning CD (2019) Gqa: a new dataset for real-world visual reasoning and compositional question answering. In: 2019 IEEE\/CVF conference on Computer Vision and Pattern Recognition (CVPR), pp 6693\u20136702. https:\/\/doi.org\/10.1109\/CVPR.2019.00686","DOI":"10.1109\/CVPR.2019.00686"},{"key":"6992_CR58","doi-asserted-by":"publisher","unstructured":"Schwenk D, Khandelwal A, Clark C, Marino K, Mottaghi R (2022) A-okvqa: a benchmark for visual question answering using world knowledge. In: European conference on computer vision, pp 146\u2013162. https:\/\/doi.org\/10.1007\/978-3-031-20074-8_9","DOI":"10.1007\/978-3-031-20074-8_9"}],"container-title":["Applied Intelligence"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10489-025-06992-3.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s10489-025-06992-3","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10489-025-06992-3.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,12,19]],"date-time":"2025-12-19T01:05:20Z","timestamp":1766106320000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s10489-025-06992-3"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,11]]},"references-count":58,"journal-issue":{"issue":"17","published-print":{"date-parts":[[2025,11]]}},"alternative-id":["6992"],"URL":"https:\/\/doi.org\/10.1007\/s10489-025-06992-3","relation":{},"ISSN":["0924-669X","1573-7497"],"issn-type":[{"type":"print","value":"0924-669X"},{"type":"electronic","value":"1573-7497"}],"subject":[],"published":{"date-parts":[[2025,11]]},"assertion":[{"value":"17 July 2024","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"5 November 2025","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"17 November 2025","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors declare that they have no known competing financial interests or personal relationships that could have appeared to influence the work reported in this paper.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Competing Interests"}},{"value":"All the data used in this paper are available and thus, we do not handle private information.","order":3,"name":"Ethics","group":{"name":"EthicsHeading","label":"Ethical and Informed Consent for Data Used"}}],"article-number":"1098"}}