{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,8,22]],"date-time":"2026-08-22T09:25:52Z","timestamp":1787390752992,"version":"build-2736575974"},"reference-count":52,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62276073"],"award-info":[{"award-number":["62276073"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100004607","name":"Natural Science Foundation of Guangxi Province","doi-asserted-by":"publisher","award":["2026GXNSFAA00641057"],"award-info":[{"award-number":["2026GXNSFAA00641057"]}],"id":[{"id":"10.13039\/501100004607","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Neurocomputing"],"published-print":{"date-parts":[[2026,9]]},"DOI":"10.1016\/j.neucom.2026.134002","type":"journal-article","created":{"date-parts":[[2026,5,17]],"date-time":"2026-05-17T14:46:13Z","timestamp":1779029173000},"page":"134002","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"C","title":["CMGR: Cross-modal graph routing for knowledge-based visual question answering"],"prefix":"10.1016","volume":"695","author":[{"given":"Wei","family":"Li","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-5313-6134","authenticated-orcid":false,"given":"Zhixin","family":"Li","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.neucom.2026.134002_bib0005","series-title":"Proceedings of the IEEE International Conference on Computer Vision","first-page":"2425","article-title":"VQA: visual question answering","author":"Antol","year":"2015"},{"issue":"8","key":"10.1016\/j.neucom.2026.134002_bib0010","doi-asserted-by":"crossref","first-page":"5575","DOI":"10.1109\/TPAMI.2024.3366154","article-title":"Robust visual question answering: datasets, methods, and future challenges","volume":"46","author":"Ma","year":"2024","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.neucom.2026.134002_bib0015","doi-asserted-by":"crossref","DOI":"10.1016\/j.neucom.2025.129345","article-title":"VQA and visual reasoning: an overview of approaches, datasets, and future direction","volume":"622","author":"Zakari","year":"2025","journal-title":"Neurocomputing"},{"issue":"3","key":"10.1016\/j.neucom.2026.134002_bib0020","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1145\/3724125","article-title":"A multi-hop graph reasoning network for knowledge-based VQA","volume":"16","author":"Hu","year":"2025","journal-title":"ACM Trans. Intell. Syst. Technol."},{"key":"10.1016\/j.neucom.2026.134002_bib0025","series-title":"Proceedings of the 47th International ACM SIGIR Conference on Research and Development in Information Retrieval","first-page":"1984","article-title":"Let me show you step by step: an interpretable graph routing network for knowledge-based visual question answering","author":"Wang","year":"2024"},{"key":"10.1016\/j.neucom.2026.134002_bib0030","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"14111","article-title":"Krisp: integrating implicit and symbolic knowledge for open-domain knowledge-based VQA","author":"Marino","year":"2021"},{"key":"10.1016\/j.neucom.2026.134002_bib0035","doi-asserted-by":"crossref","DOI":"10.1016\/j.neucom.2025.129373","article-title":"Enhancing few-shot KB-VQA with panoramic image captions guided by large language models","volume":"623","author":"Qiang","year":"2025","journal-title":"Neurocomputing"},{"key":"10.1016\/j.neucom.2026.134002_bib0040","series-title":"Proceedings of the AAAI Conference on Artificial Intelligence","first-page":"4444","article-title":"ConceptNet 5.5: an open multilingual graph of general knowledge","author":"Speer","year":"2017"},{"key":"10.1016\/j.neucom.2026.134002_bib0045","series-title":"Proceedings of the 55th Annual Meeting of the Association for Computational Linguistics","first-page":"115","article-title":"WebChild 2.0: fine-grained commonsense knowledge distillation","author":"Tandon","year":"2017"},{"issue":"7","key":"10.1016\/j.neucom.2026.134002_bib0050","doi-asserted-by":"crossref","first-page":"2758","DOI":"10.1109\/TNNLS.2020.3045034","article-title":"Knowledge-routed visual question reasoning: challenges for deep representation embedding","volume":"33","author":"Cao","year":"2022","journal-title":"IEEE Trans. Neural Netw. Learn. Syst."},{"key":"10.1016\/j.neucom.2026.134002_bib0055","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"5089","article-title":"MuKEA: multimodal knowledge extraction and accumulation for knowledge-based visual question answering","author":"Ding","year":"2022"},{"key":"10.1016\/j.neucom.2026.134002_bib0060","series-title":"Proceedings of the 29th International Conference on International Joint Conferences on Artificial Intelligence","first-page":"1097","article-title":"Mucko: multi-layer cross-modal knowledge reasoning for fact-based visual question answering","author":"Zhu","year":"2020"},{"key":"10.1016\/j.neucom.2026.134002_bib0065","doi-asserted-by":"crossref","DOI":"10.1016\/j.eswa.2025.129504","article-title":"Bias mitigation label and aware context for debiased visual question answering","volume":"297","author":"Cao","year":"2026","journal-title":"Expert Syst. Appl."},{"key":"10.1016\/j.neucom.2026.134002_bib0070","series-title":"Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing","first-page":"5100","article-title":"LXMERT: learning cross-modality encoder representations from transformers","author":"Tan","year":"2019"},{"key":"10.1016\/j.neucom.2026.134002_bib0075","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"26296","article-title":"Improved baselines with visual instruction tuning","author":"Liu","year":"2024"},{"key":"10.1016\/j.neucom.2026.134002_bib0080","series-title":"Proceedings of the International Conference on Machine Learning","first-page":"19730","article-title":"BLIP-2: bootstrapping language-image pre-training with frozen image encoders and large language models","author":"Li","year":"2023"},{"key":"10.1016\/j.neucom.2026.134002_bib0085","series-title":"Proceedings of the 45th International ACM SIGIR Conference on Research and Development in Information Retrieval","first-page":"3108","article-title":"Viquae, a dataset for knowledge-based visual question answering about named entities","author":"Lerner","year":"2022"},{"key":"10.1016\/j.neucom.2026.134002_bib0090","doi-asserted-by":"crossref","DOI":"10.1016\/j.neunet.2025.108115","article-title":"Counterfactual causal inference for robust visual question answering","volume":"194","author":"Li","year":"2026","journal-title":"Neural Netw."},{"key":"10.1016\/j.neucom.2026.134002_bib0095","series-title":"Findings of the Association for Computational Linguistics","first-page":"489","article-title":"Conceptbert: concept-aware representation for visual question answering","author":"Gard\u00e8res","year":"2020"},{"issue":"3","key":"10.1016\/j.neucom.2026.134002_bib0100","doi-asserted-by":"crossref","DOI":"10.1016\/j.ipm.2025.104578","article-title":"Question-guided attention and cross-modal alignment for knowledge-based visual question answering","volume":"63","author":"Li","year":"2026","journal-title":"Inf. Process. Manag."},{"key":"10.1016\/j.neucom.2026.134002_bib0105","series-title":"Proceedings of the European Conference on Computer Vision","first-page":"451","article-title":"Straight to the facts: learning knowledge base retrieval for factual visual question answering","author":"Narasimhan","year":"2018"},{"key":"10.1016\/j.neucom.2026.134002_bib0110","series-title":"Proceedings of the International Semantic Web Conference","first-page":"111","article-title":"Graphhopper: multi-hop scene graph reasoning for visual question answering","author":"Koner","year":"2021"},{"key":"10.1016\/j.neucom.2026.134002_bib0115","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"14974","article-title":"Prompting large language models with answer heuristics for knowledge-based visual question answering","author":"Shao","year":"2023"},{"issue":"3","key":"10.1016\/j.neucom.2026.134002_bib0120","doi-asserted-by":"crossref","first-page":"1346","DOI":"10.1109\/TBDATA.2024.3453750","article-title":"Multi-granularity feature interaction and multi-region selection based triplet visual question answering","volume":"11","author":"Liu","year":"2025","journal-title":"IEEE Trans. Big Data"},{"key":"10.1016\/j.neucom.2026.134002_bib0125","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2025.111394","article-title":"Unbiased VQA via modal information interaction and question transformation","volume":"162","author":"Peng","year":"2025","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.neucom.2026.134002_bib0130","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2024.111129","article-title":"Enhancing robust VQA via contrastive and self-supervised learning","volume":"159","author":"Cao","year":"2025","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.neucom.2026.134002_bib0135","series-title":"Proceedings of the AAAI Conference on Artificial Intelligence","first-page":"3942","article-title":"Film: visual reasoning with a general conditioning layer","author":"Perez","year":"2018"},{"key":"10.1016\/j.neucom.2026.134002_bib0140","series-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition","first-page":"6077","article-title":"Bottom-up and top-down attention for image captioning and visual question answering","author":"Anderson","year":"2018"},{"key":"10.1016\/j.neucom.2026.134002_bib0145","doi-asserted-by":"crossref","DOI":"10.1016\/j.neunet.2025.107908","article-title":"MSB-VQA: overcoming multiple source biases for robust visual question answering","volume":"192","author":"Gu","year":"2025","journal-title":"Neural Netw."},{"key":"10.1016\/j.neucom.2026.134002_bib0150","series-title":"Proceedings of the IEEE International Conference on Computer Vision","first-page":"2612","article-title":"MUTAN: multimodal Tucker fusion for visual question answering","author":"Ben-Younes","year":"2017"},{"key":"10.1016\/j.neucom.2026.134002_bib0155","series-title":"Proceedings of the International Conference on Machine Learning","first-page":"5583","article-title":"ViLT: vision-and-language transformer without convolution or region supervision","author":"Kim","year":"2021"},{"key":"10.1016\/j.neucom.2026.134002_bib0160","series-title":"Proceedings of the AAAI Conference on Artificial Intelligence","first-page":"10983","article-title":"Dynamic key-value memory enhanced multi-step graph reasoning for knowledge-based visual question answering","author":"Li","year":"2022"},{"issue":"10","key":"10.1016\/j.neucom.2026.134002_bib0165","doi-asserted-by":"crossref","DOI":"10.1007\/s11432-022-3783-3","article-title":"ViGT: proposal-free video grounding with a learnable token in the transformer","volume":"66","author":"Li","year":"2023","journal-title":"Sci. China Inf. Sci."},{"issue":"6","key":"10.1016\/j.neucom.2026.134002_bib0170","first-page":"1","article-title":"Transformer-based visual grounding with cross-modality interaction","volume":"19","author":"Li","year":"2023","journal-title":"ACM Transactions on Multimedia Computing, Communications and Applications"},{"key":"10.1016\/j.neucom.2026.134002_bib0175","series-title":"Proceedings of the 32nd ACM International Conference on Multimedia","first-page":"1476","article-title":"Maskable retentive network for video moment retrieval","author":"Hu","year":"2024"},{"key":"10.1016\/j.neucom.2026.134002_bib0180","series-title":"Proceedings of the AAAI Conference on Artificial Intelligence","first-page":"5075","article-title":"Patch-level sounding object tracking for audio-visual question answering","author":"Li","year":"2025"},{"key":"10.1016\/j.neucom.2026.134002_bib0185","doi-asserted-by":"crossref","first-page":"2999","DOI":"10.1109\/TMM.2025.3557637","article-title":"Exploiting EfficientSAM and temporal coherence for audio-visual segmentation","volume":"27","author":"Zhu","year":"2025","journal-title":"IEEE Trans. Multimed."},{"key":"10.1016\/j.neucom.2026.134002_bib0190","series-title":"Proceedings of the European Conference on Computer Vision","first-page":"146","article-title":"A-OKVQA: a benchmark for visual question answering using world knowledge","author":"Schwenk","year":"2022"},{"key":"10.1016\/j.neucom.2026.134002_bib0195","series-title":"Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics","first-page":"4498","article-title":"Improving multi-hop question answering over knowledge graphs using knowledge base embeddings","author":"Saxena","year":"2020"},{"key":"10.1016\/j.neucom.2026.134002_bib0200","series-title":"Proceedings of the 2021 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies","first-page":"535","article-title":"QA-GNN: reasoning with language models and knowledge graphs for question answering","author":"Yasunaga","year":"2021"},{"key":"10.1016\/j.neucom.2026.134002_bib0205","series-title":"Proceedings of the 2024 Joint International Conference on Computational Linguistics, Language Resources and Evaluation","first-page":"373","article-title":"Hypergraph transformer: weakly-supervised multi-hop reasoning for knowledge-based visual question answering","author":"Heo","year":"2022"},{"key":"10.1016\/j.neucom.2026.134002_bib0210","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"3716","article-title":"Unbiased scene graph generation from biased training","author":"Tang","year":"2020"},{"key":"10.1016\/j.neucom.2026.134002_bib0215","series-title":"Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing","first-page":"3982","article-title":"Sentence-BERT: sentence embeddings using Siamese BERT-networks","author":"Reimers","year":"2019"},{"key":"10.1016\/j.neucom.2026.134002_bib0220","series-title":"Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies","first-page":"4171","article-title":"BERT: pre-training of deep bidirectional transformers for language understanding","author":"Devlin","year":"2019"},{"key":"10.1016\/j.neucom.2026.134002_bib0225","series-title":"Proceedings of the International Semantic Web Conference","first-page":"722","article-title":"Dbpedia: a nucleus for a web of open data","author":"Auer","year":"2007"},{"key":"10.1016\/j.neucom.2026.134002_bib0230","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"3195","article-title":"OK-VQA: a visual question answering benchmark requiring external knowledge","author":"Marino","year":"2019"},{"issue":"12","key":"10.1016\/j.neucom.2026.134002_bib0235","doi-asserted-by":"crossref","first-page":"5947","DOI":"10.1109\/TNNLS.2018.2817340","article-title":"Beyond bilinear: generalized multimodal factorized high-order pooling for visual question answering","volume":"29","author":"Yu","year":"2018","journal-title":"IEEE Trans. Neural Netw. Learn. Syst."},{"key":"10.1016\/j.neucom.2026.134002_bib0240","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"6281","article-title":"Deep modular co-attention networks for visual question answering","author":"Yu","year":"2019"},{"issue":"11","key":"10.1016\/j.neucom.2026.134002_bib0245","doi-asserted-by":"crossref","first-page":"6628","DOI":"10.1109\/TKDE.2024.3384270","article-title":"Multi-modal validation and domain interaction learning for knowledge-based visual question answering","volume":"36","author":"Xu","year":"2024","journal-title":"IEEE Trans. Knowl. Data Eng."},{"key":"10.1016\/j.neucom.2026.134002_bib0250","series-title":"Proceedings of the 33rd ACM International Conference on Multimedia","first-page":"4817","article-title":"Benchmarking retrieval-augmented generation in multi-modal contexts","author":"Liu","year":"2025"},{"key":"10.1016\/j.neucom.2026.134002_bib0255","series-title":"Proceedings of the International Conference on Learning Representations","first-page":"1","article-title":"LLaVA-Interleave: tackling multi-image, video, and 3D in large multimodal models","author":"Li","year":"2025"},{"key":"10.1016\/j.neucom.2026.134002_bib0260","series-title":"Proceedings of the International Conference on Learning Representations","first-page":"1","article-title":"Decoupled weight decay regularization","author":"Loshchilov","year":"2019"}],"container-title":["Neurocomputing"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0925231226014001?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0925231226014001?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,8,22]],"date-time":"2026-08-22T08:51:46Z","timestamp":1787388706000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0925231226014001"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,9]]},"references-count":52,"alternative-id":["S0925231226014001"],"URL":"https:\/\/doi.org\/10.1016\/j.neucom.2026.134002","relation":{},"ISSN":["0925-2312"],"issn-type":[{"value":"0925-2312","type":"print"}],"subject":[],"published":{"date-parts":[[2026,9]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"CMGR: Cross-modal graph routing for knowledge-based visual question answering","name":"articletitle","label":"Article Title"},{"value":"Neurocomputing","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.neucom.2026.134002","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Elsevier B.V. All rights are reserved, including those for text and data mining, AI training, and similar technologies.","name":"copyright","label":"Copyright"}],"article-number":"134002"}}