{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,8]],"date-time":"2026-04-08T17:01:44Z","timestamp":1775667704099,"version":"3.50.1"},"reference-count":36,"publisher":"Springer Science and Business Media LLC","issue":"12","license":[{"start":{"date-parts":[[2024,5,20]],"date-time":"2024-05-20T00:00:00Z","timestamp":1716163200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2024,5,20]],"date-time":"2024-05-20T00:00:00Z","timestamp":1716163200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"funder":[{"DOI":"10.13039\/501100012456","name":"National Social Science Fund of China","doi-asserted-by":"publisher","award":["19BYY076"],"award-info":[{"award-number":["19BYY076"]}],"id":[{"id":"10.13039\/501100012456","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Multimed Tools Appl"],"DOI":"10.1007\/s11042-024-19387-2","type":"journal-article","created":{"date-parts":[[2024,5,20]],"date-time":"2024-05-20T08:02:01Z","timestamp":1716192121000},"page":"11063-11078","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":1,"title":["Question guided multimodal receptive field reasoning network for fact-based visual question answering"],"prefix":"10.1007","volume":"84","author":[{"given":"Zicheng","family":"Zuo","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yanhan","family":"Sun","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-7217-3109","authenticated-orcid":false,"given":"Zhenfang","family":"Zhu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Mei","family":"Wu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Hui","family":"Zhao","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2024,5,20]]},"reference":[{"key":"19387_CR1","doi-asserted-by":"crossref","unstructured":"Anderson\u00a0P, JM Fernando\u00a0B (2016) Spice: semantic propositional image caption evaluation. European Conf Comput Vis, 382\u2013398","DOI":"10.1007\/978-3-319-46454-1_24"},{"key":"19387_CR2","doi-asserted-by":"crossref","unstructured":"Ben-Younes H, TN Cadene R (2019) Block: bilinear superdiagonal fusion for visual question answering and visual relationship detection. Proc AAAI Conf Art Intell 33:8102\u20138109","DOI":"10.1609\/aaai.v33i01.33018102"},{"key":"19387_CR3","doi-asserted-by":"crossref","unstructured":"Wang P, SC Wu Q (2017) Fvqa: fact-based visual question answering. IEEE Trans Pattern Anal Mach Intell 40:2413\u20132427","DOI":"10.1109\/TPAMI.2017.2754246"},{"key":"19387_CR4","unstructured":"Narasimhan\u00a0M, SA Lazebnik\u00a0S (2018) Out of the box: reasoning with graph convolution nets for factual visual question answering. Adv Neural Inf Process Syst 31"},{"key":"19387_CR5","doi-asserted-by":"crossref","unstructured":"Ding Y, Yu J, Liu B, Hu Y, Cui M, Wu Q (2022) Mukea: multimodal knowledge extraction and accumulation for knowledge-based visual question answering. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition (CVPR), pp 5089\u20135098","DOI":"10.1109\/CVPR52688.2022.00504"},{"key":"19387_CR6","unstructured":"Zheng W, Yan L, Zhang W, Wang F-Y (2023) Webly supervised knowledge-embedded model for visual reasoning. IEEE Trans Neural Netw Learn Syst, 1\u201315"},{"key":"19387_CR7","doi-asserted-by":"crossref","unstructured":"Antol\u00a0S, LJ Agrawal\u00a0A (2015) Vqa: visual question answering. In: Proceedings of the IEEE international conference on computer vision, pp 2425\u20132433","DOI":"10.1109\/ICCV.2015.279"},{"key":"19387_CR8","first-page":"012025","volume":"1856","author":"J Wang","year":"2021","unstructured":"Wang J, Dong Y (2021) Improve visual question answering based on text feature extraction. J Phys: Conf Series 1856:012025","journal-title":"J Phys: Conf Series"},{"key":"19387_CR9","doi-asserted-by":"crossref","unstructured":"Shih K\u00a0J, HD Singh\u00a0S (2016) Where to look: focus regions for visual question answering. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 4613\u20134621","DOI":"10.1109\/CVPR.2016.499"},{"key":"19387_CR10","doi-asserted-by":"crossref","unstructured":"Malinowski\u00a0M, FM Rohrbach\u00a0M (2015) Ask your neurons: a neural-based approach to answering questions about images. In: Proceedings of the IEEE international conference on computer vision, pp 1\u20139","DOI":"10.1109\/ICCV.2015.9"},{"key":"19387_CR11","doi-asserted-by":"crossref","unstructured":"Zhu\u00a0Z, WY Yu\u00a0J (2020) Mucko: multi-layer cross-modal knowledge reasoning for fact-based visual question answering. 2006\u201309073","DOI":"10.24963\/ijcai.2020\/153"},{"key":"19387_CR12","unstructured":"Shao Z, Han J, Marnerides D, Debattista K (2022) Region-object relation-aware dense captioning via transformer. IEEE Trans Neural Netw Learn Syst, 1\u201312"},{"key":"19387_CR13","doi-asserted-by":"publisher","first-page":"343","DOI":"10.1007\/978-3-031-20497-5_28","volume-title":"Artificial intelligence","author":"F Chu","year":"2022","unstructured":"Chu F, Cao J, Shao Z, Pang Y (2022) Illumination-guided transformer-based network for multispectral pedestrian detection. In: Fang L, Povey D, Zhai G, Mei T, Wang R (eds) Artificial intelligence. Springer, Cham, pp 343\u2013355"},{"key":"19387_CR14","doi-asserted-by":"crossref","unstructured":"Yu J, WY Zhu Z (2020) Cross-modal knowledge reasoning for knowledge-based visual question answering. Pattern Recognit 108:107563","DOI":"10.1016\/j.patcog.2020.107563"},{"key":"19387_CR15","doi-asserted-by":"crossref","unstructured":"Marino\u00a0K, PD Chen\u00a0X (2021) Krisp: integrating implicit and symbolic knowledge for open-domain knowledge-based vqa. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 14111\u201314121","DOI":"10.1109\/CVPR46437.2021.01389"},{"key":"19387_CR16","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/3510373","volume":"18","author":"Y Liu","year":"2022","unstructured":"Liu Y, Guo Y, Yin J, Song X, Liu W, Nie L, Zhang M (2022) Answer questions with right image regions: a visual attention regularization approach. ACM Trans Multimed Comput Commun Appl (TOMM) 18:1\u201318","journal-title":"ACM Trans Multimed Comput Commun Appl (TOMM)"},{"key":"19387_CR17","doi-asserted-by":"publisher","first-page":"107612","DOI":"10.1016\/j.knosys.2021.107612","volume":"235","author":"X Zhan","year":"2022","unstructured":"Zhan X, Huang Y, Dong X, Cao Q, Liang X (2022) Pathreasoner: explainable reasoning paths for commonsense question answering. Knowl-Based Syst 235:107612","journal-title":"Knowl-Based Syst"},{"key":"19387_CR18","doi-asserted-by":"publisher","first-page":"108455","DOI":"10.1016\/j.patcog.2021.108455","volume":"124","author":"X Li","year":"2022","unstructured":"Li X, Wu B, Song J, Gao L, Zeng P, Gan C (2022) Text-instance graph: exploring the relational semantics for text-based visual question answering. Pattern Recognit 124:108455","journal-title":"Pattern Recognit"},{"key":"19387_CR19","doi-asserted-by":"publisher","first-page":"6174","DOI":"10.1109\/TCSVT.2022.3162650","volume":"32","author":"HS Nawaz","year":"2022","unstructured":"Nawaz HS, Shi Z, Gan Y, Hirpa A, Dong J, Zheng H (2022) Temporal moment localization via natural language by utilizing video question answers as a special variant and bypassing nlp for corpora. IEEE Trans Circuits Syst Video Technol 32:6174\u20136185","journal-title":"IEEE Trans Circuits Syst Video Technol"},{"key":"19387_CR20","doi-asserted-by":"publisher","first-page":"116159","DOI":"10.1016\/j.eswa.2021.116159","volume":"190","author":"H Sharma","year":"2022","unstructured":"Sharma H, Jalal AS (2022) A framework for visual question answering with the integration of scene-text using phocs and fisher vectors. Expert Syst Appl 190:116159","journal-title":"Expert Syst Appl"},{"issue":"10","key":"19387_CR21","doi-asserted-by":"publisher","first-page":"6642","DOI":"10.1109\/TCSVT.2022.3177320","volume":"32","author":"L Yan","year":"2022","unstructured":"Yan L, Ma S, Wang Q, Chen Y, Zhang X, Savakis A, Liu D (2022) Video captioning using global-local representation. IEEE Trans Circuits Syst Video Technol 32(10):6642\u20136656","journal-title":"IEEE Trans Circuits Syst Video Technol"},{"key":"19387_CR22","doi-asserted-by":"crossref","unstructured":"Yan L, Han C, Xu Z, Liu D, Wang Q (2023) Prompt learns prompt: exploring knowledge-aware generative prompt collaboration for video captioning. In: Proceedings of the thirty-second international joint conference on artificial intelligence. IJCAI \u201923","DOI":"10.24963\/ijcai.2023\/180"},{"key":"19387_CR23","doi-asserted-by":"crossref","unstructured":"Cai L, Fang H, Li Z (2023) Pre-trained multilevel fuse network based on vision-conditioned reasoning and bilinear attentions for medical image visual question answering. J Supercomput, 1\u201328","DOI":"10.1007\/s11227-023-05195-2"},{"key":"19387_CR24","doi-asserted-by":"crossref","unstructured":"Li\u00a0L, CY Gan\u00a0Z (2019) Relation-aware graph attention network for visual question answering. In: Proceedings of the IEEE\/CVF international conference on computer vision, pp 10313\u201310322","DOI":"10.1109\/ICCV.2019.01041"},{"key":"19387_CR25","doi-asserted-by":"crossref","unstructured":"Gard\u00e8res\u00a0F, AB Ziaeefard\u00a0M (2020) Conceptbert: concept-aware representation for visual question answering. Find Assoc Comput Linguist, 489\u2013498","DOI":"10.18653\/v1\/2020.findings-emnlp.44"},{"key":"19387_CR26","doi-asserted-by":"crossref","unstructured":"Wu J, SA Lu J (2022) Multi-modal answer validation for knowledge-based vqa. Proc AAAI Conf Artif Intell 36:2712\u20132721","DOI":"10.1609\/aaai.v36i3.20174"},{"key":"19387_CR27","doi-asserted-by":"crossref","unstructured":"Yang\u00a0Z, GJ He\u00a0X (2016) Stacked attention networks for image question answering. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 21\u201329","DOI":"10.1109\/CVPR.2016.10"},{"key":"19387_CR28","doi-asserted-by":"crossref","unstructured":"He\u00a0K, RS Zhang\u00a0X (2016) Deep residual learning for image recognition. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 770\u2013778","DOI":"10.1109\/CVPR.2016.90"},{"key":"19387_CR29","doi-asserted-by":"crossref","unstructured":"Chen\u00a0Z, GY Chen\u00a0J (2021) Zero-shot visual question answering using knowledge graph. International Semantic Web Conference, 146\u2013162","DOI":"10.1007\/978-3-030-88361-4_9"},{"key":"19387_CR30","doi-asserted-by":"publisher","first-page":"103985","DOI":"10.1016\/j.imavis.2020.103985","volume":"103","author":"MR Farazi","year":"2020","unstructured":"Farazi MR, Khan SH, Barnes N (2020) From known to the unknown: transferring knowledge to answer questions about novel visual and semantic concepts. Image Vis Comput 103:103985","journal-title":"Image Vis Comput"},{"key":"19387_CR31","unstructured":"Mikolov T, Chen K, Corrado G, Dean J (2013) Efficient estimation of word representations in vector space. arXiv:1301.3781"},{"key":"19387_CR32","doi-asserted-by":"crossref","unstructured":"Speer\u00a0R, HC Chin\u00a0J (2017) Conceptnet 5.5: an open multilingual graph of general knowledge. Thirty-first AAAI conference on artificial intelligence","DOI":"10.1609\/aaai.v31i1.11164"},{"key":"19387_CR33","doi-asserted-by":"crossref","unstructured":"Tandon\u00a0N, SF De\u00a0Melo\u00a0G (2014) Webchild: harvesting and organizing commonsense knowledge from the web. In: Proceedings of the 7th ACM international conference on Web search and data mining, pp 523\u2013532","DOI":"10.1145\/2556195.2556245"},{"key":"19387_CR34","doi-asserted-by":"crossref","unstructured":"Pennington\u00a0J, MCD Socher\u00a0R (2014) Glove: global vectors for word representation. In: Proceedings of the 2014 conference on empirical methods in natural language processing, pp 1532\u20131543","DOI":"10.3115\/v1\/D14-1162"},{"key":"19387_CR35","unstructured":"Lu\u00a0J, BD Yang\u00a0J (2016) Hierarchical question-image co-attention for visual question answering. Adv Neural Inf Process Syst 77"},{"key":"19387_CR36","unstructured":"Kim JH, ZBT Jun\u00a0J (2018) Bilinear attention networks. Adv Neural Inf Process Syst 31"}],"container-title":["Multimedia Tools and Applications"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-024-19387-2.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11042-024-19387-2\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-024-19387-2.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,5,1]],"date-time":"2025-05-01T05:05:04Z","timestamp":1746075904000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11042-024-19387-2"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,5,20]]},"references-count":36,"journal-issue":{"issue":"12","published-online":{"date-parts":[[2025,4]]}},"alternative-id":["19387"],"URL":"https:\/\/doi.org\/10.1007\/s11042-024-19387-2","relation":{},"ISSN":["1573-7721"],"issn-type":[{"value":"1573-7721","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024,5,20]]},"assertion":[{"value":"17 January 2024","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"1 May 2024","order":2,"name":"revised","label":"Revised","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"8 May 2024","order":3,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"20 May 2024","order":4,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"Not Applicable.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Ethical Approval"}},{"value":"We declare that we have no financial and personal relationships with other people or organizations that can inappropriately influence our work, there is no professional or other personal interest of any nature or kind in any product, service and\/or company that could be construed as influencing the position presented in, or the review of, the manuscript entitled \u201cQuestion Guided Multimodal Receptive Field Reasoning Network for Fact-based Visual Question Answering\u201d.","order":3,"name":"Ethics","group":{"name":"EthicsHeading","label":"Competing Interests"}}]}}