{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,14]],"date-time":"2026-05-14T23:03:18Z","timestamp":1778799798219,"version":"3.51.4"},"reference-count":67,"publisher":"Springer Science and Business Media LLC","issue":"6","license":[{"start":{"date-parts":[[2024,3,1]],"date-time":"2024-03-01T00:00:00Z","timestamp":1709251200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2024,3,1]],"date-time":"2024-03-01T00:00:00Z","timestamp":1709251200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"funder":[{"DOI":"10.13039\/100014718","name":"Innovative Research Group Project of the National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["52331012"],"award-info":[{"award-number":["52331012"]}],"id":[{"id":"10.13039\/100014718","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100004735","name":"Natural Science Foundation of Hunan Province","doi-asserted-by":"publisher","award":["2022JJ50245"],"award-info":[{"award-number":["2022JJ50245"]}],"id":[{"id":"10.13039\/501100004735","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100007219","name":"Natural Science Foundation of Shanghai Municipality","doi-asserted-by":"publisher","award":["21ZR1426500"],"award-info":[{"award-number":["21ZR1426500"]}],"id":[{"id":"10.13039\/100007219","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100014472","name":"Scientific Research Foundation of Hunan Provincial Education Department","doi-asserted-by":"publisher","award":["22B0753"],"award-info":[{"award-number":["22B0753"]}],"id":[{"id":"10.13039\/100014472","id-type":"DOI","asserted-by":"publisher"}]},{"name":"Shanghai Maritime University\u2019s Top Innovative","award":["2022YBR014"],"award-info":[{"award-number":["2022YBR014"]}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Appl Intell"],"published-print":{"date-parts":[[2024,3]]},"DOI":"10.1007\/s10489-024-05437-7","type":"journal-article","created":{"date-parts":[[2024,4,13]],"date-time":"2024-04-13T10:01:46Z","timestamp":1713002506000},"page":"5062-5080","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":17,"title":["Relational reasoning and adaptive fusion for visual question answering"],"prefix":"10.1007","volume":"54","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-6894-2550","authenticated-orcid":false,"given":"Xiang","family":"Shen","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Dezhi","family":"Han","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Liang","family":"Zong","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zihan","family":"Guo","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jie","family":"Hua","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2024,4,13]]},"reference":[{"key":"5437_CR1","doi-asserted-by":"crossref","unstructured":"Antol S, Agrawal A, Lu J, Mitchell M, Batra D, Zitnick CL, Parikh D (2015) Vqa: Visual question answering. In: Proceedings of the IEEE international conference on computer vision, pp 2425\u20132433","DOI":"10.1109\/ICCV.2015.279"},{"issue":"7","key":"5437_CR2","doi-asserted-by":"publisher","first-page":"4417","DOI":"10.1109\/TCSVT.2021.3121062","volume":"32","author":"Y Wang","year":"2021","unstructured":"Wang Y, Xu N, Liu A-A, Li W, Zhang Y (2021) High-order interaction learning for image captioning. IEEE Trans Circuits Syst Video Technol 32(7):4417\u20134430","journal-title":"IEEE Trans Circuits Syst Video Technol"},{"issue":"1","key":"5437_CR3","doi-asserted-by":"publisher","first-page":"539","DOI":"10.1109\/TPAMI.2022.3148210","volume":"45","author":"M Stefanini","year":"2022","unstructured":"Stefanini M, Cornia M, Baraldi L, Cascianelli S, Fiameni G, Cucchiara R (2022) From show to tell: A survey on deep learning-based image captioning. IEEE Trans Pattern Anal Mach Intell 45(1):539\u2013559","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"5437_CR4","doi-asserted-by":"crossref","unstructured":"Deng J, Yang Z, Liu D, Chen T, Zhou W, Zhang Y, Li H, Ouyang W (2023) Transvg++: End-to-end visual grounding with language conditioned vision transformer. IEEE Trans Pattern Anal Mach Intell","DOI":"10.1109\/TPAMI.2023.3296823"},{"key":"5437_CR5","doi-asserted-by":"publisher","first-page":"38","DOI":"10.1016\/j.knosys.2019.05.017","volume":"180","author":"P Hu","year":"2019","unstructured":"Hu P, Peng D, Wang X, Xiang Y (2019) Multimodal adversarial network for cross-modal retrieval. Knowl-Based Syst 180:38\u201350","journal-title":"Knowl-Based Syst"},{"issue":"6","key":"5437_CR6","doi-asserted-by":"publisher","first-page":"3030","DOI":"10.1109\/TPAMI.2020.3045530","volume":"44","author":"X Xu","year":"2020","unstructured":"Xu X, Lin K, Yang Y, Hanjalic A, Shen HT (2020) Joint feature synthesis and embedding: Adversarial cross-modal retrieval revisited. IEEE Trans Pattern Anal Mach Intell 44(6):3030\u20133047","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"5437_CR7","doi-asserted-by":"publisher","first-page":"88","DOI":"10.1016\/j.ins.2019.12.002","volume":"514","author":"M Esposito","year":"2020","unstructured":"Esposito M, Damiano E, Minutolo A, De Pietro G, Fujita H (2020) Hybrid query expansion using lexical resources and word embeddings for sentence retrieval in question answering. Inform Sci 514:88\u2013105","journal-title":"Inform Sci"},{"key":"5437_CR8","doi-asserted-by":"crossref","unstructured":"Nguyen BX, Do T, Tran H, Tjiputra E, Tran QD, Nguyen A (2022) Coarse-to-fine reasoning for visual question answering. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 4558\u20134566","DOI":"10.1109\/CVPRW56347.2022.00502"},{"key":"5437_CR9","doi-asserted-by":"crossref","unstructured":"Shen X, Han D, Guo Z, Chen C, Hua J, Luo G (2022) Local self-attention in transformer for visual question answering. Appl Intell 1\u201318","DOI":"10.1007\/s10489-022-04355-w"},{"key":"5437_CR10","doi-asserted-by":"publisher","DOI":"10.1016\/j.patcog.2022.108980","volume":"132","author":"C Chen","year":"2022","unstructured":"Chen C, Han D, Chang C-C (2022) Caan: Context-aware attention network for visual question answering. Pattern Recognition 132:108980","journal-title":"Pattern Recognition"},{"key":"5437_CR11","doi-asserted-by":"crossref","unstructured":"Yu Z, Yu J, Cui Y, Tao D, Tian Q (2019) Deep modular co-attention networks for visual question answering. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 6281\u20136290","DOI":"10.1109\/CVPR.2019.00644"},{"key":"5437_CR12","doi-asserted-by":"crossref","unstructured":"Gao P, Jiang Z, You H, Lu P, Hoi SC, Wang X, Li H (2019) Dynamic fusion with intra-and inter-modality attention flow for visual question answering. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 6639\u20136648","DOI":"10.1109\/CVPR.2019.00680"},{"key":"5437_CR13","doi-asserted-by":"publisher","DOI":"10.1016\/j.patcog.2023.109339","volume":"138","author":"H Zhang","year":"2023","unstructured":"Zhang H, Zeng P, Hu Y, Qian J, Song J, Gao L (2023) Learning visual question answering on controlled semantic noisy labels. Pattern Recognition 138:109339","journal-title":"Pattern Recognition"},{"key":"5437_CR14","doi-asserted-by":"crossref","unstructured":"Yanagimoto H, Nakatani R, Hashimoto K (2022) Visual question answering focusing on object positional relation with capsule network. In: 2022 12th International congress on advanced applied informatics (IIAI-AAI), IEEE, pp 89\u201394","DOI":"10.1109\/IIAIAAI55812.2022.00027"},{"key":"5437_CR15","doi-asserted-by":"publisher","first-page":"90","DOI":"10.1016\/j.cviu.2017.10.001","volume":"163","author":"A Das","year":"2017","unstructured":"Das A, Agrawal H, Zitnick L, Parikh D, Batra D (2017) Human attention in visual question answering: Do humans and deep networks look at the same regions? Comput Vision Image Understand 163:90\u2013100","journal-title":"Comput Vision Image Understand"},{"key":"5437_CR16","doi-asserted-by":"crossref","unstructured":"Fukui A, Park DH, Yang D, Rohrbach A, Darrell T, Rohrbach M (2016) Multimodal compact bilinear pooling for visual question answering and visual grounding. arXiv:1606.01847","DOI":"10.18653\/v1\/D16-1044"},{"issue":"12","key":"5437_CR17","doi-asserted-by":"publisher","first-page":"5947","DOI":"10.1109\/TNNLS.2018.2817340","volume":"29","author":"Z Yu","year":"2018","unstructured":"Yu Z, Yu J, Xiang C, Fan J, Tao D (2018) Beyond bilinear: Generalized multimodal factorized high-order pooling for visual question answering. IEEE Trans Neural Netw Learn Syst 29(12):5947\u20135959","journal-title":"IEEE Trans Neural Netw Learn Syst"},{"key":"5437_CR18","unstructured":"Vaswani A, Shazeer N, Parmar N, Uszkoreit J, Jones L, Gomez AN, Kaiser \u0141, Polosukhin I (2017) Attention is all you need. In: Advances in neural information processing systems 30"},{"key":"5437_CR19","doi-asserted-by":"crossref","unstructured":"Anderson P, He X, Buehler C, Teney D, Johnson M, Gould S, Zhang L (2018) Bottom-up and top-down attention for image captioning and visual question answering. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 6077\u20136086","DOI":"10.1109\/CVPR.2018.00636"},{"key":"5437_CR20","doi-asserted-by":"crossref","unstructured":"Gao P, Jiang Z, You H, Lu P, Hoi SC, Wang X, Li H (2019) Dynamic fusion with intra-and inter-modality attention flow for visual question answering. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 6639\u20136648","DOI":"10.1109\/CVPR.2019.00680"},{"key":"5437_CR21","doi-asserted-by":"publisher","DOI":"10.1016\/j.eswa.2022.117174","volume":"201","author":"C Wang","year":"2022","unstructured":"Wang C, Shen Y, Ji L (2022) Geometry attention transformer with position-aware lstms for image captioning. Expert Syst Appl 201:117174","journal-title":"Expert Syst Appl"},{"key":"5437_CR22","doi-asserted-by":"crossref","unstructured":"Hu H, Gu J, Zhang Z, Dai J, Wei Y (2018) Relation networks for object detection. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 3588\u20133597","DOI":"10.1109\/CVPR.2018.00378"},{"key":"5437_CR23","doi-asserted-by":"crossref","unstructured":"Wei J, Li Z, Zhu J, Ma H (2022) Enhance understanding and reasoning ability for image captioning. Appl Intell 1\u201317","DOI":"10.1007\/s10489-022-03624-y"},{"key":"5437_CR24","doi-asserted-by":"publisher","DOI":"10.7551\/mitpress\/11440.001.0001","volume-title":"How Smart Machines Think","author":"S Gerrish","year":"2018","unstructured":"Gerrish S (2018) How Smart Machines Think. The MIT Press, London"},{"issue":"1","key":"5437_CR25","doi-asserted-by":"publisher","first-page":"586","DOI":"10.1007\/s10489-022-03559-4","volume":"53","author":"Z Guo","year":"2023","unstructured":"Guo Z, Han D (2023) Sparse co-attention visual question answering networks based on thresholds. Appl Intell 53(1):586\u2013600","journal-title":"Appl Intell"},{"key":"5437_CR26","doi-asserted-by":"crossref","unstructured":"Zhou Y, Ren T, Zhu C, Sun X, Liu J, Ding X, Xu M, Ji R (2021) Trar: Routing the attention spans in transformer for visual question answering. In: Proceedings of the IEEE\/CVF international conference on computer vision, pp 2074\u20132084","DOI":"10.1109\/ICCV48922.2021.00208"},{"issue":"4","key":"5437_CR27","doi-asserted-by":"publisher","first-page":"785","DOI":"10.1587\/transinf.2021EDP7189","volume":"105","author":"X Shen","year":"2022","unstructured":"Shen X, Han D, Chang C-C, Zong L (2022) Dual self-guided attention with sparse question networks for visual question answering. IEICE Trans Inform Syst 105(4):785\u2013796","journal-title":"IEICE Trans Inform Syst"},{"key":"5437_CR28","doi-asserted-by":"crossref","unstructured":"Yang Z, He X, Gao J, Deng L, Smola A (2016) Stacked attention networks for image question answering. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 21\u201329","DOI":"10.1109\/CVPR.2016.10"},{"key":"5437_CR29","doi-asserted-by":"crossref","unstructured":"Do T, Do T-T, Tran H, Tjiputra E, Tran QD (2019) Compact trilinear interaction for visual question answering. In: Proceedings of the IEEE\/CVF international conference on computer vision, pp 392\u2013401","DOI":"10.1109\/ICCV.2019.00048"},{"key":"5437_CR30","doi-asserted-by":"crossref","unstructured":"Li L, Gan Z, Cheng Y, Liu J (2019) Relation-aware graph attention network for visual question answering. In: Proceedings of the IEEE\/CVF international conference on computer vision, pp 10313\u201310322","DOI":"10.1109\/ICCV.2019.01041"},{"key":"5437_CR31","doi-asserted-by":"publisher","first-page":"268","DOI":"10.1016\/j.inffus.2019.03.005","volume":"52","author":"D Zhang","year":"2019","unstructured":"Zhang D, Cao R, Wu S (2019) Information fusion in visual question answering: A survey. Inform Fusion 52:268\u2013280","journal-title":"Inform Fusion"},{"key":"5437_CR32","doi-asserted-by":"crossref","unstructured":"Ben-Younes H, Cadene R, Cord M, Thome N (2017) Mutan: Multimodal tucker fusion for visual question answering. In: Proceedings of the IEEE international conference on computer vision, pp 2612\u20132620","DOI":"10.1109\/ICCV.2017.285"},{"key":"5437_CR33","doi-asserted-by":"crossref","unstructured":"Jiang H, Misra I, Rohrbach M, Learned-Miller E, Chen X (2020) In defense of grid features for visual question answering. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 10267\u201310276","DOI":"10.1109\/CVPR42600.2020.01028"},{"key":"5437_CR34","doi-asserted-by":"crossref","unstructured":"Nguyen A, Tran QD, Do T-T, Reid I, Caldwell DG, Tsagarakis NG (2019) Object captioning and retrieval with natural language. In: Proceedings of the IEEE\/CVF international conference on computer vision workshops, pp 0\u20130","DOI":"10.1109\/ICCVW.2019.00316"},{"key":"5437_CR35","doi-asserted-by":"crossref","unstructured":"Pennington J, Socher R, Manning CD (2014) Glove: Global vectors for word representation. In: Proceedings of the 2014 conference on empirical methods in natural language processing (EMNLP), pp 1532\u20131543","DOI":"10.3115\/v1\/D14-1162"},{"key":"5437_CR36","unstructured":"Devlin J, Chang M-W, Lee K, Toutanova K (2018) Bert: Pre-training of deep bidirectional transformers for language understanding. arXiv:1810.04805"},{"key":"5437_CR37","first-page":"17021","volume":"34","author":"Z Zhao","year":"2021","unstructured":"Zhao Z, Samel K, Chen B et al (2021) Proto: Program-guided transformer for program-guided tasks. Advances in neural information processing systems 34:17021\u201317036","journal-title":"Advances in neural information processing systems"},{"key":"5437_CR38","doi-asserted-by":"crossref","unstructured":"Mao A, Yang Z, Lin K, Xuan J, Liu Y-J (2022) Positional attention guided transformer-like architecture for visual question answering. IEEE Trans Multimed","DOI":"10.1109\/TMM.2022.3216770"},{"key":"5437_CR39","doi-asserted-by":"publisher","first-page":"334","DOI":"10.1016\/j.patrec.2020.02.031","volume":"133","author":"W Li","year":"2020","unstructured":"Li W, Sun J, Liu G, Zhao L, Fang X (2020) Visual question answering with attention transfer and a cross-modal gating mechanism. Pattern Recognition Lett 133:334\u2013340","journal-title":"Pattern Recognition Lett"},{"key":"5437_CR40","doi-asserted-by":"crossref","unstructured":"Hu R, Rohrbach A, Darrell T, Saenko K (2019) Language-conditioned graph networks for relational reasoning. In: Proceedings of the IEEE\/CVF international conference on computer vision, pp 10294\u201310303","DOI":"10.1109\/ICCV.2019.01039"},{"issue":"12","key":"5437_CR41","doi-asserted-by":"publisher","first-page":"3196","DOI":"10.1109\/TMM.2020.2972830","volume":"22","author":"J Yu","year":"2020","unstructured":"Yu J, Zhang W, Lu Y, Qin Z, Hu Y, Tan J, Wu Q (2020) Reasoning on the relation: Enhancing visual representation for visual question answering and cross-modal retrieval. IEEE Trans Multimed 22(12):3196\u20133209","journal-title":"IEEE Trans Multimed"},{"key":"5437_CR42","doi-asserted-by":"crossref","unstructured":"Huang Q, Wei J, Cai Y, Zheng C, Chen J, Leung H-f, Li Q (2020) Aligned dual channel graph convolutional network for visual question answering. In: Proceedings of the 58th annual meeting of the association for computational linguistics, pp 7166\u20137176","DOI":"10.18653\/v1\/2020.acl-main.642"},{"key":"5437_CR43","doi-asserted-by":"crossref","unstructured":"Yang Z, Qin Z, Yu J, Wan T (2020) Prior visual relationship reasoning for visual question answering. In: 2020 IEEE International conference on image processing (ICIP), IEEE, pp 1411\u20131415","DOI":"10.1109\/ICIP40778.2020.9190771"},{"key":"5437_CR44","unstructured":"Cao J, Qin X, Zhao S, Shen J (2022) Bilateral cross-modality graph matching attention for feature fusion in visual question answering. IEEE Trans Neural Netw Learn Syst"},{"key":"5437_CR45","doi-asserted-by":"crossref","unstructured":"Cadene R, Ben-Younes H, Cord M, Thome N (2019) Murel: Multimodal relational reasoning for visual question answering. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 1989\u20131998","DOI":"10.1109\/CVPR.2019.00209"},{"key":"5437_CR46","doi-asserted-by":"crossref","unstructured":"Liu Y, Wei W, Peng D, Mao X-L, He Z, Zhou P (2022) Depth-aware and semantic guided relational attention network for visual question answering. IEEE Trans Multimed","DOI":"10.1109\/TMM.2022.3190686"},{"key":"5437_CR47","doi-asserted-by":"crossref","unstructured":"Chen H, Liu R, Peng B (2021) Cross-modal relational reasoning network for visual question answering. In: Proceedings of the IEEE\/CVF international conference on computer vision, pp 3956\u20133965","DOI":"10.1109\/ICCVW54120.2021.00441"},{"key":"5437_CR48","doi-asserted-by":"publisher","DOI":"10.1016\/j.eswa.2023.120286","volume":"227","author":"J Zhang","year":"2023","unstructured":"Zhang J, Huang B, Fujita H, Zeng G, Liu J (2023) Feqa: Fusion and enhancement of multi-source knowledge on question answering. Expert Syst Appl 227:120286","journal-title":"Expert Syst Appl"},{"key":"5437_CR49","unstructured":"Kim J-H, On K-W, Lim W, Kim J, Ha J-W, Zhang B-T (2016) Hadamard product for low-rank bilinear pooling. arXiv:1610.04325"},{"key":"5437_CR50","doi-asserted-by":"crossref","unstructured":"Gu G, Kim ST, Ro YM (2017) Adaptive attention fusion network for visual question answering. In: 2017 IEEE International conference on multimedia and expo (ICME), IEEE, pp 997\u20131002","DOI":"10.1109\/ICME.2017.8019540"},{"key":"5437_CR51","doi-asserted-by":"crossref","unstructured":"Chen H, Liu R, Fang H, Zhang X (2021) Adaptive re-balancing network with gate mechanism for long-tailed visual question answering. In: ICASSP 2021-2021 IEEE international conference on acoustics, speech and signal processing (ICASSP), IEEE, pp 3605\u20133609","DOI":"10.1109\/ICASSP39728.2021.9414074"},{"key":"5437_CR52","doi-asserted-by":"publisher","first-page":"70","DOI":"10.1016\/j.inffus.2021.02.006","volume":"72","author":"W Zhang","year":"2021","unstructured":"Zhang W, Yu J, Zhao W, Ran C (2021) Dmrfnet: deep multimodal reasoning and fusion for visual question answering and explanation generation. Inform Fusion 72:70\u201379","journal-title":"Inform Fusion"},{"issue":"6","key":"5437_CR53","doi-asserted-by":"publisher","first-page":"1137","DOI":"10.1109\/TPAMI.2016.2577031","volume":"39","author":"S Ren","year":"2017","unstructured":"Ren S, He K, Girshick RB, Sun J (2017) Faster R-CNN: towards real-time object detection with region proposal networks. IEEE Trans Pattern Anal Mach Intell 39(6):1137\u20131149","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"5437_CR54","doi-asserted-by":"publisher","first-page":"32","DOI":"10.1007\/s11263-016-0981-7","volume":"123","author":"R Krishna","year":"2017","unstructured":"Krishna R, Zhu Y, Groth O, Johnson J, Hata K, Kravitz J, Chen S, Kalantidis Y, Li L-J, Shamma DA et al (2017) Visual genome: Connecting language and vision using crowdsourced dense image annotations. Int J Comput Vision 123:32\u201373","journal-title":"Int J Comput Vision"},{"key":"5437_CR55","doi-asserted-by":"crossref","unstructured":"He K, Zhang X, Ren S, Sun J (2016) Deep residual learning for image recognition. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 770\u2013778","DOI":"10.1109\/CVPR.2016.90"},{"key":"5437_CR56","doi-asserted-by":"crossref","unstructured":"Goyal Y, Khot T, Summers-Stay D, Batra D, Parikh D (2017) Making the v in vqa matter: Elevating the role of image understanding in visual question answering. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 6904\u20136913","DOI":"10.1109\/CVPR.2017.670"},{"key":"5437_CR57","doi-asserted-by":"crossref","unstructured":"Pishchulin L, Insafutdinov E, Tang S, Andres B, Andriluka M, Gehler PV, Schiele B (2016) Deepcut: Joint subset partition and labeling for multi person pose estimation. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 4929\u20134937","DOI":"10.1109\/CVPR.2016.533"},{"key":"5437_CR58","doi-asserted-by":"crossref","unstructured":"Hudson DA, Manning CD (2019) Gqa: A new dataset for real-world visual reasoning and compositional question answering. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 6700\u20136709","DOI":"10.1109\/CVPR.2019.00686"},{"key":"5437_CR59","unstructured":"Kim J-H, Jun J, Zhang B-T (2018) Bilinear attention networks. In: Advances in neural information processing systems 31"},{"key":"5437_CR60","doi-asserted-by":"crossref","unstructured":"Yang X, Lin G, Lv F, Liu F (2020) Trrnet: Tiered relation reasoning for compositional visual question answering. In: Computer Vision\u2013ECCV 2020: 16th European Conference, Glasgow, UK, August 23\u201328, 2020, Proceedings, Part XXI 16, Springer, pp 414\u2013430","DOI":"10.1007\/978-3-030-58589-1_25"},{"key":"5437_CR61","unstructured":"Lu J, Batra D, Parikh D, Lee S (2019) Vilbert: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks. In: Advances in neural information processing systems 32"},{"key":"5437_CR62","doi-asserted-by":"publisher","DOI":"10.1016\/j.knosys.2020.106639","volume":"212","author":"W Zhang","year":"2021","unstructured":"Zhang W, Yu J, Wang Y, Wang W (2021) Multimodal deep fusion for image question answering. Knowl-Based Syst 212:106639","journal-title":"Knowl-Based Syst"},{"key":"5437_CR63","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1016\/j.inffus.2021.02.022","volume":"73","author":"S Zhang","year":"2021","unstructured":"Zhang S, Chen M, Chen J, Zou F, Li Y-F, Lu P (2021) Multimodal feature-wise co-attention method for visual question answering. Inform Fusion 73:1\u201310","journal-title":"Inform Fusion"},{"key":"5437_CR64","doi-asserted-by":"crossref","unstructured":"Rahman T, Chou S-H, Sigal L, Carenini G (2021) An improved attention for visual question answering. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 1653\u20131662","DOI":"10.1109\/CVPRW53098.2021.00181"},{"key":"5437_CR65","doi-asserted-by":"crossref","unstructured":"Chen C, Han D, Shen X (2023) Clvin: Complete language-vision interaction network for visual question answering. Knowl-Based Syst 110706","DOI":"10.1016\/j.knosys.2023.110706"},{"issue":"9\u201310","key":"5437_CR66","doi-asserted-by":"publisher","first-page":"3097","DOI":"10.1007\/s00371-022-02524-z","volume":"38","author":"F Yan","year":"2022","unstructured":"Yan F, Silamu W, Li Y, Chai Y (2022) Spca-net: a based on spatial position relationship co-attention network for visual question answering. Visual Comput 38(9\u201310):3097\u20133108","journal-title":"Visual Comput"},{"key":"5437_CR67","doi-asserted-by":"publisher","DOI":"10.1016\/j.imavis.2023.104840","volume":"140","author":"H Yao","year":"2023","unstructured":"Yao H, Wang L, Cai C, Sun Y, Zhang Z, Luo Y (2023) Multi-modal spatial relational attention networks for visual question answering. Image Vision Comput 140:104840","journal-title":"Image Vision Comput"}],"container-title":["Applied Intelligence"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10489-024-05437-7.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s10489-024-05437-7\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10489-024-05437-7.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,4,29]],"date-time":"2024-04-29T13:11:38Z","timestamp":1714396298000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s10489-024-05437-7"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,3]]},"references-count":67,"journal-issue":{"issue":"6","published-print":{"date-parts":[[2024,3]]}},"alternative-id":["5437"],"URL":"https:\/\/doi.org\/10.1007\/s10489-024-05437-7","relation":{},"ISSN":["0924-669X","1573-7497"],"issn-type":[{"value":"0924-669X","type":"print"},{"value":"1573-7497","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024,3]]},"assertion":[{"value":"30 March 2024","order":1,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"13 April 2024","order":2,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors have no competing interests to declare that are relevant to the content of this article.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Competing interests"}}]}}