{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,21]],"date-time":"2026-07-21T03:00:25Z","timestamp":1784602825228,"version":"3.55.0"},"reference-count":65,"publisher":"Springer Science and Business Media LLC","issue":"6","license":[{"start":{"date-parts":[[2025,3,15]],"date-time":"2025-03-15T00:00:00Z","timestamp":1741996800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by-nc-nd\/4.0"},{"start":{"date-parts":[[2025,3,15]],"date-time":"2025-03-15T00:00:00Z","timestamp":1741996800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by-nc-nd\/4.0"}],"funder":[{"name":"Shanghai Maritime University\u2019s Top Innovative Talent Training Program","award":["2022YBR014"],"award-info":[{"award-number":["2022YBR014"]}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["52331012"],"award-info":[{"award-number":["52331012"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["52331012"],"award-info":[{"award-number":["52331012"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Artif Intell Rev"],"DOI":"10.1007\/s10462-025-11163-4","type":"journal-article","created":{"date-parts":[[2025,3,15]],"date-time":"2025-03-15T00:30:02Z","timestamp":1741998602000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":14,"title":["GFSNet: Gaussian Fourier with sparse attention network for visual question answering"],"prefix":"10.1007","volume":"58","author":[{"given":"Xiang","family":"Shen","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Dezhi","family":"Han","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Chin-Chen","family":"Chang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Ammar","family":"Oad","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Huafeng","family":"Wu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2025,3,15]]},"reference":[{"key":"11163_CR1","doi-asserted-by":"crossref","unstructured":"Anderson P, He X, Buehler C, Teney D, Johnson M, Gould S, Zhang L (2018) Bottom-up and top-down attention for image captioning and visual question answering. In: 2018 IEEE conference on computer vision and pattern recognition, CVPR 2018, Salt Lake City, UT, USA, 18\u201322 June 2018, pp 6077\u20136086","DOI":"10.1109\/CVPR.2018.00636"},{"key":"11163_CR2","doi-asserted-by":"publisher","DOI":"10.1016\/j.neucom.2023.126991","volume":"564","author":"Y Bao","year":"2024","unstructured":"Bao Y, Xing T, Chen X (2024) Confidence-based interactable neural-symbolic visual question answering. Neurocomputing 564:126991","journal-title":"Neurocomputing"},{"key":"11163_CR3","unstructured":"Beltagy I, Peters ME, Cohan A (2020) Longformer: the long-document transformer. CoRR. arXiv:2004.05150"},{"key":"11163_CR4","unstructured":"Cao J, Qin X, Zhao S, Shen J (2021) Bilateral cross-modality graph matching attention for feature fusion in visual question answering. CoRR. arXiv:2112.07270"},{"key":"11163_CR5","doi-asserted-by":"crossref","unstructured":"Chen H, Ding G, Lin Z, Zhao S, Han J (2019) Cross-modal image-text retrieval with semantic consistency. In: Proceedings of the 27th ACM international conference on multimedia, pp 1749\u20131757","DOI":"10.1145\/3343031.3351055"},{"key":"11163_CR6","doi-asserted-by":"publisher","first-page":"35662","DOI":"10.1109\/ACCESS.2020.2975093","volume":"8","author":"C Chen","year":"2020","unstructured":"Chen C, Han D, Wang J (2020) Multimodal encoder-decoder attention networks for visual question answering. IEEE Access 8:35662\u201335671","journal-title":"IEEE Access"},{"key":"11163_CR7","doi-asserted-by":"publisher","DOI":"10.1016\/j.patcog.2022.108980","volume":"132","author":"C Chen","year":"2022","unstructured":"Chen C, Han D, Chang C (2022) CAAN: context-aware attention network for visual question answering. Pattern Recognit 132:108980","journal-title":"Pattern Recognit."},{"key":"11163_CR8","doi-asserted-by":"crossref","unstructured":"Chen C, Han D, Shen X (2023) CLVIN: complete language-vision interaction network for visual question answering. Knowl Based Syst 275:110706","DOI":"10.1016\/j.knosys.2023.110706"},{"key":"11163_CR9","doi-asserted-by":"publisher","unstructured":"Chen C, Han D, Guo Z, Chang C-C (2024) Towards bias-aware visual question answering: rectifying and mitigating comprehension biases. Expert Syst Appl. https:\/\/doi.org\/10.1016\/j.eswa.2024.1258","DOI":"10.1016\/j.eswa.2024.1258"},{"key":"11163_CR10","unstructured":"Choromanski KM, Likhosherstov V, Dohan D, Song X, Gane A, Sarl\u00f3s T, Hawkins P, Davis JQ, Mohiuddin A, Kaiser L, Belanger DB, Colwell LJ, Weller A (2021) Rethinking attention with performers. In: 9th International conference on learning representations, ICLR 2021, Virtual Event, Austria, 3\u20137 May 2021. OpenReview.net"},{"key":"11163_CR11","doi-asserted-by":"crossref","unstructured":"Correia GM, Niculae V, Martins AFT (2019) Adaptively sparse transformers. In: Inui K, Jiang J, Ng V, Wan X (eds) Proceedings of the 2019 conference on empirical methods in natural language processing and the 9th international joint conference on natural language processing, EMNLP-IJCNLP 2019, Hong Kong, China, 3\u20137 November 2019, pp 2174\u20132184. Association for Computational Linguistics, Stroudsburg","DOI":"10.18653\/v1\/D19-1223"},{"key":"11163_CR12","doi-asserted-by":"crossref","unstructured":"Gao P, Jiang Z, You H, Lu P, Hoi SCH, Wang X, Li H (2019) Dynamic fusion with intra- and inter-modality attention flow for visual question answering. In: IEEE conference on computer vision and pattern recognition, CVPR 2019, Long Beach, CA, USA, 16\u201320 June 2019, pp 6639\u20136648","DOI":"10.1109\/CVPR.2019.00680"},{"issue":"4","key":"11163_CR13","doi-asserted-by":"publisher","first-page":"398","DOI":"10.1007\/s11263-018-1116-0","volume":"127","author":"Y Goyal","year":"2019","unstructured":"Goyal Y, Khot T, Agrawal A, Summers-Stay D, Batra D, Parikh D (2019) Making the V in VQA matter: elevating the role of image understanding in visual question answering. Int J Comput Vis 127(4):398\u2013414","journal-title":"Int J Comput Vis"},{"key":"11163_CR14","unstructured":"Guibas J, Mardani M, Li Z, Tao A, Anandkumar A, Catanzaro B (2022) Efficient token mixing for transformers via adaptive fourier neural operators. In: The 10th International conference on learning representations, ICLR 2022, Virtual Event, 25\u201329 April 2022. OpenReview.net"},{"issue":"23","key":"11163_CR15","doi-asserted-by":"publisher","first-page":"6758","DOI":"10.3390\/s20236758","volume":"20","author":"Z Guo","year":"2020","unstructured":"Guo Z, Han D (2020) Multi-modal explicit sparse attention networks for visual question answering. Sensors 20(23):6758","journal-title":"Sensors"},{"issue":"1","key":"11163_CR16","doi-asserted-by":"publisher","first-page":"586","DOI":"10.1007\/s10489-022-03559-4","volume":"53","author":"Z Guo","year":"2023","unstructured":"Guo Z, Han D (2023) Sparse co-attention visual question answering networks based on thresholds. Appl Intell 53(1):586\u2013600","journal-title":"Appl. Intell."},{"key":"11163_CR18","doi-asserted-by":"publisher","first-page":"6730","DOI":"10.1109\/TIP.2021.3097180","volume":"30","author":"W Guo","year":"2021","unstructured":"Guo W, Zhang Y, Yang J, Yuan X (2021) Re-attention for visual question answering. IEEE Trans Image Process 30:6730\u20136743","journal-title":"IEEE Trans Image Process"},{"key":"11163_CR19","doi-asserted-by":"publisher","DOI":"10.1016\/j.eswa.2024.125658","author":"D Han","year":"2024","unstructured":"Han D, Shi J, Zhao J, Wu H, Zhou Y, Li L-H, Khan MK, Li K-C (2024) LRCN: layer-residual co-attention networks for visual question answering. Expert Syst Appl. https:\/\/doi.org\/10.1016\/j.eswa.2024.125658","journal-title":"Expert Syst Appl"},{"key":"11163_CR20","doi-asserted-by":"crossref","unstructured":"Hu R, Rohrbach A, Darrell T, Saenko K (2019) Language-conditioned graph networks for relational reasoning. In: Proceedings of the IEEE\/CVF international conference on computer vision, pp 10294\u201310303","DOI":"10.1109\/ICCV.2019.01039"},{"key":"11163_CR21","unstructured":"Hu JC, Cavicchioli R, Capotondi A (2024) Shifted window fourier transform and retention for image captioning. arXiv preprint. arXiv:2408.13963"},{"issue":"3","key":"11163_CR22","doi-asserted-by":"publisher","first-page":"574","DOI":"10.1113\/jphysiol.1959.sp006308","volume":"148","author":"DH Hubel","year":"1959","unstructured":"Hubel DH, Wiesel TN (1959) Receptive fields of single neurons in the cat\u2019s striate cortex. J Physiol 148(3):574","journal-title":"J Physiol"},{"key":"11163_CR23","doi-asserted-by":"crossref","unstructured":"Hudson DA, Manning CD (2019) GQA: a new dataset for real-world visual reasoning and compositional question answering. In: IEEE Conference on computer vision and pattern recognition, CVPR 2019, Long Beach, CA, USA, 16\u201320 June 2019. Computer Vision Foundation\/IEEE, pp 6700\u20136709","DOI":"10.1109\/CVPR.2019.00686"},{"key":"11163_CR24","doi-asserted-by":"crossref","unstructured":"Jiang H, Misra I, Rohrbach M, Learned-Miller EG, Chen X (2020) In defense of grid features for visual question answering. In: 2020 IEEE\/CVF conference on computer vision and pattern recognition,CVPR 2020, Seattle, WA, USA, 13\u201319 June 2020, pp 10264\u201310273","DOI":"10.1109\/CVPR42600.2020.01028"},{"key":"11163_CR25","doi-asserted-by":"crossref","unstructured":"Johnson J, Hariharan B, Van Der\u00a0Maaten L, Fei-Fei L, Lawrence\u00a0Zitnick C, Girshick R (2017) CLEVR: a diagnostic dataset for compositional language and elementary visual reasoning. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 2901\u20132910","DOI":"10.1109\/CVPR.2017.215"},{"key":"11163_CR26","doi-asserted-by":"crossref","unstructured":"Joshy DM, Das A, Amijith M, Sunil DT, Safar S (2023) Enriching transformer using fourier transform for image captioning. In: 2023 3rd International conference on intelligent technologies (CONIT). IEEE, pp 1\u20136","DOI":"10.1109\/CONIT59222.2023.10205936"},{"key":"11163_CR27","doi-asserted-by":"crossref","unstructured":"Khademi M (2020) Multimodal neural graph memory networks for visual question answering. In: Proceedings of the 58th annual meeting of the Association for Computational Linguistics, pp 7177\u20137188","DOI":"10.18653\/v1\/2020.acl-main.643"},{"key":"11163_CR28","unstructured":"Kim J, Jun J, Zhang B (2018) Bilinear attention networks. In: Advances in neural information processing systems 31: annual conference on neural information processing systems 2018, NeurIPS 2018, 3\u20138 December 2018, Montr\u00e9al, Canada, pp 1571\u20131581"},{"issue":"1","key":"11163_CR29","doi-asserted-by":"publisher","first-page":"32","DOI":"10.1007\/s11263-016-0981-7","volume":"123","author":"R Krishna","year":"2017","unstructured":"Krishna R, Zhu Y, Groth O, Johnson J, Hata K, Kravitz J, Chen S, Kalantidis Y, Li L, Shamma DA, Bernstein MS, Fei-Fei L (2017) Visual genome: connecting language and vision using crowdsourced dense image annotations. Int J Comput Vis 123(1):32\u201373","journal-title":"Int J Comput Vis"},{"key":"11163_CR30","doi-asserted-by":"crossref","unstructured":"Lee-Thorp J, Ainslie J, Eckstein I, Onta\u00f1\u00f3n S (2021) FNET: mixing tokens with fourier transforms. CoRR. arXiv:2105.03824","DOI":"10.18653\/v1\/2022.naacl-main.319"},{"key":"11163_CR31","doi-asserted-by":"crossref","unstructured":"Li L, Gan Z, Cheng Y, Liu J (2019) Relation-aware graph attention network for visual question answering. In: Proceedings of the IEEE\/CVF international conference on computer vision, pp 10313\u201310322","DOI":"10.1109\/ICCV.2019.01041"},{"key":"11163_CR32","doi-asserted-by":"crossref","unstructured":"Liu Z, Lin Y, Cao Y, Hu H, Wei Y, Zhang Z, Lin S, Guo B (2021) Swin transformer: hierarchical vision transformer using shifted windows. In: 2021 IEEE\/CVF international conference on computer vision, ICCV 2021, Montreal, QC, Canada, 10\u201317 October 2021. IEEE, pp 9992\u201310002","DOI":"10.1109\/ICCV48922.2021.00986"},{"key":"11163_CR33","doi-asserted-by":"crossref","unstructured":"Lu J, Wu C, Wang L, Yuan S, Wu J (2023) Nested attention network with graph filtering for visual question and answering. In: ICASSP 2023-2023 IEEE international conference on acoustics, speech and signal processing (ICASSP). IEEE, pp 1\u20135","DOI":"10.1109\/ICASSP49357.2023.10096849"},{"issue":"3","key":"11163_CR34","doi-asserted-by":"publisher","first-page":"1380","DOI":"10.1109\/TNNLS.2021.3105284","volume":"34","author":"J Ma","year":"2023","unstructured":"Ma J, Liu J, Lin Q, Wu B, Wang Y, You Y (2023) Multitask learning for visual question answering. IEEE Trans Neural Netw Learn Syst 34(3):1380\u20131394","journal-title":"IEEE Trans Neural Netw Learn Syst"},{"key":"11163_CR35","unstructured":"Mao J, Gan C, Kohli P, Tenenbaum JB, Wu J (2019) The neuro-symbolic concept learner: interpreting scenes, words, and sentences from natural supervision. arXiv preprint. arXiv:1904.12584"},{"key":"11163_CR36","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2022.3216770","author":"A Mao","year":"2022","unstructured":"Mao A, Yang Z, Lin K, Xuan J, Liu Y-J (2022) Positional attention guided transformer-like architecture for visual question answering. IEEE Trans Multimedia. https:\/\/doi.org\/10.1109\/TMM.2022.3216770","journal-title":"IEEE Trans Multimedia"},{"key":"11163_CR37","doi-asserted-by":"crossref","unstructured":"Nguyen D, Okatani T (2018) Improved fusion of visual and language representations by dense symmetric co-attention for visual question answering. In: 2018 IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2018, Salt Lake City, UT, USA, 18\u201322 June 2018. Computer Vision Foundation\/IEEE Computer Society, pp 6087\u20136096","DOI":"10.1109\/CVPR.2018.00637"},{"key":"11163_CR38","doi-asserted-by":"crossref","unstructured":"Nguyen BX, Do T, Tran H, Tjiputra E, Tran QD, Nguyen A (2022) Coarse-to-fine reasoning for visual question answering. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 4558\u20134566","DOI":"10.1109\/CVPRW56347.2022.00502"},{"key":"11163_CR39","doi-asserted-by":"publisher","unstructured":"Patro BN, Namboodiri VP, Agneeswaran VS (2023) Spectformer: Frequency and attention is what you need in a vision transformer. CoRR. https:\/\/doi.org\/10.48550\/arXiv.2304.06446","DOI":"10.48550\/arXiv.2304.06446"},{"key":"11163_CR40","doi-asserted-by":"crossref","unstructured":"Pennington J, Socher R, Manning CD (2014) GLOVE: global vectors for word representation. In: Proceedings of the 2014 conference on empirical methods in natural language processing, EMNLP 2014, 25\u201329 October 2014, Doha, Qatar, A Meeting of SIGDAT, a Special Interest Group of the ACL, pp 1532\u20131543","DOI":"10.3115\/v1\/D14-1162"},{"key":"11163_CR41","unstructured":"Rao Y, Zhao W, Zhu Z, Lu J, Zhou J (2021) Global filter networks for image classification. In: Ranzato M, Beygelzimer A, Dauphin YN, Liang P, Vaughan JW (eds) Advances in neural information processing systems 34: annual conference on neural information processing systems 2021, NeurIPS 2021, 6\u201314 December 2021, Virtual, pp 980\u2013993"},{"issue":"6","key":"11163_CR42","doi-asserted-by":"publisher","first-page":"1137","DOI":"10.1109\/TPAMI.2016.2577031","volume":"39","author":"S Ren","year":"2017","unstructured":"Ren S, He K, Girshick RB, Sun J (2017) Faster R-CNN: towards real-time object detection with region proposal networks. IEEE Trans Pattern Anal Mach Intell 39(6):1137\u20131149","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"11163_CR43","first-page":"53","volume":"9","author":"A Roy","year":"2021","unstructured":"Roy A, Saffar M, Vaswani A, Grangier D (2021) Efficient content-based sparse attention with routing transformers. Trans Assoc Comput Ling 9:53\u201368","journal-title":"Trans Assoc Comput Ling"},{"issue":"13","key":"11163_CR44","doi-asserted-by":"publisher","first-page":"16706","DOI":"10.1007\/s10489-022-04355-w","volume":"53","author":"X Shen","year":"2023","unstructured":"Shen X, Han D, Guo Z, Chen C, Hua J, Luo G (2023) Local self-attention in transformer for visual question answering. Appl Intell 53(13):16706\u201316723","journal-title":"Appl Intell"},{"issue":"6","key":"11163_CR45","doi-asserted-by":"publisher","first-page":"5062","DOI":"10.1007\/s10489-024-05437-7","volume":"54","author":"X Shen","year":"2024","unstructured":"Shen X, Han D, Zong L, Guo Z, Hua J (2024) Relational reasoning and adaptive fusion for visual question answering. Appl Intell 54(6):5062\u20135080","journal-title":"Appl Intell"},{"key":"11163_CR46","first-page":"1","volume":"72","author":"H Shi","year":"2023","unstructured":"Shi H, Cao G, Zhang Y, Ge Z, Liu Y, Yang D (2023) $$\\text{ F}^{3}$$net: fast Fourier filter network for hyperspectral image classification. IEEE Trans Instrum Meas 72:1\u201318","journal-title":"IEEE Trans Instrum Meas"},{"key":"11163_CR47","unstructured":"Tay Y, Bahri D, Yang L, Metzler D, Juan D (2020) Sparse sinkhorn attention. In: Proceedings of the 37th international conference on machine learning, ICML 2020, 13\u201318 July 2020, virtual event. Proceedings of machine learning research, vol 119. PMLR, pp 9438\u20139447"},{"key":"11163_CR48","doi-asserted-by":"crossref","unstructured":"Wang Z, Feng B, Narasimhan K, Russakovsky O (2020) Towards unique and informative captioning of images. In: Computer vision\u2014ECCV 2020: 16th European conference, Glasgow, UK, 23\u201328 August 2020, Proceedings, part VII, vol 16. Springer, Berlin, pp 629\u2013644","DOI":"10.1007\/978-3-030-58571-6_37"},{"key":"11163_CR49","doi-asserted-by":"crossref","unstructured":"Wu X, Lu J, Li Z, Xiong F (2022) Ques-to-visual guided visual question answering. In: 2022 IEEE international conference on image processing (ICIP). IEEE, pp 4193\u20134197","DOI":"10.1109\/ICIP46576.2022.9897277"},{"key":"11163_CR50","unstructured":"Wu C, Yin S, Qi W, Wang X, Tang Z, Duan N (2023) Visual ChatGPT: talking, drawing and editing with visual foundation models. arXiv preprint. arXiv:2303.04671"},{"key":"11163_CR51","doi-asserted-by":"crossref","unstructured":"Xia H, Lan R, Li H, Song S (2023) ST-VQA: shrinkage transformer with accurate alignment for visual question answering. Appl Intell 53(18):20967\u201320978","DOI":"10.1007\/s10489-023-04564-x"},{"key":"11163_CR52","unstructured":"Xiong P, You Q, Yu P, Liu Z, Wu Y (2022) SA-VQA: structured alignment of visual and semantic representations for visual question answering. arXiv preprint. arXiv:2201.10654"},{"issue":"9","key":"11163_CR53","doi-asserted-by":"publisher","first-page":"3097","DOI":"10.1007\/s00371-022-02524-z","volume":"38","author":"F Yan","year":"2022","unstructured":"Yan F, Silamu W, Li Y, Chai Y (2022) SPCA-NET: a based on spatial position relationship co-attention network for visual question answering. Vis Comput 38(9):3097\u20133108","journal-title":"Vis Comput"},{"key":"11163_CR54","unstructured":"Yang Z, Qin Z, Yu J, Hu Y (2018) Scene graph reasoning with prior visual relationship for visual question answering. arXiv preprint. arXiv:1812.09681"},{"key":"11163_CR55","doi-asserted-by":"crossref","unstructured":"Yang X, Liu Y, Wang X (2022) Reformer: the relational transformer for image captioning. In: Proceedings of the 30th ACM international conference on multimedia, pp 5398\u20135406","DOI":"10.1145\/3503161.3548409"},{"key":"11163_CR56","doi-asserted-by":"crossref","unstructured":"Yu J, Lu Y, Qin Z, Zhang W, Liu Y, Tan J, Guo L (2018) Modeling text with graph convolutional network for cross-modal information retrieval. In: Advances in multimedia information processing\u2014PCM 2018: 19th Pacific-Rim conference on multimedia, Hefei, China, 21\u201322 September 2018, Proceedings, Part I 19. Springer, pp 223\u2013234","DOI":"10.1007\/978-3-030-00776-8_21"},{"key":"11163_CR57","unstructured":"Yu Z, Cui Y, Yu J, Tao D, Tian Q (2019a) Multimodal unified attention networks for vision-and-language interactions. CoRR. arXiv:1908.04107"},{"key":"11163_CR58","doi-asserted-by":"crossref","unstructured":"Yu Z, Yu J, Cui Y, Tao D, Tian Q (2019b) Deep modular co-attention networks for visual question answering. In: IEEE conference on computer vision and pattern recognition, CVPR 2019, Long Beach, CA, USA, 16\u201320 June 2019, pp 6281\u20136290","DOI":"10.1109\/CVPR.2019.00644"},{"key":"11163_CR59","unstructured":"Zaheer M, Guruganesh G, Dubey KA, Ainslie J, Alberti C, Onta\u00f1\u00f3n S, Pham P, Ravula A, Wang Q, Yang L, Ahmed A (2020) Big bird: transformers for longer sequences. In: Larochelle H, Ranzato M, Hadsell R, Balcan M, Lin H (eds) Advances in neural information processing systems 33: annual conference on neural information processing systems 2020, NeurIPS 2020, 6\u201312 December 2020, Virtual"},{"key":"11163_CR60","doi-asserted-by":"crossref","unstructured":"Zhang Z, Lin Z, Zhao Z, Xiao Z (2019) Cross-modal interaction networks for query-based moment retrieval in videos. In: Proceedings of the 42nd international ACM SIGIR conference on research and development in information retrieval, pp. 655\u2013664","DOI":"10.1145\/3331184.3331235"},{"key":"11163_CR61","doi-asserted-by":"publisher","first-page":"70","DOI":"10.1016\/j.inffus.2021.02.006","volume":"72","author":"W Zhang","year":"2021","unstructured":"Zhang W, Yu J, Zhao W, Ran C (2021) DMRFNET: deep multimodal reasoning and fusion for visual question answering and explanation generation. Inf Fusion 72:70\u201379","journal-title":"Inf Fusion"},{"key":"11163_CR62","doi-asserted-by":"crossref","unstructured":"Zhang Y, Gao X, Pu X, Wang T, Gao X (2023) Decomformer: decompose self-attention via fourier transform for vhr aerial image scene classification. In: ICASSP 2023-2023 IEEE international conference on acoustics, speech and signal processing (ICASSP). IEEE, pp 1\u20135","DOI":"10.1109\/ICASSP49357.2023.10096132"},{"key":"11163_CR63","unstructured":"Zhao G, Lin J, Zhang Z, Ren X, Su Q, Sun X (2019) Explicit sparse transformer: Concentrated attention through explicit selection. CoRR. arXiv:1912.11637"},{"key":"11163_CR64","unstructured":"Zhou B, Tian Y, Sukhbaatar S, Szlam A, Fergus R (2015) Simple baseline for visual question answering. CoRR. arXiv:1512.02167"},{"key":"11163_CR65","doi-asserted-by":"crossref","unstructured":"Zhou Y, Ren T, Zhu C, Sun X, Liu J, Ding X, Xu M, Ji R (2021) TRAR: routing the attention spans in transformer for visual question answering. In: 2021 IEEE\/CVF international conference on computer vision, ICCV 2021, Montreal, QC, Canada, 10\u201317 October 2021, pp 2054\u20132064","DOI":"10.1109\/ICCV48922.2021.00208"},{"key":"11163_CR66","doi-asserted-by":"crossref","unstructured":"Zhu L, Wang X, Ke Z, Zhang W, Lau RWH (2023) Biformer: vision transformer with bi-level routing attention. CoRR. arXiv:2303.08810","DOI":"10.1109\/CVPR52729.2023.00995"}],"container-title":["Artificial Intelligence Review"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10462-025-11163-4.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s10462-025-11163-4\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10462-025-11163-4.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,4,17]],"date-time":"2025-04-17T15:32:38Z","timestamp":1744903958000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s10462-025-11163-4"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,3,15]]},"references-count":65,"journal-issue":{"issue":"6","published-online":{"date-parts":[[2025,6]]}},"alternative-id":["11163"],"URL":"https:\/\/doi.org\/10.1007\/s10462-025-11163-4","relation":{"has-preprint":[{"id-type":"doi","id":"10.21203\/rs.3.rs-3852848\/v1","asserted-by":"object"}]},"ISSN":["1573-7462"],"issn-type":[{"value":"1573-7462","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,3,15]]},"assertion":[{"value":"19 February 2025","order":1,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"15 March 2025","order":2,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors declare that they have no known competing financial interests or personal relationships that could have appeared to influence the work reported in this paper.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflict of interest"}}],"article-number":"159"}}