{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,29]],"date-time":"2026-07-29T14:26:01Z","timestamp":1785335161371,"version":"3.55.0"},"reference-count":170,"publisher":"Association for Computing Machinery (ACM)","issue":"10","license":[{"start":{"date-parts":[[2025,5,6]],"date-time":"2025-05-06T00:00:00Z","timestamp":1746489600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by-nc-sa\/4.0\/"}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":["ACM Comput. Surv."],"published-print":{"date-parts":[[2025,10,31]]},"abstract":"<jats:p>Visual question answering (VQA) is a dynamic field of research that aims to generate textual answers from given visual and question information. It is a multimodal field that has garnered significant interest from the computer vision and natural language processing communities. Furthermore, recent advances in these fields have yielded numerous achievements in VQA research. In VQA research, achieving balanced learning that avoids bias toward either visual or question information is crucial. The primary challenge in VQA lies in eliminating noise, while utilizing valuable and accurate information from different modalities. Various research methodologies have been developed to address these issues. In this study, we classify these research methods into three categories: Joint Embedding, Attention Mechanism, and Model-agnostic methods. We analyze the advantages, disadvantages, and limitations of each approach. In addition, we trace the evolution of datasets in VQA research, categorizing them into three types: Real Image, Synthetic Image, and Unbiased datasets. This study also provides an overview of evaluation metrics based on future research directions. Finally, we discuss future research and application directions for VQA research. We anticipate that this survey will offer useful perspectives and essential information to researchers and practitioners seeking to address visual questions effectively.<\/jats:p>","DOI":"10.1145\/3728635","type":"journal-article","created":{"date-parts":[[2025,4,8]],"date-time":"2025-04-08T11:44:54Z","timestamp":1744112694000},"page":"1-35","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":22,"title":["Visual Question Answering: A Survey of Methods, Datasets, Evaluation, and Challenges"],"prefix":"10.1145","volume":"57","author":[{"ORCID":"https:\/\/orcid.org\/0009-0006-3260-2307","authenticated-orcid":false,"given":"Byeong Su","family":"Kim","sequence":"first","affiliation":[{"name":"Yonsei University, Seoul, Korea (the Republic of)"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0001-4195-3479","authenticated-orcid":false,"given":"Jieun","family":"Kim","sequence":"additional","affiliation":[{"name":"Yonsei University, Seoul, Korea (the Republic of)"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-0080-6886","authenticated-orcid":false,"given":"Deokwoo","family":"Lee","sequence":"additional","affiliation":[{"name":"Keimyung University, Daegu, Korea (the Republic of)"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-3911-5935","authenticated-orcid":false,"given":"Beakcheol","family":"Jang","sequence":"additional","affiliation":[{"name":"Yonsei University, Seoul, Korea (the Republic of)"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"320","published-online":{"date-parts":[[2025,5,6]]},"reference":[{"key":"e_1_3_1_2_2","doi-asserted-by":"publisher","unstructured":"Kriti Aggarwal Aditi Khandelwal Kumar Tanmay Owais Khan Mohammed Qiang Liu Monojit Choudhury Hardik Hansrajbhai Chauhan Subhojit Som Vishrav Chaudhary and Saurabh Tiwary. 2023. DUBLIN: Visual document understanding by language-image network. In Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing: Industry Track. Association for Computational Linguistics Singapore. 10.18653\/v1\/2023.emnlp-industry.65","DOI":"10.18653\/v1\/2023.emnlp-industry.65"},{"key":"e_1_3_1_3_2","doi-asserted-by":"publisher","unstructured":"Aishwarya Agrawal Dhruv Batra and Devi Parikh. 2016. Analyzing the behavior of visual question answering models. In Proceedings of the 2016 Conference on Empirical Methods in Natural Language Processing. Association for Computational Linguistics Austin Texas. 1955\u20131960. 10.18653\/v1\/D16-1203","DOI":"10.18653\/v1\/D16-1203"},{"key":"e_1_3_1_4_2","volume-title":"IEEE Conference on Computer Vision and Pattern Recognition (CVPR\u201918)","author":"Agrawal Aishwarya","year":"2018","unstructured":"Aishwarya Agrawal, Dhruv Batra, Devi Parikh, and Aniruddha Kembhavi. 2018. Don\u2019t just assume; look and answer: Overcoming priors for visual question answering. In IEEE Conference on Computer Vision and Pattern Recognition (CVPR\u201918)."},{"key":"e_1_3_1_5_2","first-page":"4971","volume-title":"IEEE Conference on Computer Vision and Pattern Recognition","author":"Agrawal Aishwarya","year":"2018","unstructured":"Aishwarya Agrawal, Dhruv Batra, Devi Parikh, and Aniruddha Kembhavi. 2018. Don\u2019t just assume; look and answer: Overcoming priors for visual question answering. In IEEE Conference on Computer Vision and Pattern Recognition. 4971\u20134980."},{"key":"e_1_3_1_6_2","unstructured":"Jean-Baptiste Alayrac Jeff Donahue Pauline Luc Antoine Miech Iain Barr Yana Hasson Karel Lenc Arthur Mensch Katherine Millican Malcolm Reynolds et\u00a0al. 2022. Flamingo: A visual language model for few-shot learning. In Advances in Neural Information Processing Systems 35 (2022) 23716\u201323736."},{"key":"e_1_3_1_7_2","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-73383-3_25"},{"key":"e_1_3_1_8_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00636"},{"key":"e_1_3_1_9_2","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2015.279"},{"key":"e_1_3_1_10_2","first-page":"1","article-title":"Advanced visual and textual co-context aware attention network with dependent multimodal fusion block for visual question answering","author":"Asri Hesam Shokri","year":"2024","unstructured":"Hesam Shokri Asri and Reza Safabakhsh. 2024. Advanced visual and textual co-context aware attention network with dependent multimodal fusion block for visual question answering. Multimedia Tools and Applications 83, 1 (2024), 1\u201328.","journal-title":"Multimedia Tools and Applications"},{"key":"e_1_3_1_11_2","doi-asserted-by":"publisher","unstructured":"Gilles Baechler Srinivas Sunkara Maria Wang Fedir Zubach Hassan Mansoor Vincent Etter Victor C\u01cerbune Jason Lin Jindong Chen and Abhanshu Sharma. 2024. ScreenAI: A vision-language model for ui and infographics understanding. In Proceedings of the Thirty-Third International Joint Conference on Artificial Intelligence (IJCAI-24). International Joint Conferences on Artificial Intelligence Organization 3056\u20133062. 10.24963\/ijcai.2024\/339","DOI":"10.24963\/ijcai.2024\/339"},{"key":"e_1_3_1_12_2","unstructured":"Dzmitry Bahdanau Kyunghyun Cho and Yoshua Bengio. 2014. Neural machine translation by jointly learning to align and translate. arXiv:1409.0473. Retrieved from https:\/\/arxiv.org\/abs\/1409.0473"},{"key":"e_1_3_1_13_2","unstructured":"Jinze Bai Shuai Bai Shusheng Yang Shijie Wang Sinan Tan Peng Wang Junyang Lin Chang Zhou and Jingren Zhou. 2023. Qwen-vl: A versatile vision-language model for understanding localization text reading and beyond. arXiv:2308.12966. Retrieved from https:\/\/arxiv.org\/abs\/2308.12966"},{"key":"e_1_3_1_14_2","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2018.2798607"},{"key":"e_1_3_1_15_2","first-page":"32897","article-title":"Vlmo: Unified vision-language pre-training with mixture-of-modality-experts","volume":"35","author":"Bao Hangbo","year":"2022","unstructured":"Hangbo Bao, Wenhui Wang, Li Dong, Qiang Liu, Owais Khan Mohammed, Kriti Aggarwal, Subhojit Som, Songhao Piao, and Furu Wei. 2022. Vlmo: Unified vision-language pre-training with mixture-of-modality-experts. Advances in Neural Information Processing Systems 35 (2022), 32897\u201332912.","journal-title":"Advances in Neural Information Processing Systems"},{"key":"e_1_3_1_16_2","doi-asserted-by":"crossref","unstructured":"Jeffrey P. Bigham Chandrika Jayant Hanjie Ji Greg Little Andrew Miller Robert C. Miller Robin Miller Aubrey Tatarowicz Brandyn White Samual White et\u00a0al. 2010. VizWiz: Nearly real-time answers to visual questions. In Proceedings of the 23rd Annual ACM Symposium on User Interface Software and Technology (UIST\u201910). 333\u2013342.","DOI":"10.1145\/1866029.1866080"},{"key":"e_1_3_1_17_2","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00439"},{"key":"e_1_3_1_18_2","first-page":"1877","article-title":"Language models are few-shot learners","volume":"33","author":"Brown Tom","year":"2020","unstructured":"Tom Brown, Benjamin Mann, Nick Ryder, Melanie Subbiah, Jared D. Kaplan, Prafulla Dhariwal, Arvind Neelakantan, Pranav Shyam, Girish Sastry, Amanda Askell, et\u00a0al. 2020. Language models are few-shot learners. Advances in Neural Information Processing Systems 33 (2020), 1877\u20131901.","journal-title":"Advances in Neural Information Processing Systems"},{"key":"e_1_3_1_19_2","unstructured":"Remi Cadene Corentin Dancette Matthieu Cord and Devi Parikh. 2019. RUBi: Reducing unimodal biases for visual question answering. In Advances in Neural Information Processing Systems 32 (2019) 841\u2013852."},{"key":"e_1_3_1_20_2","doi-asserted-by":"crossref","unstructured":"Linqin Cai Haodu Fang and Zhiqing Li. 2023. Pre-trained multilevel fuse network based on vision-conditioned reasoning and bilinear attentions for medical image visual question answering. The Journal of Supercomputing 79 1 (2023) 1\u201328.","DOI":"10.1007\/s11227-023-05195-2"},{"key":"e_1_3_1_21_2","unstructured":"Daniel Cer Yinfei Yang Sheng-yi Kong Nan Hua Nicole Limtiaco et\u00a0al. 2018. Universal Sentence Encoder. arXiv preprint arXiv:1803.11175. https:\/\/arxiv.org\/abs\/1803.11175"},{"key":"e_1_3_1_22_2","doi-asserted-by":"publisher","unstructured":"Tuhin Chakrabarty Arkadiy Saakyan Debanjan Ghosh and Smaranda Muresan. 2022. FLUTE: Figurative language understanding through textual explanations. In Proceedings of the 2022 Conference on Empirical Methods in Natural Language Processing. Association for Computational Linguistics 7139\u20137159. 10.18653\/v1\/2022.emnlp-main.481","DOI":"10.18653\/v1\/2022.emnlp-main.481"},{"key":"e_1_3_1_23_2","doi-asserted-by":"publisher","unstructured":"Soravit Changpinyo Linting Xue Michal Yarom Ashish Thapliyal Idan Szpektor Julien Amelot Xi Chen and Radu Soricut. 2023. MaXM: Towards multilingual visual question answering. In Findings of the Association for Computational Linguistics: EMNLP 2023. Association for Computational Linguistics 2667\u20132682. 10.18653\/v1\/2023.findings-emnlp.176","DOI":"10.18653\/v1\/2023.findings-emnlp.176"},{"key":"e_1_3_1_24_2","doi-asserted-by":"publisher","unstructured":"Ken Chatfield Karen Simonyan Andrea Vedaldi and Andrew Zisserman. 2014. Return of the Devil in the details: Delving deep into convolutional nets. In Proceedings of the British Machine Vision Conference (BMVC 2014). BMVA Press 6.1\u20136.12. 10.5244\/C.28.6","DOI":"10.5244\/C.28.6"},{"key":"e_1_3_1_25_2","unstructured":"Jiuhai Chen Jianwei Yang Haiping Wu Dianqi Li Jianfeng Gao Tianyi Zhou and Bin Xiao. 2024. Florence-VL: Enhancing vision-language models with generative vision encoder and depth-breadth fusion. arXiv preprint arXiv:2412.04424. https:\/\/arxiv.org\/abs\/2412.04424"},{"key":"e_1_3_1_26_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.01081"},{"key":"e_1_3_1_27_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00998"},{"key":"e_1_3_1_28_2","unstructured":"Xi Chen Josip Djolonga Piotr Padlewski Basil Mustafa Soravit Changpinyo Jialin Wu Carlos Riquelme Ruiz Sebastian Goodman Xiao Wang Yi Tay et\u00a0al. 2023. PaLI-X: Scaling up language-image pretraining. arXiv preprint arXiv:2305.18565."},{"key":"e_1_3_1_29_2","unstructured":"Xi Chen Xiao Wang Lucas Beyer Alexander Kolesnikov Jialin Wu Paul Voigtlaender Basil Mustafa Sebastian Goodman Ibrahim Alabdulmohsin Piotr Padlewski et\u00a0al. 2023. PaLI-3 vision language models: Smaller faster stronger. arXiv preprint arXiv:2310.09199."},{"key":"e_1_3_1_30_2","unstructured":"Xi Chen Xiao Wang Soravit Changpinyo A. J. Piergiovanni Piotr Padlewski Daniel Salz Sebastian Goodman Adam Grycner Basil Mustafa Lucas Beyer et\u00a0al. 2022. PaLI: A jointly-scaled multilingual language-image model. arXiv preprint arXiv:2209.06794."},{"key":"e_1_3_1_31_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00135"},{"key":"e_1_3_1_32_2","first-page":"1607","volume-title":"IEEE\/CVF Winter Conference on Applications of Computer Vision","author":"Chou Shih-Han","year":"2020","unstructured":"Shih-Han Chou, Wei-Lun Chao, Wei-Sheng Lai, Min Sun, and Ming-Hsuan Yang. 2020. Visual question answering on 360deg images. In IEEE\/CVF Winter Conference on Applications of Computer Vision. 1607\u20131616."},{"key":"e_1_3_1_33_2","unstructured":"Iqbal Chowdhury Kien Nguyen Thanh Sridha Sridharan et\u00a0al. 2023. Video question answering for surveillance. Authorea Preprint (2023)."},{"key":"e_1_3_1_34_2","unstructured":"HyungWon Chung Le Hou Shayne Longpre Barret Zoph Yi Tay William Fedus Eric Li Xuezhi Wang Mostafa Dehghani Siddhartha Brahma et\u00a0al. 2022. Scaling instruction-finetuned language models. arXiv preprint arXiv:2210.11416."},{"key":"e_1_3_1_35_2","doi-asserted-by":"publisher","unstructured":"Christopher Clark Mark Yatskar and Luke Zettlemoyer. 2019. Don\u2019t take the easy way out: Ensemble based methods for avoiding known dataset biases. In Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing (EMNLP-IJCNLP 2019). Association for Computational Linguistics 4069\u20134082. 10.18653\/v1\/D19-1418","DOI":"10.18653\/v1\/D19-1418"},{"key":"e_1_3_1_36_2","doi-asserted-by":"publisher","DOI":"10.1007\/978-0-85729-859-1"},{"key":"e_1_3_1_37_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7298878"},{"key":"e_1_3_1_38_2","unstructured":"Alexey Dosovitskiy Lucas Beyer Alexander Kolesnikov Dirk Weissenborn Xiaohua Zhai Thomas Unterthiner Mostafa Dehghani Matthias Minderer Georg Heigold Sylvain Gelly et\u00a0al. 2020. An image is worth 16x16 words: Transformers for image recognition at scale. arXiv preprint arXiv:2010.11929."},{"key":"e_1_3_1_39_2","unstructured":"Jon Mitchell. 2011. Google: Our New Search Strategy is to Compute Answers Not Links. Retrieved March 8 2011 from https:\/\/readwrite.com\/google-our-new-search-strategy-is-to-compute-answers-not-links\/"},{"key":"e_1_3_1_40_2","volume-title":"Why Food Matters","author":"Freedman Paul","year":"2021","unstructured":"Paul Freedman. 2021. Why Food Matters. Yale University Press."},{"key":"e_1_3_1_41_2","doi-asserted-by":"publisher","unstructured":"Akira Fukui Dong Huk Park Daylen Yang Anna Rohrbach Trevor Darrell and Marcus Rohrbach. 2016. Multimodal compact bilinear pooling for visual question answering and visual grounding. In Proceedings of the 2016 Conference on Empirical Methods in Natural Language Processing (EMNLP 2016). Association for Computational Linguistics 457\u2013468. 10.18653\/v1\/D16-1044","DOI":"10.18653\/v1\/D16-1044"},{"key":"e_1_3_1_42_2","unstructured":"Haoyuan Gao Junhua Mao Jie Zhou Zhiheng Huang Lei Wang and Wei Xu. 2015. Are you talking to a machine? Dataset and methods for multilingual image question answering. In Advances in Neural Information Processing Systems 28 (2015) 2296\u20132304."},{"key":"e_1_3_1_43_2","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01246-5_29"},{"key":"e_1_3_1_44_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.41"},{"key":"e_1_3_1_45_2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2020.findings-emnlp.44"},{"key":"e_1_3_1_46_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.670"},{"key":"e_1_3_1_47_2","first-page":"219","volume-title":"Papers Presented at the May 9\u201311, 1961, Western Joint IRE-AIEE-ACM Computer Conference","author":"Jr Bert F. Green","year":"1961","unstructured":"Bert F. Green Jr, Alice K. Wolf, Carol Chomsky, and Kenneth Laughery. 1961. Baseball: An automatic question-answerer. In Papers Presented at the May 9\u201311, 1961, Western Joint IRE-AIEE-ACM Computer Conference. 219\u2013224."},{"key":"e_1_3_1_48_2","unstructured":"Liangke Gui Borui Wang Qiuyuan Huang Alex Hauptmann Yonatan Bisk and Jianfeng Gao. 2021. Kat: A knowledge augmented transformer for vision-and-language. arXiv:2112.08614. Retrieved from https:\/\/arxiv.org\/abs\/2112.08614"},{"key":"e_1_3_1_49_2","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2021.3104937"},{"key":"e_1_3_1_50_2","doi-asserted-by":"crossref","unstructured":"Deepak Gupta Swati Suman and Asif Ekbal. 2021. Hierarchical deep multi-modal network for medical visual question answering. Expert Systems with Applications 164 113 (2021).","DOI":"10.1016\/j.eswa.2020.113993"},{"key":"e_1_3_1_51_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00103"},{"key":"e_1_3_1_52_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00380"},{"key":"e_1_3_1_53_2","first-page":"3929","volume-title":"International Conference on Machine Learning","author":"Guu Kelvin","year":"2020","unstructured":"Kelvin Guu, Kenton Lee, Zora Tung, Panupong Pasupat, and Mingwei Chang. 2020. Retrieval augmented language model pre-training. In International Conference on Machine Learning. PMLR, 3929\u20133938."},{"key":"e_1_3_1_54_2","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00161"},{"key":"e_1_3_1_55_2","doi-asserted-by":"publisher","DOI":"10.1109\/WACV.2019.00082"},{"key":"e_1_3_1_56_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.90"},{"key":"e_1_3_1_57_2","unstructured":"Xuehai He Yichen Zhang Luntian Mou Eric Xing and Pengtao Xie. 2020. PathVQA: 30000+ questions for medical visual question answering. arXiv:2003.10286. Retrieved from https:\/\/arxiv.org\/abs\/2003.10286"},{"key":"e_1_3_1_58_2","doi-asserted-by":"publisher","DOI":"10.1162\/neco.1997.9.8.1735"},{"key":"e_1_3_1_59_2","doi-asserted-by":"publisher","DOI":"10.1016\/j.neucom.2020.03.098"},{"key":"e_1_3_1_60_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.153"},{"key":"e_1_3_1_61_2","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.01039"},{"key":"e_1_3_1_62_2","unstructured":"Yushi Hu Hang Hua Zhengyuan Yang Weijia Shi Noah A. Smith and Jiebo Luo. 2022. Promptcap: Prompt-guided task-aware image captioning. arXiv:2211.09699. Retrieved from https:\/\/arxiv.org\/abs\/2211.09699"},{"key":"e_1_3_1_63_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.00916"},{"key":"e_1_3_1_64_2","unstructured":"Drew Hudson and Christopher D. Manning. 2019. Learning by abstraction: The neural state machine. In Advances in Neural Information Processing Systems 32 (2019) 5901\u20135914."},{"key":"e_1_3_1_65_2","unstructured":"Drew A. Hudson and Christopher D. Manning. 2018. Compositional attention networks for machine reasoning. In Proceedings of the International Conference on Learning Representations (ICLR 2018). https:\/\/openreview.net\/forum?id=S1Euwz-Rb"},{"key":"e_1_3_1_66_2","doi-asserted-by":"publisher","unstructured":"Drew A. Hudson and Christopher D. Manning. 2019. GQA: A new dataset for real-world visual reasoning and compositional question answering. In Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR 2019). IEEE 6700\u20136709. 10.1109\/CVPR.2019.00686","DOI":"10.1109\/CVPR.2019.00686"},{"key":"e_1_3_1_67_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.123"},{"key":"e_1_3_1_68_2","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-98932-7_28"},{"key":"e_1_3_1_69_2","first-page":"4904","volume-title":"International Conference on Machine Learning","author":"Jia Chao","year":"2021","unstructured":"Chao Jia, Yinfei Yang, Ye Xia, Yi-Ting Chen, Zarana Parekh, Hieu Pham, Quoc Le, Yun-Hsuan Sung, Zhen Li, and Tom Duerig. 2021. Scaling up visual and vision-language representation learning with noisy text supervision. In International Conference on Machine Learning. PMLR, 4904\u20134916."},{"key":"e_1_3_1_70_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.215"},{"key":"e_1_3_1_71_2","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.217"},{"key":"e_1_3_1_72_2","unstructured":"Danial Kamali Elham J. Barezi and Parisa Kordjamshidi. 2024. NeSyCoCo: A neuro-symbolic concept composer for compositional generalization. arXiv preprint arXiv:2412.15588. https:\/\/arxiv.org\/abs\/2412.15588"},{"key":"e_1_3_1_73_2","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-20059-5_38"},{"key":"e_1_3_1_74_2","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00180"},{"key":"e_1_3_1_75_2","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-30645-8_27"},{"key":"e_1_3_1_76_2","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-72661-3_8"},{"key":"e_1_3_1_77_2","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00898"},{"key":"e_1_3_1_78_2","unstructured":"Jin-Hwa Kim Jaehyun Jun and Byoung-Tak Zhang. 2018. Bilinear attention networks. In Advances in Neural Information Processing Systems (NeurIPS 2018) 31 (2018) 1571\u20131581. https:\/\/papers.nips.cc\/paper\/7429-bilinear-attention-networks"},{"key":"e_1_3_1_79_2","unstructured":"Jin-Hwa Kim Kyoung-Woon On Woosang Lim Jeonghee Kim Jung-Woo Ha and Byoung-Tak Zhang. 2017. Hadamard product for low-rank bilinear pooling. In Proceedings of the 5th International Conference on Learning Representations (ICLR 2017). Toulon France. https:\/\/openreview.net\/forum?id=r1rhWnZkg"},{"key":"e_1_3_1_80_2","doi-asserted-by":"crossref","unstructured":"Olga Kovaleva Chaitanya Shivade Satyananda Kashyap Karina Kanjaria Joy Wu Deddeh Ballah Adam Coy Alexandros Karargyris Yufan Guo David Beymer et\u00a0al. 2020. Towards visual dialog for radiology. In Proceedings of the 19th SIGBioMed Workshop on Biomedical Language Processing. 60\u201369.","DOI":"10.18653\/v1\/2020.bionlp-1.6"},{"key":"e_1_3_1_81_2","doi-asserted-by":"crossref","unstructured":"Ranjay Krishna Yuke Zhu Oliver Groth Justin Johnson Kenji Hata Joshua Kravitz Stephanie Chen Yannis Kalantidis Li-Jia Li David A. Shamma et\u00a0al. 2017. Visual genome: Connecting language and vision using crowdsourced dense image annotations. International Journal of Computer Vision 123 1 (2017) 32\u201373.","DOI":"10.1007\/s11263-016-0981-7"},{"key":"e_1_3_1_82_2","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58601-0_2"},{"key":"e_1_3_1_83_2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2022.flp-1.20"},{"key":"e_1_3_1_84_2","doi-asserted-by":"publisher","DOI":"10.1038\/sdata.2018.251"},{"key":"e_1_3_1_85_2","first-page":"12888","volume-title":"International Conference on Machine Learning","author":"Li Junnan","year":"2022","unstructured":"Junnan Li, Dongxu Li, Caiming Xiong, and Steven Hoi. 2022. Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation. In International Conference on Machine Learning. PMLR, 12888\u201312900."},{"key":"e_1_3_1_86_2","unstructured":"Jiachen Li Xinyao Wang Sijie Zhu Chia-Wen Kuo Lu Xu Fan Chen Jitesh Jain Humphrey Shi and Longyin Wen. 2024. Cumo: Scaling multimodal llm with co-upcycled mixture-of-experts. arXiv:2405.05949. Retrieved from https:\/\/arxiv.org\/abs\/2405.05949"},{"key":"e_1_3_1_87_2","doi-asserted-by":"publisher","DOI":"10.32604\/jbd.2021.017169"},{"key":"e_1_3_1_88_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00294"},{"key":"e_1_3_1_89_2","first-page":"74","volume-title":"Text Summarization Branches Out","author":"Lin Chin-Yew","year":"2004","unstructured":"Chin-Yew Lin. 2004. Rouge: A package for automatic evaluation of summaries. In Text Summarization Branches Out. 74\u201381."},{"key":"e_1_3_1_90_2","unstructured":"Shanchuan Lin Anran Wang and Xiao Yang. 2024. SDXL-Lightning: Progressive adversarial diffusion distillation. arXiv preprint arXiv:2402.13929. https:\/\/arxiv.org\/abs\/2402.13929"},{"key":"e_1_3_1_91_2","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-10602-1_48"},{"key":"e_1_3_1_92_2","first-page":"10560","article-title":"Revive: Regional visual representation matters in knowledge-based visual question answering","volume":"35","author":"Lin Yuanze","year":"2022","unstructured":"Yuanze Lin, Yujia Xie, Dongdong Chen, Yichong Xu, Chenguang Zhu, and Lu Yuan. 2022. Revive: Regional visual representation matters in knowledge-based visual question answering. Advances in Neural Information Processing Systems 35 (2022), 10560\u201310571.","journal-title":"Advances in Neural Information Processing Systems"},{"key":"e_1_3_1_93_2","unstructured":"Zhihong Lin Donghao Zhang Qingyi Tao Danli Shi Gholamreza Haffari Qi Wu Mingguang He and Zongyuan Ge. 2023. Medical visual question answering: A survey. Artificial Intelligence in Medicine 144 (2023)."},{"key":"e_1_3_1_94_2","doi-asserted-by":"publisher","DOI":"10.1109\/ISBI48211.2021.9434010"},{"key":"e_1_3_1_95_2","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v31i1.11197"},{"key":"e_1_3_1_96_2","doi-asserted-by":"publisher","unstructured":"Fangyu Liu Francesco Piccinno Syrine Krichene Chenxi Pang Kenton Lee Mandar Joshi Yasemin Altun Nigel Collier and Julian Martin Eisenschlos. 2023. MatCha: Enhancing visual language pretraining with math reasoning and chart derendering. In Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics (ACL 2023). Association for Computational Linguistics 12789\u201312804. 10.18653\/v1\/2023.acl-long.714","DOI":"10.18653\/v1\/2023.acl-long.714"},{"key":"e_1_3_1_97_2","unstructured":"Haotian Liu Chunyuan Li Qingyang Wu and Yong Jae Lee. 2024. Visual instruction tuning. In Advances in Neural Information Processing Systems 36 (2024) 4377\u20134393."},{"key":"e_1_3_1_98_2","unstructured":"Shikun Liu Linxi Fan Edward Johns Zhiding Yu Chaowei Xiao and Anima Anandkumar. 2024. Prismer: A vision-language model with multi-task experts. Transactions on Machine Learning Research (TMLR). https:\/\/openreview.net\/forum?id=R7H43YD6"},{"key":"e_1_3_1_99_2","unstructured":"Yinhan Liu Myle Ott Naman Goyal Jingfei Du Mandar Joshi Danqi Chen Omer Levy Mike Lewis Luke Zettlemoyer and Veselin Stoyanov. 2019. RoBERTa: A robustly optimized BERT pretraining approach. arXiv preprint arXiv:1907.11692. https:\/\/arxiv.org\/abs\/1907.11692"},{"key":"e_1_3_1_100_2","unstructured":"Junyu Lu Ruyi Gan Dixiang Zhang Xiaojun Wu Ziwei Wu Renliang Sun Jiaxing Zhang Pingjian Zhang and Yan Song. 2023. Lyrics: boosting fine-grained language-vision alignment and comprehension via semantic-aware visual objects. arXiv preprint arXiv:2312.05278. https:\/\/arxiv.org\/abs\/2312.05278"},{"key":"e_1_3_1_101_2","unstructured":"Jiasen Lu Jianwei Yang Dhruv Batra and Devi Parikh. 2016. Hierarchical question-image co-attention for visual question answering. In Advances in Neural Information Processing Systems 29 (2016) 289\u2013297."},{"key":"e_1_3_1_102_2","unstructured":"Pan Lu Liang Qiu Jiaqi Chen Tony Xia Yizhou Zhao Wei Zhang Zhou Yu Xiaodan Liang and Song-Chun Zhu. 2021. IconQA: A new benchmark for abstract diagram understanding and visual language reasoning. In Proceedings of the 35th Conference on Neural Information Processing Systems (NeurIPS 2021). Datasets and Benchmarks Track. https:\/\/arxiv.org\/abs\/2110.13214"},{"key":"e_1_3_1_103_2","doi-asserted-by":"publisher","DOI":"10.7717\/peerj-cs.1400"},{"key":"e_1_3_1_104_2","doi-asserted-by":"publisher","DOI":"10.7717\/peerj-cs.353"},{"key":"e_1_3_1_105_2","unstructured":"Mateusz Malinowski and Mario Fritz. 2014. A multi-world approach to question answering about real-world scenes based on uncertain input. In Advances in Neural Information Processing Systems 27 (2014) 1682\u20131690."},{"key":"e_1_3_1_106_2","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2015.9"},{"key":"e_1_3_1_107_2","unstructured":"Jiayuan Mao Chuang Gan Pushmeet Kohli Joshua B. Tenenbaum and Jiajun Wu. 2019. The neuro-symbolic concept learner: Interpreting scenes words and sentences from natural supervision. In Proceedings of the 7th International Conference on Learning Representations (ICLR 2019). https:\/\/openreview.net\/forum?id=rJgMlhRctm"},{"key":"e_1_3_1_108_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.01389"},{"key":"e_1_3_1_109_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00331"},{"key":"e_1_3_1_110_2","doi-asserted-by":"publisher","DOI":"10.1109\/WACV48630.2021.00225"},{"key":"e_1_3_1_111_2","doi-asserted-by":"publisher","unstructured":"Aakansha Mishra Ashish Anand and Prithwijit Guha. 2024. Visual question answering with cascade of self- and co-attention blocks. In Pattern Recognition Lecture Notes in Computer Science 14426 (2024) 20\u201336. 10.1007\/978-3-031-78495-8_2","DOI":"10.1007\/978-3-031-78495-8_2"},{"key":"e_1_3_1_112_2","doi-asserted-by":"publisher","DOI":"10.1109\/ICDAR.2019.00156"},{"key":"e_1_3_1_113_2","unstructured":"Azhan Mohammed. 2022. ResAttUNet: Detecting marine debris using an attention activated residual UNet. arXiv preprint arXiv:2210.08506. https:\/\/arxiv.org\/abs\/2210.08506"},{"key":"e_1_3_1_114_2","unstructured":"Heejeong Nam and Jinwoo Ahn. 2024. Visual contexts clarify ambiguous expressions: A benchmark dataset. arXiv preprint arXiv:2411.14137. https:\/\/arxiv.org\/abs\/2411.14137"},{"key":"e_1_3_1_115_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.232"},{"key":"e_1_3_1_116_2","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-32251-9_57"},{"key":"e_1_3_1_117_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPRW56347.2022.00502"},{"key":"e_1_3_1_118_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00637"},{"key":"e_1_3_1_119_2","doi-asserted-by":"publisher","DOI":"10.1145\/3444685.3446256"},{"key":"e_1_3_1_120_2","first-page":"311","volume-title":"40th Annual Meeting of the Association for Computational Linguistics","author":"Papineni Kishore","year":"2002","unstructured":"Kishore Papineni, Salim Roukos, Todd Ward, and Wei-Jing Zhu. 2002. Bleu: A method for automatic evaluation of machine translation. In 40th Annual Meeting of the Association for Computational Linguistics. 311\u2013318."},{"key":"e_1_3_1_121_2","volume-title":"Causal Inference in Statistics: A Primer","author":"Pearl Judea","year":"2016","unstructured":"Judea Pearl, Madelyn Glymour, and Nicholas P. Jewell. 2016. Causal Inference in Statistics: A Primer. John Wiley & Sons."},{"key":"e_1_3_1_122_2","volume-title":"The Book of Why: The New Science of Cause and Effect","author":"Pearl Judea","year":"2018","unstructured":"Judea Pearl and Dana Mackenzie. 2018. The Book of Why: The New Science of Cause and Effect. Basic books."},{"key":"e_1_3_1_123_2","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v32i1.11671"},{"key":"e_1_3_1_124_2","doi-asserted-by":"publisher","unstructured":"Jonas Pfeiffer Gregor Geigle Aishwarya Kamath Jan-Martin O. Steitz Stefan Roth Ivan Vuli\u0107 and Iryna Gurevych. 2022. xGQA: Cross-lingual visual question answering. In Findings of the Association for Computational Linguistics: ACL 2022. Association for Computational Linguistics Dublin Ireland. 2497\u20132511. 10.18653\/v1\/2022.findings-acl.196","DOI":"10.18653\/v1\/2022.findings-acl.196"},{"key":"e_1_3_1_125_2","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v32i1.12272"},{"key":"e_1_3_1_126_2","first-page":"8748","volume-title":"International Conference on Machine Learning","author":"Radford Alec","year":"2021","unstructured":"Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, et\u00a0al. 2021. Learning transferable visual models from natural language supervision. In International Conference on Machine Learning. PMLR, 8748\u20138763."},{"key":"e_1_3_1_127_2","first-page":"28492","volume-title":"International Conference on Machine Learning","author":"Radford Alec","year":"2023","unstructured":"Alec Radford, Jong Wook Kim, Tao Xu, Greg Brockman, Christine McLeavey, and Ilya Sutskever. 2023. Robust speech recognition via large-scale weak supervision. In International Conference on Machine Learning. PMLR, 28492\u201328518."},{"key":"e_1_3_1_128_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPRW53098.2021.00181"},{"key":"e_1_3_1_129_2","doi-asserted-by":"publisher","DOI":"10.1002\/cae.22388"},{"key":"e_1_3_1_130_2","unstructured":"Shaoqing Ren Kaiming He Ross Girshick and Jian Sun. 2015. Faster R-CNN: Towards real-time object detection with region proposal networks. In Advances in Neural Information Processing Systems 28 (2015) 91\u201399."},{"key":"e_1_3_1_131_2","doi-asserted-by":"publisher","unstructured":"Andrew Slavin Ross Michael C. Hughes and Finale Doshi-Velez. 2017. Right for the right reasons: Training differentiable models by constraining their explanations. In Proceedings of the 26th International Joint Conference on Artificial Intelligence (IJCAI 2017). 2662\u20132670. 10.24963\/ijcai.2017\/371","DOI":"10.24963\/ijcai.2017\/371"},{"key":"e_1_3_1_132_2","unstructured":"Mohammadmostafa Rostamkhani Baktash Ansari Hoorieh Sabzevari Farzan Rahmani and Sauleh Eetemadi. 2024. Illusory VQA: Benchmarking and enhancing multimodal models on visual Illusions. arXiv preprint arXiv:2412.08169. https:\/\/arxiv.org\/abs\/2412.08169"},{"key":"e_1_3_1_133_2","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-20074-8_9"},{"key":"e_1_3_1_134_2","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.74"},{"key":"e_1_3_1_135_2","doi-asserted-by":"publisher","DOI":"10.1016\/j.imavis.2021.104327"},{"key":"e_1_3_1_136_2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/P18-1238"},{"key":"e_1_3_1_137_2","unstructured":"Xiang Shen Dezhi Han Zihan Guo Chongqing Chen Jie Hua and Gaofeng Luo. 2022. Local self-attention in transformer for visual question answering. Applied Intelligence 52 1 (2022) 1\u201318."},{"key":"e_1_3_1_138_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.499"},{"key":"e_1_3_1_139_2","unstructured":"Andrew Shin Yoshitaka Ushiku and Tatsuya Harada. 2016. The color of the cat is gray: 1 million full-sentences visual question answering (FSVQA). arXiv preprint arXiv:1609.06657. https:\/\/arxiv.org\/abs\/1609.06657"},{"key":"e_1_3_1_140_2","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-33715-4_54"},{"key":"e_1_3_1_141_2","unstructured":"Joseph Suarez Justin Johnson and Fei-Fei Li. 2018. DDRprog: A clevr differentiable dynamic reasoning programmer. arXiv preprint arXiv:1803.11361. https:\/\/arxiv.org\/abs\/1803.11361"},{"key":"e_1_3_1_142_2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/P17-2034"},{"key":"e_1_3_1_143_2","doi-asserted-by":"publisher","unstructured":"Alane Suhr Stephanie Zhou Ally Zhang Iris Zhang Huajun Bai and Yoav Artzi. 2019. A corpus for reasoning about natural language grounded in photographs. In Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics. Association for Computational Linguistics Florence Italy. 6418\u20136428. 10.18653\/v1\/P19-1644","DOI":"10.18653\/v1\/P19-1644"},{"key":"e_1_3_1_144_2","doi-asserted-by":"publisher","unstructured":"Hao Tan and Mohit Bansal. 2019. LXMERT: Learning cross-modality encoder representations from transformers. In Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing (EMNLP-IJCNLP). Association for Computational Linguistics Hong Kong China. 5100\u20135111. 10.18653\/v1\/D19-1514","DOI":"10.18653\/v1\/D19-1514"},{"key":"e_1_3_1_145_2","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v37i11.26598"},{"key":"e_1_3_1_146_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01845"},{"key":"e_1_3_1_147_2","doi-asserted-by":"publisher","unstructured":"Ashish V. Thapliyal Jordi Pont-Tuset Xi Chen and Radu Soricut. 2022. Crossmodal-3600: A massively multilingual multimodal evaluation dataset. In Proceedings of the 2022 Conference on Empirical Methods in Natural Language Processing (EMNLP 2022). Association for Computational Linguistics Abu Dhabi United Arab Emirates. 715\u2013729. 10.18653\/v1\/2022.emnlp-main.45","DOI":"10.18653\/v1\/2022.emnlp-main.45"},{"key":"e_1_3_1_148_2","doi-asserted-by":"publisher","unstructured":"Anthony Meng Huat Tiong Junnan Li Boyang Li Silvio Savarese and Steven C. H. Hoi. 2022. Plug-and-Play VQA: Zero-shot VQA by conjoining large pretrained models with zero training. In Findings of the Association for Computational Linguistics: EMNLP 2022. Association for Computational Linguistics Abu Dhabi United Arab Emirates. 951\u2013967. 10.18653\/v1\/2022.findings-emnlp.67","DOI":"10.18653\/v1\/2022.findings-emnlp.67"},{"key":"e_1_3_1_149_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7299087"},{"key":"e_1_3_1_150_2","volume-title":"26th Computer Vision Winter Workshop","author":"Vysko\u010dil Ji\u0159\u00ed","year":"2023","unstructured":"Ji\u0159\u00ed Vysko\u010dil and Luk\u00e1\u0161 Picek. 2023. VinVL+ L: enriching visual representation with location context in VQA. In 26th Computer Vision Winter Workshop."},{"key":"e_1_3_1_151_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01838"},{"key":"e_1_3_1_152_2","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00189"},{"key":"e_1_3_1_153_2","doi-asserted-by":"publisher","unstructured":"Genta Indra Winata Frederikus Hudi Patrick Amadeus Irawan David Anugraha Rifki Afina Putri Yutong Wang Adam Nohejl Ubaidillah Ariq Prathama Nedjma Ousidhoum Afifa Amriani et\u00a0al. 2025. WorldCuisines: A massive-scale benchmark for multilingual and multicultural visual question answering on global cuisines. In Proceedings of the 2025 Conference of the North American Chapter of the Association for Computational Linguistics (NAACL 2025). Association for Computational Linguistics. 10.48550\/arXiv.2410.12705","DOI":"10.48550\/arXiv.2410.12705"},{"key":"e_1_3_1_154_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.01347"},{"key":"e_1_3_1_155_2","doi-asserted-by":"crossref","unstructured":"Qi Wu Damien Teney Peng Wang Chunhua Shen Anthony Dick and Anton van den Hengel. 2017. Visual question answering: A survey of methods and datasets. Computer Vision and Image Understanding 163 1 (2017) 21\u201340.","DOI":"10.1016\/j.cviu.2017.05.001"},{"key":"e_1_3_1_156_2","first-page":"138","volume-title":"32nd Annual Meeting on Association for Computational Linguistics. Las Cruces: AssociationforComputationalLinguistics","author":"WuZ Palmerm","year":"1994","unstructured":"Palmerm WuZ. 1994. VerbsSemanticsandLexicalSelection. In 32nd Annual Meeting on Association for Computational Linguistics. Las Cruces: AssociationforComputationalLinguistics, Vol. 133. 138."},{"key":"e_1_3_1_157_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.00461"},{"key":"e_1_3_1_158_2","doi-asserted-by":"publisher","unstructured":"Yang Xu Yiheng Xu Tengchao Lv Lei Cui Furu Wei Guoxin Wang Yijuan Lu Dinei Florencio Cha Zhang Wanxiang Che Min Zhang and Lidong Zhou. 2021. LayoutLMv2: Multi-modal Pre-training for visually-rich document understanding. In Proceedings of the 59th Annual Meeting of the Association for Computational Linguistics and the 11th International Joint Conference on Natural Language Processing (Volume 1: Long Papers). Association for Computational Linguistics 2579\u20132591. 10.18653\/v1\/2021.acl-long.201","DOI":"10.18653\/v1\/2021.acl-long.201"},{"key":"e_1_3_1_159_2","doi-asserted-by":"publisher","DOI":"10.3390\/s22031045"},{"key":"e_1_3_1_160_2","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v36i3.20215"},{"key":"e_1_3_1_161_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.10"},{"key":"e_1_3_1_162_2","unstructured":"Kexin Yi Jiajun Wu Chuang Gan Antonio Torralba Pushmeet Kohli and Josh Tenenbaum. 2018. Neural-symbolic VQA: Disentangling reasoning from vision and language understanding. In Advances in Neural Information Processing Systems 31 (2018) 1031\u20131042."},{"key":"e_1_3_1_163_2","unstructured":"Jiahui Yu Zirui Wang Vijay Vasudevan Legg Yeung Mojtaba Seyedhosseini and Yonghui Wu. 2022. CoCa: Contrastive captioners are image-text foundation models. Transactions on Machine Learning Research. https:\/\/openreview.net\/forum?id=Ee277P3AYC"},{"key":"e_1_3_1_164_2","doi-asserted-by":"publisher","unstructured":"Zhou Yu Xuecheng Ouyang Zhenwei Shao Meng Wang and Jun Yu. 2023. Prophet: Prompting large language models with complementary answer heuristics for knowledge-based visual question answering. In Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR 2023). IEEE 14974\u201314983. 10.1109\/CVPR52729.2023.01438","DOI":"10.1109\/CVPR52729.2023.01438"},{"key":"e_1_3_1_165_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00644"},{"key":"e_1_3_1_166_2","unstructured":"Desen Yuan. 2021. Language bias in visual question answering: A survey and taxonomy. arXiv preprint arXiv:2111.08531. https:\/\/arxiv.org\/abs\/2111.08531"},{"key":"e_1_3_1_167_2","doi-asserted-by":"crossref","unstructured":"Dongxiang Zhang Rui Cao and Sai Wu. 2019. Information fusion in visual question answering: A survey. Information Fusion 52 1 (2019) 268\u2013280.","DOI":"10.1016\/j.inffus.2019.03.005"},{"key":"e_1_3_1_168_2","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00355"},{"key":"e_1_3_1_169_2","doi-asserted-by":"crossref","unstructured":"Sheng Zhang Min Chen Jincai Chen Fuhao Zou Yuan-Fang Li and Ping Lu. 2021. Multimodal feature-wise co-attention method for visual question answering. Information Fusion 73 1 (2021) 1\u201310.","DOI":"10.1016\/j.inffus.2021.02.022"},{"key":"e_1_3_1_170_2","doi-asserted-by":"publisher","DOI":"10.1016\/j.knosys.2020.106639"},{"key":"e_1_3_1_171_2","doi-asserted-by":"publisher","unstructured":"Xinsong Zhang Yan Zeng Jipeng Zhang and Hang Li. 2023. Toward building general foundation models for language vision and vision-language understanding tasks. In Findings of the Association for Computational Linguistics: EMNLP 2023. Association for Computational Linguistics Singapore 551\u2013568. 10.18653\/v1\/2023.findings-emnlp.40","DOI":"10.18653\/v1\/2023.findings-emnlp.40"}],"container-title":["ACM Computing Surveys"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3728635","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3728635","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,19]],"date-time":"2025-06-19T01:18:36Z","timestamp":1750295916000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3728635"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,5,6]]},"references-count":170,"journal-issue":{"issue":"10","published-print":{"date-parts":[[2025,10,31]]}},"alternative-id":["10.1145\/3728635"],"URL":"https:\/\/doi.org\/10.1145\/3728635","relation":{},"ISSN":["0360-0300","1557-7341"],"issn-type":[{"value":"0360-0300","type":"print"},{"value":"1557-7341","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,5,6]]},"assertion":[{"value":"2023-11-23","order":0,"name":"received","label":"Received","group":{"name":"publication_history","label":"Publication History"}},{"value":"2025-04-01","order":2,"name":"accepted","label":"Accepted","group":{"name":"publication_history","label":"Publication History"}},{"value":"2025-05-06","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}