{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,8,22]],"date-time":"2025-08-22T00:41:20Z","timestamp":1755823280968,"version":"3.44.0"},"publisher-location":"New York, NY, USA","reference-count":15,"publisher":"ACM","license":[{"start":{"date-parts":[[2023,10,26]],"date-time":"2023-10-26T00:00:00Z","timestamp":1698278400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.acm.org\/publications\/policies\/copyright_policy#Background"}],"funder":[{"name":"Natural Science Foundation of Heilongjiang Province of China","award":["Grant ZD2022F002"],"award-info":[{"award-number":["Grant ZD2022F002"]}]},{"name":"Natural Science Foundation of China","award":["Grant 62073105"],"award-info":[{"award-number":["Grant 62073105"]}]},{"name":"National Key Research and Development Program of China","award":["Grant 2020AAA0106502"],"award-info":[{"award-number":["Grant 2020AAA0106502"]}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2023,10,26]]},"DOI":"10.1145\/3581783.3614244","type":"proceedings-article","created":{"date-parts":[[2023,10,27]],"date-time":"2023-10-27T07:27:30Z","timestamp":1698391650000},"page":"9646-9650","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":0,"title":["VTQA2023: ACM Multimedia 2023 Visual Text Question Answering Challenge"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0009-0008-2667-3373","authenticated-orcid":false,"given":"Kang","family":"Chen","sequence":"first","affiliation":[{"name":"Harbin Institute of Technology, Harbin, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0004-0938-3690","authenticated-orcid":false,"given":"Tianli","family":"Zhao","sequence":"additional","affiliation":[{"name":"Harbin Institute of Technology, Harbin, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-0956-8757","authenticated-orcid":false,"given":"Xiangqian","family":"Wu","sequence":"additional","affiliation":[{"name":"Harbin Institute of Technology, Harbin, China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2023,10,27]]},"reference":[{"key":"e_1_3_2_1_1_1","volume-title":"VTQAGen: BART-based Generative Model For Visual Text Question Answering. In MM '23: The 31th ACM International Conference on Multimedia. Association for Computing Machinery.","author":"Chen Haoru","year":"2023","unstructured":"Haoru Chen, Tianjiao Wan, Zhimin Lin, and Kele Xu. 2023. VTQAGen: BART-based Generative Model For Visual Text Question Answering. In MM '23: The 31th ACM International Conference on Multimedia. Association for Computing Machinery."},{"key":"e_1_3_2_1_2_1","volume-title":"VTQA: Visual Text Question Answering via Entity Alignment and Cross-Media Reasoning. CoRR","author":"Chen Kang","year":"2023","unstructured":"Kang Chen and Xiangqian Wu. 2023. VTQA: Visual Text Question Answering via Entity Alignment and Cross-Media Reasoning. CoRR, Vol. abs\/2303.02635 (2023). [arXiv]2303.02635"},{"key":"e_1_3_2_1_3_1","volume-title":"9th International Conference on Learning Representations, ICLR","author":"Dosovitskiy Alexey","year":"2021","unstructured":"Alexey Dosovitskiy, Lucas Beyer, Alexander Kolesnikov, Dirk Weissenborn, Xiaohua Zhai, Thomas Unterthiner, Mostafa Dehghani, Matthias Minderer, Georg Heigold, Sylvain Gelly, Jakob Uszkoreit, and Neil Houlsby. 2021. An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale. In 9th International Conference on Learning Representations, ICLR 2021. OpenReview.net."},{"key":"e_1_3_2_1_4_1","volume-title":"Making the V in VQA Matter: Elevating the Role of Image Understanding in Visual Question Answering. In 2017 IEEE Conference on Computer Vision and Pattern Recognition, CVPR","author":"Goyal Yash","year":"2017","unstructured":"Yash Goyal, Tejas Khot, Douglas Summers-Stay, Dhruv Batra, and Devi Parikh. 2017. Making the V in VQA Matter: Elevating the Role of Image Understanding in Visual Question Answering. In 2017 IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2017. IEEE Computer Society, 6325--6334."},{"key":"e_1_3_2_1_5_1","volume-title":"Textbook Question Answering for Multimodal Machine Comprehension. In 2017 IEEE Conference on Computer Vision and Pattern Recognition, CVPR","author":"Kembhavi Aniruddha","year":"2017","unstructured":"Aniruddha Kembhavi, Min Joon Seo, Dustin Schwenk, Jonghyun Choi, Ali Farhadi, and Hannaneh Hajishirzi. 2017. Are You Smarter Than a Sixth Grader? Textbook Question Answering for Multimodal Machine Comprehension. In 2017 IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2017. IEEE Computer Society, 5376--5384."},{"volume-title":"Computer Vision - ECCV 2014 - 13th European Conference (Lecture Notes in Computer Science","author":"Lin Tsung-Yi","key":"e_1_3_2_1_6_1","unstructured":"Tsung-Yi Lin, Michael Maire, Serge J. Belongie, James Hays, Pietro Perona, Deva Ramanan, Piotr Doll\u00e1r, and C. Lawrence Zitnick. 2014. Microsoft COCO: Common Objects in Context. In Computer Vision - ECCV 2014 - 13th European Conference (Lecture Notes in Computer Science, Vol. 8693), David J. Fleet, Tom\u00e1s Pajdla, Bernt Schiele, and Tinne Tuytelaars (Eds.). Springer, 740--755."},{"key":"e_1_3_2_1_7_1","unstructured":"Pan Lu Swaroop Mishra Tanglin Xia Liang Qiu Kai-Wei Chang Song-Chun Zhu Oyvind Tafjord Peter Clark and Ashwin Kalyan. 2022. Learn to Explain: Multimodal Reasoning via Thought Chains for Science Question Answering. In NeurIPS."},{"key":"e_1_3_2_1_8_1","volume-title":"OK-VQA: A Visual Question Answering Benchmark Requiring External Knowledge. In IEEE Conference on Computer Vision and Pattern Recognition, CVPR","author":"Marino Kenneth","year":"2019","unstructured":"Kenneth Marino, Mohammad Rastegari, Ali Farhadi, and Roozbeh Mottaghi. 2019. OK-VQA: A Visual Question Answering Benchmark Requiring External Knowledge. In IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2019. Computer Vision Foundation \/ IEEE, 3195--3204."},{"key":"e_1_3_2_1_9_1","first-page":"1","article-title":"2020. Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer","volume":"21","author":"Raffel Colin","year":"2020","unstructured":"Colin Raffel, Noam Shazeer, Adam Roberts, Katherine Lee, Sharan Narang, Michael Matena, Yanqi Zhou, Wei Li, and Peter J. Liu. 2020. Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer. J. Mach. Learn. Res., Vol. 21 (2020), 140:1--140:67.","journal-title":"J. Mach. Learn. Res."},{"key":"e_1_3_2_1_10_1","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v36i10.21370"},{"key":"e_1_3_2_1_11_1","volume-title":"9th International Conference on Learning Representations, ICLR","author":"Talmor Alon","year":"2021","unstructured":"Alon Talmor, Ori Yoran, Amnon Catav, Dan Lahav, Yizhong Wang, Akari Asai, Gabriel Ilharco, Hannaneh Hajishirzi, and Jonathan Berant. 2021. MultiModalQA: complex question answering over text, tables and images. In 9th International Conference on Learning Representations, ICLR 2021. OpenReview.net."},{"key":"e_1_3_2_1_12_1","volume-title":"Advances in Neural Information Processing Systems 30: Annual Conference on Neural Information Processing Systems","author":"Vaswani Ashish","year":"2017","unstructured":"Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N. Gomez, Lukasz Kaiser, and Illia Polosukhin. 2017. Attention is All you Need. In Advances in Neural Information Processing Systems 30: Annual Conference on Neural Information Processing Systems 2017, Isabelle Guyon, Ulrike von Luxburg, Samy Bengio, Hanna M. Wallach, Rob Fergus, S. V. N. Vishwanathan, and Roman Garnett (Eds.). 5998--6008."},{"key":"e_1_3_2_1_13_1","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2017.2754246"},{"key":"e_1_3_2_1_14_1","volume-title":"MM '23: The 31th ACM International Conference on Multimedia. Association for Computing Machinery.","author":"Yu Jun","year":"2023","unstructured":"Jun Yu, Mohan Jing, Weihao Liu, Tongxu Luo, Bingyuan Zhang, Keda Lu, and Fangyu Lei. 2023. Answer Semantics based Alignment and Fusion for VTQA. In MM '23: The 31th ACM International Conference on Multimedia. Association for Computing Machinery."},{"key":"e_1_3_2_1_15_1","volume-title":"Finetuning Language Models for Multimodal Question Answering. In MM '23: The 31th ACM International Conference on Multimedia. Association for Computing Machinery.","author":"Zhang Xin","year":"2023","unstructured":"Xin Zhang, Wen Xie, Ziqi Dai, Jun Rao, Haokun Wen, Xuan luo, Ruifeng Xu, Meishan Zhang, Liqiang Nie, and Min Zhang. 2023. Finetuning Language Models for Multimodal Question Answering. In MM '23: The 31th ACM International Conference on Multimedia. Association for Computing Machinery."}],"event":{"name":"MM '23: The 31st ACM International Conference on Multimedia","sponsor":["SIGMM ACM Special Interest Group on Multimedia"],"location":"Ottawa ON Canada","acronym":"MM '23"},"container-title":["Proceedings of the 31st ACM International Conference on Multimedia"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3581783.3614244","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3581783.3614244","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,8,22]],"date-time":"2025-08-22T00:03:24Z","timestamp":1755821004000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3581783.3614244"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023,10,26]]},"references-count":15,"alternative-id":["10.1145\/3581783.3614244","10.1145\/3581783"],"URL":"https:\/\/doi.org\/10.1145\/3581783.3614244","relation":{},"subject":[],"published":{"date-parts":[[2023,10,26]]},"assertion":[{"value":"2023-10-27","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}