{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,28]],"date-time":"2026-04-28T20:10:40Z","timestamp":1777407040227,"version":"3.51.4"},"publisher-location":"New York, NY, USA","reference-count":68,"publisher":"ACM","license":[{"start":{"date-parts":[[2022,10,27]],"date-time":"2022-10-27T00:00:00Z","timestamp":1666828800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.acm.org\/publications\/policies\/copyright_policy#Background"}],"funder":[{"DOI":"10.13039\/501100000266","name":"Engineering and Physical Sciences Research Council","doi-asserted-by":"publisher","award":["EP\/V050869\/1"],"award-info":[{"award-number":["EP\/V050869\/1"]}],"id":[{"id":"10.13039\/501100000266","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["U19B2027,91846204"],"award-info":[{"award-number":["U19B2027,91846204"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2022,10,27]]},"DOI":"10.1145\/3579051.3579053","type":"proceedings-article","created":{"date-parts":[[2023,2,14]],"date-time":"2023-02-14T00:19:46Z","timestamp":1676333986000},"page":"20-29","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":23,"title":["LaKo: Knowledge-driven Visual Question Answering via Late Knowledge-to-Text Injection"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0000-0001-9991-6892","authenticated-orcid":false,"given":"Zhuo","family":"Chen","sequence":"first","affiliation":[{"name":"College of Computer Science and Technology, Zhejiang University, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-7110-9298","authenticated-orcid":false,"given":"Yufeng","family":"Huang","sequence":"additional","affiliation":[{"name":"School of Software Technology, Zhejiang University, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-4643-6750","authenticated-orcid":false,"given":"Jiaoyan","family":"Chen","sequence":"additional","affiliation":[{"name":"Department of Computer Science, University of Oxford, United Kingdom"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-2461-2613","authenticated-orcid":false,"given":"Yuxia","family":"Geng","sequence":"additional","affiliation":[{"name":"College of Computer Science and Technology, Zhejiang University, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-9538-848X","authenticated-orcid":false,"given":"Yin","family":"Fang","sequence":"additional","affiliation":[{"name":"College of Computer Science and Technology, Zhejiang University, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-9779-2088","authenticated-orcid":false,"given":"Jeff Z.","family":"Pan","sequence":"additional","affiliation":[{"name":"School of Informatics, The University of Edinburgh, United Kingdom"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-1970-0678","authenticated-orcid":false,"given":"Ningyu","family":"Zhang","sequence":"additional","affiliation":[{"name":"School of Software Technology, Zhejiang University, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-8429-9326","authenticated-orcid":false,"given":"Wen","family":"Zhang","sequence":"additional","affiliation":[{"name":"School of Software Technology, Zhejiang University, China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2023,2,13]]},"reference":[{"key":"e_1_3_2_1_1_1","volume-title":"Bottom-Up and Top-Down Attention for Image Captioning and Visual Question Answering","author":"Anderson Peter","unstructured":"Peter Anderson , Xiaodong He , Chris Buehler , Damien Teney , Mark Johnson , Stephen Gould , and Lei Zhang . 2018. Bottom-Up and Top-Down Attention for Image Captioning and Visual Question Answering . In CVPR. Computer Vision Foundation \/ IEEE Computer Society , 6077\u20136086. Peter Anderson, Xiaodong He, Chris Buehler, Damien Teney, Mark Johnson, Stephen Gould, and Lei Zhang. 2018. Bottom-Up and Top-Down Attention for Image Captioning and Visual Question Answering. In CVPR. Computer Vision Foundation \/ IEEE Computer Society, 6077\u20136086."},{"key":"e_1_3_2_1_2_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2015.279"},{"key":"e_1_3_2_1_3_1","volume-title":"ISWC\/ASWC(Lecture Notes in Computer Science, Vol.\u00a04825)","author":"Auer S\u00f6ren","unstructured":"S\u00f6ren Auer , Christian Bizer , Georgi Kobilarov , Jens Lehmann , Richard Cyganiak , and Zachary\u00a0 G. Ives . 2007. DBpedia: A Nucleus for a Web of Open Data . In ISWC\/ASWC(Lecture Notes in Computer Science, Vol.\u00a04825) . Springer , 722\u2013735. S\u00f6ren Auer, Christian Bizer, Georgi Kobilarov, Jens Lehmann, Richard Cyganiak, and Zachary\u00a0G. Ives. 2007. DBpedia: A Nucleus for a Web of Open Data. In ISWC\/ASWC(Lecture Notes in Computer Science, Vol.\u00a04825). Springer, 722\u2013735."},{"key":"e_1_3_2_1_4_1","unstructured":"Sumithra Bhakthavatsalam Kyle Richardson Niket Tandon and Peter Clark. 2020. Do Dogs have Whiskers? A New Knowledge Base of hasPart Relations. CoRR abs\/2006.07510(2020). Sumithra Bhakthavatsalam Kyle Richardson Niket Tandon and Peter Clark. 2020. Do Dogs have Whiskers? A New Knowledge Base of hasPart Relations. CoRR abs\/2006.07510(2020)."},{"key":"e_1_3_2_1_5_1","volume-title":"Benchmarking Knowledge-Enhanced Commonsense Question Answering via Knowledge-to-Text Transformation","author":"Bian Ning","unstructured":"Ning Bian , Xianpei Han , Bo Chen , and Le Sun . 2021. Benchmarking Knowledge-Enhanced Commonsense Question Answering via Knowledge-to-Text Transformation . In AAAI. AAAI Press , 12574\u201312582. Ning Bian, Xianpei Han, Bo Chen, and Le Sun. 2021. Benchmarking Knowledge-Enhanced Commonsense Question Answering via Knowledge-to-Text Transformation. In AAAI. AAAI Press, 12574\u201312582."},{"key":"e_1_3_2_1_6_1","unstructured":"Tom\u00a0B. Brown Benjamin Mann Nick Ryder Melanie Subbiah Jared Kaplan Prafulla Dhariwal Arvind Neelakantan Pranav Shyam Girish Sastry Amanda Askell Sandhini Agarwal Ariel Herbert-Voss Gretchen Krueger Tom Henighan Rewon Child Aditya Ramesh Daniel\u00a0M. Ziegler Jeffrey Wu Clemens Winter Christopher Hesse Mark Chen Eric Sigler Mateusz Litwin Scott Gray Benjamin Chess Jack Clark Christopher Berner Sam McCandlish Alec Radford Ilya Sutskever and Dario Amodei. 2020. Language Models are Few-Shot Learners. In NeurIPS. Tom\u00a0B. Brown Benjamin Mann Nick Ryder Melanie Subbiah Jared Kaplan Prafulla Dhariwal Arvind Neelakantan Pranav Shyam Girish Sastry Amanda Askell Sandhini Agarwal Ariel Herbert-Voss Gretchen Krueger Tom Henighan Rewon Child Aditya Ramesh Daniel\u00a0M. Ziegler Jeffrey Wu Clemens Winter Christopher Hesse Mark Chen Eric Sigler Mateusz Litwin Scott Gray Benjamin Chess Jack Clark Christopher Berner Sam McCandlish Alec Radford Ilya Sutskever and Dario Amodei. 2020. Language Models are Few-Shot Learners. In NeurIPS."},{"key":"e_1_3_2_1_7_1","volume-title":"ACL\/IJCNLP (1)","author":"Cao Boxi","year":"1860","unstructured":"Boxi Cao , Hongyu Lin , Xianpei Han , Le Sun , Lingyong Yan , Meng Liao , Tong Xue , and Jin Xu. 2021. Knowledgeable or Educated Guess? Revisiting Language Models as Knowledge Bases . In ACL\/IJCNLP (1) . Association for Computational Linguistics , 1860 \u20131874. Boxi Cao, Hongyu Lin, Xianpei Han, Le Sun, Lingyong Yan, Meng Liao, Tong Xue, and Jin Xu. 2021. Knowledgeable or Educated Guess? Revisiting Language Models as Knowledge Bases. In ACL\/IJCNLP (1). Association for Computational Linguistics, 1860\u20131874."},{"key":"e_1_3_2_1_8_1","doi-asserted-by":"crossref","unstructured":"Jiaoyan Chen Yuxia Geng Zhuo Chen Ian Horrocks Jeff\u00a0Z. Pan and Huajun Chen. 2021. Knowledge-aware Zero-Shot Learning: Survey and Perspective. In IJCAI. ijcai.org 4366\u20134373. Jiaoyan Chen Yuxia Geng Zhuo Chen Ian Horrocks Jeff\u00a0Z. Pan and Huajun Chen. 2021. Knowledge-aware Zero-Shot Learning: Survey and Perspective. In IJCAI. ijcai.org 4366\u20134373.","DOI":"10.24963\/ijcai.2021\/597"},{"key":"e_1_3_2_1_9_1","unstructured":"Jiaoyan Chen Yuxia Geng Zhuo Chen Jeff\u00a0Z. Pan Yuan He Wen Zhang Ian Horrocks and Huajun Chen. 2021. Low-resource Learning with Knowledge Graphs: A Comprehensive Survey. CoRR abs\/2112.10006(2021). Jiaoyan Chen Yuxia Geng Zhuo Chen Jeff\u00a0Z. Pan Yuan He Wen Zhang Ian Horrocks and Huajun Chen. 2021. Low-resource Learning with Knowledge Graphs: A Comprehensive Survey. CoRR abs\/2112.10006(2021)."},{"key":"e_1_3_2_1_10_1","volume-title":"Exploring Simple Siamese Representation Learning","author":"Chen Xinlei","unstructured":"Xinlei Chen and Kaiming He. 2021. Exploring Simple Siamese Representation Learning . In CVPR. Computer Vision Foundation \/ IEEE , 15750\u201315758. Xinlei Chen and Kaiming He. 2021. Exploring Simple Siamese Representation Learning. In CVPR. Computer Vision Foundation \/ IEEE, 15750\u201315758."},{"key":"e_1_3_2_1_11_1","volume-title":"ISWC(Lecture Notes in Computer Science, Vol.\u00a012922)","author":"Chen Zhuo","unstructured":"Zhuo Chen , Jiaoyan Chen , Yuxia Geng , Jeff\u00a0 Z. Pan , Zonggang Yuan , and Huajun Chen . 2021. Zero-Shot Visual Question Answering Using Knowledge Graph . In ISWC(Lecture Notes in Computer Science, Vol.\u00a012922) . Springer , 146\u2013162. Zhuo Chen, Jiaoyan Chen, Yuxia Geng, Jeff\u00a0Z. Pan, Zonggang Yuan, and Huajun Chen. 2021. Zero-Shot Visual Question Answering Using Knowledge Graph. In ISWC(Lecture Notes in Computer Science, Vol.\u00a012922). Springer, 146\u2013162."},{"key":"e_1_3_2_1_12_1","volume-title":"PMLR","author":"Cho Jaemin","year":"2021","unstructured":"Jaemin Cho , Jie Lei , Hao Tan , and Mohit Bansal . 2021 . Unifying Vision-and-Language Tasks via Text Generation. In ICML(Proceedings of Machine Learning Research, Vol.\u00a0139) . PMLR , 1931\u20131942. Jaemin Cho, Jie Lei, Hao Tan, and Mohit Bansal. 2021. Unifying Vision-and-Language Tasks via Text Generation. In ICML(Proceedings of Machine Learning Research, Vol.\u00a0139). PMLR, 1931\u20131942."},{"key":"e_1_3_2_1_13_1","volume-title":"Introduction to algorithms","author":"Cormen H","unstructured":"Thomas\u00a0 H Cormen , Charles\u00a0 E Leiserson , Ronald\u00a0 L Rivest , and Clifford Stein . 2022. Introduction to algorithms . MIT press . Thomas\u00a0H Cormen, Charles\u00a0E Leiserson, Ronald\u00a0L Rivest, and Clifford Stein. 2022. Introduction to algorithms. MIT press."},{"key":"e_1_3_2_1_14_1","volume-title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. In NAACL-HLT (1)","author":"Devlin Jacob","year":"2019","unstructured":"Jacob Devlin , Ming-Wei Chang , Kenton Lee , and Kristina Toutanova . 2019 . BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. In NAACL-HLT (1) . Association for Computational Linguistics , 4171\u20134186. Jacob Devlin, Ming-Wei Chang, Kenton Lee, and Kristina Toutanova. 2019. BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. In NAACL-HLT (1). Association for Computational Linguistics, 4171\u20134186."},{"key":"e_1_3_2_1_15_1","doi-asserted-by":"crossref","unstructured":"Feng Gao Qing Ping Govind Thattai Aishwarya\u00a0N. Reganti Ying\u00a0Nian Wu and Prem Natarajan. 2022. A Thousand Words Are Worth More Than a Picture: Natural Language-Centric Outside-Knowledge Visual Question Answering. CoRR abs\/2201.05299(2022). Feng Gao Qing Ping Govind Thattai Aishwarya\u00a0N. Reganti Ying\u00a0Nian Wu and Prem Natarajan. 2022. A Thousand Words Are Worth More Than a Picture: Natural Language-Centric Outside-Knowledge Visual Question Answering. CoRR abs\/2201.05299(2022).","DOI":"10.1109\/CVPR52688.2022.00501"},{"key":"e_1_3_2_1_16_1","volume-title":"ACL\/IJCNLP (1)","author":"Gao Tianyu","unstructured":"Tianyu Gao , Adam Fisch , and Danqi Chen . 2021. Making Pre-trained Language Models Better Few-shot Learners . In ACL\/IJCNLP (1) . Association for Computational Linguistics , 3816\u20133830. Tianyu Gao, Adam Fisch, and Danqi Chen. 2021. Making Pre-trained Language Models Better Few-shot Learners. In ACL\/IJCNLP (1). Association for Computational Linguistics, 3816\u20133830."},{"key":"e_1_3_2_1_17_1","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2020.findings-emnlp.44"},{"key":"e_1_3_2_1_18_1","doi-asserted-by":"crossref","unstructured":"Yuxia Geng Jiaoyan Chen Zhuo Chen Jeff\u00a0Z. Pan Zhiquan Ye Zonggang Yuan Yantao Jia and Huajun Chen. 2021. OntoZSL: Ontology-enhanced Zero-shot Learning. In WWW. ACM \/ IW3C2 3325\u20133336. Yuxia Geng Jiaoyan Chen Zhuo Chen Jeff\u00a0Z. Pan Zhiquan Ye Zonggang Yuan Yantao Jia and Huajun Chen. 2021. OntoZSL: Ontology-enhanced Zero-shot Learning. In WWW. ACM \/ IW3C2 3325\u20133336.","DOI":"10.1145\/3442381.3450042"},{"key":"e_1_3_2_1_19_1","unstructured":"Yuxia Geng Jiaoyan Chen Zhuo Chen Jeff\u00a0Z. Pan Zonggang Yuan and Huajun Chen. 2021. K-ZSL: Resources for Knowledge-driven Zero-shot Learning. CoRR abs\/2106.15047(2021). Yuxia Geng Jiaoyan Chen Zhuo Chen Jeff\u00a0Z. Pan Zonggang Yuan and Huajun Chen. 2021. K-ZSL: Resources for Knowledge-driven Zero-shot Learning. CoRR abs\/2106.15047(2021)."},{"key":"e_1_3_2_1_20_1","volume-title":"KAT: A Knowledge Augmented Transformer for Vision-and-Language","author":"Gui Liangke","year":"2022","unstructured":"Liangke Gui , Borui Wang , Qiuyuan Huang , Alexander Hauptmann , Yonatan Bisk , and Jianfeng Gao . 2022 . KAT: A Knowledge Augmented Transformer for Vision-and-Language . In NAACL-HLT. Association for Computational Linguistics , 956\u2013968. Liangke Gui, Borui Wang, Qiuyuan Huang, Alexander Hauptmann, Yonatan Bisk, and Jianfeng Gao. 2022. KAT: A Knowledge Augmented Transformer for Vision-and-Language. In NAACL-HLT. Association for Computational Linguistics, 956\u2013968."},{"key":"e_1_3_2_1_21_1","volume-title":"Deep Residual Learning for Image Recognition","author":"He Kaiming","unstructured":"Kaiming He , Xiangyu Zhang , Shaoqing Ren , and Jian Sun . 2016. Deep Residual Learning for Image Recognition . In CVPR. IEEE Computer Society , 770\u2013778. Kaiming He, Xiangyu Zhang, Shaoqing Ren, and Jian Sun. 2016. Deep Residual Learning for Image Recognition. In CVPR. IEEE Computer Society, 770\u2013778."},{"key":"e_1_3_2_1_22_1","volume-title":"Storage Capacity, and Paraphrased Queries","author":"Heinzerling Benjamin","unstructured":"Benjamin Heinzerling and Kentaro Inui . 2021. Language Models as Knowledge Bases: On Entity Representations , Storage Capacity, and Paraphrased Queries . In EACL. Association for Computational Linguistics , 1772\u20131791. Benjamin Heinzerling and Kentaro Inui. 2021. Language Models as Knowledge Bases: On Entity Representations, Storage Capacity, and Paraphrased Queries. In EACL. Association for Computational Linguistics, 1772\u20131791."},{"key":"e_1_3_2_1_23_1","unstructured":"Gautier Izacard and Edouard Grave. 2021. Distilling Knowledge from Reader to Retriever for Question Answering. In ICLR. Gautier Izacard and Edouard Grave. 2021. Distilling Knowledge from Reader to Retriever for Question Answering. In ICLR."},{"key":"e_1_3_2_1_24_1","volume-title":"Leveraging Passage Retrieval with Generative Models for Open Domain Question Answering","author":"Izacard Gautier","unstructured":"Gautier Izacard and Edouard Grave . 2021. Leveraging Passage Retrieval with Generative Models for Open Domain Question Answering . In EACL. Association for Computational Linguistics , 874\u2013880. Gautier Izacard and Edouard Grave. 2021. Leveraging Passage Retrieval with Generative Models for Open Domain Question Answering. In EACL. Association for Computational Linguistics, 874\u2013880."},{"key":"e_1_3_2_1_25_1","doi-asserted-by":"crossref","unstructured":"Aman Jain Mayank Kothyari Vishwajeet Kumar Preethi Jyothi Ganesh Ramakrishnan and Soumen Chakrabarti. 2021. Select Substitute Search: A New Benchmark for Knowledge-Augmented Visual Question Answering. In SIGIR. ACM 2491\u20132498. Aman Jain Mayank Kothyari Vishwajeet Kumar Preethi Jyothi Ganesh Ramakrishnan and Soumen Chakrabarti. 2021. Select Substitute Search: A New Benchmark for Knowledge-Augmented Visual Question Answering. In SIGIR. ACM 2491\u20132498.","DOI":"10.1145\/3404835.3463259"},{"key":"e_1_3_2_1_26_1","doi-asserted-by":"publisher","DOI":"10.1109\/TBDATA.2019.2921572"},{"key":"e_1_3_2_1_27_1","volume-title":"EMNLP (1)","author":"Karpukhin Vladimir","unstructured":"Vladimir Karpukhin , Barlas Oguz , Sewon Min , Patrick S.\u00a0H. Lewis , Ledell Wu , Sergey Edunov , Danqi Chen , and Wen-tau Yih. 2020. Dense Passage Retrieval for Open-Domain Question Answering . In EMNLP (1) . Association for Computational Linguistics , 6769\u20136781. Vladimir Karpukhin, Barlas Oguz, Sewon Min, Patrick S.\u00a0H. Lewis, Ledell Wu, Sergey Edunov, Danqi Chen, and Wen-tau Yih. 2020. Dense Passage Retrieval for Open-Domain Question Answering. In EMNLP (1). Association for Computational Linguistics, 6769\u20136781."},{"key":"e_1_3_2_1_28_1","unstructured":"Jin-Hwa Kim Jaehyun Jun and Byoung-Tak Zhang. 2018. Bilinear Attention Networks. In NeurIPS. 1571\u20131581. Jin-Hwa Kim Jaehyun Jun and Byoung-Tak Zhang. 2018. Bilinear Attention Networks. In NeurIPS. 1571\u20131581."},{"key":"e_1_3_2_1_29_1","volume-title":"BART: Denoising Sequence-to-Sequence Pre-training for Natural Language Generation, Translation, and Comprehension","author":"Lewis Mike","year":"2020","unstructured":"Mike Lewis , Yinhan Liu , Naman Goyal , Marjan Ghazvininejad , Abdelrahman Mohamed , Omer Levy , Veselin Stoyanov , and Luke Zettlemoyer . 2020 . BART: Denoising Sequence-to-Sequence Pre-training for Natural Language Generation, Translation, and Comprehension . In ACL. Association for Computational Linguistics , 7871\u20137880. Mike Lewis, Yinhan Liu, Naman Goyal, Marjan Ghazvininejad, Abdelrahman Mohamed, Omer Levy, Veselin Stoyanov, and Luke Zettlemoyer. 2020. BART: Denoising Sequence-to-Sequence Pre-training for Natural Language Generation, Translation, and Comprehension. In ACL. Association for Computational Linguistics, 7871\u20137880."},{"key":"e_1_3_2_1_30_1","doi-asserted-by":"crossref","unstructured":"Guohao Li Xin Wang and Wenwu Zhu. 2020. Boosting Visual Question Answering with Context-aware Knowledge Aggregation. In ACM Multimedia. ACM 1227\u20131235. Guohao Li Xin Wang and Wenwu Zhu. 2020. Boosting Visual Question Answering with Context-aware Knowledge Aggregation. In ACM Multimedia. ACM 1227\u20131235.","DOI":"10.1145\/3394171.3413943"},{"key":"e_1_3_2_1_31_1","unstructured":"Liunian\u00a0Harold Li Mark Yatskar Da Yin Cho-Jui Hsieh and Kai-Wei Chang. 2019. VisualBERT: A Simple and Performant Baseline for Vision and Language. CoRR abs\/1908.03557(2019). Liunian\u00a0Harold Li Mark Yatskar Da Yin Cho-Jui Hsieh and Kai-Wei Chang. 2019. VisualBERT: A Simple and Performant Baseline for Vision and Language. CoRR abs\/1908.03557(2019)."},{"key":"e_1_3_2_1_32_1","volume-title":"UNIMO: Towards Unified-Modal Understanding and Generation via Cross-Modal Contrastive Learning. In ACL\/IJCNLP (1)","author":"Li Wei","year":"2021","unstructured":"Wei Li , Can Gao , Guocheng Niu , Xinyan Xiao , Hao Liu , Jiachen Liu , Hua Wu , and Haifeng Wang . 2021 . UNIMO: Towards Unified-Modal Understanding and Generation via Cross-Modal Contrastive Learning. In ACL\/IJCNLP (1) . Association for Computational Linguistics , 2592\u20132607. Wei Li, Can Gao, Guocheng Niu, Xinyan Xiao, Hao Liu, Jiachen Liu, Hua Wu, and Haifeng Wang. 2021. UNIMO: Towards Unified-Modal Understanding and Generation via Cross-Modal Contrastive Learning. In ACL\/IJCNLP (1). Association for Computational Linguistics, 2592\u20132607."},{"key":"e_1_3_2_1_33_1","volume-title":"Oscar: Object-Semantics Aligned Pre-training for Vision-Language Tasks. In ECCV (30)(Lecture Notes in Computer Science, Vol.\u00a012375)","author":"Li Xiujun","year":"2020","unstructured":"Xiujun Li , Xi Yin , Chunyuan Li , Pengchuan Zhang , Xiaowei Hu , Lei Zhang , Lijuan Wang , Houdong Hu , Li Dong , Furu Wei , Yejin Choi , and Jianfeng Gao . 2020 . Oscar: Object-Semantics Aligned Pre-training for Vision-Language Tasks. In ECCV (30)(Lecture Notes in Computer Science, Vol.\u00a012375) . Springer , 121\u2013137. Xiujun Li, Xi Yin, Chunyuan Li, Pengchuan Zhang, Xiaowei Hu, Lei Zhang, Lijuan Wang, Houdong Hu, Li Dong, Furu Wei, Yejin Choi, and Jianfeng Gao. 2020. Oscar: Object-Semantics Aligned Pre-training for Vision-Language Tasks. In ECCV (30)(Lecture Notes in Computer Science, Vol.\u00a012375). Springer, 121\u2013137."},{"key":"e_1_3_2_1_34_1","unstructured":"Weizhe Lin and Bill Byrne. 2022. Retrieval Augmented Visual Question Answering with Outside Knowledge. CoRR abs\/2210.03809(2022). Weizhe Lin and Bill Byrne. 2022. Retrieval Augmented Visual Question Answering with Outside Knowledge. CoRR abs\/2210.03809(2022)."},{"key":"e_1_3_2_1_35_1","volume-title":"REVIVE: Regional Visual Representation Matters in Knowledge-Based Visual Question Answering. CoRR abs\/2206.01201(2022).","author":"Lin Yuanze","year":"2022","unstructured":"Yuanze Lin , Yujia Xie , Dongdong Chen , Yichong Xu , Chenguang Zhu , and Lu Yuan . 2022 . REVIVE: Regional Visual Representation Matters in Knowledge-Based Visual Question Answering. CoRR abs\/2206.01201(2022). Yuanze Lin, Yujia Xie, Dongdong Chen, Yichong Xu, Chenguang Zhu, and Lu Yuan. 2022. REVIVE: Regional Visual Representation Matters in Knowledge-Based Visual Question Answering. CoRR abs\/2206.01201(2022)."},{"key":"e_1_3_2_1_36_1","unstructured":"Yinhan Liu Myle Ott Naman Goyal Jingfei Du Mandar Joshi Danqi Chen Omer Levy Mike Lewis Luke Zettlemoyer and Veselin Stoyanov. 2019. RoBERTa: A Robustly Optimized BERT Pretraining Approach. CoRR abs\/1907.11692(2019). Yinhan Liu Myle Ott Naman Goyal Jingfei Du Mandar Joshi Danqi Chen Omer Levy Mike Lewis Luke Zettlemoyer and Veselin Stoyanov. 2019. RoBERTa: A Robustly Optimized BERT Pretraining Approach. CoRR abs\/1907.11692(2019)."},{"key":"e_1_3_2_1_37_1","unstructured":"Jiasen Lu Dhruv Batra Devi Parikh and Stefan Lee. 2019. ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks. In NeurIPS. 13\u201323. Jiasen Lu Dhruv Batra Devi Parikh and Stefan Lee. 2019. ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks. In NeurIPS. 13\u201323."},{"key":"e_1_3_2_1_38_1","volume-title":"Weakly-Supervised Visual-Retriever-Reader for Knowledge-based Question Answering. EMNLP","author":"Luo Man","year":"2021","unstructured":"Man Luo , Yankai Zeng , Pratyay Banerjee , and Chitta Baral . 2021. Weakly-Supervised Visual-Retriever-Reader for Knowledge-based Question Answering. EMNLP ( 2021 ). Man Luo, Yankai Zeng, Pratyay Banerjee, and Chitta Baral. 2021. Weakly-Supervised Visual-Retriever-Reader for Knowledge-based Question Answering. EMNLP (2021)."},{"key":"e_1_3_2_1_39_1","volume-title":"KRISP","author":"Marino Kenneth","year":"2021","unstructured":"Kenneth Marino , Xinlei Chen , Devi Parikh , Abhinav Gupta , and Marcus Rohrbach . 2021 . KRISP : Integrating Implicit and Symbolic Knowledge for Open-Domain Knowledge-Based VQA. In CVPR. Computer Vision Foundation \/ IEEE , 14111\u201314121. Kenneth Marino, Xinlei Chen, Devi Parikh, Abhinav Gupta, and Marcus Rohrbach. 2021. KRISP: Integrating Implicit and Symbolic Knowledge for Open-Domain Knowledge-Based VQA. In CVPR. Computer Vision Foundation \/ IEEE, 14111\u201314121."},{"key":"e_1_3_2_1_40_1","volume-title":"OK-VQA: A Visual Question Answering Benchmark Requiring External Knowledge","author":"Marino Kenneth","unstructured":"Kenneth Marino , Mohammad Rastegari , Ali Farhadi , and Roozbeh Mottaghi . 2019. OK-VQA: A Visual Question Answering Benchmark Requiring External Knowledge . In CVPR. Computer Vision Foundation \/ IEEE , 3195\u20133204. Kenneth Marino, Mohammad Rastegari, Ali Farhadi, and Roozbeh Mottaghi. 2019. OK-VQA: A Visual Question Answering Benchmark Requiring External Knowledge. In CVPR. Computer Vision Foundation \/ IEEE, 3195\u20133204."},{"key":"e_1_3_2_1_41_1","unstructured":"Medhini Narasimhan Svetlana Lazebnik and Alexander\u00a0G. Schwing. 2018. Out of the Box: Reasoning with Graph Convolution Nets for Factual Visual Question Answering. In NeurIPS. 2659\u20132670. Medhini Narasimhan Svetlana Lazebnik and Alexander\u00a0G. Schwing. 2018. Out of the Box: Reasoning with Graph Convolution Nets for Factual Visual Question Answering. In NeurIPS. 2659\u20132670."},{"key":"e_1_3_2_1_42_1","unstructured":"Fabio Petroni Patrick S.\u00a0H. Lewis Aleksandra Piktus Tim Rockt\u00e4schel Yuxiang Wu Alexander\u00a0H. Miller and Sebastian Riedel. 2020. How Context Affects Language Models\u2019 Factual Predictions. In AKBC. Fabio Petroni Patrick S.\u00a0H. Lewis Aleksandra Piktus Tim Rockt\u00e4schel Yuxiang Wu Alexander\u00a0H. Miller and Sebastian Riedel. 2020. How Context Affects Language Models\u2019 Factual Predictions. In AKBC."},{"key":"e_1_3_2_1_43_1","volume-title":"EMNLP\/IJCNLP (1)","author":"Petroni Fabio","unstructured":"Fabio Petroni , Tim Rockt\u00e4schel , Sebastian Riedel , Patrick S.\u00a0H. Lewis , Anton Bakhtin , Yuxiang Wu , and Alexander\u00a0 H. Miller . 2019. Language Models as Knowledge Bases? . In EMNLP\/IJCNLP (1) . Association for Computational Linguistics , 2463\u20132473. Fabio Petroni, Tim Rockt\u00e4schel, Sebastian Riedel, Patrick S.\u00a0H. Lewis, Anton Bakhtin, Yuxiang Wu, and Alexander\u00a0H. Miller. 2019. Language Models as Knowledge Bases?. In EMNLP\/IJCNLP (1). Association for Computational Linguistics, 2463\u20132473."},{"key":"e_1_3_2_1_44_1","unstructured":"Chen Qu Hamed Zamani Liu Yang W.\u00a0Bruce Croft and Erik\u00a0G. Learned-Miller. 2021. Passage Retrieval for Outside-Knowledge Visual Question Answering. In SIGIR. ACM 1753\u20131757. Chen Qu Hamed Zamani Liu Yang W.\u00a0Bruce Croft and Erik\u00a0G. Learned-Miller. 2021. Passage Retrieval for Outside-Knowledge Visual Question Answering. In SIGIR. ACM 1753\u20131757."},{"key":"e_1_3_2_1_45_1","unstructured":"Sahithya Ravi Aditya Chinchure Leonid Sigal Renjie Liao and Vered Shwartz. 2022. VLC-BERT: Visual Question Answering with Contextualized Commonsense Knowledge. CoRR abs\/2210.13626(2022). Sahithya Ravi Aditya Chinchure Leonid Sigal Renjie Liao and Vered Shwartz. 2022. VLC-BERT: Visual Question Answering with Contextualized Commonsense Knowledge. CoRR abs\/2210.13626(2022)."},{"key":"e_1_3_2_1_46_1","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2016.2577031"},{"key":"e_1_3_2_1_47_1","volume-title":"EMNLP (1)","author":"Roberts Adam","unstructured":"Adam Roberts , Colin Raffel , and Noam Shazeer . 2020. How Much Knowledge Can You Pack Into the Parameters of a Language Model? . In EMNLP (1) . Association for Computational Linguistics , 5418\u20135426. Adam Roberts, Colin Raffel, and Noam Shazeer. 2020. How Much Knowledge Can You Pack Into the Parameters of a Language Model?. In EMNLP (1). Association for Computational Linguistics, 5418\u20135426."},{"key":"e_1_3_2_1_48_1","doi-asserted-by":"publisher","DOI":"10.1561\/1500000019"},{"key":"e_1_3_2_1_49_1","unstructured":"Ander Salaberria Gorka Azkune Oier\u00a0Lopez de Lacalle Aitor Soroa and Eneko Agirre. 2021. Image Captioning for Effective Use of Language Models in Knowledge-Based Visual Question Answering. CoRR abs\/2109.08029(2021). Ander Salaberria Gorka Azkune Oier\u00a0Lopez de Lacalle Aitor Soroa and Eneko Agirre. 2021. Image Captioning for Effective Use of Language Models in Knowledge-Based Visual Question Answering. CoRR abs\/2109.08029(2021)."},{"key":"e_1_3_2_1_50_1","volume-title":"Ivan Titov, and Max Welling.","author":"Schlichtkrull Michael\u00a0Sejr","year":"2018","unstructured":"Michael\u00a0Sejr Schlichtkrull , Thomas\u00a0 N. Kipf , Peter Bloem , Rianne van\u00a0den Berg , Ivan Titov, and Max Welling. 2018 . Modeling Relational Data with Graph Convolutional Networks. In ESWC(Lecture Notes in Computer Science, Vol.\u00a010843). Springer , 593\u2013607. Michael\u00a0Sejr Schlichtkrull, Thomas\u00a0N. Kipf, Peter Bloem, Rianne van\u00a0den Berg, Ivan Titov, and Max Welling. 2018. Modeling Relational Data with Graph Convolutional Networks. In ESWC(Lecture Notes in Computer Science, Vol.\u00a010843). Springer, 593\u2013607."},{"key":"e_1_3_2_1_51_1","volume-title":"KVQA: Knowledge-Aware Visual Question Answering","author":"Shah Sanket","year":"2019","unstructured":"Sanket Shah , Anand Mishra , Naganand Yadati , and Partha\u00a0Pratim Talukdar . 2019 . KVQA: Knowledge-Aware Visual Question Answering . In AAAI. AAAI Press , 8876\u20138884. Sanket Shah, Anand Mishra, Naganand Yadati, and Partha\u00a0Pratim Talukdar. 2019. KVQA: Knowledge-Aware Visual Question Answering. In AAAI. AAAI Press, 8876\u20138884."},{"key":"e_1_3_2_1_52_1","unstructured":"Sheng Shen Chunyuan Li Xiaowei Hu Yujia Xie Jianwei Yang Pengchuan Zhang Anna Rohrbach Zhe Gan Lijuan Wang Lu Yuan Ce Liu Kurt Keutzer Trevor Darrell and Jianfeng Gao. 2022. K-LITE: Learning Transferable Visual Models with External Knowledge. CoRR abs\/2204.09222(2022). Sheng Shen Chunyuan Li Xiaowei Hu Yujia Xie Jianwei Yang Pengchuan Zhang Anna Rohrbach Zhe Gan Lijuan Wang Lu Yuan Ce Liu Kurt Keutzer Trevor Darrell and Jianfeng Gao. 2022. K-LITE: Learning Transferable Visual Models with External Knowledge. CoRR abs\/2204.09222(2022)."},{"key":"e_1_3_2_1_53_1","unstructured":"Violetta Shevchenko Damien Teney Anthony\u00a0R. Dick and Anton van\u00a0den Hengel. 2021. Reasoning over Vision and Language: Exploring the Benefits of Supplemental Knowledge. CoRR abs\/2101.06013(2021). Violetta Shevchenko Damien Teney Anthony\u00a0R. Dick and Anton van\u00a0den Hengel. 2021. Reasoning over Vision and Language: Exploring the Benefits of Supplemental Knowledge. CoRR abs\/2101.06013(2021)."},{"key":"e_1_3_2_1_54_1","volume-title":"Meet Shah, Marcus Rohrbach, Dhruv Batra, and Devi Parikh.","author":"Singh Amanpreet","year":"2020","unstructured":"Amanpreet Singh , Vedanuj Goswami , Vivek Natarajan , Yu Jiang , Xinlei Chen , Meet Shah, Marcus Rohrbach, Dhruv Batra, and Devi Parikh. 2020 . Mmf : A multimodal framework for vision and language research. Amanpreet Singh, Vedanuj Goswami, Vivek Natarajan, Yu Jiang, Xinlei Chen, Meet Shah, Marcus Rohrbach, Dhruv Batra, and Devi Parikh. 2020. Mmf: A multimodal framework for vision and language research."},{"key":"e_1_3_2_1_55_1","volume-title":"An Open Multilingual Graph of General Knowledge","author":"Speer Robyn","unstructured":"Robyn Speer , Joshua Chin , and Catherine Havasi . 2017. ConceptNet 5.5 : An Open Multilingual Graph of General Knowledge . In AAAI. AAAI Press , 4444\u20134451. Robyn Speer, Joshua Chin, and Catherine Havasi. 2017. ConceptNet 5.5: An Open Multilingual Graph of General Knowledge. In AAAI. AAAI Press, 4444\u20134451."},{"key":"e_1_3_2_1_56_1","volume-title":"LXMERT: Learning Cross-Modality Encoder Representations from Transformers. In EMNLP\/IJCNLP (1)","author":"Tan Hao","year":"2019","unstructured":"Hao Tan and Mohit Bansal . 2019 . LXMERT: Learning Cross-Modality Encoder Representations from Transformers. In EMNLP\/IJCNLP (1) . Association for Computational Linguistics , 5099\u20135110. Hao Tan and Mohit Bansal. 2019. LXMERT: Learning Cross-Modality Encoder Representations from Transformers. In EMNLP\/IJCNLP (1). Association for Computational Linguistics, 5099\u20135110."},{"key":"e_1_3_2_1_57_1","volume-title":"ACL (System Demonstrations)","author":"Tandon Niket","unstructured":"Niket Tandon , Gerard de Melo , and Gerhard Weikum . 2017. WebChild 2.0 : Fine-Grained Commonsense Knowledge Distillation . In ACL (System Demonstrations) . Association for Computational Linguistics , 115\u2013120. Niket Tandon, Gerard de Melo, and Gerhard Weikum. 2017. WebChild 2.0 : Fine-Grained Commonsense Knowledge Distillation. In ACL (System Demonstrations). Association for Computational Linguistics, 115\u2013120."},{"key":"e_1_3_2_1_58_1","volume-title":"Tips and Tricks for Visual Question Answering: Learnings From the 2017 Challenge","author":"Teney Damien","unstructured":"Damien Teney , Peter Anderson , Xiaodong He , and Anton van\u00a0den Hengel . 2018. Tips and Tricks for Visual Question Answering: Learnings From the 2017 Challenge . In CVPR. Computer Vision Foundation \/ IEEE Computer Society , 4223\u20134232. Damien Teney, Peter Anderson, Xiaodong He, and Anton van\u00a0den Hengel. 2018. Tips and Tricks for Visual Question Answering: Learnings From the 2017 Challenge. In CVPR. Computer Vision Foundation \/ IEEE Computer Society, 4223\u20134232."},{"key":"e_1_3_2_1_59_1","unstructured":"Maria Tsimpoukelli Jacob Menick Serkan Cabi S.\u00a0M.\u00a0Ali Eslami Oriol Vinyals and Felix Hill. 2021. Multimodal Few-Shot Learning with Frozen Language Models Vol.\u00a034. 200\u2013212. Maria Tsimpoukelli Jacob Menick Serkan Cabi S.\u00a0M.\u00a0Ali Eslami Oriol Vinyals and Felix Hill. 2021. Multimodal Few-Shot Learning with Frozen Language Models Vol.\u00a034. 200\u2013212."},{"key":"e_1_3_2_1_60_1","unstructured":"Ashish Vaswani Noam Shazeer Niki Parmar Jakob Uszkoreit Llion Jones Aidan\u00a0N. Gomez Lukasz Kaiser and Illia Polosukhin. 2017. Attention is All you Need. In NIPS. 5998\u20136008. Ashish Vaswani Noam Shazeer Niki Parmar Jakob Uszkoreit Llion Jones Aidan\u00a0N. Gomez Lukasz Kaiser and Illia Polosukhin. 2017. Attention is All you Need. In NIPS. 5998\u20136008."},{"key":"e_1_3_2_1_61_1","unstructured":"Andreas Veit Tomas Matera Lukas Neumann Jiri Matas and Serge\u00a0J. Belongie. 2016. COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images. CoRR abs\/1601.07140(2016). Andreas Veit Tomas Matera Lukas Neumann Jiri Matas and Serge\u00a0J. Belongie. 2016. COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images. CoRR abs\/1601.07140(2016)."},{"key":"e_1_3_2_1_62_1","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2017.2754246"},{"key":"e_1_3_2_1_63_1","volume-title":"OFA: Unifying Architectures, Tasks, and Modalities Through a Simple Sequence-to-Sequence Learning Framework. In ICML(Proceedings of Machine Learning Research, Vol.\u00a0162). PMLR, 23318\u201323340.","author":"Wang Peng","year":"2022","unstructured":"Peng Wang , An Yang , Rui Men , Junyang Lin , Shuai Bai , Zhikang Li , Jianxin Ma , Chang Zhou , Jingren Zhou , and Hongxia Yang . 2022 . OFA: Unifying Architectures, Tasks, and Modalities Through a Simple Sequence-to-Sequence Learning Framework. In ICML(Proceedings of Machine Learning Research, Vol.\u00a0162). PMLR, 23318\u201323340. Peng Wang, An Yang, Rui Men, Junyang Lin, Shuai Bai, Zhikang Li, Jianxin Ma, Chang Zhou, Jingren Zhou, and Hongxia Yang. 2022. OFA: Unifying Architectures, Tasks, and Modalities Through a Simple Sequence-to-Sequence Learning Framework. In ICML(Proceedings of Machine Learning Research, Vol.\u00a0162). PMLR, 23318\u201323340."},{"key":"e_1_3_2_1_64_1","volume-title":"Multi-Modal Answer Validation for Knowledge-Based VQA","author":"Wu Jialin","unstructured":"Jialin Wu , Jiasen Lu , Ashish Sabharwal , and Roozbeh Mottaghi . 2022. Multi-Modal Answer Validation for Knowledge-Based VQA . In AAAI. AAAI Press . Jialin Wu, Jiasen Lu, Ashish Sabharwal, and Roozbeh Mottaghi. 2022. Multi-Modal Answer Validation for Knowledge-Based VQA. In AAAI. AAAI Press."},{"key":"e_1_3_2_1_65_1","unstructured":"Zhengyuan Yang Zhe Gan Jianfeng Wang Xiaowei Hu Yumao Lu Zicheng Liu and Lijuan Wang. 2021. An Empirical Study of GPT-3 for Few-Shot Knowledge-Based VQA. CoRR abs\/2109.05014(2021). Zhengyuan Yang Zhe Gan Jianfeng Wang Xiaowei Hu Yumao Lu Zicheng Liu and Lijuan Wang. 2021. An Empirical Study of GPT-3 for Few-Shot Knowledge-Based VQA. CoRR abs\/2109.05014(2021)."},{"key":"e_1_3_2_1_66_1","volume-title":"ERNIE-ViL: Knowledge Enhanced Vision-Language Representations through Scene Graphs","author":"Yu Fei","unstructured":"Fei Yu , Jiji Tang , Weichong Yin , Yu Sun , Hao Tian , Hua Wu , and Haifeng Wang . 2021. ERNIE-ViL: Knowledge Enhanced Vision-Language Representations through Scene Graphs . In AAAI. AAAI Press , 3208\u20133216. Fei Yu, Jiji Tang, Weichong Yin, Yu Sun, Hao Tian, Hua Wu, and Haifeng Wang. 2021. ERNIE-ViL: Knowledge Enhanced Vision-Language Representations through Scene Graphs. In AAAI. AAAI Press, 3208\u20133216."},{"key":"e_1_3_2_1_67_1","volume-title":"VinVL: Revisiting Visual Representations in Vision-Language Models","author":"Zhang Pengchuan","unstructured":"Pengchuan Zhang , Xiujun Li , Xiaowei Hu , Jianwei Yang , Lei Zhang , Lijuan Wang , Yejin Choi , and Jianfeng Gao . 2021. VinVL: Revisiting Visual Representations in Vision-Language Models . In CVPR. Computer Vision Foundation \/ IEEE , 5579\u20135588. Pengchuan Zhang, Xiujun Li, Xiaowei Hu, Jianwei Yang, Lei Zhang, Lijuan Wang, Yejin Choi, and Jianfeng Gao. 2021. VinVL: Revisiting Visual Representations in Vision-Language Models. In CVPR. Computer Vision Foundation \/ IEEE, 5579\u20135588."},{"key":"e_1_3_2_1_68_1","volume-title":"Mucko: Multi-Layer Cross-Modal Knowledge Reasoning for Fact-based Visual Question Answering. In IJCAI. ijcai.org, 1097\u20131103.","author":"Zhu Zihao","year":"2020","unstructured":"Zihao Zhu , Jing Yu , Yujing Wang , Yajing Sun , Yue Hu , and Qi Wu . 2020 . Mucko: Multi-Layer Cross-Modal Knowledge Reasoning for Fact-based Visual Question Answering. In IJCAI. ijcai.org, 1097\u20131103. Zihao Zhu, Jing Yu, Yujing Wang, Yajing Sun, Yue Hu, and Qi Wu. 2020. Mucko: Multi-Layer Cross-Modal Knowledge Reasoning for Fact-based Visual Question Answering. In IJCAI. ijcai.org, 1097\u20131103."}],"event":{"name":"IJCKG 2022: 11th International Joint Conference On Knowledge Graphs","location":"Hangzhou China","acronym":"IJCKG 2022"},"container-title":["Proceedings of the 11th International Joint Conference on Knowledge Graphs"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3579051.3579053","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3579051.3579053","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,17]],"date-time":"2025-06-17T16:38:05Z","timestamp":1750178285000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3579051.3579053"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2022,10,27]]},"references-count":68,"alternative-id":["10.1145\/3579051.3579053","10.1145\/3579051"],"URL":"https:\/\/doi.org\/10.1145\/3579051.3579053","relation":{},"subject":[],"published":{"date-parts":[[2022,10,27]]},"assertion":[{"value":"2023-02-13","order":2,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}