{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,18]],"date-time":"2026-05-18T11:26:32Z","timestamp":1779103592719,"version":"3.51.4"},"publisher-location":"New York, NY, USA","reference-count":51,"publisher":"ACM","license":[{"start":{"date-parts":[[2020,10,12]],"date-time":"2020-10-12T00:00:00Z","timestamp":1602460800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.acm.org\/publications\/policies\/copyright_policy#Background"}],"funder":[{"name":"Fundamental Research Funds for the Central Universities","award":["D2191240"],"award-info":[{"award-number":["D2191240"]}]},{"name":"Science and Technology Program of Guangzhou China under Grants","award":["202007030007"],"award-info":[{"award-number":["202007030007"]}]},{"name":"Key-Area Research and Development Program of Guangdong Province","award":["2019B010155001"],"award-info":[{"award-number":["2019B010155001"]}]},{"name":"National Natural Science Foundation of China (NSFC)","award":["61836003 (key project)"],"award-info":[{"award-number":["61836003 (key project)"]}]},{"name":"Guangdong","award":["2017ZT07X183"],"award-info":[{"award-number":["2017ZT07X183"]}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2020,10,12]]},"DOI":"10.1145\/3394171.3413924","type":"proceedings-article","created":{"date-parts":[[2020,10,12]],"date-time":"2020-10-12T12:26:25Z","timestamp":1602505585000},"page":"4060-4069","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":51,"title":["Cascade Reasoning Network for Text-based Visual Question Answering"],"prefix":"10.1145","author":[{"given":"Fen","family":"Liu","sequence":"first","affiliation":[{"name":"South China University of Technology, Guangzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Guanghui","family":"Xu","sequence":"additional","affiliation":[{"name":"South China University of Technology, Guangzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Qi","family":"Wu","sequence":"additional","affiliation":[{"name":"University of Adelaide, Adelaide, Australia"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Qing","family":"Du","sequence":"additional","affiliation":[{"name":"South China Univercity of Technology, Guangzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Wei","family":"Jia","sequence":"additional","affiliation":[{"name":"CVTE, Guangzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Mingkui","family":"Tan","sequence":"additional","affiliation":[{"name":"South China University of Technology, Guangzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2020,10,12]]},"reference":[{"key":"e_1_3_2_2_1_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00636"},{"key":"e_1_3_2_2_2_1","volume-title":"VQA: Visual Question Answering. In The IEEE International Conference on Computer Vision (ICCV).","author":"Antol Stanislaw","year":"2015","unstructured":"Stanislaw Antol , Aishwarya Agrawal , Jiasen Lu , Margaret Mitchell , Dhruv Batra , C. Lawrence Zitnick , and Devi Parikh . 2015 . VQA: Visual Question Answering. In The IEEE International Conference on Computer Vision (ICCV). Stanislaw Antol, Aishwarya Agrawal, Jiasen Lu, Margaret Mitchell, Dhruv Batra, C. Lawrence Zitnick, and Devi Parikh. 2015. VQA: Visual Question Answering. In The IEEE International Conference on Computer Vision (ICCV)."},{"key":"e_1_3_2_2_3_1","volume-title":"6th International Conference on Learning Representations, ICLR","author":"Artetxe Mikel","year":"2018","unstructured":"Mikel Artetxe , Gorka Labaka , Eneko Agirre , and Kyunghyun Cho . 2018. Unsupervised Neural Machine Translation . In 6th International Conference on Learning Representations, ICLR 2018 , Vancouver, BC , Canada, April 30 - May 3, 2018, Conference Track Proceedings. OpenReview .net. https:\/\/openreview.net\/forum?id=Sy2ogebAW Mikel Artetxe, Gorka Labaka, Eneko Agirre, and Kyunghyun Cho. 2018. Unsupervised Neural Machine Translation. In 6th International Conference on Learning Representations, ICLR 2018, Vancouver, BC, Canada, April 30 - May 3, 2018, Conference Track Proceedings. OpenReview.net. https:\/\/openreview.net\/forum?id=Sy2ogebAW"},{"key":"e_1_3_2_2_4_1","volume-title":"Jamie Ryan Kiros, and Geoffrey E. Hinton","author":"Ba Lei Jimmy","year":"2016","unstructured":"Lei Jimmy Ba , Jamie Ryan Kiros, and Geoffrey E. Hinton . 2016 . Layer Normalization. CoRR , Vol. abs\/ 1607 .06450 (2016). arxiv: 1607.06450 http:\/\/arxiv.org\/abs\/1607.06450 Lei Jimmy Ba, Jamie Ryan Kiros, and Geoffrey E. Hinton. 2016. Layer Normalization. CoRR, Vol. abs\/1607.06450 (2016). arxiv: 1607.06450 http:\/\/arxiv.org\/abs\/1607.06450"},{"key":"e_1_3_2_2_5_1","volume-title":"ICDAR 2019 Competition on Scene Text Visual Question Answering. 15th International Conference on Document Analysis and Recognition (ICDAR)","author":"Biten Ali Furkan","year":"2019","unstructured":"Ali Furkan Biten , Rub\u00e8n Tito , Andres Mafla , Lluis Gomez , Marcc al Rusi nol, Minesh Mathew , CV Jawahar , Ernest Valveny , and Dimosthenis Karatzas . 2019 a . ICDAR 2019 Competition on Scene Text Visual Question Answering. 15th International Conference on Document Analysis and Recognition (ICDAR) (2019). Ali Furkan Biten, Rub\u00e8n Tito, Andres Mafla, Lluis Gomez, Marcc al Rusi nol, Minesh Mathew, CV Jawahar, Ernest Valveny, and Dimosthenis Karatzas. 2019 a. ICDAR 2019 Competition on Scene Text Visual Question Answering. 15th International Conference on Document Analysis and Recognition (ICDAR) (2019)."},{"key":"e_1_3_2_2_6_1","volume-title":"Scene Text Visual Question Answering. The IEEE International Conference on Computer Vision (ICCV)","author":"Biten Ali Furkan","year":"2019","unstructured":"Ali Furkan Biten , Ruben Tito , Andres Mafla , Lluis Gomez , Marcc al Rusi nol, Ernest Valveny , CV Jawahar , and Dimosthenis Karatzas . 2019 b . Scene Text Visual Question Answering. The IEEE International Conference on Computer Vision (ICCV) (2019). Ali Furkan Biten, Ruben Tito, Andres Mafla, Lluis Gomez, Marcc al Rusi nol, Ernest Valveny, CV Jawahar, and Dimosthenis Karatzas. 2019 b. Scene Text Visual Question Answering. The IEEE International Conference on Computer Vision (ICCV) (2019)."},{"key":"e_1_3_2_2_7_1","doi-asserted-by":"publisher","DOI":"10.1145\/3219819.3219861"},{"key":"e_1_3_2_2_8_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00209"},{"key":"e_1_3_2_2_9_1","volume-title":"Iterative Visual Reasoning Beyond Convolutions. In The IEEE Conference on Computer Vision and Pattern Recognition (CVPR).","author":"Chen Xinlei","year":"2018","unstructured":"Xinlei Chen , Li-Jia Li , Li Fei-Fei , and Abhinav Gupta . 2018 . Iterative Visual Reasoning Beyond Convolutions. In The IEEE Conference on Computer Vision and Pattern Recognition (CVPR). Xinlei Chen, Li-Jia Li, Li Fei-Fei, and Abhinav Gupta. 2018. Iterative Visual Reasoning Beyond Convolutions. In The IEEE Conference on Computer Vision and Pattern Recognition (CVPR)."},{"key":"e_1_3_2_2_10_1","volume-title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. In The North American","author":"Devlin Jacob","year":"2019","unstructured":"Jacob Devlin , Ming-Wei Chang , Kenton Lee , and Kristina Toutanova . 2019 . BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. In The North American Chapter of the Association for Computational Linguistics (NAACL)-HLT. Jacob Devlin, Ming-Wei Chang, Kenton Lee, and Kristina Toutanova. 2019. BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. In The North American Chapter of the Association for Computational Linguistics (NAACL)-HLT."},{"key":"e_1_3_2_2_11_1","doi-asserted-by":"publisher","DOI":"10.1145\/3240508.3240527"},{"key":"e_1_3_2_2_12_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.201"},{"key":"e_1_3_2_2_13_1","volume-title":"Multi-Modal Graph Neural Network for Joint Reasoning on Vision and Scene Text. Computing Research Repository (CoRR)","author":"Gao Difei","year":"2020","unstructured":"Difei Gao , Ke Li , Ruiping Wang , Shiguang Shan , and Xilin Chen . 2020. Multi-Modal Graph Neural Network for Joint Reasoning on Vision and Scene Text. Computing Research Repository (CoRR) , Vol. abs\/ 2003 .13962 ( 2020 ). Difei Gao, Ke Li, Ruiping Wang, Shiguang Shan, and Xilin Chen. 2020. Multi-Modal Graph Neural Network for Joint Reasoning on Vision and Scene Text. Computing Research Repository (CoRR), Vol. abs\/2003.13962 (2020)."},{"key":"e_1_3_2_2_14_1","volume-title":"Dynamic Fusion With Intra-and Inter-Modality Attention Flow for Visual Question Answering. In The IEEE Conference on Computer Vision and Pattern Recognition (CVPR). 6639--6648","author":"Gao Peng","year":"2019","unstructured":"Peng Gao , Zhengkai Jiang , Haoxuan You , Pan Lu , Steven CH Hoi , Xiaogang Wang , and Hongsheng Li . 2019 . Dynamic Fusion With Intra-and Inter-Modality Attention Flow for Visual Question Answering. In The IEEE Conference on Computer Vision and Pattern Recognition (CVPR). 6639--6648 . Peng Gao, Zhengkai Jiang, Haoxuan You, Pan Lu, Steven CH Hoi, Xiaogang Wang, and Hongsheng Li. 2019. Dynamic Fusion With Intra-and Inter-Modality Attention Flow for Visual Question Answering. In The IEEE Conference on Computer Vision and Pattern Recognition (CVPR). 6639--6648."},{"key":"e_1_3_2_2_15_1","volume-title":"NAT: Neural Architecture Transformer for Accurate and Compact Architectures. In Advances in Neural Information Processing Systems (NeurIPS). 735--747.","author":"Guo Yong","year":"2019","unstructured":"Yong Guo , Yin Zheng , Mingkui Tan , Qi Chen , Jian Chen , Peilin Zhao , and Junzhou Huang . 2019 . NAT: Neural Architecture Transformer for Accurate and Compact Architectures. In Advances in Neural Information Processing Systems (NeurIPS). 735--747. Yong Guo, Yin Zheng, Mingkui Tan, Qi Chen, Jian Chen, Peilin Zhao, and Junzhou Huang. 2019. NAT: Neural Architecture Transformer for Accurate and Compact Architectures. In Advances in Neural Information Processing Systems (NeurIPS). 735--747."},{"key":"e_1_3_2_2_16_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00380"},{"key":"e_1_3_2_2_17_1","volume-title":"Deep Residual Learning for Image Recognition. In 2016 IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2016","author":"He Kaiming","year":"2016","unstructured":"Kaiming He , Xiangyu Zhang , Shaoqing Ren , and Jian Sun . 2016 . Deep Residual Learning for Image Recognition. In 2016 IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2016 , Las Vegas, NV, USA, June 27--30 , 2016. IEEE Computer Society, 770--778. https:\/\/doi.org\/10.1109\/CVPR.2016.90 10.1109\/CVPR.2016.90 Kaiming He, Xiangyu Zhang, Shaoqing Ren, and Jian Sun. 2016. Deep Residual Learning for Image Recognition. In 2016 IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2016, Las Vegas, NV, USA, June 27--30, 2016. IEEE Computer Society, 770--778. https:\/\/doi.org\/10.1109\/CVPR.2016.90"},{"key":"e_1_3_2_2_18_1","volume-title":"Language-Conditioned Graph Networks for Relational Reasoning. The IEEE Conference on Computer Vision and Pattern Recognition (CVPR)","author":"Hu Ronghang","year":"2019","unstructured":"Ronghang Hu , Anna Rohrbach , Trevor Darrell , and Kate Saenko . 2019 a . Language-Conditioned Graph Networks for Relational Reasoning. The IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (2019). Ronghang Hu, Anna Rohrbach, Trevor Darrell, and Kate Saenko. 2019 a. Language-Conditioned Graph Networks for Relational Reasoning. The IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (2019)."},{"key":"e_1_3_2_2_19_1","volume-title":"2019 b. Iterative Answer Prediction with Pointer-Augmented Multimodal Transformers for TextVQA. arxiv","author":"Hu Ronghang","year":"1911","unstructured":"Ronghang Hu , Amanpreet Singh , Trevor Darrell , and Marcus Rohrbach . 2019 b. Iterative Answer Prediction with Pointer-Augmented Multimodal Transformers for TextVQA. arxiv : 1911 .06258 [cs.CV] Ronghang Hu, Amanpreet Singh, Trevor Darrell, and Marcus Rohrbach. 2019 b. Iterative Answer Prediction with Pointer-Augmented Multimodal Transformers for TextVQA. arxiv: 1911.06258 [cs.CV]"},{"key":"e_1_3_2_2_20_1","doi-asserted-by":"crossref","unstructured":"Deng Huang Peihao Chen Runhao Zeng Qing Du Mingkui Tan and Chuang Gan. 2020. Location-Aware Graph Convolutional Networks for Video Question Answering.. In the Association for the Advance of Artificial Intelligence (AAAI). 11021--11028.  Deng Huang Peihao Chen Runhao Zeng Qing Du Mingkui Tan and Chuang Gan. 2020. Location-Aware Graph Convolutional Networks for Video Question Answering.. In the Association for the Advance of Artificial Intelligence (AAAI). 11021--11028.","DOI":"10.1609\/aaai.v34i07.6737"},{"key":"e_1_3_2_2_21_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00592"},{"key":"e_1_3_2_2_22_1","volume-title":"The IEEE Conference on Computer Vision and Pattern Recognition (CVPR)","author":"Kazemi Vahid","year":"2017","unstructured":"Vahid Kazemi and Ali Elqursh . 2017 . Show, ask, attend, and answer: A strong baseline for visual question answering . The IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (2017). Vahid Kazemi and Ali Elqursh. 2017. Show, ask, attend, and answer: A strong baseline for visual question answering. The IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (2017)."},{"key":"e_1_3_2_2_23_1","volume-title":"Openimages: A public dataset for large-scale multi-label and multi-class image classification. Dataset available from https:\/\/github. com\/openimages","author":"Krasin Ivan","year":"2017","unstructured":"Ivan Krasin , Tom Duerig , Neil Alldrin , Vittorio Ferrari , Sami Abu-El-Haija , Alina Kuznetsova , Hassan Rom , Jasper Uijlings , Stefan Popov , Andreas Veit , 2017 . Openimages: A public dataset for large-scale multi-label and multi-class image classification. Dataset available from https:\/\/github. com\/openimages , Vol. 2 (2017), 3. Ivan Krasin, Tom Duerig, Neil Alldrin, Vittorio Ferrari, Sami Abu-El-Haija, Alina Kuznetsova, Hassan Rom, Jasper Uijlings, Stefan Popov, Andreas Veit, et al. 2017. Openimages: A public dataset for large-scale multi-label and multi-class image classification. Dataset available from https:\/\/github. com\/openimages, Vol. 2 (2017), 3."},{"key":"e_1_3_2_2_24_1","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/D18-1549"},{"key":"e_1_3_2_2_25_1","volume-title":"Soviet physics doklady","author":"Levenshtein Vladimir I","unstructured":"Vladimir I Levenshtein . 1966. Binary codes capable of correcting deletions, insertions, and reversals . In Soviet physics doklady , Vol. 10 . 707--710. Vladimir I Levenshtein. 1966. Binary codes capable of correcting deletions, insertions, and reversals. In Soviet physics doklady, Vol. 10. 707--710."},{"key":"e_1_3_2_2_26_1","volume-title":"Relation-aware Graph Attention Network for Visual Question Answering. The IEEE Conference on Computer Vision and Pattern Recognition (CVPR)","author":"Li Linjie","year":"2019","unstructured":"Linjie Li , Zhe Gan , Yu Cheng , and Jingjing Liu . 2019 . Relation-aware Graph Attention Network for Visual Question Answering. The IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (2019). Linjie Li, Zhe Gan, Yu Cheng, and Jingjing Liu. 2019. Relation-aware Graph Attention Network for Visual Question Answering. The IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (2019)."},{"key":"e_1_3_2_2_27_1","doi-asserted-by":"publisher","DOI":"10.1145\/3343031.3350993"},{"key":"e_1_3_2_2_28_1","unstructured":"Jiasen Lu Jianwei Yang Dhruv Batra and Devi Parikh. 2016. Hierarchical question-image co-attention for visual question answering. In Advances In Neural Information Processing Systems (NeurIPS). 289--297.  Jiasen Lu Jianwei Yang Dhruv Batra and Devi Parikh. 2016. Hierarchical question-image co-attention for visual question answering. In Advances In Neural Information Processing Systems (NeurIPS). 289--297."},{"key":"e_1_3_2_2_29_1","unstructured":"Mateusz Malinowski and Mario Fritz. 2014. A Multi-World Approach to Question Answering about Real-World Scenes based on Uncertain Input. In Advances in Neural Information Processing Systems (NeurIPS).  Mateusz Malinowski and Mario Fritz. 2014. A Multi-World Approach to Question Answering about Real-World Scenes based on Uncertain Input. In Advances in Neural Information Processing Systems (NeurIPS)."},{"key":"e_1_3_2_2_30_1","volume-title":"International Conference on Learning Representations (ICLR).","author":"Mao Jiayuan","year":"2019","unstructured":"Jiayuan Mao , Chuang Gan , Pushmeet Kohli , Joshua B. Tenenbaum , and Jiajun Wu . 2019 . The Neuro-Symbolic Concept Learner: Interpreting Scenes, Words, and Sentences From Natural Supervision . In International Conference on Learning Representations (ICLR). Jiayuan Mao, Chuang Gan, Pushmeet Kohli, Joshua B. Tenenbaum, and Jiajun Wu. 2019. The Neuro-Symbolic Concept Learner: Interpreting Scenes, Words, and Sentences From Natural Supervision. In International Conference on Learning Representations (ICLR)."},{"key":"e_1_3_2_2_31_1","volume-title":"Ajeet Kumar Singh, and Anirban Chakraborty","author":"Mishra Anand","year":"2019","unstructured":"Anand Mishra , Shashank Shekhar , Ajeet Kumar Singh, and Anirban Chakraborty . 2019 . OCR-VQA : Visual question answering by reading text in images. Anand Mishra, Shashank Shekhar, Ajeet Kumar Singh, and Anirban Chakraborty. 2019. OCR-VQA: Visual question answering by reading text in images."},{"key":"e_1_3_2_2_32_1","doi-asserted-by":"publisher","DOI":"10.1145\/3343031.3350925"},{"key":"e_1_3_2_2_33_1","volume-title":"Exploring the limits of transfer learning with a unified text-to-text transformer. arXiv preprint arXiv:1910.10683","author":"Raffel Colin","year":"2019","unstructured":"Colin Raffel , Noam Shazeer , Adam Roberts , Katherine Lee , Sharan Narang , Michael Matena , Yanqi Zhou , Wei Li , and Peter J Liu . 2019. Exploring the limits of transfer learning with a unified text-to-text transformer. arXiv preprint arXiv:1910.10683 ( 2019 ). Colin Raffel, Noam Shazeer, Adam Roberts, Katherine Lee, Sharan Narang, Michael Matena, Yanqi Zhou, Wei Li, and Peter J Liu. 2019. Exploring the limits of transfer learning with a unified text-to-text transformer. arXiv preprint arXiv:1910.10683 (2019)."},{"key":"e_1_3_2_2_34_1","unstructured":"Shaoqing Ren Kaiming He Ross Girshick and Jian Sun. 2015. Faster r-cnn: Towards real-time object detection with region proposal networks. In Advances in Neural Information Processing Systems (NeurIPS). 91--99.  Shaoqing Ren Kaiming He Ross Girshick and Jian Sun. 2015. Faster r-cnn: Towards real-time object detection with region proposal networks. In Advances in Neural Information Processing Systems (NeurIPS). 91--99."},{"key":"e_1_3_2_2_35_1","unstructured":"Adam Santoro David Raposo David G Barrett Mateusz Malinowski Razvan Pascanu Peter Battaglia and Timothy Lillicrap. 2017. A simple neural network module for relational reasoning. In Advances in Neural Information Processing Systems (NeurIPS). 4967--4976.  Adam Santoro David Raposo David G Barrett Mateusz Malinowski Razvan Pascanu Peter Battaglia and Timothy Lillicrap. 2017. A simple neural network module for relational reasoning. In Advances in Neural Information Processing Systems (NeurIPS). 4967--4976."},{"key":"e_1_3_2_2_36_1","doi-asserted-by":"publisher","DOI":"10.1109\/TNN.2008.2005605"},{"key":"e_1_3_2_2_37_1","volume-title":"Proximal policy optimization algorithms. arXiv preprint arXiv:1707.06347","author":"Schulman John","year":"2017","unstructured":"John Schulman , Filip Wolski , Prafulla Dhariwal , Alec Radford , and Oleg Klimov . 2017. Proximal policy optimization algorithms. arXiv preprint arXiv:1707.06347 ( 2017 ). John Schulman, Filip Wolski, Prafulla Dhariwal, Alec Radford, and Oleg Klimov. 2017. Proximal policy optimization algorithms. arXiv preprint arXiv:1707.06347 (2017)."},{"key":"e_1_3_2_2_38_1","doi-asserted-by":"crossref","unstructured":"Amanpreet Singh Vivek Natarajan Meet Shah Yu Jiang Xinlei Chen Dhruv Batra Devi Parikh and Marcus Rohrbach. 2019. Towards vqa models that can read. In Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR). 8317--8326.  Amanpreet Singh Vivek Natarajan Meet Shah Yu Jiang Xinlei Chen Dhruv Batra Devi Parikh and Marcus Rohrbach. 2019. Towards vqa models that can read. In Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR). 8317--8326.","DOI":"10.1109\/CVPR.2019.00851"},{"key":"e_1_3_2_2_39_1","unstructured":"Anonymous submission. 2019. MSFT VTI. https: \/\/evalai.cloudcv.org\/web\/challenges\/ challenge-page\/244\/. 6 7.  Anonymous submission. 2019. MSFT VTI. https: \/\/evalai.cloudcv.org\/web\/challenges\/ challenge-page\/244\/. 6 7."},{"key":"e_1_3_2_2_40_1","unstructured":"Anonymous submission. 2020. Structured Multimodal Attentions for TextVQA. https:\/\/rrc.cvc.uab.es\/?ch=11&com=evaluation&task=1.  Anonymous submission. 2020. Structured Multimodal Attentions for TextVQA. https:\/\/rrc.cvc.uab.es\/?ch=11&com=evaluation&task=1."},{"key":"e_1_3_2_2_41_1","volume-title":"Le","author":"Sutskever Ilya","year":"2014","unstructured":"Ilya Sutskever , Oriol Vinyals , and Quoc V . Le . 2014 . Sequence to Sequence Learning with Neural Networks. Computing Research Repository (CoRR) , Vol. abs\/ 1409 .3215 (2014). arxiv: 1409.3215 http:\/\/arxiv.org\/abs\/1409.3215 Ilya Sutskever, Oriol Vinyals, and Quoc V. Le. 2014. Sequence to Sequence Learning with Neural Networks. Computing Research Repository (CoRR), Vol. abs\/1409.3215 (2014). arxiv: 1409.3215 http:\/\/arxiv.org\/abs\/1409.3215"},{"key":"e_1_3_2_2_42_1","unstructured":"Richard S Sutton David A McAllester Satinder P Singh and Yishay Mansour. 2000. Policy gradient methods for reinforcement learning with function approximation. In Advances in Neural Information Processing Systems (NeurIPS). 1057--1063.  Richard S Sutton David A McAllester Satinder P Singh and Yishay Mansour. 2000. Policy gradient methods for reinforcement learning with function approximation. In Advances in Neural Information Processing Systems (NeurIPS). 1057--1063."},{"key":"e_1_3_2_2_43_1","unstructured":"Ashish Vaswani Noam Shazeer Niki Parmar Jakob Uszkoreit Llion Jones Aidan N. Gomez Lukasz Kaiser and Illia Polosukhin. 2017. Attention is All you Need. In Advances in Neural Information Processing Systems (NeurIPS).  Ashish Vaswani Noam Shazeer Niki Parmar Jakob Uszkoreit Llion Jones Aidan N. Gomez Lukasz Kaiser and Illia Polosukhin. 2017. Attention is All you Need. In Advances in Neural Information Processing Systems (NeurIPS)."},{"key":"e_1_3_2_2_44_1","volume-title":"The IEEE Conference on Computer Vision and Pattern Recognition (CVPR). 1960--1968","author":"Wang Peng","unstructured":"Peng Wang , Qi Wu , Jiewei Cao , Chunhua Shen , Lianli Gao , and Anton van den Hengel. 2019. Neighbourhood watch: Referring expression comprehension via language-guided graph attention networks . In The IEEE Conference on Computer Vision and Pattern Recognition (CVPR). 1960--1968 . Peng Wang, Qi Wu, Jiewei Cao, Chunhua Shen, Lianli Gao, and Anton van den Hengel. 2019. Neighbourhood watch: Referring expression comprehension via language-guided graph attention networks. In The IEEE Conference on Computer Vision and Pattern Recognition (CVPR). 1960--1968."},{"key":"e_1_3_2_2_45_1","volume-title":"Simple statistical gradient-following algorithms for connectionist reinforcement learning. Machine learning","author":"Williams Ronald J","year":"1992","unstructured":"Ronald J Williams . 1992. Simple statistical gradient-following algorithms for connectionist reinforcement learning. Machine learning , Vol. 8 , 3--4 ( 1992 ), 229--256. Ronald J Williams. 1992. Simple statistical gradient-following algorithms for connectionist reinforcement learning. Machine learning, Vol. 8, 3--4 (1992), 229--256."},{"key":"e_1_3_2_2_46_1","doi-asserted-by":"publisher","DOI":"10.1145\/3240508.3240513"},{"key":"e_1_3_2_2_47_1","volume-title":"Stacked Attention Networks for Image Question Answering. In The IEEE Conference on Computer Vision and Pattern Recognition (CVPR).","author":"Yang Zichao","year":"2016","unstructured":"Zichao Yang , Xiaodong He , Jianfeng Gao , Li Deng , and Alex Smola . 2016 . Stacked Attention Networks for Image Question Answering. In The IEEE Conference on Computer Vision and Pattern Recognition (CVPR). Zichao Yang, Xiaodong He, Jianfeng Gao, Li Deng, and Alex Smola. 2016. Stacked Attention Networks for Image Question Answering. In The IEEE Conference on Computer Vision and Pattern Recognition (CVPR)."},{"key":"e_1_3_2_2_48_1","volume-title":"International Conference on Learning Representations (ICLR).","author":"Yi Kexin","year":"2020","unstructured":"Kexin Yi , Chuang Gan , Yunzhu Li , Pushmeet Kohli , Jiajun Wu , Antonio Torralba , and Joshua B Tenenbaum . 2020 . Clevrer: Collision events for video representation and reasoning . In International Conference on Learning Representations (ICLR). Kexin Yi, Chuang Gan, Yunzhu Li, Pushmeet Kohli, Jiajun Wu, Antonio Torralba, and Joshua B Tenenbaum. 2020. Clevrer: Collision events for video representation and reasoning. In International Conference on Learning Representations (ICLR)."},{"key":"e_1_3_2_2_49_1","unstructured":"Kexin Yi Jiajun Wu Chuang Gan Antonio Torralba Pushmeet Kohli and Josh Tenenbaum. 2018. Neural-symbolic vqa: Disentangling reasoning from vision and language understanding. In Advances in neural information processing systems (NeurIPS). 1031--1042.  Kexin Yi Jiajun Wu Chuang Gan Antonio Torralba Pushmeet Kohli and Josh Tenenbaum. 2018. Neural-symbolic vqa: Disentangling reasoning from vision and language understanding. In Advances in neural information processing systems (NeurIPS). 1031--1042."},{"key":"e_1_3_2_2_50_1","volume-title":"Deep Modular Co-Attention Networks for Visual Question Answering. In The IEEE Conference on Computer Vision and Pattern Recognition (CVPR). 6281--6290","author":"Yu Zhou","year":"2019","unstructured":"Zhou Yu , Jun Yu , Yuhao Cui , Dacheng Tao , and Qi Tian . 2019 . Deep Modular Co-Attention Networks for Visual Question Answering. In The IEEE Conference on Computer Vision and Pattern Recognition (CVPR). 6281--6290 . Zhou Yu, Jun Yu, Yuhao Cui, Dacheng Tao, and Qi Tian. 2019. Deep Modular Co-Attention Networks for Visual Question Answering. In The IEEE Conference on Computer Vision and Pattern Recognition (CVPR). 6281--6290."},{"key":"e_1_3_2_2_51_1","unstructured":"Yanan Li Donghui Wang Yuetan Lin Hongrui Zhao. 2018. DCD presentation. https:\/\/url.cn\/5iQYM5n.  Yanan Li Donghui Wang Yuetan Lin Hongrui Zhao. 2018. DCD presentation. https:\/\/url.cn\/5iQYM5n."}],"event":{"name":"MM '20: The 28th ACM International Conference on Multimedia","location":"Seattle WA USA","acronym":"MM '20","sponsor":["SIGMM ACM Special Interest Group on Multimedia"]},"container-title":["Proceedings of the 28th ACM International Conference on Multimedia"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3394171.3413924","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3394171.3413924","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,17]],"date-time":"2025-06-17T21:32:06Z","timestamp":1750195926000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3394171.3413924"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2020,10,12]]},"references-count":51,"alternative-id":["10.1145\/3394171.3413924","10.1145\/3394171"],"URL":"https:\/\/doi.org\/10.1145\/3394171.3413924","relation":{},"subject":[],"published":{"date-parts":[[2020,10,12]]},"assertion":[{"value":"2020-10-12","order":2,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}