{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,26]],"date-time":"2026-04-26T01:48:39Z","timestamp":1777168119273,"version":"3.51.4"},"publisher-location":"New York, NY, USA","reference-count":70,"publisher":"ACM","license":[{"start":{"date-parts":[[2020,10,12]],"date-time":"2020-10-12T00:00:00Z","timestamp":1602460800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.acm.org\/publications\/policies\/copyright_policy#Background"}],"funder":[{"name":"National Key R&D Program","award":["No.2017YFC0113000; No.2016YFB1001503"],"award-info":[{"award-number":["No.2017YFC0113000; No.2016YFB1001503"]}]},{"name":"National Natural Science Foundation of China","award":["No.U1705262;No.61772443;No.61572410; No.61802324;No.617021"],"award-info":[{"award-number":["No.U1705262;No.61772443;No.61572410; No.61802324;No.617021"]}]},{"name":"Key R&D Program of Jiangxi Province","award":["No. 20171ACH80022"],"award-info":[{"award-number":["No. 20171ACH80022"]}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2020,10,12]]},"DOI":"10.1145\/3394171.3413998","type":"proceedings-article","created":{"date-parts":[[2020,10,12]],"date-time":"2020-10-12T13:10:44Z","timestamp":1602508244000},"page":"1245-1254","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":19,"title":["K-armed Bandit based Multi-Modal Network Architecture Search for Visual Question Answering"],"prefix":"10.1145","author":[{"given":"Yiyi","family":"Zhou","sequence":"first","affiliation":[{"name":"Xiamen University, Xiamen, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Rongrong","family":"Ji","sequence":"additional","affiliation":[{"name":"Xiamen University, Xiamen, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xiaoshuai","family":"Sun","sequence":"additional","affiliation":[{"name":"Xiamen University, Xiamen, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Gen","family":"Luo","sequence":"additional","affiliation":[{"name":"Xiamen University, Xiamen, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xiaopeng","family":"Hong","sequence":"additional","affiliation":[{"name":"Xi'an Jiaotong University, Xi'an, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jinsong","family":"Su","sequence":"additional","affiliation":[{"name":"Xiamen University, Xiamen, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xinghao","family":"Ding","sequence":"additional","affiliation":[{"name":"Xiamen University, Xiamen, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Ling","family":"Shao","sequence":"additional","affiliation":[{"name":"Inception Institute of Artificial Intelligence &amp;38; Mohamed Bin Zayed University of Artificial Intelligence, Abu Dhabi, UAE"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2020,10,12]]},"reference":[{"key":"e_1_3_2_2_1_1","volume-title":"Don't Just Assume","author":"Agrawal Aishwarya","year":"2018","unstructured":"Aishwarya Agrawal , Dhruv Batra , Devi Parikh , and Aniruddha Kembhavi . 2018. Don't Just Assume ; Look and Answer: Overcoming Priors for Visual Question Answering. CVPR ( 2018 ). Aishwarya Agrawal, Dhruv Batra, Devi Parikh, and Aniruddha Kembhavi. 2018. Don't Just Assume; Look and Answer: Overcoming Priors for Visual Question Answering. CVPR (2018)."},{"key":"e_1_3_2_2_2_1","doi-asserted-by":"crossref","unstructured":"Peter Anderson Xiaodong He Chris Buehler Damien Teney Mark Johnson Stephen Gould and Lei Zhang. 2018. Bottom-up and top-down attention for image captioning and visual question answering. In CVPR.  Peter Anderson Xiaodong He Chris Buehler Damien Teney Mark Johnson Stephen Gould and Lei Zhang. 2018. Bottom-up and top-down attention for image captioning and visual question answering. In CVPR.","DOI":"10.1109\/CVPR.2018.00636"},{"key":"e_1_3_2_2_3_1","volume-title":"Learning to compose neural networks for question answering. NAACL","author":"Andreas Jacob","year":"2016","unstructured":"Jacob Andreas , Marcus Rohrbach , Trevor Darrell , and Dan Klein . 2016. Learning to compose neural networks for question answering. NAACL ( 2016 ). Jacob Andreas, Marcus Rohrbach, Trevor Darrell, and Dan Klein. 2016. Learning to compose neural networks for question answering. NAACL (2016)."},{"key":"e_1_3_2_2_4_1","volume-title":"Vqa: Visual question answering. In ICCV.","author":"Antol Stanislaw","year":"2015","unstructured":"Stanislaw Antol , Aishwarya Agrawal , Jiasen Lu , Margaret Mitchell , Dhruv Batra , C Lawrence Zitnick , and Devi Parikh . 2015 . Vqa: Visual question answering. In ICCV. Stanislaw Antol, Aishwarya Agrawal, Jiasen Lu, Margaret Mitchell, Dhruv Batra, C Lawrence Zitnick, and Devi Parikh. 2015. Vqa: Visual question answering. In ICCV."},{"key":"e_1_3_2_2_5_1","unstructured":"Gabriel Bender Pieterjan Kindermans Barret Zoph Vijay Vasudevan and Quoc V Le. [n.d.]. Understanding and Simplifying One-Shot Architecture Search. ICML ( [n. d.]).  Gabriel Bender Pieterjan Kindermans Barret Zoph Vijay Vasudevan and Quoc V Le. [n.d.]. Understanding and Simplifying One-Shot Architecture Search. ICML ( [n. d.])."},{"key":"e_1_3_2_2_6_1","volume-title":"MUREL: Multimodal Relational Reasoning for Visual Question Answering. CVPR","author":"Cadene Remi","year":"2019","unstructured":"Remi Cadene , Hedi Benyounes , Matthieu Cord , and Nicolas Thome . 2019 . MUREL: Multimodal Relational Reasoning for Visual Question Answering. CVPR (2019). Remi Cadene, Hedi Benyounes, Matthieu Cord, and Nicolas Thome. 2019. MUREL: Multimodal Relational Reasoning for Visual Question Answering. CVPR (2019)."},{"key":"e_1_3_2_2_7_1","volume-title":"ProxylessNAS: Direct Neural Architecture Search on Target Task and Hardware. ICLR","author":"Cai Han","year":"2019","unstructured":"Han Cai , Ligeng Zhu , and Song Han . 2019. ProxylessNAS: Direct Neural Architecture Search on Target Task and Hardware. ICLR ( 2019 ). Han Cai, Ligeng Zhu, and Song Han. 2019. ProxylessNAS: Direct Neural Architecture Search on Target Task and Hardware. ICLR (2019)."},{"key":"e_1_3_2_2_8_1","volume-title":"Microsoft COCO captions: Data collection and evaluation server. arXiv preprint arXiv:1504.00325","author":"Chen Xinlei","year":"2015","unstructured":"Xinlei Chen , Hao Fang , Tsung-Yi Lin , Ramakrishna Vedantam , Saurabh Gupta , Piotr Doll\u00e1r , and C Lawrence Zitnick . 2015. Microsoft COCO captions: Data collection and evaluation server. arXiv preprint arXiv:1504.00325 ( 2015 ). Xinlei Chen, Hao Fang, Tsung-Yi Lin, Ramakrishna Vedantam, Saurabh Gupta, Piotr Doll\u00e1r, and C Lawrence Zitnick. 2015. Microsoft COCO captions: Data collection and evaluation server. arXiv preprint arXiv:1504.00325 (2015)."},{"key":"e_1_3_2_2_9_1","volume-title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. NAACL","author":"Devlin Jacob","year":"2019","unstructured":"Jacob Devlin , Mingwei Chang , Kenton Lee , and Kristina Toutanova . 2019 . BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. NAACL (2019), 4171--4186. Jacob Devlin, Mingwei Chang, Kenton Lee, and Kristina Toutanova. 2019. BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. NAACL (2019), 4171--4186."},{"key":"e_1_3_2_2_10_1","volume-title":"Daylen Yang, Anna Rohrbach, Trevor Darrell, and Marcus Rohrbach.","author":"Fukui Akira","year":"2016","unstructured":"Akira Fukui , Dong Huk Park , Daylen Yang, Anna Rohrbach, Trevor Darrell, and Marcus Rohrbach. 2016 . Multimodal compact bilinear pooling for visual question answering and visual grounding. arXiv preprint arXiv:1606.01847 (2016). Akira Fukui, Dong Huk Park, Daylen Yang, Anna Rohrbach, Trevor Darrell, and Marcus Rohrbach. 2016. Multimodal compact bilinear pooling for visual question answering and visual grounding. arXiv preprint arXiv:1606.01847 (2016)."},{"key":"e_1_3_2_2_11_1","volume-title":"Xiaogang Wang, and Hongsheng Li. 2019 a. Dynamic Fusion With Intra- and Inter-Modality Attention Flow for Visual Question Answering. CVPR","author":"Gao Peng","year":"2019","unstructured":"Peng Gao , Zhengkai Jiang , Haoxuan You , Pan Lu , Steven C H Hoi , Xiaogang Wang, and Hongsheng Li. 2019 a. Dynamic Fusion With Intra- and Inter-Modality Attention Flow for Visual Question Answering. CVPR ( 2019 ), 6639--6648. Peng Gao, Zhengkai Jiang, Haoxuan You, Pan Lu, Steven C H Hoi, Xiaogang Wang, and Hongsheng Li. 2019 a. Dynamic Fusion With Intra- and Inter-Modality Attention Flow for Visual Question Answering. CVPR (2019), 6639--6648."},{"key":"e_1_3_2_2_12_1","doi-asserted-by":"crossref","unstructured":"Peng Gao Haoxuan You Zhanpeng Zhang Xiaogang Wang and Hongsheng Li. 2019 b. Multi-modality Latent Interaction Network for Visual Question Answering. (2019) 5825--5835.  Peng Gao Haoxuan You Zhanpeng Zhang Xiaogang Wang and Hongsheng Li. 2019 b. Multi-modality Latent Interaction Network for Visual Question Answering. (2019) 5825--5835.","DOI":"10.1109\/ICCV.2019.00592"},{"key":"e_1_3_2_2_13_1","doi-asserted-by":"crossref","unstructured":"Yash Goyal Tejas Khot Douglas Summersstay Dhruv Batra and Devi Parikh. 2017. Making the V in VQA Matter: Elevating the Role of Image Understanding in Visual Question Answering. In CVPR.  Yash Goyal Tejas Khot Douglas Summersstay Dhruv Batra and Devi Parikh. 2017. Making the V in VQA Matter: Elevating the Role of Image Understanding in Visual Question Answering. In CVPR.","DOI":"10.1109\/CVPR.2017.670"},{"key":"e_1_3_2_2_14_1","volume-title":"Long short-term memory. Neural Computation","author":"Hochreiter Sepp","year":"1997","unstructured":"Sepp Hochreiter and Jurgen Schmidhuber . 1997. Long short-term memory. Neural Computation ( 1997 ). Sepp Hochreiter and Jurgen Schmidhuber. 1997. Long short-term memory. Neural Computation (1997)."},{"key":"e_1_3_2_2_15_1","volume-title":"Compositional Attention Networks for Machine Reasoning. ICLR","author":"Hudson Drew A","year":"2018","unstructured":"Drew A Hudson and Christopher D Manning . 2018. Compositional Attention Networks for Machine Reasoning. ICLR ( 2018 ). Drew A Hudson and Christopher D Manning. 2018. Compositional Attention Networks for Machine Reasoning. ICLR (2018)."},{"key":"e_1_3_2_2_16_1","volume-title":"GQA: A New Dataset for Real-World Visual Reasoning and Compositional Question Answering. CVPR","author":"Hudson Drew A","year":"2019","unstructured":"Drew A Hudson and Christopher D Manning . 2019 . GQA: A New Dataset for Real-World Visual Reasoning and Compositional Question Answering. CVPR (2019). Drew A Hudson and Christopher D Manning. 2019. GQA: A New Dataset for Real-World Visual Reasoning and Compositional Question Answering. CVPR (2019)."},{"key":"e_1_3_2_2_17_1","volume-title":"Pythia v0.1: the Winning Entry to the VQA Challenge","author":"Jiang Yu","year":"2018","unstructured":"Yu Jiang , Vivek Natarajan , Xinlei Chen , Marcus Rohrbach , Dhruv Batra , and Devi Parikh . 2018. Pythia v0.1: the Winning Entry to the VQA Challenge 2018 . arXiv preprint arXiv: 1807.09956 (2018). Yu Jiang, Vivek Natarajan, Xinlei Chen, Marcus Rohrbach, Dhruv Batra, and Devi Parikh. 2018. Pythia v0.1: the Winning Entry to the VQA Challenge 2018. arXiv preprint arXiv: 1807.09956 (2018)."},{"key":"e_1_3_2_2_18_1","volume-title":"Li Feifei, C Lawrence Zitnick, and Ross B Girshick.","author":"Johnson Justin","year":"2017","unstructured":"Justin Johnson , Bharath Hariharan , Laurens Van Der Maaten , Li Feifei, C Lawrence Zitnick, and Ross B Girshick. 2017 . CLEVR : A Diagnostic Dataset for Compositional Language and Elementary Visual Reasoning. CVPR ( 2017). Justin Johnson, Bharath Hariharan, Laurens Van Der Maaten, Li Feifei, C Lawrence Zitnick, and Ross B Girshick. 2017. CLEVR: A Diagnostic Dataset for Compositional Language and Elementary Visual Reasoning. CVPR (2017)."},{"key":"e_1_3_2_2_19_1","volume-title":"An Analysis of Visual Question Answering Algorithms. ICCV","author":"Kafle Kushal","year":"2017","unstructured":"Kushal Kafle and Christopher Kanan . 2017. An Analysis of Visual Question Answering Algorithms. ICCV ( 2017 ). Kushal Kafle and Christopher Kanan. 2017. An Analysis of Visual Question Answering Algorithms. ICCV (2017)."},{"key":"e_1_3_2_2_20_1","volume-title":"DVQA: Understanding Data Visualizations via Question Answering. CVPR","author":"Kafle Kushal","year":"2018","unstructured":"Kushal Kafle , Brian L Price , Scott D Cohen , and Christopher Kanan . 2018 . DVQA: Understanding Data Visualizations via Question Answering. CVPR (2018). Kushal Kafle, Brian L Price, Scott D Cohen, and Christopher Kanan. 2018. DVQA: Understanding Data Visualizations via Question Answering. CVPR (2018)."},{"key":"e_1_3_2_2_21_1","doi-asserted-by":"crossref","unstructured":"Sahar Kazemzadeh Vicente Ordonez Mark Matten and Tamara L Berg. 2014. ReferItGame: Referring to Objects in Photographs of Natural Scenes. (2014) 787--798.  Sahar Kazemzadeh Vicente Ordonez Mark Matten and Tamara L Berg. 2014. ReferItGame: Referring to Objects in Photographs of Natural Scenes. (2014) 787--798.","DOI":"10.3115\/v1\/D14-1086"},{"key":"e_1_3_2_2_22_1","volume-title":"Bilinear Attention Networks. NIPS","author":"Kim Jinhwa","year":"2018","unstructured":"Jinhwa Kim , Jaehyun Jun , and Byoungtak Zhang . 2018. Bilinear Attention Networks. NIPS ( 2018 ). Jinhwa Kim, Jaehyun Jun, and Byoungtak Zhang. 2018. Bilinear Attention Networks. NIPS (2018)."},{"key":"e_1_3_2_2_23_1","volume-title":"Woosang Lim, Jeonghee Kim, Jungwoo Ha, and Byoungtak Zhang.","author":"Kim Jinhwa","year":"2017","unstructured":"Jinhwa Kim , Kyoung Woon On , Woosang Lim, Jeonghee Kim, Jungwoo Ha, and Byoungtak Zhang. 2017 . Hadamard Product for Low-rank Bilinear Pooling. ICLR ( 2017). Jinhwa Kim, Kyoung Woon On, Woosang Lim, Jeonghee Kim, Jungwoo Ha, and Byoungtak Zhang. 2017. Hadamard Product for Low-rank Bilinear Pooling. ICLR (2017)."},{"key":"e_1_3_2_2_24_1","volume-title":"Adam: A method for stochastic optimization. arXiv preprint arXiv:1412.6980","author":"Kingma Diederik","year":"2014","unstructured":"Diederik Kingma and Jimmy Ba . 2014 . Adam: A method for stochastic optimization. arXiv preprint arXiv:1412.6980 (2014). Diederik Kingma and Jimmy Ba. 2014. Adam: A method for stochastic optimization. arXiv preprint arXiv:1412.6980 (2014)."},{"key":"e_1_3_2_2_25_1","volume-title":"Semi-supervised classification with graph convolutional networks. arXiv preprint arXiv:1609.02907","author":"Kipf Thomas N","year":"2016","unstructured":"Thomas N Kipf and Max Welling . 2016. Semi-supervised classification with graph convolutional networks. arXiv preprint arXiv:1609.02907 ( 2016 ). Thomas N Kipf and Max Welling. 2016. Semi-supervised classification with graph convolutional networks. arXiv preprint arXiv:1609.02907 (2016)."},{"key":"e_1_3_2_2_26_1","unstructured":"Ranjay Krishna Yuke Zhu Oliver Groth Justin Johnson Kenji Hata Joshua Kravitz Stephanie Chen Yannis Kalantidis Li-Jia Li David A Shamma etal 2016. Visual genome: Connecting language and vision using crowdsourced dense image annotations. arXiv preprint arXiv:1602.07332 (2016).  Ranjay Krishna Yuke Zhu Oliver Groth Justin Johnson Kenji Hata Joshua Kravitz Stephanie Chen Yannis Kalantidis Li-Jia Li David A Shamma et al. 2016. Visual genome: Connecting language and vision using crowdsourced dense image annotations. arXiv preprint arXiv:1602.07332 (2016)."},{"key":"e_1_3_2_2_27_1","volume-title":"2019 a. Unicoder-vl: A universal encoder for vision and language by cross-modal pre-training. arXiv preprint arXiv:1908.06066","author":"Li Gen","year":"2019","unstructured":"Gen Li , Nan Duan , Yuejian Fang , Daxin Jiang , and Ming Zhou . 2019 a. Unicoder-vl: A universal encoder for vision and language by cross-modal pre-training. arXiv preprint arXiv:1908.06066 ( 2019 ). Gen Li, Nan Duan, Yuejian Fang, Daxin Jiang, and Ming Zhou. 2019 a. Unicoder-vl: A universal encoder for vision and language by cross-modal pre-training. arXiv preprint arXiv:1908.06066 (2019)."},{"key":"e_1_3_2_2_28_1","volume-title":"2019 b. Relation-aware Graph Attention Network for Visual Question Answering. arXiv preprint arXiv","author":"Li Linjie","year":"1903","unstructured":"Linjie Li , Zhe Gan , Yu Cheng , and Jingjing Liu . 2019 b. Relation-aware Graph Attention Network for Visual Question Answering. arXiv preprint arXiv : 1903 .12314 (2019). Linjie Li, Zhe Gan, Yu Cheng, and Jingjing Liu. 2019 b. Relation-aware Graph Attention Network for Visual Question Answering. arXiv preprint arXiv: 1903.12314 (2019)."},{"key":"e_1_3_2_2_29_1","volume-title":"2019 c. Visualbert: A simple and performant baseline for vision and language. arXiv preprint arXiv:1908.03557","author":"Li Liunian Harold","year":"2019","unstructured":"Liunian Harold Li , Mark Yatskar , Da Yin , Cho-Jui Hsieh , and Kai-Wei Chang . 2019 c. Visualbert: A simple and performant baseline for vision and language. arXiv preprint arXiv:1908.03557 ( 2019 ). Liunian Harold Li, Mark Yatskar, Da Yin, Cho-Jui Hsieh, and Kai-Wei Chang. 2019 c. Visualbert: A simple and performant baseline for vision and language. arXiv preprint arXiv:1908.03557 (2019)."},{"key":"e_1_3_2_2_30_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00160"},{"key":"e_1_3_2_2_31_1","volume-title":"2019 b. Learning to Assemble Neural Module Tree Networks for Visual Grounding. ICCV","author":"Liu Daqing","year":"2019","unstructured":"Daqing Liu , Hanwang Zhang , Zhengjun Zha , and Feng Wu . 2019 b. Learning to Assemble Neural Module Tree Networks for Visual Grounding. ICCV ( 2019 ), 4673--4682. Daqing Liu, Hanwang Zhang, Zhengjun Zha, and Feng Wu. 2019 b. Learning to Assemble Neural Module Tree Networks for Visual Grounding. ICCV (2019), 4673--4682."},{"key":"e_1_3_2_2_32_1","volume-title":"Hierarchical Representations for Efficient Architecture Search. ICLR","author":"Liu Hanxiao","year":"2018","unstructured":"Hanxiao Liu , Karen Simonyan , Oriol Vinyals , Chrisantha Fernando , and Koray Kavukcuoglu . 2018. Hierarchical Representations for Efficient Architecture Search. ICLR ( 2018 ). Hanxiao Liu, Karen Simonyan, Oriol Vinyals, Chrisantha Fernando, and Koray Kavukcuoglu. 2018. Hierarchical Representations for Efficient Architecture Search. ICLR (2018)."},{"key":"e_1_3_2_2_33_1","volume-title":"2019 a. DARTS: Differentiable Architecture Search. ICLR","author":"Liu Hanxiao","year":"2019","unstructured":"Hanxiao Liu , Karen Simonyan , and Yiming Yang . 2019 a. DARTS: Differentiable Architecture Search. ICLR ( 2019 ). Hanxiao Liu, Karen Simonyan, and Yiming Yang. 2019 a. DARTS: Differentiable Architecture Search. ICLR (2019)."},{"key":"e_1_3_2_2_34_1","unstructured":"Jiasen Lu Dhruv Batra Devi Parikh and Stefan Lee. 2019 a. Vilbert: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks. In Advances in Neural Information Processing Systems. 13--23.  Jiasen Lu Dhruv Batra Devi Parikh and Stefan Lee. 2019 a. Vilbert: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks. In Advances in Neural Information Processing Systems. 13--23."},{"key":"e_1_3_2_2_35_1","unstructured":"Jiasen Lu Vedanuj Goswami Marcus Rohrbach Devi Parikh and Stefan Lee. 2019 b. 12-in-1: Multi-Task Vision and Language Representation Learning. arXiv preprint arXiv:1912.02315.  Jiasen Lu Vedanuj Goswami Marcus Rohrbach Devi Parikh and Stefan Lee. 2019 b. 12-in-1: Multi-Task Vision and Language Representation Learning. arXiv preprint arXiv:1912.02315."},{"key":"e_1_3_2_2_36_1","unstructured":"Jiasen Lu Jianwei Yang Dhruv Batra and Devi Parikh. 2016. Hierarchical question-image co-attention for visual question answering. In NeurIPS.  Jiasen Lu Jianwei Yang Dhruv Batra and Devi Parikh. 2016. Hierarchical question-image co-attention for visual question answering. In NeurIPS."},{"key":"e_1_3_2_2_37_1","doi-asserted-by":"crossref","unstructured":"Gen Luo Yiyi Zhou Xiaoshuai Sun Liujuan Cao Chenglin Wu Cheng Deng and Ji Rongrong. 2020. Multi-task Collaborative Network for Joint Referring Expression Comprehension and Segmentation. In CVPR.  Gen Luo Yiyi Zhou Xiaoshuai Sun Liujuan Cao Chenglin Wu Cheng Deng and Ji Rongrong. 2020. Multi-task Collaborative Network for Joint Referring Expression Comprehension and Segmentation. In CVPR.","DOI":"10.1109\/CVPR42600.2020.01005"},{"key":"e_1_3_2_2_38_1","volume-title":"Jung Woo Ha, and Jeonghee Kim","author":"Nam Hyeonseob","year":"2017","unstructured":"Hyeonseob Nam , Jung Woo Ha, and Jeonghee Kim . 2017 . Dual Attention Networks for Multimodal Reasoning and Matching . (2017). Hyeonseob Nam, Jung Woo Ha, and Jeonghee Kim. 2017. Dual Attention Networks for Multimodal Reasoning and Matching. (2017)."},{"key":"e_1_3_2_2_39_1","volume-title":"Improved Fusion of Visual and Language Representations by Dense Symmetric Co-Attention for Visual Question Answering. CVPR","author":"Nguyen Duykien","year":"2018","unstructured":"Duykien Nguyen and Takayuki Okatani . 2018. Improved Fusion of Visual and Language Representations by Dense Symmetric Co-Attention for Visual Question Answering. CVPR ( 2018 ). Duykien Nguyen and Takayuki Okatani. 2018. Improved Fusion of Visual and Language Representations by Dense Symmetric Co-Attention for Visual Question Answering. CVPR (2018)."},{"key":"e_1_3_2_2_40_1","volume-title":"Learning Conditioned Graph Structures for Interpretable Visual Question Answering. arXiv preprint arXiv:1806.07243","author":"Norcliffe-Brown Will","year":"2018","unstructured":"Will Norcliffe-Brown , Efstathios Vafeias , and Sarah Parisot . 2018. Learning Conditioned Graph Structures for Interpretable Visual Question Answering. arXiv preprint arXiv:1806.07243 ( 2018 ). Will Norcliffe-Brown, Efstathios Vafeias, and Sarah Parisot. 2018. Learning Conditioned Graph Structures for Interpretable Visual Question Answering. arXiv preprint arXiv:1806.07243 (2018)."},{"key":"e_1_3_2_2_41_1","doi-asserted-by":"crossref","unstructured":"Badri Patro and Vinay P Namboodiri. 2018. Differential Attention for Visual Question Answering. In CVPR.  Badri Patro and Vinay P Namboodiri. 2018. Differential Attention for Visual Question Answering. In CVPR.","DOI":"10.1109\/CVPR.2018.00801"},{"key":"e_1_3_2_2_42_1","volume-title":"Xiaogang Wang, and Hongsheng Li.","author":"Peng Gao","year":"2018","unstructured":"Gao Peng , Zhengkai Jiang , Haoxuan You , Pan Lu , Steven C H Hoi , Xiaogang Wang, and Hongsheng Li. 2018 . Dynamic Fusion with Intra- and Inter- Modality Attention Flow for Visual Question Answering . arXiv preprint arXiv: 1812.05252 (2018). Gao Peng, Zhengkai Jiang, Haoxuan You, Pan Lu, Steven C H Hoi, Xiaogang Wang, and Hongsheng Li. 2018. Dynamic Fusion with Intra- and Inter- Modality Attention Flow for Visual Question Answering. arXiv preprint arXiv: 1812.05252 (2018)."},{"key":"e_1_3_2_2_43_1","volume-title":"Glove: Global vectors for word representation. In EMNLP.","author":"Pennington Jeffrey","year":"2014","unstructured":"Jeffrey Pennington , Richard Socher , and Christopher Manning . 2014 . Glove: Global vectors for word representation. In EMNLP. Jeffrey Pennington, Richard Socher, and Christopher Manning. 2014. Glove: Global vectors for word representation. In EMNLP."},{"key":"e_1_3_2_2_44_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00713"},{"key":"e_1_3_2_2_45_1","volume-title":"Regularized Evolution for Image Classifier Architecture Search. AAAI","author":"Real Esteban","year":"2019","unstructured":"Esteban Real , Alok Aggarwal , Yanping Huang , and Quoc V Le. 2019. Regularized Evolution for Image Classifier Architecture Search. AAAI ( 2019 ). Esteban Real, Alok Aggarwal, Yanping Huang, and Quoc V Le. 2019. Regularized Evolution for Image Classifier Architecture Search. AAAI (2019)."},{"key":"e_1_3_2_2_46_1","unstructured":"Mengye Ren Ryan Kiros and Richard Zemel. 2015. Exploring models and data for image question answering. In NeurIPS.  Mengye Ren Ryan Kiros and Richard Zemel. 2015. Exploring models and data for image question answering. In NeurIPS."},{"key":"e_1_3_2_2_47_1","unstructured":"Shaoqing Ren Kaiming He Ross Girshick and Jian Sun. [n.d.]. Faster R-CNN: towards real-time object detection with region proposal networks. TPAMI ( [n. d.]).  Shaoqing Ren Kaiming He Ross Girshick and Jian Sun. [n.d.]. Faster R-CNN: towards real-time object detection with region proposal networks. TPAMI ( [n. d.])."},{"key":"e_1_3_2_2_48_1","volume-title":"Cycle-Consistency for Robust Visual Question Answering. arXiv preprint arXiv","author":"Shah Meet","year":"1902","unstructured":"Meet Shah , Xinlei Chen , Marcus Rohrbach , and Devi Parikh . 2019. Cycle-Consistency for Robust Visual Question Answering. arXiv preprint arXiv : 1902 .05660 (2019). Meet Shah, Xinlei Chen, Marcus Rohrbach, and Devi Parikh. 2019. Cycle-Consistency for Robust Visual Question Answering. arXiv preprint arXiv: 1902.05660 (2019)."},{"key":"e_1_3_2_2_49_1","volume-title":"Answer Them All! Toward Universal Visual Question Answering Models. CVPR","author":"Shrestha Robik","year":"2019","unstructured":"Robik Shrestha , Kushal Kafle , and Christopher Kanan . 2019. Answer Them All! Toward Universal Visual Question Answering Models. CVPR ( 2019 ). Robik Shrestha, Kushal Kafle, and Christopher Kanan. 2019. Answer Them All! Toward Universal Visual Question Answering Models. CVPR (2019)."},{"key":"e_1_3_2_2_50_1","volume-title":"Vl-bert: Pre-training of generic visual-linguistic representations. arXiv preprint arXiv:1908.08530","author":"Su Weijie","year":"2019","unstructured":"Weijie Su , Xizhou Zhu , Yue Cao , Bin Li , Lewei Lu , Furu Wei , and Jifeng Dai . 2019 . Vl-bert: Pre-training of generic visual-linguistic representations. arXiv preprint arXiv:1908.08530 (2019). Weijie Su, Xizhou Zhu, Yue Cao, Bin Li, Lewei Lu, Furu Wei, and Jifeng Dai. 2019. Vl-bert: Pre-training of generic visual-linguistic representations. arXiv preprint arXiv:1908.08530 (2019)."},{"key":"e_1_3_2_2_51_1","volume-title":"Lxmert: Learning cross-modality encoder representations from transformers. arXiv preprint arXiv:1908.07490","author":"Tan Hao","year":"2019","unstructured":"Hao Tan and Mohit Bansal . 2019 . Lxmert: Learning cross-modality encoder representations from transformers. arXiv preprint arXiv:1908.07490 (2019). Hao Tan and Mohit Bansal. 2019. Lxmert: Learning cross-modality encoder representations from transformers. arXiv preprint arXiv:1908.07490 (2019)."},{"key":"e_1_3_2_2_52_1","volume-title":"Tips and Tricks for Visual Question Answering: Learnings From the 2017 Challenge. CVPR","author":"Teney Damien","year":"2018","unstructured":"Damien Teney , Peter Anderson , Xiaodong He , and Anton Van Den Hengel . 2018. Tips and Tricks for Visual Question Answering: Learnings From the 2017 Challenge. CVPR ( 2018 ). Damien Teney, Peter Anderson, Xiaodong He, and Anton Van Den Hengel. 2018. Tips and Tricks for Visual Question Answering: Learnings From the 2017 Challenge. CVPR (2018)."},{"key":"e_1_3_2_2_53_1","volume-title":"Yfcc100m: The new data in multimedia research. COMMUN ACM","author":"Thomee Bart","year":"2016","unstructured":"Bart Thomee , David A Shamma , Gerald Friedland , Benjamin Elizalde , Karl Ni , Douglas Poland , Damian Borth , and Li-Jia Li. 2016. Yfcc100m: The new data in multimedia research. COMMUN ACM ( 2016 ). Bart Thomee, David A Shamma, Gerald Friedland, Benjamin Elizalde, Karl Ni, Douglas Poland, Damian Borth, and Li-Jia Li. 2016. Yfcc100m: The new data in multimedia research. COMMUN ACM (2016)."},{"key":"e_1_3_2_2_54_1","volume-title":"Attention is All you Need. NIPS","author":"Vaswani Ashish","year":"2017","unstructured":"Ashish Vaswani , Noam Shazeer , Niki Parmar , Jakob Uszkoreit , Llion Jones , Aidan N Gomez , Lukasz Kaiser , and Illia Polosukhin . 2017. Attention is All you Need. NIPS ( 2017 ). Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N Gomez, Lukasz Kaiser, and Illia Polosukhin. 2017. Attention is All you Need. NIPS (2017)."},{"key":"e_1_3_2_2_55_1","volume-title":"Show and tell: A neural image caption generator. CVPR","author":"Vinyals Oriol","year":"2015","unstructured":"Oriol Vinyals , Alexander Toshev , Samy Bengio , and Dumitru Erhan . 2015. Show and tell: A neural image caption generator. CVPR ( 2015 ). Oriol Vinyals, Alexander Toshev, Samy Bengio, and Dumitru Erhan. 2015. Show and tell: A neural image caption generator. CVPR (2015)."},{"key":"e_1_3_2_2_56_1","volume-title":"Genetic CNN. ICCV","author":"Xie Lingxi","year":"2017","unstructured":"Lingxi Xie and Alan L Yuille . 2017. Genetic CNN. ICCV ( 2017 ). Lingxi Xie and Alan L Yuille. 2017. Genetic CNN. ICCV (2017)."},{"key":"e_1_3_2_2_57_1","doi-asserted-by":"crossref","unstructured":"Zichao Yang Xiaodong He Jianfeng Gao Li Deng and Alex Smola. 2016. Stacked attention networks for image question answering. In CVPR.  Zichao Yang Xiaodong He Jianfeng Gao Li Deng and Alex Smola. 2016. Stacked attention networks for image question answering. In CVPR.","DOI":"10.1109\/CVPR.2016.10"},{"key":"e_1_3_2_2_58_1","volume-title":"MAttNet: Modular Attention Network for Referring Expression Comprehension. CVPR","author":"Yu Licheng","year":"2018","unstructured":"Licheng Yu , Zhe Lin , Xiaohui Shen , Jimei Yang , Xin Lu , Mohit Bansal , and Tamara L Berg . 2018a. MAttNet: Modular Attention Network for Referring Expression Comprehension. CVPR ( 2018 ), 1307--1315. Licheng Yu, Zhe Lin, Xiaohui Shen, Jimei Yang, Xin Lu, Mohit Bansal, and Tamara L Berg. 2018a. MAttNet: Modular Attention Network for Referring Expression Comprehension. CVPR (2018), 1307--1315."},{"key":"e_1_3_2_2_59_1","volume-title":"A Joint Speaker-Listener-Reinforcer Model for Referring Expressions. CVPR","author":"Yu Licheng","year":"2017","unstructured":"Licheng Yu , Hao Tan , Mohit Bansal , and Tamara L Berg . 2017a. A Joint Speaker-Listener-Reinforcer Model for Referring Expressions. CVPR ( 2017 ), 3521--3529. Licheng Yu, Hao Tan, Mohit Bansal, and Tamara L Berg. 2017a. A Joint Speaker-Listener-Reinforcer Model for Referring Expressions. CVPR (2017), 3521--3529."},{"key":"e_1_3_2_2_60_1","volume-title":"Deep Modular Co-Attention Networks for Visual Question Answering. CVPR","author":"Yu Zhou","year":"2019","unstructured":"Zhou Yu , Jun Yu , Yuhao Cui , Dacheng Tao , and Qi Tian . 2019. Deep Modular Co-Attention Networks for Visual Question Answering. CVPR ( 2019 ). Zhou Yu, Jun Yu, Yuhao Cui, Dacheng Tao, and Qi Tian. 2019. Deep Modular Co-Attention Networks for Visual Question Answering. CVPR (2019)."},{"key":"e_1_3_2_2_61_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.202"},{"key":"e_1_3_2_2_62_1","volume-title":"Beyond Bilinear: Generalized Multimodal Factorized High-Order Pooling for Visual Question Answering. TNN","author":"Yu Zhou","year":"2018","unstructured":"Zhou Yu , Jun Yu , Chenchao Xiang , Jianping Fan , and Dacheng Tao . 2018 b. Beyond Bilinear: Generalized Multimodal Factorized High-Order Pooling for Visual Question Answering. TNN (2018). Zhou Yu, Jun Yu, Chenchao Xiang, Jianping Fan, and Dacheng Tao. 2018b. Beyond Bilinear: Generalized Multimodal Factorized High-Order Pooling for Visual Question Answering. TNN (2018)."},{"key":"e_1_3_2_2_63_1","volume-title":"Rethinking Diversified and Discriminative Proposal Generation for Visual Grounding. international joint conference on artificial intelligence","author":"Yu Zhou","year":"2018","unstructured":"Zhou Yu , Jun Yu , Chenchao Xiang , Zhou Zhao , Qi Tian , and Dacheng Tao . 2018c. Rethinking Diversified and Discriminative Proposal Generation for Visual Grounding. international joint conference on artificial intelligence ( 2018 ), 1114--1120. Zhou Yu, Jun Yu, Chenchao Xiang, Zhou Zhao, Qi Tian, and Dacheng Tao. 2018c. Rethinking Diversified and Discriminative Proposal Generation for Visual Grounding. international joint conference on artificial intelligence (2018), 1114--1120."},{"key":"e_1_3_2_2_64_1","volume-title":"Learning to Count Objects in Natural Images for Visual Question Answering. ICLR","author":"Zhang Yan","year":"2018","unstructured":"Yan Zhang , Jonathon S Hare , and Adam Prugelbennett . 2018. Learning to Count Objects in Natural Images for Visual Question Answering. ICLR ( 2018 ). Yan Zhang, Jonathon S Hare, and Adam Prugelbennett. 2018. Learning to Count Objects in Natural Images for Visual Question Answering. ICLR (2018)."},{"key":"e_1_3_2_2_65_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00139"},{"key":"e_1_3_2_2_66_1","volume-title":"Rethinking Performance Estimation in Neural Architecture Search. In IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR).","author":"Zheng Xiawu","year":"2020","unstructured":"Xiawu Zheng , Rongrong Ji , Qiang Wang , Qixiang Ye , Zhenguo Li , Yonghong Tian , and Qi Tian . 2020 . Rethinking Performance Estimation in Neural Architecture Search. In IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR). Xiawu Zheng, Rongrong Ji, Qiang Wang, Qixiang Ye, Zhenguo Li, Yonghong Tian, and Qi Tian. 2020. Rethinking Performance Estimation in Neural Architecture Search. In IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR)."},{"key":"e_1_3_2_2_67_1","volume-title":"Dynamic Capsule Attention for Visual Question Answering. AAAI 2019 : Thirty-Third AAAI Conference on Artificial Intelligence","volume":"33","author":"Zhou Yiyi","year":"2019","unstructured":"Yiyi Zhou , Rongrong Ji , Jinsong Su , Xiaoshuai Sun , and Weiqiu Chen . 2019 . Dynamic Capsule Attention for Visual Question Answering. AAAI 2019 : Thirty-Third AAAI Conference on Artificial Intelligence , Vol. 33 , 1 (2019), 9324--9331. Yiyi Zhou, Rongrong Ji, Jinsong Su, Xiaoshuai Sun, and Weiqiu Chen. 2019. Dynamic Capsule Attention for Visual Question Answering. AAAI 2019 : Thirty-Third AAAI Conference on Artificial Intelligence, Vol. 33, 1 (2019), 9324--9331."},{"key":"e_1_3_2_2_68_1","volume-title":"Free VQA Models from Knowledge Inertia by Pairwise Inconformity Learning. AAAI","author":"Zhou Yiyi","year":"2019","unstructured":"Yiyi Zhou , Rongrong Ji , Jinsong Su , Xiaoshuai Sun , and Xiangming Li. 2019. Free VQA Models from Knowledge Inertia by Pairwise Inconformity Learning. AAAI ( 2019 ). Yiyi Zhou, Rongrong Ji, Jinsong Su, Xiaoshuai Sun, and Xiangming Li. 2019. Free VQA Models from Knowledge Inertia by Pairwise Inconformity Learning. AAAI (2019)."},{"key":"e_1_3_2_2_69_1","volume-title":"Neural Architecture Search with Reinforcement Learning. ICLR","author":"Zoph Barret","year":"2017","unstructured":"Barret Zoph and Quoc V Le. 2017. Neural Architecture Search with Reinforcement Learning. ICLR ( 2017 ). Barret Zoph and Quoc V Le. 2017. Neural Architecture Search with Reinforcement Learning. ICLR (2017)."},{"key":"e_1_3_2_2_70_1","doi-asserted-by":"crossref","unstructured":"Barret Zoph Vijay Vasudevan Jonathon Shlens and Quoc V Le. 2018. Learning Transferable Architectures for Scalable Image Recognition. (2018).  Barret Zoph Vijay Vasudevan Jonathon Shlens and Quoc V Le. 2018. Learning Transferable Architectures for Scalable Image Recognition. (2018).","DOI":"10.1109\/CVPR.2018.00907"}],"event":{"name":"MM '20: The 28th ACM International Conference on Multimedia","location":"Seattle WA USA","acronym":"MM '20","sponsor":["SIGMM ACM Special Interest Group on Multimedia"]},"container-title":["Proceedings of the 28th ACM International Conference on Multimedia"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3394171.3413998","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3394171.3413998","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,17]],"date-time":"2025-06-17T21:32:07Z","timestamp":1750195927000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3394171.3413998"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2020,10,12]]},"references-count":70,"alternative-id":["10.1145\/3394171.3413998","10.1145\/3394171"],"URL":"https:\/\/doi.org\/10.1145\/3394171.3413998","relation":{},"subject":[],"published":{"date-parts":[[2020,10,12]]},"assertion":[{"value":"2020-10-12","order":2,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}