{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,25]],"date-time":"2026-04-25T14:39:32Z","timestamp":1777127972637,"version":"3.51.4"},"publisher-location":"New York, NY, USA","reference-count":78,"publisher":"ACM","license":[{"start":{"date-parts":[[2021,10,17]],"date-time":"2021-10-17T00:00:00Z","timestamp":1634428800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.acm.org\/publications\/policies\/copyright_policy#Background"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["61773312,62088102"],"award-info":[{"award-number":["61773312,62088102"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2021,10,17]]},"DOI":"10.1145\/3474085.3475350","type":"proceedings-article","created":{"date-parts":[[2021,10,18]],"date-time":"2021-10-18T21:45:34Z","timestamp":1634593534000},"page":"199-208","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":15,"title":["X-GGM: Graph Generative Modeling for Out-of-distribution Generalization in Visual Question Answering"],"prefix":"10.1145","author":[{"given":"Jingjing","family":"Jiang","sequence":"first","affiliation":[{"name":"Xi'an Jiaotong University, Xi'an, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Ziyi","family":"Liu","sequence":"additional","affiliation":[{"name":"Xi'an Jiaotong University, Xi'an, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yifan","family":"Liu","sequence":"additional","affiliation":[{"name":"Xi'an Jiaotong University, Xi'an, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zhixiong","family":"Nan","sequence":"additional","affiliation":[{"name":"Xi'an Jiaotong University, Xi'an, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Nanning","family":"Zheng","sequence":"additional","affiliation":[{"name":"Xi'an Jiaotong University, Xi'an, China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2021,10,17]]},"reference":[{"key":"e_1_3_2_2_1_1","doi-asserted-by":"crossref","unstructured":"Aishwarya Agrawal Dhruv Batra and Devi Parikh. 2016. Analyzing the Behavior of Visual Question Answering Models. In EMNLP. 1955--1960. Aishwarya Agrawal Dhruv Batra and Devi Parikh. 2016. Analyzing the Behavior of Visual Question Answering Models. In EMNLP. 1955--1960.","DOI":"10.18653\/v1\/D16-1203"},{"key":"e_1_3_2_2_2_1","volume-title":"Don't just assume","author":"Agrawal Aishwarya","unstructured":"Aishwarya Agrawal , Dhruv Batra , Devi Parikh , and Aniruddha Kembhavi . 2018. Don't just assume ; look and answer: Overcoming priors for visual question answering. In CVPR. 4971--4980. Aishwarya Agrawal, Dhruv Batra, Devi Parikh, and Aniruddha Kembhavi. 2018. Don't just assume; look and answer: Overcoming priors for visual question answering. In CVPR. 4971--4980."},{"key":"e_1_3_2_2_3_1","doi-asserted-by":"crossref","unstructured":"Peter Anderson Xiaodong He Chris Buehler Damien Teney Mark Johnson Stephen Gould and Lei Zhang. 2018. Bottom-up and top-down attention for image captioning and visual question answering. In CVPR. 6077--6086. Peter Anderson Xiaodong He Chris Buehler Damien Teney Mark Johnson Stephen Gould and Lei Zhang. 2018. Bottom-up and top-down attention for image captioning and visual question answering. In CVPR. 6077--6086.","DOI":"10.1109\/CVPR.2018.00636"},{"key":"e_1_3_2_2_4_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2015.279"},{"key":"e_1_3_2_2_5_1","volume-title":"Learning generative models using denoising density estimators. arXiv preprint arXiv:2001.02728","author":"Bigdeli Siavash A","year":"2020","unstructured":"Siavash A Bigdeli , Geng Lin , Tiziano Portenier , L Andrea Dunbar , and Matthias Zwicker . 2020. Learning generative models using denoising density estimators. arXiv preprint arXiv:2001.02728 ( 2020 ). Siavash A Bigdeli, Geng Lin, Tiziano Portenier, L Andrea Dunbar, and Matthias Zwicker. 2020. Learning generative models using denoising density estimators. arXiv preprint arXiv:2001.02728 (2020)."},{"key":"e_1_3_2_2_6_1","doi-asserted-by":"publisher","DOI":"10.5555\/3454287.3454363"},{"key":"e_1_3_2_2_7_1","doi-asserted-by":"crossref","unstructured":"Long Chen Xin Yan Jun Xiao Hanwang Zhang Shiliang Pu and Yueting Zhuang. 2020 b. Counterfactual samples synthesizing for robust visual question answering. In CVPR. 10800--10809. Long Chen Xin Yan Jun Xiao Hanwang Zhang Shiliang Pu and Yueting Zhuang. 2020 b. Counterfactual samples synthesizing for robust visual question answering. In CVPR. 10800--10809.","DOI":"10.1109\/CVPR42600.2020.01081"},{"key":"e_1_3_2_2_8_1","doi-asserted-by":"crossref","unstructured":"Wenhu Chen Zhe Gan Linjie Li Yu Cheng William Wang and Jingjing Liu. 2021. Meta module network for compositional visual reasoning. In WACV. 655--664. Wenhu Chen Zhe Gan Linjie Li Yu Cheng William Wang and Jingjing Liu. 2021. Meta module network for compositional visual reasoning. In WACV. 655--664.","DOI":"10.1109\/WACV48630.2021.00070"},{"key":"e_1_3_2_2_9_1","doi-asserted-by":"crossref","unstructured":"Yen-Chun Chen Linjie Li Licheng Yu Ahmed El Kholy Faisal Ahmed Zhe Gan Yu Cheng and Jingjing Liu. 2020 a. UNITER: Universal image-text representation learning. In ECCV. 104--120. Yen-Chun Chen Linjie Li Licheng Yu Ahmed El Kholy Faisal Ahmed Zhe Gan Yu Cheng and Jingjing Liu. 2020 a. UNITER: Universal image-text representation learning. In ECCV. 104--120.","DOI":"10.1007\/978-3-030-58577-8_7"},{"key":"e_1_3_2_2_10_1","unstructured":"Christopher Clark Mark Yatskar and Luke Zettlemoyer. 2019. Don't Take the Easy Way Out: Ensemble Based Methods for Avoiding Known Dataset Biases. In EMNLP. 4067--4080. Christopher Clark Mark Yatskar and Luke Zettlemoyer. 2019. Don't Take the Easy Way Out: Ensemble Based Methods for Avoiding Known Dataset Biases. In EMNLP. 4067--4080."},{"key":"e_1_3_2_2_11_1","doi-asserted-by":"crossref","unstructured":"Christopher Clark Mark Yatskar and Luke Zettlemoyer. 2020. Learning to Model and Ignore Dataset Bias with Mixed Capacity Ensembles. In EMNLP. 3031--3045. Christopher Clark Mark Yatskar and Luke Zettlemoyer. 2020. Learning to Model and Ignore Dataset Bias with Mixed Capacity Ensembles. In EMNLP. 3031--3045.","DOI":"10.18653\/v1\/2020.findings-emnlp.272"},{"key":"e_1_3_2_2_12_1","unstructured":"Quanyu Dai Qiang Li Jian Tang and Dan Wang. 2018. Adversarial network embedding. In AAAI. 2167--2174. Quanyu Dai Qiang Li Jian Tang and Dan Wang. 2018. Adversarial network embedding. In AAAI. 2167--2174."},{"key":"e_1_3_2_2_13_1","volume-title":"MolGAN: An implicit generative model for small molecular graphs. arXiv preprint arXiv:1805.11973","author":"Cao Nicola De","year":"2018","unstructured":"Nicola De Cao and Thomas Kipf . 2018. MolGAN: An implicit generative model for small molecular graphs. arXiv preprint arXiv:1805.11973 ( 2018 ). Nicola De Cao and Thomas Kipf. 2018. MolGAN: An implicit generative model for small molecular graphs. arXiv preprint arXiv:1805.11973 (2018)."},{"key":"e_1_3_2_2_14_1","volume-title":"BERT: Pre-training of deep bidirectional transformers for language understanding. arXiv preprint arXiv:1810.04805","author":"Devlin Jacob","year":"2018","unstructured":"Jacob Devlin , Ming-Wei Chang , Kenton Lee , and Kristina Toutanova . 2018 . BERT: Pre-training of deep bidirectional transformers for language understanding. arXiv preprint arXiv:1810.04805 (2018). Jacob Devlin, Ming-Wei Chang, Kenton Lee, and Kristina Toutanova. 2018. BERT: Pre-training of deep bidirectional transformers for language understanding. arXiv preprint arXiv:1810.04805 (2018)."},{"key":"e_1_3_2_2_15_1","unstructured":"Zhe Gan Yen-Chun Chen Linjie Li Chen Zhu Yu Cheng and Jingjing Liu. 2020. Large-Scale Adversarial Training for Vision-and-Language Representation Learning. In NeurIPS . Zhe Gan Yen-Chun Chen Linjie Li Chen Zhu Yu Cheng and Jingjing Liu. 2020. Large-Scale Adversarial Training for Vision-and-Language Representation Learning. In NeurIPS ."},{"key":"e_1_3_2_2_16_1","doi-asserted-by":"crossref","unstructured":"Difei Gao Ke Li Ruiping Wang Shiguang Shan and Xilin Chen. 2020. Multi-Modal Graph Neural Network for Joint Reasoning on Vision and Scene Text. In CVPR. 12746--12756. Difei Gao Ke Li Ruiping Wang Shiguang Shan and Xilin Chen. 2020. Multi-Modal Graph Neural Network for Joint Reasoning on Vision and Scene Text. In CVPR. 12746--12756.","DOI":"10.1109\/CVPR42600.2020.01276"},{"key":"e_1_3_2_2_17_1","unstructured":"Itai Gat Idan Schwartz Alexander Schwing and Tamir Hazan. 2020. Removing Bias in Multi-modal Classifiers: Regularization by Maximizing Functional Entropies. In NeurIPS . Itai Gat Idan Schwartz Alexander Schwing and Tamir Hazan. 2020. Removing Bias in Multi-modal Classifiers: Regularization by Maximizing Functional Entropies. In NeurIPS ."},{"key":"e_1_3_2_2_18_1","volume-title":"MUTANT: A Training Paradigm for Out-of-Distribution Generalization in Visual Question Answering. In EMNLP. 878--892.","author":"Gokhale Tejas","year":"2020","unstructured":"Tejas Gokhale , Pratyay Banerjee , Chitta Baral , and Yezhou Yang . 2020 . MUTANT: A Training Paradigm for Out-of-Distribution Generalization in Visual Question Answering. In EMNLP. 878--892. Tejas Gokhale, Pratyay Banerjee, Chitta Baral, and Yezhou Yang. 2020. MUTANT: A Training Paradigm for Out-of-Distribution Generalization in Visual Question Answering. In EMNLP. 878--892."},{"key":"e_1_3_2_2_19_1","volume-title":"Generative adversarial networks. arXiv preprint arXiv:1406.2661","author":"Goodfellow Ian J","year":"2014","unstructured":"Ian J Goodfellow , Jean Pouget-Abadie , Mehdi Mirza , Bing Xu , David Warde-Farley , Sherjil Ozair , Aaron Courville , and Yoshua Bengio . 2014. Generative adversarial networks. arXiv preprint arXiv:1406.2661 ( 2014 ). Ian J Goodfellow, Jean Pouget-Abadie, Mehdi Mirza, Bing Xu, David Warde-Farley, Sherjil Ozair, Aaron Courville, and Yoshua Bengio. 2014. Generative adversarial networks. arXiv preprint arXiv:1406.2661 (2014)."},{"key":"e_1_3_2_2_20_1","doi-asserted-by":"crossref","unstructured":"Yash Goyal Tejas Khot Douglas Summers-Stay Dhruv Batra and Devi Parikh. 2017. Making the v in vqa matter: Elevating the role of image understanding in visual question answering. In CVPR. 6904--6913. Yash Goyal Tejas Khot Douglas Summers-Stay Dhruv Batra and Devi Parikh. 2017. Making the v in vqa matter: Elevating the role of image understanding in visual question answering. In CVPR. 6904--6913.","DOI":"10.1109\/CVPR.2017.670"},{"key":"e_1_3_2_2_21_1","volume-title":"Adversarial regularization for visual question answering: Strengths, shortcomings, and side effects. arXiv preprint arXiv:1906.08430","author":"Grand Gabriel","year":"2019","unstructured":"Gabriel Grand and Yonatan Belinkov . 2019. Adversarial regularization for visual question answering: Strengths, shortcomings, and side effects. arXiv preprint arXiv:1906.08430 ( 2019 ). Gabriel Grand and Yonatan Belinkov. 2019. Adversarial regularization for visual question answering: Strengths, shortcomings, and side effects. arXiv preprint arXiv:1906.08430 (2019)."},{"key":"e_1_3_2_2_22_1","volume-title":"Graphite: Iterative generative modeling of graphs. In ICML. 2434--2444.","author":"Grover Aditya","year":"2019","unstructured":"Aditya Grover , Aaron Zweig , and Stefano Ermon . 2019 . Graphite: Iterative generative modeling of graphs. In ICML. 2434--2444. Aditya Grover, Aaron Zweig, and Stefano Ermon. 2019. Graphite: Iterative generative modeling of graphs. In ICML. 2434--2444."},{"key":"e_1_3_2_2_23_1","doi-asserted-by":"publisher","DOI":"10.1145\/3343031.3350943"},{"key":"e_1_3_2_2_24_1","doi-asserted-by":"publisher","DOI":"10.1145\/3331184.3331186"},{"key":"e_1_3_2_2_25_1","volume-title":"Loss-rescaling VQA: Revisiting Language Prior Problem from a Class-imbalance View. arXiv preprint arXiv:2010.16010","author":"Guo Yangyang","year":"2020","unstructured":"Yangyang Guo , Liqiang Nie , Zhiyong Cheng , and Qi Tian . 2020. Loss-rescaling VQA: Revisiting Language Prior Problem from a Class-imbalance View. arXiv preprint arXiv:2010.16010 ( 2020 ). Yangyang Guo, Liqiang Nie, Zhiyong Cheng, and Qi Tian. 2020. Loss-rescaling VQA: Revisiting Language Prior Problem from a Class-imbalance View. arXiv preprint arXiv:2010.16010 (2020)."},{"key":"e_1_3_2_2_26_1","doi-asserted-by":"crossref","unstructured":"Dan Hendrycks Xiaoyuan Liu Eric Wallace Adam Dziedzic Rishabh Krishnan and Dawn Song. 2020. Pretrained transformers improve out-of-distribution robustness. In ACL. 2744--2751. Dan Hendrycks Xiaoyuan Liu Eric Wallace Adam Dziedzic Rishabh Krishnan and Dawn Song. 2020. Pretrained transformers improve out-of-distribution robustness. In ACL. 2744--2751.","DOI":"10.18653\/v1\/2020.acl-main.244"},{"key":"e_1_3_2_2_27_1","unstructured":"Ronghang Hu Anna Rohrbach Trevor Darrell and Kate Saenko. 2019. Language-conditioned graph networks for relational reasoning. In ICCV. 10294--10303. Ronghang Hu Anna Rohrbach Trevor Darrell and Kate Saenko. 2019. Language-conditioned graph networks for relational reasoning. In ICCV. 10294--10303."},{"key":"e_1_3_2_2_28_1","doi-asserted-by":"crossref","unstructured":"Deng Huang Peihao Chen Runhao Zeng Qing Du Mingkui Tan and Chuang Gan. 2020. Location-Aware Graph Convolutional Networks for Video Question Answering.. In AAAI. 11021--11028. Deng Huang Peihao Chen Runhao Zeng Qing Du Mingkui Tan and Chuang Gan. 2020. Location-Aware Graph Convolutional Networks for Video Question Answering.. In AAAI. 11021--11028.","DOI":"10.1609\/aaai.v34i07.6737"},{"key":"e_1_3_2_2_29_1","volume-title":"GQA: A new dataset for real-world visual reasoning and compositional question answering. In CVPR. 6700--6709.","author":"Hudson Drew A","year":"2019","unstructured":"Drew A Hudson and Christopher D Manning . 2019 . GQA: A new dataset for real-world visual reasoning and compositional question answering. In CVPR. 6700--6709. Drew A Hudson and Christopher D Manning. 2019. GQA: A new dataset for real-world visual reasoning and compositional question answering. In CVPR. 6700--6709."},{"key":"e_1_3_2_2_30_1","doi-asserted-by":"crossref","unstructured":"Pin Jiang and Yahong Han. 2020. Reasoning with heterogeneous graph alignment for video question answering. In AAAI. 11109--11116. Pin Jiang and Yahong Han. 2020. Reasoning with heterogeneous graph alignment for video question answering. In AAAI. 11109--11116.","DOI":"10.1609\/aaai.v34i07.6767"},{"key":"e_1_3_2_2_31_1","doi-asserted-by":"publisher","DOI":"10.1145\/3394171.3413902"},{"key":"e_1_3_2_2_32_1","doi-asserted-by":"crossref","unstructured":"Chenchen Jing Yuwei Wu Xiaoxun Zhang Yunde Jia and Qi Wu. 2020 b. Overcoming Language Priors in VQA via Decomposed Linguistic Representations. In AAAI. 11181--11188. Chenchen Jing Yuwei Wu Xiaoxun Zhang Yunde Jia and Qi Wu. 2020 b. Overcoming Language Priors in VQA via Decomposed Linguistic Representations. In AAAI. 11181--11188.","DOI":"10.1609\/aaai.v34i07.6776"},{"key":"e_1_3_2_2_33_1","doi-asserted-by":"crossref","unstructured":"Yash Kant Dhruv Batra Peter Anderson Alexander Schwing Devi Parikh Jiasen Lu and Harsh Agrawal. 2020. Spatially aware multimodal transformers for textvqa. In ECCV. 715--732. Yash Kant Dhruv Batra Peter Anderson Alexander Schwing Devi Parikh Jiasen Lu and Harsh Agrawal. 2020. Spatially aware multimodal transformers for textvqa. In ECCV. 715--732.","DOI":"10.1007\/978-3-030-58545-7_41"},{"key":"e_1_3_2_2_34_1","volume-title":"Scalable Generative Models for Graphs with Graph Attention Mechanism. arXiv preprint arXiv:1906.01861","author":"Kawai Wataru","year":"2019","unstructured":"Wataru Kawai , Yusuke Mukuta , and Tatsuya Harada . 2019. Scalable Generative Models for Graphs with Graph Attention Mechanism. arXiv preprint arXiv:1906.01861 ( 2019 ). Wataru Kawai, Yusuke Mukuta, and Tatsuya Harada. 2019. Scalable Generative Models for Graphs with Graph Attention Mechanism. arXiv preprint arXiv:1906.01861 (2019)."},{"key":"e_1_3_2_2_35_1","doi-asserted-by":"crossref","unstructured":"Corentin Kervadec Grigory Antipov Moez Baccouche and Christian Wolf. 2021. Roses Are Red Violets Are Blue... but Should Vqa Expect Them To?. In CVPR. 2776--2785. Corentin Kervadec Grigory Antipov Moez Baccouche and Christian Wolf. 2021. Roses Are Red Violets Are Blue... but Should Vqa Expect Them To?. In CVPR. 2776--2785.","DOI":"10.1109\/CVPR46437.2021.00280"},{"key":"e_1_3_2_2_36_1","doi-asserted-by":"publisher","DOI":"10.5555\/3326943.3327087"},{"key":"e_1_3_2_2_37_1","volume-title":"Auto-encoding variational bayes. arXiv preprint arXiv:1312.6114","author":"Kingma Diederik P","year":"2013","unstructured":"Diederik P Kingma and Max Welling . 2013. Auto-encoding variational bayes. arXiv preprint arXiv:1312.6114 ( 2013 ). Diederik P Kingma and Max Welling. 2013. Auto-encoding variational bayes. arXiv preprint arXiv:1312.6114 (2013)."},{"key":"e_1_3_2_2_38_1","volume-title":"Semi-supervised classification with graph convolutional networks. arXiv preprint arXiv:1609.02907","author":"Kipf Thomas N","year":"2016","unstructured":"Thomas N Kipf and Max Welling . 2016a. Semi-supervised classification with graph convolutional networks. arXiv preprint arXiv:1609.02907 ( 2016 ). Thomas N Kipf and Max Welling. 2016a. Semi-supervised classification with graph convolutional networks. arXiv preprint arXiv:1609.02907 (2016)."},{"key":"e_1_3_2_2_39_1","volume-title":"Variational graph auto-encoders. arXiv preprint arXiv:1611.07308","author":"Kipf Thomas N","year":"2016","unstructured":"Thomas N Kipf and Max Welling . 2016b. Variational graph auto-encoders. arXiv preprint arXiv:1611.07308 ( 2016 ). Thomas N Kipf and Max Welling. 2016b. Variational graph auto-encoders. arXiv preprint arXiv:1611.07308 (2016)."},{"key":"e_1_3_2_2_40_1","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-016-0981-7"},{"key":"e_1_3_2_2_41_1","unstructured":"Gouthaman KV and Anurag Mittal. 2020. Reducing Language Biases in Visual Question Answering with Visually-Grounded Question Encoder. In ECCV . Gouthaman KV and Anurag Mittal. 2020. Reducing Language Biases in Visual Question Answering with Visually-Grounded Question Encoder. In ECCV ."},{"key":"e_1_3_2_2_42_1","volume-title":"Building machines that learn and think like people. Behavioral and brain sciences","author":"Lake Brenden M","year":"2017","unstructured":"Brenden M Lake , Tomer D Ullman , Joshua B Tenenbaum , and Samuel J Gershman . 2017. Building machines that learn and think like people. Behavioral and brain sciences , Vol. 40 ( 2017 ). Brenden M Lake, Tomer D Ullman, Joshua B Tenenbaum, and Samuel J Gershman. 2017. Building machines that learn and think like people. Behavioral and brain sciences, Vol. 40 (2017)."},{"key":"e_1_3_2_2_43_1","doi-asserted-by":"crossref","unstructured":"Linjie Li Zhe Gan Yu Cheng and Jingjing Liu. 2019. Relation-aware graph attention network for visual question answering. In ICCV. 10313--10322. Linjie Li Zhe Gan Yu Cheng and Jingjing Liu. 2019. Relation-aware graph attention network for visual question answering. In ICCV. 10313--10322.","DOI":"10.1109\/ICCV.2019.01041"},{"key":"e_1_3_2_2_44_1","volume-title":"A Closer Look at the Robustness of Vision-and-Language Pre-trained Models. arXiv preprint arXiv:2012.08673","author":"Li Linjie","year":"2020","unstructured":"Linjie Li , Zhe Gan , and Jingjing Liu . 2020. A Closer Look at the Robustness of Vision-and-Language Pre-trained Models. arXiv preprint arXiv:2012.08673 ( 2020 ). Linjie Li, Zhe Gan, and Jingjing Liu. 2020. A Closer Look at the Robustness of Vision-and-Language Pre-trained Models. arXiv preprint arXiv:2012.08673 (2020)."},{"key":"e_1_3_2_2_45_1","doi-asserted-by":"crossref","unstructured":"Zujie Liang Weitao Jiang Haifeng Hu and Jiaying Zhu. 2020. Learning to Contrast the Counterfactual Samples for Robust Visual Question Answering. In EMNLP. 3285--3292. Zujie Liang Weitao Jiang Haifeng Hu and Jiaying Zhu. 2020. Learning to Contrast the Counterfactual Samples for Robust Visual Question Answering. In EMNLP. 3285--3292.","DOI":"10.18653\/v1\/2020.emnlp-main.265"},{"key":"e_1_3_2_2_46_1","doi-asserted-by":"publisher","DOI":"10.5555\/3454287.3454670"},{"key":"e_1_3_2_2_47_1","doi-asserted-by":"crossref","unstructured":"Yongfei Liu Bo Wan Xiaodan Zhu and Xuming He. 2020. Learning cross-modal context graph for visual grounding. In AAAI. 11645--11652. Yongfei Liu Bo Wan Xiaodan Zhu and Xuming He. 2020. Learning cross-modal context graph for visual grounding. In AAAI. 11645--11652.","DOI":"10.1609\/aaai.v34i07.6833"},{"key":"e_1_3_2_2_48_1","doi-asserted-by":"crossref","unstructured":"Nelson Nauata Kai-Hung Chang Chin-Yi Cheng Greg Mori and Yasutaka Furukawa. 2020. House-GAN: Relational generative adversarial networks for graph-constrained house layout generation. In ECCV. 162--177. Nelson Nauata Kai-Hung Chang Chin-Yi Cheng Greg Mori and Yasutaka Furukawa. 2020. House-GAN: Relational generative adversarial networks for graph-constrained house layout generation. In ECCV. 162--177.","DOI":"10.1007\/978-3-030-58452-8_10"},{"key":"e_1_3_2_2_49_1","volume-title":"Counterfactual VQA: A Cause-Effect Look at Language Bias. arXiv preprint arXiv:2006.04315","author":"Niu Yulei","year":"2020","unstructured":"Yulei Niu , Kaihua Tang , Hanwang Zhang , Zhiwu Lu , Xian-Sheng Hua , and Ji-Rong Wen . 2020. Counterfactual VQA: A Cause-Effect Look at Language Bias. arXiv preprint arXiv:2006.04315 ( 2020 ). Yulei Niu, Kaihua Tang, Hanwang Zhang, Zhiwu Lu, Xian-Sheng Hua, and Ji-Rong Wen. 2020. Counterfactual VQA: A Cause-Effect Look at Language Bias. arXiv preprint arXiv:2006.04315 (2020)."},{"key":"e_1_3_2_2_50_1","doi-asserted-by":"publisher","DOI":"10.5555\/3304889.3305023"},{"key":"e_1_3_2_2_51_1","volume-title":"Rankvqa: Answer Re-Ranking For Visual Question Answering. In ICME. 1--6.","author":"Qiao Yanyuan","year":"2020","unstructured":"Yanyuan Qiao , Zheng Yu , and Jing Liu . 2020 . Rankvqa: Answer Re-Ranking For Visual Question Answering. In ICME. 1--6. Yanyuan Qiao, Zheng Yu, and Jing Liu. 2020. Rankvqa: Answer Re-Ranking For Visual Question Answering. In ICME. 1--6."},{"key":"e_1_3_2_2_52_1","doi-asserted-by":"crossref","unstructured":"Ramprasaath R Selvaraju Stefan Lee Yilin Shen Hongxia Jin Shalini Ghosh Larry Heck Dhruv Batra and Devi Parikh. 2019. Taking a hint: Leveraging explanations to make vision and language models more grounded. In ICCV. 2591--2600. Ramprasaath R Selvaraju Stefan Lee Yilin Shen Hongxia Jin Shalini Ghosh Larry Heck Dhruv Batra and Devi Parikh. 2019. Taking a hint: Leveraging explanations to make vision and language models more grounded. In ICCV. 2591--2600.","DOI":"10.1109\/ICCV.2019.00268"},{"key":"e_1_3_2_2_53_1","unstructured":"Chence Shi Minkai Xu Zhaocheng Zhu Weinan Zhang Ming Zhang and Jian Tang. 2020. GraphAF: a flow-based autoregressive model for molecular graph generation. In ICLR . Chence Shi Minkai Xu Zhaocheng Zhu Weinan Zhang Ming Zhang and Jian Tang. 2020. GraphAF: a flow-based autoregressive model for molecular graph generation. In ICLR ."},{"key":"e_1_3_2_2_54_1","doi-asserted-by":"crossref","unstructured":"Kevin J Shih Saurabh Singh and Derek Hoiem. 2016. Where to look: Focus regions for visual question answering. In CVPR. 4613--4621. Kevin J Shih Saurabh Singh and Derek Hoiem. 2016. Where to look: Focus regions for visual question answering. In CVPR. 4613--4621.","DOI":"10.1109\/CVPR.2016.499"},{"key":"e_1_3_2_2_55_1","volume-title":"Graphvae: Towards generation of small graphs using variational autoencoders. In ICANN. 412--422.","author":"Simonovsky Martin","year":"2018","unstructured":"Martin Simonovsky and Nikos Komodakis . 2018 . Graphvae: Towards generation of small graphs using variational autoencoders. In ICANN. 412--422. Martin Simonovsky and Nikos Komodakis. 2018. Graphvae: Towards generation of small graphs using variational autoencoders. In ICANN. 412--422."},{"key":"e_1_3_2_2_56_1","volume-title":"LXMERT: Learning cross-modality encoder representations from transformers. In EMNLP. 5099--5110.","author":"Tan Hao","year":"2019","unstructured":"Hao Tan and Mohit Bansal . 2019 . LXMERT: Learning cross-modality encoder representations from transformers. In EMNLP. 5099--5110. Hao Tan and Mohit Bansal. 2019. LXMERT: Learning cross-modality encoder representations from transformers. In EMNLP. 5099--5110."},{"key":"e_1_3_2_2_57_1","doi-asserted-by":"crossref","unstructured":"Damien Teney Ehsan Abbasnejad and A. V. D. Hengel. 2020 a. Learning What Makes a Difference from Counterfactual Examples and Gradient Supervision. In ECCV. 580--599. Damien Teney Ehsan Abbasnejad and A. V. D. Hengel. 2020 a. Learning What Makes a Difference from Counterfactual Examples and Gradient Supervision. In ECCV. 580--599.","DOI":"10.1007\/978-3-030-58607-2_34"},{"key":"e_1_3_2_2_58_1","volume-title":"2020 b. Unshuffling data for improved generalization. arXiv preprint arXiv:2002.11894","author":"Teney Damien","year":"2020","unstructured":"Damien Teney , Ehsan Abbasnejad , and Anton van den Hengel . 2020 b. Unshuffling data for improved generalization. arXiv preprint arXiv:2002.11894 ( 2020 ). Damien Teney, Ehsan Abbasnejad, and Anton van den Hengel. 2020 b. Unshuffling data for improved generalization. arXiv preprint arXiv:2002.11894 (2020)."},{"key":"e_1_3_2_2_59_1","doi-asserted-by":"crossref","unstructured":"Damien Teney and Anton van den Hengel. 2019. Actively seeking and learning from live data. In CVPR. 1940--1949. Damien Teney and Anton van den Hengel. 2019. Actively seeking and learning from live data. In CVPR. 1940--1949.","DOI":"10.1109\/CVPR.2019.00204"},{"key":"e_1_3_2_2_60_1","unstructured":"Damien Teney Kushal Kafle Robik Shrestha Ehsan Abbasnejad Christopher Kanan and Anton van den Hengel. 2020 c. On the Value of Out-of-Distribution Testing: An Example of Goodhart's Law. In NeurIPS . Damien Teney Kushal Kafle Robik Shrestha Ehsan Abbasnejad Christopher Kanan and Anton van den Hengel. 2020 c. On the Value of Out-of-Distribution Testing: An Example of Goodhart's Law. In NeurIPS ."},{"key":"e_1_3_2_2_61_1","volume-title":"Visual question answering: A tutorial","author":"Teney Damien","year":"2017","unstructured":"Damien Teney , Qi Wu , and Anton van den Hengel . 2017. Visual question answering: A tutorial ., Vol. 34 , 6 ( 2017 ), 63--75. Damien Teney, Qi Wu, and Anton van den Hengel. 2017. Visual question answering: A tutorial., Vol. 34, 6 (2017), 63--75."},{"key":"e_1_3_2_2_62_1","volume-title":"Graph attention networks. arXiv preprint arXiv:1710.10903","author":"Petar Velivc","year":"2017","unstructured":"Petar Velivc kovi\u0107, Guillem Cucurull , Arantxa Casanova , Adriana Romero , Pietro Lio , and Yoshua Bengio . 2017. Graph attention networks. arXiv preprint arXiv:1710.10903 ( 2017 ). Petar Velivc kovi\u0107, Guillem Cucurull, Arantxa Casanova, Adriana Romero, Pietro Lio, and Yoshua Bengio. 2017. Graph attention networks. arXiv preprint arXiv:1710.10903 (2017)."},{"key":"e_1_3_2_2_63_1","doi-asserted-by":"publisher","DOI":"10.1145\/1390156.1390294"},{"key":"e_1_3_2_2_64_1","volume-title":"Graphgan: Graph representation learning with generative adversarial nets. In AAAI. 2508--2515.","author":"Wang Hongwei","year":"2018","unstructured":"Hongwei Wang , Jia Wang , Jialin Wang , Miao Zhao , Weinan Zhang , Fuzheng Zhang , Xing Xie , and Minyi Guo . 2018 . Graphgan: Graph representation learning with generative adversarial nets. In AAAI. 2508--2515. Hongwei Wang, Jia Wang, Jialin Wang, Miao Zhao, Weinan Zhang, Fuzheng Zhang, Xing Xie, and Minyi Guo. 2018. Graphgan: Graph representation learning with generative adversarial nets. In AAAI. 2508--2515."},{"key":"e_1_3_2_2_65_1","doi-asserted-by":"publisher","DOI":"10.5555\/3454287.3455059"},{"key":"e_1_3_2_2_66_1","volume-title":"How powerful are graph neural networks? arXiv preprint arXiv:1810.00826","author":"Xu Keyulu","year":"2018","unstructured":"Keyulu Xu , Weihua Hu , Jure Leskovec , and Stefanie Jegelka . 2018. How powerful are graph neural networks? arXiv preprint arXiv:1810.00826 ( 2018 ). Keyulu Xu, Weihua Hu, Jure Leskovec, and Stefanie Jegelka. 2018. How powerful are graph neural networks? arXiv preprint arXiv:1810.00826 (2018)."},{"key":"e_1_3_2_2_67_1","volume-title":"2020 a. Learning content and context with language bias for Visual Question Answering. arXiv preprint arXiv:2012.11134","author":"Yang Chao","year":"2020","unstructured":"Chao Yang , Su Feng , Dongsheng Li , Huawei Shen , Guoqing Wang , and Bin Jiang . 2020 a. Learning content and context with language bias for Visual Question Answering. arXiv preprint arXiv:2012.11134 ( 2020 ). Chao Yang, Su Feng, Dongsheng Li, Huawei Shen, Guoqing Wang, and Bin Jiang. 2020 a. Learning content and context with language bias for Visual Question Answering. arXiv preprint arXiv:2012.11134 (2020)."},{"key":"e_1_3_2_2_68_1","doi-asserted-by":"crossref","unstructured":"Sibei Yang Guanbin Li and Yizhou Yu. 2020 b. Graph-structured referring expression reasoning in the wild. In CVPR. 9952--9961. Sibei Yang Guanbin Li and Yizhou Yu. 2020 b. Graph-structured referring expression reasoning in the wild. In CVPR. 9952--9961.","DOI":"10.1109\/CVPR42600.2020.00997"},{"key":"e_1_3_2_2_69_1","doi-asserted-by":"crossref","unstructured":"Ting Yao Yingwei Pan Yehao Li and Tao Mei. 2018. Exploring visual relationship for image captioning. In ECCV. 684--699. Ting Yao Yingwei Pan Yehao Li and Tao Mei. 2018. Exploring visual relationship for image captioning. In ECCV. 684--699.","DOI":"10.1007\/978-3-030-01264-9_42"},{"key":"e_1_3_2_2_70_1","volume-title":"Graphrnn: Generating realistic graphs with deep auto-regressive models. In ICML. 5694--5703.","author":"You Jiaxuan","year":"2018","unstructured":"Jiaxuan You , Rex Ying , Xiang Ren , William L Hamilton , and Jure Leskovec . 2018 . Graphrnn: Generating realistic graphs with deep auto-regressive models. In ICML. 5694--5703. Jiaxuan You, Rex Ying, Xiang Ren, William L Hamilton, and Jure Leskovec. 2018. Graphrnn: Generating realistic graphs with deep auto-regressive models. In ICML. 5694--5703."},{"key":"e_1_3_2_2_71_1","unstructured":"Yuning You Tianlong Chen Yongduo Sui Ting Chen Zhangyang Wang and Yang Shen. 2020. Graph contrastive learning with augmentations. In NeurIPS. 5812--5823. Yuning You Tianlong Chen Yongduo Sui Ting Chen Zhangyang Wang and Yang Shen. 2020. Graph contrastive learning with augmentations. In NeurIPS. 5812--5823."},{"key":"e_1_3_2_2_72_1","doi-asserted-by":"publisher","DOI":"10.1145\/3219819.3220000"},{"key":"e_1_3_2_2_73_1","unstructured":"Zhou Yu Jun Yu Yuhao Cui Dacheng Tao and Qi Tian. 2019. Deep modular co-attention networks for visual question answering. In CVPR. 6281--6290. Zhou Yu Jun Yu Yuhao Cui Dacheng Tao and Qi Tian. 2019. Deep modular co-attention networks for visual question answering. In CVPR. 6281--6290."},{"key":"e_1_3_2_2_74_1","doi-asserted-by":"crossref","unstructured":"Peng Zhang Yash Goyal Douglas Summers-Stay Dhruv Batra and Devi Parikh. 2016. Yin and yang: Balancing and answering binary visual questions. In CVPR. 5014--5022. Peng Zhang Yash Goyal Douglas Summers-Stay Dhruv Batra and Devi Parikh. 2016. Yin and yang: Balancing and answering binary visual questions. In CVPR. 5014--5022.","DOI":"10.1109\/CVPR.2016.542"},{"key":"e_1_3_2_2_75_1","doi-asserted-by":"crossref","unstructured":"Wenqiao Zhang Haochen Shi Siliang Tang Jun Xiao Qiang Yu and Yueting Zhuang. 2021. Consensus graph representation learning for better grounded image captioning. In AAAI . Wenqiao Zhang Haochen Shi Siliang Tang Jun Xiao Qiang Yu and Yueting Zhuang. 2021. Consensus graph representation learning for better grounded image captioning. In AAAI .","DOI":"10.1609\/aaai.v35i4.16452"},{"key":"e_1_3_2_2_76_1","doi-asserted-by":"crossref","unstructured":"Shuai Zheng Zhenfeng Zhu Xingxing Zhang Zhizhe Liu Jian Cheng and Yao Zhao. 2020. Distribution-induced Bidirectional Generative Adversarial Network for Graph Representation Learning. In CVPR. 7224--7233. Shuai Zheng Zhenfeng Zhu Xingxing Zhang Zhizhe Liu Jian Cheng and Yao Zhao. 2020. Distribution-induced Bidirectional Generative Adversarial Network for Graph Representation Learning. In CVPR. 7224--7233.","DOI":"10.1109\/CVPR42600.2020.00725"},{"key":"e_1_3_2_2_77_1","doi-asserted-by":"crossref","unstructured":"Xi Zhu Zhendong Mao Chunxiao Liu Peng Zhang Bin Wang and Yongdong Zhang. 2020 a. Overcoming Language Priors with Self-supervised Learning for Visual Question Answering. In IJCAI. 1083--1089. Xi Zhu Zhendong Mao Chunxiao Liu Peng Zhang Bin Wang and Yongdong Zhang. 2020 a. Overcoming Language Priors with Self-supervised Learning for Visual Question Answering. In IJCAI. 1083--1089.","DOI":"10.24963\/ijcai.2020\/151"},{"key":"e_1_3_2_2_78_1","volume-title":"2020 b. Mucko: Multi-Layer Cross-Modal Knowledge Reasoning for Fact-based VisualQuestion Answering. arXiv preprint arXiv:2006.09073","author":"Zhu Zihao","year":"2020","unstructured":"Zihao Zhu , Jing Yu , Yujing Wang , Yajing Sun , Yue Hu , and Qi Wu . 2020 b. Mucko: Multi-Layer Cross-Modal Knowledge Reasoning for Fact-based VisualQuestion Answering. arXiv preprint arXiv:2006.09073 ( 2020 ). Zihao Zhu, Jing Yu, Yujing Wang, Yajing Sun, Yue Hu, and Qi Wu. 2020 b. Mucko: Multi-Layer Cross-Modal Knowledge Reasoning for Fact-based VisualQuestion Answering. arXiv preprint arXiv:2006.09073 (2020)."}],"event":{"name":"MM '21: ACM Multimedia Conference","location":"Virtual Event China","acronym":"MM '21","sponsor":["SIGMM ACM Special Interest Group on Multimedia"]},"container-title":["Proceedings of the 29th ACM International Conference on Multimedia"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3474085.3475350","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3474085.3475350","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,17]],"date-time":"2025-06-17T20:49:18Z","timestamp":1750193358000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3474085.3475350"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2021,10,17]]},"references-count":78,"alternative-id":["10.1145\/3474085.3475350","10.1145\/3474085"],"URL":"https:\/\/doi.org\/10.1145\/3474085.3475350","relation":{},"subject":[],"published":{"date-parts":[[2021,10,17]]},"assertion":[{"value":"2021-10-17","order":2,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}