{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,2,12]],"date-time":"2026-02-12T14:05:15Z","timestamp":1770905115925,"version":"3.50.1"},"publisher-location":"New York, NY, USA","reference-count":44,"publisher":"ACM","license":[{"start":{"date-parts":[[2021,10,17]],"date-time":"2021-10-17T00:00:00Z","timestamp":1634428800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.acm.org\/publications\/policies\/copyright_policy#Background"}],"funder":[{"name":"the Science and Technology Planning Project of Guangdong Province","award":["2020B0101100002"],"award-info":[{"award-number":["2020B0101100002"]}]},{"name":"the National Natural Science Foundation of China","award":["62076100"],"award-info":[{"award-number":["62076100"]}]},{"name":"Fundamental Research Funds for the Central Universities SCUT","award":["D2210010 D2200150 and D2201300"],"award-info":[{"award-number":["D2210010 D2200150 and D2201300"]}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2021,10,17]]},"DOI":"10.1145\/3474085.3476969","type":"proceedings-article","created":{"date-parts":[[2021,10,18]],"date-time":"2021-10-18T06:21:10Z","timestamp":1634538070000},"page":"4546-4554","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":19,"title":["Multiple Objects-Aware Visual Question Generation"],"prefix":"10.1145","author":[{"given":"Jiayuan","family":"Xie","sequence":"first","affiliation":[{"name":"South China University of Technology &amp; Ministry of Education, Guangzhou, Guangdong, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yi","family":"Cai","sequence":"additional","affiliation":[{"name":"South China University of Technology &amp; Ministry of Education, Guangzhou, Guangdong, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Qingbao","family":"Huang","sequence":"additional","affiliation":[{"name":"South China University of Technology, Ministry of Education, &amp; Guangxi University, Guangzhou, Guangdong, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Tao","family":"Wang","sequence":"additional","affiliation":[{"name":"King's College London, London, United Kingdom"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2021,10,17]]},"reference":[{"key":"e_1_3_2_1_1_1","doi-asserted-by":"crossref","unstructured":"Peter Anderson Xiaodong He Chris Buehler Damien Teney Mark Johnson Stephen Gould and Lei Zhang. 2018. Bottom-up and top-down attention for image captioning and visual question answering. In CVPR. 6077--6086. Peter Anderson Xiaodong He Chris Buehler Damien Teney Mark Johnson Stephen Gould and Lei Zhang. 2018. Bottom-up and top-down attention for image captioning and visual question answering. In CVPR. 6077--6086.","DOI":"10.1109\/CVPR.2018.00636"},{"key":"e_1_3_2_1_2_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2015.279"},{"key":"e_1_3_2_1_3_1","volume-title":"Microsoft COCO Captions: Data Collection and Evaluation Server. arXiv:1504.00325","author":"Chen Xinlei","year":"2015","unstructured":"Xinlei Chen , Hao Fang , Tsung-Yi Lin , Ramakrishna Vedantam , Saurabh Gupta , Piotr Doll\u00e1r , and C. Lawrence Zitnick . 2015. Microsoft COCO Captions: Data Collection and Evaluation Server. arXiv:1504.00325 ( 2015 ). Xinlei Chen, Hao Fang, Tsung-Yi Lin, Ramakrishna Vedantam, Saurabh Gupta, Piotr Doll\u00e1r, and C. Lawrence Zitnick. 2015. Microsoft COCO Captions: Data Collection and Evaluation Server. arXiv:1504.00325 (2015)."},{"key":"e_1_3_2_1_4_1","volume-title":"Meteor Universal: Language Specific Translation Evaluation for Any Target Language. In ACL workshop. 376--380","author":"Michael","unstructured":"Michael J. Denkowski and Alon Lavie. 2014 . Meteor Universal: Language Specific Translation Evaluation for Any Target Language. In ACL workshop. 376--380 . Michael J. Denkowski and Alon Lavie. 2014. Meteor Universal: Language Specific Translation Evaluation for Any Target Language. In ACL workshop. 376--380."},{"key":"e_1_3_2_1_5_1","doi-asserted-by":"publisher","DOI":"10.5555\/3304222.3304333"},{"key":"e_1_3_2_1_6_1","doi-asserted-by":"publisher","DOI":"10.5555\/2969442.2969496"},{"key":"e_1_3_2_1_7_1","doi-asserted-by":"crossref","unstructured":"Yash Goyal Tejas Khot Douglas Summers-Stay Dhruv Batra and Devi Parikh. 2017. Making the V in VQA Matter: Elevating the Role of Image Understanding in Visual Question Answering. In CVPR. 6325--6334. Yash Goyal Tejas Khot Douglas Summers-Stay Dhruv Batra and Devi Parikh. 2017. Making the V in VQA Matter: Elevating the Role of Image Understanding in Visual Question Answering. In CVPR. 6325--6334.","DOI":"10.1109\/CVPR.2017.670"},{"key":"e_1_3_2_1_8_1","doi-asserted-by":"publisher","DOI":"10.1162\/neco.1997.9.8.1735"},{"key":"e_1_3_2_1_9_1","doi-asserted-by":"crossref","unstructured":"Qingbao Huang Jielong Wei Yi Cai Changmeng Zheng Junying Chen Ho-fung Leung and Qing Li. 2020. Aligned Dual Channel Graph Convolutional Network for Visual Question Answering. In ACL. 7166--7176. Qingbao Huang Jielong Wei Yi Cai Changmeng Zheng Junying Chen Ho-fung Leung and Qing Li. 2020. Aligned Dual Channel Graph Convolutional Network for Visual Question Answering. In ACL. 7166--7176.","DOI":"10.18653\/v1\/2020.acl-main.642"},{"key":"e_1_3_2_1_10_1","doi-asserted-by":"crossref","unstructured":"Unnat Jain Svetlana Lazebnik and Alexander G Schwing. 2018. Two can play this game: visual dialog with discriminative question generation and answering. In CVPR. 5754--5763. Unnat Jain Svetlana Lazebnik and Alexander G Schwing. 2018. Two can play this game: visual dialog with discriminative question generation and answering. In CVPR. 5754--5763.","DOI":"10.1109\/CVPR.2018.00603"},{"key":"e_1_3_2_1_11_1","volume-title":"Schwing","author":"Jain Unnat","year":"2018","unstructured":"Unnat Jain , Svetlana Lazebnik , and Alexander G . Schwing . 2018 . Two Can Play This Game: Visual Dialog With Discriminative Question Generation and Answering. In CVPR. 5754--5763. Unnat Jain, Svetlana Lazebnik, and Alexander G. Schwing. 2018. Two Can Play This Game: Visual Dialog With Discriminative Question Generation and Answering. In CVPR. 5754--5763."},{"key":"e_1_3_2_1_12_1","doi-asserted-by":"crossref","unstructured":"Andrej Karpathy and Fei-Fei Li. 2015. Deep visual-semantic alignments for generating image descriptions. In CVPR. 3128--3137. Andrej Karpathy and Fei-Fei Li. 2015. Deep visual-semantic alignments for generating image descriptions. In CVPR. 3128--3137.","DOI":"10.1109\/CVPR.2015.7298932"},{"key":"e_1_3_2_1_13_1","volume-title":"3rd International Conference on Learning Representations, ICLR.","author":"Diederik","unstructured":"Diederik P. Kingma and Jimmy Ba. 2015. Adam: A Method for Stochastic Opti- mization . In 3rd International Conference on Learning Representations, ICLR. Diederik P. Kingma and Jimmy Ba. 2015. Adam: A Method for Stochastic Opti- mization. In 3rd International Conference on Learning Representations, ICLR."},{"key":"e_1_3_2_1_14_1","unstructured":"Thomas Kipf and Max Welling. 2017. Semisupervised classification with graph convolutional networks. In ICLR. Thomas Kipf and Max Welling. 2017. Semisupervised classification with graph convolutional networks. In ICLR."},{"key":"e_1_3_2_1_15_1","doi-asserted-by":"crossref","unstructured":"Ranjay Krishna Michael Bernstein and Li Fei-Fei. 2019. Information Maximizing Visual Question Generation. In CVPR. 2008--2018. Ranjay Krishna Michael Bernstein and Li Fei-Fei. 2019. Information Maximizing Visual Question Generation. In CVPR. 2008--2018.","DOI":"10.1109\/CVPR.2019.00211"},{"key":"e_1_3_2_1_16_1","volume-title":"Proc. of ICCE.","author":"Kunichika Hidenobu","year":"2004","unstructured":"Hidenobu Kunichika , Tomoki Katayama , Tsukasa Hirashima , and Akira Takeuchi . 2004 . Automated question generation methods for intelligent English learning systems and its evaluation . In Proc. of ICCE. Hidenobu Kunichika, Tomoki Katayama, Tsukasa Hirashima, and Akira Takeuchi. 2004. Automated question generation methods for intelligent English learning systems and its evaluation. In Proc. of ICCE."},{"key":"e_1_3_2_1_17_1","doi-asserted-by":"crossref","unstructured":"Linjie Li Zhe Gan Yu Cheng and Jingjing Liu. 2019. Relation-Aware Graph Attention Network for Visual Question Answering. In ICCV. 10312--10321. Linjie Li Zhe Gan Yu Cheng and Jingjing Liu. 2019. Relation-Aware Graph Attention Network for Visual Question Answering. In ICCV. 10312--10321.","DOI":"10.1109\/ICCV.2019.01041"},{"key":"e_1_3_2_1_18_1","unstructured":"Yikang Li Nan Duan Bolei Zhou Xiao Chu Wanli Ouyang Xiaogang Wang and Ming Zhou. 2018. Visual Question Generation as Dual Task of Visual Question Answering. In CVPR. 6116--6124. Yikang Li Nan Duan Bolei Zhou Xiao Chu Wanli Ouyang Xiaogang Wang and Ming Zhou. 2018. Visual Question Generation as Dual Task of Visual Question Answering. In CVPR. 6116--6124."},{"key":"e_1_3_2_1_19_1","volume-title":"ACL workshop. 74--81","author":"Lin Chin-Yew","year":"2004","unstructured":"Chin-Yew Lin . 2004 . Rouge: A package for automatic evaluation of summaries . In ACL workshop. 74--81 . Chin-Yew Lin. 2004. Rouge: A package for automatic evaluation of summaries. In ACL workshop. 74--81."},{"key":"e_1_3_2_1_20_1","volume-title":"IVQA: Inverse Visual Question Answering. In CVPR. 8611--8619.","author":"Liu Feng","year":"2018","unstructured":"Feng Liu , Tao Xiang , Timothy M. Hospedales , Wankou Yang , and Changyin Sun . 2018 . IVQA: Inverse Visual Question Answering. In CVPR. 8611--8619. Feng Liu, Tao Xiang, Timothy M. Hospedales, Wankou Yang, and Changyin Sun. 2018. IVQA: Inverse Visual Question Answering. In CVPR. 8611--8619."},{"key":"e_1_3_2_1_21_1","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2018.2880185"},{"key":"e_1_3_2_1_22_1","unstructured":"Jiasen Lu Caiming Xiong Devi Parikh and Richard Socher. 2017. Knowing When to Look: Adaptive Attention via a Visual Sentinel for Image Captioning. In CVPR. 3242--3250. Jiasen Lu Caiming Xiong Devi Parikh and Richard Socher. 2017. Knowing When to Look: Adaptive Attention via a Visual Sentinel for Image Captioning. In CVPR. 3242--3250."},{"key":"e_1_3_2_1_23_1","doi-asserted-by":"crossref","unstructured":"Shuming Ma Xu Sun Wei Li Sujian Li Wenjie Li and Xuancheng Ren. 2018. Query and output: Generating words by querying distributed word representations for paraphrase generation. In NAACL-HLT. 196--206. Shuming Ma Xu Sun Wei Li Sujian Li Wenjie Li and Xuancheng Ren. 2018. Query and output: Generating words by querying distributed word representations for paraphrase generation. In NAACL-HLT. 196--206.","DOI":"10.18653\/v1\/N18-1018"},{"key":"e_1_3_2_1_24_1","doi-asserted-by":"publisher","DOI":"10.5555\/2968826.2969014"},{"key":"e_1_3_2_1_25_1","doi-asserted-by":"crossref","unstructured":"Nasrin Mostafazadeh Ishan Misra Jacob Devlin Margaret Mitchell Xiaodong He and Lucy Vanderwende. 2016. Generating Natural Questions About an Image. In ACL. Nasrin Mostafazadeh Ishan Misra Jacob Devlin Margaret Mitchell Xiaodong He and Lucy Vanderwende. 2016. Generating Natural Questions About an Image. In ACL.","DOI":"10.18653\/v1\/P16-1170"},{"key":"e_1_3_2_1_26_1","doi-asserted-by":"publisher","DOI":"10.3115\/1073083.1073135"},{"key":"e_1_3_2_1_27_1","volume-title":"Vinod Kumar Kurmi, and Vinay P. Nam-boodiri","author":"Patro Badri Narayana","year":"2018","unstructured":"Badri Narayana Patro , Sandeep Kumar , Vinod Kumar Kurmi, and Vinay P. Nam-boodiri . 2018 . Multimodal Differential Network for Visual Question Generation. In EMNLP. 4002--4012. Badri Narayana Patro, Sandeep Kumar, Vinod Kumar Kurmi, and Vinay P. Nam-boodiri. 2018. Multimodal Differential Network for Visual Question Generation. In EMNLP. 4002--4012."},{"key":"e_1_3_2_1_28_1","volume-title":"Namboodiri","author":"Patro Badri N.","year":"2020","unstructured":"Badri N. Patro , Vinod K. Kurmi , Sandeep Kumar , and Vinay P . Namboodiri . 2020 . Deep Bayesian Network for Visual Question Generation. In WACV. 1555--1565. Badri N. Patro, Vinod K. Kurmi, Sandeep Kumar, and Vinay P. Namboodiri. 2020. Deep Bayesian Network for Visual Question Generation. In WACV. 1555--1565."},{"key":"e_1_3_2_1_29_1","volume-title":"Glove: Global vectors for word representation. In EMNLP. 1532--1543.","author":"Pennington Jeffrey","year":"2014","unstructured":"Jeffrey Pennington , Richard Socher , and Christopher Manning . 2014 . Glove: Global vectors for word representation. In EMNLP. 1532--1543. Jeffrey Pennington, Richard Socher, and Christopher Manning. 2014. Glove: Global vectors for word representation. In EMNLP. 1532--1543."},{"key":"e_1_3_2_1_30_1","doi-asserted-by":"publisher","DOI":"10.5555\/2969442.2969570"},{"key":"e_1_3_2_1_31_1","doi-asserted-by":"publisher","DOI":"10.5555\/2969239.2969250"},{"key":"e_1_3_2_1_32_1","doi-asserted-by":"crossref","unstructured":"Andrew Shin Yoshitaka Ushiku and Tatsuya Harada. 2018. Customized Image Narrative Generation via Interactive Visual Question Generation and Answering. In CVPR. 8925--8933. Andrew Shin Yoshitaka Ushiku and Tatsuya Harada. 2018. Customized Image Narrative Generation via Interactive Visual Question Generation and Answering. In CVPR. 8925--8933.","DOI":"10.1109\/CVPR.2018.00930"},{"key":"e_1_3_2_1_33_1","doi-asserted-by":"publisher","DOI":"10.1146\/annurev.neuro.24.1.1193"},{"key":"e_1_3_2_1_34_1","doi-asserted-by":"publisher","DOI":"10.5555\/3295222.3295349"},{"key":"e_1_3_2_1_35_1","doi-asserted-by":"crossref","unstructured":"Ramakrishna Vedantam C. Lawrence Zitnick and Devi Parikh. 2015. CIDEr: Consensus-based image description evaluation. In CVPR. 4566--4575. Ramakrishna Vedantam C. Lawrence Zitnick and Devi Parikh. 2015. CIDEr: Consensus-based image description evaluation. In CVPR. 4566--4575.","DOI":"10.1109\/CVPR.2015.7299087"},{"key":"e_1_3_2_1_36_1","doi-asserted-by":"publisher","DOI":"10.1145\/3394171.3413650"},{"key":"e_1_3_2_1_37_1","doi-asserted-by":"publisher","DOI":"10.5555\/3045118.3045336"},{"key":"e_1_3_2_1_38_1","doi-asserted-by":"crossref","unstructured":"Xing Xu Jingkuan Song Huimin Lu Li He Yang Yang and Fumin Shen. 2018. Dual Learning for Visual Question Generation. In ICME. 1--6. Xing Xu Jingkuan Song Huimin Lu Li He Yang Yang and Fumin Shen. 2018. Dual Learning for Visual Question Generation. In ICME. 1--6.","DOI":"10.1109\/ICME.2018.8486475"},{"key":"e_1_3_2_1_39_1","doi-asserted-by":"crossref","unstructured":"X. Xu T. Wang Y. Yang A. Hanjalic and H. T. Shen. 2021. Radial Graph Convo- lutional Network for Visual Question Generation. IEEE Transactions on Neural Networks and Learning Systems (2021) 1654--1667. X. Xu T. Wang Y. Yang A. Hanjalic and H. T. Shen. 2021. Radial Graph Convo- lutional Network for Visual Question Generation. IEEE Transactions on Neural Networks and Learning Systems (2021) 1654--1667.","DOI":"10.1109\/TNNLS.2020.2986029"},{"key":"e_1_3_2_1_40_1","volume-title":"Smola","author":"Yang Zichao","year":"2016","unstructured":"Zichao Yang , Xiaodong He , Jianfeng Gao , Li Deng , and Alexander J . Smola . 2016 . Stacked Attention Networks for Image Question Answering. In CVPR. 21--29. Zichao Yang, Xiaodong He, Jianfeng Gao, Li Deng, and Alexander J. Smola. 2016. Stacked Attention Networks for Image Question Answering. In CVPR. 21--29."},{"key":"e_1_3_2_1_41_1","volume-title":"Berg","author":"Yu Licheng","year":"2015","unstructured":"Licheng Yu , Eunbyung Park , Alexander C. Berg , and Tamara L . Berg . 2015 . Visual Madlibs : Fill in the blank Image Generation and Question Answering. CoRR abs\/1506.00278 (2015). Licheng Yu, Eunbyung Park, Alexander C. Berg, and Tamara L. Berg. 2015. Visual Madlibs: Fill in the blank Image Generation and Question Answering. CoRR abs\/1506.00278 (2015)."},{"key":"e_1_3_2_1_42_1","doi-asserted-by":"crossref","unstructured":"Junjie Zhang Qi Wu Chunhua Shen Jian Zhang Jianfeng Lu and Anton van den Hengel. 2018. Goal-Oriented Visual Question Generation via Intermediate Rewards. In ECCV. 189--204. Junjie Zhang Qi Wu Chunhua Shen Jian Zhang Jianfeng Lu and Anton van den Hengel. 2018. Goal-Oriented Visual Question Generation via Intermediate Rewards. In ECCV. 189--204.","DOI":"10.1007\/978-3-030-01228-1_12"},{"key":"e_1_3_2_1_43_1","doi-asserted-by":"publisher","DOI":"10.5555\/3171837.3171878"},{"key":"e_1_3_2_1_44_1","doi-asserted-by":"crossref","unstructured":"Yuke Zhu Oliver Groth Michael S. Bernstein and Li Fei-Fei. 2016. Visual7W: Grounded Question Answering in Images. In CVPR. Yuke Zhu Oliver Groth Michael S. Bernstein and Li Fei-Fei. 2016. Visual7W: Grounded Question Answering in Images. In CVPR.","DOI":"10.1109\/CVPR.2016.540"}],"event":{"name":"MM '21: ACM Multimedia Conference","location":"Virtual Event China","acronym":"MM '21","sponsor":["SIGMM ACM Special Interest Group on Multimedia"]},"container-title":["Proceedings of the 29th ACM International Conference on Multimedia"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3474085.3476969","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3474085.3476969","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,17]],"date-time":"2025-06-17T20:48:26Z","timestamp":1750193306000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3474085.3476969"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2021,10,17]]},"references-count":44,"alternative-id":["10.1145\/3474085.3476969","10.1145\/3474085"],"URL":"https:\/\/doi.org\/10.1145\/3474085.3476969","relation":{},"subject":[],"published":{"date-parts":[[2021,10,17]]},"assertion":[{"value":"2021-10-17","order":2,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}