{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,8,23]],"date-time":"2025-08-23T05:23:42Z","timestamp":1755926622426,"version":"3.41.0"},"publisher-location":"New York, NY, USA","reference-count":57,"publisher":"ACM","license":[{"start":{"date-parts":[[2021,10,17]],"date-time":"2021-10-17T00:00:00Z","timestamp":1634428800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.acm.org\/publications\/policies\/copyright_policy#Background"}],"funder":[{"name":"Grant of Tianjin New Generation Artificial Intelligence Major Program","award":["19ZXZNGX00110, 18ZXZNGX00150"],"award-info":[{"award-number":["19ZXZNGX00110, 18ZXZNGX00150"]}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["61772359, 62002257"],"award-info":[{"award-number":["61772359, 62002257"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100012166","name":"National Key Research and Development Program of China","doi-asserted-by":"publisher","award":["2020YFB1406602"],"award-info":[{"award-number":["2020YFB1406602"]}],"id":[{"id":"10.13039\/501100012166","id-type":"DOI","asserted-by":"publisher"}]},{"name":"Open Funding Project of the State Key Laboratory of Communication Content Cognition","award":["Grant No.20K04"],"award-info":[{"award-number":["Grant No.20K04"]}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2021,10,17]]},"DOI":"10.1145\/3474085.3475545","type":"proceedings-article","created":{"date-parts":[[2021,10,18]],"date-time":"2021-10-18T04:52:26Z","timestamp":1634532746000},"page":"4128-4136","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":11,"title":["Mask and Predict"],"prefix":"10.1145","author":[{"given":"Hongshuo","family":"Tian","sequence":"first","affiliation":[{"name":"Tianjin University &amp; People's Daily Online, Tianjin, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Ning","family":"Xu","sequence":"additional","affiliation":[{"name":"Tianjin University, Tianjin, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"An-An","family":"Liu","sequence":"additional","affiliation":[{"name":"Tianjin University, Tianjin, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Chenggang","family":"Yan","sequence":"additional","affiliation":[{"name":"Hangzhou Dianzi University, Hangzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zhendong","family":"Mao","sequence":"additional","affiliation":[{"name":"University of Science and Technology of China, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Quan","family":"Zhang","sequence":"additional","affiliation":[{"name":"Peking University, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yongdong","family":"Zhang","sequence":"additional","affiliation":[{"name":"University of Science and Technology of China, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2021,10,17]]},"reference":[{"volume-title":"SPICE: Semantic Propositional Image Caption Evaluation. In ECCV. 382--398.","year":"2016","author":"Anderson Peter","key":"e_1_3_2_2_1_1"},{"key":"e_1_3_2_2_2_1","doi-asserted-by":"crossref","unstructured":"Long Chen Hanwang Zhang Jun Xiao Xiangnan He Shiliang Pu and Shih-Fu Chang. 2019 b. Counterfactual Critic Multi-Agent Training for Scene Graph Generation. In ICCV. 4612--4622.  Long Chen Hanwang Zhang Jun Xiao Xiangnan He Shiliang Pu and Shih-Fu Chang. 2019 b. Counterfactual Critic Multi-Agent Training for Scene Graph Generation. In ICCV. 4612--4622.","DOI":"10.1109\/ICCV.2019.00471"},{"key":"e_1_3_2_2_3_1","doi-asserted-by":"crossref","unstructured":"Shizhe Chen Qin Jin Peng Wang and Qi Wu. 2020. Say As You Wish: Fine-Grained Control of Image Caption Generation With Abstract Scene Graphs. In CVPR. 9959--9968.  Shizhe Chen Qin Jin Peng Wang and Qi Wu. 2020. Say As You Wish: Fine-Grained Control of Image Caption Generation With Abstract Scene Graphs. In CVPR. 9959--9968.","DOI":"10.1109\/CVPR42600.2020.00998"},{"key":"e_1_3_2_2_4_1","doi-asserted-by":"crossref","unstructured":"Tianshui Chen Weihao Yu Riquan Chen and Liang Lin. 2019 a. Knowledge-Embedded Routing Network for Scene Graph Generation. In CVPR. 6163--6171.  Tianshui Chen Weihao Yu Riquan Chen and Liang Lin. 2019 a. Knowledge-Embedded Routing Network for Scene Graph Generation. In CVPR. 6163--6171.","DOI":"10.1109\/CVPR.2019.00632"},{"key":"e_1_3_2_2_5_1","doi-asserted-by":"crossref","unstructured":"Xinlei Chen and Abhinav Gupta. 2017. Spatial Memory for Context Reasoning in Object Detection. In ICCV. 4106--4116.  Xinlei Chen and Abhinav Gupta. 2017. Spatial Memory for Context Reasoning in Object Detection. In ICCV. 4106--4116.","DOI":"10.1109\/ICCV.2017.440"},{"key":"e_1_3_2_2_6_1","doi-asserted-by":"crossref","unstructured":"Xinlei Chen Li-Jia Li Li Fei-Fei and Abhinav Gupta. 2018. Iterative Visual Reasoning Beyond Convolutions. In CVPR. 7239--7248.  Xinlei Chen Li-Jia Li Li Fei-Fei and Abhinav Gupta. 2018. Iterative Visual Reasoning Beyond Convolutions. In CVPR. 7239--7248.","DOI":"10.1109\/CVPR.2018.00756"},{"key":"e_1_3_2_2_7_1","doi-asserted-by":"crossref","unstructured":"Bo Dai Yuqi Zhang and Dahua Lin. 2017. Detecting Visual Relationships with Deep Relational Networks. In CVPR. 3298--3308.  Bo Dai Yuqi Zhang and Dahua Lin. 2017. Detecting Visual Relationships with Deep Relational Networks. In CVPR. 3298--3308.","DOI":"10.1109\/CVPR.2017.352"},{"key":"e_1_3_2_2_8_1","doi-asserted-by":"crossref","unstructured":"Marjan Ghazvininejad Omer Levy Yinhan Liu and Luke Zettlemoyer. 2019. Mask-Predict: Parallel Decoding of Conditional Masked Language Models. In EMNLP-IJCNLP. 6111--6120.  Marjan Ghazvininejad Omer Levy Yinhan Liu and Luke Zettlemoyer. 2019. Mask-Predict: Parallel Decoding of Conditional Masked Language Models. In EMNLP-IJCNLP. 6111--6120.","DOI":"10.18653\/v1\/D19-1633"},{"key":"e_1_3_2_2_9_1","unstructured":"Jiuxiang Gu Handong Zhao Zhe Lin Sheng Li Jianfei Cai and Mingyang Ling. 2019. Scene Graph Generation With External Knowledge and Image Reconstruction. In CVPR. 1969--1978.  Jiuxiang Gu Handong Zhao Zhe Lin Sheng Li Jianfei Cai and Mingyang Ling. 2019. Scene Graph Generation With External Knowledge and Image Reconstruction. In CVPR. 1969--1978."},{"key":"e_1_3_2_2_10_1","doi-asserted-by":"publisher","DOI":"10.1145\/3394171.3414025"},{"key":"e_1_3_2_2_11_1","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2018.2844175"},{"key":"e_1_3_2_2_12_1","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2017.2710635"},{"volume-title":"Action Genome: Actions As Compositions of Spatio-Temporal Scene Graphs. In CVPR. 10233--10244.","year":"2020","author":"Ji Jingwei","key":"e_1_3_2_2_13_1"},{"key":"e_1_3_2_2_14_1","doi-asserted-by":"crossref","unstructured":"Justin Johnson Ranjay Krishna Michael Stark Li-Jia Li David A. Shamma Michael S. Bernstein and Fei-Fei Li. 2015. Image retrieval using scene graphs. In CVPR. 3668--3678.  Justin Johnson Ranjay Krishna Michael Stark Li-Jia Li David A. Shamma Michael S. Bernstein and Fei-Fei Li. 2015. Image retrieval using scene graphs. In CVPR. 3668--3678.","DOI":"10.1109\/CVPR.2015.7298990"},{"key":"e_1_3_2_2_15_1","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-016-0981-7"},{"key":"e_1_3_2_2_16_1","doi-asserted-by":"crossref","unstructured":"Jason Lee Elman Mansimov and Kyunghyun Cho. 2018. Deterministic Non-Autoregressive Neural Sequence Modeling by Iterative Refinement. In EMNLP. 1173--1182.  Jason Lee Elman Mansimov and Kyunghyun Cho. 2018. Deterministic Non-Autoregressive Neural Sequence Modeling by Iterative Refinement. In EMNLP. 1173--1182.","DOI":"10.18653\/v1\/D18-1149"},{"key":"e_1_3_2_2_17_1","unstructured":"Yikang Li Wanli Ouyang Bolei Zhou Kun Wang and Xiaogang Wang. 2017. Scene Graph Generation from Objects Phrases and Region Captions. In ICCV. 1270--1279.  Yikang Li Wanli Ouyang Bolei Zhou Kun Wang and Xiaogang Wang. 2017. Scene Graph Generation from Objects Phrases and Region Captions. In ICCV. 1270--1279."},{"volume-title":"Yuille","year":"2020","author":"Li Zhuowan","key":"e_1_3_2_2_18_1"},{"volume-title":"Belongie","year":"2017","author":"Lin Tsung-Yi","key":"e_1_3_2_2_19_1"},{"key":"e_1_3_2_2_20_1","doi-asserted-by":"crossref","unstructured":"Xin Lin Changxing Ding Jinquan Zeng and Dacheng Tao. 2020. GPS-Net: Graph Property Sensing Network for Scene Graph Generation. In CVPR. 3743--3752.  Xin Lin Changxing Ding Jinquan Zeng and Dacheng Tao. 2020. GPS-Net: Graph Property Sensing Network for Scene Graph Generation. In CVPR. 3743--3752.","DOI":"10.1109\/CVPR42600.2020.00380"},{"volume-title":"2020 b. Adaptively Clustering-Driven Learning for Visual Relationship Detection","year":"2020","author":"Liu An-An","key":"e_1_3_2_2_21_1"},{"volume-title":"Graph Structured Network for Image-Text Matching. In CVPR","year":"2020","author":"Liu Chunxiao","key":"e_1_3_2_2_22_1"},{"key":"e_1_3_2_2_23_1","unstructured":"Xiaodong Liu Yelong Shen Kevin Duh and Jianfeng Gao. 2018. Stochastic Answer Networks for Machine Reading Comprehension. In ACL. 1694--1704.  Xiaodong Liu Yelong Shen Kevin Duh and Jianfeng Gao. 2018. Stochastic Answer Networks for Machine Reading Comprehension. In ACL. 1694--1704."},{"key":"e_1_3_2_2_24_1","unstructured":"Zhenguang Liu Haoming Chen Runyang Feng Shuang Wu Shouling Ji Bailin Yang and Xun Wang. 2021 a. Deep Dual Consecutive Network for Human Pose Estimation. In CVPR. 525--534.  Zhenguang Liu Haoming Chen Runyang Feng Shuang Wu Shouling Ji Bailin Yang and Xun Wang. 2021 a. Deep Dual Consecutive Network for Human Pose Estimation. In CVPR. 525--534."},{"volume-title":"2021 b. Combining Graph Neural Networks with Expert Knowledge for Smart Contract Vulnerability Detection","year":"2021","author":"Liu Zhenguang","key":"e_1_3_2_2_25_1"},{"key":"e_1_3_2_2_26_1","doi-asserted-by":"crossref","unstructured":"Cewu Lu Ranjay Krishna Michael S. Bernstein and Fei-Fei Li. 2016. Visual Relationship Detection with Language Priors. In ECCV. 852--869.  Cewu Lu Ranjay Krishna Michael S. Bernstein and Fei-Fei Li. 2016. Visual Relationship Detection with Language Priors. In ECCV. 852--869.","DOI":"10.1007\/978-3-319-46448-0_51"},{"key":"e_1_3_2_2_27_1","unstructured":"Hyeonseob Nam Jung-Woo Ha and Jeonghee Kim. 2017. Dual Attention Networks for Multimodal Reasoning and Matching. In CVPR. 2156--2164.  Hyeonseob Nam Jung-Woo Ha and Jeonghee Kim. 2017. Dual Attention Networks for Multimodal Reasoning and Matching. In CVPR. 2156--2164."},{"key":"e_1_3_2_2_28_1","doi-asserted-by":"publisher","DOI":"10.5555\/3294771.3294978"},{"key":"e_1_3_2_2_29_1","unstructured":"Adam Paszke Sam Gross Soumith Chintala Gregory Chanan Edward Yang Zachary DeVito Zeming Lin Alban Desmaison Luca Antiga and Adam Lerer. 2017. Automatic differentiation in PyTorch. In NIPS.  Adam Paszke Sam Gross Soumith Chintala Gregory Chanan Edward Yang Zachary DeVito Zeming Lin Alban Desmaison Luca Antiga and Adam Lerer. 2017. Automatic differentiation in PyTorch. In NIPS."},{"key":"e_1_3_2_2_30_1","unstructured":"Hang Qi Yuanlu Xu Tao Yuan Tianfu Wu and Song-Chun Zhu. 2018. Scene-Centric Joint Parsing of Cross-View Videos. In AAAI. 7292--7299.  Hang Qi Yuanlu Xu Tao Yuan Tianfu Wu and Song-Chun Zhu. 2018. Scene-Centric Joint Parsing of Cross-View Videos. In AAAI. 7292--7299."},{"key":"e_1_3_2_2_31_1","unstructured":"Mengshi Qi Weijian Li Zhengyuan Yang Yunhong Wang and Jiebo Luo. 2019. Attentive Relational Networks for Mapping Images to Scene Graphs. In CVPR. 3957--3966.  Mengshi Qi Weijian Li Zhengyuan Yang Yunhong Wang and Jiebo Luo. 2019. Attentive Relational Networks for Mapping Images to Scene Graphs. In CVPR. 3957--3966."},{"key":"e_1_3_2_2_32_1","doi-asserted-by":"publisher","DOI":"10.5555\/2969239.2969250"},{"volume-title":"Manning","year":"2015","author":"Schuster Sebastian","key":"e_1_3_2_2_33_1"},{"key":"e_1_3_2_2_34_1","doi-asserted-by":"publisher","DOI":"10.1145\/3097983.3098177"},{"volume-title":"Explainable and Explicit Visual Reasoning Over Scene Graphs. In CVPR","year":"2019","author":"Shi Jiaxin","key":"e_1_3_2_2_35_1"},{"key":"e_1_3_2_2_36_1","unstructured":"Karen Simonyan and Andrew Zisserman. 2015. Very Deep Convolutional Networks for Large-Scale Image Recognition. In ICLR.  Karen Simonyan and Andrew Zisserman. 2015. Very Deep Convolutional Networks for Large-Scale Image Recognition. In ICLR."},{"key":"e_1_3_2_2_37_1","doi-asserted-by":"publisher","DOI":"10.5555\/3298023.3298212"},{"key":"e_1_3_2_2_38_1","doi-asserted-by":"crossref","unstructured":"Kaihua Tang Yulei Niu Jianqiang Huang Jiaxin Shi and Hanwang Zhang. 2020. Unbiased Scene Graph Generation From Biased Training. In CVPR. 3713--3722.  Kaihua Tang Yulei Niu Jianqiang Huang Jiaxin Shi and Hanwang Zhang. 2020. Unbiased Scene Graph Generation From Biased Training. In CVPR. 3713--3722.","DOI":"10.1109\/CVPR42600.2020.00377"},{"key":"e_1_3_2_2_39_1","doi-asserted-by":"crossref","unstructured":"Kaihua Tang Hanwang Zhang Baoyuan Wu Wenhan Luo and Wei Liu. 2019. Learning to Compose Dynamic Tree Structures for Visual Contexts. In CVPR. 6619--6628.  Kaihua Tang Hanwang Zhang Baoyuan Wu Wenhan Luo and Wei Liu. 2019. Learning to Compose Dynamic Tree Structures for Visual Contexts. In CVPR. 6619--6628.","DOI":"10.1109\/CVPR.2019.00678"},{"key":"e_1_3_2_2_40_1","doi-asserted-by":"publisher","DOI":"10.5555\/3295222.3295349"},{"key":"e_1_3_2_2_41_1","doi-asserted-by":"crossref","unstructured":"Sijin Wang Ruiping Wang Ziwei Yao Shiguang Shan and Xilin Chen. 2020 b. Cross-modal Scene Graph Matching for Relationship-aware Image-Text Retrieval. In WACV. 1497--1506.  Sijin Wang Ruiping Wang Ziwei Yao Shiguang Shan and Xilin Chen. 2020 b. Cross-modal Scene Graph Matching for Relationship-aware Image-Text Retrieval. In WACV. 1497--1506.","DOI":"10.1109\/WACV45572.2020.9093614"},{"volume-title":"2020 a. ORD: Object Relationship Discovery for Visual Dialogue Generation. CoRR","year":"2020","author":"Wang Ziwei","key":"e_1_3_2_2_42_1"},{"key":"e_1_3_2_2_43_1","doi-asserted-by":"publisher","DOI":"10.1016\/S0960-9822(98)70192-7"},{"volume-title":"Rethinking Classification and Localization for Object Detection. In CVPR","year":"2020","author":"Wu Yue","key":"e_1_3_2_2_44_1"},{"key":"e_1_3_2_2_45_1","unstructured":"Danfei Xu Yuke Zhu Christopher B. Choy and Li Fei-Fei. 2017. Scene Graph Generation by Iterative Message Passing. In CVPR. 3097--3106.  Danfei Xu Yuke Zhu Christopher B. Choy and Li Fei-Fei. 2017. Scene Graph Generation by Iterative Message Passing. In CVPR. 3097--3106."},{"key":"e_1_3_2_2_46_1","doi-asserted-by":"publisher","DOI":"10.1145\/3394171.3413722"},{"key":"e_1_3_2_2_47_1","doi-asserted-by":"crossref","unstructured":"Jianwei Yang Jiasen Lu Stefan Lee Dhruv Batra and Devi Parikh. 2018a. Graph R-CNN for Scene Graph Generation. In ECCV. 690--706.  Jianwei Yang Jiasen Lu Stefan Lee Dhruv Batra and Devi Parikh. 2018a. Graph R-CNN for Scene Graph Generation. In ECCV. 690--706.","DOI":"10.1007\/978-3-030-01246-5_41"},{"key":"e_1_3_2_2_48_1","doi-asserted-by":"crossref","unstructured":"Xu Yang Hanwang Zhang and Jianfei Cai. 2018b. Shuffle-Then-Assemble: Learning Object-Agnostic Visual Relationship Features. In ECCV. 38--54.  Xu Yang Hanwang Zhang and Jianfei Cai. 2018b. Shuffle-Then-Assemble: Learning Object-Agnostic Visual Relationship Features. In ECCV. 38--54.","DOI":"10.1007\/978-3-030-01258-8_3"},{"volume-title":"Smola","year":"2016","author":"Yang Zichao","key":"e_1_3_2_2_49_1"},{"volume-title":"CogTree: Cognition Tree Loss for Unbiased Scene Graph Generation. CoRR","year":"2020","author":"Yu Jing","key":"e_1_3_2_2_50_1"},{"key":"e_1_3_2_2_51_1","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2020.3034494"},{"key":"e_1_3_2_2_52_1","doi-asserted-by":"crossref","unstructured":"Alireza Zareian Svebor Karaman and Shih-Fu Chang. 2020. Bridging Knowledge Graphs to Generate Scene Graphs. In ECCV. 606--623.  Alireza Zareian Svebor Karaman and Shih-Fu Chang. 2020. Bridging Knowledge Graphs to Generate Scene Graphs. In ECCV. 606--623.","DOI":"10.1007\/978-3-030-58592-1_36"},{"volume-title":"Neural Motifs: Scene Graph Parsing With Global Context. In CVPR. 5831--5840.","year":"2018","author":"Zellers Rowan","key":"e_1_3_2_2_53_1"},{"volume-title":"An Empirical Study on Leveraging Scene Graphs for Visual Question Answering. In BMVC","year":"2019","author":"Zhang Cheng","key":"e_1_3_2_2_54_1"},{"key":"e_1_3_2_2_55_1","doi-asserted-by":"crossref","unstructured":"Hanwang Zhang Zawlin Kyaw Shih-Fu Chang and Tat-Seng Chua. 2017. Visual Translation Embedding Network for Visual Relation Detection. In CVPR. 3107--3115.  Hanwang Zhang Zawlin Kyaw Shih-Fu Chang and Tat-Seng Chua. 2017. Visual Translation Embedding Network for Visual Relation Detection. In CVPR. 3107--3115.","DOI":"10.1109\/CVPR.2017.331"},{"key":"e_1_3_2_2_56_1","doi-asserted-by":"publisher","DOI":"10.1145\/3365841"},{"key":"e_1_3_2_2_57_1","unstructured":"Yaohui Zhu and Shuqiang Jiang. 2018. Deep Structured Learning for Visual Relationship Detection. In AAAI. 7623--7630.  Yaohui Zhu and Shuqiang Jiang. 2018. Deep Structured Learning for Visual Relationship Detection. In AAAI. 7623--7630."}],"event":{"name":"MM '21: ACM Multimedia Conference","sponsor":["SIGMM ACM Special Interest Group on Multimedia"],"location":"Virtual Event China","acronym":"MM '21"},"container-title":["Proceedings of the 29th ACM International Conference on Multimedia"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3474085.3475545","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3474085.3475545","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,17]],"date-time":"2025-06-17T20:49:10Z","timestamp":1750193350000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3474085.3475545"}},"subtitle":["Multi-step Reasoning for Scene Graph Generation"],"short-title":[],"issued":{"date-parts":[[2021,10,17]]},"references-count":57,"alternative-id":["10.1145\/3474085.3475545","10.1145\/3474085"],"URL":"https:\/\/doi.org\/10.1145\/3474085.3475545","relation":{},"subject":[],"published":{"date-parts":[[2021,10,17]]},"assertion":[{"value":"2021-10-17","order":2,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}