{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,16]],"date-time":"2026-07-16T05:17:41Z","timestamp":1784179061060,"version":"3.55.0"},"publisher-location":"New York, NY, USA","reference-count":38,"publisher":"ACM","license":[{"start":{"date-parts":[[2021,10,17]],"date-time":"2021-10-17T00:00:00Z","timestamp":1634428800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.acm.org\/publications\/policies\/copyright_policy#Background"}],"funder":[{"DOI":"10.13039\/501100012166","name":"National Key Research and Development Program of China","doi-asserted-by":"publisher","award":["2018YFB1402600"],"award-info":[{"award-number":["2018YFB1402600"]}],"id":[{"id":"10.13039\/501100012166","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["61727809, 62072423"],"award-info":[{"award-number":["61727809, 62072423"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2021,10,17]]},"DOI":"10.1145\/3474085.3475684","type":"proceedings-article","created":{"date-parts":[[2021,10,18]],"date-time":"2021-10-18T04:59:18Z","timestamp":1634533158000},"page":"4716-4724","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":27,"title":["Linking the Characters"],"prefix":"10.1145","author":[{"given":"Shiwei","family":"Wu","sequence":"first","affiliation":[{"name":"University of Science and Technology of China, Hefei, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Joya","family":"Chen","sequence":"additional","affiliation":[{"name":"University of Science and Technology of China, Hefei, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Tong","family":"Xu","sequence":"additional","affiliation":[{"name":"University of Science and Technology of China, Hefei, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Liyi","family":"Chen","sequence":"additional","affiliation":[{"name":"University of Science and Technology of China, Hefei, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Lingfei","family":"Wu","sequence":"additional","affiliation":[{"name":"JD.COM Silicon Valley Research Center, Santa Clara, CA, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yao","family":"Hu","sequence":"additional","affiliation":[{"name":"Alibaba Youku Cognitive and Intelligent Lab, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Enhong","family":"Chen","sequence":"additional","affiliation":[{"name":"University of Science and Technology of China, Hefei, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"320","published-online":{"date-parts":[[2021,10,17]]},"reference":[{"key":"e_1_3_2_2_1_1","first-page":"2846","article-title":"Weakly Supervised Deep Detection Networks","volume":"2016","author":"Bilen Hakan","year":"2016","journal-title":"CVPR"},{"key":"e_1_3_2_2_2_1","first-page":"4612","article-title":"b. Counterfactual Critic Multi-Agent Training for Scene Graph Generation","volume":"2019","author":"Chen Long","year":"2019","journal-title":"ICCV"},{"key":"e_1_3_2_2_3_1","volume-title":"ICLR","author":"Chen Yu","year":"2019"},{"key":"e_1_3_2_2_4_1","volume-title":"Thirty-Fourth annual conference on Neural Information Processing Systems (NeurIPS","author":"Chen Yu","year":"2020"},{"key":"e_1_3_2_2_5_1","first-page":"256","article-title":"Understanding images of groups of people","volume":"2009","author":"Gallagher Andrew C.","year":"2009","journal-title":"CVPR"},{"key":"e_1_3_2_2_6_1","first-page":"11186","article-title":"An End-To-End Network for Generating Social Relationship Graphs","volume":"2019","author":"Goel Arushi","year":"2019","journal-title":"CVPR"},{"key":"e_1_3_2_2_7_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.90"},{"key":"e_1_3_2_2_8_1","doi-asserted-by":"publisher","DOI":"10.1162\/neco.1997.9.8.1735"},{"key":"e_1_3_2_2_9_1","first-page":"437","article-title":"Person Search in Videos with One Portrait Through Visual and Temporal Links","volume":"2018","author":"Huang Qingqiu","year":"2018","journal-title":"ECCV"},{"key":"e_1_3_2_2_10_1","first-page":"3668","article-title":"Image retrieval using scene graphs","volume":"2015","author":"Johnson Justin","year":"2015","journal-title":"CVPR"},{"key":"e_1_3_2_2_11_1","volume-title":"Karen Simonyan, Brian Zhang, Chloe Hillier, Sudheendra Vijayanarasimhan, Fabio Viola, Tim Green, Trevor Back, Paul Natsev, Mustafa Suleyman, and Andrew Zisserman.","author":"Kay Will","year":"2017"},{"key":"e_1_3_2_2_12_1","volume-title":"Kipf and Max Welling","author":"Thomas","year":"2017"},{"key":"e_1_3_2_2_13_1","first-page":"9846","article-title":"Learning Interactions and Relationships Between Movie Characters","volume":"2020","author":"Kukleva Anna","year":"2020","journal-title":"CVPR"},{"key":"e_1_3_2_2_14_1","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2018.2868854"},{"key":"e_1_3_2_2_15_1","first-page":"2669","article-title":"Dual-Glance Model for Deciphering Social Relationships","volume":"2017","author":"Li Junnan","year":"2017","journal-title":"ICCV"},{"key":"e_1_3_2_2_16_1","volume-title":"Zemel","author":"Li Yujia","year":"2016"},{"key":"e_1_3_2_2_17_1","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2016.2537337"},{"key":"e_1_3_2_2_18_1","first-page":"3566","article-title":"Social Relation Recognition From Videos via Multi-Scale Spatial-Temporal Reasoning","volume":"2019","author":"Liu Xinchen","year":"2019","journal-title":"CVPR"},{"key":"e_1_3_2_2_19_1","first-page":"355","article-title":"Multi-stream Fusion Model for Social Relation Recognition from Videos","volume":"2018","author":"Lv Jinna","year":"2018","journal-title":"MMM"},{"key":"e_1_3_2_2_20_1","volume-title":"Making Monolingual Sentence Embeddings Multilingual using Knowledge Distillation","author":"Reimers Nils","year":"2004"},{"key":"e_1_3_2_2_21_1","doi-asserted-by":"publisher","DOI":"10.5555\/2969239.2969250"},{"key":"e_1_3_2_2_22_1","doi-asserted-by":"publisher","DOI":"10.5555\/2999611.2999715"},{"key":"e_1_3_2_2_23_1","first-page":"435","article-title":"A Domain Based Approach to Social Relation Recognition","volume":"2017","author":"Sun Qianru","year":"2017","journal-title":"CVPR"},{"key":"e_1_3_2_2_24_1","first-page":"6450","article-title":"A Closer Look at Spatiotemporal Convolutions for Action Recognition","volume":"20188","author":"Tran Du","year":"2018","journal-title":"CVPR"},{"key":"e_1_3_2_2_25_1","first-page":"20","article-title":"Temporal Segment Networks: Towards Good Practices for Deep Action Recognition","volume":"2016","author":"Wang Limin","year":"2016","journal-title":"ECCV"},{"key":"e_1_3_2_2_26_1","first-page":"413","article-title":"Videos as Space-Time Region Graphs","volume":"2018","author":"Wang Xiaolong","year":"2018","journal-title":"ECCV"},{"key":"e_1_3_2_2_27_1","doi-asserted-by":"publisher","DOI":"10.5555\/3304415.3304560"},{"key":"e_1_3_2_2_28_1","doi-asserted-by":"publisher","DOI":"10.5555\/3304415.3304560"},{"key":"e_1_3_2_2_29_1","volume-title":"2021 a. Estimating Fund-Raising Performance for Start-up Projects from a Market Graph Perspective. Pattern Recognition","author":"Wu Likang","year":"2021"},{"key":"e_1_3_2_2_30_1","volume-title":"2021 b. Learning the Implicit Semantic Representation on Graph-Structured Data. DASFAA","author":"Wu Likang","year":"2021"},{"key":"e_1_3_2_2_31_1","doi-asserted-by":"publisher","DOI":"10.1145\/3231737"},{"key":"e_1_3_2_2_32_1","first-page":"3097","article-title":"Scene Graph Generation by Iterative Message Passing","volume":"2017","author":"Xu Danfei","year":"2017","journal-title":"CVPR"},{"key":"e_1_3_2_2_33_1","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2020.2990989"},{"key":"e_1_3_2_2_34_1","doi-asserted-by":"publisher","DOI":"10.1145\/3416493"},{"key":"e_1_3_2_2_35_1","first-page":"690","article-title":"Graph R-CNN for Scene Graph Generation","volume":"2018","author":"Yang Jianwei","year":"2018","journal-title":"ECCV"},{"key":"e_1_3_2_2_36_1","first-page":"5831","article-title":"Neural Motifs: Scene Graph Parsing With Global Context","volume":"2018","author":"Zellers Rowan","year":"2018","journal-title":"CVPR"},{"key":"e_1_3_2_2_37_1","first-page":"4804","article-title":"Beyond frontal faces: Improving Person Recognition using multiple cues","volume":"2015","author":"Zhang Ning","year":"2015","journal-title":"CVPR"},{"key":"e_1_3_2_2_38_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2015.414"}],"event":{"name":"MM '21: ACM Multimedia Conference","location":"Virtual Event China","acronym":"MM '21","sponsor":["SIGMM ACM Special Interest Group on Multimedia"]},"container-title":["Proceedings of the 29th ACM International Conference on Multimedia"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3474085.3475684","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3474085.3475684","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,17]],"date-time":"2025-06-17T20:48:25Z","timestamp":1750193305000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3474085.3475684"}},"subtitle":["Video-oriented Social Graph Generation via Hierarchical-cumulative GCN"],"short-title":[],"issued":{"date-parts":[[2021,10,17]]},"references-count":38,"alternative-id":["10.1145\/3474085.3475684","10.1145\/3474085"],"URL":"https:\/\/doi.org\/10.1145\/3474085.3475684","relation":{},"subject":[],"published":{"date-parts":[[2021,10,17]]},"assertion":[{"value":"2021-10-17","order":2,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}