{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,1,10]],"date-time":"2026-01-10T19:05:05Z","timestamp":1768071905391,"version":"3.49.0"},"publisher-location":"New York, NY, USA","reference-count":46,"publisher":"ACM","license":[{"start":{"date-parts":[[2020,10,12]],"date-time":"2020-10-12T00:00:00Z","timestamp":1602460800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.acm.org\/publications\/policies\/copyright_policy#Background"}],"funder":[{"name":"Open Project of Zhejiang Lab","award":["2019KD0AB05"],"award-info":[{"award-number":["2019KD0AB05"]}]},{"name":"National Natural Science Foundation of China","award":["61772116"],"award-info":[{"award-number":["61772116"]}]},{"name":"National Natural Science Foundation of China","award":["61632007"],"award-info":[{"award-number":["61632007"]}]},{"name":"National Natural Science Foundation of China","award":["61872064"],"award-info":[{"award-number":["61872064"]}]},{"name":"National Natural Science Foundation of China","award":["61602049"],"award-info":[{"award-number":["61602049"]}]},{"name":"Sichuan Science and Technology Program","award":["2019JDTD0005"],"award-info":[{"award-number":["2019JDTD0005"]}]},{"name":"Fundamental Research Funds for the Central Universities","award":["ZYGX2019J073"],"award-info":[{"award-number":["ZYGX2019J073"]}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2020,10,12]]},"DOI":"10.1145\/3394171.3414025","type":"proceedings-article","created":{"date-parts":[[2020,10,12]],"date-time":"2020-10-12T12:26:53Z","timestamp":1602505613000},"page":"3090-3098","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":25,"title":["One-shot Scene Graph Generation"],"prefix":"10.1145","author":[{"given":"Yuyu","family":"Guo","sequence":"first","affiliation":[{"name":"University of Electronic Science and Technology of China, Chengdu, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jingkuan","family":"Song","sequence":"additional","affiliation":[{"name":"University of Electronic Science and Technology of China, Chengdu, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Lianli","family":"Gao","sequence":"additional","affiliation":[{"name":"University of Electronic Science and Technology of China, Chengdu, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Heng Tao","family":"Shen","sequence":"additional","affiliation":[{"name":"University of Electronic Science and Technology of China, Chengdu, China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2020,10,12]]},"reference":[{"key":"e_1_3_2_2_1_1","unstructured":"Antoine Bordes Nicolas Usunier Alberto Garc'i a-Dur\u00e1 n Jason Weston and Oksana Yakhnenko. [n.d.]. Translating Embeddings for Modeling Multi-relational Data. In NeurIPS. 2787--2795.  Antoine Bordes Nicolas Usunier Alberto Garc'i a-Dur\u00e1 n Jason Weston and Oksana Yakhnenko. [n.d.]. Translating Embeddings for Modeling Multi-relational Data. In NeurIPS. 2787--2795."},{"key":"e_1_3_2_2_2_1","doi-asserted-by":"crossref","unstructured":"Long Chen Hanwang Zhang Jun Xiao Xiangnan He Shiliang Pu and Shih-Fu Chang. 2019 b. Counterfactual Critic Multi-Agent Training for Scene Graph Generation. In ICCV. 4612--4622.  Long Chen Hanwang Zhang Jun Xiao Xiangnan He Shiliang Pu and Shih-Fu Chang. 2019 b. Counterfactual Critic Multi-Agent Training for Scene Graph Generation. In ICCV. 4612--4622.","DOI":"10.1109\/ICCV.2019.00471"},{"key":"e_1_3_2_2_3_1","doi-asserted-by":"crossref","unstructured":"Tianshui Chen Weihao Yu Riquan Chen and Liang Lin. 2019 a. Knowledge-Embedded Routing Network for Scene Graph Generation. In CVPR.  Tianshui Chen Weihao Yu Riquan Chen and Liang Lin. 2019 a. Knowledge-Embedded Routing Network for Scene Graph Generation. In CVPR.","DOI":"10.1109\/CVPR.2019.00632"},{"key":"e_1_3_2_2_4_1","unstructured":"Chuang Gan Deng Huang Peihao Chen Joshua B Tenenbaum and Antonio Torralba. 2020 a. Foley Music: Learning to Generate Music from Videos. ECCV (2020).  Chuang Gan Deng Huang Peihao Chen Joshua B Tenenbaum and Antonio Torralba. 2020 a. Foley Music: Learning to Generate Music from Videos. ECCV (2020)."},{"key":"e_1_3_2_2_5_1","unstructured":"Chuang Gan Deng Huang Hang Zhao Joshua B Tenenbaum and Antonio Torralba. 2020 b. Music Gesture for Visual Sound Separation. In CVPR. 10478--10487.  Chuang Gan Deng Huang Hang Zhao Joshua B Tenenbaum and Antonio Torralba. 2020 b. Music Gesture for Visual Sound Separation. In CVPR. 10478--10487."},{"key":"e_1_3_2_2_6_1","doi-asserted-by":"publisher","DOI":"10.1145\/3240508.3240687"},{"key":"e_1_3_2_2_7_1","doi-asserted-by":"crossref","unstructured":"Ross B. Girshick. 2015. Fast R-CNN. In ICCV. 1440--1448.  Ross B. Girshick. 2015. Fast R-CNN. In ICCV. 1440--1448.","DOI":"10.1109\/ICCV.2015.169"},{"key":"e_1_3_2_2_8_1","unstructured":"Jiuxiang Gu Handong Zhao Zhe Lin Sheng Li Jianfei Cai and Mingyang Ling. 2019. Scene Graph Generation With External Knowledge and Image Reconstruction. In CVPR. 1969--1978.  Jiuxiang Gu Handong Zhao Zhe Lin Sheng Li Jianfei Cai and Mingyang Ling. 2019. Scene Graph Generation With External Knowledge and Image Reconstruction. In CVPR. 1969--1978."},{"key":"e_1_3_2_2_9_1","doi-asserted-by":"publisher","DOI":"10.1007\/s11280-018-0530-0"},{"key":"e_1_3_2_2_10_1","unstructured":"Kaiming He Xiangyu Zhang Shaoqing Ren and Jian Sun. 2016. Deep Residual Learning for Image Recognition. In CVPR. 770--778.  Kaiming He Xiangyu Zhang Shaoqing Ren and Jian Sun. 2016. Deep Residual Learning for Image Recognition. In CVPR. 770--778."},{"key":"e_1_3_2_2_11_1","doi-asserted-by":"crossref","unstructured":"Seong Jae Hwang Sathya N. Ravi Zirui Tao Hyunwoo J. Kim Maxwell D. Collins and Vikas Singh. 2018. Tensorize Factorize and Regularize: Robust Visual Relationship Learning. In CVPR. 1014--1023.  Seong Jae Hwang Sathya N. Ravi Zirui Tao Hyunwoo J. Kim Maxwell D. Collins and Vikas Singh. 2018. Tensorize Factorize and Regularize: Robust Visual Relationship Learning. In CVPR. 1014--1023.","DOI":"10.1109\/CVPR.2018.00112"},{"key":"e_1_3_2_2_12_1","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2019.2952088"},{"key":"e_1_3_2_2_13_1","doi-asserted-by":"crossref","unstructured":"Justin Johnson Ranjay Krishna Michael Stark Li-Jia Li David A. Shamma Michael S. Bernstein and Fei-Fei Li. 2015. Image retrieval using scene graphs. In CVPR. IEEE Computer Society 3668--3678.  Justin Johnson Ranjay Krishna Michael Stark Li-Jia Li David A. Shamma Michael S. Bernstein and Fei-Fei Li. 2015. Image retrieval using scene graphs. In CVPR. IEEE Computer Society 3668--3678.","DOI":"10.1109\/CVPR.2015.7298990"},{"key":"e_1_3_2_2_14_1","unstructured":"Thomas N. Kipf and Max Welling. 2017. Semi-Supervised Classification with Graph Convolutional Networks. In ICLR.  Thomas N. Kipf and Max Welling. 2017. Semi-Supervised Classification with Graph Convolutional Networks. In ICLR."},{"key":"e_1_3_2_2_15_1","unstructured":"Gregory Koch Richard Zemel and Ruslan Salakhutdinov. 2015. Siamese neural networks for one-shot image recognition. (2015).  Gregory Koch Richard Zemel and Ruslan Salakhutdinov. 2015. Siamese neural networks for one-shot image recognition. (2015)."},{"key":"e_1_3_2_2_16_1","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-016-0981-7"},{"key":"e_1_3_2_2_17_1","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2006.79"},{"key":"e_1_3_2_2_18_1","doi-asserted-by":"publisher","DOI":"10.1145\/3343031.3350971"},{"key":"e_1_3_2_2_19_1","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v33i01.33018658"},{"key":"e_1_3_2_2_20_1","volume-title":"Factorizable Net: An Efficient Subgraph-Based Framework for Scene Graph Generation. In ECCV. 346--363.","author":"Li Yikang","year":"2018"},{"key":"e_1_3_2_2_21_1","unstructured":"Yikang Li Wanli Ouyang Bolei Zhou Kun Wang and Xiaogang Wang. 2017. Scene Graph Generation from Objects Phrases and Region Captions. In ICCV. 1270--1279.  Yikang Li Wanli Ouyang Bolei Zhou Kun Wang and Xiaogang Wang. 2017. Scene Graph Generation from Objects Phrases and Region Captions. In ICCV. 1270--1279."},{"key":"e_1_3_2_2_22_1","unstructured":"Bill Yuchen Lin Xinyue Chen Jamin Chen and Xiang Ren. 2019. KagNet: Knowledge-Aware Graph Networks for Commonsense Reasoning. In EMNLP-IJCNLP Kentaro Inui Jing Jiang Vincent Ng and Xiaojun Wan (Eds.). 2829--2839.  Bill Yuchen Lin Xinyue Chen Jamin Chen and Xiang Ren. 2019. KagNet: Knowledge-Aware Graph Networks for Commonsense Reasoning. In EMNLP-IJCNLP Kentaro Inui Jing Jiang Vincent Ng and Xiaojun Wan (Eds.). 2829--2839."},{"key":"e_1_3_2_2_23_1","doi-asserted-by":"crossref","unstructured":"Cewu Lu Ranjay Krishna Michael S. Bernstein and Fei-Fei Li. 2016. Visual Relationship Detection with Language Priors. In ECCV. 852--869.  Cewu Lu Ranjay Krishna Michael S. Bernstein and Fei-Fei Li. 2016. Visual Relationship Detection with Language Priors. In ECCV. 852--869.","DOI":"10.1007\/978-3-319-46448-0_51"},{"key":"e_1_3_2_2_24_1","unstructured":"Alejandro Newell and Jia Deng. 2017. Pixels to Graphs by Associative Embedding. In NeurIPS. 2168--2177.  Alejandro Newell and Jia Deng. 2017. Pixels to Graphs by Associative Embedding. In NeurIPS. 2168--2177."},{"key":"e_1_3_2_2_25_1","doi-asserted-by":"crossref","unstructured":"Joseph Redmon Santosh Kumar Divvala Ross B. Girshick and Ali Farhadi. 2016. You Only Look Once: Unified Real-Time Object Detection. In CVPR. 779--788.  Joseph Redmon Santosh Kumar Divvala Ross B. Girshick and Ali Farhadi. 2016. You Only Look Once: Unified Real-Time Object Detection. In CVPR. 779--788.","DOI":"10.1109\/CVPR.2016.91"},{"key":"e_1_3_2_2_26_1","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2016.2577031"},{"key":"e_1_3_2_2_27_1","unstructured":"Ruslan Salakhutdinov Joshua B. Tenenbaum and Antonio Torralba. 2012. One-Shot Learning with a Hierarchical Nonparametric Bayesian Model. In Unsupervised and Transfer Learning - Workshop held at ICML. 195--206.  Ruslan Salakhutdinov Joshua B. Tenenbaum and Antonio Torralba. 2012. One-Shot Learning with a Hierarchical Nonparametric Bayesian Model. In Unsupervised and Transfer Learning - Workshop held at ICML. 195--206."},{"key":"e_1_3_2_2_28_1","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2015.2405340"},{"key":"e_1_3_2_2_29_1","unstructured":"Heng Tao Shen Luchen Liu Yang Yang Xing Xu Zi Huang Fumin Shen and Richang Hong. 2020. Exploiting subspace relation in semantic labels for cross-modal hashing. IEEE Transactions on Knowledge and Data Engineering (2020).  Heng Tao Shen Luchen Liu Yang Yang Xing Xu Zi Huang Fumin Shen and Richang Hong. 2020. Exploiting subspace relation in semantic labels for cross-modal hashing. IEEE Transactions on Knowledge and Data Engineering (2020)."},{"key":"e_1_3_2_2_30_1","unstructured":"Karen Simonyan and Andrew Zisserman. 2015. Very Deep Convolutional Networks for Large-Scale Image Recognition. (2015).  Karen Simonyan and Andrew Zisserman. 2015. Very Deep Convolutional Networks for Large-Scale Image Recognition. (2015)."},{"key":"e_1_3_2_2_31_1","doi-asserted-by":"crossref","unstructured":"Jingkuan Song Yuyu Guo Lianli Gao Xuelong Li Alan Hanjalic and Heng Tao Shen. 2018a. From deterministic to generative: Multimodal stochastic RNNs for video captioning. IEEE transactions on neural networks and learning systems Vol. 30 10 (2018) 3047--3058.  Jingkuan Song Yuyu Guo Lianli Gao Xuelong Li Alan Hanjalic and Heng Tao Shen. 2018a. From deterministic to generative: Multimodal stochastic RNNs for video captioning. IEEE transactions on neural networks and learning systems Vol. 30 10 (2018) 3047--3058.","DOI":"10.1109\/TNNLS.2018.2851077"},{"key":"e_1_3_2_2_32_1","doi-asserted-by":"crossref","unstructured":"Jingkuan Song Zhao Guo Lianli Gao Wu Liu Dongxiang Zhang and Heng Tao Shen. 2017. Hierarchical LSTM with adjusted temporal attention for video captioning. arXiv preprint arXiv:1706.01231 (2017).  Jingkuan Song Zhao Guo Lianli Gao Wu Liu Dongxiang Zhang and Heng Tao Shen. 2017. Hierarchical LSTM with adjusted temporal attention for video captioning. arXiv preprint arXiv:1706.01231 (2017).","DOI":"10.24963\/ijcai.2017\/381"},{"key":"e_1_3_2_2_33_1","doi-asserted-by":"crossref","unstructured":"Jingkuan Song Pengpeng Zeng Lianli Gao and Heng Tao Shen. 2018b. From Pixels to Objects: Cubic Visual Attention for Visual Question Answering.. In IJCAI. 906--912.  Jingkuan Song Pengpeng Zeng Lianli Gao and Heng Tao Shen. 2018b. From Pixels to Objects: Cubic Visual Attention for Visual Question Answering.. In IJCAI. 906--912.","DOI":"10.24963\/ijcai.2018\/126"},{"key":"e_1_3_2_2_34_1","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2018.2814344"},{"key":"e_1_3_2_2_35_1","doi-asserted-by":"crossref","unstructured":"Robyn Speer Joshua Chin and Catherine Havasi. 2017. ConceptNet 5.5: An Open Multilingual Graph of General Knowledge. In AAAI Satinder P. Singh and Shaul Markovitch (Eds.). 4444--4451.  Robyn Speer Joshua Chin and Catherine Havasi. 2017. ConceptNet 5.5: An Open Multilingual Graph of General Knowledge. In AAAI Satinder P. Singh and Shaul Markovitch (Eds.). 4444--4451.","DOI":"10.1609\/aaai.v31i1.11164"},{"key":"e_1_3_2_2_36_1","doi-asserted-by":"crossref","unstructured":"Christian Szegedy Wei Liu Yangqing Jia Pierre Sermanet Scott E. Reed Dragomir Anguelov Dumitru Erhan Vincent Vanhoucke and Andrew Rabinovich. 2015. Going deeper with convolutions. In CVPR. 1--9.  Christian Szegedy Wei Liu Yangqing Jia Pierre Sermanet Scott E. Reed Dragomir Anguelov Dumitru Erhan Vincent Vanhoucke and Andrew Rabinovich. 2015. Going deeper with convolutions. In CVPR. 1--9.","DOI":"10.1109\/CVPR.2015.7298594"},{"key":"e_1_3_2_2_37_1","doi-asserted-by":"crossref","unstructured":"Kaihua Tang Hanwang Zhang Baoyuan Wu Wenhan Luo and Wei Liu. 2019. Learning to Compose Dynamic Tree Structures for Visual Contexts. In CVPR. 6619--6628.  Kaihua Tang Hanwang Zhang Baoyuan Wu Wenhan Luo and Wei Liu. 2019. Learning to Compose Dynamic Tree Structures for Visual Contexts. In CVPR. 6619--6628.","DOI":"10.1109\/CVPR.2019.00678"},{"key":"e_1_3_2_2_38_1","unstructured":"Ashish Vaswani Noam Shazeer Niki Parmar Jakob Uszkoreit Llion Jones Aidan N. Gomez Lukasz Kaiser and Illia Polosukhin. 2017. Attention is All you Need. In NeurIPS. 5998--6008.  Ashish Vaswani Noam Shazeer Niki Parmar Jakob Uszkoreit Llion Jones Aidan N. Gomez Lukasz Kaiser and Illia Polosukhin. 2017. Attention is All you Need. In NeurIPS. 5998--6008."},{"key":"e_1_3_2_2_39_1","doi-asserted-by":"crossref","unstructured":"Peng Wang Lingqiao Liu Chunhua Shen Zi Huang Anton van den Hengel and Heng Tao Shen. 2017. Multi-attention Network for One Shot Learning. In CVPR. 6212--6220.  Peng Wang Lingqiao Liu Chunhua Shen Zi Huang Anton van den Hengel and Heng Tao Shen. 2017. Multi-attention Network for One Shot Learning. In CVPR. 6212--6220.","DOI":"10.1109\/CVPR.2017.658"},{"key":"e_1_3_2_2_40_1","doi-asserted-by":"crossref","unstructured":"Jiwei Wei Xing Xu Yang Yang Yanli Ji Zheng Wang and Heng Tao Shen. 2020. Universal Weighting Metric Learning for Cross-Modal Matching. In CVPR. 13005--13014.  Jiwei Wei Xing Xu Yang Yang Yanli Ji Zheng Wang and Heng Tao Shen. 2020. Universal Weighting Metric Learning for Cross-Modal Matching. In CVPR. 13005--13014.","DOI":"10.1109\/CVPR42600.2020.01302"},{"key":"e_1_3_2_2_41_1","unstructured":"Danfei Xu Yuke Zhu Christopher B. Choy and Li Fei-Fei. 2017. Scene Graph Generation by Iterative Message Passing. In CVPR. 3097--3106.  Danfei Xu Yuke Zhu Christopher B. Choy and Li Fei-Fei. 2017. Scene Graph Generation by Iterative Message Passing. In CVPR. 3097--3106."},{"key":"e_1_3_2_2_42_1","unstructured":"Bishan Yang Wen-tau Yih Xiaodong He Jianfeng Gao and Li Deng. 2015. Embedding Entities and Relations for Learning and Inference in Knowledge Bases. In ICLR Yoshua Bengio and Yann LeCun (Eds.).  Bishan Yang Wen-tau Yih Xiaodong He Jianfeng Gao and Li Deng. 2015. Embedding Entities and Relations for Learning and Inference in Knowledge Bases. In ICLR Yoshua Bengio and Yann LeCun (Eds.)."},{"key":"e_1_3_2_2_43_1","doi-asserted-by":"crossref","unstructured":"Jianwei Yang Jiasen Lu Stefan Lee Dhruv Batra and Devi Parikh. 2018. Graph R-CNN for Scene Graph Generation. In ECCV. 690--706.  Jianwei Yang Jiasen Lu Stefan Lee Dhruv Batra and Devi Parikh. 2018. Graph R-CNN for Scene Graph Generation. In ECCV. 690--706.","DOI":"10.1007\/978-3-030-01246-5_41"},{"key":"e_1_3_2_2_44_1","doi-asserted-by":"crossref","unstructured":"Guojun Yin Lu Sheng Bin Liu Nenghai Yu Xiaogang Wang Jing Shao and Chen Change Loy. 2018. Zoom-Net: Mining Deep Feature Interactions for Visual Relationship Recognition. In ECCV. 330--347.  Guojun Yin Lu Sheng Bin Liu Nenghai Yu Xiaogang Wang Jing Shao and Chen Change Loy. 2018. Zoom-Net: Mining Deep Feature Interactions for Visual Relationship Recognition. In ECCV. 330--347.","DOI":"10.1007\/978-3-030-01219-9_20"},{"key":"e_1_3_2_2_45_1","volume-title":"Neural Motifs: Scene Graph Parsing With Global Context. In CVPR. 5831--5840.","author":"Zellers Rowan","year":"2018"},{"key":"e_1_3_2_2_46_1","doi-asserted-by":"crossref","unstructured":"Hanwang Zhang Zawlin Kyaw Shih-Fu Chang and Tat-Seng Chua. 2017. Visual Translation Embedding Network for Visual Relation Detection. In CVPR. 3107--3115.  Hanwang Zhang Zawlin Kyaw Shih-Fu Chang and Tat-Seng Chua. 2017. Visual Translation Embedding Network for Visual Relation Detection. In CVPR. 3107--3115.","DOI":"10.1109\/CVPR.2017.331"}],"event":{"name":"MM '20: The 28th ACM International Conference on Multimedia","location":"Seattle WA USA","acronym":"MM '20","sponsor":["SIGMM ACM Special Interest Group on Multimedia"]},"container-title":["Proceedings of the 28th ACM International Conference on Multimedia"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3394171.3414025","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3394171.3414025","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,17]],"date-time":"2025-06-17T22:01:23Z","timestamp":1750197683000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3394171.3414025"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2020,10,12]]},"references-count":46,"alternative-id":["10.1145\/3394171.3414025","10.1145\/3394171"],"URL":"https:\/\/doi.org\/10.1145\/3394171.3414025","relation":{},"subject":[],"published":{"date-parts":[[2020,10,12]]},"assertion":[{"value":"2020-10-12","order":2,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}