{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,11,28]],"date-time":"2025-11-28T12:35:07Z","timestamp":1764333307128,"version":"3.41.0"},"reference-count":65,"publisher":"Association for Computing Machinery (ACM)","issue":"1","license":[{"start":{"date-parts":[[2023,8,24]],"date-time":"2023-08-24T00:00:00Z","timestamp":1692835200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.acm.org\/publications\/policies\/copyright_policy#Background"}],"funder":[{"DOI":"10.13039\/501100012166","name":"National Key R&D Program of China","doi-asserted-by":"crossref","award":["2022ZD0161901"],"award-info":[{"award-number":["2022ZD0161901"]}],"id":[{"id":"10.13039\/501100012166","id-type":"DOI","asserted-by":"crossref"}]},{"DOI":"10.13039\/501100001809","name":"National Nature Science Foundation of China","doi-asserted-by":"crossref","award":["62276018, U20B2069"],"award-info":[{"award-number":["62276018, U20B2069"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"crossref"}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":["ACM Trans. Multimedia Comput. Commun. Appl."],"published-print":{"date-parts":[[2024,1,31]]},"abstract":"<jats:p>\n            Scene Graph Generation (SGG) plays a pivotal role in downstream vision-language tasks. Existing SGG methods typically suffer from poor compositional generalizations on unseen triplets. They are generally trained on incompletely annotated scene graphs that contain dominant triplets and tend to bias toward these seen triplets during inference. To address this issue, we propose a Triplet Calibration and Reduction (T-CAR) framework in this article. In our framework, a triplet calibration loss is first presented to regularize the representations of diverse triplets and to simultaneously excavate the unseen triplets in incompletely annotated training scene graphs. Moreover, the unseen space of scene graphs is usually several times larger than the seen space, since it contains a huge number of unrealistic compositions. Thus, we propose an unseen space reduction loss to shift the attention of excavation to reasonable unseen compositions to facilitate the model training. Finally, we propose a contextual encoder to improve the compositional generalizations of unseen triplets by explicitly modeling the relative spatial relations between subjects and objects. Extensive experiments show that our approach achieves consistent improvements for zero-shot SGG over state-of-the-art methods. The code is available at\n            <jats:ext-link xmlns:xlink=\"http:\/\/www.w3.org\/1999\/xlink\" xlink:href=\"https:\/\/github.com\/jkli1998\/T-CAR\">https:\/\/github.com\/jkli1998\/T-CAR<\/jats:ext-link>\n            .\n          <\/jats:p>","DOI":"10.1145\/3604284","type":"journal-article","created":{"date-parts":[[2023,6,8]],"date-time":"2023-06-08T10:50:08Z","timestamp":1686221408000},"page":"1-21","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":3,"title":["Zero-shot Scene Graph Generation via Triplet Calibration and Reduction"],"prefix":"10.1145","volume":"20","author":[{"ORCID":"https:\/\/orcid.org\/0009-0008-8858-7980","authenticated-orcid":false,"given":"Jiankai","family":"Li","sequence":"first","affiliation":[{"name":"State Key Laboratory of Software Development Environment, School of Computer Science and Engineering, Beihang University; and Shanghai Artificial Intelligence Laboratory, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-8001-2703","authenticated-orcid":false,"given":"Yunhong","family":"Wang","sequence":"additional","affiliation":[{"name":"State Key Laboratory of Software Development Environment, School of Computer Science and Engineering, Beihang University; and Shanghai Artificial Intelligence Laboratory, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-5093-5635","authenticated-orcid":false,"given":"Weixin","family":"Li","sequence":"additional","affiliation":[{"name":"State Key Laboratory of Software Development Environment, School of Computer Science and Engineering, Beihang University; and Shanghai Artificial Intelligence Laboratory, China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2023,8,24]]},"reference":[{"key":"e_1_3_2_2_2","doi-asserted-by":"publisher","DOI":"10.1007\/s10994-020-05877-5"},{"key":"e_1_3_2_3_2","first-page":"8102","volume-title":"AAAI","author":"Ben-Younes Hedi","year":"2019","unstructured":"Hedi Ben-Younes, Remi Cadene, Nicolas Thome, and Matthieu Cord. 2019. BLOCK: Bilinear superdiagonal fusion for visual question answering and visual relationship detection. In AAAI. 8102\u20138109."},{"key":"e_1_3_2_4_2","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2021.3137605"},{"key":"e_1_3_2_5_2","first-page":"212","volume-title":"AAAI","author":"Chen Chao","year":"2022","unstructured":"Chao Chen, Yibing Zhan, Baosheng Yu, Liu Liu, Yong Luo, and Bo Du. 2022. Resistance training using prior bias: Toward unbiased scene graph generation. In AAAI. 212\u2013220."},{"key":"e_1_3_2_6_2","first-page":"9962","volume-title":"CVPR","author":"Chen Shizhe","year":"2020","unstructured":"Shizhe Chen, Qin Jin, Peng Wang, and Qi Wu. 2020. Say as you wish: Fine-grained control of image caption generation with abstract scene graphs. In CVPR. IEEE, 9962\u20139971."},{"key":"e_1_3_2_7_2","first-page":"8648","volume-title":"CVPR","author":"Chen Yixin","year":"2019","unstructured":"Yixin Chen, Siyuan Huang, Tao Yuan, Siyuan Qi, Yixin Zhu, and Song-Chun Zhu. 2019. Holistic++ scene understanding: Single-view 3D holistic scene parsing and human pose estimation with human-object interaction and physical commonsense. In CVPR. IEEE, 8648\u20138657."},{"key":"e_1_3_2_8_2","first-page":"5213","volume-title":"CVPR","author":"Dhamo Helisa","year":"2020","unstructured":"Helisa Dhamo, Azade Farshad, Iro Laina, Nassir Navab, Gregory D. Hager, Federico Tombari, and Christian Rupprecht. 2020. Semantic image manipulation using scene graphs. In CVPR. IEEE, 5213\u20135222."},{"key":"e_1_3_2_9_2","first-page":"19427","volume-title":"CVPR","author":"Dong Xingning","year":"2022","unstructured":"Xingning Dong, Tian Gan, Xuemeng Song, Jianlong Wu, Yuan Cheng, and Liqiang Nie. 2022. Stacked hybrid-attention and group collaborative learning for unbiased scene graph generation. In CVPR. IEEE, 19427\u201319436."},{"key":"e_1_3_2_10_2","first-page":"15596","volume-title":"CVPR","author":"Goel Arushi","year":"2022","unstructured":"Arushi Goel, Basura Fernando, Frank Keller, and Hakan Bilen. 2022. Not all relations are equal: Mining informative labels for scene graph generation. In CVPR. IEEE, 15596\u201315606."},{"key":"e_1_3_2_11_2","first-page":"10323","volume-title":"ICCV","author":"Gu Jiuxiang","year":"2019","unstructured":"Jiuxiang Gu, Shafiq Joty, Jianfei Cai, Handong Zhao, Xu Yang, and Gang Wang. 2019. Unpaired image captioning via scene graph alignments. In ICCV. IEEE, 10323\u201310332."},{"key":"e_1_3_2_12_2","first-page":"9","volume-title":"ICMR","author":"Guo Yutian","year":"2020","unstructured":"Yutian Guo, Jingjing Chen, Hao Zhang, and Yu-Gang Jiang. 2020. Visual relations augmented cross-modal retrieval. In ICMR. ACM, 9\u201315."},{"key":"e_1_3_2_13_2","first-page":"1025","volume-title":"Advances in Neural Information Processing Systems","author":"Hamilton W.","year":"2017","unstructured":"W. Hamilton, R. Ying, and J. Leskovec. 2017. Inductive representation learning on large graphs. In Advances in Neural Information Processing Systems 30 (2017), 1025\u20131035."},{"key":"e_1_3_2_14_2","doi-asserted-by":"publisher","DOI":"10.1162\/neco.1997.9.8.1735"},{"issue":"11","key":"e_1_3_2_15_2","doi-asserted-by":"crossref","first-page":"3820","DOI":"10.1109\/TPAMI.2020.2992222","article-title":"Contextual translation embedding for visual relationship detection and scene graph generation","volume":"43","author":"Hung Zih-Siou","year":"2021","unstructured":"Zih-Siou Hung, Arun Mallya, and Svetlana Lazebnik. 2021. Contextual translation embedding for visual relationship detection and scene graph generation. IEEE Trans. Pattern Anal. Mach. Intell. 43, 11 (2021), 3820\u20133832.","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"e_1_3_2_16_2","first-page":"19849","volume-title":"Advances in Neural Information Processing Systems","author":"Huynh Dat","year":"2020","unstructured":"Dat Huynh and Ehsan Elhamifar. 2020. Compositional zero-shot learning via fine-grained dense feature composition. In Advances in Neural Information Processing Systems, Vol. 33. MIT Press, 19849\u201319860."},{"key":"e_1_3_2_17_2","first-page":"1383","volume-title":"CVPR","author":"Isola Phillip","year":"2015","unstructured":"Phillip Isola, Joseph J. Lim, and Edward H. Adelson. 2015. Discovering states and transformations in image collections. In CVPR. IEEE, 1383\u20131391."},{"key":"e_1_3_2_18_2","first-page":"9336","volume-title":"CVPR","author":"Karthik Shyamgopal","year":"2022","unstructured":"Shyamgopal Karthik, Massimiliano Mancini, and Zeynep Akata. 2022. KG-SP: Knowledge guided simple primitives for open world compositional zero-shot learning. In CVPR. IEEE, 9336\u20139345."},{"key":"e_1_3_2_19_2","volume-title":"Advances in Neural Information Processing Systems","author":"Kiryo Ryuichi","year":"2017","unstructured":"Ryuichi Kiryo, Gang Niu, Marthinus C. Du Plessis, and Masashi Sugiyama. 2017. Positive-unlabeled learning with non-negative risk estimator. In Advances in Neural Information Processing Systems, Vol. 30. MIT Press."},{"key":"e_1_3_2_20_2","first-page":"1","volume-title":"BMVC","author":"Knyazev Boris","year":"2020","unstructured":"Boris Knyazev, Harm de Vries, C\u0103t\u0103lina Cangea, Graham W. Taylor, Aaron Courville, and Eugene Belilovsky. 2020. Graph density-aware losses for novel compositions in scene graph generation. In BMVC. BMVA, 1\u201314."},{"key":"e_1_3_2_21_2","first-page":"15827","volume-title":"ICCV","author":"Knyazev Boris","year":"2021","unstructured":"Boris Knyazev, Harm de Vries, C\u0103t\u0103lina Cangea, Graham W. Taylor, Aaron Courville, and Eugene Belilovsky. 2021. Generative compositional augmentations for scene graph prediction. In ICCV. IEEE, 15827\u201315837."},{"key":"e_1_3_2_22_2","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-016-0981-7"},{"key":"e_1_3_2_23_2","first-page":"18869","volume-title":"CVPR","author":"Li Lin","year":"2022","unstructured":"Lin Li, Long Chen, Yifeng Huang, Zhimeng Zhang, Songyang Zhang, and Jun Xiao. 2022. The devil is in the labels: Noisy label correction for robust scene graph generation. In CVPR. IEEE, 18869\u201318878."},{"issue":"3","key":"e_1_3_2_24_2","article-title":"Inner knowledge-based Img2Doc scheme for visual question answering","volume":"18","author":"Li Qun","year":"2022","unstructured":"Qun Li, Fu Xiao, Bir Bhanu, Biyun Sheng, and Richang Hong. 2022. Inner knowledge-based Img2Doc scheme for visual question answering. ACM Trans. Multimedia Comput. Commun. Appl. 18, 3 (Mar.2022).","journal-title":"ACM Trans. Multimedia Comput. Commun. Appl."},{"key":"e_1_3_2_25_2","first-page":"11109","volume-title":"CVPR","author":"Li Rongjie","year":"2021","unstructured":"Rongjie Li, Songyang Zhang, Bo Wan, and Xuming He. 2021. Bipartite graph network with adaptive message passing for unbiased scene graph generation. In CVPR. IEEE, 11109\u201311119."},{"key":"e_1_3_2_26_2","first-page":"9326","volume-title":"CVPR","author":"Li Xiangyu","year":"2022","unstructured":"Xiangyu Li, Xu Yang, Kun Wei, Cheng Deng, and Muli Yang. 2022. Siamese contrastive embedding network for compositional zero-shot learning. In CVPR. IEEE, 9326\u20139335."},{"key":"e_1_3_2_27_2","volume-title":"AAAI","author":"Liang Kongming","year":"2018","unstructured":"Kongming Liang, Yuhong Guo, Hong Chang, and Xilin Chen. 2018. Visual relationship detection with deep structural ranking. In AAAI."},{"key":"e_1_3_2_28_2","first-page":"2117","volume-title":"CVPR","author":"Lin Tsung-Yi","year":"2017","unstructured":"Tsung-Yi Lin, Piotr Doll\u00e1r, Ross Girshick, Kaiming He, Bharath Hariharan, and Serge Belongie. 2017. Feature pyramid networks for object detection. In CVPR. IEEE, 2117\u20132125."},{"key":"e_1_3_2_29_2","first-page":"19476","volume-title":"CVPR","author":"Lin Xin","year":"2022","unstructured":"Xin Lin, Changxing Ding, Yibing Zhan, Zijian Li, and Dacheng Tao. 2022. HL-Net: Heterophily learning network for scene graph generation. In CVPR. IEEE, 19476\u201319485."},{"key":"e_1_3_2_30_2","first-page":"19457","volume-title":"CVPR","author":"Lin Xin","year":"2022","unstructured":"Xin Lin, Changxing Ding, Jing Zhang, Yibing Zhan, and Dacheng Tao. 2022. RU-Net: Regularized unrolling network for scene graph generation. In CVPR. IEEE, 19457\u201319466."},{"issue":"4","key":"e_1_3_2_31_2","article-title":"Answer questions with right image regions: A visual attention regularization approach","volume":"18","author":"Liu Yibing","year":"2022","unstructured":"Yibing Liu, Yangyang Guo, Jianhua Yin, Xuemeng Song, Weifeng Liu, Liqiang Nie, and Min Zhang. 2022. Answer questions with right image regions: A visual attention regularization approach. ACM Trans. Multimedia Comput. Commun. Appl. 18, 4 (Mar.2022).","journal-title":"ACM Trans. Multimedia Comput. Commun. Appl."},{"key":"e_1_3_2_32_2","first-page":"852","volume-title":"ECCV","author":"Lu Cewu","year":"2016","unstructured":"Cewu Lu, Ranjay Krishna, Michael Bernstein, and Li Fei-Fei. 2016. Visual relationship detection with language priors. In ECCV. Springer, 852\u2013869."},{"key":"e_1_3_2_33_2","first-page":"15931","volume-title":"ICCV","author":"Lu Yichao","year":"2021","unstructured":"Yichao Lu, Himanshu Rai, Jason Chang, Boris Knyazev, Guangwei Yu, Shashank Shekhar, Graham W. Taylor, and Maksims Volkovs. 2021. Context-aware scene graph generation with Seq2Seq transformers. In ICCV. IEEE, 15931\u201315941."},{"key":"e_1_3_2_34_2","first-page":"19467","volume-title":"CVPR","author":"Lyu Xinyu","year":"2022","unstructured":"Xinyu Lyu, Lianli Gao, Yuyu Guo, Zhou Zhao, Hao Huang, Heng Tao Shen, and Jingkuan Song. 2022. Fine-grained predicates learning for scene graph generation. In CVPR. IEEE, 19467\u201319475."},{"key":"e_1_3_2_35_2","first-page":"5222","volume-title":"CVPR","author":"Mancini Massimiliano","year":"2021","unstructured":"Massimiliano Mancini, Muhammad Ferjad Naeem, Yongqin Xian, and Zeynep Akata. 2021. Open world compositional zero-shot learning. In CVPR. IEEE, 5222\u20135230."},{"key":"e_1_3_2_36_2","first-page":"1532","volume-title":"EMNLP","author":"Pennington Jeffrey","year":"2014","unstructured":"Jeffrey Pennington, Richard Socher, and Christopher D. Manning. 2014. GloVe: Global vectors for word representation. In EMNLP. ACL, 1532\u20131543."},{"key":"e_1_3_2_37_2","article-title":"A review of generalized zero-shot learning methods","author":"Pourpanah Farhad","year":"2023","unstructured":"Farhad Pourpanah, Moloud Abdar, Yuxuan Luo, Xinlei Zhou, Ran Wang, Chee Peng Lim, Xi-Zhao Wang, and Q. M. Jonathan Wu. 2023. A review of generalized zero-shot learning methods. IEEE Trans. Pattern Anal. Mach. Intell. 45, 4 (2023).","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"e_1_3_2_38_2","first-page":"8748","volume-title":"ICML","author":"Radford Alec","year":"2021","unstructured":"Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, Gretchen Krueger, and Ilya Sutskever. 2021. Learning transferable visual models from natural language supervision. In ICML, Vol. 139. PMLR, 8748\u20138763."},{"key":"e_1_3_2_39_2","article-title":"Dual projective zero-shot learning using text descriptions","author":"Rao Yunbo","year":"2023","unstructured":"Yunbo Rao, Ziqiang Yang, Shaoning Zeng, Qifei Wang, and Jiansu Pu. 2023. Dual projective zero-shot learning using text descriptions. ACM Trans. Multimedia Comput. Commun. Appl. 19, 1 (2023).","journal-title":"ACM Trans. Multimedia Comput. Commun. Appl."},{"key":"e_1_3_2_40_2","volume-title":"Advances in Neural Information Processing Systems","author":"Ren Shaoqing","year":"2015","unstructured":"Shaoqing Ren, Kaiming He, Ross Girshick, and Jian Sun. 2015. Faster R-CNN: Towards real-time object detection with region proposal networks. In Advances in Neural Information Processing Systems, Vol. 28. MIT Press."},{"key":"e_1_3_2_41_2","first-page":"2189","volume-title":"AAAI","author":"Sharifzadeh Sahand","year":"2022","unstructured":"Sahand Sharifzadeh, Sina Moayed Baharlou, Martin Schmitt, Hinrich Sch\u00fctze, and Volker Tresp. 2022. Improving scene graph classification by exploiting knowledge from texts. In AAAI, Vol. 36. 2189\u20132197."},{"key":"e_1_3_2_42_2","first-page":"8376","volume-title":"CVPR","author":"Shi Jiaxin","year":"2019","unstructured":"Jiaxin Shi, Hanwang Zhang, and Juanzi Li. 2019. Explainable and explicit visual reasoning over scene graphs. In CVPR. IEEE, 8376\u20138384."},{"key":"e_1_3_2_43_2","volume-title":"ICLR","author":"Simonyan Karen","year":"2015","unstructured":"Karen Simonyan and Andrew Zisserman. 2015. Very deep convolutional networks for large-scale image recognition. In ICLR."},{"key":"e_1_3_2_44_2","first-page":"13936","volume-title":"CVPR","author":"Suhail Mohammed","year":"2021","unstructured":"Mohammed Suhail, Abhay Mittal, Behjat Siddiquie, Chris Broaddus, Jayan Eledath, Gerard Medioni, and Leonid Sigal. 2021. Energy-based learning for scene graph generation. In CVPR. IEEE, 13936\u201313945."},{"key":"e_1_3_2_45_2","first-page":"3716","volume-title":"CVPR","author":"Tang Kaihua","year":"2020","unstructured":"Kaihua Tang, Yulei Niu, Jianqiang Huang, Jiaxin Shi, and Hanwang Zhang. 2020. Unbiased scene graph generation from biased training. In CVPR. IEEE, 3716\u20133725."},{"key":"e_1_3_2_46_2","first-page":"6619","volume-title":"CVPR","author":"Tang Kaihua","year":"2019","unstructured":"Kaihua Tang, Hanwang Zhang, Baoyuan Wu, Wenhan Luo, and Wei Liu. 2019. Learning to compose dynamic tree structures for visual contexts. In CVPR. IEEE, 6619\u20136628."},{"key":"e_1_3_2_47_2","first-page":"19437","volume-title":"CVPR","author":"Teng Yao","year":"2022","unstructured":"Yao Teng and Limin Wang. 2022. Structured sparse R-CNN for direct scene graph generation. In CVPR. IEEE, 19437\u201319446."},{"key":"e_1_3_2_48_2","volume-title":"Advances in Neural Information Processing Systems","author":"Vaswani Ashish","year":"2017","unstructured":"Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N. Gomez, \u0141ukasz Kaiser, and Illia Polosukhin. 2017. Attention is all you need. In Advances in Neural Information Processing Systems, Vol. 30. MIT Press."},{"key":"e_1_3_2_49_2","first-page":"222","volume-title":"ECCV","author":"Wang Wenbin","year":"2020","unstructured":"Wenbin Wang, Ruiping Wang, Shiguang Shan, and Xilin Chen. 2020. Sketching image gist: Human-mimetic hierarchical scene graph generation. In ECCV. Springer, 222\u2013239."},{"issue":"7","key":"e_1_3_2_50_2","first-page":"3508","article-title":"Hierarchical human semantic parsing with comprehensive part-relation modeling","volume":"44","author":"Wang Wenguan","year":"2021","unstructured":"Wenguan Wang, Tianfei Zhou, Siyuan Qi, Jianbing Shen, and Song-Chun Zhu. 2021. Hierarchical human semantic parsing with comprehensive part-relation modeling. IEEE Trans. Pattern Anal. Mach. Intell. 44, 7 (2021), 3508\u20133522.","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"e_1_3_2_51_2","article-title":"Symbiotic attention for egocentric action recognition with object-centric alignment","author":"Wang Xiaohan","year":"2023","unstructured":"Xiaohan Wang, Linchao Zhu, Yu Wu, and Yi Yang. 2023. Symbiotic attention for egocentric action recognition with object-centric alignment. IEEE Trans. Pattern Anal. Mach. Intell. 45, 6 (2023), 1\u201313.","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"issue":"2","key":"e_1_3_2_52_2","article-title":"Learning transferable perturbations for image captioning","volume":"18","author":"Wu Hanjie","year":"2022","unstructured":"Hanjie Wu, Yongtuo Liu, Hongmin Cai, and Shengfeng He. 2022. Learning transferable perturbations for image captioning. ACM Trans. Multimedia Comput. Commun. Appl. 18, 2 (Feb.2022).","journal-title":"ACM Trans. Multimedia Comput. Commun. Appl."},{"key":"e_1_3_2_53_2","first-page":"5410","volume-title":"CVPR","author":"Xu Danfei","year":"2017","unstructured":"Danfei Xu, Yuke Zhu, Christopher B. Choy, and Li Fei-Fei. 2017. Scene graph generation by iterative message passing. In CVPR. IEEE, 5410\u20135419."},{"issue":"1","key":"e_1_3_2_54_2","article-title":"Zero-shot cross-modal retrieval by assembling autoencoder and generative adversarial network","volume":"17","author":"Xu Xing","year":"2021","unstructured":"Xing Xu, Jialin Tian, Kaiyi Lin, Huimin Lu, Jie Shao, and Heng Tao Shen. 2021. Zero-shot cross-modal retrieval by assembling autoencoder and generative adversarial network. ACM Trans. Multimedia Comput. Commun. Appl. 17, 1s (Mar.2021).","journal-title":"ACM Trans. Multimedia Comput. Commun. Appl."},{"issue":"3","key":"e_1_3_2_55_2","article-title":"Interactive re-ranking via object entropy-guided question answering for cross-modal image retrieval","volume":"18","author":"Yanagi Rintaro","year":"2022","unstructured":"Rintaro Yanagi, Ren Togo, Takahiro Ogawa, and Miki Haseyama. 2022. Interactive re-ranking via object entropy-guided question answering for cross-modal image retrieval. ACM Trans. Multimedia Comput. Commun. Appl. 18, 3 (Mar.2022).","journal-title":"ACM Trans. Multimedia Comput. Commun. Appl."},{"key":"e_1_3_2_56_2","article-title":"Domain adaptation problem in sketch based image retrieval","author":"Yu Hongchuan","year":"2023","unstructured":"Hongchuan Yu, Mengqing Huang, and Jian J. Zhang. 2023. Domain adaptation problem in sketch based image retrieval. ACM Trans. Multimedia Comput. Commun. Appl. 19, 3 (2023).","journal-title":"ACM Trans. Multimedia Comput. Commun. Appl."},{"issue":"3","key":"e_1_3_2_57_2","article-title":"Image captioning with a joint attention mechanism by visual concept samples","volume":"16","author":"Yuan Jin","year":"2020","unstructured":"Jin Yuan, Lei Zhang, Songrui Guo, Yi Xiao, and Zhiyong Li. 2020. Image captioning with a joint attention mechanism by visual concept samples. ACM Trans. Multimedia Comput. Commun. Appl. 16, 3 (July2020).","journal-title":"ACM Trans. Multimedia Comput. Commun. Appl."},{"key":"e_1_3_2_58_2","first-page":"642","volume-title":"ECCV","author":"Zareian Alireza","year":"2020","unstructured":"Alireza Zareian, Zhecan Wang, Haoxuan You, and Shih-Fu Chang. 2020. Learning visual commonsense for robust scene graph generation. In ECCV. Springer, 642\u2013657."},{"key":"e_1_3_2_59_2","first-page":"5831","volume-title":"CVPR","author":"Zellers Rowan","year":"2018","unstructured":"Rowan Zellers, Mark Yatskar, Sam Thomson, and Yejin Choi. 2018. Neural motifs: Scene graph parsing with global context. In CVPR. IEEE, 5831\u20135840."},{"key":"e_1_3_2_60_2","first-page":"5532","volume-title":"CVPR","author":"Zhang Hanwang","year":"2017","unstructured":"Hanwang Zhang, Zawlin Kyaw, Shih-Fu Chang, and Tat-Seng Chua. 2017. Visual translation embedding network for visual relation detection. In CVPR. IEEE, 5532\u20135540."},{"issue":"3","key":"e_1_3_2_61_2","first-page":"3848","article-title":"TN-ZSTAD: Transferable network for zero-shot temporal activity detection","volume":"45","author":"Zhang Lingling","year":"2023","unstructured":"Lingling Zhang, Xiaojun Chang, Jun Liu, Minnan Luo, Zhihui Li, Lina Yao, and Alex Hauptmann. 2023. TN-ZSTAD: Transferable network for zero-shot temporal activity detection. IEEE Trans. Pattern Anal. Mach. Intell. 45, 3 (2023), 3848\u20133861.","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"e_1_3_2_62_2","article-title":"Boosting scene graph generation with visual relation saliency","author":"Zhang Yong","year":"2023","unstructured":"Yong Zhang, Yingwei Pan, Ting Yao, Rui Huang, Tao Mei, and Chang-Wen Chen. 2023. Boosting scene graph generation with visual relation saliency. ACM Trans. Multimedia Comput. Commun. Appl. 19, 1 (2023).","journal-title":"ACM Trans. Multimedia Comput. Commun. Appl."},{"key":"e_1_3_2_63_2","first-page":"14461","volume-title":"CVPR","author":"Zhao Yunrui","year":"2022","unstructured":"Yunrui Zhao, Qianqian Xu, Yangbangyan Jiang, Peisong Wen, and Qingming Huang. 2022. Dist-PU: Positive-unlabeled learning from a label distribution perspective. In CVPR. IEEE, 14461\u201314470."},{"key":"e_1_3_2_64_2","first-page":"1823","volume-title":"ICCV","author":"Zhong Yiwu","year":"2021","unstructured":"Yiwu Zhong, Jing Shi, Jianwei Yang, Chenliang Xu, and Yin Li. 2021. Learning to generate scene graph from natural language supervision. In ICCV. IEEE, 1823\u20131834."},{"key":"e_1_3_2_65_2","first-page":"211","volume-title":"ECCV","author":"Zhong Yiwu","year":"2020","unstructured":"Yiwu Zhong, Liwei Wang, Jianshu Chen, Dong Yu, and Yin Li. 2020. Comprehensive image captioning via scene graph decomposition. In ECCV. Springer, 211\u2013229."},{"issue":"6","key":"e_1_3_2_66_2","doi-asserted-by":"crossref","first-page":"2827","DOI":"10.1109\/TPAMI.2021.3049156","article-title":"Cascaded parsing of human-object interaction recognition","volume":"44","author":"Zhou Tianfei","year":"2022","unstructured":"Tianfei Zhou, Siyuan Qi, Wenguan Wang, Jianbing Shen, and Song-Chun Zhu. 2022. Cascaded parsing of human-object interaction recognition. IEEE Trans. Pattern Anal. Mach. Intell. 44, 6 (2022), 2827\u20132840.","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."}],"container-title":["ACM Transactions on Multimedia Computing, Communications, and Applications"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3604284","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3604284","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,17]],"date-time":"2025-06-17T16:47:17Z","timestamp":1750178837000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3604284"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023,8,24]]},"references-count":65,"journal-issue":{"issue":"1","published-print":{"date-parts":[[2024,1,31]]}},"alternative-id":["10.1145\/3604284"],"URL":"https:\/\/doi.org\/10.1145\/3604284","relation":{},"ISSN":["1551-6857","1551-6865"],"issn-type":[{"type":"print","value":"1551-6857"},{"type":"electronic","value":"1551-6865"}],"subject":[],"published":{"date-parts":[[2023,8,24]]},"assertion":[{"value":"2022-11-30","order":0,"name":"received","label":"Received","group":{"name":"publication_history","label":"Publication History"}},{"value":"2023-05-31","order":1,"name":"accepted","label":"Accepted","group":{"name":"publication_history","label":"Publication History"}},{"value":"2023-08-24","order":2,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}