{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,6]],"date-time":"2026-05-06T15:46:05Z","timestamp":1778082365214,"version":"3.51.4"},"publisher-location":"New York, NY, USA","reference-count":70,"publisher":"ACM","license":[{"start":{"date-parts":[[2023,10,26]],"date-time":"2023-10-26T00:00:00Z","timestamp":1698278400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.acm.org\/publications\/policies\/copyright_policy#Background"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["No. 62122018, No. 62020106008, No. 61772116, No. 61872064"],"award-info":[{"award-number":["No. 62122018, No. 62020106008, No. 61772116, No. 61872064"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"name":"Sichuan Science and Technology Program","award":["No.2022119"],"award-info":[{"award-number":["No.2022119"]}]},{"name":"National Key R&D Program of China","award":["2022YFC2009903\/2022YFC2009900"],"award-info":[{"award-number":["2022YFC2009903\/2022YFC2009900"]}]},{"name":"SongShan Laboratory","award":["YYJC012022019"],"award-info":[{"award-number":["YYJC012022019"]}]},{"name":"Fok Ying-Tong Education Foundation","award":["171106"],"award-info":[{"award-number":["171106"]}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2023,10,26]]},"DOI":"10.1145\/3581783.3611714","type":"proceedings-article","created":{"date-parts":[[2023,10,27]],"date-time":"2023-10-27T07:27:40Z","timestamp":1698391660000},"page":"4778-4787","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":11,"title":["Depth-Aware Sparse Transformer for Video-Language Learning"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0000-0003-1015-7338","authenticated-orcid":false,"given":"Haonan","family":"Zhang","sequence":"first","affiliation":[{"name":"University of Electronic Science and Technology of China, Chengdu, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-2522-6394","authenticated-orcid":false,"given":"Lianli","family":"Gao","sequence":"additional","affiliation":[{"name":"University of Electronic Science and Technology of China, Chengdu, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-0672-3790","authenticated-orcid":false,"given":"Pengpeng","family":"Zeng","sequence":"additional","affiliation":[{"name":"University of Electronic Science and Technology of China &amp; Sichuan Artificial Intelligence Research Institute, Yibin, Chengdu, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-5771-2549","authenticated-orcid":false,"given":"Alan","family":"Hanjalic","sequence":"additional","affiliation":[{"name":"Delft University of Technology, Delft, Holland"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-2999-2088","authenticated-orcid":false,"given":"Heng Tao","family":"Shen","sequence":"additional","affiliation":[{"name":"University of Electronic Science and Technology of China, Chengdu, China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2023,10,27]]},"reference":[{"key":"e_1_3_2_1_1_1","volume-title":"Syed Zulqarnain Gilani, and Ajmal Mian","author":"Aafaq Nayyer","year":"2019","unstructured":"Nayyer Aafaq, Naveed Akhtar, Wei Liu, Syed Zulqarnain Gilani, and Ajmal Mian. 2019. Spatio-temporal dynamics and semantic attribute enriched visual encoding for video captioning. In CVPR. 12487--12496."},{"key":"e_1_3_2_1_2_1","volume-title":"Mario Luvc i\u0107, and Cordelia Schmid","author":"Arnab Anurag","year":"2021","unstructured":"Anurag Arnab, Mostafa Dehghani, Georg Heigold, Chen Sun, Mario Luvc i\u0107, and Cordelia Schmid. 2021. Vivit: A video vision transformer. In ICCV. 6836--6846."},{"key":"e_1_3_2_1_3_1","doi-asserted-by":"crossref","unstructured":"Max Bain Arsha Nagrani G\u00fcl Varol and Andrew Zisserman. 2021. Frozen in time: A joint video and image encoder for end-to-end retrieval. In ICCV. 1728--1738.","DOI":"10.1109\/ICCV48922.2021.00175"},{"key":"e_1_3_2_1_4_1","volume-title":"Adabins: Depth estimation using adaptive bins. In CVPR. 4009--4018.","author":"Bhat Shariq Farooq","year":"2021","unstructured":"Shariq Farooq Bhat, Ibraheem Alhashim, and Peter Wonka. 2021. Adabins: Depth estimation using adaptive bins. In CVPR. 4009--4018."},{"key":"e_1_3_2_1_5_1","unstructured":"David Chen and William B Dolan. 2011. Collecting highly parallel data for paraphrase evaluation. In ACL. 190--200."},{"key":"e_1_3_2_1_6_1","volume-title":"Learning modality interaction for temporal sentence localization and event captioning in videos","author":"Chen Shaoxiang","unstructured":"Shaoxiang Chen, Wenhao Jiang, Wei Liu, and Yu-Gang Jiang. 2020a. Learning modality interaction for temporal sentence localization and event captioning in videos. In ECCV. Springer, 333--351."},{"key":"e_1_3_2_1_7_1","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v33i01.33018191"},{"key":"e_1_3_2_1_8_1","unstructured":"Shaoxiang Chen and Yu-Gang Jiang. 2021. Motion guided region message passing for video captioning. In ICCV. 1543--1552."},{"key":"e_1_3_2_1_9_1","doi-asserted-by":"crossref","unstructured":"Shizhe Chen Yida Zhao Qin Jin and Qi Wu. 2020b. Fine-grained video-text retrieval with hierarchical graph reasoning. In CVPR. 10638--10647.","DOI":"10.1109\/CVPR42600.2020.01065"},{"key":"e_1_3_2_1_10_1","volume-title":"Hierarchical relational attention for video question answering","author":"Hasan Chowdhury Muhammad Iqbal","unstructured":"Muhammad Iqbal Hasan Chowdhury, Kien Nguyen, Sridha Sridharan, and Clinton Fookes. 2018. Hierarchical relational attention for video question answering. In ICIP. IEEE, 599--603."},{"key":"e_1_3_2_1_11_1","volume-title":"Vuong Le, and Truyen Tran.","author":"Dang Long Hoang","year":"2021","unstructured":"Long Hoang Dang, Thao Minh Le, Vuong Le, and Truyen Tran. 2021. Hierarchical object-oriented spatio-temporal reasoning for video question answering. arXiv preprint arXiv:2106.13432 (2021)."},{"key":"e_1_3_2_1_12_1","doi-asserted-by":"publisher","DOI":"10.3115\/v1\/W14-3348"},{"key":"e_1_3_2_1_13_1","volume-title":"Bert: Pre-training of deep bidirectional transformers for language understanding. arXiv preprint arXiv:1810.04805","author":"Devlin Jacob","year":"2018","unstructured":"Jacob Devlin, Ming-Wei Chang, Kenton Lee, and Kristina Toutanova. 2018. Bert: Pre-training of deep bidirectional transformers for language understanding. arXiv preprint arXiv:1810.04805 (2018)."},{"key":"e_1_3_2_1_14_1","volume-title":"Dual encoding for video retrieval by text. TPAMI","author":"Dong Jianfeng","year":"2021","unstructured":"Jianfeng Dong, Xirong Li, Chaoxi Xu, Xun Yang, Gang Yang, Xun Wang, and Meng Wang. 2021. Dual encoding for video retrieval by text. TPAMI (2021)."},{"key":"e_1_3_2_1_15_1","unstructured":"Alexey Dosovitskiy Lucas Beyer Alexander Kolesnikov Dirk Weissenborn Xiaohua Zhai Thomas Unterthiner Mostafa Dehghani Matthias Minderer Georg Heigold Sylvain Gelly et al. 2020. An image is worth 16x16 words: Transformers for image recognition at scale. arXiv preprint arXiv:2010.11929 (2020)."},{"key":"e_1_3_2_1_16_1","volume-title":"Jamie Ryan Kiros, and Sanja Fidler","author":"Faghri Fartash","year":"2017","unstructured":"Fartash Faghri, David J Fleet, Jamie Ryan Kiros, and Sanja Fidler. 2017. Vse: Improving visual-semantic embeddings with hard negatives. arXiv preprint arXiv:1707.05612 (2017)."},{"key":"e_1_3_2_1_17_1","unstructured":"Chenyou Fan Xiaofan Zhang Shu Zhang Wensheng Wang Chi Zhang and Heng Huang. 2019. Heterogeneous memory enhanced multimodal attention model for video question answering. In CVPR. 1999--2007."},{"key":"e_1_3_2_1_18_1","volume-title":"Clip2video: Mastering video-text retrieval via image clip. arXiv preprint arXiv:2106.11097","author":"Fang Han","year":"2021","unstructured":"Han Fang, Pengfei Xiong, Luhui Xu, and Yu Chen. 2021. Clip2video: Mastering video-text retrieval via image clip. arXiv preprint arXiv:2106.11097 (2021)."},{"key":"e_1_3_2_1_19_1","unstructured":"Jiyang Gao Runzhou Ge Kan Chen and Ram Nevatia. 2018. Motion-appearance co-memory networks for video question answering. In CVPR. 6576--6585."},{"key":"e_1_3_2_1_20_1","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2021.3120867"},{"key":"e_1_3_2_1_21_1","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v33i01.33016391"},{"key":"e_1_3_2_1_22_1","volume-title":"Vincent Michalski, Joanna Materzynska, Susanne Westphal, Heuna Kim, Valentin Haenel, Ingo Fruend, Peter Yianilos, Moritz Mueller-Freitag, et al.","author":"Goyal Raghav","year":"2017","unstructured":"Raghav Goyal, Samira Ebrahimi Kahou, Vincent Michalski, Joanna Materzynska, Susanne Westphal, Heuna Kim, Valentin Haenel, Ingo Fruend, Peter Yianilos, Moritz Mueller-Freitag, et al. 2017. The \"something something\" video database for learning and evaluating visual common sense. In ICCV. 5842--5850."},{"key":"e_1_3_2_1_23_1","doi-asserted-by":"crossref","unstructured":"Kensho Hara Hirokatsu Kataoka and Yutaka Satoh. 2018. Can spatiotemporal 3d cnns retrace the history of 2d cnns and imagenet?. In CVPR. 6546--6555.","DOI":"10.1109\/CVPR.2018.00685"},{"key":"e_1_3_2_1_24_1","doi-asserted-by":"crossref","unstructured":"Kaiming He Xiangyu Zhang Shaoqing Ren and Jian Sun. 2016. Deep residual learning for image recognition. In CVPR. 770--778.","DOI":"10.1109\/CVPR.2016.90"},{"key":"e_1_3_2_1_25_1","doi-asserted-by":"crossref","unstructured":"Yaosi Hu Zhenzhong Chen Zheng-Jun Zha and Feng Wu. 2019. Hierarchical global-local temporal modeling for video captioning. In ACM MM. 774--783.","DOI":"10.1145\/3343031.3351072"},{"key":"e_1_3_2_1_26_1","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v34i07.6737"},{"key":"e_1_3_2_1_27_1","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v34i07.6766"},{"key":"e_1_3_2_1_28_1","unstructured":"Will Kay Joao Carreira Karen Simonyan Brian Zhang Chloe Hillier Sudheendra Vijayanarasimhan Fabio Viola Tim Green Trevor Back Paul Natsev et al. 2017. The kinetics human action video dataset. arXiv preprint arXiv:1705.06950 (2017)."},{"key":"e_1_3_2_1_29_1","volume-title":"Kingma and Jimmy Ba","author":"Diederik","year":"2015","unstructured":"Diederik P. Kingma and Jimmy Ba. 2015. Adam: A Method for Stochastic Optimization. In ICLR."},{"key":"e_1_3_2_1_30_1","unstructured":"Thao Minh Le Vuong Le Svetha Venkatesh and Truyen Tran. 2020. Hierarchical conditional relation networks for video question answering. In CVPR. 9972--9981."},{"key":"e_1_3_2_1_31_1","doi-asserted-by":"crossref","unstructured":"Jie Lei Linjie Li Luowei Zhou Zhe Gan Tamara L Berg Mohit Bansal and Jingjing Liu. 2021. Less is more: Clipbert for video-and-language learning via sparse sampling. In CVPR. 7331--7341.","DOI":"10.1109\/CVPR46437.2021.00725"},{"key":"e_1_3_2_1_32_1","unstructured":"Xirong Li Chaoxi Xu Gang Yang Zhineng Chen and Jianfeng Dong. 2019. W2vv fully deep learning for ad-hoc video search. In ACM MM. 1786--1794."},{"key":"e_1_3_2_1_33_1","unstructured":"Yicong Li Xiang Wang Junbin Xiao Wei Ji and Tat-Seng Chua. 2022c. Invariant grounding for video question answering. In CVPR. 2928--2937."},{"key":"e_1_3_2_1_34_1","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v36i2.20040"},{"key":"e_1_3_2_1_35_1","volume-title":"DepthFormer: Exploiting Long-Range Correlation and Local Information for Accurate Monocular Depth Estimation. arXiv preprint arXiv:2203.14211","author":"Li Zhenyu","year":"2022","unstructured":"Zhenyu Li, Zehui Chen, Xianming Liu, and Junjun Jiang. 2022b. DepthFormer: Exploiting Long-Range Correlation and Local Information for Accurate Monocular Depth Estimation. arXiv preprint arXiv:2203.14211 (2022)."},{"key":"e_1_3_2_1_36_1","volume-title":"Rouge: A package for automatic evaluation of summaries. In Text summarization branches out. 74--81.","author":"Lin Chin-Yew","year":"2004","unstructured":"Chin-Yew Lin. 2004. Rouge: A package for automatic evaluation of summaries. In Text summarization branches out. 74--81."},{"key":"e_1_3_2_1_37_1","doi-asserted-by":"crossref","unstructured":"Kevin Lin Linjie Li Chung-Ching Lin Faisal Ahmed Zhe Gan Zicheng Liu Yumao Lu and Lijuan Wang. 2022. SwinBERT: End-to-end transformers with sparse attention for video captioning. In CVPR. 17949--17958.","DOI":"10.1109\/CVPR52688.2022.01742"},{"key":"e_1_3_2_1_38_1","volume-title":"Use what you have: Video retrieval using representations from collaborative experts. arXiv preprint arXiv:1907.13487","author":"Liu Yang","year":"2019","unstructured":"Yang Liu, Samuel Albanie, Arsha Nagrani, and Andrew Zisserman. 2019. Use what you have: Video retrieval using representations from collaborative experts. arXiv preprint arXiv:1907.13487 (2019)."},{"key":"e_1_3_2_1_39_1","doi-asserted-by":"publisher","DOI":"10.1016\/j.neucom.2022.07.028"},{"key":"e_1_3_2_1_40_1","volume-title":"Heng Tao Shen, and Jingkuan Song","author":"Lyu Xinyu","year":"2023","unstructured":"Xinyu Lyu, Lianli Gao, Pengpeng Zeng, Heng Tao Shen, and Jingkuan Song. 2023. Adaptive Fine-Grained Predicates Learning for Scene Graph Generation. TPAMI (2023)."},{"key":"e_1_3_2_1_41_1","doi-asserted-by":"crossref","unstructured":"Antoine Miech Jean-Baptiste Alayrac Lucas Smaira Ivan Laptev Josef Sivic and Andrew Zisserman. 2020. End-to-end learning of visual representations from uncurated instructional videos. In CVPR. 9879--9889.","DOI":"10.1109\/CVPR42600.2020.00990"},{"key":"e_1_3_2_1_42_1","unstructured":"Boxiao Pan Haoye Cai De-An Huang Kuan-Hui Lee Adrien Gaidon Ehsan Adeli and Juan Carlos Niebles. 2020. Spatio-temporal graph for video captioning with knowledge distillation. In CVPR. 10870--10879."},{"key":"e_1_3_2_1_43_1","doi-asserted-by":"crossref","unstructured":"Kishore Papineni Salim Roukos Todd Ward and Wei-Jing Zhu. 2002. Bleu: a method for automatic evaluation of machine translation. In ACL. 311--318.","DOI":"10.3115\/1073083.1073135"},{"key":"e_1_3_2_1_44_1","doi-asserted-by":"crossref","unstructured":"Jungin Park Jiyoung Lee and Kwanghoon Sohn. 2021. Bridge to answer: Structure-aware graph interaction network for video question answering. In CVPR. 15526--15535.","DOI":"10.1109\/CVPR46437.2021.01527"},{"key":"e_1_3_2_1_45_1","unstructured":"Wenjie Pei Jiyuan Zhang Xiangrong Wang Lei Ke Xiaoyong Shen and Yu-Wing Tai. 2019. Memory-attended recurrent network for video captioning. In CVPR. 8347--8356."},{"key":"e_1_3_2_1_46_1","doi-asserted-by":"crossref","unstructured":"Liang Peng Shuangji Yang Yi Bin and Guoqing Wang. 2021. Progressive graph attention network for video question answering. In ACM MM. 2871--2879.","DOI":"10.1145\/3474085.3475193"},{"key":"e_1_3_2_1_47_1","volume-title":"Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, et al.","author":"Radford Alec","year":"2021","unstructured":"Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, et al. 2021. Learning transferable visual models from natural language supervision. In ICML. PMLR, 8748--8763."},{"key":"e_1_3_2_1_48_1","doi-asserted-by":"crossref","unstructured":"Ren\u00e9 Ranftl Alexey Bochkovskiy and Vladlen Koltun. 2021. Vision transformers for dense prediction. In ICCV. 12179--12188.","DOI":"10.1109\/ICCV48922.2021.01196"},{"key":"e_1_3_2_1_49_1","volume-title":"NeurIPS","volume":"28","author":"Ren Shaoqing","year":"2015","unstructured":"Shaoqing Ren, Kaiming He, Ross Girshick, and Jian Sun. 2015. Faster r-cnn: Towards real-time object detection with region proposal networks. NeurIPS, Vol. 28 (2015)."},{"key":"e_1_3_2_1_50_1","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v35i3.16353"},{"key":"e_1_3_2_1_51_1","doi-asserted-by":"crossref","unstructured":"Ahjeong Seo Gi-Cheon Kang Joonhan Park and Byoung-Tak Zhang. 2021. Attend What You Need: Motion-Appearance Synergistic Networks for Video Question Answering. In ACL-IJCNLP. 6167--6177.","DOI":"10.18653\/v1\/2021.acl-long.481"},{"key":"e_1_3_2_1_52_1","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2022.3212317"},{"key":"e_1_3_2_1_53_1","doi-asserted-by":"crossref","unstructured":"Nina Shvetsova Brian Chen Andrew Rouditchenko Samuel Thomas Brian Kingsbury Rogerio S Feris David Harwath James Glass and Hilde Kuehne. 2022. Everything at Once-Multi-Modal Fusion Transformer for Video Retrieval. In CVPR. 20020--20029.","DOI":"10.1109\/CVPR52688.2022.01939"},{"key":"e_1_3_2_1_54_1","doi-asserted-by":"publisher","DOI":"10.1145\/3474085.3475326"},{"key":"e_1_3_2_1_55_1","doi-asserted-by":"crossref","unstructured":"Christian Szegedy Sergey Ioffe Vincent Vanhoucke and Alexander A Alemi. 2017. Inception-v4 inception-resnet and the impact of residual connections on learning. In AAAI.","DOI":"10.1609\/aaai.v31i1.11231"},{"key":"e_1_3_2_1_56_1","doi-asserted-by":"crossref","unstructured":"Ganchao Tan Daqing Liu Meng Wang and Zheng-Jun Zha. 2020. Learning to Discretely Compose Reasoning Module Networks for Video Captioning. In IJCAI. 745--752.","DOI":"10.24963\/ijcai.2020\/104"},{"key":"e_1_3_2_1_57_1","doi-asserted-by":"crossref","unstructured":"Ganchao Tan Daqing Liu Meng Wang and Zheng-Jun Zha. 2021. Learning to discretely compose reasoning module networks for video captioning. In IJCAI. 745--752.","DOI":"10.24963\/ijcai.2020\/104"},{"key":"e_1_3_2_1_58_1","volume-title":"NeurIPS","volume":"30","author":"Vaswani Ashish","year":"2017","unstructured":"Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N Gomez, \u0141ukasz Kaiser, and Illia Polosukhin. 2017. Attention is all you need. NeurIPS, Vol. 30 (2017)."},{"key":"e_1_3_2_1_59_1","volume-title":"Cider: Consensus-based image description evaluation. In CVPR. 4566--4575.","author":"Vedantam Ramakrishna","year":"2015","unstructured":"Ramakrishna Vedantam, C Lawrence Zitnick, and Devi Parikh. 2015. Cider: Consensus-based image description evaluation. In CVPR. 4566--4575."},{"key":"e_1_3_2_1_60_1","doi-asserted-by":"crossref","unstructured":"Junbo Wang Wei Wang Yan Huang Liang Wang and Tieniu Tan. 2018. M3: Multimodal memory modelling for video captioning. In CVPR. 7512--7520.","DOI":"10.1109\/CVPR.2018.00784"},{"key":"e_1_3_2_1_61_1","doi-asserted-by":"crossref","unstructured":"Junbin Xiao Angela Yao Zhiyuan Liu Yicong Li Wei Ji and Tat-Seng Chua. 2022. Video as Conditional Graph Hierarchy for Multi-Granular Question Answering. AAAI.","DOI":"10.1609\/aaai.v36i3.20184"},{"key":"e_1_3_2_1_62_1","unstructured":"Saining Xie Ross Girshick Piotr Doll\u00e1r Zhuowen Tu and Kaiming He. 2017. Aggregated residual transformations for deep neural networks. In CVPR. 1492--1500."},{"key":"e_1_3_2_1_63_1","doi-asserted-by":"crossref","unstructured":"Dejing Xu Zhou Zhao Jun Xiao Fei Wu Hanwang Zhang Xiangnan He and Yueting Zhuang. 2017. Video question answering via gradually refined attention over appearance and motion. In ACM MM. 1645--1653.","DOI":"10.1145\/3123266.3123427"},{"key":"e_1_3_2_1_64_1","volume-title":"Msr-vtt: A large video description dataset for bridging video and language. In CVPR. 5288--5296.","author":"Xu Jun","year":"2016","unstructured":"Jun Xu, Tao Mei, Ting Yao, and Yong Rui. 2016. Msr-vtt: A large video description dataset for bridging video and language. In CVPR. 5288--5296."},{"key":"e_1_3_2_1_65_1","doi-asserted-by":"crossref","unstructured":"Xun Yang Jianfeng Dong Yixin Cao Xun Wang Meng Wang and Tat-Seng Chua. 2020. Tree-augmented cross-modal encoding for complex-query video retrieval. In SIGIR. 1339--1348.","DOI":"10.1145\/3397271.3401151"},{"key":"e_1_3_2_1_66_1","unstructured":"Hanhua Ye Guorong Li Yuankai Qi Shuhui Wang Qingming Huang and Ming-Hsuan Yang. 2022. Hierarchical Modular Network for Video Captioning. In CVPR. 17939--17948."},{"key":"e_1_3_2_1_67_1","doi-asserted-by":"crossref","unstructured":"Junchao Zhang and Yuxin Peng. 2019. Object-aware aggregation with bidirectional temporal graph for video captioning. In CVPR. 8327--8336.","DOI":"10.1109\/CVPR.2019.00852"},{"key":"e_1_3_2_1_68_1","doi-asserted-by":"crossref","unstructured":"Ziqi Zhang Yaya Shi Chunfeng Yuan Bing Li Peijin Wang Weiming Hu and Zheng-Jun Zha. 2020. Object relational graph with teacher-recommended learning for video captioning. In CVPR. 13278--13288.","DOI":"10.1109\/CVPR42600.2020.01329"},{"key":"e_1_3_2_1_69_1","volume-title":"NeurIPS","volume":"34","author":"Zhao Wentian","year":"2021","unstructured":"Wentian Zhao, Xinxiao Wu, and Jiebo Luo. 2021. Multi-modal Dependency Tree for Video Captioning. NeurIPS, Vol. 34 (2021)."},{"key":"e_1_3_2_1_70_1","doi-asserted-by":"crossref","unstructured":"Qi Zheng Chaoyue Wang and Dacheng Tao. 2020. Syntax-aware action targeting for video captioning. In CVPR. 13096--13105.","DOI":"10.1109\/CVPR42600.2020.01311"}],"event":{"name":"MM '23: The 31st ACM International Conference on Multimedia","location":"Ottawa ON Canada","acronym":"MM '23","sponsor":["SIGMM ACM Special Interest Group on Multimedia"]},"container-title":["Proceedings of the 31st ACM International Conference on Multimedia"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3581783.3611714","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3581783.3611714","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,8,22]],"date-time":"2025-08-22T00:08:06Z","timestamp":1755821286000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3581783.3611714"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023,10,26]]},"references-count":70,"alternative-id":["10.1145\/3581783.3611714","10.1145\/3581783"],"URL":"https:\/\/doi.org\/10.1145\/3581783.3611714","relation":{},"subject":[],"published":{"date-parts":[[2023,10,26]]},"assertion":[{"value":"2023-10-27","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}