{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,12,10]],"date-time":"2025-12-10T04:10:31Z","timestamp":1765339831696,"version":"3.46.0"},"publisher-location":"New York, NY, USA","reference-count":51,"publisher":"ACM","funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62372325, 62402255"],"award-info":[{"award-number":["62372325, 62402255"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"name":"Natural Science Foundation of Tianjin Municipality","award":["23JCZDJC00280"],"award-info":[{"award-number":["23JCZDJC00280"]}]},{"DOI":"10.13039\/501100007129","name":"Natural Science Foundation of Shandong Province","doi-asserted-by":"publisher","award":["ZR2024QF020"],"award-info":[{"award-number":["ZR2024QF020"]}],"id":[{"id":"10.13039\/501100007129","id-type":"DOI","asserted-by":"publisher"}]},{"name":"Shandong Province National Talents Supporting Program","award":["2023GJJLJRC-070"],"award-info":[{"award-number":["2023GJJLJRC-070"]}]},{"name":"Shandong Project Towards the Integration of Education and Industry","award":["801822020100000024, 2024ZDZX11"],"award-info":[{"award-number":["801822020100000024, 2024ZDZX11"]}]},{"name":"Young Talent of Lifting engineering for Science and Technology in Shandong","award":["SDAST2024QTB001"],"award-info":[{"award-number":["SDAST2024QTB001"]}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2025,10,27]]},"DOI":"10.1145\/3746027.3755391","type":"proceedings-article","created":{"date-parts":[[2025,10,25]],"date-time":"2025-10-25T07:38:54Z","timestamp":1761377934000},"page":"6123-6132","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":0,"title":["Lightweight Relational Proposal Network with Dual-Branch Distillation for Video Moment Retrieval"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0009-0002-4365-7339","authenticated-orcid":false,"given":"Yujia","family":"Zhu","sequence":"first","affiliation":[{"name":"Institute of Information Engineering, Chinese Academy of Sciences, Beijing, China and School of Cyber Security, University of Chinese Academy of Sciences, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0008-1931-7143","authenticated-orcid":false,"given":"Hao","family":"Yang","sequence":"additional","affiliation":[{"name":"School of Computer Science and Engineering, Tianjin University of Technology, Tianjin, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-4187-1980","authenticated-orcid":false,"given":"Yibo","family":"Zhao","sequence":"additional","affiliation":[{"name":"School of Computer Science and Engineering, Tianjin University of Technology, Tianjin, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-6348-671X","authenticated-orcid":false,"given":"Chunjie","family":"Ma","sequence":"additional","affiliation":[{"name":"Shandong Artificial Intelligence Institute, Qilu University of Technology (Shandong Academy of Sciences), Jinan, Shandong Province, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-5658-5509","authenticated-orcid":false,"given":"Weili","family":"Guan","sequence":"additional","affiliation":[{"name":"Harbin Institute of Technology (Shenzhen), Shenzhen, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-2182-5741","authenticated-orcid":false,"given":"Zan","family":"Gao","sequence":"additional","affiliation":[{"name":"School of Computer Science and Engineering, Tianjin University of Technology, Tianjin, China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2025,10,27]]},"reference":[{"key":"e_1_3_2_2_1_1","volume-title":"Rethinking the Bottom-Up Framework for Query-Based Video Localization. In The Thirty-Fourth AAAI Conference on Artificial Intelligence. 10551-10558","author":"Chen Long","year":"2020","unstructured":"Long Chen, Chujie Lu, Siliang Tang, Jun Xiao, Dong Zhang, Chilie Tan, and Xiaolin Li. 2020. Rethinking the Bottom-Up Framework for Query-Based Video Localization. In The Thirty-Fourth AAAI Conference on Artificial Intelligence. 10551-10558."},{"volume-title":"DPHANet: Discriminative Parallel and Hierarchical Attention Network for Natural Language Video Localization","author":"Chen Ruihan","key":"e_1_3_2_2_2_1","unstructured":"Ruihan Chen, Junpeng Tan, Zhijing Yang, Xiaojun Yang, Qingyun Dai, Yongqiang Cheng, and Liang Lin. [n.d.]. DPHANet: Discriminative Parallel and Hierarchical Attention Network for Natural Language Video Localization. IEEE Trans. Multim. ([n.d.])."},{"key":"e_1_3_2_2_3_1","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v33i01.33018199"},{"key":"e_1_3_2_2_4_1","volume-title":"Better Performance: Efficient Cross-Modal Clip Trimming for Video Moment Retrieval Using Language. In Thirty-Eighth AAAI Conference on Artificial Intelligence. AAAI Press, 1735-1743","author":"Fang Xiang","year":"2024","unstructured":"Xiang Fang, Daizong Liu, Wanlong Fang, Pan Zhou, Zichuan Xu, Wenzheng Xu, Junyang Chen, and Renfu Li. 2024. Fewer Steps, Better Performance: Efficient Cross-Modal Clip Trimming for Video Moment Retrieval Using Language. In Thirty-Eighth AAAI Conference on Artificial Intelligence. AAAI Press, 1735-1743."},{"key":"e_1_3_2_2_5_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.563"},{"key":"e_1_3_2_2_6_1","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2021.emnlp-main.324"},{"key":"e_1_3_2_2_7_1","volume-title":"MAC: Mining Activity Concepts for Language-Based Temporal Localization. In Winter Conference on Applications of Computer Vision. 245-253","author":"Ge Runzhou","year":"2019","unstructured":"Runzhou Ge, Jiyang Gao, Kan Chen, and Ram Nevatia. 2019. MAC: Mining Activity Concepts for Language-Based Temporal Localization. In Winter Conference on Applications of Computer Vision. 245-253."},{"key":"e_1_3_2_2_8_1","volume-title":"Hauptmann","author":"Ghosh Soham","year":"2019","unstructured":"Soham Ghosh, Anuva Agarwal, Zarana Parekh, and Alexander G. Hauptmann. 2019. ExCL: Extractive Clip Localization Using Natural Language Descriptions. In Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies. 1984-1990."},{"key":"e_1_3_2_2_9_1","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2023.3344097"},{"key":"e_1_3_2_2_10_1","volume-title":"Query-aware video encoder for video moment retrieval. Neurocomputing","author":"Hao Jiachang","year":"2022","unstructured":"Jiachang Hao, Haifeng Sun, Pengfei Ren, Jingyu Wang, Qi Qi, and Jianxin Liao. 2022. Query-aware video encoder for video moment retrieval. Neurocomputing (2022), 72-86."},{"volume-title":"Localizing Moments in Video with Natural Language. In International Conference on Computer Vision. 5804-5813","author":"Hendricks Lisa Anne","key":"e_1_3_2_2_11_1","unstructured":"Lisa Anne Hendricks, Oliver Wang, Eli Shechtman, Josef Sivic, Trevor Darrell, and Bryan C. Russell. 2017. Localizing Moments in Video with Natural Language. In International Conference on Computer Vision. 5804-5813."},{"key":"e_1_3_2_2_12_1","volume-title":"Unified Static and Dynamic Network: Efficient Temporal Filtering for Video Grounding. CoRR","author":"Hu Jingjing","year":"2024","unstructured":"Jingjing Hu, Dan Guo, Kun Li, Zhan Si, Xun Yang, Xiaojun Chang, and Meng Wang. 2024b. Unified Static and Dynamic Network: Efficient Temporal Filtering for Video Grounding. CoRR (2024)."},{"key":"e_1_3_2_2_13_1","doi-asserted-by":"publisher","DOI":"10.1145\/3664647.3680746"},{"key":"e_1_3_2_2_14_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.02204"},{"key":"e_1_3_2_2_15_1","doi-asserted-by":"publisher","DOI":"10.1145\/3323873.3325019"},{"key":"e_1_3_2_2_16_1","volume-title":"SDN: Semantic Decoupling Network for Temporal Language Grounding","author":"Jiang Xun","year":"2024","unstructured":"Xun Jiang, Xing Xu, Jingran Zhang, Fumin Shen, Zuo Cao, and Heng Tao Shen. 2024. SDN: Semantic Decoupling Network for Temporal Language Grounding. IEEE Trans. Neural Networks Learn. Syst. (2024), 6598-6612."},{"key":"e_1_3_2_2_17_1","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.acl-long.77"},{"key":"e_1_3_2_2_18_1","volume-title":"Dense-Captioning Events in Videos. In International Conference on Computer Vision. 706-715","author":"Krishna Ranjay","year":"2017","unstructured":"Ranjay Krishna, Kenji Hata, Frederic Ren, Li Fei-Fei, and Juan Carlos Niebles. 2017. Dense-Captioning Events in Videos. In International Conference on Computer Vision. 706-715."},{"key":"e_1_3_2_2_19_1","volume-title":"Exploiting Auxiliary Caption for Video Grounding. In Thirty-Eighth AAAI Conference on Artificial Intelligence. 18508-18516","author":"Li Hongxiang","year":"2024","unstructured":"Hongxiang Li, Meng Cao, Xuxin Cheng, Yaowei Li, Zhihong Zhu, and Yuexian Zou. 2024a. Exploiting Auxiliary Caption for Video Grounding. In Thirty-Eighth AAAI Conference on Artificial Intelligence. 18508-18516."},{"key":"e_1_3_2_2_20_1","unstructured":"Pandeng Li Chen-Wei Xie Hongtao Xie Liming Zhao Lei Zhang Yun Zheng Deli Zhao and Yongdong Zhang. 2023. MomentDiff: Generative Video Moment Retrieval from Random to Real. In Advances in Neural Information Processing Systems."},{"volume-title":"MogaNet: Multi-order Gated Aggregation Network. In The Twelfth International Conference on Learning Representations.","author":"Li Siyuan","key":"e_1_3_2_2_21_1","unstructured":"Siyuan Li, Zedong Wang, Zicheng Liu, Cheng Tan, Haitao Lin, Di Wu, Zhiyuan Chen, Jiangbin Zheng, and Stan Z. Li. 2024b. MogaNet: Multi-order Gated Aggregation Network. In The Twelfth International Conference on Learning Representations."},{"key":"e_1_3_2_2_22_1","volume-title":"Jointly Cross- and Self-Modal Graph Attention Network for Query-Based Moment Localization. In The 28th ACM International Conference on Multimedia. 4070-4078","author":"Liu Daizong","year":"2020","unstructured":"Daizong Liu, Xiaoye Qu, Xiao-Yang Liu, Jianfeng Dong, Pan Zhou, and Zichuan Xu. 2020. Jointly Cross- and Self-Modal Graph Attention Network for Query-Based Moment Localization. In The 28th ACM International Conference on Multimedia. 4070-4078."},{"key":"e_1_3_2_2_23_1","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2023.3261927"},{"key":"e_1_3_2_2_24_1","volume-title":"Towards Balanced Alignment: Modal-Enhanced Semantic Modeling for Video Moment Retrieval. In Thirty-Eighth AAAI Conference on Artificial Intelligence. 3855-3863","author":"Liu Zhihang","year":"2024","unstructured":"Zhihang Liu, Jun Li, Hongtao Xie, Pandeng Li, Jiannan Ge, Sun'ao Liu, and Guoqing Jin. 2024a. Towards Balanced Alignment: Modal-Enhanced Semantic Modeling for Video Moment Retrieval. In Thirty-Eighth AAAI Conference on Artificial Intelligence. 3855-3863."},{"key":"e_1_3_2_2_25_1","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/D19-1518"},{"key":"e_1_3_2_2_26_1","volume-title":"Temporal-enhanced Cross-modality Fusion Network for Video Sentence Grounding. In International Conference on Multimedia and Expo. 1487-1492","author":"Lv Zezhong","year":"2023","unstructured":"Zezhong Lv and Bing Su. 2023. Temporal-enhanced Cross-modality Fusion Network for Video Sentence Grounding. In International Conference on Multimedia and Expo. 1487-1492."},{"key":"e_1_3_2_2_27_1","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2021.3052086"},{"key":"e_1_3_2_2_28_1","volume-title":"Grounding Action Descriptions in Videos. Trans. Assoc. Comput. Linguistics","author":"Regneri Michaela","year":"2013","unstructured":"Michaela Regneri, Marcus Rohrbach, Dominikus Wetzel, Stefan Thater, Bernt Schiele, and Manfred Pinkal. 2013. Grounding Action Descriptions in Videos. Trans. Assoc. Comput. Linguistics (2013), 25-36."},{"key":"e_1_3_2_2_29_1","volume-title":"BMRN: Boundary Matching and Refinement Network for Temporal Moment Localization with Natural Language. In Conference on Computer Vision and Pattern Recognition - Workshops. 5571-5579","author":"Seol Muah","year":"2023","unstructured":"Muah Seol, Jonghee Kim, and Jinyoung Moon. 2023. BMRN: Boundary Matching and Refinement Network for Temporal Moment Localization with Natural Language. In Conference on Computer Vision and Pattern Recognition - Workshops. 5571-5579."},{"key":"e_1_3_2_2_30_1","doi-asserted-by":"publisher","DOI":"10.1145\/3581783.3613772"},{"key":"e_1_3_2_2_31_1","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2023.3250518"},{"key":"e_1_3_2_2_32_1","doi-asserted-by":"publisher","DOI":"10.1145\/3477495.3532083"},{"key":"e_1_3_2_2_33_1","volume-title":"Target-Oriented: A 3-Level Human-Like Framework for Video Moment Retrieval","author":"Wang Di","year":"2024","unstructured":"Di Wang, Xiantao Lu, Quan Wang, Yumin Tian, Bo Wan, and Lihuo He. 2024. Gist, Content, Target-Oriented: A 3-Level Human-Like Framework for Video Moment Retrieval. IEEE Trans. Multim. (2024), 11044-11056."},{"key":"e_1_3_2_2_34_1","doi-asserted-by":"crossref","unstructured":"Guolong Wang Xun Wu Zhaoyuan Liu and Zheng Qin. 2023b. Reducing 0s bias in video moment retrieval with a circular competence-based captioner. Inf. Process. Manag. (2023) 103147.","DOI":"10.1016\/j.ipm.2022.103147"},{"key":"e_1_3_2_2_35_1","doi-asserted-by":"publisher","DOI":"10.1145\/3581783.3612401"},{"key":"e_1_3_2_2_36_1","volume-title":"Negative Sample Matters: A Renaissance of Metric Learning for Temporal Grounding. In Thirty-Sixth AAAI Conference on Artificial Intelligence. 2613-2623","author":"Wang Zhenzhi","year":"2022","unstructured":"Zhenzhi Wang, Limin Wang, Tao Wu, Tianhao Li, and Gangshan Wu. 2022. Negative Sample Matters: A Renaissance of Metric Learning for Temporal Grounding. In Thirty-Sixth AAAI Conference on Artificial Intelligence. 2613-2623."},{"key":"e_1_3_2_2_37_1","volume-title":"Boundary Proposal Network for Two-stage Natural Language Video Localization. In Thirty-Fifth AAAI Conference on Artificial Intelligence. 2986-2994","author":"Xiao Shaoning","year":"2021","unstructured":"Shaoning Xiao, Long Chen, Songyang Zhang, Wei Ji, Jian Shao, Lu Ye, and Jun Xiao. 2021. Boundary Proposal Network for Two-stage Natural Language Video Localization. In Thirty-Fifth AAAI Conference on Artificial Intelligence. 2986-2994."},{"key":"e_1_3_2_2_38_1","volume-title":"Multilevel Language and Vision Integration for Text-to-Clip Retrieval. In The Thirty-Third AAAI Conference on Artificial Intelligence. 9062-9069","author":"Xu Huijuan","year":"2019","unstructured":"Huijuan Xu, Kun He, Bryan A. Plummer, Leonid Sigal, Stan Sclaroff, and Kate Saenko. 2019. Multilevel Language and Vision Integration for Text-to-Clip Retrieval. In The Thirty-Third AAAI Conference on Artificial Intelligence. 9062-9069."},{"key":"e_1_3_2_2_39_1","volume-title":"To Find Where You Talk: Temporal Sentence Localization in Video with Attention Based Location Regression. In The Thirty-Third AAAI Conference on Artificial Intelligence. 9159-9166","author":"Yuan Yitian","year":"2019","unstructured":"Yitian Yuan, Tao Mei, and Wenwu Zhu. 2019. To Find Where You Talk: Temporal Sentence Localization in Video with Attention Based Location Regression. In The Thirty-Third AAAI Conference on Artificial Intelligence. 9159-9166."},{"key":"e_1_3_2_2_40_1","volume-title":"Dense Regression Network for Video Grounding. In Conference on Computer Vision and Pattern Recognition. 10284-10293","author":"Zeng Runhao","year":"2020","unstructured":"Runhao Zeng, Haoming Xu, Wenbing Huang, Peihao Chen, Mingkui Tan, and Chuang Gan. 2020. Dense Regression Network for Video Grounding. In Conference on Computer Vision and Pattern Recognition. 10284-10293."},{"key":"e_1_3_2_2_41_1","first-page":"346","volume-title":"Video Moment Retrieval with Hierarchical Contrastive Learning. In The 30th ACM International Conference on Multimedia","author":"Zhang Bolin","year":"2022","unstructured":"Bolin Zhang, Chao Yang, Bin Jiang, and Xiaokang Zhou. 2022b. Video Moment Retrieval with Hierarchical Contrastive Learning. In The 30th ACM International Conference on Multimedia, 2022. 346-355."},{"key":"e_1_3_2_2_42_1","volume-title":"Joey Tianyi Zhou, and Rick Siow Mong Goh","author":"Zhang Hao","year":"2021","unstructured":"Hao Zhang, Aixin Sun, Wei Jing, Liangli Zhen, Joey Tianyi Zhou, and Rick Siow Mong Goh. 2021a. Parallel Attention Network with Sequence Matching for Video Grounding. In Findings of the Association for Computational Linguistics: ACL\/IJCNLP. 776-790."},{"volume-title":"Natural Language Video Moment Localization Through Query-Controlled Temporal Convolution. In Winter Conference on Applications of Computer Vision. 2524-2532","author":"Zhang Lingyu","key":"e_1_3_2_2_43_1","unstructured":"Lingyu Zhang and Richard J. Radke. 2022. Natural Language Video Moment Localization Through Query-Controlled Temporal Convolution. In Winter Conference on Applications of Computer Vision. 2524-2532."},{"key":"e_1_3_2_2_44_1","volume-title":"Multi-Stage Aggregated Transformer Network for Temporal Language Localization in Videos. In Conference on Computer Vision and Pattern Recognition. 12669-12678","author":"Zhang Mingxing","year":"2021","unstructured":"Mingxing Zhang, Yang Yang, Xinghan Chen, Yanli Ji, Xing Xu, Jingjing Li, and Heng Tao Shen. 2021b. Multi-Stage Aggregated Transformer Network for Temporal Language Localization in Videos. In Conference on Computer Vision and Pattern Recognition. 12669-12678."},{"key":"e_1_3_2_2_45_1","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2021.3120745"},{"key":"e_1_3_2_2_46_1","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v34i07.6984"},{"key":"e_1_3_2_2_47_1","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2023.3303712"},{"key":"e_1_3_2_2_48_1","doi-asserted-by":"publisher","DOI":"10.1145\/3331184.3331235"},{"key":"e_1_3_2_2_49_1","volume-title":"Fine-Grained Modality Relation-Aware Network for Video Moment Retrieval. Transactions on Circuits and Systems for Video Technology","author":"Zhao Yibo","year":"2024","unstructured":"Yibo Zhao, Zan Gao, Chunjie Ma, Weili Guan, Riwei Wang, and Shengyong Chen. 2024. Fine-Grained Modality Relation-Aware Network for Video Moment Retrieval. Transactions on Circuits and Systems for Video Technology (2024)."},{"key":"e_1_3_2_2_50_1","volume-title":"Phrase-Level Temporal Relationship Mining for Temporal Sentence Localization. In Thirty-Seventh AAAI Conference on Artificial Intelligence. 3669-3677","author":"Zheng Minghang","year":"2023","unstructured":"Minghang Zheng, Sizhe Li, Qingchao Chen, Yuxin Peng, and Yang Liu. 2023. Phrase-Level Temporal Relationship Mining for Temporal Sentence Localization. In Thirty-Seventh AAAI Conference on Artificial Intelligence. 3669-3677."},{"key":"e_1_3_2_2_51_1","volume-title":"Vision Mamba: Efficient Visual Representation Learning with Bidirectional State Space Model. In Forty-first International Conference on Machine Learning.","author":"Zhu Lianghui","year":"2024","unstructured":"Lianghui Zhu, Bencheng Liao, Qian Zhang, Xinlong Wang, Wenyu Liu, and Xinggang Wang. 2024. Vision Mamba: Efficient Visual Representation Learning with Bidirectional State Space Model. In Forty-first International Conference on Machine Learning."}],"event":{"name":"MM '25: The 33rd ACM International Conference on Multimedia","sponsor":["SIGMM ACM Special Interest Group on Multimedia"],"location":"Dublin Ireland","acronym":"MM '25"},"container-title":["Proceedings of the 33rd ACM International Conference on Multimedia"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3746027.3755391","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,12,10]],"date-time":"2025-12-10T04:09:06Z","timestamp":1765339746000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3746027.3755391"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,10,27]]},"references-count":51,"alternative-id":["10.1145\/3746027.3755391","10.1145\/3746027"],"URL":"https:\/\/doi.org\/10.1145\/3746027.3755391","relation":{},"subject":[],"published":{"date-parts":[[2025,10,27]]},"assertion":[{"value":"2025-10-27","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}