{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,12,10]],"date-time":"2025-12-10T04:04:18Z","timestamp":1765339458153,"version":"3.46.0"},"publisher-location":"New York, NY, USA","reference-count":65,"publisher":"ACM","funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62476097"],"award-info":[{"award-number":["62476097"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"name":"Fundamental Research Funds for the Central Universities, South China University of Technology","award":["x2rjD2250190"],"award-info":[{"award-number":["x2rjD2250190"]}]},{"name":"Guangdong Provincial Fund for Basic and Applied Basic Research?Regional Joint Fund Project (Key Project)","award":["2023B1515120078"],"award-info":[{"award-number":["2023B1515120078"]}]},{"name":"Guangdong Provincial Natural Science Foundation for Outstanding Youth Team Project","award":["2024B1515040010"],"award-info":[{"award-number":["2024B1515040010"]}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2025,10,27]]},"DOI":"10.1145\/3746027.3755756","type":"proceedings-article","created":{"date-parts":[[2025,10,25]],"date-time":"2025-10-25T06:55:00Z","timestamp":1761375300000},"page":"6576-6585","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":0,"title":["ExpStar: Towards Automatic Commentary Generation for Multi-discipline Scientific Experiments"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0000-0001-8064-1577","authenticated-orcid":false,"given":"Jiali","family":"Chen","sequence":"first","affiliation":[{"name":"South China University of Technology, Guangzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0000-0425-5199","authenticated-orcid":false,"given":"Yujie","family":"Jia","sequence":"additional","affiliation":[{"name":"South China University of Technology, Guangzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0004-7728-4467","authenticated-orcid":false,"given":"Zihan","family":"Wu","sequence":"additional","affiliation":[{"name":"South China University of Technology, Guangzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0000-7555-2211","authenticated-orcid":false,"given":"Jinyu","family":"Yang","sequence":"additional","affiliation":[{"name":"South China University of Technology, Guangzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0003-3222-7509","authenticated-orcid":false,"given":"Jianpeng","family":"Chen","sequence":"additional","affiliation":[{"name":"South China University of Technology, Guangzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0009-3148-139X","authenticated-orcid":false,"given":"Xusen","family":"Hei","sequence":"additional","affiliation":[{"name":"South China University of Technology, Guangzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-6833-7879","authenticated-orcid":false,"given":"Jiayuan","family":"Xie","sequence":"additional","affiliation":[{"name":"The Hong Kong Polytechnic University, Hong Kong, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-1767-789X","authenticated-orcid":false,"given":"Yi","family":"Cai","sequence":"additional","affiliation":[{"name":"Key Laboratory of Big Data and Intelligent Robot, Ministry of Education, Guangzhou, China and South China University of Technology, Guangzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3370-471X","authenticated-orcid":false,"given":"Qing","family":"Li","sequence":"additional","affiliation":[{"name":"The Hong Kong Polytechnic University, Hong Kong, Hong Kong SAR, China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2025,10,27]]},"reference":[{"key":"e_1_3_2_1_1_1","unstructured":"Rohan Anil Sebastian Borgeaud Yonghui Wu Jean-Baptiste Alayrac Jiahui Yu Radu Soricut Johan Schalkwyk Andrew M. Dai Anja Hauth Katie Millican David Silver Slav Petrov Melvin Johnson Ioannis Antonoglou Julian Schrittwieser Amelia Glaese Jilin Chen Emily Pitler Timothy P. Lillicrap Angeliki Lazaridou Orhan Firat James Molloy Michael Isard Paul Ronald Barham Tom Hennigan Benjamin Lee Fabio Viola Malcolm Reynolds Yuanzhong Xu Ryan Doherty Eli Collins Clemens Meyer Eliza Rutherford Erica Moreira Kareem Ayoub Megha Goel George Tucker Enrique Piqueras Maxim Krikun Iain Barr Nikolay Savinov Ivo Danihelka Becca Roelofs Ana\u00efs White Anders Andreassen Tamara von Glehn Lakshman Yagati Mehran Kazemi Lucas Gonzalez Misha Khalman Jakub Sygnowski and et al. 2023. Gemini: A Family of Highly Capable Multimodal Models. CoRR Vol. abs\/2312.11805 (2023)."},{"key":"e_1_3_2_1_2_1","volume-title":"Proc. of ICLR. OpenReview.net.","author":"Asai Akari","year":"2024","unstructured":"Akari Asai, Zeqiu Wu, Yizhong Wang, Avirup Sil, and Hannaneh Hajishirzi. 2024. Self-RAG: Learning to Retrieve, Generate, and Critique through Self-Reflection. In Proc. of ICLR. OpenReview.net."},{"key":"e_1_3_2_1_3_1","volume-title":"VIEWS: Entity-Aware News Video Captioning. In Proc. of EMNLP, Yaser Al-Onaizan, Mohit Bansal, and Yun-Nung Chen (Eds.)","author":"Ayyubi Hammad A.","year":"2024","unstructured":"Hammad A. Ayyubi, Tianqi Liu, Arsha Nagrani, Xudong Lin, Mingda Zhang, Anurag Arnab, Feng Han, Yukun Zhu, Xuande Feng, Kevin Zhang, Jialu Liu, and Shih-Fu Chang. 2024. VIEWS: Entity-Aware News Video Captioning. In Proc. of EMNLP, Yaser Al-Onaizan, Mohit Bansal, and Yun-Nung Chen (Eds.). Association for Computational Linguistics, 20220-20239."},{"key":"e_1_3_2_1_4_1","volume-title":"Qwen-VL: A Frontier Large Vision-Language Model with Versatile Abilities. CoRR","author":"Bai Jinze","year":"2023","unstructured":"Jinze Bai, Shuai Bai, Shusheng Yang, Shijie Wang, Sinan Tan, Peng Wang, Junyang Lin, Chang Zhou, and Jingren Zhou. 2023. Qwen-VL: A Frontier Large Vision-Language Model with Versatile Abilities. CoRR, Vol. abs\/2308.12966 (2023)."},{"key":"e_1_3_2_1_5_1","unstructured":"Shuai Bai Keqin Chen Xuejing Liu Jialin Wang Wenbin Ge Sibo Song Kai Dang Peng Wang Shijie Wang Jun Tang et al. 2025. Qwen2. 5-VL Technical Report. arXiv preprint arXiv:2502.13923 (2025)."},{"key":"e_1_3_2_1_6_1","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2023-78"},{"key":"e_1_3_2_1_7_1","doi-asserted-by":"publisher","DOI":"10.1145\/3581783.3612536"},{"key":"e_1_3_2_1_8_1","doi-asserted-by":"publisher","DOI":"10.1145\/3664647.3681590"},{"key":"e_1_3_2_1_9_1","doi-asserted-by":"publisher","DOI":"10.52202\/079017-0614"},{"key":"e_1_3_2_1_10_1","volume-title":"Proc. of ACL, Lun-Wei Ku, Andre Martins, and Vivek Srikumar (Eds.). Association for Computational Linguistics, 8199-8221","author":"Chen Qiguang","year":"2024","unstructured":"Qiguang Chen, Libo Qin, Jin Zhang, Zhi Chen, Xiao Xu, and Wanxiang Che. 2024c. M(3)CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought. In Proc. of ACL, Lun-Wei Ku, Andre Martins, and Vivek Srikumar (Eds.). Association for Computational Linguistics, 8199-8221."},{"key":"e_1_3_2_1_11_1","volume-title":"Martin Renqiang Min, and Dimitris N. Metaxas","author":"Chen Yuxiao","year":"2024","unstructured":"Yuxiao Chen, Kai Li, Wentao Bao, Deep Patel, Yu Kong, Martin Renqiang Min, and Dimitris N. Metaxas. 2024b. Learning to Localize Actions in Instructional Videos with LLM-Based Multi-pathway Text-Video Alignment. In Proc. of ECCV, Ales Leonardis, Elisa Ricci, Stefan Roth, Olga Russakovsky, Torsten Sattler, and G\u00fcl Varol (Eds.), Vol. 15140. Springer, 193-210."},{"key":"e_1_3_2_1_12_1","volume-title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling. CoRR","author":"Chen Zhe","year":"2024","unstructured":"Zhe Chen, Weiyun Wang, Yue Cao, Yangzhou Liu, Zhangwei Gao, Erfei Cui, Jinguo Zhu, Shenglong Ye, Hao Tian, Zhaoyang Liu, Lixin Gu, Xuehui Wang, Qingyun Li, Yimin Ren, Zixuan Chen, Jiapeng Luo, Jiahao Wang, Tan Jiang, Bo Wang, Conghui He, Botian Shi, Xingcheng Zhang, Han Lv, Yi Wang, Wenqi Shao, Pei Chu, Zhongying Tu, Tong He, Zhiyong Wu, Huipeng Deng, Jiaye Ge, Kai Chen, Min Dou, Lewei Lu, Xizhou Zhu, Tong Lu, Dahua Lin, Yu Qiao, Jifeng Dai, and Wenhai Wang. 2024d. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling. CoRR, Vol. abs\/2412.05271 (2024)."},{"key":"e_1_3_2_1_13_1","volume-title":"2024 e. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling. CoRR","author":"Chen Zhe","year":"2024","unstructured":"Zhe Chen, Weiyun Wang, Yue Cao, Yangzhou Liu, Zhangwei Gao, Erfei Cui, Jinguo Zhu, Shenglong Ye, Hao Tian, Zhaoyang Liu, Lixin Gu, Xuehui Wang, Qingyun Li, Yimin Ren, Zixuan Chen, Jiapeng Luo, Jiahao Wang, Tan Jiang, Bo Wang, Conghui He, Botian Shi, Xingcheng Zhang, Han Lv, Yi Wang, Wenqi Shao, Pei Chu, Zhongying Tu, Tong He, Zhiyong Wu, Huipeng Deng, Jiaye Ge, Kai Chen, Min Dou, Lewei Lu, Xizhou Zhu, Tong Lu, Dahua Lin, Yu Qiao, Jifeng Dai, and Wenhai Wang. 2024 e. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling. CoRR, Vol. abs\/2412.05271 (2024)."},{"key":"e_1_3_2_1_14_1","volume-title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks. CoRR","author":"Chen Zhe","year":"2023","unstructured":"Zhe Chen, Jiannan Wu, Wenhai Wang, Weijie Su, Guo Chen, Sen Xing, Muyan Zhong, Qinglong Zhang, Xizhou Zhu, Lewei Lu, Bin Li, Ping Luo, Tong Lu, Yu Qiao, and Jifeng Dai. 2023b. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks. CoRR, Vol. abs\/2312.14238 (2023)."},{"key":"e_1_3_2_1_15_1","volume-title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs. CoRR","author":"Cheng Zesen","year":"2024","unstructured":"Zesen Cheng, Sicong Leng, Hang Zhang, Yifei Xin, Xin Li, Guanzheng Chen, Yongxin Zhu, Wenqi Zhang, Ziyang Luo, Deli Zhao, and Lidong Bing. 2024. VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs. CoRR, Vol. abs\/2406.07476 (2024)."},{"key":"e_1_3_2_1_16_1","volume-title":"Augmenting Multimodal LLMs with Self-Reflective Tokens for Knowledge-based Visual Question Answering. CoRR","author":"Cocchi Federico","year":"2024","unstructured":"Federico Cocchi, Nicholas Moratelli, Marcella Cornia, Lorenzo Baraldi, and Rita Cucchiara. 2024. Augmenting Multimodal LLMs with Self-Reflective Tokens for Knowledge-based Visual Question Answering. CoRR, Vol. abs\/2411.16863 (2024)."},{"volume-title":"Proc. of ACL Workshop. 376-380","author":"Michael","key":"e_1_3_2_1_17_1","unstructured":"Michael J. Denkowski and Alon Lavie. 2014. Meteor Universal: Language Specific Translation Evaluation for Any Target Language. In Proc. of ACL Workshop. 376-380."},{"key":"e_1_3_2_1_18_1","unstructured":"Abhimanyu Dubey Abhinav Jauhri Abhinav Pandey Abhishek Kadian Ahmad Al-Dahle Aiesha Letman Akhil Mathur Alan Schelten Amy Yang Angela Fan Anirudh Goyal Anthony Hartshorn Aobo Yang Archi Mitra Archie Sravankumar Artem Korenev Arthur Hinsvark Arun Rao Aston Zhang Aur\u00e9lien Rodriguez Austen Gregerson Ava Spataru Baptiste Rozi\u00e8re Bethany Biron Binh Tang Bobbie Chern Charlotte Caucheteux Chaya Nayak Chloe Bi Chris Marra Chris McConnell Christian Keller Christophe Touret Chunyang Wu Corinne Wong Cristian Canton Ferrer Cyrus Nikolaidis Damien Allonsius Daniel Song Danielle Pintz Danny Livshits David Esiobu Dhruv Choudhary Dhruv Mahajan Diego Garcia-Olano Diego Perino Dieuwke Hupkes Egor Lakomkin Ehab AlBadawy Elina Lobanova Emily Dinan Eric Michael Smith Filip Radenovic Frank Zhang Gabriel Synnaeve Gabrielle Lee Georgia Lewis Anderson Graeme Nail Gr\u00e9goire Mialon Guan Pang Guillem Cucurell Hailey Nguyen Hannah Korevaar Hu Xu Hugo Touvron Iliyan Zarov Imanol Arrieta Ibarra Isabel M. Kloumann Ishan Misra Ivan Evtimov Jade Copet Jaewon Lee Jan Geffert Jana Vranes Jason Park Jay Mahadeokar Jeet Shah Jelmer van der Linde Jennifer Billock Jenny Hong Jenya Lee Jeremy Fu Jianfeng Chi Jianyu Huang Jiawen Liu Jie Wang Jiecao Yu Joanna Bitton Joe Spisak Jongsoo Park Joseph Rocca Joshua Johnstun Joshua Saxe Junteng Jia Kalyan Vasuden Alwala Kartikeya Upasani Kate Plawiak Ke Li Kenneth Heafield Kevin Stone and et al. 2024. The Llama 3 Herd of Models. CoRR Vol. abs\/2407.21783 (2024)."},{"key":"e_1_3_2_1_19_1","unstructured":"David Gooding Trevor Pinch and Simon Schaffer. 1989. The uses of experiment: Studies in the natural sciences."},{"key":"e_1_3_2_1_20_1","first-page":"13599","article-title":"AutoAD II: The Sequel - Who, When, and What in Movie Audio Description","author":"Han Tengda","year":"2023","unstructured":"Tengda Han, Max Bain, Arsha Nagrani, G\u00fcl Varol, Weidi Xie, and Andrew Zisserman. 2023a. AutoAD II: The Sequel - Who, When, and What in Movie Audio Description. In Proc. of ICCV. IEEE, 13599-13609.","journal-title":"Proc. of ICCV. IEEE"},{"key":"e_1_3_2_1_21_1","first-page":"18930","article-title":"AutoAD: Movie Description in Context","author":"Han Tengda","year":"2023","unstructured":"Tengda Han, Max Bain, Arsha Nagrani, G\u00fcl Varol, Weidi Xie, and Andrew Zisserman. 2023b. AutoAD: Movie Description in Context. In Proc. of CVPR. IEEE, 18930-18940.","journal-title":"Proc. of CVPR. IEEE"},{"key":"e_1_3_2_1_22_1","first-page":"18164","article-title":"AutoAD III: The Prequel - Back to the Pixels","author":"Han Tengda","year":"2024","unstructured":"Tengda Han, Max Bain, Arsha Nagrani, G\u00fcl Varol, Weidi Xie, and Andrew Zisserman. 2024. AutoAD III: The Prequel - Back to the Pixels. In Proc. of CVPR. IEEE, 18164-18174.","journal-title":"Proc. of CVPR. IEEE"},{"key":"e_1_3_2_1_23_1","volume-title":"Lijuan Wang, and Xin Eric Wang.","author":"He Xuehai","year":"2024","unstructured":"Xuehai He, Weixi Feng, Kaizhi Zheng, Yujie Lu, Wanrong Zhu, Jiachen Li, Yue Fan, Jianfeng Wang, Linjie Li, Zhengyuan Yang, Kevin Lin, William Yang Wang, Lijuan Wang, and Xin Eric Wang. 2024. MMWorld: Towards Multi-discipline Multi-faceted World Model Evaluation in Videos. CoRR, Vol. abs\/2406.08407 (2024)."},{"key":"e_1_3_2_1_24_1","volume-title":"CogVLM2: Visual Language Models for Image and Video Understanding. CoRR","author":"Hong Wenyi","year":"2024","unstructured":"Wenyi Hong, Weihan Wang, Ming Ding, Wenmeng Yu, Qingsong Lv, Yan Wang, Yean Cheng, Shiyu Huang, Junhui Ji, Zhao Xue, Lei Zhao, Zhuoyi Yang, Xiaotao Gu, Xiaohan Zhang, Guanyu Feng, Da Yin, Zihan Wang, Ji Qi, Xixuan Song, Peng Zhang, Debing Liu, Bin Xu, Juanzi Li, Yuxiao Dong, and Jie Tang. 2024. CogVLM2: Visual Language Models for Image and Video Understanding. CoRR, Vol. abs\/2408.16500 (2024)."},{"key":"e_1_3_2_1_25_1","volume-title":"Proc. of ICLR. OpenReview.net.","author":"Hu Edward J.","year":"2022","unstructured":"Edward J. Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen. 2022. LoRA: Low-Rank Adaptation of Large Language Models. In Proc. of ICLR. OpenReview.net."},{"key":"e_1_3_2_1_26_1","volume-title":"Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos. CoRR","author":"Hu Kairui","year":"2025","unstructured":"Kairui Hu, Penghao Wu, Fanyi Pu, Wang Xiao, Yuanhan Zhang, Xiang Yue, Bo Li, and Ziwei Liu. 2025. Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos. CoRR, Vol. abs\/2501.13826 (2025)."},{"key":"e_1_3_2_1_27_1","volume-title":"Heuristics for scientific experimentation: A developmental study. Cognitive psychology","author":"Klahr David","year":"1993","unstructured":"David Klahr, Anne L Fay, and Kevin Dunbar. 1993. Heuristics for scientific experimentation: A developmental study. Cognitive psychology, Vol. 25, 1 (1993), 111-146."},{"key":"e_1_3_2_1_28_1","first-page":"706","article-title":"Dense-Captioning Events in Videos","author":"Krishna Ranjay","year":"2017","unstructured":"Ranjay Krishna, Kenji Hata, Frederic Ren, Li Fei-Fei, and Juan Carlos Niebles. 2017. Dense-Captioning Events in Videos. In Proc. of ICCV. IEEE Computer Society, 706-715.","journal-title":"Proc. of ICCV. IEEE Computer Society"},{"key":"e_1_3_2_1_29_1","volume-title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models. CoRR","author":"Li Feng","year":"2024","unstructured":"Feng Li, Renrui Zhang, Hao Zhang, Yuanhan Zhang, Bo Li, Wei Li, Zejun Ma, and Chunyuan Li. 2024c. LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models. CoRR, Vol. abs\/2407.07895 (2024)."},{"key":"e_1_3_2_1_30_1","first-page":"22195","article-title":"MVBench: A Comprehensive Multi-modal Video Understanding Benchmark","author":"Li Kunchang","year":"2024","unstructured":"Kunchang Li, Yali Wang, Yinan He, Yizhuo Li, Yi Wang, Yi Liu, Zun Wang, Jilan Xu, Guo Chen, Ping Lou, Limin Wang, and Yu Qiao. 2024b. MVBench: A Comprehensive Multi-modal Video Understanding Benchmark. In Proc. of CVPR. IEEE, 22195-22206.","journal-title":"Proc. of CVPR. IEEE"},{"key":"e_1_3_2_1_31_1","first-page":"323","volume-title":"Proc. of ECCV, Ales Leonardis, Elisa Ricci, Stefan Roth, Olga Russakovsky, Torsten Sattler, and G\u00fcl Varol (Eds.)","volume":"15104","author":"Li Yanwei","year":"2024","unstructured":"Yanwei Li, Chengyao Wang, and Jiaya Jia. 2024a. LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models. In Proc. of ECCV, Ales Leonardis, Elisa Ricci, Stefan Roth, Olga Russakovsky, Torsten Sattler, and G\u00fcl Varol (Eds.), Vol. 15104. Springer, 323-340."},{"key":"e_1_3_2_1_32_1","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.emnlp-main.342"},{"key":"e_1_3_2_1_33_1","volume-title":"Proc. of ACL Workshop. 74-81","author":"Lin Chin-Yew","year":"2004","unstructured":"Chin-Yew Lin. 2004. Rouge: A package for automatic evaluation of summaries. In Proc. of ACL Workshop. 74-81."},{"key":"e_1_3_2_1_34_1","volume-title":"Proc. of NeurIPS, Alice Oh, Tristan Naumann, Amir Globerson, Kate Saenko, Moritz Hardt, and Sergey Levine (Eds.).","author":"Liu Haotian","year":"2023","unstructured":"Haotian Liu, Chunyuan Li, Qingyang Wu, and Yong Jae Lee. 2023. Visual Instruction Tuning. In Proc. of NeurIPS, Alice Oh, Tristan Naumann, Amir Globerson, Kate Saenko, Moritz Hardt, and Sergey Levine (Eds.)."},{"key":"e_1_3_2_1_35_1","volume-title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding. CoRR","author":"Lu Haoyu","year":"2024","unstructured":"Haoyu Lu, Wen Liu, Bo Zhang, Bingxuan Wang, Kai Dong, Bo Liu, Jingxiang Sun, Tongzheng Ren, Zhuoshu Li, Hao Yang, Yaofeng Sun, Chengqi Deng, Hanwei Xu, Zhenda Xie, and Chong Ruan. 2024. DeepSeek-VL: Towards Real-World Vision-Language Understanding. CoRR, Vol. abs\/2403.05525 (2024)."},{"key":"e_1_3_2_1_36_1","volume-title":"Proc. of NeurIPS, Sanmi Koyejo, S. Mohamed, A. Agarwal, Danielle Belgrave, K. Cho, and A. Oh (Eds.).","author":"Lu Pan","year":"2022","unstructured":"Pan Lu, Swaroop Mishra, Tanglin Xia, Liang Qiu, Kai-Wei Chang, Song-Chun Zhu, Oyvind Tafjord, Peter Clark, and Ashwin Kalyan. 2022. Learn to Explain: Multimodal Reasoning via Thought Chains for Science Question Answering. In Proc. of NeurIPS, Sanmi Koyejo, S. Mohamed, A. Agarwal, Danielle Belgrave, K. Cho, and A. Oh (Eds.)."},{"key":"e_1_3_2_1_37_1","first-page":"3090","article-title":"Encyclopedic VQA: Visual questions about detailed properties of fine-grained categories","author":"Mensink Thomas","year":"2023","unstructured":"Thomas Mensink, Jasper R. R. Uijlings, Llu\u00eds Castrej\u00f3n, Arushi Goel, Felipe Cadar, Howard Zhou, Fei Sha, Andr\u00e9 Ara\u00fajo, and Vittorio Ferrari. 2023. Encyclopedic VQA: Visual questions about detailed properties of fine-grained categories. In Proc. of ICCV. IEEE, 3090-3101.","journal-title":"Proc. of ICCV. IEEE"},{"key":"e_1_3_2_1_38_1","unstructured":"OpenAI. 2023. GPT-4 Technical Report. CoRR Vol. abs\/2303.08774 (2023)."},{"key":"e_1_3_2_1_39_1","first-page":"311","article-title":"Bleu: a Method for Automatic Evaluation of Machine Translation","author":"Papineni Kishore","year":"2002","unstructured":"Kishore Papineni, Salim Roukos, Todd Ward, and Wei-Jing Zhu. 2002. Bleu: a Method for Automatic Evaluation of Machine Translation. In Proc. of ACL. 311-318.","journal-title":"Proc. of ACL."},{"key":"e_1_3_2_1_40_1","doi-asserted-by":"publisher","DOI":"10.1145\/3583780.3615120"},{"key":"e_1_3_2_1_41_1","volume-title":"Proc. of ICML (Proceedings of Machine Learning Research","volume":"8763","author":"Radford Alec","year":"2021","unstructured":"Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, Gretchen Krueger, and Ilya Sutskever. 2021. Learning Transferable Visual Models From Natural Language Supervision. In Proc. of ICML (Proceedings of Machine Learning Research, Vol. 139), Marina Meila and Tong Zhang (Eds.). PMLR, 8748-8763."},{"key":"e_1_3_2_1_42_1","volume-title":"Proc. of NeurIPS, Alice Oh, Tristan Naumann, Amir Globerson, Kate Saenko, Moritz Hardt, and Sergey Levine (Eds.).","author":"Rafailov Rafael","year":"2023","unstructured":"Rafael Rafailov, Archit Sharma, Eric Mitchell, Christopher D. Manning, Stefano Ermon, and Chelsea Finn. 2023. Direct Preference Optimization: Your Language Model is Secretly a Reward Model. In Proc. of NeurIPS, Alice Oh, Tristan Naumann, Amir Globerson, Kate Saenko, Moritz Hardt, and Sergey Levine (Eds.)."},{"key":"e_1_3_2_1_43_1","volume-title":"Towards Universal Soccer Video Understanding. CoRR","author":"Rao Jiayuan","year":"1820","unstructured":"Jiayuan Rao, Haoning Wu, Hao Jiang, Ya Zhang, Yanfeng Wang, and Weidi Xie. 2024a. Towards Universal Soccer Video Understanding. CoRR, Vol. abs\/2412.01820 (2024)."},{"key":"e_1_3_2_1_44_1","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.emnlp-main.99"},{"key":"e_1_3_2_1_45_1","first-page":"21064","article-title":"Assembly101: A Large-Scale Multi-View Video Dataset for Understanding Procedural Activities","author":"Sener Fadime","year":"2022","unstructured":"Fadime Sener, Dibyadip Chatterjee, Daniel Shelepov, Kun He, Dipika Singhania, Robert Wang, and Angela Yao. 2022. Assembly101: A Large-Scale Multi-View Video Dataset for Understanding Procedural Activities. In Proc. of CVPR. IEEE, 21064-21074.","journal-title":"Proc. of CVPR. IEEE"},{"key":"e_1_3_2_1_46_1","volume-title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding. CoRR","author":"Shu Yan","year":"2024","unstructured":"Yan Shu, Peitian Zhang, Zheng Liu, Minghao Qin, Junjie Zhou, Tie-Jun Huang, and Bo Zhao. 2024. Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding. CoRR, Vol. abs\/2409.14485 (2024)."},{"key":"e_1_3_2_1_47_1","volume-title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters. CoRR","author":"Sun Quan","year":"2024","unstructured":"Quan Sun, Jinsheng Wang, Qiying Yu, Yufeng Cui, Fan Zhang, Xiaosong Zhang, and Xinlong Wang. 2024. EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters. CoRR, Vol. abs\/2402.04252 (2024)."},{"key":"e_1_3_2_1_48_1","first-page":"4566","article-title":"CIDEr: Consensus-based image description evaluation","author":"Vedantam Ramakrishna","year":"2015","unstructured":"Ramakrishna Vedantam, C. Lawrence Zitnick, and Devi Parikh. 2015. CIDEr: Consensus-based image description evaluation. In Proc. of CVPR. 4566-4575.","journal-title":"Proc. of CVPR."},{"key":"e_1_3_2_1_49_1","volume-title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution. CoRR","author":"Wang Peng","year":"2024","unstructured":"Peng Wang, Shuai Bai, Sinan Tan, Shijie Wang, Zhihao Fan, Jinze Bai, Keqin Chen, Xuejing Liu, Jialin Wang, Wenbin Ge, Yang Fan, Kai Dang, Mengfei Du, Xuancheng Ren, Rui Men, Dayiheng Liu, Chang Zhou, Jingren Zhou, and Junyang Lin. 2024a. Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution. CoRR, Vol. abs\/2409.12191 (2024)."},{"key":"e_1_3_2_1_50_1","volume-title":"Proc. of ICLR. OpenReview.net.","author":"Wang Yi","year":"2024","unstructured":"Yi Wang, Yinan He, Yizhuo Li, Kunchang Li, Jiashuo Yu, Xin Ma, Xinhao Li, Guo Chen, Xinyuan Chen, Yaohui Wang, Ping Luo, Ziwei Liu, Yali Wang, Limin Wang, and Yu Qiao. 2024b. InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation. In Proc. of ICLR. OpenReview.net."},{"key":"e_1_3_2_1_51_1","volume-title":"Chang Wen Chen, and Zhenzhong Chen","author":"Wei Hongchen","year":"2025","unstructured":"Hongchen Wei, Zhihong Tan, Yaosi Hu, Chang Wen Chen, and Zhenzhong Chen. 2025. LongCaptioning: Unlocking the Power of Long Video Caption Generation in Large Multimodal Models. CoRR, Vol. abs\/2502.15393 (2025)."},{"key":"e_1_3_2_1_52_1","unstructured":"Stephen Wooding Alison Cullinane and Sibel Erduran. 2020. Supporting the teaching of scientific methods in practical science. (2020)."},{"key":"e_1_3_2_1_53_1","volume-title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding. CoRR","author":"Wu Zhiyu","year":"2024","unstructured":"Zhiyu Wu, Xiaokang Chen, Zizheng Pan, Xingchao Liu, Wen Liu, Damai Dai, Huazuo Gao, Yiyang Ma, Chengyue Wu, Bingxuan Wang, Zhenda Xie, Yu Wu, Kai Hu, Jiawei Wang, Yaofeng Sun, Yukun Li, Yishi Piao, Kang Guan, Aixin Liu, Xin Xie, Yuxiang You, Kai Dong, Xingkai Yu, Haowei Zhang, Liang Zhao, Yisong Wang, and Chong Ruan. 2024. DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding. CoRR, Vol. abs\/2412.10302 (2024)."},{"key":"e_1_3_2_1_54_1","volume-title":"Progress-Aware Video Frame Captioning. CoRR","author":"Xue Zihui","year":"2071","unstructured":"Zihui Xue, Joungbin An, Xitong Yang, and Kristen Grauman. 2024. Progress-Aware Video Frame Captioning. CoRR, Vol. abs\/2412.02071 (2024)."},{"key":"e_1_3_2_1_55_1","first-page":"10714","article-title":"Vid2Seq: Large-Scale Pretraining of a Visual Language Model for Dense Video Captioning","author":"Yang Antoine","year":"2023","unstructured":"Antoine Yang, Arsha Nagrani, Paul Hongsuck Seo, Antoine Miech, Jordi Pont-Tuset, Ivan Laptev, Josef Sivic, and Cordelia Schmid. 2023. Vid2Seq: Large-Scale Pretraining of a Visual Language Model for Dense Video Captioning. In Proc. of CVPR. IEEE, 10714-10726.","journal-title":"Proc. of CVPR. IEEE"},{"key":"e_1_3_2_1_56_1","unstructured":"An Yang Baosong Yang Binyuan Hui Bo Zheng Bowen Yu Chang Zhou Chengpeng Li Chengyuan Li Dayiheng Liu Fei Huang Guanting Dong Haoran Wei Huan Lin Jialong Tang Jialin Wang Jian Yang Jianhong Tu Jianwei Zhang Jianxin Ma Jianxin Yang Jin Xu Jingren Zhou Jinze Bai Jinzheng He Junyang Lin Kai Dang Keming Lu Keqin Chen Kexin Yang Mei Li Mingfeng Xue Na Ni Pei Zhang Peng Wang Ru Peng Rui Men Ruize Gao Runji Lin Shijie Wang Shuai Bai Sinan Tan Tianhang Zhu Tianhao Li Tianyu Liu Wenbin Ge Xiaodong Deng Xiaohuan Zhou Xingzhang Ren Xinyu Zhang Xipin Wei Xuancheng Ren Xuejing Liu Yang Fan Yang Yao Yichang Zhang Yu Wan Yunfei Chu Yuqiong Liu Zeyu Cui Zhenru Zhang Zhifang Guo and Zhihao Fan. 2024a. Qwen2 Technical Report. CoRR Vol. abs\/2407.10671 (2024)."},{"key":"e_1_3_2_1_57_1","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.acl-long.513"},{"key":"e_1_3_2_1_58_1","first-page":"9556","article-title":"MMMU: A Massive Multi-Discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI","author":"Yue Xiang","year":"2024","unstructured":"Xiang Yue, Yuansheng Ni, Tianyu Zheng, Kai Zhang, Ruoqi Liu, Ge Zhang, Samuel Stevens, Dongfu Jiang, Weiming Ren, Yuxuan Sun, Cong Wei, Botao Yu, Ruibin Yuan, Renliang Sun, Ming Yin, Boyuan Zheng, Zhenzhu Yang, Yibo Liu, Wenhao Huang, Huan Sun, Yu Su, and Wenhu Chen. 2024. MMMU: A Massive Multi-Discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI. In Proc. of CVPR. IEEE, 9556-9567.","journal-title":"Proc. of CVPR. IEEE"},{"key":"e_1_3_2_1_59_1","unstructured":"Aohan Zeng Bin Xu Bowen Wang Chenhui Zhang Da Yin Diego Rojas Guanyu Feng Hanlin Zhao Hanyu Lai Hao Yu Hongning Wang Jiadai Sun Jiajie Zhang Jiale Cheng Jiayi Gui Jie Tang Jing Zhang Juanzi Li Lei Zhao Lindong Wu Lucen Zhong Mingdao Liu Minlie Huang Peng Zhang Qinkai Zheng Rui Lu Shuaiqi Duan Shudan Zhang Shulin Cao Shuxun Yang Weng Lam Tam Wenyi Zhao Xiao Liu Xiao Xia Xiaohan Zhang Xiaotao Gu Xin Lv Xinghan Liu Xinyi Liu Xinyue Yang Xixuan Song Xunkai Zhang Yifan An Yifan Xu Yilin Niu Yuantao Yang Yueyan Li Yushi Bai Yuxiao Dong Zehan Qi Zhaoyu Wang Zhen Yang Zhengxiao Du Zhenyu Hou and Zihan Wang. 2024. ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools. CoRR Vol. abs\/2406.12793 (2024)."},{"key":"e_1_3_2_1_60_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.01100"},{"volume-title":"Proc. of EMNLP","author":"Zhang Hang","key":"e_1_3_2_1_61_1","unstructured":"Hang Zhang, Xin Li, and Lidong Bing. 2023. Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding. In Proc. of EMNLP, Yansong Feng and Els Lefever (Eds.). Association for Computational Linguistics, 543-553."},{"key":"e_1_3_2_1_62_1","volume-title":"Proc. of ICLR. OpenReview.net.","author":"Zhang Tianyi","year":"2020","unstructured":"Tianyi Zhang, Varsha Kishore, Felix Wu, Kilian Q. Weinberger, and Yoav Artzi. 2020. BERTScore: Evaluating Text Generation with BERT. In Proc. of ICLR. OpenReview.net."},{"key":"e_1_3_2_1_63_1","volume-title":"MMVU: Measuring Expert-Level Multi-Discipline Video Understanding. CoRR","author":"Zhao Yilun","year":"2025","unstructured":"Yilun Zhao, Lujing Xie, Haowei Zhang, Guo Gan, Yitao Long, Zhiyuan Hu, Tongyan Hu, Weiyuan Chen, Chuhan Li, Junyang Song, Zhijian Xu, Chengye Wang, Weifeng Pan, Ziyao Shangguan, Xiangru Tang, Zhenwen Liang, Yixin Liu, Chen Zhao, and Arman Cohan. 2025. MMVU: Measuring Expert-Level Multi-Discipline Video Understanding. CoRR, Vol. abs\/2501.12380 (2025)."},{"key":"e_1_3_2_1_64_1","first-page":"18243","article-title":"Streaming Dense Video Captioning","author":"Zhou Xingyi","year":"2024","unstructured":"Xingyi Zhou, Anurag Arnab, Shyamal Buch, Shen Yan, Austin Myers, Xuehan Xiong, Arsha Nagrani, and Cordelia Schmid. 2024. Streaming Dense Video Captioning. In Proc. of CVPR. IEEE, 18243-18252.","journal-title":"Proc. of CVPR. IEEE"},{"key":"e_1_3_2_1_65_1","volume-title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models. CoRR","author":"Zohar Orr","year":"2024","unstructured":"Orr Zohar, Xiaohan Wang, Yann Dubois, Nikhil Mehta, Tong Xiao, Philippe Hansen-Estruch, Licheng Yu, Xiaofang Wang, Felix Juefei-Xu, Ning Zhang, Serena Yeung-Levy, and Xide Xia. 2024. Apollo: An Exploration of Video Understanding in Large Multimodal Models. CoRR, Vol. abs\/2412.10360 (2024)."}],"event":{"name":"MM '25: The 33rd ACM International Conference on Multimedia","sponsor":["SIGMM ACM Special Interest Group on Multimedia"],"location":"Dublin Ireland","acronym":"MM '25"},"container-title":["Proceedings of the 33rd ACM International Conference on Multimedia"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3746027.3755756","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,12,10]],"date-time":"2025-12-10T03:59:26Z","timestamp":1765339166000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3746027.3755756"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,10,27]]},"references-count":65,"alternative-id":["10.1145\/3746027.3755756","10.1145\/3746027"],"URL":"https:\/\/doi.org\/10.1145\/3746027.3755756","relation":{},"subject":[],"published":{"date-parts":[[2025,10,27]]},"assertion":[{"value":"2025-10-27","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}