{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,15]],"date-time":"2026-06-15T14:55:57Z","timestamp":1781535357729,"version":"3.54.5"},"publisher-location":"New York, NY, USA","reference-count":21,"publisher":"ACM","license":[{"start":{"date-parts":[[2026,6,15]],"date-time":"2026-06-15T00:00:00Z","timestamp":1781481600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/legalcode"}],"funder":[{"name":"National Research Foundation, Singapore","award":["AISG-NMLP-2024-002"],"award-info":[{"award-number":["AISG-NMLP-2024-002"]}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2026,6,16]]},"DOI":"10.1145\/3805622.3810431","type":"proceedings-article","created":{"date-parts":[[2026,6,15]],"date-time":"2026-06-15T14:42:57Z","timestamp":1781534577000},"page":"2852-2856","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":0,"title":["VideoCreator: An Agentic System for Multi-turn Video Production"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0009-0008-0205-0163","authenticated-orcid":false,"given":"Zhengyang","family":"Liang","sequence":"first","affiliation":[{"name":"Singapore Management University, Singapore, Singapore"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-5544-9425","authenticated-orcid":false,"given":"Yan","family":"Shu","sequence":"additional","affiliation":[{"name":"University of Trento, Trento, Italy"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-2903-3968","authenticated-orcid":false,"given":"Cathal","family":"Gurrin","sequence":"additional","affiliation":[{"name":"Dublin City University, Dublin, Ireland"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-6597-7248","authenticated-orcid":false,"given":"Nicu","family":"Sebe","sequence":"additional","affiliation":[{"name":"University of Trento, Trento, Italy"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-9973-3305","authenticated-orcid":false,"given":"Lizi","family":"Liao","sequence":"additional","affiliation":[{"name":"Singapore Management University, Singapore, Singapore"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"320","published-online":{"date-parts":[[2026,6,15]]},"reference":[{"key":"e_1_3_3_2_2_2","unstructured":"Shuai Bai Yuxuan Cai Ruizhe Chen Keqin Chen Xionghui Chen Zesen Cheng Lianghao Deng Wei Ding Chang Gao Chunjiang Ge Wenbin Ge Zhifang Guo Qidong Huang Jie Huang Fei Huang Binyuan Hui Shutong Jiang Zhaohai Li Mingsheng Li Mei Li Kaixin Li Zicheng Lin Junyang Lin Xuejing Liu Jiawei Liu Chenglong Liu Yang Liu Dayiheng Liu Shixuan Liu Dunjie Lu Ruilin Luo Chenxu Lv Rui Men Lingchen Meng Xuancheng Ren Xingzhang Ren Sibo Song Yuchong Sun Jun Tang Jianhong Tu Jianqiang Wan Peng Wang Pengfei Wang Qiuyue Wang Yuxuan Wang Tianbao Xie Yiheng Xu Haiyang Xu Jin Xu Zhibo Yang Mingkun Yang Jianxin Yang An Yang Bowen Yu Fei Zhang Hang Zhang Xi Zhang Bo Zheng Humen Zhong Jingren Zhou Fan Zhou Jing Zhou Yuanzhi Zhu and Ke Zhu. 2025. Qwen3-VL Technical Report. arxiv:https:\/\/arXiv.org\/abs\/2511.21631\u00a0[cs.CV] https:\/\/arxiv.org\/abs\/2511.21631"},{"key":"e_1_3_3_2_3_2","unstructured":"Yu Gao Haoyuan Guo Tuyen Hoang Weilin Huang Lu Jiang Fangyuan Kong Huixia Li Jiashi Li Liang Li Xiaojie Li Xunsong Li Yifu Li Shanchuan Lin Zhijie Lin Jiawei Liu Shu Liu Xiaonan Nie Zhiwu Qing Yuxi Ren Li Sun Zhi Tian Rui Wang Sen Wang Guoqiang Wei Guohong Wu Jie Wu Ruiqi Xia Fei Xiao Xuefeng Xiao Jiangqiao Yan Ceyuan Yang Jianchao Yang Runkai Yang Tao Yang Yihang Yang Zilyu Ye Xuejiao Zeng Yan Zeng Heng Zhang Yang Zhao Xiaozheng Zheng Peihao Zhu Jiaxin Zou and Feilong Zuo. 2025. Seedance 1.0: Exploring the Boundaries of Video Generation Models. arxiv:https:\/\/arXiv.org\/abs\/2506.09113\u00a0[cs.CV] https:\/\/arxiv.org\/abs\/2506.09113"},{"key":"e_1_3_3_2_4_2","unstructured":"Panwen Hu Jin Jiang Jianqi Chen Mingfei Han Shengcai Liao Xiaojun Chang and Xiaodan Liang. 2024. StoryAgent: Customized Storytelling Video Generation via Multi-Agent Collaboration. arxiv:https:\/\/arXiv.org\/abs\/2411.04925\u00a0[cs.CV] https:\/\/arxiv.org\/abs\/2411.04925"},{"key":"e_1_3_3_2_5_2","unstructured":"Ziqi Huang Ning Yu Gordon Chen Haonan Qiu Paul Debevec and Ziwei Liu. 2025. VChain: Chain-of-Visual-Thought for Reasoning in Video Generation. arxiv:https:\/\/arXiv.org\/abs\/2510.05094\u00a0[cs.CV] https:\/\/arxiv.org\/abs\/2510.05094"},{"key":"e_1_3_3_2_6_2","unstructured":"Weijie Kong Qi Tian Zijian Zhang Rox Min Zuozhuo Dai Jin Zhou Jiangfeng Xiong Xin Li Bo Wu Jianwei Zhang Kathrina Wu Qin Lin Junkun Yuan Yanxin Long Aladdin Wang Andong Wang Changlin Li Duojun Huang Fang Yang Hao Tan Hongmei Wang Jacob Song Jiawang Bai Jianbing Wu Jinbao Xue Joey Wang Kai Wang Mengyang Liu Pengyu Li Shuai Li Weiyan Wang Wenqing Yu Xinchi Deng Yang Li Yi Chen Yutao Cui Yuanbo Peng Zhentao Yu Zhiyu He Zhiyong Xu Zixiang Zhou Zunnan Xu Yangyu Tao Qinglin Lu Songtao Liu Dax Zhou Hongfa Wang Yong Yang Di Wang Yuhong Liu Jie Jiang and Caesar Zhong. 2025. HunyuanVideo: A Systematic Framework For Large Video Generative Models. arxiv:https:\/\/arXiv.org\/abs\/2412.03603\u00a0[cs.CV] https:\/\/arxiv.org\/abs\/2412.03603"},{"key":"e_1_3_3_2_7_2","unstructured":"Dohun Lee Chun-Hao\u00a0Paul Huang Xuelin Chen Jong\u00a0Chul Ye Duygu Ceylan and Hyeonho Jeong. 2026. Memory-V2V: Augmenting Video-to-Video Diffusion Models with Memory. arxiv:https:\/\/arXiv.org\/abs\/2601.16296\u00a0[cs.CV] https:\/\/arxiv.org\/abs\/2601.16296"},{"key":"e_1_3_3_2_8_2","unstructured":"Zhengyang Liang Daoan Zhang Huichi Zhou Rui Huang Bobo Li Yuechen Zhang Shengqiong Wu Xiaohan Wang Jiebo Luo Lizi Liao and Hao Fei. 2025. UniVA: Universal Video Agent towards Open-Source Next-Generation Video Generalist. arxiv:https:\/\/arXiv.org\/abs\/2511.08521\u00a0[cs.CV] https:\/\/arxiv.org\/abs\/2511.08521"},{"key":"e_1_3_3_2_9_2","unstructured":"Yixin Liu Kai Zhang Yuan Li Zhiling Yan Chujie Gao Ruoxi Chen Zhengqing Yuan Yue Huang Hanchi Sun Jianfeng Gao Lifang He and Lichao Sun. 2024. Sora: A Review on Background Technology Limitations and Opportunities of Large Vision Models. arxiv:https:\/\/arXiv.org\/abs\/2402.17177\u00a0[cs.CV] https:\/\/arxiv.org\/abs\/2402.17177"},{"key":"e_1_3_3_2_10_2","unstructured":"Do\u00a0Xuan Long Xingchen Wan Hootan Nakhost Chen-Yu Lee Tomas Pfister and Sercan\u00a0\u00d6. Ar\u0131k. 2025. VISTA: A Test-Time Self-Improving Video Generation Agent. arxiv:https:\/\/arXiv.org\/abs\/2510.15831\u00a0[cs.CV] https:\/\/arxiv.org\/abs\/2510.15831"},{"key":"e_1_3_3_2_11_2","unstructured":"Lin Long Yichen He Wentao Ye Yiyuan Pan Yuan Lin Hang Li Junbo Zhao and Wei Li. 2025. Seeing Listening Remembering and Reasoning: A Multimodal Agent with Long-Term Memory. arxiv:https:\/\/arXiv.org\/abs\/2508.09736\u00a0[cs.CV] https:\/\/arxiv.org\/abs\/2508.09736"},{"key":"e_1_3_3_2_12_2","unstructured":"Aaditya Singh Adam Fry Adam Perelman Adam Tart Adi Ganesh Ahmed El-Kishky Aidan McLaughlin Aiden Low AJ Ostrow Akhila Ananthram Akshay Nathan Alan Luo Alec Helyar and etc. Aleksander\u00a0Madry. 2025. OpenAI GPT-5 System Card. arxiv:https:\/\/arXiv.org\/abs\/2601.03267\u00a0[cs.CL] https:\/\/arxiv.org\/abs\/2601.03267"},{"key":"e_1_3_3_2_13_2","unstructured":"Achint Soni Sreyas Venkataraman Abhranil Chandra Sebastian Fischmeister Percy Liang Bo Dai and Sherry Yang. 2025. VideoAgent: Self-Improving Video Generation. arxiv:https:\/\/arXiv.org\/abs\/2410.10076\u00a0[cs.AI] https:\/\/arxiv.org\/abs\/2410.10076"},{"key":"e_1_3_3_2_14_2","unstructured":"Kling Team Jialu Chen Yuanzheng Ci Xiangyu Du Zipeng Feng Kun Gai Sainan Guo Feng Han Jingbin He Kang He Xiao Hu Xiaohua Hu Boyuan Jiang Fangyuan Kong Hang Li Jie Li Qingyu Li Shen Li Xiaohan Li Yan Li Jiajun Liang Borui Liao Yiqiao Liao Weihong Lin Quande Liu Xiaokun Liu Yilun Liu Yuliang Liu Shun Lu Hangyu Mao Yunyao Mao Haodong Ouyang Wenyu Qin Wanqi Shi Xiaoyu Shi Lianghao Su Haozhi Sun Peiqin Sun Pengfei Wan Chao Wang Chenyu Wang Meng Wang Qiulin Wang Runqi Wang Xintao Wang Xuebo Wang Zekun Wang Min Wei Tiancheng Wen Guohao Wu Xiaoshi Wu Zhenhua Wu Da Xie Yingtong Xiong Yulong Xu Sile Yang Zikang Yang Weicai Ye Ziyang Yuan Shenglong Zhang Shuaiyu Zhang Yuanxing Zhang Yufan Zhang Wenzheng Zhao Ruiliang Zhou Yan Zhou Guosheng Zhu and Yongjie Zhu. 2025. Kling-Omni Technical Report. arxiv:https:\/\/arXiv.org\/abs\/2512.16776\u00a0[cs.CV] https:\/\/arxiv.org\/abs\/2512.16776"},{"key":"e_1_3_3_2_15_2","unstructured":"Team Wan Ang Wang Baole Ai Bin Wen Chaojie Mao Chen-Wei Xie Di Chen Feiwu Yu Haiming Zhao Jianxiao Yang Jianyuan Zeng Jiayu Wang Jingfeng Zhang Jingren Zhou Jinkai Wang Jixuan Chen Kai Zhu Kang Zhao Keyu Yan Lianghua Huang Mengyang Feng Ningyi Zhang Pandeng Li Pingyu Wu Ruihang Chu Ruili Feng Shiwei Zhang Siyang Sun Tao Fang Tianxing Wang Tianyi Gui Tingyu Weng Tong Shen Wei Lin Wei Wang Wei Wang Wenmeng Zhou Wente Wang Wenting Shen Wenyuan Yu Xianzhong Shi Xiaoming Huang Xin Xu Yan Kou Yangyu Lv Yifei Li Yijing Liu Yiming Wang Yingya Zhang Yitong Huang Yong Li You Wu Yu Liu Yulin Pan Yun Zheng Yuntao Hong Yupeng Shi Yutong Feng Zeyinzi Jiang Zhen Han Zhi-Fan Wu and Ziyu Liu. 2025. Wan: Open and Advanced Large-Scale Video Generative Models. arxiv:https:\/\/arXiv.org\/abs\/2503.20314\u00a0[cs.CV] https:\/\/arxiv.org\/abs\/2503.20314"},{"key":"e_1_3_3_2_16_2","unstructured":"Weijia Wu Zeyu Zhu and Mike\u00a0Zheng Shou. 2025. Automated Movie Generation via Multi-Agent CoT Planning. arxiv:https:\/\/arXiv.org\/abs\/2503.07314\u00a0[cs.CV] https:\/\/arxiv.org\/abs\/2503.07314"},{"key":"e_1_3_3_2_17_2","unstructured":"Zhuoyi Yang Jiayan Teng Wendi Zheng Ming Ding Shiyu Huang Jiazheng Xu Yuanming Yang Wenyi Hong Xiaohan Zhang Guanyu Feng Da Yin Yuxuan Zhang Weihan Wang Yean Cheng Bin Xu Xiaotao Gu Yuxiao Dong and Jie Tang. 2025. CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer. arxiv:https:\/\/arXiv.org\/abs\/2408.06072\u00a0[cs.CV] https:\/\/arxiv.org\/abs\/2408.06072"},{"key":"e_1_3_3_2_18_2","unstructured":"Shunyu Yao Jeffrey Zhao Dian Yu Nan Du Izhak Shafran Karthik Narasimhan and Yuan Cao. 2023. ReAct: Synergizing Reasoning and Acting in Language Models. arxiv:https:\/\/arXiv.org\/abs\/2210.03629\u00a0[cs.CL] https:\/\/arxiv.org\/abs\/2210.03629"},{"key":"e_1_3_3_2_19_2","unstructured":"Hangjie Yuan Shiwei Zhang Xiang Wang Yujie Wei Tao Feng Yining Pan Yingya Zhang Ziwei Liu Samuel Albanie and Dong Ni. 2023. InstructVideo: Instructing Video Diffusion Models with Human Feedback. arxiv:https:\/\/arXiv.org\/abs\/2312.12490\u00a0[cs.CV] https:\/\/arxiv.org\/abs\/2312.12490"},{"key":"e_1_3_3_2_20_2","doi-asserted-by":"crossref","unstructured":"Shenghai Yuan Jinfa Huang Xianyi He Yunyuan Ge Yujun Shi Liuhan Chen Jiebo Luo and Li Yuan. 2025. Identity-Preserving Text-to-Video Generation by Frequency Decomposition. arxiv:https:\/\/arXiv.org\/abs\/2411.17440\u00a0[cs.CV] https:\/\/arxiv.org\/abs\/2411.17440","DOI":"10.32388\/TZIID6"},{"key":"e_1_3_3_2_21_2","unstructured":"Zangwei Zheng Xiangyu Peng Tianji Yang Chenhui Shen Shenggui Li Hongxin Liu Yukun Zhou Tianyi Li and Yang You. 2024. Open-Sora: Democratizing Efficient Video Production for All. arxiv:https:\/\/arXiv.org\/abs\/2412.20404\u00a0[cs.CV] https:\/\/arxiv.org\/abs\/2412.20404"},{"key":"e_1_3_3_2_22_2","unstructured":"Jinguo Zhu Weiyun Wang Zhe Chen Zhaoyang Liu Shenglong Ye Lixin Gu Hao Tian Yuchen Duan Weijie Su Jie Shao Zhangwei Gao Erfei Cui Xuehui Wang Yue Cao Yangzhou Liu Xingguang Wei Hongjie Zhang Haomin Wang Weiye Xu Hao Li Jiahao Wang Nianchen Deng Songze Li Yinan He Tan Jiang Jiapeng Luo Yi Wang Conghui He Botian Shi Xingcheng Zhang Wenqi Shao Junjun He Yingtong Xiong Wenwen Qu Peng Sun Penglong Jiao Han Lv Lijun Wu Kaipeng Zhang Huipeng Deng Jiaye Ge Kai Chen Limin Wang Min Dou Lewei Lu Xizhou Zhu Tong Lu Dahua Lin Yu Qiao Jifeng Dai and Wenhai Wang. 2025. InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models. arxiv:https:\/\/arXiv.org\/abs\/2504.10479\u00a0[cs.CV] https:\/\/arxiv.org\/abs\/2504.10479"}],"event":{"name":"ICMR '26: International Conference on Multimedia Retrieval","location":"Amsterdam The Netherlands","acronym":"ICMR '26","sponsor":["SIGMM ACM Special Interest Group on Multimedia"]},"container-title":["Proceedings of the 2026 International Conference on Multimedia Retrieval"],"original-title":[],"deposited":{"date-parts":[[2026,6,15]],"date-time":"2026-06-15T14:45:14Z","timestamp":1781534714000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3805622.3810431"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,6,15]]},"references-count":21,"alternative-id":["10.1145\/3805622.3810431","10.1145\/3805622"],"URL":"https:\/\/doi.org\/10.1145\/3805622.3810431","relation":{},"subject":[],"published":{"date-parts":[[2026,6,15]]},"assertion":[{"value":"2026-06-15","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}