{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,18]],"date-time":"2026-07-18T15:41:16Z","timestamp":1784389276199,"version":"3.55.0"},"publisher-location":"New York, NY, USA","reference-count":76,"publisher":"ACM","content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2025,10,27]]},"DOI":"10.1145\/3746027.3755111","type":"proceedings-article","created":{"date-parts":[[2025,10,25]],"date-time":"2025-10-25T07:30:51Z","timestamp":1761377451000},"page":"9753-9762","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":1,"title":["DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0009-0001-7931-4285","authenticated-orcid":false,"given":"Xiaofan","family":"Li","sequence":"first","affiliation":[{"name":"Baidu Inc., Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-8012-1547","authenticated-orcid":false,"given":"Chenming","family":"Wu","sequence":"additional","affiliation":[{"name":"Baidu Inc., Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0000-5169-3669","authenticated-orcid":false,"given":"Zhao","family":"Yang","sequence":"additional","affiliation":[{"name":"Baidu Inc., Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0004-2814-6543","authenticated-orcid":false,"given":"Zhihao","family":"Xu","sequence":"additional","affiliation":[{"name":"Baidu Inc., Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-0174-4824","authenticated-orcid":false,"given":"Yumeng","family":"Zhang","sequence":"additional","affiliation":[{"name":"Baidu Inc., Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3035-1373","authenticated-orcid":false,"given":"Dingkang","family":"Liang","sequence":"additional","affiliation":[{"name":"Baidu Inc., Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-1761-352X","authenticated-orcid":false,"given":"Ji","family":"Wan","sequence":"additional","affiliation":[{"name":"Baidu Inc., Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-6619-1669","authenticated-orcid":false,"given":"Jun","family":"Wang","sequence":"additional","affiliation":[{"name":"Baidu Inc., Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"320","published-online":{"date-parts":[[2025,10,27]]},"reference":[{"key":"e_1_3_2_1_1_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00175"},{"key":"e_1_3_2_1_2_1","unstructured":"Andreas Blattmann Tim Dockhorn Sumith Kulal Daniel Mendelevitch Maciej Kilian Dominik Lorenz Yam Levi Zion English Vikram Voleti Adam Letts et al. 2023. Stable video diffusion: Scaling latent video diffusion models to large datasets. arXiv preprint arXiv:2311.15127 (2023)."},{"key":"e_1_3_2_1_3_1","volume-title":"Muvo: A multimodal generative world model for autonomous driving with geometric representations. arXiv preprint arXiv:2311.11762","author":"Bogdoll Daniel","year":"2023","unstructured":"Daniel Bogdoll, Yitian Yang, and J Marius Z\u00f6llner. 2023. Muvo: A multimodal generative world model for autonomous driving with geometric representations. arXiv preprint arXiv:2311.11762 (2023)."},{"key":"e_1_3_2_1_4_1","volume-title":"Video generation models as world simulators. https:\/\/openai.com\/index\/video-generation-models-as-world-simulators\/","author":"Brooks Tim","year":"2024","unstructured":"Tim Brooks, Bill Peebles, Connor Holmes, Will DePue, Yufei Guo, Li Jing, David Schnurr, Joe Taylor, Troy Luhman, Eric Luhman, Clarence Ng, Ricky Wang, and Aditya Ramesh. 2024. Video generation models as world simulators. https:\/\/openai.com\/index\/video-generation-models-as-world-simulators\/ (2024). https:\/\/openai.com\/research\/video-generation-models-as-world-simulators"},{"key":"e_1_3_2_1_5_1","volume-title":"Qiang Xu, Anush Krishnan, Yu Pan, Giancarlo Baldan, and Oscar Beijbom.","author":"Caesar Holger","year":"2020","unstructured":"Holger Caesar, Varun Bankiti, Alex H Lang, Sourabh Vora, Venice Erin Liong, Qiang Xu, Anush Krishnan, Yu Pan, Giancarlo Baldan, and Oscar Beijbom. 2020. nuscenes: A multimodal dataset for autonomous driving. 11621-11631."},{"key":"e_1_3_2_1_6_1","doi-asserted-by":"publisher","DOI":"10.1145\/3664647.3681214"},{"key":"e_1_3_2_1_7_1","unstructured":"Haoxin Chen Menghan Xia Yingqing He Yong Zhang Xiaodong Cun Shaoshu Yang Jinbo Xing Yaofang Liu Qifeng Chen Xintao Wang Chao Weng and Ying Shan. 2023d. VideoCrafter1: Open Diffusion Models for High-Quality Video Generation. arXiv:2310.19512 [cs.CV]"},{"key":"e_1_3_2_1_8_1","volume-title":"Hung-Yu Tseng, Tsung-Yi Lin, and Ming-Hsuan Yang.","author":"Chen Tsai-Shien","year":"2023","unstructured":"Tsai-Shien Chen, Chieh Hubert Lin, Hung-Yu Tseng, Tsung-Yi Lin, and Ming-Hsuan Yang. 2023a. Motion-Conditioned Diffusion Model for Controllable Video Synthesis. arXiv preprint arXiv:2304.14404 (2023)."},{"key":"e_1_3_2_1_9_1","volume-title":"Control-A-Video: Controllable Text-to-Video Generation with Diffusion Models. arXiv preprint arXiv:2305.13840","author":"Chen Weifeng","year":"2023","unstructured":"Weifeng Chen, Jie Wu, Pan Xie, Hefeng Wu, Jiashi Li, Xin Xia, Xuefeng Xiao, and Liang Lin. 2023c. Control-A-Video: Controllable Text-to-Video Generation with Diffusion Models. arXiv preprint arXiv:2305.13840 (2023)."},{"key":"e_1_3_2_1_10_1","volume-title":"The Twelfth International Conference on Learning Representations.","author":"Chen Xinyuan","year":"2023","unstructured":"Xinyuan Chen, Yaohui Wang, Lingjun Zhang, Shaobin Zhuang, Xin Ma, Jiashuo Yu, Yali Wang, Dahua Lin, Yu Qiao, and Ziwei Liu. 2023b. Seine: Short-to-long video diffusion model for generative transition and prediction. In The Twelfth International Conference on Learning Representations."},{"key":"e_1_3_2_1_11_1","volume-title":"Drivinggpt: Unifying driving world modeling and planning with multi-modal autoregressive transformers. arXiv preprint arXiv:2412.18607","author":"Chen Yuntao","year":"2024","unstructured":"Yuntao Chen, Yuqi Wang, and Zhaoxiang Zhang. 2024a. Drivinggpt: Unifying driving world modeling and planning with multi-modal autoregressive transformers. arXiv preprint arXiv:2412.18607 (2024)."},{"key":"e_1_3_2_1_12_1","volume-title":"Structure and Content-Guided Video Synthesis with Diffusion Models. arXiv preprint arXiv:2302.03011","author":"Esser Patrick","year":"2023","unstructured":"Patrick Esser, Johnathan Chiu, Parmida Atighehchian, Jonathan Granskog, and Anastasis Germanidis. 2023. Structure and Content-Guided Video Synthesis with Diffusion Models. arXiv preprint arXiv:2302.03011 (2023)."},{"key":"e_1_3_2_1_13_1","volume-title":"Magicdrive: Street view generation with diverse 3d geometry control. arXiv preprint arXiv:2310.02601","author":"Gao Ruiyuan","year":"2023","unstructured":"Ruiyuan Gao, Kai Chen, Enze Xie, Lanqing Hong, Zhenguo Li, Dit-Yan Yeung, and Qiang Xu. 2023. Magicdrive: Street view generation with diverse 3d geometry control. arXiv preprint arXiv:2310.02601 (2023)."},{"key":"e_1_3_2_1_14_1","volume-title":"Vista: A generalizable driving world model with high fidelity and versatile controllability","author":"Gao Shenyuan","year":"2024","unstructured":"Shenyuan Gao, Jiazhi Yang, Li Chen, Kashyap Chitta, Yihang Qiu, Andreas Geiger, Jun Zhang, and Hongyang Li. 2024. Vista: A generalizable driving world model with high fidelity and versatile controllability, Vol. 37. 91560-91596."},{"key":"e_1_3_2_1_15_1","volume-title":"Imagine-2-Drive: High-Fidelity World Modeling in CARLA for Autonomous Vehicles. arXiv preprint arXiv:2411.10171","author":"Garg Anant","year":"2024","unstructured":"Anant Garg and K Madhava Krishna. 2024. Imagine-2-Drive: High-Fidelity World Modeling in CARLA for Autonomous Vehicles. arXiv preprint arXiv:2411.10171 (2024)."},{"key":"e_1_3_2_1_16_1","doi-asserted-by":"publisher","DOI":"10.1145\/3664647.3681488"},{"key":"e_1_3_2_1_17_1","volume-title":"DOME: Taming Diffusion Model into High-Fidelity Controllable Occupancy World Model. arXiv preprint arXiv:2410.10429","author":"Gu Songen","year":"2024","unstructured":"Songen Gu, Wei Yin, Bu Jin, Xiaoyang Guo, Junming Wang, Haodong Li, Qian Zhang, and Xiaoxiao Long. 2024. DOME: Taming Diffusion Model into High-Fidelity Controllable Occupancy World Model. arXiv preprint arXiv:2410.10429 (2024)."},{"key":"e_1_3_2_1_18_1","doi-asserted-by":"crossref","unstructured":"Yanchen Guan Haicheng Liao Zhenning Li Jia Hu Runze Yuan Yunjian Li Guohui Zhang and Chengzhong Xu. 2024. World models for autonomous driving: An initial survey. (2024).","DOI":"10.1109\/TIV.2024.3398357"},{"key":"e_1_3_2_1_19_1","volume-title":"InfinityDrive: Breaking Time Limits in Driving World Models. arXiv preprint arXiv:2412.01522","author":"Guo Xi","year":"2024","unstructured":"Xi Guo, Chenjing Ding, Haoxuan Dou, Xin Zhang, Weixuan Tang, and Wei Wu. 2024. InfinityDrive: Breaking Time Limits in Driving World Models. arXiv preprint arXiv:2412.01522 (2024)."},{"key":"e_1_3_2_1_20_1","volume-title":"Sparsectrl: Adding sparse controls to text-to-video diffusion models. arXiv preprint arXiv:2311.16933","author":"Guo Yuwei","year":"2023","unstructured":"Yuwei Guo, Ceyuan Yang, Anyi Rao, Maneesh Agrawala, Dahua Lin, and Bo Dai. 2023. Sparsectrl: Adding sparse controls to text-to-video diffusion models. arXiv preprint arXiv:2311.16933 (2023)."},{"key":"e_1_3_2_1_21_1","volume-title":"Photorealistic video generation with diffusion models. arXiv preprint arXiv:2312.06662","author":"Gupta Agrim","year":"2023","unstructured":"Agrim Gupta, Lijun Yu, Kihyuk Sohn, Xiuye Gu, Meera Hahn, Li Fei-Fei, Irfan Essa, Lu Jiang, and Jos\u00e9 Lezama. 2023. Photorealistic video generation with diffusion models. arXiv preprint arXiv:2312.06662 (2023)."},{"key":"e_1_3_2_1_22_1","unstructured":"David Ha and J\u00fcrgen Schmidhuber. 2018. World models."},{"key":"e_1_3_2_1_23_1","volume-title":"Cameractrl: Enabling camera control for text-to-video generation. arXiv preprint arXiv:2404.02101","author":"He Hao","year":"2024","unstructured":"Hao He, Yinghao Xu, Yuwei Guo, Gordon Wetzstein, Bo Dai, Hongsheng Li, and Ceyuan Yang. 2024. Cameractrl: Enabling camera control for text-to-video generation. arXiv preprint arXiv:2404.02101 (2024)."},{"key":"e_1_3_2_1_24_1","volume-title":"Latent video diffusion models for high-fidelity video generation with arbitrary lengths. arXiv preprint arXiv:2211.13221","author":"He Yingqing","year":"2022","unstructured":"Yingqing He, Tianyu Yang, Yong Zhang, Ying Shan, and Qifeng Chen. 2022. Latent video diffusion models for high-fidelity video generation with arbitrary lengths. arXiv preprint arXiv:2211.13221 (2022)."},{"key":"e_1_3_2_1_25_1","volume-title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium","author":"Heusel Martin","unstructured":"Martin Heusel, Hubert Ramsauer, Thomas Unterthiner, Bernhard Nessler, and Sepp Hochreiter. 2017. Gans trained by a two time-scale update rule converge to a local nash equilibrium, Vol. 30."},{"key":"e_1_3_2_1_26_1","first-page":"6840","article-title":"Denoising diffusion probabilistic models","volume":"33","author":"Ho Jonathan","year":"2020","unstructured":"Jonathan Ho, Ajay Jain, and Pieter Abbeel. 2020. Denoising diffusion probabilistic models. Advances in Neural Information Processing Systems, Vol. 33 (2020), 6840-6851.","journal-title":"Advances in Neural Information Processing Systems"},{"key":"e_1_3_2_1_27_1","volume-title":"Video diffusion models. arXiv:2204.03458","author":"Ho Jonathan","year":"2022","unstructured":"Jonathan Ho, Tim Salimans, Alexey Gritsenko, William Chan, Mohammad Norouzi, and David J Fleet. 2022. Video diffusion models. arXiv:2204.03458 (2022)."},{"key":"e_1_3_2_1_28_1","volume-title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers. arXiv preprint arXiv:2205.15868","author":"Hong Wenyi","year":"2022","unstructured":"Wenyi Hong, Ming Ding, Wendi Zheng, Xinghan Liu, and Jie Tang. 2022. CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers. arXiv preprint arXiv:2205.15868 (2022)."},{"key":"e_1_3_2_1_29_1","volume-title":"Gaia-1: A generative world model for autonomous driving. arXiv preprint arXiv:2309.17080","author":"Hu Anthony","year":"2023","unstructured":"Anthony Hu, Lloyd Russell, Hudson Yeo, Zak Murez, George Fedoseev, Alex Kendall, Jamie Shotton, and Gianluca Corrado. 2023b. Gaia-1: A generative world model for autonomous driving. arXiv preprint arXiv:2309.17080 (2023)."},{"key":"e_1_3_2_1_30_1","volume-title":"Lora: Low-rank adaptation of large language models. arXiv preprint arXiv:2106.09685","author":"Hu Edward J","year":"2021","unstructured":"Edward J Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen. 2021. Lora: Low-rank adaptation of large language models. arXiv preprint arXiv:2106.09685 (2021)."},{"key":"e_1_3_2_1_31_1","volume-title":"Animate anyone: Consistent and controllable image-to-video synthesis for character animation. arXiv preprint arXiv:2311.17117","author":"Hu Li","year":"2023","unstructured":"Li Hu, Xin Gao, Peng Zhang, Ke Sun, Bang Zhang, and Liefeng Bo. 2023a. Animate anyone: Consistent and controllable image-to-video synthesis for character animation. arXiv preprint arXiv:2311.17117 (2023)."},{"key":"e_1_3_2_1_32_1","volume-title":"DrivingWorld: ConstructingWorld Model for Autonomous Driving via Video GPT. arXiv preprint arXiv:2412.19505","author":"Hu Xiaotao","year":"2024","unstructured":"Xiaotao Hu, Wei Yin, Mingkai Jia, Junyuan Deng, Xiaoyang Guo, Qian Zhang, Xiaoxiao Long, and Ping Tan. 2024. DrivingWorld: ConstructingWorld Model for Autonomous Driving via Video GPT. arXiv preprint arXiv:2412.19505 (2024)."},{"key":"e_1_3_2_1_33_1","volume-title":"Adriver-i: A general world model for autonomous driving. arXiv preprint arXiv:2311.13549","author":"Jia Fan","year":"2023","unstructured":"Fan Jia, Weixin Mao, Yingfei Liu, Yucheng Zhao, Yuqing Wen, Chi Zhang, Xiangyu Zhang, and Tiancai Wang. 2023a. Adriver-i: A general world model for autonomous driving. arXiv preprint arXiv:2311.13549 (2023)."},{"key":"e_1_3_2_1_34_1","volume-title":"Adriver-i: A general world model for autonomous driving. arXiv preprint arXiv:2311.13549","author":"Jia Fan","year":"2023","unstructured":"Fan Jia, Weixin Mao, Yingfei Liu, Yucheng Zhao, Yuqing Wen, Chi Zhang, Xiangyu Zhang, and Tiancai Wang. 2023b. Adriver-i: A general world model for autonomous driving. arXiv preprint arXiv:2311.13549 (2023)."},{"key":"e_1_3_2_1_35_1","volume-title":"Dive: Dit-based video generation with enhanced control. arXiv preprint arXiv:2409.01595","author":"Jiang Junpeng","year":"2024","unstructured":"Junpeng Jiang, Gangyi Hong, Lijun Zhou, Enhui Ma, Hengtong Hu, Xia Zhou, Jie Xiang, Fan Liu, Kaicheng Yu, Haiyang Sun, et al., 2024. Dive: Dit-based video generation with enhanced control. arXiv preprint arXiv:2409.01595 (2024)."},{"key":"e_1_3_2_1_36_1","volume-title":"Proc. arXiv:2410","author":"Karaev Nikita","year":"2024","unstructured":"Nikita Karaev, Iurii Makarov, Jianyuan Wang, Natalia Neverova, Andrea Vedaldi, and Christian Rupprecht. 2024. CoTracker3: Simpler and Better Point Tracking by Pseudo-Labelling Real Videos. In Proc. arXiv:2410.11831."},{"key":"e_1_3_2_1_37_1","volume-title":"Proceedings of the IEEE\/CVF International Conference on Computer Vision. 22680-22690","author":"Karras Johanna","year":"2023","unstructured":"Johanna Karras, Aleksander Holynski, Ting-Chun Wang, and Ira Kemelmacher-Shlizerman. 2023. DreamPose: Fashion Video Synthesis with Stable Diffusion. In Proceedings of the IEEE\/CVF International Conference on Computer Vision. 22680-22690."},{"key":"e_1_3_2_1_38_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.01462"},{"key":"e_1_3_2_1_39_1","volume-title":"Drivegan: Towards a controllable high-quality neural simulation. 5820-5829.","author":"Kim Seung Wook","year":"2021","unstructured":"Seung Wook Kim, Jonah Philion, Antonio Torralba, and Sanja Fidler. 2021. Drivegan: Towards a controllable high-quality neural simulation. 5820-5829."},{"key":"e_1_3_2_1_40_1","volume-title":"Videopoet: A large language model for zero-shot video generation. arXiv preprint arXiv:2312.14125","author":"Kondratyuk Dan","year":"2023","unstructured":"Dan Kondratyuk, Lijun Yu, Xiuye Gu, Jos\u00e9 Lezama, Jonathan Huang, Rachel Hornung, Hartwig Adam, Hassan Akbari, Yair Alon, Vighnesh Birodkar, et al., 2023. Videopoet: A large language model for zero-shot video generation. arXiv preprint arXiv:2312.14125 (2023)."},{"key":"e_1_3_2_1_41_1","volume-title":"DrivingDiffusion: Layout-Guided Multi-view Driving Scenarios Video Generation with Latent Diffusion Model","author":"Li Xiaofan","unstructured":"Xiaofan Li, Yifu Zhang, and Xiaoqing Ye. 2024. DrivingDiffusion: Layout-Guided Multi-view Driving Scenarios Video Generation with Latent Diffusion Model. Springer, 469-485."},{"key":"e_1_3_2_1_42_1","volume-title":"Wovogen: World volume-aware diffusion for controllable multi-camera driving scene generation","author":"Lu Jiachen","year":"2024","unstructured":"Jiachen Lu, Ze Huang, Zeyu Yang, Jiahui Zhang, and Li Zhang. 2024. Wovogen: World volume-aware diffusion for controllable multi-camera driving scene generation. Springer, 329-345."},{"key":"e_1_3_2_1_43_1","volume-title":"Latte: Latent diffusion transformer for video generation. arXiv preprint arXiv:2401.03048","author":"Ma Xin","year":"2024","unstructured":"Xin Ma, Yaohui Wang, Gengyun Jia, Xinyuan Chen, Ziwei Liu, Yuan-Fang Li, Cunjian Chen, and Yu Qiao. 2024. Latte: Latent diffusion transformer for video generation. arXiv preprint arXiv:2401.03048 (2024)."},{"key":"e_1_3_2_1_44_1","doi-asserted-by":"crossref","unstructured":"Chen Min Dawei Zhao Liang Xiao Jian Zhao Xinli Xu Zheng Zhu Lei Jin Jianshu Li Yulan Guo Junliang Xing et al. 2024. Driveworld: 4d pre-trained scene understanding via world models for autonomous driving. 15522-15533.","DOI":"10.1109\/CVPR52733.2024.01470"},{"key":"e_1_3_2_1_45_1","doi-asserted-by":"publisher","DOI":"10.1109\/TRO.2015.2463671"},{"key":"e_1_3_2_1_46_1","volume-title":"Scalable Diffusion Models with Transformers. arXiv preprint arXiv:2212.09748","author":"Peebles Geoffrey","year":"2022","unstructured":"Geoffrey Peebles and Saining Xie. 2022. Scalable Diffusion Models with Transformers. arXiv preprint arXiv:2212.09748 (2022)."},{"key":"e_1_3_2_1_47_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00387"},{"key":"e_1_3_2_1_48_1","unstructured":"Ryan Po Wang Yifan and Vladislav Golyanik et al. 2023. Compositional 3D Scene Generation using Locally Conditioned Diffusion. In ArXiv."},{"key":"e_1_3_2_1_49_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01042"},{"key":"e_1_3_2_1_50_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00985"},{"key":"e_1_3_2_1_51_1","volume-title":"Denoising diffusion implicit models. arXiv preprint arXiv:2010.02502","author":"Song Jiaming","year":"2020","unstructured":"Jiaming Song, Chenlin Meng, and Stefano Ermon. 2020. Denoising diffusion implicit models. arXiv preprint arXiv:2010.02502 (2020)."},{"key":"e_1_3_2_1_52_1","doi-asserted-by":"crossref","unstructured":"Pei Sun Henrik Kretzschmar Xerxes Dotiwalla Aurelien Chouard Vijaysai Patnaik Paul Tsui James Guo Yin Zhou Yuning Chai Benjamin Caine et al. 2020. Scalability in perception for autonomous driving: Waymo open dataset. 2446-2454.","DOI":"10.1109\/CVPR42600.2020.00252"},{"key":"e_1_3_2_1_53_1","volume-title":"FVD: A new metric for video generation. https:\/\/openreview.net\/forum?id=rylgEULtdN","author":"Unterthiner Thomas","year":"2019","unstructured":"Thomas Unterthiner, Sjoerd van Steenkiste, Karol Kurach, Rapha\u00ebl Marinier, Marcin Michalski, and Sylvain Gelly. 2019. FVD: A new metric for video generation. https:\/\/openreview.net\/forum?id=rylgEULtdN (2019)."},{"key":"e_1_3_2_1_54_1","volume-title":"Occsora: 4d occupancy generation models as world simulators for autonomous driving. arXiv preprint arXiv:2405.20337","author":"Wang Lening","year":"2024","unstructured":"Lening Wang, Wenzhao Zheng, Yilong Ren, Han Jiang, Zhiyong Cui, Haiyang Yu, and Jiwen Lu. 2024c. Occsora: 4d occupancy generation models as world simulators for autonomous driving. arXiv preprint arXiv:2405.20337 (2024)."},{"key":"e_1_3_2_1_55_1","volume-title":"DriveDreamer: Towards Real-World-Drive World Models for Autonomous Driving","author":"Wang Xiaofeng","unstructured":"Xiaofeng Wang, Zheng Zhu, Guan Huang, Xinze Chen, Jiagang Zhu, and Jiwen Lu. 2024d. DriveDreamer: Towards Real-World-Drive World Models for Autonomous Driving. Springer, 55-72."},{"key":"e_1_3_2_1_56_1","doi-asserted-by":"crossref","unstructured":"Xiaofeng Wang Zheng Zhu Guan Huang Xinze Chen Jiagang Zhu and Jiwen Lu. 2024 e. Drivedreamer: Towards real-world-driven world models for autonomous driving.","DOI":"10.1007\/978-3-031-73195-2_4"},{"key":"e_1_3_2_1_57_1","doi-asserted-by":"crossref","unstructured":"Yuqi Wang Jiawei He Lue Fan Hongxin Li Yuntao Chen and Zhaoxiang Zhang. 2024a. Driving into the future: Multiview visual forecasting and planning with world model for autonomous driving. 14749-14759.","DOI":"10.1109\/CVPR52733.2024.01397"},{"key":"e_1_3_2_1_58_1","doi-asserted-by":"crossref","unstructured":"Yuqi Wang Jiawei He Lue Fan Hongxin Li Yuntao Chen and Zhaoxiang Zhang. 2024b. Driving into the future: Multiview visual forecasting and planning with world model for autonomous driving. 14749-14759.","DOI":"10.1109\/CVPR52733.2024.01397"},{"key":"e_1_3_2_1_59_1","volume-title":"Motionctrl: A unified and flexible motion controller for video generation. arXiv preprint arXiv:2312.03641","author":"Wang Zhouxia","year":"2023","unstructured":"Zhouxia Wang, Ziyang Yuan, Xintao Wang, Tianshui Chen, Menghan Xia, Ping Luo, and Ying Shan. 2023. Motionctrl: A unified and flexible motion controller for video generation. arXiv preprint arXiv:2312.03641 (2023)."},{"key":"e_1_3_2_1_60_1","volume-title":"Wan: Open and Advanced Large-Scale Video Generative Models. arXiv preprint arXiv:2503.20314","author":"Wang Ang","year":"2025","unstructured":"WanTeam, Ang Wang, Baole Ai, Bin Wen, Chaojie Mao, Chen-Wei Xie, Di Chen, Feiwu Yu, Haiming Zhao, Jianxiao Yang, Jianyuan Zeng, Jiayu Wang, Jingfeng Zhang, Jingren Zhou, Jinkai Wang, Jixuan Chen, Kai Zhu, Kang Zhao, Keyu Yan, Lianghua Huang, Mengyang Feng, Ningyi Zhang, Pandeng Li, Pingyu Wu, Ruihang Chu, Ruili Feng, Shiwei Zhang, Siyang Sun, Tao Fang, Tianxing Wang, Tianyi Gui, Tingyu Weng, Tong Shen, Wei Lin, Wei Wang, Wei Wang, Wenmeng Zhou, Wente Wang, Wenting Shen, Wenyuan Yu, Xianzhong Shi, Xiaoming Huang, Xin Xu, Yan Kou, Yangyu Lv, Yifei Li, Yijing Liu, Yiming Wang, Yingya Zhang, Yitong Huang, Yong Li, You Wu, Yu Liu, Yulin Pan, Yun Zheng, Yuntao Hong, Yupeng Shi, Yutong Feng, Zeyinzi Jiang, Zhen Han, Zhi-Fan Wu, and Ziyu Liu. 2025. Wan: Open and Advanced Large-Scale Video Generative Models. arXiv preprint arXiv:2503.20314 (2025)."},{"key":"e_1_3_2_1_61_1","volume-title":"Panacea: Panoramic and controllable video generation for autonomous driving. 6902-6912.","author":"Wen Yuqing","year":"2024","unstructured":"Yuqing Wen, Yucheng Zhao, Yingfei Liu, Fan Jia, Yanhui Wang, Chong Luo, Chi Zhang, Tiancai Wang, Xiaoyan Sun, and Xiangyu Zhang. 2024a. Panacea: Panoramic and controllable video generation for autonomous driving. 6902-6912."},{"key":"e_1_3_2_1_62_1","volume-title":"Panacea: Panoramic and controllable video generation for autonomous driving. 6902-6912.","author":"Wen Yuqing","year":"2024","unstructured":"Yuqing Wen, Yucheng Zhao, Yingfei Liu, Fan Jia, Yanhui Wang, Chong Luo, Chi Zhang, Tiancai Wang, Xiaoyan Sun, and Xiangyu Zhang. 2024b. Panacea: Panoramic and controllable video generation for autonomous driving. 6902-6912."},{"key":"e_1_3_2_1_63_1","volume-title":"HoloDrive: Holistic 2D-3D Multi-Modal Street Scene Generation for Autonomous Driving. arXiv preprint arXiv:2412.01407","author":"Wu Zehuan","year":"2024","unstructured":"Zehuan Wu, Jingcheng Ni, Xiaodong Wang, Yuxin Guo, Rui Chen, Lewei Lu, Jifeng Dai, and Yuwen Xiong. 2024. HoloDrive: Holistic 2D-3D Multi-Modal Street Scene Generation for Autonomous Driving. arXiv preprint arXiv:2412.01407 (2024)."},{"key":"e_1_3_2_1_64_1","volume-title":"Hanshu Yan, Jia-Wei Liu, Chenxu Zhang, Jiashi Feng, and Mike Zheng Shou.","author":"Xu Zhongcong","year":"2023","unstructured":"Zhongcong Xu, Jianfeng Zhang, Jun Hao Liew, Hanshu Yan, Jia-Wei Liu, Chenxu Zhang, Jiashi Feng, and Mike Zheng Shou. 2023. Magicanimate: Temporally consistent human image animation using diffusion model. arXiv preprint arXiv:2311.16498 (2023)."},{"key":"e_1_3_2_1_65_1","doi-asserted-by":"crossref","unstructured":"Jiazhi Yang Shenyuan Gao Yihang Qiu Li Chen Tianyu Li Bo Dai Kashyap Chitta Penghao Wu Jia Zeng Ping Luo Jun Zhang Andreas Geiger Yu Qiao and Hongyang Li. 2024a. Generalized Predictive Model for Autonomous Driving.","DOI":"10.1109\/CVPR52733.2024.01389"},{"key":"e_1_3_2_1_66_1","volume-title":"Direct-a-Video: Customized Video Generation with User-Directed Camera Movement and Object Motion. arXiv preprint arXiv:2402.03162","author":"Yang Shiyuan","year":"2024","unstructured":"Shiyuan Yang, Liang Hou, Haibin Huang, Chongyang Ma, Pengfei Wan, Di Zhang, Xiaodong Chen, and Jing Liao. 2024c. Direct-a-Video: Customized Video Generation with User-Directed Camera Movement and Object Motion. arXiv preprint arXiv:2402.03162 (2024)."},{"key":"e_1_3_2_1_67_1","volume-title":"Physical Informed Driving World Model. arXiv preprint arXiv:2412.08410","author":"Yang Zhuoran","year":"2024","unstructured":"Zhuoran Yang, Xi Guo, Chenjing Ding, Chiyu Wang, and Wei Wu. 2024b. Physical Informed Driving World Model. arXiv preprint arXiv:2412.08410 (2024)."},{"key":"e_1_3_2_1_68_1","volume-title":"DualDiff: Dual-Branch Diffusion for High-Fidelity Video Generation with Reward Guidance. arXiv preprint arXiv:2503.03689","author":"Yang Zhao","year":"2025","unstructured":"Zhao Yang, Zezhong Qian, Xiaofan Li, Weixiang Xu, Gongpeng Zhao, Ruohong Yu, Lingsi Zhu, and Longjun Liu. 2025. DualDiff: Dual-Branch Diffusion for High-Fidelity Video Generation with Reward Guidance. arXiv preprint arXiv:2503.03689 (2025)."},{"key":"e_1_3_2_1_69_1","volume-title":"Cogvideox: Text-to-video diffusion models with an expert transformer. arXiv preprint arXiv:2408.06072","author":"Yang Zhuoyi","year":"2024","unstructured":"Zhuoyi Yang, Jiayan Teng, Wendi Zheng, Ming Ding, Shiyu Huang, Jiazheng Xu, Yuanming Yang, Wenyi Hong, Xiaohan Zhang, Guanyu Feng, et al., 2024d. Cogvideox: Text-to-video diffusion models with an expert transformer. arXiv preprint arXiv:2408.06072 (2024)."},{"key":"e_1_3_2_1_70_1","unstructured":"Jiahui Zhang Kangle Han Zhen Li Di He Hao Fan Yinpeng Wu Lei Zhou Ping Liu Jiaying Dong Dongdong Chen et al. 2023a. PixArt-\u03b1: A Powerful Text-to-Image Generation Foundation Model. arXiv preprint arXiv:2310.00426 (2023)."},{"key":"e_1_3_2_1_71_1","volume-title":"I2VGen-XL: High-Quality Image-to-Video Synthesis via Cascaded Diffusion Models. arXiv preprint arXiv:2311.04145","author":"Zhang Shiwei","year":"2023","unstructured":"Shiwei Zhang, Jiayu Wang, Yingya Zhang, Kang Zhao, Hangjie Yuan, Zhiwu Qin, Xiang Wang, Deli Zhao, and Jingren Zhou. 2023b. I2VGen-XL: High-Quality Image-to-Video Synthesis via Cascaded Diffusion Models. arXiv preprint arXiv:2311.04145 (2023)."},{"key":"e_1_3_2_1_72_1","volume-title":"Bevworld: A multimodal world model for autonomous driving via unified bev latent space. arXiv preprint arXiv:2407.05679","author":"Zhang Yumeng","year":"2024","unstructured":"Yumeng Zhang, Shi Gong, Kaixin Xiong, Xiaoqing Ye, Xiao Tan, Fan Wang, Jizhou Huang, Hua Wu, and Haifeng Wang. 2024. Bevworld: A multimodal world model for autonomous driving via unified bev latent space. arXiv preprint arXiv:2407.05679 (2024)."},{"key":"e_1_3_2_1_73_1","volume-title":"ControlVideo: Training-free Controllable Text-to-Video Generation. arXiv preprint arXiv:2305.13077","author":"Zhang Yabo","year":"2023","unstructured":"Yabo Zhang, Yuxiang Wei, Dongsheng Jiang, Xiaopeng Zhang, Wangmeng Zuo, and Qi Tian. 2023c. ControlVideo: Training-free Controllable Text-to-Video Generation. arXiv preprint arXiv:2305.13077 (2023)."},{"key":"e_1_3_2_1_74_1","volume-title":"Drivedreamer-2: Llm-enhanced world models for diverse driving video generation. arXiv preprint arXiv:2403.06845","author":"Zhao Guosheng","year":"2024","unstructured":"Guosheng Zhao, Xiaofeng Wang, Zheng Zhu, Xinze Chen, Guan Huang, Xiaoyi Bao, and Xingang Wang. 2024. Drivedreamer-2: Llm-enhanced world models for diverse driving video generation. arXiv preprint arXiv:2403.06845 (2024)."},{"key":"e_1_3_2_1_75_1","volume-title":"Occworld: Learning a 3d occupancy world model for autonomous driving","author":"Zheng Wenzhao","year":"2024","unstructured":"Wenzhao Zheng, Weiliang Chen, Yuanhui Huang, Borui Zhang, Yueqi Duan, and Jiwen Lu. 2024. Occworld: Learning a 3d occupancy world model for autonomous driving. Springer, 55-72."},{"key":"e_1_3_2_1_76_1","volume-title":"HERMES: A Unified Self-Driving World Model for Simultaneous 3D Scene Understanding and Generation. arXiv preprint arXiv:2501.14729","author":"Zhou Xin","year":"2025","unstructured":"Xin Zhou, Dingkang Liang, Sifan Tu, Xiwu Chen, Yikang Ding, Dingyuan Zhang, Feiyang Tan, Hengshuang Zhao, and Xiang Bai. 2025. HERMES: A Unified Self-Driving World Model for Simultaneous 3D Scene Understanding and Generation. arXiv preprint arXiv:2501.14729 (2025)."}],"event":{"name":"MM '25: The 33rd ACM International Conference on Multimedia","location":"Dublin Ireland","acronym":"MM '25","sponsor":["SIGMM ACM Special Interest Group on Multimedia"]},"container-title":["Proceedings of the 33rd ACM International Conference on Multimedia"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3746027.3755111","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,12,9]],"date-time":"2025-12-09T20:06:00Z","timestamp":1765310760000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3746027.3755111"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,10,27]]},"references-count":76,"alternative-id":["10.1145\/3746027.3755111","10.1145\/3746027"],"URL":"https:\/\/doi.org\/10.1145\/3746027.3755111","relation":{},"subject":[],"published":{"date-parts":[[2025,10,27]]},"assertion":[{"value":"2025-10-27","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}