{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,11]],"date-time":"2026-06-11T21:25:08Z","timestamp":1781213108636,"version":"3.54.1"},"reference-count":57,"publisher":"IEEE","license":[{"start":{"date-parts":[[2025,10,19]],"date-time":"2025-10-19T00:00:00Z","timestamp":1760832000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2025,10,19]],"date-time":"2025-10-19T00:00:00Z","timestamp":1760832000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/501100001809","name":"Natural Science Foundation of China","doi-asserted-by":"publisher","award":["LD24F020008"],"award-info":[{"award-number":["LD24F020008"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100012166","name":"National Key Research and Development Project of China","doi-asserted-by":"publisher","award":["2023YFB4301804"],"award-info":[{"award-number":["2023YFB4301804"]}],"id":[{"id":"10.13039\/501100012166","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025,10,19]]},"DOI":"10.1109\/iccv51701.2025.02683","type":"proceedings-article","created":{"date-parts":[[2026,4,29]],"date-time":"2026-04-29T19:45:49Z","timestamp":1777491949000},"page":"28892-28902","source":"Crossref","is-referenced-by-count":3,"title":["Authentic 4D Driving Simulation with a Video Generation Model"],"prefix":"10.1109","author":[{"given":"Lening","family":"Wang","sequence":"first","affiliation":[{"name":"Beihang University,State Key Lab of Intelligent Transportation System"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Wenzhao","family":"Zheng","sequence":"additional","affiliation":[{"name":"Tsinghua University,Department of Automation"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Dalong","family":"Du","sequence":"additional","affiliation":[{"name":"PhiGent Robotics"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yunpeng","family":"Zhang","sequence":"additional","affiliation":[{"name":"PhiGent Robotics"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yilong","family":"Ren","sequence":"additional","affiliation":[{"name":"Beihang University,State Key Lab of Intelligent Transportation System"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Han","family":"Jiang","sequence":"additional","affiliation":[{"name":"Beihang University,State Key Lab of Intelligent Transportation System"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zhiyong","family":"Cui","sequence":"additional","affiliation":[{"name":"Beihang University,State Key Lab of Intelligent Transportation System"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Haiyang","family":"Yu","sequence":"additional","affiliation":[{"name":"Beihang University,State Key Lab of Intelligent Transportation System"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jie","family":"Zhou","sequence":"additional","affiliation":[{"name":"Tsinghua University,Department of Automation"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Shanghang","family":"Zhang","sequence":"additional","affiliation":[{"name":"School of Computer Science, Peking University,State Key Laboratory of Multimedia Information Processing"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","article-title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","author":"Blattmann","year":"2023","journal-title":"arXiv preprint arXiv"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.01164"},{"key":"ref3","article-title":"nuplan: A closed-loop ml-based planning benchmark for autonomous vehicles","author":"Caesar","year":"2021","journal-title":"arXiv preprint arXiv"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.02121"},{"key":"ref5","article-title":"S-nerf++: Autonomous driving simulation via neural reconstruction and generation","author":"Chen","year":"2024","journal-title":"arXiv preprint arXiv"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2023.3261988"},{"key":"ref7","first-page":"1","article-title":"Carla: An open urban driving simulator","volume-title":"Conference on robot learning","author":"Dosovitskiy"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1038\/s41586-023-05732-2"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.01154"},{"key":"ref10","article-title":"Magicdrive: Street view generation with diverse 3d geometry control","volume":"2","author":"Gao","year":"2023","journal-title":"arXiv preprint arXiv"},{"key":"ref11","article-title":"Magicdrive3d: Controllable 3d generation for any-view rendering in street scenes","author":"Gao","year":"2024","journal-title":"arXiv preprint arXiv"},{"key":"ref12","article-title":"Vista: A generalizable driving world model with high fidelity and versatile controllability","volume":"2","author":"Gao","year":"2024","journal-title":"arXiv preprint arXiv"},{"key":"ref13","first-page":"51830","article-title":"Aligning optimization trajectories with diffusion models for constrained design generation","volume":"36","author":"Giannone","year":"2023","journal-title":"NeurIPS"},{"key":"ref14","first-page":"27","article-title":"Generative adversarial nets","author":"Goodfellow","year":"2014","journal-title":"NeurIPS"},{"key":"ref15","first-page":"30","article-title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium","author":"Heusel","year":"2017","journal-title":"NeurIPS"},{"key":"ref16","article-title":"Gaia-1: A generative world model for autonomous driving","author":"Hu","year":"2023","journal-title":"arXiv preprint arXiv"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19839-7_31"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01712"},{"key":"ref19","article-title":"s3 gaussian: Self-supervised street gaussians for autonomous driving","volume":"2","author":"Huang","year":"2024","journal-title":"arXiv preprint arXiv"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.02060"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00766"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.02073"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1145\/3592433"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00576"},{"key":"ref25","article-title":"Controllable text-to-image generation","volume":"32","author":"Li","year":"2019","journal-title":"NeurIPS"},{"key":"ref26","first-page":"129","article-title":"Controlnet ++: Improving conditional controls with efficient consistency feedback","volume-title":"ECCV","author":"Li","year":"2025"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-20077-9_1"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1109\/CVPRW63382.2024.00449"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00302"},{"key":"ref30","article-title":"Decoupled weight decay regularization","author":"Loshchilov","year":"2017","journal-title":"arXiv preprint arXiv"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-72989-8_19"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1145\/3503250"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00387"},{"key":"ref34","first-page":"8821","volume-title":"Zero-shot text-to-image generation","author":"Ramesh","year":"2021"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01042"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00298"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.01432"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00252"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.01411"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1007\/s00542-018-4164-z"},{"key":"ref41","article-title":"Freevs: Generative view synthesis on free driving trajectory","author":"Wang","year":"2024","journal-title":"arXiv preprint arXiv"},{"key":"ref42","article-title":"Drivedreamer: Towards real-worlddriven world models for autonomous driving","author":"Wang","year":"2023","journal-title":"arXiv preprint arXiv"},{"key":"ref43","article-title":"Editable scene simulation for autonomous driving via collaborative 11 m agents","author":"Wei","year":"2024","journal-title":"CVPR"},{"key":"ref44","first-page":"315","article-title":"Mars: An instance-aware, modular and realistic simulator for autonomous driving","volume-title":"CAAI International Conference on Artificial Intelligence","author":"Wu"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-72952-2_23"},{"key":"ref46","first-page":"15869","article-title":"Diffsketcher: Text guided vector sketch synthesis through latent diffusion models","volume":"36","author":"Xing","year":"2023","journal-title":"NeurIPS"},{"key":"ref47","article-title":"Street gaussians for modeling dynamic urban scenes","volume":"6","author":"Yan","year":"2024","journal-title":"arXiv preprint arXiv"},{"key":"ref48","article-title":"Emernerf: Emergent spatial-temporal scene decomposition via self-supervision","author":"Yang","year":"2023","journal-title":"arXiv preprint arXiv"},{"key":"ref49","article-title":"Drivearena: A closed-loop generative simulation platform for autonomous driving","author":"Yang","year":"2024","journal-title":"arXiv preprint arXiv"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1109\/tpami.2025.3613256"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00355"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00068"},{"key":"ref53","article-title":"Beverse: Unified perception and prediction in birds-eye-view for vision-centric autonomous driving","author":"Zhang","year":"2022","journal-title":"arXiv preprint arXiv"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52734.2025.01122"},{"key":"ref55","first-page":"36","article-title":"Uni-controlnet: All-in-one control to text-to-image diffusion models","author":"Zhao","year":"2024","journal-title":"NeurIPS"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-72624-8_4"},{"key":"ref57","article-title":"Simgen: Simulator-conditioned driving scene generation","author":"Zhou","year":"2024","journal-title":"arXiv preprint arXiv"}],"event":{"name":"2025 IEEE\/CVF International Conference on Computer Vision (ICCV)","location":"Honolulu, HI, USA","start":{"date-parts":[[2025,10,19]]},"end":{"date-parts":[[2025,10,25]]}},"container-title":["2025 IEEE\/CVF International Conference on Computer Vision (ICCV)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/11443115\/11443287\/11445304.pdf?arnumber=11445304","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,5,1]],"date-time":"2026-05-01T05:18:43Z","timestamp":1777612723000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11445304\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,10,19]]},"references-count":57,"URL":"https:\/\/doi.org\/10.1109\/iccv51701.2025.02683","relation":{},"subject":[],"published":{"date-parts":[[2025,10,19]]}}}