{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,12,12]],"date-time":"2025-12-12T06:16:19Z","timestamp":1765520179431,"version":"3.48.0"},"reference-count":31,"publisher":"IEEE","license":[{"start":{"date-parts":[[2025,10,19]],"date-time":"2025-10-19T00:00:00Z","timestamp":1760832000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2025,10,19]],"date-time":"2025-10-19T00:00:00Z","timestamp":1760832000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025,10,19]]},"DOI":"10.1109\/iros60139.2025.11246734","type":"proceedings-article","created":{"date-parts":[[2025,11,27]],"date-time":"2025-11-27T18:54:45Z","timestamp":1764269685000},"page":"14163-14169","source":"Crossref","is-referenced-by-count":0,"title":["STAGE: A Stream-Centric Generative World Model for Long-Horizon Driving-Scene Simulation"],"prefix":"10.1109","author":[{"given":"Jiamin","family":"Wang","sequence":"first","affiliation":[{"name":"ShanghaiTech University,Shanghai,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yichen","family":"Yao","sequence":"additional","affiliation":[{"name":"ShanghaiTech University,Shanghai,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xiang","family":"Feng","sequence":"additional","affiliation":[{"name":"ShanghaiTech University,Shanghai,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Hang","family":"Wu","sequence":"additional","affiliation":[{"name":"Yinwang Intelligent Technology Co. Ltd."}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yaming","family":"Wang","sequence":"additional","affiliation":[{"name":"Yinwang Intelligent Technology Co. Ltd."}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Qingqiu","family":"Huang","sequence":"additional","affiliation":[{"name":"Yinwang Intelligent Technology Co. Ltd."}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yuexin","family":"Ma","sequence":"additional","affiliation":[{"name":"ShanghaiTech University,Shanghai,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xinge","family":"Zhu","sequence":"additional","affiliation":[{"name":"Yinwang Intelligent Technology Co. Ltd."}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"issue":"1","key":"ref1","first-page":"1","article-title":"A path towards autonomous machine intelligence version 0.9. 2, 2022-06-27","volume":"62","author":"LeCun","year":"2022","journal-title":"Open Review"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/TIV.2024.3398357"},{"article-title":"Magicdrivedit: High-resolution long video generation for autonomous driving with adaptive control","year":"2024","author":"Gao","key":"ref3"},{"key":"ref4","article-title":"Magicdrive: Street view generation with diverse 3d geometry control","author":"Gao","year":"2024","journal-title":"ICLR"},{"key":"ref5","first-page":"91560","article-title":"Vista: A generalizable driving world model with high fidelity and versatile controllability","volume":"37","author":"Gao","year":"2025","journal-title":"NIPS"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.01397"},{"key":"ref7","article-title":"Glad: A streaming scene generator for autonomous driving","author":"Xie","year":"2025","journal-title":"ICLR"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52734.2025.00245"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v38i5.28253"},{"article-title":"Bevcontrol: Accurately controlling street-view elements with multi-perspective consistency via bev sketch layout","year":"2023","author":"Yang","key":"ref10"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/LRA.2024.3368234"},{"article-title":"Gaia-1: A generative world model for autonomous driving","year":"2023","author":"Hu","key":"ref12"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.01389"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-73195-2_4"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-73229-4_27"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.00659"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00387"},{"article-title":"Dreamforge: Motion-aware autoregressive video generation for multi-view driving scenes","volume-title":"ECCV Workshop","author":"Mei","key":"ref18"},{"article-title":"Latent video diffusion models for high-fidelity long video generation","year":"2022","author":"He","key":"ref19"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.acl-long.73"},{"key":"ref21","article-title":"Generating long videos of dynamic scenes","author":"Brooks","year":"2022","journal-title":"NeurIPS"},{"key":"ref22","article-title":"Fifo-diffusion: Generating infinite videos from text without training","author":"Kim","year":"2024","journal-title":"NeurIPS"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01042"},{"journal-title":"ICLR","article-title":"Geodiffusion: Text-prompted geometric control for object detection data generation","author":"Chen","key":"ref24"},{"key":"ref25","first-page":"20703","article-title":"Model-based imitation learning for urban driving","volume":"35","author":"Hu","year":"2022","journal-title":"NIPS"},{"key":"ref26","first-page":"26565","article-title":"Elucidating the design space of diffusion-based generative models","volume":"35","author":"Karras","year":"2022","journal-title":"NIPS"},{"author":"Unterthiner","key":"ref27","article-title":"Towards accurate generative models of video: A new metric & challenges"},{"key":"ref28","first-page":"6629","article-title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium","author":"Heusel","year":"2017","journal-title":"NeurIPS"},{"article-title":"Videogpt: Video generation using vq-vae and transformers","year":"2021","author":"Yan","key":"ref29"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.308"},{"article-title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","year":"2023","author":"Blattmann","key":"ref31"}],"event":{"name":"2025 IEEE\/RSJ International Conference on Intelligent Robots and Systems (IROS)","start":{"date-parts":[[2025,10,19]]},"location":"Hangzhou, China","end":{"date-parts":[[2025,10,25]]}},"container-title":["2025 IEEE\/RSJ International Conference on Intelligent Robots and Systems (IROS)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/11245651\/11245652\/11246734.pdf?arnumber=11246734","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,12,12]],"date-time":"2025-12-12T06:13:04Z","timestamp":1765519984000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11246734\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,10,19]]},"references-count":31,"URL":"https:\/\/doi.org\/10.1109\/iros60139.2025.11246734","relation":{},"subject":[],"published":{"date-parts":[[2025,10,19]]}}}