{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,4]],"date-time":"2026-05-04T10:00:13Z","timestamp":1777888813165,"version":"3.51.4"},"reference-count":79,"publisher":"IEEE","license":[{"start":{"date-parts":[[2025,10,19]],"date-time":"2025-10-19T00:00:00Z","timestamp":1760832000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2025,10,19]],"date-time":"2025-10-19T00:00:00Z","timestamp":1760832000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/100000001","name":"NSF","doi-asserted-by":"publisher","award":["2404386,2441250"],"award-info":[{"award-number":["2404386,2441250"]}],"id":[{"id":"10.13039\/100000001","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025,10,19]]},"DOI":"10.1109\/iccv51701.2025.00507","type":"proceedings-article","created":{"date-parts":[[2026,4,29]],"date-time":"2026-04-29T19:45:49Z","timestamp":1777491949000},"page":"5337-5347","source":"Crossref","is-referenced-by-count":0,"title":["Learning 4D Embodied World Models"],"prefix":"10.1109","author":[{"given":"Haoyu","family":"Zhen","sequence":"first","affiliation":[{"name":"UMass Amherst"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Qiao","family":"Sun","sequence":"additional","affiliation":[{"name":"UMass Amherst"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Hongxin","family":"Zhang","sequence":"additional","affiliation":[{"name":"UMass Amherst"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Junyan","family":"Li","sequence":"additional","affiliation":[{"name":"UMass Amherst"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Siyuan","family":"Zhou","sequence":"additional","affiliation":[{"name":"HKUST"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yilun","family":"Du","sequence":"additional","affiliation":[{"name":"Harvard University"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Chuang","family":"Gan","sequence":"additional","affiliation":[{"name":"UMass Amherst"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1146\/annurev-control-060117-105140"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.00911"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.00764"},{"key":"ref4","article-title":"Dynamic Programming and Optimal Control","author":"Bertsekas","year":"1995","journal-title":"Athena Scientific"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.15607\/rss.2023.xix.025"},{"key":"ref6","article-title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","author":"Brohan","year":"2023","journal-title":"arXiv preprint"},{"key":"ref7","article-title":"Genie: Generative interactive environments","volume-title":"Forty-first International Conference on Machine Learning","author":"Bruce","year":"2024"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19769-7_32"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.01370"},{"key":"ref10","article-title":"Transdreamer: Reinforcement learning with transformer world models","author":"Chen","year":"2022","journal-title":"arXiv preprint"},{"key":"ref11","article-title":"Recurrent environment simulators","author":"Chiappa","year":"2017","journal-title":"arXiv preprint"},{"key":"ref12","article-title":"Palm-e: An embodied multi-modal language model","author":"Driess","year":"2023","journal-title":"arXiv preprint"},{"key":"ref13","article-title":"Video language planning","author":"Du","year":"2023","journal-title":"arXiv preprint"},{"key":"ref14","article-title":"Learning universal policies via text-guided video generation","author":"Du","year":"2024","journal-title":"Advances in Neural Information Processing Systems, 36"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-03641-5_20"},{"key":"ref16","first-page":"162","article-title":"Metrics for finite markov decision processes","author":"Ferns","year":"2004","journal-title":"UAI"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1177\/02783649241281508"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-72670-5_14"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.622"},{"key":"ref20","article-title":"Generating executable action plans with environmentally-aware language models","author":"Gramopadhye","year":"2022","journal-title":"arXiv preprint"},{"key":"ref21","article-title":"Recurrent world models facilitate policy evolution","author":"Ha","year":"2018","journal-title":"Advances in Neural Information Processing Systems. Curran Associates, Inc."},{"key":"ref22","article-title":"Mastering atari with discrete world models","volume-title":"International Conference on Learning Representations","author":"Hafner","year":"2021"},{"key":"ref23","first-page":"6840","article-title":"Denoising diffusion probabilistic models","volume":"33","author":"Ho","year":"2020","journal-title":"Advances in neural information processing systems"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.52202\/075280-0900"},{"key":"ref25","article-title":"An embodied generalist agent in 3d world","author":"Huang","year":"2023","journal-title":"arXiv preprint"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1109\/LRA.2020.2974707"},{"key":"ref27","first-page":"991","article-title":"Bc-z: Zero-shot task generalization with robotic imitation learning","volume-title":"Conference on Robot Learning","author":"Jang","year":"2022"},{"key":"ref28","article-title":"Planning with diffusion for flexible behavior synthesis","author":"Janner","year":"2022","journal-title":"arXiv preprint"},{"issue":"3","key":"ref29","article-title":"Vima: General robot manipulation with multi-modal prompts","volume":"2","author":"Jiang","year":"2022","journal-title":"arXiv preprint"},{"key":"ref30","article-title":"Consistent4d: Consistent 360\\{\\backslash deg}\\} dynamic object generation from monocular video","author":"Jiang","year":"2023","journal-title":"arXiv preprint"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52734.2025.00678"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.00907"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1145\/3592433"},{"key":"ref34","article-title":"Openvla: An open-source vision-language-action model","author":"Jin Kim","year":"2024","journal-title":"arXiv preprint"},{"key":"ref35","article-title":"Auto-encoding variational bayes","author":"Kingma","year":"2013","journal-title":"arXiv preprint"},{"key":"ref36","volume-title":"Aesthetic predictor","year":"2022"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1016\/j.neunet.2018.07.006"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.52202\/068431-2262"},{"key":"ref39","article-title":"Dreamitate: Real-world visuomotor policy learning via video generation","author":"Liang","year":"2024","journal-title":"arXiv preprint"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.00819"},{"key":"ref41","volume-title":"Modeling of dynamic systems","author":"Ljung","year":"1994"},{"key":"ref42","article-title":"Transformers are sample efficient world models","author":"Micheli","year":"2022","journal-title":"arXiv preprint"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1145\/3503250"},{"key":"ref44","article-title":"Point-e: A system for generating 3d point clouds from complex prompts","author":"Nichol","year":"2022","journal-title":"arXiv preprint"},{"key":"ref45","year":"2023","journal-title":"Video generation models as world simulators"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00387"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2024.XX.133"},{"key":"ref48","article-title":"Pointnet++: Deep hierarchical feature learning on point sets in a metric space","volume":"30","author":"Ruizhongtai Qi","year":"2017","journal-title":"Advances in neural information processing systems"},{"key":"ref49","first-page":"8748","article-title":"Learning transferable visual models from natural language supervision","volume-title":"International conference on machine learning","author":"Radford","year":"2021"},{"key":"ref50","article-title":"Planning with large language models via corrective re-prompting","author":"Sundara Raman","year":"2022","journal-title":"arXiv preprint"},{"key":"ref51","article-title":"Dreamgaussian4d: Generative 4d gaussian splatting","author":"Ren","year":"2023","journal-title":"arXiv preprint"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01042"},{"key":"ref53","article-title":"Text-to-4d dynamic scene generation","author":"Singer","year":"2023","journal-title":"arXiv preprint"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1145\/122344.122377"},{"key":"ref55","article-title":"Aether: Geometric-aware unified world modeling","author":"Team","year":"2025","journal-title":"arXiv preprint"},{"key":"ref56","volume-title":"Open X-Embodiment: Robotic learning datasets and RT-X m odels","year":"2023"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58536-5_24"},{"key":"ref58","article-title":"Neural discrete representation learning","volume":"30","author":"Van","year":"2017","journal-title":"Advances in neural information processing systems"},{"key":"ref59","article-title":"Bridgedata v2: A dataset for robot learning at scale","volume-title":"Conference on Robot Learning (CoRL)","author":"Walke","year":"2023"},{"key":"ref60","article-title":"Shape of motion: 4d reconstruction from a single video","author":"Wang","year":"2024","journal-title":"arXiv preprint"},{"key":"ref61","article-title":"Describe, explain, plan and select: interactive planning with 11 ms enables open-world multi-task agents","volume-title":"Thirty-seventh Conference on Neural Information Processing Systems","author":"Wang","year":"2023"},{"key":"ref62","article-title":"Pandora: Towards general world model with natural language actions and video states","author":"Xiang","year":"2024","journal-title":"arXiv preprint"},{"key":"ref63","article-title":"Sv4d: Dynamic 3d content generation with multi-frame and multi-view consistency","author":"Xie","year":"2024","journal-title":"arXiv preprint"},{"key":"ref64","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00057"},{"key":"ref65","article-title":"Learning interactive real-world simulators","author":"Yang","year":"2023","journal-title":"arXiv preprint"},{"key":"ref66","article-title":"Foundation models for decision making: Problems, methods, and opportunities","author":"Yang","year":"2023","journal-title":"arXiv preprint"},{"key":"ref67","article-title":"Cogvideox: Text-to-video diffusion models with an expert transformer","author":"Yang","year":"2024","journal-title":"arXiv preprint"},{"key":"ref68","doi-asserted-by":"publisher","DOI":"10.1145\/3687971"},{"key":"ref69","article-title":"4dgen: Grounded 4d content generation with spatial-temporal consistency","author":"Yin","year":"2023","journal-title":"arXiv preprint"},{"key":"ref70","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52734.2025.00555"},{"key":"ref71","article-title":"Building cooperative embodied agents modularly with large language models","author":"Zhang","year":"2023","journal-title":"arXiv preprint"},{"key":"ref72","article-title":"Combo: Compositional world models for embodied multiagent cooperation","author":"Zhang","year":"2024","journal-title":"arXiv preprint"},{"key":"ref73","article-title":"Animate124: Animating one image to 4d dynamic scene","author":"Zhao","year":"2023","journal-title":"arXiv preprint"},{"key":"ref74","article-title":"3d-vla: A 3d vision-language-action generative world model","author":"Zhen","year":"2024","journal-title":"arXiv preprint"},{"key":"ref75","author":"Zheng","year":"2024","journal-title":"Open-sora: Democratizing efficient video production for all"},{"key":"ref76","volume-title":"clip-score: CLIP Score for PyTorch","author":"Zhengwentai","year":"2023"},{"key":"ref77","article-title":"Robodreamer: Learning compositional world models for robot imagination","author":"Zhou","year":"2024","journal-title":"arXiv preprint"},{"key":"ref78","article-title":"Irasim: Learning interactive realrobot action simulators","author":"Zhu","year":"2024","journal-title":"arXiv preprint"},{"issue":"6","key":"ref79","first-page":"551","article-title":"Adaptive control of linear time-invariant systems","volume":"9","author":"\u00c5str\u00f6m","year":"1973","journal-title":"Automatica"}],"event":{"name":"2025 IEEE\/CVF International Conference on Computer Vision (ICCV)","location":"Honolulu, HI, USA","start":{"date-parts":[[2025,10,19]]},"end":{"date-parts":[[2025,10,25]]}},"container-title":["2025 IEEE\/CVF International Conference on Computer Vision (ICCV)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/11443115\/11443287\/11446006.pdf?arnumber=11446006","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,5,1]],"date-time":"2026-05-01T04:57:43Z","timestamp":1777611463000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11446006\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,10,19]]},"references-count":79,"URL":"https:\/\/doi.org\/10.1109\/iccv51701.2025.00507","relation":{},"subject":[],"published":{"date-parts":[[2025,10,19]]}}}