{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,17]],"date-time":"2026-07-17T15:16:13Z","timestamp":1784301373162,"version":"3.55.0"},"reference-count":71,"publisher":"IEEE","license":[{"start":{"date-parts":[[2025,5,19]],"date-time":"2025-05-19T00:00:00Z","timestamp":1747612800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2025,5,19]],"date-time":"2025-05-19T00:00:00Z","timestamp":1747612800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Science Foundation of China","doi-asserted-by":"publisher","award":["12471501"],"award-info":[{"award-number":["12471501"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025,5,19]]},"DOI":"10.1109\/icra55743.2025.11128074","type":"proceedings-article","created":{"date-parts":[[2025,9,2]],"date-time":"2025-09-02T17:28:56Z","timestamp":1756834136000},"page":"10838-10845","source":"Crossref","is-referenced-by-count":6,"title":["Scaling Diffusion Policy in Transformer to 1 Billion Parameters for Robotic Manipulation"],"prefix":"10.1109","author":[{"given":"Minjie","family":"Zhu","sequence":"first","affiliation":[{"name":"School of Computer Science, East China Normal University,China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yichen","family":"Zhu","sequence":"additional","affiliation":[{"name":"Midea Group, AI Research Center,China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jinming","family":"Li","sequence":"additional","affiliation":[{"name":"School of Future Technology, Shanghai University,China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Junjie","family":"Wen","sequence":"additional","affiliation":[{"name":"School of Computer Science, East China Normal University,China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zhiyuan","family":"Xu","sequence":"additional","affiliation":[{"name":"Beijing Innovation Center of Humanoid Robotics,China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Ning","family":"Liu","sequence":"additional","affiliation":[{"name":"Midea Group, AI Research Center,China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Ran","family":"Cheng","sequence":"additional","affiliation":[{"name":"Midea Group, AI Research Center,China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Chaomin","family":"Shen","sequence":"additional","affiliation":[{"name":"School of Computer Science, East China Normal University,China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yaxin","family":"Peng","sequence":"additional","affiliation":[{"name":"School of Future Technology, Shanghai University,China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Feifei","family":"Feng","sequence":"additional","affiliation":[{"name":"Midea Group, AI Research Center,China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jian","family":"Tang","sequence":"additional","affiliation":[{"name":"Beijing Innovation Center of Humanoid Robotics,China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","first-page":"6840","article-title":"Denoising diffusion probabilistic models","volume":"33","author":"Ho","year":"2020","journal-title":"Advances in neural information processing systems"},{"key":"ref2","article-title":"Denoising diffusion implicit models","author":"Song","year":"2020","journal-title":"arXiv preprint arXiv"},{"key":"ref3","article-title":"Classifier-free diffusion guidance","author":"Ho","year":"2022","journal-title":"arXiv preprint arXiv"},{"key":"ref4","first-page":"36479","article-title":"Photorealistic text-to-image diffusion models with deep language understanding","volume":"35","author":"Saharia","year":"2022","journal-title":"Advances in neural information processing systems"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2023.3285241"},{"key":"ref6","volume-title":"Video generation models as world simulators","author":"Brooks","year":"2024"},{"key":"ref7","article-title":"Imagen video: High definition video generation with diffusion models","author":"Ho","year":"2022","journal-title":"arXiv preprint arXiv"},{"key":"ref8","article-title":"Dreamflow: High-quality text-to-3d generation by approximating probability flow","volume-title":"The Twelfth International Conference on Learning Representations","author":"Lee","year":"2024"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2023.XIX.026"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2024.XX.071"},{"key":"ref11","article-title":"Discrete policy: Learning disentangled action space for multi-task robotic manipulation","author":"Wu","year":"2024","journal-title":"arXiv preprint arXiv"},{"key":"ref12","article-title":"Llama 2: Open foundation and fine-tuned chat models","author":"Touvron","year":"2023","journal-title":"arXiv preprint arXiv"},{"key":"ref13","first-page":"7480","article-title":"Scaling vision transformers to 22 billion parameters","volume-title":"International Conference on Machine Learning","author":"Dehghani","year":"2023"},{"key":"ref14","first-page":"3766","article-title":"Scaling up and distilling down: Language-guided robot skill acquisition","volume-title":"Conference on Robot Learning","author":"Ha","year":"2023"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01179"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.48550\/ARXIV.1706.03762"},{"key":"ref17","article-title":"An image is worth $16 \\times 16$ words: Transformers for image recognition at scale","volume-title":"International Conference on Learning Representations","author":"Dosovitskiy","year":"2021"},{"key":"ref18","article-title":"Scaling laws for neural language models","author":"Kaplan","year":"2020","journal-title":"arXiv preprint arXiv"},{"key":"ref19","first-page":"1094","article-title":"Meta-world: A benchmark and evaluation for multi-task and meta reinforcement learning","volume-title":"Conference on robot learning","author":"Yu","year":"2020"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00453"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01042"},{"key":"ref22","article-title":"Policy representation via diffusion probability model for reinforcement learning","author":"Yang","year":"2023","journal-title":"arXiv preprint arXiv"},{"key":"ref23","article-title":"Value function estimation using conditional diffusion models for control","author":"Mazoure","year":"2023","journal-title":"arXiv preprint arXiv"},{"key":"ref24","article-title":"Edgi: Equivariant diffusion for planning with embodied agents","volume":"36","author":"Brehmer","year":"2024","journal-title":"Advances in Neural Information Processing Systems"},{"key":"ref25","article-title":"Reasoning with latent diffusion in offline reinforcement learning","author":"Venkatraman","year":"2023","journal-title":"arXiv preprint arXiv"},{"key":"ref26","article-title":"Refining diffusion planner for reliable behavior synthesis by automatic detection of infeasible plans","volume":"36","author":"Lee","year":"2024","journal-title":"Advances in Neural Information Processing Systems"},{"key":"ref27","article-title":"Adaptive online replanning with diffusion models","volume":"36","author":"Zhou","year":"2024","journal-title":"Advances in Neural Information Processing Systems"},{"key":"ref28","article-title":"Offline reinforcement learning via high-fidelity generative behavior modeling","author":"Chen","year":"2022","journal-title":"arXiv preprint arXiv"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1109\/LRA.2023.3259681"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2024.XX.120"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2024.XX.051"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2024.XX.121"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2024.XX.067"},{"key":"ref34","article-title":"Octo: An open-source generalist robot policy","author":"Team","year":"2024","journal-title":"arXiv preprint arXiv"},{"key":"ref35","article-title":"Unifying diffusion models with action detection transformers for multi-task robotic manipulation","volume-title":"7th Annual Conference on Robot Learning","author":"Xian","year":"2023"},{"key":"ref36","first-page":"284","article-title":"Gnfactor: Multi-task real robot learning with generalizable neural feature fields","volume-title":"Conference on Robot Learning","author":"Ze","year":"2023"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2023.XIX.028"},{"key":"ref38","article-title":"Imitating human behaviour with diffusion models","author":"Pearce","year":"2023","journal-title":"arXiv preprint arXiv"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1109\/LRA.2023.3259681"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.01703"},{"key":"ref41","article-title":"Movie: Visual model-based policy adaptation for view generalization","volume":"36","author":"Yang","year":"2024","journal-title":"Advances in Neural Information Processing Systems"},{"key":"ref42","article-title":"Learning a diffusion model policy from rewards via q-score matching","author":"Psenka","year":"2023","journal-title":"arXiv preprint arXiv"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-72946-1_27"},{"key":"ref44","article-title":"H-index: Visual reinforcement learning with hand-informed representations for dexterous manipulation","volume":"36","author":"Ze","year":"2024","journal-title":"Advances in Neural Information Processing Systems"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA48891.2023.10161569"},{"key":"ref46","article-title":"Shelving, stacking, hanging: Relational pose diffusion for multi-modal rearrangement","author":"Simeonov","year":"2023","journal-title":"arXiv preprint arXiv"},{"key":"ref47","article-title":"Learning score-based grasping primitive for human-assisting dexterous grasping","volume":"36","author":"Wu","year":"2024","journal-title":"Advances in Neural Information Processing Systems"},{"key":"ref48","article-title":"Tinyvla: Towards fast, data-efficient vision-language-action models for robotic manipulation","author":"Wen","year":"2024","journal-title":"arXiv preprint arXiv"},{"key":"ref49","first-page":"144","article-title":"Language-guided traffic simulation via scene-level diffusion","volume-title":"Conference on Robot Learning","author":"Zhong","year":"2023"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-72992-8_22"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1145\/3688863.3689575"},{"key":"ref52","article-title":"Structdiffusion: Object-centric diffusion for semantic rearrangement of novel objects","volume-title":"Workshop on Language and Robotics at CoRL 2022","author":"Liu","year":"2022"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.1109\/icra57147.2024.10610519"},{"key":"ref54","article-title":"Denoising heat-inspired diffusion with insulators for collision free motion planning","author":"Chang","year":"2023","journal-title":"arXiv preprint arXiv"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA57147.2024.10609992"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA57147.2024.10611525"},{"key":"ref57","article-title":"Carp: Visuomotor policy learning via coarse-to-fine autoregressive prediction","author":"Gong","year":"2024","journal-title":"arXiv preprint arXiv"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-72652-1_21"},{"key":"ref59","article-title":"Swbt: Similarity weighted behavior transformer with the imperfect demonstration for robotic manipulation","author":"Wu","year":"2024","journal-title":"arXiv preprint arXiv"},{"key":"ref60","article-title":"Score and distribution matching policy: Advanced accelerated visuomotor policies via matched distillation","author":"Jia","year":"2024","journal-title":"arXiv preprint arXiv"},{"key":"ref61","article-title":"Robomind: Benchmark on multi-embodiment intelligence normative data for robot manipulation","author":"Wu","year":"2024","journal-title":"arXiv preprint arXiv"},{"key":"ref62","article-title":"Robocodex: Multimodal code generation for robotic behavior synthesis","author":"Mu","year":"2024","journal-title":"arXiv preprint arXiv"},{"key":"ref63","article-title":"Embodiedgpt: Vision-language pre-training via embodied chain of thought","volume":"36","author":"Mu","year":"2024","journal-title":"Advances in Neural Information Processing Systems"},{"key":"ref64","first-page":"681","article-title":"Bayesian learning via stochastic gradient langevin dynamics","volume-title":"Proceedings of the 28th international conference on machine learning (ICML-11)","author":"Welling","year":"2011"},{"key":"ref65","first-page":"26982","article-title":"Penalizing gradient norm for efficiently improving generalization in deep learning","volume-title":"International Conference on Machine Learning","author":"Zhao","year":"2022"},{"key":"ref66","first-page":"810","article-title":"Towards better generalization of adaptive gradient methods","volume":"33","author":"Zhou","year":"2020","journal-title":"Advances in Neural Information Processing Systems"},{"key":"ref67","first-page":"141","article-title":"How does loss function affect generalization performance of deep learning? application to human age estimation","volume-title":"Proceedings of the 38th International Conference on Machine Learning, ser. Proceedings of Machine Learning Research","volume":"139","author":"Akbari"},{"key":"ref68","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00387"},{"key":"ref69","article-title":"Large scale gan training for high fidelity natural image synthesis","author":"Brock","year":"2018","journal-title":"arXiv preprint arXiv"},{"key":"ref70","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2023.XIX.016"},{"key":"ref71","first-page":"1332","article-title":"Masked world models for visual control","volume-title":"Conference on Robot Learning","author":"Seo","year":"2023"}],"event":{"name":"2025 IEEE International Conference on Robotics and Automation (ICRA)","location":"Atlanta, GA, USA","start":{"date-parts":[[2025,5,19]]},"end":{"date-parts":[[2025,5,23]]}},"container-title":["2025 IEEE International Conference on Robotics and Automation (ICRA)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/11127273\/11127223\/11128074.pdf?arnumber=11128074","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,9,3]],"date-time":"2025-09-03T06:12:25Z","timestamp":1756879945000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11128074\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,5,19]]},"references-count":71,"URL":"https:\/\/doi.org\/10.1109\/icra55743.2025.11128074","relation":{},"subject":[],"published":{"date-parts":[[2025,5,19]]}}}