{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,20]],"date-time":"2026-07-20T17:03:19Z","timestamp":1784566999317,"version":"3.55.0"},"reference-count":178,"publisher":"Springer Science and Business Media LLC","issue":"6","license":[{"start":{"date-parts":[[2026,5,31]],"date-time":"2026-05-31T00:00:00Z","timestamp":1780185600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2026,5,31]],"date-time":"2026-05-31T00:00:00Z","timestamp":1780185600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"funder":[{"DOI":"10.13039\/501100001381","name":"National Research Foundation Singapore","doi-asserted-by":"publisher","award":["AISG3-RP-2022-030"],"award-info":[{"award-number":["AISG3-RP-2022-030"]}],"id":[{"id":"10.13039\/501100001381","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Int J Comput Vis"],"published-print":{"date-parts":[[2026,6]]},"DOI":"10.1007\/s11263-026-02893-1","type":"journal-article","created":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T08:00:19Z","timestamp":1780300819000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["Diffusion Models in Robotics: A Survey"],"prefix":"10.1007","volume":"134","author":[{"given":"Xiaokang","family":"Liu","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Kevin Yuchen","family":"Ma","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Chen","family":"Gao","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Mike Zheng","family":"Shou","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2026,5,31]]},"reference":[{"key":"2893_CR1","unstructured":"Aburub, M., Beltran-Hernandez, C. C., Kamijo, T., & Hamaya, M. (2024). Learning diffusion policies from demonstrations for compliant contact-rich manipulation. arXiv:2410.19235."},{"key":"2893_CR2","unstructured":"Agarwal, N., Ali, A., Bala, M., Balaji, Y., Barker, E., Cai, T., Chattopadhyay, P., Chen, Y., Cui, Y., Ding, Y., et al. (2025). Cosmos world foundation model platform for physical AI. arXiv:2501.03575"},{"key":"2893_CR3","unstructured":"Agia, C., Sinha, R., Yang, J., Cao, Z- A., Antonova, R., Pavone, M., Bohg, J. (2024). Unpacking failure modes of generative policies: Runtime monitoring of consistency and progress. arXiv preprint arXiv:2410.04640"},{"key":"2893_CR4","unstructured":"Ajay, A., Du, Y., Gupta, A., Tenenbaum, J., Jaakkola, T., & Agrawal, P. (2022). Is conditional generative modeling all you need for decision-making? arXiv:2211.15657"},{"key":"2893_CR5","doi-asserted-by":"publisher","first-page":"22304","DOI":"10.52202\/075280-0979","volume":"36","author":"A Ajay","year":"2023","unstructured":"Ajay, A., Han, S., Du, Y., Li, S., Gupta, A., Jaakkola, T., & Agrawal, P. (2023). Compositional foundation models for hierarchical planning. Advances in Neural Information Processing Systems, 36, 22304\u201322325.","journal-title":"Advances in Neural Information Processing Systems"},{"issue":"2","key":"2893_CR6","doi-asserted-by":"publisher","first-page":"76","DOI":"10.1609\/aimag.v37i2.2651","volume":"37","author":"R Alterovitz","year":"2016","unstructured":"Alterovitz, R., Koenig, S., & Likhachev, M. (2016). Robot planning in the real world: Research challenges and opportunities. AI Magazine, 37(2), 76\u201384.","journal-title":"AI Magazine"},{"key":"2893_CR7","doi-asserted-by":"crossref","unstructured":"Ankile, L., Simeonov, A., Shenfeld, I., & Agrawal, P. (2024). Juicer: Data-efficient imitation learning for robotic assembly. arXiv:2404.03729","DOI":"10.1109\/IROS58592.2024.10802498"},{"key":"2893_CR8","unstructured":"Atreya, P., Pertsch, K., Lee, T., Kim, M.J., Jain, A., Kuramshin, A., Eppner, Clemens., Neary, C., Hu, E., Ramos, F., et al. (2025). Roboarena: Distributed real-world evaluation of generalist robot policies. arXiv:2506.18123"},{"key":"2893_CR9","doi-asserted-by":"crossref","unstructured":"Bao, C., Xu, H., Qin, Y., & Wang, X. (2023). Dexart: Benchmarking generalizable dexterous manipulation with articulated objects. In Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition (pp. 21190\u201321200)","DOI":"10.1109\/CVPR52729.2023.02030"},{"key":"2893_CR10","doi-asserted-by":"crossref","unstructured":"Bartsch, A., Car, A., Avra, C., & Farimani, A. B. (2024). Sculptdiff: Learning robotic clay sculpting from humans with goal conditioned diffusion policy. arXiv:2403.10401","DOI":"10.1109\/IROS58592.2024.10803054"},{"key":"2893_CR11","doi-asserted-by":"crossref","unstructured":"Bharadhwaj, H., Mottaghi, R., Gupta, A., & Tulsiani, S. (2024). Track2act: Predicting point tracks from internet videos enables generalizable robot manipulation. In European conference on computer vision (pp. 306\u2013324)","DOI":"10.1007\/978-3-031-73116-7_18"},{"key":"2893_CR12","doi-asserted-by":"crossref","unstructured":"Black, K., Brown, N., Driess, D., Esmail, A., Equi, M., Finn, C., Fusai, N., Groom, L., Hausman, K., Ichter, B., et al. (2024). $$\\pi _0$$: A vision-language-action flow model for general robot control. arXiv:2410.24164","DOI":"10.15607\/RSS.2025.XXI.010"},{"key":"2893_CR13","unstructured":"Brohan, A., Brown, N., Carbajal, J., Chebotar, Y., Chen, X., Choromanski, K.. Ding, T., Driess, D., Dubey, A., Finn, C., et al. (2023). Rt-2: Vision-language-action models transfer web knowledge to robotic control. arXiv:2307.15818"},{"key":"2893_CR14","doi-asserted-by":"crossref","unstructured":"Brohan, A., Brown, N., Carbajal, J., Chebotar, Y., Dabis, J., Finn, C., Gopalakrishnan, K., Hausman, K., Herzog, A., Hsu, J., et al. (2022). Rt-1: Robotics transformer for real-world control at scale. arXiv:2212.06817","DOI":"10.15607\/RSS.2023.XIX.025"},{"key":"2893_CR15","unstructured":"Bruce, J., Dennis, M. D., Edwards, A., Parker-Holder, J., Shi, Y., Hughes, E., Lai, M., Mavalankar, A., Steigerwald, R., & Apps, C., et al. (2024). Generative interactive environments. In Forty-first international conference on machine learning: Genie"},{"key":"2893_CR16","doi-asserted-by":"crossref","unstructured":"Bu, Q., Zeng, J., Chen, L., Yang, Y., Zhou, G., Yan, J., & Li, H. (2024). Closed-loop visuomotor control with generative expectation for robotic manipulation. arXiv:2409.09016","DOI":"10.52202\/079017-4411"},{"key":"2893_CR17","doi-asserted-by":"crossref","unstructured":"Cao, J., Zhang, Q., Sun, J., Wang, J., Cheng, H., Li, Y., Ma, J., Shao, Y., Zhao, W., Han, G., et al. (2024). Mamba policy: Towards efficient 3d diffusion policy with hybrid selective state models. arXiv:2409.07163","DOI":"10.1109\/IROS60139.2025.11247625"},{"key":"2893_CR18","doi-asserted-by":"crossref","unstructured":"Carvalho, J., Le, A. T., Baierl, M., Koert, D., & Peters, J. (2023). Motion planning diffusion: Learning and planning of robot motions with diffusion models. In IEEE\/RSJ international conference on intelligent robots and systems (IROS) (pp. 1916\u20131923)","DOI":"10.1109\/IROS55552.2023.10342382"},{"key":"2893_CR19","doi-asserted-by":"crossref","unstructured":"Chang, H., Boyalakuntla, K., Liu, Y., Zhang, X., Schramm, L., & Boularias, A. (2024). Dap: Diffusion-based affordance prediction for multi-modality storage. In IEEE\/RSJ international conference on intelligent robots and systems (IROS) (pp. 9476\u20139481)","DOI":"10.1109\/IROS58592.2024.10802575"},{"key":"2893_CR20","unstructured":"Chen, L., Bahl, S., & Pathak, D. (2023). Playfusion: Skill acquisition via diffusion from language-annotated play. In Conference on robot learning (pp. 2012\u20132029)"},{"key":"2893_CR21","doi-asserted-by":"crossref","unstructured":"Chen, Z., Kiami, S., Gupta, A., & Kumar, V. (2023). Genaug: Retargeting behaviors to unseen situations via generative augmentation. arXiv:2302.06671","DOI":"10.15607\/RSS.2023.XIX.010"},{"key":"2893_CR22","doi-asserted-by":"crossref","unstructured":"Chen, T., Mu, Y., Liang, Z., Chen, Z., Peng, S., Chen, Q., Xu, M., Hu, R., Zhang, H., Li, X., et al. (2024). G3flow: Generative 3d semantic flow for pose-aware and generalizable object manipulation. arXiv:2411.18369","DOI":"10.1109\/CVPR52734.2025.00169"},{"key":"2893_CR23","doi-asserted-by":"crossref","unstructured":"Chen, Y., Xue, H., Chen, Y. (2024). Diffusion policy attacker: Crafting adversarial attacks for diffusion-based policies. arXiv:2405.19424","DOI":"10.52202\/079017-3800"},{"key":"2893_CR24","doi-asserted-by":"crossref","unstructured":"Chen, Z., Chen, S., Arlaud, E., Laptev, I., & Schmid, C. (2024). Vividex: Learning vision-based dexterous manipulation from human videos arXiv:2404.15709.","DOI":"10.1109\/ICRA55743.2025.11127358"},{"key":"2893_CR25","doi-asserted-by":"publisher","first-page":"5150","DOI":"10.52202\/068431-0372","volume":"35","author":"Y Chen","year":"2022","unstructured":"Chen, Y., Wu, T., Wang, S., Feng, X., Jiang, J., Lu, Z., & Yang, Y. (2022). Towards human-level bimanual dexterous manipulation with reinforcement learning. Advances in Neural Information Processing Systems, 35, 5150\u20135163.","journal-title":"Advances in Neural Information Processing Systems"},{"key":"2893_CR26","unstructured":"Chisari, E., Heppert, N., Argus, M., Welschehold, T., Brox, T., & Valada, A. (2024). Learning robotic manipulation policies from point clouds with conditional flow matching. arXiv:2409.07343"},{"key":"2893_CR27","doi-asserted-by":"publisher","DOI":"10.1177\/02783649241273668","author":"C Chi","year":"2023","unstructured":"Chi, C., Xu, Z., Feng, S., Cousineau, E., Du, Y., Burchfiel, B., & Song, S. (2023). Diffusion policy: Visuomotor policy learning via action diffusion. The International Journal of Robotics Research. https:\/\/doi.org\/10.1177\/02783649241273668","journal-title":"The International Journal of Robotics Research"},{"key":"2893_CR28","unstructured":"Christiano, P. F., Leike, J., Brown, T., Martic, M., Legg, S., & Amodei, D. (2017). Deep reinforcement learning from human preferences. In Advances in neural information processing systems (p. 30)"},{"key":"2893_CR29","doi-asserted-by":"crossref","unstructured":"Ding, H., Jaquier, N., Peters, J., & Rozo, L. (2024). Fast and robust visuomotor riemannian flow matching policy. arXiv:2412.10855","DOI":"10.1109\/TRO.2025.3601293"},{"key":"2893_CR30","unstructured":"Du, Y., & Mordatch, I. (2019). Implicit generation and modeling with energy based models. In Advances in neural information processing systems (p. 32)"},{"key":"2893_CR31","unstructured":"Du, Y., Yang, M., Florence, P., Xia, F., Wahid, A., Ichter, B., Sermanet, P., Yu, T., Abbeel, P., Tenenbaum, J.B., et al. (2023). Video language planning. arXiv:2310.10625"},{"key":"2893_CR32","doi-asserted-by":"publisher","first-page":"9156","DOI":"10.52202\/075280-0403","volume":"36","author":"Y Du","year":"2023","unstructured":"Du, Y., Yang, S., Dai, B., Dai, H., Nachum, O., Tenenbaum, J., & Abbeel, P. (2023). Learning universal policies via text-guided video generation. Advances in Neural Information Processing Systems, 36, 9156\u20139172.","journal-title":"Advances in Neural Information Processing Systems"},{"key":"2893_CR33","doi-asserted-by":"crossref","unstructured":"Ebert, F., Yang, Y., Schmeckpeper, K., Bucher, B., Georgakis, G., Daniilidis, K., & Levine, S. (2021). Bridge data: Boosting generalization of robotic skills with cross-domain datasets. arXiv:2109.13396.","DOI":"10.15607\/RSS.2022.XVIII.063"},{"key":"2893_CR34","doi-asserted-by":"crossref","unstructured":"Fang, X., Garrett, C. R., Eppner, C., Lozano-P\u00e9rez, T., Kaelbling, L. P., & Fox, D. (2024). Dimsam: Diffusion models as samplers for task and motion planning under partial observability. In IEEE\/RSJ international conference on intelligent robots and systems (iros) (pp. 1412\u20131419)","DOI":"10.1109\/IROS58592.2024.10802746"},{"key":"2893_CR35","unstructured":"Funk, N., Urain, J., Carvalho, J., Prasad, V., Chalvatzaki, G., & Peters, J. (2024). Actionflow: Equivariant, accurate, and efficient policies with spatially symmetric flow matching. arXiv:2409.04576"},{"key":"2893_CR36","doi-asserted-by":"crossref","unstructured":"George, A., Gano, S., Katragadda, P., & Farimani, A. B. (2024). Vital pretraining: Visuo-tactile pretraining for tactile and non-tactile manipulation policies. arXiv:2403.11898","DOI":"10.1109\/ICRA55743.2025.11128336"},{"key":"2893_CR37","unstructured":"Gode, S., Nayak, A., & Burgard, W. (2024). Flownav: Learning efficient navigation policies via conditional flow matching. arXiv:2411.09524"},{"key":"2893_CR38","unstructured":"Goodfellow, I., Pouget-Abadie, J., Mirza, M., Xu, B., Warde-Farley, D., Ozair, S., & Bengio, Y. (2014). Generative adversarial nets. In Advances in neural information processing systems (p. 27)"},{"key":"2893_CR39","unstructured":"Gu, A., & Dao, T. (2023). Mamba: Linear-time sequence modeling with selective state spaces. arXiv:2312.00752"},{"issue":"4","key":"2893_CR40","doi-asserted-by":"publisher","first-page":"3313","DOI":"10.1109\/TKDE.2021.3130191","volume":"35","author":"J Gui","year":"2021","unstructured":"Gui, J., Sun, Z., Wen, Y., Tao, D., & Ye, J. (2021). A review on generative adversarial networks: Algorithms, theory, and applications. IEEE Transactions on Knowledge and Data Engineering, 35(4), 3313\u20133332.","journal-title":"IEEE Transactions on Knowledge and Data Engineering"},{"key":"2893_CR41","doi-asserted-by":"crossref","unstructured":"Guo, S. W., Hsiao, T. C., Liu, Y. L., & Lee, C. Y. (2024). Precise pick-and-place using score-based diffusion networks. In IEEE\/RSJ international conference on intelligent robots and systems (IROS) (pp. 7484\u20137491)","DOI":"10.1109\/IROS58592.2024.10801772"},{"key":"2893_CR42","unstructured":"Ha, H., Florence, P., & Song, S. (2023). Scaling up and distilling down: Language-guided robot skill acquisition. In Conference on robot learning (pp. 3766\u20133777)"},{"key":"2893_CR43","unstructured":"Ha, H., Gao, Y., Fu, Z., Tan, J., & Song, S. (2024). Umi on legs: Making manipulation policies mobile with manipulation-centric whole-body controllers. arXiv:2407.10353"},{"key":"2893_CR44","unstructured":"Hansen-Estruch, P., Kostrikov, I., Janner, M., Kuba, J. G., & Levine, S. (2023). Idql: Implicit q-learning as an actor-critic method with diffusion policies. arXiv:2304.10573"},{"key":"2893_CR45","doi-asserted-by":"crossref","unstructured":"Hao, C., Lin, K., Luo, S., & Soh, H. (2024). Language-guided manipulation with diffusion policies and constrained inpainting. arXiv:2406.09767","DOI":"10.1109\/LRA.2025.3595034"},{"key":"2893_CR46","doi-asserted-by":"crossref","unstructured":"Hatch, K.B., Balakrishna, A., Mees, O., Nair, S., Park, S., Wulfe, B., Itkina, M., Eysenbach, B., Levine, S., Kollar, T., et al. (2024). Ghil-glue: Hierarchical control with filtered subgoal images. arXiv:2410.20018","DOI":"10.1109\/ICRA55743.2025.11128025"},{"key":"2893_CR47","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., & Sun, J. (2016). Deep residual learning for image recognition. In Proceedings of the IEEE conference on computer vision and pattern recognition (pp. 770\u2013778)","DOI":"10.1109\/CVPR.2016.90"},{"key":"2893_CR48","doi-asserted-by":"crossref","unstructured":"Ho, D., Rao, K., Xu, Z., Jang, E., Khansari, M., & Bai, Y. (2021). Retinagan: An object-aware approach to sim-to-real transfer. In 2021 IEEE international conference on robotics and automation (ICRA) (pp. 10920\u201310926)","DOI":"10.1109\/ICRA48506.2021.9561157"},{"key":"2893_CR49","first-page":"6840","volume":"33","author":"J Ho","year":"2020","unstructured":"Ho, J., Jain, A., & Abbeel, P. (2020). Denoising diffusion probabilistic models. Advances in Neural Information Processing Systems, 33, 6840\u20136851.","journal-title":"Advances in Neural Information Processing Systems"},{"key":"2893_CR50","doi-asserted-by":"publisher","first-page":"8633","DOI":"10.52202\/068431-0628","volume":"35","author":"J Ho","year":"2022","unstructured":"Ho, J., Salimans, T., Gritsenko, A., Chan, W., Norouzi, M., & Fleet, D. J. (2022). Video diffusion models. Advances in Neural Information Processing Systems, 35, 8633\u20138646.","journal-title":"Advances in Neural Information Processing Systems"},{"key":"2893_CR51","unstructured":"Hou, Z., Gao, M., Yu, H., Yang, M., & Ieong, C. I. (2024). Sdp: Spiking diffusion policy for robotic manipulation with learnable channel-wise membrane thresholds. arXiv:2409.11195"},{"key":"2893_CR52","doi-asserted-by":"crossref","unstructured":"Hou, Y., Liu, Z., Chi, C., Cousineau, E., Kuppuswamy, N., Feng, S., & Song, S. (2024). Adaptive compliance policy: Learning approximate compliance for diffusion guided control. arXiv:2410.09309","DOI":"10.1109\/ICRA55743.2025.11128452"},{"key":"2893_CR53","doi-asserted-by":"crossref","unstructured":"Hou, Z., Zhang, T., Xiong, Y., Duan, H., Pu, H., Tong, R., Zhao, C., Zhu, X., Qiao, Y., Dai, J., et al. (2025). Dita: Scaling diffusion transformer for generalist vision-language-action policy. arXiv:2503.19757","DOI":"10.1109\/ICCV51701.2025.00721"},{"key":"2893_CR54","doi-asserted-by":"crossref","unstructured":"Hsu, C. C., Wen, B., Xu, J., Narang, Y., Wang, X., Zhu, Y., & Birchfield, S. (2024). Spot: Se (3) pose trajectory diffusion for object-centric manipulation. arXiv:2411.00965","DOI":"10.1109\/ICRA55743.2025.11127562"},{"key":"2893_CR55","unstructured":"Hu, Y., Guo, Y., Wang, P., Chen, X., Wang, Y- J., Zhang, J.. Chen, J. (2024). Video prediction policy: A generalist robot policy with predictive visual representations. arXiv:2412.14803"},{"key":"2893_CR56","unstructured":"Hu, Y., Lin, F., Zhang, T., Yi, L., & Gao, Y. (2023). Look before you leap: Unveiling the power of gpt-4v in robotic vision-language planning. arXiv:2311.17842"},{"key":"2893_CR57","doi-asserted-by":"crossref","unstructured":"Huang, T., Jiang, G., Ze, Y., & Xu, H. (2024). Diffusion reward: Learning rewards via conditional video diffusion. In European conference on computer vision (pp. 478\u2013495)","DOI":"10.1007\/978-3-031-72946-1_27"},{"key":"2893_CR58","doi-asserted-by":"crossref","unstructured":"Huang, Z., Lin, Y., Yang, F., & Berenson, D. (2024). Subgoal diffuser: Coarse-to-fine subgoal generation to guide model predictive control for robot manipulation. arXiv:2403.13085","DOI":"10.1109\/ICRA57147.2024.10610189"},{"key":"2893_CR59","unstructured":"Huang, H., Schmeckpeper, K., Wang, D., Biza, O., Qian, Y., Liu, H., & Walters, R. (2024). Imagination policy: Using generative point cloud models for learning manipulation policies. arXiv:2406.11740"},{"key":"2893_CR60","unstructured":"Huang, H., Sundaralingam, B., Mousavian, A., Murali, A., Goldberg, K., & Fox, D. (2024). Diffusionseeder: Seeding motion optimization with diffusion for rapid motion planning. arXiv:2410.16727"},{"key":"2893_CR61","unstructured":"Huang, B., Wang, Y., Yang, X., Luo, Y., & Li, Y. (2024). 3d-vitac: Learning fine-grained manipulation with visuo-tactile sensing. arXiv:2410.24091"},{"key":"2893_CR62","unstructured":"Huang, R., Liu, S., Pei, Y., Wang, P., Wang, G., Yang, Y., & Shen, H. (2024). Goal-reaching policy learning from non-expert observations via effective subgoal guidance arXiv:2409.03996."},{"issue":"4","key":"2893_CR63","doi-asserted-by":"publisher","first-page":"1278","DOI":"10.3390\/s21041278","volume":"21","author":"J Hua","year":"2021","unstructured":"Hua, J., Zeng, L., Li, G., & Ju, Z. (2021). Learning for a robot: Deep reinforcement learning, imitation learning, transfer learning. Sensors, 21(4), 1278.","journal-title":"Sensors"},{"key":"2893_CR64","doi-asserted-by":"crossref","unstructured":"Ikeda, T., Zakharov, S., Ko, T., Irshad, M. Z., Lee, R., Liu, K., & Nishiwaki, K. (2024). Diffusionnocs: Managing symmetry and uncertainty in sim2real multi-modal category-level pose estimation. In IEEE\/RSJ international conference on intelligent robots and systems (IROS) (pp. 7406\u20137413)","DOI":"10.1109\/IROS58592.2024.10802487"},{"issue":"2","key":"2893_CR65","doi-asserted-by":"publisher","first-page":"3019","DOI":"10.1109\/LRA.2020.2974707","volume":"5","author":"S James","year":"2020","unstructured":"James, S., Ma, Z., Arrojo, D. R., & Davison, A. J. (2020). Rlbench: The robot learning benchmark & learning environment. IEEE Robotics and Automation Letters, 5(2), 3019\u20133026.","journal-title":"IEEE Robotics and Automation Letters"},{"key":"2893_CR66","unstructured":"Janner, M., Du, Y., Tenenbaum, J. B., & Levine, S. (2022). Planning with diffusion for flexible behavior synthesis. arXiv:2205.09991"},{"key":"2893_CR67","unstructured":"Jia, X., Wang, Q., Donat, A., Xing, B., Li, G., Zhou, H., & Neumann, G. (2024). Mail: Improving imitation learning with mamba. arXiv:2406.08234"},{"key":"2893_CR68","doi-asserted-by":"publisher","first-page":"237","DOI":"10.1613\/jair.301","volume":"4","author":"LP Kaelbling","year":"1996","unstructured":"Kaelbling, L. P., Littman, M. L., & Moore, A. W. (1996). Reinforcement learning: A survey. Journal of Artificial Intelligence Research, 4, 237\u2013285.","journal-title":"Journal of Artificial Intelligence Research"},{"key":"2893_CR69","unstructured":"Kalashnikov, D., Irpan, A., Pastor, P., Ibarz, J., Herzog, A., Jang, E., Quillen, D., Holly, E., Kalakrishnan, M., Vanhoucke, V., and others (2018). Scalable deep reinforcement learning for vision-based robotic manipulation. In Conference on robot learning (pp. 651\u2013673)."},{"issue":"7","key":"2893_CR70","doi-asserted-by":"publisher","first-page":"3956","DOI":"10.1109\/LRA.2023.3272516","volume":"8","author":"I Kapelyukh","year":"2023","unstructured":"Kapelyukh, I., Vosylius, V., & Johns, E. (2023). Dall-e-bot: Introducing web-scale diffusion models to robotics. IEEE Robotics and Automation Letters, 8(7), 3956\u20133963.","journal-title":"IEEE Robotics and Automation Letters"},{"key":"2893_CR71","unstructured":"Ke, T. W., Gkanatsios, N., & Fragkiadaki, K. (2024). 3d diffuser actor: Policy diffusion with 3d scene representations. arXiv:2402.10885"},{"key":"2893_CR72","doi-asserted-by":"crossref","unstructured":"Khazatsky, A., Pertsch, K., Nair, S., Balakrishna, A., Dasari, S., Karamcheti, S., Nasiriany, S., Srirama, M. K., Chen, L. Y., & Ellis, K. (2024). Droid: A large-scale in-the-wild robot manipulation dataset. arXiv:2403.12945","DOI":"10.15607\/RSS.2024.XX.120"},{"key":"2893_CR73","doi-asserted-by":"crossref","unstructured":"Kim, S., Choi, Y., Matsunaga, D. E., Kim, K- E. (2024). Stitching sub-trajectories with conditional diffusion model for goal-conditioned offline rl. InProceedings of the AAAI conference on artificial intelligence (Vol.\u00a038, pp. 13160\u201313167).","DOI":"10.1609\/aaai.v38i12.29215"},{"key":"2893_CR74","doi-asserted-by":"crossref","unstructured":"Kim, M. J., Finn, C., & Liang, P. (2025). Fine-tuning vision-language-action models: Optimizing speed and success. arXiv:2502.19645","DOI":"10.15607\/RSS.2025.XXI.017"},{"key":"2893_CR75","unstructured":"Kim, M.J., Pertsch, K., Karamcheti, S., Xiao, T., Balakrishna, A., Nair, S., Rafailov, R., Foster, E., Lam, G., Sanketi, P., et al. (2024). Openvla: An open-source vision-language-action model. arXiv:2406.09246"},{"key":"2893_CR76","volume-title":"Auto-encoding variational bayes","author":"DP Kingma","year":"2013","unstructured":"Kingma, D. P., Welling, M., et al. (2013). Auto-encoding variational bayes. Canada: Banff."},{"key":"2893_CR77","unstructured":"Ko, P. C., Mao, J., Du, Y., Sun, S. H., & Tenenbaum, J. B. (2023). Learning to act from actionless videos through dense correspondences. arXiv:2310.08576"},{"key":"2893_CR78","unstructured":"Kong, Z., Ping, W., Huang, J., Zhao, K., & Catanzaro, B. (2020). Diffwave: A versatile diffusion model for audio synthesis. arXiv:2009.09761"},{"key":"2893_CR79","unstructured":"Labs, W. (2024). Generating worlds.https:\/\/www.worldlabs.ai\/blog"},{"key":"2893_CR80","unstructured":"LaValle, S. (1998). Rapidly-exploring random trees: A new tool for path planning. Research Report 9811"},{"issue":"1","key":"2893_CR81","doi-asserted-by":"publisher","first-page":"75","DOI":"10.1109\/TAC.1981.1102565","volume":"26","author":"N Lehtomaki","year":"1981","unstructured":"Lehtomaki, N., Sandell, N., & Athans, M. (1981). Robustness results in linear-quadratic gaussian based multivariable control designs. IEEE Transactions on Automatic Control, 26(1), 75\u201393. https:\/\/doi.org\/10.1109\/TAC.1981.1102565","journal-title":"IEEE Transactions on Automatic Control"},{"key":"2893_CR82","unstructured":"Liang, J., Liu, R., Ozguroglu, E., Sudhakar, S., Dave, A., Tokmakov, P., & Vondrick, C. (2024). Dreamitate: Real-world visuomotor policy learning via video generation. arXiv:2406.16862"},{"key":"2893_CR83","doi-asserted-by":"crossref","unstructured":"Liang, Z., Mu, Y., Ma, H., Tomizuka, M., Ding, M., & Luo, P. (2024). Skilldiffuser: Interpretable hierarchical planning via skill abstractions in diffusion-based task execution. In Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition (pp. 16467\u201316476)","DOI":"10.1109\/CVPR52733.2024.01558"},{"key":"2893_CR84","doi-asserted-by":"crossref","unstructured":"Liang, J., Payandeh, A., Song, D., Xiao, X., & Manocha, D. (2024). Dtg: Diffusion-based trajectory generation for mapless global navigation. In IEEE\/RSJ international conference on intelligent robots and systems (IROS) (pp. 5340\u20135347)","DOI":"10.1109\/IROS58592.2024.10802055"},{"key":"2893_CR85","doi-asserted-by":"crossref","unstructured":"Li, H., Feng, Q., Zheng, Z., Feng, J., & Knoll, A. (2024). Language-guided object-centric diffusion policy for collision-aware robotic manipulation. arXiv:2407.00451","DOI":"10.1109\/ICRA55743.2025.11127231"},{"issue":"4","key":"2893_CR86","doi-asserted-by":"publisher","first-page":"2325","DOI":"10.1109\/LRA.2023.3248443","volume":"8","author":"G Li","year":"2023","unstructured":"Li, G., Jin, Z., Volpp, M., Otto, F., Lioutikov, R., & Neumann, G. (2023). Prodmp: A unified perspective on dynamic and probabilistic movement primitives. IEEE Robotics and Automation Letters, 8(4), 2325\u20132332.","journal-title":"IEEE Robotics and Automation Letters"},{"key":"2893_CR87","doi-asserted-by":"crossref","unstructured":"Lin, T., Zhang, Y., Li, Q., Qi, H., Yi, B., Levine, S., & Malik, J. (2024). Learning visuotactile skills with two multifingered hands. arXiv:2404.16823","DOI":"10.1109\/ICRA55743.2025.11128180"},{"key":"2893_CR88","doi-asserted-by":"crossref","unstructured":"Liu, W., Du, Y., Hermans, T., Chernova, S., & Paxton, C. (2022). Structdiffusion: Language-guided creation of physically-valid structures using unseen objects. arXiv:2211.04604","DOI":"10.15607\/RSS.2023.XIX.031"},{"key":"2893_CR89","unstructured":"Liu, W., Mao, J., Hsu, J., Hermans, T., Garg, A., & Wu, J. (2024). Composable part-based manipulation. arXiv:2405.05876"},{"key":"2893_CR90","doi-asserted-by":"crossref","unstructured":"Liu, J., Stamatopoulou, M., & Kanoulas, D. (2024). Dipper: Diffusion-based 2d path planner applied on legged robots. In 2024 IEEE international conference on robotics and automation (ICRA) (pp. 9264\u20139270)","DOI":"10.1109\/ICRA57147.2024.10610013"},{"key":"2893_CR91","unstructured":"Liu, S., Wu, L., Li, B., Tan, H., Chen, H., Wang, Z., & Zhu, J. (2024). Rdt-1b: a diffusion foundation model for bimanual manipulation. arXiv:2410.07864"},{"key":"2893_CR92","unstructured":"Liu, X., Gong, C., & Liu, Q. (2022). Flow straight and fast: Learning to generate and transfer data with rectified flow. arXiv:2209.03003"},{"key":"2893_CR93","doi-asserted-by":"crossref","unstructured":"Liu, W., Wang, J., Wang, Y., Wang, W., & Lu, C. (2024). Forcemimic: Force-centric imitation learning with force-motion capture system for contact-rich manipulation. arXiv:2410.07554","DOI":"10.1109\/ICRA55743.2025.11128061"},{"key":"2893_CR94","doi-asserted-by":"publisher","first-page":"44776","DOI":"10.52202\/075280-1939","volume":"36","author":"B Liu","year":"2023","unstructured":"Liu, B., Zhu, Y., Gao, C., Feng, Y., Liu, Q., Zhu, Y., & Stone, P. (2023). Libero: Benchmarking knowledge transfer for lifelong robot learning. Advances in Neural Information Processing Systems, 36, 44776\u201344791.","journal-title":"Advances in Neural Information Processing Systems"},{"key":"2893_CR95","doi-asserted-by":"publisher","DOI":"10.1109\/LRA.2025.3526436","author":"P Li","year":"2025","unstructured":"Li, P., Wu, H., Huang, Y., Cheang, C., Wang, L., & Kong, T. (2025). Gr-mg: Leveraging partially-annotated data via multi-modal goal-conditioned policy. IEEE Robotics and Automation Letters. https:\/\/doi.org\/10.1109\/LRA.2025.3526436","journal-title":"IEEE Robotics and Automation Letters"},{"key":"2893_CR96","unstructured":"Lu, G., Gao, Z., Chen, T., Dai, W., Wang, Z., & Tang, Y. (2024). Manicm: Real-time 3d diffusion policy via consistency model for robotic manipulation. arXiv:2406.01586"},{"key":"2893_CR97","doi-asserted-by":"crossref","unstructured":"Lugmayr, A., Danelljan, M., Romero, A., Yu, F., Timofte, R., & Van Gool, L. (2022). Repaint: Inpainting using denoising diffusion probabilistic models. In Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition (pp. 11461\u201311471)","DOI":"10.1109\/CVPR52688.2022.01117"},{"key":"2893_CR98","doi-asserted-by":"crossref","unstructured":"Ma, X., Patidar, S., Haughton, I., & James, S. (2024). Hierarchical diffusion policy for kinematics-aware multi-task robotic manipulation. In Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition (pp. 18081\u201318090)","DOI":"10.1109\/CVPR52733.2024.01712"},{"key":"2893_CR99","unstructured":"Mandi, Z., Bharadhwaj, H., Moens, V., Song, S., Rajeswaran, A., & Kumar, V. (2022). Cacti: A framework for scalable multi-task multi-scene visual imitation learning. arXiv:2212.05711"},{"issue":"3","key":"2893_CR100","doi-asserted-by":"publisher","first-page":"7327","DOI":"10.1109\/LRA.2022.3180108","volume":"7","author":"O Mees","year":"2022","unstructured":"Mees, O., Hermann, L., Rosete-Beas, E., & Burgard, W. (2022). Calvin: A benchmark for language-conditioned policy learning for long-horizon robot manipulation tasks. IEEE Robotics and Automation Letters, 7(3), 7327\u20137334.","journal-title":"IEEE Robotics and Automation Letters"},{"key":"2893_CR101","unstructured":"Mishra, U. A., Xue, S., Chen, Y., & Xu, D. (2023). Generative skill chaining: Long-horizon skill planning with diffusion models. In Conference on robot learning (pp. 2905\u20132925)"},{"key":"2893_CR102","doi-asserted-by":"crossref","unstructured":"Mishra, U. A., C., & Y. (2024). Reorientdiff: Diffusion model based reorientation for object manipulation. In 2024 IEEE international conference on robotics and automation (ICRA) (pp. 10867\u201310873)","DOI":"10.1109\/ICRA57147.2024.10610749"},{"key":"2893_CR103","unstructured":"Nair, S., Rajeswaran, A., Kumar, V., Finn, C., & Gupta, A. (2022). R3m: A universal visual representation for robot manipulation. arXiv:2203.12601"},{"key":"2893_CR104","doi-asserted-by":"publisher","DOI":"10.1109\/LRA.2023.3330663","author":"E Ng","year":"2023","unstructured":"Ng, E., Liu, Z., & Kennedy, M. (2023). Diffusion co-policy for synergistic human-robot collaborative tasks. IEEE Robotics and Automation Letters. https:\/\/doi.org\/10.1109\/LRA.2023.3330663","journal-title":"IEEE Robotics and Automation Letters"},{"key":"2893_CR105","doi-asserted-by":"crossref","unstructured":"Okamura, A. M., Smaby, N., & Cutkosky, M. R. (2000). An overview of dexterous manipulation. In Proceedings 2000 icra. millennium conference. IEEE international conference on robotics and automation. Symposia proceedings (cat. no. 00ch37065) (Vol. 1, pp. 255\u2013262)","DOI":"10.1109\/ROBOT.2000.844067"},{"key":"2893_CR106","unstructured":"O\u2019Neill, A., Rehman, A., Gupta, A., Maddukuri, A., Gupta, A., Padalkar, A., Lee, A., Pooley, A., Gupta, A., Mandlekar, A., et al. (2023). Open x-embodiment: Robotic learning datasets and rt-x models. arXiv:2310.08864"},{"key":"2893_CR107","unstructured":"Pan, C., Junge, K., & Hughes, J. (2024). Vision-language-action model and diffusion policy switching enables dexterous control of an anthropomorphic hand. arXiv:2410.14022"},{"key":"2893_CR108","doi-asserted-by":"crossref","unstructured":"Pathre, P., Gupta, G., Qureshi, M. N., Brunda, M., Brahmbhatt, S., & Krishna, K. M. (2024). Imagine2servo: Intelligent visual servoing with diffusion-driven goal generation for robotic tasks. In IEEE\/RSJ international conference on intelligent robots and systems (IROS) (pp. 13466\u201313472)","DOI":"10.1109\/IROS58592.2024.10802688"},{"key":"2893_CR109","doi-asserted-by":"crossref","unstructured":"Peebles, W., & Xie, S. (2023). Scalable diffusion models with transformers. In Proceedings of the IEEE\/CVF international conference on computer vision (pp. 4195\u20134205)","DOI":"10.1109\/ICCV51070.2023.00387"},{"key":"2893_CR110","doi-asserted-by":"crossref","unstructured":"Perez, E., Strub, F., De Vries, H., Dumoulin, V., & Courville, A. (2018). Film: Visual reasoning with a general conditioning layer. In Proceedings of the AAAI conference on artificial intelligence (Vol. 32)","DOI":"10.1609\/aaai.v32i1.11671"},{"key":"2893_CR111","unstructured":"Pomerleau, D. A. (1988). Alvinn: An autonomous land vehicle in a neural network. Advances in neural information processing systems (Vol. 1)"},{"key":"2893_CR112","unstructured":"Power, T., Soltani-Zarrin, R., Iba, S., & Berenson, D. (2023). Sampling constrained trajectories using composable diffusion models. In Iros 2023 workshop on differentiable probabilistic robotics: Emerging perspectives on robot learning"},{"key":"2893_CR113","doi-asserted-by":"publisher","DOI":"10.1109\/TRO.2024.3428428","author":"T Power","year":"2024","unstructured":"Power, T., & Berenson, D. (2024). Constrained stein variational trajectory optimization. IEEE Transactions on Robotics. https:\/\/doi.org\/10.1109\/TRO.2024.3428428","journal-title":"IEEE Transactions on Robotics"},{"key":"2893_CR114","doi-asserted-by":"crossref","unstructured":"Prasad, A., Lin, K., Wu, J., Zhou, L., & Bohg, J. (2024). Consistency policy: Accelerated visuomotor policies via consistency distillation. arXiv:2405.07503","DOI":"10.15607\/RSS.2024.XX.071"},{"key":"2893_CR115","doi-asserted-by":"crossref","unstructured":"Qin, Y., Wu, Y. H., Liu, S., Jiang, H., Yang, R., Fu, Y., & Wang, X. (2022). Dexmv: Imitation learning for dexterous manipulation from human videos. INEuropean conference on computer vision (pp. 570\u2013587)","DOI":"10.1007\/978-3-031-19842-7_33"},{"key":"2893_CR116","unstructured":"Radford, A., Kim, J. W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., et al. (2021). Learning transferable visual models from natural language supervision. In International conference on machine learning (pp. 8748\u20138763)."},{"key":"2893_CR117","unstructured":"Rana, K., Abou-Chakra, J., Garg, S., Lee, R., Reid, I., & Suenderhauf, N. (2024). Affordance-centric policy learning: Sample efficient and generalisable robot policy learning using affordance-centric task frames. arXiv:2410.12124"},{"key":"2893_CR118","doi-asserted-by":"crossref","unstructured":"Ren, Y., Cong, Y., Chen, R., & Long, J. (2024). Learning generalizable 3d manipulation with 10 demonstrations. arXiv:2411.10203","DOI":"10.1109\/IROS60139.2025.11247500"},{"key":"2893_CR119","unstructured":"Ren, A. Z., Lidard, J., Ankile, L. L., Simeonov, A., Agrawal, P., Majumdar, A., & Simchowitz, M. (2024). Diffusion policy policy optimization. arXiv:2409.00588"},{"key":"2893_CR120","doi-asserted-by":"crossref","unstructured":"Reuss, M., Li, M., Jia, X., Lioutikov, R. (2023). Goal-conditioned imitation learning using score-based diffusion policies. arXiv:2304.02532","DOI":"10.15607\/RSS.2023.XIX.028"},{"key":"2893_CR121","doi-asserted-by":"crossref","unstructured":"Reuss, M., Ya\u011fmurlu, \u00d6. E., Wenzel, F., & Lioutikov, R. (2024). Multimodal diffusion transformer: Learning versatile behavior from multimodal goals. arXiv:2407.05996","DOI":"10.15607\/RSS.2024.XX.121"},{"key":"2893_CR122","doi-asserted-by":"crossref","unstructured":"Rombach, R., Blattmann, A., Lorenz, D., Esser, P., & Ommer, B. (2021). High-resolution image synthesis with latent diffusion models","DOI":"10.1109\/CVPR52688.2022.01042"},{"key":"2893_CR123","unstructured":"Ross, S., & Bagnell, D. (2010). Efficient reductions for imitation learning. In Proceedings of the thirteenth international conference on artificial intelligence and statistics (pp. 661\u2013668)"},{"key":"2893_CR124","unstructured":"Ross, S., Gordon, G., & Bagnell, D. (2011). A reduction of imitation learning and structured prediction to no-regret online learning. In Proceedings of the fourteenth international conference on artificial intelligence and statistics (pp. 627\u2013635)"},{"key":"2893_CR125","doi-asserted-by":"crossref","unstructured":"Rouxel, Q., Ferrari, A., Ivaldi, S., & Mouret, J. B. (2024). Flow matching imitation learning for multi-support manipulation. In IEEE-RAS 23rd international conference on humanoid robots (humanoids) (pp. 528\u2013535)","DOI":"10.1109\/Humanoids58906.2024.10769838"},{"key":"2893_CR126","doi-asserted-by":"crossref","unstructured":"Ryu, H., Kim, J., An, H., Chang, J., Seo, J., Kim, T.. Horowitz, R. (2024). Diffusion-edfs: Bi-equivariant denoising generative modeling on se (3) for visual robotic manipulation. In Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition (pp. 18007\u201318018).","DOI":"10.1109\/CVPR52733.2024.01705"},{"key":"2893_CR127","doi-asserted-by":"crossref","unstructured":"Saha, K., Mandadi, V., Reddy, J., Srikanth, A., Agarwal, A., Sen, B., & Krishna, M. (2024). Edmp: Ensemble-of-costs-guided diffusion for motion planning. In 2024 IEEE international conference on robotics and automation (ICRA) (pp. 10351\u201310358)","DOI":"10.1109\/ICRA57147.2024.10610519"},{"key":"2893_CR128","doi-asserted-by":"publisher","DOI":"10.1109\/LRA.2024.3382529x5","author":"PM Scheikl","year":"2024","unstructured":"Scheikl, P. M., Schreiber, N., Haas, C., Freymuth, N., Neumann, G., Lioutikov, R., & Mathis-Ullrich, F. (2024). Movement primitive diffusion: Learning gentle robotic manipulation of deformable objects. IEEE Robotics and Automation Letters. https:\/\/doi.org\/10.1109\/LRA.2024.3382529x5","journal-title":"IEEE Robotics and Automation Letters"},{"key":"2893_CR129","unstructured":"Shah, D., Sridhar, A., Dashora, N., Stachowicz, K., Black, K., Hirose, N., & Levine, S. (2023). Vint: A foundation model for visual navigation. arXiv:2306.14846"},{"key":"2893_CR130","unstructured":"Simeonov, A., Goyal, A., Manuelli, L., Yen-Chen, L., Sarmiento, A., Rodriguez, A., & Fox, D. (2023). Shelving, stacking, hanging: Relational pose diffusion for multi-modal rearrangement. arXiv:2307.04751"},{"key":"2893_CR131","unstructured":"Song, Y., Dhariwal, P., Chen, M., & Sutskever, I. (2023). Consistency models. arXiv:2303.01469"},{"key":"2893_CR132","unstructured":"Song, Y., Sohl-Dickstein, J., Kingma, D. P., Kumar, A., Ermon, S., & Poole, B. (2020). Score-based generative modeling through stochastic differential equations. arXiv:2011.13456"},{"key":"2893_CR133","doi-asserted-by":"crossref","unstructured":"Sridhar, A., Shah, D., Glossop, C., & Levine, S. (2024). Nomad: Goal masked diffusion policies for navigation and exploration. In 2024 IEEE international conference on robotics and automation (ICRA) (pp. 63\u201370)","DOI":"10.1109\/ICRA57147.2024.10610665"},{"key":"2893_CR134","doi-asserted-by":"crossref","unstructured":"Su, Y., Zhan, X., Fang, H., Li, Y. L., Lu, C., & Yang, L. (2024). Motion before action: Diffusing object motion as manipulation condition. arXiv:2411.09658","DOI":"10.1109\/LRA.2025.3577424"},{"key":"2893_CR135","doi-asserted-by":"crossref","unstructured":"Tang, W., Pan, J. H., Zhan, W., Zhou, J., Yao, H., Liu, Y. H., & Fu, C. W. (2024). Embodiment-agnostic action planning via object-part scene flow. arXiv:2409.10032","DOI":"10.1109\/ICRA55743.2025.11127873"},{"key":"2893_CR136","unstructured":"Team, O.M., Ghosh, D., Walke, H., Pertsch, K., Black, K., Mees, O., Dasari, S., Hejna, J., Kreiman, T., Xu, C., et al. (2024). Octo: An open-source generalist robot policy. arXiv:2405.12213"},{"key":"2893_CR137","unstructured":"Tian, R., Wu, Y., Xu, C., Tomizuka, M., Malik, J., & Bajcsy, A. (2024). Maximizing alignment with minimal feedback: Efficiently learning rewards for visuomotor robot policy alignment. arXiv:2412.04835"},{"key":"2893_CR138","doi-asserted-by":"crossref","unstructured":"Urain, J., Funk, N., Peters, J., & Chalvatzaki, G. (2023). Se (3)-diffusionfields: Learning smooth cost functions for joint grasp and motion optimization through diffusion. In 2023 IEEE international conference on robotics and automation (ICRA) (pp. 5923\u20135930)","DOI":"10.1109\/ICRA48891.2023.10161569"},{"key":"2893_CR139","unstructured":"Van Den Oord, A., & Vinyals, O. (2017). Neural discrete representation learning. In Advances in neural information processing systems (p. 30)"},{"key":"2893_CR140","unstructured":"Walke, H.R., Black, K., Zhao, T.Z., Vuong, Q., Zheng, C., Hansen-Estruch, P., He, A.W., Myers, V., Kim, M.J., Du, M., et al. (2023). Bridgedata v2: A dataset for robot learning at scale. In Conference on robot learning (pp. 1723\u20131736)."},{"key":"2893_CR141","doi-asserted-by":"crossref","unstructured":"Wang, C., Fang, H., Fang, H- S., Lu, C. (2024). Rise: 3d perception makes real-world robot imitation simple and effective. arXiv:2404.12281","DOI":"10.1109\/IROS58592.2024.10801678"},{"key":"2893_CR142","unstructured":"Wang, D., Hart, S., Surovik, D., Kelestemur, T., Huang, H., Zhao, H., & Platt, R. (2024). Equivariant diffusion policy. arXiv:2407.01812"},{"key":"2893_CR143","doi-asserted-by":"crossref","unstructured":"Wang, D., Liu, C., Chang, F., & Xu, Y. (2024). Hierarchical diffusion policy: manipulation trajectory generation via contact guidance. arXiv:2411.12982","DOI":"10.1109\/TRO.2025.3547272"},{"key":"2893_CR144","doi-asserted-by":"crossref","unstructured":"Wang, B., Sridhar, N., Feng, C., Van\u00a0der Merwe, M., Fishman, A., Fazeli, N., Park, J. J. (2024). This&that: Language-gesture controlled video generation for robot planning. arXiv:2407.05530","DOI":"10.1109\/ICRA55743.2025.11128780"},{"key":"2893_CR145","unstructured":"Wang, Y., Yin, G., Huang, B., Kelestemur, T., Wang, J., Li, Y. (2024). Gendp: 3d semantic fields for category-level generalizable diffusion policy. In 8th annual conference on robot learning (Vol.\u00a02)"},{"key":"2893_CR146","doi-asserted-by":"crossref","unstructured":"Wen, J., Zhu, Y., Li, J., Zhu, M., Wu, K., Xu, Z., Liu, N., Cheng, R., Shen, C., Peng, Y., et al. (2024). Tinyvla: Towards fast, data-efficient vision-language-action models for robotic manipulation. arXiv:2409.12514","DOI":"10.1109\/LRA.2025.3544909"},{"key":"2893_CR147","doi-asserted-by":"crossref","unstructured":"Weng, Z., Lu, H., Kragic, D., & Lundell, J. (2024). Dexdiffuser: Generating dexterous grasps with diffusion models. arXiv:2402.02989","DOI":"10.1109\/LRA.2024.3498776"},{"key":"2893_CR148","doi-asserted-by":"publisher","first-page":"1606247","DOI":"10.3389\/frobt.2025.1606247","volume":"12","author":"R Wolf","year":"2025","unstructured":"Wolf, R., Shi, Y., Liu, S., & Rayyes, R. (2025). Diffusion models for robotic manipulation: A survey. Frontiers in Robotics and AI, 12, 1606247.","journal-title":"Frontiers in Robotics and AI"},{"key":"2893_CR149","doi-asserted-by":"crossref","unstructured":"Wu, T., Wu, M., Zhang, J., Gan, Y., Dong, H. (2024). Learning score-based grasping primitive for human-assisting dexterous grasping. In Advances in Neural Information Processing Systems, 36,","DOI":"10.52202\/075280-0972"},{"key":"2893_CR150","doi-asserted-by":"crossref","unstructured":"Wu, Y., Chen, Z., Wu, F., Chen, L., Zhang, L., Bing, Z., & Haddadin, S. (2024). Tacdiffusion: Force-domain diffusion policy for precise tactile manipulation. arXiv:2409.11047","DOI":"10.1109\/ICRA55743.2025.11127334"},{"key":"2893_CR151","doi-asserted-by":"crossref","unstructured":"Wu, T., Li, J., Zhang, J., Wu, M., & Dong, H. (2024). Canonical representation and force-based pretraining of 3d tactile for dexterous visuo-tactile policy learning. arXiv:2409.17549","DOI":"10.1109\/ICRA55743.2025.11128094"},{"key":"2893_CR152","doi-asserted-by":"crossref","unstructured":"Xia, S., Fang, H., Lu, C., Fang, H- S. (2024). Cage: Causal attention enables data-efficient generalizable robotic manipulation. arXiv:2410.14974","DOI":"10.1109\/ICRA55743.2025.11127739"},{"key":"2893_CR153","unstructured":"Xian, Z., Gkanatsios, N., Gervet, T., Ke, T. W., & Fragkiadaki, K. (2023). Chaineddiffuser: Unifying trajectory diffusion and keypose prediction for robotic manipulation 7th annual conference on robot learning."},{"key":"2893_CR154","unstructured":"Xiao, W., Wang, T. H., Gan, C., & Rus, D. (2023). Safediffuser: Safe planning with diffusion probabilistic models. arXiv:2306.00148"},{"key":"2893_CR155","unstructured":"Xu, M., Xu, Z., Chi, C., Veloso, M., Song, S. (2023). Xskill: Cross embodiment skill discovery. In Conference on robot learning (pp. 3536\u20133555)."},{"key":"2893_CR156","doi-asserted-by":"crossref","unstructured":"Xue, H., Ren, J., Chen, W., Zhang, G., Fang, Y., Gu, G., & Lu, C. (2025). Reactive diffusion policy: Slow-fast visual-tactile policy learning for contact-rich manipulation. arXiv:2503.02881","DOI":"10.15607\/RSS.2025.XXI.052"},{"key":"2893_CR157","unstructured":"Xu, S., Wang, Y., Xia, C., Zhu, D., Huang, T., & Xu, C. (2025). Vla-cache: Towards efficient vision-language-action model via adaptive token caching in robotic manipulation. arXiv:2502.02175"},{"key":"2893_CR158","unstructured":"Xu, M., Yu, L., Song, Y., Shi, C., Ermon, S., & Tang, J. (2022). Geodiff: A geometric diffusion model for molecular conformation generation. arXiv:2203.02923"},{"key":"2893_CR159","doi-asserted-by":"crossref","unstructured":"Yan, S., Zhang, Z., Han, M., Wang, Z., Xie, Q., Li, Z., & Zhu, S. C. (2024). M2diffuser: Diffusion-based trajectory optimization for mobile manipulation in 3d scenes. arXiv:2410.11402.","DOI":"10.1109\/TPAMI.2025.3553454"},{"key":"2893_CR160","unstructured":"Yang, M., Du, Y., Ghasemipour, K., Tompson, J., Schuurmans, D., Abbeel, P. (2023). Learning interactive real-world simulators. arXiv:2310.06114"},{"key":"2893_CR161","doi-asserted-by":"crossref","unstructured":"Yang, J., Glossop, C., Bhorkar, A., Shah, D., Vuong, Q., Finn, C., & Levine, S. (2024). Pushing the limits of cross-embodiment learning for manipulation and navigation. arXiv:2402.19432","DOI":"10.15607\/RSS.2024.XX.093"},{"key":"2893_CR162","unstructured":"Yang, J., Cao, Deng, C., Antonova, R., Song, S., & Bohg, J. (2024). Equibot: Sim (3)-equivariant diffusion policy for generalizable and data efficient learning. arXiv:2407.01479"},{"key":"2893_CR163","doi-asserted-by":"crossref","unstructured":"Yoo, U., Hung, A., Francis, J., Oh, J., & Ichnowski, J. (2024). Ropotter: Toward robotic pottery and deformable object manipulation with structural priors. In 2024 IEEE-RAS 23rd international conference on humanoid robots (humanoids) (pp. 843\u2013850)","DOI":"10.1109\/Humanoids58906.2024.10769600"},{"key":"2893_CR164","doi-asserted-by":"crossref","unstructured":"Yu, W., Peng, J., Yang, H., Zhang, J., Duan, Y., Ji, J., Zhang, Y. (2024). Ldp: A local diffusion planner for efficient robot navigation and collision avoidance. In 2024 IEEE\/RSJ international conference on intelligent robots and systems (IROS) (pp. 5466\u20135472).","DOI":"10.1109\/IROS58592.2024.10802009"},{"key":"2893_CR165","unstructured":"Yu, T., Quillen, D., He, Z., Julian, R., Hausman, K., Finn, C., & Levine, S. (2020). Meta-world: A benchmark and evaluation for multi-task and meta reinforcement learning. In Conference on robot learning (pp. 1094\u20131100)"},{"key":"2893_CR166","doi-asserted-by":"crossref","unstructured":"Yu, T., Xiao, T., Stone, A., Tompson, J., Brohan, A., Wang, S., Singh, J., Tan, C., Peralta, J., Ichter, B., et al. (2023). Scaling robot learning with semantically imagined experience. arXiv:2302.11550","DOI":"10.15607\/RSS.2023.XIX.027"},{"issue":"12","key":"2893_CR167","doi-asserted-by":"publisher","first-page":"2762","DOI":"10.3390\/s17122762","volume":"17","author":"W Yuan","year":"2017","unstructured":"Yuan, W., Dong, S., & Adelson, E. H. (2017). Gelsight: High-resolution robot tactile sensors for estimating geometry and force. Sensors, 17(12), 2762.","journal-title":"Sensors"},{"key":"2893_CR168","unstructured":"Ze, Y., Zhang, G., Zhang, K., Hu, C., Wang, M., Xu, H. (2024). 3D diffusion policy. arXiv:2403.03954"},{"key":"2893_CR169","unstructured":"Zhang, F., & Gienger, M. (2024). Affordance-based robot manipulation with flow matching. arXiv:2409.01083"},{"key":"2893_CR170","doi-asserted-by":"crossref","unstructured":"Zhang, X., Chang, M., Kumar, P., & Gupta, S. (2024). Diffusion meets dagger: Supercharging eye-in-hand imitation learning. arXiv:2402.17768","DOI":"10.15607\/RSS.2024.XX.048"},{"key":"2893_CR171","doi-asserted-by":"crossref","unstructured":"Zhang, L., Rao, A., & Agrawala, M. (2023). Adding conditional control to text-to-image diffusion models. In Proceedings of the IEEE\/CVF international conference on computer vision (pp. 3836\u20133847)","DOI":"10.1109\/ICCV51070.2023.00355"},{"key":"2893_CR172","unstructured":"Zhang, Z., Zhou, L., Liu, C., Liu, Z., Yuan, C., Guo, S.. Tay, F.E. (2024). Dexgrasp-diffusion: Diffusion-based unified functional grasp synthesis method for multi-dexterous robotic hands. arXiv:2407.09899"},{"key":"2893_CR173","doi-asserted-by":"crossref","unstructured":"Zhang, Q., Liu, Z., Fan, H., Liu, G., Zeng, B., & Liu, S. (2024). Flowpolicy: Enabling fast and robust 3d flow-based policy via consistency flow matching for robot manipulation. arXiv:2412.04987","DOI":"10.1609\/aaai.v39i14.33617"},{"key":"2893_CR174","doi-asserted-by":"crossref","unstructured":"Zhao, Q., Lu, Y., Kim, M.J., Fu, Z., Zhang, Z., Wu, Y., Li, Z., Ma, Q., Han, S., Finn, C., et al. (2025). Cot-vla: Visual chain-of-thought reasoning for vision-language-action models. In Proceedings of the computer vision and pattern recognition conference (pp. 1702\u20131713).","DOI":"10.1109\/CVPR52734.2025.00166"},{"key":"2893_CR175","unstructured":"Zhen, H., Qiu, X., Chen, P., Yang, J., Yan, X., Du, Y., & Gan, C. (2024). 3d-vla: A 3d vision-language-action generative world model. arXiv:2403.09631"},{"key":"2893_CR176","unstructured":"Zheng, Z., Peng, X., Yang, T., Shen, C., Li, S., Liu, H., & You, Y. (2024). Open-sora: Democratizing efficient video production for all. arXiv:2412.20404"},{"key":"2893_CR177","unstructured":"Zhou, S., Du, Y., Chen, J., Li, Y., Yeung, D. Y., & Gan, C. (2024). Robodreamer: Learning compositional world models for robot imagination. arXiv:2404.12377"},{"key":"2893_CR178","unstructured":"Zhu, F., Wu, H., Guo, S., Liu, Y., Cheang, C., & Kong, T. (2024). Irasim: Learning interactive real-robot action simulators. arXiv:2406.14540"}],"container-title":["International Journal of Computer Vision"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-026-02893-1.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11263-026-02893-1","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-026-02893-1.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,7,20]],"date-time":"2026-07-20T16:16:03Z","timestamp":1784564163000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11263-026-02893-1"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,5,31]]},"references-count":178,"journal-issue":{"issue":"6","published-print":{"date-parts":[[2026,6]]}},"alternative-id":["2893"],"URL":"https:\/\/doi.org\/10.1007\/s11263-026-02893-1","relation":{},"ISSN":["0920-5691","1573-1405"],"issn-type":[{"value":"0920-5691","type":"print"},{"value":"1573-1405","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026,5,31]]},"assertion":[{"value":"7 August 2025","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"14 May 2026","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"31 May 2026","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"The authors declare that they have no known competing financial interests or personal relationships that could have appeared to influence the work reported in this paper.","order":1,"name":"Ethics","label":"Conflict of Interest","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"This article does not contain any studies involving human participants performed by any of the authors. No individual person\u2019s data is included in this manuscript; therefore, consent for publication is not applicable.","order":2,"name":"Ethics","label":"Consent for Publication","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"This article does not involve any studies with human participants or animals performed by any of the authors. Therefore, consent to participate is not applicable.","order":3,"name":"Ethics","label":"Consent to Participate","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"This is a review-based study that does not involve human participants, animals, or sensitive data. As such, no ethical approval was required.","order":4,"name":"Ethics","label":"Ethical Approval","group":{"name":"EthicsHeading","label":"Declarations"}}],"article-number":"299"}}