{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,3]],"date-time":"2026-07-03T20:26:38Z","timestamp":1783110398344,"version":"3.54.6"},"reference-count":47,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","license":[{"start":{"date-parts":[[2026,1,1]],"date-time":"2026-01-01T00:00:00Z","timestamp":1767225600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/legalcode"}],"funder":[{"name":"JST CREST, Japan","award":["JPMJCR2553"],"award-info":[{"award-number":["JPMJCR2553"]}]},{"name":"JSPS KAKENHI","award":["22K17984"],"award-info":[{"award-number":["22K17984"]}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Access"],"published-print":{"date-parts":[[2026]]},"DOI":"10.1109\/access.2026.3691054","type":"journal-article","created":{"date-parts":[[2026,5,7]],"date-time":"2026-05-07T19:54:26Z","timestamp":1778183666000},"page":"97896-97909","source":"Crossref","is-referenced-by-count":0,"title":["RoboManipBaselines: A Unified Framework for Imitation Learning in Robotic Manipulation Across Real and Simulation Environments"],"prefix":"10.1109","volume":"14","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-1258-0431","authenticated-orcid":false,"given":"Masaki","family":"Murooka","sequence":"first","affiliation":[{"name":"Artificial Intelligence Research Center, National Institute of Advanced Industrial Science and Technology (AIST), Koto-ku, Tokyo, Japan"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3339-6147","authenticated-orcid":false,"given":"Tomohiro","family":"Motoda","sequence":"additional","affiliation":[{"name":"Artificial Intelligence Research Center, National Institute of Advanced Industrial Science and Technology (AIST), Koto-ku, Tokyo, Japan"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Ryoichi","family":"Nakajo","sequence":"additional","affiliation":[{"name":"Artificial Intelligence Research Center, National Institute of Advanced Industrial Science and Technology (AIST), Koto-ku, Tokyo, Japan"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-2368-3321","authenticated-orcid":false,"given":"Hanbit","family":"Oh","sequence":"additional","affiliation":[{"name":"Artificial Intelligence Research Center, National Institute of Advanced Industrial Science and Technology (AIST), Koto-ku, Tokyo, Japan"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Koshi","family":"Makihara","sequence":"additional","affiliation":[{"name":"Artificial Intelligence Research Center, National Institute of Advanced Industrial Science and Technology (AIST), Koto-ku, Tokyo, Japan"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Keisuke","family":"Shirai","sequence":"additional","affiliation":[{"name":"Artificial Intelligence Research Center, National Institute of Advanced Industrial Science and Technology (AIST), Koto-ku, Tokyo, Japan"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-7015-0379","authenticated-orcid":false,"given":"Tetsuya","family":"Ogata","sequence":"additional","affiliation":[{"name":"Artificial Intelligence Research Center, National Institute of Advanced Industrial Science and Technology (AIST), Koto-ku, Tokyo, Japan"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-1366-9657","authenticated-orcid":false,"given":"Yukiyasu","family":"Domae","sequence":"additional","affiliation":[{"name":"Artificial Intelligence Research Center, National Institute of Advanced Industrial Science and Technology (AIST), Koto-ku, Tokyo, Japan"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","article-title":"What matters in learning from offline human demonstrations for robot manipulation","volume-title":"Proc. Conf. Robot Learn.","author":"Mandlekar"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/SII.2019.8700380"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.36288\/roscon2013-900162"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/MRA.2012.2205651"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.52202\/075280-1939"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2025.XXI.021"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.52202\/075280-1918"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2024.XX.050"},{"key":"ref9","article-title":"Towards diverse behaviors: A benchmark for imitation learning with human demonstrations","volume-title":"Proc. Int. Conf. Learn. Represent.","author":"Jia"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2024.XX.133"},{"key":"ref11","article-title":"LeRobot: An open-source library for end-to-end robot learning","volume-title":"Proc. Int. Conf. Learn. Represent.","author":"Cadene"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2025.XXI.022"},{"key":"ref13","first-page":"1367","article-title":"Error-aware imitation learning from teleoperation data for mobile manipulation","volume-title":"Conf. Robot Learn.","author":"Wong"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1007\/s41315-019-00103-5"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1016\/j.robot.2008.10.024"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1126\/scirobotics.aax8177"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2023.XIX.016"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1177\/02783649241273668"},{"key":"ref19","first-page":"2268","article-title":"ManiFlow: A general robot manipulation policy via consistency flow training","volume-title":"Proc. Conf. Robot Learn.","author":"Yan"},{"key":"ref20","article-title":"Recipe for vision-language-action models in robotic manipulation: A survey","author":"Motoda","year":"2025","journal-title":"TechRxiv Preprint"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2024.XX.067"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/LRA.2025.3559835"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/LRA.2025.3580329"},{"key":"ref24","article-title":"The sound of simulation: Learning multimodal sim-to-real robot policies with generative audio","volume-title":"Proc. Conf. Robot Learn.","author":"Wang"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA57147.2024.10611293"},{"key":"ref26","article-title":"\u03c0: A vision-language-action flow model for general robot control","author":"Black","year":"2024","journal-title":"arXiv:2410.24164"},{"key":"ref27","article-title":"GR00T n1: An open foundation model for generalist humanoid robots","author":"Bjorck","year":"2025","journal-title":"arXiv:2503.14734"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1109\/IROS58592.2024.10801581"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2024.XX.045"},{"key":"ref30","article-title":"RLDS: An ecosystem to generate, share and use datasets in reinforcement learning","author":"Ramos","year":"2021","journal-title":"arXiv:2111.02767"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1109\/LRA.2020.2974707"},{"key":"ref32","article-title":"RoboArena: Distributed real-world evaluation of generalist robot policies","volume-title":"Proc. Conf. Robot Learn.","author":"Atreya"},{"key":"ref33","article-title":"DROID: A large-scale in-the-wild robot manipulation dataset","author":"Khazatsky","year":"2024","journal-title":"Robotics: Science and Systems"},{"key":"ref34","first-page":"6892","article-title":"Open X-Embodiment: Robotic learning datasets and RT-X models","volume-title":"Proc. IEEE Int. Conf. Robot. Autom.","author":"O\u2019Neill"},{"key":"ref35","article-title":"OpenAI gym","author":"Brockman","year":"2016","journal-title":"arXiv:1606.01540"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1109\/IROS.2012.6386109"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1109\/IROS58592.2024.10801658"},{"key":"ref38","volume-title":"PyBullet, a Python Module for Physics Simulation for Games, Robotics and Machine Learning","author":"Coumans","year":"2016"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA46639.2022.9811940"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v39i14.33617"},{"key":"ref41","article-title":"PaliGemma: A versatile 3B VLM for transfer","author":"Beyer","year":"2024","journal-title":"arXiv:2407.07726"},{"key":"ref42","article-title":"Eagle 2: Building post-training data strategies from scratch for frontier vision-language models","author":"Li","year":"2025","journal-title":"arXiv:2501.14818"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1080\/01691864.2026.2631642"},{"key":"ref44","article-title":"Sparsh: Self-supervised touch representations for vision-based tactile sensing","volume-title":"Proc. Conf. Robot Learn.","author":"Higuera"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1109\/LRA.2022.3146945"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1109\/LRA.2025.3585396"},{"key":"ref47","article-title":"3D-ViTac: Learning fine-grained manipulation with visuo-tactile sensing","volume-title":"Proc. Conf. Robot Learn.","author":"Huang"}],"container-title":["IEEE Access"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/6287639\/11323511\/11511708.pdf?arnumber=11511708","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,7,3]],"date-time":"2026-07-03T19:53:57Z","timestamp":1783108437000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11511708\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026]]},"references-count":47,"URL":"https:\/\/doi.org\/10.1109\/access.2026.3691054","relation":{},"ISSN":["2169-3536"],"issn-type":[{"value":"2169-3536","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026]]}}}