{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,12,18]],"date-time":"2025-12-18T14:30:33Z","timestamp":1766068233532,"version":"3.44.0"},"reference-count":60,"publisher":"IEEE","license":[{"start":{"date-parts":[[2025,5,19]],"date-time":"2025-05-19T00:00:00Z","timestamp":1747612800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2025,5,19]],"date-time":"2025-05-19T00:00:00Z","timestamp":1747612800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025,5,19]]},"DOI":"10.1109\/icra55743.2025.11127918","type":"proceedings-article","created":{"date-parts":[[2025,9,2]],"date-time":"2025-09-02T17:28:56Z","timestamp":1756834136000},"page":"16899-16906","source":"Crossref","is-referenced-by-count":1,"title":["Learning From Imperfect Demonstrations With Self-Supervision for Robotic Manipulation"],"prefix":"10.1109","author":[{"given":"Kun","family":"Wu","sequence":"first","affiliation":[{"name":"Syracuse University,NY,USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Ning","family":"Liu","sequence":"additional","affiliation":[{"name":"Beijing Innovation Center of Humanoid Robotics,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zhen","family":"Zhao","sequence":"additional","affiliation":[{"name":"Beijing Innovation Center of Humanoid Robotics,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Di","family":"Qiu","sequence":"additional","affiliation":[{"name":"Peking University,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jinming","family":"Li","sequence":"additional","affiliation":[{"name":"Shanghai University,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zhengping","family":"Che","sequence":"additional","affiliation":[{"name":"Beijing Innovation Center of Humanoid Robotics,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zhiyuan","family":"Xu","sequence":"additional","affiliation":[{"name":"Beijing Innovation Center of Humanoid Robotics,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jian","family":"Tang","sequence":"additional","affiliation":[{"name":"Beijing Innovation Center of Humanoid Robotics,China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref1","article-title":"Gpt-4 technical report","author":"Achiam","year":"2023","journal-title":"arXiv preprint"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00371"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.15607\/rss.2023.xix.025"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2017.7989385"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2018.8461249"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA48506.2021.9560942"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA46639.2022.9811698"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2023.XIX.026"},{"key":"ref9","article-title":"Policy invariance under reward transformations: Theory and application to reward shaping","author":"Ng","year":"1999","journal-title":"Icml. Citeseer"},{"key":"ref10","article-title":"Reward design with language models","volume-title":"The Eleventh International Conference on Learning Representations","author":"Kwon","year":"2023"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2018.8461076"},{"key":"ref12","article-title":"Bc-z: Zero-shot task generalization with robotic imitation learning","volume-title":"Conference on Robot Learning. PMLR","author":"Jang","year":"2022"},{"key":"ref13","article-title":"RT2: Vision-language-action models transfer web knowledge to robotic control","volume-title":"7th Annual Conference on Robot Learning","author":"Zitkovich","year":"2023"},{"key":"ref14","article-title":"Alvinn: An autonomous land vehicle in a neural network","author":"Pomerleau","year":"1988","journal-title":"Advances in neural information processing systems"},{"key":"ref15","article-title":"Do as i can, not as i say: Grounding language in robotic affordances","volume-title":"Conference on Robot Learning. PMLR","author":"Brohan","year":"2023"},{"key":"ref16","article-title":"Offline learning from demonstrations and unlabeled experience","author":"Zolna","year":"2020","journal-title":"arXiv preprint"},{"key":"ref17","first-page":"965","article-title":"Mitigating covariate shift in imitation learning via offline data with partial coverage","volume":"34","author":"Chang","year":"2021","journal-title":"Advances in Neural Information Processing Systems"},{"key":"ref18","article-title":"CLARE: Conservative model-based reward learning for offline inverse reinforcement learning","volume-title":"The Eleventh International Conference on Learning Representations","author":"Yue","year":"2023"},{"key":"ref19","article-title":"When demonstrations meet generative world models: A maximum likelihood framework for of-fline inverse reinforcement learning","volume":"36","author":"Zeng","year":"2024","journal-title":"Advances in Neural Information Processing Systems"},{"key":"ref20","article-title":"Get back here: Robust imitation by return-to-distribution planning","author":"Cideron","year":"2023","journal-title":"arXiv preprint"},{"key":"ref21","article-title":"Imitation learning from imperfect demonstration","volume-title":"International Conference on Machine Learning. PMLR","author":"Wu","year":"2019"},{"key":"ref22","article-title":"Behavioral cloning from noisy demonstrations","volume-title":"International Conference on Learning Representations","author":"Sasaki","year":"2020"},{"key":"ref23","article-title":"Demodice: Offline imitation learning with supplementary imperfect demonstrations","volume-title":"International Conference on Learning Representations","author":"Kim","year":"2021"},{"key":"ref24","article-title":"Discriminator-weighted offline imitation learning from suboptimal demonstrations","volume-title":"International Conference on Machine Learning. PMLR","author":"Xu","year":"2022"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v37i9.26305"},{"key":"ref26","article-title":"Imitation learning from imperfection: Theoretical justifications and algorithms","volume":"36","author":"Li","year":"2024","journal-title":"Advances in Neural Information Processing Systems"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2023.3250269"},{"key":"ref28","article-title":"Bert: Pre-training of deep bidirectional transformers for language understanding","author":"Devlin","year":"2018","journal-title":"arXiv preprint"},{"key":"ref29","article-title":"Generative adversarial imitation learning","author":"Ho","year":"2016","journal-title":"Advances in neural information processing systems"},{"key":"ref30","article-title":"Implicit behavioral cloning","volume-title":"Conference on Robot Learning. PMLR","author":"Florence","year":"2022"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2023.XIX.016"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA57147.2024.10611477"},{"key":"ref33","article-title":"Robomind: Benchmark on multi-embodiment intelligence normative data for robot manipulation","author":"Wu","year":"2024","journal-title":"arXiv preprint"},{"key":"ref34","article-title":"Imitation learning via offpolicy distribution matching","volume-title":"International Conference on Learning Representations","author":"Kostrikov","year":"2020"},{"key":"ref35","article-title":"Softdice for imitation learning: Rethinking off-policy distribution matching","author":"Sun","year":"2021","journal-title":"arXiv preprint"},{"key":"ref36","article-title":"Of moments and matching: Trade-offs and treatments in imitation learning","author":"Swamy","year":"2021","journal-title":"arXiv preprint"},{"key":"ref37","article-title":"Offline inverse reinforcement learning","author":"Jarboui","year":"2021","journal-title":"arXiv preprint"},{"key":"ref38","first-page":"10 122","article-title":"Maximum-likelihood inverse reinforcement learning with finite-time guarantees","volume":"35","author":"Zeng","year":"2022","journal-title":"Advances in Neural Information Processing Systems"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1145\/3219819.3219961"},{"key":"ref40","article-title":"Disagreement-regularized imitation learning","volume-title":"International Conference on Learning Representations","author":"Brantley","year":"2019"},{"key":"ref41","article-title":"Extrapolating beyond suboptimal demonstrations via inverse reinforcement learning from observations","volume-title":"International conference on machine learning. PMLR","author":"Brown","year":"2019"},{"key":"ref42","article-title":"Better-than-demonstrator imitation learning via automatically-ranked demonstrations","volume-title":"Conference on robot learning. PMLR","author":"Brown","year":"2020"},{"key":"ref43","article-title":"Variational imitation learning with diverse-quality demonstrations","volume-title":"Proceedings of the 37th International Conference on Machine Learning","author":"Tangkaratt","year":"2020"},{"key":"ref44","article-title":"Behavior retrieval: Fewshot imitation learning by querying unlabeled datasets","author":"Du","year":"2023","journal-title":"arXiv preprint"},{"key":"ref45","first-page":"1273","article-title":"Offline reinforcement learning as one big sequence modeling problem","volume":"34","author":"Janner","year":"2021","journal-title":"Advances in neural information processing systems"},{"key":"ref46","first-page":"22955","article-title":"Behavior transformers: Cloning k modes with one stone","volume":"35","author":"Shafiullah","year":"2022","journal-title":"Advances in neural information processing systems"},{"key":"ref47","article-title":"Attention is all you need","author":"Vaswani","year":"2017","journal-title":"Advances in neural information processing systems"},{"key":"ref48","article-title":"Decision transformer: Reinforcement learning via sequence modeling","author":"Chen","year":"2021","journal-title":"Advances in neural information processing systems"},{"key":"ref49","article-title":"From play to policy: Conditional behavior generation from uncurated robot data","author":"Cui","year":"2022","journal-title":"arXiv preprint"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1109\/IROS55552.2023.10342381"},{"key":"ref51","article-title":"Masked trajectory models for prediction, representation, and control","volume-title":"International Conference on Machine Learning. PMLR","author":"Wu","year":"2023"},{"key":"ref52","article-title":"SMART: Self-supervised multi-task pretraining with control transformers","volume-title":"International Conference on Learning Representations","author":"Sun","year":"2023"},{"key":"ref53","doi-asserted-by":"crossref","DOI":"10.1109\/TNN.1998.712192","volume-title":"Introduction to reinforcement learning","author":"Sutton","year":"1998"},{"key":"ref54","article-title":"Maniskill2: A unified benchmark for generalizable manipulation skills","volume-title":"International Conference on Learning Representations","author":"Gu","year":"2023"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.01111"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2018.XIV.049"},{"key":"ref57","article-title":"Proximal policy optimization algorithms","author":"Schulman","year":"2017","journal-title":"arXiv preprint"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.1109\/ICAR.2015.7251504"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2024.XX.120"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.15607\/rss.2023.xix.026"}],"event":{"name":"2025 IEEE International Conference on Robotics and Automation (ICRA)","start":{"date-parts":[[2025,5,19]]},"location":"Atlanta, GA, USA","end":{"date-parts":[[2025,5,23]]}},"container-title":["2025 IEEE International Conference on Robotics and Automation (ICRA)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/11127273\/11127223\/11127918.pdf?arnumber=11127918","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,9,3]],"date-time":"2025-09-03T06:16:40Z","timestamp":1756880200000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11127918\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,5,19]]},"references-count":60,"URL":"https:\/\/doi.org\/10.1109\/icra55743.2025.11127918","relation":{},"subject":[],"published":{"date-parts":[[2025,5,19]]}}}