{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,3]],"date-time":"2026-07-03T16:20:57Z","timestamp":1783095657786,"version":"3.54.6"},"reference-count":52,"publisher":"IEEE","license":[{"start":{"date-parts":[[2021,9,27]],"date-time":"2021-09-27T00:00:00Z","timestamp":1632700800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2021,9,27]],"date-time":"2021-09-27T00:00:00Z","timestamp":1632700800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2021,9,27]],"date-time":"2021-09-27T00:00:00Z","timestamp":1632700800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2021,9,27]]},"DOI":"10.1109\/iros51168.2021.9636080","type":"proceedings-article","created":{"date-parts":[[2021,12,16]],"date-time":"2021-12-16T20:45:38Z","timestamp":1639687538000},"page":"7827-7834","source":"Crossref","is-referenced-by-count":48,"title":["Learning by Watching: Physical Imitation of Manipulation Skills from Human Videos"],"prefix":"10.1109","author":[{"given":"Haoyu","family":"Xiong","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Quanzhou","family":"Li","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yun-Chun","family":"Chen","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Homanga","family":"Bharadhwaj","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Samarth","family":"Sinha","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Animesh","family":"Garg","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01249-6_40"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.348"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00189"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.01291"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.01117"},{"key":"ref30","article-title":"Multimodal unsupervised image-to-image translation","author":"huang","year":"2018","journal-title":"ECCV"},{"key":"ref37","article-title":"Unsupervised learning of object landmarks through conditional image generation","author":"jakab","year":"2018","journal-title":"NeurIPS"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00285"},{"key":"ref35","article-title":"Transfer learning for related reinforcement learning tasks via image-to-image translation","author":"gamrian","year":"2019","journal-title":"ICML"},{"key":"ref34","article-title":"Learning cross-domain correspondence for control with dynamics cycle-consistency","author":"zhang","year":"2021","journal-title":"ICLRE"},{"key":"ref28","article-title":"Toward multimodal image-to-image translation","author":"zhu","year":"2017","journal-title":"NeurIPS"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00916"},{"key":"ref29","article-title":"Diverse image-to-image translation via disentangled representations","author":"lee","year":"2018","journal-title":"ECCV"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1145\/2157689.2157815"},{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/IROS.2011.6095059"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2018.XIV.002"},{"key":"ref22","article-title":"Graph-structured visual imitation","author":"sieb","year":"2020","journal-title":"CoRL"},{"key":"ref21","doi-asserted-by":"crossref","DOI":"10.1145\/3272127.3275014","article-title":"Sfv: Reinforcement learning of physical skills from videos","author":"peng","year":"2018","journal-title":"TOG"},{"key":"ref24","article-title":"Reinforcement learning with videos: Combining offline observations with interaction","author":"schmeckpeper","year":"2020","journal-title":"CoRL"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/HUMANOIDS.2018.8625007"},{"key":"ref26","article-title":"Unsupervised image-to-image translation networks","author":"liu","year":"2017","journal-title":"NeurIPS"},{"key":"ref25","article-title":"Learning Object Manipulation Skills via Approximate State Estimation from Real Videos","author":"petrik","year":"2020","journal-title":"CoRL"},{"key":"ref50","article-title":"Improving sample efficiency in model-free reinforcement learning from images","author":"yarats","year":"2019"},{"key":"ref51","article-title":"Variational inverse control with events: A general framework for data-driven reward definition","author":"fu","year":"2018","journal-title":"NeurIPS"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.24963\/ijcai.2018\/687"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2020.XVI.024"},{"key":"ref40","article-title":"Self-supervised learning of a facial attribute embedding from video","author":"wiles","year":"2018"},{"key":"ref11","article-title":"Third-person visual imitation learning via decoupled hierarchical controller","author":"sharma","year":"2019","journal-title":"NeurIPS"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.244"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00460"},{"key":"ref14","article-title":"Hindsight experience replay","author":"andrychowicz","year":"2017","journal-title":"NeurIPS"},{"key":"ref15","article-title":"Meta-world: A benchmark and evaluation for multi-task and meta reinforcement learning","author":"yu","year":"2019","journal-title":"CoRL"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2020.XVI.082"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2018.8462891"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/CVPRW.2018.00278"},{"key":"ref19","article-title":"Unsupervised perceptual rewards for imitation learning","author":"sermanet","year":"2016"},{"key":"ref4","article-title":"Learning collaborative manipulation tasks by demonstration using a haptic interface","author":"calinon","year":"2009","journal-title":"ICAR"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2018.8461249"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA40945.2020.9196935"},{"key":"ref5","article-title":"Roboturk: A crowdsourcing platform for robotic skill learning through imitation","author":"mandlekar","year":"2018","journal-title":"CoRL"},{"key":"ref8","article-title":"Human-in-the-loop imitation learning using remote teleoperation","author":"mandlekar","year":"2020"},{"key":"ref49","article-title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","author":"haarnoja","year":"2018"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2020.XVI.061"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2018.8462901"},{"key":"ref46","article-title":"Stochastic latent actor-critic: Deep reinforcement learning with a latent variable model","author":"lee","year":"2019"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1016\/j.neunet.2018.07.006"},{"key":"ref48","article-title":"Learning latent dynamics for planning from pixels","author":"hafner","year":"2019","journal-title":"ICML"},{"key":"ref47","article-title":"Solar: Deep structured representations for model-based reinforcement learning","author":"zhang","year":"2019","journal-title":"ICML"},{"key":"ref42","article-title":"Keypoints into the Future: Self-Supervised Correspondence in Model-Based Reinforcement Learning","author":"manuelli","year":"2020","journal-title":"CoRL"},{"key":"ref41","article-title":"Unsupervised learning of object keypoints for perception and control","author":"kulkarni","year":"2019","journal-title":"NeurIPS"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2016.7487173"},{"key":"ref43","article-title":"Unsupervised learning of object structure and dynamics from videos","author":"minderer","year":"2019"}],"event":{"name":"2021 IEEE\/RSJ International Conference on Intelligent Robots and Systems (IROS)","location":"Prague, Czech Republic","start":{"date-parts":[[2021,9,27]]},"end":{"date-parts":[[2021,10,1]]}},"container-title":["2021 IEEE\/RSJ International Conference on Intelligent Robots and Systems (IROS)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/9635848\/9635849\/09636080.pdf?arnumber=9636080","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,1,18]],"date-time":"2023-01-18T22:41:10Z","timestamp":1674081670000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/9636080\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2021,9,27]]},"references-count":52,"URL":"https:\/\/doi.org\/10.1109\/iros51168.2021.9636080","relation":{},"subject":[],"published":{"date-parts":[[2021,9,27]]}}}