{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,5]],"date-time":"2026-06-05T15:43:48Z","timestamp":1780674228926,"version":"3.54.1"},"reference-count":42,"publisher":"IEEE","license":[{"start":{"date-parts":[[2020,10,24]],"date-time":"2020-10-24T00:00:00Z","timestamp":1603497600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2020,10,24]],"date-time":"2020-10-24T00:00:00Z","timestamp":1603497600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2020,10,24]],"date-time":"2020-10-24T00:00:00Z","timestamp":1603497600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/501100004830","name":"Siemens","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100004830","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100000006","name":"Office of Naval Research","doi-asserted-by":"publisher","id":[{"id":"10.13039\/100000006","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2020,10,24]]},"DOI":"10.1109\/iros45743.2020.9341714","type":"proceedings-article","created":{"date-parts":[[2021,2,13]],"date-time":"2021-02-13T02:26:48Z","timestamp":1613183208000},"page":"5548-5555","source":"Crossref","is-referenced-by-count":125,"title":["Deep Reinforcement Learning for Industrial Insertion Tasks with Visual Inputs and Natural Rewards"],"prefix":"10.1109","author":[{"given":"Gerrit","family":"Schoettler","sequence":"first","affiliation":[{"name":"Siemens Corporation"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Ashvin","family":"Nair","sequence":"additional","affiliation":[{"name":"University of California,Berkeley"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jianlan","family":"Luo","sequence":"additional","affiliation":[{"name":"University of California,Berkeley"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Shikhar","family":"Bahl","sequence":"additional","affiliation":[{"name":"University of California,Berkeley"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Juan","family":"Aparicio Ojea","sequence":"additional","affiliation":[{"name":"Siemens Corporation"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Eugen","family":"Solowjow","sequence":"additional","affiliation":[{"name":"Siemens Corporation"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Sergey","family":"Levine","sequence":"additional","affiliation":[{"name":"University of California,Berkeley"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref39","article-title":"Addressing Function Approximation Error in Actor-Critic Methods","author":"fujimoto","year":"2018","journal-title":"ICML"},{"key":"ref38","article-title":"Continuous control with deep reinforcement learning","author":"lillicrap","year":"2016","journal-title":"ICLRE"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1109\/IROS.2014.6943123"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2019.XV.073"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2018.XIV.049"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2018.8463162"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-94568-2_12"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2019.8793506"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1109\/IROS.2017.8202244"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2017.7989043"},{"key":"ref10","first-page":"305","article-title":"Alvinn: An autonomous land vehicle in a neural network","author":"pomerleau","year":"1989","journal-title":"NIPS"},{"key":"ref40","doi-asserted-by":"crossref","DOI":"10.1609\/aaai.v30i1.10295","article-title":"Deep Reinforcement Learning with Double Q-learning","author":"van hasselt","year":"2016","journal-title":"AAAI"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1016\/j.robot.2004.03.003"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2011.VII.008"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2016.7487517"},{"key":"ref14","first-page":"2377","article-title":"A Machine Learning Approach to Visual Perception of Forest Trails for Mobile Robots","volume":"1","author":"giusti","year":"2015","journal-title":"IEEE l of Robotics and Automation"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/CVPRW.2018.00278"},{"key":"ref16","first-page":"465","article-title":"PILCO: A model-based and data-efficient approach to policy search","author":"deisenroth","year":"2011","journal-title":"ICML"},{"key":"ref17","first-page":"1607","article-title":"Relative Entropy Policy Search","author":"peters","year":"0"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1016\/j.neunet.2008.02.003"},{"key":"ref19","first-page":"1334","article-title":"End-to-End Training of Deep Visuomotor Policies","volume":"17","author":"levine","year":"2016","journal-title":"Journal of Machine Learning Research (JMLR)"},{"key":"ref28","first-page":"1433","article-title":"Maximum Entropy Inverse Reinforcement Learning","author":"ziebart","year":"2008","journal-title":"AAAI"},{"key":"ref4","article-title":"Policy invariance under reward transformations: Theory and application to reward shaping","author":"ng","year":"1999","journal-title":"ICML"},{"key":"ref27","article-title":"Guided Cost Learning: Deep Inverse Optimal Control via Policy Optimization","author":"finn","year":"2016","journal-title":"ICML"},{"key":"ref3","doi-asserted-by":"crossref","DOI":"10.1609\/aaai.v32i1.11796","article-title":"Rainbow: Combining improvements in deep reinforcement learning","author":"hessel","year":"2018","journal-title":"AAAI"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2014.X.031"},{"key":"ref29","article-title":"Learning from Demonstrations for Real World Reinforcement Learning","author":"hester","year":"2018","journal-title":"AAAI"},{"key":"ref5","article-title":"Data-efficient Deep Reinforcement Learning for Dexterous Manipulation","author":"popov","year":"2017","journal-title":"CoRR"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2019.8794127"},{"key":"ref7","article-title":"Visual Reinforcement Learning with Imagined Goals","author":"nair","year":"2018","journal-title":"NeurIPS"},{"key":"ref2","article-title":"Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor","author":"haarnoja","year":"2018","journal-title":"ICML"},{"key":"ref9","article-title":"Residual Policy Learning","author":"silver","year":"2018"},{"key":"ref1","first-page":"1","article-title":"Playing Atari with Deep Reinforcement Learning","author":"mnih","year":"2013","journal-title":"NIPS Workshop on Deep Learning"},{"key":"ref20","article-title":"Continuous Deep Q-Learning with Model-based Acceleration","author":"gu","year":"2016","journal-title":"ICML"},{"key":"ref22","article-title":"SOLAR: Deep Structured Representations for Model-Based Reinforcement Learning","author":"zhang","year":"2019","journal-title":"ICML"},{"key":"ref21","article-title":"Combining Model-Based and Model-Free Updates for Trajectory-Centric Reinforcement Learning","author":"chebotar","year":"2017","journal-title":"ICML"},{"key":"ref42","article-title":"Hindsight Experience Replay","author":"andrychowicz","year":"2017","journal-title":"NIPS"},{"key":"ref24","article-title":"QT-Opt: Scalable Deep Reinforcement Learning for Vision-Based Robotic Manipulation","author":"kalashnikov","year":"2018","journal-title":"CoRL"},{"key":"ref41","article-title":"Temporal Difference Models: Model-Free Deep RL For Model-Based Control","author":"pong","year":"2018","journal-title":"ICLRE"},{"key":"ref23","article-title":"Dexterous Manipulation with Deep Reinforcement Learning: Efficient, General, and Low-Cost","author":"zhu","year":"2018","journal-title":"ICRA"},{"key":"ref26","first-page":"83","article-title":"Policy search for motor primitives in robotics","volume":"97","author":"kober","year":"2008","journal-title":"NIPS"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2018.8460696"}],"event":{"name":"2020 IEEE\/RSJ International Conference on Intelligent Robots and Systems (IROS)","location":"Las Vegas, NV, USA","start":{"date-parts":[[2020,10,24]]},"end":{"date-parts":[[2021,1,24]]}},"container-title":["2020 IEEE\/RSJ International Conference on Intelligent Robots and Systems (IROS)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/9340668\/9340635\/09341714.pdf?arnumber=9341714","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,12,17]],"date-time":"2022-12-17T04:15:37Z","timestamp":1671250537000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/9341714\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2020,10,24]]},"references-count":42,"URL":"https:\/\/doi.org\/10.1109\/iros45743.2020.9341714","relation":{},"subject":[],"published":{"date-parts":[[2020,10,24]]}}}