{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,11,15]],"date-time":"2025-11-15T10:21:15Z","timestamp":1763202075205},"reference-count":31,"publisher":"IEEE","content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2017,5]]},"DOI":"10.1109\/icra.2017.7989680","type":"proceedings-article","created":{"date-parts":[[2017,7,25]],"date-time":"2017-07-25T17:44:28Z","timestamp":1501004668000},"page":"5798-5805","source":"Crossref","is-referenced-by-count":9,"title":["Probabilistically safe policy transfer"],"prefix":"10.1109","author":[{"given":"David","family":"Held","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zoe","family":"McCarthy","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Michael","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Fred","family":"Shentu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Pieter","family":"Abbeel","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1109\/ADPRL.2013.6614995"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1109\/IROS.2012.6386109"},{"key":"ref10","article-title":"Benchmarking deep reinforcement learning for continuous control","author":"duan","year":"2016","journal-title":"International Conference on Machine Learning (ICML)"},{"key":"ref11","article-title":"One-shot learning of manipulation skills with online dynamics adaptation and neural network priors","author":"fu","year":"2015","journal-title":"Proceedings of the 29th IEEE\/RSJ InternationalConference on Intelligent Robots and Systems (IROS)"},{"journal-title":"A comprehensive survey on safe reinforcement learning Journal of Machine Learning Research","year":"2015","author":"garcia","key":"ref12"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1007\/11871842_63"},{"key":"ref14","article-title":"Deep learning for reward design to improve monte carlo tree search in atari games","author":"guo","year":"2016","journal-title":"Conference on Uncertainty in Artificial Intelligence (UAI)"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1007\/3-540-45435-7_25"},{"key":"ref16","article-title":"End-to-end training of deep visuomotor policies","author":"levine","year":"2016","journal-title":"Journal of Machine Learning Research"},{"key":"ref17","article-title":"Asynchronous methods for deep reinforcement learning","author":"mnih","year":"2016","journal-title":"ICML"},{"key":"ref18","first-page":"529","author":"mnih","year":"2015","journal-title":"Human-level control through deep reinforcement learning Nature 518"},{"key":"ref19","first-page":"1711","article-title":"Safe exploration in markov decision processes","author":"moldovan","year":"2012","journal-title":"Proc of the International Conference on Machine Learning (ICML)"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1609\/aimag.v32i1.2329"},{"key":"ref4","article-title":"Policy gradients with variance related risk criteria","author":"castro","year":"2012","journal-title":"ICML"},{"key":"ref27","first-page":"484","author":"silver","year":"2016","journal-title":"Mastering the game of go with deep neural networks and tree search Nature 529"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2014.6907818"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2016.7487756"},{"journal-title":"A deep hierarchical approach to lifelong learning in minecraft","year":"2016","author":"tessler","key":"ref29"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2015.7139550"},{"key":"ref8","first-page":"465","article-title":"Pilco: A model-based and data-efficient approach to policy search","author":"deisenroth","year":"2011","journal-title":"28th International Conference on Machine Learning (ICML)"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2014.6907423"},{"journal-title":"Concrete problems in ai safety","year":"2016","author":"amodei","key":"ref2"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1287\/opre.1080.0685"},{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1007\/BF01414154"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2016.7487140"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1016\/j.neunet.2008.02.003"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-13823-7_31"},{"journal-title":"Progressive neural networks","year":"2016","author":"rusu","key":"ref24"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/ACC.2013.6580329"},{"key":"ref26","article-title":"High-dimensional continuous control using generalized advantage estimation","author":"schulman","year":"2016","journal-title":"ICLRE"},{"key":"ref25","first-page":"1889","article-title":"Trust region policy optimization","author":"schulman","year":"2015","journal-title":"Proceedings of The 32nd International Conference on Machine Learning"}],"event":{"name":"2017 IEEE International Conference on Robotics and Automation (ICRA)","start":{"date-parts":[[2017,5,29]]},"location":"Singapore, Singapore","end":{"date-parts":[[2017,6,3]]}},"container-title":["2017 IEEE International Conference on Robotics and Automation (ICRA)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/7960754\/7988677\/07989680.pdf?arnumber=7989680","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2017,8,16]],"date-time":"2017-08-16T11:38:17Z","timestamp":1502883497000},"score":1,"resource":{"primary":{"URL":"http:\/\/ieeexplore.ieee.org\/document\/7989680\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2017,5]]},"references-count":31,"URL":"https:\/\/doi.org\/10.1109\/icra.2017.7989680","relation":{},"subject":[],"published":{"date-parts":[[2017,5]]}}}