{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,3,5]],"date-time":"2026-03-05T14:26:45Z","timestamp":1772720805956,"version":"3.50.1"},"reference-count":33,"publisher":"IEEE","license":[{"start":{"date-parts":[[2020,7,1]],"date-time":"2020-07-01T00:00:00Z","timestamp":1593561600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/Crown.html"},{"start":{"date-parts":[[2020,7,1]],"date-time":"2020-07-01T00:00:00Z","timestamp":1593561600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2020,7,1]],"date-time":"2020-07-01T00:00:00Z","timestamp":1593561600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2020,7]]},"DOI":"10.1109\/ijcnn48605.2020.9207344","type":"proceedings-article","created":{"date-parts":[[2020,9,29]],"date-time":"2020-09-29T20:40:33Z","timestamp":1601412033000},"page":"1-10","source":"Crossref","is-referenced-by-count":7,"title":["Learning Transferable Domain Priors for Safe Exploration in Reinforcement Learning"],"prefix":"10.1109","author":[{"given":"Thommen George","family":"Karimpanal","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Santu","family":"Rana","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Sunil","family":"Gupta","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Truyen","family":"Tran","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Svetha","family":"Venkatesh","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref33","article-title":"Adam: A method for stochastic optimization","author":"kingma","year":"2014"},{"key":"ref32","article-title":"Openai gym","author":"brockman","year":"2016"},{"key":"ref31","article-title":"Playing atari with deep reinforcement learning","author":"mnih","year":"2013"},{"key":"ref30","article-title":"Continuous control with deep reinforcement learning","author":"lillicrap","year":"2015"},{"key":"ref10","article-title":"An optimal online method of selecting source policies for reinforcement learning","author":"li","year":"2018","journal-title":"Thirty-Second AAAI Conference on Artificial Intelligence"},{"key":"ref11","article-title":"Transfer in deep reinforcement learning using successor features and generalised policy improvement","author":"barreto","year":"2019"},{"key":"ref12","first-page":"22","article-title":"Constrained policy optimization","author":"achiam","year":"0"},{"key":"ref13","article-title":"Benchmarking safe exploration in deep reinforcement learning","author":"ray","year":"0"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1613\/jair.3761"},{"key":"ref15","doi-asserted-by":"crossref","DOI":"10.1609\/aaai.v32i1.11797","article-title":"Safe reinforcement learning via shielding","author":"alshiekh","year":"2018","journal-title":"Thirty-Second AAAI Conference on Artificial Intelligence"},{"key":"ref16","first-page":"3562","article-title":"Learn what not to learn: Action elimination with deep reinforcement learning","author":"zahavy","year":"2018","journal-title":"Advances in neural information processing systems"},{"key":"ref17","first-page":"78712","article-title":"Continual learning in reinforcement environments","author":"ring","year":"1994","journal-title":"Ph D Dissertation"},{"key":"ref18","first-page":"289","article-title":"Off-policy learning with eligibility traces: a survey","volume":"15","author":"geist","year":"2014","journal-title":"Journal of Machine Learning Research"},{"key":"ref19","first-page":"4055","article-title":"Successor features for transfer in reinforcement learning","author":"barreto","year":"2017","journal-title":"Advances in neural information processing systems"},{"key":"ref28","article-title":"Asynchronous methods for deep reinforcement learning","author":"mnih","year":"2016","journal-title":"International Conference on Machine Learning"},{"key":"ref4","doi-asserted-by":"crossref","first-page":"484","DOI":"10.1038\/nature16961","article-title":"Mastering the game of go with deep neural networks and tree search","volume":"529","author":"silver","year":"2016","journal-title":"Nature"},{"key":"ref27","article-title":"Learningfrom delayed rewards","author":"watkins","year":"1989","journal-title":"Phdthesis"},{"key":"ref3","doi-asserted-by":"crossref","first-page":"529","DOI":"10.1038\/nature14236","article-title":"Human-level control through deep reinforcement learning","volume":"518","author":"mnih","year":"2015","journal-title":"Nature"},{"key":"ref6","first-page":"1348","article-title":"Investigating human priors for playing video games","author":"dubey","year":"2018","journal-title":"International Conference on Machine Learning"},{"key":"ref29","article-title":"Proximal policy optimization algorithms","author":"schulman","year":"2017"},{"key":"ref5","article-title":"Inverted autonomous helicopter flight via reinforcement learning","author":"ng","year":"2004","journal-title":"International Symposium on Experimental Robotics"},{"key":"ref8","first-page":"1633","article-title":"Transfer learning for reinforcement learning domains: A survey","volume":"10","author":"taylor","year":"2009","journal-title":"Journal of Machine Learning Research"},{"key":"ref7","first-page":"1437","article-title":"A comprehensive survey on safe reinforcement learning","volume":"16","author":"garcia","year":"2015","journal-title":"Journal of Machine Learning Research"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1145\/203330.203343"},{"key":"ref9","first-page":"720","article-title":"Probabilistic policy reuse in a reinforcement learning agent","author":"fern\u00e1ndez","year":"0"},{"key":"ref1","article-title":"Reinforcement learning: An introduction","author":"sutton","year":"2011"},{"key":"ref20","article-title":"Universal successor representations for transfer reinforcement learning","author":"ma","year":"2018"},{"key":"ref22","article-title":"Sample-efficient reinforcement learning through transfer and architectural priors","author":"spector","year":"2018"},{"key":"ref21","article-title":"Kickstarting deep reinforcement learning","author":"schmitt","year":"2018"},{"key":"ref24","article-title":"Diverse exploration for fast and safe policy improvement","author":"cohen","year":"2018","journal-title":"Thirty-Second AAAI Conference on Artificial Intelligence"},{"key":"ref23","article-title":"Ai safety gridworlds","author":"leike","year":"2017"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.21236\/ADA280862"},{"key":"ref25","first-page":"2361","article-title":"Safe policy search for lifelong reinforcement learning with sublinear regret","author":"ammar","year":"2015","journal-title":"International Conference on Machine Learning"}],"event":{"name":"2020 International Joint Conference on Neural Networks (IJCNN)","location":"Glasgow, United Kingdom","start":{"date-parts":[[2020,7,19]]},"end":{"date-parts":[[2020,7,24]]}},"container-title":["2020 International Joint Conference on Neural Networks (IJCNN)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/9200848\/9206590\/09207344.pdf?arnumber=9207344","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,10,8]],"date-time":"2023-10-08T13:39:32Z","timestamp":1696772372000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/9207344\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2020,7]]},"references-count":33,"URL":"https:\/\/doi.org\/10.1109\/ijcnn48605.2020.9207344","relation":{},"subject":[],"published":{"date-parts":[[2020,7]]}}}