{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,11,5]],"date-time":"2025-11-05T06:46:27Z","timestamp":1762325187905,"version":"3.37.3"},"reference-count":27,"publisher":"IEEE","license":[{"start":{"date-parts":[[2021,9,27]],"date-time":"2021-09-27T00:00:00Z","timestamp":1632700800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2021,9,27]],"date-time":"2021-09-27T00:00:00Z","timestamp":1632700800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2021,9,27]],"date-time":"2021-09-27T00:00:00Z","timestamp":1632700800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/501100000266","name":"Engineering and Physical Sciences Research Council","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100000266","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2021,9,27]]},"DOI":"10.1109\/iros51168.2021.9636167","type":"proceedings-article","created":{"date-parts":[[2021,12,16]],"date-time":"2021-12-16T20:45:38Z","timestamp":1639687538000},"page":"3499-3505","source":"Crossref","is-referenced-by-count":2,"title":["HARL-A: Hardware Agnostic Reinforcement Learning Through Adversarial Selection"],"prefix":"10.1109","author":[{"given":"Lucy","family":"Jackson","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Steve","family":"Eckersley","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Pete","family":"Senior","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Simon","family":"Hadfield","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2014.6907694"},{"key":"ref11","first-page":"501","article-title":"Transfer in deep reinforcement learning using successor features and generalised policy improvement","volume":"80","author":"barreto","year":"2018","journal-title":"Machine Learning Research"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2018.8463147"},{"key":"ref13","article-title":"Sim-to-real transfer of robotic control with dynamics randomization","author":"peng","year":"2017","journal-title":"CoRR"},{"key":"ref14","article-title":"Continuous adaptation via meta-learning in nonstationary and competitive environments","author":"al-shedivat","year":"2017","journal-title":"CoRR"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/IROS.2017.8202133"},{"key":"ref16","article-title":"Policy transfer with strategy optimization","author":"yu","year":"2018","journal-title":"CoRR"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2017.7989250"},{"key":"ref18","first-page":"1126","article-title":"Model-agnostic meta-learning for fast adapation of deep networks","author":"finn","year":"2017","journal-title":"Proc of the International Conference on Machine Learning (ICML)"},{"key":"ref19","article-title":"Learning to adapt in dynamic, real-world environments through meta-reinforcement learning","author":"nagabandi","year":"2018","journal-title":"CoRR"},{"key":"ref4","doi-asserted-by":"crossref","DOI":"10.1609\/aaai.v32i1.11694","article-title":"Deep reinforcement learning that matters","author":"henderson","year":"2018","journal-title":"The 32nd AAAI Conference on Artificial Intelligence"},{"key":"ref27","first-page":"1889","article-title":"Trust region policy optimization","volume":"37","author":"schulman","year":"0"},{"key":"ref3","article-title":"Deep reinforcement learning: An overiview","author":"lui","year":"2017","journal-title":"CoRR"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/IROS.2016.7759592"},{"key":"ref5","first-page":"1633","article-title":"Transfer learning for reinforcement learning domains: A survey","volume":"10","author":"taylor","year":"2009","journal-title":"Journal of Machine Learning Research"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/IROS.2017.8206342"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2019.8793789"},{"key":"ref2","article-title":"Continuous control with deep reinforcement learning","author":"lillicrap","year":"2015","journal-title":"Proc in 4th International Conference on Learning Representations (ICLR)"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2017.7989249"},{"key":"ref1","doi-asserted-by":"crossref","first-page":"484","DOI":"10.1038\/nature16961","article-title":"Mastering the game of go with deep neural networks and tree search","volume":"529","author":"silver","year":"2016","journal-title":"Nature (London)"},{"key":"ref20","article-title":"Hardware conditioned policies for multi-robot transfer learning","author":"chen","year":"2018","journal-title":"CoRR"},{"key":"ref22","article-title":"Robust adversarial reinforcement learning","author":"pinto","year":"2017","journal-title":"Proc of the International Conference on Machine Learning (ICML)"},{"key":"ref21","article-title":"Epopt: Learning robust neural network policies using model ensembles","author":"rajeswaran","year":"2017","journal-title":"Proc 5th International Conference on Learning Representations (ICLR)"},{"article-title":"Emergent complexity via multi-agent competition","year":"2018","author":"bansal","key":"ref24"},{"key":"ref23","article-title":"Extending robust adversarial reinforcement learning considering adaptation and diversity","author":"shioya","year":"2018","journal-title":"Proc 6th International Conference on Learning Representations (ICLR)"},{"key":"ref26","article-title":"Openai gym","author":"brockman","year":"2016","journal-title":"CoRR"},{"key":"ref25","article-title":"Proximal policy optimization algorithms","author":"schulman","year":"2017","journal-title":"CoRR"}],"event":{"name":"2021 IEEE\/RSJ International Conference on Intelligent Robots and Systems (IROS)","start":{"date-parts":[[2021,9,27]]},"location":"Prague, Czech Republic","end":{"date-parts":[[2021,10,1]]}},"container-title":["2021 IEEE\/RSJ International Conference on Intelligent Robots and Systems (IROS)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/9635848\/9635849\/09636167.pdf?arnumber=9636167","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,1,18]],"date-time":"2023-01-18T22:39:12Z","timestamp":1674081552000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/9636167\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2021,9,27]]},"references-count":27,"URL":"https:\/\/doi.org\/10.1109\/iros51168.2021.9636167","relation":{},"subject":[],"published":{"date-parts":[[2021,9,27]]}}}