{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,16]],"date-time":"2026-07-16T03:18:16Z","timestamp":1784171896495,"version":"3.55.0"},"reference-count":28,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"5","license":[{"start":{"date-parts":[[2023,5,1]],"date-time":"2023-05-01T00:00:00Z","timestamp":1682899200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2023,5,1]],"date-time":"2023-05-01T00:00:00Z","timestamp":1682899200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2023,5,1]],"date-time":"2023-05-01T00:00:00Z","timestamp":1682899200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/501100003803","name":"Platform Technology Fund of The University of Hong Kong","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100003803","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Neural Netw. Learning Syst."],"published-print":{"date-parts":[[2023,5]]},"DOI":"10.1109\/tnnls.2021.3107742","type":"journal-article","created":{"date-parts":[[2021,9,6]],"date-time":"2021-09-06T20:19:03Z","timestamp":1630959543000},"page":"2701-2708","source":"Crossref","is-referenced-by-count":53,"title":["Flying Through a Narrow Gap Using End-to-End Deep Reinforcement Learning Augmented With Curriculum Learning and Sim2Real"],"prefix":"10.1109","volume":"34","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-7819-9633","authenticated-orcid":false,"given":"Chenxi","family":"Xiao","sequence":"first","affiliation":[{"name":"Interdisciplinary Division of Aeronautical and Aviation Engineering, The Hong Kong Polytechnic University, Hong Kong"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-5611-4902","authenticated-orcid":false,"given":"Peng","family":"Lu","sequence":"additional","affiliation":[{"name":"Interdisciplinary Division of Aeronautical and Aviation Engineering, The Hong Kong Polytechnic University, Hong Kong"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-1492-8948","authenticated-orcid":false,"given":"Qizhi","family":"He","sequence":"additional","affiliation":[{"name":"School of Automation, Northwestern Polytechnical University, Xi&#x2019;an, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/IROS.2015.7354046"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/TMECH.2017.2675913"},{"key":"ref15","article-title":"Proximal policy optimization algorithms","author":"schulman","year":"2017","journal-title":"arXiv 1707 06347"},{"key":"ref14","article-title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","author":"haarnoja","year":"2018","journal-title":"arXiv 1801 01290"},{"key":"ref11","article-title":"Self-imitation learning via trajectory-conditioned policy for hard-exploration tasks","author":"guo","year":"2019","journal-title":"arXiv 1907 10247"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-67361-5_40"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/LRA.2016.2633290"},{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2017.7989679"},{"key":"ref17","first-page":"2575","article-title":"Variational dropout and the local reparameterization trick","author":"kingma","year":"2015","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref16","article-title":"Continuous control with deep reinforcement learning","author":"lillicrap","year":"2015","journal-title":"arXiv 1509 02971"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v30i1.10295"},{"key":"ref18","first-page":"2613","article-title":"Double Q-learning","volume":"23","author":"hasselt","year":"2010","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref24","article-title":"Model-agnostic meta-learning for fast adaptation of deep networks","author":"finn","year":"2017","journal-title":"arXiv 1703 03400"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2018.XIV.010"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1126\/scirobotics.aau5872"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1177\/0278364919887447"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1145\/1553374.1553380"},{"key":"ref22","article-title":"Transfer from simulation to real world through learning deep inverse dynamics model","author":"christiano","year":"2016","journal-title":"arXiv 1610 03518"},{"key":"ref21","article-title":"Deep Q-learning with Q-matrix transfer learning for novel fire evacuation environment","author":"sharma","year":"2020","journal-title":"IEEE Trans Syst Man Cybern Syst"},{"key":"ref28","first-page":"1162","article-title":"Active domain randomization","author":"mehta","year":"2020","journal-title":"Proc Conf Robot Learn"},{"key":"ref27","article-title":"On first-order meta-learning algorithms","author":"nichol","year":"2018","journal-title":"arXiv 1803 02999"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2017.2654539"},{"key":"ref7","article-title":"Learning unmanned aerial vehicle control for autonomous target following","author":"li","year":"2017","journal-title":"arXiv 1709 08233"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/IROS40897.2019.8967944"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/LRA.2017.2720851"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2016.7487175"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/LRA.2019.2930489"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/IROS40897.2019.8967695"}],"container-title":["IEEE Transactions on Neural Networks and Learning Systems"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/5962385\/10114428\/09530254.pdf?arnumber=9530254","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,5,22]],"date-time":"2023-05-22T17:53:46Z","timestamp":1684778026000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/9530254\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023,5]]},"references-count":28,"journal-issue":{"issue":"5"},"URL":"https:\/\/doi.org\/10.1109\/tnnls.2021.3107742","relation":{},"ISSN":["2162-237X","2162-2388"],"issn-type":[{"value":"2162-237X","type":"print"},{"value":"2162-2388","type":"electronic"}],"subject":[],"published":{"date-parts":[[2023,5]]}}}