{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2024,10,30]],"date-time":"2024-10-30T02:47:48Z","timestamp":1730256468272,"version":"3.28.0"},"reference-count":55,"publisher":"IEEE","license":[{"start":{"date-parts":[[2023,12,16]],"date-time":"2023-12-16T00:00:00Z","timestamp":1702684800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2023,12,16]],"date-time":"2023-12-16T00:00:00Z","timestamp":1702684800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2023,12,16]]},"DOI":"10.1109\/icsai61474.2023.10423342","type":"proceedings-article","created":{"date-parts":[[2024,2,9]],"date-time":"2024-02-09T18:24:28Z","timestamp":1707503068000},"page":"1-8","source":"Crossref","is-referenced-by-count":1,"title":["Reinforcement Learning Methods for Fixed-Wing Aircraft Control"],"prefix":"10.1109","author":[{"given":"Lun","family":"Li","sequence":"first","affiliation":[{"name":"Nankai University Institute of Robotics and Automatic Information System Tianjin Key Laboratory of Intelligent Robotics,College of Artificial Intelligence,Tianjin,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xuebo","family":"Zhang","sequence":"additional","affiliation":[{"name":"Nankai University Institute of Robotics and Automatic Information System Tianjin Key Laboratory of Intelligent Robotics,College of Artificial Intelligence,Tianjin,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yang","family":"Wang","sequence":"additional","affiliation":[{"name":"Tianjin Municipal Data Management Center,Tianjin,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Chenxu","family":"Qian","sequence":"additional","affiliation":[{"name":"Nankai University Institute of Robotics and Automatic Information System Tianjin Key Laboratory of Intelligent Robotics,College of Artificial Intelligence,Tianjin,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Minghui","family":"Zhao","sequence":"additional","affiliation":[{"name":"Nankai University Institute of Robotics and Automatic Information System Tianjin Key Laboratory of Intelligent Robotics,College of Artificial Intelligence,Tianjin,China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/ACCESS.2023.3257849"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1515\/9781400840601"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/ICUAS.2019.8798254"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2023.3263430"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.2307\/2334029"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/TSMC.2023.3270444"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.3390\/drones7070418"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.2514\/6.2020-1234"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.2514\/6.2020-0136"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1016\/j.ifacol.2022.12.035"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1007\/s11071-023-08725-y"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.3390\/a16060282"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.2514\/6.2021-1282"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1145\/3306618.3314283"},{"key":"ref15","first-page":"1861","article-title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","volume-title":"International Conference on Machine Learning","author":"Haarnoja"},{"article-title":"Deep reinforcement learning in the enterprise: Bridging the gap from games to industry","volume-title":"Artificial Intelligence Conference Presentation","author":"Hammond","key":"ref16"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/LRA.2020.3011351"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/BDAI56143.2022.9862674"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2019.8794206"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-77939-9_2"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1038\/s41586-023-06419-4"},{"key":"ref22","article-title":"Regret-based reward elicitation for Markov decision processes","volume-title":"PhD thesis","author":"Kevin","year":"2014"},{"article-title":"Application of reinforcement learning in heading control of a fixed wing uav using x-plane platform","year":"2017","author":"Kimathi","key":"ref23"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1109\/ME54704.2022.9983345"},{"key":"ref25","article-title":"A brief review on Unmanned Combat Aerial Vehicle (UCAV)","author":"Kumar","year":"2020","journal-title":"Available at SSRN 3593220"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1109\/CoG51982.2022.9893690"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1007\/s00521-023-08232-6"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.32657\/10356\/90191"},{"key":"ref29","first-page":"22270","article-title":"Meta-reward-net: Implicitly differentiable reward learning for preference-based reinforcement learning","volume":"35","author":"Liu","year":"2022","journal-title":"Advances in Neural Information Processing Systems"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1109\/CAC.2018.8623434"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1038\/nature14236"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/CAC57257.2022.10055344"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1109\/ICUAS51884.2021.9476700"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1109\/tai.2022.3222143"},{"key":"ref35","first-page":"463","article-title":"Learning to drive a bicycle using reinforcement learning and shaping","volume":"98","author":"Randlov","year":"1998","journal-title":"ICML"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1109\/SITIS57111.2022.00102"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-98404-5_59"},{"article-title":"Proximal policy optimization algorithms","year":"2017","author":"Schulman","key":"ref38"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1109\/tnn.1998.712192"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1109\/ICUAS48674.2020.9213987"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1109\/TITS.2021.3055899"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1109\/ICMLA.2018.00138"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.32604\/jiot.2022.031043"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1007\/978-981-99-0479-2_125"},{"key":"ref45","first-page":"31","article-title":"Exponentially weighted imitation learning for batched historical data","author":"Wang","year":"2018","journal-title":"Advances in Neural Information Processing Systems"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1155\/2022\/1477078"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.1155\/2020\/7180639"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1016\/j.ast.2022.107623"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.3390\/drones7010028"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1109\/IAEAC47372.2019.8998066"},{"article-title":"Guarded Policy Optimization with Imperfect Online Demonstrations","year":"2023","author":"Xue","key":"ref51"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1109\/ICCA.2019.8899703"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.1007\/s10846-023-01953-9"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1109\/CCDC52312.2021.9602605"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1109\/ICUS50048.2020.9274875"}],"event":{"name":"2023 9th International Conference on Systems and Informatics (ICSAI)","start":{"date-parts":[[2023,12,16]]},"location":"Changsha, China","end":{"date-parts":[[2023,12,18]]}},"container-title":["2023 9th International Conference on Systems and Informatics (ICSAI)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/10423279\/10423280\/10423342.pdf?arnumber=10423342","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,3,3]],"date-time":"2024-03-03T12:08:35Z","timestamp":1709467715000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/10423342\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023,12,16]]},"references-count":55,"URL":"https:\/\/doi.org\/10.1109\/icsai61474.2023.10423342","relation":{},"subject":[],"published":{"date-parts":[[2023,12,16]]}}}