{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,21]],"date-time":"2026-07-21T14:55:43Z","timestamp":1784645743685,"version":"3.55.0"},"reference-count":48,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"9","license":[{"start":{"date-parts":[[2023,9,1]],"date-time":"2023-09-01T00:00:00Z","timestamp":1693526400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2023,9,1]],"date-time":"2023-09-01T00:00:00Z","timestamp":1693526400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2023,9,1]],"date-time":"2023-09-01T00:00:00Z","timestamp":1693526400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/501100012166","name":"National Key Research and Development Program of China","doi-asserted-by":"publisher","award":["2018AAA0101005"],"award-info":[{"award-number":["2018AAA0101005"]}],"id":[{"id":"10.13039\/501100012166","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62293541"],"award-info":[{"award-number":["62293541"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100002367","name":"Strategic Priority Research Program of Chinese Academy of Sciences","doi-asserted-by":"publisher","award":["XDA27030400"],"award-info":[{"award-number":["XDA27030400"]}],"id":[{"id":"10.13039\/501100002367","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100002367","name":"Youth Innovation Promotion Association CAS","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100002367","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Syst. Man Cybern, Syst."],"published-print":{"date-parts":[[2023,9]]},"DOI":"10.1109\/tsmc.2023.3270444","type":"journal-article","created":{"date-parts":[[2023,5,8]],"date-time":"2023-05-08T18:57:11Z","timestamp":1683572231000},"page":"5417-5429","source":"Crossref","is-referenced-by-count":79,"title":["A Hierarchical Deep Reinforcement Learning Framework for 6-DOF UCAV Air-to-Air Combat"],"prefix":"10.1109","volume":"53","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-7611-064X","authenticated-orcid":false,"given":"Jiajun","family":"Chai","sequence":"first","affiliation":[{"name":"State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0003-3395-0221","authenticated-orcid":false,"given":"Wenzhang","family":"Chen","sequence":"additional","affiliation":[{"name":"State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-5384-423X","authenticated-orcid":false,"given":"Yuanheng","family":"Zhu","sequence":"additional","affiliation":[{"name":"State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zong-Xin","family":"Yao","sequence":"additional","affiliation":[{"name":"Department of Unmanned Aerial Vehicle, Shenyang Aircraft Design and Research Institute, Shenyang, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-8218-9633","authenticated-orcid":false,"given":"Dongbin","family":"Zhao","sequence":"additional","affiliation":[{"name":"State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.2139\/ssrn.3593220"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1016\/j.futures.2021.102848"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.3390\/electronics11030467"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1016\/j.ast.2017.11.014"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1016\/j.dt.2021.09.014"},{"key":"ref6","article-title":"Games of pursuit","author":"Isaacs","year":"1951"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.3906\/elk-1201-50"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/DASC.1992.282166"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.2514\/6.2011-6241"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.2514\/1.46815"},{"key":"ref11","article-title":"A survey of deep reinforcement learning in video games","author":"Shao","year":"2019","journal-title":"arXiv:1912.10944"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2020.3041469"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1038\/nature24270"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1109\/TG.2020.3022698"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1038\/s41586-019-1724-z"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1109\/TETCI.2018.2823329"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2021.3105869"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/tcyb.2022.3179775"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/TSMC.2021.3105663"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1007\/s40747-021-00577-6"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1038\/nature14236"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/ACCESS.2019.2961426"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/IAEAC47372.2019.8998066"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1109\/CAC.2018.8623434"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1155\/2022\/1477078"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1109\/CoG51982.2022.9893690"},{"key":"ref27","article-title":"Case study: Development of a baseline controller for automatic landing of an F-16 aircraft using linear matrix inequalities","author":"Seto","year":"2000"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.5139\/IJASS.2016.17.2.204"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1155\/2020\/7180639"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1109\/ICCA51439.2020.9264567"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2018.2805379"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1016\/j.ast.2019.105534"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.29007\/91x9"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.2514\/3.20932"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.2991\/icmra-15.2015.103"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1109\/NAECON.1995.521982"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1109\/TSMC.2020.2981192"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1109\/TSMC.2018.2850701"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1109\/TSMC.2015.2389752"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1109\/ICCAIS.2018.8570323"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1109\/ICUAS51884.2021.9476700"},{"key":"ref42","first-page":"1861","article-title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","volume-title":"Proc. 35th Int. Conf. Mach. Learn.","volume":"80","author":"Haarnoja"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.11648\/j.acis.20190701.15"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1002\/9781119174882"},{"key":"ref45","article-title":"Proximal policy optimization algorithms","author":"Schulman","year":"2017","journal-title":"arXiv:1707.06347"},{"key":"ref46","article-title":"High-dimensional continuous control using generalized advantage estimation","author":"Schulman","year":"2015","journal-title":"arXiv:1506.02438"},{"issue":"1","key":"ref47","first-page":"374","article-title":"Iterative solution of games by fictitious play","volume":"13","author":"Brown","year":"1951","journal-title":"Act. Anal. Prod. Allocation"},{"key":"ref48","first-page":"3053","article-title":"RLlib: Abstractions for distributed reinforcement learning","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Liang"}],"container-title":["IEEE Transactions on Systems, Man, and Cybernetics: Systems"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/6221021\/10223302\/10120732.pdf?arnumber=10120732","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,3,1]],"date-time":"2024-03-01T04:55:43Z","timestamp":1709268943000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/10120732\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023,9]]},"references-count":48,"journal-issue":{"issue":"9"},"URL":"https:\/\/doi.org\/10.1109\/tsmc.2023.3270444","relation":{},"ISSN":["2168-2216","2168-2232"],"issn-type":[{"value":"2168-2216","type":"print"},{"value":"2168-2232","type":"electronic"}],"subject":[],"published":{"date-parts":[[2023,9]]}}}