{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,9,11]],"date-time":"2025-09-11T20:22:37Z","timestamp":1757622157364,"version":"3.44.0"},"reference-count":61,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"9","license":[{"start":{"date-parts":[[2025,9,1]],"date-time":"2025-09-01T00:00:00Z","timestamp":1756684800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/legalcode"}],"funder":[{"DOI":"10.13039\/501100005089","name":"Beijing Natural Science Foundation","doi-asserted-by":"publisher","award":["JQ23016"],"award-info":[{"award-number":["JQ23016"]}],"id":[{"id":"10.13039\/501100005089","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62476273"],"award-info":[{"award-number":["62476273"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Neural Netw. Learning Syst."],"published-print":{"date-parts":[[2025,9]]},"DOI":"10.1109\/tnnls.2025.3567001","type":"journal-article","created":{"date-parts":[[2025,5,20]],"date-time":"2025-05-20T13:15:58Z","timestamp":1747746958000},"page":"17239-17252","source":"Crossref","is-referenced-by-count":0,"title":["UBG: An Unreal BattleGround Benchmark With Object-Aware Hierarchical Proximal Policy Optimization"],"prefix":"10.1109","volume":"36","author":[{"ORCID":"https:\/\/orcid.org\/0009-0001-5449-5155","authenticated-orcid":false,"given":"Longyu","family":"Niu","sequence":"first","affiliation":[{"name":"State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences (CASIA), Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Baihui","family":"Li","sequence":"additional","affiliation":[{"name":"State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences (CASIA), Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xingjian","family":"Fan","sequence":"additional","affiliation":[{"name":"School of Computer Science and Technology, Nanjing University of Posts and Telecommunications (NJUPT), Nanjing, Jiangsu, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-1321-3035","authenticated-orcid":false,"given":"Hao","family":"Fang","sequence":"additional","affiliation":[{"name":"State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences (CASIA), Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-9169-7194","authenticated-orcid":false,"given":"Jun","family":"Li","sequence":"additional","affiliation":[{"name":"State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences (CASIA), Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-6801-0510","authenticated-orcid":false,"given":"Junliang","family":"Xing","sequence":"additional","affiliation":[{"name":"Department of Computer Science and Technology, Tsinghua University, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-4735-2885","authenticated-orcid":false,"given":"Jun","family":"Wan","sequence":"additional","affiliation":[{"name":"State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences (CASIA), Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-0791-189X","authenticated-orcid":false,"given":"Zhen","family":"Lei","sequence":"additional","affiliation":[{"name":"State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences (CASIA), Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref1","article-title":"Dota 2 with large scale deep reinforcement learning","author":"OpenAI","year":"2019","journal-title":"arXiv:1912.06680"},{"doi-asserted-by":"publisher","key":"ref2","DOI":"10.1038\/nature14236"},{"key":"ref3","article-title":"JueWu-MC: Playing minecraft with sample-efficient hierarchical reinforcement learning","author":"Lin","year":"2021","journal-title":"arXiv:2112.04907"},{"key":"ref4","first-page":"4246","article-title":"The malmo platform for artificial intelligence experimentation","volume-title":"Proc. IJCAI","author":"Johnson"},{"key":"ref5","article-title":"End-to-end deep reinforcement learning for lane keeping assist","author":"El Sallab","year":"2016","journal-title":"arXiv:1612.04340"},{"key":"ref6","article-title":"Playing doom with SLAM-augmented deep reinforcement learning","author":"Bhatti","year":"2016","journal-title":"arXiv:1612.00380"},{"doi-asserted-by":"publisher","key":"ref7","DOI":"10.1609\/aaai.v34i04.6144"},{"doi-asserted-by":"publisher","key":"ref8","DOI":"10.1609\/aaai.v33i01.3301954"},{"doi-asserted-by":"publisher","key":"ref9","DOI":"10.1609\/aaai.v31i1.10827"},{"doi-asserted-by":"publisher","key":"ref10","DOI":"10.1109\/CIG.2016.7860433"},{"doi-asserted-by":"publisher","key":"ref11","DOI":"10.1109\/TG.2018.2877047"},{"key":"ref12","first-page":"1","article-title":"Clyde: A deep reinforcement learning doom playing agent","volume-title":"Proc. AAAI Workshops","author":"Ratcliffe"},{"doi-asserted-by":"publisher","key":"ref13","DOI":"10.24963\/ijcai.2019\/482"},{"doi-asserted-by":"publisher","key":"ref14","DOI":"10.1007\/11552413_40"},{"doi-asserted-by":"publisher","key":"ref15","DOI":"10.1109\/CoG51982.2022.9893617"},{"doi-asserted-by":"publisher","key":"ref16","DOI":"10.1093\/oso\/9780198538677.003.0006"},{"key":"ref17","article-title":"DeepMind lab","author":"Beattie","year":"2016","journal-title":"arXiv:1612.03801"},{"key":"ref18","article-title":"Making efficient use of demonstrations to solve hard exploration problems","author":"Le Paine","year":"2019","journal-title":"arXiv:1909.01387"},{"key":"ref19","first-page":"4499","article-title":"Distral: Robust multitask reinforcement learning","volume":"30","author":"Teh","year":"2017","journal-title":"NeurIPS"},{"key":"ref20","article-title":"WILD-SCAV: Benchmarking FPS gaming AI on Unity3D-based environments","author":"Chen","year":"2022","journal-title":"arXiv:2210.09026"},{"doi-asserted-by":"publisher","key":"ref21","DOI":"10.1613\/jair.3912"},{"doi-asserted-by":"publisher","key":"ref22","DOI":"10.1038\/s41586-019-1724-z"},{"doi-asserted-by":"publisher","key":"ref23","DOI":"10.1109\/TG.2023.3259724"},{"doi-asserted-by":"publisher","key":"ref24","DOI":"10.1109\/TG.2019.2896986"},{"key":"ref25","article-title":"Learning neuro-symbolic skills for bilevel planning","author":"Silver","year":"2022","journal-title":"arXiv:2206.10680"},{"doi-asserted-by":"publisher","key":"ref26","DOI":"10.1109\/CIG.2009.5286463"},{"key":"ref27","first-page":"271","article-title":"Feudal reinforcement learning","volume-title":"Proc. NIPS","volume":"5","author":"Dayan"},{"key":"ref28","first-page":"3540","article-title":"Feudal networks for hierarchical reinforcement learning","volume-title":"Proc. Int. Conf. Mach. Learn. (ICML)","author":"Vezhnevets"},{"doi-asserted-by":"publisher","key":"ref29","DOI":"10.1016\/S0004-3702(99)00052-1"},{"doi-asserted-by":"publisher","key":"ref30","DOI":"10.1609\/aaai.v31i1.10916"},{"key":"ref31","first-page":"3682","article-title":"Hierarchical deep reinforcement learning: Integrating temporal abstraction and intrinsic motivation","volume-title":"Proc. NIPS","volume":"29","author":"Kulkarni"},{"doi-asserted-by":"publisher","key":"ref32","DOI":"10.1613\/jair.639"},{"doi-asserted-by":"publisher","key":"ref33","DOI":"10.1007\/978-3-642-32375-1_2"},{"key":"ref34","article-title":"Learning multi-level hierarchies with hindsight","author":"Levy","year":"2017","journal-title":"arXiv:1712.00948"},{"key":"ref35","first-page":"1","article-title":"Data-efficient hierarchical reinforcement learning","volume-title":"Proc. NeurIPS","author":"Nachum"},{"key":"ref36","first-page":"627","article-title":"A reduction of imitation learning and structured prediction to no-regret online learning","volume-title":"Proc. 14th Int. Conf. Artif. Intell. Statist.","author":"Ross"},{"key":"ref37","first-page":"1","article-title":"Algorithms for inverse reinforcement learning","volume-title":"Proc. ICML","volume":"1","author":"Ng"},{"key":"ref38","article-title":"Relay policy learning: Solving long-horizon tasks via imitation and reinforcement learning","author":"Gupta","year":"2019","journal-title":"arXiv:1910.11956"},{"doi-asserted-by":"publisher","key":"ref39","DOI":"10.1109\/ICRA.2018.8463162"},{"key":"ref40","first-page":"2469","article-title":"Policy optimization with demonstrations","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Kang"},{"key":"ref41","article-title":"Proximal policy optimization algorithms","author":"Schulman","year":"2017","journal-title":"arXiv:1707.06347"},{"key":"ref42","article-title":"High-dimensional continuous control using generalized advantage estimation","author":"Schulman","year":"2015","journal-title":"arXiv:1506.02438"},{"doi-asserted-by":"publisher","key":"ref43","DOI":"10.1609\/aaai.v32i1.11757"},{"key":"ref44","article-title":"Leveraging demonstrations for deep reinforcement learning on robotics problems with sparse rewards","author":"Vecerik","year":"2017","journal-title":"arXiv:1707.08817"},{"key":"ref45","first-page":"1889","article-title":"Trust region policy optimization","volume-title":"Proc. 32nd Int. Conf. Mach. Learn.","volume":"37","author":"Schulman"},{"doi-asserted-by":"publisher","key":"ref46","DOI":"10.1109\/TNNLS.2023.3289315"},{"doi-asserted-by":"publisher","key":"ref47","DOI":"10.1109\/TNNLS.2023.3245980"},{"doi-asserted-by":"publisher","key":"ref48","DOI":"10.1145\/3123266.3129396"},{"doi-asserted-by":"publisher","key":"ref49","DOI":"10.1145\/1553374.1553380"},{"doi-asserted-by":"publisher","key":"ref50","DOI":"10.1109\/ISAS61044.2024.10552510"},{"key":"ref51","first-page":"2917","article-title":"Hierarchical imitation and reinforcement learning","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Le"},{"doi-asserted-by":"publisher","key":"ref52","DOI":"10.1109\/TCIAIG.2014.2363042"},{"key":"ref53","article-title":"YOLOv7: Trainable bag-of-freebies sets new state-of-the-art for real-time object detectors","author":"Wang","year":"2022","journal-title":"arXiv:2207.02696"},{"key":"ref54","first-page":"278","article-title":"Policy invariance under reward transformations: Theory and application to reward shaping","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Ng"},{"doi-asserted-by":"publisher","key":"ref55","DOI":"10.1109\/TNNLS.2023.3250269"},{"key":"ref56","first-page":"1","article-title":"Recurrent experience replay in distributed reinforcement Learning","volume-title":"Proc. ICLR","author":"Kapturowski"},{"doi-asserted-by":"publisher","key":"ref57","DOI":"10.15607\/rss.2018.xiv.049"},{"key":"ref58","first-page":"1433","article-title":"Maximum entropy inverse reinforcement learning","volume-title":"Proc. 23rd AAAI Conf. Artif. Intell.","volume":"8","author":"Ziebart"},{"key":"ref59","first-page":"5982","article-title":"ProcTHOR: Large-scale embodied AI using procedural generation","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Deitke"},{"key":"ref60","article-title":"GRUtopia: Dream general robots in a city at scale","author":"Wang","year":"2024","journal-title":"arXiv:2407.10943"},{"doi-asserted-by":"publisher","key":"ref61","DOI":"10.1007\/978-3-319-67361-5_40"}],"container-title":["IEEE Transactions on Neural Networks and Learning Systems"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/5962385\/11151745\/11007665.pdf?arnumber=11007665","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,9,8]],"date-time":"2025-09-08T17:47:01Z","timestamp":1757353621000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11007665\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,9]]},"references-count":61,"journal-issue":{"issue":"9"},"URL":"https:\/\/doi.org\/10.1109\/tnnls.2025.3567001","relation":{},"ISSN":["2162-237X","2162-2388"],"issn-type":[{"type":"print","value":"2162-237X"},{"type":"electronic","value":"2162-2388"}],"subject":[],"published":{"date-parts":[[2025,9]]}}}