{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,11]],"date-time":"2026-06-11T16:03:20Z","timestamp":1781193800446,"version":"3.54.1"},"reference-count":62,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"3","license":[{"start":{"date-parts":[[2023,6,1]],"date-time":"2023-06-01T00:00:00Z","timestamp":1685577600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/USG.html"},{"start":{"date-parts":[[2023,6,1]],"date-time":"2023-06-01T00:00:00Z","timestamp":1685577600000},"content-version":"am","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/USG.html"},{"start":{"date-parts":[[2023,6,1]],"date-time":"2023-06-01T00:00:00Z","timestamp":1685577600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2023,6,1]],"date-time":"2023-06-01T00:00:00Z","timestamp":1685577600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/100006234","name":"Sandia National Laboratories","doi-asserted-by":"publisher","id":[{"id":"10.13039\/100006234","id-type":"DOI","asserted-by":"publisher"}]},{"name":"National Technology and Engineering Solutions of Sandia LLC"},{"DOI":"10.13039\/100019966","name":"Honeywell","doi-asserted-by":"publisher","id":[{"id":"10.13039\/100019966","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100000015","name":"U.S. Department of Energy","doi-asserted-by":"publisher","id":[{"id":"10.13039\/100000015","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100006168","name":"National Nuclear Security Administration","doi-asserted-by":"publisher","award":["DE-NA0003525"],"award-info":[{"award-number":["DE-NA0003525"]}],"id":[{"id":"10.13039\/100006168","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Aerosp. Electron. Syst."],"published-print":{"date-parts":[[2023,6]]},"DOI":"10.1109\/taes.2022.3218496","type":"journal-article","created":{"date-parts":[[2022,11,7]],"date-time":"2022-11-07T22:50:49Z","timestamp":1667861449000},"page":"2513-2529","source":"Crossref","is-referenced-by-count":26,"title":["Trajectory Planning With Deep Reinforcement Learning in High-Level Action Spaces"],"prefix":"10.1109","volume":"59","author":[{"ORCID":"https:\/\/orcid.org\/0000-0003-2418-0897","authenticated-orcid":false,"given":"Kyle R.","family":"Williams","sequence":"first","affiliation":[{"name":"Sandia National Laboratories, Albuquerque, CA, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Rachel","family":"Schlossman","sequence":"additional","affiliation":[{"name":"Sandia National Laboratories, Albuquerque, CA, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Daniel","family":"Whitten","sequence":"additional","affiliation":[{"name":"Sandia National Laboratories, Albuquerque, CA, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Joe","family":"Ingram","sequence":"additional","affiliation":[{"name":"Sandia National Laboratories, Albuquerque, CA, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-8288-9883","authenticated-orcid":false,"given":"Srideep","family":"Musuvathy","sequence":"additional","affiliation":[{"name":"Sandia National Laboratories, Albuquerque, CA, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"James","family":"Pagan","sequence":"additional","affiliation":[{"name":"Sandia National Laboratories, Albuquerque, CA, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Kyle A.","family":"Williams","sequence":"additional","affiliation":[{"name":"Sandia National Laboratories, Albuquerque, CA, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Sam","family":"Green","sequence":"additional","affiliation":[{"name":"Semiotic Labs, Los Altos, CA, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Anirudh","family":"Patel","sequence":"additional","affiliation":[{"name":"Semiotic Labs, Los Altos, CA, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-3457-282X","authenticated-orcid":false,"given":"Anirban","family":"Mazumdar","sequence":"additional","affiliation":[{"name":"Georgia Institute of Technology, Atlanta, GA, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Julie","family":"Parish","sequence":"additional","affiliation":[{"name":"Sandia National Laboratories, Albuquerque, CA, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/TCST.2008.917870"},{"key":"ref57","author":"\u00e5str\u00f6m","year":"2021","journal-title":"Feedback Systems An Introduction for Scientists and Engineers"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/MCS.2022.3187542"},{"key":"ref56","first-page":"1597","article-title":"Clipped action policy gradient","author":"fujita","year":"0","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/CAC51589.2020.9326562"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.2514\/1.G004976"},{"key":"ref14","first-page":"1","article-title":"Utilizing reinforcement learning to continuously improve a primitive-based motion planner","author":"goddard","year":"0","journal-title":"Proc AIAA SciTech Forum"},{"key":"ref58","first-page":"8024","article-title":"Pytorch: An imperative style, high-performance deep learning library","author":"paszke","year":"0","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref53","first-page":"1057","article-title":"Policy gradient methods for reinforcement learning with function approximation","volume":"99","author":"sutton","year":"0","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref52","first-page":"626","article-title":"Trust region-guided proximal policy optimization","volume":"32","author":"wang","year":"2019","journal-title":"Adv Neural Inf Process Syst"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.2514\/1.A34640"},{"key":"ref55","first-page":"834","article-title":"Improving stochastic policy gradients in continuous control with deep reinforcement learning using the beta distribution","author":"chou","year":"0","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/TAC.2019.2929099"},{"key":"ref54","article-title":"Stable baselines3","author":"raffin","year":"2019"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/CDC.2000.912871"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1109\/TCST.2008.2012116"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2018.8461096"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1038\/nature14236"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v34i04.6059"},{"key":"ref50","article-title":"Spinning up in deep reinforcement learning","author":"achiam","year":"2018"},{"key":"ref46","article-title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","author":"haarnoja","year":"0","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref45","author":"bertsekas","year":"2016","journal-title":"Nonlinear Programming"},{"key":"ref48","first-page":"1928","article-title":"Asynchronous methods for deep reinforcement learning","author":"mnih","year":"0","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref47","first-page":"387","article-title":"Deterministic policy gradient algorithms","author":"silver","year":"0","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1109\/ACCESS.2021.3126658"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1016\/B978-1-55860-335-6.50027-1"},{"key":"ref44","first-page":"761","article-title":"Objective mismatch in model-based reinforcement learning","volume":"120","author":"lambert","year":"0","journal-title":"Proc 2nd Conf Learn Dyn Control"},{"key":"ref43","article-title":"Model-based reinforcement learning: A survey","author":"moerland","year":"2020"},{"key":"ref49","article-title":"Proximal policy optimization algorithms","author":"schulman","year":"2017"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.2514\/3.20223"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/TAES.2019.2926654"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.2514\/2.4231"},{"key":"ref4","first-page":"18","article-title":"Practical search techniques in path planning for autonomous driving","volume":"1001","author":"dolgov","year":"2008","journal-title":"Ann Arbor"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/TSSC.1968.300136"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.2514\/6.2021-1951"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1007\/BF01386390"},{"key":"ref40","article-title":"High-dimensional continuous control using generalized advantage estimation","author":"schulman","year":"0","journal-title":"Proc Int Conf Learn Representations"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.2514\/6.2016-0276"},{"key":"ref34","article-title":"Training agents using upside-down reinforcement learning","author":"srivastava","year":"2019"},{"key":"ref37","author":"bertsekas","year":"1995","journal-title":"Dynamic Programming and Optimal Control"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.2514\/6.2005-6079"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA40945.2020.9196964"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1109\/IROS.2018.8594476"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1109\/IROS.2006.282564"},{"key":"ref32","article-title":"Dynamic movement primitives in robotics: A tutorial survey","author":"saveriano","year":"2021"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1177\/02783640122067453"},{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1137\/1.9780898718577"},{"key":"ref39","author":"sutton","year":"2018","journal-title":"Reinforcement Learning An Introduction"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1137\/16M1062569"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1109\/TAES.2021.3096873"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/TAES.2021.3074134"},{"key":"ref26","article-title":"Dota 2 with large scale deep reinforcement learning","author":"berner","year":"2019"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1109\/TRO.2020.3006716"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1038\/s41586-020-2939-8"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.2514\/6.2020-1600"},{"key":"ref21","article-title":"Guidance for closed-loop transfers using reinforcement learning with application to libration point orbits","author":"lafarge","year":"0","journal-title":"Proc AIAA SciTech Forum"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1109\/ROBOT.2002.1014739"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/LRA.2019.2931199"},{"key":"ref29","article-title":"Motion primitives for robotic flight control","author":"perk","year":"2006"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.2514\/4.861741"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.1016\/j.compchemeng.2008.08.006"},{"key":"ref61","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-58821-6"}],"container-title":["IEEE Transactions on Aerospace and Electronic Systems"],"original-title":[],"link":[{"URL":"https:\/\/ieeexplore.ieee.org\/ielam\/7\/10146528\/9940484-aam.pdf","content-type":"application\/pdf","content-version":"am","intended-application":"syndication"},{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/7\/10146528\/09940484.pdf?arnumber=9940484","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,6,26]],"date-time":"2023-06-26T18:54:21Z","timestamp":1687805661000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/9940484\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023,6]]},"references-count":62,"journal-issue":{"issue":"3"},"URL":"https:\/\/doi.org\/10.1109\/taes.2022.3218496","relation":{},"ISSN":["0018-9251","1557-9603","2371-9877"],"issn-type":[{"value":"0018-9251","type":"print"},{"value":"1557-9603","type":"electronic"},{"value":"2371-9877","type":"electronic"}],"subject":[],"published":{"date-parts":[[2023,6]]}}}