{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,8,27]],"date-time":"2026-08-27T04:07:59Z","timestamp":1787803679514,"version":"build-2784847793"},"reference-count":125,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"6","license":[{"start":{"date-parts":[[2018,6,1]],"date-time":"2018-06-01T00:00:00Z","timestamp":1527811200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2018,6,1]],"date-time":"2018-06-01T00:00:00Z","timestamp":1527811200000},"content-version":"am","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2018,6,1]],"date-time":"2018-06-01T00:00:00Z","timestamp":1527811200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2018,6,1]],"date-time":"2018-06-01T00:00:00Z","timestamp":1527811200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"name":"U.S. NSF","award":["ECCS-1405173"],"award-info":[{"award-number":["ECCS-1405173"]}]},{"name":"ONR","award":["N00014-17-1-2239"],"award-info":[{"award-number":["N00014-17-1-2239"]}]},{"name":"China NSFC","award":["61633007"],"award-info":[{"award-number":["61633007"]}]},{"name":"NATO through the Virginia Tech Startup Fund","award":["SPS G5176"],"award-info":[{"award-number":["SPS G5176"]}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Neural Netw. Learning Syst."],"published-print":{"date-parts":[[2018,6]]},"DOI":"10.1109\/tnnls.2017.2773458","type":"journal-article","created":{"date-parts":[[2017,12,7]],"date-time":"2017-12-07T14:28:18Z","timestamp":1512656898000},"page":"2042-2062","source":"Crossref","is-referenced-by-count":805,"title":["Optimal and Autonomous Control Using Reinforcement Learning: A Survey"],"prefix":"10.1109","volume":"29","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-9701-8375","authenticated-orcid":false,"given":"Bahare","family":"Kiumarsi","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-1978-4848","authenticated-orcid":false,"given":"Kyriakos G.","family":"Vamvoudakis","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-0800-5140","authenticated-orcid":false,"given":"Hamidreza","family":"Modares","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-4074-1615","authenticated-orcid":false,"given":"Frank L.","family":"Lewis","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1016\/j.jfranklin.2014.11.008"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1016\/j.jfranklin.2013.12.008"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1162\/089976600300015961"},{"key":"ref32","article-title":"Learning from delayed rewards","author":"watkins","year":"1989"},{"key":"ref31","article-title":"Approximate dynamic programming for real-time control and neural modeling","author":"werbos","year":"1992","journal-title":"Handbook of Intelligent Control Neural Fuzzy and Adaptive Approaches"},{"key":"ref30","author":"werbos","year":"1991","journal-title":"A Menu of Design for Reinforcement Learning Over Time"},{"key":"ref37","doi-asserted-by":"crossref","first-page":"1106","DOI":"10.1109\/TNNLS.2013.2288067","article-title":"Optimal switching and control of nonlinear switching systems using approximate dynamic programming","volume":"25","author":"heydari","year":"2014","journal-title":"IEEE Trans Neural Netw Learn Syst"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1016\/j.automatica.2010.02.018"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1016\/j.automatica.2008.08.017"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1016\/j.automatica.2004.11.034"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1007\/BF00115009"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/TSMC.1983.6313077"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1109\/CDC.1989.70114"},{"key":"ref20","author":"krsti?","year":"1995","journal-title":"Nonlinear and Adaptive Control Design"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1137\/1.9780898718652"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1002\/0471459100"},{"key":"ref24","author":"sastry","year":"2011","journal-title":"Adaptive Control Stability Convergence and Robustness"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1137\/1.9780898719376"},{"key":"ref101","doi-asserted-by":"publisher","DOI":"10.1109\/CDC.2016.7798300"},{"key":"ref26","author":"ioannou","year":"2013","journal-title":"Robust Adaptive Control"},{"key":"ref100","doi-asserted-by":"publisher","DOI":"10.1109\/ICARM.2016.7606926"},{"key":"ref25","author":"astr\u00f6m","year":"2013","journal-title":"Adaptive Control"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.2514\/1.G001154"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2016.2541020"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.1073\/pnas.42.10.767"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.1016\/j.automatica.2014.02.015"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2014.2358227"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1109\/TSMCB.2010.2043839"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1109\/MCAS.2009.933854"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1007\/BF00992698"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.1109\/ACC.1994.735224"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2015.2453320"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1016\/j.neucom.2014.08.030"},{"key":"ref4","author":"athans","year":"2006","journal-title":"Optimal Control An Introduction to the Theory and Its Applications"},{"key":"ref3","doi-asserted-by":"crossref","DOI":"10.2307\/j.ctvcm4g0s","author":"liberzon","year":"2011","journal-title":"Calculus of Variations and Optimal Control Theory A Concise Introduction"},{"key":"ref6","author":"bryson","year":"1975","journal-title":"Applied Optimal Control Optimization Estimation and Control"},{"key":"ref5","author":"kirk","year":"2012","journal-title":"Optimal Control Theory An Introduction"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1137\/S0363012998332433"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1016\/j.automatica.2015.06.001"},{"key":"ref7","author":"mceneaney","year":"2006","journal-title":"Max-Plus Methods for Nonlinear Control and Estimation"},{"key":"ref9","author":"hagan","year":"2014","journal-title":"Neural Network Design"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1109\/TSMCB.2006.883869"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1109\/TSMCB.2008.926614"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1016\/j.pnsc.2008.03.006"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.1007\/s11768-011-0178-0"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1137\/0305004"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2015.2388672"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1007\/978-1-4471-5574-4"},{"key":"ref43","author":"howard","year":"1960","journal-title":"Dynamic Programming and Markov Processes"},{"key":"ref125","doi-asserted-by":"publisher","DOI":"10.1109\/TSG.2016.2640184"},{"key":"ref124","doi-asserted-by":"publisher","DOI":"10.1109\/TEC.2016.2543229"},{"key":"ref73","doi-asserted-by":"publisher","DOI":"10.1002\/acs.2297"},{"key":"ref72","doi-asserted-by":"publisher","DOI":"10.1016\/j.automatica.2013.09.043"},{"key":"ref71","doi-asserted-by":"publisher","DOI":"10.1016\/j.automatica.2015.10.039"},{"key":"ref70","doi-asserted-by":"publisher","DOI":"10.1109\/JAS.2014.7004681"},{"key":"ref76","doi-asserted-by":"publisher","DOI":"10.1049\/iet-cta.2015.0943"},{"key":"ref77","doi-asserted-by":"publisher","DOI":"10.1109\/CDC.2016.7799165"},{"key":"ref74","doi-asserted-by":"crossref","first-page":"282","DOI":"10.1109\/JAS.2014.7004686","article-title":"Event-triggered optimal adaptive control algorithm for continuous-time nonlinear systems","volume":"1","author":"vamvoudakis","year":"2014","journal-title":"IEEE\/CAA Journal of Automatica Sinica"},{"key":"ref75","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2016.2586303"},{"key":"ref78","doi-asserted-by":"publisher","DOI":"10.1109\/ACC.2016.7525383"},{"key":"ref79","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2013.2294968"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1109\/TCYB.2014.2384016"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.1109\/9.256331"},{"key":"ref61","doi-asserted-by":"publisher","DOI":"10.1109\/TAC.1981.1102603"},{"key":"ref63","author":"ba?ar","year":"1995","journal-title":"$H^\\infty$ -Optimal Control and Related Minimax Design Problems"},{"key":"ref64","doi-asserted-by":"publisher","DOI":"10.1109\/9.29425"},{"key":"ref65","doi-asserted-by":"publisher","DOI":"10.1016\/j.automatica.2006.09.019"},{"key":"ref66","doi-asserted-by":"publisher","DOI":"10.1016\/j.automatica.2016.12.009"},{"key":"ref67","doi-asserted-by":"publisher","DOI":"10.1016\/j.neunet.2009.03.008"},{"key":"ref68","doi-asserted-by":"publisher","DOI":"10.1016\/j.automatica.2012.09.019"},{"key":"ref2","author":"stengel","year":"1986","journal-title":"Optimal Control and Estimation"},{"key":"ref69","doi-asserted-by":"publisher","DOI":"10.1109\/ACC.2010.5531586"},{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1002\/9781118122631"},{"key":"ref109","doi-asserted-by":"publisher","DOI":"10.1177\/0278364910371999"},{"key":"ref95","doi-asserted-by":"publisher","DOI":"10.1155\/2014\/628798"},{"key":"ref108","doi-asserted-by":"publisher","DOI":"10.1145\/1121241.1121263"},{"key":"ref94","doi-asserted-by":"publisher","DOI":"10.1109\/CYBER.2012.6392582"},{"key":"ref107","doi-asserted-by":"publisher","DOI":"10.1016\/j.robot.2004.03.004"},{"key":"ref93","doi-asserted-by":"publisher","DOI":"10.1016\/j.automatica.2012.05.074"},{"key":"ref106","first-page":"225","author":"robins","year":"2004","journal-title":"Effects of Repeated Exposure to A Humanoid Robot on Children with Autism"},{"key":"ref92","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2014.2350835"},{"key":"ref105","doi-asserted-by":"publisher","DOI":"10.1109\/TSMCA.2002.804820"},{"key":"ref91","doi-asserted-by":"publisher","DOI":"10.1016\/j.automatica.2015.08.017"},{"key":"ref104","first-page":"575","article-title":"Learning trajectory preferences for manipulators via iterative improvement","author":"jain","year":"2013","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref90","doi-asserted-by":"publisher","DOI":"10.1002\/rnc.2814"},{"key":"ref103","doi-asserted-by":"publisher","DOI":"10.1145\/500742.500765"},{"key":"ref102","doi-asserted-by":"publisher","DOI":"10.1109\/CDC.2016.7799164"},{"key":"ref111","doi-asserted-by":"publisher","DOI":"10.1109\/TMECH.2012.2219880"},{"key":"ref112","doi-asserted-by":"publisher","DOI":"10.1016\/j.ifacol.2016.07.127"},{"key":"ref110","doi-asserted-by":"publisher","DOI":"10.1109\/TRO.2012.2210294"},{"key":"ref98","doi-asserted-by":"publisher","DOI":"10.1109\/RiiSS.2013.6607932"},{"key":"ref99","doi-asserted-by":"publisher","DOI":"10.1002\/oca.2222"},{"key":"ref96","doi-asserted-by":"publisher","DOI":"10.7763\/IJET.2015.V7.835"},{"key":"ref97","author":"walters","year":"2013","journal-title":"Online approximate optimal station keeping of an autonomous underwater vehicle"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1126\/science.aaa8415"},{"key":"ref11","author":"bishop","year":"2006","journal-title":"Pattern Recognition and Machine Learning"},{"key":"ref12","author":"hastie","year":"2009","journal-title":"The Elements of Statistical Learning Data Mining Inference and Prediction"},{"key":"ref13","author":"murphy","year":"2012","journal-title":"Machine Learning A Probabilistic Perspective"},{"key":"ref14","volume":"1","author":"sutton","year":"2017","journal-title":"Reinforcement Learning An Introduction"},{"key":"ref15","author":"bertsekas","year":"1996","journal-title":"Neuro-Dynamic Programming"},{"key":"ref118","first-page":"1","article-title":"End-to-end training of deep visuomotor policies","volume":"17","author":"levine","year":"2016","journal-title":"J Mach Learn Res"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1002\/9780470182963"},{"key":"ref82","doi-asserted-by":"publisher","DOI":"10.1109\/TAC.2014.2317301"},{"key":"ref117","first-page":"784","article-title":"Application of reinforcement learning based on neural network to dynamic obstacle avoidance","author":"qiao","year":"2008","journal-title":"Proc Int Conf Inf Autom"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1007\/978-0-387-69082-7"},{"key":"ref81","doi-asserted-by":"publisher","DOI":"10.1016\/j.automatica.2012.06.096"},{"key":"ref18","doi-asserted-by":"crossref","DOI":"10.1007\/978-1-4471-4757-2","author":"zhang","year":"2013","journal-title":"Adaptive Dynamic Programming for Control"},{"key":"ref84","article-title":"Optimal tracking control of uncertain systems: On-policy and off-policy reinforcement learning approaches","author":"modares","year":"2015"},{"key":"ref119","author":"schulman","year":"2015","journal-title":"Trust region policy optimization"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-50815-3"},{"key":"ref83","doi-asserted-by":"publisher","DOI":"10.1016\/j.automatica.2014.05.011"},{"key":"ref114","first-page":"1107","article-title":"Least-squares policy iteration","volume":"4","author":"lagoudakis","year":"2003","journal-title":"J Mach Learn Res"},{"key":"ref113","doi-asserted-by":"publisher","DOI":"10.1109\/ICMLC.2004.1380601"},{"key":"ref116","doi-asserted-by":"publisher","DOI":"10.1109\/ICIA.2006.305870"},{"key":"ref80","doi-asserted-by":"publisher","DOI":"10.1109\/TCYB.2014.2319577"},{"key":"ref115","first-page":"85","article-title":"Reinforcement learning neural network to the problem of autonomous mobile robot obstacle avoidance","volume":"1","author":"huang","year":"2005","journal-title":"Proc Int Conf Mach Learn Cybern"},{"key":"ref120","doi-asserted-by":"publisher","DOI":"10.1016\/j.ijepes.2014.06.057"},{"key":"ref89","doi-asserted-by":"publisher","DOI":"10.1109\/TASE.2014.2300532"},{"key":"ref121","doi-asserted-by":"publisher","DOI":"10.1109\/TIE.2016.2630658"},{"key":"ref122","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2016.2635586"},{"key":"ref123","doi-asserted-by":"publisher","DOI":"10.1016\/j.engappai.2016.02.007"},{"key":"ref85","doi-asserted-by":"publisher","DOI":"10.1016\/j.automatica.2014.08.023"},{"key":"ref86","doi-asserted-by":"publisher","DOI":"10.1142\/S2301385016400069"},{"key":"ref87","author":"vrabie","year":"2013","journal-title":"Optimal Adaptive Control and Differential Games by Reinforcement Learning Principles"},{"key":"ref88","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2015.2441749"}],"container-title":["IEEE Transactions on Neural Networks and Learning Systems"],"original-title":[],"link":[{"URL":"https:\/\/ieeexplore.ieee.org\/ielaam\/5962385\/8360119\/8169685-aam.pdf","content-type":"application\/pdf","content-version":"am","intended-application":"syndication"},{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/5962385\/8360119\/08169685.pdf?arnumber=8169685","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,4,8]],"date-time":"2022-04-08T14:53:07Z","timestamp":1649429587000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/8169685\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2018,6]]},"references-count":125,"journal-issue":{"issue":"6"},"URL":"https:\/\/doi.org\/10.1109\/tnnls.2017.2773458","relation":{},"ISSN":["2162-237X","2162-2388"],"issn-type":[{"value":"2162-237X","type":"print"},{"value":"2162-2388","type":"electronic"}],"subject":[],"published":{"date-parts":[[2018,6]]}}}