{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,9,11]],"date-time":"2025-09-11T17:53:58Z","timestamp":1757613238574,"version":"3.44.0"},"reference-count":55,"publisher":"IEEE","license":[{"start":{"date-parts":[[2019,7,1]],"date-time":"2019-07-01T00:00:00Z","timestamp":1561939200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2019,7,1]],"date-time":"2019-07-01T00:00:00Z","timestamp":1561939200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2019,7]]},"DOI":"10.23919\/acc.2019.8814910","type":"proceedings-article","created":{"date-parts":[[2019,11,25]],"date-time":"2019-11-25T18:42:46Z","timestamp":1574707366000},"page":"2378-2383","source":"Crossref","is-referenced-by-count":2,"title":["Model-based reinforcement learning for output-feedback optimal control of a class of nonlinear systems"],"prefix":"10.23919","author":[{"given":"Ryan","family":"Self","sequence":"first","affiliation":[{"name":"School of Mechanical and Aerospace Engineering, Oklahoma State University, Stillwater, OK, USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Michael","family":"Harlan","sequence":"additional","affiliation":[{"name":"School of Mechanical and Aerospace Engineering, Oklahoma State University, Stillwater, OK, USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Rushikesh","family":"Kamalapurkar","sequence":"additional","affiliation":[{"name":"School of Mechanical and Aerospace Engineering, Oklahoma State University, Stillwater, OK, USA"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/TNN.2007.900227"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/CDC.2009.5399753"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/CDC.2010.5718152"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1016\/j.automatica.2010.02.018"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1002\/9781118122631"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1016\/j.automatica.2012.06.008"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2013.2276571"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1016\/j.automatica.2012.09.019"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1016\/j.automatica.2014.08.023"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1016\/j.automatica.2014.02.015"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1016\/j.automatica.2014.05.011"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/TIE.2014.2345343"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1049\/iet-cta.2014.1325"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1002\/rnc.3181"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2014.2315646"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1080\/019697299125127"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1016\/j.neunet.2009.05.011"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/TNN.2011.2168538"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/TSMCC.2011.2106494"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1016\/j.automatica.2014.10.056"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1016\/j.automatica.2013.09.043"},{"key":"ref22","first-page":"471","article-title":"Integrated modeling and control based on reinforcement learning and dynamic programming","volume-title":"Advances in Neural Information Processing Systems 3","author":"Sutton","year":"1991"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/IJCNN.2014.6889733"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1145\/1143844.1143845"},{"key":"ref25","first-page":"465","article-title":"Pilco: a model-based and data-efficient approach to policy search","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Deisenroth"},{"key":"ref26","first-page":"2944","article-title":"Learning continuous control policies by stochastic value gradients","volume-title":"Advances in Neural Information Processing Systems 28","author":"Heess","year":"2015"},{"volume-title":"Online model learning algorithms for actor-critic control","year":"2015","author":"Grondman","key":"ref27"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1162\/153244303765208377"},{"issue":"2","key":"ref29","doi-asserted-by":"crossref","first-page":"209","DOI":"10.1023\/A:1017984413808","article-title":"Near-optimal reinforcement learning in polynomial time","volume":"49","author":"Kearns","year":"2002","journal-title":"Machine Learning"},{"key":"ref30","first-page":"306","article-title":"Exploration in metric state spaces","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Kakade"},{"key":"ref31","first-page":"1209","article-title":"Multi-resolution exploration in continuous spaces","volume-title":"Advances in Neural Information Processing Systems 21","author":"Nouri","year":"2009"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1007\/s10994-010-5225-4"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-15880-3_44"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.5555\/3044805.3045041"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1016\/j.automatica.2014.10.103"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1016\/j.automatica.2015.10.039"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1016\/B978-0-12-805246-4.00008-2"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1016\/j.automatica.2016.08.004"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2015.2511658"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1109\/TCNS.2016.2617622"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2015.2399020"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1287\/moor.12.3.441"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1016\/S0004-3702(02)00378-8"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1109\/TCYB.2015.2477810"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1109\/CDC.2017.8263965"},{"key":"ref46","doi-asserted-by":"crossref","DOI":"10.1515\/9781400842643","volume-title":"Calculus of variations and optimal control theory: a concise introduction","author":"Liberzon","year":"2012"},{"volume-title":"Nonlinear systems","year":"2002","author":"Khalil","key":"ref47"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1016\/j.neunet.2014.07.009"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1016\/j.automatica.2003.12.007"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1016\/0893-6080(90)90005-6"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1016\/0893-6080(91)90009-T"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1016\/j.automatica.2004.11.034"},{"key":"ref53","doi-asserted-by":"crossref","DOI":"10.1007\/978-3-319-78384-0","volume-title":"Reinforcement Learning for Optimal Feedback Control: A Lyapunov-Based Approach, ser. Communications and Control Engineering","author":"Kamalapurkar","year":"2018"},{"volume-title":"Output-feedback online optimal control for a class of nonlinear systems","year":"2019","author":"Kamalapurkar","key":"ref54"},{"key":"ref55","article-title":"Constrained nonlinear optimal control: a converse HJB approach","volume-title":"California Institute of Technology, Pasadena, CA 91125","author":"Nevistic","year":"1996"}],"event":{"name":"2019 American Control Conference (ACC)","start":{"date-parts":[[2019,7,10]]},"location":"Philadelphia, PA, USA","end":{"date-parts":[[2019,7,12]]}},"container-title":["2019 American Control Conference (ACC)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/8789884\/8814292\/08814910.pdf?arnumber=8814910","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,9,4]],"date-time":"2025-09-04T18:19:51Z","timestamp":1757009991000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/8814910\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2019,7]]},"references-count":55,"URL":"https:\/\/doi.org\/10.23919\/acc.2019.8814910","relation":{},"subject":[],"published":{"date-parts":[[2019,7]]}}}