{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,2,6]],"date-time":"2026-02-06T03:37:04Z","timestamp":1770349024458,"version":"3.49.0"},"reference-count":31,"publisher":"IEEE","content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2014,12]]},"DOI":"10.1109\/cdc.2014.7040183","type":"proceedings-article","created":{"date-parts":[[2015,2,17]],"date-time":"2015-02-17T19:53:59Z","timestamp":1424202839000},"page":"5083-5088","source":"Crossref","is-referenced-by-count":12,"title":["Model-based reinforcement learning for infinite-horizon approximate optimal tracking"],"prefix":"10.1109","author":[{"given":"Rushikesh","family":"Kamalapurkar","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Lindsey","family":"Andrews","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Patrick","family":"Walters","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Warren E.","family":"Dixon","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref31","article-title":"Nonlinear Systems","author":"khalil","year":"2002"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1002\/9781118122631"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1016\/j.neunet.2009.06.014"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1016\/j.automatica.2010.02.018"},{"key":"ref12","doi-asserted-by":"crossref","first-page":"89","DOI":"10.1016\/j.automatica.2012.09.019","article-title":"A novel actor-critic-identifier architecture for approximate optimal control of uncertain nonlinear systems","volume":"49","author":"bhasin","year":"2013","journal-title":"Automatica"},{"key":"ref13","doi-asserted-by":"crossref","DOI":"10.1007\/978-1-4471-4757-2","article-title":"Adaptive Dynamic Programming for Control Algorithms and Stability","author":"zhang","year":"2013","journal-title":"ser Communications and control engineering"},{"key":"ref14","doi-asserted-by":"crossref","first-page":"621","DOI":"10.1109\/TNNLS.2013.2281663","article-title":"Policy iteration adaptive dynamic programming algorithm for discrete-time nonlinear systems","volume":"25","author":"liu","year":"2014","journal-title":"IEEE Trans Neural Netw Learn Syst"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1016\/j.automatica.2013.09.043"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1080\/00207179.2013.848292"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/TSMCB.2008.920269"},{"key":"ref18","article-title":"Approximate optimal trajectory tracking for continuous-time nonlinear systems","author":"kamalapurkar","year":"0","journal-title":"Automatica to appear (see also arXiv 1301 7664)"},{"key":"ref19","doi-asserted-by":"crossref","DOI":"10.1016\/j.automatica.2014.02.015","article-title":"Reinforcement Q-learning for optimal tracking control of linear discrete-time systems with unknown dynamics","author":"kiumarsi","year":"2014","journal-title":"Automatica"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1109\/CDC.2013.6760878"},{"key":"ref4","article-title":"Efficient reinforcement learning using Gaussian processes","author":"deisenroth","year":"2010"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1002\/acs.2297"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/CDC.2009.5399753"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/TAC.2006.884959"},{"key":"ref29","article-title":"Optimal Control Theory: An Introduction","author":"kirk","year":"2004","journal-title":"Dover"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1162\/089976600300015961"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/TSMCB.2008.926614"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1016\/j.neunet.2006.08.010"},{"key":"ref2","article-title":"Dynamic Programming and Optimal Control","author":"bertsekas","year":"2007"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/TNN.2007.900227"},{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/TNN.1998.712192"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1080\/00207179.2013.863432"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/IWACI.2011.6159991"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/CDC.2009.5399697"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-39068-5_1"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/TNN.2011.2168538"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.2514\/1.46866"},{"key":"ref25","article-title":"Concurrent learning adaptive control for convergence without persistencey of excitation","author":"chowdhary","year":"2010"}],"event":{"name":"2014 IEEE 53rd Annual Conference on Decision and Control (CDC)","location":"Los Angeles, CA, USA","start":{"date-parts":[[2014,12,15]]},"end":{"date-parts":[[2014,12,17]]}},"container-title":["53rd IEEE Conference on Decision and Control"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/7027307\/7039338\/07040183.pdf?arnumber=7040183","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2017,6,23]],"date-time":"2017-06-23T05:44:04Z","timestamp":1498196644000},"score":1,"resource":{"primary":{"URL":"http:\/\/ieeexplore.ieee.org\/document\/7040183\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2014,12]]},"references-count":31,"URL":"https:\/\/doi.org\/10.1109\/cdc.2014.7040183","relation":{},"subject":[],"published":{"date-parts":[[2014,12]]}}}