{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,23]],"date-time":"2026-07-23T16:15:51Z","timestamp":1784823351650,"version":"3.55.0"},"reference-count":239,"publisher":"Emerald","issue":"3","content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2020,12,8]]},"abstract":"<jats:p>This monograph presents a new framework for learningbased control synthesis of continuous-time dynamical systems with unknown dynamics. The new design paradigm proposed here is fundamentally different from traditional control theory. In the classical paradigm, controllers are often designed for a given class of dynamical control systems; it is a model-based design. Under the learning-based control framework, controllers are learned online from realtime input-output data collected along the trajectories of the control system in question. An entanglement of techniques from reinforcement learning and model-based control theory is advocated to find a sequence of suboptimal controllers that converge to the optimal solution as learning steps increase. On the one hand, this learning-based design approach attempts to overcome the well-known \u201ccurse of dimensionality\u201d and the \u201curse of modeling\u201d associated with Bellman\u2019s Dynamic Programming. On the other hand, rigorous stability and robustness analysis can be derived for the closed-loop system with real-time learning-based controllers. The effectiveness of the proposed learning-based control framework is demonstrated via its applications to theoretical optimal control problems tied to various important classes of continuous-time dynamical systems and practical problems arising from biological motor control, connected and autonomous vehicles.<\/jats:p>","DOI":"10.1561\/2600000023","type":"journal-article","created":{"date-parts":[[2020,12,8]],"date-time":"2020-12-08T04:31:13Z","timestamp":1607401873000},"page":"176-284","source":"Crossref","is-referenced-by-count":102,"title":["Learning-Based Control: A Tutorial and Some Recent Results"],"prefix":"10.1108","volume":"8","author":[{"given":"Jiang","family":"Zhong-Ping","sequence":"first","affiliation":[{"name":"Tandon School of Engineering, New York University , New York, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Bian","family":"Tao","sequence":"additional","affiliation":[{"name":"Bank of America , New York, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Gao","family":"Weinan","sequence":"additional","affiliation":[{"name":"College of Engineering and Science, Florida Institute of Technology , Florida, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"140","published-online":{"date-parts":[[2020,12,8]]},"reference":[{"issue":"6","key":"2025121805181890900_ref001","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1371\/journal.pcbi.1003661","article-title":"On the origins of suboptimality in human probabilistic inference","volume":"10","author":"Acerbi","year":"2014","journal-title":"PLOS Computational Biology"},{"issue":"2","key":"2025121805181890900_ref002","doi-asserted-by":"crossref","first-page":"111","DOI":"10.1080\/00222895.1971.10734898","article-title":"A closed-loop theory of motor learning","volume":"3","author":"Adams","year":"1971","journal-title":"Journal of Motor Behavior"},{"key":"2025121805181890900_ref003","volume-title":"Optimal Control: Linear Quadratic Methods","author":"Anderson","year":"1989"},{"issue":"4","key":"2025121805181890900_ref004","doi-asserted-by":"crossref","first-page":"5","DOI":"10.1109\/37.88585","article-title":"An introduction to autonomous control systems","volume":"11","author":"Antsaklis","year":"1991","journal-title":"IEEE Control Systems Magazine"},{"issue":"1","key":"2025121805181890900_ref005","doi-asserted-by":"crossref","first-page":"23","DOI":"10.1007\/s10846-018-0832-6","article-title":"Control and machine intelligence for system autonomy","volume":"91","author":"Antsaklis","year":"2018","journal-title":"Journal of Intelligent and Robotic Systems, 30th Year Anniversary Special Issue"},{"key":"2025121805181890900_ref006","volume-title":"Ergodic Control of Diffusion Processes","author":"Arapostathis","year":"2012"},{"issue":"1","key":"2025121805181890900_ref007","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1137\/130912918","article-title":"Convergence of the relative value iteration for the ergodic control problem of nondegenerate diffusions under near-monotone costs","volume":"52","author":"Arapostathis","year":"2014","journal-title":"SIAM Journal on Control and Optimization"},{"issue":"4","key":"2025121805181890900_ref008","doi-asserted-by":"crossref","first-page":"429","DOI":"10.1109\/TITS.2006.884615","article-title":"The impact of cooperative adaptive cruise control on traffic-flow characteristics","volume":"7","author":"van Arem","year":"2006","journal-title":"IEEE Transactions on Intelligent Transportation Systems"},{"issue":"3","key":"2025121805181890900_ref009","doi-asserted-by":"crossref","first-page":"707","DOI":"10.1109\/TCST.2010.2047860","article-title":"Predictive cruise control: Utilizing upcoming traffic signal information for improving fuel economy and reducing trip time","volume":"19","author":"Asadi","year":"2011","journal-title":"IEEE Transactions on Control Systems Technology"},{"key":"2025121805181890900_ref010","volume-title":"Adaptive Control","author":"\u00c5str\u00f6m","year":"1997"},{"issue":"8","key":"2025121805181890900_ref011","doi-asserted-by":"crossref","first-page":"572","DOI":"10.1038\/nrn3289","article-title":"Knowing how much you don't know: A neural organization of uncertainty estimates","volume":"13","author":"Bach","year":"2012","journal-title":"Nature Reviews Neuroscience"},{"key":"2025121805181890900_ref012","volume-title":"Tech. rep. No. WL-TR-93-1146","author":"Baird, III","year":"1993"},{"key":"2025121805181890900_ref013","first-page":"2448","article-title":"Reinforcement learning in continuous time: Advantage updating","author":"Baird, III","year":"1994"},{"issue":"3","key":"2025121805181890900_ref014","doi-asserted-by":"crossref","first-page":"499","DOI":"10.1137\/0329029","article-title":"A numerical algorithm for optimal feedback gains in high dimensional linear quadratic regulator problems","volume":"29","author":"Banks","year":"1991","journal-title":"SIAM Journal on Control and Optimization"},{"key":"2025121805181890900_ref015","author":"Barto","year":"2017"},{"key":"2025121805181890900_ref016","volume-title":"PhD thesis","author":"Beard","year":"1995"},{"issue":"12","key":"2025121805181890900_ref017","doi-asserted-by":"crossref","first-page":"2159","DOI":"10.1016\/S0005-1098(97)00128-3","article-title":"Galerkin approximations of the generalized Hamilton-Jacobi-Bellman equation","volume":"33","author":"Beard","year":"1997","journal-title":"Automatica"},{"issue":"1","key":"2025121805181890900_ref018","doi-asserted-by":"crossref","first-page":"30","DOI":"10.1016\/j.neuron.2012.03.016","article-title":"Not noisy, just wrong: The role of suboptimal inference in behavioral variability","volume":"74","author":"Beck","year":"2012","journal-title":"Neuron"},{"issue":"1424","key":"2025121805181890900_ref019","doi-asserted-by":"crossref","first-page":"1137","DOI":"10.1098\/rstb.2002.1101","article-title":"Role of uncertainty in sensorimotor control","volume":"357","author":"van Beers","year":"2002","journal-title":"Philosophical Transactions of the Royal Society of London B: Biological Sciences"},{"issue":"4","key":"2025121805181890900_ref020","doi-asserted-by":"crossref","first-page":"231","DOI":"10.1073\/pnas.40.4.231","article-title":"Dynamic programming and a new formalism in the calculus of variations","volume":"40","author":"Bellman","year":"1954","journal-title":"Proceedings of the National Academy of Sciences of the United States of America"},{"key":"2025121805181890900_ref021","volume-title":"Dynamic Programming","author":"Bellman","year":"1957"},{"issue":"1","key":"2025121805181890900_ref022","doi-asserted-by":"crossref","first-page":"101","DOI":"10.1109\/9.654908","article-title":"An exact line search method for solving generalized continuous-time algebraic Riccati equations","volume":"43","author":"Benner","year":"1998","journal-title":"IEEE Transactions on Automatic Control"},{"issue":"9","key":"2025121805181890900_ref023","doi-asserted-by":"crossref","first-page":"755","DOI":"10.1002\/nla.622","article-title":"Numerical solution of largescale Lyapunov equations, Riccati equations, and linear-quadratic optimal control problems","volume":"15","author":"Benner","year":"2008","journal-title":"Numerical Linear Algebra with Applications"},{"key":"2025121805181890900_ref024","doi-asserted-by":"crossref","first-page":"21","DOI":"10.1007\/BFb0007045","volume-title":"Applied Stochastic Analysis","author":"Bensoussan","year":"1992"},{"key":"2025121805181890900_ref025","volume-title":"Dynamic Programming and Optimal Control","author":"Bertsekas","year":"2005","edition":"3rd Ed."},{"key":"2025121805181890900_ref026","volume-title":"Dynamic Programming and Optimal Control","author":"Bertsekas","year":"2007","edition":"3rd Ed."},{"issue":"3","key":"2025121805181890900_ref027","doi-asserted-by":"crossref","first-page":"310","DOI":"10.1007\/s11768-011-1005-3","article-title":"Approximate policy iteration: A survey and some new methods","volume":"9","author":"Bertsekas","year":"2011","journal-title":"Journal of Control Theory and Applications"},{"key":"2025121805181890900_ref028","volume-title":"Abstract Dynamic Programming","author":"Bertsekas","year":"2013"},{"issue":"3","key":"2025121805181890900_ref029","doi-asserted-by":"crossref","first-page":"500","DOI":"10.1109\/TNNLS.2015.2503980","article-title":"Value and policy iterations in optimal control and adaptive dynamic programming","volume":"28","author":"Bertsekas","year":"2017","journal-title":"IEEE Transactions on Neural Networks and Learning Systems"},{"key":"2025121805181890900_ref030","volume-title":"Reinforcement Learning and Optimal Control","author":"Bertsekas","year":"2019"},{"key":"2025121805181890900_ref031","volume-title":"Tech. rep. No. Report LIDS-P-2349","author":"Bertsekas","year":"1996"},{"issue":"11","key":"2025121805181890900_ref032","doi-asserted-by":"crossref","first-page":"2471","DOI":"10.1016\/j.automatica.2009.07.008","article-title":"Natural actor-critic algorithms","volume":"45","author":"Bhatnagar","year":"2009","journal-title":"Automatica"},{"issue":"1","key":"2025121805181890900_ref033","doi-asserted-by":"crossref","first-page":"39","DOI":"10.1007\/s004220050543","article-title":"Computational nature of human adaptive control during learning of reaching movements in force fields","volume":"81","author":"Bhushan","year":"1999","journal-title":"Biological Cybernetics"},{"issue":"10","key":"2025121805181890900_ref034","doi-asserted-by":"crossref","first-page":"2624","DOI":"10.1016\/j.automatica.2014.08.023","article-title":"Adaptive dynamic programming and optimal control of nonlinear nonaffine systems","volume":"50","author":"Bian","year":"2014","journal-title":"Automatica"},{"issue":"4","key":"2025121805181890900_ref035","doi-asserted-by":"crossref","first-page":"24392447","DOI":"10.1109\/TIE.2014.2345343","article-title":"Decentralized adaptive optimal control of large-scale systems with application to power systems","volume":"62","author":"Bian","year":"2015","journal-title":"IEEE Transactions on Industrial Electronics"},{"issue":"12","key":"2025121805181890900_ref036","doi-asserted-by":"crossref","first-page":"4170","DOI":"10.1109\/TAC.2016.2550518","article-title":"Adaptive dynamic programming for stochastic systems with state and control dependent noise","volume":"61","author":"Bian","year":"2016","journal-title":"IEEE Transactions on Automatic Control"},{"key":"2025121805181890900_ref037","doi-asserted-by":"crossref","first-page":"211","DOI":"10.1016\/B978-0-12-805246-4.00007-0","volume-title":"Control of Complex Systems: Theory and Applications","author":"Bian","year":"2016"},{"key":"2025121805181890900_ref038","doi-asserted-by":"crossref","first-page":"348","DOI":"10.1016\/j.automatica.2016.05.003","article-title":"Value iteration and adaptive dynamic programming for data-driven adaptive optimal control design","volume":"71","author":"Bian","year":"2016","journal-title":"Automatica"},{"key":"2025121805181890900_ref039","first-page":"3375","volume-title":"Proceedings of the 55th IEEE Conference on Decision and Control (CDC)","author":"Bian","year":"2016"},{"issue":"4","key":"2025121805181890900_ref040","doi-asserted-by":"crossref","first-page":"1946","DOI":"10.1109\/TAC.2016.2589547","article-title":"A tool for the global stabilization of stochastic nonlinear systems","volume":"62","author":"Bian","year":"2017","journal-title":"IEEE Transactions on Automatic Control"},{"issue":"5","key":"2025121805181890900_ref041","doi-asserted-by":"crossref","first-page":"48","DOI":"10.1016\/j.sysconle.2018.03.001","article-title":"Stochastic and adaptive optimal control of uncertain interconnected systems: A data-driven approach","volume":"115","author":"Bian","year":"2018","journal-title":"Systems & Control Letters"},{"issue":"6","key":"2025121805181890900_ref042","doi-asserted-by":"crossref","first-page":"4150","DOI":"10.1137\/18M1214147","article-title":"Continuous-time robust dynamic programming","volume":"57","author":"Bian","year":"2019","journal-title":"SIAM Journal on Control and Optimization"},{"issue":"2","key":"2025121805181890900_ref043","doi-asserted-by":"crossref","first-page":"433","DOI":"10.1109\/JAS.2019.1911390","article-title":"Reinforcement learning for linear continuous-time systems: An incremental learning approach","volume":"6","author":"Bian","year":"2019","journal-title":"IEEE\/CAA Journal of Automatica Sinica"},{"issue":"3","key":"2025121805181890900_ref044","doi-asserted-by":"crossref","first-page":"562","DOI":"10.1162\/neco_a_01260","article-title":"Model-free robust optimal feedback mechanisms of biological motor control","volume":"32","author":"Bian","year":"2020","journal-title":"Neural Computation"},{"key":"2025121805181890900_ref045","article-title":"Ergodic control of diffusion processes","volume-title":"Proceedings of the International Congress of Mathematicians","author":"Borkar","year":"2006"},{"key":"2025121805181890900_ref046","first-page":"393","volume-title":"Advances in Neural Information Processing Systems 7","author":"Bradtke","year":"1994"},{"key":"2025121805181890900_ref047","doi-asserted-by":"crossref","DOI":"10.1515\/9781400880034","volume-title":"Control of Spaceraft and Aircraft","author":"Bryson","year":"1994"},{"issue":"6862","key":"2025121805181890900_ref048","doi-asserted-by":"crossref","first-page":"446","DOI":"10.1038\/35106566","article-title":"The central nervous system stabilizes unstable dynamics by learning optimal impedance","volume":"414","author":"Burdet","year":"2001","journal-title":"Nature"},{"issue":"7","key":"2025121805181890900_ref049","doi-asserted-by":"crossref","first-page":"2137","DOI":"10.1152\/jn.00901.2014","article-title":"The human motor system alters its reaching movement plan for taskirrelevant, positional forces","volume":"113","author":"Cashaback","year":"2015","journal-title":"Journal of Neurophysiology"},{"key":"2025121805181890900_ref050","doi-asserted-by":"crossref","DOI":"10.1109\/TAC.2019.2905215","article-title":"Reinforcement learning-based adaptive optimal exponential tracking control of linear systems with unknown dynamics","author":"Chen","year":"2019","journal-title":"IEEE Transactions on Automatic Control"},{"key":"2025121805181890900_ref051","doi-asserted-by":"crossref","DOI":"10.1007\/978-1-4612-0185-4","volume-title":"Nonlinear and Robust Control of PDE Systems: Methods and Applications to Transport-Reaction Processes","author":"Christofides","year":"2001"},{"key":"2025121805181890900_ref052","doi-asserted-by":"crossref","DOI":"10.1007\/978-1-4471-4820-3","volume-title":"Functional Analysis, Calculus of Variations and Optimal Control","author":"Clarke","year":"2013"},{"key":"2025121805181890900_ref053","volume-title":"Numerical Methods","author":"Dahlquist","year":"1973"},{"key":"2025121805181890900_ref054","volume-title":"Rational Matrix Equations in Stochastic Control","author":"Damm","year":"2004"},{"key":"2025121805181890900_ref055","first-page":"332-334","article-title":"Newton\u2019s method for a rational matrix equation occurring in stochastic control","author":"Damm","year":"2001","journal-title":"Linear Algebra and its Applications"},{"issue":"4","key":"2025121805181890900_ref056","doi-asserted-by":"crossref","first-page":"560","DOI":"10.1287\/mnsc.45.4.560","article-title":"Solving semi-Markov decision problems using average reward reinforcement learning","volume":"45","author":"Das","year":"1999","journal-title":"Management Science"},{"issue":"2","key":"2025121805181890900_ref057","doi-asserted-by":"crossref","first-page":"285","DOI":"10.1016\/S0896-6273(02)00963-7","article-title":"Reward, motivation, and reinforcement learning","volume":"36","author":"Dayan","year":"2002","journal-title":"Neuron"},{"issue":"3","key":"2025121805181890900_ref058","doi-asserted-by":"crossref","first-page":"498","DOI":"10.1109\/TAC.2005.864199","article-title":"Output regulation of uncertain nonlinear systems with nonlinear exosystems","volume":"51","author":"Ding","year":"2006","journal-title":"IEEE Transactions on Automatic Control"},{"issue":"10","key":"2025121805181890900_ref059","doi-asserted-by":"crossref","first-page":"2648","DOI":"10.1109\/TAC.2013.2255973","article-title":"Consensus output regulation of a class of heterogeneous nonlinear systems","volume":"58","author":"Ding","year":"2013","journal-title":"IEEE Transactions on Automatic Control"},{"issue":"1","key":"2025121805181890900_ref060","doi-asserted-by":"crossref","first-page":"219","DOI":"10.1162\/089976600300015961","article-title":"Reinforcement learning in continuous time and space","volume":"12","author":"Doya","year":"2000","journal-title":"Neural Computation"},{"issue":"4-6","key":"2025121805181890900_ref061","doi-asserted-by":"crossref","first-page":"495","DOI":"10.1016\/S0893-6080(02)00044-8","article-title":"Metalearning and neuromodulation","volume":"15","author":"Doya","year":"2002","journal-title":"Neural Networks"},{"issue":"6","key":"2025121805181890900_ref062","doi-asserted-by":"crossref","first-page":"1347","DOI":"10.1162\/089976602753712972","article-title":"Multiple model-based reinforcement learning","volume":"14","author":"Doya","year":"2002","journal-title":"Neural Computation"},{"key":"2025121805181890900_ref063","article-title":"An introduction to mathematical optimal control theory","author":"Evans","year":"2005","journal-title":"Lecture Notes, University of California, Department of Mathematics, Berkeley"},{"issue":"7","key":"2025121805181890900_ref064","doi-asserted-by":"crossref","first-page":"1688","DOI":"10.1523\/JNEUROSCI.05-07-01688.1985","article-title":"The coordination of arm movements: An experimentally confirmed mathematical model","volume":"5","author":"Flash","year":"1985","journal-title":"The Journal of Neuroscience"},{"key":"2025121805181890900_ref065","doi-asserted-by":"crossref","DOI":"10.1007\/978-1-4612-6380-7","volume-title":"Deterministic and Stochastic Optimal Control","author":"Fleming","year":"1975"},{"issue":"3","key":"2025121805181890900_ref066","doi-asserted-by":"crossref","first-page":"486","DOI":"10.1137\/0315033","article-title":"The linear multivariable regulator problem","volume":"15","author":"Francis","year":"1977","journal-title":"SIAM Journal on Control and Optimization"},{"issue":"5","key":"2025121805181890900_ref067","doi-asserted-by":"crossref","first-page":"457","DOI":"10.1016\/0005-1098(76)90006-6","article-title":"The internal model principle of control theory","volume":"12","author":"Francis","year":"1976","journal-title":"Automatica"},{"issue":"2","key":"2025121805181890900_ref068","doi-asserted-by":"crossref","first-page":"145","DOI":"10.1007\/s00221-003-1443-3","article-title":"Functional significance of stiffness in adaptation of multijoint arm movements to stable and unstable dynamics","volume":"151","author":"Franklin","year":"2003","journal-title":"Experimental Brain Research"},{"issue":"12","key":"2025121805181890900_ref069","doi-asserted-by":"crossref","first-page":"4164","DOI":"10.1109\/TAC.2016.2548662","article-title":"Adaptive dynamic programming and adaptive optimal output regulation of linear systems","volume":"61","author":"Gao","year":"2016","journal-title":"IEEE Transactions on Automatic Control"},{"key":"2025121805181890900_ref070","first-page":"1","article-title":"Nonlinear and adaptive suboptimal control of connected vehicles: A global adaptive dynamic programming approach","author":"Gao","year":"2016","journal-title":"Journal of Intelligent & Robotic Systems"},{"issue":"6","key":"2025121805181890900_ref071","doi-asserted-by":"crossref","first-page":"2614","DOI":"10.1109\/TNNLS.2017.2761718","article-title":"Learning-based adaptive optimal tracking control of strict-feedback nonlinear systems","volume":"29","author":"Gao","year":"2018","journal-title":"IEEE Transactions on Neural Networks and Learning Systems"},{"issue":"10","key":"2025121805181890900_ref072","doi-asserted-by":"crossref","first-page":"3581","DOI":"10.1109\/TAC.2018.2799526","article-title":"Leader-to-formation stability of multiagent systems: An adaptive optimal control approach","volume":"63","author":"Gao","year":"2018","journal-title":"IEEE Transactions on Automatic Control"},{"issue":"10","key":"2025121805181890900_ref073","doi-asserted-by":"crossref","first-page":"3796","DOI":"10.1109\/TITS.2019.2895285","article-title":"Reinforcement-learning-based cooperative adaptive cruise control of buses in the Lincoln tunnel corridor with time-varying topology","volume":"20","author":"Gao","year":"2019","journal-title":"IEEE Transactions on Intelligent Transportation Systems"},{"issue":"3","key":"2025121805181890900_ref074","first-page":"447","article-title":"Data-driven cooperative output regulation of multi-agent systems via robust adaptive dynamic programming","volume":"66","author":"Gao","year":"2019","journal-title":"IEEE Transactions on Circuits and Systems II: Express Briefs"},{"issue":"7","key":"2025121805181890900_ref075","article-title":"Predictive cruise control of connected and autonomous vehicles via reinforcement learning","volume":"13","author":"Gao","year":"2019","journal-title":"IET Control Theory & Applications"},{"key":"2025121805181890900_ref076","first-page":"15647","article-title":"Understanding dopamine and reinforcement learning: The dopamine reward prediction error hypothesis","author":"Glimcher","year":"2011"},{"key":"2025121805181890900_ref077","volume-title":"Hybrid Dynamical Systems: Modeling, Stability, and Robustness","author":"Goebel","year":"2012"},{"issue":"6","key":"2025121805181890900_ref078","doi-asserted-by":"crossref","first-page":"2404","DOI":"10.1109\/TITS.2014.2316016","article-title":"Sampled-data cooperative adaptive cruise control of vehicles with sensor failures","volume":"15","author":"Guo","year":"2014","journal-title":"IEEE Transactions on Intelligent Transportation Systems"},{"key":"2025121805181890900_ref079","volume-title":"Impulsive and Hybrid Dynamical Systems: Stability, Dissipativity, and Control","author":"Haddad","year":"2014"},{"key":"2025121805181890900_ref080","author":"Haith","year":"2013"},{"key":"2025121805181890900_ref081","doi-asserted-by":"crossref","DOI":"10.1007\/978-1-4612-4342-7","volume-title":"Introduction to Functional Differential Equations","author":"Hale","year":"1993"},{"issue":"6695","key":"2025121805181890900_ref082","doi-asserted-by":"crossref","first-page":"780","DOI":"10.1038\/29528","article-title":"Signal-dependent noise determines motor planning","volume":"394","author":"Harris","year":"1998","journal-title":"Nature"},{"issue":"6","key":"2025121805181890900_ref083","doi-asserted-by":"crossref","first-page":"4244","DOI":"10.1152\/jn.00404.2005","article-title":"Optimal control of redundant muscles in step-tracking wrist movements","volume":"94","author":"Haruno","year":"2005","journal-title":"Journal of Neurophysiology"},{"issue":"2","key":"2025121805181890900_ref084","doi-asserted-by":"crossref","first-page":"184","DOI":"10.1137\/0309016","article-title":"Optimal stationary control with state control dependent noise","volume":"9","author":"Haussmann","year":"1971","journal-title":"SIAM Journal on Control"},{"issue":"2","key":"2025121805181890900_ref085","doi-asserted-by":"crossref","first-page":"382","DOI":"10.1137\/0311030","article-title":"Stability of linear systems with control dependent noise","volume":"11","author":"Haussmann","year":"1973","journal-title":"SIAM Journal on Control"},{"issue":"3","key":"2025121805181890900_ref086","doi-asserted-by":"crossref","first-page":"48","DOI":"10.1109\/MCI.2018.2840727","article-title":"Learning without external reward","volume":"13","author":"He","year":"2018","journal-title":"IEEE Computational Intelligence Magazine"},{"key":"2025121805181890900_ref087","volume-title":"Dynamic Programming and Markov Processes","author":"Howard","year":"1960"},{"key":"2025121805181890900_ref088","doi-asserted-by":"crossref","DOI":"10.1137\/1.9780898718683","volume-title":"Nonlinear Output Regulation: Theory and Applications","author":"Huang","year":"2004"},{"issue":"12","key":"2025121805181890900_ref089","doi-asserted-by":"crossref","first-page":"2203","DOI":"10.1109\/TAC.2004.839236","article-title":"A general framework for tackling the output regulation problem","volume":"49","author":"Huang","year":"2004","journal-title":"IEEE Transactions on Automatic Control"},{"issue":"4","key":"2025121805181890900_ref090","doi-asserted-by":"crossref","first-page":"350","DOI":"10.1109\/THMS.2019.2900409","article-title":"Data-driven shared steering control of semi-autonomous vehicles","volume":"49","author":"Huang","year":"2019","journal-title":"IEEE Transactions on Human-Machine Systems"},{"issue":"4","key":"2025121805181890900_ref091","doi-asserted-by":"crossref","first-page":"787","DOI":"10.1016\/j.neuron.2011.04.012","article-title":"Rethinking motor learning and savings in adaptation paradigms: Modelfree memory for successful actions combines with internal models","volume":"70","author":"Huang","year":"2011","journal-title":"Neuron"},{"issue":"4","key":"2025121805181890900_ref092","doi-asserted-by":"crossref","DOI":"10.1109\/25.260745","article-title":"Autonomous intelligent cruise control","volume":"42","author":"Ioannou","year":"1993","journal-title":"IEEE Transactions on Vehicular Technology"},{"issue":"2","key":"2025121805181890900_ref093","doi-asserted-by":"crossref","first-page":"131","DOI":"10.1109\/9.45168","article-title":"Output regulation of nonlinear systems","volume":"35","author":"Isidori","year":"1990","journal-title":"IEEE Transactions on Automatic Control"},{"issue":"12","key":"2025121805181890900_ref094","doi-asserted-by":"crossref","first-page":"2392","DOI":"10.1109\/TNN.2011.2165729","article-title":"Approximate dynamic programming for optimal stationary control with control-dependent noise","volume":"22","author":"Jiang","year":"2011","journal-title":"IEEE Transactions on Neural Networks"},{"issue":"10","key":"2025121805181890900_ref095","doi-asserted-by":"crossref","first-page":"2699","DOI":"10.1016\/j.automatica.2012.06.096","article-title":"Computational adaptive optimal control for continuous-time linear systems with completely unknown dynamics","volume":"48","author":"Jiang","year":"2012","journal-title":"Automatica"},{"issue":"10","key":"2025121805181890900_ref096","first-page":"693","article-title":"Robust adaptive dynamic programming for large-scale systems with an application to multimachine power systems","volume":"59","author":"Jiang","year":"2012","journal-title":"IEEE Transactions on Circuits and Systems II: Express Briefs"},{"issue":"7","key":"2025121805181890900_ref097","doi-asserted-by":"crossref","first-page":"1150","DOI":"10.1109\/TNNLS.2013.2249668","article-title":"Robust adaptive dynamic programming with an application to power systems","volume":"24","author":"Jiang","year":"2013","journal-title":"IEEE Transactions on Neural Networks and Learning Systems"},{"issue":"4","key":"2025121805181890900_ref098","doi-asserted-by":"crossref","first-page":"459","DOI":"10.1007\/s00422-014-0613-7","article-title":"Adaptive dynamic programming as a theory of sensorimotor control","volume":"108","author":"Jiang","year":"2014","journal-title":"Biological Cybernetics"},{"issue":"5","key":"2025121805181890900_ref099","doi-asserted-by":"crossref","first-page":"882","DOI":"10.1109\/TNNLS.2013.2294968","article-title":"Robust adaptive dynamic programming and feedback stabilization of nonlinear systems","volume":"25","author":"Jiang","year":"2014","journal-title":"IEEE Trans. Neural Networks and Learning Syst"},{"issue":"2","key":"2025121805181890900_ref100","doi-asserted-by":"crossref","first-page":"261","DOI":"10.1007\/s11424-015-3310-2","article-title":"A robust adaptive dynamic programming principle for sensorimotor control with signal-dependent noise","volume":"28","author":"Jiang","year":"2015","journal-title":"Journal of Systems Science and Complexity"},{"issue":"11","key":"2025121805181890900_ref101","doi-asserted-by":"crossref","first-page":"2917","DOI":"10.1109\/TAC.2015.2414811","article-title":"Global adaptive dynamic programming for continuous-time nonlinear systems","volume":"60","author":"Jiang","year":"2015","journal-title":"IEEE Transactions on Automatic Control"},{"key":"2025121805181890900_ref102","doi-asserted-by":"crossref","DOI":"10.1002\/9781119132677","volume-title":"Robust Adaptive Dynamic Programming","author":"Jiang","year":"2017"},{"issue":"3","key":"2025121805181890900_ref103","doi-asserted-by":"crossref","first-page":"292","DOI":"10.1109\/9.557574","article-title":"A small-gain control method for nonlinear cascaded systems with dynamic uncertainties","volume":"42","author":"Jiang","year":"1997","journal-title":"IEEE Transactions on Automatic Control"},{"issue":"5","key":"2025121805181890900_ref104","doi-asserted-by":"crossref","first-page":"417","DOI":"10.1016\/j.ejcon.2013.05.017","article-title":"Robust adaptive dynamic programming for linear and nonlinear systems: An overview","volume":"19","author":"Jiang","year":"2013","journal-title":"European Journal of Control"},{"key":"2025121805181890900_ref105","doi-asserted-by":"crossref","first-page":"58","DOI":"10.1016\/j.arcontrol.2018.09.001","article-title":"Small-gain theory for stability and control of dynamical networks: A survey","volume":"46","author":"Jiang","year":"2018","journal-title":"Annual Reviews in Control"},{"issue":"2","key":"2025121805181890900_ref106","doi-asserted-by":"crossref","first-page":"95","DOI":"10.1007\/BF01211469","article-title":"Small-gain theorem for ISS systems and applications","volume":"7","author":"Jiang","year":"1994","journal-title":"Mathematics of Control, Signals and Systems"},{"issue":"8","key":"2025121805181890900_ref107","doi-asserted-by":"crossref","first-page":"1211","DOI":"10.1016\/0005-1098(96)00051-9","article-title":"A Lyapunov formulation of the nonlinear small-gain theorem for interconnected ISS systems","volume":"32","author":"Jiang","year":"1996","journal-title":"Automatica"},{"key":"2025121805181890900_ref108","doi-asserted-by":"crossref","first-page":"635","DOI":"10.1109\/TAC.1971.1099830","article-title":"Accommodation of external disturbances in linear regulator and servomechanism problems","volume":"16","author":"Johnson","year":"1971","journal-title":"IEEE Transactions on Automatic Control"},{"key":"2025121805181890900_ref109","first-page":"102","article-title":"Contributions to the theory of optimal control","volume":"5","author":"Kalman","year":"1960","journal-title":"Boletin de la Sociedad Matematica Mexicana"},{"key":"2025121805181890900_ref110","doi-asserted-by":"crossref","first-page":"40","DOI":"10.1016\/j.automatica.2014.10.103","article-title":"Approximate optimal trajectory tracking for continuous-time nonlinear systems","volume":"51","author":"Kamalapurkar","year":"2015","journal-title":"Automatica"},{"key":"2025121805181890900_ref111","author":"Kamalapurkar","year":"2018"},{"key":"2025121805181890900_ref112","doi-asserted-by":"crossref","DOI":"10.1007\/978-0-85729-513-2","volume-title":"Stability and Stabilization of Nonlinear Systems","author":"Karafyllis","year":"2011"},{"key":"2025121805181890900_ref113","volume-title":"Input-to-State Stability for PDEs","author":"Karafyllis","year":"2018"},{"issue":"1","key":"2025121805181890900_ref114","doi-asserted-by":"crossref","first-page":"144","DOI":"10.1137\/1112019","article-title":"Necessary and sufficient conditions for the asymptotic stability of linear stochastic systems","volume":"12","author":"Khas\u2019minskii","year":"1967","journal-title":"Theory of Probability & Its Applications"},{"key":"2025121805181890900_ref115","doi-asserted-by":"crossref","DOI":"10.1007\/978-3-642-23280-0","volume-title":"Stochastic Stability of Differential Equations","author":"Khas\u2019minskii","year":"2012"},{"issue":"6","key":"2025121805181890900_ref116","first-page":"32","article-title":"Optimal and autonomous control using reinforcement learning: A survey","volume":"29","author":"Kiumarsi","year":"2017","journal-title":"IEEE Transactions on Neural Networks and Learning Systems"},{"issue":"1","key":"2025121805181890900_ref117","doi-asserted-by":"crossref","first-page":"114","DOI":"10.1109\/TAC.1968.1098829","article-title":"On an iterative technique for Riccati equation computations","volume":"13","author":"Kleinman","year":"1968","journal-title":"IEEE Transactions on Automatic Control"},{"issue":"6","key":"2025121805181890900_ref118","doi-asserted-by":"crossref","first-page":"673","DOI":"10.1109\/TAC.1969.1099303","article-title":"Optimal stationary control of linear systems with control-dependent noise","volume":"14","author":"Kleinman","year":"1969","journal-title":"IEEE Transactions on Automatic Control"},{"issue":"11","key":"2025121805181890900_ref119","doi-asserted-by":"crossref","DOI":"10.1177\/0278364913495721","article-title":"Reinforcement learning in robotics: A survey","volume":"32","author":"Kober","year":"2013","journal-title":"The Int. J. Robotics Research"},{"issue":"2","key":"2025121805181890900_ref120","doi-asserted-by":"crossref","first-page":"356","DOI":"10.1016\/j.ejor.2013.10.060","article-title":"60 years of portfolio optimization: Practical challenges and current trends","volume":"234","author":"Kolm","year":"2014","journal-title":"European Journal of Operational Research"},{"key":"2025121805181890900_ref121","doi-asserted-by":"crossref","first-page":"301","DOI":"10.1007\/978-1-4757-2204-8_21","volume-title":"Systems, Models and Feedback: Theory and Applications","author":"Krener","year":"1992"},{"key":"2025121805181890900_ref122","doi-asserted-by":"crossref","DOI":"10.1007\/978-0-8176-4877-0","volume-title":"Delay Compensation for Nonlinear, Adaptive, and PDE Systems","author":"Krsti\u0107","year":"2009"},{"key":"2025121805181890900_ref123","volume-title":"Nonlinear and Adaptive Control Design","author":"Krsti\u0107","year":"1995"},{"issue":"1","key":"2025121805181890900_ref124","first-page":"42","article-title":"A review of the matrix Riccati equation","volume":"9","author":"Kucera","year":"1973","journal-title":"Kybernetika"},{"issue":"4","key":"2025121805181890900_ref125","doi-asserted-by":"crossref","first-page":"520","DOI":"10.1137\/0305032","article-title":"Optimal discounted stochastic control for diffusion processes","volume":"5","author":"Kushner","year":"1967","journal-title":"SIAM Journal on Control"},{"key":"2025121805181890900_ref126","volume-title":"Stochastic Approximation and Recursive Algorithms and Applications","author":"Kushner","year":"2003"},{"key":"2025121805181890900_ref127","doi-asserted-by":"crossref","DOI":"10.1093\/oso\/9780198537953.001.0001","volume-title":"Algebraic Riccati Equations","author":"Lancaster","year":"1995"},{"issue":"10","key":"2025121805181890900_ref128","doi-asserted-by":"crossref","first-page":"2280","DOI":"10.1109\/TAC.2008.2006108","article-title":"Computing the positive stabilizing solution to algebraic Riccati equations with an indefinite quadratic term via a recursive method","volume":"53","author":"Lanzon","year":"2008","journal-title":"IEEE Transactions on Automatic Control"},{"issue":"1","key":"2025121805181890900_ref129","doi-asserted-by":"crossref","first-page":"54","DOI":"10.1137\/0305004","article-title":"Construction of suboptimal control sequences","volume":"5","author":"Leake","year":"1967","journal-title":"SIAM Journal on Control"},{"issue":"5","key":"2025121805181890900_ref130","doi-asserted-by":"crossref","first-page":"1235","DOI":"10.1109\/TAC.2008.923688","article-title":"Uniform asymptotic stability of nonlinear switched systems with an application to mobile robots","volume":"53","author":"Lee","year":"2008","journal-title":"IEEE Trans. Automatic Control"},{"issue":"1","key":"2025121805181890900_ref131","doi-asserted-by":"crossref","first-page":"81","DOI":"10.1109\/TITS.2011.2178836","article-title":"Development and evaluation of a cooperative vehicle intersection control algorithm under the connected vehicles environment","volume":"13","author":"Lee","year":"2012","journal-title":"IEEE Transactions on Intelligent Transportation Systems"},{"key":"2025121805181890900_ref132","volume-title":"Robot Manipulator Control: Theory and Practice","author":"Lewis","year":"2004"},{"issue":"3","key":"2025121805181890900_ref133","doi-asserted-by":"crossref","first-page":"32","DOI":"10.1109\/MCAS.2009.933854","article-title":"Reinforcement learning and adaptive dynamic programming for feedback control","volume":"9","author":"Lewis","year":"2009","journal-title":"IEEE Circuits and Systems Magazine"},{"key":"2025121805181890900_ref134","author":"Lewis","year":"2012","edition":"3rd Ed."},{"issue":"6","key":"2025121805181890900_ref135","doi-asserted-by":"crossref","first-page":"76","DOI":"10.1109\/MCS.2012.2214134","article-title":"Reinforcement learning and feedback control: Using natural decision methods to design optimal adaptive controllers","volume":"32","author":"Lewis","year":"2012","journal-title":"IEEE Control Systems"},{"key":"2025121805181890900_ref136","author":"Liberzon","year":"2003"},{"key":"2025121805181890900_ref137","doi-asserted-by":"crossref","DOI":"10.1515\/9781400842643","volume-title":"Calculus of Variations and Optimal Control Theory: A Concise Introduction","author":"Liberzon","year":"2012"},{"key":"2025121805181890900_ref138","doi-asserted-by":"crossref","first-page":"110","DOI":"10.1016\/j.conb.2015.03.008","article-title":"How and why neural and motor variation are related","volume":"33","author":"Lisberger","year":"2015","journal-title":"Current Opinion in Neurobiology"},{"issue":"35","key":"2025121805181890900_ref139","doi-asserted-by":"crossref","first-page":"9354","DOI":"10.1523\/JNEUROSCI.1110-06.2007","article-title":"Evidence for the flexible sensorimotor strategies predicted by optimal feedback control","volume":"27","author":"Liu","year":"2007","journal-title":"The Journal of Neuroscience"},{"issue":"5","key":"2025121805181890900_ref140","doi-asserted-by":"crossref","first-page":"1306","DOI":"10.1016\/j.automatica.2009.01.003","article-title":"Parameter convergence and minimal internal model with an adaptive output regulation problem","volume":"45","author":"Liu","year":"2009","journal-title":"Automatica"},{"key":"2025121805181890900_ref141","volume-title":"Nonlinear Control of Dynamic Networks","author":"Liu","year":"2014"},{"key":"2025121805181890900_ref142","author":"Liu","year":"2017"},{"issue":"7","key":"2025121805181890900_ref143","doi-asserted-by":"crossref","first-page":"956","DOI":"10.1038\/nn1722","article-title":"Cortico-basal ganglia circuit mechanism for a decision threshold in reaction time tasks","volume":"9","author":"Lo","year":"2006","journal-title":"Nature Neuroscience"},{"key":"2025121805181890900_ref144","author":"Lorica","year":"2017"},{"issue":"12","key":"2025121805181890900_ref145","doi-asserted-by":"crossref","first-page":"3281","DOI":"10.1016\/j.automatica.2014.10.056","article-title":"Data-based approximate policy iteration for affine nonlinear continuous-time optimal control design","volume":"50","author":"Luo","year":"2014","journal-title":"Automatica"},{"issue":"10","key":"2025121805181890900_ref146","doi-asserted-by":"crossref","first-page":"2134","DOI":"10.1109\/TNNLS.2016.2585520","article-title":"Model-free optimal tracking control via critic-only Q-learning","volume":"27","author":"Luo","year":"2016","journal-title":"IEEE Transactions on Neural Networks and Learning Systems"},{"key":"2025121805181890900_ref147","author":"Mahadevan","year":"1996"},{"issue":"12","key":"2025121805181890900_ref148","doi-asserted-by":"crossref","first-page":"2199","DOI":"10.1109\/TAC.2003.820143","article-title":"Output regulation for linear systems via adaptive internal model","volume":"48","author":"Marino","year":"2003","journal-title":"IEEE Transactions on Automatic Control"},{"issue":"3","key":"2025121805181890900_ref149","doi-asserted-by":"crossref","first-page":"487","DOI":"10.2307\/1427521","article-title":"Stability of Markovian processes II: Continuous-time processes and sampled chains","volume":"25","author":"Meyn","year":"1993","journal-title":"Advances in Applied Probability"},{"issue":"3","key":"2025121805181890900_ref150","doi-asserted-by":"crossref","first-page":"518","DOI":"10.2307\/1427522","article-title":"Stability of Markovian processes III: Foster-Lyapunov criteria for continuous-time processes","volume":"25","author":"Meyn","year":"1993","journal-title":"Advances in Applied Probability"},{"key":"2025121805181890900_ref151","author":"Minsky","year":"1954"},{"issue":"7540","key":"2025121805181890900_ref152","doi-asserted-by":"crossref","first-page":"529","DOI":"10.1038\/nature14236","article-title":"Human-level control through deep reinforcement learning","volume":"518","author":"Mnih","year":"2015","journal-title":"Nature"},{"key":"2025121805181890900_ref153","first-page":"1928","author":"Mnih","year":"2016"},{"issue":"11","key":"2025121805181890900_ref154","doi-asserted-by":"crossref","DOI":"10.1109\/TAC.2014.2317301","article-title":"Linear quadratic tracking control of partially-unknown continuous-time systems using reinforcement learning","volume":"59","author":"Modares","year":"2014","journal-title":"IEEE Transactions on Automatic Control"},{"issue":"3","key":"2025121805181890900_ref155","doi-asserted-by":"crossref","first-page":"265","DOI":"10.1023\/A:1007686309208","article-title":"A study of reinforcement learning in the continuous case by the means of viscosity solutions","volume":"40","author":"Munos","year":"2000","journal-title":"Machine Learning"},{"issue":"2","key":"2025121805181890900_ref156","doi-asserted-by":"crossref","first-page":"140","DOI":"10.1109\/TSMCC.2002.801727","article-title":"Adaptive dynamic programming","volume":"32","author":"Murray","year":"2002","journal-title":"IEEE Transactions on Systems, Man, and Cybernetics, Part C: Applications and Reviews"},{"key":"2025121805181890900_ref157","author":"Nedic","year":"2003"},{"issue":"6","key":"2025121805181890900_ref158","doi-asserted-by":"crossref","first-page":"913","DOI":"10.1109\/TNNLS.2013.2247627","article-title":"Adaptive learning in tracking control based on the dual critic network design","volume":"24","author":"Ni","year":"2013","journal-title":"IEEE Transactions on Neural Networks and Learning Systems"},{"issue":"2","key":"2025121805181890900_ref159","article-title":"Reinforcement learning and non-zero-sum game output regulation for multi-player linear uncertain systems","volume":"112","author":"Odekunle","year":"2020","journal-title":"Automatica"},{"issue":"4","key":"2025121805181890900_ref160","doi-asserted-by":"crossref","first-page":"1527","DOI":"10.1109\/TITS.2014.2302816","article-title":"Cooperative adaptive cruise control: Network-aware analysis of string stability","volume":"15","author":"Oncu","year":"2014","journal-title":"IEEE Transactions on Intelligent Transportation Systems"},{"key":"2025121805181890900_ref161","author":"Pang","year":"2020"},{"issue":"1","key":"2025121805181890900_ref162","doi-asserted-by":"crossref","first-page":"73","DOI":"10.1007\/s11768-019-8168-8","article-title":"Adaptive dynamic programming for finite-horizon optimal control of linear time-varying discretetime systems","volume":"17","author":"Pang","year":"2019","journal-title":"Control Theory and Technology"},{"key":"2025121805181890900_ref163","author":"Pang","year":"2020"},{"issue":"2","key":"2025121805181890900_ref164","doi-asserted-by":"crossref","first-page":"246","DOI":"10.1162\/neco.1991.3.2.246","article-title":"Universal approximation using radial-basis-function networks","volume":"3","author":"Park","year":"1991","journal-title":"Neural Computation"},{"issue":"9","key":"2025121805181890900_ref165","doi-asserted-by":"crossref","first-page":"4015","DOI":"10.1523\/JNEUROSCI.3244-14.2015","article-title":"Reward-dependent modulation of movement variability","volume":"35","author":"Pekny","year":"2015","journal-title":"The Journal of Neuroscience"},{"issue":"2","key":"2025121805181890900_ref166","doi-asserted-by":"crossref","first-page":"371","DOI":"10.1287\/moor.11.2.371","article-title":"A stochastic calculus model of continuous trading: Optimal portfolios","volume":"11","author":"Pliska","year":"1986","journal-title":"Mathematics of Operations Research"},{"issue":"1","key":"2025121805181890900_ref167","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1007\/BF01211516","article-title":"Stabilization in spite of matched unmodeled dynamics and an equivalent definition of input-to-state stability","volume":"9","author":"Praly","year":"1996","journal-title":"Mathematics of Control, Signals and Systems"},{"key":"2025121805181890900_ref168","volume-title":"Markov Decision Processes: Discrete Stochastic Dynamic Programming","author":"Puterman","year":"2005"},{"issue":"10","key":"2025121805181890900_ref169","doi-asserted-by":"crossref","DOI":"10.1109\/TAC.2019.2957338","article-title":"Learning-based event-triggered control for synchronization of passive multi-agent systems under attack","volume":"65","author":"Rahnama","year":"2019","journal-title":"IEEE Transactions on Automatic Control"},{"issue":"1","key":"2025121805181890900_ref170","doi-asserted-by":"crossref","first-page":"253","DOI":"10.1146\/annurev-control-053018-023825","article-title":"A tour of reinforcement learning: The view from continuous control","volume":"2","author":"Recht","year":"2019","journal-title":"Annual Review of Control, Robotics, and Autonomous Systems"},{"key":"2025121805181890900_ref171","doi-asserted-by":"crossref","first-page":"211","DOI":"10.1016\/j.conb.2014.02.013","article-title":"Variability in neural activity and behavior","volume":"25","author":"Renart","year":"2014","journal-title":"Current Opinion in Neurobiology"},{"key":"2025121805181890900_ref172","author":"Rizvi","year":"2019"},{"issue":"3","key":"2025121805181890900_ref173","doi-asserted-by":"crossref","first-page":"400","DOI":"10.1214\/aoms\/1177729586","article-title":"A stochastic approximation method","volume":"22","author":"Robbins","year":"1951","journal-title":"The Annals of Mathematical Statistics"},{"issue":"3","key":"2025121805181890900_ref174","doi-asserted-by":"crossref","first-page":"341","DOI":"10.1016\/0022-0531(76)90046-6","article-title":"The arbitrage theory of capital asset pricing","volume":"13","author":"Ross","year":"1976","journal-title":"Journal of Economic Theory"},{"key":"2025121805181890900_ref175","volume-title":"Artificial Intelligence: A Modern Approach","author":"Russell","year":"2010"},{"issue":"10","key":"2025121805181890900_ref176","doi-asserted-by":"crossref","first-page":"1233","DOI":"10.1068\/p5343","article-title":"A two-point visual control model of steering","volume":"33","author":"Salvucci","year":"2004","journal-title":"Perception"},{"issue":"3","key":"2025121805181890900_ref177","doi-asserted-by":"crossref","first-page":"254","DOI":"10.1109\/TAC.1974.1100536","article-title":"On Newton's method for Riccati equation solution","volume":"19","author":"Sandell","year":"1974","journal-title":"IEEE Transactions on Automatic Control"},{"issue":"3","key":"2025121805181890900_ref178","doi-asserted-by":"crossref","first-page":"152","DOI":"10.1109\/TSMC.1979.4310171","article-title":"An approximation theory of optimal control for trainable manipulators","volume":"9","author":"Saridis","year":"1979","journal-title":"IEEE Transactions on Systems, Man and Cybernetics"},{"key":"2025121805181890900_ref179","author":"Schmidhuber","year":"2015"},{"key":"2025121805181890900_ref180","first-page":"298","article-title":"A reinforcement learning method for maximizing undiscounted rewards","author":"Schwartz","year":"1993"},{"issue":"10","key":"2025121805181890900_ref181","doi-asserted-by":"crossref","first-page":"1835","DOI":"10.1109\/TAC.2004.835586","article-title":"Disturbance propagation in vehicle strings","volume":"49","author":"Seiler","year":"2004","journal-title":"IEEE Transactions on Automatic Control"},{"issue":"8","key":"2025121805181890900_ref182","doi-asserted-by":"crossref","first-page":"1178","DOI":"10.1109\/9.940923","article-title":"Semiglobal nonlinear output regulation with adaptive internal model","volume":"46","author":"Serrani","year":"2001","journal-title":"IEEE Transactions on Automatic Control"},{"issue":"5","key":"2025121805181890900_ref183","doi-asserted-by":"crossref","first-page":"3208","DOI":"10.1523\/JNEUROSCI.14-05-03208.1994","article-title":"Adaptive representation of dynamics during learning of a motor task","volume":"14","author":"Shadmehr","year":"1994","journal-title":"The Journal of Neuroscience"},{"key":"2025121805181890900_ref184","doi-asserted-by":"crossref","DOI":"10.7551\/mitpress\/9780262016964.001.0001","volume-title":"Biological Learning and Control: How the Brain Builds Representations, Predicts Events, and Makes Decisions","author":"Shadmehr","year":"2012"},{"issue":"1","key":"2025121805181890900_ref185","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1137\/0324001","article-title":"Phase portrait of the matrix Riccati equation","volume":"24","author":"Shayman","year":"1986","journal-title":"SIAM Journal on Control and Optimization"},{"key":"2025121805181890900_ref186","doi-asserted-by":"crossref","first-page":"63","DOI":"10.3141\/2324-08","article-title":"Impacts of cooperative adaptive cruise control on freeway traffic flow","volume":"2324","author":"Shladover","year":"2012","journal-title":"Transportation Research Record"},{"key":"2025121805181890900_ref187","author":"Silver","year":"2015"},{"issue":"7587","key":"2025121805181890900_ref188","doi-asserted-by":"crossref","first-page":"484","DOI":"10.1038\/nature16961","article-title":"Mastering the game of Go with deep neural networks and tree search","volume":"529","author":"Silver","year":"2016","journal-title":"Nature"},{"issue":"7676","key":"2025121805181890900_ref189","doi-asserted-by":"crossref","first-page":"354","DOI":"10.1038\/nature24270","article-title":"Mastering the game of Go without human knowledge","volume":"550","author":"Silver","year":"2017","journal-title":"Nature"},{"issue":"4","key":"2025121805181890900_ref190","doi-asserted-by":"crossref","first-page":"851","DOI":"10.1109\/TNNLS.2015.2399020","article-title":"Multiple actor-critic structures for continuous-time optimal control using input-output data","volume":"26","author":"Song","year":"2015","journal-title":"IEEE Transactions on Neural Networks and Learning Systems"},{"key":"2025121805181890900_ref191","doi-asserted-by":"crossref","first-page":"163","DOI":"10.1007\/978-3-540-77653-6_3","volume-title":"Nonlinear and Optimal Control Theory","author":"Sontag","year":"2008"},{"key":"2025121805181890900_ref192","doi-asserted-by":"crossref","DOI":"10.1002\/0471722138","volume-title":"Introduction to Stochastic Search and Optimization: Estimation, Simulation, and Control","author":"Spall","year":"2003"},{"issue":"4","key":"2025121805181890900_ref193","doi-asserted-by":"crossref","first-page":"1062","DOI":"10.1109\/TAC.2011.2169618","article-title":"Cooperative output regulation of linear multi-agent systems","volume":"57","author":"Su","year":"2012","journal-title":"IEEE Transactions on Automatic Control"},{"key":"2025121805181890900_ref194","author":"Sutton","year":"2018"},{"issue":"2","key":"2025121805181890900_ref195","doi-asserted-by":"crossref","first-page":"19","DOI":"10.1109\/37.126844","article-title":"Reinforcement learning is direct adaptive optimal control","volume":"12","author":"Sutton","year":"1992","journal-title":"IEEE Control Systems"},{"key":"2025121805181890900_ref196","volume-title":"\"Between MDPs and semi-MDPs: A framework for temporal abstraction in reinforcement learning\"","author":"Sutton","year":"1999"},{"key":"2025121805181890900_ref197","author":"Sutton","year":"2000"},{"key":"2025121805181890900_ref198","author":"Szepesv\u00e1ri","year":"2010"},{"issue":"3","key":"2025121805181890900_ref199","doi-asserted-by":"crossref","first-page":"443","DOI":"10.1109\/TRA.2004.825275","article-title":"Leader-to-formation stability","volume":"20","author":"Tanner","year":"2004","journal-title":"IEEE Transactions on Robotics and Automation"},{"key":"2025121805181890900_ref200","doi-asserted-by":"crossref","DOI":"10.1002\/0471459100","volume-title":"Adaptive Control Design and Analysis","author":"Tao","year":"2003"},{"key":"2025121805181890900_ref201","author":"Theodorou","year":"2010"},{"key":"2025121805181890900_ref202","volume-title":"\"Efficient exploration in reinforcement learning\"","author":"Thrun","year":"1992"},{"issue":"9","key":"2025121805181890900_ref203","doi-asserted-by":"crossref","first-page":"907","DOI":"10.1038\/nn1309","article-title":"Optimality principles in sensorimotor control","volume":"7","author":"Todorov","year":"2004","journal-title":"Nature Neuroscience"},{"issue":"5","key":"2025121805181890900_ref204","doi-asserted-by":"crossref","first-page":"1084","DOI":"10.1162\/0899766053491887","article-title":"Stochastic optimal control and estimation methods adapted to the noise characteristics of the sensorimotor system","volume":"17","author":"Todorov","year":"2005","journal-title":"Neural Computation"},{"issue":"11","key":"2025121805181890900_ref205","doi-asserted-by":"crossref","DOI":"10.1038\/nn963","article-title":"Optimal feedback control as a theory of motor coordination","volume":"5","author":"Todorov","year":"2002","journal-title":"Nature Neuroscience"},{"issue":"3","key":"2025121805181890900_ref206","doi-asserted-by":"crossref","first-page":"185","DOI":"10.1023\/A:1022689125041","article-title":"Asynchronous stochastic approximation and Q-learning","volume":"16","author":"Tsitsiklis","year":"1994","journal-title":"Machine Learning"},{"issue":"5","key":"2025121805181890900_ref207","doi-asserted-by":"crossref","first-page":"674","DOI":"10.1109\/9.580874","article-title":"An analysis of temporaldifference learning with function approximation","volume":"42","author":"Tsitsiklis","year":"1997","journal-title":"IEEE Transactions on Automatic Control"},{"issue":"11","key":"2025121805181890900_ref208","doi-asserted-by":"crossref","first-page":"1799","DOI":"10.1016\/S0005-1098(99)00099-0","article-title":"Average cost temporaldifference learning","volume":"35","author":"Tsitsiklis","year":"1999","journal-title":"Automatica"},{"issue":"2-3","key":"2025121805181890900_ref209","doi-asserted-by":"crossref","first-page":"179","DOI":"10.1023\/A:1017980312899","article-title":"On average versus discounted reward temporal-difference learning","volume":"49","author":"Tsitsiklis","year":"2002","journal-title":"Machine Learning"},{"issue":"2","key":"2025121805181890900_ref210","doi-asserted-by":"crossref","first-page":"89","DOI":"10.1007\/BF00204593","article-title":"Formation and control of optimal trajectory in human multijoint arm movement","volume":"61","author":"Uno","year":"1989","journal-title":"Biological Cybernetics"},{"key":"2025121805181890900_ref211","doi-asserted-by":"crossref","first-page":"14","DOI":"10.1016\/j.sysconle.2016.12.003","article-title":"Q-learning for continuous-time linear systems: A model-free infinite horizon optimal control approach","volume":"100","author":"Vamvoudakis","year":"2017","journal-title":"Systems & Control Letters"},{"key":"2025121805181890900_ref212","first-page":"412","article-title":"Model-free event-triggered control algorithms for continuous-time linear systems with optimal performance","volume":"87","author":"Vamvoudakis","year":"2018","journal-title":"Systems & Control Letters"},{"key":"2025121805181890900_ref213","doi-asserted-by":"crossref","first-page":"207","DOI":"10.1007\/978-3-642-27645-3_7","volume-title":"Reinforcement Learning: State-of-the-Art","author":"van Hasselt","year":"2012"},{"key":"2025121805181890900_ref214","author":"van Hasselt","year":"2007"},{"key":"2025121805181890900_ref215","author":"van der Schaft","year":"2017"},{"key":"2025121805181890900_ref216","author":"van der Schaft","year":"2000"},{"issue":"17","key":"2025121805181890900_ref217","doi-asserted-by":"crossref","DOI":"10.1523\/JNEUROSCI.2656-14.2015","article-title":"Persistent residual errors in motor adaptation tasks: Reversion to baseline and exploratory escape","volume":"35","author":"Vaswani","year":"2015","journal-title":"The Journal of Neuroscience"},{"issue":"2","key":"2025121805181890900_ref218","doi-asserted-by":"crossref","first-page":"477","DOI":"10.1016\/j.automatica.2008.08.017","article-title":"Adaptive optimal control for continuous-time linear systems based on policy iteration","volume":"45","author":"Vrabie","year":"2009","journal-title":"Automatica"},{"key":"2025121805181890900_ref219","volume-title":"Optimal Adaptive Control and Differential Games by Reinforcement Learning Principles","author":"Vrabie","year":"2013"},{"key":"2025121805181890900_ref220","doi-asserted-by":"crossref","DOI":"10.1007\/978-981-13-1253-3","volume-title":"Adaptive Critic Control with Robust Stabilization for Uncertain Nonlinear Systems","author":"Wang","year":"2019"},{"issue":"10","key":"2025121805181890900_ref221","doi-asserted-by":"crossref","DOI":"10.1109\/TCYB.2017.2712188","article-title":"Adaptive critic nonlinear robust control: A survey","volume":"47","author":"Wang","year":"2017","journal-title":"IEEE Transactions on Cybernetics"},{"issue":"2","key":"2025121805181890900_ref222","doi-asserted-by":"crossref","first-page":"39","DOI":"10.1109\/MCI.2009.932261","article-title":"Adaptive dynamic programming: An introduction","volume":"4","author":"Wang","year":"2009","journal-title":"IEEE Computational Intelligence Magazine"},{"issue":"6","key":"2025121805181890900_ref223","doi-asserted-by":"crossref","first-page":"860","DOI":"10.1038\/s41593-018-0147-8","article-title":"Prefrontal cortex as a meta-reinforcement learning system","volume":"21","author":"Wang","year":"2018","journal-title":"Nature Neuroscience"},{"issue":"12","key":"2025121805181890900_ref224","doi-asserted-by":"crossref","first-page":"2891","DOI":"10.1109\/TAC.2010.2076250","article-title":"A distributed control approach to a robust output regulation problem for multiagent linear systems","volume":"55","author":"Wang","year":"2010","journal-title":"IEEE Transactions on Automatic Control"},{"issue":"3","key":"2025121805181890900_ref225","article-title":"The elements of intelligence","volume":"11","author":"Werbos","year":"1968","journal-title":"Cybernetica (Namur)"},{"key":"2025121805181890900_ref226","first-page":"3","author":"Werbos","year":"2013","journal-title":"Reinforcement Learning and Approximate Dynamic Programming for Feedback Control"},{"key":"2025121805181890900_ref227","first-page":"107","author":"Werbos","year":"2014"},{"key":"2025121805181890900_ref228","author":"Werbos","year":"2018"},{"issue":"6","key":"2025121805181890900_ref229","doi-asserted-by":"crossref","first-page":"621","DOI":"10.1109\/TAC.1971.1099831","article-title":"Least squares stationary optimal control and the algebraic Riccati equation","volume":"16","author":"Willems","year":"1971","journal-title":"IEEE Transactions on Automatic Control"},{"key":"2025121805181890900_ref230","author":"Wise","year":"2004"},{"key":"2025121805181890900_ref231","doi-asserted-by":"crossref","first-page":"1212","DOI":"10.1038\/81497","article-title":"Computational principles of movement neuroscience","volume":"3","author":"Wolpert","year":"2000","journal-title":"Nature Neuroscience"},{"issue":"12","key":"2025121805181890900_ref232","doi-asserted-by":"crossref","first-page":"739","DOI":"10.1038\/nrn3112","article-title":"Principles of sensorimotor learning","volume":"12","author":"Wolpert","year":"2011","journal-title":"Nature Reviews Neuroscience"},{"issue":"3","key":"2025121805181890900_ref233","doi-asserted-by":"crossref","first-page":"486","DOI":"10.1137\/0305028","article-title":"Optimal stationary control of a linear system with state-dependent noise","volume":"5","author":"Wonham","year":"1967","journal-title":"SIAM Journal on Control"},{"issue":"2","key":"2025121805181890900_ref234","doi-asserted-by":"crossref","first-page":"312","DOI":"10.1038\/nn.3616","article-title":"Temporal structure of motor variability is dynamically regulated and predicts motor learning ability","volume":"17","author":"Wu","year":"2014","journal-title":"Nature Neuroscience"},{"issue":"1","key":"2025121805181890900_ref235","doi-asserted-by":"crossref","first-page":"82901","DOI":"10.1109\/ACCESS.2019.2923845","article-title":"Data-driven integral reinforcement learning for continuoustime non-zero-sum games","volume":"7","author":"Yang","year":"2019","journal-title":"IEEE Access"},{"issue":"7","key":"2025121805181890900_ref236","doi-asserted-by":"crossref","first-page":"1515","DOI":"10.1109\/TAC.2009.2022097","article-title":"Convergence results for some temporal difference methods based on least squares","volume":"54","author":"Yu","year":"2009","journal-title":"IEEE Transactions on Automatic Control"},{"issue":"3","key":"2025121805181890900_ref237","doi-asserted-by":"crossref","first-page":"390","DOI":"10.1137\/0307028","article-title":"A Lyapunov criterion for the existence of stationary probability distributions for systems perturbed by noise","volume":"7","author":"Zakai","year":"1969","journal-title":"SIAM Journal on Control"},{"issue":"1","key":"2025121805181890900_ref238","doi-asserted-by":"crossref","first-page":"19","DOI":"10.1080\/23307706.2015.1129295","article-title":"Learning control in robot-assisted rehabilitation of motor skills-A review","volume":"3","author":"Zhou","year":"2016","journal-title":"Journal of Control and Decision"},{"issue":"3","key":"2025121805181890900_ref239","doi-asserted-by":"publisher","first-page":"176","DOI":"10.1561\/2600000023","article-title":"Learning-Based Control: A Tutorial and Some Recent Results","volume":"8","author":"Jiang","year":"2020","journal-title":"Foundations and Trends in Systems and Control"}],"container-title":["Foundations and Trends in Systems and Control"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/www.emerald.com\/ftsys\/article-pdf\/8\/3\/176\/11098016\/2600000023en.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"syndication"},{"URL":"https:\/\/www.emerald.com\/ftsys\/article-pdf\/8\/3\/176\/11098016\/2600000023en.pdf","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,4,29]],"date-time":"2026-04-29T19:00:47Z","timestamp":1777489247000},"score":1,"resource":{"primary":{"URL":"https:\/\/www.emerald.com\/ftsys\/article\/8\/3\/176\/1330355\/Learning-Based-Control-A-Tutorial-and-Some-Recent"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2020,12,8]]},"references-count":239,"journal-issue":{"issue":"3","published-print":{"date-parts":[[2020,12,8]]}},"URL":"https:\/\/doi.org\/10.1561\/2600000023","relation":{},"ISSN":["2325-6818","2325-6826"],"issn-type":[{"value":"2325-6818","type":"print"},{"value":"2325-6826","type":"electronic"}],"subject":[],"published":{"date-parts":[[2020,12,8]]}}}