{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,1,5]],"date-time":"2026-01-05T21:48:35Z","timestamp":1767649715698},"publisher-location":"Berlin, Heidelberg","reference-count":92,"publisher":"Springer Berlin Heidelberg","isbn-type":[{"type":"print","value":"9783642116872"},{"type":"electronic","value":"9783642116889"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2010]]},"DOI":"10.1007\/978-3-642-11688-9_1","type":"book-chapter","created":{"date-parts":[[2010,3,22]],"date-time":"2010-03-22T01:34:40Z","timestamp":1269221680000},"page":"3-44","source":"Crossref","is-referenced-by-count":8,"title":["Approximate Dynamic Programming and Reinforcement Learning"],"prefix":"10.1007","author":[{"given":"Lucian","family":"Bu\u015foniu","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Bart","family":"De Schutter","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Robert","family":"Babu\u0161ka","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","reference":[{"issue":"4","key":"1_CR1","doi-asserted-by":"publisher","first-page":"950","DOI":"10.1109\/TSMCB.2008.921000","volume":"38","author":"B. Baddeley","year":"2008","unstructured":"Baddeley, B.: Reinforcement learning in continuous time and space: Interference and not ill conditioning is the main problem when using distributed function approximators. IEEE Transactions on Systems, Man, and Cybernetics\u2014Part B: Cybernetics\u00a038(4), 950\u2013956 (2008)","journal-title":"IEEE Transactions on Systems, Man, and Cybernetics\u2014Part B: Cybernetics"},{"key":"1_CR2","unstructured":"Barash, D.: A genetic search in policy space for solving Markov decision processes. In: AAAI Spring Symposium on Search Techniques for Problem Solving under Uncertainty and Incomplete Information. Palo Alto, US (1999)"},{"issue":"5","key":"1_CR3","first-page":"833","volume":"13","author":"A.G. Barto","year":"1983","unstructured":"Barto, A.G., Sutton, R.S., Anderson, C.W.: Neuronlike adaptive elements than can solve difficult learning control problems. IEEE Transactions on Systems, Man, and Cybernetics\u00a013(5), 833\u2013846 (1983)","journal-title":"IEEE Transactions on Systems, Man, and Cybernetics"},{"key":"1_CR4","doi-asserted-by":"publisher","first-page":"319","DOI":"10.1016\/S0954-1810(01)00028-0","volume":"15","author":"J. Baxter","year":"2001","unstructured":"Baxter, J., Bartlett, P.L.: Infinite-horizon policy-gradient estimation. Journal of Artificial Intelligence Research\u00a015, 319\u2013350 (2001)","journal-title":"Journal of Artificial Intelligence Research"},{"issue":"5","key":"1_CR5","doi-asserted-by":"publisher","first-page":"724","DOI":"10.1109\/72.159061","volume":"3","author":"H.R. Berenji","year":"1992","unstructured":"Berenji, H.R., Khedkar, P.: Learning and tuning fuzzy logic controllers through reinforcements. IEEE Transactions on Neural Networks\u00a03(5), 724\u2013740 (1992)","journal-title":"IEEE Transactions on Neural Networks"},{"issue":"4","key":"1_CR6","doi-asserted-by":"publisher","first-page":"478","DOI":"10.1109\/TFUZZ.2003.814834","volume":"11","author":"H.R. Berenji","year":"2003","unstructured":"Berenji, H.R., Vengerov, D.: A convergent actor-critic-based FRL algorithm with application to power management of wireless transmitters. IEEE Transactions on Fuzzy Systems\u00a011(4), 478\u2013485 (2003)","journal-title":"IEEE Transactions on Fuzzy Systems"},{"issue":"6","key":"1_CR7","doi-asserted-by":"publisher","first-page":"589","DOI":"10.1109\/9.24227","volume":"34","author":"D.P. Bertsekas","year":"1989","unstructured":"Bertsekas, D.P.: Adaptive aggregation methods for infinite horizon dynamic programming. IEEE Transactions on Automatic Control\u00a034(6), 589\u2013598 (1989)","journal-title":"IEEE Transactions on Automatic Control"},{"key":"#cr-split#-1_CR8.1","doi-asserted-by":"crossref","unstructured":"Bertsekas, D.P.: Dynamic programming and suboptimal control: A survey from ADP to MPC. European Journal of Control\u00a011(4-5) (2005);","DOI":"10.3166\/ejc.11.310-334"},{"key":"#cr-split#-1_CR8.2","unstructured":"Special issue for the CDC-ECC-05 in Seville, Spain"},{"key":"1_CR9","unstructured":"Bertsekas, D.P.: Dynamic Programming and Optimal Control, 3rd edn., vol.\u00a02. Athena Scientific, Belmont (2007)"},{"key":"1_CR10","volume-title":"Stochastic Optimal Control: The Discrete Time Case","author":"D.P. Bertsekas","year":"1978","unstructured":"Bertsekas, D.P., Shreve, S.E.: Stochastic Optimal Control: The Discrete Time Case. Academic Press, London (1978)"},{"key":"1_CR11","volume-title":"Neuro-Dynamic Programming","author":"D.P. Bertsekas","year":"1996","unstructured":"Bertsekas, D.P., Tsitsiklis, J.N.: Neuro-Dynamic Programming. Athena Scientific, Belmont (1996)"},{"key":"1_CR12","doi-asserted-by":"publisher","first-page":"207","DOI":"10.1016\/j.sysconle.2004.08.007","volume":"54","author":"V. Borkar","year":"2005","unstructured":"Borkar, V.: An actor\u2013critic algorithm for constrained Markov decision processes. Systems & Control Letters\u00a054, 207\u2013213 (2005)","journal-title":"Systems & Control Letters"},{"issue":"2","key":"1_CR13","doi-asserted-by":"publisher","first-page":"156","DOI":"10.1109\/TSMCC.2007.913919","volume":"38","author":"L. Bu\u015foniu","year":"2008","unstructured":"Bu\u015foniu, L., Babu\u0161ka, R., De Schutter, B.: A comprehensive survey of multi-agent reinforcement learning. IEEE Transactions on Systems, Man, and Cybernetics\u00a038(2), 156\u2013172 (2008)","journal-title":"IEEE Transactions on Systems, Man, and Cybernetics"},{"key":"1_CR14","doi-asserted-by":"crossref","unstructured":"Bu\u015foniu, L., Ernst, D., De Schutter, B., Babu\u0161ka, R.: Consistency of fuzzy model-based reinforcement learning. In: Proceedings 2008 IEEE International Conference on Fuzzy Systems (FUZZ-IEEE 2008), Hong Kong, pp. 518\u2013524 (2008)","DOI":"10.1109\/FUZZY.2008.4630417"},{"key":"1_CR15","doi-asserted-by":"crossref","unstructured":"Bu\u015foniu, L., Ernst, D., De Schutter, B., Babu\u0161ka, R.: Fuzzy partition optimization for approximate fuzzy Q-iteration. In: Proceedings 17th IFAC World Congress (IFAC 2008), Seoul, Korea, pp. 5629\u20135634 (2008)","DOI":"10.3182\/20080706-5-KR-1001.00949"},{"key":"1_CR16","doi-asserted-by":"crossref","unstructured":"Bu\u015foniu, L., Ernst, D., De Schutter, B., Babu\u0161ka, R.: Policy search with cross-entropy optimization of basis functions. In: Proceedings 2009 IEEE International Symposium on Adaptive Dynamic Programming and Reinforcement Learning (ADPRL 2009), Nashville, US, pp. 153\u2013160 (2009)","DOI":"10.1109\/ADPRL.2009.4927539"},{"key":"1_CR17","doi-asserted-by":"crossref","DOI":"10.1007\/978-1-84628-690-2","volume-title":"Simulation-Based Algorithms for Markov Decision Processes","author":"H.S. Chang","year":"2007","unstructured":"Chang, H.S., Fu, M.C., Hu, J., Marcus, S.I.: Simulation-Based Algorithms for Markov Decision Processes. Springer, Heidelberg (2007)"},{"key":"1_CR18","doi-asserted-by":"crossref","unstructured":"Chin, H.H., Jafari, A.A.: Genetic algorithm methods for solving the best stationary policy of finite Markov decision processes. In: Proceedings 30th Southeastern Symposium on System Theory, Morgantown, US, pp. 538\u2013543 (1998)","DOI":"10.1109\/SSST.1998.660132"},{"issue":"8","key":"1_CR19","doi-asserted-by":"publisher","first-page":"898","DOI":"10.1109\/9.133184","volume":"36","author":"C.S. Chow","year":"1991","unstructured":"Chow, C.S., Tsitsiklis, J.N.: An optimal one-way multigrid algorithm for discrete-time stochastic control. IEEE Transactions on Automatic Control\u00a036(8), 898\u2013914 (1991)","journal-title":"IEEE Transactions on Automatic Control"},{"key":"1_CR20","series-title":"Lecture Notes in Artificial Intelligence","doi-asserted-by":"publisher","first-page":"403","DOI":"10.1007\/3-540-36169-3_32","volume-title":"Algorithmic Learning Theory","author":"R. Coulom","year":"2002","unstructured":"Coulom, R.: Feedforward neural networks in reinforcement learning applied to high-dimensional motor control. In: Cesa-Bianchi, N., Numao, M., Reischuk, R. (eds.) ALT 2002. LNCS (LNAI), vol.\u00a02533, pp. 403\u2013413. Springer, Heidelberg (2002)"},{"key":"1_CR21","first-page":"503","volume":"6","author":"D. Ernst","year":"2005","unstructured":"Ernst, D., Geurts, P., Wehenkel, L.: Tree-based batch mode reinforcement learning. Journal of Machine Learning Research\u00a06, 503\u2013556 (2005)","journal-title":"Journal of Machine Learning Research"},{"issue":"2","key":"1_CR22","doi-asserted-by":"publisher","first-page":"517","DOI":"10.1109\/TSMCB.2008.2007630","volume":"39","author":"D. Ernst","year":"2009","unstructured":"Ernst, D., Glavic, M., Capitanescu, F., Wehenkel, L.: Reinforcement learning versus model predictive control: a comparison on a power system problem. IEEE Transactions on Systems, Man, and Cybernetics\u2014Part B: Cybernetics\u00a039(2), 517\u2013529 (2009)","journal-title":"IEEE Transactions on Systems, Man, and Cybernetics\u2014Part B: Cybernetics"},{"key":"1_CR23","unstructured":"Glorennec, P.Y.: Reinforcement learning: An overview. In: Proceedings European Symposium on Intelligent Techniques (ESIT 2000), Aachen, Germany, pp. 17\u201335 (2000)"},{"key":"1_CR24","series-title":"Lecture Notes in Artificial Intelligence","doi-asserted-by":"publisher","first-page":"654","DOI":"10.1007\/11871842_64","volume-title":"Machine Learning: ECML 2006","author":"F.J. Gomez","year":"2006","unstructured":"Gomez, F.J., Schmidhuber, J., Miikkulainen, R.: Efficient non-linear control through neuroevolution. In: F\u00fcrnkranz, J., Scheffer, T., Spiliopoulou, M. (eds.) ECML 2006. LNCS (LNAI), vol.\u00a04212, pp. 654\u2013662. Springer, Heidelberg (2006)"},{"issue":"2","key":"1_CR25","doi-asserted-by":"publisher","first-page":"242","DOI":"10.1137\/0323018","volume":"23","author":"R.L. Gonzalez","year":"1985","unstructured":"Gonzalez, R.L., Rofman, E.: On deterministic control problems: An approximation procedure for the optimal cost I. The stationary problem. SIAM Journal on Control and Optimization\u00a023(2), 242\u2013266 (1985)","journal-title":"The stationary problem. SIAM Journal on Control and Optimization"},{"key":"1_CR26","doi-asserted-by":"crossref","unstructured":"Gordon, G.: Stable function approximation in dynamic programming. In: Proceedings 12th International Conference on Machine Learning (ICML 1995), Tahoe City, US, pp. 261\u2013268 (1995)","DOI":"10.1016\/B978-1-55860-377-6.50040-2"},{"key":"1_CR27","doi-asserted-by":"publisher","first-page":"85","DOI":"10.1007\/s00211-004-0555-4","volume":"99","author":"L. Gr\u00fcne","year":"2004","unstructured":"Gr\u00fcne, L.: Error estimation and adaptive discretization for the discrete stochastic Hamilton-Jacobi-Bellman equation. Numerical Mathematics\u00a099, 85\u2013112 (2004)","journal-title":"Numerical Mathematics"},{"key":"1_CR28","doi-asserted-by":"crossref","unstructured":"Horiuchi, T., Fujino, A., Katai, O., Sawaragi, T.: Fuzzy interpolation-based Q-learning with continuous states and actions. In: Proceedings 5th IEEE International Conference on Fuzzy Systems (FUZZ-IEEE 1996), New Orleans, US, pp. 594\u2013600 (1996)","DOI":"10.1109\/FUZZY.1996.551807"},{"issue":"6","key":"1_CR29","doi-asserted-by":"publisher","first-page":"1185","DOI":"10.1162\/neco.1994.6.6.1185","volume":"6","author":"T. Jaakkola","year":"1994","unstructured":"Jaakkola, T., Jordan, M.I., Singh, S.P.: On the convergence of stochastic iterative dynamic programming algorithms. Neural Computation\u00a06(6), 1185\u20131201 (1994)","journal-title":"Neural Computation"},{"issue":"3","key":"1_CR30","doi-asserted-by":"publisher","first-page":"338","DOI":"10.1109\/5326.704563","volume":"28","author":"L. Jouffe","year":"1998","unstructured":"Jouffe, L.: Fuzzy inference system learning by reinforcement methods. IEEE Transactions on Systems, Man, and Cybernetics\u2014Part C: Applications and Reviews\u00a028(3), 338\u2013355 (1998)","journal-title":"IEEE Transactions on Systems, Man, and Cybernetics\u2014Part C: Applications and Reviews"},{"key":"1_CR31","unstructured":"Jung, T., Polani, D.: Least squares SVM for least squares TD learning. In: Proceedings of 17th European Conference on Artificial Intelligence (ECAI 2006), Riva del Garda, Italy, pp. 499\u2013503 (2006)"},{"key":"1_CR32","doi-asserted-by":"crossref","unstructured":"Jung, T., Polani, D.: Kernelizing LSPE(\u03bb). In: Proceedings 2007 IEEE Symposium on Approximate Dynamic Programming and Reinforcement Learning (ADPRL 2007), Honolulu, US, pp. 338\u2013345 (2007)","DOI":"10.1109\/ADPRL.2007.368208"},{"key":"1_CR33","doi-asserted-by":"crossref","unstructured":"Jung, T., Uthmann, T.: Experiments in value function approximation with sparse support vector regression. In: Proceedings 15th European Conference on Machine Learning (ECML 2004), Pisa, Italy, pp. 180\u2013191 (2004)","DOI":"10.1007\/978-3-540-30115-8_19"},{"key":"1_CR34","doi-asserted-by":"publisher","first-page":"99","DOI":"10.1016\/S0004-3702(98)00023-X","volume":"101","author":"L.P. Kaelbling","year":"1998","unstructured":"Kaelbling, L.P., Littman, M.L., Cassandra, A.R.: Planning and acting in partially observable stochastic domains. Artificial Intelligence\u00a0101, 99\u2013134 (1998)","journal-title":"Artificial Intelligence"},{"key":"1_CR35","doi-asserted-by":"crossref","first-page":"237","DOI":"10.1613\/jair.301","volume":"4","author":"L.P. Kaelbling","year":"1996","unstructured":"Kaelbling, L.P., Littman, M.L., Moore, A.W.: Reinforcement learning: A survey. Journal of Artificial Intelligence Research\u00a04, 237\u2013285 (1996)","journal-title":"Journal of Artificial Intelligence Research"},{"key":"1_CR36","unstructured":"Konda, V.: Actor\u2013critic algorithms. Ph.D. thesis, Massachusetts Institute of Technology, Cambridge, US (2002)"},{"key":"1_CR37","first-page":"1008","volume-title":"Advances in Neural Information Processing Systems","author":"V.R. Konda","year":"2000","unstructured":"Konda, V.R., Tsitsiklis, J.N.: Actor\u2013critic algorithms. In: Solla, S.A., Leen, T.K., M\u00fcller, K.R. (eds.) Advances in Neural Information Processing Systems, vol.\u00a012, pp. 1008\u20131014. MIT Press, Cambridge (2000)"},{"issue":"4","key":"1_CR38","doi-asserted-by":"publisher","first-page":"1143","DOI":"10.1137\/S0363012901385691","volume":"42","author":"V.R. Konda","year":"2003","unstructured":"Konda, V.R., Tsitsiklis, J.N.: On actor\u2013critic algorithms. SIAM Journal on Control and Optimization\u00a042(4), 1143\u20131166 (2003)","journal-title":"SIAM Journal on Control and Optimization"},{"key":"1_CR39","series-title":"Lecture Notes in Artificial Intelligence","doi-asserted-by":"publisher","first-page":"249","DOI":"10.1007\/3-540-46014-4_23","volume-title":"Methods and Applications of Artificial Intelligence","author":"M. Lagoudakis","year":"2002","unstructured":"Lagoudakis, M., Parr, R., Littman, M.: Least-squares methods in reinforcement learning for control. In: Vlahavas, I.P., Spyropoulos, C.D. (eds.) SETN 2002. LNCS (LNAI), vol.\u00a02308, pp. 249\u2013260. Springer, Heidelberg (2002)"},{"key":"1_CR40","doi-asserted-by":"publisher","first-page":"1107","DOI":"10.1162\/jmlr.2003.4.6.1107","volume":"4","author":"M.G. Lagoudakis","year":"2003","unstructured":"Lagoudakis, M.G., Parr, R.: Least-squares policy iteration. Journal of Machine Learning Research\u00a04, 1107\u20131149 (2003)","journal-title":"Journal of Machine Learning Research"},{"key":"1_CR41","unstructured":"Lagoudakis, M.G., Parr, R.: Reinforcement learning as classification: Leveraging modern classifiers. In: Proceedings 20th International Conference on Machine Learning (ICML 2003), Washington, US, pp. 424\u2013431 (2003)"},{"issue":"4","key":"1_CR42","doi-asserted-by":"publisher","first-page":"1082","DOI":"10.1137\/S1052623496300507","volume":"9","author":"R.M. Lewis","year":"1999","unstructured":"Lewis, R.M., Torczon, V.: Pattern search algorithms for bound constrained minimization. SIAM Journal on Optimization\u00a09(4), 1082\u20131099 (1999)","journal-title":"SIAM Journal on Optimization"},{"issue":"3\/4","key":"1_CR43","doi-asserted-by":"publisher","first-page":"293","DOI":"10.1023\/A:1022628806385","volume":"8","author":"L.J. Lin","year":"1992","unstructured":"Lin, L.J.: Self-improving reactive agents based on reinforcement learning, planning and teaching. Machine Learning\u00a08(3\/4), 293\u2013321 (1992); Special Issue on Reinforcement Learning","journal-title":"Machine Learning"},{"issue":"4","key":"1_CR44","doi-asserted-by":"publisher","first-page":"988","DOI":"10.1109\/TSMCB.2008.922019","volume":"38","author":"D. Liu","year":"2008","unstructured":"Liu, D., Javaherian, H., Kovalenko, O., Huang, T.: Adaptive critic learning techniques for engine torque and air-fuel ratio control. IEEE Transactions on Systems, Man, and Cybernetics\u2014Part B: Cybernetics\u00a038(4), 988\u2013993 (2008)","journal-title":"IEEE Transactions on Systems, Man, and Cybernetics\u2014Part B: Cybernetics"},{"key":"1_CR45","unstructured":"Madani, O.: On policy iteration as a newton s method and polynomial policy iteration algorithms. In: Proceedings 18th National Conference on Artificial Intelligence and 14th Conference on Innovative Applications of Artificial Intelligence AAAI\/IAAI 2002, Edmonton, Canada, pp. 273\u2013278 (2002)"},{"key":"1_CR46","unstructured":"Mahadevan, S.: Samuel meets Amarel: Automating value function approximation using global state space analysis. In: Proceedings 20th National Conference on Artificial Intelligence and the 17th Innovative Applications of Artificial Intelligence Conference (AAAI 2005), Pittsburgh, US, pp. 1000\u20131005 (2005)"},{"key":"1_CR47","first-page":"2169","volume":"8","author":"S. Mahadevan","year":"2007","unstructured":"Mahadevan, S., Maggioni, M.: Proto-value functions: A Laplacian framework for learning representation and control in Markov decision processes. Journal of Machine Learning Research\u00a08, 2169\u20132231 (2007)","journal-title":"Journal of Machine Learning Research"},{"key":"1_CR48","unstructured":"Mannor, S., Rubinstein, R.Y., Gat, Y.: The cross-entropy method for fast policy search. In: Proceedings 20th International Conference on Machine Learning (ICML 2003), Washington, US, pp. 512\u2013519 (2003)"},{"key":"1_CR49","doi-asserted-by":"publisher","first-page":"111","DOI":"10.1023\/A:1022145020786","volume":"13","author":"P. Marbach","year":"2003","unstructured":"Marbach, P., Tsitsiklis, J.N.: Approximate gradient methods in policy-space optimization of Markov reward processes. Discrete Event Dynamic Systems: Theory and Applications\u00a013, 111\u2013148 (2003)","journal-title":"Discrete Event Dynamic Systems: Theory and Applications"},{"key":"1_CR50","doi-asserted-by":"crossref","unstructured":"McCallum, A.: Overcoming incomplete perception with utile distinction memory. In: Proceedings 10th International Conference on Machine Learning (ICML 1993), Amherst, US, pp. 190\u2013196 (1993)","DOI":"10.1016\/B978-1-55860-307-3.50031-9"},{"key":"1_CR51","doi-asserted-by":"publisher","first-page":"215","DOI":"10.1007\/s10479-005-5732-z","volume":"134","author":"I. Menache","year":"2005","unstructured":"Menache, I., Mannor, S., Shimkin, N.: Basis function adaptation in temporal difference reinforcement learning. Annals of Operations Research\u00a0134, 215\u2013238 (2005)","journal-title":"Annals of Operations Research"},{"issue":"2-3","key":"1_CR52","doi-asserted-by":"publisher","first-page":"247","DOI":"10.1023\/A:1017988514716","volume":"49","author":"J.d.R. Mill\u00e1n","year":"2002","unstructured":"Mill\u00e1n, J.d.R., Posenato, D., Dedieu, E.: Continuous-action Q-learning. Machine Learning\u00a049(2-3), 247\u2013265 (2002)","journal-title":"Machine Learning"},{"key":"1_CR53","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"crossref","first-page":"170","DOI":"10.1007\/3-540-62858-4_82","volume-title":"Machine Learning: ECML\u201997","author":"R. Munos","year":"1997","unstructured":"Munos, R.: Finite-element methods with local triangulation refinement for continuous reinforcement learning problems. In: van Someren, M., Widmer, G. (eds.) ECML 1997. LNCS, vol.\u00a01224, pp. 170\u2013182. Springer, Heidelberg (1997)"},{"key":"1_CR54","first-page":"771","volume":"7","author":"R. Munos","year":"2006","unstructured":"Munos, R.: Policy gradient in continuous time. Journal of Machine Learning Research\u00a07, 771\u2013791 (2006)","journal-title":"Journal of Machine Learning Research"},{"issue":"2-3","key":"1_CR55","doi-asserted-by":"publisher","first-page":"291","DOI":"10.1023\/A:1017992615625","volume":"49","author":"R. Munos","year":"2002","unstructured":"Munos, R., Moore, A.: Variable-resolution discretization in optimal control. Machine Learning\u00a049(2-3), 291\u2013323 (2002)","journal-title":"Machine Learning"},{"key":"1_CR56","doi-asserted-by":"publisher","first-page":"723","DOI":"10.1016\/j.neunet.2007.01.002","volume":"20","author":"Y. Nakamura","year":"2007","unstructured":"Nakamura, Y., Moria, T., Satoc, M., Ishiia, S.: Reinforcement learning for a biped robot based on a CPG-actor-critic method. Neural Networks\u00a020, 723\u2013735 (2007)","journal-title":"Neural Networks"},{"key":"1_CR57","doi-asserted-by":"publisher","first-page":"79","DOI":"10.1023\/A:1022192903948","volume":"13","author":"A. Nedi\u0107","year":"2003","unstructured":"Nedi\u0107, A., Bertsekas, D.P.: Least-squares policy evaluation algorithms with linear function approximation. Discrete Event Dynamic Systems\u00a013, 79\u2013110 (2003)","journal-title":"Discrete Event Dynamic Systems"},{"key":"1_CR58","unstructured":"Ng, A.Y., Harada, D., Russell, S.: Policy invariance under reward transformations: Theory and application to reward shaping. In: Proceedings 16th International Conference on Machine Learning (ICML 1999), Bled, Slovenia, pp. 278\u2013287 (1999)"},{"key":"1_CR59","unstructured":"Ng, A.Y., Jordan, M.I.: PEGASUS: A policy search method for large MDPs and POMDPs. In: Proceedings 16th Conference in Uncertainty in Artificial Intelligence (UAI 2000), Palo Alto, US, pp. 406\u2013415 (2000)"},{"issue":"2-3","key":"1_CR60","doi-asserted-by":"publisher","first-page":"161","DOI":"10.1023\/A:1017928328829","volume":"49","author":"D. Ormoneit","year":"2002","unstructured":"Ormoneit, D., Sen, S.: Kernel-based reinforcement learning. Machine Learning\u00a049(2-3), 161\u2013178 (2002)","journal-title":"Machine Learning"},{"key":"1_CR61","series-title":"Lecture Notes in Artificial Intelligence","doi-asserted-by":"publisher","first-page":"522","DOI":"10.1007\/3-540-44597-8_37","volume-title":"Emergent Neural Computational Architectures Based on Neuroscience","author":"A. P\u00e9rez-Uribe","year":"2001","unstructured":"P\u00e9rez-Uribe, A.: Using a time-delay actor\u2013critic neural architecture with dopamine-like reinforcement signal for learning in autonomous robots. In: Wermter, S., Austin, J., Willshaw, D.J. (eds.) Emergent Neural Computational Architectures Based on Neuroscience. LNCS (LNAI), vol.\u00a02036, pp. 522\u2013533. Springer, Heidelberg (2001)"},{"issue":"7-9","key":"1_CR62","doi-asserted-by":"publisher","first-page":"1180","DOI":"10.1016\/j.neucom.2007.11.026","volume":"71","author":"J. Peters","year":"2008","unstructured":"Peters, J., Schaal, S.: Natural actor\u2013critic. Neurocomputing\u00a071(7-9), 1180\u20131190 (2008)","journal-title":"Neurocomputing"},{"key":"1_CR63","first-page":"2329","volume":"7","author":"J.M. Porta","year":"2006","unstructured":"Porta, J.M., Vlassis, N., Spaan, M.T., Poupart, P.: Point-based value iteration for continuous POMDPs. Journal of Machine Learning Research\u00a07, 2329\u20132367 (2006)","journal-title":"Journal of Machine Learning Research"},{"issue":"5","key":"1_CR64","doi-asserted-by":"publisher","first-page":"997","DOI":"10.1109\/72.623201","volume":"8","author":"D. Prokhorov","year":"1997","unstructured":"Prokhorov, D., Wunsch, D.C.: Adaptive critic designs. IEEE Transactions on Neural Networks\u00a08(5), 997\u20131007 (1997)","journal-title":"IEEE Transactions on Neural Networks"},{"key":"1_CR65","series-title":"Lecture Notes in Artificial Intelligence","doi-asserted-by":"crossref","first-page":"347","DOI":"10.1007\/978-3-540-30115-8_33","volume-title":"Machine Learning: ECML 2004","author":"B. Ratitch","year":"2004","unstructured":"Ratitch, B., Precup, D.: Sparse distributed memories for on-line value-based reinforcement learning. In: Boulicaut, J.-F., Esposito, F., Giannotti, F., Pedreschi, D. (eds.) ECML 2004. LNCS (LNAI), vol.\u00a03201, pp. 347\u2013358. Springer, Heidelberg (2004)"},{"key":"1_CR66","unstructured":"Reynolds, S.I.: Adaptive resolution model-free reinforcement learning: Decision boundary partitioning. In: Proceedings 17th International Conference on Machine Learning (ICML 2000), Stanford University, US, pp. 783\u2013790 (2000)"},{"key":"1_CR67","series-title":"Lecture Notes in Artificial Intelligence","doi-asserted-by":"publisher","first-page":"317","DOI":"10.1007\/11564096_32","volume-title":"Machine Learning: ECML 2005","author":"M. Riedmiller","year":"2005","unstructured":"Riedmiller, M.: Neural fitted Q-iteration \u2013 first experiences with a data efficient neural reinforcement learning method. In: Gama, J., Camacho, R., Brazdil, P.B., Jorge, A.M., Torgo, L. (eds.) ECML 2005. LNCS (LNAI), vol.\u00a03720, pp. 317\u2013328. Springer, Heidelberg (2005)"},{"key":"1_CR68","doi-asserted-by":"crossref","unstructured":"Riedmiller, M., Peters, J., Schaal, S.: Evaluation of policy gradient methods and variants on the cart-pole benchmark. In: Proceedings 2007 IEEE Symposium on Approximate Dynamic Programming and Reinforcement Learning (ADPRL 2007), Honolulu, US, pp. 254\u2013261 (2007)","DOI":"10.1109\/ADPRL.2007.368196"},{"key":"1_CR69","unstructured":"Rummery, G.A., Niranjan, M.: On-line Q-learning using connectionist systems. Tech. Rep. CUED\/F-INFENG\/TR166, Engineering Department, Cambridge University, UK (1994)"},{"issue":"2","key":"1_CR70","doi-asserted-by":"publisher","first-page":"409","DOI":"10.2307\/2998564","volume":"66","author":"M.S. Santos","year":"1998","unstructured":"Santos, M.S., Vigo-Aguiar, J.: Analysis of a numerical dynamic programming algorithm applied to economic models. Econometrica\u00a066(2), 409\u2013426 (1998)","journal-title":"Econometrica"},{"key":"1_CR71","unstructured":"Singh, S.P., Jaakkola, T., Jordan, M.I.: Reinforcement learning with soft state aggregation. In: Tesauro, G., Touretzky, D.S., Leen, T.K. (eds.) Advances in Neural Information Processing Systems, vol.\u00a07, pp. 361\u2013368 (1995)"},{"key":"1_CR72","first-page":"9","volume":"3","author":"R.S. Sutton","year":"1988","unstructured":"Sutton, R.S.: Learning to predict by the method of temporal differences. Machine Learning\u00a03, 9\u201344 (1988)","journal-title":"Machine Learning"},{"key":"1_CR73","doi-asserted-by":"crossref","unstructured":"Sutton, R.S.: Integrated architectures for learning, planning, and reacting based on approximating dynamic programming. In: Proceedings 7th International Conference on Machine Learning (ICML 1990), Austin, US, pp. 216\u2013224 (1990)","DOI":"10.1016\/B978-1-55860-141-3.50030-4"},{"key":"1_CR74","volume-title":"Reinforcement Learning: An Introduction","author":"R.S. Sutton","year":"1998","unstructured":"Sutton, R.S., Barto, A.G.: Reinforcement Learning: An Introduction. MIT Press, Cambridge (1998)"},{"issue":"2","key":"1_CR75","doi-asserted-by":"publisher","first-page":"19","DOI":"10.1109\/37.126844","volume":"12","author":"R.S. Sutton","year":"1992","unstructured":"Sutton, R.S., Barto, A.G., Williams, R.J.: Reinforcement learning is adaptive optimal control. IEEE Control Systems Magazine\u00a012(2), 19\u201322 (1992)","journal-title":"IEEE Control Systems Magazine"},{"key":"1_CR76","first-page":"1057","volume-title":"Advances in Neural Information Processing Systems","author":"R.S. Sutton","year":"2000","unstructured":"Sutton, R.S., McAllester, D.A., Singh, S.P., Mansour, Y.: Policy gradient methods for reinforcement learning with function approximation. In: Solla, S.A., Leen, T.K., M\u00fcller, K.R. (eds.) Advances in Neural Information Processing Systems, vol.\u00a012, pp. 1057\u20131063. MIT Press, Cambridge (2000)"},{"key":"1_CR77","doi-asserted-by":"crossref","unstructured":"Szepesv\u00e1ri, C., Smart, W.D.: Interpolation-based Q-learning. In: Proceedings 21st International Conference on Machine Learning (ICML 2004), Bannf, Canada, pp. 791\u2013798 (2004)","DOI":"10.1145\/1015330.1015445"},{"issue":"1","key":"1_CR78","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1137\/S1052623493250780","volume":"7","author":"V. Torczon","year":"1997","unstructured":"Torczon, V.: On the convergence of pattern search algorithms. SIAM Journal on Optimization\u00a07(1), 1\u201325 (1997)","journal-title":"SIAM Journal on Optimization"},{"issue":"3-4","key":"1_CR79","doi-asserted-by":"publisher","first-page":"251","DOI":"10.1016\/S0921-8890(97)00042-0","volume":"22","author":"C.F. Touzet","year":"1997","unstructured":"Touzet, C.F.: Neural reinforcement learning for behaviour synthesis. Robotics and Autonomous Systems\u00a022(3-4), 251\u2013281 (1997)","journal-title":"Robotics and Autonomous Systems"},{"issue":"1-3","key":"1_CR80","doi-asserted-by":"publisher","first-page":"59","DOI":"10.1007\/BF00114724","volume":"22","author":"J.N. Tsitsiklis","year":"1996","unstructured":"Tsitsiklis, J.N., Van Roy, B.: Feature-based methods for large scale dynamic programming. Machine Learning\u00a022(1-3), 59\u201394 (1996)","journal-title":"Machine Learning"},{"issue":"5","key":"1_CR81","doi-asserted-by":"publisher","first-page":"674","DOI":"10.1109\/9.580874","volume":"42","author":"J.N. Tsitsiklis","year":"1997","unstructured":"Tsitsiklis, J.N., Van Roy, B.: An analysis of temporal difference learning with function approximation. IEEE Transactions on Automatic Control\u00a042(5), 674\u2013690 (1997)","journal-title":"IEEE Transactions on Automatic Control"},{"key":"1_CR82","unstructured":"Uther, W.T.B., Veloso, M.M.: Tree based discretization for continuous state space reinforcement learning. In: Proceedings 15th National Conference on Artificial Intelligence and 10th Innovative Applications of Artificial Intelligence Conference (AAAI 1998\/IAAI 1998), Madison, US, pp. 769\u2013774 (1998)"},{"issue":"2","key":"1_CR83","doi-asserted-by":"publisher","first-page":"477","DOI":"10.1016\/j.automatica.2008.08.017","volume":"45","author":"D. Vrabie","year":"2009","unstructured":"Vrabie, D., Pastravanu, O., Abu-Khalaf, M., Lewis, F.: Adaptive optimal control for continuous-time linear systems based on policy iteration. Automatica\u00a045(2), 477\u2013484 (2009)","journal-title":"Automatica"},{"key":"1_CR84","doi-asserted-by":"crossref","unstructured":"Waldock, A., Carse, B.: Fuzzy Q-learning with an adaptive representation. In: Proceedings 2008 IEEE World Congress on Computational Intelligence (WCCI 2008), Hong Kong, pp. 720\u2013725 (2008)","DOI":"10.1109\/FUZZY.2008.4630449"},{"issue":"7-8","key":"1_CR85","doi-asserted-by":"publisher","first-page":"1290","DOI":"10.1166\/jctn.2007.013","volume":"4","author":"X. Wang","year":"2007","unstructured":"Wang, X., Tian, X., Cheng, Y.: Value approximation with least squares support vector machine in reinforcement learning system. Journal of Computational and Theoretical Nanoscience\u00a04(7-8), 1290\u20131294 (2007)","journal-title":"Journal of Computational and Theoretical Nanoscience"},{"key":"1_CR86","unstructured":"Watkins, C.J.C.H.: Learning from delayed rewards. Ph.D. thesis, King\u2019s College, Oxford (1989)"},{"key":"1_CR87","first-page":"279","volume":"8","author":"C.J.C.H. Watkins","year":"1992","unstructured":"Watkins, C.J.C.H., Dayan, P.: Q-learning. Machine Learning\u00a08, 279\u2013292 (1992)","journal-title":"Machine Learning"},{"key":"1_CR88","series-title":"Lecture Notes in Artificial Intelligence","doi-asserted-by":"crossref","first-page":"477","DOI":"10.1007\/978-3-540-30115-8_44","volume-title":"Machine Learning: ECML 2004","author":"M. Wiering","year":"2004","unstructured":"Wiering, M.: Convergence and divergence in standard and averaging reinforcement learning. In: Boulicaut, J.-F., Esposito, F., Giannotti, F., Pedreschi, D. (eds.) ECML 2004. LNCS (LNAI), vol.\u00a03201, pp. 477\u2013488. Springer, Heidelberg (2004)"},{"key":"1_CR89","unstructured":"Williams, R.J., Baird, L.C.: Tight performance bounds on greedy policies based on imperfect value functions. In: Proceedings 8th Yale Workshop on Adaptive and Learning Systems, New Haven, US, pp. 108\u2013113 (1994)"},{"issue":"4","key":"1_CR90","doi-asserted-by":"publisher","first-page":"973","DOI":"10.1109\/TNN.2007.899161","volume":"18","author":"X. Xu","year":"2007","unstructured":"Xu, X., Hu, D., Lu, X.: Kernel-based least-squares policy iteration for reinforcement learning. IEEE Transactions on Neural Networks\u00a018(4), 973\u2013992 (2007)","journal-title":"IEEE Transactions on Neural Networks"},{"key":"1_CR91","unstructured":"Yu, H., Bertsekas, D.P.: Convergence results for some temporal difference methods based on least-squares. Tech. Rep. LIDS 2697, Massachusetts Institute of Technology, Cambridge, US (2006)"}],"container-title":["Studies in Computational Intelligence","Interactive Collaborative Information Systems"],"original-title":[],"link":[{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-642-11688-9_1","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2019,5,27]],"date-time":"2019-05-27T07:27:06Z","timestamp":1558942026000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/978-3-642-11688-9_1"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2010]]},"ISBN":["9783642116872","9783642116889"],"references-count":92,"URL":"https:\/\/doi.org\/10.1007\/978-3-642-11688-9_1","relation":{},"ISSN":["1860-949X","1860-9503"],"issn-type":[{"type":"print","value":"1860-949X"},{"type":"electronic","value":"1860-9503"}],"subject":[],"published":{"date-parts":[[2010]]}}}