{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2024,10,29]],"date-time":"2024-10-29T09:26:51Z","timestamp":1730194011539,"version":"3.28.0"},"reference-count":28,"publisher":"IEEE","content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2011,4]]},"DOI":"10.1109\/adprl.2011.5967368","type":"proceedings-article","created":{"date-parts":[[2011,8,4]],"date-time":"2011-08-04T01:40:00Z","timestamp":1312422000000},"page":"287-294","source":"Crossref","is-referenced-by-count":2,"title":["Fitted policy search"],"prefix":"10.1109","author":[{"given":"Martino","family":"Migliavacca","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Alessio","family":"Pecorino","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Matteo","family":"Pirotta","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Marcello","family":"Restelli","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Andrea","family":"Bonarini","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref10","first-page":"1057","article-title":"Policy gradient methods for reinforcement learning with function approximation","volume":"12","author":"sutton","year":"2000","journal-title":"Advances in NIPS MIT Press"},{"key":"ref11","first-page":"406","article-title":"Pegasus: A policy search method for large mdps and pomdps","author":"ng","year":"2000","journal-title":"Proceedings of UAI"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1016\/j.neunet.2008.02.003"},{"key":"ref13","first-page":"1","article-title":"Reinforcement learning for humanoid robotics","author":"peters","year":"2003","journal-title":"Proc Humanoids"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1109\/ROBOT.2004.1307456"},{"key":"ref15","article-title":"Natural actor-critic","volume":"3720","author":"peters","year":"0","journal-title":"Proceedings of ECML"},{"key":"ref16","article-title":"Approximate solutions to markov decision processes","author":"gordon","year":"1999","journal-title":"PhD Dissertation Carnegie Mellon University"},{"key":"ref17","first-page":"1177","article-title":"Fitted q-iteration by advantage weighted regression","author":"neumann","year":"2009","journal-title":"Advances in NIPS MIT Press"},{"key":"ref18","first-page":"151","article-title":"Batch reinforcement learning for controlling a mobile wheeled pendulum robot","volume":"276","author":"bonarini","year":"0","journal-title":"Artificial Intelligence in Theory and Practice II IFIP 20th World Computer Congress"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/IROS.2006.282564"},{"key":"ref28","article-title":"The cross-entropy method: a unified approach to combinatorial optimization","author":"rubinstein","year":"0","journal-title":"Monte-Carlo Simulation and Machine Learning"},{"key":"ref4","first-page":"1052","article-title":"Stable fitted reinforcement learning","author":"gordon","year":"1996","journal-title":"Advances in NIPS MIT Press"},{"key":"ref27","article-title":"Adaptation in natural and artificial systems","author":"holland","year":"1992","journal-title":"MIT Press Cambridge MA"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/9.580874"},{"key":"ref6","first-page":"815","article-title":"Finite-time bounds for fitted value iteration","volume":"9","author":"munos","year":"2008","journal-title":"Journal of Machine Learning Research"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1023\/A:1017928328829"},{"key":"ref8","first-page":"317","article-title":"Neural fitted q iteration-first experiences with a data efficient neural reinforcement learning method","author":"riedmiller","year":"2005","journal-title":"Proceedings of ECML Springer"},{"key":"ref7","first-page":"503","article-title":"Tree-based batch mode reinforcement learning","volume":"6","author":"ernst","year":"2005","journal-title":"Journal of Machine Learning Research"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1016\/B978-1-55860-377-6.50013-X"},{"key":"ref9","first-page":"1","article-title":"Fitted q-iteration with emacs","author":"timmer","year":"2007","journal-title":"Proc ADPRL"},{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1007\/978-1-4615-3618-5"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-540-87700-4_43"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/ADPRL.2009.4927539"},{"key":"ref21","first-page":"179","article-title":"Simulated annealing algorithms for continuous global optimization","volume":"2","author":"locatelli","year":"0","journal-title":"Handbook of Global Optimization"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-540-87481-2_5"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/ADPRL.2007.368196"},{"key":"ref26","first-page":"654","article-title":"Efficient non-linear control through neuroevolution","volume":"4212","author":"gomez","year":"0","journal-title":"Proceedings of ECML"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1007\/s10994-006-6226-1"}],"event":{"name":"2011 Ieee Symposium On Adaptive Dynamic Programming And Reinforcement Learning","start":{"date-parts":[[2011,4,11]]},"location":"Paris, France","end":{"date-parts":[[2011,4,15]]}},"container-title":["2011 IEEE Symposium on Adaptive Dynamic Programming and Reinforcement Learning (ADPRL)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx5\/5958170\/5967347\/05967368.pdf?arnumber=5967368","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2017,3,21]],"date-time":"2017-03-21T09:43:46Z","timestamp":1490089426000},"score":1,"resource":{"primary":{"URL":"http:\/\/ieeexplore.ieee.org\/document\/5967368\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2011,4]]},"references-count":28,"URL":"https:\/\/doi.org\/10.1109\/adprl.2011.5967368","relation":{},"subject":[],"published":{"date-parts":[[2011,4]]}}}