{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,3]],"date-time":"2026-07-03T18:33:15Z","timestamp":1783103595331,"version":"3.54.6"},"reference-count":26,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"3","license":[{"start":{"date-parts":[[2012,6,1]],"date-time":"2012-06-01T00:00:00Z","timestamp":1338508800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Syst., Man, Cybern. B"],"published-print":{"date-parts":[[2012,6]]},"DOI":"10.1109\/tsmcb.2011.2170565","type":"journal-article","created":{"date-parts":[[2011,12,7]],"date-time":"2011-12-07T22:07:13Z","timestamp":1323295633000},"page":"591-602","source":"Crossref","is-referenced-by-count":98,"title":["Efficient Model Learning Methods for Actor\u2013Critic Control"],"prefix":"10.1109","volume":"42","author":[{"given":"I.","family":"Grondman","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"M.","family":"Vaandrager","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"L.","family":"Busoniu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"R.","family":"Babuska","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"E.","family":"Schuitema","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/TSMC.1983.6313077"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1137\/S0363012901385691"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/TFUZZ.2003.814834"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/TSMCB.2005.846001"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1109\/TSMCB.2006.886173"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1016\/j.neucom.2007.11.026"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1109\/TSMCB.2008.926607"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/TSMCB.2008.922018"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1016\/j.automatica.2009.07.008"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1016\/j.automatica.2010.02.018"},{"key":"ref4","first-page":"206","article-title":"CBR for state value function approximation in reinforcement learning","author":"gabel","year":"2005","journal-title":"Proc 6th Int Conf Case-Based Reason"},{"key":"ref3","first-page":"101","article-title":"Model-based reinforcement learning with an approximate, learned model","author":"kuvayev","year":"1996","journal-title":"Proc 9th Yale Workshop on Adaptive and Learning Syst"},{"key":"ref6","doi-asserted-by":"crossref","first-page":"363","DOI":"10.1007\/11552246_35","volume":"21","author":"ng","year":"2006","journal-title":"Experimental Robotics IX"},{"key":"ref5","first-page":"1177","volume":"22","author":"neumann","year":"2009","journal-title":"Advances in neural information processing systems"},{"key":"ref8","first-page":"12","article-title":"Robot learning from demonstration","author":"atkeson","year":"1997","journal-title":"Proc 14th Int Conf Mach Learn"},{"key":"ref7","first-page":"7","article-title":"Representations for learning control policies","author":"forbes","year":"2002","journal-title":"Proc 19th Int Conf Mach Learn Workshop Develop Represent"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1007\/BF00993104"},{"key":"ref9","author":"sutton","year":"1998","journal-title":"Reinforcement Learning An Introduction"},{"key":"ref1","first-page":"211","article-title":"Reinforcement learning architectures","author":"sutton","year":"1992","journal-title":"Proc Int Symp Neural Inf Porcess"},{"key":"ref20","doi-asserted-by":"crossref","first-page":"433","DOI":"10.1109\/TSMCB.2009.2026289","article-title":"Impedance learning for robotic contact tasks using natural actor-critic algorithm","volume":"40","author":"kim","year":"2010","journal-title":"IEEE Trans Syst Man Cybern B Cybern"},{"key":"ref22","first-page":"1","article-title":"epicardial ecg mapping of human ventricular fibrillation","author":"mourad","year":"2006","journal-title":"2006 IET 3rd International Conference On Advances in Medical Signal and Information Processing - MEDSIP 2006 MEDSIP"},{"key":"ref21","doi-asserted-by":"crossref","DOI":"10.1201\/9781439821091","author":"buoniu","year":"2010","journal-title":"Reinforcement Learning and Dynamic Programming Using Function Approximators"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1023\/A:1007626913721"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1023\/A:1006593614256"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1016\/S0167-6911(97)90015-3"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1145\/356789.356797"}],"container-title":["IEEE Transactions on Systems, Man, and Cybernetics, Part B (Cybernetics)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx5\/3477\/6198838\/06096441.pdf?arnumber=6096441","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2021,10,10]],"date-time":"2021-10-10T23:47:20Z","timestamp":1633909640000},"score":1,"resource":{"primary":{"URL":"http:\/\/ieeexplore.ieee.org\/document\/6096441\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2012,6]]},"references-count":26,"journal-issue":{"issue":"3"},"URL":"https:\/\/doi.org\/10.1109\/tsmcb.2011.2170565","relation":{},"ISSN":["1083-4419","1941-0492"],"issn-type":[{"value":"1083-4419","type":"print"},{"value":"1941-0492","type":"electronic"}],"subject":[],"published":{"date-parts":[[2012,6]]}}}