{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,2,21]],"date-time":"2025-02-21T10:07:51Z","timestamp":1740132471040,"version":"3.37.3"},"reference-count":57,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"4","license":[{"start":{"date-parts":[[2021,4,1]],"date-time":"2021-04-01T00:00:00Z","timestamp":1617235200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2021,4,1]],"date-time":"2021-04-01T00:00:00Z","timestamp":1617235200000},"content-version":"am","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2021,4,1]],"date-time":"2021-04-01T00:00:00Z","timestamp":1617235200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2021,4,1]],"date-time":"2021-04-01T00:00:00Z","timestamp":1617235200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"name":"SMART Scholarship"},{"name":"ARL DCIST CRA","award":["W911NF-17-2-0181"],"award-info":[{"award-number":["W911NF-17-2-0181"]}]},{"name":"NSF","award":["DGE-1321851"],"award-info":[{"award-number":["DGE-1321851"]}]},{"name":"Intel DevCloud"},{"name":"Intel Science and Technology Center for Wireless Autonomous Systems"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Automat. Contr."],"published-print":{"date-parts":[[2021,4]]},"DOI":"10.1109\/tac.2020.3029315","type":"journal-article","created":{"date-parts":[[2020,10,7]],"date-time":"2020-10-07T19:22:07Z","timestamp":1602098527000},"page":"1856-1863","source":"Crossref","is-referenced-by-count":8,"title":["Policy Evaluation in Continuous MDPs With Efficient Kernelized Gradient Temporal Difference"],"prefix":"10.1109","volume":"66","author":[{"ORCID":"https:\/\/orcid.org\/0000-0003-2447-2873","authenticated-orcid":false,"given":"Alec","family":"Koppel","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3846-8787","authenticated-orcid":false,"given":"Garrett","family":"Warnell","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-0119-2169","authenticated-orcid":false,"given":"Ethan","family":"Stump","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-6795-420X","authenticated-orcid":false,"given":"Peter","family":"Stone","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-4230-9906","authenticated-orcid":false,"given":"Alejandro","family":"Ribeiro","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"article-title":"On the sample complexity of actor-critic method for reinforcement learning with function approximation","year":"2019","author":"kumar","key":"ref39"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1137\/S0363012901385691"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1007\/s10107-016-1017-3"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2017.7953042"},{"key":"ref31","first-page":"154","article-title":"Bayes meets Bellman: The Gaussian process approach to temporal difference learning","author":"engel","year":"0","journal-title":"Proc 20th Int Conf Mach Learn"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1016\/j.crma.2008.03.014"},{"key":"ref37","first-page":"80","article-title":"Eligibility traces for off-policy policy evaluation","author":"precup","year":"0","journal-title":"Comput Sci Dep Fac Publ Ser"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.23919\/ACC.2018.8430925"},{"key":"ref35","first-page":"2651","article-title":"Universal kernels","volume":"7","author":"micchelli","year":"0","journal-title":"J Mach Learn Res"},{"key":"ref34","first-page":"1714","article-title":"Accelerating stochastic composition optimization","author":"wang","year":"0","journal-title":"Proc Conf Neural Inf Process Syst"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1109\/ACSSC.1993.342465"},{"key":"ref27","first-page":"1458","article-title":"Learning from conditional distributions via dual embeddings","author":"dai","year":"0","journal-title":"Prco Artif Intell and Statist"},{"key":"ref29","first-page":"40","article-title":"Compressed conditional mean embeddings for model-based reinforcement learning","author":"lever","year":"0","journal-title":"Assoc Adv Artif Intell"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1177\/0278364913495721"},{"key":"ref1","volume":"1","author":"sutton","year":"1998","journal-title":"Reinforcement Learning An Introduction"},{"key":"ref20","first-page":"1057","article-title":"Policy gradient methods for reinforcement learning with function approximation","author":"sutton","year":"0","journal-title":"Proc Conf Neural Inf Process Syst"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1016\/0022-247X(71)90184-3"},{"key":"ref21","first-page":"1609","article-title":"A convergent $ o (n)$ temporal-difference algorithm for off-policy learning with linear function approximation","author":"sutton","year":"0","journal-title":"Proc Conf Neural Inf Process Syst"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1145\/1553374.1553504"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1023\/A:1017928328829"},{"key":"ref26","first-page":"1","article-title":"Regularized policy iteration with nonparametric function spaces","volume":"17","author":"farahmand","year":"0","journal-title":"J Mach Learn Res"},{"key":"ref25","first-page":"535","article-title":"Modelling transition dynamics in MDPs with RKHS embeddings","volume":"1","author":"gr\u00fcnew\u00e4lder","year":"0","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1007\/BF00993306"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1137\/S0363012997331639"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.1109\/TSP.2004.830985"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1007\/978-0-387-70914-7"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1109\/ACSSC.2008.5074572"},{"key":"ref54","first-page":"1889","article-title":"Trust region policy optimization","author":"schulman","year":"0","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.1137\/0330046"},{"key":"ref52","article-title":"Incremental constraint projection-proximal methods for nonsmooth convex optimization","author":"wang","year":"0","journal-title":"J Optim"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1145\/1390156.1390240"},{"key":"ref11","first-page":"1204","article-title":"Convergent temporal-difference learning with arbitrary smooth function approximation","author":"bhatnagar","year":"0","journal-title":"Proc Conf Neural Inf Process Syst"},{"article-title":"Global convergence of policy gradient methods to (almost) locally optimal policies","year":"2019","author":"zhang","key":"ref40"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1016\/B978-1-55860-377-6.50013-X"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1145\/1329125.1329242"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1109\/70.163777"},{"key":"ref15","first-page":"278","article-title":"Policy invariance under reward transformations: Theory and application to reward shaping","author":"ng","year":"0","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1137\/1.9781611973433"},{"journal-title":"Stochastic Recurrent Procedures Local Properties","year":"1984","author":"korostelev","key":"ref17"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1080\/17442508308833246"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1007\/BF02745577"},{"journal-title":"Dynamic Programming","year":"1957","author":"bellman","key":"ref4"},{"article-title":"Least squares policy iteration with instrumental variables vs. direct policy search: Comparison against optimal benchmarks using energy storage","year":"2014","author":"scott","key":"ref3"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1007\/BF00115009"},{"key":"ref5","volume":"23","author":"bertsekas","year":"1978","journal-title":"Stochastic Optimal Control The Discrete Time Case"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1007\/s11768-011-0313-y"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1007\/BF00114723"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1214\/aoms\/1177729586"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/9.580874"},{"key":"ref46","first-page":"13","article-title":"A hilbert space embedding for distributions","author":"smola","year":"0","journal-title":"Proc Int Conf Algorithmic Learn Theory"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1109\/TSP.2004.830991"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1023\/A:1013955821559"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.1006\/jcom.2002.0635"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1145\/1553374.1553501"},{"key":"ref41","article-title":"Policy gradient using weak derivatives for reinforcement learning","author":"bhatt","year":"0","journal-title":"Proc 53rd Annu Conf Inform Sci Syst"},{"journal-title":"Measure and Integral an Introduction to Real Analysis","year":"1977","author":"wheeden","key":"ref44"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.15388\/Informatica.2009.250"}],"container-title":["IEEE Transactions on Automatic Control"],"original-title":[],"link":[{"URL":"https:\/\/ieeexplore.ieee.org\/ielam\/9\/9387648\/9216519-aam.pdf","content-type":"application\/pdf","content-version":"am","intended-application":"syndication"},{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/9\/9387648\/09216519.pdf?arnumber=9216519","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,5,10]],"date-time":"2022-05-10T14:53:05Z","timestamp":1652194385000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/9216519\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2021,4]]},"references-count":57,"journal-issue":{"issue":"4"},"URL":"https:\/\/doi.org\/10.1109\/tac.2020.3029315","relation":{},"ISSN":["0018-9286","1558-2523","2334-3303"],"issn-type":[{"type":"print","value":"0018-9286"},{"type":"electronic","value":"1558-2523"},{"type":"electronic","value":"2334-3303"}],"subject":[],"published":{"date-parts":[[2021,4]]}}}