{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2024,10,22]],"date-time":"2024-10-22T22:12:27Z","timestamp":1729635147042,"version":"3.28.0"},"reference-count":26,"publisher":"IEEE","license":[{"start":{"date-parts":[[2020,10,24]],"date-time":"2020-10-24T00:00:00Z","timestamp":1603497600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2020,10,24]],"date-time":"2020-10-24T00:00:00Z","timestamp":1603497600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2020,10,24]],"date-time":"2020-10-24T00:00:00Z","timestamp":1603497600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2020,10,24]]},"DOI":"10.1109\/iros45743.2020.9341559","type":"proceedings-article","created":{"date-parts":[[2021,2,12]],"date-time":"2021-02-12T21:26:48Z","timestamp":1613165208000},"page":"5438-5444","source":"Crossref","is-referenced-by-count":0,"title":["Proximal Deterministic Policy Gradient"],"prefix":"10.1109","author":[{"given":"Marco","family":"Maggipinto","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Gian Antonio","family":"Susto","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Pratik","family":"Chaudhari","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref10","article-title":"Continuous control with deep reinforcement learning","author":"lillicrap","year":"2015","journal-title":"arXiv preprint arXiv 1509 02971"},{"key":"ref11","article-title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","author":"haarnoja","year":"2018","journal-title":"arXiv preprint arXiv 1801 01000"},{"key":"ref12","article-title":"Adam: A method for stochastic optimization","author":"kingma","year":"2014","journal-title":"arXiv preprint arXiv 1412 6980"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1561\/2400000003"},{"key":"ref14","article-title":"Stochastic proximal iteration: a non-asymptotic improvement upon stochastic gradient descent","author":"ryu","year":"2014","journal-title":"Author website early draft"},{"key":"ref15","article-title":"Playing atari with deep reinforcement learning","author":"mnih","year":"2013","journal-title":"arXiv 1312 5602"},{"key":"ref16","first-page":"1928","article-title":"Asynchronous methods for deep reinforcement learning","author":"mnih","year":"2016","journal-title":"ICML"},{"key":"ref17","article-title":"High-dimensional continuous control using generalized advantage estimation","author":"schulman","year":"2015","journal-title":"arXiv 1506 02438 [cs]"},{"key":"ref18","article-title":"P3o: Policy-on policy-off policy optimization","author":"fakoor","year":"2019","journal-title":"arXiv preprint arXiv 1905 10520"},{"key":"ref19","article-title":"Sbeed: Convergent reinforcement learning with nonlinear function approximation","author":"dai","year":"2017","journal-title":"arXiv preprint arXiv 1712 10285"},{"key":"ref4","article-title":"Proximal policy optimization algorithms","author":"schulman","year":"2017","journal-title":"arXiv preprint arXiv 1707 06347"},{"key":"ref3","first-page":"1889","article-title":"Trust region policy optimization","author":"schulman","year":"2015","journal-title":"International Conference on Machine Learning"},{"article-title":"Deterministic policy gradient algorithms","year":"2014","author":"silver","key":"ref6"},{"key":"ref5","article-title":"Are deep policy gradient algorithms truly policy gradient algorithms?","author":"ilyas","year":"2018","journal-title":"arXiv preprint arXiv 1811 02553"},{"key":"ref8","doi-asserted-by":"crossref","DOI":"10.1609\/aaai.v30i1.10295","article-title":"Deep reinforcement learning with double q-learning","author":"van hasselt","year":"2016","journal-title":"THIRTIETH AAAI Conference on Artificial Intelligence"},{"key":"ref7","article-title":"Issues in using function approximation for reinforcement learning","author":"thrun","year":"1993","journal-title":"Proceedings of the 1993 Connectionist Models Summer School Hillsdale NJ Lawrence Erlbaum"},{"journal-title":"Reinforcement Learning An Introduction","year":"2018","author":"sutton","key":"ref2"},{"key":"ref9","article-title":"Addressing function approximation error in actor-critic methods","author":"fujimoto","year":"2018","journal-title":"arXiv preprint arXiv 1802 09085"},{"key":"ref1","first-page":"1008","article-title":"Actor-critic algorithms","author":"konda","year":"2000","journal-title":"NIPS"},{"key":"ref20","first-page":"15 430","article-title":"A kernel loss for solving the bellman equation","author":"feng","year":"2019","journal-title":"Advances in neural information processing systems"},{"key":"ref22","article-title":"Reinforcement learning and optimal control","volume":"1","author":"bertsekas","year":"2019","journal-title":"Athena Scientific"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1007\/s40687-018-0148-y"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1109\/IROS.2012.6386109"},{"key":"ref23","first-page":"1057","article-title":"Policy gradient methods for reinforcement learning with function approximation","author":"sutton","year":"2000","journal-title":"Advances in neural information processing systems"},{"key":"ref26","first-page":"315","article-title":"Deep sparse rectifier neural networks","author":"glorot","year":"2011","journal-title":"Proceedings of the Fourteenth International Conference on Artificial Intelligence and Statistics"},{"key":"ref25","article-title":"OpenAI Gym","author":"brockman","year":"2016","journal-title":"arXiv 1606 01540 [cs]"}],"event":{"name":"2020 IEEE\/RSJ International Conference on Intelligent Robots and Systems (IROS)","start":{"date-parts":[[2020,10,24]]},"location":"Las Vegas, NV, USA","end":{"date-parts":[[2021,1,24]]}},"container-title":["2020 IEEE\/RSJ International Conference on Intelligent Robots and Systems (IROS)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/9340668\/9340635\/09341559.pdf?arnumber=9341559","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,12,16]],"date-time":"2022-12-16T23:15:51Z","timestamp":1671232551000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/9341559\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2020,10,24]]},"references-count":26,"URL":"https:\/\/doi.org\/10.1109\/iros45743.2020.9341559","relation":{},"subject":[],"published":{"date-parts":[[2020,10,24]]}}}