{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2024,12,24]],"date-time":"2024-12-24T07:40:24Z","timestamp":1735026024068,"version":"3.32.0"},"reference-count":24,"publisher":"IEEE","license":[{"start":{"date-parts":[[2024,11,6]],"date-time":"2024-11-06T00:00:00Z","timestamp":1730851200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2024,11,6]],"date-time":"2024-11-06T00:00:00Z","timestamp":1730851200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2024,11,6]]},"DOI":"10.1109\/robot61475.2024.10796930","type":"proceedings-article","created":{"date-parts":[[2024,12,23]],"date-time":"2024-12-23T19:10:37Z","timestamp":1734981037000},"page":"1-6","source":"Crossref","is-referenced-by-count":0,"title":["Model-Based Policy Optimization for Legged Locomotion"],"prefix":"10.1109","author":[{"given":"Javier","family":"Garcia-Barcos","sequence":"first","affiliation":[{"name":"I3A, Universidad de Zaragoza,Zaragoza,Spain"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Ruben","family":"Martinez-Cantin","sequence":"additional","affiliation":[{"name":"I3A, Universidad de Zaragoza,Zaragoza,Spain"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Luis","family":"Montesano","sequence":"additional","affiliation":[{"name":"I3A, Universidad de Zaragoza,Zaragoza,Spain"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/FPM.2015.7337218"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1007\/s10472-015-9463-9"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1038\/nature14422"},{"key":"ref4","article-title":"Reinforcement learning for humanoid robots-policy gradients and beyond","volume-title":"3rd IEEE International Conference on Humanoid Robotics, 2003","author":"Peters","year":"2003"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.15607\/rss.2019.xv.011"},{"journal-title":"Emergence of locomotion behaviours in rich environments","year":"2017","author":"Heess","key":"ref6"},{"key":"ref7","article-title":"Reinforcement learning: An introduction","author":"Sutton","year":"2018","journal-title":"MIT Press"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1561\/2300000021"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1163\/1574-9347_bnp_e500660"},{"key":"ref10","article-title":"PILCO: A model-based and data-efficient approach to policy search","author":"Deisenroth","year":"2011","journal-title":"ICML"},{"key":"ref11","article-title":"Rowan McAllister, and Sergey Levine. Deep reinforcement learning in a handful of trials using probabilistic dynamics models","volume":"31","author":"Chua","year":"2018","journal-title":"NeurIPS"},{"key":"ref12","article-title":"When to trust your model: Model-based policy optimization","volume":"32","author":"Janner","year":"2019","journal-title":"NeurIPS"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.5244\/c.31.57"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1162\/neco.1992.4.3.415"},{"key":"ref15","first-page":"5779","article-title":"Model-based active exploration","volume-title":"ICML","author":"Shyam","year":"2019"},{"journal-title":"Active exploration in bayesian model-based reinforcement learning for robot manipulation","year":"2024","author":"Plou","key":"ref16"},{"issue":"518","key":"ref17","doi-asserted-by":"crossref","first-page":"859","DOI":"10.1080\/01621459.2017.1285773","article-title":"Variational inference: A review for statisticians","volume":"112","author":"David","year":"2017","journal-title":"Journal of the American statistical Association"},{"key":"ref18","first-page":"1050","article-title":"Dropout as a Bayesian approximation: Representing model uncertainty in deep learning","volume-title":"ICML","author":"Gal","year":"2016"},{"key":"ref19","article-title":"Simple and scalable predictive uncertainty estimation using deep ensembles","volume":"30","author":"Lakshminarayanan","year":"2017","journal-title":"NeurIPS"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/LRA.2022.3142915"},{"key":"ref21","article-title":"Mbrl-lib: A modular library for model-based reinforcement learning","author":"Pineda","year":"2021","journal-title":"Arxiv"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/IROS.2012.6386109"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.15607\/rss.2011.vii.010"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-04921-7_39"}],"event":{"name":"2024 7th Iberian Robotics Conference (ROBOT)","start":{"date-parts":[[2024,11,6]]},"location":"Madrid, Spain","end":{"date-parts":[[2024,11,8]]}},"container-title":["2024 7th Iberian Robotics Conference (ROBOT)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/10795802\/10796856\/10796930.pdf?arnumber=10796930","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,12,24]],"date-time":"2024-12-24T06:38:19Z","timestamp":1735022299000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/10796930\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,11,6]]},"references-count":24,"URL":"https:\/\/doi.org\/10.1109\/robot61475.2024.10796930","relation":{},"subject":[],"published":{"date-parts":[[2024,11,6]]}}}