{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2024,10,30]],"date-time":"2024-10-30T02:32:21Z","timestamp":1730255541955,"version":"3.28.0"},"reference-count":51,"publisher":"IEEE","content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2018,5]]},"DOI":"10.1109\/icra.2018.8461083","type":"proceedings-article","created":{"date-parts":[[2018,9,21]],"date-time":"2018-09-21T18:28:03Z","timestamp":1537554483000},"page":"5121-5128","source":"Crossref","is-referenced-by-count":22,"title":["Using Parameterized Black-Box Priors to Scale Up Model-Based Policy Search for Robotics"],"prefix":"10.1109","author":[{"given":"Konstantinos","family":"Chatzilygeroudis","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jean-Baptiste","family":"Mouret","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref39","article-title":"20 Years of Reality Gap: a few Thoughts about Simulators in Evolutionary Robotics","author":"mouret","year":"2017","journal-title":"Workshop&#x201D; Simulation in Evolutionary Robotics&#x201D; GECCO"},{"key":"ref38","article-title":"Model-based reinforcement learning with parametrized physical models and optimism-driven exploration","author":"xie","year":"2016","journal-title":"Proc of ICRA"},{"key":"ref33","article-title":"Gaussian processes and reinforcement learning for identification and control of an autonomous blimp","author":"ko","year":"2007","journal-title":"Proc of ICRA"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/JPROC.2015.2494218"},{"key":"ref31","article-title":"Using centroidal voronoi tessellations to scale up the multi-dimensional archive of phenotypic elites algorithm","author":"vassiliades","year":"2017","journal-title":"IEEE Trans on Evolutionary Computation"},{"key":"ref30","article-title":"Illuminating search spaces by mapping elites","author":"mouret","year":"2015","journal-title":"arxiv 1504 04909"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1109\/TMECH.2007.897273"},{"key":"ref36","first-page":"362","article-title":"Exciting trajectories for the identification of base inertial parameters of robots","volume":"11","author":"gautier","year":"1992","journal-title":"IJRR"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-32552-1_6"},{"key":"ref34","article-title":"A generalized iterative LQG method for locally-optimal feedback control of constrained nonlinear stochastic systems","author":"todorov","year":"2005","journal-title":"Proc of ACC"},{"key":"ref28","first-page":"947","article-title":"Funnel libraries for real-time robust feedback motion planning","volume":"36","author":"majumdar","year":"2017","journal-title":"IJRR"},{"key":"ref27","article-title":"Behavioral repertoire learning in robotics","author":"cully","year":"2013","journal-title":"GECCO"},{"key":"ref29","article-title":"Sample efficient optimization for learning controllers for bipedal locomotion","author":"antonova","year":"2016","journal-title":"Proc of Humanoids"},{"key":"ref2","doi-asserted-by":"crossref","first-page":"436","DOI":"10.1038\/nature14539","article-title":"Deep learning","volume":"521","author":"lecun","year":"2015","journal-title":"Nature"},{"key":"ref1","article-title":"No falls, no resets: Reliable humanoid behavior in the DARPA robotics challenge","author":"atkeson","year":"2015","journal-title":"Proc of Humanoids"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1007\/s10994-010-5223-6"},{"key":"ref22","first-page":"949","article-title":"Natural evolution strategies","volume":"15","author":"wierstra","year":"2014","journal-title":"JMLR"},{"key":"ref21","first-page":"3137","article-title":"A generalized path integral control approach to reinforcement learning","volume":"11","author":"theodorou","year":"2010","journal-title":"JMLR"},{"journal-title":"Reinforcement Learning An Introduction","year":"1998","author":"sutton","key":"ref24"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1162\/106365601750190398"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.2478\/pjbr-2013-0003"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1109\/MRA.2010.936952"},{"key":"ref50","article-title":"DART: Dynamic Animation and Robotics Toolkit","volume":"3","author":"lee","year":"2018","journal-title":"Open Source Software"},{"journal-title":"Fault-Diagnosis Systems An Introduction from Fault Detection to Fault Tolerance","year":"2006","author":"isermann","key":"ref51"},{"key":"ref10","article-title":"Efficient reinforcement learning for robots using informative simulated priors","author":"cutler","year":"2015","journal-title":"Proc of ICRA"},{"key":"ref11","article-title":"GP-ILQG: Data-driven Robust Optimal Control for Uncertain Nonlinear Dynamical Systems","author":"lee","year":"2017","journal-title":"arXiv preprint arXiv 1705 05344"},{"key":"ref40","article-title":"Reset-free Trial-and-Error Learning for Robot Damage Recovery","author":"chatzilygeroudis","year":"2016","journal-title":"arXiv 1610 04213"},{"key":"ref12","article-title":"Data-Efficient Control Policy Search using Residual Dynamics Learning","author":"saveriano","year":"2017","journal-title":"Proc of IROS"},{"key":"ref13","article-title":"Policy search for learning robot control using sparse data","author":"bischoff","year":"2014","journal-title":"Proc of ICRA"},{"key":"ref14","doi-asserted-by":"crossref","first-page":"503","DOI":"10.1038\/nature14422","article-title":"Robots that can adapt like animals","volume":"521","author":"cully","year":"2015","journal-title":"Nature"},{"key":"ref15","article-title":"Virtual vs. Real: Trading Off Simulations and Physical Experiments in Reinforcement Learning with Bayesian Optimization","author":"marco","year":"2017","journal-title":"Proc of ICRA"},{"key":"ref16","article-title":"Using model knowledge for learning inverse dynamics","author":"nguyen-tuong","year":"2010","journal-title":"Proc of ICRA"},{"key":"ref17","article-title":"Incremental semiparametric inverse dynamics learning","author":"camoriano","year":"2016","journal-title":"Proc of ICRA"},{"key":"ref18","article-title":"Continuous control with deep reinforcement learning","author":"lillicrap","year":"2015","journal-title":"arXiv preprint arXiv 1509 02971"},{"key":"ref19","article-title":"Trust region policy optimization","author":"schulman","year":"2015","journal-title":"Proc of ICML"},{"key":"ref4","doi-asserted-by":"crossref","first-page":"529","DOI":"10.1038\/nature14236","article-title":"Human-level control through deep reinforcement learning","volume":"518","author":"mnih","year":"2015","journal-title":"Nature"},{"key":"ref3","article-title":"Imagenet: A large-scale hierarchical image database","author":"deng","year":"2009","journal-title":"CVPR"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1007\/s10846-017-0468-y"},{"key":"ref5","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1561\/2300000021","article-title":"A survey on policy search for robotics","volume":"2","author":"deisenroth","year":"2013","journal-title":"Foundations and Trends in Robotics"},{"key":"ref8","article-title":"Black-Box Data-efficient Policy Search for Robotics","author":"chatzilygeroudis","year":"2017","journal-title":"Proc of IROS"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2013.218"},{"key":"ref49","article-title":"The pendubot: A mechatronic system for control research and education","author":"spong","year":"1995","journal-title":"Proc Conf Decision Control"},{"key":"ref9","first-page":"257","article-title":"Curse of dimensionality","author":"keogh","year":"2011","journal-title":"Encyclopedia of Machine Learning"},{"journal-title":"Functional stability analysis of numerical algorithms","year":"1990","author":"rowan","key":"ref46"},{"key":"ref45","article-title":"Limbo: A fast and flexible library for Bayesian optimization","author":"cully","year":"2016","journal-title":"arxiv 1611 07343"},{"key":"ref48","article-title":"Model-based contextual policy search for data-efficient generalization of robot skills","author":"kupcsik","year":"2014","journal-title":"Artificial Intelligence"},{"journal-title":"The NLopt Nonlinear-optimization Package","year":"0","author":"johnson steven","key":"ref47"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1007\/s10339-011-0404-1"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1145\/1102351.1102377"},{"key":"ref44","article-title":"Optimization of Gaussian process hyperparameters using Rprop","author":"blum","year":"2013","journal-title":"Proc of ESANN"},{"journal-title":"Gaussian Processes for Machine Learning","year":"2006","author":"rasmussen","key":"ref43"}],"event":{"name":"2018 IEEE International Conference on Robotics and Automation (ICRA)","start":{"date-parts":[[2018,5,21]]},"location":"Brisbane, QLD","end":{"date-parts":[[2018,5,25]]}},"container-title":["2018 IEEE International Conference on Robotics and Automation (ICRA)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/8449910\/8460178\/08461083.pdf?arnumber=8461083","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2020,8,23]],"date-time":"2020-08-23T21:42:30Z","timestamp":1598218950000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/8461083\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2018,5]]},"references-count":51,"URL":"https:\/\/doi.org\/10.1109\/icra.2018.8461083","relation":{},"subject":[],"published":{"date-parts":[[2018,5]]}}}