{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,11]],"date-time":"2026-07-11T05:57:00Z","timestamp":1783749420253,"version":"3.55.0"},"reference-count":201,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"2","license":[{"start":{"date-parts":[[2020,4,1]],"date-time":"2020-04-01T00:00:00Z","timestamp":1585699200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/legalcode"}],"funder":[{"DOI":"10.13039\/501100000781","name":"European Research Council","doi-asserted-by":"publisher","award":["637972"],"award-info":[{"award-number":["637972"]}],"id":[{"id":"10.13039\/501100000781","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100000780","name":"European Commission","doi-asserted-by":"publisher","award":["731540"],"award-info":[{"award-number":["731540"]}],"id":[{"id":"10.13039\/501100000780","id-type":"DOI","asserted-by":"publisher"}]},{"name":"MEMMO","award":["780684"],"award-info":[{"award-number":["780684"]}]},{"name":"European Unions Horizon 2020 Research and Innovation Programme","award":["739578"],"award-info":[{"award-number":["739578"]}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Robot."],"published-print":{"date-parts":[[2020,4]]},"DOI":"10.1109\/tro.2019.2958211","type":"journal-article","created":{"date-parts":[[2019,12,27]],"date-time":"2019-12-27T21:04:21Z","timestamp":1577480661000},"page":"328-347","source":"Crossref","is-referenced-by-count":115,"title":["A Survey on Policy Search Algorithms for Learning Robot Controllers in a Handful of Trials"],"prefix":"10.1109","volume":"36","author":[{"ORCID":"https:\/\/orcid.org\/0000-0003-3585-1027","authenticated-orcid":false,"given":"Konstantinos","family":"Chatzilygeroudis","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-1336-5629","authenticated-orcid":false,"given":"Vassilis","family":"Vassiliades","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-9555-9517","authenticated-orcid":false,"given":"Freek","family":"Stulp","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-9036-6799","authenticated-orcid":false,"given":"Sylvain","family":"Calinon","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-2513-027X","authenticated-orcid":false,"given":"Jean-Baptiste","family":"Mouret","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref170","first-page":"1443","article-title":"Learning parameterized skills","author":"da silva","year":"0","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref172","first-page":"3371","article-title":"Active contextual policy search","volume":"15","author":"fabisch","year":"2014","journal-title":"J Mach Learn Res"},{"key":"ref171","doi-asserted-by":"publisher","DOI":"10.1007\/s10514-012-9290-3"},{"key":"ref174","article-title":"Factored contextual policy search with Bayesian optimization","author":"karkus","year":"0","journal-title":"Proc Int Workshop &#x201C;Bayesian Optimization Black-box Optimization and Beyond&#x201D; Neural Inf Process Syst"},{"key":"ref173","first-page":"1312","article-title":"Universal value function approximators","author":"schaul","year":"0","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref176","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2017.7989381"},{"key":"ref175","first-page":"1390","article-title":"Evolutionary optimization for parameterized whole-body dynamic motor skills","author":"ha","year":"0","journal-title":"Proc IEEE Int Conf Robot Autom"},{"key":"ref178","article-title":"Divide-and-conquer reinforcement learning","author":"ghosh","year":"0","journal-title":"Proc Int Conf Learn Representations"},{"key":"ref177","article-title":"Hindsight policy gradients","author":"rauber","year":"2019","journal-title":"Proc Int Conf Learn Represent"},{"key":"ref168","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2018.8460756"},{"key":"ref169","doi-asserted-by":"publisher","DOI":"10.1145\/2001576.2001612"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.2478\/pjbr-2013-0003"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1109\/HUMANOIDS.2017.8246914"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1109\/HUMANOIDS.2015.7363524"},{"key":"ref32","doi-asserted-by":"crossref","first-page":"1521","DOI":"10.1163\/156855307782148550","article-title":"Reinforcement learning for imitating constrained reaching movements","volume":"21","author":"guenter","year":"2007","journal-title":"Adv Robot"},{"key":"ref31","article-title":"Learning ball acquisition on a physical robot","author":"fidelman","year":"0","journal-title":"Proc IEEE Symp Robot Appl"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1145\/2908961.2930952"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1109\/TRO.2010.2065430"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1109\/IROS.2016.7759695"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1109\/TRO.2011.2159412"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1016\/j.neunet.2011.02.004"},{"key":"ref181","first-page":"3925","article-title":"Alternating optimisation and quadrature for robust control","author":"paul","year":"0","journal-title":"Proc Assoc Advance Artif Intell"},{"key":"ref180","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2014.6907421"},{"key":"ref185","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2017.XIII.048"},{"key":"ref184","article-title":"Control adaptation via meta-learning dynamics","author":"harrison","year":"0","journal-title":"Proceedings of the 2nd NeurIPS Workshop on Meta-Learning"},{"key":"ref183","article-title":"Learning to reinforcement learn","author":"wang","year":"2016"},{"key":"ref182","doi-asserted-by":"publisher","DOI":"10.1162\/NECO_a_00514"},{"key":"ref189","author":"jacobson","year":"1970","journal-title":"Differential Dynamic Programming"},{"key":"ref188","doi-asserted-by":"publisher","DOI":"10.1080\/00207176608921369"},{"key":"ref187","doi-asserted-by":"publisher","DOI":"10.1115\/1.3662552"},{"key":"ref186","article-title":"Epopt: Learning robust neural network policies using model ensembles","author":"rajeswaran","year":"2017","journal-title":"Proc Int Conf Learn Represent"},{"key":"ref28","first-page":"1889","article-title":"Trust region policy optimization","author":"schulman","year":"0","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/ADPRL.2009.4927542"},{"key":"ref179","article-title":"Unicorn: Continual learning with a universal, off-policy agent","author":"mankowitz","year":"2018"},{"key":"ref29","article-title":"Continuous control with deep reinforcement learning","author":"lillicrap","year":"0","journal-title":"Proc Int Conf Learn Representations"},{"key":"ref20","article-title":"A tutorial on Bayesian optimization of expensive cost functions, with application to active user modeling and hierarchical reinforcement learning","author":"brochu","year":"2010"},{"key":"ref22","first-page":"1057","article-title":"Policy gradient methods for reinforcement learning with function approximation","author":"sutton","year":"0","journal-title":"Proc Neural Inf Process Syst"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/JPROC.2015.2494218"},{"key":"ref24","first-page":"387","article-title":"Deterministic policy gradient algorithms","author":"silver","year":"0","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/ROBOT.2004.1307456"},{"key":"ref26","article-title":"Expected policy gradients for reinforcement learning","author":"ciosek","year":"2018"},{"key":"ref25","first-page":"457","article-title":"Linear off-policy actor-critic","author":"degris","year":"0","journal-title":"Int Conf Mach Learn"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2014.6907339"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1016\/j.robot.2012.09.012"},{"key":"ref154","doi-asserted-by":"publisher","DOI":"10.1109\/JSEN.2013.2258149"},{"key":"ref153","doi-asserted-by":"publisher","DOI":"10.1163\/156855307781389419"},{"key":"ref156","doi-asserted-by":"publisher","DOI":"10.1016\/S0004-3702(00)00033-3"},{"key":"ref155","doi-asserted-by":"publisher","DOI":"10.1111\/j.1467-8640.1989.tb00324.x"},{"key":"ref150","article-title":"Learning to Adapt in Dynamic, Real-World Environments through Meta-Reinforcement Learning","author":"clavera","year":"0","journal-title":"Proc Int Conf Learn Representations"},{"key":"ref152","doi-asserted-by":"publisher","DOI":"10.1126\/scirobotics.aau5872"},{"key":"ref151","first-page":"642","article-title":"Meta Reinforcement Learning with Latent Variable Gaussian Processes","author":"s\u00e6mundsson","year":"0","journal-title":"Proc Conf Uncertainty Artif Intell"},{"key":"ref146","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2018.8460528"},{"key":"ref147","first-page":"5048","article-title":"Hindsight experience replay","author":"andrychowicz","year":"0","journal-title":"Proc Conf Neural Inf Process Syst"},{"key":"ref148","first-page":"1128","article-title":"Initializing Bayesian hyperparameter optimization via meta-learning","author":"feurer","year":"0","journal-title":"Proc 29th AAAI Conf Artif Intell"},{"key":"ref149","first-page":"1126","article-title":"Model-agnostic meta-learning for fast adaptation of deep networks","author":"finn","year":"0","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.24963\/ijcai.2018\/675"},{"key":"ref58","first-page":"3725","article-title":"Exploration in relational domains for model-based reinforcement learning","author":"lang","year":"2012","journal-title":"J Mach Learn Res"},{"key":"ref57","first-page":"481","article-title":"Rl-tops: An architecture for modularity and re-use in reinforcement learning","author":"ryan","year":"0","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref56","first-page":"1","article-title":"Hierarchical relative entropy policy search","volume":"17","author":"daniel","year":"2016","journal-title":"J Mach Learn Res"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1007\/978-4-431-67869-4_12"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1145\/192161.192167"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.1162\/106365602320169811"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1109\/IROS.2011.6095096"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1162\/NECO_a_00393"},{"key":"ref167","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2018.8460547"},{"key":"ref166","article-title":"Unsupervised state representation learning with robotic priors: A robustness benchmark","author":"lesort","year":"2017"},{"key":"ref165","first-page":"137","article-title":"Habitat utilization and migration in juvenile sea turtles","volume":"1","author":"musick","year":"1997","journal-title":"The Biology of Sea Turtles"},{"key":"ref164","doi-asserted-by":"publisher","DOI":"10.1126\/science.aar6170"},{"key":"ref163","article-title":"Data-efficient learning of feedback policies from image pixels using deep dynamical models","author":"assael","year":"0","journal-title":"Proc Conf Neural Inf Process Syst Deep RL Workshop"},{"key":"ref162","article-title":"World models","author":"ha","year":"2018"},{"key":"ref161","first-page":"2863","article-title":"Action-conditional video prediction using deep networks in Atari games","author":"oh","year":"0","journal-title":"Proc Conf Neural Inf Process Syst"},{"key":"ref160","doi-asserted-by":"publisher","DOI":"10.1016\/j.neunet.2018.07.006"},{"key":"ref4","first-page":"1928","article-title":"Asynchronous methods for deep reinforcement learning","author":"mnih","year":"0","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1038\/nature14236"},{"key":"ref6","article-title":"Emergence of locomotion behaviours in rich environments","author":"heess","year":"2017"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1038\/nature24270"},{"key":"ref8","first-page":"2","article-title":"Micro-data learning: The other end of the spectrum","author":"mouret","year":"2016","journal-title":"ERCIM News"},{"key":"ref159","doi-asserted-by":"publisher","DOI":"10.1007\/s10514-015-9459-7"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1177\/0278364917710318"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1177\/0278364911402527"},{"key":"ref157","doi-asserted-by":"publisher","DOI":"10.1016\/j.neunet.2008.03.014"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2013.218"},{"key":"ref158","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2018.8463209"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1016\/j.artint.2014.11.005"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1109\/HUMANOIDS.2013.7030008"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1007\/s11370-015-0187-9"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.24963\/ijcai.2017\/191"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1109\/IRDS.2002.1041630"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1109\/ROBOT.2002.1014739"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1109\/TRO.2012.2210294"},{"key":"ref43","article-title":"Policy improvement: Between black-box optimization and episodic reinforcement learning","author":"stulp","year":"0","journal-title":"Proc Journ&#x00E9;es Francophones Planification D&#x00E9;cision et Apprentissage pour la conduite de syst&#x00E8;mes"},{"key":"ref73","first-page":"295","article-title":"High dimensional Bayesian optimisation and bandits via additive models","author":"kandasamy","year":"0","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref72","doi-asserted-by":"publisher","DOI":"10.1613\/jair.4806"},{"key":"ref71","author":"bellman","year":"1957","journal-title":"Dynamic Programming"},{"key":"ref70","doi-asserted-by":"publisher","DOI":"10.1089\/soro.2017.0066"},{"key":"ref76","article-title":"Illuminating search spaces by mapping elites","author":"mouret","year":"2015"},{"key":"ref77","doi-asserted-by":"publisher","DOI":"10.1109\/TEVC.2017.2735550"},{"key":"ref74","article-title":"High-dimensional bayesian optimization via additive models with overlapping groups","author":"rolland","year":"2018"},{"key":"ref75","first-page":"41","article-title":"Local Bayesian optimization of motor skills","author":"akrour","year":"0","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref78","doi-asserted-by":"publisher","DOI":"10.3389\/frobt.2016.00040"},{"key":"ref79","article-title":"GP-ILQG: Data-driven robust optimal control for uncertain nonlinear dynamical systems","author":"lee","year":"2017"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1561\/2300000053"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-540-30301-5_60"},{"key":"ref61","doi-asserted-by":"publisher","DOI":"10.1016\/j.robot.2008.10.024"},{"key":"ref63","volume":"1","author":"rasmussen","year":"2006","journal-title":"Gaussian Processes for Machine Learning"},{"key":"ref64","doi-asserted-by":"publisher","DOI":"10.1115\/1.3653121"},{"key":"ref65","first-page":"1809","article-title":"Entropy search for information-efficient global optimization","volume":"13","author":"hennig","year":"2012","journal-title":"J Mach Learn Res"},{"key":"ref66","first-page":"1015","article-title":"Gaussian process optimization in the bandit setting: No regret and experimental design","author":"srinivas","year":"0","journal-title":"Proc 7th Int Conf Machine Learning"},{"key":"ref67","doi-asserted-by":"publisher","DOI":"10.1007\/s10472-015-9463-9"},{"key":"ref68","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2007.III.041"},{"key":"ref69","first-page":"944","article-title":"Automatic gait optimization with Gaussian process regression","author":"lizotte","year":"0","journal-title":"Proc Int Joint Conf Artif Intell"},{"key":"ref197","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2016.7487175"},{"key":"ref198","doi-asserted-by":"publisher","DOI":"10.1177\/0278364911406761"},{"key":"ref199","doi-asserted-by":"publisher","DOI":"10.1109\/TCIAIG.2012.2186810"},{"key":"ref193","doi-asserted-by":"publisher","DOI":"10.1109\/MCS.2006.1636313"},{"key":"ref194","doi-asserted-by":"publisher","DOI":"10.1002\/aic.690451016"},{"key":"ref195","doi-asserted-by":"publisher","DOI":"10.1016\/S0005-1098(99)00194-6"},{"key":"ref196","doi-asserted-by":"publisher","DOI":"10.1016\/j.jprocont.2007.10.014"},{"key":"ref95","doi-asserted-by":"publisher","DOI":"10.1613\/jair.301"},{"key":"ref94","doi-asserted-by":"publisher","DOI":"10.1145\/122344.122377"},{"key":"ref190","doi-asserted-by":"publisher","DOI":"10.1109\/ACC.2005.1469949"},{"key":"ref93","doi-asserted-by":"publisher","DOI":"10.1007\/s10846-017-0468-y"},{"key":"ref191","doi-asserted-by":"publisher","DOI":"10.1109\/IROS.2015.7353843"},{"key":"ref92","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2016.7487170"},{"key":"ref192","doi-asserted-by":"publisher","DOI":"10.1002\/rob.4620090502"},{"key":"ref91","first-page":"937","article-title":"Bayesian optimization with inequality constraints","author":"gardner","year":"0","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref90","article-title":"Safety-aware robot damage recovery using constrained Bayesian optimization and simulated priors","author":"papaspyros","year":"0","journal-title":"Proc Int Workshop &#x201C;Bayesian Optim Black-box Optim Beyond&#x201D; at Neural Inf Process Syst"},{"key":"ref98","first-page":"4065","article-title":"PIPPS: Flexible model-based policy search robust to the curse of chaos","author":"parmas","year":"0","journal-title":"Int Conf Mach Learn"},{"key":"ref99","doi-asserted-by":"publisher","DOI":"10.1109\/IROS.2017.8202137"},{"key":"ref96","doi-asserted-by":"publisher","DOI":"10.1016\/j.neunet.2014.06.006"},{"key":"ref97","first-page":"1071","article-title":"Learning neural network policies with guided policy search under unknown dynamics","author":"levine","year":"0","journal-title":"Proc Neural Inf Process Syst"},{"key":"ref82","first-page":"47","article-title":"Deep kernels for optimizing locomotion controllers","author":"antonova","year":"0","journal-title":"Proc of CoRL"},{"key":"ref81","doi-asserted-by":"publisher","DOI":"10.1109\/HUMANOIDS.2016.7803249"},{"key":"ref84","doi-asserted-by":"publisher","DOI":"10.1162\/106365601750190398"},{"key":"ref83","doi-asserted-by":"crossref","first-page":"543","DOI":"10.2106\/00004623-195335030-00003","article-title":"The major determinants in normal and pathological gait","volume":"35","author":"inman","year":"1953","journal-title":"J Bone Joint Surg Am"},{"key":"ref80","doi-asserted-by":"publisher","DOI":"10.1016\/j.robot.2017.11.010"},{"key":"ref89","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2017.7989186"},{"key":"ref85","first-page":"253","article-title":"Using trajectory data to improve Bayesian optimization for reinforcement learning","volume":"15","author":"wilson","year":"2014","journal-title":"J Mach Learn Res"},{"key":"ref86","doi-asserted-by":"publisher","DOI":"10.1109\/HUMANOIDS.2016.7803348"},{"key":"ref87","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2011.5980202"},{"key":"ref88","article-title":"Optimizing task feasibility using model-free policy search and model-based whole-body control","author":"lober","year":"0","journal-title":"Proc Int Conf Robot Autom"},{"key":"ref200","doi-asserted-by":"publisher","DOI":"10.1109\/TEVC.2017.2722101"},{"key":"ref101","doi-asserted-by":"publisher","DOI":"10.1587\/transinf.E93.D.583"},{"key":"ref100","first-page":"465","article-title":"PILCO: A model-based and data-efficient approach to policy search","author":"deisenroth","year":"0","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref201","doi-asserted-by":"publisher","DOI":"10.1109\/LRA.2017.2657000"},{"key":"ref127","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2015.7139550"},{"key":"ref126","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2014.6907421"},{"key":"ref125","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2014.6907422"},{"key":"ref124","doi-asserted-by":"publisher","DOI":"10.1109\/CEC.2005.1554902"},{"key":"ref129","doi-asserted-by":"publisher","DOI":"10.1109\/IROS.2012.6385977"},{"key":"ref128","doi-asserted-by":"publisher","DOI":"10.1109\/IROS.2017.8206343"},{"key":"ref130","doi-asserted-by":"publisher","DOI":"10.1109\/ROBOT.2007.363075"},{"key":"ref133","doi-asserted-by":"publisher","DOI":"10.1126\/science.1133687"},{"key":"ref134","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-32552-1"},{"key":"ref131","doi-asserted-by":"publisher","DOI":"10.1109\/CDC.1995.478951"},{"key":"ref132","doi-asserted-by":"publisher","DOI":"10.24963\/ijcai.2018\/451"},{"key":"ref136","first-page":"1","article-title":"Guided policy search","author":"levine","year":"0","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref135","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2017.7989383"},{"key":"ref138","doi-asserted-by":"publisher","DOI":"10.1177\/0278364913499192"},{"key":"ref137","doi-asserted-by":"publisher","DOI":"10.1109\/TEVC.2012.2185849"},{"key":"ref139","doi-asserted-by":"publisher","DOI":"10.1142\/9789814374286_0008"},{"key":"ref140","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2017.XIII.034"},{"key":"ref141","first-page":"334","article-title":"Transferring end-to-end visuomotor control from simulation to real world for a multi-stage task","author":"james","year":"0","journal-title":"Proc of CoRL"},{"key":"ref142","first-page":"783","article-title":"Task-embedded control networks for few-shot imitation learning","author":"james","year":"0","journal-title":"Proc of CoRL"},{"key":"ref143","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.01291"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1038\/nature14539"},{"key":"ref144","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2019.8793789"},{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/TNN.1998.712192"},{"key":"ref145","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2018.XIV.010"},{"key":"ref109","article-title":"Learning and policy search in stochastic dynamical systems with Bayesian neural networks","author":"depeweg","year":"0","journal-title":"Proc Int Conf Learn Representations"},{"key":"ref108","doi-asserted-by":"publisher","DOI":"10.1109\/EURCON.2007.4400335"},{"key":"ref107","first-page":"4754","article-title":"Deep reinforcement learning in a handful of trials using probabilistic dynamics models","author":"chua","year":"0","journal-title":"Proc Conf Neural Inf Process Syst"},{"key":"ref106","first-page":"2538","article-title":"Synthesizing neural network controllers with probabilistic model based reinforcement learning","author":"higuera","year":"0","journal-title":"IEEE\/RSJ Int Conf Intell Robots Syst"},{"key":"ref105","article-title":"Improving PILCO with Bayesian neural network dynamics models","author":"gal","year":"0","journal-title":"Data-Efficient Machine Learning workshop"},{"key":"ref104","first-page":"1050","article-title":"Dropout as a Bayesian approximation: Representing model uncertainty in deep learning","author":"gal","year":"0","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref103","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2016.7487156"},{"key":"ref102","first-page":"1","article-title":"End-to-end training of deep visuomotor policies","volume":"17","author":"levine","year":"2016","journal-title":"J Mach Learn Res"},{"key":"ref111","first-page":"227","article-title":"Optimizing long-term predictions for model-based policy search","author":"doerr","year":"0","journal-title":"Proc of CoRL"},{"key":"ref112","first-page":"406","article-title":"PEGASUS: A policy search method for large MDPs and POMDPs","author":"ng","year":"0","journal-title":"Proc Conf Uncertainty Artif Intell"},{"key":"ref110","first-page":"1184","article-title":"Decomposition of uncertainty in bayesian deep learning for efficient and risk-sensitive learning","author":"depeweg","year":"0","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref10","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1561\/2300000021","article-title":"A survey on policy search for robotics","volume":"2","author":"deisenroth","year":"2013","journal-title":"Foundations and Trends in Robotics"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1016\/0005-1098(89)90002-2"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1177\/0278364913495721"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1007\/11552246_35"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1109\/ROBOT.2009.5152577"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1038\/nature14422"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2018.8463197"},{"key":"ref118","doi-asserted-by":"publisher","DOI":"10.1162\/evco.1996.4.2.113"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2018.8461083"},{"key":"ref117","doi-asserted-by":"publisher","DOI":"10.1109\/TEVC.2005.846356"},{"key":"ref18","first-page":"1547","article-title":"Learning attractor landscapes for learning motor primitives","author":"ijspeert","year":"0","journal-title":"Proc Neural Inf Process Syst"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1145\/1143844.1143845"},{"key":"ref119","doi-asserted-by":"publisher","DOI":"10.1109\/4235.661550"},{"key":"ref114","doi-asserted-by":"publisher","DOI":"10.1109\/JPROC.2003.823141"},{"key":"ref113","first-page":"22","article-title":"Optimal filtering","volume":"21","author":"anderson","year":"1979","journal-title":"Englewood Cliffs"},{"key":"ref116","doi-asserted-by":"publisher","DOI":"10.1109\/IROS.2012.6385955"},{"key":"ref115","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2011.VII.008"},{"key":"ref120","doi-asserted-by":"publisher","DOI":"10.1007\/3-540-32494-1_4"},{"key":"ref121","doi-asserted-by":"publisher","DOI":"10.1145\/1553374.1553426"},{"key":"ref122","doi-asserted-by":"publisher","DOI":"10.1109\/TEVC.2008.924423"},{"key":"ref123","doi-asserted-by":"publisher","DOI":"10.1145\/1570256.1570334"}],"container-title":["IEEE Transactions on Robotics"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/8860\/9056603\/08944013.pdf?arnumber=8944013","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2021,12,17]],"date-time":"2021-12-17T20:02:25Z","timestamp":1639771345000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/8944013\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2020,4]]},"references-count":201,"journal-issue":{"issue":"2"},"URL":"https:\/\/doi.org\/10.1109\/tro.2019.2958211","relation":{},"ISSN":["1552-3098","1941-0468"],"issn-type":[{"value":"1552-3098","type":"print"},{"value":"1941-0468","type":"electronic"}],"subject":[],"published":{"date-parts":[[2020,4]]}}}