{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,19]],"date-time":"2026-07-19T09:48:29Z","timestamp":1784454509395,"version":"3.55.0"},"reference-count":34,"publisher":"Frontiers Media SA","license":[{"start":{"date-parts":[[2026,2,18]],"date-time":"2026-02-18T00:00:00Z","timestamp":1771372800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/"}],"funder":[{"DOI":"10.13039\/100014013","name":"UK Research and Innovation","doi-asserted-by":"publisher","award":["MR\/V025333\/1"],"award-info":[{"award-number":["MR\/V025333\/1"]}],"id":[{"id":"10.13039\/100014013","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["frontiersin.org"],"crossmark-restriction":true},"short-container-title":["Front. Robot. AI"],"abstract":"<jats:p>This study develops a hierarchical learning and optimization framework that can learn and achieve well-coordinated multi-skill locomotion. The learned multi-skill policy can switch between skills automatically and naturally while tracking arbitrarily positioned goals and can recover from failures promptly. The proposed framework is composed of a deep reinforcement learning process and an optimization process. First, the contact pattern is incorporated into the reward terms to learn different types of gaits as separate policies without the need for any other references. Then, a higher-level policy is learned to generate weights for individual policies to compose multi-skill locomotion in a goal-tracking task setting. Skills are automatically and naturally switched according to the distance to the goal. The appropriate distances for skill switching are incorporated into the reward calculation for learning the high-level policy and are updated by an outer optimization loop as learning progresses. We first demonstrate successful multi-skill locomotion in comprehensive tasks on a simulated Unitree A1 quadruped robot. We also deploy the learned policy in the real world, showcasing trotting, bounding, galloping, and their natural transitions as the goal position changes. Moreover, the learned policy can react to unexpected failures at any time, perform prompt recovery, and successfully resume locomotion. Compared to baselines, our proposed approach achieves all the learned agile skills with improved learning performance, enabling smoother and more continuous skill transitions.<\/jats:p>","DOI":"10.3389\/frobt.2026.1697159","type":"journal-article","created":{"date-parts":[[2026,2,18]],"date-time":"2026-02-18T07:42:27Z","timestamp":1771400547000},"update-policy":"https:\/\/doi.org\/10.3389\/crossmark-policy","source":"Crossref","is-referenced-by-count":2,"title":["Discovery of skill-switching criteria for learning agile quadruped locomotion"],"prefix":"10.3389","volume":"13","author":[{"given":"Wanming","family":"Yu","sequence":"first","affiliation":[{"name":"Department of Engineering Science, Oxford Robotics Institute, University of Oxford","place":["Oxford, United Kingdom"]}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Fernando","family":"Acero","sequence":"additional","affiliation":[{"name":"Department of Computer Science, University College London","place":["London, United Kingdom"]}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Vassil","family":"Atanassov","sequence":"additional","affiliation":[{"name":"Department of Engineering Science, Oxford Robotics Institute, University of Oxford","place":["Oxford, United Kingdom"]}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Chuanyu","family":"Yang","sequence":"additional","affiliation":[{"name":"National Elite Institute of Engineering, Chongqing University","place":["Chongqing, China"]}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Ioannis","family":"Havoutis","sequence":"additional","affiliation":[{"name":"Department of Engineering Science, Oxford Robotics Institute, University of Oxford","place":["Oxford, United Kingdom"]}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Dimitrios","family":"Kanoulas","sequence":"additional","affiliation":[{"name":"Department of Computer Science, University College London","place":["London, United Kingdom"]}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zhibin","family":"Li","sequence":"additional","affiliation":[{"name":"Department of Computer Science, University College London","place":["London, United Kingdom"]}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"1965","published-online":{"date-parts":[[2026,2,18]]},"reference":[{"key":"B1","first-page":"15929","article-title":"Allgaits: learning all quadruped gaits and transitions","author":"Bellegarda","year":"2025"},{"key":"B2","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2305.14654","article-title":"Barkour: benchmarking animal-level agility with quadruped robots","author":"Caluwaerts","year":"2023","journal-title":"arXiv preprint arXiv:2305.14654"},{"key":"B3","doi-asserted-by":"crossref","first-page":"41","DOI":"10.1109\/ROBIO49542.2019.8961722","article-title":"Design a fall recovery strategy for a wheel-legged quadruped robot using stability feature space","volume-title":"2019 IEEE international conference on robotics and biomimetics (ROBIO)","author":"Castano","year":"2019"},{"key":"B4","doi-asserted-by":"publisher","first-page":"12826","DOI":"10.1109\/ICRA55743.2025.11127234","article-title":"Commonsense reasoning for legged robot adaptation with vision-language models","author":"Chen","year":"2025"},{"key":"B5","first-page":"11443","article-title":"Extreme parkour with legged robots","author":"Cheng","year":"2024"},{"key":"B6","doi-asserted-by":"publisher","first-page":"1225297","DOI":"10.3389\/frobt.2024.1225297","article-title":"Enabling robustness to failure with modular field robots","volume":"11","author":"Cordie","year":"2024","journal-title":"Front. Robotics AI"},{"key":"B7","article-title":"Minimizing energy consumption leads to the emergence of gaits in legged robots","volume-title":"Conference on robot learning (PMLR)","author":"Fu","year":"2021"},{"key":"B8","first-page":"1861","article-title":"Soft actor-critic: off-policy maximum entropy deep reinforcement learning with a stochastic actor","volume-title":"International conference on machine learning ICML 2018","author":"Haarnoja","year":"2018"},{"key":"B9","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.1604.00772","article-title":"The cma evolution strategy: a tutorial","author":"Hansen","year":"2016","journal-title":"arXiv preprint arXiv:1604.00772"},{"key":"B10","doi-asserted-by":"publisher","first-page":"1473628","DOI":"10.3389\/frobt.2024.1473628","article-title":"Bicycle-inspired simple balance control method for quadruped robots in high-speed running","volume":"11","author":"Hattori","year":"2025","journal-title":"Front. Robotics AI"},{"key":"B11","doi-asserted-by":"crossref","DOI":"10.15607\/RSS.2024.XX.059","article-title":"Agile but safe: learning collision-free high-speed legged locomotion","volume-title":"Robotics: science and systems","author":"He","year":"2024"},{"key":"B12","doi-asserted-by":"publisher","first-page":"239","DOI":"10.1038\/292239a0","article-title":"Gait and the energetics of locomotion in horses","volume":"292","author":"Hoyt","year":"1981","journal-title":"Nature"},{"key":"B13","article-title":"Diffuseloco: real-time legged locomotion control with diffusion from offline datasets","volume-title":"Conference on robot learning","author":"Huang","year":"2024"},{"key":"B14","doi-asserted-by":"publisher","first-page":"6131","DOI":"10.1109\/lra.2023.3300249","article-title":"Bio-inspired gait transitions for quadruped locomotion","volume":"8","author":"Humphreys","year":"2023","journal-title":"IEEE Robotics Automation Lett."},{"key":"B15","doi-asserted-by":"publisher","first-page":"eaau5872","DOI":"10.1126\/scirobotics.aau5872","article-title":"Learning agile and dynamic motor skills for legged robots","volume":"4","author":"Hwangbo","year":"2019","journal-title":"Sci. Robotics"},{"key":"B16","doi-asserted-by":"publisher","first-page":"79","DOI":"10.1162\/neco.1991.3.1.79","article-title":"Adaptive mixtures of local experts","volume":"3","author":"Jacobs","year":"1991","journal-title":"Neural Computation"},{"key":"B17","doi-asserted-by":"publisher","first-page":"4630","DOI":"10.1109\/lra.2022.3151396","article-title":"Concurrent training of a control policy and a state estimator for dynamic and robust legged locomotion","volume":"7","author":"Ji","year":"2022","journal-title":"IEEE Robotics Automation Lett."},{"key":"B18","first-page":"2679","article-title":"Openvla: an open-source vision-language-action model","volume":"270","author":"Kim","year":"2025"},{"key":"B19","doi-asserted-by":"publisher","first-page":"5350","DOI":"10.1109\/ICRA55743.2025.11128812","article-title":"Adaptive energy regularization for autonomous gait transition and energy-efficient quadruped locomotion","author":"Liang","year":"2025"},{"key":"B20","first-page":"22","article-title":"Walk these ways: tuning robot control for generalization with multiplicity of behavior","volume-title":"Conference on robot learning (PMLR)","author":"Margolis","year":"2023"},{"key":"B21","doi-asserted-by":"publisher","first-page":"1671336","DOI":"10.3389\/frobt.2025.1671336","article-title":"Energy consumption analysis and optimization in collaborative robots","volume":"12","author":"Miranda","year":"2025","journal-title":"Front. Robotics AI"},{"key":"B22","article-title":"Gaitor: learning a unified representation across gaits for real-world quadruped locomotion","volume-title":"Conference on robot learning (PMLR)","author":"Mitchell","year":"2024"},{"key":"B23","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1038\/s41598-017-00348-9","article-title":"A quadruped robot exhibiting spontaneous gait transitions from walking to trotting to galloping","volume":"7","author":"Owaki","year":"2017","journal-title":"Sci. Reports"},{"key":"B24","doi-asserted-by":"publisher","first-page":"9974","DOI":"10.1109\/ICRA55743.2025.11128726","article-title":"Offline adaptation of quadruped locomotion using diffusion models","author":"O\u2019Mahoney","year":"2025"},{"key":"B25","article-title":"Mcp: learning composable hierarchical control with multiplicative compositional policies","volume":"32","author":"Peng","year":"2019"},{"key":"B26","doi-asserted-by":"crossref","first-page":"5014","DOI":"10.1109\/ICRA48506.2021.9561444","article-title":"Imitation learning from mpc for quadrupedal multi-gait control","volume-title":"2021 IEEE international conference on robotics and automation (ICRA)","author":"Reske","year":"2021"},{"key":"B27","doi-asserted-by":"publisher","first-page":"3073","DOI":"10.1038\/s41467-024-47443-w","article-title":"Viability leads to the emergence of gait transitions in learning agile quadrupedal locomotion on challenging terrains","volume":"15","author":"Shafiee","year":"2024","journal-title":"Nat. Commun."},{"key":"B28","doi-asserted-by":"publisher","first-page":"1230","DOI":"10.1109\/lra.2021.3136645","article-title":"Learning free gait transition for quadruped robots via phase-guided controller","volume":"7","author":"Shao","year":"2021","journal-title":"IEEE Robotics Automation Lett."},{"key":"B29","first-page":"3556","article-title":"Saytap: language to quadrupedal locomotion","volume":"229","author":"Tang","year":"2023"},{"key":"B30","doi-asserted-by":"publisher","first-page":"eabb2174","DOI":"10.1126\/scirobotics.abb2174","article-title":"Multi-expert learning of adaptive legged locomotion","volume":"5","author":"Yang","year":"2020","journal-title":"Sci. Robotics"},{"key":"B31","first-page":"773","article-title":"Fast and efficient locomotion via learned gait transitions","volume-title":"Conference on robot learning (PMLR)","author":"Yang","year":"2022"},{"key":"B32","doi-asserted-by":"publisher","first-page":"919","DOI":"10.1038\/s42256-023-00701-w","article-title":"Identifying important sensory feedback for learning locomotion skills","volume":"5","author":"Yu","year":"2023","journal-title":"Nat. Mach. Intell."},{"key":"B33","doi-asserted-by":"publisher","first-page":"970890","DOI":"10.3389\/frobt.2022.970890","article-title":"Multi-expert synthesis for versatile locomotion and manipulation skills","volume":"9","author":"Yuan","year":"2022","journal-title":"Front. Robotics AI"},{"key":"B34","first-page":"73","article-title":"Robot parkour learning","volume-title":"Conference on robot learning (PMLR)","author":"Zhuang","year":"2023"}],"container-title":["Frontiers in Robotics and AI"],"original-title":[],"link":[{"URL":"https:\/\/www.frontiersin.org\/articles\/10.3389\/frobt.2026.1697159\/full","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,2,18]],"date-time":"2026-02-18T07:42:30Z","timestamp":1771400550000},"score":1,"resource":{"primary":{"URL":"https:\/\/www.frontiersin.org\/articles\/10.3389\/frobt.2026.1697159\/full"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,2,18]]},"references-count":34,"alternative-id":["10.3389\/frobt.2026.1697159"],"URL":"https:\/\/doi.org\/10.3389\/frobt.2026.1697159","relation":{},"ISSN":["2296-9144"],"issn-type":[{"value":"2296-9144","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026,2,18]]},"article-number":"1697159"}}