{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,8,18]],"date-time":"2026-08-18T00:12:02Z","timestamp":1787011922935,"version":"build-2736575974"},"reference-count":63,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","license":[{"start":{"date-parts":[[2025,1,1]],"date-time":"2025-01-01T00:00:00Z","timestamp":1735689600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/legalcode"},{"start":{"date-parts":[[2025,1,1]],"date-time":"2025-01-01T00:00:00Z","timestamp":1735689600000},"content-version":"am","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/legalcode"}],"funder":[{"DOI":"10.13039\/100000001","name":"U.S. National Science Foundation","doi-asserted-by":"publisher","award":["IIS-2348323"],"award-info":[{"award-number":["IIS-2348323"]}],"id":[{"id":"10.13039\/100000001","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Access"],"published-print":{"date-parts":[[2025]]},"DOI":"10.1109\/access.2025.3582523","type":"journal-article","created":{"date-parts":[[2025,6,23]],"date-time":"2025-06-23T13:28:39Z","timestamp":1750685319000},"page":"108732-108742","source":"Crossref","is-referenced-by-count":10,"title":["Benchmarking Model Predictive Control and Reinforcement Learning-Based Control for Legged Robot Locomotion in MuJoCo Simulation"],"prefix":"10.1109","volume":"13","author":[{"ORCID":"https:\/\/orcid.org\/0009-0001-3502-3590","authenticated-orcid":false,"given":"Shivayogi","family":"Akki","sequence":"first","affiliation":[{"name":"Electrical and Computer Engineering Department, Michigan Technological University, Houghton, MI, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-4199-8706","authenticated-orcid":false,"given":"Tan","family":"Chen","sequence":"additional","affiliation":[{"name":"Electrical and Computer Engineering Department, Michigan Technological University, Houghton, MI, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-540-30301-5_17"},{"key":"ref2","article-title":"Legged and flying robots for disaster response","volume-title":"Proc. World Eng. Conf. Conv. (WECC)","author":"Siegwart"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/IROS40897.2019.8967552"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/TSMC.1979.4310180"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2013.6631038"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/IROS.2016.7758092"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1177\/0278364904050917"},{"issue":"4","key":"ref8","doi-asserted-by":"crossref","first-page":"642","DOI":"10.1016\/j.neunet.2008.03.014","article-title":"Central pattern generators for locomotion control in animals and robots: A review","volume":"21","author":"Ijspeert","year":"2008","journal-title":"Neural Netw."},{"key":"ref9","volume-title":"An introduction to model-based predictive control (MPC)","author":"Zak","year":"2017"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1177\/0278364913495721"},{"key":"ref11","first-page":"1","article-title":"Data efficient reinforcement learning for legged robots","volume-title":"Proc. Conf. Robot Learn.","author":"Yang"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/TRO.2022.3172469"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/ACCESS.2021.3118957"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1109\/IROS40897.2019.8968251"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1126\/scirobotics.adg1462"},{"key":"ref16","volume-title":"Go1","year":"2022"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/TNN.1998.712192"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1007\/BF00992698"},{"key":"ref19","article-title":"Playing Atari with deep reinforcement learning","author":"Mnih","year":"2013","journal-title":"arXiv:1312.5602"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1038\/nature14236"},{"key":"ref21","article-title":"Proximal policy optimization algorithms","author":"Schulman","year":"2017","journal-title":"arXiv:1707.06347"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.1812.05905"},{"key":"ref23","volume-title":"Spinning up in deep reinforcement learning","author":"Achiam","year":"2018"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1177\/02783649231224053"},{"key":"ref25","first-page":"144","article-title":"Reinforcement learning for locomotion of a two-linked robot arm","volume-title":"Proc. 6th Eur. Workshop Learn. Robots","author":"Kimura"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2017.7989385"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/LRA.2023.3335777"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1016\/S0098-1354(98)00260-9"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1007\/bfb0109870"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1007\/s00170-021-07682-3"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1016\/S0967-0661(02)00186-7"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/ACC.2001.946095"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1109\/HUMANOIDS.2017.8246930"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1109\/IROS.2018.8594448"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA48506.2021.9561326"},{"key":"ref36","article-title":"Learning-based legged locomotion; state of the art and future perspectives","author":"Ha","year":"2024","journal-title":"arXiv:2406.01152"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1109\/IROS45743.2020.9341021"},{"issue":"1","key":"ref38","doi-asserted-by":"crossref","first-page":"154","DOI":"10.3390\/app13010154","article-title":"Model predictive control of quadruped robot based on reinforcement learning","volume":"13","author":"Zhang","year":"2022","journal-title":"Appl. Sci."},{"key":"ref39","article-title":"Learning agile locomotion and adaptive behaviors via RL-augmented MPC","author":"Chen","year":"2023","journal-title":"arXiv:2310.09442"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1177\/0142331216645176"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA57147.2024.10611209"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1109\/IROS.2012.6386109"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1109\/LRA.2024.3360814"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1017\/S0263574722000625"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA46639.2022.9811684"},{"key":"ref46","volume-title":"Benchmarking Model Predictive Control and Reinforcement Learning Based Control for Legged Robot Locomotion","author":"Akki","year":"2024"},{"key":"ref47","first-page":"1889","article-title":"Trust region policy optimization","volume-title":"Proc. 32nd Int. Conf. Mach. Learn.","author":"Schulman"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.4236\/jilsa.2023.151003"},{"key":"ref49","article-title":"Openai gym","author":"Brockman","year":"2016","journal-title":"arXiv:1606.01540"},{"key":"ref50","volume-title":"Rl Baselines3 Zoo","author":"Raffin","year":"2020"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1145\/3292500.3330701"},{"key":"ref52","article-title":"Predictive sampling: Real-time behaviour synthesis with mujoco","author":"Howell","year":"2022","journal-title":"arXiv:2212.00541"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.1137\/16M1062569"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1007\/s10514-019-09893-w"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1561\/2300000044"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1126\/science.1254486"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.1126\/scirobotics.abc5986"},{"key":"ref58","first-page":"25502","article-title":"Why generalization in RL is difficult: Epistemic POMDPs and implicit partial observability","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Ghosh"},{"key":"ref59","article-title":"Test and evaluation of quadrupedal walking gaits through Sim2Real gap quantification","author":"Akella","year":"2022","journal-title":"arXiv:2201.01323"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1109\/IROS47612.2022.9981072"},{"key":"ref61","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2018.8460528"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA48506.2021.9560769"},{"key":"ref63","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2017.XIII.048"}],"container-title":["IEEE Access"],"original-title":[],"link":[{"URL":"https:\/\/ieeexplore.ieee.org\/ielam\/6287639\/10820123\/11048516-aam.pdf","content-type":"application\/pdf","content-version":"am","intended-application":"syndication"},{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/6287639\/10820123\/11048516.pdf?arnumber=11048516","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,7,1]],"date-time":"2025-07-01T01:26:06Z","timestamp":1751333166000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11048516\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025]]},"references-count":63,"URL":"https:\/\/doi.org\/10.1109\/access.2025.3582523","relation":{},"ISSN":["2169-3536"],"issn-type":[{"value":"2169-3536","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025]]}}}