{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,17]],"date-time":"2026-07-17T14:56:37Z","timestamp":1784300197235,"version":"3.55.0"},"reference-count":210,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"5","license":[{"start":{"date-parts":[[2025,10,1]],"date-time":"2025-10-01T00:00:00Z","timestamp":1759276800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2025,10,1]],"date-time":"2025-10-01T00:00:00Z","timestamp":1759276800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2025,10,1]],"date-time":"2025-10-01T00:00:00Z","timestamp":1759276800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["92370132"],"award-info":[{"award-number":["92370132"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62106172"],"award-info":[{"award-number":["62106172"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"Xiaomi Young Talents Program of Xiaomi Foundation","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"name":"National Project X of China","award":["JCKY2021204B104"],"award-info":[{"award-number":["JCKY2021204B104"]}]},{"name":"Science and Technology on Information Systems Engineering Laboratory","award":["WDZC20235250409"],"award-info":[{"award-number":["WDZC20235250409"]}]},{"name":"Science and Technology on Information Systems Engineering Laboratory","award":["6142101220304"],"award-info":[{"award-number":["6142101220304"]}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Evol. Computat."],"published-print":{"date-parts":[[2025,10]]},"DOI":"10.1109\/tevc.2024.3443913","type":"journal-article","created":{"date-parts":[[2024,8,14]],"date-time":"2024-08-14T13:36:54Z","timestamp":1723642614000},"page":"1707-1728","source":"Crossref","is-referenced-by-count":52,"title":["Bridging Evolutionary Algorithms and Reinforcement Learning: A Comprehensive Survey on Hybrid Algorithms"],"prefix":"10.1109","volume":"29","author":[{"ORCID":"https:\/\/orcid.org\/0009-0009-8546-2346","authenticated-orcid":false,"given":"Pengyi","family":"Li","sequence":"first","affiliation":[{"name":"College of Intelligence and Computing, Tianjin University, Tianjin, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-0422-8235","authenticated-orcid":false,"given":"Jianye","family":"Hao","sequence":"additional","affiliation":[{"name":"College of Intelligence and Computing, Tianjin University, Tianjin, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-7478-7684","authenticated-orcid":false,"given":"Hongyao","family":"Tang","sequence":"additional","affiliation":[{"name":"Montreal Institute of Learning Algorithms, Montreal, QC, Canada"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-4667-3505","authenticated-orcid":false,"given":"Xian","family":"Fu","sequence":"additional","affiliation":[{"name":"College of Intelligence and Computing, Tianjin University, Tianjin, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-5016-6549","authenticated-orcid":false,"given":"Yan","family":"Zheng","sequence":"additional","affiliation":[{"name":"College of Intelligence and Computing, Tianjin University, Tianjin, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-6236-2002","authenticated-orcid":false,"given":"Ke","family":"Tang","sequence":"additional","affiliation":[{"name":"Department of Computer Science and Engineering, Southern University of Science and Technology, Shenzhen, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/TNN.1998.712192"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1126\/science.aaa8415"},{"key":"ref3","volume-title":"Markov Decision Processes: Discrete Stochastic Dynamic Programming","author":"Puterman","year":"1990"},{"key":"ref4","first-page":"1","article-title":"Learning to learn by gradient descent by gradient descent","volume-title":"Proc. NeurIPS","author":"Andrychowicz"},{"key":"ref5","first-page":"1","article-title":"Policy optimization by genetic distillation","volume-title":"Proc. ICLR","author":"Gangwani"},{"key":"ref6","first-page":"1","article-title":"Randomized ensembled double Q-learning: Learning fast without a model","volume-title":"Proc. ICLR","author":"Chen"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1038\/s41586-019-1724-z"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2019.8794127"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1145\/3292500.3330668"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1145\/3447548.3467135"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2023.3236361"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1145\/3569096"},{"key":"ref13","article-title":"Hyperparameters in reinforcement learning and how to tune them","author":"Eimer","year":"2023","journal-title":"arXiv:2306.01324"},{"key":"ref14","first-page":"1","article-title":"The primacy bias in deep reinforcement learning","volume-title":"Proc. ICML","author":"Nikishin"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1162\/evco.1993.1.1.1"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1093\/oso\/9780195099713.001.0001"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/ICGTSPICC.2016.7955308"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1007\/978-981-13-5956-9"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1145\/1388969.1389054"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/CEC.2010.5586349"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/TEVC.2005.846356"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/TEVC.2002.804320"},{"key":"ref23","article-title":"Deep neuroevolution: Genetic algorithms are a competitive alternative for training deep neural networks for reinforcement learning","author":"Such","year":"2017","journal-title":"arXiv: 1712.06567"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1016\/j.knosys.2020.106209"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1109\/JAS.2019.1911540"},{"key":"ref26","volume-title":"Evolutionary Algorithms in Engineering Applications","author":"Dasgupta","year":"2013"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1162\/evco_a_00232"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-16670-0_11"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1007\/s10710-021-09418-4"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1109\/TASE.2023.3244331"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1016\/j.ins.2022.10.134"},{"key":"ref32","first-page":"1","article-title":"ERL-RE2: Efficient evolutionary reinforcement learning with shared state representation and individual policy representation","volume-title":"Proc. ICLR","author":"Hao"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1162\/evco.1995.3.2.149"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1023\/A:1016535925043"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1007\/s12065-015-0129-7"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1162\/EVCO_a_00080"},{"key":"ref37","article-title":"Interpretable-AI policies using evolutionary nonlinear decision trees for discrete action systems","author":"Dhebar","year":"2020","journal-title":"arXiv:2009.09521"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1145\/3520304.3533959"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1109\/SSCI50451.2021.9660048"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1145\/3555776.3577591"},{"key":"ref41","article-title":"Social interpretable reinforcement learning","author":"Custode","year":"2024","journal-title":"arXiv:2401.15480"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1109\/ACCESS.2021.3119000"},{"key":"ref43","first-page":"1","article-title":"Evolution gym: A large-scale benchmark for evolving soft robots","volume-title":"Proc. 35th NeurIPS","author":"Bhatia"},{"key":"ref44","first-page":"1","article-title":"Leveraging hyperbolic embeddings for coarse-to-fine robot design","volume-title":"Proc. CoRR","author":"Dong"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1109\/tevc.2023.3327459"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1038\/s41467-021-25874-z"},{"key":"ref47","article-title":"Task-agnostic morphology evolution","author":"Hejna","year":"2021","journal-title":"arXiv:2102.13100"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1145\/3583131.3590429"},{"key":"ref49","first-page":"6651","article-title":"Evolutionary reinforcement learning for sample-efficient multiagent coordination","volume-title":"Proc. ICML","author":"Majumdar"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1145\/3583131.3590428"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1109\/IJCNN54540.2023.10191313"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-30105-6_23"},{"key":"ref53","first-page":"19490","article-title":"RACE: Improve multi-agent reinforcement learning with representation asymmetry and collaborative evolution","volume-title":"Proc. ICML","author":"Li"},{"key":"ref54","first-page":"1","article-title":"Evolution-guided policy gradient in reinforcement learning","volume-title":"Proc. 32nd NeurIPS","author":"Khadka"},{"key":"ref55","first-page":"1","article-title":"Collaborative evolutionary reinforcement learning","volume-title":"Proc. 36th ICML","author":"Khadka"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v34i04.5728"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.1145\/3449726.3463142"},{"key":"ref58","first-page":"1","article-title":"Cooperative heterogeneous deep reinforcement learning","volume-title":"Proc. NeurIPS","author":"Zheng"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.1145\/3583131.3590512"},{"key":"ref60","first-page":"1237","article-title":"Off-policy evolutionary reinforcement learning with maximum mutations","volume-title":"Proc. 21st AAMAS","author":"Suri"},{"key":"ref61","volume-title":"PGPS: Coupling policy gradient with population-based search","author":"Kim"},{"key":"ref62","first-page":"1","article-title":"Value-evolutionary-based reinforcement learning","volume-title":"Proc. 41st ICML","author":"Li"},{"key":"ref63","first-page":"1","article-title":"EvoRainbow: Combining improvements in evolutionary reinforcement learning for policy search","volume-title":"Proc. ICML","author":"Li"},{"key":"ref64","first-page":"1","article-title":"Model-predictive control via cross-entropy and gradient-based optimization","volume-title":"Proc. L4DC","author":"Bharadhwaj"},{"key":"ref65","first-page":"1","article-title":"Learning off-policy with online planning","volume-title":"Proc. CORL","author":"Sikchi"},{"key":"ref66","first-page":"1","article-title":"Temporal difference learning for model predictive control","volume-title":"Proc. ICML","author":"Hansen"},{"key":"ref67","doi-asserted-by":"publisher","DOI":"10.1023\/A:1011953410319"},{"key":"ref68","doi-asserted-by":"publisher","DOI":"10.1162\/evco.2007.15.3.369"},{"key":"ref69","first-page":"1","article-title":"Discovered policy optimisation","volume-title":"Proc. 36th Conf. Neural Inf. Process. Syst.","author":"Lu"},{"key":"ref70","first-page":"1","article-title":"Discovering temporally-aware reinforcement learning algorithms","volume-title":"Proc. ICLR","author":"Jackson"},{"key":"ref71","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-540-69868-5_10"},{"key":"ref72","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58112-1_48"},{"key":"ref73","first-page":"1","article-title":"Dynamic algorithm configuration: Foundation of a new meta-algorithmic framework","volume-title":"Proc. 24th ECAI","author":"Biedenkapp"},{"key":"ref74","doi-asserted-by":"publisher","DOI":"10.1109\/TETCI.2022.3221483"},{"key":"ref75","doi-asserted-by":"publisher","DOI":"10.1109\/MCI.2022.3222057"},{"key":"ref76","first-page":"1","article-title":"Multi-agent dynamic algorithm configuration","volume-title":"Proc. 36th NeurIPS","author":"Xue"},{"key":"ref77","doi-asserted-by":"publisher","DOI":"10.1016\/j.asoc.2021.107464"},{"key":"ref78","doi-asserted-by":"publisher","DOI":"10.1016\/j.egyr.2021.01.096"},{"key":"ref79","first-page":"692","article-title":"Controlling genetic algorithms with reinforcement learning","volume-title":"Proc. GECCO","author":"Pettinger"},{"key":"ref80","doi-asserted-by":"publisher","DOI":"10.1016\/j.ins.2007.09.026"},{"key":"ref81","doi-asserted-by":"publisher","DOI":"10.1109\/ICMLA.2012.32"},{"key":"ref82","doi-asserted-by":"publisher","DOI":"10.1145\/2598394.2605681"},{"key":"ref83","doi-asserted-by":"publisher","DOI":"10.1016\/j.swevo.2023.101236"},{"key":"ref84","doi-asserted-by":"publisher","DOI":"10.1109\/TEVC.2022.3197298"},{"key":"ref85","doi-asserted-by":"publisher","DOI":"10.1109\/ACCESS.2020.3033593"},{"key":"ref86","doi-asserted-by":"publisher","DOI":"10.3934\/mbe.2023373"},{"key":"ref87","doi-asserted-by":"publisher","DOI":"10.1016\/j.asoc.2021.107678"},{"key":"ref88","doi-asserted-by":"publisher","DOI":"10.1145\/3321707.3321813"},{"key":"ref89","doi-asserted-by":"publisher","DOI":"10.1016\/j.knosys.2021.107731"},{"key":"ref90","doi-asserted-by":"publisher","DOI":"10.1016\/j.swevo.2023.101351"},{"key":"ref91","doi-asserted-by":"publisher","DOI":"10.1016\/j.swevo.2019.06.010"},{"key":"ref92","doi-asserted-by":"publisher","DOI":"10.1016\/j.asoc.2020.106693"},{"key":"ref93","doi-asserted-by":"publisher","DOI":"10.1109\/TETCI.2022.3146882"},{"key":"ref94","first-page":"1","article-title":"CEM-RL: Combining evolutionary and gradient-based methods for policy search","volume-title":"Proc. ICLR","author":"Pourchot"},{"key":"ref95","first-page":"1","article-title":"Guiding evolutionary strategies with off-policy actor-critic","volume-title":"Proc. 20th AAMAS","author":"Tang"},{"key":"ref96","doi-asserted-by":"publisher","DOI":"10.1109\/SSCI50451.2021.9660084"},{"key":"ref97","doi-asserted-by":"publisher","DOI":"10.1109\/ACCESS.2020.3008735"},{"key":"ref98","doi-asserted-by":"publisher","DOI":"10.1155\/2021\/5300189"},{"key":"ref99","article-title":"QD-RL: Efficient mixing of quality and diversity in reinforcement learning","author":"Cideron","year":"2020","journal-title":"arXiv:2006.08505"},{"key":"ref100","doi-asserted-by":"publisher","DOI":"10.1145\/3449639.3459304"},{"key":"ref101","doi-asserted-by":"publisher","DOI":"10.1145\/3583131.3590388"},{"key":"ref102","doi-asserted-by":"publisher","DOI":"10.1145\/3512290.3528705"},{"key":"ref103","first-page":"1","article-title":"Sample-efficient quality-diversity by cooperative coevolution","volume-title":"Proc. ICLR","author":"Xue"},{"key":"ref104","article-title":"Quality-diversity with limited resources","author":"Wang","year":"2024","journal-title":"arXiv:2406.03731"},{"key":"ref105","doi-asserted-by":"publisher","DOI":"10.1109\/ASE.2019.00077"},{"key":"ref106","article-title":"Symbolic regression via neural-guided genetic programming population seeding","author":"Mundhenk","year":"2021","journal-title":"arXiv:2111.00053"},{"key":"ref107","doi-asserted-by":"publisher","DOI":"10.1016\/j.knosys.2021.106836"},{"key":"ref108","first-page":"1","article-title":"DeepACO: Neural-enhanced ant systems for combinatorial optimization","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Ye"},{"key":"ref109","doi-asserted-by":"publisher","DOI":"10.1109\/TAMD.2010.2051436"},{"key":"ref110","first-page":"1","article-title":"Evolving reinforcement learning algorithms","volume-title":"Proc. ICLR","author":"Co-Reyes"},{"key":"ref111","doi-asserted-by":"publisher","DOI":"10.1109\/TEVC.2006.890270"},{"key":"ref112","doi-asserted-by":"publisher","DOI":"10.1109\/IROS51168.2021.9636234"},{"key":"ref113","article-title":"Go-explore: A new approach for hard-exploration problems","author":"Ecoffet","year":"2019","journal-title":"arXiv:1901.10995"},{"key":"ref114","first-page":"1","article-title":"Genetic-gated networks for deep reinforcement learning","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Chang"},{"key":"ref115","doi-asserted-by":"publisher","DOI":"10.1145\/3449726.3459475"},{"key":"ref116","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v37i10.26388"},{"key":"ref117","doi-asserted-by":"publisher","DOI":"10.1007\/s11704-023-2733-5"},{"key":"ref118","first-page":"1","article-title":"Evolutionary population curriculum for scaling multi-agent reinforcement learning","volume-title":"Proc. ICLR","author":"Long"},{"key":"ref119","doi-asserted-by":"publisher","DOI":"10.1109\/IROS45743.2020.9340876"},{"key":"ref120","doi-asserted-by":"publisher","DOI":"10.1145\/3205455.3205486"},{"key":"ref121","article-title":"Population based training of neural networks","author":"Jaderberg","year":"2017","journal-title":"arXiv:1711.09846"},{"key":"ref122","first-page":"1","article-title":"Sample-efficient automated deep reinforcement learning","volume-title":"Proc. ICLR","author":"Franke"},{"key":"ref123","doi-asserted-by":"publisher","DOI":"10.1109\/IRC55401.2022.00022"},{"key":"ref124","article-title":"Towards automatic actor-critic solutions to continuous control","author":"Grigsby","year":"2021","journal-title":"arXiv:2106.08918"},{"key":"ref125","article-title":"Online hyper-parameter tuning in off-policy learning via evolutionary strategies","author":"Tang","year":"2020","journal-title":"arXiv:2006.07554"},{"key":"ref126","first-page":"1","article-title":"Scalable deep reinforcement learning for vision-based robotic manipulation","volume-title":"Proc. 2nd Conf. Robot Learn.","author":"Kalashnikov"},{"key":"ref127","article-title":"Q-learning for continuous actions with cross-entropy guided policies","author":"Simmons-Edler","year":"2019","journal-title":"arXiv:1903.10605"},{"key":"ref128","article-title":"Evolutionary action selection for gradient-based policy learning","author":"Ma","year":"2022","journal-title":"arXiv:2201.04286"},{"key":"ref129","article-title":"Soft actor-critic with cross-entropy policy optimization","author":"Shi","year":"2021","journal-title":"arXiv:2112.11115"},{"key":"ref130","first-page":"1","article-title":"GRAC: Self-guided and self-regularized actor-critic","volume-title":"Proc. Conf. Robot Learn.","author":"Shao"},{"key":"ref131","first-page":"1","article-title":"Plan better amid conservatism: Offline multi-agent reinforcement learning with actor rectification","volume-title":"Proc. ICML","author":"Pan"},{"key":"ref132","article-title":"Deep multi-agent reinforcement learning for decentralized continuous cooperative control","author":"de Witt","year":"2020","journal-title":"arXiv:2003.06709v2"},{"key":"ref133","doi-asserted-by":"publisher","DOI":"10.1162\/isal_a_00338"},{"key":"ref134","first-page":"1","article-title":"Genetic soft updates for policy evolution in deep reinforcement learning","volume-title":"Proc. ICLR","author":"Marchesini"},{"key":"ref135","first-page":"1","article-title":"Improving deep policy gradients with value function search","volume-title":"Proc. ICLR","author":"Marchesini"},{"key":"ref136","doi-asserted-by":"publisher","DOI":"10.1109\/tnnls.2023.3264540"},{"key":"ref137","doi-asserted-by":"publisher","DOI":"10.1016\/j.neucom.2023.126628"},{"key":"ref138","doi-asserted-by":"publisher","DOI":"10.1016\/j.swevo.2018.03.011"},{"key":"ref139","doi-asserted-by":"publisher","DOI":"10.1007\/978-981-99-3814-8_4"},{"key":"ref140","doi-asserted-by":"publisher","DOI":"10.34133\/icomputing.0025"},{"key":"ref141","volume-title":"An Introduction to Genetic Algorithms","author":"Mitchell","year":"1998"},{"key":"ref142","doi-asserted-by":"publisher","DOI":"10.1109\/TEVC.2010.2059031"},{"key":"ref143","article-title":"Evolution strategies as a scalable alternative to reinforcement learning","author":"Salimans","year":"2017","journal-title":"arXiv:1703.03864"},{"key":"ref144","doi-asserted-by":"publisher","DOI":"10.1007\/978-1-4614-1770-5_3"},{"key":"ref145","article-title":"Illuminating search spaces by mapping elites","author":"Mouret","year":"2015","journal-title":"arXiv:1504.04909"},{"key":"ref146","volume-title":"Genetic Programming II","author":"Koza","year":"1994"},{"key":"ref147","doi-asserted-by":"publisher","DOI":"10.1007\/BF00992698"},{"key":"ref148","doi-asserted-by":"publisher","DOI":"10.1007\/BF00992696"},{"key":"ref149","first-page":"1","article-title":"A natural policy gradient","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Kakade"},{"key":"ref150","first-page":"1","article-title":"Actor-critic algorithms","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Konda"},{"key":"ref151","article-title":"Playing Atari with deep reinforcement learning","author":"Mnih","year":"2013","journal-title":"arXiv:1312.5602"},{"key":"ref152","doi-asserted-by":"publisher","DOI":"10.1038\/nature14236"},{"key":"ref153","first-page":"1","article-title":"Continuous control with deep reinforcement learning","volume-title":"Proc. ICLR","author":"Lillicrap"},{"key":"ref154","first-page":"1","article-title":"Addressing function approximation error in actor-critic methods","volume-title":"Proc. 35th Int. Conf. Mach. Learn.","author":"Fujimoto"},{"key":"ref155","first-page":"1","article-title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Haarnoja"},{"key":"ref156","first-page":"1","article-title":"Trust region policy optimization","volume-title":"Proc. ICML","author":"Schulman"},{"key":"ref157","article-title":"Proximal policy optimization algorithms","author":"Schulman","year":"2017","journal-title":"arXiv:1707.06347"},{"key":"ref158","doi-asserted-by":"publisher","DOI":"10.1109\/IROS.2012.6386109"},{"key":"ref159","article-title":"Deepmind control suite","author":"Tassa","year":"2018","journal-title":"arXiv:1801.00690"},{"key":"ref160","first-page":"1","article-title":"QMIX: Monotonic value function factorisation for deep multi-agent reinforcement learning","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Rashid"},{"key":"ref161","first-page":"1","article-title":"FACMAC: Factored multi-agent centralised policy gradients","volume-title":"Proc. 35th Conf. Neural Inf. Process. Syst.","author":"Peng"},{"key":"ref162","first-page":"6382","article-title":"Multi-agent actor-critic for mixed cooperative-competitive environments","volume-title":"Proc. 31st Int. Conf. Neural Inf. Process. Syst.","author":"Lowe"},{"key":"ref163","doi-asserted-by":"publisher","DOI":"10.1016\/j.ins.2015.05.010"},{"key":"ref164","doi-asserted-by":"publisher","DOI":"10.3390\/app11146449"},{"key":"ref165","article-title":"Benchmark functions for the CEC\u20192010 special session and competition on large-scale global optimization","author":"Tang","year":"2007"},{"key":"ref166","first-page":"1","article-title":"Benchmark functions for the CEC 2013 special session and competition on large-scale global optimization","volume-title":"Proc. GENE","author":"Li"},{"key":"ref167","doi-asserted-by":"publisher","DOI":"10.1038\/s42256-022-00579-0"},{"key":"ref168","doi-asserted-by":"publisher","DOI":"10.1287\/opre.4.1.61"},{"key":"ref169","doi-asserted-by":"crossref","DOI":"10.1137\/1.9780898718515","volume-title":"The Vehicle Routing Problem","author":"Toth","year":"2002"},{"key":"ref170","doi-asserted-by":"publisher","DOI":"10.1016\/0377-2217(93)90182-M"},{"key":"ref171","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2023.3236361"},{"key":"ref172","doi-asserted-by":"publisher","DOI":"10.1023\/A:1010091220143"},{"key":"ref173","article-title":"Introduction to the \u2019industrial benchmark\u2019","author":"Hein","year":"2016","journal-title":"arXiv:1610.03793"},{"key":"ref174","doi-asserted-by":"publisher","DOI":"10.1023\/A:1014538503543"},{"key":"ref175","doi-asserted-by":"publisher","DOI":"10.1613\/jair.639"},{"key":"ref176","first-page":"1","article-title":"EvIL: Evolution strategies for generalisable imitation learning","volume-title":"Proc. ICML","author":"Sapora"},{"key":"ref177","first-page":"1","article-title":"Behaviour distillation","volume-title":"Proc. ICLR","author":"Lupu"},{"key":"ref178","first-page":"1","article-title":"Adversarial cheap talk","volume-title":"Proc. ICML","author":"Lu"},{"key":"ref179","first-page":"1","article-title":"Learning neural network policies with guided policy search under unknown dynamics","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Levine"},{"key":"ref180","doi-asserted-by":"publisher","DOI":"10.1371\/journal.pcbi.1004295"},{"key":"ref181","doi-asserted-by":"publisher","DOI":"10.1145\/3577203"},{"key":"ref182","article-title":"Dropout q-functions for doubly efficient reinforcement learning","author":"Hiraoka","year":"2021","journal-title":"arXiv:2110.02034"},{"key":"ref183","doi-asserted-by":"publisher","DOI":"10.1287\/trsc.1030.0057"},{"key":"ref184","first-page":"356","article-title":"The roles of mutation, inbreeding, crossbreeding, and selection in evolution","volume-title":"Proc. 6th Int. Congr. Genet.","author":"Wright"},{"key":"ref185","doi-asserted-by":"crossref","DOI":"10.1007\/978-3-662-04199-4","volume-title":"Evolutionary Algorithms: The Role of Mutation and Recombination","author":"Spears","year":"2000"},{"key":"ref186","article-title":"Real-parameter black-box optimization benchmarking 2009: Noiseless functions definitions","author":"Hansen","year":"2009"},{"key":"ref187","doi-asserted-by":"publisher","DOI":"10.1109\/CEC.2014.6900380"},{"key":"ref188","doi-asserted-by":"publisher","DOI":"10.1109\/CEC.2018.8477908"},{"key":"ref189","first-page":"2085","article-title":"Value-decomposition networks for cooperative multi-agent learning based on team reward","volume-title":"Proc. AAMAS","author":"Sunehag"},{"key":"ref190","doi-asserted-by":"publisher","DOI":"10.1109\/TEVC.2007.892759"},{"key":"ref191","doi-asserted-by":"publisher","DOI":"10.17684\/i7A112en"},{"key":"ref192","doi-asserted-by":"publisher","DOI":"10.1037\/12922-014"},{"issue":"3","key":"ref193","first-page":"1","article-title":"How learning can guide evolution","volume":"1","author":"Hinton","year":"1987","journal-title":"Complex Syst."},{"key":"ref194","doi-asserted-by":"publisher","DOI":"10.1109\/CEC.2001.934337"},{"key":"ref195","doi-asserted-by":"publisher","DOI":"10.1016\/0005-1098(89)90002-2"},{"key":"ref196","first-page":"1","article-title":"Deep reinforcement learning in a handful of trials using probabilistic dynamics models","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Chua"},{"key":"ref197","first-page":"1","article-title":"Learning latent dynamics for planning from pixels","volume-title":"Proc. ICML","author":"Hafner"},{"key":"ref198","first-page":"1","article-title":"Exploring model-based planning with policy networks","volume-title":"Proc. ICLR","author":"Wang"},{"key":"ref199","first-page":"1","article-title":"Curriculum-based co-design of morphology and control of voxel-based soft robots","volume-title":"Proc. ICLR","author":"Wang"},{"key":"ref200","first-page":"478","article-title":"PreCo: Enhancing generalization in co-design of modular soft robots via brain-body pre-training","volume-title":"Proc. CORL","author":"Wang"},{"key":"ref201","doi-asserted-by":"publisher","DOI":"10.1109\/SSCI51031.2022.10022230"},{"key":"ref202","doi-asserted-by":"publisher","DOI":"10.1109\/TEVC.2017.2712906"},{"key":"ref203","doi-asserted-by":"publisher","DOI":"10.1007\/BFb0055930"},{"key":"ref204","doi-asserted-by":"publisher","DOI":"10.1109\/ICEC.1996.542381"},{"key":"ref205","article-title":"Optimization by learning and simulation of Bayesian and Gaussian networks","author":"Larranaga","year":"1999"},{"key":"ref206","doi-asserted-by":"publisher","DOI":"10.1155\/2009\/736398"},{"key":"ref207","doi-asserted-by":"publisher","DOI":"10.1109\/TEVC.2005.850265"},{"key":"ref208","doi-asserted-by":"publisher","DOI":"10.1007\/s12065-007-0003-3"},{"key":"ref209","doi-asserted-by":"publisher","DOI":"10.1016\/j.cor.2021.105400"},{"key":"ref210","volume-title":"Algorithms for Decision Making","author":"Kochenderfer","year":"2022"}],"container-title":["IEEE Transactions on Evolutionary Computation"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/4235\/11199991\/10637292.pdf?arnumber=10637292","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,10,13]],"date-time":"2025-10-13T17:41:07Z","timestamp":1760377267000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/10637292\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,10]]},"references-count":210,"journal-issue":{"issue":"5"},"URL":"https:\/\/doi.org\/10.1109\/tevc.2024.3443913","relation":{},"ISSN":["1089-778X","1089-778X","1941-0026"],"issn-type":[{"value":"1089-778X","type":"print"},{"value":"1089-778X","type":"print"},{"value":"1941-0026","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,10]]}}}