{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,22]],"date-time":"2026-04-22T17:43:54Z","timestamp":1776879834666,"version":"3.51.2"},"reference-count":73,"publisher":"IEEE","license":[{"start":{"date-parts":[[2023,5,29]],"date-time":"2023-05-29T00:00:00Z","timestamp":1685318400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2023,5,29]],"date-time":"2023-05-29T00:00:00Z","timestamp":1685318400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2023,5,29]]},"DOI":"10.1109\/icra48891.2023.10161498","type":"proceedings-article","created":{"date-parts":[[2023,7,4]],"date-time":"2023-07-04T17:20:56Z","timestamp":1688491256000},"page":"1192-1199","source":"Crossref","is-referenced-by-count":8,"title":["Scalable Task-Driven Robotic Swarm Control via Collision Avoidance and Learning Mean-Field Control"],"prefix":"10.1109","author":[{"given":"Kai","family":"Cui","sequence":"first","affiliation":[{"name":"Technische Universit&#x00E4;t Darmstadt,Department of Electrical Engineering and Information Technology,Darmstadt,Germany,64287"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Mengguang","family":"Li","sequence":"additional","affiliation":[{"name":"Technische Universit&#x00E4;t Darmstadt,Department of Electrical Engineering and Information Technology,Darmstadt,Germany,64287"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Christian","family":"Fabian","sequence":"additional","affiliation":[{"name":"Technische Universit&#x00E4;t Darmstadt,Department of Electrical Engineering and Information Technology,Darmstadt,Germany,64287"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Heinz","family":"Koeppl","sequence":"additional","affiliation":[{"name":"Technische Universit&#x00E4;t Darmstadt,Department of Electrical Engineering and Information Technology,Darmstadt,Germany,64287"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref13","article-title":"Dota 2 with large scale deep reinforcement learning","author":"berner","year":"2019","journal-title":"ArXiv"},{"key":"ref57","first-page":"3053","article-title":"RLlib: Abstractions for distributed reinforcement learning","author":"liang","year":"2018","journal-title":"Proc ICML"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-60990-0_12"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-662-02888-9"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/TITS.2019.2901791"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.1109\/ROBOT.1985.1087247"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1007\/s10462-012-9383-6"},{"key":"ref58","article-title":"Proximal policy optimization algorithms","author":"schulman","year":"2017","journal-title":"ArXiv"},{"key":"ref53","article-title":"Efficient model-based multi-agent mean-field reinforcement learning","author":"pasztor","year":"2021","journal-title":"ArXiv"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1109\/MSP.2017.2743240"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1145\/967900.967919"},{"key":"ref55","volume":"352","author":"parthasarathy","year":"2005","journal-title":"Probability Measures on Metric Spaces"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1177\/0954410019853982"},{"key":"ref54","article-title":"On the near-optimality of local policies in large cooperative multi-agent reinforcement learning","author":"mondal","year":"2022","journal-title":"Trans Mach Learn Res"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1088\/1748-3190\/ab49a4"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-74528-2"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/CDC.2017.8264117"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1007\/978-1-4614-8508-7"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA46639.2022.9812221"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1109\/ACCESS.2021.3050338"},{"key":"ref46","first-page":"1","article-title":"On the approximation of cooperative heterogeneous multi-agent reinforcement learning (MARL) using mean field control (MFC)","volume":"23","author":"mondal","year":"2022","journal-title":"J Mach Learn Res"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1137\/20M1360700"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1177\/027836499801700706"},{"key":"ref47","first-page":"1","article-title":"Deep reinforcement learning for swarm systems","volume":"20","author":"h\u00fcttenrauch","year":"2019","journal-title":"J Mach Learn Res"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.3390\/s22145437"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1109\/GLOBECOM38437.2019.9013181"},{"key":"ref44","article-title":"Model-free mean-field reinforcement learning: mean-field mdp and mean-field q-learning","author":"carmona","year":"2019","journal-title":"ArXiv"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1007\/s11721-017-0142-9"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1109\/ACCESS.2018.2889533"},{"key":"ref8","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1504\/IJBIC.2009.022770","article-title":"Towards group transport by swarms of robots","volume":"1","author":"gross","year":"2009","journal-title":"Int J Bio-Inspired Comput"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1177\/1059712308090537"},{"key":"ref9","first-page":"523","article-title":"Dynamic UAV swarm deployment for non-uniform coverage","author":"albani","year":"2018","journal-title":"Proc AAMAS"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1126\/scirobotics.abe4385"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/TRO.2018.2857475"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.3389\/frobt.2018.00059"},{"key":"ref5","first-page":"31","article-title":"System identification of self-organizing robotic swarms","volume":"7","author":"correll","year":"2006","journal-title":"Distributed Autonomous Robotic Systems"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1109\/TVT.2022.3158896"},{"key":"ref35","article-title":"MF-OMO: An optimization formulation of mean-field games","author":"guo","year":"2022","journal-title":"ArXiv"},{"key":"ref34","first-page":"1028","article-title":"Scaling mean field games by online mirror descent","volume":"21","author":"p\u00e9rolat","year":"2022","journal-title":"Proc AAMAS"},{"key":"ref37","first-page":"1909","article-title":"Approximately solving mean field games via entropy-regularized deep reinforcement learning","author":"cui","year":"2021","journal-title":"Proc AISTATS"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1007\/s13235-022-00450-2"},{"key":"ref31","article-title":"Mean field multi-agent reinforcement learning","author":"yang","year":"2018","journal-title":"ArXiv"},{"key":"ref30","doi-asserted-by":"crossref","first-page":"221","DOI":"10.4310\/CIS.2006.v6.n3.a5","article-title":"Large population stochastic dynamic games: closed-loop mckean-vlasov systems and the nash certainty equivalence principle","volume":"6","author":"huang","year":"2006","journal-title":"Commun Inf Syst"},{"key":"ref33","first-page":"251","article-title":"Reinforcement learning in stationary mean-field games","author":"subramanian","year":"2019","journal-title":"Proc AAMAS"},{"key":"ref32","first-page":"4966","article-title":"Learning mean-field games","author":"guo","year":"2019","journal-title":"Proc NeurIPS"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.3389\/frobt.2020.00036"},{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1007\/s11721-012-0075-2"},{"key":"ref39","article-title":"Learning correlated equilibria in mean-field games","author":"muller","year":"2022","journal-title":"ArXiv"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1287\/moor.2021.1206"},{"key":"ref71","first-page":"1","article-title":"Learning graphon mean field games and approximate Nash equilibria","author":"cui","year":"2022","journal-title":"Proc ICLR"},{"key":"ref70","doi-asserted-by":"publisher","DOI":"10.1109\/CDC40024.2019.9029871"},{"key":"ref73","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v36i9.21173"},{"key":"ref72","doi-asserted-by":"publisher","DOI":"10.1073\/pnas.2122566119"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1162\/106454601317297013"},{"key":"ref68","doi-asserted-by":"publisher","DOI":"10.1109\/MMAR.2017.8046794"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1007\/s11721-019-00166-x"},{"key":"ref67","first-page":"6863","article-title":"Revisiting some common practices in cooperative multi-agent reinforcement learning","author":"fu","year":"2022","journal-title":"Proc ICML"},{"key":"ref26","article-title":"Transporting robotic swarms via mean-field feedback control","author":"zheng","year":"2021","journal-title":"IEEE Trans Autom Control"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1016\/j.ifacol.2017.08.1454"},{"key":"ref69","doi-asserted-by":"publisher","DOI":"10.23919\/FUSION43075.2019.9011242"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/LRA.2018.2792696"},{"key":"ref64","article-title":"Is independent learning all you need in the Starcraft multi-agent challenge?","author":"de witt","year":"2020","journal-title":"ArXiv"},{"key":"ref63","doi-asserted-by":"publisher","DOI":"10.1016\/B978-1-55860-307-3.50049-6"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/TRO.2018.2872285"},{"key":"ref66","article-title":"Benchmarking multi-agent deep reinforcement learning algorithms in cooperative tasks","author":"papoudakis","year":"2021","journal-title":"Proc NeurIPS Datasets and Benchmarks"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.23919\/ACC.2018.8431780"},{"key":"ref65","article-title":"The surprising effectiveness of PPO in cooperative, multi-agent games","author":"yu","year":"2022","journal-title":"Proc NeurIPS Datasets and Benchmarks"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1007\/s11721-008-0015-3"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/TRO.2006.882941"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1007\/s11537-007-0657-8"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-540-71050-9"},{"key":"ref62","first-page":"66","article-title":"Cooperative multi-agent control using deep reinforcement learning","author":"gupta","year":"2017","journal-title":"Proc AAMAS"},{"key":"ref61","first-page":"1889","article-title":"Trust region policy optimization","author":"schulman","year":"2015","journal-title":"Proc ICML"}],"event":{"name":"2023 IEEE International Conference on Robotics and Automation (ICRA)","location":"London, United Kingdom","start":{"date-parts":[[2023,5,29]]},"end":{"date-parts":[[2023,6,2]]}},"container-title":["2023 IEEE International Conference on Robotics and Automation (ICRA)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/10160211\/10160212\/10161498.pdf?arnumber=10161498","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,7,24]],"date-time":"2023-07-24T17:31:23Z","timestamp":1690219883000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/10161498\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023,5,29]]},"references-count":73,"URL":"https:\/\/doi.org\/10.1109\/icra48891.2023.10161498","relation":{},"subject":[],"published":{"date-parts":[[2023,5,29]]}}}