{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,9]],"date-time":"2026-05-09T11:27:59Z","timestamp":1778326079537,"version":"3.51.4"},"reference-count":50,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"10","license":[{"start":{"date-parts":[[2023,10,1]],"date-time":"2023-10-01T00:00:00Z","timestamp":1696118400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2023,10,1]],"date-time":"2023-10-01T00:00:00Z","timestamp":1696118400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2023,10,1]],"date-time":"2023-10-01T00:00:00Z","timestamp":1696118400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/501100012166","name":"National Key Research and Development Program of China","doi-asserted-by":"publisher","award":["2018AAA0101005"],"award-info":[{"award-number":["2018AAA0101005"]}],"id":[{"id":"10.13039\/501100012166","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62136008"],"award-info":[{"award-number":["62136008"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100002367","name":"Strategic Priority Research Program of Chinese Academy of Sciences","doi-asserted-by":"publisher","award":["XDA27030400"],"award-info":[{"award-number":["XDA27030400"]}],"id":[{"id":"10.13039\/501100002367","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100002367","name":"Youth Innovation Promotion Association CAS","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100002367","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Cybern."],"published-print":{"date-parts":[[2023,10]]},"DOI":"10.1109\/tcyb.2022.3179775","type":"journal-article","created":{"date-parts":[[2022,6,24]],"date-time":"2022-06-24T19:37:11Z","timestamp":1656099431000},"page":"6443-6455","source":"Crossref","is-referenced-by-count":22,"title":["Empirical Policy Optimization for <i>n<\/i>-Player Markov Games"],"prefix":"10.1109","volume":"53","author":[{"ORCID":"https:\/\/orcid.org\/0000-0001-5384-423X","authenticated-orcid":false,"given":"Yuanheng","family":"Zhu","sequence":"first","affiliation":[{"name":"State Key Laboratory of Management and Control for Complex Systems, Institute of Automation, Chinese Academy of Sciences, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Weifan","family":"Li","sequence":"additional","affiliation":[{"name":"State Key Laboratory of Management and Control for Complex Systems, Institute of Automation, Chinese Academy of Sciences, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Mengchen","family":"Zhao","sequence":"additional","affiliation":[{"name":"Noah&#x2019;s Ark Laboratory, Huawei, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jianye","family":"Hao","sequence":"additional","affiliation":[{"name":"Noah&#x2019;s Ark Laboratory, Huawei, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-8218-9633","authenticated-orcid":false,"given":"Dongbin","family":"Zhao","sequence":"additional","affiliation":[{"name":"State Key Laboratory of Management and Control for Complex Systems, Institute of Automation, Chinese Academy of Sciences, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1038\/nature24270"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1007\/s12652-019-01503-y"},{"key":"ref15","first-page":"5527","article-title":"Independent policy gradient methods for competitive reinforcement learning","author":"daskalakis","year":"2020","journal-title":"Advances in neural information processing systems"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.24963\/ijcai.2019\/66"},{"key":"ref11","article-title":"Proximal policy optimization algorithms","author":"schulman","year":"2017","journal-title":"arXiv 1707 06347"},{"key":"ref10","doi-asserted-by":"crossref","first-page":"529","DOI":"10.1038\/nature14236","article-title":"Human-level control through deep reinforcement learning","volume":"518","author":"mnih","year":"2015","journal-title":"Nature"},{"key":"ref17","first-page":"434","article-title":"Open-ended learning in symmetric zero-sum games","volume":"97","author":"balduzzi","year":"2019","journal-title":"Proc 36th Int Conf Mach Learn"},{"key":"ref16","first-page":"4193","article-title":"A unified game-theoretic approach to multiagent reinforcement learning","author":"lanctot","year":"2017","journal-title":"Proc 31st Int Conf Neural Inf Process Syst"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1007\/s10107-018-1254-8"},{"key":"ref18","first-page":"1","article-title":"A generalized training approach for multiagent learning","author":"muller","year":"2020","journal-title":"Proc Int Conf Learn Represent"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1137\/S0363012904439301"},{"key":"ref46","author":"sutton","year":"2018","journal-title":"Reinforcement Learning An Introduction"},{"key":"ref45","first-page":"1894","article-title":"Using iterated best-response to find Bayes-Nash equilibria in auctions","volume":"2","author":"naroditskiy","year":"2007","journal-title":"Proc 22nd Nat Conf Artif Intell"},{"key":"ref48","article-title":"Deep reinforcement learning from self-play in imperfect-information games","author":"heinrich","year":"2016","journal-title":"arXiv 1603 01121"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.1016\/S1574-0005(05)80052-9"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1038\/s41586-019-1724-z"},{"key":"ref41","author":"khalil","year":"2002","journal-title":"Nonlinear Systems"},{"key":"ref44","first-page":"1","article-title":"High-dimensional continuous control using generalized advantage estimation","author":"schulman","year":"2016","journal-title":"Proc 4th Int Conf Learn Represent"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1007\/BFb0096509"},{"key":"ref49","author":"takayama","year":"1985","journal-title":"Mathematical Economics"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1137\/S0363012903437976"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1137\/070699652"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1287\/moor.2014.0687"},{"key":"ref4","first-page":"1321","article-title":"Approximate dynamic programming for two-player zero-sum Markov games","volume":"37","author":"perolat","year":"2015","journal-title":"Proc 32nd Int Conf Mach Learn"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1016\/B978-1-55860-335-6.50027-1"},{"key":"ref6","first-page":"7722","article-title":"No-regret learning dynamics for extensive-form correlated equilibrium","author":"celli","year":"2020","journal-title":"Advances in neural information processing systems"},{"key":"ref5","first-page":"805","article-title":"Fictitious self-play in extensive-form games","author":"heinrich","year":"2015","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1109\/Allerton.2013.6736623"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1109\/TETCI.2018.2823329"},{"key":"ref34","first-page":"4295","article-title":"QMIX: Monotonic value function factorisation for deep multi-agent reinforcement learning","author":"rashid","year":"2018","journal-title":"Proc 35th Int Conf Mach Learn"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1007\/s10107-004-0552-5"},{"key":"ref36","article-title":"UNMAS: Multiagent reinforcement learning for unshaped cooperative scenarios","author":"chai","year":"2021","journal-title":"IEEE Trans Neural Netw Learn Syst"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1109\/TCYB.2018.2830820"},{"key":"ref30","article-title":"Multi-H? controls for unknown input-interference nonlinear system with reinforcement learning","author":"lv","year":"2021","journal-title":"IEEE Trans Neural Netw Learn Syst"},{"key":"ref33","article-title":"Q-learning for feedback Nash strategy of finite-horizon nonzero-sum difference games","author":"zhang","year":"2021","journal-title":"IEEE Trans Cybern"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/TCYB.2019.2950262"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/TCYB.2015.2453165"},{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1073\/pnas.39.10.1953"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1023\/A:1016304319551"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1080\/00029890.1979.11994922"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1109\/TCYB.2020.3015811"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/TCYB.2020.3025491"},{"key":"ref26","first-page":"3426","article-title":"Actor-critic policy optimization in partially observable multiagent environments","author":"srinivasan","year":"2018","journal-title":"Proc 32nd Int Conf Neural Inf Process Syst"},{"key":"ref25","first-page":"1889","article-title":"Trust region policy optimization","author":"schulman","year":"2015","journal-title":"Proc 32nd Int Conf Mach Learn (ICML)"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/TAC.2020.2978037"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2020.3041469"},{"key":"ref21","first-page":"1659","article-title":"Learning in zero-sum team Markov games using factored value functions","author":"lagoudakis","year":"2002","journal-title":"Proc 15th Int Conf Neural Inf Process Syst"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2016.2561300"},{"key":"ref27","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1038\/s41598-019-45619-9","article-title":"?-rank: Multi-agent evaluation by evolution","volume":"9","author":"omidshafiei","year":"2019","journal-title":"Sci Rep"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1109\/TCYB.2016.2643687"}],"container-title":["IEEE Transactions on Cybernetics"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/6221036\/10252107\/09806433.pdf?arnumber=9806433","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,10,2]],"date-time":"2023-10-02T18:03:26Z","timestamp":1696269806000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/9806433\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023,10]]},"references-count":50,"journal-issue":{"issue":"10"},"URL":"https:\/\/doi.org\/10.1109\/tcyb.2022.3179775","relation":{},"ISSN":["2168-2267","2168-2275"],"issn-type":[{"value":"2168-2267","type":"print"},{"value":"2168-2275","type":"electronic"}],"subject":[],"published":{"date-parts":[[2023,10]]}}}