{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,3,25]],"date-time":"2026-03-25T06:26:10Z","timestamp":1774419970088,"version":"3.50.1"},"reference-count":45,"publisher":"IEEE","license":[{"start":{"date-parts":[[2025,4,6]],"date-time":"2025-04-06T00:00:00Z","timestamp":1743897600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2025,4,6]],"date-time":"2025-04-06T00:00:00Z","timestamp":1743897600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025,4,6]]},"DOI":"10.1109\/icassp49660.2025.10889127","type":"proceedings-article","created":{"date-parts":[[2025,3,12]],"date-time":"2025-03-12T13:56:59Z","timestamp":1741787819000},"page":"1-5","source":"Crossref","is-referenced-by-count":0,"title":["A Ranking Scheme for Trust Region Multi-agent Reinforcement Learning"],"prefix":"10.1109","author":[{"given":"Ruichen","family":"Gao","sequence":"first","affiliation":[{"name":"Harbin Institute of Technology,Harbin,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yi","family":"Hu","sequence":"additional","affiliation":[{"name":"Harbin Institute of Technology,Harbin,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Deqin","family":"Zheng","sequence":"additional","affiliation":[{"name":"Harbin Institute of Technology,Harbin,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Mengxuan","family":"Shao","sequence":"additional","affiliation":[{"name":"Harbin Institute of Technology,Harbin,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Haiqi","family":"Zhu","sequence":"additional","affiliation":[{"name":"Harbin Institute of Technology,Harbin,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Chenyue","family":"Song","sequence":"additional","affiliation":[{"name":"Harbin Institute of Technology,Harbin,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Wei","family":"Zhang","sequence":"additional","affiliation":[{"name":"Harbin Institute of Technology,Harbin,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Feng","family":"Jiang","sequence":"additional","affiliation":[{"name":"Harbin Institute of Technology,Harbin,China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref1","article-title":"An overview of multi-agent reinforcement learning from game theoretical perspective","author":"Yang","year":"2020"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1093\/nsr\/nwac256"},{"issue":"150","key":"ref3","first-page":"1","article-title":"Malib: A parallel framework for population-based multi-agent reinforcement learning","volume":"24","author":"Zhou","year":"2023","journal-title":"Journal of Machine Learning Research"},{"key":"ref4","first-page":"1861","article-title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","volume-title":"International conference on machine learning","author":"Haarnoja"},{"key":"ref5","article-title":"Multi-agent actor-critic for mixed cooperative-competitive environments","volume":"30","author":"Lowe","year":"2017","journal-title":"Advances in neural information processing systems"},{"key":"ref6","article-title":"Policy gradient methods for reinforcement learning with function approximation","volume":"12","author":"Sutton","year":"1999","journal-title":"Advances in neural information processing systems"},{"key":"ref7","first-page":"7688","article-title":"Learning in nonzero-sum stochastic games with potentials","volume-title":"International Conference on Machine Learning","author":"Mguni"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/tpami.2024.3457538"},{"key":"ref9","first-page":"387","article-title":"Deterministic policy gradient algorithms","volume-title":"International conference on machine learning","author":"Silver"},{"issue":"746-752","key":"ref10","first-page":"2","article-title":"The dynamics of reinforcement learning in cooperative multiagent systems","volume-title":"AAAI\/IAAI","volume":"1998","author":"Claus"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/ICME52920.2022.9859846"},{"key":"ref12","article-title":"Multiagent bidirectionally-coordinated nets: Emergence of human-level coordination in learning to play starcraft combat games","author":"Peng","year":"2017"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v34i05.6226"},{"key":"ref14","article-title":"Probabilistic recursive reasoning for multi-agent reinforcement learning","author":"Wen","year":"2019"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v32i1.11794"},{"key":"ref16","first-page":"5571","article-title":"Mean field multi-agent reinforcement learning","volume-title":"International conference on machine learning","author":"Yang"},{"key":"ref17","first-page":"29142","article-title":"Towards understanding cooperative multi-agent q-learning with value factorization","volume":"34","author":"Wang","year":"2021","journal-title":"Advances in Neural Information Processing Systems"},{"key":"ref18","first-page":"1889","article-title":"Trust region policy optimization","volume-title":"International conference on machine learning","author":"Schulman"},{"key":"ref19","article-title":"A review of cooperation in multi-agent learning","author":"Du","year":"2023"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/ICME51207.2021.9428143"},{"key":"ref21","article-title":"Value-decomposition networks for cooperative multi-agent learning","author":"Sunehag","year":"2017"},{"key":"ref22","author":"Rashid","journal-title":"Monotonic value function factorisation for deep multi-agent reinforcement learning"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1038\/nature14236"},{"key":"ref24","first-page":"5887","article-title":"Qtran: Learning to factorize with transformation for cooperative multi-agent reinforcement learning","volume-title":"International conference on machine learning","author":"Son"},{"key":"ref25","article-title":"Qatten: A general framework for cooperative multiagent reinforcement learning","author":"Yang","year":"2020"},{"key":"ref26","first-page":"12843","article-title":"Decon-founded value decomposition for multi-agent reinforcement learning","volume-title":"International Conference on Machine Learning","author":"Li"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1145\/3503160"},{"issue":"178","key":"ref28","first-page":"1","article-title":"Monotonic value function factorisation for deep multi-agent reinforcement learning","volume":"21","author":"Rashid","year":"2020","journal-title":"Journal of Machine Learning Research"},{"key":"ref29","first-page":"24611","article-title":"The surprising effectiveness of ppo in cooperative multi-agent games","volume":"35","author":"Yu","year":"2022","journal-title":"Advances in Neural Information Processing Systems"},{"issue":"178","key":"ref30","first-page":"1","article-title":"Trust region policy optimisation in multi-agent reinforcement learning","volume":"21","author":"Kuba","year":"2020","journal-title":"Journal of Machine Learning Research"},{"key":"ref31","article-title":"Heterogeneous-agent mirror learning: A continuum of solutions to cooperative marl","author":"Kuba","year":"2022"},{"issue":"1-67","key":"ref32","first-page":"1","article-title":"Heterogeneous-agent reinforcement learning","volume":"25","author":"Zhong","year":"2024","journal-title":"Journal of Machine Learning Research"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.12794\/metadc1505267"},{"key":"ref34","article-title":"High-dimensional continuous control using generalized advantage estimation","author":"Schulman","year":"2015"},{"key":"ref35","first-page":"5711","article-title":"Self-organized group for cooperative multi-agent reinforcement learning","volume":"35","author":"Shao","year":"2022","journal-title":"Advances in Neural Information Processing Systems"},{"key":"ref36","article-title":"The starcraft multi-agent challenge","author":"Samvelyan","year":"2019"},{"key":"ref37","first-page":"19","article-title":"Deep multi-agent reinforcement learning for decentralized continuous cooperative control","author":"de Witt","year":"2020"},{"key":"ref38","first-page":"16509","article-title":"Multi-agent reinforcement learning is a sequence modeling problem","volume":"35","author":"Wen","year":"2022","journal-title":"Advances in Neural Information Processing Systems"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1007\/s11704-023-2689-5"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2023.3301213"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1109\/ICME52920.2022.9859965"},{"key":"ref42","article-title":"Learning multi-agent communication from graph modeling perspective","author":"Hu","year":"2024"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.3390\/ai5020029"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1007\/s11633-023-1426-8"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-25549-6_6"}],"event":{"name":"ICASSP 2025 - 2025 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","location":"Hyderabad, India","start":{"date-parts":[[2025,4,6]]},"end":{"date-parts":[[2025,4,11]]}},"container-title":["ICASSP 2025 - 2025 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/10887540\/10887541\/10889127.pdf?arnumber=10889127","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,3,25]],"date-time":"2026-03-25T05:25:42Z","timestamp":1774416342000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/10889127\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,4,6]]},"references-count":45,"URL":"https:\/\/doi.org\/10.1109\/icassp49660.2025.10889127","relation":{},"subject":[],"published":{"date-parts":[[2025,4,6]]}}}