{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,2]],"date-time":"2026-06-02T23:41:32Z","timestamp":1780443692427,"version":"3.54.1"},"reference-count":31,"publisher":"IEEE","license":[{"start":{"date-parts":[[2025,10,19]],"date-time":"2025-10-19T00:00:00Z","timestamp":1760832000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2025,10,19]],"date-time":"2025-10-19T00:00:00Z","timestamp":1760832000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025,10,19]]},"DOI":"10.1109\/iros60139.2025.11247096","type":"proceedings-article","created":{"date-parts":[[2025,11,27]],"date-time":"2025-11-27T18:54:45Z","timestamp":1764269685000},"page":"6055-6062","source":"Crossref","is-referenced-by-count":1,"title":["Transformer-Based Multi-Agent Reinforcement Learning Method With Credit-Oriented Strategy Differentiation"],"prefix":"10.1109","author":[{"given":"Kaixuan","family":"Huang","sequence":"first","affiliation":[{"name":"Dalian University of Technology,School of Computer Science and Technology,Dalian,China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Bo","family":"Jin","sequence":"additional","affiliation":[{"name":"Dalian University of Technology,School of Computer Science and Technology,Dalian,China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Kun","family":"Zhang","sequence":"additional","affiliation":[{"name":"Northwestern Polytechnical University,School of Electronics and Information,Xian,China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Haiyin","family":"Piao","sequence":"additional","affiliation":[{"name":"Northwestern Polytechnical University,School of Electronics and Information,Xian,China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Ziqi","family":"Wei","sequence":"additional","affiliation":[{"name":"Chinese Academy of Sciences,Institute of Automation,Beijing,China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","article-title":"Multi-agent actor-critic for mixed cooperative-competitive environments","volume":"30","author":"Lowe","year":"2017"},{"key":"ref2","article-title":"Learning to communicate with deep multi-agent reinforcement learning","author":"Foerster","year":"2016"},{"issue":"178","key":"ref3","first-page":"1","article-title":"Monotonic value function factorisation for deep multi-agent reinforcement learning","volume":"21","author":"Rashid","year":"2020","journal-title":"Journal of Machine Learning Research"},{"key":"ref4","first-page":"24 611","article-title":"The surprising effectiveness of ppo in cooperative multi-agent games","volume":"35","author":"Yu","year":"2022","journal-title":"Advances in Neural Information Processing Systems"},{"key":"ref5","article-title":"Smarts: Scalable multi-agent reinforcement learning training school for autonomous driving, 2020","author":"Zhou","year":"2010"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.3390\/s23073625"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/TWC.2021.3051163"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-27645-3_12"},{"key":"ref9","article-title":"Deep recurrent q-learning for partially observable mdps","volume-title":"2015 aaai fall Symposium series","author":"Hausknecht"},{"key":"ref10","article-title":"Recurrent experience replay in distributed reinforcement learning","volume-title":"International conference on learning representations","author":"Kapturowski"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v34i05.6214"},{"key":"ref12","first-page":"34 874","article-title":"Transformer-based working memory for multiagent reinforcement learning with action parsing","volume":"35","author":"Yang","year":"2022","journal-title":"Advances in Neural Information Processing Systems"},{"key":"ref13","article-title":"Value-decomposition networks for cooperative multi-agent learning","author":"Sunehag","year":"2017"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v32i1.11794"},{"key":"ref15","first-page":"10 199","article-title":"Weighted qmix: Expanding monotonic value function factorisation for deep multi-agent reinforcement learning","volume":"33","author":"Rashid","year":"2020","journal-title":"Advances in neural information processing systems"},{"key":"ref16","article-title":"Attention-guided contrastive role representations for multi-agent reinforcement learning","author":"Hu","year":"2023"},{"key":"ref17","first-page":"4992","article-title":"The emergence of individuality","volume-title":"International Conference on Machine Learning","author":"Jiang"},{"key":"ref18","article-title":"M3rl: Mind-aware multi-agent management reinforcement learning","author":"Shu","year":"2018"},{"key":"ref19","article-title":"Recurrent experience replay in distributed reinforcement learning","author":"Kapturowski","year":"2018"},{"key":"ref20","article-title":"Learning multi-agent communication from graph modeling perspective","author":"Hu","year":"2024"},{"key":"ref21","article-title":"Transformers in reinforcement learning: a survey","author":"Agarwal","year":"2023"},{"key":"ref22","first-page":"16 509","article-title":"Multi-agent reinforcement learning is a sequence modeling problem","volume":"35","author":"Wen","year":"2022","journal-title":"Advances in Neural Information Processing Systems"},{"key":"ref23","article-title":"Cooperative multi-agent reinforcement learning with sequential credit assignment","author":"Zang"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v37i10.26370"},{"key":"ref25","first-page":"11 853","article-title":"Learning implicit credit assignment for cooperative multi-agent reinforcement learning","volume":"33","author":"Zhou","year":"2020","journal-title":"Advances in neural information processing systems"},{"key":"ref26","article-title":"Diversity is all you need: Learning skills without a reward function","author":"Eysenbach","year":"2018"},{"key":"ref27","first-page":"3991","article-title":"Celebrating diversity in shared multi-agent reinforcement learning","volume":"34","author":"Li","year":"2021","journal-title":"Advances in Neural Information Processing Systems"},{"key":"ref28","first-page":"46 105","article-title":"Automatic grouping for efficient cooperative multi-agent reinforcement learning","volume":"36","author":"Zang","year":"2023","journal-title":"Advances in Neural Information Processing Systems"},{"key":"ref29","article-title":"Representation learning with contrastive predictive coding","author":"Oord","year":"2018"},{"key":"ref30","article-title":"The starcraft multi-agent challenge","author":"Samvelyan","year":"2019"},{"key":"ref31","article-title":"Trust region policy optimisation in multi-agent reinforcement learning","author":"Kuba","year":"2021"}],"event":{"name":"2025 IEEE\/RSJ International Conference on Intelligent Robots and Systems (IROS)","location":"Hangzhou, China","start":{"date-parts":[[2025,10,19]]},"end":{"date-parts":[[2025,10,25]]}},"container-title":["2025 IEEE\/RSJ International Conference on Intelligent Robots and Systems (IROS)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/11245651\/11245652\/11247096.pdf?arnumber=11247096","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,12,18]],"date-time":"2025-12-18T12:37:43Z","timestamp":1766061463000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11247096\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,10,19]]},"references-count":31,"URL":"https:\/\/doi.org\/10.1109\/iros60139.2025.11247096","relation":{},"subject":[],"published":{"date-parts":[[2025,10,19]]}}}