{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,2,21]],"date-time":"2025-02-21T01:25:40Z","timestamp":1740101140348,"version":"3.37.3"},"reference-count":29,"publisher":"IEEE","license":[{"start":{"date-parts":[[2022,8,22]],"date-time":"2022-08-22T00:00:00Z","timestamp":1661126400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2022,8,22]],"date-time":"2022-08-22T00:00:00Z","timestamp":1661126400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/100000001","name":"National Science Foundation","doi-asserted-by":"publisher","award":["CCF-2106560,CCF-2007783"],"award-info":[{"award-number":["CCF-2106560,CCF-2007783"]}],"id":[{"id":"10.13039\/100000001","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2022,8,22]]},"DOI":"10.1109\/mlsp55214.2022.9943500","type":"proceedings-article","created":{"date-parts":[[2022,11,17]],"date-time":"2022-11-17T20:39:35Z","timestamp":1668717575000},"page":"1-6","source":"Crossref","is-referenced-by-count":1,"title":["Data-Driven Robust Multi-Agent Reinforcement Learning"],"prefix":"10.1109","author":[{"given":"Yudan","family":"Wang","sequence":"first","affiliation":[{"name":"University at Buffalo,Department of Electrical Engineering"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yue","family":"Wang","sequence":"additional","affiliation":[{"name":"University at Buffalo,Department of Electrical Engineering"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yi","family":"Zhou","sequence":"additional","affiliation":[{"name":"University of Utah,Department of Electrical and Computer Engineering"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Alvaro","family":"Velasquez","sequence":"additional","affiliation":[{"name":"Information Directorate, Air Force Research Laboratory"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Shaofeng","family":"Zou","sequence":"additional","affiliation":[{"name":"University at Buffalo,Department of Electrical Engineering"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref10","first-page":"511","article-title":"Robust reinforcement learning using least squares policy iteration with provable performance guarantees","author":"badrinath","year":"0","journal-title":"Proc International Conference on Machine Learning (ICML)"},{"key":"ref11","article-title":"Robust reinforcement learning using adversarial populations","author":"vinitsky","year":"2020","journal-title":"ArXiv Preprint"},{"key":"ref12","first-page":"2817","article-title":"Robust adversarial reinforcement learning","author":"pinto","year":"0","journal-title":"Proc International Conference on Machine Learning (ICML)"},{"key":"ref13","article-title":"Robust reinforcement learning with wasserstein constraint","author":"hou","year":"2020","journal-title":"ArXiv Preprint"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.24963\/ijcai.2017\/525"},{"key":"ref15","first-page":"2040","article-title":"Robust deep reinforcement learning with adversarial attacks","author":"pattanaik","year":"0","journal-title":"Proc 1st Int Conf Autonomous Agents Multiagent Syst"},{"key":"ref16","article-title":"Robust multi-agent reinforcement learning with model uncertainty","volume":"33","author":"zhang","year":"0","journal-title":"Proc Advances in Neural Information Processing Systems (NeurIPS)"},{"key":"ref17","first-page":"5872","article-title":"Fully decentralized multi-agent reinforcement learning with networked agents","author":"zhang","year":"0","journal-title":"Proc International Conference on Machine Learning (ICML)"},{"key":"ref18","article-title":"Learning markov games with adversarial opponents: Efficient algorithms and fundamental limits","author":"liu","year":"2022","journal-title":"ArXiv Preprint"},{"key":"ref19","article-title":"Sample and communication-efficient decentralized actor-critic algorithms with finite-time analysis","author":"chen","year":"2021","journal-title":"ArXiv Preprint"},{"key":"ref28","first-page":"8665","article-title":"Finite-sample analysis for SARSA with linear function approximation","author":"zou","year":"0","journal-title":"Proc Advances in Neural Information Processing Systems (NeurIPS)"},{"key":"ref4","doi-asserted-by":"crossref","first-page":"158","DOI":"10.1016\/j.comnet.2015.12.017","article-title":"Towards smart factory for industry 4.0: a self-organized multi-agent system with big data based feedback and coordination","volume":"101","author":"wang","year":"2016","journal-title":"Computer Networks"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/TIT.2021.3120096"},{"key":"ref3","first-page":"464","article-title":"Multi-agent reinforcement learning in sequential social dilemmas","author":"leibo","year":"0","journal-title":"Proceedings of the 16th Conference on Autonomous Agents and MultiAgent Systems"},{"key":"ref6","volume":"9","author":"bagnell","year":"2001","journal-title":"Solving uncertain Markov decision processes"},{"key":"ref29","article-title":"Policy gradient method for robust reinforcement learning","author":"wang","year":"2022","journal-title":"ArXiv Preprint"},{"journal-title":"Reinforcement Learning An Introduction","year":"2018","author":"sutton","key":"ref5"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1287\/moor.1040.0129"},{"key":"ref7","first-page":"839","article-title":"Robustness in Markov decision problems with uncertain transition matrices","author":"nilim","year":"0","journal-title":"Proc Advances in Neural Information Processing Systems (NIPS)"},{"key":"ref2","article-title":"Safe, multi-agent, reinforcement learning for autonomous driving","author":"shalev-shwartz","year":"2016","journal-title":"ArXiv Preprint"},{"key":"ref9","first-page":"3046","article-title":"Reinforcement learning under model mismatch","author":"roy","year":"0","journal-title":"Proc Advances in Neural Information Processing Systems (NIPS)"},{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-60990-0_12"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1016\/B978-1-55860-335-6.50027-1"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1016\/j.jpdc.2006.08.010"},{"key":"ref21","article-title":"Online robust reinforcement learning with model uncertainty","author":"wang","year":"0","journal-title":"Proc Advances in Neural Information Processing Systems (NeurIPS)"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v30i1.10295"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1038\/nature14236"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1214\/aoms\/1177699803"},{"key":"ref25","article-title":"Robustness in markov decision problems with uncertain transition matrices","volume":"16","author":"nilim","year":"2003","journal-title":"Advances in Neural Information Processing Systems (NIPS)"}],"event":{"name":"2022 IEEE 32nd International Workshop on Machine Learning for Signal Processing (MLSP)","start":{"date-parts":[[2022,8,22]]},"location":"Xi'an, China","end":{"date-parts":[[2022,8,25]]}},"container-title":["2022 IEEE 32nd International Workshop on Machine Learning for Signal Processing (MLSP)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/9943282\/9943306\/09943500.pdf?arnumber=9943500","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,12,12]],"date-time":"2022-12-12T19:59:58Z","timestamp":1670875198000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/9943500\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2022,8,22]]},"references-count":29,"URL":"https:\/\/doi.org\/10.1109\/mlsp55214.2022.9943500","relation":{},"subject":[],"published":{"date-parts":[[2022,8,22]]}}}