{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,9,17]],"date-time":"2025-09-17T15:10:34Z","timestamp":1758121834256,"version":"3.28.0"},"reference-count":37,"publisher":"IEEE","license":[{"start":{"date-parts":[[2020,8,1]],"date-time":"2020-08-01T00:00:00Z","timestamp":1596240000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2020,8,1]],"date-time":"2020-08-01T00:00:00Z","timestamp":1596240000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2020,8,1]],"date-time":"2020-08-01T00:00:00Z","timestamp":1596240000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2020,8]]},"DOI":"10.1109\/case48305.2020.9216981","type":"proceedings-article","created":{"date-parts":[[2020,10,8]],"date-time":"2020-10-08T20:01:51Z","timestamp":1602187311000},"page":"266-273","source":"Crossref","is-referenced-by-count":4,"title":["Learning Multi-Agent Communication with Policy Fingerprints for Adaptive Traffic Signal Control"],"prefix":"10.1109","author":[{"given":"Yifan","family":"Zhao","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Gangyan","family":"Xu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yali","family":"Duy","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Meng","family":"Fangz","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref33","article-title":"Stabilising experience replay for deep multi-agent reinforcement learning","volume":"abs 1702 8887","author":"foerster","year":"2017","journal-title":"ArXiv"},{"key":"ref32","article-title":"Extending q-learning to general adaptive multi-agent systems","volume":"16","author":"tesauro","year":"2003","journal-title":"Advances in neural information processing systems"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1109\/TITS.2019.2901791"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1016\/B978-1-55860-307-3.50049-6"},{"key":"ref37","article-title":"Recent development and applications of sumo-simulation of urban mobility","volume":"5","author":"krajzewicz","year":"2012","journal-title":"International Journal on Advances in Systems and Measurements"},{"key":"ref36","article-title":"A survey on trafic signal control methods","author":"wei","year":"2019","journal-title":"arXiv preprint arXiv 1904 01870"},{"journal-title":"Reinforcement Learning An Introduction","year":"2018","author":"sutton","key":"ref35"},{"key":"ref34","article-title":"Multi-agent reinforcement learning for networked system control","author":"chu","year":"2020","journal-title":"International Conference on Learning Representations"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1016\/j.trc.2008.03.002"},{"key":"ref11","article-title":"Flow: Architecture and benchmarking for reinforcement learning in trafic control","author":"wu","year":"2017","journal-title":"arXiv preprint arXiv 1710 05465"},{"key":"ref12","article-title":"Playing atari with deep reinforcement learning","author":"mnih","year":"2013","journal-title":"arXiv preprint arXiv 1312 5602"},{"key":"ref13","doi-asserted-by":"crossref","first-page":"529","DOI":"10.1038\/nature14236","article-title":"Human-level control through deep reinforcement learning","volume":"518","author":"mnih","year":"2015","journal-title":"Nature"},{"key":"ref14","doi-asserted-by":"crossref","DOI":"10.1609\/aaai.v31i1.10827","article-title":"Playing fps games with deep reinforcement learning","author":"lample","year":"2017","journal-title":"Thirty-First AAAI Conference on Artificial Intelligence"},{"key":"ref15","first-page":"4405","article-title":"Liir: Learning individual intrinsic reward in multi-agent reinforcement learning","author":"du","year":"2019","journal-title":"Advances in neural information processing systems"},{"key":"ref16","first-page":"1889","article-title":"Trust region policy optimization","author":"schulman","year":"2015","journal-title":"International Conference on Machine Learning"},{"key":"ref17","article-title":"Continuous control with deep reinforcement learning","author":"lillicrap","year":"2015","journal-title":"arXiv preprint arXiv 1509 02971"},{"key":"ref18","article-title":"DHER: Hindsight experience replay for dynamic goals","author":"fang","year":"2019","journal-title":"International Conference on Learning Representations"},{"key":"ref19","first-page":"12 602","article-title":"Curriculum-guided hindsight experience replay","author":"fang","year":"2019","journal-title":"Advances in neural information processing systems"},{"key":"ref28","article-title":"Multiagent bidirectionally-coordinated nets: Emergence of human-level coordination in learning to play starcraft combat games","author":"peng","year":"2017","journal-title":"arXiv preprint arXiv 1703 10593"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1016\/j.trc.2019.01.026"},{"key":"ref27","first-page":"2137","article-title":"Learning to communicate with deep multi-agent reinforcement learning","author":"foerster","year":"2016","journal-title":"Advances in neural information processing systems"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1016\/j.trc.2017.09.020"},{"key":"ref6","article-title":"Two trafic responsive area trafic control methods: Scat and scoot","author":"luk","year":"1983","journal-title":"9th Road Engineering Association of Asia and Australasia Conference"},{"key":"ref29","first-page":"2244","article-title":"Learning multiagent communication with backpropagation","author":"sukhbaatar","year":"2016","journal-title":"Advances in neural information processing systems"},{"key":"ref5","first-page":"190","article-title":"The scoot on-line trafic signal optimisation technique (glasgow)","volume":"23","author":"hunt","year":"1982","journal-title":"Traffic Engineering Control"},{"key":"ref8","article-title":"Optimal control of trafic signals using quantum annealing","author":"hussain","year":"2019","journal-title":"arXiv preprint arXiv 1912 07134"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1016\/S0191-2615(03)00015-8"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1287\/trsc.2017.0754"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/TITS.2010.2050688"},{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-05299-6"},{"key":"ref20","article-title":"Alphago: Mastering the ancient game of go with machine learning","volume":"9","author":"silver","year":"2016","journal-title":"Research blog"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2017.7989385"},{"key":"ref21","first-page":"1329","article-title":"Benchmarking deep reinforcement learning for continuous control","author":"duan","year":"2016","journal-title":"International Conference on Machine Learning"},{"key":"ref24","doi-asserted-by":"crossref","DOI":"10.1609\/aaai.v32i1.11794","article-title":"Counterfactual multi-agent policy gradients","author":"foerster","year":"2018","journal-title":"Thirty-Second AAAI Conference on Artificial Intelligence"},{"key":"ref23","first-page":"6379","article-title":"Multi-agent actor-critic for mixed cooperative-competitive environments","author":"lowe","year":"2017","journal-title":"Advances in neural information processing systems"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-71682-4_5"},{"key":"ref25","first-page":"2681","article-title":"Deep decentralized multi-task multi-agent reinforcement learning under partial observability","author":"omidshaiei","year":"2017","journal-title":"Proceedings of the 34th International Conference on Machine Learning-Volume 70 JMLR org"}],"event":{"name":"2020 IEEE 16th International Conference on Automation Science and Engineering (CASE)","start":{"date-parts":[[2020,8,20]]},"location":"Hong Kong, Hong Kong","end":{"date-parts":[[2020,8,21]]}},"container-title":["2020 IEEE 16th International Conference on Automation Science and Engineering (CASE)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/9210430\/9216730\/09216981.pdf?arnumber=9216981","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,11,22]],"date-time":"2022-11-22T17:59:54Z","timestamp":1669139994000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/9216981\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2020,8]]},"references-count":37,"URL":"https:\/\/doi.org\/10.1109\/case48305.2020.9216981","relation":{},"subject":[],"published":{"date-parts":[[2020,8]]}}}