{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,30]],"date-time":"2026-06-30T15:35:54Z","timestamp":1782833754320,"version":"3.54.5"},"reference-count":60,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"2","license":[{"start":{"date-parts":[[2023,4,1]],"date-time":"2023-04-01T00:00:00Z","timestamp":1680307200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2023,4,1]],"date-time":"2023-04-01T00:00:00Z","timestamp":1680307200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2023,4,1]],"date-time":"2023-04-01T00:00:00Z","timestamp":1680307200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/100016443","name":"Amazon Catalyst","doi-asserted-by":"publisher","id":[{"id":"10.13039\/100016443","id-type":"DOI","asserted-by":"publisher"}]},{"name":"MIT-IBM Watson AI Laboratory"},{"DOI":"10.13039\/100000140","name":"Department of Transportation Dwight David Eisenhower Transportation Fellowship Program","doi-asserted-by":"publisher","id":[{"id":"10.13039\/100000140","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Automat. Sci. Eng."],"published-print":{"date-parts":[[2023,4]]},"DOI":"10.1109\/tase.2022.3168621","type":"journal-article","created":{"date-parts":[[2022,4,29]],"date-time":"2022-04-29T20:01:36Z","timestamp":1651262496000},"page":"789-804","source":"Crossref","is-referenced-by-count":53,"title":["Unified Automatic Control of Vehicular Systems With Reinforcement Learning"],"prefix":"10.1109","volume":"20","author":[{"ORCID":"https:\/\/orcid.org\/0000-0003-1897-7381","authenticated-orcid":false,"given":"Zhongxia","family":"Yan","sequence":"first","affiliation":[{"name":"Department of Electrical Engineering and Computer Science, Massachusetts Institute of Technology, Cambridge, MA, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Abdul Rahman","family":"Kreidieh","sequence":"additional","affiliation":[{"name":"Department of Civil and Environmental Engineering, University of California, Berkeley, Berkeley, CA, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Eugene","family":"Vinitsky","sequence":"additional","affiliation":[{"name":"Department of Mechanical Engineering, University of California, Berkeley, Berkeley, CA, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-6697-222X","authenticated-orcid":false,"given":"Alexandre M.","family":"Bayen","sequence":"additional","affiliation":[{"name":"Department of Electrical Engineering and Computer Science, University of California, Berkeley, Berkeley, CA, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-8594-303X","authenticated-orcid":false,"given":"Cathy","family":"Wu","sequence":"additional","affiliation":[{"name":"Department of Civil and Environmental Engineering, Laboratory for Information and Decision Systems, Institute of Data, Systems, and Society, Massachusetts Institute of Technology, Cambridge, MA, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/TASE.2016.2640778"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1016\/j.tra.2015.12.001"},{"issue":"1","key":"ref3","first-page":"9","article-title":"Coordinating hundreds of cooperative, autonomous vehicles in warehouses","volume":"29","author":"Wurman","year":"2008","journal-title":"AI Mag."},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/TRO.2021.3087314"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/ITSC.2018.8569615"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1145\/3302509.3313784"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/TASE.2021.3064065"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/TASE.2015.2446614"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/TASE.2011.2160537"},{"key":"ref10","first-page":"1","article-title":"Planning, scheduling and monitoring for airport surface operations","volume-title":"Proc. Workshops 13th AAAI Conf. Artif. Intell.","author":"Morris"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/TASE.2017.2679485"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/TASE.2020.2996018"},{"key":"ref13","first-page":"398","article-title":"Emergent behaviors in mixed-autonomy traffic","volume-title":"Proc. Conf. Robot Learn.","author":"Wu"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1109\/ITSC.2018.8569485"},{"key":"ref15","first-page":"399","article-title":"Benchmarks for reinforcement learning in mixed-autonomy traffic","volume-title":"Proc. Conf. Robot Learn.","author":"Vinitsky"},{"key":"ref16","article-title":"Optimizing mixed autonomy traffic flow with decentralized autonomous vehicles and multi-agent RL","author":"Vinitsky","year":"2020","journal-title":"arXiv:2011.00120"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/ITSC48978.2021.9565000"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/JPROC.2003.819610"},{"key":"ref19","first-page":"40","article-title":"MAXBAND: A program for setting signals on arteries and triangular networks","volume":"795","author":"Little","year":"1981","journal-title":"Transp. Res. Rec. J. Transp. Res. Board"},{"key":"ref20","volume-title":"SCOOT: A Traffic Responsive Method Coordinating Signals","author":"Hunt","year":"1981"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-32460-4"},{"issue":"1","key":"ref22","first-page":"58","article-title":"ALINEA: A local feedback control law for on-ramp metering","volume":"1320","author":"Papageorgiou","year":"1991","journal-title":"Transp. Res. Rec."},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/TITS.2006.884615"},{"key":"ref24","doi-asserted-by":"crossref","DOI":"10.1007\/978-3-642-03991-1","volume-title":"The DARPA Urban Challenge: Autonomous Vehicles in City Traffic","volume":"56","author":"Buehler","year":"2009"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1109\/TITS.2003.821292"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1109\/TASE.2015.2498192"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-71682-4_10"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1613\/jair.2502"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1007\/s10489-011-0322-z"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1109\/TAC.2019.2921659"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1109\/COMST.2020.2965856"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/GLOCOM.2018.8647380"},{"key":"ref33","volume-title":"Neuro-Dynamic Programming","author":"Bertsekas","year":"1996"},{"key":"ref34","volume-title":"Reinforcement Learning: An Introduction","author":"Sutton","year":"2018"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1145\/3357384.3357902"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1109\/TITS.2017.2725912"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1109\/TASE.2021.3114327"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1109\/TASE.2019.2924444"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1109\/TASE.2019.2956762"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1109\/TASE.2020.2984739"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1109\/ITSC.2017.8317694"},{"key":"ref42","first-page":"1889","article-title":"Trust region policy optimization","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Schulman"},{"key":"ref43","first-page":"1587","article-title":"Addressing function approximation error in actor-critic methods","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Fujimoto"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1007\/BF00992696"},{"key":"ref45","first-page":"1","article-title":"Adam: A method for stochastic optimization","volume-title":"Proc. 3rd Int. Conf. Learn. Represent., (ICLR)","author":"Kingma"},{"issue":"8","key":"ref46","first-page":"2","article-title":"Neural networks for machine learning lecture 6a overview of mini-batch gradient descent","volume":"14","author":"Hinton","year":"2012","journal-title":"Cited"},{"key":"ref47","first-page":"1","article-title":"High-dimensional continuous control using generalized advantage estimation","volume-title":"Proc. 4th Int. Conf. Learn. Represent. (ICLR)","author":"Schulman"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1103\/PhysRevE.62.1805"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1109\/TASE.2020.3015110"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1016\/S0004-3702(98)00023-X"},{"key":"ref51","first-page":"195","article-title":"Planning, learning and coordination in multiagent decision processes","volume-title":"Proc. TARK","volume":"96","author":"Boutilier"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-71682-4_5"},{"key":"ref53","first-page":"1","article-title":"Implementation matters in deep RL: A case study on PPO and TRPO","volume-title":"Proc. Int. Conf. Learn. Represent.","author":"Engstrom"},{"key":"ref54","first-page":"1","article-title":"A natural policy gradient","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"14","author":"Kakade"},{"issue":"98","key":"ref55","first-page":"1","article-title":"On the theory of policy gradient methods: Optimality, approximation, and distribution shift","volume":"22","author":"Agarwal","year":"2021","journal-title":"J. Mach. Learn. Res."},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1109\/ITSC.2018.8569938"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.1287\/opre.7.1.86"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.1016\/j.trc.2018.02.005"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.3141\/2391-05"},{"key":"ref60","first-page":"3053","article-title":"Rllib: Abstractions for distributed reinforcement learning","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Liang"}],"container-title":["IEEE Transactions on Automation Science and Engineering"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/8856\/10094220\/09765650.pdf?arnumber=9765650","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,1,22]],"date-time":"2024-01-22T22:34:29Z","timestamp":1705962869000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/9765650\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023,4]]},"references-count":60,"journal-issue":{"issue":"2"},"URL":"https:\/\/doi.org\/10.1109\/tase.2022.3168621","relation":{},"ISSN":["1545-5955","1558-3783"],"issn-type":[{"value":"1545-5955","type":"print"},{"value":"1558-3783","type":"electronic"}],"subject":[],"published":{"date-parts":[[2023,4]]}}}