{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,2]],"date-time":"2026-07-02T16:40:16Z","timestamp":1783010416711,"version":"3.54.6"},"reference-count":273,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","license":[{"start":{"date-parts":[[2021,1,1]],"date-time":"2021-01-01T00:00:00Z","timestamp":1609459200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/legalcode"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Access"],"published-print":{"date-parts":[[2021]]},"DOI":"10.1109\/access.2021.3087410","type":"journal-article","created":{"date-parts":[[2021,6,8]],"date-time":"2021-06-08T12:47:50Z","timestamp":1623156470000},"page":"84417-84464","source":"Crossref","is-referenced-by-count":19,"title":["User-Centric Radio Access Technology Selection: A Survey of Game Theory Models and Multi-Agent Learning Algorithms"],"prefix":"10.1109","volume":"9","author":[{"ORCID":"https:\/\/orcid.org\/0000-0003-0611-5637","authenticated-orcid":false,"given":"Giuseppe","family":"Caso","sequence":"first","affiliation":[{"name":"Department of Mobile Systems and Analytics, Simula Metropolitan Center for Digital Engineering, Oslo, Norway"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-5800-2779","authenticated-orcid":false,"given":"\u00d6zg\u00fc","family":"Alay","sequence":"additional","affiliation":[{"name":"Department of Mobile Systems and Analytics, Simula Metropolitan Center for Digital Engineering, Oslo, Norway"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-1811-4300","authenticated-orcid":false,"given":"Guido Carlo","family":"Ferrante","sequence":"additional","affiliation":[{"name":"Ericsson Research, Kista, Sweden"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-9286-8744","authenticated-orcid":false,"given":"Luca De","family":"Nardis","sequence":"additional","affiliation":[{"name":"Department of Information Engineering, Electronics and Telecommunications, Sapienza University of Rome, Rome, Italy"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-1523-5083","authenticated-orcid":false,"given":"Maria-Gabriella Di","family":"Benedetto","sequence":"additional","affiliation":[{"name":"Department of Information Engineering, Electronics and Telecommunications, Sapienza University of Rome, Rome, Italy"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-7311-9334","authenticated-orcid":false,"given":"Anna","family":"Brunstrom","sequence":"additional","affiliation":[{"name":"Department of Computer Science, Karlstad University, Karlstad, Sweden"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref271","doi-asserted-by":"publisher","DOI":"10.1145\/2630088.2631977"},{"key":"ref270","doi-asserted-by":"publisher","DOI":"10.1109\/JSAC.2020.3000365"},{"key":"ref273","doi-asserted-by":"publisher","DOI":"10.1109\/MCOM.001.2000881"},{"key":"ref170","article-title":"The role of exploration in learning control","author":"thrun","year":"1992","journal-title":"Handbook for Intelligent Control Neural Fuzzy and Adaptive Approaches"},{"key":"ref272","doi-asserted-by":"publisher","DOI":"10.1109\/INFOCOM.2019.8737649"},{"key":"ref172","doi-asserted-by":"publisher","DOI":"10.1109\/APSIPA.2013.6694368"},{"key":"ref171","doi-asserted-by":"publisher","DOI":"10.1109\/GLOCOM.2012.6503908"},{"key":"ref174","doi-asserted-by":"publisher","DOI":"10.1049\/iet-com.2017.0213"},{"key":"ref173","doi-asserted-by":"publisher","DOI":"10.1109\/BlackSeaCom.2017.8277675"},{"key":"ref176","doi-asserted-by":"publisher","DOI":"10.1109\/ACCESS.2019.2898205"},{"key":"ref175","doi-asserted-by":"publisher","DOI":"10.1051\/matecconf\/201817303014"},{"key":"ref178","doi-asserted-by":"publisher","DOI":"10.3390\/e20040236"},{"key":"ref177","doi-asserted-by":"publisher","DOI":"10.1109\/SCVT.2017.8240310"},{"key":"ref168","doi-asserted-by":"publisher","DOI":"10.1007\/BF00993306"},{"key":"ref169","doi-asserted-by":"publisher","DOI":"10.1023\/A:1007678930559"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1109\/TNN.1998.712192"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1613\/jair.301"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1109\/MCOM.2011.5978427"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/MSP.2015.2451994"},{"key":"ref31","author":"lasaulce","year":"2011","journal-title":"Game Theory and Learning for Wireless Networks Fundamentals and Applications"},{"key":"ref30","author":"blumrosen","year":"2007","journal-title":"Algorithmic Game Theory"},{"key":"ref267","doi-asserted-by":"publisher","DOI":"10.1109\/6GSUMMIT49458.2020.9083786"},{"key":"ref37","article-title":"Multi-agent reinforcement learning: A selective overview of theories and algorithms","author":"zhang","year":"2019","journal-title":"arXiv 1911 10635"},{"key":"ref268","doi-asserted-by":"publisher","DOI":"10.1109\/ACCESS.2020.2987467"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1109\/TSMCC.2007.913919"},{"key":"ref269","first-page":"399","article-title":"How hard can it Be? Designing and implementing a deployable multipath $$TCP$ $","author":"raiciu","year":"2012","journal-title":"Proc USENIX Symp Netw Syst Design Implement (NSDI)"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-60454-6_15"},{"key":"ref34","author":"morgenstern","year":"1953","journal-title":"Theory of Games and Economic Behavior"},{"key":"ref181","doi-asserted-by":"publisher","DOI":"10.1109\/TVT.2017.2730230"},{"key":"ref180","doi-asserted-by":"publisher","DOI":"10.1109\/JSAC.2015.2416987"},{"key":"ref185","year":"2012","journal-title":"Hotspot 2 0 Technical Specification"},{"key":"ref184","doi-asserted-by":"publisher","DOI":"10.1109\/VETECF.2011.6092863"},{"key":"ref183","doi-asserted-by":"publisher","DOI":"10.1109\/ICCCN.2011.6005775"},{"key":"ref182","doi-asserted-by":"publisher","DOI":"10.1109\/JSAC.2012.120401"},{"key":"ref189","first-page":"1039","article-title":"Nash Q-learning for general-sum stochastic games","volume":"4","author":"hu","year":"2003","journal-title":"J Mach Learn Res"},{"key":"ref188","doi-asserted-by":"publisher","DOI":"10.1109\/ICT.2019.8798797"},{"key":"ref187","first-page":"203","article-title":"Adaptive $\\varepsilon$ -greedy exploration in reinforcement learning based on value differences","author":"tokic","year":"2010","journal-title":"Proc German Conf Adv Artif Intell (KI)"},{"key":"ref186","doi-asserted-by":"publisher","DOI":"10.1109\/MCOM.2009.4752689"},{"key":"ref28","volume":"2","author":"fudenberg","year":"1998","journal-title":"The Theory of Learning in Games"},{"key":"ref27","author":"vidal","year":"2006","journal-title":"Fundamentals of Multiagent Systems with NetLogo Examples"},{"key":"ref179","doi-asserted-by":"publisher","DOI":"10.1109\/VTCSpring.2014.7023063"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1093\/acprof:oso\/9780199269181.001.0001"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/JSAC.2014.2328143"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/TWC.2015.2509067"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/JSAC.2015.2416982"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1109\/TNSE.2021.3058037"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/TMC.2016.2613864"},{"key":"ref26","author":"osborne","year":"1994","journal-title":"A Course in Game Theory"},{"key":"ref25","author":"fudenberg","year":"1991","journal-title":"Game Theory"},{"key":"ref50","first-page":"242","article-title":"Multiagent reinforcement learning: Theoretical framework and an algorithm","volume":"98","author":"hu","year":"1998","journal-title":"Proc Int Conf Mach Learn (ICML)"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1017\/CBO9780511546921"},{"key":"ref154","volume":"2","author":"kuhn","year":"1953","journal-title":"Contributions to the Theory of Games"},{"key":"ref153","doi-asserted-by":"publisher","DOI":"10.1016\/j.artint.2007.02.004"},{"key":"ref156","doi-asserted-by":"publisher","DOI":"10.1109\/TVT.2007.907072"},{"key":"ref155","doi-asserted-by":"publisher","DOI":"10.32917\/hmj\/1206139508"},{"key":"ref150","doi-asserted-by":"publisher","DOI":"10.1016\/j.chaos.2016.12.012"},{"key":"ref152","doi-asserted-by":"publisher","DOI":"10.3233\/KES-2010-0206"},{"key":"ref151","doi-asserted-by":"publisher","DOI":"10.1073\/pnas.39.10.1953"},{"key":"ref146","first-page":"1","article-title":"Network selection for heterogeneous wireless networks based on multiple attribute decision making and evolutionary game theory","author":"sui","year":"2016","journal-title":"Proc 25th Wireless Opt Commun Conf (WOCC)"},{"key":"ref147","doi-asserted-by":"publisher","DOI":"10.1109\/MWC.2008.4599227"},{"key":"ref148","doi-asserted-by":"publisher","DOI":"10.1109\/ICT.2019.8798772"},{"key":"ref149","doi-asserted-by":"publisher","DOI":"10.1109\/TMC.2020.2965450"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.1201\/b11896"},{"key":"ref58","author":"han","year":"2012","journal-title":"Game Theory in Wireless and Communication Networks Theory Models and Applications"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.1007\/s10458-019-09421-1"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1109\/TCYB.2020.2977374"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1109\/MSP.2017.2743240"},{"key":"ref54","first-page":"426","article-title":"Deep reinforcement learning: An overview","volume":"2","author":"mousavi","year":"2016","journal-title":"Proc SAI Intell Syst Conf (IntelliSys)"},{"key":"ref53","first-page":"4193","article-title":"A unified game-theoretic approach to multiagent reinforcement learning","author":"lanctot","year":"2017","journal-title":"Proc Int Conf Neural Inf Process Syst (NIPS)"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-27645-3_14"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1109\/MWC.2016.1500356WC"},{"key":"ref167","doi-asserted-by":"publisher","DOI":"10.1162\/neco.1994.6.6.1185"},{"key":"ref166","first-page":"1038","article-title":"Generalization in reinforcement learning: Successful examples using sparse coarse coding","author":"sutton","year":"1995","journal-title":"Proc Int Conf Neural Inf Process Syst (NIPS)"},{"key":"ref165","article-title":"On-line Q-learning using connectionist systems","volume":"37","author":"rummery","year":"1994"},{"key":"ref164","doi-asserted-by":"publisher","DOI":"10.1007\/BF00992698"},{"key":"ref163","author":"puterman","year":"2014","journal-title":"Markov Decision Processes Discrete Stochastic Dynamic Programming"},{"key":"ref162","author":"howard","year":"1960","journal-title":"Dynamic Programming and Markov Processes"},{"key":"ref161","doi-asserted-by":"crossref","first-page":"34","DOI":"10.1126\/science.153.3731.34","article-title":"Dynamic programming","volume":"153","author":"bellman","year":"1966","journal-title":"Science"},{"key":"ref160","doi-asserted-by":"publisher","DOI":"10.1016\/j.geb.2008.02.011"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/MWC.2014.7000976"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/MWC.2003.1182111"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/SURV.2012.010912.00044"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/SURV.2012.010912.00081"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/COMST.2014.2369742"},{"key":"ref159","author":"fudenberg","year":"1992","journal-title":"Lectures on Learning and Equilibrium in Strategic-Form Games"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/SURV.2013.082713.00141"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1109\/TVT.2015.2394431"},{"key":"ref157","doi-asserted-by":"publisher","DOI":"10.1109\/LCOMM.2014.031414.132731"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/COMST.2016.2516538"},{"key":"ref158","doi-asserted-by":"publisher","DOI":"10.1109\/TPWRS.2012.2210288"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1109\/TWC.2015.2417155"},{"key":"ref45","author":"du","year":"2019","journal-title":"Towards User-Centric Intelligent Network Selection in 5G Heterogeneous Wireless Networks A Reinforcement Learning Perspective"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1109\/ACCESS.2018.2844882"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.1109\/TVT.2014.2316533"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1109\/SURV.2013.030713.00189"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1109\/COMST.2005.1593279"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1109\/TNET.2016.2587622"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1109\/INFCOM.2013.6566889"},{"key":"ref73","doi-asserted-by":"publisher","DOI":"10.1109\/MCOM.2018.1701177"},{"key":"ref72","doi-asserted-by":"publisher","DOI":"10.1109\/MCOM.2018.1700449"},{"key":"ref71","year":"2011","journal-title":"Access to the Evolved Packet Core (EPC) Via Non-3GPP Access Networks"},{"key":"ref70","doi-asserted-by":"publisher","DOI":"10.1109\/ICC.2012.6364783"},{"key":"ref76","doi-asserted-by":"publisher","DOI":"10.1109\/TNET.2006.882843"},{"key":"ref77","doi-asserted-by":"publisher","DOI":"10.1145\/3143361.3143370"},{"key":"ref74","year":"0","journal-title":"System Architecture for the 5G System"},{"key":"ref75","doi-asserted-by":"publisher","DOI":"10.17487\/rfc6824"},{"key":"ref78","doi-asserted-by":"publisher","DOI":"10.1177\/1550147720909759"},{"key":"ref79","year":"0","journal-title":"Study on access traffic steering switch and splitting support in the 5G System (5GS) architecture"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1017\/9781108277402"},{"key":"ref62","article-title":"Single and multi-agent deep reinforcement learning for AI-enabled wireless networks: A tutorial","author":"feriani","year":"2020","journal-title":"arXiv 2011 03615"},{"key":"ref61","doi-asserted-by":"publisher","DOI":"10.1109\/MSP.2009.933496"},{"key":"ref63","doi-asserted-by":"publisher","DOI":"10.1109\/COMST.2019.2916188"},{"key":"ref64","doi-asserted-by":"publisher","DOI":"10.1109\/ACCESS.2019.2937405"},{"key":"ref65","doi-asserted-by":"publisher","DOI":"10.1109\/MCOM.001.2000230"},{"key":"ref66","doi-asserted-by":"publisher","DOI":"10.1109\/WCNC.2015.7127696"},{"key":"ref67","year":"2009","journal-title":"E-UTRA Radio Resource Control (RRC) Protocol Specification (Release 9)"},{"key":"ref68","year":"0","journal-title":"Evolved Universal Terrestrial Radio Access Network (E-UTRAN) Self-configuring and Self-optimizing Network (SON) Use Cases and Solutions"},{"key":"ref69","year":"0","journal-title":"Evolved Universal Terrestrial Radio Access (E-UTRA) Mobility Enhancements in Heterogeneous Networks"},{"key":"ref197","article-title":"Prioritized experience replay","author":"schaul","year":"2015","journal-title":"arXiv 1511 05952"},{"key":"ref198","first-page":"2094","article-title":"Deep reinforcement learning with double Q-learning","author":"van hasselt","year":"2016","journal-title":"Proc AAAI Conf Artif Intell"},{"key":"ref199","first-page":"2613","article-title":"Double Q-learning","author":"hasselt","year":"2010","journal-title":"Proc Int Conf Neural Inf Process Syst (NIPS)"},{"key":"ref193","doi-asserted-by":"crossref","first-page":"529","DOI":"10.1038\/nature14236","article-title":"Human-level control through deep reinforcement learning","volume":"518","author":"mnih","year":"2015","journal-title":"Nature"},{"key":"ref194","doi-asserted-by":"publisher","DOI":"10.1038\/nature24270"},{"key":"ref195","doi-asserted-by":"publisher","DOI":"10.1109\/COMST.2019.2916583"},{"key":"ref196","doi-asserted-by":"publisher","DOI":"10.1038\/nature16961"},{"key":"ref95","doi-asserted-by":"publisher","DOI":"10.1109\/WCNC.2010.5506371"},{"key":"ref94","doi-asserted-by":"publisher","DOI":"10.1109\/VETECS.2010.5493875"},{"key":"ref190","doi-asserted-by":"publisher","DOI":"10.1109\/TVT.2018.2793186"},{"key":"ref93","doi-asserted-by":"publisher","DOI":"10.1109\/TWC.2017.2718526"},{"key":"ref191","author":"goodfellow","year":"2016","journal-title":"Deep Learning"},{"key":"ref92","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1109\/JIOT.2021.3139772","article-title":"Intelligent network selection algorithm for multi-service users in 5G heterogeneous network system: Nash Q-learning method","author":"ma","year":"2021","journal-title":"IEEE Internet of Things Journal"},{"key":"ref192","doi-asserted-by":"publisher","DOI":"10.1109\/COMST.2019.2904897"},{"key":"ref91","first-page":"3810","article-title":"Application of ELECTRE to network selection in a hetereogeneous wireless network environment","author":"bari","year":"2007","journal-title":"Proc IEEE Wireless Commun Netw Conf (WCNC)"},{"key":"ref90","first-page":"653","article-title":"Handover decision using fuzzy MADM in heterogeneous networks","author":"zhang","year":"2004","journal-title":"Proc IEEE Wireless Commun Netw Conf (WCNC)"},{"key":"ref98","doi-asserted-by":"publisher","DOI":"10.1109\/ICC.2014.6883553"},{"key":"ref99","doi-asserted-by":"publisher","DOI":"10.1109\/VTCSpring.2014.7022970"},{"key":"ref96","doi-asserted-by":"publisher","DOI":"10.1109\/TVT.2008.2004588"},{"key":"ref97","doi-asserted-by":"publisher","DOI":"10.1109\/JIOT.2018.2848295"},{"key":"ref82","doi-asserted-by":"publisher","DOI":"10.1007\/978-0-387-71787-6_2"},{"key":"ref81","doi-asserted-by":"crossref","first-page":"233","DOI":"10.1016\/S1388-3437(01)80125-6","article-title":"Performance analysis of bandwidth allocation schemes in multiservice IP networks using utility functions","volume":"4","author":"rakocevic","year":"2001","journal-title":"Teletraffic Science and Engineering"},{"key":"ref84","doi-asserted-by":"publisher","DOI":"10.1109\/MWC.2004.1308935"},{"key":"ref83","doi-asserted-by":"publisher","DOI":"10.1109\/NOMS.2008.4575128"},{"key":"ref80","doi-asserted-by":"publisher","DOI":"10.21236\/AD0708563"},{"key":"ref89","doi-asserted-by":"publisher","DOI":"10.1109\/CCNC.2007.164"},{"key":"ref85","doi-asserted-by":"publisher","DOI":"10.1109\/ICC.2006.254986"},{"key":"ref86","doi-asserted-by":"publisher","DOI":"10.1109\/MNET.2007.314536"},{"key":"ref87","doi-asserted-by":"publisher","DOI":"10.1109\/MWC.2005.1452853"},{"key":"ref88","doi-asserted-by":"publisher","DOI":"10.1109\/VETECS.2006.1682964"},{"key":"ref200","first-page":"1995","article-title":"Dueling network architectures for deep reinforcement learning","volume":"48","author":"wang","year":"2016","journal-title":"Proc Int Conf Mach Learn (ICML)"},{"key":"ref101","doi-asserted-by":"publisher","DOI":"10.1109\/JSAC.2016.2612038"},{"key":"ref100","doi-asserted-by":"publisher","DOI":"10.1109\/GLOCOMW.2012.6477582"},{"key":"ref209","doi-asserted-by":"publisher","DOI":"10.1109\/IROS.2007.4399095"},{"key":"ref203","doi-asserted-by":"publisher","DOI":"10.1587\/transcom.2017CQP0014"},{"key":"ref204","doi-asserted-by":"publisher","DOI":"10.1109\/GLOCOM.2018.8647611"},{"key":"ref201","first-page":"1928","article-title":"Asynchronous methods for deep reinforcement learning","volume":"48","author":"mnih","year":"2016","journal-title":"Proc Int Conf Mach Learn (ICML)"},{"key":"ref202","doi-asserted-by":"publisher","DOI":"10.1109\/WCNC.2017.7925950"},{"key":"ref207","doi-asserted-by":"publisher","DOI":"10.1109\/TWC.2020.3003719"},{"key":"ref208","first-page":"29","article-title":"Deep recurrent Q-learning for partially observable MDPs","author":"hausknecht","year":"2015","journal-title":"Proc AAAI Fall Symp Sequential Decision Making Intell Agents (AAAI-SDMIA)"},{"key":"ref205","doi-asserted-by":"publisher","DOI":"10.1109\/GLOCOM.2017.8254853"},{"key":"ref206","doi-asserted-by":"publisher","DOI":"10.1109\/TWC.2019.2933417"},{"key":"ref211","doi-asserted-by":"publisher","DOI":"10.1109\/TWC.2020.2984758"},{"key":"ref210","doi-asserted-by":"publisher","DOI":"10.1109\/TVT.2018.2882635"},{"key":"ref212","doi-asserted-by":"publisher","DOI":"10.1109\/MWC.2016.7498076"},{"key":"ref213","doi-asserted-by":"publisher","DOI":"10.1109\/TMC.2017.2762668"},{"key":"ref214","doi-asserted-by":"publisher","DOI":"10.3390\/a11020013"},{"key":"ref215","article-title":"Periodic bandits and wireless network selection","author":"oh","year":"2019","journal-title":"Proc Int Colloq Automata Lang Program (ICALP)"},{"key":"ref216","doi-asserted-by":"publisher","DOI":"10.1109\/ETFA.2019.8869285"},{"key":"ref217","doi-asserted-by":"publisher","DOI":"10.1287\/stsy.2019.0033"},{"key":"ref218","doi-asserted-by":"publisher","DOI":"10.1111\/j.2517-6161.1979.tb01068.x"},{"key":"ref219","doi-asserted-by":"publisher","DOI":"10.1002\/9781118596333.ch24"},{"key":"ref220","doi-asserted-by":"publisher","DOI":"10.2307\/3214163"},{"key":"ref222","doi-asserted-by":"publisher","DOI":"10.1109\/5GWF.2019.8911617"},{"key":"ref221","doi-asserted-by":"publisher","DOI":"10.1109\/TIT.2012.2230215"},{"key":"ref229","first-page":"830","article-title":"Continuous time associative bandit problems","author":"gy\u00f6rgy","year":"2007","journal-title":"Proc Int Joint Conf Artif Intell (IJCAI)"},{"key":"ref228","author":"gummadi","year":"2013","journal-title":"Mean field analysis of multi-armed bandit games"},{"key":"ref227","doi-asserted-by":"publisher","DOI":"10.1109\/Allerton.2012.6483342"},{"key":"ref226","doi-asserted-by":"publisher","DOI":"10.1109\/TAC.2007.904450"},{"key":"ref225","doi-asserted-by":"publisher","DOI":"10.1109\/ALLERTON.2010.5707118"},{"key":"ref224","doi-asserted-by":"publisher","DOI":"10.1023\/A:1013689704352"},{"key":"ref223","doi-asserted-by":"publisher","DOI":"10.1016\/0196-8858(85)90002-8"},{"key":"ref127","doi-asserted-by":"publisher","DOI":"10.1007\/BF01770224"},{"key":"ref126","doi-asserted-by":"publisher","DOI":"10.1287\/mnsc.14.3.159"},{"key":"ref125","doi-asserted-by":"publisher","DOI":"10.1109\/TWC.2013.090513.122033"},{"key":"ref124","doi-asserted-by":"publisher","DOI":"10.1109\/JIOT.2019.2931448"},{"key":"ref129","doi-asserted-by":"publisher","DOI":"10.2307\/1911154"},{"key":"ref128","doi-asserted-by":"publisher","DOI":"10.1007\/978-0-387-30440-3_29"},{"key":"ref130","doi-asserted-by":"publisher","DOI":"10.1016\/0022-0531(83)90076-5"},{"key":"ref133","doi-asserted-by":"publisher","DOI":"10.1109\/TVT.2019.2937941"},{"key":"ref134","doi-asserted-by":"publisher","DOI":"10.1007\/BF01737559"},{"key":"ref131","doi-asserted-by":"publisher","DOI":"10.1109\/ICC.2015.7248848"},{"key":"ref132","doi-asserted-by":"publisher","DOI":"10.1109\/ICC.2015.7249349"},{"key":"ref232","doi-asserted-by":"publisher","DOI":"10.1007\/s10994-010-5178-7"},{"key":"ref233","doi-asserted-by":"publisher","DOI":"10.1145\/1772690.1772758"},{"key":"ref230","doi-asserted-by":"publisher","DOI":"10.1007\/11564096_42"},{"key":"ref231","doi-asserted-by":"publisher","DOI":"10.1137\/S0097539701398375"},{"key":"ref239","doi-asserted-by":"publisher","DOI":"10.1109\/TIT.2014.2302471"},{"key":"ref238","first-page":"321","article-title":"Performance and convergence of multi-user online learning","author":"tekin","year":"2011","journal-title":"Proc Int Conf Game Theory Netw (GameNets)"},{"key":"ref235","doi-asserted-by":"publisher","DOI":"10.1109\/JSAC.2012.120118"},{"key":"ref234","doi-asserted-by":"publisher","DOI":"10.2307\/2347628"},{"key":"ref237","article-title":"Cooperation speeds surfing: Use co-bandit!","author":"meetoo appavoo","year":"2019","journal-title":"arXiv 1901 07768"},{"key":"ref236","doi-asserted-by":"publisher","DOI":"10.1109\/iccsp.2013.6577074"},{"key":"ref136","doi-asserted-by":"publisher","DOI":"10.3390\/s150924230"},{"key":"ref135","doi-asserted-by":"publisher","DOI":"10.1006\/game.1996.0044"},{"key":"ref138","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-14165-2_8"},{"key":"ref137","doi-asserted-by":"publisher","DOI":"10.1016\/j.tcs.2008.12.035"},{"key":"ref139","doi-asserted-by":"publisher","DOI":"10.1017\/CBO9780511806292"},{"key":"ref140","doi-asserted-by":"publisher","DOI":"10.1038\/246015a0"},{"key":"ref141","doi-asserted-by":"publisher","DOI":"10.1007\/s10458-005-3783-9"},{"key":"ref142","doi-asserted-by":"publisher","DOI":"10.1016\/0025-5564(78)90077-9"},{"key":"ref143","doi-asserted-by":"publisher","DOI":"10.1080\/00207179208934253"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/COMST.2016.2532458"},{"key":"ref144","volume":"112","author":"kuznetsov","year":"2013","journal-title":"Elements of Applied Bifurcation Theory"},{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/MCOM.2014.6736748"},{"key":"ref145","doi-asserted-by":"publisher","DOI":"10.1109\/ICISCE.2015.170"},{"key":"ref241","first-page":"7222","article-title":"Distributed multi-player bandits&#x2014;A game of thrones approach","volume":"31","author":"bistritz","year":"2018","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref242","first-page":"12071","article-title":"SIC&#x2014;MMAB: Synchronisation involves communication in multiplayer multi-armed bandits","author":"boursier","year":"2019","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref243","doi-asserted-by":"publisher","DOI":"10.1111\/1468-0262.00153"},{"key":"ref244","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-662-04623-4_12"},{"key":"ref240","first-page":"56","article-title":"Multi-player bandits revisited","author":"besson","year":"2018","journal-title":"Algorithmic Learning Theory"},{"key":"ref248","doi-asserted-by":"publisher","DOI":"10.1007\/3-540-49116-3_38"},{"key":"ref247","doi-asserted-by":"publisher","DOI":"10.1109\/GAMENETS.2009.5137395"},{"key":"ref246","doi-asserted-by":"publisher","DOI":"10.1037\/14496-000"},{"key":"ref245","doi-asserted-by":"publisher","DOI":"10.1109\/21.293490"},{"key":"ref249","doi-asserted-by":"publisher","DOI":"10.1137\/070680096"},{"key":"ref109","doi-asserted-by":"publisher","DOI":"10.1109\/ICACT.2014.6779115"},{"key":"ref108","doi-asserted-by":"publisher","DOI":"10.1109\/LWC.2015.2495123"},{"key":"ref107","doi-asserted-by":"publisher","DOI":"10.1109\/LCOMM.2013.102113.131876"},{"key":"ref106","doi-asserted-by":"publisher","DOI":"10.1002\/ett.4460080106"},{"key":"ref105","doi-asserted-by":"publisher","DOI":"10.1109\/TWC.2011.032411.100461"},{"key":"ref104","doi-asserted-by":"publisher","DOI":"10.1109\/49.840210"},{"key":"ref103","doi-asserted-by":"publisher","DOI":"10.1109\/ICCChina.2014.7008348"},{"key":"ref102","doi-asserted-by":"publisher","DOI":"10.1109\/TMC.2012.207"},{"key":"ref111","doi-asserted-by":"publisher","DOI":"10.1109\/TWC.2017.2647946"},{"key":"ref112","doi-asserted-by":"publisher","DOI":"10.4108\/ICST.VALUETOOLS2008.4341"},{"key":"ref110","doi-asserted-by":"publisher","DOI":"10.1109\/ACCESS.2017.2676166"},{"key":"ref250","article-title":"A quantitative measure of fairness and discrimination for resource allocation in shared computer systems","author":"jain","year":"1984"},{"key":"ref251","doi-asserted-by":"publisher","DOI":"10.1145\/3298981"},{"key":"ref254","article-title":"Deep Q-learning for Nash equilibria: Nash-DQN","author":"casgrain","year":"2019","journal-title":"arXiv 1904 10554"},{"key":"ref255","article-title":"Actor-critic provably finds Nash equilibria of linear-quadratic mean-field games","author":"fu","year":"2019","journal-title":"arXiv 1910 07498"},{"key":"ref252","doi-asserted-by":"publisher","DOI":"10.1109\/COMST.2020.2986024"},{"key":"ref253","doi-asserted-by":"publisher","DOI":"10.1109\/ICCW.2018.8403664"},{"key":"ref257","first-page":"387","article-title":"Deterministic policy gradient algorithms","volume":"32","author":"silver","year":"2014","journal-title":"Proc Int Conf Mach Learn (ICML)"},{"key":"ref256","first-page":"6379","article-title":"Multi-agent actor-critic for mixed cooperative-competitive environments","author":"lowe","year":"2017","journal-title":"Proc Int Conf Neural Inf Process Syst (NIPS)"},{"key":"ref259","doi-asserted-by":"publisher","DOI":"10.1109\/MCOM.2019.1900271"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/ACCESS.2016.2624755"},{"key":"ref258","doi-asserted-by":"publisher","DOI":"10.1109\/MNET.001.1900287"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/TVT.2016.2597442"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/MVT.2011.2179343"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/MCOM.2013.6525592"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1007\/s11265-015-1061-x"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/MWC.2017.1700090"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1109\/ACCESS.2018.2875469"},{"key":"ref118","doi-asserted-by":"publisher","DOI":"10.1109\/TMC.2012.196"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/MCOM.2017.7901470"},{"key":"ref117","doi-asserted-by":"publisher","DOI":"10.1142\/IISLNS"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/TWC.2013.040413.120676"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/TWC.2013.013013.120940"},{"key":"ref119","doi-asserted-by":"publisher","DOI":"10.1109\/WiMOB.2013.6673415"},{"key":"ref114","doi-asserted-by":"publisher","DOI":"10.2307\/1969529"},{"key":"ref113","volume":"556","author":"branzei","year":"2008","journal-title":"Models in Cooperative Game Theory"},{"key":"ref116","doi-asserted-by":"publisher","DOI":"10.1109\/MSP.2016.2598848"},{"key":"ref115","doi-asserted-by":"publisher","DOI":"10.1109\/MCOM.2015.7105641"},{"key":"ref120","doi-asserted-by":"publisher","DOI":"10.1109\/INFOCOM.2014.6848040"},{"key":"ref121","doi-asserted-by":"publisher","DOI":"10.1109\/TCOMM.2014.2339313"},{"key":"ref122","doi-asserted-by":"publisher","DOI":"10.1109\/TWC.2015.2403363"},{"key":"ref123","doi-asserted-by":"publisher","DOI":"10.1109\/TWC.2015.2407355"},{"key":"ref260","doi-asserted-by":"publisher","DOI":"10.1109\/MCOM.2017.1600568CM"},{"key":"ref261","doi-asserted-by":"publisher","DOI":"10.1109\/MITS.2019.2919563"},{"key":"ref262","doi-asserted-by":"publisher","DOI":"10.1109\/VTC2020-Spring48590.2020.9129074"},{"key":"ref263","doi-asserted-by":"publisher","DOI":"10.1109\/ACCESS.2020.3001277"},{"key":"ref264","doi-asserted-by":"publisher","DOI":"10.1109\/COMST.2018.2863030"},{"key":"ref265","doi-asserted-by":"publisher","DOI":"10.1109\/MCOM.2014.6957143"},{"key":"ref266","doi-asserted-by":"publisher","DOI":"10.1109\/MWC.2015.7143339"}],"container-title":["IEEE Access"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/6287639\/9312710\/09448025.pdf?arnumber=9448025","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,1,14]],"date-time":"2025-01-14T20:02:30Z","timestamp":1736884950000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/9448025\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2021]]},"references-count":273,"URL":"https:\/\/doi.org\/10.1109\/access.2021.3087410","relation":{},"ISSN":["2169-3536"],"issn-type":[{"value":"2169-3536","type":"electronic"}],"subject":[],"published":{"date-parts":[[2021]]}}}