{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,30]],"date-time":"2026-06-30T03:51:34Z","timestamp":1782791494906,"version":"3.54.5"},"reference-count":208,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"3","license":[{"start":{"date-parts":[[2016,1,1]],"date-time":"2016-01-01T00:00:00Z","timestamp":1451606400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2016,1,1]],"date-time":"2016-01-01T00:00:00Z","timestamp":1451606400000},"content-version":"am","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2016,1,1]],"date-time":"2016-01-01T00:00:00Z","timestamp":1451606400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2016,1,1]],"date-time":"2016-01-01T00:00:00Z","timestamp":1451606400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/100000001","name":"National Science Foundation","doi-asserted-by":"publisher","award":["CCF-1331788"],"award-info":[{"award-number":["CCF-1331788"]}],"id":[{"id":"10.13039\/100000001","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100000001","name":"National Science Foundation","doi-asserted-by":"publisher","award":["ECCS-1547201"],"award-info":[{"award-number":["ECCS-1547201"]}],"id":[{"id":"10.13039\/100000001","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100000001","name":"National Science Foundation","doi-asserted-by":"publisher","award":["CCF-1456921"],"award-info":[{"award-number":["CCF-1456921"]}],"id":[{"id":"10.13039\/100000001","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100000001","name":"National Science Foundation","doi-asserted-by":"publisher","award":["CNS-1443917"],"award-info":[{"award-number":["CNS-1443917"]}],"id":[{"id":"10.13039\/100000001","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100000001","name":"National Science Foundation","doi-asserted-by":"publisher","award":["ECCS-1405121"],"award-info":[{"award-number":["ECCS-1405121"]}],"id":[{"id":"10.13039\/100000001","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100000001","name":"National Science Foundation","doi-asserted-by":"publisher","award":["NSFC61428101"],"award-info":[{"award-number":["NSFC61428101"]}],"id":[{"id":"10.13039\/100000001","id-type":"DOI","asserted-by":"publisher"}]},{"name":"Korean government","award":["2014R1A5A1011478"],"award-info":[{"award-number":["2014R1A5A1011478"]}]},{"name":"Singapore MOE Tier 1","award":["RG18\/13"],"award-info":[{"award-number":["RG18\/13"]}]},{"name":"Singapore MOE Tier 1","award":["RG33\/12"],"award-info":[{"award-number":["RG33\/12"]}]},{"name":"MOE Tier 2","award":["MOE2014-T2-2-015 ARC 4\/15"],"award-info":[{"award-number":["MOE2014-T2-2-015 ARC 4\/15"]}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Commun. Surv. Tutorials"],"published-print":{"date-parts":[[2016]]},"DOI":"10.1109\/comst.2016.2539923","type":"journal-article","created":{"date-parts":[[2016,3,9]],"date-time":"2016-03-09T19:45:57Z","timestamp":1457552757000},"page":"1717-1757","source":"Crossref","is-referenced-by-count":76,"title":["A Survey on Applications of Model-Free Strategy Learning in Cognitive Wireless Networks"],"prefix":"10.1109","volume":"18","author":[{"given":"Wenbo","family":"Wang","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Andres","family":"Kwasinski","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Dusit","family":"Niyato","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zhu","family":"Han","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref170","doi-asserted-by":"publisher","DOI":"10.1109\/TCOMM.2009.02.070158"},{"key":"ref172","article-title":"An analysis of stochastic game theory for multiagent reinforcement learning","author":"bowling","year":"2000"},{"key":"ref171","doi-asserted-by":"publisher","DOI":"10.1109\/TVT.2014.2311496"},{"key":"ref174","doi-asserted-by":"publisher","DOI":"10.1109\/JSAC.2011.110418"},{"key":"ref173","doi-asserted-by":"publisher","DOI":"10.1109\/GLOCOM.2007.66"},{"key":"ref176","doi-asserted-by":"publisher","DOI":"10.1109\/MNET.2013.6523804"},{"key":"ref175","doi-asserted-by":"publisher","DOI":"10.1109\/CNS.2013.6682689"},{"key":"ref178","doi-asserted-by":"publisher","DOI":"10.1109\/TNET.2012.2190419"},{"key":"ref177","doi-asserted-by":"publisher","DOI":"10.1109\/WCNC.2013.6554865"},{"key":"ref168","doi-asserted-by":"publisher","DOI":"10.1186\/1687-1499-2012-233"},{"key":"ref169","doi-asserted-by":"publisher","DOI":"10.1007\/s001820300162"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1109\/ISSNIP.2007.4496871"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1016\/j.jnca.2011.08.007"},{"key":"ref33","author":"fudenberg","year":"1998","journal-title":"The Theory of Learning in Games"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/TVT.2010.2043968"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1017\/CBO9780511778773"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1109\/CC.2014.6827574"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1201\/b11896"},{"key":"ref36","author":"lasaulce","year":"2011","journal-title":"Game Theory and Learning for Wireless Networks Fundamentals and Applications"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1109\/TSMCB.2002.1049606"},{"key":"ref34","first-page":"183","article-title":"Multi-agent reinforcement learning: An overview","author":"bu?oniu","year":"2010","journal-title":"Innovations in Multi-Agent Systems and Applications - 1"},{"key":"ref181","doi-asserted-by":"publisher","DOI":"10.1109\/WCNC.2013.6554824"},{"key":"ref180","doi-asserted-by":"publisher","DOI":"10.4304\/jcm.4.10.790-802"},{"key":"ref185","first-page":"140","article-title":"Computing equilibria in multiplayer stochastic games of imperfect information","author":"ganzfried","year":"0","journal-title":"Proc 21st Int Joint Conf Artif Intell"},{"key":"ref184","doi-asserted-by":"publisher","DOI":"10.1109\/TWC.2014.2314121"},{"key":"ref183","doi-asserted-by":"publisher","DOI":"10.1109\/TMC.2012.178"},{"key":"ref182","doi-asserted-by":"publisher","DOI":"10.1109\/JSAC.2010.100508"},{"key":"ref189","doi-asserted-by":"publisher","DOI":"10.1109\/TSP.2010.2046894"},{"key":"ref188","doi-asserted-by":"publisher","DOI":"10.1109\/TCOMM.2010.01.080157"},{"key":"ref187","doi-asserted-by":"publisher","DOI":"10.1109\/JSAC.2012.121115"},{"key":"ref186","doi-asserted-by":"publisher","DOI":"10.1016\/j.aeue.2013.04.002"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1016\/j.comnet.2006.05.001"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/SURV.2012.111412.00160"},{"key":"ref179","doi-asserted-by":"publisher","DOI":"10.1109\/JSAC.2015.2393496"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1007\/s11277-012-0674-7"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/SURV.2012.062612.00056"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/TMC.2005.19"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/TWC.2014.2318719"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1109\/ICC.2015.7248799"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2010.2099648"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1109\/TSMCC.2007.913919"},{"key":"ref25","doi-asserted-by":"crossref","first-page":"237","DOI":"10.1613\/jair.301","article-title":"Reinforcement learning: A survey","volume":"4","author":"kaelbling","year":"1996","journal-title":"J Artif Intell Res"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1109\/TSMCB.2008.920231"},{"key":"ref51","author":"sutton","year":"1998","journal-title":"Reinforcement Learning An Introduction"},{"key":"ref154","doi-asserted-by":"publisher","DOI":"10.1109\/TSP.2014.2347261"},{"key":"ref153","doi-asserted-by":"publisher","DOI":"10.1109\/TWC.2012.020812.110025"},{"key":"ref156","doi-asserted-by":"publisher","DOI":"10.1109\/ICC.2010.5502112"},{"key":"ref155","doi-asserted-by":"publisher","DOI":"10.1109\/TVT.2014.2366559"},{"key":"ref150","doi-asserted-by":"publisher","DOI":"10.1109\/JCN.2015.000071"},{"key":"ref152","doi-asserted-by":"publisher","DOI":"10.1109\/21.293490"},{"key":"ref151","doi-asserted-by":"publisher","DOI":"10.1016\/j.comcom.2009.11.019"},{"key":"ref146","doi-asserted-by":"publisher","DOI":"10.1109\/CDC.2004.1430262"},{"key":"ref147","doi-asserted-by":"publisher","DOI":"10.1109\/JSAC.2008.080909"},{"key":"ref148","doi-asserted-by":"publisher","DOI":"10.1016\/j.peva.2004.03.004"},{"key":"ref149","doi-asserted-by":"publisher","DOI":"10.1109\/TWC.2007.051043"},{"key":"ref59","first-page":"535","article-title":"An algorithm for distributed reinforcement learning in cooperative multi-agent systems","author":"lauer","year":"0","journal-title":"Proc 17th Int Conf Mach Learn"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.1016\/S1389-0417(01)00015-8"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.1017\/S0269888912000057"},{"key":"ref56","first-page":"746","article-title":"The dynamics of reinforcement learning in cooperative multiagent systems","author":"claus","year":"0","journal-title":"Proc 15th Nat Conf Artif Intell \/10th Innovative Appl Artif Intell Conf"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1080\/095281398146798"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1109\/3477.979961"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.1007\/s10458-005-2631-2"},{"key":"ref52","first-page":"487","article-title":"Multi-agent reinforcement learning: Independent vs. cooperative agents","author":"tan","year":"1998","journal-title":"Readings in Agents"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1109\/COMST.2014.2320099"},{"key":"ref167","doi-asserted-by":"publisher","DOI":"10.1109\/MASS.2011.143"},{"key":"ref166","doi-asserted-by":"publisher","DOI":"10.1109\/INFCOM.2010.5462143"},{"key":"ref165","doi-asserted-by":"publisher","DOI":"10.1109\/WCNC.2007.8"},{"key":"ref164","doi-asserted-by":"publisher","DOI":"10.1109\/ICC.2010.5502580"},{"key":"ref163","doi-asserted-by":"publisher","DOI":"10.1017\/CBO9780511800481"},{"key":"ref162","doi-asserted-by":"publisher","DOI":"10.1007\/s11036-006-0049-y"},{"key":"ref161","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-540-45167-9_2"},{"key":"ref160","author":"poznyak","year":"1997","journal-title":"Learning Automata and Stochastic Optimization"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1017\/CBO9780511818363"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/JSTSP.2010.2093210"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/SURV.2012.100412.00017"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/MCOM.2008.4481339"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1016\/j.phycom.2010.12.003"},{"key":"ref159","doi-asserted-by":"publisher","DOI":"10.1109\/JSAC.2012.120106"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1109\/TSMCC.2012.2218595"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/SURV.2009.090109"},{"key":"ref157","doi-asserted-by":"publisher","DOI":"10.1109\/TNET.2007.911424"},{"key":"ref9","first-page":"2:2","article-title":"A review on spectrum sensing for cognitive radio: Challenges and solutions","author":"zeng","year":"2010","journal-title":"EURASIP J Adv Signal Process"},{"key":"ref158","doi-asserted-by":"publisher","DOI":"10.1109\/TMC.2009.111"},{"key":"ref46","author":"narendra","year":"1989","journal-title":"Learning Automata An Introduction"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1007\/BF00114727"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1016\/S0378-7796(02)00088-3"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.1109\/TAC.1986.1104342"},{"key":"ref42","article-title":"Learning from delayed rewards","author":"watkins","year":"1989"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1109\/TAC.1982.1102893"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1007\/BF00992698"},{"key":"ref43","author":"ibe","year":"2008","journal-title":"Markov Processes for Stochastic Modeling"},{"key":"ref73","doi-asserted-by":"crossref","first-page":"1231","DOI":"10.1214\/aoap\/1069786497","article-title":"Convergent multiple-timescales reinforcement learning algorithms in normal form games","volume":"13","author":"leslie","year":"2003","journal-title":"Ann Appl Probab"},{"key":"ref72","doi-asserted-by":"publisher","DOI":"10.1111\/1468-0262.00153"},{"key":"ref71","doi-asserted-by":"publisher","DOI":"10.1109\/TAC.2005.843878"},{"key":"ref70","doi-asserted-by":"publisher","DOI":"10.1109\/TSMCB.2002.1049610"},{"key":"ref76","doi-asserted-by":"publisher","DOI":"10.1111\/j.1468-0262.2002.00440.x"},{"key":"ref77","doi-asserted-by":"publisher","DOI":"10.1109\/TSMCB.2009.2017273"},{"key":"ref74","doi-asserted-by":"publisher","DOI":"10.1016\/j.jebo.2004.02.007"},{"key":"ref75","doi-asserted-by":"publisher","DOI":"10.1023\/A:1007514623589"},{"key":"ref78","first-page":"226","article-title":"On no-regret learning, fictitious play, and nash equilibrium","author":"jafari","year":"0","journal-title":"Proc 18th Int Conf Mach Learn"},{"key":"ref79","doi-asserted-by":"publisher","DOI":"10.1109\/TSMCB.2008.920998"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1016\/S0004-3702(02)00121-2"},{"key":"ref62","author":"mackenzie","year":"2006","journal-title":"Game Theory for Wireless Engineers"},{"key":"ref61","doi-asserted-by":"crossref","first-page":"569","DOI":"10.1613\/jair.898","article-title":"Accelerating reinforcement learning through implicit imitation","volume":"19","author":"price","year":"2003","journal-title":"J Artif Intell Res"},{"key":"ref63","doi-asserted-by":"publisher","DOI":"10.1016\/S1574-0005(02)03011-4"},{"key":"ref64","doi-asserted-by":"publisher","DOI":"10.1016\/B978-1-55860-335-6.50027-1"},{"key":"ref65","first-page":"506","article-title":"Best-response multiagent learning in non-stationary environments","author":"weinberg","year":"0","journal-title":"Proc 3rd Int Joint Conf Auton Agents Multiagent Syst"},{"key":"ref66","first-page":"1039","article-title":"Nash q-learning for general-sum stochastic games","volume":"4","author":"hu","year":"2003","journal-title":"J Mach Learn Res"},{"key":"ref67","article-title":"A reinforcement learning (Nash-R) algorithm for average reward irreducible stochastic games","author":"li","year":"2007","journal-title":"J Mach Learn Res"},{"key":"ref68","first-page":"242","article-title":"Correlated q-learning","author":"greenwald","year":"0","journal-title":"Proc 20th Int Conf Mach Learn"},{"key":"ref69","doi-asserted-by":"publisher","DOI":"10.1137\/0317054"},{"key":"ref197","doi-asserted-by":"publisher","DOI":"10.1109\/ICC.2013.6654861"},{"key":"ref198","doi-asserted-by":"publisher","DOI":"10.1109\/TWC.2013.100113.121828"},{"key":"ref199","doi-asserted-by":"publisher","DOI":"10.1109\/TWC.2013.112613.130405"},{"key":"ref193","first-page":"4057","article-title":"Distributed strategic learning with application to network security","author":"zhu","year":"0","journal-title":"Proc Amer Control Conf (ACC11)"},{"key":"ref194","doi-asserted-by":"publisher","DOI":"10.1016\/j.artint.2006.02.006"},{"key":"ref195","doi-asserted-by":"publisher","DOI":"10.1109\/JSTSP.2011.2176916"},{"key":"ref196","doi-asserted-by":"publisher","DOI":"10.1109\/TVT.2011.2158596"},{"key":"ref95","doi-asserted-by":"publisher","DOI":"10.1109\/Allerton.2011.6120364"},{"key":"ref190","volume":"65","author":"spall","year":"2005","journal-title":"Introduction to Stochastic Search and Optimization Estimation Simulation and Control"},{"key":"ref94","doi-asserted-by":"publisher","DOI":"10.1007\/s11036-005-4464-2"},{"key":"ref191","doi-asserted-by":"publisher","DOI":"10.1002\/9781118453988.ch14"},{"key":"ref93","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2009.2035228"},{"key":"ref192","article-title":"On the convergence of a Nash seeking algorithm with stochastic state dependent payoff","author":"hanif","year":"2012"},{"key":"ref92","doi-asserted-by":"publisher","DOI":"10.1109\/INFCOM.2004.1354562"},{"key":"ref91","doi-asserted-by":"publisher","DOI":"10.1109\/TCOMM.2008.060106"},{"key":"ref90","doi-asserted-by":"publisher","DOI":"10.1109\/TSP.2007.907867"},{"key":"ref98","doi-asserted-by":"publisher","DOI":"10.1007\/s11276-011-0335-x"},{"key":"ref99","doi-asserted-by":"publisher","DOI":"10.1109\/TVT.2007.907023"},{"key":"ref96","doi-asserted-by":"publisher","DOI":"10.1109\/TW.2013.081913.121525"},{"key":"ref97","doi-asserted-by":"publisher","DOI":"10.1109\/GLOCOM.2010.5683502"},{"key":"ref82","doi-asserted-by":"publisher","DOI":"10.1109\/72.809089"},{"key":"ref81","doi-asserted-by":"publisher","DOI":"10.1109\/25.790549"},{"key":"ref84","first-page":"531","article-title":"Towards a unified theory of state abstraction for MDPS","author":"li","year":"0","journal-title":"Proc Int Symp Artif Intell Math"},{"key":"ref83","doi-asserted-by":"publisher","DOI":"10.1109\/TVT.2003.822330"},{"key":"ref80","first-page":"671","article-title":"Packet routing in dynamically changing networks: A reinforcement learning approach","volume":"6","author":"boyan","year":"1994","journal-title":"Advances in neural information processing systems"},{"key":"ref89","doi-asserted-by":"publisher","DOI":"10.1109\/TSP.2010.2046040"},{"key":"ref85","doi-asserted-by":"publisher","DOI":"10.1109\/WCNC.2004.1311428"},{"key":"ref86","doi-asserted-by":"publisher","DOI":"10.1109\/ICC.2005.1494473"},{"key":"ref87","doi-asserted-by":"publisher","DOI":"10.1109\/JPROC.2009.2013036"},{"key":"ref88","doi-asserted-by":"crossref","first-page":"1904","DOI":"10.1109\/TVT.2008.2002917","article-title":"Learning to compete for resources in wireless stochastic games","volume":"58","author":"fu","year":"2009","journal-title":"IEEE Trans Veh Technol"},{"key":"ref200","doi-asserted-by":"publisher","DOI":"10.1006\/jeth.2002.2927"},{"key":"ref101","doi-asserted-by":"publisher","DOI":"10.3166\/ejc.17.89-103"},{"key":"ref100","volume":"7","author":"altman","year":"1999","journal-title":"Constrained Markov Decision Processes"},{"key":"ref203","doi-asserted-by":"publisher","DOI":"10.1007\/s00199-006-0192-5"},{"key":"ref204","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-01882-4"},{"key":"ref201","doi-asserted-by":"publisher","DOI":"10.1109\/VTCFall.2013.6692444"},{"key":"ref202","doi-asserted-by":"publisher","DOI":"10.1109\/TWC.2014.022014.130840"},{"key":"ref207","doi-asserted-by":"publisher","DOI":"10.1023\/A:1022140919877"},{"key":"ref208","doi-asserted-by":"publisher","DOI":"10.1007\/s10458-006-7035-4"},{"key":"ref205","doi-asserted-by":"publisher","DOI":"10.1109\/MWC.2015.7143333"},{"key":"ref206","doi-asserted-by":"publisher","DOI":"10.1109\/PIMRC.2013.6666642"},{"key":"ref127","doi-asserted-by":"publisher","DOI":"10.1214\/aoms\/1177729586"},{"key":"ref126","doi-asserted-by":"publisher","DOI":"10.1155\/2010\/876216"},{"key":"ref125","doi-asserted-by":"publisher","DOI":"10.1109\/TMC.2012.67"},{"key":"ref124","doi-asserted-by":"publisher","DOI":"10.1109\/ICCW.2008.98"},{"key":"ref129","doi-asserted-by":"publisher","DOI":"10.1109\/TVT.2010.2059055"},{"key":"ref128","doi-asserted-by":"publisher","DOI":"10.1109\/ISSNIP.2007.4496881"},{"key":"ref130","doi-asserted-by":"publisher","DOI":"10.1145\/2093256.2093311"},{"key":"ref133","doi-asserted-by":"publisher","DOI":"10.1016\/j.comcom.2010.07.025"},{"key":"ref134","doi-asserted-by":"publisher","DOI":"10.1109\/GLOCOM.2010.5683552"},{"key":"ref131","doi-asserted-by":"publisher","DOI":"10.1109\/MWC.2010.5547921"},{"key":"ref132","doi-asserted-by":"publisher","DOI":"10.4108\/ICST.CROWNCOM2010.9173"},{"key":"ref136","doi-asserted-by":"publisher","DOI":"10.1109\/26.983324"},{"key":"ref135","doi-asserted-by":"publisher","DOI":"10.1109\/IDAACS.2013.6662729"},{"key":"ref138","first-page":"1633","article-title":"Transfer learning for reinforcement learning domains: A survey","volume":"10","author":"taylor","year":"2009","journal-title":"J Mach Learn Res"},{"key":"ref137","doi-asserted-by":"publisher","DOI":"10.1109\/WCNCW.2012.6215470"},{"key":"ref139","doi-asserted-by":"publisher","DOI":"10.1111\/1468-0262.00054"},{"key":"ref140","doi-asserted-by":"publisher","DOI":"10.1109\/TVT.2008.925308"},{"key":"ref141","doi-asserted-by":"publisher","DOI":"10.1109\/MILCOM.2011.6127463"},{"key":"ref142","doi-asserted-by":"publisher","DOI":"10.1109\/INFCOM.2010.5462017"},{"key":"ref143","doi-asserted-by":"publisher","DOI":"10.1109\/GLOCOM.2009.5426293"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/JSAC.2004.839380"},{"key":"ref144","doi-asserted-by":"publisher","DOI":"10.1109\/JSAC.2012.120118"},{"key":"ref1","article-title":"Cognitive radio&#x2014;An integrated agent architecture for software defined radio","author":"mitola","year":"2000"},{"key":"ref145","doi-asserted-by":"publisher","DOI":"10.1109\/JSAC.2007.070805"},{"key":"ref109","doi-asserted-by":"publisher","DOI":"10.1109\/JSAC.2007.070409"},{"key":"ref108","doi-asserted-by":"publisher","DOI":"10.1109\/TMC.2009.65"},{"key":"ref107","doi-asserted-by":"publisher","DOI":"10.1109\/TWC.2012.062012.111342"},{"key":"ref106","doi-asserted-by":"publisher","DOI":"10.1109\/DYSPAN.2008.82"},{"key":"ref105","doi-asserted-by":"publisher","DOI":"10.1109\/WCNC.2007.622"},{"key":"ref104","first-page":"2130","article-title":"A new QoS provisioning method for adaptive multimedia in cellular wireless networks","volume":"3","author":"yu","year":"0","journal-title":"Proc 23rd Ann Joint Conf IEEE Comput Commun Soc"},{"key":"ref103","doi-asserted-by":"publisher","DOI":"10.1109\/TWC.2006.1673076"},{"key":"ref102","doi-asserted-by":"publisher","DOI":"10.1109\/TSP.2007.893228"},{"key":"ref111","first-page":"41","article-title":"Reinforcement learning in POMDP&#x2019;s via direct gradient ascent","author":"baxter","year":"0","journal-title":"Proc 17th Int Conf Mach Learn"},{"key":"ref112","doi-asserted-by":"publisher","DOI":"10.1109\/MWC.2011.5876496"},{"key":"ref110","doi-asserted-by":"publisher","DOI":"10.1137\/S036301299731669X"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/SURV.2012.040912.00180"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1007\/s11277-008-9480-7"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/MWC.2013.6507392"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/SURV.2012.021312.00116"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1016\/j.adhoc.2010.06.009"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/SURV.2008.080404"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1109\/JPROC.2006.887322"},{"key":"ref118","doi-asserted-by":"publisher","DOI":"10.1109\/GLOCOMW.2010.5700414"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/SURV.2012.121112.00047"},{"key":"ref117","doi-asserted-by":"publisher","DOI":"10.1109\/TVT.2010.2043124"},{"key":"ref18","author":"han","year":"2012","journal-title":"Game Theory in Wireless and Communication Networks"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/SURV.2011.122310.000119"},{"key":"ref119","first-page":"1705","article-title":"Spectrum management of cognitive radio using multi-agent reinforcement learning","author":"wu","year":"0","journal-title":"Proc 9th Int Conf Auton Agents Multiagent Syst Ind Track"},{"key":"ref114","doi-asserted-by":"publisher","DOI":"10.1109\/GLOCOM.2012.6503987"},{"key":"ref113","doi-asserted-by":"publisher","DOI":"10.1109\/VETECS.2010.5493950"},{"key":"ref116","doi-asserted-by":"publisher","DOI":"10.1109\/SAHCN.2014.6990372"},{"key":"ref115","doi-asserted-by":"publisher","DOI":"10.1109\/TWC.2013.060513.120959"},{"key":"ref120","doi-asserted-by":"publisher","DOI":"10.1109\/AUSCTW.2010.5426758"},{"key":"ref121","doi-asserted-by":"publisher","DOI":"10.1186\/1687-1499-2012-138"},{"key":"ref122","doi-asserted-by":"publisher","DOI":"10.1109\/PIMRCW.2010.5670390"},{"key":"ref123","doi-asserted-by":"publisher","DOI":"10.1109\/ISCC.2014.6912482"}],"container-title":["IEEE Communications Surveys &amp; Tutorials"],"original-title":[],"link":[{"URL":"https:\/\/ieeexplore.ieee.org\/ielaam\/9739\/7548084\/7429691-aam.pdf","content-type":"application\/pdf","content-version":"am","intended-application":"syndication"},{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/9739\/7548084\/07429691.pdf?arnumber=7429691","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,4,8]],"date-time":"2022-04-08T18:51:48Z","timestamp":1649443908000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/7429691\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2016]]},"references-count":208,"journal-issue":{"issue":"3"},"URL":"https:\/\/doi.org\/10.1109\/comst.2016.2539923","relation":{},"ISSN":["1553-877X","2373-745X"],"issn-type":[{"value":"1553-877X","type":"electronic"},{"value":"2373-745X","type":"electronic"}],"subject":[],"published":{"date-parts":[[2016]]}}}