{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,24]],"date-time":"2026-07-24T11:26:29Z","timestamp":1784892389082,"version":"3.55.0"},"reference-count":103,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","license":[{"start":{"date-parts":[[2019,1,1]],"date-time":"2019-01-01T00:00:00Z","timestamp":1546300800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/OAPA.html"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Access"],"published-print":{"date-parts":[[2019]]},"DOI":"10.1109\/access.2019.2913776","type":"journal-article","created":{"date-parts":[[2019,4,29]],"date-time":"2019-04-29T20:53:43Z","timestamp":1556571223000},"page":"55916-55950","source":"Crossref","is-referenced-by-count":213,"title":["Reinforcement Learning Based Routing in Networks: Review and Classification of Approaches"],"prefix":"10.1109","volume":"7","author":[{"ORCID":"https:\/\/orcid.org\/0000-0003-4164-9597","authenticated-orcid":false,"given":"Zoubir","family":"Mammeri","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.17487\/rfc3561"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1109\/ICON.2004.1409226"},{"key":"ref33","first-page":"758","article-title":"Confidence based Q-routing: An online network routing algorithm","author":"kumar","year":"1998","journal-title":"Proc Artif Neural Netw Eng Conf"},{"key":"ref32","first-page":"832","article-title":"Ants and reinforcement learning: A case study in routing in dynamic networks","author":"subramanian","year":"1997","journal-title":"Proc 15th Int Joint Conf Artif Intell"},{"key":"ref31","first-page":"946","article-title":"Predictive Q-routing: A memory-based reinforcement learning approach to adaptive control","author":"choi","year":"1996","journal-title":"Proc Neural Inf Process Syst Conf (NIPS)"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1109\/LCN.2004.71"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1109\/CONTEL.2003.176942"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1109\/IJCNN.2002.1007796"},{"key":"ref35","first-page":"409","article-title":"Application of multiagent reinforcement learning&#x2014;To multicast routing in wireless ad hoc networks ensuring resource reservation","author":"sun","year":"2002","journal-title":"Proc IEEE Int Conf Syst Man Cybern"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1109\/CDC.1998.760738"},{"key":"ref28","article-title":"LEQS: Learning-based efficient querying for sensor networks","author":"krishnamachari","year":"2003"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/ICSMC.1998.726708"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1109\/ISWCS.2004.1407241"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1201\/9781420085891"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1016\/j.adhoc.2012.12.004"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1145\/863956.863960"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1145\/2656877.2656887"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1002\/9780470742020"},{"key":"ref101","doi-asserted-by":"publisher","DOI":"10.1109\/ACCESS.2018.2877686"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1109\/JPROC.2014.2371999"},{"key":"ref100","doi-asserted-by":"publisher","DOI":"10.1109\/MSP.2017.2743240"},{"key":"ref25","doi-asserted-by":"crossref","first-page":"72","DOI":"10.1109\/COMST.2005.1610546","article-title":"A survey and comparison of peer-to-peer overlay network schemes","volume":"7","author":"lua","year":"2005","journal-title":"IEEE Commun Surveys Tuts"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1109\/ISSNIP.2007.4496872"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1016\/j.adhoc.2010.11.006"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.1109\/GLOCOM.2009.5425437"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.1109\/CROWNCOM.2009.5189189"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.1109\/VETECS.2008.523"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1109\/GLOCOM.2008.ECP.500"},{"key":"ref55","first-page":"552","article-title":"A multi-agent reinforcement learning based routing protocol for wireless sensor networks","author":"liang","year":"2008","journal-title":"Proc IEEE Int Symp Wireless Commun Syst"},{"key":"ref54","first-page":"1","article-title":"A reinforcement learning based routing protocol with QoS support for biomedical sensor networks","author":"liang","year":"2008","journal-title":"Proc 1st Int Symp Appl Sci Biomed Commun Technol"},{"key":"ref53","first-page":"7","article-title":"Balancing energy expenditure in WSNs through reinforcement learning: A study","author":"forster","year":"2008","journal-title":"Proc of the 1st Int Wrkshp on Energy in Wireless Sensor Networks (WEWSN)"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1109\/ICDCS.2009.43"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1109\/ICAC.2004.1301369"},{"key":"ref4","author":"sutton","year":"2018","journal-title":"Reinforcement Learning An Introduction"},{"key":"ref3","author":"witten","year":"2013","journal-title":"An Introduction to Statistical Learning with Applications in R"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/SURV.2011.040310.00002"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/MCOM.2018.1700560"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/49.536364"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1109\/WIOPT.2007.4480049"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/MNET.2017.1700200"},{"key":"ref9","first-page":"671","article-title":"Packet routing in dynamically changing networks: A reinforcement learning approach","author":"boyan","year":"1994","journal-title":"Proc Neural Inf Process Syst Conf (NIPS)"},{"key":"ref46","first-page":"1107","article-title":"Least-squares policy iteration","volume":"4","author":"lagoudakis","year":"2003","journal-title":"J Mach Learn Res"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1109\/CIT.2006.34"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1109\/ISSNIP.2007.4496810"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.1109\/GLOCOM.2007.127"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1109\/TSMCA.2005.846390"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1109\/AICT.2005.53"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1109\/AINA.2006.132"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1007\/11563952_38"},{"key":"ref73","first-page":"1971","article-title":"Learning-based routing approach for direct interactions between wireless sensor network and moving vehicles","author":"yang","year":"2013","journal-title":"Proc IEEE Int Conf Intell Transp Syst"},{"key":"ref72","doi-asserted-by":"publisher","DOI":"10.1109\/TNET.2011.2159844"},{"key":"ref71","doi-asserted-by":"publisher","DOI":"10.1109\/MED.2012.6265812"},{"key":"ref70","doi-asserted-by":"publisher","DOI":"10.1109\/GLOCOM.2012.6503112"},{"key":"ref76","first-page":"764","article-title":"A predictive Q-learning algorithm for deflection routing in buffer-less networks","author":"haeri","year":"2013","journal-title":"Proc IEEE Int Conf Syst Man Cybern"},{"key":"ref77","doi-asserted-by":"publisher","DOI":"10.1109\/ISTEL.2014.7000865"},{"key":"ref74","doi-asserted-by":"publisher","DOI":"10.1109\/TVT.2013.2273945"},{"key":"ref75","doi-asserted-by":"publisher","DOI":"10.1007\/s11276-013-0592-y"},{"key":"ref78","doi-asserted-by":"publisher","DOI":"10.1109\/ICCKE.2014.6993408"},{"key":"ref79","doi-asserted-by":"publisher","DOI":"10.1109\/PCCC.2014.7017079"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1109\/ICCGI.2010.22"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.1109\/MASCOTS.2010.45"},{"key":"ref61","doi-asserted-by":"publisher","DOI":"10.1109\/IS.2010.5548378"},{"key":"ref63","doi-asserted-by":"publisher","DOI":"10.1109\/WIMOB.2010.5645040"},{"key":"ref64","doi-asserted-by":"crossref","first-page":"796","DOI":"10.1109\/TMC.2010.28","article-title":"QELAR: A machine-learning-based adaptive routing protocol for energy-efficient and lifetime-extended underwater sensor networks","volume":"9","author":"hu","year":"2010","journal-title":"IEEE Trans Mobile Comput"},{"key":"ref65","first-page":"462","article-title":"Using statistical network link model for routing in ad hoc networks with multi-agent reinforcement learning","author":"binbin","year":"2010","journal-title":"Proc 2nd Int Conf Adv Comput Control"},{"key":"ref66","doi-asserted-by":"publisher","DOI":"10.1109\/ICRTIT.2011.5972411"},{"key":"ref67","doi-asserted-by":"publisher","DOI":"10.1109\/TWC.2010.111910.091238"},{"key":"ref68","doi-asserted-by":"publisher","DOI":"10.1109\/ICCS.2012.6406152"},{"key":"ref2","author":"murphy","year":"2012","journal-title":"Machine Learning A Probabilistic Perspective"},{"key":"ref69","doi-asserted-by":"publisher","DOI":"10.1109\/APCC.2012.6388091"},{"key":"ref1","author":"mitchell","year":"2017","journal-title":"Machine Learning"},{"key":"ref95","doi-asserted-by":"publisher","DOI":"10.1109\/WiMOB.2018.8589161"},{"key":"ref94","doi-asserted-by":"publisher","DOI":"10.1109\/JSYST.2016.2558515"},{"key":"ref93","doi-asserted-by":"publisher","DOI":"10.1109\/MCOM.2017.1700323"},{"key":"ref92","doi-asserted-by":"publisher","DOI":"10.1109\/TVT.2018.2871606"},{"key":"ref91","doi-asserted-by":"publisher","DOI":"10.1109\/ACCESS.2017.2777867"},{"key":"ref90","doi-asserted-by":"publisher","DOI":"10.1109\/TVT.2016.2610444"},{"key":"ref103","doi-asserted-by":"publisher","DOI":"10.1109\/COMST.2018.2846401"},{"key":"ref102","doi-asserted-by":"publisher","DOI":"10.1145\/3152434.3152441"},{"key":"ref98","doi-asserted-by":"crossref","first-page":"261","DOI":"10.1515\/math-2017-0029","article-title":"Learnheuristics: Hybridizing metaheuristics with machine learning for optimization with dynamic inputs","volume":"15","author":"calvet","year":"2017","journal-title":"The Open Mathematics Journal"},{"key":"ref99","doi-asserted-by":"publisher","DOI":"10.1038\/nature14236"},{"key":"ref96","doi-asserted-by":"publisher","DOI":"10.1109\/MILCOM.2018.8599797"},{"key":"ref97","doi-asserted-by":"publisher","DOI":"10.1109\/JIOT.2018.2812210"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1007\/s10462-012-9383-6"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-21937-5_1"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1613\/jair.301"},{"key":"ref13","article-title":"Learning from delayed rewards","author":"watkins","year":"1989"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1007\/BF00992698"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1016\/j.comnet.2004.12.001"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1109\/MCOM.2004.1341264"},{"key":"ref82","doi-asserted-by":"publisher","DOI":"10.1109\/I4CT.2015.7219529"},{"key":"ref17","author":"ramaswami","year":"2010","journal-title":"Optical Networks A Practical Perspective"},{"key":"ref81","author":"osborne","year":"2000","journal-title":"An Introduction to Game Theory"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1002\/0471656895"},{"key":"ref84","doi-asserted-by":"publisher","DOI":"10.1109\/SCC.2016.12"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1016\/S1389-1286(01)00302-4"},{"key":"ref83","doi-asserted-by":"publisher","DOI":"10.1109\/CAMAD.2016.7790324"},{"key":"ref80","doi-asserted-by":"publisher","DOI":"10.1109\/TWC.2014.2370046"},{"key":"ref89","doi-asserted-by":"publisher","DOI":"10.1109\/SECON.2017.7925316"},{"key":"ref85","doi-asserted-by":"publisher","DOI":"10.1109\/MMSP.2017.8122255"},{"key":"ref86","doi-asserted-by":"publisher","DOI":"10.1109\/LCOMM.2017.2656879"},{"key":"ref87","doi-asserted-by":"publisher","DOI":"10.1109\/COMSNETS.2017.7945377"},{"key":"ref88","doi-asserted-by":"publisher","DOI":"10.1109\/ICCChina.2017.8330354"}],"container-title":["IEEE Access"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/6287639\/8600701\/08701570.pdf?arnumber=8701570","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2021,8,10]],"date-time":"2021-08-10T19:40:02Z","timestamp":1628624402000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/8701570\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2019]]},"references-count":103,"URL":"https:\/\/doi.org\/10.1109\/access.2019.2913776","relation":{},"ISSN":["2169-3536"],"issn-type":[{"value":"2169-3536","type":"electronic"}],"subject":[],"published":{"date-parts":[[2019]]}}}