{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,31]],"date-time":"2026-07-31T20:54:00Z","timestamp":1785531240761,"version":"3.56.0"},"reference-count":132,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","license":[{"start":{"date-parts":[[2019,1,1]],"date-time":"2019-01-01T00:00:00Z","timestamp":1546300800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/legalcode"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Access"],"published-print":{"date-parts":[[2019]]},"DOI":"10.1109\/access.2019.2941229","type":"journal-article","created":{"date-parts":[[2019,9,13]],"date-time":"2019-09-13T20:26:02Z","timestamp":1568406362000},"page":"133653-133667","source":"Crossref","is-referenced-by-count":587,"title":["Q-Learning Algorithms: A Comprehensive Classification and Applications"],"prefix":"10.1109","volume":"7","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-3911-5935","authenticated-orcid":false,"given":"Beakcheol","family":"Jang","sequence":"first","affiliation":[{"name":"Department of Computer Science, Sangmyung University, Seoul, South Korea"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-8036-4434","authenticated-orcid":false,"given":"Myeonghwi","family":"Kim","sequence":"additional","affiliation":[{"name":"Department of Computer Science, Sangmyung University, Seoul, South Korea"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Gaspard","family":"Harerimana","sequence":"additional","affiliation":[{"name":"Department of Computer Science, Sangmyung University, Seoul, South Korea"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-8373-1893","authenticated-orcid":false,"given":"Jong Wook","family":"Kim","sequence":"additional","affiliation":[{"name":"Department of Computer Science, Sangmyung University, Seoul, South Korea"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1109\/SAINT-W.2006.20"},{"key":"ref38","first-page":"17","article-title":"QV (lambda)-learning: A new on-policy reinforcement learning algrithm","author":"wiering","year":"2005","journal-title":"Proc of European Workshop on Reinforcement Learning"},{"key":"ref33","first-page":"455","article-title":"Reinforcement learning and function approximation","author":"irodova","year":"2005","journal-title":"Proc FLAIRS Conf"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1613\/jair.639"},{"key":"ref31","first-page":"1057","article-title":"Policy gradient methods for reinforcement learning with function approximation","author":"sutton","year":"2000","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1016\/S1389-0417(01)00015-8"},{"key":"ref37","first-page":"2613","article-title":"Double Q-learning","author":"hasselt","year":"2010","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1038\/nature14236"},{"key":"ref35","article-title":"Playing atari with deep reinforcement learning","author":"mnih","year":"2013","journal-title":"arXiv 1312 5602"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1109\/ICNSC.2008.4525304"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1007\/3-540-44581-1_39"},{"key":"ref27","first-page":"1038","article-title":"Generalization in reinforcement learning: Successful examples using sparse coarse coding","author":"sutton","year":"1996","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref29","article-title":"Exact and approximate algorithms for partially observable Markov decision processes","author":"cassandra","year":"1998"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/TII.2017.2761852"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/COMST.2014.2320099"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1016\/j.arcontrol.2012.03.004"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1007\/s10994-017-5666-0"},{"key":"ref23","doi-asserted-by":"crossref","first-page":"33","DOI":"10.1109\/MCS.2016.2621461","article-title":"Game theory-based control system algorithms with real-time reinforcement learning: How to solve multiplayer games online","volume":"37","author":"vamvoudakis","year":"2017","journal-title":"IEEE Control Syst"},{"key":"ref101","doi-asserted-by":"publisher","DOI":"10.1007\/s10462-012-9383-6"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1016\/0377-2217(89)90348-2"},{"key":"ref100","article-title":"Continuous control with deep reinforcement learning","author":"lillicrap","year":"2015","journal-title":"arXiv 1509 02971"},{"key":"ref25","article-title":"Multi-goal reinforcement learning: Challenging robotics environments and request for research","author":"plappert","year":"2018","journal-title":"arXiv 1802 09464"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1613\/jair.2628"},{"key":"ref51","first-page":"927","article-title":"Multi-agent learning with policy prediction","author":"zhang","year":"2010","journal-title":"Proc 24th AAAI Conf Artif Intell"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.1007\/BF00993306"},{"key":"ref58","first-page":"226","article-title":"Incremental multi-step Q-learning","author":"peng","year":"1994","journal-title":"Proc Mach Learn"},{"key":"ref57","article-title":"ViZDoom: DRQN with prioritized experience replay, double-Q learning, & snapshot ensembling","author":"schulze","year":"2018","journal-title":"arXiv 1801 01000"},{"key":"ref56","article-title":"Deep reinforcement learning with double Q-learning","author":"van hasselt","year":"2019","journal-title":"arXiv 1509 06461 [cs]"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1371\/journal.pone.0180234"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1007\/s11432-011-4332-6"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.1023\/A:1022140919877"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1109\/TSUSC.2017.2743704"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1109\/MRA.2008.921541"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1177\/0278364913495721"},{"key":"ref3","article-title":"Concurrent meta reinforcement learning","author":"parisotto","year":"2019","journal-title":"arXiv 1903 02710"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1023\/A:1017936530646"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1145\/203330.203343"},{"key":"ref8","author":"puterman","year":"2014","journal-title":"Markov Decision Processes Discrete Stochastic Dynamic Programming"},{"key":"ref49","first-page":"475","article-title":"Emergence of social norms through collective learning in networked agent societies","author":"yu","year":"2013","journal-title":"Proc Int Conf Auton Agents Multi-Agent Syst"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1201\/b14835"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1007\/BF00992698"},{"key":"ref46","first-page":"2779","article-title":"Swarm reinforcement learning algorithms&#x2014;Exchange of information among multiple agents","author":"iima","year":"2007","journal-title":"Proc SICE Annu Conf"},{"key":"ref45","first-page":"205","article-title":"Cooperative behavior acquisition based modular Q learning in multi-agent system","author":"zhou","year":"2005","journal-title":"Proc Int Conf Mach Learn Cybern"},{"key":"ref48","first-page":"209","article-title":"Convergence and no-regret in multiagent learning","author":"bowling","year":"2005","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref47","first-page":"191","article-title":"On multiagent Q-learning in a semi-competitive domain","author":"sandholm","year":"1995","journal-title":"Proc Int Joint Conf Artif Intell"},{"key":"ref42","first-page":"1039","article-title":"Nash Q-learning for general-sum stochastic games","volume":"4","author":"hu","year":"2003","journal-title":"J Mach Learn Res"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1109\/ADPRL.2013.6614986"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1016\/S0921-8890(01)00114-2"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1007\/s11276-012-0457-9"},{"key":"ref127","article-title":"Multi-task deep learning for user intention understanding in speech interaction systems","author":"ning","year":"2017","journal-title":"Proc 31st AAAI Conf Artif Intell"},{"key":"ref126","doi-asserted-by":"publisher","DOI":"10.1002\/9781119159193.ch35"},{"key":"ref125","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2017.7989202"},{"key":"ref124","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2017.2784440"},{"key":"ref73","first-page":"168","article-title":"Gradient-based relational reinforcement learning of temporally extended policies","author":"gretton","year":"2007","journal-title":"Proc ICAPS"},{"key":"ref72","article-title":"Hierarchical and interpretable skill acquisition in multi-task reinforcement learning","author":"shu","year":"2017","journal-title":"arXiv 1712 07294"},{"key":"ref129","doi-asserted-by":"publisher","DOI":"10.1109\/MSP.2017.2743240"},{"key":"ref71","article-title":"Modeling others using oneself in multi-agent reinforcement learning","author":"raileanu","year":"2018","journal-title":"arXiv 1802 09640"},{"key":"ref128","first-page":"5617","article-title":"Deep learning for precipitation nowcasting: A benchmark and a new model","author":"shi","year":"2017","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref70","doi-asserted-by":"publisher","DOI":"10.1007\/0-387-27705-6_6"},{"key":"ref76","first-page":"2137","article-title":"Learning to communicate with deep multi-agent reinforcement learning","author":"foerster","year":"2016","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref130","first-page":"1437","article-title":"A comprehensive survey on safe reinforcement learning","volume":"16","author":"garc\u00eda","year":"2015","journal-title":"J Mach Learn Res"},{"key":"ref77","first-page":"1840","article-title":"Estimating the maximum expected value in continuous reinforcement learning problems","author":"d\u2019eramo","year":"2017","journal-title":"Proc 31st AAAI Conf Artif Intell"},{"key":"ref74","article-title":"Parameter sharing deep deterministic policy gradient for cooperative multi-agent reinforcement learning","author":"chu","year":"2017","journal-title":"arXiv 1710 00336"},{"key":"ref75","article-title":"Dueling network architectures for deep reinforcement learning","author":"wang","year":"2015","journal-title":"arXiv 1511 06581"},{"key":"ref131","first-page":"1327","article-title":"Learning algorithms for risk-sensitive control","volume":"5","author":"borkar","year":"2010","journal-title":"Proc 19th Int Symp Math Theory Netw Syst (MTNS)"},{"key":"ref78","doi-asserted-by":"publisher","DOI":"10.24963\/ijcai.2017\/656"},{"key":"ref132","doi-asserted-by":"publisher","DOI":"10.1287\/ijoc.1080.0305"},{"key":"ref79","first-page":"565","article-title":"Reward shaping in episodic reinforcement learning","author":"grze?","year":"2017","journal-title":"Proc 16th Conf Auton Agents Multiagent Syst (AAMAS)"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1109\/TPWRS.2010.2102372"},{"key":"ref62","first-page":"25","article-title":"A modular approach to multi-agent reinforcement learning","author":"ono","year":"1996","journal-title":"Distributed Artificial Intelligence Meets Machine Learning Learning in Multi-Agent Environments"},{"key":"ref61","first-page":"943","article-title":"A Bayesian framework for reinforcement learning","author":"strens","year":"2000","journal-title":"Proc ICML"},{"key":"ref63","first-page":"820","article-title":"An adaptive architecture for modular Q-learning","volume":"2","author":"kohri","year":"1997","journal-title":"Proc IJCAI"},{"key":"ref64","doi-asserted-by":"publisher","DOI":"10.1007\/3-540-62934-3_39"},{"key":"ref65","doi-asserted-by":"publisher","DOI":"10.3745\/KIPSTB.2011.18B.3.165"},{"key":"ref66","doi-asserted-by":"publisher","DOI":"10.1016\/B978-1-55860-377-6.50039-6"},{"key":"ref67","doi-asserted-by":"publisher","DOI":"10.1109\/TSMCA.2009.2014539"},{"key":"ref68","doi-asserted-by":"publisher","DOI":"10.1109\/SICE.2008.4654998"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1126\/science.aaa8415"},{"key":"ref69","doi-asserted-by":"publisher","DOI":"10.1109\/FISTS.2011.5973658"},{"key":"ref1","first-page":"726","article-title":"Input generalization in delayed reinforcement learning: An algorithm and performance comparisons","author":"chapman","year":"1991","journal-title":"Proc IJCAI"},{"key":"ref109","first-page":"4994","article-title":"Online reinforcement learning in stochastic games","author":"wei","year":"2017","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref95","first-page":"503","article-title":"Resource abstraction for reinforcement learning in multiagent congestion problems","author":"malialis","year":"2016","journal-title":"Proc 4th Int Conf Auton Agents Multiagent Syst (AAMAS)"},{"key":"ref108","first-page":"464","article-title":"Multi-agent reinforcement learning in sequential social dilemmas","author":"leibo","year":"2017","journal-title":"Proc 16th Conf Autonomous Agents and MultiAgent Systems"},{"key":"ref94","first-page":"819","article-title":"Sparse multi-task reinforcement learning","author":"calandriello","year":"2014","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref107","article-title":"Mobile edge computation offloading using game theory and reinforcement learning","author":"ranadheera","year":"2017","journal-title":"arXiv 1711 09012"},{"key":"ref93","article-title":"Stabilising experience replay for deep multi-agent reinforcement learning","author":"foerster","year":"2017","journal-title":"arXiv 1702 08887"},{"key":"ref106","article-title":"On the properties of the softmax function with application in game theory and reinforcement learning","author":"gao","year":"2017","journal-title":"arXiv 1704 00805"},{"key":"ref92","doi-asserted-by":"publisher","DOI":"10.24963\/ijcai.2017\/196"},{"key":"ref105","doi-asserted-by":"publisher","DOI":"10.1016\/j.jhydrol.2014.07.061"},{"key":"ref91","article-title":"FeUdal networks for hierarchical reinforcement learning","author":"vezhnevets","year":"2017","journal-title":"arXiv 1703 01161"},{"key":"ref104","doi-asserted-by":"publisher","DOI":"10.1504\/IJSNET.2017.087899"},{"key":"ref90","doi-asserted-by":"publisher","DOI":"10.1017\/S0269888918000206"},{"key":"ref103","first-page":"4424","article-title":"Federated multi-task learning","author":"smith","year":"2017","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref102","doi-asserted-by":"publisher","DOI":"10.1109\/IMTC.2007.379173"},{"key":"ref111","article-title":"Towards vision-based deep reinforcement learning for robotic motion control","author":"zhang","year":"2015","journal-title":"arXiv 1511 03791"},{"key":"ref112","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2017.7989381"},{"key":"ref110","first-page":"4055","article-title":"Successor features for transfer in reinforcement learning","author":"barreto","year":"2017","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref98","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2017.2773458"},{"key":"ref99","doi-asserted-by":"publisher","DOI":"10.1109\/72.914523"},{"key":"ref96","first-page":"1413","article-title":"Inverse reinforcement learning in swarm systems","author":"\u0161o\u0161i?","year":"2017","journal-title":"Proc 16th Conf Auton Agents Multiagent Syst (AAMAS)"},{"key":"ref97","doi-asserted-by":"crossref","DOI":"10.4324\/9781315185613","author":"coker","year":"2017","journal-title":"Motor Learning and Control for Practitioners"},{"key":"ref10","first-page":"761","article-title":"Bayesian Q-learning","author":"dearden","year":"1998","journal-title":"Proc AAAI\/IAAI"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-27645-3_5"},{"key":"ref12","first-page":"1073","article-title":"A generalization error for Q-learning","volume":"6","author":"murphy","year":"2005","journal-title":"J Mach Learn Res"},{"key":"ref13","article-title":"A survey on multi-task learning","author":"zhang","year":"2017","journal-title":"arXiv 1707 08114"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2017.7989385"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1561\/2200000049"},{"key":"ref118","doi-asserted-by":"publisher","DOI":"10.1155\/2017\/7902579"},{"key":"ref16","first-page":"3223","article-title":"Deep Q-learning from demonstrations","author":"hester","year":"2018","journal-title":"Proc 32nd AAAI Conf Artif Intell"},{"key":"ref82","first-page":"2258","article-title":"Efficient average reward reinforcement learning using constant shifting values","author":"yang","year":"2016","journal-title":"Proc AAAI"},{"key":"ref117","article-title":"Device placement optimization with reinforcement learning","author":"mirhoseini","year":"2017","journal-title":"arXiv 1706 04972"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1016\/B978-1-55860-335-6.50045-3"},{"key":"ref81","first-page":"165","article-title":"Potential-based difference rewards for multiagent reinforcement learning","author":"devlin","year":"2014","journal-title":"Proc Auton Agents Multi-Agent Syst (AAMAS)"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1007\/3-540-61723-X_1029"},{"key":"ref84","first-page":"1819","article-title":"OFFER: Off-environment reinforcement learning","author":"ciosek","year":"2017","journal-title":"Proc AAAI"},{"key":"ref119","doi-asserted-by":"publisher","DOI":"10.1109\/LRA.2017.2720851"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1016\/j.neucom.2019.01.109"},{"key":"ref83","first-page":"2050","article-title":"Compatible reward inverse reinforcement learning","author":"metelli","year":"2017","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref114","doi-asserted-by":"publisher","DOI":"10.1109\/IEMCON.2017.8117147"},{"key":"ref113","doi-asserted-by":"publisher","DOI":"10.1016\/j.cie.2017.05.026"},{"key":"ref116","first-page":"2430","article-title":"Device placement optimization with reinforcement learning","volume":"70","author":"mirhoseini","year":"2017","journal-title":"Proc 34th Int Conf Mach Learn"},{"key":"ref80","first-page":"763","article-title":"Knowledge revision for reinforcement learning with abstract MDPs","author":"efthymiadis","year":"2015","journal-title":"Proc Int'l Joint Conf Autonomous Agents and Multiagent Systems (AAMAS)"},{"key":"ref115","doi-asserted-by":"publisher","DOI":"10.1016\/j.enbuild.2016.01.030"},{"key":"ref120","article-title":"Autonomous quadrotor landing using deep reinforcement learning","author":"polvara","year":"2017","journal-title":"arXiv 1709 03339"},{"key":"ref89","first-page":"4299","article-title":"Deep reinforcement learning from human preferences","author":"christiano","year":"2017","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref121","article-title":"Recurrent attentional reinforcement learning for multi-label image recognition","author":"chen","year":"2017","journal-title":"arXiv 1712 07465"},{"key":"ref122","doi-asserted-by":"publisher","DOI":"10.1145\/3125502.3125554"},{"key":"ref123","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2017.2782687"},{"key":"ref85","article-title":"Robust adversarial reinforcement learning","author":"pinto","year":"2017","journal-title":"arXiv 1703 02702"},{"key":"ref86","first-page":"5392","article-title":"Hybrid reward architecture for reinforcement learning","author":"van seijen","year":"2017","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref87","first-page":"3504","article-title":"Potential based reward shaping for hierarchical reinforcement learning","author":"gao","year":"2015","journal-title":"Proc 24th Int Joint Conf Artif Intell"},{"key":"ref88","first-page":"1897","article-title":"P-MARL: Prediction-based multi-agent reinforcement learning for non-stationary environments","author":"marinescu","year":"2015","journal-title":"Proc Int'l Joint Conf Autonomous Agents and Multiagent Systems (AAMAS)"}],"container-title":["IEEE Access"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/6287639\/8600701\/08836506.pdf?arnumber=8836506","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,9,8]],"date-time":"2022-09-08T19:53:27Z","timestamp":1662666807000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/8836506\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2019]]},"references-count":132,"URL":"https:\/\/doi.org\/10.1109\/access.2019.2941229","relation":{},"ISSN":["2169-3536"],"issn-type":[{"value":"2169-3536","type":"electronic"}],"subject":[],"published":{"date-parts":[[2019]]}}}