{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,10]],"date-time":"2026-07-10T06:37:39Z","timestamp":1783665459359,"version":"3.55.0"},"reference-count":242,"publisher":"SAGE Publications","issue":"2","license":[{"start":{"date-parts":[[2020,4,10]],"date-time":"2020-04-10T00:00:00Z","timestamp":1586476800000},"content-version":"unspecified","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/"}],"content-domain":{"domain":["journals.sagepub.com"],"crossmark-restriction":true},"short-container-title":["Data Science"],"published-print":{"date-parts":[[2020,11,11]]},"abstract":"<jats:p>The major application areas of reinforcement learning (RL) have traditionally been game playing and continuous control. In recent years, however, RL has been increasingly applied in systems that interact with humans. RL can personalize digital systems to make them more relevant to individual users. Challenges in personalization settings may be different from challenges found in traditional application areas of RL. An overview of work that uses RL for personalization, however, is lacking. In this work, we introduce a framework of personalization settings and use it in a systematic literature review. Besides setting, we review solutions and evaluation strategies. Results show that RL has been increasingly applied to personalization problems and realistic evaluations have become more prevalent. RL has become sufficiently robust to apply in contexts that involve humans and the field as a whole is growing. However, it seems not to be maturing: the ratios of studies that include a comparison or a realistic evaluation are not showing upward trends and the vast majority of algorithms are used only once. This review can be used to find related work across domains, provides insights into the state of the field and identifies opportunities for future work.<\/jats:p>","DOI":"10.3233\/ds-200028","type":"journal-article","created":{"date-parts":[[2020,4,10]],"date-time":"2020-04-10T11:54:04Z","timestamp":1586519644000},"page":"107-147","update-policy":"https:\/\/doi.org\/10.1177\/sage-journals-update-policy","source":"Crossref","is-referenced-by-count":44,"title":["Reinforcement learning for personalization: A systematic literature review"],"prefix":"10.1177","volume":"3","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-2092-9904","authenticated-orcid":false,"given":"Floris","family":"den Hengst","sequence":"first","affiliation":[{"name":"Dept. of Computer Science, Faculty of Science, Vrije Universiteit Amsterdam, De Boelelaan 1111, 1081 HV, Amsterdam, The Netherlands."}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-5471-4338","authenticated-orcid":false,"given":"Eoin Martino","family":"Grua","sequence":"additional","affiliation":[{"name":"Dept. of Computer Science, Faculty of Science, Vrije Universiteit Amsterdam, De Boelelaan 1111, 1081 HV, Amsterdam, The Netherlands."}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-0919-8861","authenticated-orcid":false,"given":"Ali","family":"el Hassouni","sequence":"additional","affiliation":[{"name":"Dept. of Computer Science, Faculty of Science, Vrije Universiteit Amsterdam, De Boelelaan 1111, 1081 HV, Amsterdam, The Netherlands."}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3356-3574","authenticated-orcid":false,"given":"Mark","family":"Hoogendoorn","sequence":"additional","affiliation":[{"name":"Dept. of Computer Science, Faculty of Science, Vrije Universiteit Amsterdam, De Boelelaan 1111, 1081 HV, Amsterdam, The Netherlands."}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"179","published-online":{"date-parts":[[2020,4,10]]},"reference":[{"key":"ref001","doi-asserted-by":"publisher","DOI":"10.1145\/1014052.1016912"},{"key":"ref002","doi-asserted-by":"publisher","DOI":"10.1007\/3-540-48157-5_29"},{"key":"ref003","doi-asserted-by":"publisher","DOI":"10.5555\/2936924.2937221"},{"key":"ref004","doi-asserted-by":"publisher","DOI":"10.1145\/1082473.1082648"},{"issue":"10","key":"ref005","first-page":"108","volume":"85","author":"Aspinall M.G.","year":"2007","journal-title":"Harvard Business Review"},{"key":"ref006","doi-asserted-by":"publisher","DOI":"10.1145\/1502650.1502700"},{"key":"ref007","doi-asserted-by":"publisher","DOI":"10.1023\/A:1013689704352"},{"key":"ref008","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-34546-3_143"},{"key":"ref009","doi-asserted-by":"publisher","DOI":"10.2307\/25148715"},{"key":"ref010","doi-asserted-by":"publisher","DOI":"10.1109\/ICCUBEA.2015.44"},{"key":"ref011","unstructured":"A.Baniya, S.Herrmann, Q.Qiao and H.Lu, Adaptive interventions treatment modelling and regimen optimization using sequential multiple assignment randomized trials (SMART) and Q-learning, in: IIE Annual Conference. Proceedings, Institute of Industrial and Systems Engineers (IISE), 2017, pp. 1187\u20131192. https:\/\/pdfs.semanticscholar.org\/858e\/ffd10b711ad6c86eff9c32cdc0bc320a6e1a.pdf."},{"key":"ref012","unstructured":"A.G.Barto, P.S.Thomas and R.S.Sutton, Some recent applications of reinforcement learning, 2017. https:\/\/people.cs.umass.edu\/~pthomas\/papers\/Barto2017.pdf."},{"key":"ref013","doi-asserted-by":"publisher","DOI":"10.1145\/3067695.3075970"},{"key":"ref014","doi-asserted-by":"publisher","DOI":"10.1613\/jair.3912"},{"key":"ref015","doi-asserted-by":"publisher","DOI":"10.1002\/nav.3800080314"},{"key":"ref016","doi-asserted-by":"publisher","DOI":"10.1109\/NGMAST.2015.12"},{"key":"ref017","doi-asserted-by":"publisher","DOI":"10.1109\/PERCOM.2004.1276875"},{"key":"ref018","doi-asserted-by":"publisher","DOI":"10.1109\/INFOCT.2018.8356853"},{"key":"ref019","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-30217-6_39"},{"key":"ref020","doi-asserted-by":"publisher","DOI":"10.5555\/2936924.2937066"},{"key":"ref021","unstructured":"G.Brockman, V.Cheung, L.Pettersson, J.Schneider, J.Schulman, J.Tang and W.Zaremba, Openai gym, Preprint, arXiv:1606.01540, 2016."},{"key":"ref022","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-540-72079-9"},{"key":"ref023","doi-asserted-by":"publisher","DOI":"10.1145\/1134285.1134500"},{"key":"ref024","doi-asserted-by":"publisher","DOI":"10.1109\/QRS.2015.40"},{"key":"ref025","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/W15-4603"},{"key":"ref026","doi-asserted-by":"publisher","DOI":"10.1109\/ROBIO.2011.6181679"},{"key":"ref027","doi-asserted-by":"publisher","DOI":"10.1145\/3099023.3102251"},{"key":"ref028","doi-asserted-by":"publisher","DOI":"10.1146\/annurev-statistics-022513-115553"},{"key":"ref029","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2011.5980426"},{"key":"ref030","doi-asserted-by":"publisher","DOI":"10.1007\/s10799-005-5879-y"},{"key":"ref031","doi-asserted-by":"publisher","DOI":"10.1109\/ICICS.2003.1292790"},{"key":"ref032","doi-asserted-by":"publisher","DOI":"10.1109\/IVS.2017.7995748"},{"key":"ref033","doi-asserted-by":"publisher","DOI":"10.1016\/j.enbuild.2016.05.067"},{"key":"ref034","doi-asserted-by":"publisher","DOI":"10.1109\/TAAI.2010.21"},{"key":"ref035","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-13470-8_15"},{"key":"ref036","doi-asserted-by":"publisher","DOI":"10.1109\/ARSO.2014.7020978"},{"key":"ref037","unstructured":"W.Chu, L.Li, L.Reyzin and R.Schapire, Contextual bandits with linear payoff functions, in: Proceedings of the Fourteenth International Conference on Artificial Intelligence and Statistics, 2011, pp. 208\u2013214. http:\/\/proceedings.mlr.press\/v15\/chu11a."},{"key":"ref038","doi-asserted-by":"publisher","DOI":"10.1109\/LCOMM.2014.020414.132649"},{"key":"ref039","doi-asserted-by":"publisher","DOI":"10.1016\/S0925-5273(00)00079-7"},{"key":"ref040","doi-asserted-by":"publisher","DOI":"10.1109\/SRII.2012.65"},{"key":"ref041","doi-asserted-by":"publisher","DOI":"10.1109\/EMBC.2013.6610293"},{"key":"ref042","doi-asserted-by":"publisher","DOI":"10.1016\/j.cmpb.2012.03.002"},{"key":"ref043","doi-asserted-by":"publisher","DOI":"10.1371\/journal.pone.0158722"},{"key":"ref044","doi-asserted-by":"publisher","DOI":"10.1016\/j.eswa.2014.10.038"},{"key":"ref045","doi-asserted-by":"publisher","DOI":"10.1016\/j.asoc.2015.06.041"},{"key":"ref046","doi-asserted-by":"publisher","DOI":"10.5281\/zenodo.3627118"},{"key":"ref047","doi-asserted-by":"publisher","DOI":"10.1145\/3350546.3352501"},{"key":"ref048","doi-asserted-by":"publisher","DOI":"10.1109\/ADPRL.2011.5967348"},{"key":"ref049","doi-asserted-by":"publisher","DOI":"10.5555\/3295222.3295238"},{"key":"ref050","unstructured":"Y.Duan, X.Chen, R.Houthooft, J.Schulman and P.Abbeel, Benchmarking deep reinforcement learning for continuous control, in: International Conference on Machine Learning, 2016, pp. 1329\u20131338. http:\/\/proceedings.mlr.press\/v48\/duan16.html."},{"key":"ref051","unstructured":"A.Durand and J.Pineau, Adaptive treatment allocation using sub-sampled Gaussian processes, in: 2015 AAAI Fall Symposium Series, 2015. https:\/\/www.aaai.org\/ocs\/index.php\/FSS\/FSS15\/paper\/view\/11671."},{"key":"ref052","doi-asserted-by":"publisher","DOI":"10.1145\/3167486.3167574"},{"key":"ref053","doi-asserted-by":"publisher","DOI":"10.1145\/3350546.3352527"},{"key":"ref054","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-03098-8_31"},{"key":"ref055","doi-asserted-by":"publisher","DOI":"10.1207\/s15327744joce1603&4_2"},{"key":"ref056","doi-asserted-by":"publisher","DOI":"10.1080\/10919392.2006.9681199"},{"key":"ref057","doi-asserted-by":"publisher","DOI":"10.1109\/CASoN.2014.6920422"},{"key":"ref058","doi-asserted-by":"publisher","DOI":"10.1109\/COMPSACW.2014.45"},{"key":"ref059","doi-asserted-by":"publisher","DOI":"10.1109\/CCNC.2014.6940520"},{"key":"ref060","doi-asserted-by":"publisher","DOI":"10.1016\/j.jss.2016.02.008"},{"key":"ref061","doi-asserted-by":"publisher","DOI":"10.1007\/s10209-016-0463-2"},{"key":"ref062","doi-asserted-by":"publisher","DOI":"10.1109\/IVS.1994.639561"},{"key":"ref063","unstructured":"A.Y.Gao, W.Barendregt and G.Castellano, Personalised human\u2013robot co-adaptation in instructional settings using reinforcement learning, in: IVA Workshop on Persuasive Embodied Agents for Behavior Change: PEACH 2017, August 27, Stockholm, Sweden, 2017. http:\/\/www.diva-portal.org\/smash\/get\/diva2:1162389\/FULLTEXT01.pdf."},{"issue":"1","key":"ref064","first-page":"1437","volume":"16","author":"Garc\u00eda J.","year":"2015","journal-title":"Journal of Machine Learning Research"},{"key":"ref065","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-24412-4_16"},{"key":"ref066","doi-asserted-by":"publisher","DOI":"10.1109\/IJCNN.2009.5179004"},{"key":"ref067","doi-asserted-by":"publisher","DOI":"10.1016\/j.neunet.2005.06.020"},{"key":"ref068","doi-asserted-by":"publisher","DOI":"10.1109\/ICMLA.2005.40"},{"key":"ref069","unstructured":"C.Gentile, S.Li and G.Zappella, Online clustering of bandits, in: International Conference on Machine Learning, 2014, pp. 757\u2013765. http:\/\/proceedings.mlr.press\/v32\/gentile14.html."},{"key":"ref070","doi-asserted-by":"publisher","DOI":"10.1007\/s11276-013-0572-2"},{"key":"ref071","doi-asserted-by":"publisher","DOI":"10.1016\/S0167-7799(01)01814-5"},{"key":"ref072","doi-asserted-by":"publisher","DOI":"10.1145\/2449396.2449413"},{"key":"ref073","doi-asserted-by":"publisher","DOI":"10.1214\/12-AOS968"},{"key":"ref074","doi-asserted-by":"publisher","DOI":"10.5555\/3016387.3016461"},{"key":"ref075","doi-asserted-by":"publisher","DOI":"10.1109\/SSCI.2018.8628621"},{"key":"ref076","unstructured":"X.Guo, Y.Sun, Z.Yan and N.Wang, Privacy-personalization paradox in adoption of mobile health service: The mediating role of trust, in: PACIS 2012 Proceedings, 2012, p. 27. https:\/\/aisel.aisnet.org\/pacis2012\/27."},{"key":"ref077","doi-asserted-by":"publisher","DOI":"10.1056\/NEJMp1006304"},{"key":"ref078","unstructured":"A.Hans, D.Schneega\u00df, A.M.Sch\u00e4fer and S.Udluft, Safe exploration for reinforcement learning., in: ESANN, 2008, pp. 143\u2013148. http:\/\/www.elen.ucl.ac.be\/Proceedings\/esann\/esannpdf\/es2008-36.pdf."},{"key":"ref079","doi-asserted-by":"publisher","DOI":"10.1007\/11527886_40"},{"key":"ref080","doi-asserted-by":"publisher","DOI":"10.1145\/3173386.3176916"},{"key":"ref081","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-27645-3_4"},{"key":"ref082","doi-asserted-by":"publisher","DOI":"10.1145\/3097983.3098184"},{"key":"ref083","doi-asserted-by":"publisher","DOI":"10.1016\/j.specom.2016.09.002"},{"key":"ref084","doi-asserted-by":"publisher","DOI":"10.1016\/j.nbt.2012.03.004"},{"key":"ref085","doi-asserted-by":"publisher","DOI":"10.1109\/IECON.2008.4757965"},{"key":"ref086","doi-asserted-by":"publisher","DOI":"10.1145\/1089551.1089605"},{"key":"ref087","unstructured":"E.Ie, C.Hsu, M.Mladenov, V.Jain, S.Narvekar, J.Wang, R.Wu and C.Boutilier, RecSim: A configurable simulation platform for recommender systems, Preprint, arXiv:1909.04847, 2019."},{"key":"ref088","doi-asserted-by":"publisher","DOI":"10.1109\/ASONAM.2016.7752236"},{"key":"ref089","doi-asserted-by":"publisher","DOI":"10.1145\/1869446.1869453"},{"key":"ref090","unstructured":"N.Jiang and L.Li, Doubly robust off-policy value evaluation for reinforcement learning, in: International Conference on Machine Learning, 2016, pp. 652\u2013661. http:\/\/proceedings.mlr.press\/v48\/jiang16.html."},{"key":"ref091","doi-asserted-by":"publisher","DOI":"10.1109\/ICIEA.2011.5976002"},{"key":"ref092","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-662-49674-9_8"},{"key":"ref093","doi-asserted-by":"publisher","DOI":"10.1109\/ITNG.2010.140"},{"key":"ref094","doi-asserted-by":"publisher","DOI":"10.1145\/2134203.2134206"},{"key":"ref095","doi-asserted-by":"publisher","DOI":"10.1007\/978-1-4614-4803-7_4"},{"key":"ref096","doi-asserted-by":"publisher","DOI":"10.1109\/ICALT.2008.198"},{"key":"ref097","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-27645-3_18"},{"key":"ref098","doi-asserted-by":"publisher","DOI":"10.5555\/3009657.3009799"},{"key":"ref099","doi-asserted-by":"publisher","DOI":"10.1049\/cp:20030322"},{"key":"ref100","doi-asserted-by":"publisher","DOI":"10.1145\/169891.169908"},{"key":"ref101","doi-asserted-by":"publisher","DOI":"10.1093\/aje\/kwx027"},{"key":"ref102","doi-asserted-by":"publisher","DOI":"10.1016\/0196-8858(85)90002-8"},{"key":"ref103","unstructured":"A.S.Lan and R.G.Baraniuk, A contextual bandits framework for personalized learning action selection, in: EDM, 2016. http:\/\/www.educationaldatamining.org\/EDM2016\/proceedings\/paper_18.pdf."},{"key":"ref104","doi-asserted-by":"publisher","DOI":"10.5555\/1018409.1018782"},{"key":"ref105","doi-asserted-by":"publisher","DOI":"10.1007\/978-1-4614-4803-7"},{"key":"ref106","doi-asserted-by":"publisher","DOI":"10.15302\/J-ENG-2015024"},{"key":"ref107","doi-asserted-by":"publisher","DOI":"10.1145\/1772690.1772758"},{"key":"ref108","doi-asserted-by":"publisher","DOI":"10.1145\/3121050.3121098"},{"key":"ref109","doi-asserted-by":"publisher","DOI":"10.5555\/2772879.2772954"},{"key":"ref110","doi-asserted-by":"publisher","DOI":"10.1109\/SCC.2017.24"},{"key":"ref111","doi-asserted-by":"publisher","DOI":"10.1007\/BF00992699"},{"key":"ref112","doi-asserted-by":"publisher","DOI":"10.24963\/ijcai.2019\/710"},{"key":"ref113","doi-asserted-by":"publisher","DOI":"10.1109\/ICHI.2017.45"},{"key":"ref114","doi-asserted-by":"publisher","DOI":"10.1109\/TKDE.2011.116"},{"key":"ref115","doi-asserted-by":"publisher","DOI":"10.1016\/j.jare.2015.06.005"},{"key":"ref116","doi-asserted-by":"publisher","DOI":"10.1109\/NER.2013.6696208"},{"key":"ref117","doi-asserted-by":"publisher","DOI":"10.1145\/1089827.1089838"},{"key":"ref118","unstructured":"P.Maes and R.Kozierok, Learning interface agents, in: AAAI, Vol. 93, 1993, pp. 459\u2013465. https:\/\/www.aaai.org\/Papers\/AAAI\/1993\/AAAI93-069.pdf."},{"key":"ref119","doi-asserted-by":"publisher","DOI":"10.1007\/s10257-013-0222-3"},{"key":"ref120","doi-asserted-by":"publisher","DOI":"10.1145\/1282100.1282114"},{"key":"ref121","unstructured":"A.Malpani, B.Ravindran and H.Murthy, Personalized intelligent tutoring system using reinforcement learning, in: FLAIRS Conference, 2011. https:\/\/www.aaai.org\/ocs\/index.php\/FLAIRS\/FLAIRS11\/paper\/viewPaper\/2597."},{"key":"ref122","doi-asserted-by":"publisher","DOI":"10.1145\/345124.345136"},{"key":"ref123","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2017.7953377"},{"key":"ref124","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-540-30139-4_53"},{"key":"ref125","doi-asserted-by":"publisher","DOI":"10.1016\/j.eswa.2009.02.041"},{"key":"ref126","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-540-89722-4_15"},{"key":"ref127","doi-asserted-by":"publisher","DOI":"10.1145\/3099023.3099070"},{"key":"ref128","doi-asserted-by":"publisher","DOI":"10.1109\/ICIP.2000.899351"},{"key":"ref129","first-page":"2069","volume":"13","author":"May B.C.","year":"2012","journal-title":"Journal of Machine Learning Research"},{"key":"ref130","doi-asserted-by":"publisher","DOI":"10.1145\/3208903.3208907"},{"key":"ref131","doi-asserted-by":"publisher","DOI":"10.1145\/3208903.3214348"},{"key":"ref132","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-69459-7_12"},{"key":"ref133","unstructured":"V.Mnih, K.Kavukcuoglu, D.Silver, A.Graves, I.Antonoglou, D.Wierstra and M.Riedmiller, Playing atari with deep reinforcement learning, Preprint, arXiv:1312.5602, 2013."},{"key":"ref134","doi-asserted-by":"crossref","unstructured":"K.Mo, Y.Zhang, S.Li, J.Li and Q.Yang, Personalizing a dialogue system with transfer reinforcement learning, in: AAAI, 2018. https:\/\/www.aaai.org\/ocs\/index.php\/AAAI\/AAAI18\/paper\/viewPaper\/16104.","DOI":"10.1609\/aaai.v32i1.11938"},{"key":"ref135","doi-asserted-by":"publisher","DOI":"10.7326\/0003-4819-151-4-200908180-00135"},{"key":"ref136","unstructured":"T.M.Moldovan and P.Abbeel, Safe exploration in Markov decision processes, Preprint, arXiv:1205.4810, 2012."},{"key":"ref137","doi-asserted-by":"publisher","DOI":"10.1145\/2365952.2365971"},{"key":"ref138","doi-asserted-by":"publisher","DOI":"10.1109\/ROMAN.2007.4415198"},{"key":"ref139","doi-asserted-by":"publisher","DOI":"10.5555\/3172077.3172241"},{"key":"ref140","doi-asserted-by":"publisher","DOI":"10.1109\/EMBC.2016.7591355"},{"key":"ref141","doi-asserted-by":"publisher","DOI":"10.1016\/j.media.2016.04.003"},{"key":"ref142","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-24571-3_53"},{"key":"ref143","unstructured":"D.W.Oard, J.Kim et al., Implicit feedback for recommender systems, in: Proceedings of the AAAI Workshop on Recommender Systems, AAAI Press, Menlo Park, CA, 1998, pp. 81\u201383. https:\/\/www.aaai.org\/Papers\/Workshops\/1998\/WS-98-08\/WS98-08-021.pdf."},{"key":"ref144","doi-asserted-by":"publisher","DOI":"10.1609\/aimag.v26i3.1823"},{"key":"ref145","doi-asserted-by":"crossref","unstructured":"P.Ondruska and I.Posner, The route not taken: Driver-centric estimation of electric vehicle range, in: Twenty-Fourth International Conference on Automated Planning and Scheduling, 2014. https:\/\/www.aaai.org\/ocs\/index.php\/ICAPS\/ICAPS14\/paper\/viewPaper\/7899.","DOI":"10.1609\/icaps.v24i1.13663"},{"key":"ref146","doi-asserted-by":"publisher","DOI":"10.1109\/TKDE.2009.191"},{"key":"ref147","doi-asserted-by":"publisher","DOI":"10.1109\/ICETCCT.2017.8280344"},{"key":"ref148","doi-asserted-by":"publisher","DOI":"10.1109\/URAI.2017.7992879"},{"key":"ref149","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-13823-7_31"},{"key":"ref150","doi-asserted-by":"publisher","DOI":"10.1109\/EUSIPCO.2016.7760594"},{"key":"ref151","doi-asserted-by":"publisher","DOI":"10.5220\/0002629501400145"},{"key":"ref152","doi-asserted-by":"publisher","DOI":"10.1109\/SURV.2013.042313.00197"},{"key":"ref153","first-page":"803","volume":"3","author":"Perkins T.J.","year":"2002","journal-title":"Journal of Machine Learning Research"},{"issue":"5","key":"ref154","first-page":"108","volume":"71","author":"Pine B.J.","year":"1993","journal-title":"Harvard Business Review"},{"key":"ref155","doi-asserted-by":"publisher","DOI":"10.1016\/j.drugalcdep.2007.01.005"},{"key":"ref156","doi-asserted-by":"publisher","DOI":"10.1016\/j.conengprac.2016.07.014"},{"key":"ref157","unstructured":"N.Prasad, L.F.Cheng, C.Chivers, M.Draugelis and B.E.Engelhardt, A reinforcement learning approach to weaning of mechanical ventilation in intensive care units, Preprint, arXiv:1704.06300, 2017."},{"key":"ref158","doi-asserted-by":"publisher","DOI":"10.1109\/WI.2005.115"},{"key":"ref159","unstructured":"F.D.Priscoli, L.Fogliati, A.Palo and A.Pietrabissa, Dynamic class of service mapping for quality of experience control in future networks, in: WTC 2014; World Telecommunications Congress 2014, VDE, 2014, pp. 1\u20136. https:\/\/www.vde-verlag.de\/proceedings-de\/453602012.html."},{"key":"ref160","doi-asserted-by":"publisher","DOI":"10.1145\/2959100.2959139"},{"key":"ref161","doi-asserted-by":"publisher","DOI":"10.1109\/MITE.2014.7020289"},{"key":"ref162","doi-asserted-by":"publisher","DOI":"10.1145\/223355.223409"},{"key":"ref163","doi-asserted-by":"publisher","DOI":"10.1145\/245108.245121"},{"key":"ref164","doi-asserted-by":"publisher","DOI":"10.1007\/978-0-387-85820-3"},{"key":"ref165","doi-asserted-by":"publisher","DOI":"10.1145\/345124.345133"},{"key":"ref166","doi-asserted-by":"publisher","DOI":"10.1007\/11564096_32"},{"key":"ref167","doi-asserted-by":"publisher","DOI":"10.1145\/3029798.3038381"},{"key":"ref168","doi-asserted-by":"publisher","DOI":"10.1109\/THMS.2017.2767286"},{"key":"ref169","doi-asserted-by":"publisher","DOI":"10.1145\/2959100.2959139"},{"key":"ref170","unstructured":"S.Russell and P.Norvig, Artificial Intelligence: A Modern Approach, Prentice-Hall, Egnlewood Cliffs, NJ, 1995. ISBN 0136042597."},{"key":"ref171","doi-asserted-by":"publisher","DOI":"10.1109\/ICCITECHN.2008.4803023"},{"key":"ref172","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-540-72079-9_9"},{"key":"ref173","doi-asserted-by":"publisher","DOI":"10.1109\/SeGAH.2017.7939260"},{"key":"ref174","doi-asserted-by":"publisher","DOI":"10.1145\/325737.325859"},{"key":"ref175","doi-asserted-by":"publisher","DOI":"10.1145\/336595.337546"},{"key":"ref176","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-74690-6_22"},{"key":"ref177","doi-asserted-by":"publisher","DOI":"10.1145\/2930238.2930247"},{"key":"ref178","doi-asserted-by":"publisher","DOI":"10.1007\/s10994-010-5229-0"},{"key":"ref179","doi-asserted-by":"publisher","DOI":"10.1176\/appi.ajp.2010.09111680"},{"key":"ref180","doi-asserted-by":"publisher","DOI":"10.1109\/JBHI.2015.2414934"},{"key":"ref181","doi-asserted-by":"publisher","DOI":"10.5555\/1630659.1630892"},{"key":"ref182","doi-asserted-by":"publisher","DOI":"10.1109\/COASE.2016.7743527"},{"key":"ref183","doi-asserted-by":"crossref","unstructured":"A.Srivihok and P.Sukonmanee, Intelligent agent for e-tourism: Personalization travel support agent using reinforcement learning, in: WWW 2005, 2005. http:\/\/ceur-ws.org\/Vol-143\/paper12.pdf.","DOI":"10.1145\/1089551.1089606"},{"key":"ref184","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2013.6639266"},{"key":"ref185","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2014.2375572"},{"key":"ref186","doi-asserted-by":"publisher","DOI":"10.1016\/B978-1-55860-141-3.50030-4"},{"key":"ref187","doi-asserted-by":"publisher","DOI":"10.5555\/2998828.2998974"},{"key":"ref188","unstructured":"R.S.Sutton and A.G.Barto, Reinforcement Learning: An Introduction, MIT Press, Cambridge, MA, 2018. ISBN 9780262193986."},{"key":"ref189","doi-asserted-by":"publisher","DOI":"10.5555\/3009657.3009806"},{"key":"ref190","doi-asserted-by":"publisher","DOI":"10.2200\/S00268ED1V01Y201005AIM009"},{"key":"ref191","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-03098-8_19"},{"key":"ref192","doi-asserted-by":"publisher","DOI":"10.1145\/1363686.1363954"},{"key":"ref193","doi-asserted-by":"publisher","DOI":"10.1145\/1297231.1297250"},{"key":"ref194","doi-asserted-by":"publisher","DOI":"10.1145\/2645710.2645732"},{"key":"ref195","doi-asserted-by":"publisher","DOI":"10.1145\/2766462.2767707"},{"key":"ref196","doi-asserted-by":"publisher","DOI":"10.1145\/2505515.2514700"},{"key":"ref197","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-71246-8_17"},{"key":"ref198","doi-asserted-by":"publisher","DOI":"10.1109\/PERCOMW.2016.7457110"},{"key":"ref199","doi-asserted-by":"publisher","DOI":"10.1145\/203330.203343"},{"key":"ref200","doi-asserted-by":"publisher","DOI":"10.5555\/2832415.2832500"},{"key":"ref201","doi-asserted-by":"publisher","DOI":"10.1145\/2740908.2741998"},{"key":"ref202","unstructured":"P.Thomas and E.Brunskill, Data-efficient off-policy policy evaluation for reinforcement learning, in: International Conference on Machine Learning, 2016, pp. 2139\u20132148. http:\/\/proceedings.mlr.press\/v48\/thomasa16.html."},{"key":"ref203","unstructured":"P.S.Thomas, Safe reinforcement learning, 2015. https:\/\/scholarworks.umass.edu\/dissertations_2\/514."},{"key":"ref204","doi-asserted-by":"publisher","DOI":"10.5555\/2888116.2888134"},{"key":"ref205","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-59394-4_6"},{"key":"ref206","doi-asserted-by":"publisher","DOI":"10.1002\/mp.12625"},{"key":"ref207","doi-asserted-by":"publisher","DOI":"10.1145\/2910674.2935849"},{"key":"ref208","doi-asserted-by":"publisher","DOI":"10.1145\/2769493.2769507"},{"key":"ref209","doi-asserted-by":"publisher","DOI":"10.1145\/2910674.2935857"},{"key":"ref210","doi-asserted-by":"publisher","DOI":"10.1145\/3056540.3076191"},{"key":"ref211","doi-asserted-by":"publisher","DOI":"10.5555\/2615731.2617516"},{"key":"ref212","doi-asserted-by":"publisher","DOI":"10.5555\/3016100.3016191"},{"key":"ref213","doi-asserted-by":"publisher","DOI":"10.1109\/ICORR.2017.8009453"},{"key":"ref214","doi-asserted-by":"publisher","DOI":"10.1109\/COMPSACW.2012.38"},{"key":"ref215","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-48279-8_24"},{"key":"ref216","doi-asserted-by":"publisher","DOI":"10.5555\/3172077.3172427"},{"key":"ref217","doi-asserted-by":"publisher","DOI":"10.1145\/2648583"},{"key":"ref218","doi-asserted-by":"publisher","DOI":"10.1109\/WI-IAT.2015.108"},{"key":"ref219","doi-asserted-by":"publisher","DOI":"10.1007\/BF00992698"},{"key":"ref220","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-27645-3"},{"key":"ref221","doi-asserted-by":"publisher","DOI":"10.1109\/CDC.2017.8264410"},{"key":"ref222","doi-asserted-by":"publisher","DOI":"10.1109\/TSP.2016.2595495"},{"key":"ref223","doi-asserted-by":"publisher","DOI":"10.1137\/1.9781611975321.71"},{"key":"ref224","doi-asserted-by":"publisher","DOI":"10.1016\/j.neunet.2018.03.009"},{"key":"ref225","doi-asserted-by":"publisher","DOI":"10.1145\/3077136.3080706"},{"key":"ref226","doi-asserted-by":"publisher","DOI":"10.1016\/S0167-9236(02)00077-5"},{"key":"ref227","doi-asserted-by":"publisher","DOI":"10.5555\/3042573.3042700"},{"key":"ref228","doi-asserted-by":"publisher","DOI":"10.5772\/13723"},{"key":"ref229","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-540-85867-6_30"},{"key":"ref230","doi-asserted-by":"publisher","DOI":"10.1145\/2939672.2939878"},{"key":"ref231","doi-asserted-by":"publisher","DOI":"10.1080\/088395101750363993"},{"key":"ref232","doi-asserted-by":"publisher","DOI":"10.1145\/3097983.3098109"},{"key":"ref233","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-46687-3_9"},{"key":"ref234","doi-asserted-by":"publisher","DOI":"10.1002\/sim.3720"},{"key":"ref235","doi-asserted-by":"publisher","DOI":"10.1109\/ICWS.2017.93"},{"key":"ref236","doi-asserted-by":"publisher","DOI":"10.1111\/j.1541-0420.2011.01572.x"},{"key":"ref237","doi-asserted-by":"publisher","DOI":"10.1109\/CoASE.2013.6653964"},{"key":"ref238","doi-asserted-by":"publisher","DOI":"10.1145\/3178876.3185994"},{"key":"ref239","doi-asserted-by":"publisher","DOI":"10.5555\/2936924.2937192"},{"key":"ref240","doi-asserted-by":"publisher","DOI":"10.5555\/3061053.3061129"},{"key":"ref241","unstructured":"M.Zhou, Y.D.Mintz, Y.Fukuoka, K.Y.Goldberg, E.Flowers, P.Kaminsky, A.Castillejo and A.Aswani, Personalizing mobile fitness apps using reinforcement learning, in: IUI Workshops, 2018. http:\/\/ceur-ws.org\/Vol-2068\/humanize7.pdf."},{"key":"ref242","doi-asserted-by":"publisher","DOI":"10.1111\/biom.12593"}],"container-title":["Data Science"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/journals.sagepub.com\/doi\/pdf\/10.3233\/DS-200028","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/journals.sagepub.com\/doi\/full-xml\/10.3233\/DS-200028","content-type":"application\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/journals.sagepub.com\/doi\/pdf\/10.3233\/DS-200028","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,4,28]],"date-time":"2026-04-28T18:10:05Z","timestamp":1777399805000},"score":1,"resource":{"primary":{"URL":"https:\/\/journals.sagepub.com\/doi\/10.3233\/DS-200028"}},"subtitle":[],"editor":[{"ORCID":"https:\/\/orcid.org\/0000-0003-0370-6749","authenticated-orcid":false,"given":"Izabela","family":"Moise","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"editor"}]}],"short-title":[],"issued":{"date-parts":[[2020,4,10]]},"references-count":242,"journal-issue":{"issue":"2","published-print":{"date-parts":[[2020,11,11]]}},"alternative-id":["10.3233\/DS-200028"],"URL":"https:\/\/doi.org\/10.3233\/ds-200028","relation":{},"ISSN":["2451-8484","2451-8492"],"issn-type":[{"value":"2451-8484","type":"print"},{"value":"2451-8492","type":"electronic"}],"subject":[],"published":{"date-parts":[[2020,4,10]]}}}