{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,8,5]],"date-time":"2026-08-05T01:49:04Z","timestamp":1785894544179,"version":"3.56.0"},"reference-count":44,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,10,1]],"date-time":"2026-10-01T00:00:00Z","timestamp":1790812800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,10,1]],"date-time":"2026-10-01T00:00:00Z","timestamp":1790812800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,6,8]],"date-time":"2026-06-08T00:00:00Z","timestamp":1780876800000},"content-version":"vor","delay-in-days":0,"URL":"http:\/\/creativecommons.org\/licenses\/by-nc-nd\/4.0\/"}],"funder":[{"DOI":"10.13039\/100031478","name":"NextGenerationEU","doi-asserted-by":"publisher","id":[{"id":"10.13039\/100031478","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Information Systems"],"published-print":{"date-parts":[[2026,10]]},"DOI":"10.1016\/j.is.2026.102763","type":"journal-article","created":{"date-parts":[[2026,6,6]],"date-time":"2026-06-06T15:29:56Z","timestamp":1780759796000},"page":"102763","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"C","title":["Learning optimal policies from event logs through reinforcement learning: A comparison of deep and MDP-based approaches"],"prefix":"10.1016","volume":"141","author":[{"given":"Stefano","family":"Branchi","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-8179-9146","authenticated-orcid":false,"given":"Andrei","family":"Buliga","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Chiara","family":"Di Francescomarino","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Chiara","family":"Ghidini","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Riccardo","family":"Graziosi","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Francesca","family":"Meneghello","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-7277-2999","authenticated-orcid":false,"given":"Massimiliano","family":"Ronzani","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.is.2026.102763_b1","series-title":"Business Process Management Forum","first-page":"91","article-title":"Alarm-based prescriptive process monitoring","author":"Teinemaa","year":"2018"},{"key":"10.1016\/j.is.2026.102763_b2","series-title":"Fire now, fire later: alarm-based systems for prescriptive process monitoring","author":"Fahrenkrog-Petersen","year":"2019"},{"key":"10.1016\/j.is.2026.102763_b3","series-title":"Int. Conf. on Advanced Information Systems Engineering","first-page":"547","article-title":"Proactive process adaptation using deep learning ensembles","author":"Metzger","year":"2019"},{"key":"10.1016\/j.is.2026.102763_b4","series-title":"Int. Conf. on Business Process Management","first-page":"273","article-title":"Triggering proactive business process adaptations via online reinforcement learning","author":"Metzger","year":"2020"},{"key":"10.1016\/j.is.2026.102763_b5","series-title":"Process Mining Workshops - ICPM 2021, Revised Sel. Papers","first-page":"180","article-title":"Prescriptive process monitoring under resource constraints: A causal inference approach","volume":"433","author":"Shoush","year":"2021"},{"key":"10.1016\/j.is.2026.102763_b6","article-title":"Prescriptive process monitoring under resource constraints: A reinforcement learning approach","author":"Shoush","year":"2024","journal-title":"KI - K\u00fcnstliche Intell."},{"key":"10.1016\/j.is.2026.102763_b7","series-title":"2nd Int. Conf. on Process Mining (ICPM 2020)","first-page":"9","article-title":"Design and evaluation of a process-aware recommender system based on prescriptive analytics","author":"de Leoni","year":"2020"},{"key":"10.1016\/j.is.2026.102763_b8","series-title":"Business Process Management","first-page":"345","article-title":"Experience-based resource allocation for remaining time optimization","author":"Padella","year":"2024"},{"key":"10.1016\/j.is.2026.102763_b9","doi-asserted-by":"crossref","unstructured":"G. Park, M. Song, Prediction-based Resource Allocation using LSTM and Minimum Cost and Maximum Flow Algorithm, in: 2019 Int. Conf. on Process Mining, 2019, pp. 121\u2013128.","DOI":"10.1109\/ICPM.2019.00027"},{"key":"10.1016\/j.is.2026.102763_b10","series-title":"Advanced Information Systems Engineering","first-page":"575","article-title":"Context-aware analysis of past process executions to aid resource allocation decisions","author":"Sindhgatta","year":"2016"},{"key":"10.1016\/j.is.2026.102763_b11","series-title":"17th International Conference on Business Process Management 2019 Industry Forum","first-page":"61","article-title":"What if process predictions are not followed by good recommendations?","author":"Dees","year":"2019"},{"key":"10.1016\/j.is.2026.102763_b12","series-title":"Wirtschaftsinformatik (Zentrale Tracks)","first-page":"364","article-title":"From predictive to prescriptive process monitoring: Recommending the next best actions instead of calculating the next most likely events.","author":"Weinzierl","year":"2020"},{"key":"10.1016\/j.is.2026.102763_b13","series-title":"Int. Conf. on Business Information Systems","first-page":"25","article-title":"Prescriptive analytics for recommendation-based business process optimization","author":"Gr\u00f6ger","year":"2014"},{"key":"10.1016\/j.is.2026.102763_b14","series-title":"Business Process Management Forum - BPM 2022, Proc.","first-page":"137","article-title":"Learning to act: A reinforcement learning approach to recommend the best next activities","volume":"458","author":"Branchi","year":"2022"},{"key":"10.1016\/j.is.2026.102763_b15","doi-asserted-by":"crossref","DOI":"10.1016\/j.datak.2025.102412","article-title":"Reinforcement learning for optimizing responses in care processes","volume":"157","author":"Hundogan","year":"2025","journal-title":"Data Knowl. Eng."},{"key":"10.1016\/j.is.2026.102763_b16","doi-asserted-by":"crossref","first-page":"171528","DOI":"10.1109\/ACCESS.2020.3024979","article-title":"Optimizing transportation dynamics at a city-scale using a reinforcement learning framework","volume":"8","author":"Khaidem","year":"2020","journal-title":"IEEE Access"},{"key":"10.1016\/j.is.2026.102763_b17","series-title":"Thirty-Fifth AAAI Conference on Artificial Intelligence, AAAI 2021","first-page":"11895","article-title":"Synthesis of search heuristics for temporal planning via reinforcement learning","author":"Micheli","year":"2021"},{"issue":"7587","key":"10.1016\/j.is.2026.102763_b18","doi-asserted-by":"crossref","first-page":"484","DOI":"10.1038\/nature16961","article-title":"Mastering the game of go with deep neural networks and tree search","volume":"529","author":"Silver","year":"2016","journal-title":"Nature"},{"key":"10.1016\/j.is.2026.102763_b19","series-title":"Proc of the 2016 Conference on Empirical Methods in Natural Language Processing","first-page":"1192","article-title":"Deep reinforcement learning for dialogue generation","author":"Li","year":"2016"},{"issue":"6","key":"10.1016\/j.is.2026.102763_b20","doi-asserted-by":"crossref","first-page":"26","DOI":"10.1109\/MSP.2017.2743240","article-title":"Deep reinforcement learning: A brief survey","volume":"34","author":"Arulkumaran","year":"2017","journal-title":"IEEE Signal Process. Mag."},{"key":"10.1016\/j.is.2026.102763_b21","series-title":"Reinforcement Learning: An Introduction","author":"Sutton","year":"2018"},{"key":"10.1016\/j.is.2026.102763_b22","series-title":"Process Mining Handbook","first-page":"37","article-title":"Foundations of process discovery","volume":"vol. 448","author":"van der Aalst","year":"2022"},{"key":"10.1016\/j.is.2026.102763_b23","series-title":"Business Process Management Workshops, BPM 2007 International Workshops, BPI, BPD, CBP, ProHealth, RefMod, Semantics4ws, Brisbane, Australia, September 24, 2007, Revised Selected Papers","first-page":"66","article-title":"Business process simulation for operational decision support","volume":"4928","author":"Wynn","year":"2007"},{"issue":"1","key":"10.1016\/j.is.2026.102763_b24","doi-asserted-by":"crossref","first-page":"127","DOI":"10.1016\/j.datak.2010.09.002","article-title":"Reinforcement learning based resource allocation in business process management","volume":"70","author":"Huang","year":"2011","journal-title":"Data Knowl. Eng."},{"key":"10.1016\/j.is.2026.102763_b25","series-title":"Business Process Management - 22nd International Conference, BPM 2024, Krakow, Poland, September 1-6, 2024, Proceedings","first-page":"167","article-title":"Optimizing resource allocation policies in real-world business processes using hybrid process simulation and deep reinforcement learning","volume":"14940","author":"Meneghello","year":"2024"},{"key":"10.1016\/j.is.2026.102763_b26","series-title":"Business Process Management Workshops","first-page":"245","article-title":"Timed process interventions: Causal inference vs. Reinforcement learning","author":"Weytjens","year":"2024"},{"key":"10.1016\/j.is.2026.102763_b27","doi-asserted-by":"crossref","DOI":"10.1016\/j.softx.2025.102157","article-title":"SIMOD: automated discovery of business process simulation models","volume":"30","author":"Chapela-Campa","year":"2025","journal-title":"SoftwareX"},{"key":"10.1016\/j.is.2026.102763_b28","doi-asserted-by":"crossref","DOI":"10.1016\/j.is.2024.102472","article-title":"Runtime integration of machine learning and simulation for business processes: Time and decision mining predictions","volume":"128","author":"Meneghello","year":"2025","journal-title":"Inf. Syst."},{"key":"10.1016\/j.is.2026.102763_b29","series-title":"BPI challenge 2012","author":"van Dongen","year":"2012"},{"key":"10.1016\/j.is.2026.102763_b30","series-title":"BPI challenge 2017","author":"van Dongen","year":"2017"},{"key":"10.1016\/j.is.2026.102763_b31","doi-asserted-by":"crossref","DOI":"10.7717\/peerj-cs.1097","article-title":"Prescriptive process monitoring: Quo vadis?","volume":"8","author":"Kubrak","year":"2022","journal-title":"PeerJ Comput. Sci."},{"key":"10.1016\/j.is.2026.102763_b32","series-title":"Business Process Management Forum - BPM Forum 2020, Seville, Spain, September 13-18, 2020, Proceedings","first-page":"193","article-title":"Prescriptive business process monitoring for recommending next best actions","volume":"vol. 392","author":"Weinzierl","year":"2020"},{"key":"10.1016\/j.is.2026.102763_b33","series-title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems","author":"Levine","year":"2020"},{"key":"10.1016\/j.is.2026.102763_b34","series-title":"Advances in Neural Information Processing Systems","first-page":"1179","article-title":"Conservative Q-learning for offline reinforcement learning","volume":"33","author":"Kumar","year":"2020"},{"key":"10.1016\/j.is.2026.102763_b35","first-page":"1","article-title":"A survey on offline reinforcement learning: Taxonomy, review, and open problems","volume":"PP","author":"Prudencio","year":"2023","journal-title":"IEEE Trans. Neural Netw. Learn. Syst."},{"key":"10.1016\/j.is.2026.102763_b36","series-title":"Least Squares Quantization in PCM","author":"Lloyd","year":"1957"},{"key":"10.1016\/j.is.2026.102763_b37","series-title":"Process Mining Workshops - ICPM 2020, Revised Selected Papers","first-page":"124","article-title":"A preliminary study on the application of reinforcement learning for predictive process monitoring","volume":"vol. 406","author":"Chiorrini","year":"2020"},{"key":"10.1016\/j.is.2026.102763_b38","series-title":"Business Process Management - 16th Int. Conf., BPM 2018, Proceedings","first-page":"462","article-title":"Predictive process monitoring methods: Which one suits me best?","volume":"11080","author":"Di Francescomarino","year":"2018"},{"key":"10.1016\/j.is.2026.102763_b39","series-title":"Proc. of the Int. Workshop on BPM Problems To Solve before We Die (PROBLEMS 2021)","first-page":"23","article-title":"Constructing digital twins for accurate and reliable what-if business process analysis","volume":"vol. 2938","author":"Dumas","year":"2021"},{"key":"10.1016\/j.is.2026.102763_b40","series-title":"Business Process Management Workshops - BPM 2013 International Workshops, Beijing, China, August 26, 2013, Revised Papers","first-page":"66","article-title":"Discovering block-structured process models from event logs containing infrequent behaviour","volume":"vol. 171","author":"Leemans","year":"2013"},{"key":"10.1016\/j.is.2026.102763_b41","series-title":"Business Process Management - 23rd International Conference, BPM 2025, Seville, Spain, August 31 - September 5, 2025, Proceedings","first-page":"397","article-title":"Optimization of activity batching policies in business processes","volume":"vol. 16044","author":"L\u00f3pez-Pintado","year":"2025"},{"key":"10.1016\/j.is.2026.102763_b42","doi-asserted-by":"crossref","DOI":"10.1016\/j.softx.2025.102157","article-title":"SIMOD: automated discovery of business process simulation models","volume":"30","author":"Chapela-Campa","year":"2025","journal-title":"SoftwareX"},{"key":"10.1016\/j.is.2026.102763_b43","series-title":"6th International Conference on Process Mining, ICPM 2024, Kgs. Lyngby, Denmark, October 14-18, 2024","first-page":"97","article-title":"AgentSimulator: An agent-based approach for data-driven business process simulation","author":"Kirchdorfer","year":"2024"},{"key":"10.1016\/j.is.2026.102763_b44","series-title":"SimBank: from simulation to solution in prescriptive process monitoring","author":"Moor","year":"2025"}],"container-title":["Information Systems"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0306437926000773?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0306437926000773?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,8,5]],"date-time":"2026-08-05T01:07:19Z","timestamp":1785892039000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0306437926000773"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,10]]},"references-count":44,"alternative-id":["S0306437926000773"],"URL":"https:\/\/doi.org\/10.1016\/j.is.2026.102763","relation":{},"ISSN":["0306-4379"],"issn-type":[{"value":"0306-4379","type":"print"}],"subject":[],"published":{"date-parts":[[2026,10]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"Learning optimal policies from event logs through reinforcement learning: A comparison of deep and MDP-based approaches","name":"articletitle","label":"Article Title"},{"value":"Information Systems","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.is.2026.102763","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 The Authors. Published by Elsevier Ltd.","name":"copyright","label":"Copyright"}],"article-number":"102763"}}