{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,9]],"date-time":"2026-04-09T18:14:19Z","timestamp":1775758459535,"version":"3.50.1"},"reference-count":52,"publisher":"Elsevier BV","issue":"1","license":[{"start":{"date-parts":[[2026,8,1]],"date-time":"2026-08-01T00:00:00Z","timestamp":1785542400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,8,1]],"date-time":"2026-08-01T00:00:00Z","timestamp":1785542400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2025,12,22]],"date-time":"2025-12-22T00:00:00Z","timestamp":1766361600000},"content-version":"vor","delay-in-days":0,"URL":"http:\/\/creativecommons.org\/licenses\/by\/4.0\/"}],"funder":[{"DOI":"10.13039\/501100016241","name":"TKI Dinalog","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100016241","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["European Journal of Operational Research"],"published-print":{"date-parts":[[2026,8]]},"DOI":"10.1016\/j.ejor.2025.12.033","type":"journal-article","created":{"date-parts":[[2025,12,24]],"date-time":"2025-12-24T16:01:50Z","timestamp":1766592110000},"page":"153-173","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"title":["Zero-shot generalization in inventory management: Train, then Estimate and Decide"],"prefix":"10.1016","volume":"333","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-2921-6900","authenticated-orcid":false,"given":"Tarkan","family":"Temiz\u00f6z","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3181-8879","authenticated-orcid":false,"given":"Christina","family":"Imdahl","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-4083-0036","authenticated-orcid":false,"given":"Remco","family":"Dijkman","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-7756-7377","authenticated-orcid":false,"given":"Douniel","family":"Lamghari-Idrissi","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3620-4067","authenticated-orcid":false,"given":"Willem","family":"Van Jaarsveld","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"78","reference":[{"issue":"4","key":"10.1016\/j.ejor.2025.12.033_bib0001","doi-asserted-by":"crossref","first-page":"623","DOI":"10.1017\/S0269964800004101","article-title":"Fitting discrete distributions on the first two moments","volume":"9","author":"Adan","year":"1995","journal-title":"Probability in the Engineering and Informational Sciences"},{"issue":"3","key":"10.1016\/j.ejor.2025.12.033_bib0002","doi-asserted-by":"crossref","first-page":"1646","DOI":"10.1287\/opre.2022.2263","article-title":"Learning in structured MDPs with convex cost functions: Improved regret bounds for inventory management","volume":"70","author":"Agrawal","year":"2022","journal-title":"Operations Research"},{"key":"10.1016\/j.ejor.2025.12.033_bib0003","doi-asserted-by":"crossref","DOI":"10.1080\/00207543.2025.2489755","article-title":"Solving dual sourcing problems with supply mode dependent failure rates","author":"Akkerman","year":"2025","journal-title":"International Journal of Production Research"},{"key":"10.1016\/j.ejor.2025.12.033_bib0004","article-title":"Adaptive multi-armed bandits for non-stationary inventory control","author":"Amiri","year":"2023","journal-title":"Available at SSRN 4650653"},{"key":"10.1016\/j.ejor.2025.12.033_bib0005","unstructured":"Andaz, S., Eisenach, C., Madeka, D., Torkkola, K., Jia, R., Foster, D., & Kakade, S. (2023). Learning an inventory control policy with general inventory arrival dynamics. arXiv preprint arXiv: 2310.17168."},{"key":"10.1016\/j.ejor.2025.12.033_bib0006","doi-asserted-by":"crossref","DOI":"10.1007\/978-3-319-15729-0","article-title":"Inventory Control","author":"Axs\u00e4ter","year":"2015"},{"key":"10.1016\/j.ejor.2025.12.033_bib0007","article-title":"Asymptotic optimality of semi-open-loop policies in inventory models with stochastic lead times","author":"Bai","year":"2023","journal-title":"Available at SSRN 4362329"},{"key":"10.1016\/j.ejor.2025.12.033_bib0008","doi-asserted-by":"crossref","DOI":"10.1016\/j.eswa.2024.123541","article-title":"Contextual reinforcement learning for supply chain management","volume":"249","author":"Batsis","year":"2024","journal-title":"Expert Systems with Applications"},{"issue":"2","key":"10.1016\/j.ejor.2025.12.033_bib0009","doi-asserted-by":"crossref","first-page":"401","DOI":"10.1016\/j.ejor.2021.07.016","article-title":"Deep reinforcement learning for inventory control: A roadmap","volume":"298","author":"Boute","year":"2022","journal-title":"European Journal of Operational Research"},{"key":"10.1016\/j.ejor.2025.12.033_bib0010","article-title":"Learning to order for inventory systems with lost sales and uncertain supplies","author":"Chen","year":"2023","journal-title":"Management Science"},{"key":"10.1016\/j.ejor.2025.12.033_bib0011","article-title":"Learning in lost-sales inventory systems with stochastic lead times and random supplies","author":"Chen","year":"2023","journal-title":"Available at SSRN 4671416"},{"issue":"10","key":"10.1016\/j.ejor.2025.12.033_bib0012","doi-asserted-by":"crossref","first-page":"5722","DOI":"10.1287\/mnsc.2023.4704","article-title":"Nonstationary reinforcement learning: The blessing of (more) optimism","volume":"69","author":"Cheung","year":"2023","journal-title":"Management Science"},{"key":"10.1016\/j.ejor.2025.12.033_bib0013","unstructured":"Danihelka, I., Guez, A., Schrittwieser, J., & Silver, D. (2022). Policy improvement by planning with gumbel. In International conference on learning representations.https:\/\/openreview.net\/forum?id=bERaNdoegnO."},{"issue":"2","key":"10.1016\/j.ejor.2025.12.033_bib0014","doi-asserted-by":"crossref","first-page":"433","DOI":"10.1016\/j.ejor.2023.10.007","article-title":"Deep reinforcement learning for inventory optimization with non-stationary uncertain demand","volume":"314","author":"Dehaybe","year":"2024","journal-title":"European Journal of Operational Research"},{"issue":"1","key":"10.1016\/j.ejor.2025.12.033_bib0015","doi-asserted-by":"crossref","first-page":"9","DOI":"10.1287\/mnsc.2020.3922","article-title":"Smart \u201cpredict, then optimize\u201d","volume":"68","author":"Elmachtoub","year":"2021","journal-title":"Management Science"},{"issue":"3","key":"10.1016\/j.ejor.2025.12.033_bib0016","doi-asserted-by":"crossref","first-page":"1349","DOI":"10.1287\/msom.2021.1064","article-title":"Can deep reinforcement learning improve inventory management? performance on lost sales, dual-sourcing, and multi-echelon problems","volume":"24","author":"Gijsbrechts","year":"2022","journal-title":"Manufacturing & Service Operations Management"},{"issue":"9","key":"10.1016\/j.ejor.2025.12.033_bib0017","first-page":"6139","article-title":"Bandits atop reinforcement learning: Tackling online inventory models with cyclic demands","volume":"70","author":"Gong","year":"2024","journal-title":"Management Science"},{"key":"10.1016\/j.ejor.2025.12.033_bib0018","unstructured":"Hallak, A., Di Castro, D., & Mannor, S. (2015). Contextual Markov decision processes. arXiv preprint arXiv: 1502.02259."},{"issue":"2","key":"10.1016\/j.ejor.2025.12.033_bib0019","doi-asserted-by":"crossref","first-page":"369","DOI":"10.1287\/msom.2022.0617","article-title":"Deep policy iteration with integer programming for inventory management","volume":"27","author":"Harsha","year":"2025","journal-title":"Manufacturing & Service Operations Management"},{"issue":"1","key":"10.1016\/j.ejor.2025.12.033_bib0020","doi-asserted-by":"crossref","DOI":"10.1609\/aaai.v32i1.11694","article-title":"Deep reinforcement learning that matters","volume":"32","author":"Henderson","year":"2018","journal-title":"Proceedings of the AAAI Conference on Artificial Intelligence"},{"issue":"4","key":"10.1016\/j.ejor.2025.12.033_bib0021","doi-asserted-by":"crossref","first-page":"929","DOI":"10.1287\/opre.1100.0906","article-title":"Adaptive data-driven inventory control with censored demand based on kaplan-meier estimator","volume":"59","author":"Huh","year":"2011","journal-title":"Operations Research"},{"issue":"1","key":"10.1016\/j.ejor.2025.12.033_bib0022","doi-asserted-by":"crossref","first-page":"103","DOI":"10.1287\/moor.1080.0355","article-title":"A nonparametric asymptotic analysis of inventory planning with censored demand","volume":"34","author":"Huh","year":"2009","journal-title":"Mathematics of Operations Research"},{"key":"10.1016\/j.ejor.2025.12.033_bib0023","series-title":"Markov Decision Processes","author":"Kallenberg","year":"2016"},{"issue":"282","key":"10.1016\/j.ejor.2025.12.033_bib0024","doi-asserted-by":"crossref","first-page":"457","DOI":"10.1080\/01621459.1958.10501452","article-title":"Nonparametric estimation from incomplete observations","volume":"53","author":"Kaplan","year":"1958","journal-title":"Journal of the American Statistical Association"},{"issue":"7","key":"10.1016\/j.ejor.2025.12.033_bib0025","doi-asserted-by":"crossref","first-page":"491","DOI":"10.1287\/mnsc.16.7.491","article-title":"A dynamic inventory model with stochastic lead times","volume":"16","author":"Kaplan","year":"1970","journal-title":"Management Science"},{"key":"10.1016\/j.ejor.2025.12.033_bib0026","doi-asserted-by":"crossref","first-page":"209","DOI":"10.1023\/A:1017984413808","article-title":"Near-optimal reinforcement learning in polynomial time","volume":"49","author":"Kearns","year":"2002","journal-title":"Machine Learning"},{"key":"10.1016\/j.ejor.2025.12.033_bib0027","doi-asserted-by":"crossref","first-page":"201","DOI":"10.1613\/jair.1.14174","article-title":"A survey of zero-shot generalisation in deep reinforcement learning","volume":"76","author":"Kirk","year":"2023","journal-title":"Journal of Artificial Intelligence Research"},{"issue":"5","key":"10.1016\/j.ejor.2025.12.033_bib0028","doi-asserted-by":"crossref","first-page":"372","DOI":"10.1287\/inte.2023.1160","article-title":"Ai vs. human buyers: A study of alibaba\u2019s inventory replenishment system","volume":"53","author":"Liu","year":"2023","journal-title":"INFORMS Journal on Applied Analytics"},{"key":"10.1016\/j.ejor.2025.12.033_bib0029","unstructured":"Lobel, S., & Parr, R. (2024). An optimal tightness bound for the simulation lemma. arXiv preprint arXiv: 2406.16249."},{"issue":"4","key":"10.1016\/j.ejor.2025.12.033_bib0030","doi-asserted-by":"crossref","first-page":"1317","DOI":"10.1287\/opre.2022.0273","article-title":"Ucb-type learning algorithms with kaplan\u2013meier estimator for lost-sales inventory models with lead times","volume":"72","author":"Lyu","year":"2024","journal-title":"Operations Research"},{"key":"10.1016\/j.ejor.2025.12.033_bib0031","unstructured":"Madeka, D., Torkkola, K., Eisenach, C., Luo, A., Foster, D. P., & Kakade, S. M. (2022). Deep inventory management. arXiv preprint arXiv: 2210.03137."},{"key":"10.1016\/j.ejor.2025.12.033_bib0032","article-title":"A general-purpose deep reinforcement learning approach for dynamic inventory control","author":"Maichle","year":"2024","journal-title":"MIT Center for Transportation & Logistics Research Paper No 2024\/003, Available at SSRN 4754937"},{"issue":"1","key":"10.1016\/j.ejor.2025.12.033_bib0033","doi-asserted-by":"crossref","first-page":"158","DOI":"10.1287\/msom.2019.0805","article-title":"Data analytics in operations management: A review","volume":"22","author":"Mi\u0161i\u0107","year":"2020","journal-title":"Manufacturing & Service Operations Management"},{"key":"10.1016\/j.ejor.2025.12.033_bib0034","series-title":"Nips deep learning workshop","article-title":"Playing atari with deep reinforcement learning","author":"Mnih","year":"2013"},{"issue":"1","key":"10.1016\/j.ejor.2025.12.033_bib0035","doi-asserted-by":"crossref","first-page":"285","DOI":"10.1287\/msom.2020.0939","article-title":"A deep q-network for the beer game: Deep reinforcement learning for inventory optimization","volume":"24","author":"Oroojlooyjadid","year":"2021","journal-title":"Manufacturing & Service Operations Management"},{"key":"10.1016\/j.ejor.2025.12.033_bib0036","doi-asserted-by":"crossref","unstructured":"Ortner, R. (2024). A note on the bias and kemeny\u2019s constant in markov reward processes with an application to markov chain perturbation. arXiv preprint arXiv: 2408.04454.","DOI":"10.2139\/ssrn.4937365"},{"key":"10.1016\/j.ejor.2025.12.033_bib0037","series-title":"Foundations of stochastic inventory theory","author":"Porteus","year":"2002"},{"key":"10.1016\/j.ejor.2025.12.033_bib0038","series-title":"Markov decision processes: discrete stochastic dynamic programming","author":"Puterman","year":"2014"},{"issue":"2","key":"10.1016\/j.ejor.2025.12.033_bib0039","doi-asserted-by":"crossref","first-page":"759","DOI":"10.1287\/mnsc.2022.4564","article-title":"A practical end-to-end inventory management model with deep learning","volume":"69","author":"Qi","year":"2023","journal-title":"Management Science"},{"key":"10.1016\/j.ejor.2025.12.033_bib0040","series-title":"Inventory and production management in supply chains","article-title":"Chapter 1","author":"Silver","year":"2016"},{"key":"10.1016\/j.ejor.2025.12.033_bib0041","series-title":"Proceedings of the 40th international conference on machine learning","article-title":"Hindsight learning for MDPs with exogenous inputs","author":"Sinclair","year":"2023"},{"key":"10.1016\/j.ejor.2025.12.033_bib0042","series-title":"4th annual conference on learning for dynamics and control","first-page":"1","article-title":"Block contextual MDPs for continual learning","author":"Sodhani","year":"2022"},{"issue":"4","key":"10.1016\/j.ejor.2025.12.033_bib0043","doi-asserted-by":"crossref","first-page":"2496","DOI":"10.1287\/opre.2021.2129","article-title":"Exploiting random lead times for significant inventory cost savings","volume":"70","author":"Stolyar","year":"2022","journal-title":"Operations Research"},{"issue":"1","key":"10.1016\/j.ejor.2025.12.033_bib0044","doi-asserted-by":"crossref","first-page":"104","DOI":"10.1016\/j.ejor.2025.01.026","article-title":"Deep controlled learning for inventory control","volume":"324","author":"Temiz\u00f6z","year":"2025","journal-title":"European Journal of Operational Research"},{"key":"10.1016\/j.ejor.2025.12.033_bib0045","article-title":"Industrializing deep reinforcement learning for operational spare parts inventory management","author":"van der Haar","year":"2024","journal-title":"Available at SSRN 4999374"},{"issue":"2","key":"10.1016\/j.ejor.2025.12.033_bib0046","doi-asserted-by":"crossref","first-page":"135","DOI":"10.1007\/s00186-025-00888-1","article-title":"On non-negative auto-correlated integer demand processes","volume":"101","author":"van Hezewijk","year":"2025","journal-title":"Mathematical Methods of Operations Research"},{"key":"10.1016\/j.ejor.2025.12.033_bib0047","doi-asserted-by":"crossref","DOI":"10.1016\/j.ijpe.2023.109133","article-title":"Deep reinforcement learning for demand fulfillment in online retail","volume":"269","author":"Wang","year":"2024","journal-title":"International Journal of Production Economics"},{"issue":"1","key":"10.1016\/j.ejor.2025.12.033_bib0048","doi-asserted-by":"crossref","first-page":"61","DOI":"10.1287\/opre.2020.2019","article-title":"Technical note-understanding the performance of capped base-stock policies in lost-sales inventory models","volume":"69","author":"Xin","year":"2021","journal-title":"Operations Research"},{"key":"10.1016\/j.ejor.2025.12.033_bib0049","doi-asserted-by":"crossref","first-page":"391","DOI":"10.1007\/s10994-011-5268-1","article-title":"Robustness and generalization","volume":"86","author":"Xu","year":"2012","journal-title":"Machine Learning"},{"issue":"5","key":"10.1016\/j.ejor.2025.12.033_bib0050","doi-asserted-by":"crossref","first-page":"1962","DOI":"10.1287\/mnsc.2019.3288","article-title":"Closing the gap: A learning algorithm for lost-sales inventory systems with lead times","volume":"66","author":"Zhang","year":"2020","journal-title":"Management Science"},{"issue":"5","key":"10.1016\/j.ejor.2025.12.033_bib0051","doi-asserted-by":"crossref","first-page":"1256","DOI":"10.1287\/opre.1070.0471","article-title":"Old and new methods for lost-sales inventory systems","volume":"56","author":"Zipkin","year":"2008","journal-title":"Operations Research"},{"key":"10.1016\/j.ejor.2025.12.033_bib0052","series-title":"Foundations of inventory management","author":"Zipkin","year":"2000"}],"container-title":["European Journal of Operational Research"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S037722172501001X?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S037722172501001X?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,4,9]],"date-time":"2026-04-09T17:23:18Z","timestamp":1775755398000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S037722172501001X"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,8]]},"references-count":52,"journal-issue":{"issue":"1","published-print":{"date-parts":[[2026,8]]}},"alternative-id":["S037722172501001X"],"URL":"https:\/\/doi.org\/10.1016\/j.ejor.2025.12.033","relation":{},"ISSN":["0377-2217"],"issn-type":[{"value":"0377-2217","type":"print"}],"subject":[],"published":{"date-parts":[[2026,8]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"Zero-shot generalization in inventory management: Train, then Estimate and Decide","name":"articletitle","label":"Article Title"},{"value":"European Journal of Operational Research","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.ejor.2025.12.033","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2025 The Author(s). Published by Elsevier B.V.","name":"copyright","label":"Copyright"}]}}