{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,28]],"date-time":"2026-04-28T04:13:38Z","timestamp":1777349618260,"version":"3.51.4"},"reference-count":145,"publisher":"Springer Science and Business Media LLC","issue":"3","license":[{"start":{"date-parts":[[2025,8,18]],"date-time":"2025-08-18T00:00:00Z","timestamp":1755475200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2025,8,18]],"date-time":"2025-08-18T00:00:00Z","timestamp":1755475200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["72401173"],"award-info":[{"award-number":["72401173"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["72192832"],"award-info":[{"award-number":["72192832"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Ann Oper Res"],"published-print":{"date-parts":[[2025,10]]},"DOI":"10.1007\/s10479-025-06738-x","type":"journal-article","created":{"date-parts":[[2025,8,18]],"date-time":"2025-08-18T13:43:04Z","timestamp":1755524584000},"page":"1239-1285","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":1,"title":["Sequential decision-making under uncertainty: a robust MDPs review"],"prefix":"10.1007","volume":"353","author":[{"ORCID":"https:\/\/orcid.org\/0009-0001-8996-4732","authenticated-orcid":false,"given":"Wenfan","family":"Ou","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-7340-5680","authenticated-orcid":false,"given":"Sheng","family":"Bi","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2025,8,18]]},"reference":[{"key":"6738_CR1","unstructured":"Abdullah, M.A., Ren, H., Ammar, H.B., Milenkovic, V., Luo, R., & Zhang, M., Wang, J. (2019). Wasserstein robust reinforcement learning. arXiv preprint arXiv:1907.13196,,"},{"issue":"1","key":"6738_CR2","doi-asserted-by":"publisher","first-page":"148","DOI":"10.1287\/trsc.2018.0840","volume":"53","author":"L Agussurja","year":"2019","unstructured":"Agussurja, L., Cheng, S.-F., & Lau, H. C. (2019). A state aggregation approach for stochastic multiperiod last-mile ride-sharing problems. Transportation Science, 53(1), 148\u2013166.","journal-title":"Transportation Science"},{"key":"6738_CR3","first-page":"89","volume-title":"Near-optimal regret bounds for reinforcement learning","author":"P Auer","year":"2009","unstructured":"Auer, P., Jaksch, T., & Ortner, R. (2009). Near-optimal regret bounds for reinforcement learning (pp. 89\u201396). Advances in neural information processing systems. MIT Press."},{"issue":"3","key":"6738_CR4","doi-asserted-by":"publisher","first-page":"375","DOI":"10.1007\/s10009-023-00704-3","volume":"25","author":"T Badings","year":"2023","unstructured":"Badings, T., Sim\u00e3o, T. D., Suilen, M., & Jansen, N. (2023). Decision-making under uncertainty: beyond probabilities: Challenges and perspectives. International Journal on Software Tools for Technology Transfer, 25(3), 375\u2013391. https:\/\/doi.org\/10.1007\/s10009-023-00704-3","journal-title":"International Journal on Software Tools for Technology Transfer"},{"key":"6738_CR5","unstructured":"Badrinath, K.P., & Kalathil, D. (2021). Robust reinforcement learning using least squares policy iteration with provable performance guarantees. International conference on machine learning (pp. 511\u2013520)."},{"key":"6738_CR6","unstructured":"Bagnell, J.A., Ng, A.Y., & Schneider, J.G. (2001). Solving uncertain markov decision processes. Carnegie Mellon University."},{"issue":"3","key":"6738_CR7","doi-asserted-by":"publisher","first-page":"1757","DOI":"10.1287\/moor.2021.1187","volume":"47","author":"N B\u00e4uerle","year":"2022","unstructured":"B\u00e4uerle, N., & Glauner, A. (2022). Distributionally Robust Markov Decision Processes and Their Connection to Risk Measures. Mathematics of Operations Research, 47(3), 1757\u20131780. https:\/\/doi.org\/10.1287\/moor.2021.1187","journal-title":"Mathematics of Operations Research"},{"issue":"1","key":"6738_CR8","doi-asserted-by":"publisher","first-page":"105","DOI":"10.1287\/moor.2013.0601","volume":"39","author":"N B\u00e4uerle","year":"2014","unstructured":"B\u00e4uerle, N., & Rieder, U. (2014). More risk-sensitive markov decision processes. Mathematics of Operations Research, 39(1), 105\u2013120. https:\/\/doi.org\/10.1287\/moor.2013.0601","journal-title":"Mathematics of Operations Research"},{"key":"6738_CR9","doi-asserted-by":"crossref","unstructured":"Bayraksan, G., & Love, D.K. (2015). Data-driven stochastic programming using phi-divergences. The operations research revolution (pp. 1\u201319). Informs.","DOI":"10.1287\/educ.2015.0134"},{"key":"6738_CR10","unstructured":"Behzadian, B., Hasan\u00a0Russel, R., Petrik, M., & Pang\u00a0Ho, C. (2021). Optimizing percentile criterion using robust mdps. A.\u00a0Banerjee and K.\u00a0Fukumizu (Eds.), In: Proceedings of the 24th international conference on artificial intelligence and statistics (Vol.\u00a0130, pp. 1009\u20131017). PMLR. https:\/\/proceedings.mlr.press\/v130\/behzadian21a.html"},{"key":"6738_CR11","unstructured":"Behzadian, B., Petrik, M., & Ho, C. P. (2021). Fast algorithms for [CDATA[l_{\\infty }]]$$l_{\\infty }$$-constrained s-rectangular robust mdps. Advances in Neural Information Processing Systems, 34, 25982\u201325992."},{"issue":"3731","key":"6738_CR12","doi-asserted-by":"publisher","first-page":"34","DOI":"10.1126\/science.153.3731.34","volume":"153","author":"R Bellman","year":"1966","unstructured":"Bellman, R. (1966). Dynamic programming. Science, 153(3731), 34\u201337. https:\/\/doi.org\/10.1126\/science.153.3731.34","journal-title":"Science"},{"key":"6738_CR13","doi-asserted-by":"publisher","DOI":"10.1515\/9781400831050","volume-title":"Robust optimization","author":"A Ben-Tal","year":"2009","unstructured":"Ben-Tal, A., El Ghaoui, L., & Nemirovski, A. (2009). Robust optimization. Princeton University Press."},{"issue":"2","key":"6738_CR14","doi-asserted-by":"publisher","first-page":"351","DOI":"10.1007\/s10107-003-0454-y","volume":"99","author":"A Ben-Tal","year":"2004","unstructured":"Ben-Tal, A., Goryashko, A., Guslitzer, E., & Nemirovski, A. (2004). Adjustable robust solutions of uncertain linear programs. Mathematical programming, 99(2), 351\u2013376.","journal-title":"Mathematical programming"},{"key":"6738_CR15","doi-asserted-by":"publisher","first-page":"453","DOI":"10.1007\/s101070100286","volume":"92","author":"A Ben-Tal","year":"2002","unstructured":"Ben-Tal, A., & Nemirovski, A. (2002). Mathematical programming. Robust Optimization-Methodology and Applications, 92, 453\u2013480. https:\/\/doi.org\/10.1007\/s101070100286","journal-title":"Robust Optimization-Methodology and Applications"},{"issue":"1","key":"6738_CR16","doi-asserted-by":"publisher","first-page":"35","DOI":"10.1287\/opre.1030.0065","volume":"52","author":"D Bertsimas","year":"2004","unstructured":"Bertsimas, D., & Sim, M. (2004). The price of robustness. Operations Research, 52(1), 35\u201353. https:\/\/doi.org\/10.1287\/opre.1030.0065","journal-title":"Operations Research"},{"issue":"2","key":"6738_CR17","doi-asserted-by":"publisher","first-page":"604","DOI":"10.1287\/mnsc.2017.2952","volume":"65","author":"D Bertsimas","year":"2019","unstructured":"Bertsimas, D., Sim, M., & Zhang, M. (2019). Adaptive distributionally robust optimization. Management Science, 65(2), 604\u2013618. https:\/\/doi.org\/10.1287\/mnsc.2017.2952","journal-title":"Management Science"},{"key":"6738_CR18","unstructured":"Black, B., Dokka, T., & Kirkbride, C. (2022). Robust markov decision processes under parametric transition distributions. (Preprint at arxiv:2211.07488)"},{"issue":"2","key":"6738_CR19","doi-asserted-by":"publisher","first-page":"565","DOI":"10.1287\/moor.2018.0936","volume":"44","author":"J Blanchet","year":"2019","unstructured":"Blanchet, J., & Murthy, K. (2019). Quantifying distributional model risk via optimal transport. Mathematics of Operations Research, 44(2), 565\u2013600. https:\/\/doi.org\/10.1287\/moor.2018.0936","journal-title":"Mathematics of Operations Research"},{"key":"6738_CR20","doi-asserted-by":"crossref","unstructured":"Blanchet, J.H., & Glynn, P.W. (2015). Unbiased monte carlo for optimization and functions of expectations via multi-level randomization. 2015 winter simulation conference (wsc) (pp. 3656\u20133667).","DOI":"10.1109\/WSC.2015.7408524"},{"key":"6738_CR21","unstructured":"Blanchet, J.H., Glynn, P.W., & Pei, Y. (2019). Unbiased multilevel monte carlo: Stochastic optimization, steady-state simulation, quantiles, and other applications. arXiv preprint  arXiv:1904.09929,,"},{"key":"6738_CR22","unstructured":"Bubeck, S., & Slivkins, A. (2012). The best of both worlds: Stochastic and adversarial bandits. Conference on learning theory (pp. 42\u20131)."},{"issue":"8","key":"6738_CR23","doi-asserted-by":"publisher","first-page":"3329","DOI":"10.1287\/mnsc.2020.3603","volume":"66","author":"Z Chen","year":"2020","unstructured":"Chen, Z., Sim, M., & Xiong, P. (2020). Robust stochastic optimization made easy with rsome. Management Science, 66(8), 3329\u20133339. https:\/\/doi.org\/10.1287\/mnsc.2020.3603","journal-title":"Management Science"},{"issue":"12","key":"6738_CR24","doi-asserted-by":"publisher","first-page":"2397","DOI":"10.1080\/02331934.2019.1655738","volume":"68","author":"Z Chen","year":"2019","unstructured":"Chen, Z., Yu, P., & Haskell, W. B. (2019). Distributionally robust optimization for sequential decision-making. Optimization, 68(12), 2397\u20132426. https:\/\/doi.org\/10.1080\/02331934.2019.1655738","journal-title":"Optimization"},{"key":"6738_CR25","doi-asserted-by":"crossref","unstructured":"Cowan, W., Katehakis, M.N., & Pirutinsky, D. (2018). Reinforcement learning: A comparison of ucb versus alternative adaptive policies. First congress of greek mathematicians (p.127).","DOI":"10.1515\/9783110663075-006"},{"key":"6738_CR26","unstructured":"Croonenborghs, T., Ramon, J., Blockeel, H., & Bruynooghe, M. (2007). Online learning and exploiting relational models in reinforcement learning. In: Ijcai 2007, proceedings of the 20th international joint conference on artificial intelligence (pp. 726\u2013731)."},{"key":"6738_CR27","unstructured":"Daryalal, M., Arslan, A.N., & Bodur, M. (2023). Two-stage and lagrangian dual decision rules for multistage adaptive robust optimization. arXiv preprint  arXiv:2305.06190,,"},{"issue":"2","key":"6738_CR28","doi-asserted-by":"publisher","first-page":"717","DOI":"10.1287\/opre.2022.2366","volume":"72","author":"M Daryalal","year":"2024","unstructured":"Daryalal, M., Bodur, M., & Luedtke, J. R. (2024). Lagrangian dual decision rules for multistage stochastic mixed-integer programming. Operations Research, 72(2), 717\u2013737.","journal-title":"Operations Research"},{"issue":"1","key":"6738_CR29","doi-asserted-by":"publisher","first-page":"203","DOI":"10.1287\/opre.1080.0685","volume":"58","author":"E Delage","year":"2010","unstructured":"Delage, E., & Mannor, S. (2010). Percentile optimization for markov decision processes with parameter uncertainty. Operations Research, 58(1), 203\u2013213. https:\/\/doi.org\/10.1287\/opre.1080.0685","journal-title":"Operations Research"},{"issue":"3","key":"6738_CR30","doi-asserted-by":"publisher","first-page":"595","DOI":"10.1287\/opre.1090.0741","volume":"58","author":"E Delage","year":"2010","unstructured":"Delage, E., & Ye, Y. (2010). Distributionally robust optimization under moment uncertainty with application to data-driven problems. Operations Research, 58(3), 595\u2013612. https:\/\/doi.org\/10.1287\/opre.1090.0741","journal-title":"Operations Research"},{"key":"6738_CR31","doi-asserted-by":"crossref","unstructured":"Delimpaltadakis, G., Lahijanian, M., Mazo\u00a0Jr., M., & Laurenti, L. (2023). Interval markov decision processes with continuous action-spaces. In: Proceedings of the 26th acm international conference on hybrid systems: Computation and control (p.10). New York, NY, USA: Association for Computing Machinery.","DOI":"10.1145\/3575870.3587117"},{"key":"6738_CR32","first-page":"22274","volume":"34","author":"E Derman","year":"2021","unstructured":"Derman, E., Geist, M., & Mannor, S. (2021). Twice regularized mdps and the equivalence between robustness and regularization. Advances in Neural Information Processing Systems, 34, 22274\u201322287.","journal-title":"Advances in Neural Information Processing Systems"},{"key":"6738_CR33","unstructured":"Derman, E., Mankowitz, D., Mann, T., & Mannor, S. (2020). A bayesian approach to robust reinforcement learning. Uncertainty in artificial intelligence (pp. 648\u2013658)."},{"key":"6738_CR34","unstructured":"Derman, E., & Mannor, S. (2020). Distributional robustness and regularization in reinforcement learning. (Preprint at https:\/\/arxiv.org\/abs\/2003.02894)"},{"issue":"3","key":"6738_CR35","doi-asserted-by":"publisher","first-page":"1137","DOI":"10.1287\/msom.2022.0473","volume":"26","author":"C Drent","year":"2024","unstructured":"Drent, C., Drent, M., & Arts, J. (2024). Condition-based production for stochastically deteriorating systems: Optimal policies and learning. Manufacturing & Service Operations Management, 26(3), 1137\u20131156.","journal-title":"Manufacturing & Service Operations Management"},{"issue":"1","key":"6738_CR36","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1016\/S0022-0531(03)00097-8","volume":"113","author":"LG Epstein","year":"2003","unstructured":"Epstein, L. G., & Schneider, M. (2003). Recursive multiple-priors. Journal of Economic Theory, 113(1), 1\u201331. https:\/\/doi.org\/10.1016\/S0022-0531(03)00097-8","journal-title":"Journal of Economic Theory"},{"issue":"1","key":"6738_CR37","doi-asserted-by":"publisher","first-page":"115","DOI":"10.1007\/s10107-017-1172-1","volume":"171","author":"PM Esfahani","year":"2018","unstructured":"Esfahani, P. M., & Kuhn, D. (2018). Data-driven distributionally robust optimization using the wasserstein metric: Performance guarantees and tractable reformulations. Mathematical Programming, 171(1), 115\u2013166. https:\/\/doi.org\/10.1007\/s10107-017-1172-1","journal-title":"Mathematical Programming"},{"issue":"1","key":"6738_CR38","doi-asserted-by":"publisher","first-page":"269","DOI":"10.1007\/s10479-020-03779-2","volume":"316","author":"W Fan","year":"2022","unstructured":"Fan, W., Zong, Y., & Kumar, S. (2022). Optimal treatment of chronic kidney disease with uncertainty in obtaining a transplantable kidney: an mdp based approach. Annals of Operations Research, 316(1), 269\u2013302. https:\/\/doi.org\/10.1007\/s10479-020-03779-2","journal-title":"Annals of Operations Research"},{"key":"6738_CR39","doi-asserted-by":"publisher","unstructured":"Farahmand, A- m. (2011). Regularization in reinforcement learning (Doctoral dissertation,University of Alberta). https:\/\/doi.org\/10.7939\/R34P5W","DOI":"10.7939\/R34P5W"},{"key":"6738_CR40","unstructured":"Feinberg, E.A., & Liang, Y. (2022). On the optimality equation for average cost markov decision processes and its validity for inventory control. Annals of Operations Research, 1\u201318,"},{"issue":"2","key":"6738_CR41","doi-asserted-by":"publisher","first-page":"603","DOI":"10.1287\/moor.2022.1275","volume":"48","author":"R Gao","year":"2023","unstructured":"Gao, R., & Kleywegt, A. (2023). Distributionally robust stochastic optimization with wasserstein distance. Mathematics of Operations Research, 48(2), 603\u2013655. https:\/\/doi.org\/10.1287\/moor.2022.1275","journal-title":"Mathematics of Operations Research"},{"issue":"3","key":"6738_CR42","doi-asserted-by":"publisher","first-page":"813","DOI":"10.1287\/opre.2018.1835","volume":"67","author":"A Georghiou","year":"2019","unstructured":"Georghiou, A., Tsoukalas, A., & Wiesemann, W. (2019). Robust dual dynamic programming. Operations Research, 67(3), 813\u2013830.","journal-title":"Operations Research"},{"key":"6738_CR43","unstructured":"Ghavamzadeh, M., Petrik, M., & Chow, Y. (2016). Safe policy improvement by minimizing robust baseline regret. D.\u00a0Lee, M.\u00a0Sugiyama, U.\u00a0Luxburg, I.\u00a0Guyon, and R.\u00a0Garnett (Eds.), Advances in neural information processing systems (Vol.\u00a029). Curran Associates, Inc."},{"issue":"1\u20132","key":"6738_CR44","doi-asserted-by":"publisher","first-page":"71","DOI":"10.1016\/S0004-3702(00)00047-3","volume":"122","author":"R Givan","year":"2000","unstructured":"Givan, R., Leach, S., & Dean, T. (2000). Bounded-parameter markov decision processes. Artificial Intelligence, 122(1\u20132), 71\u2013109. https:\/\/doi.org\/10.1016\/S0004-3702(00)00047-3","journal-title":"Artificial Intelligence"},{"key":"6738_CR45","doi-asserted-by":"crossref","unstructured":"Goerigk, M., & Sch\u00f6bel, A. (2016). Algorithm engineering in robust optimization. Algorithm engineering: selected results and surveys, 245\u2013279,","DOI":"10.1007\/978-3-319-49487-6_8"},{"issue":"3","key":"6738_CR46","doi-asserted-by":"publisher","first-page":"697","DOI":"10.1287\/opre.2017.1685","volume":"66","author":"J Goh","year":"2018","unstructured":"Goh, J., Bayati, M., Zenios, S. A., Singh, S., & Moore, D. (2018). Data uncertainty in Markov chains: Application to cost-effectiveness analyses of medical innovations. Operations Research, 66(3), 697\u2013715. https:\/\/doi.org\/10.1287\/opre.2017.1685","journal-title":"Operations Research"},{"key":"6738_CR47","doi-asserted-by":"publisher","unstructured":"Goh, J., & Sim, M. (2010). Distributionally robust optimization and its tractable approximations. Operations research, 58(4-part-1), 902\u2013917, https:\/\/doi.org\/10.1287\/opre.1090.0795","DOI":"10.1287\/opre.1090.0795"},{"issue":"1","key":"6738_CR48","doi-asserted-by":"publisher","first-page":"203","DOI":"10.1287\/moor.2022.1259","volume":"48","author":"V Goyal","year":"2023","unstructured":"Goyal, V., & Grand-Cl\u00e9ment, J. (2023). Robust Markov decision processes: Beyond rectangularity. Mathematics of Operations Research, 48(1), 203\u2013226. https:\/\/doi.org\/10.1287\/moor.2022.1259","journal-title":"Mathematics of Operations Research"},{"key":"6738_CR49","doi-asserted-by":"crossref","unstructured":"Grand-Cl\u00e9ment, J., & Kroer, C. (2021). Scalable first-order methods for robust mdps. In: Proceedings of the aaai conference on artificial intelligence (Vol.\u00a035, pp. 12086\u201312094).","DOI":"10.1609\/aaai.v35i13.17435"},{"key":"6738_CR50","unstructured":"Grand-Cl\u00e9ment, J., & Petrik, M. (2022). On the convex formulations of robust markov decision processes. (Preprint at arxiv:2209.10187)"},{"issue":"2","key":"6738_CR51","doi-asserted-by":"publisher","first-page":"721","DOI":"10.1137\/110836183","volume":"23","author":"A Gupte","year":"2013","unstructured":"Gupte, A., Ahmed, S., Cheon, M. S., & Dey, S. (2013). Solving mixed integer bilinear problems using milp formulations. SIAM Journal on Optimization, 23(2), 721\u2013744.","journal-title":"SIAM Journal on Optimization"},{"key":"6738_CR52","unstructured":"Hanasusanto, G.A., & Kuhn, D. (2013). Robust data-driven dynamic programming. C.\u00a0Burges, L.\u00a0Bottou, M.\u00a0Welling, Z.\u00a0Ghahramani, and K.\u00a0Weinberger (Eds.), Advances in neural information processing systems (Vol.\u00a026). Curran Associates, Inc."},{"key":"6738_CR53","unstructured":"Hans, A., Schneega\u00df, D., Sch\u00e4fer, A.M., & Udluft, S. (2008). Safe exploration for reinforcement learning. Esann (pp. 143\u2013148)."},{"key":"6738_CR54","unstructured":"Ho, C.P., Petrik, M., & Wiesemann, W. (2018). Fast bellman updates for robust mdps. In: International conference on machine learning (pp. 1979\u20131988)."},{"issue":"1","key":"6738_CR55","first-page":"12612","volume":"22","author":"CP Ho","year":"2021","unstructured":"Ho, C. P., Petrik, M., & Wiesemann, W. (2021). Partial policy iteration for l1-robust markov decision processes. The Journal of Machine Learning Research, 22(1), 12612\u201312657.","journal-title":"The Journal of Machine Learning Research"},{"key":"6738_CR56","unstructured":"Ho, C. P., Petrik, M., & Wiesemann, W. (2022). Robust $$\\phi $$[CDATA[\\phi ]]-divergence mdps. Advances in Neural Information Processing Systems, 35, 32680\u201332693."},{"key":"6738_CR57","unstructured":"Hou, L., Pang, L., Hong, X., Lan, Y., Ma, Z., & Yin, D. (2020). Robust reinforcement learning with wasserstein constraint. (Preprint at https:\/\/arxiv.org\/abs\/2006.00945)"},{"issue":"358","key":"6738_CR58","first-page":"120","volume":"3","author":"RA Howard","year":"1960","unstructured":"Howard, R. A. (1960). Dynamic programming and markov processes. Mathematical Gazette, 3(358), 120.","journal-title":"Mathematical Gazette"},{"issue":"2","key":"6738_CR59","first-page":"9","volume":"1","author":"Z Hu","year":"2013","unstructured":"Hu, Z., & Hong, L. J. (2013). Kullback-leibler divergence constrained distributionally robust optimization. Available at Optimization Online, 1(2), 9.","journal-title":"Available at Optimization Online"},{"key":"6738_CR60","unstructured":"Huang, A., Leqi, L., Lipton, Z.C., & Azizzadenesheli, K. (2021). On the convergence and optimality of policy gradient for markov coherent risk. (Preprint at https:\/\/arxiv.org\/abs\/2103.02827)"},{"issue":"3","key":"6738_CR61","doi-asserted-by":"publisher","first-page":"655","DOI":"10.1287\/moor.2014.0689","volume":"40","author":"DA Iancu","year":"2015","unstructured":"Iancu, D. A., Petrik, M., & Subramanian, D. (2015). Tight approximations of dynamic risk measures. Mathematics of Operations Research, 40(3), 655\u2013682. https:\/\/doi.org\/10.1287\/moor.2014.0689","journal-title":"Mathematics of Operations Research"},{"issue":"2","key":"6738_CR62","doi-asserted-by":"publisher","first-page":"257","DOI":"10.1287\/moor.1040.0129","volume":"30","author":"GN Iyengar","year":"2005","unstructured":"Iyengar, G. N. (2005). Robust dynamic programming. Mathematics of Operations Research, 30(2), 257\u2013280. https:\/\/doi.org\/10.1287\/moor.1040.0129","journal-title":"Mathematics of Operations Research"},{"key":"6738_CR63","unstructured":"Kandel, A., & Moura, S.J. (2020). Safe wasserstein constrained deep q-learning. (Preprint at https:\/\/arxiv.org\/abs\/2002.03016)"},{"issue":"4","key":"6738_CR64","doi-asserted-by":"publisher","first-page":"244","DOI":"10.1016\/j.orl.2012.03.012","volume":"40","author":"MN Katehakis","year":"2012","unstructured":"Katehakis, M. N., & Puranam, K. S. (2012). On optimal bidding in sequential procurement auctions. Operations Research Letters, 40(4), 244\u2013249. https:\/\/doi.org\/10.1016\/j.orl.2012.03.012","journal-title":"Operations Research Letters"},{"issue":"3","key":"6738_CR65","doi-asserted-by":"publisher","first-page":"396","DOI":"10.1287\/ijoc.1120.0509","volume":"25","author":"DL Kaufman","year":"2013","unstructured":"Kaufman, D. L., & Schaefer, A. J. (2013). Robust modified policy iteration. INFORMS Journal on Computing, 25(3), 396\u2013410. https:\/\/doi.org\/10.1287\/ijoc.1120.0509","journal-title":"INFORMS Journal on Computing"},{"issue":"2","key":"6738_CR66","doi-asserted-by":"publisher","first-page":"319","DOI":"10.1007\/s10479-019-03431-8","volume":"300","author":"AJ Keith","year":"2021","unstructured":"Keith, A. J., & Ahner, D. K. (2021). A survey of decision making and optimization under uncertainty. Annals of Operations Research, 300(2), 319\u2013353. https:\/\/doi.org\/10.1007\/s10479-019-03431-8","journal-title":"Annals of Operations Research"},{"issue":"3","key":"6738_CR67","doi-asserted-by":"publisher","first-page":"691","DOI":"10.1111\/j.1937-5956.2012.01420.x","volume":"22","author":"D Klabjan","year":"2013","unstructured":"Klabjan, D., Simchi-Levi, D., & Song, M. (2013). Robust stochastic lot-sizing by means of histograms. Production and Operations Management, 22(3), 691\u2013710. https:\/\/doi.org\/10.1111\/j.1937-5956.2012.01420.x","journal-title":"Production and Operations Management"},{"key":"6738_CR68","unstructured":"Kostrikov, I., Fergus, R., Tompson, J., & Nachum, O. (2021). Offline reinforcement learning with fisher divergence critic regularization. In: International conference on machine learning (pp. 5774\u20135783)."},{"key":"6738_CR69","unstructured":"Kumar, N., Derman, E., Geist, M., Levy, K.Y., & Mannor, S. (2023). Policy gradient for rectangular robust markov decision processes. In: Advances in neural information processing systems (Vol.\u00a036, pp. 59477\u201359501). Curran Associates, Inc."},{"key":"6738_CR70","unstructured":"Kumar, N., Levy, K., Wang, K., & Mannor, S. (2022). Efficient policy iteration for robust markov decision processes via regularization. (Preprint at https:\/\/arxiv.org\/abs\/2205.14327)"},{"key":"6738_CR71","unstructured":"Laroche, R., Trichelair, P., & Des\u00a0Combes, R.T. (2019). Safe policy improvement with baseline bootstrapping. In: International conference on machine learning (pp. 3652\u20133661)."},{"key":"6738_CR72","doi-asserted-by":"crossref","unstructured":"Lasserre, J.B. (2009). Moments, positive polynomials and their applications (Vol.\u00a01). World Scientific.","DOI":"10.1142\/p665"},{"key":"6738_CR73","unstructured":"Le\u00a0Tallec, Y. (2007). Robust, risk-sensitive, and data-driven control of markov decision processes(Unpublished doctoral dissertation). Massachusetts Institute of Technology."},{"issue":"3","key":"6738_CR74","doi-asserted-by":"publisher","first-page":"1428","DOI":"10.1287\/opre.2021.2123","volume":"70","author":"X Li","year":"2022","unstructured":"Li, X., Zhong, H., & Brandeau, M. L. (2022). Quantile markov decision processes. Operations Research, 70(3), 1428\u20131447. https:\/\/doi.org\/10.1287\/opre.2021.2123","journal-title":"Operations Research"},{"key":"6738_CR75","unstructured":"Lim, S.H., Xu, H., & Mannor, S. (2013). Reinforcement learning in robust markov decision processes. C.\u00a0Burges, L.\u00a0Bottou, M.\u00a0Welling, Z.\u00a0Ghahramani, and K.\u00a0Weinberger (Eds.), Advances in neural information processing systems (Vol.\u00a026). Curran Associates, Inc."},{"key":"6738_CR76","unstructured":"Liu, Z., Bai, Q., Blanchet, J., Dong, P., Xu, W., Zhou, Z., & Zhou, Z. (2022). Distributionally robust $$ q $$[CDATA[ q ]]-learning. In: International conference on machine learning (pp. 13623\u201313643)."},{"issue":"1","key":"6738_CR77","doi-asserted-by":"publisher","first-page":"61","DOI":"10.1287\/opre.2021.2238","volume":"71","author":"DZ Long","year":"2023","unstructured":"Long, D. Z., Sim, M., & Zhou, M. (2023). Robust satisficing. Operations Research, 71(1), 61\u201382. https:\/\/doi.org\/10.1287\/opre.2021.2238","journal-title":"Operations Research"},{"key":"6738_CR78","unstructured":"Madeka, D., Torkkola, K., Eisenach, C., Luo, A., Foster, D.P., & Kakade, S.M. (2022). Deep inventory management. arXiv preprint  arXiv:2210.03137,,"},{"key":"6738_CR79","unstructured":"Mannor, S., Mebel, O., & Xu, H. (2012). Lightning does not strike twice: robust mdps with coupled uncertainty. In: Proceedings of the 29th international conference on international conference on machine learning (pp. 451\u2013458)."},{"issue":"4","key":"6738_CR80","doi-asserted-by":"publisher","first-page":"1484","DOI":"10.1287\/moor.2016.0786","volume":"41","author":"S Mannor","year":"2016","unstructured":"Mannor, S., Mebel, O., & Xu, H. (2016). Robust mdps with k-rectangular uncertainty. Mathematics of Operations Research, 41(4), 1484\u20131509. https:\/\/doi.org\/10.1287\/moor.2016.0786","journal-title":"Mathematics of Operations Research"},{"issue":"2","key":"6738_CR81","doi-asserted-by":"publisher","first-page":"308","DOI":"10.1287\/mnsc.1060.0614","volume":"53","author":"S Mannor","year":"2007","unstructured":"Mannor, S., Simester, D., Sun, P., & Tsitsiklis, J. N. (2007). Bias and variance approximation in value function estimates. Management Science, 53(2), 308\u2013322.","journal-title":"Management Science"},{"key":"6738_CR82","doi-asserted-by":"crossref","unstructured":"Mannor, S., & Xu, H. (2019). Data-driven methods for markov decision problems with parameter uncertainty. Operations research & management science in the age of analytics (pp. 101\u2013129). INFORMS.","DOI":"10.1287\/educ.2019.0205"},{"issue":"1","key":"6738_CR83","doi-asserted-by":"publisher","first-page":"147","DOI":"10.1007\/BF01580665","volume":"10","author":"GP McCormick","year":"1976","unstructured":"McCormick, G. P. (1976). Computability of global solutions to factorable nonconvex programs: Part i\u2014convex underestimating problems. Mathematical Programming, 10(1), 147\u2013175.","journal-title":"Mathematical Programming"},{"key":"6738_CR84","doi-asserted-by":"publisher","first-page":"391","DOI":"10.1007\/s10479-019-03469-8","volume":"288","author":"RS McKenna","year":"2020","unstructured":"McKenna, R. S., Robbins, M. J., Lunday, B. J., & McCormack, I. M. (2020). Approximate dynamic programming for the military inventory routing problem. Annals of Operations Research, 288, 391\u2013416. https:\/\/doi.org\/10.1007\/s10479-019-03469-8","journal-title":"Annals of Operations Research"},{"key":"6738_CR85","doi-asserted-by":"publisher","DOI":"10.1002\/9780470094846","volume-title":"Maximum likelihood estimation and inference: with examples in r, sas and admb","author":"RB Millar","year":"2011","unstructured":"Millar, R. B. (2011). Maximum likelihood estimation and inference: with examples in r, sas and admb. Wiley."},{"key":"6738_CR86","unstructured":"Namkoong, H., & Duchi, J.C. (2017). Variance-based regularization with convex objectives. I.\u00a0Guyon et\u00a0al. (Eds.), Advances in neural information processing systems (Vol.\u00a030). Curran Associates, Inc."},{"key":"6738_CR87","unstructured":"Neu, G., Jonsson, A., & G\u00f3mez, V. (2017). A unified view of entropy-regularized markov decision processes. (Preprint at https:\/\/arxiv.org\/abs\/1705.07798)"},{"key":"6738_CR88","doi-asserted-by":"publisher","DOI":"10.1016\/j.automatica.2024.111825","volume":"168","author":"A Neufeld","year":"2024","unstructured":"Neufeld, A., & Sester, J. (2024). Robust q-learning algorithm for markov decision processes under wasserstein uncertainty. Automatica, 168, Article 111825.","journal-title":"Automatica"},{"issue":"5","key":"6738_CR89","doi-asserted-by":"publisher","first-page":"780","DOI":"10.1287\/opre.1050.0216","volume":"53","author":"A Nilim","year":"2005","unstructured":"Nilim, A., & El Ghaoui, L. (2005). Robust control of Markov decision processes with uncertain transition matrices. Operations Research, 53(5), 780\u2013798. https:\/\/doi.org\/10.1287\/opre.1050.0216","journal-title":"Operations Research"},{"issue":"1","key":"6738_CR90","doi-asserted-by":"publisher","first-page":"327","DOI":"10.1007\/s10479-021-03996-3","volume":"302","author":"A Ninh","year":"2021","unstructured":"Ninh, A. (2021). Robust newsvendor problems with compound poisson demands. Annals of Operations Research, 302(1), 327\u2013338. https:\/\/doi.org\/10.1007\/s10479-021-03996-3","journal-title":"Annals of Operations Research"},{"key":"6738_CR91","unstructured":"O\u2019Donoghue, B., Osband, I., Munos, R., & Mnih, V. (2018). The uncertainty bellman equation and exploration. International conference on machine learning (pp. 3836\u20133845)."},{"key":"6738_CR92","unstructured":"Osogami, T. (2012). Robustness and risk-sensitivity in markov decision processes. F.\u00a0Pereira, C.\u00a0Burges, L.\u00a0Bottou, and K.\u00a0Weinberger (Eds.), Advances in neural information processing systems (Vol.\u00a025). Curran Associates, Inc."},{"key":"6738_CR93","doi-asserted-by":"publisher","DOI":"10.1201\/9781420034813","volume-title":"Statistical inference based on divergence measures","author":"L Pardo","year":"2018","unstructured":"Pardo, L. (2018). Statistical inference based on divergence measures. Chapman and Hall\/CRC."},{"key":"6738_CR94","unstructured":"Parkes, D.C., & Singh, S. (2003). An mdp-based approach to online mechanism design. S.\u00a0Thrun, L.\u00a0Saul, and B.\u00a0Sch\u00f6lkopf (Eds.), Advances in neural information processing systems (Vol.\u00a016). MIT Press."},{"key":"6738_CR95","unstructured":"Petrik, M., & Russel, R.H. (2019). Beyond confidence regions: Tight bayesian ambiguity sets for robust mdps. H.\u00a0Wallach, H.\u00a0Larochelle, A.\u00a0Beygelzimer, F.\u00a0d\u2019 Alch\u00e9-Buc, E.\u00a0Fox, and R.\u00a0Garnett (Eds.), Advances in neural information processing systems (Vol.\u00a032). Curran Associates, Inc."},{"key":"6738_CR96","unstructured":"Petrik, M., & Subramanian, D. (2014). Raam: The benefits of robustness in approximating aggregated mdps in reinforcement learning. Z.\u00a0Ghahramani, M.\u00a0Welling, C.\u00a0Cortes, N.\u00a0Lawrence, and K.\u00a0Weinberger (Eds.), Advances in neural information processing systems (Vol.\u00a027). Curran Associates, Inc."},{"issue":"4","key":"6738_CR97","doi-asserted-by":"publisher","first-page":"450","DOI":"10.1016\/j.orl.2008.01.013","volume":"36","author":"AB Philpott","year":"2008","unstructured":"Philpott, A. B., & Guan, Z. (2008). On the convergence of stochastic dual dynamic programming and related methods. Operations Research Letters, 36(4), 450\u2013455.","journal-title":"Operations Research Letters"},{"key":"6738_CR98","doi-asserted-by":"crossref","unstructured":"Polo, F.J.G., & Rebollo, F.F. (2011). Safe reinforcement learning in high-risk tasks through policy improvement. In: 2011 IEEE symposium on adaptive dynamic programming and reinforcement learning (adprl) (pp. 76\u201383).","DOI":"10.1109\/ADPRL.2011.5967356"},{"issue":"1","key":"6738_CR99","doi-asserted-by":"publisher","first-page":"98","DOI":"10.1287\/opre.1060.0353","volume":"55","author":"I Popescu","year":"2007","unstructured":"Popescu, I. (2007). Robust mean-covariance solutions for stochastic optimization. Operations Research, 55(1), 98\u2013112. https:\/\/doi.org\/10.1287\/opre.1060.0353","journal-title":"Operations Research"},{"key":"6738_CR100","volume-title":"Markov decision processes: Discrete stochastic dynamic programming","author":"ML Puterman","year":"2014","unstructured":"Puterman, M. L. (2014). Markov decision processes: Discrete stochastic dynamic programming. Wiley."},{"key":"6738_CR101","unstructured":"Rahimian, H., & Mehrotra, S. (2019). Distributionally robust optimization: A review. (Preprint at https:\/\/arxiv.org\/abs\/1908.05659)"},{"key":"6738_CR102","unstructured":"Rajeswaran, A., Mordatch, I., & Kumar, V. (2020). A game theoretic framework for model based reinforcement learning. International conference on machine learning (pp. 7953\u20137963)."},{"issue":"2","key":"6738_CR103","doi-asserted-by":"publisher","first-page":"989","DOI":"10.1137\/21M1423841","volume":"32","author":"S Ramani","year":"2022","unstructured":"Ramani, S., & Ghate, A. (2022). Robust markov decision processes with data-driven, distance-based ambiguity sets. SIAM Journal on Optimization, 32(2), 989\u20131017. https:\/\/doi.org\/10.1137\/21M1423841","journal-title":"SIAM Journal on Optimization"},{"key":"6738_CR104","doi-asserted-by":"publisher","unstructured":"Rockafellar, R.T., & Uryasev, S. (2000). Optimization of conditional value-at-risk. Journal of risk, 2, 21\u201342, https:\/\/doi.org\/10.21314\/JOR.2000.038","DOI":"10.21314\/JOR.2000.038"},{"key":"6738_CR105","unstructured":"Ruan, H., Zhou, S., Chen, Z., & Ho, C.P. (2023). Robust satisficing mdps. International conference on machine learning (pp. 29232\u201329258)."},{"key":"6738_CR106","unstructured":"Russel, R.H., Behzadian, B., & Petrik, M. (2019). Optimizing norm-bounded weighted ambiguity sets for robust mdps. (Preprint at https:\/\/arxiv.org\/abs\/1912.02696)"},{"key":"6738_CR107","doi-asserted-by":"publisher","first-page":"235","DOI":"10.1007\/s10107-010-0393-3","volume":"125","author":"A Ruszczy\u0144ski","year":"2010","unstructured":"Ruszczy\u0144ski, A. (2010). Risk-averse dynamic programming for markov decision processes. Mathematical Programming, 125, 235\u2013261. https:\/\/doi.org\/10.1007\/s10107-010-0393-3","journal-title":"Mathematical Programming"},{"issue":"3","key":"6738_CR108","doi-asserted-by":"publisher","first-page":"728","DOI":"10.1287\/opre.21.3.728","volume":"21","author":"JK Satia","year":"1973","unstructured":"Satia, J. K., & Lave, R. E., Jr. (1973). Markovian decision processes with uncertain transition probabilities. Operations Research, 21(3), 728\u2013740. https:\/\/doi.org\/10.1287\/opre.21.3.728","journal-title":"Operations Research"},{"key":"6738_CR109","unstructured":"Scarf, H.E., Arrow, K., & Karlin, S. (1957). A min-max solution of an inventory problem. Rand Corporation Santa Monica."},{"issue":"103","key":"6738_CR110","first-page":"1","volume":"20","author":"S Shafieezadeh-Abadeh","year":"2019","unstructured":"Shafieezadeh-Abadeh, S., Kuhn, D., & Esfahani, P. M. (2019). Regularization via mass transportation. Journal of Machine Learning Research, 20(103), 1\u201368.","journal-title":"Journal of Machine Learning Research"},{"issue":"2","key":"6738_CR111","doi-asserted-by":"publisher","first-page":"528","DOI":"10.1287\/opre.2015.1466","volume":"64","author":"A Shapiro","year":"2016","unstructured":"Shapiro, A. (2016). Rectangular sets of probability measures. Operations Research, 64(2), 528\u2013541. https:\/\/doi.org\/10.1287\/opre.2015.1466","journal-title":"Operations Research"},{"issue":"4","key":"6738_CR112","doi-asserted-by":"publisher","first-page":"2258","DOI":"10.1137\/16M1058297","volume":"27","author":"A Shapiro","year":"2017","unstructured":"Shapiro, A. (2017). Distributionally robust stochastic programming. SIAM Journal on Optimization, 27(4), 2258\u20132275. https:\/\/doi.org\/10.1137\/16M1058297","journal-title":"SIAM Journal on Optimization"},{"issue":"1","key":"6738_CR113","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1016\/j.ejor.2020.03.065","volume":"288","author":"A Shapiro","year":"2021","unstructured":"Shapiro, A. (2021). Tutorial on risk neutral, distributionally robust and risk averse multistage stochastic programming. European Journal of Operational Research, 288(1), 1\u201313. https:\/\/doi.org\/10.1016\/j.ejor.2020.03.065","journal-title":"European Journal of Operational Research"},{"key":"6738_CR114","unstructured":"Shi, L., Li, G., Wei, Y., Chen, Y., Geist, M., & Chi, Y. (2023). The curious price of distributional robustness in reinforcement learning with a generative model. A.\u00a0Oh, T.\u00a0Neumann, A.\u00a0Globerson, K.\u00a0Saenko, M.\u00a0Hardt, and S.\u00a0Levine (Eds.), Advances in neural information processing systems (Vol.\u00a036, pp. 79903\u201379917). Curran Associates, Inc."},{"issue":"6","key":"6738_CR115","doi-asserted-by":"publisher","first-page":"1842","DOI":"10.1287\/opre.2020.2044","volume":"69","author":"P Shi","year":"2021","unstructured":"Shi, P., Helm, J. E., Deglise-Hawkinson, J., & Pan, J. (2021). Timing it right: Balancing inpatient congestion vs. readmission risk at discharge. Operations Research, 69(6), 1842\u20131865.","journal-title":"Operations Research"},{"key":"6738_CR116","unstructured":"Sim\u00e3o, T.D., Laroche, R., & des Combes, R.T. (2020). Safe policy improvement with an estimated baseline policy. Aamas 2020: In: The 19th international conference on autonomous agents and multi-agent systems (pp. 1269\u20131277)."},{"key":"6738_CR117","unstructured":"Sinclair, S.R., Vieira\u00a0Frujeri, F., Cheng, C- A., Marshall, L., Barbalho, H.D.O., Li, J., & Swaminathan, A. (2023). Hindsight learning for MDPs with exogenous inputs. A.\u00a0Krause, E.\u00a0Brunskill, K.\u00a0Cho, B.\u00a0Engelhardt, S.\u00a0Sabato, and J.\u00a0Scarlett (Eds.), In: Proceedings of the 40th international conference on machine learning (Vol.\u00a0202, pp. 31877\u201331914). PMLR. https:\/\/proceedings.mlr.press\/v202\/sinclair23a.html"},{"issue":"3","key":"6738_CR118","doi-asserted-by":"publisher","first-page":"311","DOI":"10.1287\/mnsc.1050.0451","volume":"52","author":"JE Smith","year":"2006","unstructured":"Smith, J. E., & Winkler, R. L. (2006). The optimizer\u2019s curse: Skepticism and postdecision surprise in decision analysis. Management Science, 52(3), 311\u2013322. https:\/\/doi.org\/10.1287\/mnsc.1050.0451","journal-title":"Management Science"},{"issue":"4","key":"6738_CR119","doi-asserted-by":"publisher","first-page":"458","DOI":"10.1080\/24725854.2023.2219281","volume":"56","author":"J Song","year":"2024","unstructured":"Song, J., Yang, W., & Zhao, C. (2024). Decision-dependent distributionally robust markov decision process method in dynamic epidemic control. IISE Transactions, 56(4), 458\u2013470. https:\/\/doi.org\/10.1080\/24725854.2023.2219281","journal-title":"IISE Transactions"},{"issue":"2","key":"6738_CR120","doi-asserted-by":"publisher","first-page":"351","DOI":"10.1287\/opre.41.2.351","volume":"41","author":"J-S Song","year":"1993","unstructured":"Song, J.-S., & Zipkin, P. (1993). Inventory control in a fluctuating demand environment. Operations Research, 41(2), 351\u2013370. https:\/\/doi.org\/10.1287\/opre.41.2.351","journal-title":"Operations Research"},{"key":"6738_CR121","doi-asserted-by":"publisher","DOI":"10.1007\/978-1-349-15492-0_10","volume-title":"Myopia and inconsistency in dynamic utility maximization","author":"RH Strotz","year":"1973","unstructured":"Strotz, R. H. (1973). Myopia and inconsistency in dynamic utility maximization. Springer."},{"issue":"7","key":"6738_CR122","doi-asserted-by":"publisher","first-page":"1033","DOI":"10.1080\/02331930903395592","volume":"59","author":"A Thiele","year":"2010","unstructured":"Thiele, A. (2010). A note on issues of over-conservatism in robust optimization with cost uncertainty. Optimization, 59(7), 1033\u20131040. https:\/\/doi.org\/10.1080\/02331930903395592","journal-title":"Optimization"},{"key":"6738_CR123","unstructured":"Tirinzoni, A., Petrik, M., Chen, X., & Ziebart, B. (2018). Policy-conditioned uncertainty sets for robust markov decision processes. S.\u00a0Bengio, H.\u00a0Wallach, H.\u00a0Larochelle, K.\u00a0Grauman, N.\u00a0Cesa-Bianchi, and R.\u00a0Garnett (Eds.), Advances in neural information processing systems (Vol.\u00a031). Curran Associates, Inc."},{"key":"6738_CR124","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-540-71050-9","volume-title":"Optimal transport: old and new","author":"C Villani","year":"2009","unstructured":"Villani, C. (2009). Optimal transport: old and new. UK: Springer."},{"key":"6738_CR125","unstructured":"Villani, C. (2021). Topics in optimal transportation (Vol.\u00a058). American Mathematical Soc."},{"key":"6738_CR126","unstructured":"Wachi, A., & Sui, Y. (2020). Safe reinforcement learning in constrained markov decision processes. In: International conference on machine learning (pp. 9797\u20139806)."},{"key":"6738_CR127","unstructured":"Wang, K., Gadot, U., Kumar, N., Levy, K., & Mannor, S. (2023). Robust reinforcement learning via adversarial kernel approximation. (Preprint at arxiv:2306.05859)"},{"key":"6738_CR128","unstructured":"Wang, Q., Ho, C.P., & Petrik, M. (2023). Policy gradient in robust mdps with global convergence guarantee. International conference on machine learning (pp. 35763\u201335797)."},{"key":"6738_CR129","unstructured":"Wang, S., Si, N., Blanchet, J., & Zhou, Z. (2023). A finite sample complexity bound for distributionally robust q-learning. In: International conference on artificial intelligence and statistics (pp. 3370\u20133398)."},{"key":"6738_CR130","first-page":"125","volume-title":"Inequalities for the l1 deviation of the empirical distribution","author":"T Weissman","year":"2003","unstructured":"Weissman, T., Ordentlich, E., Seroussi, G., Verdu, S., & Weinberger, M. J. (2003). Inequalities for the l1 deviation of the empirical distribution (p. 125). Rep: Hewlett-Packard Labs, Tech."},{"issue":"1","key":"6738_CR131","doi-asserted-by":"publisher","first-page":"120","DOI":"10.1287\/opre.34.1.120","volume":"34","author":"CC White III","year":"1986","unstructured":"White, C. C., III., & El-Deib, H. K. (1986). Parameter imprecision in finite state, finite action dynamic programs. Operations Research, 34(1), 120\u2013129. https:\/\/doi.org\/10.1287\/opre.34.1.120","journal-title":"Operations Research"},{"issue":"4","key":"6738_CR132","doi-asserted-by":"publisher","first-page":"739","DOI":"10.1287\/opre.42.4.739","volume":"42","author":"CC White III","year":"1994","unstructured":"White, C. C., III., & Eldeib, H. K. (1994). Markov decision processes with imprecise transition probabilities. Operations Research, 42(4), 739\u2013749. https:\/\/doi.org\/10.1287\/opre.42.4.739","journal-title":"Operations Research"},{"issue":"1","key":"6738_CR133","doi-asserted-by":"publisher","first-page":"153","DOI":"10.1287\/moor.1120.0566","volume":"38","author":"W Wiesemann","year":"2013","unstructured":"Wiesemann, W., Kuhn, D., & Rustem, B. (2013). Robust markov decision processes. Mathematics of Operations Research, 38(1), 153\u2013183. https:\/\/doi.org\/10.1287\/moor.1120.0566","journal-title":"Mathematics of Operations Research"},{"issue":"6","key":"6738_CR134","doi-asserted-by":"publisher","first-page":"1358","DOI":"10.1287\/opre.2014.1314","volume":"62","author":"W Wiesemann","year":"2014","unstructured":"Wiesemann, W., Kuhn, D., & Sim, M. (2014). Distributionally robust convex optimization. Operations Research, 62(6), 1358\u20131376. https:\/\/doi.org\/10.1287\/opre.2014.1314","journal-title":"Operations Research"},{"issue":"3","key":"6738_CR135","doi-asserted-by":"publisher","first-page":"1127","DOI":"10.1016\/j.ejor.2020.07.041","volume":"289","author":"L Xin","year":"2021","unstructured":"Xin, L., & Goldberg, D. A. (2021). Time (in) consistency of multistage distributionally robust inventory models with moment constraints. European Journal of Operational Research, 289(3), 1127\u20131141. https:\/\/doi.org\/10.1016\/j.ejor.2020.07.041","journal-title":"European Journal of Operational Research"},{"issue":"2","key":"6738_CR136","doi-asserted-by":"publisher","first-page":"288","DOI":"10.1287\/moor.1120.0540","volume":"37","author":"H Xu","year":"2012","unstructured":"Xu, H., & Mannor, S. (2012). Distributionally robust markov decision processes. Mathematics of Operations Research, 37(2), 288\u2013300. https:\/\/doi.org\/10.1287\/moor.1120.0540","journal-title":"Mathematics of Operations Research"},{"issue":"1","key":"6738_CR137","doi-asserted-by":"publisher","first-page":"164","DOI":"10.1109\/LCSYS.2017.2711553","volume":"1","author":"I Yang","year":"2017","unstructured":"Yang, I. (2017). A convex optimization approach to distributionally robust markov decision processes with wasserstein distance. IEEE Control Systems Letters, 1(1), 164\u2013169. https:\/\/doi.org\/10.1109\/LCSYS.2017.2711553","journal-title":"IEEE Control Systems Letters"},{"key":"6738_CR138","doi-asserted-by":"publisher","first-page":"94","DOI":"10.1016\/j.automatica.2018.04.022","volume":"94","author":"I Yang","year":"2018","unstructured":"Yang, I. (2018). A dynamic game approach to distributionally robust safety specifications for stochastic systems. Automatica, 94, 94\u2013101. https:\/\/doi.org\/10.1016\/j.automatica.2018.04.022","journal-title":"Automatica"},{"issue":"8","key":"6738_CR139","doi-asserted-by":"publisher","first-page":"3863","DOI":"10.1109\/TAC.2020.3030884","volume":"66","author":"I Yang","year":"2020","unstructured":"Yang, I. (2020). Wasserstein distributionally robust stochastic control: A data-driven approach. IEEE Transactions on Automatic Control, 66(8), 3863\u20133870. https:\/\/doi.org\/10.1109\/TAC.2020.3030884","journal-title":"IEEE Transactions on Automatic Control"},{"issue":"3","key":"6738_CR140","doi-asserted-by":"publisher","first-page":"799","DOI":"10.1016\/j.ejor.2018.08.031","volume":"277","author":"\u0130 Yan\u0131ko\u011flu","year":"2019","unstructured":"Yan\u0131ko\u011flu, \u0130, Gorissen, B. L., & den Hertog, D. (2019). A survey of adjustable robust optimization. European Journal of Operational Research, 277(3), 799\u2013813.","journal-title":"European Journal of Operational Research"},{"issue":"9","key":"6738_CR141","doi-asserted-by":"publisher","first-page":"2538","DOI":"10.1109\/TAC.2015.2495174","volume":"61","author":"P Yu","year":"2015","unstructured":"Yu, P., & Xu, H. (2015). Distributionally robust counterpart in markov decision processes. IEEE Transactions on Automatic Control, 61(9), 2538\u20132543. https:\/\/doi.org\/10.1109\/TAC.2015.2495174","journal-title":"IEEE Transactions on Automatic Control"},{"key":"6738_CR142","doi-asserted-by":"crossref","unstructured":"Yu, X., & Shen, S. (2022). Risk-averse reinforcement learning via dynamic time-consistent risk measures. In: 2022 IEEE 61st conference on decision and control (cdc) (pp. 2307\u20132312).","DOI":"10.1109\/CDC51059.2022.9992450"},{"key":"6738_CR143","unstructured":"Zhang, C., Vinyals, O., Munos, R., & Bengio, S. (2018). A study on overfitting in deep reinforcement learning. (Preprint at arxiv:1804.06893)"},{"key":"6738_CR144","unstructured":"Zhang, R., Hu, Y., & Li, N. (2023). Regularized robust mdps and risk-sensitive mdps: Equivalence, policy gradient, and sample complexity. (Preprint at arxiv:2306.11626)"},{"key":"6738_CR145","doi-asserted-by":"publisher","first-page":"461","DOI":"10.1007\/s10107-018-1249-5","volume":"175","author":"J Zou","year":"2019","unstructured":"Zou, J., Ahmed, S., & Sun, X. A. (2019). Stochastic dual dynamic integer programming. Mathematical Programming, 175, 461\u2013502.","journal-title":"Mathematical Programming"}],"container-title":["Annals of Operations Research"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10479-025-06738-x.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s10479-025-06738-x\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10479-025-06738-x.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,10,28]],"date-time":"2025-10-28T10:10:07Z","timestamp":1761646207000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s10479-025-06738-x"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,8,18]]},"references-count":145,"journal-issue":{"issue":"3","published-print":{"date-parts":[[2025,10]]}},"alternative-id":["6738"],"URL":"https:\/\/doi.org\/10.1007\/s10479-025-06738-x","relation":{},"ISSN":["0254-5330","1572-9338"],"issn-type":[{"value":"0254-5330","type":"print"},{"value":"1572-9338","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,8,18]]},"assertion":[{"value":"12 April 2024","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"24 June 2025","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"18 August 2025","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors have no Conflict of interest.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflict of interest"}}]}}