{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,31]],"date-time":"2026-07-31T08:58:30Z","timestamp":1785488310132,"version":"3.56.0"},"reference-count":38,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,7,18]],"date-time":"2026-07-18T00:00:00Z","timestamp":1784332800000},"content-version":"vor","delay-in-days":0,"URL":"http:\/\/creativecommons.org\/licenses\/by\/4.0\/"}],"funder":[{"DOI":"10.13039\/501100006690","name":"Politecnico di Milano","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100006690","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100003407","name":"Ministero dell\u2019Istruzione, dell\u2019Universit\u00e0 e della Ricerca","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100003407","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Artificial Intelligence"],"published-print":{"date-parts":[[2026,9]]},"DOI":"10.1016\/j.artint.2026.104589","type":"journal-article","created":{"date-parts":[[2026,7,20]],"date-time":"2026-07-20T07:39:19Z","timestamp":1784533159000},"page":"104589","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"C","title":["Policy optimization for CMDPs with bandit feedback: Best-of-both-worlds and beyond"],"prefix":"10.1016","volume":"358","author":[{"ORCID":"https:\/\/orcid.org\/0009-0008-1200-4187","authenticated-orcid":false,"given":"Francesco Emanuele","family":"Stradi","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Anna","family":"Lunghi","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-1070-6766","authenticated-orcid":false,"given":"Matteo","family":"Castiglioni","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-8284-5757","authenticated-orcid":false,"given":"Alberto","family":"Marchesi","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-7349-3932","authenticated-orcid":false,"given":"Nicola","family":"Gatti","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.artint.2026.104589_bib0001","series-title":"Proceedings of the 41st International Conference on Machine Learning","first-page":"46692","article-title":"Online learning in CMDPs: handling stochastic and adversarial constraints","volume":"Vol. 235","author":"Stradi","year":"2024"},{"key":"10.1016\/j.artint.2026.104589_bib0002","series-title":"Markov Decision Processes: Discrete Stochastic Dynamic Programming","author":"Puterman","year":"2014"},{"key":"10.1016\/j.artint.2026.104589_bib0003","series-title":"2018 IEEE\/RSJ International Conference on Intelligent Robots and Systems (IROS)","first-page":"1","article-title":"Safe reinforcement learning on autonomous vehicles","author":"Isele","year":"2018"},{"key":"10.1016\/j.artint.2026.104589_bib0004","series-title":"Proceedings of the 27th ACM SIGKDD Conference on Knowledge Discovery & Data Mining","first-page":"2993","article-title":"A unified solution to constrained bidding in online display advertising","author":"He","year":"2021"},{"key":"10.1016\/j.artint.2026.104589_bib0005","series-title":"Proceedings of the FAccTRec Workshop, Online","first-page":"26","article-title":"Building healthy recommendation sequences for everyone: a safe reinforcement learning approach","author":"Singh","year":"2020"},{"key":"10.1016\/j.artint.2026.104589_bib0006","series-title":"Constrained Markov Decision Processes","author":"Altman","year":"1999"},{"key":"10.1016\/j.artint.2026.104589_bib0007","unstructured":"Y. Efroni, S. Mannor, M. Pirotta, Exploration-Exploitation in Constrained MDPs, 2020,. https:\/\/arxiv.org\/abs\/2003.02189."},{"key":"10.1016\/j.artint.2026.104589_bib0008","series-title":"Proceedings of the 39th International Conference on Machine Learning","first-page":"1854","article-title":"Safe learning in tree-form sequential decision making: handling hard and soft constraints","volume":"Vol. 162","author":"Bernasconi","year":"2022"},{"issue":"20","key":"10.1016\/j.artint.2026.104589_bib0009","first-page":"569","article-title":"Online learning with sample path constraints","volume":"10","author":"Mannor","year":"2009","journal-title":"J. Mach. Learn. Res."},{"key":"10.1016\/j.artint.2026.104589_bib0010","series-title":"International Conference on Machine Learning","first-page":"3877","article-title":"No-regret is not enough! bandits with general constraints through adaptive regret minimization","author":"Bernasconi","year":"2025"},{"key":"10.1016\/j.artint.2026.104589_bib0011","series-title":"Advances in Neural Information Processing Systems 25: 26th Annual Conference on Neural Information Processing Systems 2012","first-page":"989","article-title":"Mirror descent meets fixed share (and feels no regret)","author":"Cesa-Bianchi","year":"2012"},{"key":"10.1016\/j.artint.2026.104589_bib0012","series-title":"Advances in Neural Information Processing Systems","article-title":"Near-optimal regret bounds for reinforcement learning","volume":"Vol. 21","author":"Auer","year":"2008"},{"issue":"3","key":"10.1016\/j.artint.2026.104589_bib0013","doi-asserted-by":"crossref","first-page":"726","DOI":"10.1287\/moor.1090.0396","article-title":"Online Markov decision processes","volume":"34","author":"Even-Dar","year":"2009","journal-title":"Math. Oper. Res."},{"key":"10.1016\/j.artint.2026.104589_bib0014","series-title":"Advances in Neural Information Processing Systems 23: 24th Annual Conference on Neural Information Processing Systems 2010","first-page":"1804","article-title":"Online Markov decision processes under bandit feedback","author":"Neu","year":"2010"},{"key":"10.1016\/j.artint.2026.104589_bib0015","series-title":"International Conference on Machine Learning","first-page":"263","article-title":"Minimax regret bounds for reinforcement learning","author":"Azar","year":"2017"},{"key":"10.1016\/j.artint.2026.104589_bib0016","series-title":"Proceedings of the 36th International Conference on Machine Learning","first-page":"5478","article-title":"Online convex optimization in adversarial markov decision processes","volume":"97","author":"Rosenberg","year":"2019"},{"key":"10.1016\/j.artint.2026.104589_bib0017","series-title":"Advances in Neural Information Processing Systems","article-title":"Online stochastic shortest path with bandit feedback and unknown transition function","volume":"Vol. 32","author":"Rosenberg","year":"2019"},{"key":"10.1016\/j.artint.2026.104589_bib0018","series-title":"Proceedings of the 37th International Conference on Machine Learning","first-page":"4860","article-title":"Learning adversarial markov decision processes with bandit feedback and unknown transition","volume":"Vol. 119","author":"Jin","year":"2020"},{"key":"10.1016\/j.artint.2026.104589_bib0019","first-page":"22931","article-title":"Policy optimization in adversarial mdps: improved exploration via dilated bonuses","volume":"34","author":"Luo","year":"2021","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.artint.2026.104589_bib0020","series-title":"International Conference on Machine Learning","first-page":"3944","article-title":"Cautious regret minimization: online optimization with long-term budget constraints","author":"Liakopoulos","year":"2019"},{"key":"10.1016\/j.artint.2026.104589_bib0021","series-title":"Proceedings of the 39th International Conference on Machine Learning","first-page":"2767","article-title":"Online learning with knapsacks: the best of both worlds","volume":"162","author":"Castiglioni","year":"2022"},{"key":"10.1016\/j.artint.2026.104589_bib0022","doi-asserted-by":"crossref","first-page":"33589","DOI":"10.52202\/068431-2434","article-title":"A unifying framework for online optimization with long-term constraints","volume":"35","author":"Castiglioni","year":"2022","journal-title":"Adv. Neural Inf. Process. Syst."},{"issue":"1","key":"10.1016\/j.artint.2026.104589_bib0023","doi-asserted-by":"crossref","DOI":"10.1145\/3179415","article-title":"Online learning in weakly coupled markov decision processes: a convergence time study","volume":"2","author":"Wei","year":"2018","journal-title":"Proc. ACM Meas. Anal. Comput. Syst."},{"key":"10.1016\/j.artint.2026.104589_bib0024","series-title":"Proceedings of the 2nd Conference on Learning for Dynamics and Control","first-page":"620","article-title":"Constrained upper confidence reinforcement learning","volume":"120","author":"Zheng","year":"2020"},{"key":"10.1016\/j.artint.2026.104589_bib0025","unstructured":"Q. Bai, V. Aggarwal, A. Gattami, Provably efficient model-free algorithm for MDPs with peak constraints, (2020). arXiv preprint arXiv: 2003.05555."},{"key":"10.1016\/j.artint.2026.104589_bib0026","series-title":"Advances in Neural Information Processing Systems","first-page":"15277","article-title":"Upper confidence primal-dual reinforcement learning for CMDP with adversarial loss","volume":"Vol. 33","author":"Qiu","year":"2020"},{"key":"10.1016\/j.artint.2026.104589_bib0027","first-page":"17183","article-title":"Learning policies with zero or bounded constraint violation for constrained mdps","volume":"34","author":"Liu","year":"2021","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.artint.2026.104589_bib0028","series-title":"International Conference on Artificial Intelligence and Statistics","first-page":"3304","article-title":"Provably efficient safe exploration via primal-dual policy optimization","author":"Ding","year":"2021"},{"key":"10.1016\/j.artint.2026.104589_bib0029","series-title":"Proceedings of the 25th International Conference on Artificial Intelligence and Statistics","first-page":"3274","article-title":"Triple-Q: a model-free algorithm for constrained reinforcement learning with sublinear regret and zero constraint violation","volume":"Vol. 151","author":"Wei","year":"2022"},{"key":"10.1016\/j.artint.2026.104589_bib0030","series-title":"International Conference on Artificial Intelligence and Statistics","first-page":"6527","article-title":"Provably efficient model-free algorithms for non-stationary CMDPs","author":"Wei","year":"2023"},{"key":"10.1016\/j.artint.2026.104589_bib0031","series-title":"Proceedings of the AAAI Conference on Artificial Intelligence","first-page":"7396","article-title":"Provably efficient primal-dual reinforcement learning for CMDPs with non-stationary objectives and constraints","volume":"Vol. 37","author":"Ding","year":"2023"},{"key":"10.1016\/j.artint.2026.104589_bib0032","series-title":"Advances in Neural Information Processing Systems","article-title":"Taming Adversarial Constraints in CMDPs","volume":"38","author":"Stradi","year":"2025"},{"key":"10.1016\/j.artint.2026.104589_bib0033","series-title":"Proceedings of the 27th International Conference on Artificial Intelligence and Statistics","first-page":"1054","article-title":"Towards achieving sub-linear regret and hard constraint violation in model-free RL","volume":"238","author":"Ghosh","year":"2024"},{"key":"10.1016\/j.artint.2026.104589_bib0034","series-title":"Forty-first International Conference on Machine Learning","article-title":"Truly no-regret learning in constrained MDPs","author":"M\u00fcller","year":"2024"},{"key":"10.1016\/j.artint.2026.104589_bib0035","series-title":"The Thirteenth International Conference on Learning Representations, ICLR 2025, Singapore, April 24\u201328, 2025","article-title":"Optimal strong regret and violation in constrained MDPs via policy optimization","author":"Stradi","year":"2025"},{"key":"10.1016\/j.artint.2026.104589_bib0036","series-title":"Forty-second International Conference on Machine Learning, ICML","article-title":"Learning adversarial MDPs with stochastic hard constraints","volume":"267","author":"Stradi","year":"2025"},{"key":"10.1016\/j.artint.2026.104589_bib0037","series-title":"Prediction, Learning, and Games","author":"Cesa-Bianchi","year":"2006"},{"key":"10.1016\/j.artint.2026.104589_bib0038","article-title":"A modern introduction to online learning","author":"Orabona","year":"2019","journal-title":"CoRR"}],"container-title":["Artificial Intelligence"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0004370226001153?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0004370226001153?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,7,31]],"date-time":"2026-07-31T08:13:54Z","timestamp":1785485634000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0004370226001153"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,9]]},"references-count":38,"alternative-id":["S0004370226001153"],"URL":"https:\/\/doi.org\/10.1016\/j.artint.2026.104589","relation":{},"ISSN":["0004-3702"],"issn-type":[{"value":"0004-3702","type":"print"}],"subject":[],"published":{"date-parts":[[2026,9]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"Policy optimization for CMDPs with bandit feedback: Best-of-both-worlds and beyond","name":"articletitle","label":"Article Title"},{"value":"Artificial Intelligence","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.artint.2026.104589","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 The Author(s). Published by Elsevier B.V.","name":"copyright","label":"Copyright"}],"article-number":"104589"}}