{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,14]],"date-time":"2026-07-14T09:01:19Z","timestamp":1784019679944,"version":"3.55.0"},"reference-count":71,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"5","license":[{"start":{"date-parts":[[2024,5,1]],"date-time":"2024-05-01T00:00:00Z","timestamp":1714521600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2024,5,1]],"date-time":"2024-05-01T00:00:00Z","timestamp":1714521600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2024,5,1]],"date-time":"2024-05-01T00:00:00Z","timestamp":1714521600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"name":"National Key Research and Development Project of China","award":["2022YFA1004002"],"award-info":[{"award-number":["2022YFA1004002"]}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["12350001"],"award-info":[{"award-number":["12350001"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["12271011"],"award-info":[{"award-number":["12271011"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Pattern Anal. Mach. Intell."],"published-print":{"date-parts":[[2024,5]]},"DOI":"10.1109\/tpami.2023.3348460","type":"journal-article","created":{"date-parts":[[2024,1,1]],"date-time":"2024-01-01T19:39:14Z","timestamp":1704137954000},"page":"3722-3735","source":"Crossref","is-referenced-by-count":8,"title":["Semi-Infinitely Constrained Markov Decision Processes and Provably Efficient Reinforcement Learning"],"prefix":"10.1109","volume":"46","author":[{"ORCID":"https:\/\/orcid.org\/0009-0005-2731-3941","authenticated-orcid":false,"given":"Liangyu","family":"Zhang","sequence":"first","affiliation":[{"name":"Academy for Advanced Interdisciplinary Studies, Peking University, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-0063-3102","authenticated-orcid":false,"given":"Yang","family":"Peng","sequence":"additional","affiliation":[{"name":"School of Mathematical Sciences, Peking University, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-6228-8917","authenticated-orcid":false,"given":"Wenhao","family":"Yang","sequence":"additional","affiliation":[{"name":"Academy for Advanced Interdisciplinary Studies, Peking University, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3165-5213","authenticated-orcid":false,"given":"Zhihua","family":"Zhang","sequence":"additional","affiliation":[{"name":"School of Mathematical Sciences, Peking University, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1145\/1835804.1835817"},{"key":"ref2","first-page":"22","article-title":"Constrained policy optimization","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Achiam"},{"key":"ref3","first-page":"67","article-title":"Model-based reinforcement learning with a generative model is minimax optimal","volume-title":"Proc. 33rd Conf. Learn. Theory","author":"Agarwal"},{"issue":"98","key":"ref4","first-page":"1","article-title":"On the theory of policy gradient methods: Optimality, approximation, and distribution shift","volume":"22","author":"Agarwal","year":"2021","journal-title":"J. Mach. Learn. Res."},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1007\/s001860050035"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1201\/9781315140223"},{"key":"ref7","article-title":"Safe reinforcement learning with linear function approximation","author":"Amani","year":"2021"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1007\/978-1-4939-1384-8_10"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1137\/060667049"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.5555\/2188385.2188395"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1007\/s10107-003-0492-5"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1561\/2200000050"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1103\/physreva.104.022413"},{"key":"ref14","first-page":"1042","article-title":"Information-theoretic considerations in batch reinforcement learning","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Chen"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1137\/1.9780898719857"},{"key":"ref16","article-title":"A Theoretical Comparison of the Efficiencies of Two Classical Methods and a Monte Carlo Method for Computing One Component of the Solution of a Set of Linear Algebraic Equations","author":"Curtiss","year":"1954"},{"key":"ref17","first-page":"809","article-title":"Policy evaluation with temporal differences: A survey and comparison","volume":"15","author":"Dann","year":"2014","journal-title":"J. Mach. Learn. Res."},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1080\/02331934.2011.619263"},{"key":"ref19","first-page":"8378","article-title":"Naturala policy gradient primal-dual method for constrained Markov decision processes","author":"Ding","journal-title":"Proc. Adv. Neural Inf. Process. Syst."},{"key":"ref20","article-title":"Exploration-exploitation in constrained MDPs","author":"Efroni","year":"2020"},{"issue":"1","key":"ref21","first-page":"1437","article-title":"A comprehensive survey on safe reinforcement learning","volume":"16","author":"Garc\u0131a","year":"2015","journal-title":"J. Mach. Learn. Res."},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1016\/S0377-2217(02)00327-2"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1007\/s10479-018-2987-8"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1068\/a040183"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.24963\/ijcai.2021\/347"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1137\/1035089"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1007\/BF01585730"},{"key":"ref28","first-page":"1704","article-title":"Contextual decision processes with low Bellman rank are PAC-learnable","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Jiang"},{"key":"ref29","first-page":"1531","article-title":"A natural policy gradient","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"ShamKakade"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1177\/0278364913495721"},{"key":"ref31","article-title":"The dual simplex method, techniques for a fast and stable implementation","author":"Koberstein","year":"2005"},{"key":"ref32","first-page":"1008","article-title":"Actor-critic algorithms","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Konda"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1007\/s10589-020-00179-x"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1016\/j.tcs.2014.09.029"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v34i04.5932"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1109\/TSP.2011.2165211"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1017\/9781009051873"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1109\/78.622941"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1137\/040619867"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1109\/82.924065"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1007\/s10514-015-9467-7"},{"key":"ref42","volume-title":"arXiv:2303.08774","year":"2023"},{"key":"ref43","article-title":"Training language models to follow instructions with human feedback","author":"Ouyang","year":"2022"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1137\/0330023"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1137\/0330032"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1007\/978-1-4757-2868-2_7"},{"issue":"196","key":"ref47","first-page":"41","article-title":"Sur la d\u00e9termination des polyn\u00f4mes d\u2019approximation de degr\u00e9 donn\u00e9e","volume":"10","author":"Remez","year":"1934","journal-title":"Commun. Soc. Math. Kharkov"},{"key":"ref48","first-page":"1889","article-title":"Trust region policy optimization","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Schulman"},{"key":"ref49","article-title":"Proximal policy optimization algorithms","author":"Schulman","year":"2017"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1090\/S0025-5718-1970-0274029-X"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1126\/science.aar6404"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1109\/TAC.2018.2874671"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.1287\/moor.6.1.19"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1137\/S0363012901398393"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1007\/s101070100239"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1007\/BF00115009"},{"key":"ref57","first-page":"1057","article-title":"Policy gradient methods for reinforcement learning with function approximation","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Sutton"},{"key":"ref58","article-title":"Reward constrained policy optimization","author":"Tessler","year":"2018"},{"key":"ref59","article-title":"Near-optimal sample complexity bounds for constrained MDPs","author":"Vaswani","year":"2022"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1038\/s41586-019-1724-z"},{"key":"ref61","first-page":"9797","article-title":"Safe reinforcement learning in constrained markov decision processes","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Wachi"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.1038\/540027a"},{"key":"ref63","doi-asserted-by":"publisher","DOI":"10.1038\/530275a"},{"key":"ref64","article-title":"Neural policy gradient methods: Global optimality and rates of convergence","author":"Wang","year":"2019"},{"key":"ref65","doi-asserted-by":"publisher","DOI":"10.1007\/s10479-020-03766-7"},{"key":"ref66","first-page":"11480","article-title":"CRPO: A new approach for safe reinforcement learning with convergence guarantee","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Xu"},{"key":"ref67","article-title":"Projection-based constrained policy optimization","author":"Yang","year":"2020"},{"key":"ref68","doi-asserted-by":"publisher","DOI":"10.1137\/20M1347942"},{"key":"ref69","first-page":"16808","article-title":"Semi-infinitely constrained markov decision processes","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Zhang"},{"key":"ref70","doi-asserted-by":"publisher","DOI":"10.1137\/090767133"},{"key":"ref71","first-page":"620","article-title":"Constrained upper confidence reinforcement learning","volume-title":"Proc. 2nd Annu. Learn. Dyn. Control","author":"Zheng"}],"container-title":["IEEE Transactions on Pattern Analysis and Machine Intelligence"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/34\/10490207\/10378871.pdf?arnumber=10378871","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,4,9]],"date-time":"2024-04-09T19:37:55Z","timestamp":1712691475000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/10378871\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,5]]},"references-count":71,"journal-issue":{"issue":"5"},"URL":"https:\/\/doi.org\/10.1109\/tpami.2023.3348460","relation":{},"ISSN":["0162-8828","2160-9292","1939-3539"],"issn-type":[{"value":"0162-8828","type":"print"},{"value":"2160-9292","type":"electronic"},{"value":"1939-3539","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024,5]]}}}