{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,1]],"date-time":"2026-04-01T17:51:42Z","timestamp":1775065902561,"version":"3.50.1"},"reference-count":34,"publisher":"IEEE","content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2021,5,25]]},"DOI":"10.23919\/acc50511.2021.9482783","type":"proceedings-article","created":{"date-parts":[[2021,7,28]],"date-time":"2021-07-28T20:29:16Z","timestamp":1627504156000},"page":"894-901","source":"Crossref","is-referenced-by-count":4,"title":["Beyond Cumulative Returns via Reinforcement Learning over State-Action Occupancy Measures"],"prefix":"10.23919","author":[{"given":"Junyu","family":"Zhang","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Amrit Singh","family":"Bedi","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Mengdi","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Alec","family":"Koppel","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref33","author":"wang","year":"2017","journal-title":"Primal-dual pi learning Sample complexity and sublinear run time for ergodic markov decision problems"},{"key":"ref32","author":"zhang","year":"2020","journal-title":"Cautious reinforcement learning via distributional risk in the dual domain"},{"key":"ref31","author":"chen","year":"2018","journal-title":"Scalable bilinear pi learning using state and action features"},{"key":"ref30","author":"chen","year":"2016","journal-title":"Stochastic primal-dual methods and sample complexity of reinforcement learning"},{"key":"ref34","author":"wang","year":"2017","journal-title":"Randomized linear programming solves the discounted Markov decision problem in nearly-linear (sometimes sublinear) running time"},{"key":"ref10","first-page":"22","article-title":"Constrained policy optimization","author":"achiam","year":"0","journal-title":"Proceedings of the 34th International Conference on Machine Learning-Volume 70"},{"key":"ref11","first-page":"77","article-title":"Portfolio selection","volume":"7","author":"markowitz","year":"1952","journal-title":"The Journal of Finance"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1016\/S0378-4266(02)00271-6"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1111\/1467-9965.00068"},{"key":"ref14","first-page":"6070","article-title":"Risk-constrained reinforcement learning with percentile risk criteria","volume":"18","author":"chow","year":"2017","journal-title":"The Journal of Machine Learning Research"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1287\/moor.2017.0872"},{"key":"ref16","author":"bjork","year":"2010","journal-title":"A general theory of Markovian time inconsisitent stochastic control problems"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1007\/s10107-010-0393-3"},{"key":"ref18","first-page":"1468","article-title":"Policy gradient for coherent risk measures","author":"tamar","year":"0","journal-title":"Advances in neural information processing systems"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/CDC.2003.1272362"},{"key":"ref28","author":"bertsekas","year":"2004","journal-title":"Stochastic Optimal Control The Discrete-Time Case"},{"key":"ref4","first-page":"2","article-title":"Alphastar: Mastering the real-time strategy game starcraft ii","author":"vinyals","year":"2019","journal-title":"DeepMind blog"},{"key":"ref27","first-page":"6190","article-title":"Fully parameterized quantile function for distributional reinforcement learning","author":"yang","year":"0","journal-title":"Advances in neural information processing systems"},{"key":"ref3","author":"mnih","year":"2013","journal-title":"Playing atari with deep reinforcement learning"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1007\/s00170-008-1715-y"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1287\/opre.51.6.850.24925"},{"key":"ref5","author":"schulman","year":"2015","journal-title":"High-dimensional continuous control using generalized advantage estimation"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1016\/S0304-3932(03)00029-1"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1007\/s10339-011-0392-1"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1145\/2507157.2508063"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1126\/science.1134239"},{"key":"ref1","author":"sutton","year":"2018","journal-title":"Reinforcement Learning An Introduction"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-11662-4_12"},{"key":"ref22","first-page":"3121","article-title":"Convergent policy optimization for safe reinforcement learning","author":"yu","year":"0","journal-title":"Advances in neural information processing systems"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/CDC40024.2019.9029423"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1561\/2200000049"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1137\/050622328"},{"key":"ref26","author":"keramati","year":"2019","journal-title":"Being optimistic to be conservative Quickly learning a cvar policy"},{"key":"ref25","first-page":"449","article-title":"A distributional perspective on reinforcement learning","author":"bellemare","year":"0","journal-title":"Proceedings of the 34th International Conference on Machine Learning-Volume 70"}],"event":{"name":"2021 American Control Conference (ACC)","location":"New Orleans, LA, USA","start":{"date-parts":[[2021,5,25]]},"end":{"date-parts":[[2021,5,28]]}},"container-title":["2021 American Control Conference (ACC)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/9482409\/9482614\/09482783.pdf?arnumber=9482783","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2021,10,6]],"date-time":"2021-10-06T10:52:22Z","timestamp":1633517542000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/9482783\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2021,5,25]]},"references-count":34,"URL":"https:\/\/doi.org\/10.23919\/acc50511.2021.9482783","relation":{},"subject":[],"published":{"date-parts":[[2021,5,25]]}}}