{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,2,21]],"date-time":"2025-02-21T01:08:50Z","timestamp":1740100130498,"version":"3.37.3"},"reference-count":24,"publisher":"IEEE","funder":[{"DOI":"10.13039\/100000185","name":"DARPA","doi-asserted-by":"publisher","award":["D19AP00004"],"award-info":[{"award-number":["D19AP00004"]}],"id":[{"id":"10.13039\/100000185","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100006602","name":"AFRL","doi-asserted-by":"publisher","award":["FA9550-19-1-0169"],"award-info":[{"award-number":["FA9550-19-1-0169"]}],"id":[{"id":"10.13039\/100006602","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2021,5,25]]},"DOI":"10.23919\/acc50511.2021.9483085","type":"proceedings-article","created":{"date-parts":[[2021,7,28]],"date-time":"2021-07-28T20:29:16Z","timestamp":1627504156000},"page":"1953-1958","source":"Crossref","is-referenced-by-count":1,"title":["Online Learning with Implicit Exploration in Episodic Markov Decision Processes"],"prefix":"10.23919","author":[{"given":"Mahsa","family":"Ghasemi","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Abolfazl","family":"Hashemi","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Haris","family":"Vikalo","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Ufuk","family":"Topcu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref10","first-page":"5478","article-title":"Online convex optimization in adversarial Markov decision processes","author":"rosenberg","year":"2019","journal-title":"Proceedings of International Conference on Machine Learning (ICML)"},{"key":"ref11","first-page":"2337","article-title":"Large scale Markov decision processes with changing rewards","author":"cardoso","year":"2019","journal-title":"Proceedings of Advances in neural information processing systems (Ne u rIPS)"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1006\/inco.1994.1009"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1287\/moor.1090.0397"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-540-45167-9_4"},{"key":"ref15","first-page":"1563","article-title":"Near-optimal regret bounds for reinforcement learning","volume":"11","author":"jaksch","year":"2010","journal-title":"Journal of Machine Learning Research (JMLR)"},{"key":"ref16","first-page":"263","article-title":"Minimax regret bounds for reinforcement learning","volume":"70","author":"azar","year":"2017","journal-title":"Proceedings of International Conference on Machine Learning (ICML)"},{"key":"ref17","first-page":"805","article-title":"The adversarial stochastic shortest path problem with unknown transition probabilities","author":"neu","year":"2012","journal-title":"Proceedings of Artificial Intelligence and Statistics (AISTATS)"},{"key":"ref18","first-page":"231","article-title":"The online loop-free stochastic shortest-path problem","author":"neu","year":"2010","journal-title":"Proceedings of Conference on Learning Theory (COLT)"},{"key":"ref19","first-page":"1804","article-title":"Online Markov decision processes under bandit feedback","volume":"2","author":"neu","year":"2010","journal-title":"Proceedings of International Conference on Neural Information Processing Systems"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1561\/9781680831719"},{"key":"ref3","volume":"1","author":"bertsekas","year":"1995","journal-title":"Dynamic Programming and Optimal Control"},{"journal-title":"Markov Decision Processes Discrete Stochastic Dynamic Programming","year":"2014","author":"puterman","key":"ref6"},{"key":"ref5","volume":"5","author":"bertsekas","year":"1996","journal-title":"Neuro-Dynamic Programming"},{"key":"ref8","article-title":"Primal-dual 1f learning: Sample complexity and sublinear run time for ergodic Markov decision problems","author":"wang","year":"2017","journal-title":"ArXiv Preprint"},{"key":"ref7","article-title":"Large-scale Markov decision problems via the linear programming dual","author":"abbasi-yadkori","year":"2019","journal-title":"ArXiv Preprint"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1017\/CBO9780511546921"},{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1287\/moor.1090.0396"},{"key":"ref9","first-page":"1583","article-title":"Online learning in episodic Markovian decision processes by relative entropy policy search","author":"zimin","year":"2013","journal-title":"Proceedings of Advances in neural information processing systems (Ne u rIPS)"},{"key":"ref20","first-page":"512","article-title":"Online learning in Markov decision processes with changing cost sequences","author":"dick","year":"2014","journal-title":"Proceedings of International Conference on Machine Learning (ICML)"},{"key":"ref22","doi-asserted-by":"crossref","first-page":"1607","DOI":"10.1609\/aaai.v24i1.7727","article-title":"Relative entropy policy search","author":"peters","year":"2010","journal-title":"Proceedings of AAAI Conference on Artificial Intelligence"},{"key":"ref21","article-title":"Learning adversarial MDPs with bandit feedback and unknown transition","author":"jin","year":"2019","journal-title":"ArXiv Preprint"},{"key":"ref24","article-title":"Online learning with implicit exploration in episodic Markov decision processes","author":"ghasemi","year":"2021","journal-title":"arXiv preprint a rXiv"},{"key":"ref23","first-page":"613","article-title":"Efficient learning by implicit exploration in bandit problems with side observations","author":"kocak","year":"2014","journal-title":"Proceedings of Advances in Neural Information Processing Systems (NeurIPS)"}],"event":{"name":"2021 American Control Conference (ACC)","start":{"date-parts":[[2021,5,25]]},"location":"New Orleans, LA, USA","end":{"date-parts":[[2021,5,28]]}},"container-title":["2021 American Control Conference (ACC)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/9482409\/9482614\/09483085.pdf?arnumber=9483085","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,1,5]],"date-time":"2023-01-05T20:00:28Z","timestamp":1672948828000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/9483085\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2021,5,25]]},"references-count":24,"URL":"https:\/\/doi.org\/10.23919\/acc50511.2021.9483085","relation":{},"subject":[],"published":{"date-parts":[[2021,5,25]]}}}