{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,4]],"date-time":"2026-07-04T21:19:49Z","timestamp":1783199989803,"version":"3.54.6"},"reference-count":48,"publisher":"Society for Industrial & Applied Mathematics (SIAM)","issue":"3","funder":[{"DOI":"10.13039\/501100004853","name":"Chinese University of Hong Kong","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100004853","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100002920","name":"Research Grants Council, University Grants Committee","doi-asserted-by":"publisher","award":["24211124"],"award-info":[{"award-number":["24211124"]}],"id":[{"id":"10.13039\/501100002920","id-type":"DOI","asserted-by":"publisher"}]},{"name":"International Research Lab"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["SIAM J. Control Optim."],"published-print":{"date-parts":[[2026,6,30]]},"DOI":"10.1137\/25m1742199","type":"journal-article","created":{"date-parts":[[2026,6,12]],"date-time":"2026-06-12T12:27:31Z","timestamp":1781267251000},"page":"1889-1929","source":"Crossref","is-referenced-by-count":1,"title":["Accuracy of Discretely Sampled Stochastic Policies in Continuous-Time Reinforcement Learning"],"prefix":"10.1137","volume":"64","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-6089-9842","authenticated-orcid":true,"given":"Yanwei","family":"Jia","sequence":"first","affiliation":[{"name":"Department of Systems Engineering and Engineering Management, The Chinese University of Hong Kong, Shatin, NT, Hong Kong."}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0009-9211-4171","authenticated-orcid":true,"given":"Du","family":"Ouyang","sequence":"additional","affiliation":[{"name":"Department of Mathematical Sciences, Tsinghua University, Beijing, 100084, China."}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-9843-1404","authenticated-orcid":true,"given":"Yufei","family":"Zhang","sequence":"additional","affiliation":[{"name":"Department of Mathematics, Imperial College London, London, SW7 2AZ, United Kingdom."}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"351","published-online":{"date-parts":[[2026,6,11]]},"reference":[{"key":"ref1","doi-asserted-by":"crossref","unstructured":"L. C. Baird, Reinforcement learning in continuous time:\u00a0Advantage updating, in Proceedings of the IEEE International Conference on Neural Networks (ICNN\u201994), Vol. 4, 1994, pp. 2448\u20132453.","DOI":"10.1109\/ICNN.1994.374604"},{"key":"ref2","first-page":"1","volume":"23","author":"Basei M.","year":"2022","journal-title":"J. Mach. Learn. Res."},{"key":"ref3","unstructured":"C. Bender and N. T. Thuan, On the Grid-Sampling Limit SDE, preprint, arXiv:2410.07778, 2024."},{"key":"ref4","first-page":"104848","author":"Bender C.","year":"2025","journal-title":"Stochastic Process. Appl."},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1007\/s002459900110"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1137\/S0363012997331639"},{"key":"ref7","unstructured":"R. Carmona and M. Lauriere, Reconciling Discrete-Time Mixed Policies and Continuous-Time Relaxed Controls in Reinforcement Learning and Stochastic Control, preprint, arXiv:2504.21793, 2025."},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1002\/9781118673331"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1111\/mafi.12402"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1162\/089976600300015961"},{"key":"ref11","series-title":"Stoch. Model. Appl. Probab. 25","volume-title":"Controlled Markov Processes and Viscosity Solutions","author":"Fleming W. H.","year":"2006"},{"key":"ref12","first-page":"1","volume":"26","author":"Frikha N.","year":"2025","journal-title":"J. Mach. Learn. Res."},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1137\/22M1533517"},{"key":"ref14","volume-title":"Stoch. Model. Appl. Probab. 68","author":"Graham C.","year":"2013"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1137\/21M1414413"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1287\/moor.2021.1238"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1137\/S0036142901389530"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1214\/19-ECP256"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1007\/s00245-026-10412-4"},{"key":"ref20","first-page":"1","volume":"23","author":"Jia Y.","year":"2022","journal-title":"J. Mach. Learn. Res."},{"key":"ref21","first-page":"1","volume":"23","author":"Jia Y.","year":"2022","journal-title":"J. Mach. Learn. Res."},{"key":"ref22","first-page":"1","volume":"24","author":"Jia Y.","year":"2023","journal-title":"J. Mach. Learn. Res."},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1007\/978-1-4757-4015-8"},{"key":"ref24","first-page":"1","volume":"22","author":"Kim J.","year":"2021","journal-title":"J. Mach. Learn. Res."},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-662-12616-5"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1137\/S0363012995295516"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1090\/mmono\/023"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-20212-4"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1016\/j.automatica.2020.109421"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1137\/24M1680039"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1533\/9780857099402"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1080\/17442508708833443"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1007\/BFb0007334"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1137\/24M166591X"},{"key":"ref35","volume-title":"Reinforcement Learning:\u00a0An Introduction","author":"Sutton R. S.","year":"2018"},{"key":"ref36","first-page":"1057","volume":"12","author":"Sutton R. S.","year":"1999","journal-title":"Adv. Neural Inform. Process. Syst."},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1137\/22M1515744"},{"key":"ref38","unstructured":"C. Tallec, L. Blier, and Y. Ollivier, Making deep q-learning methods robust to time discretization, in Proceedings of the International Conference on Machine Learning, PMLR, 2019, pp. 6096\u20136104."},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1007\/978-1-4757-2545-2"},{"key":"ref40","series-title":"Camb. Ser. Stat. Probab. Math.","volume-title":"High-Dimensional Probability:\u00a0An Introduction with Applications in Data Science","author":"Vershynin R.","year":"2018"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1017\/9781108627771"},{"key":"ref42","first-page":"1","volume":"21","author":"Wang H.","year":"2020","journal-title":"J. Mach. Learn. Res."},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1007\/s00245-024-10205-7"},{"key":"ref44","unstructured":"C. Yildiz, M. Heinonen, and H. L\u00e4hdesm\u00e4ki, Continuous-time model-based reinforcement learning, in Proceedings of the International Conference on Machine Learning, PMLR, 2021, pp. 12009\u201312018."},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1007\/978-1-4612-1466-3"},{"key":"ref46","first-page":"13637","volume":"36","author":"Zhao H.","year":"2023","journal-title":"Adv. Neural Inform. Process. Syst."},{"key":"ref47","unstructured":"Y. Zhu, PhiBE:\u00a0A PDE-based Bellman Equation for Continuous Time Policy Evaluation, preprint, arXiv:2405.12535, 2024."},{"key":"ref48","unstructured":"Y. Zhu, Y. Zhang, and H. Zhang, Optimal-PhiBE:\u00a0A PDE-Based Model-Free Framework for Continuous-Time Reinforcement Learning, preprint, arXiv:2506.05208, 2025."}],"container-title":["SIAM Journal on Control and Optimization"],"original-title":[],"language":"en","deposited":{"date-parts":[[2026,6,12]],"date-time":"2026-06-12T12:27:37Z","timestamp":1781267257000},"score":1,"resource":{"primary":{"URL":"https:\/\/epubs.siam.org\/doi\/10.1137\/25M1742199"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,6,11]]},"references-count":48,"journal-issue":{"issue":"3","published-print":{"date-parts":[[2026,6,30]]}},"alternative-id":["10.1137\/25M1742199"],"URL":"https:\/\/doi.org\/10.1137\/25m1742199","relation":{},"ISSN":["0363-0129","1095-7138"],"issn-type":[{"value":"0363-0129","type":"print"},{"value":"1095-7138","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026,6,11]]}}}