{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,30]],"date-time":"2026-05-30T05:01:43Z","timestamp":1780117303991,"version":"3.54.0"},"reference-count":56,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"6","license":[{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/501100000781","name":"European Research Council","doi-asserted-by":"publisher","award":["TRUST-949796"],"award-info":[{"award-number":["TRUST-949796"]}],"id":[{"id":"10.13039\/501100000781","id-type":"DOI","asserted-by":"publisher"}]},{"name":"NSERC Discovery","award":["RGPIN-2025-06544"],"award-info":[{"award-number":["RGPIN-2025-06544"]}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Automat. Contr."],"published-print":{"date-parts":[[2026,6]]},"DOI":"10.1109\/tac.2026.3652902","type":"journal-article","created":{"date-parts":[[2026,1,12]],"date-time":"2026-01-12T22:05:24Z","timestamp":1768255524000},"page":"3880-3893","source":"Crossref","is-referenced-by-count":0,"title":["From Optimization to Control: Quasi-Policy Iteration"],"prefix":"10.1109","volume":"71","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-4290-3836","authenticated-orcid":false,"given":"Mohamad Amin Sharifi","family":"Kolarijani","sequence":"first","affiliation":[{"name":"Delft Center for Systems and Control, Delft University of Technology, Delft, CD, The Netherlands"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-1286-8782","authenticated-orcid":false,"given":"Peyman Mohajerin","family":"Esfahani","sequence":"additional","affiliation":[{"name":"Delft Center for Systems and Control, Delft University of Technology, Delft, CD, The Netherlands"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1512\/iumj.1957.6.56038"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1287\/moor.4.1.60"},{"key":"ref3","volume-title":"Dynamic Programming and Markov Processes","author":"Howard","year":"1960"},{"key":"ref4","article-title":"From convex optimization to MDPs: A review of first-order, second-order and quasi-Newton methods for MDPs","author":"Grand-Clment","year":"2021"},{"key":"ref5","article-title":"On connections between constrained optimization and reinforcement learning","author":"Vieillard","year":"2019"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1016\/0041-5553(64)90137-5"},{"issue":"3","key":"ref7","first-page":"543","article-title":"A method for solving the convex programming problem with convergence rate $o (1\/k^{2})$","volume":"269","author":"Nesterov","year":"1983","journal-title":"Doklady Akademii Nauk SSSR"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1145\/321296.321305"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1287\/opre.2022.2269"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1137\/18M1232772"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1090\/S0002-9904-1967-11864-0"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.52202\/075280-2346"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/TAC.2021.3112851"},{"key":"ref14","article-title":"Speedy Q-learning","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"24","author":"Ghavamzadeh","year":"2011"},{"key":"ref15","first-page":"665","article-title":"Finite-time theory for momentum Q-learning","volume-title":"Proc. 37th Conf. Uncertainty Artif. Intell.","author":"Weng","year":"2021"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1109\/ALLERTON.2019.8919828"},{"key":"ref17","article-title":"Unified convergence analysis of stochastic momentum methods for convex and non-convex optimization","author":"Yang","year":"2016"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/ITA.2018.8503173"},{"key":"ref19","article-title":"Accelerating SGD with momentum for over-parameterized learning","author":"Liu","year":"2018"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1145\/3055399.3055448"},{"key":"ref21","article-title":"Zap Q-learning","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"30","author":"Devraj","year":"2017"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1214\/aos\/1176346589"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/TAC.1975.1100984"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1002\/SERIES1345"},{"key":"ref25","volume-title":"Abstract Dynamic Programming","author":"Bertsekas","year":"2022"},{"key":"ref26","doi-asserted-by":"crossref","DOI":"10.1007\/978-3-031-01551-9","volume-title":"Algorithms for Reinforcement Learning","author":"Szepesvri","year":"2010"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/TAC.2011.2115290"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1109\/9.580874"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1007\/0-306-48332-7_333"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.48550\/ARXIV.1404.7828"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1109\/tnn.1998.712192"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/LCSYS.2020.2973199"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1016\/j.automatica.2021.109623"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1109\/TAC.2022.3232637"},{"key":"ref35","first-page":"23652","article-title":"Fast approximate dynamic programming for infinite-horizon Markov decision processes","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"34","author":"Kolarijani","year":"2021"},{"key":"ref36","volume-title":"Max-Plus Methods for Nonlinear Control and Estimation","author":"McEneaney","year":"2006"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1109\/LCSYS.2024.3520060"},{"key":"ref38","volume-title":"Discrete-Time Markov Control Processes: Basic Optimality Criteria","author":"Hernndez-Lerma","year":"2012"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1287\/moor.1040.0094"},{"key":"ref40","volume-title":"Further Topics on Discrete-Time Markov Control Processes","author":"Hernndez-Lerma","year":"2012"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1137\/17M1133087"},{"key":"ref42","volume-title":"Markov Decision Processes: Discrete Stochastic Dynamic Programming","author":"Puterman","year":"2014"},{"key":"ref43","volume-title":"Lessons from AlphaZero for Optimal, Model Predictive, and Adaptive Control","author":"Bertsekas","year":"2022"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1109\/LCSYS.2022.3181213"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1561\/2200000050"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1090\/S0025-5718-1965-0198670-6"},{"key":"ref47","article-title":"Anderson acceleration for reinforcement learning","author":"Geist","year":"2018"},{"key":"ref48","first-page":"3732","article-title":"Damped anderson mixing for deep reinforcement learning: Acceleration, convergence, and stabilization","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"34","author":"Sun","year":"2021"},{"key":"ref49","first-page":"996","article-title":"Finite-sample convergence rates for Q-learning and indirect algorithms","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Kearns","year":"1998"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1007\/BF00992698"},{"key":"ref51","volume-title":"Finite-Dimensional Variational Inequalities and Complementarity Problems","volume":"2","author":"Facchinei","year":"2003"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1137\/S1052623494274970"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.1287\/11-SSY056"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1057\/jors.1995.50"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.52202\/068431-2780"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1137\/19M1245384"}],"container-title":["IEEE Transactions on Automatic Control"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/9\/11539063\/11344799.pdf?arnumber=11344799","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,5,30]],"date-time":"2026-05-30T04:16:07Z","timestamp":1780114567000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11344799\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,6]]},"references-count":56,"journal-issue":{"issue":"6"},"URL":"https:\/\/doi.org\/10.1109\/tac.2026.3652902","relation":{},"ISSN":["0018-9286","1558-2523","2334-3303"],"issn-type":[{"value":"0018-9286","type":"print"},{"value":"1558-2523","type":"electronic"},{"value":"2334-3303","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026,6]]}}}