{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,2,4]],"date-time":"2026-02-04T16:34:41Z","timestamp":1770222881797,"version":"3.49.0"},"reference-count":33,"publisher":"Springer Science and Business Media LLC","issue":"12","license":[{"start":{"date-parts":[[2019,11,12]],"date-time":"2019-11-12T00:00:00Z","timestamp":1573516800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2019,11,12]],"date-time":"2019-11-12T00:00:00Z","timestamp":1573516800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Sci. China Inf. Sci."],"published-print":{"date-parts":[[2019,12]]},"DOI":"10.1007\/s11432-018-9865-9","type":"journal-article","created":{"date-parts":[[2019,11,15]],"date-time":"2019-11-15T02:01:52Z","timestamp":1573783312000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":11,"title":["Online adaptive Q-learning method for fully cooperative linear quadratic dynamic games"],"prefix":"10.1007","volume":"62","author":[{"given":"Xinxing","family":"Li","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zhihong","family":"Peng","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Lei","family":"Jiao","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Lele","family":"Xi","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Junqi","family":"Cai","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2019,11,12]]},"reference":[{"key":"9865_CR1","volume-title":"Dynamic Noncooperative Game Theory (Classics in Applied Mathematics)","author":"T Basar","year":"1999","unstructured":"Basar T, Olsder G J. Dynamic Noncooperative Game Theory (Classics in Applied Mathematics). 2nd ed. Philadelphia: SIAM, 1999","edition":"2nd ed."},{"key":"9865_CR2","doi-asserted-by":"publisher","first-page":"2778","DOI":"10.1109\/TAC.2012.2194335","volume":"57","author":"P Falugi","year":"2012","unstructured":"Falugi P, Kountouriotis P A, Vinter R B. Differential games controllers that confine a system to a safe region in the state space, with applications to surge tank control. IEEE Trans Autom Contr, 2012, 57: 2778\u20132788","journal-title":"IEEE Trans Autom Contr"},{"key":"9865_CR3","doi-asserted-by":"publisher","first-page":"042306","DOI":"10.1007\/s11432-014-5083-y","volume":"57","author":"F H Lin","year":"2014","unstructured":"Lin F H, Liu Q, Zhou X W, et al. Towards green for relay in InterPlaNetary Internet based on differential game model. Sci China Inf Sci, 2014, 57: 042306","journal-title":"Sci China Inf Sci"},{"key":"9865_CR4","doi-asserted-by":"publisher","first-page":"65","DOI":"10.1109\/TCYB.2014.2319577","volume":"45","author":"B Luo","year":"2015","unstructured":"Luo B, Wu H N, Huang T. Off-policy reinforcement learning for H\n\u221e control design. IEEE Trans Cyber, 2015, 45: 65\u201376","journal-title":"IEEE Trans Cyber"},{"key":"9865_CR5","volume-title":"Reinforcement Learning: An Introduction","author":"R S Sutton","year":"1998","unstructured":"Sutton R S, Barto A G. Reinforcement Learning: An Introduction. Cambridge: MIT Press 1998"},{"key":"9865_CR6","doi-asserted-by":"publisher","first-page":"050212","DOI":"10.1007\/s11432-018-9683-y","volume":"62","author":"R S Xia","year":"2019","unstructured":"Xia R S, Wu Q X, Chen M. Disturbance observer-based optimal longitudinal trajectory control of near space vehicle. Sci China Inf Sci, 2019, 62: 050212","journal-title":"Sci China Inf Sci"},{"key":"9865_CR7","doi-asserted-by":"publisher","first-page":"058201","DOI":"10.1007\/s11432-016-9022-1","volume":"60","author":"D Wang","year":"2017","unstructured":"Wang D, Mu C X. Developing nonlinear adaptive optimal regulators through an improved neural learning mechanism. Sci China Inf Sci, 2017, 60: 058201","journal-title":"Sci China Inf Sci"},{"key":"9865_CR8","doi-asserted-by":"publisher","first-page":"119204","DOI":"10.1007\/s11432-018-9463-x","volume":"61","author":"X H Yan","year":"2018","unstructured":"Yan X H, Zhu J H, Kuang M C, et al. Missile aerodynamic design using reinforcement learning and transfer learning. Sci China Inf Sci, 2018, 61: 119204","journal-title":"Sci China Inf Sci"},{"key":"9865_CR9","doi-asserted-by":"publisher","first-page":"279","DOI":"10.1007\/BF00992698","volume":"8","author":"C Watkins","year":"1992","unstructured":"Watkins C, Dayan P. Q-learning. Mach Learn, 1992, 8: 279\u2013292","journal-title":"Mach Learn"},{"key":"9865_CR10","unstructured":"Bradtke S J, Ydstie B E, Barto A G. Adaptive linear quadratic control using policy iteration. In: Proceedings of American Control Conference, Baltimore, 1994. 3475\u20133479"},{"key":"9865_CR11","doi-asserted-by":"publisher","first-page":"2279","DOI":"10.1007\/s11432-011-4332-6","volume":"54","author":"C L Chen","year":"2011","unstructured":"Chen C L, Dong D Y, Li H X, et al. Hybrid MDP based integrated hierarchical Q-learning. Sci China Inf Sci, 2011, 54: 2279\u20132294","journal-title":"Sci China Inf Sci"},{"key":"9865_CR12","doi-asserted-by":"publisher","first-page":"122203","DOI":"10.1007\/s11432-015-5462-z","volume":"58","author":"Q L Wei","year":"2015","unstructured":"Wei Q L, Liu D R. A novel policy iteration based deterministic Q-learning for discrete-time nonlinear systems. Sci China Inf Sci, 2015, 58: 122203","journal-title":"Sci China Inf Sci"},{"key":"9865_CR13","doi-asserted-by":"publisher","first-page":"1224","DOI":"10.1109\/TCYB.2016.2542923","volume":"47","author":"Q L Wei","year":"2017","unstructured":"Wei Q L, Lewis F L, Sun Q Y, et al. Discrete-time deterministic Q-learning: a novel convergence analysis. IEEE Trans Cybern, 2017, 47: 1224\u20131237","journal-title":"IEEE Trans Cybern"},{"key":"9865_CR14","doi-asserted-by":"publisher","first-page":"2134","DOI":"10.1109\/TNNLS.2016.2585520","volume":"27","author":"B Luo","year":"2016","unstructured":"Luo B, Liu D R, Huang T W, et al. Model-free optimal tracking control via critic-only Q-learning. IEEE Trans Neural Netw Learn Syst, 2016, 27: 2134\u20132144","journal-title":"IEEE Trans Neural Netw Learn Syst"},{"key":"9865_CR15","doi-asserted-by":"publisher","first-page":"14","DOI":"10.1016\/j.sysconle.2016.12.003","volume":"100","author":"K G Vamvoudakis","year":"2017","unstructured":"Vamvoudakis K G. Q-learning for continuous-time linear systems: a model-free infinite horizon optimal control approach. Syst Control Lett, 2017, 100: 14\u201320","journal-title":"Syst Control Lett"},{"key":"9865_CR16","doi-asserted-by":"publisher","first-page":"353","DOI":"10.1007\/s11768-011-0166-4","volume":"9","author":"D Vrabie","year":"2011","unstructured":"Vrabie D, Lewis F L. Adaptive dynamic programming for online solution of a zero-sum differential game. J Control Theory Appl, 2011, 9: 353\u2013360","journal-title":"J Control Theory Appl"},{"key":"9865_CR17","doi-asserted-by":"publisher","first-page":"714","DOI":"10.1109\/TNNLS.2016.2561300","volume":"28","author":"Y H Zhu","year":"2017","unstructured":"Zhu Y H, Zhao D B, Li X G. Iterative adaptive dynamic programming for solving unknown nonlinear zero-sum game based on online data. IEEE Trans Neural Netw Learn Syst, 2017, 28: 714\u2013725","journal-title":"IEEE Trans Neural Netw Learn Syst"},{"key":"9865_CR18","doi-asserted-by":"publisher","first-page":"1556","DOI":"10.1016\/j.automatica.2011.03.005","volume":"47","author":"K G Vamvoudakis","year":"2011","unstructured":"Vamvoudakis K G, Lewis F L. Multi-player non-zero-sum games: online adaptive learning solution of coupled Hamilton-Jacobi equations. Automatica, 2011, 47: 1556\u20131569","journal-title":"Automatica"},{"key":"9865_CR19","doi-asserted-by":"publisher","first-page":"206","DOI":"10.1109\/TSMCB.2012.2203336","volume":"43","author":"H G Zhang","year":"2013","unstructured":"Zhang H G, Cui L L, Luo Y H. Near-optimal control for nonzero-sum differential games of continuous-time nonlinear systems using single-network ADP. IEEE Trans Cyber, 2013, 43: 206\u2013216","journal-title":"IEEE Trans Cyber"},{"key":"9865_CR20","doi-asserted-by":"publisher","first-page":"1015","DOI":"10.1109\/TSMC.2013.2295351","volume":"44","author":"D R Liu","year":"2014","unstructured":"Liu D R, Li H L, Wang D. Online synchronous approximate optimal learning algorithm for multi-player non-zero-sum games with unknown dynamics. IEEE Trans Syst Man Cyber Syst, 2014, 44: 1015\u20131027","journal-title":"IEEE Trans Syst Man Cyber Syst"},{"key":"9865_CR21","doi-asserted-by":"publisher","first-page":"274","DOI":"10.1016\/j.automatica.2015.08.017","volume":"61","author":"K G Vamvoudakis","year":"2015","unstructured":"Vamvoudakis K G. Non-zero sum Nash Q-learning for unknown deterministic continuous-time linear systems. Automatica, 2015, 61: 274\u2013281","journal-title":"Automatica"},{"key":"9865_CR22","doi-asserted-by":"publisher","first-page":"854","DOI":"10.1109\/TCYB.2015.2488680","volume":"46","author":"D B Zhao","year":"2016","unstructured":"Zhao D B, Zhang Q C, Wang D, et al. Experience replay for optimal control of nonzero-sum game systems with unknown dynamics. IEEE Trans Cyber, 2016, 46: 854\u2013865","journal-title":"IEEE Trans Cyber"},{"key":"9865_CR23","doi-asserted-by":"publisher","first-page":"704","DOI":"10.1109\/TNNLS.2016.2582849","volume":"28","author":"R Z Song","year":"2017","unstructured":"Song R Z, Lewis F L, Wei Q L. Off-policy integral reinforcement learning method to solve nonlinear continuous-time multiplayer nonzero-sum games. IEEE Trans Neural Netw Learn Syst, 2017, 28: 704\u2013713","journal-title":"IEEE Trans Neural Netw Learn Syst"},{"key":"9865_CR24","doi-asserted-by":"publisher","first-page":"1641","DOI":"10.1109\/TSMCB.2012.2227253","volume":"43","author":"S Mehraeen","year":"2013","unstructured":"Mehraeen S, Dierks T, Jagannathan S, et al. Zero-sum two-player game theoretic formulation of affine nonlinear discrete-time systems using neural networks. IEEE Trans Cyber, 2013, 43: 1641\u20131655","journal-title":"IEEE Trans Cyber"},{"key":"9865_CR25","doi-asserted-by":"publisher","first-page":"3331","DOI":"10.1109\/TCYB.2016.2611613","volume":"47","author":"H G Zhang","year":"2017","unstructured":"Zhang H G, Jiang H, Luo C M, et al. Discrete-time nonzero-sum games for multiplayer using policy-iteration-based adaptive dynamic programming algorithms. IEEE Trans Cyber, 2017, 47: 3331\u20133340","journal-title":"IEEE Trans Cyber"},{"key":"9865_CR26","doi-asserted-by":"publisher","first-page":"4091","DOI":"10.1109\/TIE.2016.2542134","volume":"64","author":"H G Zhang","year":"2017","unstructured":"Zhang H G, Jiang H, Luo Y H, et al. Data-driven optimal consensus control for discrete-time multi-agent systems with unknown dynamics using reinforcement learning method. IEEE Trans Ind Electron, 2017, 64: 4091\u20134100","journal-title":"IEEE Trans Ind Electron"},{"key":"9865_CR27","doi-asserted-by":"publisher","first-page":"144","DOI":"10.1016\/j.automatica.2016.12.009","volume":"78","author":"B Kiumarsi","year":"2017","unstructured":"Kiumarsi B, Lewis F L, Jiang Z P. H\n\u221e control of linear discrete-time systems: off-policy reinforcement learning. Automatica, 2017, 78: 144\u2013152","journal-title":"Automatica"},{"key":"9865_CR28","doi-asserted-by":"publisher","first-page":"33","DOI":"10.1109\/MCS.2016.2621461","volume":"37","author":"K G Vamvoudakis","year":"2017","unstructured":"Vamvoudakis K G, Modares H, Kiumarsi B, et al. Game theory-based control system algorithms with real-time reinforcement learning: how to solve multiplayer games online. IEEE Control Syst, 2017, 37: 33\u201352","journal-title":"IEEE Control Syst"},{"key":"9865_CR29","doi-asserted-by":"publisher","first-page":"473","DOI":"10.1016\/j.automatica.2006.09.019","volume":"43","author":"A A Tamimi","year":"2007","unstructured":"Tamimi A A, Lewis F L, Khalaf M A. Model-free Q-learning designs for linear discrete-time zero-sum games with application to H-infinity control. Automatica, 2007, 43: 473\u2013481","journal-title":"Automatica"},{"key":"9865_CR30","doi-asserted-by":"publisher","first-page":"213","DOI":"10.1016\/j.automatica.2018.05.027","volume":"95","author":"S A A Rizvi","year":"2018","unstructured":"Rizvi S A A, Lin Z L. Output feedback Q-learning for discrete-time linear zero-sum games with application to the H-infinity control. Automatica, 2018, 95: 213\u2013221","journal-title":"Automatica"},{"key":"9865_CR31","doi-asserted-by":"publisher","first-page":"4092","DOI":"10.1109\/TIE.2017.2760245","volume":"65","author":"J N Li","year":"2018","unstructured":"Li J N, Chai T Y, Lewis F L, et al. Off-policy Q-learning: set-point design for optimizing dual-rate rougher flotation operational processes. IEEE Trans Ind Electron, 2018, 65: 4092\u20134102","journal-title":"IEEE Trans Ind Electron"},{"key":"9865_CR32","doi-asserted-by":"publisher","first-page":"54","DOI":"10.1137\/0305004","volume":"5","author":"R J Leake","year":"1967","unstructured":"Leake R J, Liu R W. Construction of suboptimal control sequences. J SIAM Control, 1967, 5: 54\u201363","journal-title":"J SIAM Control"},{"key":"9865_CR33","doi-asserted-by":"publisher","DOI":"10.1137\/1.9780898718652","volume-title":"Adaptive Control Tutorial","author":"P Ioannou","year":"2006","unstructured":"Ioannou P, Fidan B. Adaptive Control Tutorial. Philadelphia: SIAM 2006"}],"container-title":["Science China Information Sciences"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11432-018-9865-9.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11432-018-9865-9\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11432-018-9865-9.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,8,8]],"date-time":"2023-08-08T10:41:04Z","timestamp":1691491264000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11432-018-9865-9"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2019,11,12]]},"references-count":33,"journal-issue":{"issue":"12","published-print":{"date-parts":[[2019,12]]}},"alternative-id":["9865"],"URL":"https:\/\/doi.org\/10.1007\/s11432-018-9865-9","relation":{},"ISSN":["1674-733X","1869-1919"],"issn-type":[{"value":"1674-733X","type":"print"},{"value":"1869-1919","type":"electronic"}],"subject":[],"published":{"date-parts":[[2019,11,12]]},"assertion":[{"value":"19 December 2018","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"4 March 2019","order":2,"name":"revised","label":"Revised","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"29 March 2019","order":3,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"12 November 2019","order":4,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}],"article-number":"222201"}}