{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,8]],"date-time":"2026-07-08T02:19:22Z","timestamp":1783477162259,"version":"3.55.0"},"reference-count":40,"publisher":"Springer Science and Business Media LLC","issue":"6","license":[{"start":{"date-parts":[[2014,10,15]],"date-time":"2014-10-15T00:00:00Z","timestamp":1413331200000},"content-version":"tdm","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Int. J. Mach. Learn. &amp; Cyber."],"published-print":{"date-parts":[[2016,12]]},"DOI":"10.1007\/s13042-014-0300-y","type":"journal-article","created":{"date-parts":[[2014,10,14]],"date-time":"2014-10-14T08:54:24Z","timestamp":1413276864000},"page":"967-980","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":49,"title":["Reinforcement learning and neural networks for multi-agent nonzero-sum games of nonlinear constrained-input systems"],"prefix":"10.1007","volume":"7","author":[{"given":"Sholeh","family":"Yasini","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Mohammad Bagher","family":"Naghibi Sitani","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Ali","family":"Kirampor","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2014,10,15]]},"reference":[{"key":"300_CR1","unstructured":"Shah V (1998) Power control for wireless data services based on utility and pricing. Dissertation, Rutgers University"},{"issue":"1","key":"300_CR2","doi-asserted-by":"crossref","first-page":"103","DOI":"10.1016\/j.amc.2006.09.100","volume":"188","author":"H Mukaidani","year":"2007","unstructured":"Mukaidani H (2007) Newton\u2019s method for solving cross-coupled sign-indefinite algebraic Riccati equations for weakly coupled large-scale systems. J Appl Math Comput 188(1):103\u2013115","journal-title":"J Appl Math Comput"},{"key":"300_CR3","volume-title":"Differential Games","author":"R Isaacs","year":"1965","unstructured":"Isaacs R (1965) Differential Games. Wiley, New York"},{"issue":"3","key":"300_CR4","doi-asserted-by":"crossref","first-page":"148","DOI":"10.1007\/BF00929443","volume":"3","author":"A Starr","year":"1969","unstructured":"Starr A, Ho Y (1969) Nonzero-sum differential games. J Optim Theory Appl 3(3):148\u2013206","journal-title":"J Optim Theory Appl"},{"key":"300_CR5","doi-asserted-by":"crossref","DOI":"10.1137\/1.9781611971132","volume-title":"Dynamic Noncooperative Game Theory","author":"T Basar","year":"1998","unstructured":"Basar T, Olsder GJ (1998) Dynamic Noncooperative Game Theory, 2nd edn. SIAM, Philadelphia","edition":"2"},{"key":"300_CR6","first-page":"489","volume-title":"New Trends Dynam Appl","author":"T Li","year":"1994","unstructured":"Li T, Gajic Z (1994) Lyapunov iterations for solving coupled algebraic Lyapunov equations of Nash differential games and algebraic Riccati equations of zero-sum games. New Trends Dynam Appl. Birkh\u00e4user, Boston, pp 489\u2013494"},{"issue":"2","key":"300_CR7","doi-asserted-by":"crossref","first-page":"264","DOI":"10.1109\/9.481532","volume":"41","author":"G Freiling","year":"2002","unstructured":"Freiling G, Jank G, Abou-Kandil H (2002) On global existence of solutions to coupled matrix Riccati equations in closed-loop Nash games. IEEE Trans Autom Control 41(2):264\u2013269","journal-title":"IEEE Trans Autom Control"},{"key":"300_CR8","first-page":"49","volume":"7","author":"M Jungers","year":"2007","unstructured":"Jungers M, De Pieri E, Abu-Kandil H (2007) Solving coupled Riccati equations for closed-loop Nash strategy by lack of trust approach. Int J Tomography Stat 7:49\u201354","journal-title":"Int J Tomography Stat"},{"issue":"1","key":"300_CR9","first-page":"9","volume":"3","author":"R Sutton","year":"1988","unstructured":"Sutton R (1988) Learning to predictive by the method of temporal differences. Mach Learn 3(1):9\u201344","journal-title":"Mach Learn"},{"issue":"3","key":"300_CR10","doi-asserted-by":"crossref","first-page":"32","DOI":"10.1109\/MCAS.2009.933854","volume":"9","author":"FL Lewis","year":"2009","unstructured":"Lewis FL, Vrabie D (2009) Reinforcement learning and adaptive dynamic programming for feedback control. IEEE Circuits Syst Mag 9(3):32\u201350","journal-title":"IEEE Circuits Syst Mag"},{"issue":"6","key":"300_CR11","doi-asserted-by":"crossref","first-page":"76","DOI":"10.1109\/MCS.2012.2214134","volume":"32","author":"FL Lewis","year":"2012","unstructured":"Lewis FL, Vrabie D, Vamvoudakis K (2012) Reinforcement learning and feedback control. IEEE Control Syst 32(6):76\u2013105","journal-title":"IEEE Control Syst"},{"key":"300_CR12","volume-title":"Handbook of intelligent control","author":"PJ Werbos","year":"1992","unstructured":"Werbos PJ (1992) Approximate dynamic programming for real-time control and neural modeling. In: White DA, Sofge DA (eds) Handbook of intelligent control. Multiscience Press, Brentwood"},{"issue":"2","key":"300_CR13","doi-asserted-by":"crossref","first-page":"140","DOI":"10.1109\/TSMCC.2002.801727","volume":"32","author":"JJ Murray","year":"2002","unstructured":"Murray JJ, Cox CJ, Lendaris GG, Saeks R (2002) Adaptive dynamic programming. IEEE Trans Syst Man Cybern Part C Appl Rev 32(2):140\u2013153","journal-title":"IEEE Trans Syst Man Cybern Part C Appl Rev"},{"key":"300_CR14","volume-title":"Neuro-dynamic Programming","author":"DP Bertsekas","year":"1996","unstructured":"Bertsekas DP, Tsitsiklis JN (1996) Neuro-dynamic Programming. Athena Scientific, MA"},{"issue":"3","key":"300_CR15","doi-asserted-by":"crossref","first-page":"237","DOI":"10.1016\/j.neunet.2009.03.008","volume":"22","author":"D Vrabie","year":"2009","unstructured":"Vrabie D, Lewis FL (2009) Neural network approach to continuous-time direct adaptive optimal control for partially unknown nonlinear systems. Neural Netw 22(3):237\u2013246","journal-title":"Neural Netw"},{"issue":"5","key":"300_CR16","doi-asserted-by":"crossref","first-page":"878","DOI":"10.1016\/j.automatica.2010.02.018","volume":"46","author":"K Vamvoudakis","year":"2010","unstructured":"Vamvoudakis K, Lewis FL (2010) Online actor-critic algorithm to solve the continuous infinite time horizon optimal control problem. Automatica 46(5):878\u2013888","journal-title":"Automatica"},{"issue":"1","key":"300_CR17","doi-asserted-by":"crossref","first-page":"82","DOI":"10.1016\/j.automatica.2012.09.019","volume":"49","author":"S Bhasin","year":"2012","unstructured":"Bhasin S, Kamalapurkar R, Johnson M, Vamvoudakis K, Lewis FL, Dixon WD (2012) A novel actor-critic-identifier architecture for approximate optimal control of uncertain nonlinear systems. Automatica 49(1):82\u201392","journal-title":"Automatica"},{"issue":"10","key":"300_CR18","doi-asserted-by":"crossref","first-page":"1513","DOI":"10.1109\/TNNLS.2013.2276571","volume":"24","author":"H Modares","year":"2013","unstructured":"Modares H, Lewis FL, Naghibi Sistani MB (2013) Adaptive optimal control of unknown constrained-input systems using policy iteration and neural networks. IEEE Trans Neural Netw Learning Syst 24(10):1513\u20131525","journal-title":"IEEE Trans Neural Netw Learning Syst"},{"issue":"3","key":"300_CR19","doi-asserted-by":"crossref","first-page":"353","DOI":"10.1007\/s11768-011-0166-4","volume":"9","author":"D Vrabie","year":"2011","unstructured":"Vrabie D, Lewis FL (2011) Adaptive dynamic programming for online solution of a zero-sum differential game. J Control Theory Appl 9(3):353\u2013360","journal-title":"J Control Theory Appl"},{"key":"300_CR20","doi-asserted-by":"crossref","unstructured":"Vamvoudakis K, Lewis FL (2010) Online solution of nonlinear two-player zero-sum games using synchronous policy iteration. In Proc. 49th IEEE CDC, pp 3040-3047","DOI":"10.1109\/CDC.2010.5717607"},{"issue":"3\u20135","key":"300_CR21","doi-asserted-by":"crossref","first-page":"232","DOI":"10.1002\/acs.2348","volume":"28","author":"H Modares","year":"2014","unstructured":"Modares H, Lewis FL, Naghibi Sistani MB (2014) Online solution of nonquadratic two-player zero-sum games arising in the H \u221e control of constrained input systems. Int J Adapt Cont Sig Proc 28(3\u20135):232\u2013254","journal-title":"Int J Adapt Cont Sig Proc"},{"key":"300_CR22","doi-asserted-by":"crossref","unstructured":"Johnson M, Bhasin S, Dixon WE (2011) Nonlinear two-player zero-sum game approximate solution using a policy iteration algorithm. In: Proc. IEEE CDC, pp 142\u2013147","DOI":"10.1109\/CDC.2011.6160778"},{"key":"300_CR23","doi-asserted-by":"crossref","unstructured":"Vrabie D, Lewis FL (2010) Integral reinforcement learning for online computation of feedback Nash strategies of nonzero-sum differential games. In: Proc. 49th IEEE CDC, pp 3066\u20133071","DOI":"10.1109\/CDC.2010.5718152"},{"issue":"8","key":"300_CR24","doi-asserted-by":"crossref","first-page":"1556","DOI":"10.1016\/j.automatica.2011.03.005","volume":"47","author":"K Vamvoudakis","year":"2011","unstructured":"Vamvoudakis K, Lewis FL (2011) Multi-player non-zero-sum games: online adaptive learning solution of coupled Hamilton-Jacobi equations. Automatica 47(8):1556\u20131569","journal-title":"Automatica"},{"issue":"1","key":"300_CR25","doi-asserted-by":"crossref","first-page":"206","DOI":"10.1109\/TSMCB.2012.2203336","volume":"45","author":"H Zhang","year":"2013","unstructured":"Zhang H, Cui L, Luo Y (2013) Near-optimal control for nonzero-sum differential games of continuous-time nonlinear systems using single-network ADP. IEEE Trans Cybern 45(1):206\u2013216","journal-title":"IEEE Trans Cybern"},{"issue":"5","key":"300_CR26","doi-asserted-by":"crossref","first-page":"779","DOI":"10.1016\/j.automatica.2004.11.034","volume":"41","author":"M Abu-Khalaf","year":"2005","unstructured":"Abu-Khalaf M, Lewis FL (2005) Nearly optimal control laws for nonlinear systems with saturating actuators using a neural network HJB approach. Automatica 41(5):779\u2013791","journal-title":"Automatica"},{"issue":"7","key":"300_CR27","doi-asserted-by":"crossref","first-page":"1243","DOI":"10.1109\/TNN.2008.2000204","volume":"19","author":"M Abu-Khalaf","year":"2008","unstructured":"Abu-Khalaf M, Lewis FL, Huang J (2008) Neurodynamic programming and zero-sum games for constrained control systems. IEEE Trans Neural Netw 19(7):1243\u20131252","journal-title":"IEEE Trans Neural Netw"},{"key":"300_CR28","doi-asserted-by":"crossref","unstructured":"Chowdhary GV (2010) Concurrent learning for convergence in adaptive control without persistency of excitation. Dissertation, Georgia Institute of Technology","DOI":"10.1109\/CDC.2010.5717148"},{"key":"300_CR29","doi-asserted-by":"crossref","unstructured":"Modares H, Lewis FL, Naghibi Sistani MB, Chowdhary GV, Yucelen T (2013) Adaptive optimal control for the partially-unknown constrained-input using policy iteration with experience replay. AIAA Guidance Navigation and Control Conference, Boston, Massachusetts","DOI":"10.2514\/6.2013-4519"},{"issue":"1","key":"300_CR30","doi-asserted-by":"crossref","first-page":"193","DOI":"10.1016\/j.automatica.2013.09.043","volume":"50","author":"H Modares","year":"2014","unstructured":"Modares H, Lewis FL, Naghibi Sistani MB (2014) Integral reinforcement learning and experience replay for adaptive optimal control of partially-unknown constrained-input continuous-time systems. Automatica 50(1):193\u2013202","journal-title":"Automatica"},{"key":"300_CR31","doi-asserted-by":"publisher","DOI":"10.1002\/acs.2485","author":"S Yasini","year":"2014","unstructured":"Yasini S, Karimpour A, Naghibi Sistani MB, Modares H (2014) Online concurrent reinforcement learning algorithm to solve two-player zero-sum games for partially unknown nonlinear continuous-time systems. Int J Adapt Cont Sig Proc. doi: 10.1002\/acs.2485","journal-title":"Int J Adapt Cont Sig Proc"},{"key":"300_CR32","doi-asserted-by":"crossref","DOI":"10.1002\/9781118122631","volume-title":"Optimal control","author":"FL Lewis","year":"2012","unstructured":"Lewis FL, Vrabie D, Syrmos VL (2012) Optimal control, 3rd edn. Wiley, New York","edition":"3"},{"key":"300_CR33","doi-asserted-by":"crossref","unstructured":"Lyshevski SE (1998) Optimal control of nonlinear continuous-time systems: design of bounded controllers via generalized nonquadratic functionals. In Proc. IEEE ACC. pp 205\u2013209","DOI":"10.1109\/ACC.1998.694659"},{"issue":"5","key":"300_CR34","doi-asserted-by":"crossref","first-page":"551","DOI":"10.1016\/0893-6080(90)90005-6","volume":"3","author":"K Hornik","year":"1990","unstructured":"Hornik K, Stinchcombe M, White H (1990) Universal approximation of an unknown mapping and its derivatives using multilayer feedforward networks. Neural Netw 3(5):551\u2013560","journal-title":"Neural Netw"},{"issue":"7\u20139","key":"300_CR35","doi-asserted-by":"crossref","first-page":"1515","DOI":"10.1016\/j.neucom.2007.05.005","volume":"71","author":"XZ Wang","year":"2008","unstructured":"Wang XZ, Li CG, Yeung DS, Song S, Feng H (2008) A definition of partial derivative of random functions and its application to RBFNN sensitivity analysis. Neurocomputing 71(7\u20139):1515\u20131526","journal-title":"Neurocomputing"},{"issue":"1","key":"300_CR36","doi-asserted-by":"publisher","first-page":"51","DOI":"10.1007\/s13042-013-0180-6","volume":"5","author":"A Ghazikhani","year":"2014","unstructured":"Ghazikhani A, Monsefi R, Sadoghi Yazdi H (2014) Online neural network model for non-stationary and imbalanced data stream classification. Int J Mach Learn Cyber 5(1):51\u201362. doi: 10.1007\/s13042-013-0180-6","journal-title":"Int J Mach Learn Cyber"},{"issue":"3","key":"300_CR37","doi-asserted-by":"publisher","first-page":"217","DOI":"10.1007\/s13042-012-0089-5","volume":"4","author":"M Barakat","year":"2013","unstructured":"Barakat M, Lefebvre D, Khalil M, Druaux F, Mustapha O (2013) Parameter selection algorithm with self adaptive growing neural network classifier for diagnosis issues. Int J Mach Learn Cyber 4(3):217\u2013233. doi: 10.1007\/s13042-012-0089-5","journal-title":"Int J Mach Learn Cyber"},{"key":"300_CR38","unstructured":"Nevisitc V, Primbs JA (1996) Constrained nonlinear optimal control: A converse HJB approach. California Institute of Technology, Tech. Rep"},{"issue":"1","key":"300_CR39","doi-asserted-by":"publisher","first-page":"39","DOI":"10.1007\/s13042-013-0199-8","volume":"5","author":"R Raja","year":"2014","unstructured":"Raja R, Karthik Raja U, Samidurai R, Leelamani A (2014) Dynamic analysis of discrete-time BAM neural networks with stochastic perturbations and impulses. Int J Mach Learn Cyber 5(1):39\u201350. doi: 10.1007\/s13042-013-0199-8","journal-title":"Int J Mach Learn Cyber"},{"key":"300_CR40","volume-title":"Inequalities","author":"G Hardy","year":"1998","unstructured":"Hardy G, Littlewood J, Polya G (1998) Inequalities, 2nd edn. Cambridge University Press, Cambridge","edition":"2"}],"updated-by":[{"DOI":"10.1007\/s13042-015-0336-7","type":"correction","label":"Correction","source":"publisher","updated":{"date-parts":[[2015,2,18]],"date-time":"2015-02-18T00:00:00Z","timestamp":1424217600000}}],"container-title":["International Journal of Machine Learning and Cybernetics"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s13042-014-0300-y.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/article\/10.1007\/s13042-014-0300-y\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s13042-014-0300-y.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s13042-014-0300-y","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2019,8,16]],"date-time":"2019-08-16T05:04:33Z","timestamp":1565931873000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/s13042-014-0300-y"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2014,10,15]]},"references-count":40,"journal-issue":{"issue":"6","published-print":{"date-parts":[[2016,12]]}},"alternative-id":["300"],"URL":"https:\/\/doi.org\/10.1007\/s13042-014-0300-y","relation":{"correction":[{"id-type":"doi","id":"10.1007\/s13042-015-0336-7","asserted-by":"object"}]},"ISSN":["1868-8071","1868-808X"],"issn-type":[{"value":"1868-8071","type":"print"},{"value":"1868-808X","type":"electronic"}],"subject":[],"published":{"date-parts":[[2014,10,15]]}}}