{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T12:03:30Z","timestamp":1780315410922,"version":"3.54.1"},"reference-count":124,"publisher":"Springer Science and Business Media LLC","issue":"6","license":[{"start":{"date-parts":[[2026,3,25]],"date-time":"2026-03-25T00:00:00Z","timestamp":1774396800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by-nc-nd\/4.0"},{"start":{"date-parts":[[2026,5,21]],"date-time":"2026-05-21T00:00:00Z","timestamp":1779321600000},"content-version":"vor","delay-in-days":57,"URL":"https:\/\/creativecommons.org\/licenses\/by-nc-nd\/4.0"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62406251"],"award-info":[{"award-number":["62406251"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Artif Intell Rev"],"DOI":"10.1007\/s10462-026-11533-6","type":"journal-article","created":{"date-parts":[[2026,3,25]],"date-time":"2026-03-25T04:58:25Z","timestamp":1774414705000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["Nash equilibrium strategy solving in two-player imperfect-information games: a survey"],"prefix":"10.1007","volume":"59","author":[{"given":"Huale","family":"Li","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zhaobin","family":"Wang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zhen","family":"Yang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Shuhan","family":"Qi","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jiajia","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2026,3,25]]},"reference":[{"key":"11533_CR1","doi-asserted-by":"crossref","unstructured":"Abou\u00a0Risk N, Szafron D, et al (2010) Using counterfactual regret minimization to create competitive multiplayer poker agents. In: AAMAS, pp. 159\u2013166","DOI":"10.65109\/SFPS9972"},{"key":"11533_CR2","doi-asserted-by":"crossref","unstructured":"Basak A (2016) Abstraction using analysis of subgames. In: Proceedings of the 30th AAAI Conference on Artificial Intelligence, pp. 4196\u20134197. AAAI Press, Phoenix, USA","DOI":"10.1609\/aaai.v30i1.9956"},{"issue":"1","key":"11533_CR3","first-page":"67","volume":"11","author":"N Basilico","year":"2017","unstructured":"Basilico N, Celli A, De Nittis G, Gatti N (2017) Computing the team-maxmin equilibrium in single-team single-adversary team games. Intell Artif 11(1):67\u201379","journal-title":"Intell Artif"},{"key":"11533_CR4","doi-asserted-by":"crossref","unstructured":"Basilico N, Celli A, De\u00a0Nittis G, Gatti N (2017) Team-maxmin equilibrium: efficiency bounds and algorithms. In: Proceedings of the AAAI Conference on Artificial Intelligence, vol. 31","DOI":"10.1609\/aaai.v31i1.10560"},{"key":"11533_CR5","unstructured":"Berner C, Brockman G, Chan B, Cheung V, Debiak P, Dennison C, Farhi D, Fischer Q, Hashme S, Hesse C, et al (2019) Dota 2 with large scale deep reinforcement learning. arXiv preprint arXiv:1912.06680"},{"key":"11533_CR6","doi-asserted-by":"crossref","unstructured":"Blashfield RK, Aldenderfer MS (1988) The methods and problems of cluster analysis. Handbook of Multivariate Experimental Psychology, 447\u2013473","DOI":"10.1007\/978-1-4613-0893-5_14"},{"issue":"6218","key":"11533_CR7","doi-asserted-by":"publisher","first-page":"145","DOI":"10.1126\/science.1259433","volume":"347","author":"M Bowling","year":"2015","unstructured":"Bowling M, Burch N, Johanson M, Tammelin O (2015) Heads-up limit hold em poker is solved. Science 347(6218):145\u2013149","journal-title":"Science"},{"issue":"1","key":"11533_CR8","first-page":"374","volume":"13","author":"GW Brown","year":"1951","unstructured":"Brown GW (1951) Iterative solution of games by fictitious play. Act Anal Prod Allocation 13(1):374","journal-title":"Act Anal Prod Allocation"},{"issue":"6374","key":"11533_CR9","doi-asserted-by":"publisher","first-page":"418","DOI":"10.1126\/science.aao1733","volume":"359","author":"N Brown","year":"2018","unstructured":"Brown N, Sandholm T (2018) Superhuman ai for heads-up no-limit poker: Libratus beats top professionals. Science 359(6374):418\u2013424","journal-title":"Science"},{"issue":"6456","key":"11533_CR10","doi-asserted-by":"publisher","first-page":"885","DOI":"10.1126\/science.aay2400","volume":"365","author":"N Brown","year":"2019","unstructured":"Brown N, Sandholm T (2019) Superhuman ai for multiplayer poker. Science 365(6456):885\u2013890","journal-title":"Science"},{"key":"11533_CR11","doi-asserted-by":"crossref","unstructured":"Brown N, Ganzfried S, Sandholm T (2015) Hierarchical abstraction, distributed equilibrium computation, and post-processing, with application to a champion no-limit texas hold\u2019em agent. In: Proceedings of the 14th International Conference on Autonomous Agents and Multiagent Systems, pp. 7\u201315. ACM, Istanbul, Turkey","DOI":"10.65109\/EHJL6692"},{"key":"11533_CR12","unstructured":"Brown N, Lerer A, Gross S, Sandholm T (2019) Deep counterfactual regret minimization. In: Proceedings of the 36th International Conference on Machine Learning, pp. 793\u2013802. PMLR, Long Beach, USA"},{"key":"11533_CR13","unstructured":"Brown N, Sandholm T (2015) Regret-based pruning in extensive-form games. In: Proceedings of the 28th International Conference on Neural Information Processing Systems, pp. 1972\u20131980. Curran Associates, Inc., Montreal, Canada"},{"key":"11533_CR14","doi-asserted-by":"crossref","unstructured":"Brown N, Sandholm T (2016) Strategy-based warm starting for regret minimization in games. In: Proceedings of the 30th AAAI Conference on Artificial Intelligence, pp. 432\u2013438. AAAI Press, Arizona, USA","DOI":"10.1609\/aaai.v30i1.10056"},{"key":"11533_CR15","unstructured":"Brown N, Sandholm T (2017) Safe and nested endgame solving for imperfect-information games. In: Proceedings of the 31st AAAI Conference on Artificial Intelligence, pp. 295\u2013303. AAAI Press, San Francisco, USA"},{"key":"11533_CR16","doi-asserted-by":"crossref","unstructured":"Brown N, Sandholm T (2019) Solving imperfect-information games via discounted regret minimization. In: Proceedings of the AAAI Conference on Artificial Intelligence, vol. 33, pp. 1829\u20131836","DOI":"10.1609\/aaai.v33i01.33011829"},{"key":"11533_CR17","doi-asserted-by":"publisher","first-page":"429","DOI":"10.1613\/jair.1.11370","volume":"64","author":"N Burch","year":"2019","unstructured":"Burch N, Moravcik M, Schmid M (2019) Revisiting cfr+ and alternating updates. J Artif Intell Res 64:429\u2013443","journal-title":"J Artif Intell Res"},{"key":"11533_CR18","doi-asserted-by":"crossref","unstructured":"Burch N, Johanson M, Bowling M (2014) Solving imperfect information games using decomposition. In: Proceedings of the 28th AAAI Conference on Artificial Intelligence, pp. 602\u2013608. AAAI Press, Qu\u00e9bec, Canada","DOI":"10.1609\/aaai.v28i1.8810"},{"key":"11533_CR19","doi-asserted-by":"publisher","first-page":"126471","DOI":"10.1016\/j.neucom.2023.126471","volume":"549","author":"Y Chen","year":"2023","unstructured":"Chen Y, Zhang L, Li S, Chen X, Pan G, Pan Z (2023) Rm-fsp: Regret minimization optimizes neural fictitious self-play. Neurocomputing 549:126471","journal-title":"Neurocomputing"},{"key":"11533_CR20","doi-asserted-by":"crossref","unstructured":"Chen Y, Deng X, Li C, Mguni D, Wang J, Yan X, Yang Y (2022) On the convergence of fictitious play: A decomposition approach. In: Proceedings of the Thirty-First International Joint Conference on Artificial Intelligence, pp. 179\u2013185. IJCAI: International Joint Conferences on Artificial Intelligence Organization","DOI":"10.24963\/ijcai.2022\/26"},{"key":"11533_CR21","unstructured":"Chen J, Lan T, Aggarwal V (2023) Hierarchical deep counterfactual regret minimization. arXiv preprint arXiv:2305.17327"},{"key":"11533_CR22","unstructured":"Chen J, Xie W, Zhang W, Wen Y, et al (2024) Offline fictitious self-play for competitive games. arXiv e-prints, 2403"},{"key":"11533_CR23","doi-asserted-by":"crossref","unstructured":"Coulom R (2006) Efficient selectivity and backup operators in monte-carlo tree search. In: International Conference on Computers and Games, pp. 72\u201383. Springer","DOI":"10.1007\/978-3-540-75538-8_7"},{"issue":"2","key":"11533_CR24","doi-asserted-by":"publisher","first-page":"89","DOI":"10.1145\/1461928.1461951","volume":"52","author":"C Daskalakis","year":"2009","unstructured":"Daskalakis C, Goldberg PW, Papadimitriou CH (2009) The complexity of computing a nash equilibrium. Commun ACM 52(2):89\u201397","journal-title":"Commun ACM"},{"key":"11533_CR25","doi-asserted-by":"crossref","unstructured":"D\u2019Orazio R, Morrill D, Wright JR, Bowling M (2019) Alternative function approximation parameterizations for solving games: An analysis of $$ f $$-regression counterfactual regret minimization. arXiv preprint arXiv:1912.02967","DOI":"10.65109\/HJFZ7394"},{"key":"11533_CR26","unstructured":"Dushatskiy A, Chebykin A, Alderliesten T, Bosman P (2023) Multi-objective population based training. In: International Conference on Machine Learning, pp. 8969\u20138989. PMLR"},{"issue":"7847","key":"11533_CR27","doi-asserted-by":"publisher","first-page":"580","DOI":"10.1038\/s41586-020-03157-9","volume":"590","author":"A Ecoffet","year":"2021","unstructured":"Ecoffet A, Huizinga J, Lehman J, Stanley KO, Clune J (2021) First return, then explore. Nature 590(7847):580\u2013586","journal-title":"Nature"},{"key":"11533_CR28","unstructured":"Farina G, Kroer C, Sandholm T (2017) Regret minimization in behaviorally-constrained zero-sum games. In: International Conference on Machine Learning, pp. 1107\u20131116. PMLR"},{"key":"11533_CR29","unstructured":"Farina G, Kroer C, Sandholm T (2020) Stochastic regret minimization in extensive-form games. In: International Conference on Machine Learning, pp. 3018\u20133028. PMLR"},{"key":"11533_CR30","doi-asserted-by":"crossref","unstructured":"Farina G, Kroer C, Sandholm T (2021) Faster game solving via predictive blackwell approachability: Connecting regret matching and mirror descent. In: Proceedings of the AAAI Conference on Artificial Intelligence, vol. 35, pp. 5363\u20135371","DOI":"10.1609\/aaai.v35i6.16676"},{"key":"11533_CR31","doi-asserted-by":"crossref","unstructured":"Farina G, Schmucker R, Sandholm T (2020) Counterfactual-free regret minimization for sequential decision making and extensive-form games. In: AAAI Workshop on Reinforcement Learning in Games","DOI":"10.1609\/aaai.v35i6.16677"},{"key":"11533_CR32","doi-asserted-by":"crossref","unstructured":"Ferguson TS (1970) On a class of infinite games related to liar dice. The Annals of Mathematical Statistics, 353\u2013362","DOI":"10.1214\/aoms\/1177697075"},{"issue":"1\u20132","key":"11533_CR33","doi-asserted-by":"publisher","first-page":"7","DOI":"10.1006\/game.1999.0740","volume":"29","author":"DP Foster","year":"1999","unstructured":"Foster DP, Vohra R (1999) Regret in the on-line decision problem. Games Econom Behav 29(1\u20132):7\u201335","journal-title":"Games Econom Behav"},{"key":"11533_CR34","unstructured":"Ganzfried S, Sandholm T (2013) Action translation in extensive-form games with large action spaces: Axioms, paradoxes, and the pseudo-harmonic mapping. In: Proceedings of the 23rd International Joint Conference on Artificial Intelligence, pp. 120\u2013128. ijcai.org, Beijing, China"},{"issue":"04","key":"11533_CR35","doi-asserted-by":"publisher","first-page":"307","DOI":"10.1142\/S0219198900000202","volume":"2","author":"B Genugten","year":"2000","unstructured":"Genugten B (2000) A weakened form of fictitious play in two-person zero-sum games. Int Game Theory Rev 2(04):307\u2013328","journal-title":"Int Game Theory Rev"},{"key":"11533_CR36","unstructured":"Gibson RG, Burch N, Lanctot M, Szafron D (2012) Efficient monte carlo counterfactual regret minimization in games with many player actions. In: Proceedings of the 25th International Conference on Neural Information Processing Systems, pp. 1880\u20131888. Curran Associates, Inc., Nevada,USA"},{"key":"11533_CR37","doi-asserted-by":"crossref","unstructured":"Gibson R, Lanctot M, Burch N, Szafron D, Bowling M (2012) Generalized sampling and variance in counterfactual regret minimization. In: Proceedings of the AAAI Conference on Artificial Intelligence, vol. 26, pp. 1355\u20131361","DOI":"10.1609\/aaai.v26i1.8241"},{"issue":"5","key":"11533_CR38","doi-asserted-by":"publisher","first-page":"25","DOI":"10.1145\/1284320.1284324","volume":"54","author":"A Gilpin","year":"2007","unstructured":"Gilpin A, Sandholm T (2007) Lossless abstraction of imperfect information games. J ACM 54(5):25\u201355","journal-title":"J ACM"},{"key":"11533_CR39","unstructured":"Gilpin A, Sandholm T (2008) Expectation-based versus potential-aware automated abstraction in imperfect information games: an experimental comparison using poker. In: Proceedings of the 23rd AAAI Conference on Artificial Intelligence, pp. 1454\u20131457. AAAI Press, Chicago, USA"},{"key":"11533_CR40","unstructured":"Goldstein M, Brown N (2022) Converging to unexploitable policies in continuous control adversarial games. In: Deep Reinforcement Learning Workshop NeurIPS 2022"},{"issue":"2","key":"11533_CR41","doi-asserted-by":"publisher","first-page":"69","DOI":"10.2498\/cit.1002381","volume":"22","author":"M Hajibaba","year":"2014","unstructured":"Hajibaba M, Gorgin S (2014) A review on modern distributed computing paradigms: Cloud computing, jungle computing and fog computing. J Comput Inf Technol 22(2):69\u201384","journal-title":"J Comput Inf Technol"},{"key":"11533_CR42","doi-asserted-by":"crossref","unstructured":"Hansen KA, Hansen TD, Miltersen PB, S\u00f8rensen TB (2008) Approximability and parameterized complexity of minmax values. In: Internet and Network Economics: 4th International Workshop, WINE 2008, Shanghai, China, December 17-20, 2008. Proceedings 4, pp. 684\u2013695. Springer","DOI":"10.1007\/978-3-540-92185-1_74"},{"key":"11533_CR43","doi-asserted-by":"crossref","unstructured":"Hawkin JA, Holte R, Szafron D (2011) Automated action abstraction of imperfect information extensive-form games. In: Proceedings of the 25th AAAI Conference on Artificial Intelligence, pp. 681\u2013687. AAAI Press, San Francisco, USA","DOI":"10.1609\/aaai.v25i1.7880"},{"issue":"9","key":"11533_CR44","doi-asserted-by":"publisher","first-page":"6152","DOI":"10.1002\/int.22837","volume":"37","author":"K He","year":"2022","unstructured":"He K, Wu H, Wang Z, Li H (2022) Finding nash equilibrium for imperfect information games via fictitious play based on local regret minimization. Int J Intell Syst 37(9):6152\u20136167","journal-title":"Int J Intell Syst"},{"key":"11533_CR45","unstructured":"Heinrich J, Lanctot M, Silver D (2015) Fictitious self-play in extensive-form games. In: International Conference on Machine Learning, pp. 805\u2013813. PMLR"},{"key":"11533_CR46","unstructured":"Heinrich J, Silver D (2016) Deep reinforcement learning from self-play in imperfect-information games. arXiv preprint arXiv:1603.01121"},{"issue":"2","key":"11533_CR47","doi-asserted-by":"publisher","first-page":"177","DOI":"10.1006\/game.1996.0065","volume":"15","author":"E Hendon","year":"1996","unstructured":"Hendon E, Jacobsen HJ, Sloth B (1996) Fictitious play in extensive form games. Games Econom Behav 15(2):177\u2013202","journal-title":"Games Econom Behav"},{"key":"11533_CR48","doi-asserted-by":"crossref","unstructured":"Hennes D, Morrill D, Omidshafiei S, Munos R, Perolat J, Lanctot M, Gruslys A, Lespiau J-B, Parmas P, Du\u00e9\u00f1ez-Guzm\u00e1n E, et al (2020) Neural replicator dynamics: Multiagent learning via hedging policy gradients. In: Proceedings of the 19th International Conference on Autonomous Agents and Multiagent Systems, pp. 492\u2013501","DOI":"10.65109\/GJMW6851"},{"issue":"6","key":"11533_CR49","doi-asserted-by":"publisher","first-page":"2265","DOI":"10.1111\/1468-0262.00376","volume":"70","author":"J Hofbauer","year":"2002","unstructured":"Hofbauer J, Sandholm WH (2002) On the global convergence of stochastic fictitious play. Econometrica 70(6):2265\u20132294","journal-title":"Econometrica"},{"issue":"6443","key":"11533_CR50","doi-asserted-by":"publisher","first-page":"859","DOI":"10.1126\/science.aau6249","volume":"364","author":"M Jaderberg","year":"2019","unstructured":"Jaderberg M, Czarnecki WM, Dunning I, Marris L, Lever G, Castaneda AG, Beattie C, Rabinowitz NC, Morcos AS, Ruderman A et al (2019) Human-level performance in 3d multiplayer games with population-based reinforcement learning. Science 364(6443):859\u2013865","journal-title":"Science"},{"key":"11533_CR51","unstructured":"Jin P, Keutzer K, Levine S (2018) Regret minimization for partially observable deep reinforcement learning. In: Proceedings of the 35th International Conference on Machine Learning, pp. 2347\u20132356. PMLR, Stockholm, Sweden"},{"key":"11533_CR52","doi-asserted-by":"crossref","unstructured":"Johanson M, Burch N, Valenzano R, Bowling M (2013) Evaluating state-space abstractions in extensive-form games. In: Proceedings of the 12th International Conference on Autonomous Agents and Multiagent Systems, pp. 271\u2013278. ACM, Saint Paul, USA","DOI":"10.65109\/IYLH7767"},{"key":"11533_CR53","unstructured":"Johanson M, Waugh K, Bowling M, Zinkevich M (2011) Accelerating best response calculation in large extensive games. In: Proceedings of the 22nd International Joint Conference on Artificial Intelligence, pp. 258\u2013265. ijcai.org, Barcelona, Spain"},{"key":"11533_CR54","first-page":"15","volume":"20","author":"M Johanson","year":"2007","unstructured":"Johanson M, Zinkevich M, Bowling M (2007) Computing robust counter-strategies. Adv Neural Inf Process Syst 20:15","journal-title":"Adv Neural Inf Process Syst"},{"key":"11533_CR55","unstructured":"Ju Q, Hei F, Fang Z, Luo Y (2024) Integrating dynamic weighted approach with fictitious play and pure counterfactual regret minimization for equilibrium finding. arXiv preprint arXiv:2402.12164"},{"issue":"1","key":"11533_CR56","doi-asserted-by":"publisher","first-page":"95","DOI":"10.1016\/j.ejor.2020.10.015","volume":"292","author":"A Keith","year":"2021","unstructured":"Keith A, Ahner D (2021) Counterfactual regret minimization for integrated cyber and air defense resource allocation. Eur J Oper Res 292(1):95\u2013107","journal-title":"Eur J Oper Res"},{"key":"11533_CR57","unstructured":"Kim J (2024) Gpu-accelerated counterfactual regret minimization. arXiv preprint arXiv:2408.14778"},{"issue":"97\u2013103","key":"11533_CR58","first-page":"2","volume":"1","author":"HW Kuhn","year":"1950","unstructured":"Kuhn HW (1950) A simplified two-person poker. Contri Theor Games 1(97\u2013103):2","journal-title":"Contri Theor Games"},{"issue":"3","key":"11533_CR59","doi-asserted-by":"publisher","first-page":"477","DOI":"10.1287\/opre.1040.0178","volume":"53","author":"TJ Lambert Iii","year":"2005","unstructured":"Lambert Iii TJ, Epelman MA, Smith RL (2005) A fictitious play approach to large-scale optimization. Oper Res 53(3):477\u2013489","journal-title":"Oper Res"},{"key":"11533_CR60","unstructured":"Lanctot M, Lisy V, Bowling M (2014) Search in imperfect information games using online monte carlo counterfactual regret minimization. In: Proceedings of the 28th AAAI Conference on Artificial Intelligence, pp. 34\u201341. AAAI Press, Qu\u00e9bec, Canada"},{"key":"11533_CR61","unstructured":"Lanctot M, Lockhart E, Lespiau J-B, Zambaldi V, Upadhyay S, P\u00e9rolat J, Srinivasan S, Timbers F, Tuyls K, Omidshafiei S, et al (2019) Openspiel: A framework for reinforcement learning in games. arXiv preprint arXiv:1908.09453"},{"key":"11533_CR62","unstructured":"Lanctot M, Waugh K, Zinkevich M, Bowling M (2009) Monte carlo sampling for regret minimization in extensive games. In: Proceedings of the 22nd International Conference on Neural Information Processing Systems, pp. 1078\u20131086. Curran Associates, Inc., Vancouver, Canada"},{"issue":"7553","key":"11533_CR63","first-page":"436","volume":"521","author":"Y LeCun","year":"2015","unstructured":"LeCun Y, Bengio Y, Hinton G (2015) Nature. Deep learning 521(7553):436\u2013444","journal-title":"Deep learning"},{"issue":"2","key":"11533_CR64","doi-asserted-by":"publisher","first-page":"285","DOI":"10.1016\/j.geb.2005.08.005","volume":"56","author":"DS Leslie","year":"2006","unstructured":"Leslie DS, Collins EJ (2006) Generalised weakened fictitious play. Games Econom Behav 56(2):285\u2013298","journal-title":"Games Econom Behav"},{"key":"11533_CR65","doi-asserted-by":"publisher","first-page":"2749","DOI":"10.1007\/s11831-020-09475-5","volume":"28","author":"H Li","year":"2021","unstructured":"Li H, Wang X, Jia F, Li Y, Chen Q (2021) A survey of nash equilibrium strategy solving based on cfr. Arch Comput Methods Eng 28:2749\u20132760","journal-title":"Arch Comput Methods Eng"},{"key":"11533_CR66","doi-asserted-by":"publisher","DOI":"10.1016\/j.knosys.2023.110567","volume":"272","author":"H Li","year":"2023","unstructured":"Li H, Guo Z, Liu Y, Wang X, Qi S, Zhang J, Xiao J (2023) Kdb-d2cfr: Solving multiplayer imperfect-information games with knowledge distillation-based deepcfr. Knowl-Based Syst 272:110567","journal-title":"Knowl-Based Syst"},{"key":"11533_CR67","doi-asserted-by":"publisher","first-page":"100613","DOI":"10.1016\/j.cosrev.2023.100613","volume":"51","author":"H Li","year":"2024","unstructured":"Li H, Huang W, Duan Z, Mguni DH, Shao K, Wang J, Deng X (2024) A survey on algorithms for nash equilibria in finite normal-form games. Comput Sci Rev 51:100613","journal-title":"Comput Sci Rev"},{"issue":"12","key":"11533_CR68","doi-asserted-by":"publisher","first-page":"18343","DOI":"10.1109\/TNNLS.2023.3314638","volume":"35","author":"H Li","year":"2024","unstructured":"Li H, Wang X, Guo Z, Zhang J, Qi S (2024) D2cfr: minimize counterfactual regret with deep dueling neural network. IEEE Trans Neural Netw Learn Syst 35(12):18343\u201318356","journal-title":"IEEE Trans Neural Netw Learn Syst"},{"key":"11533_CR69","unstructured":"Li H, Hu K, Zhang S, Qi Y, Song L (2019) Double neural counterfactual regret minimization. In: Proceedings of the 8th International Conference on Learning Representations, pp. 1\u201313. OpenReview.net, Addis Ababa, Ethiopia"},{"key":"11533_CR70","unstructured":"Li J, Koyamada S, Ye Q, Liu G, Wang C, Yang R, Zhao L, Qin T, Liu T-Y, Hon H-W (2020) Suphx: Mastering mahjong with deep reinforcement learning. arXiv preprint arXiv:2003.13590"},{"key":"11533_CR71","doi-asserted-by":"crossref","unstructured":"Li A, Spyra O, Perel S, Dalibard V, Jaderberg M, Gu C, Budden D, Harley T, Gupta P (2019) A generalized framework for population based training. In: Proceedings of the 25th ACM SIGKDD International Conference on Knowledge Discovery & Data Mining, pp. 1791\u20131799","DOI":"10.1145\/3292500.3330649"},{"key":"11533_CR72","doi-asserted-by":"crossref","unstructured":"Lisy V, Davis T, Bowling M (2016) Counterfactual regret minimization in sequential security games. In: Proceedings of the AAAI Conference on Artificial Intelligence, vol. 30","DOI":"10.1609\/aaai.v30i1.10051"},{"key":"11533_CR73","doi-asserted-by":"crossref","unstructured":"Lis\u1ef3 V, Lanctot M, Bowling MH (2015) Online monte carlo counterfactual regret minimization for search in imperfect information games. In: AAMAS, pp. 27\u201336","DOI":"10.65109\/QFXI4541"},{"key":"11533_CR74","unstructured":"Liu W, Jiang H, Li B, Li H (2022) Equivalence analysis between counterfactual regret minimization and online mirror descent. In: International Conference on Machine Learning, pp. 13717\u201313745. PMLR"},{"key":"11533_CR75","unstructured":"Liu W, Li B, Togelius J (2020) Model-free neural counterfactual regret minimization with bootstrap learning. ArXiv Preprint arXiv:2012.01870, 1\u201319"},{"key":"11533_CR76","doi-asserted-by":"crossref","unstructured":"Li S, Zhang Y, Wang X, Xue W, An B (2021) Cfr-mix: Solving imperfect information extensive-form games with combinatorial action space. arXiv preprint arXiv:2105.08440","DOI":"10.24963\/ijcai.2021\/504"},{"key":"11533_CR77","doi-asserted-by":"crossref","unstructured":"Mnih V, Kavukcuoglu K, Silver D, Rusu AA, Veness J, Bellemare MG, Graves A, Riedmiller M, Fidjeland AK, Ostrovski G, et al (2015) Human-level control through deep reinforcement learning. nature 518(7540), 529\u2013533","DOI":"10.1038\/nature14236"},{"issue":"6337","key":"11533_CR78","doi-asserted-by":"publisher","first-page":"508","DOI":"10.1126\/science.aam6960","volume":"356","author":"M Morav\u010d\u00edk","year":"2017","unstructured":"Morav\u010d\u00edk M, Schmid M, Burch N, Lis\u1ef3 V, Morrill D, Bard N, Davis T, Waugh K, Johanson M, Bowling M (2017) Deepstack: expert-level artificial intelligence in heads-up no-limit poker. Science 356(6337):508\u2013513","journal-title":"Science"},{"key":"11533_CR79","doi-asserted-by":"crossref","unstructured":"Nash JF, et al (1950) Non-cooperative games","DOI":"10.2307\/1969529"},{"key":"11533_CR80","doi-asserted-by":"crossref","unstructured":"Neller TW, Lanctot M (2013) An introduction to counterfactual regret minimization. In: Proceedings of Model AI Assignments, the Fourth Symposium on Educational Advances in Artificial Intelligence (EAAI-2013), vol. 11","DOI":"10.1609\/aaai.v27i3.19009"},{"key":"11533_CR81","volume-title":"A course in game theory","author":"MJ Osborne","year":"1994","unstructured":"Osborne MJ, Rubinstein A (1994) A course in game theory. MIT Press, Cambridge, MA"},{"key":"11533_CR82","unstructured":"Panageas I, Patris N, Skoulakis S, Cevher V (2024) Exponential lower bounds for fictitious play in potential games. Advances in Neural Information Processing Systems 36"},{"issue":"6623","key":"11533_CR83","doi-asserted-by":"publisher","first-page":"990","DOI":"10.1126\/science.add4679","volume":"378","author":"J Perolat","year":"2022","unstructured":"Perolat J, De Vylder B, Hennes D, Tarassov E, Strub F, Boer V, Muller P, Connor JT, Burch N, Anthony T et al (2022) Mastering the game of stratego with model-free multiagent reinforcement learning. Science 378(6623):990\u2013996","journal-title":"Science"},{"key":"11533_CR84","unstructured":"Perolat J, Piot B, Pietquin O (2018) Actor-critic fictitious play in simultaneous move multistage games. In: International Conference on Artificial Intelligence and Statistics, pp. 919\u2013928. PMLR"},{"key":"11533_CR85","first-page":"13199","volume":"33","author":"S Perrin","year":"2020","unstructured":"Perrin S, P\u00e9rolat J, Lauri\u00e8re M, Geist M, Elie R, Pietquin O (2020) Fictitious play for mean field games: Continuous time analysis and applications. Adv Neural Inf Process Syst 33:13199\u201313213","journal-title":"Adv Neural Inf Process Syst"},{"key":"11533_CR86","first-page":"575","volume":"42","author":"M Ponsen","year":"2011","unstructured":"Ponsen M, De Jong S, Lanctot M (2011) Computing approximate nash equilibria and robust best-responses using sampling. J Artif Intell Res 42:575\u2013605","journal-title":"J Artif Intell Res"},{"key":"11533_CR87","unstructured":"Qin R-J, Pang J-C, Yu Y (2019) Improving fictitious play reinforcement learning with expanding models. arXiv preprint arXiv:1911.11928"},{"issue":"1","key":"11533_CR88","doi-asserted-by":"publisher","first-page":"9482323","DOI":"10.1155\/int\/9482323","volume":"2024","author":"C Qiu","year":"2024","unstructured":"Qiu C, Wang X, Ma T, Wen Y, Zhang J (2024) Combining counterfactual regret minimization with information gain to solve extensive games with unknown environments. Int J Intell Syst 2024(1):9482323","journal-title":"Int J Intell Syst"},{"key":"11533_CR89","doi-asserted-by":"crossref","unstructured":"Schmid M, Burch N, Lanctot M, Moravcik M, Kadlec R, Bowling M (2019) Variance reduction in monte carlo counterfactual regret minimization (vr-mccfr) for extensive form games using baselines. In: Proceedings of the AAAI Conference on Artificial Intelligence, vol. 33, pp. 2157\u20132164","DOI":"10.1609\/aaai.v33i01.33012157"},{"issue":"7839","key":"11533_CR90","doi-asserted-by":"publisher","first-page":"604","DOI":"10.1038\/s41586-020-03051-4","volume":"588","author":"J Schrittwieser","year":"2020","unstructured":"Schrittwieser J, Antonoglou I, Hubert T, Simonyan K, Sifre L, Schmitt S, Guez A, Lockhart E, Hassabis D, Graepel T et al (2020) Mastering atari, go, chess and shogi by planning with a learned model. Nature 588(7839):604\u2013609","journal-title":"Nature"},{"key":"11533_CR91","first-page":"353","volume":"10","author":"A Shapiro","year":"2003","unstructured":"Shapiro A (2003) Monte carlo sampling methods. Handbooks Oper Res Management Sci 10:353\u2013425","journal-title":"Handbooks Oper Res Management Sci"},{"key":"11533_CR92","doi-asserted-by":"crossref","unstructured":"Shi J, Littman ML (2000) Abstraction methods for game theoretic poker. In: Proceedings of the 2nd International Conference on Computers and Games, pp. 333\u2013345. Springer, Hamamatsu, Japan","DOI":"10.1007\/3-540-45579-5_22"},{"issue":"6419","key":"11533_CR93","doi-asserted-by":"publisher","first-page":"1140","DOI":"10.1126\/science.aar6404","volume":"362","author":"D Silver","year":"2018","unstructured":"Silver D, Hubert T, Schrittwieser J, Antonoglou I, Lai M, Guez A, Lanctot M, Sifre L, Kumaran D, Graepel T et al (2018) A general reinforcement learning algorithm that masters chess, shogi, and go through self-play. Science 362(6419):1140\u20131144","journal-title":"Science"},{"key":"11533_CR94","doi-asserted-by":"crossref","unstructured":"Silver D, Huang A, Maddison CJ, Guez A, Sifre L, Van Den\u00a0Driessche G, Schrittwieser J, Antonoglou I, Panneershelvam V, Lanctot M, et al (2016) Mastering the game of go with deep neural networks and tree search. nature 529(7587), 484\u2013489","DOI":"10.1038\/nature16961"},{"key":"11533_CR95","doi-asserted-by":"crossref","unstructured":"Silver D, Schrittwieser J, Simonyan K, Antonoglou I, Huang A, Guez A, Hubert T, Baker L, Lai M, Bolton A, et al (2017) Mastering the game of go without human knowledge. nature 550(7676), 354\u2013359","DOI":"10.1038\/nature24270"},{"key":"11533_CR96","unstructured":"Southey F, Bowling M, Larson B, Piccione C, Burch N, Billings D, Rayner C (2005) Bayes\u2019 bluff: opponent modelling in poker. In: Proceedings of the Twenty-First Conference on Uncertainty in Artificial Intelligence, pp. 550\u2013558"},{"key":"11533_CR97","unstructured":"Steinberger E (2019) Single deep counterfactual regret minimization. ArXiv Preprint arXiv:1901.07621, 1\u201313"},{"key":"11533_CR98","unstructured":"Steinberger E, Lerer A, Brown N (2021) Dream: Deep regret minimization with advantage baselines and model-free learning. In: Proceedings of the 35th AAAI Conference on Artificial Intelligence, pp. 5300\u20135308. AAAI Press, Virtual Event"},{"key":"11533_CR99","unstructured":"Sutton RS, Barto AG (2018) Reinforcement Learning: An Introduction. MIT press"},{"key":"11533_CR100","unstructured":"Swaminathan A, Joachims T (2015) Counterfactual risk minimization: Learning from logged bandit feedback. In: International Conference on Machine Learning, pp. 814\u2013823. PMLR"},{"key":"11533_CR101","unstructured":"Sychrovsk\u1ef3 D, Sustr M, Bowling M, Schmid M (2023) Global cfr: Meta-learning in self-play regret minimization. In: OPT 2023: Optimization for Machine Learning"},{"key":"11533_CR102","unstructured":"Tammelin O (2014) Solving large imperfect information games using cfr+. ArXiv Preprint arXiv:1407.5042, 1\u20136"},{"key":"11533_CR103","unstructured":"Te\u00f3filo LFG, Reis LP, Cardoso HL (2013) Speeding-up poker game abstraction computation: Average rank strength. In: Proceedings of the 27th AAAI Conference on Artificial Intelligence, pp. 56\u201364. AAAI Press, Bellevue, USA"},{"key":"11533_CR104","doi-asserted-by":"crossref","unstructured":"Vinyals O, Babuschkin I, Czarnecki WM, Mathieu M, Dudzik A, Chung J, Choi DH, Powell R, Ewalds T, Georgiev P, et al (2019) Grandmaster level in starcraft ii using multi-agent reinforcement learning. nature 575(7782), 350\u2013354","DOI":"10.1038\/s41586-019-1724-z"},{"issue":"1\u20132","key":"11533_CR105","doi-asserted-by":"publisher","first-page":"309","DOI":"10.1006\/game.1997.0527","volume":"21","author":"B Von Stengel","year":"1997","unstructured":"Von Stengel B, Koller D (1997) Team-maxmin equilibria. Games Econom Behav 21(1\u20132):309\u2013321","journal-title":"Games Econom Behav"},{"issue":"5","key":"11533_CR106","doi-asserted-by":"publisher","first-page":"312","DOI":"10.1007\/s10489-024-06194-3","volume":"55","author":"Y Wang","year":"2025","unstructured":"Wang Y, Sun P, Zhang D, Li Y (2025) Counterfactual regret minimization for the safety verification of autonomous driving. Appl Intell 55(5):312","journal-title":"Appl Intell"},{"key":"11533_CR107","doi-asserted-by":"publisher","first-page":"125697","DOI":"10.1016\/j.eswa.2024.125697","volume":"263","author":"S Wang","year":"2025","unstructured":"Wang S, Wang J, Song B (2025) Horse-cfr: Hierarchical opponent reasoning for safe exploitation counterfactual regret minimization. Expert Syst Appl 263:125697","journal-title":"Expert Syst Appl"},{"key":"11533_CR108","first-page":"279","volume":"8","author":"CJ Watkins","year":"1992","unstructured":"Watkins CJ, Dayan P (1992) Q-learning. Mach Learn 8:279\u2013292","journal-title":"Mach Learn"},{"key":"11533_CR109","doi-asserted-by":"crossref","unstructured":"Waugh K, Morrill D, Bagnell JA, Bowling M (2015) Solving games with functional regret estimation. In: Proceedings of the 29th AAAI Conference on Artificial Intelligence, pp. 2138\u20132145. AAAI Press, Austin, USA","DOI":"10.1609\/aaai.v29i1.9445"},{"issue":"44","key":"11533_CR110","first-page":"1","volume":"26","author":"Z Xu","year":"2025","unstructured":"Xu Z, Yu C, Liang Y, Wu Y, Wang Y (2025) Learning global nash equilibrium in team competitive games with generalized fictitious cross-play. J Mach Learn Res 26(44):1\u201330","journal-title":"J Mach Learn Res"},{"key":"11533_CR111","doi-asserted-by":"crossref","unstructured":"Xu Z, Liang Y, Yu C, Wang Y, Wu Y (2023) Fictitious cross-play: Learning global nash equilibrium in mixed cooperative-competitive games. In: Proceedings of the 2023 International Conference on Autonomous Agents and Multiagent Systems, pp. 1053\u20131061","DOI":"10.65109\/DDJG5728"},{"key":"11533_CR112","doi-asserted-by":"crossref","unstructured":"Xu H, Li K, Fu H, Fu Q, Xing J (2022) Autocfr: Learning to design counterfactual regret minimization algorithms. In: Proceedings of the 36th AAAI Conference on Artificial Intelligence, pp. 10\u201318. AAAI Press, Virtual Event, Canada","DOI":"10.1609\/aaai.v36i5.20460"},{"key":"11533_CR113","unstructured":"Xu H, Li K, Fu H, Fu Q, Xing J, Cheng J (2024) Dynamic discounted counterfactual regret minimization. In: The Twelfth International Conference on Learning Representations"},{"key":"11533_CR114","unstructured":"Xu H, Li K, Liu B, Fu H, Fu Q, Xing J, Cheng J (2024) Minimizing weighted counterfactual regret with optimistic online mirror descent. arXiv preprint arXiv:2404.13891"},{"key":"11533_CR115","unstructured":"Yang Y, Wang J (2020) An overview of multi-agent reinforcement learning from game theoretical perspective. arXiv preprint arXiv:2011.00583"},{"issue":"2","key":"11533_CR116","doi-asserted-by":"publisher","first-page":"140","DOI":"10.1109\/JPROC.2023.3234687","volume":"111","author":"M Ye","year":"2023","unstructured":"Ye M, Han Q-L, Ding L, Xu S (2023) Distributed nash equilibrium seeking in games with partial decision information: A survey. Proc IEEE 111(2):140\u2013157","journal-title":"Proc IEEE"},{"key":"11533_CR117","unstructured":"Zenati H, Diemert E, Martin M, Mairal J, Gaillard P (2023) Sequential counterfactual risk minimization. In: International Conference on Machine Learning, pp. 40681\u201340706. PMLR"},{"key":"11533_CR118","unstructured":"Zhang BH, Farina G, Sandholm T (2023) Team belief dag: generalizing the sequence form to team games for fast computation of correlated team max-min equilibria via regret minimization. In: International Conference on Machine Learning, pp. 40996\u201341018. PMLR"},{"key":"11533_CR119","first-page":"1","volume":"15","author":"L Zhang","year":"2021","unstructured":"Zhang L, Chen Y, Wang W, Han Z, Li S, Pan Z, Pan G (2021) A monte carlo neural fictitious self-play approach to approximate nash equilibrium in imperfect-information dynamic games. Front Comp Sci 15:1\u201314","journal-title":"Front Comp Sci"},{"key":"11533_CR120","unstructured":"Zhang Y, An B (2020) Converging to team-maxmin equilibria in zero-sum multiplayer games. In: International Conference on Machine Learning, pp. 11033\u201311043. PMLR"},{"key":"11533_CR121","doi-asserted-by":"crossref","unstructured":"Zhang Y, An B, Subrahmanian V (2022) Correlation-based algorithm for team-maxmin equilibrium in multiplayer extensive-form games. In: 31st International Joint Conference on Artificial Intelligence, IJCAI 2022, pp. 606\u2013612. International Joint Conferences on Artificial Intelligence","DOI":"10.24963\/ijcai.2022\/86"},{"key":"11533_CR122","unstructured":"Zha D, Xie J, Ma W, Zhang S, Lian X, Hu X, Liu J (2021) Douzero: Mastering doudizhu with self-play deep reinforcement learning. In: International Conference on Machine Learning, pp. 12333\u201312344. PMLR"},{"key":"11533_CR123","unstructured":"Zhou Y, Ren T, Li J, Yan D, Zhu J (2019) Lazy-cfr: Fast and near-optimal regret minimization for extensive games with imperfect information. In: Proceedings of the 8th International Conference on Learning Representations, pp. 1\u201315. OpenReview.net, Addis Ababa, Ethiopia"},{"key":"11533_CR124","unstructured":"Zinkevich M, Johanson M, Bowling M, Piccione C (2007) Regret minimization in games with incomplete information. Advances in neural information processing systems 20"}],"container-title":["Artificial Intelligence Review"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s10462-026-11533-6","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10462-026-11533-6.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10462-026-11533-6.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T11:04:45Z","timestamp":1780311885000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s10462-026-11533-6"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,3,25]]},"references-count":124,"journal-issue":{"issue":"6","published-online":{"date-parts":[[2026,6]]}},"alternative-id":["11533"],"URL":"https:\/\/doi.org\/10.1007\/s10462-026-11533-6","relation":{},"ISSN":["1573-7462"],"issn-type":[{"value":"1573-7462","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026,3,25]]},"assertion":[{"value":"17 September 2025","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"26 February 2026","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"25 March 2026","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors declare no Conflict of interest.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflict of interest"}}],"article-number":"143"}}