{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,11,15]],"date-time":"2025-11-15T10:31:46Z","timestamp":1763202706294,"version":"3.37.3"},"reference-count":35,"publisher":"Springer Science and Business Media LLC","issue":"12","license":[{"start":{"date-parts":[[2022,11,16]],"date-time":"2022-11-16T00:00:00Z","timestamp":1668556800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2022,11,16]],"date-time":"2022-11-16T00:00:00Z","timestamp":1668556800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["61976065"],"award-info":[{"award-number":["61976065"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["U1836205"],"award-info":[{"award-number":["U1836205"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100004001","name":"Guizhou Science and Technology Department","doi-asserted-by":"publisher","award":["Qiankehejichu20201Y420"],"award-info":[{"award-number":["Qiankehejichu20201Y420"]}],"id":[{"id":"10.13039\/501100004001","id-type":"DOI","asserted-by":"publisher"}]},{"name":"Guizhou Science Support Project","award":["2022-259"],"award-info":[{"award-number":["2022-259"]}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Appl Intell"],"published-print":{"date-parts":[[2023,6]]},"DOI":"10.1007\/s10489-022-04281-x","type":"journal-article","created":{"date-parts":[[2022,11,16]],"date-time":"2022-11-16T14:03:56Z","timestamp":1668607436000},"page":"15372-15389","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":5,"title":["A Q-based policy gradient optimization approach for Doudizhu"],"prefix":"10.1007","volume":"53","author":[{"given":"Xiaomin","family":"Yu","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-2126-7006","authenticated-orcid":false,"given":"Yisong","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jin","family":"Qin","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Panfeng","family":"Chen","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2022,11,16]]},"reference":[{"issue":"15","key":"4281_CR1","doi-asserted-by":"publisher","first-page":"12014","DOI":"10.1016\/j.eswa.2012.03.050","volume":"39","author":"M Alvarado","year":"2012","unstructured":"Alvarado M, Rend\u00f3n AY (2012) Nash equilibrium for collective strategic reasoning. Expert Syst Appl 39(15):12014\u201312025","journal-title":"Expert Syst Appl"},{"unstructured":"Asadi K, Allen C, Roderick M, Mohamed A-R, Konidaris GD, Littman ML (2017) Mean actor critic. arXiv:1709.00503","key":"4281_CR2"},{"issue":"25","key":"4281_CR3","doi-asserted-by":"publisher","first-page":"3591","DOI":"10.1080\/00036841003670747","volume":"43","author":"OH Azar","year":"2011","unstructured":"Azar OH, Bar-Eli M (2011) Do soccer players play the mixed-strategy nash equilibrium? Appl Econ 43(25):3591\u20133601","journal-title":"Appl Econ"},{"unstructured":"Babaeizadeh M, Frosio I, Tyree S, Clemons J, Kautz J (2017) Reinforcement learning through asynchronous advantage actor-critic on a GPU. In: 5th international conference on learning representations, ICLR 2017, Toulon, April 24\u201326. Conference track proceedings. OpenReview.net","key":"4281_CR4"},{"issue":"6218","key":"4281_CR5","doi-asserted-by":"publisher","first-page":"145","DOI":"10.1126\/science.1259433","volume":"347","author":"M Bowling","year":"2015","unstructured":"Bowling M, Burch N, Johanson M, Tammelin O (2015) Heads-up limit hold\u2019em poker is solved. Science 347(6218):145\u2013149","journal-title":"Science"},{"unstructured":"Brown N, Lerer A, Gross S, Sandholm T (2019) Deep counterfactual regret minimization. In: Chaudhuri K, Salakhutdinov R (eds) Proceedings of the 36th international conference on machine learning, ICM. 9\u201315 June 2019. Long Beach, California, vol 97 of Proceedings of machine learning research, pp 793\u2013802. PMLR","key":"4281_CR6"},{"issue":"6374","key":"4281_CR7","doi-asserted-by":"publisher","first-page":"418","DOI":"10.1126\/science.aao1733","volume":"359","author":"N Brown","year":"2018","unstructured":"Brown N, Sandholm T (2018) Superhuman ai for heads-up no-limit poker: libratus beats top professionals. Science 359(6374):418\u2013424","journal-title":"Science"},{"issue":"6456","key":"4281_CR8","doi-asserted-by":"publisher","first-page":"885","DOI":"10.1126\/science.aay2400","volume":"365","author":"N Brown","year":"2019","unstructured":"Brown N, Sandholm T (2019) Superhuman ai for multiplayer poker. Science 365(6456):885\u2013890","journal-title":"Science"},{"issue":"2","key":"4281_CR9","doi-asserted-by":"publisher","first-page":"120","DOI":"10.1109\/TCIAIG.2012.2200894","volume":"4","author":"PI Cowling","year":"2012","unstructured":"Cowling PI, Powley EJ, Whitehouse D (2012) Information set Monte Carlo tree search. IEEE Trans Comput Intell AI Games 4(2):120\u2013143","journal-title":"IEEE Trans Comput Intell AI Games"},{"key":"4281_CR10","doi-asserted-by":"publisher","first-page":"81","DOI":"10.1016\/j.jtbi.2014.07.009","volume":"361","author":"X Deng","year":"2014","unstructured":"Deng X, Wang Z, Qi L, Deng Y, Mahadevan S (2014) A belief-based evolutionarily stable strategy. J Theor Biol 361:81\u201386","journal-title":"J Theor Biol"},{"unstructured":"Fortunato M, Azar MG, Piot B, Menick J, Hessel M, Osband I, Graves A, Mnih V, Munos R, Hassabis D, Pietquin O, Blundell C, Legg S (2018) Noisy networks for exploration. In: 6th international conference on learning representations, ICLR 2018, Vancouver, BC, April 30\u2013May 3 2018, conference track proceedings. OpenReview.net","key":"4281_CR11"},{"doi-asserted-by":"crossref","unstructured":"Gao Y, Li W, Khalid MNA, Iida H (2020) Quantifying attractiveness of incomplete-information multi-player game: case study using doudizhu. In: Computational science and technology. Springer, pp 301\u2013310","key":"4281_CR12","DOI":"10.1007\/978-981-15-0058-9_29"},{"issue":"3","key":"4281_CR13","doi-asserted-by":"publisher","first-page":"141","DOI":"10.3390\/info11030141","volume":"11","author":"Y Gao","year":"2020","unstructured":"Gao Y, Li W, Xiao Y, Khalid MNA, Iida H (2020) Nature of attractive multiplayer games: case study on China\u2019s most popular card game\u2014doudizhu. Information 11(3):141","journal-title":"Information"},{"unstructured":"Heinrich J, Silver D (2015) Smooth UCT search in computer poker. In: Yang Q, Wooldridge MJ (eds) Proceedings of the twenty-fourth international joint conference on artificial intelligence, IJCAI, Buenos Aires, Argentina, July 25\u201331, 2015. AAAI Press, pp 554\u2013560","key":"4281_CR14"},{"doi-asserted-by":"crossref","unstructured":"Jiang Q, Li K, Du B, Chen H, Fang H (2019) Deltadou: expert-level doudizhu AI through self-play. In: Kraus S","key":"#cr-split#-4281_CR15.1","DOI":"10.24963\/ijcai.2019\/176"},{"unstructured":"(ed) Proceedings of the twenty-eighth international joint conference on artificial intelligence, IJCAI 2019, Macao, China, August 10-16, 2019, pp 1265-1271. ijcai.org","key":"#cr-split#-4281_CR15.2"},{"unstructured":"Kawamura K, Mizukami N, Tsuruoka Y (2017) Neural fictitious self-play in imperfect information games with many players. In: Cazenave T, Winands MHM, Saffidine A (eds) Computer games - 6th workshop, CGW 2017, held in conjunction with the 26th international conference on artificial intelligence, IJCAI 2017, Melbourne, VIC, Australia, August, 20, 2017, Revised selected papers, vol 818 of Communications in computer and information science. Springer, pp 61\u201374","key":"4281_CR16"},{"unstructured":"Knuth DE (2000) Dancing links. arXiv:cs\/0011047","key":"4281_CR17"},{"unstructured":"Lanctot M, Waugh K, Zinkevich M, Bowling MH (2009) Monte Carlo sampling for regret minimization in extensive games. In: Bengio Y, Schuurmans D, Lafferty JD, Williams CKI, Culotta A (eds) Advances in neural information processing systems 22: 23rd annual conference on neural information processing systems 2009. Proceedings of a meeting held 7\u201310 December 2009, Vancouver, British Columbia, Canada. Curran Associates, Inc., pp 1078\u20131086","key":"4281_CR18"},{"unstructured":"Li P, Bing L, Lam W (2018) Actor-critic based training framework for abstractive summarization. arXiv:1803.11070","key":"4281_CR19"},{"doi-asserted-by":"crossref","unstructured":"Li S, Li S, Cao H, Meng K, Ding M (2020) Study on the strategy of playing doudizhu game based on multirole modeling. Complexity 2020","key":"4281_CR20","DOI":"10.1155\/2020\/1764594"},{"doi-asserted-by":"crossref","unstructured":"Li S, Wu R, Bo J (2019) Study on the play strategy of dou dizhu poker based on convolution neural network. In: 2019 IEEE international conferences on ubiquitous computing & communications (IUCC) and data science and computational intelligence (DSCI) and smart computing, networking and services (SmartCNS). IEEE, pp 702\u2013707","key":"4281_CR21","DOI":"10.1109\/IUCC\/DSCI\/SmartCNS.2019.00145"},{"unstructured":"Mnih V, Badia AP, Mirza M, Graves A, Lillicrap TP, Harley T, Silver D, Kavukcuoglu K (2016) Asynchronous methods for deep reinforcement learning. In: Balcan M-F, Weinberger KQ (eds) Proceedings of the 33rd international conference on machine learning, ICML 2016, New York City, NY, USA, June 19\u201324, 2016, vol 48 of JMLR workshop and conference proceedings, pp 1928\u20131937, JMLR.org","key":"4281_CR22"},{"issue":"6337","key":"4281_CR23","doi-asserted-by":"publisher","first-page":"508","DOI":"10.1126\/science.aam6960","volume":"356","author":"M Morav\u010d\u00edk","year":"2017","unstructured":"Morav\u010d\u00edk M, Schmid M, Burch N, Lisy\u0300 V, Morrill D, Bard N, Davis T, Waugh K, Johanson M, Bowling M (2017) Deepstack: expert-level artificial intelligence in heads-up no-limit poker. Science 356(6337):508\u2013513","journal-title":"Science"},{"doi-asserted-by":"crossref","unstructured":"Powley EJ, Whitehouse D, Cowling PI (2011) Determinization in Monte-Carlo tree search for the card game dou di zhu. Proc Artif Intell Simul Behav:17\u201324","key":"4281_CR24","DOI":"10.1109\/CIG.2011.6031993"},{"issue":"1","key":"4281_CR25","doi-asserted-by":"publisher","first-page":"193","DOI":"10.1023\/A:1016304319551","volume":"109","author":"N Schofield","year":"2002","unstructured":"Schofield N, Sened I (2002) Local nash equilibrium in multiparty politics. Ann Oper Res 109 (1):193\u2013211","journal-title":"Ann Oper Res"},{"unstructured":"Schulman J, Wolski F, Dhariwal P, Radford A, Klimov O (2017) Proximal policy optimization algorithms. arXiv:1707.06347","key":"4281_CR26"},{"issue":"7587","key":"4281_CR27","doi-asserted-by":"publisher","first-page":"484","DOI":"10.1038\/nature16961","volume":"529","author":"D Silver","year":"2016","unstructured":"Silver D, Huang A, Maddison CJ, Guez A, Sifre L, van den Driessche G, Schrittwieser J, Antonoglou I, Panneershelvam V, Lanctot M, Dieleman S, Grewe D, Nham J, Kalchbrenner N, Sutskever I, Lillicrap TP, Leach M, Kavukcuoglu K, Graepel T, Hassabis D (2016) Mastering the game of go with deep neural networks and tree search. Nature 529(7587):484\u2013489","journal-title":"Nature"},{"issue":"6419","key":"4281_CR28","doi-asserted-by":"publisher","first-page":"1140","DOI":"10.1126\/science.aar6404","volume":"362","author":"D Silver","year":"2018","unstructured":"Silver D, Hubert T, Schrittwieser J, Antonoglou I, Lai M, Guez A, Lanctot M, Sifre L, Kumaran D, Graepel T et al (2018) A general reinforcement learning algorithm that masters chess, shogi, and go through self-play. Science 362(6419):1140\u20131144","journal-title":"Science"},{"issue":"7676","key":"4281_CR29","doi-asserted-by":"publisher","first-page":"354","DOI":"10.1038\/nature24270","volume":"550","author":"D Silver","year":"2017","unstructured":"Silver D, Schrittwieser J, Simonyan K, Antonoglou I, Huang A, Guez A, Hubert T, Baker L, Lai M, Bolton A, Chen Y, Lillicrap TP, Hui F, Sifre L, van den Driessche G, Graepel T, Hassabis D (2017) Mastering the game of go without human knowledge. Nature 550(7676):354\u2013359","journal-title":"Nature"},{"issue":"1","key":"4281_CR30","first-page":"3","volume":"21","author":"G Tan","year":"2021","unstructured":"Tan G, Wei P, He Y, Xu H, Shi X (2021) Solving the playing strategy of dou dizhu using convolutional neural network: a residual learning approach. J Comput Methods Sci Eng 21(1):3\u201318","journal-title":"J Comput Methods Sci Eng"},{"unstructured":"Wang Z, Schaul T, Hessel M, van Hasselt H, Lanctot M, de Freitas N (2016) Dueling network architectures for deep reinforcement learning. In: Balcan M-F, Weinberger KQ (eds) Proceedings of the 33rd international conference on machine learning, ICML 2016, New York City, NY, USA, June 19\u201324, 2016, vol 48 of JMLR workshop and conference proceedings, pp 1995\u20132003, JMLR.org","key":"4281_CR31"},{"doi-asserted-by":"crossref","unstructured":"Yee A, Rodr\u00edguez R, Alvarado M (2014) Analysis of strategies in American football using nash equilibrium. In: International conference on artificial intelligence: methodology, systems, and applications. Springer, pp 286\u2013294","key":"4281_CR32","DOI":"10.1007\/978-3-319-10554-3_30"},{"doi-asserted-by":"crossref","unstructured":"You Y, Li L, Guo B, Wang W, Lu C (2020) Combinatorial q-learning for dou di zhu. In: Proceedings of the sixteenth AAAI conference on artificial intelligence and interactive digital entertainment, AIIDE\u201920. AAAI Press","key":"4281_CR33","DOI":"10.1609\/aiide.v16i1.7445"},{"doi-asserted-by":"crossref","unstructured":"Zha D, Lai K-H, Cao Y, Huang S, Wei R, Guo J, Hu X (2019) Rlcard: a toolkit for reinforcement learning in card games. arXiv:1910.04376","key":"4281_CR34","DOI":"10.24963\/ijcai.2020\/764"}],"container-title":["Applied Intelligence"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10489-022-04281-x.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s10489-022-04281-x\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10489-022-04281-x.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,6,1]],"date-time":"2023-06-01T03:55:59Z","timestamp":1685591759000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s10489-022-04281-x"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2022,11,16]]},"references-count":35,"journal-issue":{"issue":"12","published-print":{"date-parts":[[2023,6]]}},"alternative-id":["4281"],"URL":"https:\/\/doi.org\/10.1007\/s10489-022-04281-x","relation":{},"ISSN":["0924-669X","1573-7497"],"issn-type":[{"type":"print","value":"0924-669X"},{"type":"electronic","value":"1573-7497"}],"subject":[],"published":{"date-parts":[[2022,11,16]]},"assertion":[{"value":"18 October 2022","order":1,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"16 November 2022","order":2,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}