{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,7,2]],"date-time":"2025-07-02T22:43:29Z","timestamp":1751496209501,"version":"3.40.3"},"publisher-location":"Cham","reference-count":12,"publisher":"Springer International Publishing","isbn-type":[{"type":"print","value":"9783319700861"},{"type":"electronic","value":"9783319700878"}],"license":[{"start":{"date-parts":[[2017,1,1]],"date-time":"2017-01-01T00:00:00Z","timestamp":1483228800000},"content-version":"unspecified","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2017]]},"DOI":"10.1007\/978-3-319-70087-8_86","type":"book-chapter","created":{"date-parts":[[2017,10,23]],"date-time":"2017-10-23T21:10:19Z","timestamp":1508793019000},"page":"840-848","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":3,"title":["FMR-GA \u2013 A Cooperative Multi-agent Reinforcement Learning Algorithm Based on Gradient Ascent"],"prefix":"10.1007","author":[{"given":"Zhen","family":"Zhang","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Dongqing","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Dongbin","family":"Zhao","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Tingting","family":"Song","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2017,10,24]]},"reference":[{"key":"86_CR1","doi-asserted-by":"crossref","unstructured":"Busoniu, L., Babuska, R., De Schutter.: A comprehensive survey of multi-agent reinforcement learning. IEEE Trans. Syst. Man Cybern. C, Appl. Rev. 38(2), 156\u2013172 (2008)","DOI":"10.1109\/TSMCC.2007.913919"},{"issue":"3","key":"86_CR2","doi-asserted-by":"publisher","first-page":"248","DOI":"10.1109\/JAS.2014.7004682","volume":"1","author":"Z Zhang","year":"2014","unstructured":"Zhang, Z., Zhao, D.: Clique-based cooperative multiagent reinforcement learning using factor graphs. IEEE\/CAA J. Autom. Sinica 1(3), 248\u2013256 (2014)","journal-title":"IEEE\/CAA J. Autom. Sinica"},{"issue":"1","key":"86_CR3","doi-asserted-by":"publisher","first-page":"23","DOI":"10.1016\/j.neucom.2011.05.032","volume":"78","author":"D Zhao","year":"2012","unstructured":"Zhao, D., Zhang, Z., Dai, Y.: Self-teaching adaptive dynamic programming for gomoku. Neurocomputing 78(1), 23\u201329 (2012)","journal-title":"Neurocomputing"},{"key":"86_CR4","doi-asserted-by":"crossref","unstructured":"Waltman, L., Kaymak, U.: A theoretical analysis of cooperative behavior in multi-agent Q-learning. In: Proceedings of the 2007 IEEE Symposium on ADPRL, pp. 84\u201391 (2007)","DOI":"10.1109\/ADPRL.2007.368173"},{"key":"86_CR5","doi-asserted-by":"crossref","unstructured":"Tuyls, K., Verbeeck, K., Lenaerts, T.: A Selection-mutation model for Q-Learning in multi-agent systems. In: Proceedings of the Second International Joint Conference on Autonomous Agents and Multiagent Systems, pp. 693\u2013700. ACM (2003)","DOI":"10.1145\/860575.860687"},{"issue":"7","key":"86_CR6","doi-asserted-by":"publisher","first-page":"406","DOI":"10.1016\/j.artint.2007.01.004","volume":"171","author":"K Tuyls","year":"2007","unstructured":"Tuyls, K., Parsons, S.: What evolutionary game theory tells us about multiagent learning. Artif. Intell. 171(7), 406\u2013416 (2007)","journal-title":"Artif. Intell."},{"key":"86_CR7","doi-asserted-by":"crossref","first-page":"659","DOI":"10.1613\/jair.4818","volume":"53","author":"D Bloembergen","year":"2015","unstructured":"Bloembergen, D., Tuyls, K., Hennes, D., et al.: Evolutionary dynamics of multi-agent learning: a survey. J. Artif. Intell. Res. 53, 659\u2013697 (2015)","journal-title":"J. Artif. Intell. Res."},{"issue":"4","key":"86_CR8","doi-asserted-by":"publisher","first-page":"1145","DOI":"10.1103\/PhysRevE.85.041145","volume":"85","author":"A Kianercy","year":"2012","unstructured":"Kianercy, A., Galstyan, A.: Dynamics of boltzmann Q-Learning in two-player two-action games. Phys. Rev. E 85(4), 1145\u20131154 (2012)","journal-title":"Phys. Rev. E"},{"key":"86_CR9","unstructured":"Babes, M., Wunder, M., Littman, M.: Q-Learning in two-player two-action games. In: AAMAS (2009)"},{"key":"86_CR10","unstructured":"Singh, S., Kearns, M., Mansour, Y.: Nash convergence of gradient dynamics in general-sum games. In: Proceedings of UAI, pp. 541\u2013548 (2000)"},{"issue":"2","key":"86_CR11","doi-asserted-by":"publisher","first-page":"215","DOI":"10.1016\/S0004-3702(02)00121-2","volume":"136","author":"M Bowling","year":"2002","unstructured":"Bowling, M., Veloso, M.: Multiagent learning using a variable learning rate. Artif. Intell. 136(2), 215\u2013250 (2002)","journal-title":"Artif. Intell."},{"issue":"6","key":"86_CR12","doi-asserted-by":"publisher","first-page":"1367","DOI":"10.1109\/TCYB.2016.2544866","volume":"47","author":"Z Zhang","year":"2017","unstructured":"Zhang, Z., Zhao, D., Gao, J., et al.: FMRQ - a multiagent reinforcement learning algorithm for fully cooperative tasks. IEEE Trans. Cybern. 47(6), 1367\u20131379 (2017)","journal-title":"IEEE Trans. Cybern."}],"container-title":["Lecture Notes in Computer Science","Neural Information Processing"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-319-70087-8_86","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,3,13]],"date-time":"2024-03-13T15:26:07Z","timestamp":1710343567000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-3-319-70087-8_86"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2017]]},"ISBN":["9783319700861","9783319700878"],"references-count":12,"URL":"https:\/\/doi.org\/10.1007\/978-3-319-70087-8_86","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"type":"print","value":"0302-9743"},{"type":"electronic","value":"1611-3349"}],"subject":[],"published":{"date-parts":[[2017]]},"assertion":[{"value":"24 October 2017","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"ICONIP","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"International Conference on Neural Information Processing","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Guangzhou","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"China","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2017","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"14 November 2017","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"18 November 2017","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"24","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"iconip2017","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"http:\/\/www.iconip2017.org\/index.html","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}