{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,3,19]],"date-time":"2026-03-19T14:48:35Z","timestamp":1773931715841,"version":"3.50.1"},"reference-count":102,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","license":[{"start":{"date-parts":[[2023,1,1]],"date-time":"2023-01-01T00:00:00Z","timestamp":1672531200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/legalcode"}],"funder":[{"DOI":"10.13039\/501100008812","name":"Defence Science and Technology Group","doi-asserted-by":"publisher","award":["10923"],"award-info":[{"award-number":["10923"]}],"id":[{"id":"10.13039\/501100008812","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Access"],"published-print":{"date-parts":[[2023]]},"DOI":"10.1109\/access.2023.3287100","type":"journal-article","created":{"date-parts":[[2023,6,16]],"date-time":"2023-06-16T17:30:39Z","timestamp":1686936639000},"page":"60737-60757","source":"Crossref","is-referenced-by-count":6,"title":["Reinforcement Learning Agents Playing Ticket to Ride\u2013A Complex Imperfect Information Board Game With Delayed Rewards"],"prefix":"10.1109","volume":"11","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-0373-7142","authenticated-orcid":false,"given":"Shuo","family":"Yang","sequence":"first","affiliation":[{"name":"School of Engineering and Information Technology, University of New South Wales, Canberra, ACT, Australia"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-7344-4302","authenticated-orcid":false,"given":"Michael","family":"Barlow","sequence":"additional","affiliation":[{"name":"School of Professional Studies, University of New South Wales, Canberra, ACT, Australia"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-8566-6423","authenticated-orcid":false,"given":"Thomas","family":"Townsend","sequence":"additional","affiliation":[{"name":"School of Professional Studies, University of New South Wales, Canberra, ACT, Australia"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xuejie","family":"Liu","sequence":"additional","affiliation":[{"name":"School of Engineering and Information Technology, University of New South Wales, Canberra, ACT, Australia"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-1549-0159","authenticated-orcid":false,"given":"Dilini","family":"Samarasinghe","sequence":"additional","affiliation":[{"name":"School of Engineering and Information Technology, University of New South Wales, Canberra, ACT, Australia"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-1132-3492","authenticated-orcid":false,"given":"Erandi","family":"Lakshika","sequence":"additional","affiliation":[{"name":"School of Engineering and Information Technology, University of New South Wales, Canberra, ACT, Australia"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0006-4283-4590","authenticated-orcid":false,"given":"Glennn","family":"Moy","sequence":"additional","affiliation":[{"name":"Defence Science and Technology Group, Edinburgh, SA, Australia"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-7934-5658","authenticated-orcid":false,"given":"Timothy","family":"Lynar","sequence":"additional","affiliation":[{"name":"School of Engineering and Information Technology, University of New South Wales, Canberra, ACT, Australia"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-0440-5032","authenticated-orcid":false,"given":"Benjamin","family":"Turnbull","sequence":"additional","affiliation":[{"name":"School of Engineering and Information Technology, University of New South Wales, Canberra, ACT, Australia"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.1109\/TCIAIG.2012.2200894"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1016\/S0004-3702(97)00082-9"},{"key":"ref59","first-page":"2182","article-title":"Implementation and evaluation of information set Monte Carlo tree search for Pok&#x00E9;mon","author":"ihara","year":"2018","journal-title":"Proc IEEE Int Conf Syst Man Cybern (SMC)"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v24i1.7562"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.1016\/j.artint.2011.03.007"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.3233\/ICG-2007-30403"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1109\/TCIAIG.2012.2204883"},{"key":"ref54","first-page":"1371","article-title":"Finding optimal abstract strategies in extensive-form games","author":"johanson","year":"2012","journal-title":"Proc AAAI"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1126\/science.aar6404"},{"key":"ref50","first-page":"2164","article-title":"Monte-Carlo planning in large POMDPs","author":"silver","year":"2010","journal-title":"Proc NIPS"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1142\/S1793005708001094"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.3233\/ICG-1998-21103"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-540-75538-8_7"},{"key":"ref47","article-title":"Monte Carlo Go","author":"br\u00fcgmann","year":"1993"},{"key":"ref42","first-page":"1068","article-title":"On-line policy improvement using Monte-Carlo search","author":"tesauro","year":"1996","journal-title":"Proc NeurlIPS"},{"key":"ref41","first-page":"1","article-title":"Two-person games with complete information and the search of positions","author":"adelson-velsky","year":"2012","journal-title":"Algorithms for Games"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1016\/j.tcs.2016.06.026"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-12993-3_4"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1007\/11871842_29"},{"key":"ref8","article-title":"AI and wargaming","author":"goodman","year":"2020","journal-title":"arXiv 2009 08922"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-35288-2_1"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1613\/jair.820"},{"key":"ref4","year":"2023","journal-title":"COIN Series"},{"key":"ref3","year":"2023","journal-title":"Board Game Geek"},{"key":"ref6","author":"qi","year":"2023","journal-title":"Board Game Geek"},{"key":"ref5","year":"2023","journal-title":"Board Game Geek Cuba Libre"},{"key":"ref100","article-title":"A closer look at invalid action masking in policy gradient algorithms","author":"huang","year":"2020","journal-title":"arXiv 2006 14171"},{"key":"ref101","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v32i1.11741"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1016\/0004-3702(83)90001-2"},{"key":"ref35","article-title":"Real-time decision making for adversarial environments using a plan-based heuristic","author":"thomas","year":"2003"},{"key":"ref34","year":"2023","journal-title":"Board Game Geek"},{"key":"ref37","first-page":"384","article-title":"Reinforcement learning of strategies for Settlers of Catan","author":"pfeiffer","year":"2004","journal-title":"Proc CGAIDE"},{"key":"ref36","first-page":"233","article-title":"Deep reinforcement learning in strategic board game environments","author":"xenou","year":"2018","journal-title":"Proc EURAMAS"},{"key":"ref31","article-title":"Deep reinforcement learning from self-play in imperfect-information games","author":"heinrich","year":"2016","journal-title":"arXiv 1603 01121"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-01569-4"},{"key":"ref33","year":"2023","journal-title":"Board Game Geek"},{"key":"ref32","author":"schwarcz","year":"2023","journal-title":"Ticket to Ride Library"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1109\/CIG.2017.8080449"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1109\/TG.2018.2834618"},{"key":"ref24","article-title":"Player of games","author":"schmid","year":"2021","journal-title":"arXiv 2112 03178"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v34i02.5533"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1126\/science.aay2400"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1126\/science.aao1733"},{"key":"ref20","article-title":"Dota 2 with large scale deep reinforcement learning","author":"berner","year":"2019","journal-title":"arXiv 1912 06680"},{"key":"ref22","article-title":"Board game AI using reinforcement learning","author":"str\u00f6mberg","year":"2022"},{"key":"ref21","first-page":"8280","article-title":"Off-policy reinforcement learning with delayed rewards","author":"han","year":"2022","journal-title":"Proc PMLR"},{"key":"ref28","first-page":"793","article-title":"Deep counterfactual regret minimization","author":"brown","year":"2019","journal-title":"Proc PMLR"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1002\/int.22837"},{"key":"ref29","first-page":"1729","article-title":"Regret minimization in games with incomplete information","author":"zinkevich","year":"2007","journal-title":"Proc NIPS"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1016\/S0004-3702(01)00129-1"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1126\/science.1259433"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1145\/2093548.2093574"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1038\/nature16961"},{"key":"ref97","doi-asserted-by":"publisher","DOI":"10.1023\/A:1007417214905"},{"key":"ref96","doi-asserted-by":"publisher","DOI":"10.1177\/105971239700600201"},{"key":"ref11","doi-asserted-by":"crossref","first-page":"529","DOI":"10.1038\/nature14236","article-title":"Human-level control through deep reinforcement learning","volume":"518","author":"mnih","year":"2015","journal-title":"Nature"},{"key":"ref99","year":"2023","journal-title":"Docs&#x2014;Reliable Reinforcement Learning Implementations"},{"key":"ref10","first-page":"21","article-title":"Monte-Carlo tree search in settlers of Catan","author":"szita","year":"2009","journal-title":"Proc ACG"},{"key":"ref98","first-page":"12348","article-title":"Stable-baselines3: Reliable reinforcement learning implementations","volume":"22","author":"raffin","year":"2021","journal-title":"J Mach Learn Res"},{"key":"ref17","first-page":"959","article-title":"AI as evaluator: Search driven playtesting of modern board games","author":"silva","year":"2017","journal-title":"Proc Workshops AAAI"},{"key":"ref16","doi-asserted-by":"crossref","first-page":"354","DOI":"10.1038\/nature24270","article-title":"Mastering the game of go without human knowledge","volume":"550","author":"silver","year":"0","journal-title":"Nature"},{"key":"ref19","first-page":"13566","article-title":"RUDDER: Return decomposition for delayed rewards","author":"arjona-medina","year":"2019","journal-title":"Proc NeurIPS"},{"key":"ref18","article-title":"An MCTS agent for ticket to ride","author":"huchler","year":"2015"},{"key":"ref93","first-page":"1889","article-title":"Trust region policy optimization","author":"schulman","year":"2015","journal-title":"Proc ICML"},{"key":"ref92","article-title":"Sample efficient actor-critic with experience replay","author":"wang","year":"2016","journal-title":"arXiv 1611 01224"},{"key":"ref95","doi-asserted-by":"publisher","DOI":"10.1080\/14786445008521796"},{"key":"ref94","year":"2023","journal-title":"Ticket to Ride New York"},{"key":"ref91","article-title":"Proximal policy optimization with graph neural networks for optimal power flow","author":"l\u00f3pez-cardona","year":"2022","journal-title":"arXiv 2212 12470"},{"key":"ref90","article-title":"Proximal policy optimization algorithms","author":"schulman","year":"2017","journal-title":"arXiv 1707 06347"},{"key":"ref89","doi-asserted-by":"publisher","DOI":"10.1007\/s10462-021-09996-w"},{"key":"ref86","doi-asserted-by":"publisher","DOI":"10.1109\/SeGAH.2017.7939260"},{"key":"ref85","doi-asserted-by":"publisher","DOI":"10.1016\/j.apenergy.2018.12.061"},{"key":"ref88","doi-asserted-by":"publisher","DOI":"10.1145\/203330.203343"},{"key":"ref87","doi-asserted-by":"publisher","DOI":"10.1109\/ACCESS.2020.2980380"},{"key":"ref82","first-page":"1","article-title":"An entropy-based approach for modeling lithium-ion battery capacity fade","author":"namdari","year":"2020","journal-title":"Proceedings of Annual Reliability and Maintainability Symposium (RAMS)"},{"key":"ref81","doi-asserted-by":"publisher","DOI":"10.3390\/a15110393"},{"key":"ref84","doi-asserted-by":"publisher","DOI":"10.17775\/CSEEJPES.2018.00520"},{"key":"ref83","doi-asserted-by":"publisher","DOI":"10.1109\/ICPHM51084.2021.9486674"},{"key":"ref80","doi-asserted-by":"publisher","DOI":"10.1109\/TPWRS.2018.2823641"},{"key":"ref79","doi-asserted-by":"publisher","DOI":"10.1016\/j.rser.2021.111833"},{"key":"ref78","doi-asserted-by":"publisher","DOI":"10.1016\/j.ress.2022.108908"},{"key":"ref75","doi-asserted-by":"publisher","DOI":"10.1109\/TITS.2020.3008612"},{"key":"ref74","article-title":"Deep reinforcement learning in transportation research: A review","volume":"11","author":"farazi","year":"2021","journal-title":"Transp Res Interdiscipl Perspect"},{"key":"ref77","doi-asserted-by":"publisher","DOI":"10.23919\/CSMS.2021.0027"},{"key":"ref102","article-title":"Deep recurrent Q-learning for partially observable MDPs","author":"hausknecht","year":"2015","journal-title":"arXiv 1507 06527"},{"key":"ref76","first-page":"1","article-title":"Reinforcement learning for solving the vehicle routing problem","author":"nazari","year":"2018","journal-title":"Proc NeurIPS"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-37983-4_6"},{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1145\/1514402.1514409"},{"key":"ref71","doi-asserted-by":"publisher","DOI":"10.1177\/0278364920987859"},{"key":"ref70","first-page":"651","article-title":"Scalable deep reinforcement learning for vision-based robotic manipulation","author":"kalashnikov","year":"2018","journal-title":"Proc CoRL"},{"key":"ref73","doi-asserted-by":"publisher","DOI":"10.1109\/TITS.2021.3054625"},{"key":"ref72","doi-asserted-by":"publisher","DOI":"10.1145\/3543846"},{"key":"ref68","first-page":"1","article-title":"Some recent applications of reinforcement learning","author":"barto","year":"2017","journal-title":"Proc Yale Workshop Adapt Learn Syst"},{"key":"ref67","first-page":"1","article-title":"Reinforcement learning","author":"sutton","year":"2018","journal-title":"Reinforcement Learning An Introduction"},{"key":"ref69","doi-asserted-by":"publisher","DOI":"10.1177\/0278364918770733"},{"key":"ref64","doi-asserted-by":"publisher","DOI":"10.1109\/CIG.2015.7317929"},{"key":"ref63","article-title":"Bayes&#x2019; bluff: Opponent modelling in poker","author":"southey","year":"2012","journal-title":"ArXiv 1207 1411"},{"key":"ref66","first-page":"1","article-title":"Does it matter how well I know what you&#x2019;re thinking? Opponent modelling in an RTS game","author":"goodman","year":"2020","journal-title":"Proc IEEE Congr Evol Comput (CEC)"},{"key":"ref65","doi-asserted-by":"publisher","DOI":"10.1109\/CEC.2017.7969465"},{"key":"ref60","first-page":"1407","article-title":"Improving state evaluation, inference, and search in trick-based card games","author":"buro","year":"2009","journal-title":"Proc IJCAI"},{"key":"ref62","first-page":"570","article-title":"MCTS based on simple regret","author":"tolpin","year":"2012","journal-title":"Proc AAAI"},{"key":"ref61","doi-asserted-by":"publisher","DOI":"10.1109\/CIG.2015.7317917"}],"container-title":["IEEE Access"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/6287639\/10005208\/10154465.pdf?arnumber=10154465","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,7,10]],"date-time":"2023-07-10T19:29:52Z","timestamp":1689017392000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/10154465\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023]]},"references-count":102,"URL":"https:\/\/doi.org\/10.1109\/access.2023.3287100","relation":{},"ISSN":["2169-3536"],"issn-type":[{"value":"2169-3536","type":"electronic"}],"subject":[],"published":{"date-parts":[[2023]]}}}