{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,2,10]],"date-time":"2026-02-10T16:04:26Z","timestamp":1770739466690,"version":"3.49.0"},"reference-count":45,"publisher":"Public Library of Science (PLoS)","issue":"12","license":[{"start":{"date-parts":[[2010,12,2]],"date-time":"2010-12-02T00:00:00Z","timestamp":1291248000000},"content-version":"unspecified","delay-in-days":0,"URL":"http:\/\/creativecommons.org\/licenses\/by\/4.0\/"}],"content-domain":{"domain":["www.ploscompbiol.org"],"crossmark-restriction":false},"short-container-title":["PLoS Comput Biol"],"DOI":"10.1371\/journal.pcbi.1001003","type":"journal-article","created":{"date-parts":[[2010,12,2]],"date-time":"2010-12-02T22:22:16Z","timestamp":1291328536000},"page":"e1001003","update-policy":"https:\/\/doi.org\/10.1371\/journal.pcbi.corrections_policy","source":"Crossref","is-referenced-by-count":37,"title":["Structure Learning in Human Sequential Decision-Making"],"prefix":"10.1371","volume":"6","author":[{"given":"Daniel E.","family":"Acu\u00f1a","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Paul","family":"Schrater","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"340","published-online":{"date-parts":[[2010,12,2]]},"reference":[{"key":"ref1","first-page":"221","article-title":"A problem in the sequential design of experiments.","volume":"16","author":"RE Bellman","year":"1956","journal-title":"Sankhy\u0101"},{"key":"ref2","article-title":"Multi-armed bandit allocation indices","author":"JC Gittins","year":"1989"},{"key":"ref3","doi-asserted-by":"crossref","first-page":"287","DOI":"10.1017\/S0021900200040420","article-title":"Restless bandits: activity allocation in a changing world.","volume":"25","author":"P Whittle","year":"1988","journal-title":"J Appl Probab"},{"key":"ref4","doi-asserted-by":"crossref","first-page":"876","DOI":"10.1038\/nature04766","article-title":"Cortical substrates for exploratory decisions in humans.","volume":"441","author":"ND Daw","year":"2006","journal-title":"Nature"},{"key":"ref5","article-title":"Modeling human performance in restless bandits with particle filters.","volume":"2","author":"MS Yi","year":"2009","journal-title":"The Journal of Problem Solving"},{"key":"ref6","first-page":"1873","article-title":"Sequential effects: Superstition or rational behavior?","author":"AJ Yu","year":"2009"},{"key":"ref7","doi-asserted-by":"crossref","first-page":"e3795","DOI":"10.1371\/journal.pone.0003795","article-title":"When does reward maximization lead to matching law?","volume":"3","author":"Y Sakai","year":"2008","journal-title":"PLoS One"},{"key":"ref8","doi-asserted-by":"crossref","first-page":"227","DOI":"10.1162\/neco.2008.20.1.227","article-title":"The actor-critic learning is behind the matching law: Matching vs. optimal behaviors.","volume":"20","author":"Y Sakai","year":"2008","journal-title":"Neural Comput"},{"key":"ref9","doi-asserted-by":"crossref","first-page":"99","DOI":"10.1016\/S0004-3702(98)00023-X","article-title":"Planning and acting in partially observable stochastic domains.","volume":"101","author":"L Kaelbling","year":"1998","journal-title":"Artif Intell"},{"key":"ref10","first-page":"761","article-title":"Bayesian Q-learning.","author":"R Dearden","year":"1998"},{"key":"ref11","first-page":"943","article-title":"A bayesian framework for reinforcement learning.","author":"MJA Strens","year":"2000"},{"key":"ref12","first-page":"697","article-title":"An analytic solution to discrete bayesian reinforcement learning.","author":"P Poupart","year":"2006"},{"key":"ref13","first-page":"59","article-title":"Structure learning in human causal induction.","author":"JB Tenenbaum","year":"2001"},{"key":"ref14","doi-asserted-by":"crossref","first-page":"197","DOI":"10.1007\/BF00994016","article-title":"Learning bayesian networks: The combination of knowledge and statistical data.","volume":"20","author":"D Heckerman","year":"1995","journal-title":"Mach Learn"},{"key":"ref15","article-title":"Learning Bayesian networks","author":"RE Neapolitan","year":"2004"},{"key":"ref16","doi-asserted-by":"crossref","first-page":"309","DOI":"10.1016\/j.tics.2006.05.009","article-title":"Theory-based bayesian models of inductive learning and reasoning.","volume":"10","author":"JB Tenenbaum","year":"2006","journal-title":"Trends Cogn Sci"},{"key":"ref17","article-title":"Dynamic programming","author":"RE Bellman","year":"1957"},{"key":"ref18","first-page":"241","article-title":"A dynamic allocation index for the sequential design of experiments.","author":"JC Gittins","year":"1974"},{"key":"ref19","doi-asserted-by":"crossref","first-page":"279","DOI":"10.1007\/BF00992698","article-title":"Technical note: Q-learning.","volume":"8","author":"C Watkins","year":"1992","journal-title":"Mach Learn"},{"key":"ref20","doi-asserted-by":"crossref","DOI":"10.1109\/TNN.1998.712192","article-title":"Reinforcement learning: An introduction","author":"RS Sutton","year":"1998"},{"key":"ref21","doi-asserted-by":"crossref","first-page":"1593","DOI":"10.1126\/science.275.5306.1593","article-title":"A neural substrate of prediction and reward.","volume":"275","author":"W Schultz","year":"1997","journal-title":"Science"},{"key":"ref22","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1152\/jn.1998.80.1.1","article-title":"Predictive reward signal of dopamine neurons.","volume":"80","author":"W Schultz","year":"1998","journal-title":"J Neurophysiol"},{"key":"ref23","doi-asserted-by":"crossref","DOI":"10.1201\/9780429258480","article-title":"Bayesian Data Analysis","author":"A Gelman","year":"2003"},{"key":"ref24","doi-asserted-by":"crossref","first-page":"817","DOI":"10.1287\/mnsc.41.5.817","article-title":"Sequential choice under ambiguity: Intuitive solutions to the armed-bandit problem.","volume":"41","author":"RJ Meyer","year":"1995","journal-title":"Manage Sci"},{"key":"ref25","doi-asserted-by":"crossref","first-page":"55","DOI":"10.1007\/s001990050146","article-title":"An experimental analysis of the bandit problem.","volume":"10","author":"J Banks","year":"1997","journal-title":"Econ Theory"},{"key":"ref26","article-title":"Behavioral Models of Strategies in Multi-Armed Bandit Problems.","author":"C Anderson","year":"2001"},{"key":"ref27","doi-asserted-by":"crossref","first-page":"383","DOI":"10.1287\/msom.1060.0130","article-title":"Simple models of discrete choice and their performance in bandit experiments.","volume":"9","author":"N Gans","year":"2007","journal-title":"Manuf Serv Oper Manag"},{"key":"ref28","doi-asserted-by":"crossref","first-page":"177","DOI":"10.1037\/h0047727","article-title":"Reward probability, amount, and information as determiners of sequential two-alternative decisions.","volume":"52","author":"W Edwards","year":"1956","journal-title":"J Exp Psychol"},{"key":"ref29","doi-asserted-by":"crossref","first-page":"385","DOI":"10.1037\/h0041970","article-title":"Probability learning in 1000 trials.","volume":"62","author":"W Edwards","year":"1961","journal-title":"J Exp Psychol"},{"key":"ref30","doi-asserted-by":"crossref","first-page":"648","DOI":"10.1037\/h0046489","article-title":"Supplementary report: The utility of correctly predicting infrequent events.","volume":"64","author":"Y Brackbill","year":"1962","journal-title":"J Exp Psychol"},{"key":"ref31","article-title":"Experimental Study of the Two-Armed Bandit Problem. Ph.D. Dissertation","author":"AD Horowitz","year":"1973"},{"key":"ref32","doi-asserted-by":"crossref","first-page":"251","DOI":"10.1016\/j.conb.2010.02.008","article-title":"Learning latent structure: carving nature at its joints.","volume":"20","author":"SJ Gershman","year":"2010","journal-title":"Curr Opin Neurobiol"},{"key":"ref33","first-page":"977","article-title":"Model uncertainty in classical conditioning.","author":"AC Courville","year":"2004"},{"key":"ref34","doi-asserted-by":"crossref","first-page":"157","DOI":"10.1016\/j.bbr.2009.08.031","article-title":"Structure learning in action.","volume":"206","author":"DA Braun","year":"2009","journal-title":"Behav Brain Res"},{"key":"ref35","first-page":"2065","article-title":"Bayesian modeling of human sequential decision-making on the multi-armed bandit problem.","author":"D Acuna","year":"2008"},{"key":"ref36","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1207\/s15516709cog0000_69","article-title":"A hierarchical Bayesian model of human decision-making on an optimal stopping problem.","volume":"30","author":"MD Lee","year":"2006","journal-title":"Cogn Sci"},{"key":"ref37","doi-asserted-by":"crossref","first-page":"1214","DOI":"10.1038\/nn1954","article-title":"Learning the value of information in an uncertain world.","volume":"10","author":"TEJ Behrens","year":"2007","journal-title":"Nat Neurosci"},{"key":"ref38","first-page":"1281","article-title":"Prediction and change detection.","author":"M Steyvers","year":"2006"},{"key":"ref39","article-title":"Learning and memory.","author":"J Anderson","year":"2000"},{"key":"ref40","first-page":"848","article-title":"Predicting how people play games: Reinforcement learning in experimental games with unique, mixed strategy equilibria.","volume":"88","author":"I Erev","year":"1998","journal-title":"Am Econ Rev"},{"key":"ref41","doi-asserted-by":"crossref","first-page":"61","DOI":"10.1080\/09548980500361624","article-title":"Dopamine, prediction error and associative learning: A model-based account.","volume":"17","author":"A Smith","year":"2006","journal-title":"Network"},{"key":"ref42","doi-asserted-by":"crossref","first-page":"692","DOI":"10.1016\/j.conb.2008.01.003","article-title":"Integrating hippocampus and striatum in decision-making.","volume":"17","author":"A Johnson","year":"2007","journal-title":"Curr Opin Neurobiol"},{"key":"ref43","doi-asserted-by":"crossref","first-page":"168","DOI":"10.1016\/j.jmp.2008.11.002","article-title":"A bayesian analysis of human decision-making on bandit problems.","volume":"53","author":"M Steyvers","year":"2009","journal-title":"J Math Psychol"},{"key":"ref44","article-title":"Dynamic Programming","author":"R Howard","year":"1960"},{"key":"ref45","article-title":"Optimal Control Systems","author":"A Fel'dbaum","year":"1965"}],"container-title":["PLoS Computational Biology"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/dx.plos.org\/10.1371\/journal.pcbi.1001003","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2021,11,14]],"date-time":"2021-11-14T15:20:33Z","timestamp":1636903233000},"score":1,"resource":{"primary":{"URL":"https:\/\/dx.plos.org\/10.1371\/journal.pcbi.1001003"}},"subtitle":[],"editor":[{"given":"Tim","family":"Behrens","sequence":"first","affiliation":[],"role":[{"role":"editor","vocabulary":"crossref"}]}],"short-title":[],"issued":{"date-parts":[[2010,12,2]]},"references-count":45,"journal-issue":{"issue":"12","published-online":{"date-parts":[[2010,12,2]]}},"URL":"https:\/\/doi.org\/10.1371\/journal.pcbi.1001003","relation":{},"ISSN":["1553-7358"],"issn-type":[{"value":"1553-7358","type":"electronic"}],"subject":[],"published":{"date-parts":[[2010,12,2]]}}}