{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,3]],"date-time":"2026-07-03T05:27:00Z","timestamp":1783056420484,"version":"3.54.6"},"reference-count":70,"publisher":"Springer Science and Business Media LLC","issue":"1","license":[{"start":{"date-parts":[[2012,6,8]],"date-time":"2012-06-08T00:00:00Z","timestamp":1339113600000},"content-version":"tdm","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["Auton Agent Multi-Agent Syst"],"published-print":{"date-parts":[[2013,7]]},"DOI":"10.1007\/s10458-012-9200-2","type":"journal-article","created":{"date-parts":[[2012,6,7]],"date-time":"2012-06-07T05:24:01Z","timestamp":1339046641000},"page":"1-51","source":"Crossref","is-referenced-by-count":292,"title":["A survey of point-based POMDP solvers"],"prefix":"10.1007","volume":"27","author":[{"given":"Guy","family":"Shani","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Joelle","family":"Pineau","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Robert","family":"Kaplow","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2012,6,8]]},"reference":[{"key":"9200_CR1","unstructured":"Albore, A., Palacios, H., & Geffner, H. (2009). A translation-based approach to contingent planning. In International joint conference on artificial intelligence (IJCAI) (pp. 1623\u20131628)."},{"key":"9200_CR2","unstructured":"Armstrong-Crews, N., Gordon, G., & Veloso, M. (2008). Solving POMDPs from both sides: Growing dual parsimonious bounds. In AAAI workshop for advancement in POMDP solvers."},{"key":"9200_CR3","doi-asserted-by":"crossref","first-page":"345","DOI":"10.1007\/s12369-009-0032-4","volume":"1","author":"A. Atrash","year":"2009","unstructured":"Atrash A., Kaplow R., Villemure J., West R., Yamani H., Pineau J. (2009) Development and validation of a robust speech interface for improved human-robot interaction. International Journal of Social Robotics 1: 345\u2013356","journal-title":"International Journal of Social Robotics"},{"key":"9200_CR4","doi-asserted-by":"crossref","first-page":"81","DOI":"10.1016\/0004-3702(94)00011-O","volume":"72","author":"A. G. Barto","year":"1995","unstructured":"Barto A. G., Bradtke S. J., Singh S. P. (1995) Learning to act using real-time dynamic programming. Artificial Intelligence 72: 81\u2013138. doi: 10.1016\/0004-3702(94)00011-O","journal-title":"Artificial Intelligence"},{"key":"9200_CR5","volume-title":"Dynamic programming","author":"R. Bellman","year":"1957","unstructured":"Bellman R. (1957) Dynamic programming. Princeton University Press, Princeton"},{"key":"9200_CR6","first-page":"679","volume":"6","author":"R. Bellman","year":"1957","unstructured":"Bellman R. (1957) A Markovian decision process. Journal of Mathematics and Mechanics 6: 679\u2013684","journal-title":"Journal of Mathematics and Mechanics"},{"key":"9200_CR7","unstructured":"Bonet, B., & Geffner, H. (2003). Labeled RTDP: Improving the convergence of real-time dynamic programming. In International conference on planning and scheduling (ICAPS) (pp. 12\u201331)."},{"key":"9200_CR8","unstructured":"Bonet, B., & Geffner, H. (2009). Solving POMDPs: RTDP-Bel vs. Point-based algorithms. In International joint conference on artificial intelligence (IJCAI) (pp. 1641\u20131646)."},{"key":"9200_CR9","unstructured":"Boutilier, C. (2002). A POMDP formulation of preference elicitation problems. In National conference on artificial intelligence (AAAI) (pp. 239\u2013246)."},{"key":"9200_CR10","unstructured":"Brunskill, E., Kaelbling, L., Lozano-Perez, T., & Roy, N. (2008). Continuous-state POMDPs with hybrid dynamics. In International symposium on artificial intelligence and mathematics (ISAIM)."},{"key":"9200_CR11","unstructured":"Cassandra, A., Littman, M. L., & Zhang, N. L. (1997). Incremental Pruning: A simple, fast, exact method for partially observable Markov decision processes. In Conference on uncertainty in artificial intelligence (UAI) (pp. 54\u201361). http:\/\/www.cs.duke.edu\/~mlittman\/docs\/uai97-pomdp.ps ."},{"key":"9200_CR12","unstructured":"Dai, P., & Goldsmith, J. (2007). Topological value iteration algorithm for Markov decision processes. In: International joint conference on artificial intelligence (IJCAI) (pp. 1860\u20131865)"},{"key":"9200_CR13","unstructured":"Dibangoye, J. S., Shani, G., Chaib-draa, B., & Mouaddib, A. I. (2009). Topological order planner for POMDPs. In International joint conference on artificial intelligence (IJCAI) (pp. 1684\u20131689)."},{"key":"9200_CR14","unstructured":"Doshi, F., & Roy, N. (2008). The permutable POMDP: Fast solutions to POMDPs for preference elicitation. In International conference on autonomous agents and multiagent systems (AAMAS) (pp. 493\u2013500)."},{"key":"9200_CR15","unstructured":"Geffner, H., & Bonet, B. (1998). Solving large POMDPs using real time dynamic programming. In Proceedings AAAI fall symposium on POMDPs."},{"key":"9200_CR16","unstructured":"Hansen, E. (1998). Solving POMDPs by searching in policy space. In: Conference on uncertainty in artificial intelligence (UAI)(pp. 211\u2013219)."},{"key":"9200_CR17","unstructured":"Hansen, E. A. (2007). Indefinite-horizon POMDPs with action-based termination. In National conference on artificial intelligence (AAAI) (pp. 1237\u20131242)."},{"key":"9200_CR18","unstructured":"Hauskrecht, M. (1997). Incremental methods for computing bounds in partially observable Markov decision processes. In: National conference on artificial intelligence (pp. 734\u2013739)."},{"key":"9200_CR19","unstructured":"Hauskrecht, M. (2000). Value-function approximations for partially observable Markov decision processes. Journal of Artificial Intelligence Research (JAIR), 13, 33\u201394. http:\/\/www.cs.washington.edu\/research\/jair\/abstracts\/hauskrecht00a.html ."},{"issue":"3","key":"9200_CR20","doi-asserted-by":"crossref","first-page":"221","DOI":"10.1016\/S0933-3657(99)00042-1","volume":"18","author":"M. Hauskrecht","year":"2000","unstructured":"Hauskrecht M., Fraser H. S. F. (2000) Planning treatment of ischemic heart disease with partially observable Markov decision processes. Artificial Intelligence in Medicine 18(3): 221\u2013244","journal-title":"Artificial Intelligence in Medicine"},{"issue":"5","key":"9200_CR21","doi-asserted-by":"crossref","first-page":"503","DOI":"10.1016\/j.cviu.2009.06.008","volume":"114","author":"J. Hoey","year":"2010","unstructured":"Hoey J., Poupart P., von Bertoldi A., Craig T., Boutilier C., Mihailidis A. (2010) Automated handwashing assistance for persons with dementia using video and a partially observable Markov decision process. Computer Vision and Image Understanding 114(5): 503\u2013519","journal-title":"Computer Vision and Image Understanding"},{"key":"9200_CR22","volume-title":"Dynamic programming and Markov processes","author":"R. A. Howard","year":"1960","unstructured":"Howard R. A. (1960) Dynamic programming and Markov processes. MIT Press, Cambridge, MA"},{"key":"9200_CR23","doi-asserted-by":"crossref","unstructured":"Hsiao, K., Kaelbling, L. P., & Lozano-P\u00e9rez, T. (2007). Grasping POMDPs. In IEEE international conference on robotics and automation (ICRA) (pp. 4685\u20134692).","DOI":"10.1109\/ROBOT.2007.364201"},{"key":"9200_CR24","unstructured":"Huynh, V. A., & Roy N. (2009). icLQG: Combining local and global optimization for control in information space. In IEEE international conference on robotics and automation (ICRA) (pp. 2851\u20132858)."},{"key":"9200_CR25","unstructured":"Izadi, M. T., Rajwade, A. V., & Precup, D. (2005). Using core beliefs for point-based value iteration. In International joint conference on artificial intelligence (pp. 1751\u20131753)."},{"key":"9200_CR26","doi-asserted-by":"crossref","unstructured":"Izadi, M. T., Precup, D., & Azar, D. (2006). Belief selection in point-based planning algorithms for POMDPs. In Canadian conference on artificial intelligence (pp. 383\u2013394).","DOI":"10.1007\/11766247_33"},{"key":"9200_CR27","unstructured":"Ji, S., Parr, R., Li, H., Liao, X., & Carin, L. (2007). Point-based policy iteration. In National conference on artificial intelligence (AAAI) (pp. 1243\u20131249). AAAI Press."},{"key":"9200_CR28","doi-asserted-by":"crossref","unstructured":"Kaelbling, L., Littman, M., & Cassandra, A. (1998). Planning and acting in partially observable stochastic domains. In Artificial intelligence (pp. 99\u2013134).","DOI":"10.1016\/S0004-3702(98)00023-X"},{"key":"9200_CR29","unstructured":"Kaplow, R. (2010). Point-based POMDP solvers: Survey and comparative analysis. Master\u2019s thesis, McGill University."},{"key":"9200_CR30","unstructured":"Kurniawati, H., Hsu, D., & Lee, W. (2008). SARSOP: Efficient point-based POMDP planning by approximating optimally reachable belief spaces. In Robotics: Science and systems (RSS)."},{"key":"9200_CR31","unstructured":"Littman, M. L. (1996). Algorithms for sequential decision making. PhD thesis, Department of Computer Science, Brown University, Providence, RI. ftp:\/\/ftp.cs.brown.edu\/pub\/techreports\/96\/cs96-09.ps.Z . Also Technical Report CS-96-09."},{"key":"9200_CR32","doi-asserted-by":"crossref","unstructured":"Littman, M. L., Cassandra, A. R., & Kaelbling, L. P. (1995). Learning policies for partially observable environments: Scaling up. In International conference on machine learning (ICML) (pp. 362\u2013370).","DOI":"10.1016\/B978-1-55860-377-6.50052-9"},{"key":"9200_CR33","unstructured":"Littman, M. L., Sutton, R. S., & Singh, S. P. (2001). Predictive representations of state. In Advances in neural information processing systems (NIPS) (pp. 1555\u20131561)."},{"key":"9200_CR34","unstructured":"Littman, M. L., Ravi, N., Fenson, E., & Howard, R. (2004). An instance-based state representation for network repair. In National conference on artificial intelligence (AAAI) (pp. 287\u2013292)."},{"issue":"1","key":"9200_CR35","doi-asserted-by":"crossref","first-page":"162","DOI":"10.1287\/opre.39.1.162","volume":"39","author":"W. S. Lovejoy","year":"1991","unstructured":"Lovejoy W. S. (1991) Computationally feasible bounds for partially observed Markov decision processes. Operations Research 39(1): 162\u2013175","journal-title":"Operations Research"},{"key":"9200_CR36","unstructured":"Ng, A., Harada, D., & Russell, S. (1999). Policy invariance underreward transformations: Theory and application to reward shaping. In International conference on machine learning (ICML)."},{"key":"9200_CR37","unstructured":"Pineau, J., & Gordon, G. (2005). POMDP planning for robust robot control. In International symposium on robotics research (ISRR) (Vol. 28, pp. 69\u201382). Springer."},{"key":"9200_CR38","unstructured":"Pineau, J., Gordon, G., & Thrun, S. (2003). Point-based value iteration: An anytime algorithm for POMDPs. In International joint conference on artificial intelligence (pp. 1025\u20131032)."},{"key":"9200_CR39","unstructured":"Pineau, J., Gordon, G. J., & Thrun, S. (2003). Applying metric-trees to belief-point POMDPs. In Advances in neural information processing systems (NIPS)."},{"key":"9200_CR40","doi-asserted-by":"crossref","first-page":"335","DOI":"10.1613\/jair.2078","volume":"27","author":"J. Pineau","year":"2006","unstructured":"Pineau J., Gordon G. J., Thrun S. (2006) Anytime point-based approximations for large POMDPs. Journal of Artificial Intelligence Research (JAIR) 27: 335\u2013380","journal-title":"Journal of Artificial Intelligence Research (JAIR)"},{"key":"9200_CR41","unstructured":"Poon, L. (2001). A fast heuristic algorithm for decision theoretic planning. Master\u2019s thesis, The Hong-Kong University of Science and Technology."},{"key":"9200_CR42","first-page":"2329","volume":"7","author":"J. M. Porta","year":"2006","unstructured":"Porta J. M., Vlassis N., Spaan M. T. J., Poupart P. (2006) Point-based value iteration for continuous POMDPs. Journal of Machine Learning Research 7: 2329\u20132367","journal-title":"Journal of Machine Learning Research"},{"key":"9200_CR43","unstructured":"Poupart, P. (2005). Exploiting structure to efficiently solve large scale partially observable Markov decision processes. PhD thesis, Department of Computer Science, University of Toronto."},{"key":"9200_CR44","unstructured":"Poupart, P., & Boutilier, C. (2003). Bounded finite state controllers. In Advances in neural information processing systems (NIPS)"},{"key":"9200_CR45","doi-asserted-by":"crossref","unstructured":"Poupart, P., Kim, K. E., & Kim, D. (2011). Closing the gap: Improved bounds on optimal POMDP solutions. In International conference on planning and scheduling (ICAPS).","DOI":"10.1609\/icaps.v21i1.13467"},{"key":"9200_CR46","doi-asserted-by":"crossref","DOI":"10.1002\/9780470316887","volume-title":"Markov decision processes: Discrete stochastic dynamic programming","author":"M. L. Puterman","year":"1994","unstructured":"Puterman M. L. (1994) Markov decision processes: Discrete stochastic dynamic programming. Wiley, New York, NY"},{"key":"9200_CR47","doi-asserted-by":"crossref","unstructured":"Ross, S., & Chaib-draa, B. (2007). AEMS: An anytime online search algorithm for approximate policy refinement in large POMDPs. In International joint conference on artificial intelligence (IJCAI) (pp. 2592\u20132598).","DOI":"10.1016\/j.artint.2007.10.003"},{"key":"9200_CR48","doi-asserted-by":"crossref","unstructured":"Sanner, S., & Kersting, K. (2010). Symbolic dynamic programming for first-order POMDPs. In National conference on artificial intelligence (AAAI).","DOI":"10.1609\/aaai.v24i1.7747"},{"issue":"4","key":"9200_CR49","doi-asserted-by":"crossref","first-page":"1062","DOI":"10.1109\/TSMCB.2009.2034015","volume":"40","author":"G. Shani","year":"2010","unstructured":"Shani G. (2010) Evaluating point-based POMDP solvers on multicore machines. IEEE Transactions on Systems, Man, and Cybernetics, Part B 40(4): 1062\u20131074","journal-title":"IEEE Transactions on Systems, Man, and Cybernetics, Part B"},{"key":"9200_CR50","unstructured":"Shani, G., & Meek, C. (2009). Improving existing fault recovery policies. In Advances in neural information processing systems (NIPS) (Vol. 22, pp. 1642\u20131650)."},{"key":"9200_CR51","first-page":"1265","volume":"6","author":"G. Shani","year":"2005","unstructured":"Shani G., Heckerman D., Brafman R. I. (2005) An MDP-based recommender system. Journal of Machine Learning Research 6: 1265\u20131295","journal-title":"Journal of Machine Learning Research"},{"key":"9200_CR52","unstructured":"Shani, G., Brafman, R., & Shimony, S. (2007). Forward search value iteration for POMDPs. In International joint conference on artificial intelligence (IJCAI)."},{"issue":"6","key":"9200_CR53","doi-asserted-by":"crossref","first-page":"1592","DOI":"10.1109\/TSMCB.2008.928222","volume":"38","author":"G. Shani","year":"2008","unstructured":"Shani G., Brafman R. I., Shimony S. E. (2008) Prioritizing point-based POMDP solvers. IEEE Transactions on Systems, Man, and Cybernetics, Part B 38(6): 1592\u20131605","journal-title":"IEEE Transactions on Systems, Man, and Cybernetics, Part B"},{"key":"9200_CR54","unstructured":"Shani, G., Poupart, P., Brafman, R. I., & Shimony, S. E. (2008). Efficient ADD operations for point-based algorithms. In International conference on automated scheduling and planning (ICAPS) (pp. 330\u2013337)."},{"key":"9200_CR55","unstructured":"Sim, H. S., Kim, K. E., Kim, J. H., Chang, D. S., & Koo, M. W. (2008). Symbolic heuristic search value iteration for factored POMDPs. In National conference on artificial intelligence (pp. 1088\u20131093)."},{"key":"9200_CR56","first-page":"123","volume":"22","author":"S. P. Singh","year":"1996","unstructured":"Singh S. P., Sutton R. S. (1996) Reinforcement learning with replacing eligibility traces. Machine Learning 22: 123\u2013158","journal-title":"Machine Learning"},{"key":"9200_CR57","unstructured":"Smith, T., & Simmons, R. (2004). Heuristic search value iteration for POMDPs. In Conference on uncertainty in artificial intelligence (UAI)."},{"key":"9200_CR58","unstructured":"Smith, T., & Simmons, R. G. (2005). Point-based POMDP algorithms: Improved analysis and implementation. In Conference on uncertainty in artificial intelligence (UAI) (pp. 542\u2013547)."},{"key":"9200_CR59","unstructured":"Sondik, E. (1971). The optimal control of partially observable Markov decision processes. PhD thesis, Stanford University."},{"key":"9200_CR60","doi-asserted-by":"crossref","first-page":"282","DOI":"10.1287\/opre.26.2.282","volume":"26","author":"E. J. Sondik","year":"1978","unstructured":"Sondik E. J. (1978) The optimal control of partially observable Markov processes over the infinite horizon: Discounted costs. Operations Research 26: 282\u2013304","journal-title":"Operations Research"},{"key":"9200_CR61","doi-asserted-by":"crossref","unstructured":"Spaan, M., & Vlassis, N. (2004). A point-based POMDP algorithm for robot planning. In IEEE international conference on robotics and automation (ICRA) (pp. 2399\u20132404).","DOI":"10.1109\/ROBOT.2004.1307420"},{"key":"9200_CR62","doi-asserted-by":"crossref","first-page":"195","DOI":"10.1613\/jair.1659","volume":"24","author":"M. Spaan","year":"2005","unstructured":"Spaan M., Vlassis N. (2005) Perseus: Randomized point-based value iteration for POMDPs. Journal of Artificial Intelligence Research, 24: 195\u2013220","journal-title":"Journal of Artificial Intelligence Research,"},{"key":"9200_CR63","volume-title":"Reinforcement learning: An introduction","author":"R. S. Sutton","year":"1998","unstructured":"Sutton R. S., Barto A. G. (1998) Reinforcement learning: An introduction. MIT Press, Cambridge, MA"},{"key":"9200_CR64","unstructured":"Szepesvari, C. (2009). Reinforcement learning algorithms for MDPs\u2014a survey. Technical report TR09-13, University Of Alberta."},{"key":"9200_CR65","unstructured":"Virin, Y., Shani, G., Shimony, S. E., & Brafman, R. I. (2007). Scaling up: Solving POMDPs through value based clustering. In: National conference on artificial intelligence (AAAI) (pp. 1290\u20131295)."},{"key":"9200_CR66","doi-asserted-by":"crossref","unstructured":"Wang, C., & Khardon, R. (2010). Relational partially observable mdps. In National conference on artificial intelligence (AAAI).","DOI":"10.1609\/aaai.v24i1.7742"},{"issue":"2","key":"9200_CR67","doi-asserted-by":"crossref","first-page":"393","DOI":"10.1016\/j.csl.2006.06.008","volume":"21","author":"J. D. Williams","year":"2007","unstructured":"Williams J. D., Young S. (2007) Partially observable Markov decision processes for spoken dialog systems. Computer Speech & Language 21(2): 393\u2013422","journal-title":"Computer Speech & Language"},{"key":"9200_CR68","first-page":"851","volume":"6","author":"D. Wingate","year":"2005","unstructured":"Wingate D., Seppi K. D. (2005) Prioritization methods for accelerating MDP solvers. Journal of Machine Learning Research (JMLR) 6: 851\u2013881","journal-title":"Journal of Machine Learning Research (JMLR)"},{"key":"9200_CR69","doi-asserted-by":"crossref","first-page":"29","DOI":"10.1613\/jair.761","volume":"14","author":"N. L. Zhang","year":"2001","unstructured":"Zhang N. L., Zhang S. (2001) Speeding up the convergence of value iteration in partially observable Markov decision processes. Journal of Artificial Intelligence Research (JAIR) 14: 29\u201351","journal-title":"Journal of Artificial Intelligence Research (JAIR)"},{"key":"9200_CR70","first-page":"73","volume":"17","author":"S. Zilberstein","year":"1996","unstructured":"Zilberstein S. (1996) Using anytime algorithms in intelligent systems. AI Magazine 17: 73\u201383","journal-title":"AI Magazine"}],"container-title":["Autonomous Agents and Multi-Agent Systems"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s10458-012-9200-2.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/article\/10.1007\/s10458-012-9200-2\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s10458-012-9200-2","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,6,23]],"date-time":"2023-06-23T05:37:59Z","timestamp":1687498679000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/s10458-012-9200-2"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2012,6,8]]},"references-count":70,"journal-issue":{"issue":"1","published-print":{"date-parts":[[2013,7]]}},"alternative-id":["9200"],"URL":"https:\/\/doi.org\/10.1007\/s10458-012-9200-2","relation":{},"ISSN":["1387-2532","1573-7454"],"issn-type":[{"value":"1387-2532","type":"print"},{"value":"1573-7454","type":"electronic"}],"subject":[],"published":{"date-parts":[[2012,6,8]]}}}