{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2024,9,7]],"date-time":"2024-09-07T18:07:11Z","timestamp":1725732431704},"publisher-location":"Berlin, Heidelberg","reference-count":29,"publisher":"Springer Berlin Heidelberg","isbn-type":[{"type":"print","value":"9783642387081"},{"type":"electronic","value":"9783642387098"}],"license":[{"start":{"date-parts":[[2013,1,1]],"date-time":"2013-01-01T00:00:00Z","timestamp":1356998400000},"content-version":"tdm","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2013]]},"DOI":"10.1007\/978-3-642-40988-2_9","type":"book-chapter","created":{"date-parts":[[2013,8,28]],"date-time":"2013-08-28T10:56:40Z","timestamp":1377687400000},"page":"129-144","source":"Crossref","is-referenced-by-count":1,"title":["Expectation Maximization for Average Reward Decentralized POMDPs"],"prefix":"10.1007","author":[{"given":"Joni","family":"Pajarinen","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jaakko","family":"Peltonen","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","reference":[{"key":"9_CR1","unstructured":"Aberdeen, D.: Policy-gradient algorithms for partially observable Markov decision processes. Ph.D. thesis, Australian National University (2003)"},{"issue":"3","key":"9_CR2","doi-asserted-by":"publisher","first-page":"293","DOI":"10.1007\/s10458-009-9103-z","volume":"21","author":"C. Amato","year":"2010","unstructured":"Amato, C., Bernstein, D.S., Zilberstein, S.: Optimizing fixed-size stochastic controllers for POMDPs and decentralized POMDPs. Autonomous Agents and Multi-Agent Systems\u00a021(3), 293\u2013320 (2010)","journal-title":"Autonomous Agents and Multi-Agent Systems"},{"key":"9_CR3","doi-asserted-by":"crossref","unstructured":"Amato, C., Bonet, B., Zilberstein, S.: Finite-state controllers based on Mealy machines for centralized and decentralized POMDPs. In: AAAI, pp. 1052\u20131058. AAAI Press (2010)","DOI":"10.1609\/aaai.v24i1.7748"},{"issue":"1","key":"9_CR4","doi-asserted-by":"crossref","first-page":"89","DOI":"10.1613\/jair.2667","volume":"34","author":"D.S. Bernstein","year":"2009","unstructured":"Bernstein, D.S., Amato, C., Hansen, E.A., Zilberstein, S.: Policy iteration for decentralized control of Markov decision processes. Journal of Artificial Intelligence Research\u00a034(1), 89\u2013132 (2009)","journal-title":"Journal of Artificial Intelligence Research"},{"key":"9_CR5","unstructured":"Bernstein, D.S., Hansen, E.A., Zilberstein, S.: Bounded policy iteration for decentralized POMDPs. In: IJCAI, pp. 1287\u20131292. IJCAI (2005)"},{"key":"9_CR6","doi-asserted-by":"crossref","unstructured":"Bernstein, D., Givan, R., Immerman, N., Zilberstein, S.: The complexity of decentralized control of Markov decision processes. Mathematics of Operations Research, 819\u2013840 (2002)","DOI":"10.1287\/moor.27.4.819.297"},{"key":"9_CR7","unstructured":"Bianchi, G., Fratta, L., Oliveri, M.: Performance evaluation and enhancement of the CSMA\/CA MAC protocol for 802.11 wireless LANs. In: PIMRC, vol.\u00a02, pp. 392\u2013396. IEEE (1996)"},{"key":"9_CR8","unstructured":"Ji, S., Parr, R., Li, H., Liao, X., Carin, L.: Point-based policy iteration. In: AAAI, vol.\u00a022, pp. 1243\u20131249. AAAI Press (2007)"},{"key":"9_CR9","series-title":"Lecture Notes in Artificial Intelligence","doi-asserted-by":"publisher","first-page":"605","DOI":"10.1007\/3-540-44581-1_40","volume-title":"Computational Learning Theory","author":"S. Kakade","year":"2001","unstructured":"Kakade, S.: Optimizing average reward using discounted rewards. In: Helmbold, D.P., Williamson, B. (eds.) COLT 2001 and EuroCOLT 2001. LNCS (LNAI), vol.\u00a02111, pp. 605\u2013615. Springer, Heidelberg (2001)"},{"key":"9_CR10","unstructured":"Kumar, A., Zilberstein, S.: Anytime planning for decentralized POMDPs using Expectation Maximization. In: UAI, pp. 294\u2013301. AUAI Press (2010)"},{"key":"9_CR11","doi-asserted-by":"crossref","unstructured":"Levin, D., Peres, Y., Wilmer, E.: Markov chains and mixing times. American Mathematical Society (2009)","DOI":"10.1090\/mbk\/058"},{"issue":"3","key":"9_CR12","doi-asserted-by":"publisher","first-page":"556","DOI":"10.1016\/j.ejor.2010.12.014","volume":"211","author":"Y. Li","year":"2011","unstructured":"Li, Y., Yin, B., Xi, H.: Finding optimal memoryless policies of POMDPs under the expected average reward criterion. European Journal of Operational Research\u00a0211(3), 556\u2013567 (2011)","journal-title":"European Journal of Operational Research"},{"issue":"1","key":"9_CR13","first-page":"159","volume":"22","author":"S. Mahadevan","year":"1996","unstructured":"Mahadevan, S.: Average reward reinforcement learning: Foundations, algorithms, and empirical results. Machine Learning\u00a022(1), 159\u2013195 (1996)","journal-title":"Machine Learning"},{"key":"9_CR14","doi-asserted-by":"crossref","unstructured":"Oliehoek, F.: Value-Based Planning for Teams of Agents in Stochastic Partially Observable Environments. Ph.D. thesis, Informatics Institute, University of Amsterdam (February 2010)","DOI":"10.5117\/9789056296100"},{"key":"9_CR15","unstructured":"Oliehoek, F., Spaan, M., Whiteson, S., Vlassis, N.: Exploiting locality of interaction in factored DEC-POMDPs. In: AAMAS, vol.\u00a01, pp. 517\u2013524. IFAAMAS (2008)"},{"key":"9_CR16","unstructured":"Pajarinen, J., Peltonen, J.: Efficient planning for factored infinite-horizon DEC-POMDPs. In: IJCAI, pp. 325\u2013331. AAAI Press (2011)"},{"key":"9_CR17","unstructured":"Pajarinen, J., Peltonen, J.: Periodic finite state controllers for efficient POMDP and DEC-POMDP planning. In: NIPS, pp. 2636\u20132644 (2011)"},{"key":"9_CR18","doi-asserted-by":"crossref","unstructured":"Pajarinen, J., Hottinen, A., Peltonen, J.: Optimizing spatial and temporal reuse in wireless networks by decentralized partially observable Markov decision processes. IEEE Transactions on Mobile Computing (2013) (preprint)","DOI":"10.1109\/TMC.2013.39"},{"key":"9_CR19","unstructured":"Petrik, M., Zilberstein, S.: Average reward decentralized Markov decision processes. In: IJCAI, pp. 1997\u20132002 (2007)"},{"key":"9_CR20","unstructured":"Poupart, P., Boutilier, C.: Bounded finite state controllers. In: NIPS, pp. 823\u2013830. MIT Press (2004)"},{"key":"9_CR21","unstructured":"Puterman, M.L.: Markov decision processes: discrete stochastic dynamic programming. Wiley (2005)"},{"issue":"2","key":"9_CR22","doi-asserted-by":"publisher","first-page":"190","DOI":"10.1007\/s10458-007-9026-5","volume":"17","author":"S. Seuken","year":"2008","unstructured":"Seuken, S., Zilberstein, S.: Formal models and algorithms for decentralized decision making under uncertainty. Autonomous Agents and Multi-Agent Systems\u00a017(2), 190\u2013250 (2008)","journal-title":"Autonomous Agents and Multi-Agent Systems"},{"key":"9_CR23","unstructured":"Spaan, M., Oliehoek, F., Amato, C.: Scaling up optimal heuristic search in DEC-POMDPs via incremental expansion. In: IJCAI. AAAI Press (2011)"},{"key":"9_CR24","series-title":"Lecture Notes in Artificial Intelligence","doi-asserted-by":"publisher","first-page":"389","DOI":"10.1007\/11564096_38","volume-title":"Machine Learning: ECML 2005","author":"D. Szer","year":"2005","unstructured":"Szer, D., Charpillet, F.: An optimal best-first search algorithm for solving infinite horizon DEC-POMDPs. In: Gama, J., Camacho, R., Brazdil, P.B., Jorge, A.M., Torgo, L. (eds.) ECML 2005. LNCS (LNAI), vol.\u00a03720, pp. 389\u2013399. Springer, Heidelberg (2005)"},{"key":"9_CR25","unstructured":"Tangamchit, P., Dolan, J., Khosla, P.: The necessity of average rewards in cooperative multirobot learning. In: ICRA, vol.\u00a02, pp. 1296\u20131301. IEEE (2002)"},{"key":"9_CR26","unstructured":"Toussaint, M., Harmeling, S., Storkey, A.: Probabilistic inference for solving (PO)MDPs. Tech. rep., University of Edinburgh (2006)"},{"key":"9_CR27","doi-asserted-by":"crossref","unstructured":"Toussaint, M., Storkey, A.: Probabilistic inference for solving discrete and continuous state Markov decision processes. In: ICML, pp. 945\u2013952. ACM (2006)","DOI":"10.1145\/1143844.1143963"},{"key":"9_CR28","doi-asserted-by":"crossref","unstructured":"Yagan, D., Tham, C.: Coordinated reinforcement learning for decentralized optimal control. In: ADPRL, pp. 296\u2013302. IEEE (2007)","DOI":"10.1109\/ADPRL.2007.368202"},{"key":"9_CR29","unstructured":"Yu, H., Bertsekas, D.P.: Discretized approximations for POMDP with average cost. In: UAI, pp. 619\u2013627. AUAI Press (2004)"}],"container-title":["Lecture Notes in Computer Science","Advanced Information Systems Engineering"],"original-title":[],"link":[{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-642-40988-2_9","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,7,4]],"date-time":"2023-07-04T04:36:20Z","timestamp":1688445380000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/978-3-642-40988-2_9"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2013]]},"ISBN":["9783642387081","9783642387098"],"references-count":29,"URL":"https:\/\/doi.org\/10.1007\/978-3-642-40988-2_9","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"type":"print","value":"0302-9743"},{"type":"electronic","value":"1611-3349"}],"subject":[],"published":{"date-parts":[[2013]]}}}