{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,13]],"date-time":"2026-04-13T12:37:02Z","timestamp":1776083822103,"version":"3.50.1"},"reference-count":40,"publisher":"Springer Science and Business Media LLC","issue":"8-10","license":[{"start":{"date-parts":[[2018,6,27]],"date-time":"2018-06-27T00:00:00Z","timestamp":1530057600000},"content-version":"tdm","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"funder":[{"DOI":"10.13039\/501100002341","name":"Academy of Finland (FI)","doi-asserted-by":"publisher","award":["251170"],"award-info":[{"award-number":["251170"]}],"id":[{"id":"10.13039\/501100002341","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100002341","name":"Academy of Finland (FI)","doi-asserted-by":"publisher","award":["294238"],"award-info":[{"award-number":["294238"]}],"id":[{"id":"10.13039\/501100002341","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100002341","name":"Academy of Finland (FI)","doi-asserted-by":"publisher","award":["292334"],"award-info":[{"award-number":["292334"]}],"id":[{"id":"10.13039\/501100002341","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Mach Learn"],"published-print":{"date-parts":[[2018,9]]},"DOI":"10.1007\/s10994-018-5730-4","type":"journal-article","created":{"date-parts":[[2018,6,27]],"date-time":"2018-06-27T16:59:44Z","timestamp":1530118784000},"page":"1517-1535","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":10,"title":["Inverse reinforcement learning from summary data"],"prefix":"10.1007","volume":"107","author":[{"ORCID":"https:\/\/orcid.org\/0000-0001-6072-7787","authenticated-orcid":false,"given":"Antti","family":"Kangasr\u00e4\u00e4si\u00f6","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Samuel","family":"Kaski","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2018,6,27]]},"reference":[{"issue":"13","key":"5730_CR1","doi-asserted-by":"publisher","first-page":"1608","DOI":"10.1177\/0278364910371999","volume":"29","author":"P Abbeel","year":"2010","unstructured":"Abbeel, P., Coates, A., & Ng, A. Y. (2010). Autonomous helicopter aerobatics through apprenticeship learning. The International Journal of Robotics Research, 29(13), 1608\u20131639.","journal-title":"The International Journal of Robotics Research"},{"key":"5730_CR2","doi-asserted-by":"crossref","unstructured":"Abbeel, P., & Ng, A. Y. (2004). Apprenticeship learning via inverse reinforcement learning. In International conference on machine learning, ACM, ICML \u201904 (pp. 1\u20138).","DOI":"10.1145\/1015330.1015430"},{"key":"5730_CR3","doi-asserted-by":"crossref","unstructured":"Bailly, G., Oulasvirta, A., Brumby, D. P., & Howes, A. (2014). Model of visual search and selection time in linear menus. In ACM conference on human factors in computing systems, ACM, CHI \u201914 (pp. 3865\u20133874).","DOI":"10.1145\/2556288.2557093"},{"key":"5730_CR4","doi-asserted-by":"crossref","unstructured":"Banovic, N., Buzali, T., Chevalier, F., Mankoff, J., & Dey, A. K. (2016). Modeling and understanding human routine behavior. In ACM conference on human factors in computing systems, ACM, CHI \u201916 (pp. 248\u2013260).","DOI":"10.1145\/2858036.2858557"},{"key":"5730_CR5","doi-asserted-by":"crossref","unstructured":"Bloem, M., & Bambos, N. (2014). Infinite time horizon maximum causal entropy inverse reinforcement learning. In IEEE conference on decision and control, CDC \u201914 (pp. 4911\u20134916).","DOI":"10.1109\/CDC.2014.7040156"},{"key":"5730_CR6","unstructured":"Boularias, A., Kober, J., & Peters, J. (2011). Relative entropy inverse reinforcement learning. In International conference on artificial intelligence and statistics, PMLR, AISTATS \u201911 (Vol. 15, pp. 182\u2013189)."},{"key":"5730_CR7","unstructured":"Brochu, E., Cora, M., & De Freitas, N. (2009). A tutorial on Bayesian optimization of expensive cost functions, with application to active user modeling and hierarchical reinforcement learning. Technical Report TR-2009-023, Department of Computer Science, University of British Columbia."},{"key":"5730_CR8","doi-asserted-by":"crossref","unstructured":"Chandramohan, S., Geist, M., Lefevre, F., & Pietquin, O. (2011). User simulation in dialogue systems using inverse reinforcement learning. In Conference of the international speech communication association, INTERSPEECH \u201911 (pp. 1025\u20131028).","DOI":"10.21437\/Interspeech.2011-302"},{"key":"5730_CR9","doi-asserted-by":"crossref","unstructured":"Chen, X., Bailly, G., Brumby, D. P., Oulasvirta, A., & Howes, A. (2015). The emergence of interactive behavior: A model of rational menu search. In ACM conference on human factors in computing systems, ACM, CHI \u201915 (pp. 4217\u20134226).","DOI":"10.1145\/2702123.2702483"},{"key":"5730_CR10","first-page":"691","volume":"12","author":"J Choi","year":"2011","unstructured":"Choi, J., & Kim, K. E. (2011). Inverse reinforcement learning in partially observable environments. Journal of Machine Learning Research, 12, 691\u2013730.","journal-title":"Journal of Machine Learning Research"},{"issue":"4","key":"5730_CR11","doi-asserted-by":"publisher","first-page":"793","DOI":"10.1109\/TCYB.2014.2336867","volume":"45","author":"J Choi","year":"2015","unstructured":"Choi, J., & Kim, K. E. (2015). Hierarchical Bayesian inverse reinforcement learning. IEEE Transactions on Cybernetics, 45(4), 793\u2013805.","journal-title":"IEEE Transactions on Cybernetics"},{"key":"5730_CR12","unstructured":"Dimitrakakis, C., & Rothkopf, C. A. (2011). Bayesian multitask inverse reinforcement learning. In European workshop on recent advances in reinforcement learning, Springer (pp. 273\u2013284)."},{"issue":"12","key":"5730_CR13","doi-asserted-by":"publisher","first-page":"493","DOI":"10.1016\/S1364-6613(98)01262-5","volume":"2","author":"V Gallese","year":"1998","unstructured":"Gallese, V., & Goldman, A. (1998). Mirror neurons and the simulation theory of mind-reading. Trends in Cognitive Sciences, 2(12), 493\u2013501.","journal-title":"Trends in Cognitive Sciences"},{"key":"5730_CR14","unstructured":"Gonz\u00e1lez, J., Dai, Z., Hennig, P., & Lawrence, N. (2016). Batch Bayesian optimization via local penalization. In International conference on artificial intelligence and statistics, PMLR, AISTATS \u201916 (pp. 648\u2013657)."},{"issue":"125","key":"5730_CR15","first-page":"1","volume":"17","author":"MU Gutmann","year":"2016","unstructured":"Gutmann, M. U., & Corander, J. (2016). Bayesian optimization for likelihood-free inference of simulator-based statistical models. Journal of Machine Learning Research, 17(125), 1\u201347.","journal-title":"Journal of Machine Learning Research"},{"issue":"2","key":"5730_CR16","doi-asserted-by":"publisher","first-page":"411","DOI":"10.1007\/s11222-017-9738-6","volume":"28","author":"M Gutmann","year":"2018","unstructured":"Gutmann, M., Dutta, R., Kaski, S., & Corander, J. (2018). Likelihood-free inference via classification. Statistics and Computing, 28(2), 411\u2013425.","journal-title":"Statistics and Computing"},{"key":"5730_CR17","unstructured":"Herman, M., Gindele, T., Wagner, J., Schmitt, F., & Burgard, W. (2016). Inverse reinforcement learning with simultaneous estimation of rewards and dynamics. In International conference on artificial intelligence and statistics, PMLR, AISTATS \u201916 (pp. 102\u2013110)."},{"key":"5730_CR18","doi-asserted-by":"crossref","unstructured":"Kangasr\u00e4\u00e4si\u00f6, A., Athukorala, K., Howes, A., Corander, J., Kaski, S., & Oulasvirta, A. (2017). Inferring cognitive models from data using approximate Bayesian computation. In ACM conference on human factors in computing systems, ACM, CHI \u201917 (pp. 1295\u20131306).","DOI":"10.1145\/3025453.3025576"},{"key":"5730_CR19","doi-asserted-by":"crossref","unstructured":"Kitani, K. M., Ziebart, B. D., Bagnell, J. A., & Hebert, M. (2012). Activity forecasting. In European conference on computer vision, Springer, ECCV \u201912 (pp. 201\u2013214).","DOI":"10.1007\/978-3-642-33765-9_15"},{"key":"5730_CR20","unstructured":"Klein, E., Geist, M., Piot, B., & Pietquin, O. (2012). Inverse reinforcement learning through structured classification. In Advances in neural information processing systems, Curran Associates, Inc., NIPS \u201912 (pp. 1007\u20131015)."},{"key":"5730_CR21","doi-asserted-by":"crossref","unstructured":"Klein, E., Piot, B., Geist, M., & Pietquin, O. (2013). A cascaded supervised learning approach to inverse reinforcement learning. In Joint European conference on machine learning and knowledge discovery in databases, Springer, ECML PKDD \u201913 (pp. 1\u201316).","DOI":"10.1007\/978-3-642-40988-2_1"},{"issue":"1","key":"5730_CR22","first-page":"e66","volume":"66","author":"J Lintusaari","year":"2017","unstructured":"Lintusaari, J., Gutmann, M. U., Dutta, R., Kaski, S., & Corander, J. (2017). Fundamentals and recent developments in approximate Bayesian computation. Systematic Biology, 66(1), e66\u2013e82.","journal-title":"Systematic Biology"},{"key":"5730_CR23","doi-asserted-by":"crossref","unstructured":"Michini, B., & How, J. P. (2012). Bayesian nonparametric inverse reinforcement learning. In Joint European conference on machine learning and knowledge discovery in databases, Springer, ECML PKDD \u201912 (pp. 148\u2013163).","DOI":"10.1007\/978-3-642-33486-3_10"},{"key":"5730_CR24","doi-asserted-by":"crossref","unstructured":"Mohammed, R. A. A., & Staadt, O. (2015). Learning eye movements strategies on tiled large high-resolution displays using inverse reinforcement learning. In International joint conference on neural networks, IJCNN \u201915 (pp. 1\u20137).","DOI":"10.1109\/IJCNN.2015.7280675"},{"key":"5730_CR25","unstructured":"Neu, G., & Szepesv\u00e1ri, C. (2007). Apprenticeship learning using inverse reinforcement learning and gradient methods. In Conference on uncertainty in artificial intelligence, UAI \u201907 (pp. 295\u2013302)."},{"key":"5730_CR26","unstructured":"Ng, A. Y., & Russell, S. (2000). Algorithms for inverse reinforcement learning. In International conference on machine learning (pp. 663\u2013670)."},{"key":"5730_CR27","unstructured":"Nguyen, Q. P., Low, B. K. H., & Jaillet, P. (2015). Inverse reinforcement learning with locally consistent reward functions. In Advances in neural information processing systems, Curran Associates, Inc., NIPS \u201915 (pp. 1747\u20131755)."},{"key":"5730_CR28","unstructured":"Ramachandran, D., & Amir, E. (2007). Bayesian inverse reinforcement learning. In International joint conference on artificial intelligence, IJCAI \u201907 (Vol. 51, pp. 2586\u20132591)."},{"key":"5730_CR29","doi-asserted-by":"crossref","unstructured":"Rasmussen, C. E. (2003). Gaussian processes to speed up hybrid Monte Carlo for expensive Bayesian integrals. In Bayesian statistics 7, Oxford University Press (pp. 651\u2013659).","DOI":"10.1093\/oso\/9780198526155.003.0045"},{"key":"5730_CR30","doi-asserted-by":"crossref","unstructured":"Rasmussen, C. E. (2004). Gaussian processes in machine learning. In Advanced lectures on machine learning, Springer (pp. 63\u201371).","DOI":"10.1007\/978-3-540-28650-9_4"},{"key":"5730_CR31","doi-asserted-by":"crossref","unstructured":"Ratliff, N. D., Bagnell, J. A., & Zinkevich, M. A. (2006). Maximum margin planning. In International conference on machine learning, ACM, ICML \u201906 (pp. 729\u2013736).","DOI":"10.1145\/1143844.1143936"},{"key":"5730_CR32","doi-asserted-by":"crossref","unstructured":"Rothkopf, C. A., & Dimitrakakis, C. (2011). Preference elicitation and inverse reinforcement learning. In Joint European conference on machine learning and knowledge discovery in databases, Springer, ECML PKDD \u201911 (pp. 34\u201348).","DOI":"10.1007\/978-3-642-23808-6_3"},{"key":"5730_CR33","unstructured":"Russell, S. (1998). Learning agents for uncertain environments. In Conference on computational learning theory, ACM, COLT \u201998 (pp. 101\u2013103)."},{"issue":"1","key":"5730_CR34","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1371\/journal.pcbi.1002803","volume":"9","author":"M Sunn\u00e5ker","year":"2013","unstructured":"Sunn\u00e5ker, M., Busetto, A. G., Numminen, E., Corander, J., Foll, M., & Dessimoz, C. (2013). Approximate Bayesian computation. PLOS Computational Biology, 9(1), 1\u201310.","journal-title":"PLOS Computational Biology"},{"key":"5730_CR35","doi-asserted-by":"crossref","unstructured":"Surana, A. (2014). Unsupervised inverse reinforcement learning with noisy data. In IEEE conference on decision and control, CDC \u201914 (pp. 4938\u20134945).","DOI":"10.1109\/CDC.2014.7040160"},{"key":"5730_CR36","unstructured":"Tossou, A. C. Y., & Dimitrakakis, C. (2013). Probabilistic inverse reinforcement learning in unknown environments. In Conference on uncertainty in artificial intelligence, AUAI Press, UAI \u201913 (pp. 635\u2013643)."},{"key":"5730_CR37","doi-asserted-by":"publisher","first-page":"361","DOI":"10.1613\/jair.4806","volume":"55","author":"Z Wang","year":"2016","unstructured":"Wang, Z., Hutter, F., Zoghi, M., Matheson, D., & de Feitas, N. (2016). Bayesian optimization in a billion dimensions via random embeddings. Journal of Artificial Intelligence Research, 55, 361\u2013387.","journal-title":"Journal of Artificial Intelligence Research"},{"issue":"3","key":"5730_CR38","doi-asserted-by":"publisher","first-page":"293","DOI":"10.1108\/17563781211255862","volume":"5","author":"S Zhifei","year":"2012","unstructured":"Zhifei, S., & Joo, E. M. (2012). A survey of inverse reinforcement learning techniques. International Journal of Intelligent Computing and Cybernetics, 5(3), 293\u2013311.","journal-title":"International Journal of Intelligent Computing and Cybernetics"},{"key":"5730_CR39","unstructured":"Ziebart, B. D., Maas, A. L., Bagnell, J. A., & Dey, A. K. (2008). Maximum entropy inverse reinforcement learning. In National conference on artificial intelligence, AAAI \u201908 (pp. 1433\u20131438)."},{"key":"5730_CR40","doi-asserted-by":"crossref","unstructured":"Ziebart, B. D., Ratliff, N., Gallagher, G., Mertz, C., Peterson, K., Bagnell, J. A., Hebert, M., Dey, A. K., & Srinivasa, S. (2009). Planning-based prediction for pedestrians. In International conference on intelligent robots and systems (pp. 3931\u20133936).","DOI":"10.1109\/IROS.2009.5354147"}],"container-title":["Machine Learning"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/article\/10.1007\/s10994-018-5730-4\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s10994-018-5730-4.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s10994-018-5730-4.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,7,7]],"date-time":"2024-07-07T19:37:44Z","timestamp":1720381064000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/s10994-018-5730-4"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2018,6,27]]},"references-count":40,"journal-issue":{"issue":"8-10","published-print":{"date-parts":[[2018,9]]}},"alternative-id":["5730"],"URL":"https:\/\/doi.org\/10.1007\/s10994-018-5730-4","relation":{},"ISSN":["0885-6125","1573-0565"],"issn-type":[{"value":"0885-6125","type":"print"},{"value":"1573-0565","type":"electronic"}],"subject":[],"published":{"date-parts":[[2018,6,27]]},"assertion":[{"value":"11 January 2018","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"12 June 2018","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"27 June 2018","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}