{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,9]],"date-time":"2026-06-09T18:58:09Z","timestamp":1781031489968,"version":"3.54.1"},"publisher-location":"Cham","reference-count":29,"publisher":"Springer Nature Switzerland","isbn-type":[{"value":"9783031608742","type":"print"},{"value":"9783031608759","type":"electronic"}],"license":[{"start":{"date-parts":[[2024,1,1]],"date-time":"2024-01-01T00:00:00Z","timestamp":1704067200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2024,1,1]],"date-time":"2024-01-01T00:00:00Z","timestamp":1704067200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2024]]},"DOI":"10.1007\/978-3-031-60875-9_13","type":"book-chapter","created":{"date-parts":[[2024,6,1]],"date-time":"2024-06-01T01:06:47Z","timestamp":1717204007000},"page":"197-212","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":3,"title":["Style-Based Reinforcement Learning: Task Decoupling Personalization for\u00a0Human-Robot Collaboration"],"prefix":"10.1007","author":[{"ORCID":"https:\/\/orcid.org\/0000-0003-0922-9656","authenticated-orcid":false,"given":"Mahdi","family":"Bonyani","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3796-3137","authenticated-orcid":false,"given":"Maryam","family":"Soleymani","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-9322-7778","authenticated-orcid":false,"given":"Chao","family":"Wang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2024,6,1]]},"reference":[{"key":"13_CR1","doi-asserted-by":"publisher","unstructured":"Akrour, R., Schoenauer, M., Sebag, M.: APRIL: active preference learning-based reinforcement learning. In: Flach, P.A., De Bie, T., Cristianini, N. (eds.) Machine Learning and Knowledge Discovery in Databases: European Conference, ECML PKDD 2012, Bristol, UK, 24\u201328 September 2012, Proceedings, Part II 23, pp. 116\u2013131. Springer, Cham (2012). https:\/\/doi.org\/10.1007\/978-3-642-33486-3_8","DOI":"10.1007\/978-3-642-33486-3_8"},{"key":"13_CR2","doi-asserted-by":"crossref","unstructured":"Bradley, R.A., Terry, M.E.: Rank analysis of incomplete block designs: I. the method of paired comparisons. Biometrika 39(3\/4), 324\u2013345 (1952)","DOI":"10.1093\/biomet\/39.3-4.324"},{"issue":"12","key":"13_CR3","doi-asserted-by":"publisher","first-page":"5369","DOI":"10.1109\/TNNLS.2021.3084198","volume":"32","author":"Z Cao","year":"2021","unstructured":"Cao, Z., Wong, K., Lin, C.T.: Weak human preference supervision for deep reinforcement learning. IEEE Trans. Neural Netw. Learn. Syst. 32(12), 5369\u20135378 (2021)","journal-title":"IEEE Trans. Neural Netw. Learn. Syst."},{"key":"13_CR4","unstructured":"Christiano, P.F., Leike, J., Brown, T., Martic, M., Legg, S., Amodei, D.: Deep reinforcement learning from human preferences. In: Advances in Neural Information Processing Systems, vol. 30 (2017)"},{"key":"13_CR5","doi-asserted-by":"crossref","unstructured":"Clabaugh, C., Matari\u0107, M.: Robots for the people, by the people: personalizing human-machine interaction. Sci. Robot. 3(21), eaat7451 (2018)","DOI":"10.1126\/scirobotics.aat7451"},{"key":"13_CR6","doi-asserted-by":"crossref","unstructured":"Erickson, Z., Gangaram, V., Kapusta, A., Liu, C.K., Kemp, C.C.: Assistive gym: a physics simulation framework for assistive robotics. In: 2020 IEEE International Conference on Robotics and Automation (ICRA), pp. 10169\u201310176. IEEE (2020)","DOI":"10.1109\/ICRA40945.2020.9197411"},{"key":"13_CR7","doi-asserted-by":"publisher","first-page":"123","DOI":"10.1007\/s10994-012-5313-8","volume":"89","author":"J F\u00fcrnkranz","year":"2012","unstructured":"F\u00fcrnkranz, J., H\u00fcllermeier, E., Cheng, W., Park, S.H.: Preference-based reinforcement learning: a formal framework and a policy iteration algorithm. Mach. Learn. 89, 123\u2013156 (2012)","journal-title":"Mach. Learn."},{"key":"13_CR8","unstructured":"Haarnoja, T., Zhou, A., Abbeel, P., Levine, S.: Soft actor-critic: off-policy maximum entropy deep reinforcement learning with a stochastic actor. In: International Conference on Machine Learning, pp. 1861\u20131870. PMLR (2018)"},{"key":"13_CR9","doi-asserted-by":"crossref","unstructured":"Hwangbo, J., et al.: Learning agile and dynamic motor skills for legged robots. Sci. Robot. 4(26), eaau5872 (2019)","DOI":"10.1126\/scirobotics.aau5872"},{"key":"13_CR10","unstructured":"Ibarz, B., Leike, J., Pohlen, T., Irving, G., Legg, S., Amodei, D.: Reward learning from human preferences and demonstrations in Atari. In: Advances in Neural Information Processing Systems, vol. 31 (2018)"},{"key":"13_CR11","doi-asserted-by":"publisher","first-page":"2183","DOI":"10.1007\/s10514-019-09865-0","volume":"43","author":"A Kapusta","year":"2019","unstructured":"Kapusta, A., et al.: Personalized collaborative plans for robot-assisted dressing via optimization and simulation. Auton. Robot. 43, 2183\u20132207 (2019)","journal-title":"Auton. Robot."},{"key":"13_CR12","unstructured":"Lee, K., Smith, L., Dragan, A., Abbeel, P.: B-Pref: benchmarking preference-based reinforcement learning. In: Neural Information Processing Systems (NeurIPS) (2021)"},{"key":"13_CR13","unstructured":"Lee, K., Smith, L.M., Abbeel, P.: PEBBLE: feedback-efficient interactive reinforcement learning via relabeling experience and unsupervised pre-training. In: International Conference on Machine Learning, pp. 6152\u20136163. PMLR (2021)"},{"key":"13_CR14","unstructured":"Liang, X., Shu, K., Lee, K., Abbeel, P.: Reward uncertainty for exploration in preference-based reinforcement learning. In: Deep RL Workshop NeurIPS (2021)"},{"issue":"12","key":"13_CR15","doi-asserted-by":"publisher","first-page":"7654","DOI":"10.1109\/TSMC.2022.3161588","volume":"52","author":"M Liu","year":"2022","unstructured":"Liu, M., Xiao, C., Chen, C.: Perspective-corrected spatial referring expression generation for human-robot interaction. IEEE Trans. Syst. Man Cybern. Syst. 52(12), 7654\u20137666 (2022)","journal-title":"IEEE Trans. Syst. Man Cybern. Syst."},{"key":"13_CR16","doi-asserted-by":"crossref","unstructured":"Mnih, V., et al.: Human-level control through deep reinforcement learning. Nature 518(7540), 529\u2013533 (2015)","DOI":"10.1038\/nature14236"},{"issue":"2","key":"13_CR17","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/3277903","volume":"7","author":"C Moro","year":"2018","unstructured":"Moro, C., Nejat, G., Mihailidis, A.: Learning and personalizing socially assistive robot behaviors to aid with activities of daily living. ACM Trans. Hum.-Robot Interact. (THRI) 7(2), 1\u201325 (2018)","journal-title":"ACM Trans. Hum.-Robot Interact. (THRI)"},{"key":"13_CR18","doi-asserted-by":"crossref","unstructured":"Palan, M., Shevchuk, G., Charles\u00a0Landolfi, N., Sadigh, D.: Learning reward functions by integrating human demonstrations and preferences. In: Robotics: Science and Systems (2019)","DOI":"10.15607\/RSS.2019.XV.023"},{"key":"13_CR19","unstructured":"Park, J., Seo, Y., Shin, J., Lee, H., Abbeel, P., Lee, K.: SURF: semi-supervised reward learning with data augmentation for feedback-efficient preference-based reinforcement learning. In: Deep RL Workshop NeurIPS (2021)"},{"key":"13_CR20","doi-asserted-by":"publisher","first-page":"267","DOI":"10.1007\/s12369-019-00560-9","volume":"12","author":"P Patompak","year":"2020","unstructured":"Patompak, P., Jeong, S., Nilkhamhang, I., Chong, N.Y.: Learning proxemics for personalized human-robot social interaction. Int. J. Soc. Robot. 12, 267\u2013280 (2020)","journal-title":"Int. J. Soc. Robot."},{"key":"13_CR21","doi-asserted-by":"crossref","unstructured":"Rudovic, O., Lee, J., Dai, M., Schuller, B., Picard, R.W.: Personalized machine learning for robot perception of affect and engagement in autism therapy. Sci. Robot. 3(19), eaao6760 (2018)","DOI":"10.1126\/scirobotics.aao6760"},{"key":"13_CR22","unstructured":"Schulman, J., Wolski, F., Dhariwal, P., Radford, A., Klimov, O.: Proximal policy optimization algorithms. arXiv preprint arXiv:1707.06347 (2017)"},{"key":"13_CR23","unstructured":"Sutton, R.S., Barto, A.G.: Reinforcement Learning: An Introduction (2018)"},{"issue":"2","key":"13_CR24","doi-asserted-by":"publisher","first-page":"200","DOI":"10.1109\/TAFFC.2017.2784832","volume":"11","author":"S Taylor","year":"2017","unstructured":"Taylor, S., Jaques, N., Nosakhare, E., Sano, A., Picard, R.: Personalized multitask learning for predicting tomorrow\u2019s mood, stress, and health. IEEE Trans. Affect. Comput. 11(2), 200\u2013213 (2017)","journal-title":"IEEE Trans. Affect. Comput."},{"key":"13_CR25","doi-asserted-by":"crossref","unstructured":"Tucker, M., et al.: Human preference-based learning for high-dimensional optimization of exoskeleton walking gaits. In: 2020 IEEE\/RSJ International Conference on Intelligent Robots and Systems (IROS), pp. 3423\u20133430. IEEE (2020)","DOI":"10.1109\/IROS45743.2020.9341416"},{"key":"13_CR26","doi-asserted-by":"crossref","unstructured":"Tucker, M., et al.: Preference-based learning for exoskeleton gait optimization. In: 2020 IEEE International Conference on Robotics and Automation (ICRA), pp. 2351\u20132357. IEEE (2020)","DOI":"10.1109\/ICRA40945.2020.9196661"},{"key":"13_CR27","unstructured":"Wilson, A., Fern, A., Tadepalli, P.: A Bayesian approach for policy learning from trajectory preference queries. In: Advances in Neural Information Processing Systems, vol. 25 (2012)"},{"issue":"136","key":"13_CR28","first-page":"1","volume":"18","author":"C Wirth","year":"2017","unstructured":"Wirth, C., Akrour, R., Neumann, G., F\u00fcrnkranz, J.: A survey of preference-based reinforcement learning methods. J. Mach. Learn. Res. 18(136), 1\u201346 (2017)","journal-title":"J. Mach. Learn. Res."},{"issue":"2","key":"13_CR29","doi-asserted-by":"publisher","first-page":"3545","DOI":"10.1109\/LRA.2021.3063927","volume":"6","author":"H Zhan","year":"2021","unstructured":"Zhan, H., Tao, F., Cao, Y.: Human-guided robot behavior learning: a GAN-assisted preference-based reinforcement learning approach. IEEE Robot. Autom. Lett. 6(2), 3545\u20133552 (2021)","journal-title":"IEEE Robot. Autom. Lett."}],"container-title":["Lecture Notes in Computer Science","Universal Access in Human-Computer Interaction"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-031-60875-9_13","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,6,1]],"date-time":"2024-06-01T01:43:52Z","timestamp":1717206232000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-3-031-60875-9_13"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024]]},"ISBN":["9783031608742","9783031608759"],"references-count":29,"URL":"https:\/\/doi.org\/10.1007\/978-3-031-60875-9_13","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024]]},"assertion":[{"value":"1 June 2024","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"HCII","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"International Conference on Human-Computer Interaction","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Washington DC","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"USA","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2024","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"29 June 2024","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"4 July 2024","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"26","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"hcii2024","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/2024.hci.international\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}