{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,10,24]],"date-time":"2025-10-24T05:03:54Z","timestamp":1761282234557,"version":"build-2065373602"},"reference-count":22,"publisher":"IEEE","license":[{"start":{"date-parts":[[2025,9,1]],"date-time":"2025-09-01T00:00:00Z","timestamp":1756684800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2025,9,1]],"date-time":"2025-09-01T00:00:00Z","timestamp":1756684800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025,9,1]]},"DOI":"10.1109\/idsta66210.2025.11202848","type":"proceedings-article","created":{"date-parts":[[2025,10,23]],"date-time":"2025-10-23T17:48:51Z","timestamp":1761241731000},"page":"109-116","source":"Crossref","is-referenced-by-count":0,"title":["Off-Policy Evaluation and Learning of Multi-Action Recommendation Considering Unrecommended Action Rewards"],"prefix":"10.1109","author":[{"given":"Riki","family":"OKAMURA","sequence":"first","affiliation":[{"name":"Waseda University,Dept. of Computer Science and Communications Engineering,Tokyo,Japan,1950055"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Toshiharu","family":"SUGAWARA","sequence":"additional","affiliation":[{"name":"Waseda University,Dept. of Computer Science and Communications Engineering,Tokyo,Japan,1950055"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref1","article-title":"A review of off-policy evaluation in reinforcement learning","author":"Uehara","year":"2022","journal-title":"arXiv preprint"},{"key":"ref2","article-title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems","author":"Levine","year":"2020","journal-title":"arXiv preprint"},{"key":"ref3","article-title":"Off-policy evaluation for slate recommendation","volume-title":"Proc. 31st Conf. Neural Information Processing Systems (NeurIPS)","author":"Swaminathan","year":"2017"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1145\/3589334.3645343"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1145\/3640457.3688099"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1177\/0962280210395740"},{"key":"ref7","article-title":"Doubly robust policy evaluation and learning","volume-title":"Proc. 28th Int. Conf. Machine Learning (ICML)","author":"Dud\u00edk","year":"2011"},{"key":"ref8","article-title":"Doubly robust off-policy evaluation with shrinkage","volume-title":"Proc. 37th Int. Conf. Machine Learning (ICML)","volume":"119","author":"Su","year":"2020"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1145\/3394486.3403139"},{"key":"ref10","article-title":"Optimal and adaptive offpolicy evaluation in contextual bandits","volume-title":"Proc. 34th Int. Conf. Machine Learning (ICML)","volume":"70","author":"Wang","year":"2017"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1145\/3394486.3403229"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1145\/3580305.3599447"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1145\/3383313.3412262"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1145\/3534678.3539353"},{"key":"ref15","article-title":"Off-policy evaluation for large action spaces via embeddings","volume-title":"Proc. 39th Int. Conf. Machine Learning (ICML)","volume":"PMLR 162","author":"Saito","year":"2022"},{"key":"ref16","article-title":"Off-policy evaluation for large action spaces via conjunct effect modeling","volume-title":"Proc. 40th Int. Conf. Machine Learning (ICML), volume PMLR 202, Honolulu, HI, USA","author":"Saito","year":"2023"},{"key":"ref17","first-page":"1675","article-title":"Positive unlabeled learning with non-negative risk estimator","author":"Kiryo","year":"2017","journal-title":"Advances in Neural Information Processing Systems (NeurIPS)"},{"key":"ref18","article-title":"Off-policy evaluation via off-policy classification","volume-title":"Proc. 33rd Conf. Neural Information Processing Systems (NeurIPS)","author":"Irpan","year":"2019"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1145\/3097983.3098155"},{"key":"ref20","first-page":"5067","article-title":"Optimal off-policy evaluation from multiple logging policies","volume-title":"Proc. 38th Int. Conf. Machine Learning (ICML)","volume":"PMLR 139","author":"Kallus","year":"2021"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1145\/3589334.3645446"},{"key":"ref22","article-title":"Universal off-policy evaluation","volume-title":"Proc. 35th Conf. Neural Information Processing Systems (NeurIPS)","author":"Chandak","year":"2021"}],"event":{"name":"2025 Sixth International Conference on Intelligent Data Science Technologies and Applications (IDSTA)","start":{"date-parts":[[2025,9,1]]},"location":"Varna, Bulgaria","end":{"date-parts":[[2025,9,4]]}},"container-title":["2025 Sixth International Conference on Intelligent Data Science Technologies and Applications (IDSTA)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/11202699\/11202765\/11202848.pdf?arnumber=11202848","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,10,24]],"date-time":"2025-10-24T04:59:25Z","timestamp":1761281965000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11202848\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,9,1]]},"references-count":22,"URL":"https:\/\/doi.org\/10.1109\/idsta66210.2025.11202848","relation":{},"subject":[],"published":{"date-parts":[[2025,9,1]]}}}