{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,2,4]],"date-time":"2026-02-04T18:20:31Z","timestamp":1770229231935,"version":"3.49.0"},"publisher-location":"Singapore","reference-count":39,"publisher":"Springer Nature Singapore","isbn-type":[{"value":"9789819561957","type":"print"},{"value":"9789819561964","type":"electronic"}],"license":[{"start":{"date-parts":[[2026,1,1]],"date-time":"2026-01-01T00:00:00Z","timestamp":1767225600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2026,1,1]],"date-time":"2026-01-01T00:00:00Z","timestamp":1767225600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2026]]},"DOI":"10.1007\/978-981-95-6196-4_5","type":"book-chapter","created":{"date-parts":[[2026,2,4]],"date-time":"2026-02-04T05:59:11Z","timestamp":1770184751000},"page":"64-78","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["Distributional Offline Reinforcement Learning for\u00a0Recommender Systems"],"prefix":"10.1007","author":[{"given":"Xiaocong","family":"Chen","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Siyu","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Lina","family":"Yao","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2026,2,5]]},"reference":[{"key":"5_CR1","doi-asserted-by":"publisher","first-page":"110335","DOI":"10.1016\/j.knosys.2023.110335","volume":"264","author":"X Chen","year":"2023","unstructured":"Chen, X., Yao, L., McAuley, J., Zhou, G., Wang, X.: Deep reinforcement learning in recommender systems: a survey and new perspectives. Knowl.-Based Syst. 264, 110335 (2023)","journal-title":"Knowl.-Based Syst."},{"key":"5_CR2","unstructured":"Wang, S.,\u00a0Chen, X.,\u00a0McAuley, J.,\u00a0Cripps, S.,\u00a0Yao, L.: Plug-and-play model-agnostic counterfactual policy synthesis for deep reinforcement learning-based recommendation. IEEE Trans. Neural Netw. Learn. Syst. (2023)"},{"key":"5_CR3","doi-asserted-by":"crossref","unstructured":"Zheng, G., et al.: DRN: a deep reinforcement learning framework for news recommendation. In: Proceedings of the 2018 World Wide Web Conference, pp. 167\u2013176 (2018)","DOI":"10.1145\/3178876.3185994"},{"key":"5_CR4","doi-asserted-by":"crossref","unstructured":"Zhao, X.,\u00a0Xia, L.,\u00a0Zhang, L.,\u00a0Ding, Z.,\u00a0Yin, D.,\u00a0Tang, J.: Deep reinforcement learning for page-wise recommendations. In: Proceedings of the 12th ACM Conference on Recommender Systems, pp. 95\u2013103 (2018)","DOI":"10.1145\/3240323.3240374"},{"key":"5_CR5","doi-asserted-by":"crossref","unstructured":"Chen, X.,\u00a0Yao, L.,\u00a0Sun, A.,\u00a0Wang, X.,\u00a0Xu, X.,\u00a0Zhu, L.: Generative inverse deep reinforcement learning for online recommendation. In: Proceedings of the 30th ACM International Conference on Information & Knowledge Management, pp. 201\u2013210 (2021)","DOI":"10.1145\/3459637.3482347"},{"key":"5_CR6","unstructured":"Chen, X.,\u00a0Yao, L.,\u00a0Wang, X.,\u00a0Sun, A., Sheng, Q.Z.: Generative adversarial reward learning for generalized behavior tendency inference. IEEE Trans. Knowl. Data Eng., 1\u201312 (2022)"},{"key":"5_CR7","doi-asserted-by":"crossref","unstructured":"Chen, X.,\u00a0Yao, L.,\u00a0McAuley, J.,\u00a0Guan, W.,\u00a0Chang, X.,\u00a0Wang, X.: Locality-sensitive state-guided experience replay optimization for sparse rewards in online recommendation. In: Proceedings of the 45th International ACM SIGIR Conference on Research and Development in Information Retrieval, pp. 1316\u20131325 (2022)","DOI":"10.1145\/3477495.3532015"},{"issue":"6","key":"5_CR8","first-page":"1","volume":"42","author":"X Chen","year":"2024","unstructured":"Chen, X., Wang, S., McAuley, J., Jannach, D., Yao, L.: On the opportunities and challenges of offline reinforcement learning for recommender systems. ACM Trans. Inf. Syst. 42(6), 1\u201326 (2024)","journal-title":"ACM Trans. Inf. Syst."},{"key":"5_CR9","doi-asserted-by":"crossref","unstructured":"Chen, X.,\u00a0Wang, S.,\u00a0Yao, L.: Maximum-entropy regularized decision transformer with reward relabelling for dynamic recommendation. In: Proceedings of the 30th ACM SIGKDD Conference on Knowledge Discovery and Data Mining, pp. 376\u2013384 (2024)","DOI":"10.1145\/3637528.3671750"},{"issue":"3","key":"5_CR10","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/3719208","volume":"16","author":"S Wang","year":"2025","unstructured":"Wang, S., Chen, X., Yao, L.: Retentive decision transformer with adaptive masking for reinforcement learning-based recommendation systems. ACM Trans. Intell. Syst. Technol. 16(3), 1\u201320 (2025)","journal-title":"ACM Trans. Intell. Syst. Technol."},{"key":"5_CR11","unstructured":"Haarnoja, T., et\u00a0al.: Soft actor-critic algorithms and applications. arXiv preprint: arXiv:1812.05905 (2018)"},{"key":"5_CR12","doi-asserted-by":"crossref","unstructured":"Riedmiller, M.: Neural fitted q iteration\u2013first experiences with a data efficient neural reinforcement learning method. In: Machine Learning: ECML 2005: 16th European Conference on Machine Learning, Porto, Portugal, 3\u20137 October 2005. Proceedings 16, pp. 317\u2013328. Springer (2005)","DOI":"10.1007\/11564096_32"},{"key":"5_CR13","unstructured":"Levine, S.,\u00a0Kumar, A.,\u00a0Tucker, G.,\u00a0Fu, J.: Offline reinforcement learning: tutorial, review, and perspectives on open problems. arXiv preprint: arXiv:2005.01643 (2020)"},{"key":"5_CR14","unstructured":"Bellemare, M.G.,\u00a0Dabney, W.,\u00a0Munos, R.: A distributional perspective on reinforcement learning. In: International Conference on Machine Learning, pp. 449\u2013458. PMLR (2017)"},{"key":"5_CR15","unstructured":"Sutton, R.S., Barto, A.G.: Reinforcement learning: An introduction. MIT press (2018)"},{"key":"5_CR16","unstructured":"Haarnoja, T.,\u00a0Zhou, A.,\u00a0Abbeel, P.,\u00a0Levine, S.: Soft actor-critic: off-policy maximum entropy deep reinforcement learning with a stochastic actor. In: International Conference on Machine Learning, pp. 1861\u20131870. PMLR (2018)"},{"key":"5_CR17","unstructured":"Yang, D.,\u00a0Zhao, L.,\u00a0Lin, Z.,\u00a0Qin, T.,\u00a0Bian, J., Liu, T.-Y.: Fully parameterized quantile function for distributional reinforcement learning. In: Advances in Neural Information Processing Systems, vol.\u00a032 (2019)"},{"issue":"2","key":"5_CR18","doi-asserted-by":"publisher","first-page":"429","DOI":"10.2307\/1428011","volume":"29","author":"A M\u00fcller","year":"1997","unstructured":"M\u00fcller, A.: Integral probability metrics and their generating classes of functions. Adv. Appl. Probab. 29(2), 429\u2013443 (1997)","journal-title":"Adv. Appl. Probab."},{"key":"5_CR19","doi-asserted-by":"crossref","unstructured":"Huber, P.J.: Robust estimation of a location parameter. In: Breakthroughs in Statistics: Methodology and Distribution, pp. 492\u2013518 (1992)","DOI":"10.1007\/978-1-4612-4380-9_35"},{"key":"5_CR20","doi-asserted-by":"publisher","unstructured":"Wan, M.,\u00a0McAuley, J.: Item recommendation on monotonic behavior chains. In: Proceedings of the 12th ACM Conference on Recommender Systems, ser, RecSys \u201918, pp. 86\u201394. Association for Computing Machinery, New York (2018). https:\/\/doi.org\/10.1145\/3240323.3240369","DOI":"10.1145\/3240323.3240369"},{"key":"5_CR21","doi-asserted-by":"publisher","unstructured":"Ziegler, C.-N., McNee, S.M., Konstan, J.A.,\u00a0Lausen, G.: Improving recommendation lists through topic diversification. In: Proceedings of the 14th International Conference on World Wide Web, ser. WWW \u201905, pp. 22\u201332. Association for Computing Machinery, New York (2005). https:\/\/doi.org\/10.1145\/1060745.1060754","DOI":"10.1145\/1060745.1060754"},{"key":"5_CR22","doi-asserted-by":"crossref","unstructured":"Chen, X.,\u00a0Huang, C.,\u00a0Yao, L.,\u00a0Wang, X.,\u00a0liu, W.,\u00a0Zhang, W.: Knowledge-guided deep reinforcement learning for interactive recommendation. In: 2020 International Joint Conference on Neural Networks (IJCNN), pp. 1\u20138 (2020)","DOI":"10.1109\/IJCNN48605.2020.9207010"},{"key":"5_CR23","doi-asserted-by":"crossref","unstructured":"Zhao, X.,\u00a0Zhang, L.,\u00a0Ding, Z.,\u00a0Xia, L.,\u00a0Tang, J.,\u00a0Yin, D.: Recommendations with negative feedback via pairwise deep reinforcement learning. In: Proceedings of the 24th ACM SIGKDD International Conference on Knowledge Discovery & Data Mining, pp. 1040\u20131048 (2018)","DOI":"10.1145\/3219819.3219886"},{"key":"5_CR24","doi-asserted-by":"crossref","unstructured":"Wang, S.,\u00a0Chen, X.,\u00a0Jannach, D.,\u00a0Yao, L.: Causal decision transformer for recommender systems via offline reinforcement learning. In: Proceedings of the 46th International ACM SIGIR Conference on Research and Development in Information Retrieval, pp. 1599\u20131608 (2023)","DOI":"10.1145\/3539618.3591648"},{"key":"5_CR25","doi-asserted-by":"crossref","unstructured":"Wang, S.,\u00a0Chen, X.,\u00a0Yao, L.: On causally disentangled state representation learning for reinforcement learning based recommender systems. In: Proceedings of the 33rd ACM International Conference on Information and Knowledge Management, pp. 2390\u20132399 (2024)","DOI":"10.1145\/3627673.3679674"},{"key":"5_CR26","doi-asserted-by":"crossref","unstructured":"Shi, J.-C.,\u00a0Yu, Y.,\u00a0Da, Q., Chen, S.-Y., Zeng, A.-X.: Virtual-Taobao: virtualizing real-world online retail environment for reinforcement learning. In: Proceedings of the AAAI Conference on Artificial Intelligence, vol.\u00a033, pp. 4902\u20134909 (2019)","DOI":"10.1609\/aaai.v33i01.33014902"},{"key":"5_CR27","unstructured":"Lillicrap, T.P. et al.: Continuous control with deep reinforcement learning. In: 4th International Conference on Learning Representations, ICLR 2016, San Juan, Puerto Rico, 2\u20134 May 2016, Conference Track Proceedings (2016). http:\/\/arxiv.org\/abs\/1509.02971"},{"key":"5_CR28","unstructured":"Fujimoto, S.,\u00a0van Hoof, H.,\u00a0Meger, D.: Addressing function approximation error in actor-critic methods. In: Proceedings of the 35th International Conference on Machine Learning, ICML 2018, Stockholmsm\u00e4ssan, Stockholm, Sweden, 10\u201315 July 2018, ser. Proceedings of Machine Learning Research, vol.\u00a080, pp. 1582\u20131591. PMLR (2018). http:\/\/proceedings.mlr.press\/v80\/fujimoto18a.html"},{"key":"5_CR29","unstructured":"Chen, L.,\u00a0et al.: Decision transformer: reinforcement learning via sequence modeling. In: Advances in Neural Information Processing Systems (2021). https:\/\/openreview.net\/forum?id=a7APmM4B9d"},{"key":"5_CR30","doi-asserted-by":"crossref","unstructured":"Kang, W.-C., McAuley, J.: Self-attentive sequential recommendation. In: IEEE International Conference on Data Mining (ICDM) 2018, pp. 197\u2013206 (2018)","DOI":"10.1109\/ICDM.2018.00035"},{"key":"5_CR31","doi-asserted-by":"publisher","unstructured":"Sun, F., et al.: BERT4Rec: sequential recommendation with bidirectional encoder representations from transformer, ser. CIKM \u201919, pp. 1441\u20131450. Association for Computing Machinery, New York (2019). https:\/\/doi.org\/10.1145\/3357384.3357895","DOI":"10.1145\/3357384.3357895"},{"key":"5_CR32","doi-asserted-by":"crossref","unstructured":"Zhou, K.,\u00a0et al.: S3-Rec: self-supervised learning for sequential recommendation with mutual information maximization. In: Proceedings of the 29th ACM International Conference on Information & Knowledge Management, pp. 1893\u20131902 (2020)","DOI":"10.1145\/3340531.3411954"},{"key":"5_CR33","doi-asserted-by":"crossref","unstructured":"Chen, H., et al.: Large-scale interactive recommendation with tree-structured policy gradient. In: Proceedings of the AAAI Conference on Artificial Intelligence, vol.\u00a033, pp. 3312\u20133320 (2019)","DOI":"10.1609\/aaai.v33i01.33013312"},{"key":"5_CR34","doi-asserted-by":"crossref","unstructured":"Xian, Y.,\u00a0Fu, Z.,\u00a0Muthukrishnan, S.,\u00a0de\u00a0Melo, G.,\u00a0Zhang, Y.: Reinforcement knowledge graph reasoning for explainable recommendation. In: Proceedings of the 42nd International ACM SIGIR Conference on Research and Development in Information Retrieval, pp. 285\u2013294. ACM (2019)","DOI":"10.1145\/3331184.3331203"},{"key":"5_CR35","unstructured":"Bai, X.,\u00a0Guan, J.,\u00a0Wang, H.: A model-based reinforcement learning with adversarial training for online recommendation. In: Advances in Neural Information Processing Systems, vol.\u00a032 (2019)"},{"key":"5_CR36","unstructured":"Kumar, A., Zhou, A., Tucker, G., Levine, S.: Conservative q-learning for offline reinforcement learning. In: Advances in Neural Information Processing Systems, vol. 33, pp. 1179\u20131191 (2020)"},{"key":"5_CR37","unstructured":"Kidambi, R.,\u00a0Rajeswaran, A.,\u00a0Netrapalli, P.,\u00a0Joachims, T.: MORel: model-based offline reinforcement learning. In: Advances in Neural Information Processing Systems, vol.\u00a033, pp. 21810\u201321823. Curran Associates, Inc., (2020). https:\/\/proceedings.neurips.cc\/paper_files\/paper\/2020\/file\/f7efa4f864ae9b88d43527f4b14f750f-Paper.pdf"},{"key":"5_CR38","unstructured":"Janner, M.,\u00a0Li, Q.,\u00a0Levine, S.: Offline reinforcement learning as one big sequence modeling problem. In: Advances in Neural Information Processing Systems, vol.\u00a034, pp. 1273\u20131286. Curran Associates, Inc. (2021). https:\/\/proceedings.neurips.cc\/paper_files\/paper\/2021\/file\/099fe6b0b444c23836c4a5d07346082b-Paper.pdf"},{"key":"5_CR39","unstructured":"Kostrikov, I.,\u00a0Fergus, R.,\u00a0Tompson, J.,\u00a0Nachum, O.: Offline reinforcement learning with fisher divergence critic regularization. In: International Conference on Machine Learning, pp. 5774\u20135783. PMLR (2021)"}],"container-title":["Lecture Notes in Computer Science","Databases Theory and Applications"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-981-95-6196-4_5","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,2,4]],"date-time":"2026-02-04T05:59:21Z","timestamp":1770184761000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-981-95-6196-4_5"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026]]},"ISBN":["9789819561957","9789819561964"],"references-count":39,"URL":"https:\/\/doi.org\/10.1007\/978-981-95-6196-4_5","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026]]},"assertion":[{"value":"5 February 2026","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"ADC","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Australasian Database Conference","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Sydney","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Australia","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2025","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"4 December 2025","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"7 December 2025","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"36","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"adc2025","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/adc-conference.github.io\/2025\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}