{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,6,25]],"date-time":"2025-06-25T02:10:04Z","timestamp":1750817404513,"version":"3.37.3"},"reference-count":50,"publisher":"Springer Science and Business Media LLC","issue":"6","license":[{"start":{"date-parts":[[2023,11,1]],"date-time":"2023-11-01T00:00:00Z","timestamp":1698796800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2023,11,1]],"date-time":"2023-11-01T00:00:00Z","timestamp":1698796800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"funder":[{"DOI":"10.13039\/501100001809","name":"Natural Science Foundation of China","doi-asserted-by":"crossref","award":["62176175"],"award-info":[{"award-number":["62176175"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"crossref"}]},{"name":"Major project of natural science research in the Universities of Jiangsu Province","award":["21KJA520004"],"award-info":[{"award-number":["21KJA520004"]}]},{"name":"Suzhou Science and Technology Development Program","award":["SYC2022139"],"award-info":[{"award-number":["SYC2022139"]}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["World Wide Web"],"published-print":{"date-parts":[[2023,11]]},"DOI":"10.1007\/s11280-023-01215-6","type":"journal-article","created":{"date-parts":[[2023,12,20]],"date-time":"2023-12-20T07:02:21Z","timestamp":1703055741000},"page":"4153-4172","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":2,"title":["Click is not equal to purchase: multi-task reinforcement learning for multi-behavior recommendation"],"prefix":"10.1007","volume":"26","author":[{"given":"Huiwang","family":"Zhang","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Pengpeng","family":"Zhao","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xuefeng","family":"Xian","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Victor S.","family":"Sheng","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yongjing","family":"Hao","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zhiming","family":"Cui","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2023,12,20]]},"reference":[{"key":"1215_CR1","doi-asserted-by":"crossref","unstructured":"Cai, Q., Filos-Ratsikas, A., Tang, P., Zhang, Y.: Reinforcement mechanism design for e-commerce. In: WWW, pp. 1339\u20131348 (2018)","DOI":"10.1145\/3178876.3186039"},{"key":"1215_CR2","doi-asserted-by":"crossref","unstructured":"Takanobu, R., Zhuang, T., Huang, M., Feng, J., Tang, H., Zheng, B.: Aggregating e-commerce search results from heterogeneous sources via hierarchical reinforcement learning. In: WWW, pp. 1771\u20131781 (2019)","DOI":"10.1145\/3308558.3313455"},{"key":"1215_CR3","doi-asserted-by":"crossref","unstructured":"Zheng, G., Zhang, F., Zheng, Z., Xiang, Y., Yuan, N.J., Xie, X., Li, Z.: DRN: A deep reinforcement learning framework for news recommendation. In: WWW, pp. 167\u2013176 (2018)","DOI":"10.1145\/3178876.3185994"},{"key":"1215_CR4","unstructured":"van den Oord, A., Dieleman, S., Schrauwen, B.: Deep content-based music recommendation. In: NIPS, pp. 2643\u20132651 (2013)"},{"key":"1215_CR5","doi-asserted-by":"crossref","unstructured":"Hong, D., Li, Y., Dong, Q.: Nonintrusive-sensing and reinforcementlearning based adaptive personalized music recommendation. In: SIGIR, pp. 1721\u20131724 (2020)","DOI":"10.1145\/3397271.3401225"},{"key":"1215_CR6","doi-asserted-by":"crossref","unstructured":"Zhao, J., Zhao, P., Zhao, L., Liu, Y., Sheng, V.S., Zhou, X.: Variational self-attention network for sequential recommendation. In: ICDE, pp. 1559\u20131570 (2021)","DOI":"10.1109\/ICDE51399.2021.00138"},{"key":"1215_CR7","doi-asserted-by":"publisher","first-page":"580","DOI":"10.1016\/j.neucom.2020.10.066","volume":"423","author":"C Xu","year":"2021","unstructured":"Xu, C., Feng, J., Zhao, P., Zhuang, F., Wang, D., Liu, Y., Sheng, V.S.: Long- and short-term self-attention network for sequential recommendation. Neurocomputing 423, 580\u2013589 (2021)","journal-title":"Neurocomputing"},{"key":"1215_CR8","doi-asserted-by":"crossref","unstructured":"Liu, J., Zhao, P., Zhuang, F., Liu, Y., Sheng, V.S., Xu, J., Zhou, X., Xiong, H.: Exploiting aesthetic preference in deep cross networks for crossdomain recommendation. In: WWW, pp. 2768\u20132774 (2020)","DOI":"10.1145\/3366423.3380036"},{"issue":"5","key":"1215_CR9","doi-asserted-by":"publisher","first-page":"52","DOI":"10.1145\/3360048","volume":"14","author":"K Xiao","year":"2020","unstructured":"Xiao, K., Ye, Z., Zhang, L., Zhou, W., Ge, Y., Deng, Y.: Multi-user mobile sequential recommendation for route optimization. TKDD 14(5), 52\u201315228 (2020)","journal-title":"TKDD"},{"key":"1215_CR10","doi-asserted-by":"crossref","unstructured":"Hidasi, B., Karatzoglou, A.: Recurrent neural networks with top-k gains for session-based recommendations. In: CIKM, pp. 843\u2013852 (2018)","DOI":"10.1145\/3269206.3271761"},{"key":"1215_CR11","doi-asserted-by":"crossref","unstructured":"Sun, F., Liu, J., Wu, J., Pei, C., Lin, X., Ou, W., Jiang, P.: Bert4rec: Sequential recommendation with bidirectional encoder representations from transformer. In: CIKM, pp. 1441\u20131450 (2019)","DOI":"10.1145\/3357384.3357895"},{"key":"1215_CR12","doi-asserted-by":"crossref","unstructured":"Zhou, K., Wang, H., Zhao, W.X., Zhu, Y., Wang, S., Zhang, F., Wang, Z., Wen, J.: S3-rec: Self-supervised learning for sequential recommendation with mutual information maximization. In: CIKM, pp. 1893\u20131902 (2020)","DOI":"10.1145\/3340531.3411954"},{"key":"1215_CR13","first-page":"1265","volume":"6","author":"G Shani","year":"2005","unstructured":"Shani, G., Heckerman, D., Brafman, R.I.: An mdp-based recommender system. J. Mach. Learn. Res. 6, 1265\u20131295 (2005)","journal-title":"J. Mach. Learn. Res."},{"key":"1215_CR14","doi-asserted-by":"crossref","unstructured":"Zhao, X., Zhang, L., Ding, Z., Xia, L., Tang, J., Yin, D.: Recommendations with negative feedback via pairwise deep reinforcement learning. In: KDD, pp. 1040\u20131048 (2018)","DOI":"10.1145\/3219819.3219886"},{"key":"1215_CR15","doi-asserted-by":"crossref","unstructured":"Zhao, D., Zhang, L., Zhang, B., Zheng, L., Bao, Y., Yan, W.: Mahrl: Multi-goals abstraction based deep hierarchical reinforcement learning for recommendations. In: SIGIR, pp. 871\u2013880 (2020)","DOI":"10.1145\/3397271.3401170"},{"key":"1215_CR16","doi-asserted-by":"crossref","unstructured":"He, X., Liao, L., Zhang, H., Nie, L., Hu, X., Chua, T.: Neural collaborative filtering. In: WWW, pp. 173\u2013182 (2017)","DOI":"10.1145\/3038912.3052569"},{"key":"1215_CR17","doi-asserted-by":"crossref","unstructured":"Wu, J., Wang, X., Feng, F., He, X., Chen, L., Lian, J., Xie, X.: Selfsupervised graph learning for recommendation. In: SIGIR, pp. 726\u2013735 (2021)","DOI":"10.1145\/3404835.3462862"},{"key":"1215_CR18","unstructured":"Mnih, V., Kavukcuoglu, K., Silver, D., Graves, A., Antonoglou, I., Wierstra, D., Riedmiller, M.A.: Playing atari with deep reinforcement learning. CoRR abs\/1312.5602 (2013)"},{"key":"1215_CR19","doi-asserted-by":"crossref","unstructured":"van Hasselt, H., Guez, A., Silver, D.: Deep reinforcement learning with double q-learning. In: AAAI, pp. 2094\u20132100 (2016)","DOI":"10.1609\/aaai.v30i1.10295"},{"key":"1215_CR20","doi-asserted-by":"publisher","first-page":"229","DOI":"10.1007\/BF00992696","volume":"8","author":"RJ Williams","year":"1992","unstructured":"Williams, R.J.: Simple statistical gradient-following algorithms for connectionist reinforcement learning. Mach. Learn. 8, 229\u2013256 (1992)","journal-title":"Mach. Learn."},{"issue":"5","key":"1215_CR21","doi-asserted-by":"publisher","first-page":"1054","DOI":"10.1109\/TNN.1998.712192","volume":"9","author":"RS Sutton","year":"1998","unstructured":"Sutton, R.S., Barto, A.G.: Reinforcement learning: An introduction. IEEE Trans. Neural Networks 9(5), 1054\u20131054 (1998)","journal-title":"IEEE Trans. Neural Networks"},{"key":"1215_CR22","unstructured":"Lillicrap, T.P., Hunt, J.J., Pritzel, A., Heess, N., Erez, T., Tassa, Y., Silver, D., Wierstra, D.: Continuous control with deep reinforcement learning. In: ICLR (Poster) (2016)"},{"key":"1215_CR23","unstructured":"Haarnoja, T., Zhou, A., Abbeel, P., Levine, S.: Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor. In: ICML. Proceedings of machine learning research, vol. 80, pp. 1856\u20131865 (2018)"},{"issue":"7","key":"1215_CR24","doi-asserted-by":"publisher","first-page":"145","DOI":"10.1145\/3543846","volume":"55","author":"MM Afsar","year":"2023","unstructured":"Afsar, M.M., Crump, T., Far, B.H.: Reinforcement learning based recommender systems: A survey. ACM Comput. Surv. 55(7), 145\u2013114538 (2023)","journal-title":"ACM Comput. Surv."},{"key":"1215_CR25","doi-asserted-by":"crossref","unstructured":"Zhang, J., Hao, B., Chen, B., Li, C., Chen, H., Sun, J.: Hierarchical reinforcement learning for course recommendation in moocs. In: AAAI, pp. 435\u2013442 (2019)","DOI":"10.1609\/aaai.v33i01.3301435"},{"key":"1215_CR26","doi-asserted-by":"crossref","unstructured":"Pei, C., Yang, X., Cui, Q., Lin, X., Sun, F., Jiang, P., Ou, W., Zhang, Y.: Value-aware recommendation based on reinforcement profit maximization. In: WWW, pp. 3123\u20133129 (2019)","DOI":"10.1145\/3308558.3313404"},{"key":"1215_CR27","unstructured":"Bai, X., Guan, J., Wang, H.: A model-based reinforcement learning with adversarial training for online recommendation. NeurIPS, 10734\u201310745 (2019)"},{"key":"1215_CR28","doi-asserted-by":"crossref","unstructured":"Wang, P., Fan, Y., Xia, L., Zhao, W.X., Niu, S., Huang, J.: KERL: A knowledge-guided reinforcement learning model for sequential recommendation. In: SIGIR, pp. 209\u2013218 (2020)","DOI":"10.1145\/3397271.3401134"},{"issue":"1\u20132","key":"1215_CR29","doi-asserted-by":"publisher","first-page":"41","DOI":"10.1023\/A:1022140919877","volume":"13","author":"AG Barto","year":"2003","unstructured":"Barto, A.G., Mahadevan, S.: Recent advances in hierarchical reinforcement learning. Discret. Event Dyn. Syst. 13(1\u20132), 41\u201377 (2003)","journal-title":"Discret. Event Dyn. Syst."},{"key":"1215_CR30","doi-asserted-by":"crossref","unstructured":"Xie, R., Zhang, S., Wang, R., Xia, F., Lin, L.: Hierarchical reinforcement learning for integrated recommendation. In: AAAI, pp. 4521\u20134528 (2021)","DOI":"10.1609\/aaai.v35i5.16580"},{"key":"1215_CR31","doi-asserted-by":"crossref","unstructured":"Chen, M., Chang, B., Xu, C., Chi, E.H.: User response models to improve a REINFORCE recommender system. In: WSDM, pp. 121\u2013129 (2021)","DOI":"10.1145\/3437963.3441764"},{"key":"1215_CR32","doi-asserted-by":"crossref","unstructured":"Xin, X., Karatzoglou, A., Arapakis, I., Jose, J.M.: Self-supervised reinforcement learning for recommender systems. In: SIGIR, pp. 931\u2013940 (2020)","DOI":"10.1145\/3397271.3401147"},{"key":"1215_CR33","doi-asserted-by":"crossref","unstructured":"Wang, P., Fan, Y., Xia, L., Zhao, W.X., Niu, S., Huang, J.X.: KERL: A knowledge-guided reinforcement learning model for sequential recommendation. In: SIGIR, pp. 209\u2013218 (2020)","DOI":"10.1145\/3397271.3401134"},{"key":"1215_CR34","doi-asserted-by":"crossref","unstructured":"Gao, C., Xu, K., Zhou, K., Li, L., Wang, X., Yuan, B., Zhao, P.: Value penalized q-learning for recommender systems. In: SIGIR, pp. 2008\u20132012 (2022)","DOI":"10.1145\/3477495.3531796"},{"key":"1215_CR35","doi-asserted-by":"crossref","unstructured":"Deng, Y., Li, Y., Sun, F., Ding, B., Lam, W.: Unified conversational recommendation policy learning via graph-based reinforcement learning. In: SIGIR, pp. 1431\u20131441 (2021)","DOI":"10.1145\/3404835.3462913"},{"key":"1215_CR36","doi-asserted-by":"crossref","unstructured":"Zhao, X., Xia, L., Zou, L., Liu, H., Yin, D., Tang, J.: Whole-chain recommendations. In: CIKM, pp. 1883\u20131891 (2020)","DOI":"10.1145\/3340531.3412044"},{"issue":"1","key":"1215_CR37","doi-asserted-by":"publisher","first-page":"41","DOI":"10.1023\/A:1007379606734","volume":"28","author":"R Caruana","year":"1997","unstructured":"Caruana, R.: Multitask learning. Machine learning 28(1), 41\u201375 (1997)","journal-title":"Multitask learning. Machine learning"},{"key":"1215_CR38","doi-asserted-by":"crossref","unstructured":"Pinto, L., Gupta, A.: Learning to push by grasping: Using multiple tasks for effective learning. In: ICRA, pp. 2161\u20132168 (2017)","DOI":"10.1109\/ICRA.2017.7989249"},{"key":"1215_CR39","unstructured":"Crawshaw, M.: Multi-task learning with deep neural networks: A survey. CoRR abs\/2009.09796 (2020)"},{"key":"1215_CR40","doi-asserted-by":"crossref","unstructured":"Strezoski, G., van Noord, N., Worring, M.: Many task learning with task routing. In: ICCV, pp. 1375\u20131384 (2019)","DOI":"10.1109\/ICCV.2019.00146"},{"key":"1215_CR41","doi-asserted-by":"crossref","unstructured":"Liu, X., He, P., Chen, W., Gao, J.: Multi-task deep neural networks for natural language understanding. In: ACL (1), pp. 4487\u20134496 (2019)","DOI":"10.18653\/v1\/P19-1441"},{"key":"1215_CR42","doi-asserted-by":"publisher","first-page":"323","DOI":"10.1007\/BF00992700","volume":"8","author":"SP Singh","year":"1992","unstructured":"Singh, S.P.: Transfer of learning by composing solutions of elemental sequential tasks. Mach. Learn. 8, 323\u2013339 (1992)","journal-title":"Mach. Learn."},{"key":"1215_CR43","doi-asserted-by":"crossref","unstructured":"Wilson, A., Fern, A., Ray, S., Tadepalli, P.: Multi-task reinforcement learning: a hierarchical bayesian approach. In: ICML, vol. 227, pp. 1015\u20131022 (2007)","DOI":"10.1145\/1273496.1273624"},{"key":"1215_CR44","doi-asserted-by":"crossref","unstructured":"Pinto, L., Gupta, A.: Learning to push by grasping: Using multiple tasks for effective learning. In: ICRA, pp. 2161\u20132168 (2017)","DOI":"10.1109\/ICRA.2017.7989249"},{"key":"1215_CR45","unstructured":"Yang, R., Xu, H., Wu, Y., Wang, X.: Multi-task reinforcement learning with soft modularization. NeurIPS (2020)"},{"issue":"1","key":"1215_CR46","doi-asserted-by":"publisher","first-page":"79","DOI":"10.1162\/neco.1991.3.1.79","volume":"3","author":"RA Jacobs","year":"1991","unstructured":"Jacobs, R.A., Jordan, M.I., Nowlan, S.J., Hinton, G.E.: Adaptive mixtures of local experts. Neural Comput. 3(1), 79\u201387 (1991)","journal-title":"Neural Comput."},{"key":"1215_CR47","doi-asserted-by":"crossref","unstructured":"Ma, J., Zhao, Z., Yi, X., Chen, J., Hong, L., Chi, E.H.: Modeling task relationships in multi-task learning with multi-gate mixture-of-experts. In: KDD, pp. 1930\u20131939 (2018)","DOI":"10.1145\/3219819.3220007"},{"key":"1215_CR48","doi-asserted-by":"crossref","unstructured":"Tang, H., Liu, J., Zhao, M., Gong, X.: Progressive layered extraction (PLE): A novel multi-task learning (MTL) model for personalized recommendations. In: RecSys, pp. 269\u2013278 (2020)","DOI":"10.1145\/3383313.3412236"},{"key":"1215_CR49","unstructured":"Mnih, V., Kavukcuoglu, K., Silver, D., Graves, A., Antonoglou, I., Wierstra, D., Riedmiller, M.A.: Playing atari with deep reinforcement learning. CoRR abs\/1312.5602 (2013)"},{"key":"1215_CR50","doi-asserted-by":"crossref","unstructured":"J\u00e4rvelin, K., Kek\u00e4l\u00e4inen, J.: Cumulated gain-based evaluation of IR techniques. ACM Trans. Inf. Syst. 20(4), 422\u2013446 (2002)","DOI":"10.1145\/582415.582418"}],"container-title":["World Wide Web"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11280-023-01215-6.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11280-023-01215-6\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11280-023-01215-6.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,12,30]],"date-time":"2023-12-30T03:20:49Z","timestamp":1703906449000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11280-023-01215-6"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023,11]]},"references-count":50,"journal-issue":{"issue":"6","published-print":{"date-parts":[[2023,11]]}},"alternative-id":["1215"],"URL":"https:\/\/doi.org\/10.1007\/s11280-023-01215-6","relation":{},"ISSN":["1386-145X","1573-1413"],"issn-type":[{"type":"print","value":"1386-145X"},{"type":"electronic","value":"1573-1413"}],"subject":[],"published":{"date-parts":[[2023,11]]},"assertion":[{"value":"31 March 2023","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"21 September 2023","order":2,"name":"revised","label":"Revised","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"25 September 2023","order":3,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"20 December 2023","order":4,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"Not Applicable","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Ethical Approval"}},{"value":"The authors declare that they have no known competing financial interests or personal relationships that could have appeared to influence the work reported in this paper.","order":3,"name":"Ethics","group":{"name":"EthicsHeading","label":"Competing Interests"}}]}}