{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,8]],"date-time":"2026-07-08T20:27:34Z","timestamp":1783542454160,"version":"3.55.0"},"reference-count":38,"publisher":"Elsevier BV","issue":"1","license":[{"start":{"date-parts":[[2027,1,1]],"date-time":"2027-01-01T00:00:00Z","timestamp":1798761600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2027,1,1]],"date-time":"2027-01-01T00:00:00Z","timestamp":1798761600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2027,1,1]],"date-time":"2027-01-01T00:00:00Z","timestamp":1798761600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2027,1,1]],"date-time":"2027-01-01T00:00:00Z","timestamp":1798761600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2027,1,1]],"date-time":"2027-01-01T00:00:00Z","timestamp":1798761600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2027,1,1]],"date-time":"2027-01-01T00:00:00Z","timestamp":1798761600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2027,1,1]],"date-time":"2027-01-01T00:00:00Z","timestamp":1798761600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Information Processing &amp; Management"],"published-print":{"date-parts":[[2027,1]]},"DOI":"10.1016\/j.ipm.2026.105035","type":"journal-article","created":{"date-parts":[[2026,7,7]],"date-time":"2026-07-07T19:47:08Z","timestamp":1783453628000},"page":"105035","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"PA","title":["Offline-to-online reinforcement learning with triple-intensity policy constraints"],"prefix":"10.1016","volume":"64","author":[{"ORCID":"https:\/\/orcid.org\/0009-0009-2113-6402","authenticated-orcid":false,"given":"Hao","family":"Wu","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0009-6272-258X","authenticated-orcid":false,"given":"Songlin","family":"Li","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0002-2336-4395","authenticated-orcid":false,"given":"Wei","family":"Xiao","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0005-3405-3340","authenticated-orcid":false,"given":"Taihong","family":"Zhong","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-8081-4498","authenticated-orcid":false,"given":"Shuai","family":"L\u00fc","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"issue":"2","key":"10.1016\/j.ipm.2026.105035_b1","doi-asserted-by":"crossref","first-page":"1298","DOI":"10.1137\/120867925","article-title":"Finite linear programming approximations of constrained discounted Markov decision processes","volume":"51","author":"Dufour","year":"2013","journal-title":"SIAM Journal on Control and Optimization"},{"key":"10.1016\/j.ipm.2026.105035_b2","series-title":"AAAI conference on artificial intelligence","first-page":"11961","article-title":"Suf: Stabilized unconstrained fine-tuning for offline-to-online reinforcement learning","volume":"vol. 38","author":"Feng","year":"2024"},{"key":"10.1016\/j.ipm.2026.105035_b3","series-title":"D4RL: Datasets for deep data-driven reinforcement learning","author":"Fu","year":"2020"},{"key":"10.1016\/j.ipm.2026.105035_b4","unstructured":"Fujimoto, S., & Gu, S. S. (2021). A Minimalist Approach to Offline Reinforcement Learning. In Annual conference on neural information processing systems (pp. 20132\u201320145)."},{"key":"10.1016\/j.ipm.2026.105035_b5","unstructured":"G\u00fcl\u00e7ehre, \u00c7., Wang, Z., Novikov, A., Paine, T., Colmenarejo, S. G., Zolna, K., Agarwal, R., Merel, J., Mankowitz, D. J., Paduraru, C., Dulac-Arnold, G., Li, J., Norouzi, M., Hoffman, M., Heess, N., & de Freitas, N. (2020). RL Unplugged: A Suite of Benchmarks for Offline Reinforcement Learning. In Annual conference on neural information processing systems (pp. 7248\u20137259)."},{"key":"10.1016\/j.ipm.2026.105035_b6","article-title":"A simple unified uncertainty-guided framework for offline-to-online reinforcement learning","author":"Guo","year":"2025","journal-title":"IEEE Transactions on Neural Networks and Learning Systems"},{"issue":"3","key":"10.1016\/j.ipm.2026.105035_b7","doi-asserted-by":"crossref","first-page":"1299","DOI":"10.1109\/TKDE.2023.3302804","article-title":"Sample efficient offline-to-online reinforcement learning","volume":"36","author":"Guo","year":"2023","journal-title":"IEEE Transactions on Knowledge and Data Engineering"},{"key":"10.1016\/j.ipm.2026.105035_b8","doi-asserted-by":"crossref","unstructured":"Hong, Z.-W., Kumar, A., Karnik, S., Bhandwaldar, A., Srivastava, A., Pajarinen, J., Laroche, R., Gupta, A., & Agrawal, P. (2023). Beyond Uniform Sampling: Offline Reinforcement Learning with Imbalanced Datasets. In Annual conference on neural information processing systems (pp. 4985\u20135009).","DOI":"10.52202\/075280-0221"},{"key":"10.1016\/j.ipm.2026.105035_b9","unstructured":"Kong, R., Wu, C., Gao, C.-X., Zhang, Z., & Li, M. (2024). Efficient and Stable Offline-to-Online Reinforcement Learning via Continual Policy Revitalization. In International joint conference on artificial intelligence (pp. 4317\u20134325)."},{"key":"10.1016\/j.ipm.2026.105035_b10","unstructured":"Kostrikov, I., Nair, A., & Levine, S. (2022). Offline Reinforcement Learning with Implicit Q-Learning. In International conference on learning representations."},{"key":"10.1016\/j.ipm.2026.105035_b11","unstructured":"Kumar, A., Zhou, A., Tucker, G., & Levine, S. (2020). Conservative Q-learning for Offline Reinforcement Learning. In Annual conference on neural information processing systems (pp. 1179\u20131191)."},{"key":"10.1016\/j.ipm.2026.105035_b12","unstructured":"Lee, S., Seo, Y., Lee, K., Abbeel, P., & Shin, J. (2021). Offline-to-Online Reinforcement Learning via Balanced Replay and Pessimistic Q-Ensemble. In Conference on robot learning (pp. 1702\u20131712)."},{"issue":"4","key":"10.1016\/j.ipm.2026.105035_b13","doi-asserted-by":"crossref","DOI":"10.1016\/j.ipm.2025.104590","article-title":"End-to-end scheduling for carrier-based aircraft sortie operations using deep reinforcement learning","volume":"63","author":"Li","year":"2026","journal-title":"Information Processing & Management"},{"key":"10.1016\/j.ipm.2026.105035_b14","unstructured":"Liu, T., Li, Y., Lan, Y., Gao, H., Pan, W., & Xu, X. (2024). Adaptive Advantage-Guided Policy Regularization for Offline Reinforcement Learning. In International conference on machine learning (pp. 31406\u201331424)."},{"key":"10.1016\/j.ipm.2026.105035_b15","doi-asserted-by":"crossref","unstructured":"Luo, Q.-W., Xie, M.-K., Wang, Y.-W., & Huang, S.-J. (2024). Optimistic Critic Reconstruction and Constrained Fine-Tuning for General Offline-to-Online RL. In Annual conference on neural information processing systems (pp. 108167\u2013108207).","DOI":"10.52202\/079017-3435"},{"key":"10.1016\/j.ipm.2026.105035_b16","series-title":"AWAC: Accelerating online reinforcement learning with offline datasets","author":"Nair","year":"2020"},{"key":"10.1016\/j.ipm.2026.105035_b17","doi-asserted-by":"crossref","unstructured":"Nakamoto, M., Zhai, S., Singh, A., Sobol Mark, M., Ma, Y., Finn, C., Kumar, A., & Levine, S. (2023). Cal-QL: Calibrated Offline RL Pre-Training for Efficient Online Fine-Tuning. In Annual conference on neural information processing systems (pp. 62244\u201362269).","DOI":"10.52202\/075280-2719"},{"key":"10.1016\/j.ipm.2026.105035_b18","doi-asserted-by":"crossref","unstructured":"Qin, R.-J., Zhang, X., Gao, S., Chen, X.-H., Li, Z., Zhang, W., & Yu, Y. (2022). NeoRL: A Near Real-World Benchmark for Offline Reinforcement Learning. In Annual conference on neural information processing systems (pp. 24753\u201324765).","DOI":"10.52202\/068431-1795"},{"key":"10.1016\/j.ipm.2026.105035_b19","unstructured":"Saxena, N., Khastagir, S., Kolathaya, S., & Bhatnagar, S. (2023). Off-Policy Average reward Actor-Critic with Deterministic Policy Search. In International conference on machine learning (pp. 30130\u201330203)."},{"key":"10.1016\/j.ipm.2026.105035_b20","unstructured":"Schulman, J., Levine, S., Abbeel, P., Jordan, M., & Moritz, P. (2015). Trust Region Policy Optimization. In International conference on machine learning (pp. 1889\u20131897)."},{"key":"10.1016\/j.ipm.2026.105035_b21","doi-asserted-by":"crossref","unstructured":"Sontakke, S., Zhang, J., Arnold, S., Pertsch, K., B\u0131y\u0131k, E., Sadigh, D., Finn, C., & Itti, L. (2023). RoboCLIP: One Demonstration is Enough to Learn Robot Policies. In Annual conference on neural information processing systems (pp. 55681\u201355693).","DOI":"10.52202\/075280-2430"},{"key":"10.1016\/j.ipm.2026.105035_b22","doi-asserted-by":"crossref","unstructured":"Todorov, E., Erez, T., & Tassa, Y. (2012). Mujoco: A Physics Engine for Model-Based Control. In IEEE\/RSJ international conference on intelligent robots and systems (pp. 5026\u20135033).","DOI":"10.1109\/IROS.2012.6386109"},{"key":"10.1016\/j.ipm.2026.105035_b23","series-title":"Critic regularized regression","author":"Wang","year":"2020"},{"key":"10.1016\/j.ipm.2026.105035_b24","doi-asserted-by":"crossref","unstructured":"Wang, S., Yang, Q., Gao, J., Lin, M., Chen, H., Wu, L., Jia, N., Song, S., & Huang, G. (2023). Train Once, Get a Family: State-Adaptive Balances for Offline-to-Online Reinforcement Learning. In Annual conference on neural information processing systems (pp. 47081\u201347104).","DOI":"10.52202\/075280-2039"},{"key":"10.1016\/j.ipm.2026.105035_b25","series-title":"Uncertainty in artificial intelligence","first-page":"2159","article-title":"Deterministic policy gradient: Convergence analysis","author":"Xiong","year":"2022"},{"key":"10.1016\/j.ipm.2026.105035_b26","doi-asserted-by":"crossref","unstructured":"Yu, Y. (2018). Towards Sample Efficient Reinforcement Learning. In International joint conference on artificial intelligence (pp. 5739\u20135743).","DOI":"10.24963\/ijcai.2018\/820"},{"key":"10.1016\/j.ipm.2026.105035_b27","unstructured":"Yu, Z., & Zhang, X. (2023). Actor-Critic Alignment for Offline-to-Online Reinforcement Learning. In International conference on machine learning (pp. 40452\u201340474)."},{"issue":"4","key":"10.1016\/j.ipm.2026.105035_b28","article-title":"Uncertainty-penalized reinforcement learning from human feedback with diversified reward LoRA ensembles","volume":"63","author":"Zhai","year":"2026","journal-title":"Information Processing & Management"},{"key":"10.1016\/j.ipm.2026.105035_b29","doi-asserted-by":"crossref","unstructured":"Zhang, Y., Liu, J., Li, C., Niu, Y., Yang, Y., Liu, Y., & Ouyang, W. (2024). A Perspective of Q-value Estimation on Offline-to-Online Reinforcement Learning. In AAAI conference on artificial intelligence (pp. 16908\u201316916).","DOI":"10.1609\/aaai.v38i15.29633"},{"key":"10.1016\/j.ipm.2026.105035_b30","unstructured":"Zhang, H., Xu, W., & Yu, H. (2023). Policy Expansion for Bridging Offline-to-Online Reinforcement Learning. In International conference on learning representations."},{"key":"10.1016\/j.ipm.2026.105035_b31","doi-asserted-by":"crossref","unstructured":"Zhao, Y., Boney, R., Ilin, A., Kannala, J., & Pajarinen, J. (2022). Adaptive Behavior Cloning Regularization for Stable Offline-to-Online Reinforcement Learning. In European symposium on artificial neural networks, computational intelligence and machine learning.","DOI":"10.14428\/esann\/2022.ES2022-110"},{"key":"10.1016\/j.ipm.2026.105035_b32","doi-asserted-by":"crossref","unstructured":"Zhao, K., Hao, J., Ma, Y., Liu, J., Zheng, Y., & Meng, Z. (2024). ENOTO: Improving Offline-to-Online Reinforcement Learning with Q-Ensembles. In International joint conference on artificial intelligence (pp. 2609\u20132611).","DOI":"10.65109\/WLQJ9357"},{"issue":"3","key":"10.1016\/j.ipm.2026.105035_b33","doi-asserted-by":"crossref","DOI":"10.1016\/j.ipm.2024.104044","article-title":"Towards human-like questioning: Knowledge base question generation with bias-corrected reinforcement learning from human feedback","volume":"62","author":"Zhao","year":"2025","journal-title":"Information Processing & Management"},{"key":"10.1016\/j.ipm.2026.105035_b34","doi-asserted-by":"crossref","DOI":"10.1016\/j.neunet.2025.108120","article-title":"Offline-to-online reinforcement learning with efficient unconstrained fine-tuning","volume":"194","author":"Zheng","year":"2026","journal-title":"Neural Networks"},{"key":"10.1016\/j.ipm.2026.105035_b35","doi-asserted-by":"crossref","unstructured":"Zheng, H., Luo, X., Wei, P., Song, X., Li, D., & Jiang, J. (2023). Adaptive Policy Learning for Offline-to-Online Reinforcement Learning. In AAAI conference on artificial intelligence (pp. 11372\u201311380).","DOI":"10.1609\/aaai.v37i9.26345"},{"issue":"2","key":"10.1016\/j.ipm.2026.105035_b36","doi-asserted-by":"crossref","DOI":"10.1016\/j.ipm.2025.104452","article-title":"TATRC: triple actor-critic structure with regularization for better performance","volume":"63","author":"Zhong","year":"2026","journal-title":"Information Processing & Management"},{"key":"10.1016\/j.ipm.2026.105035_b37","unstructured":"Zhou, Z., Peng, A., Li, Q., Levine, S., & Kumar, A. (2025). Efficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline Data. In International conference on learning representations."},{"issue":"2","key":"10.1016\/j.ipm.2026.105035_b38","doi-asserted-by":"crossref","DOI":"10.1016\/j.ipm.2025.104428","article-title":"Influence of Gaussian distribution on performance metrics in continuous reinforcement learning","volume":"63","author":"Zhou","year":"2026","journal-title":"Information Processing & Management"}],"container-title":["Information Processing &amp; Management"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0306457326004267?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0306457326004267?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,7,8]],"date-time":"2026-07-08T19:43:26Z","timestamp":1783539806000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0306457326004267"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2027,1]]},"references-count":38,"journal-issue":{"issue":"1","published-print":{"date-parts":[[2027,1]]}},"alternative-id":["S0306457326004267"],"URL":"https:\/\/doi.org\/10.1016\/j.ipm.2026.105035","relation":{},"ISSN":["0306-4573"],"issn-type":[{"value":"0306-4573","type":"print"}],"subject":[],"published":{"date-parts":[[2027,1]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"Offline-to-online reinforcement learning with triple-intensity policy constraints","name":"articletitle","label":"Article Title"},{"value":"Information Processing & Management","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.ipm.2026.105035","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Elsevier Ltd. All rights are reserved, including those for text and data mining, AI training, and similar technologies.","name":"copyright","label":"Copyright"}],"article-number":"105035"}}