{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,10]],"date-time":"2026-07-10T16:22:02Z","timestamp":1783700522984,"version":"3.55.0"},"reference-count":47,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"3","license":[{"start":{"date-parts":[[2024,3,1]],"date-time":"2024-03-01T00:00:00Z","timestamp":1709251200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2024,3,1]],"date-time":"2024-03-01T00:00:00Z","timestamp":1709251200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2024,3,1]],"date-time":"2024-03-01T00:00:00Z","timestamp":1709251200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["61976102"],"award-info":[{"award-number":["61976102"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["U19A2065"],"award-info":[{"award-number":["U19A2065"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"name":"International Cooperation Project of Jilin Province","award":["20220402009GH"],"award-info":[{"award-number":["20220402009GH"]}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Knowl. Data Eng."],"published-print":{"date-parts":[[2024,3]]},"DOI":"10.1109\/tkde.2023.3302804","type":"journal-article","created":{"date-parts":[[2023,8,7]],"date-time":"2023-08-07T18:25:37Z","timestamp":1691432737000},"page":"1299-1310","source":"Crossref","is-referenced-by-count":28,"title":["Sample Efficient Offline-to-Online Reinforcement Learning"],"prefix":"10.1109","volume":"36","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-9304-5405","authenticated-orcid":false,"given":"Siyuan","family":"Guo","sequence":"first","affiliation":[{"name":"School of Artificial Intelligence, Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, Jilin University, Changchun, Jilin, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-6755-871X","authenticated-orcid":false,"given":"Lixin","family":"Zou","sequence":"additional","affiliation":[{"name":"School of Cyber Science and Engineering, Wuhan University, Wuhan, Hubei, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-7835-9556","authenticated-orcid":false,"given":"Hechang","family":"Chen","sequence":"additional","affiliation":[{"name":"School of Artificial Intelligence, Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, Jilin University, Changchun, Jilin, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3192-8736","authenticated-orcid":false,"given":"Bohao","family":"Qu","sequence":"additional","affiliation":[{"name":"School of Artificial Intelligence, Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, Jilin University, Changchun, Jilin, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0006-3286-7444","authenticated-orcid":false,"given":"Haotian","family":"Chi","sequence":"additional","affiliation":[{"name":"School of Artificial Intelligence, Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, Jilin University, Changchun, Jilin, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-3491-5968","authenticated-orcid":false,"given":"Philip S.","family":"Yu","sequence":"additional","affiliation":[{"name":"Department of Computer Science, University of Illinois at Chicago, Chicago, IL, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-2697-8093","authenticated-orcid":false,"given":"Yi","family":"Chang","sequence":"additional","affiliation":[{"name":"School of Artificial Intelligence, Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, Jilin University, Changchun, Jilin, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","first-page":"907","article-title":"S4RL: Surprisingly simple self-supervision for offline reinforcement learning in robotics","volume-title":"Proc. Conf. Robot Learn.","author":"Sinha"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v35i5.16579"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1145\/3594871"},{"key":"ref4","first-page":"2","article-title":"Model selection for offline reinforcement learning: Practical considerations for healthcare settings","volume-title":"Proc. Mach. Learn. Healthcare Conf.","author":"Tang"},{"key":"ref5","first-page":"119","article-title":"Semi-Markov offline reinforcement learning for healthcare","volume-title":"Proc. Conf. Health Inference Learn.","author":"Fatemi"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2010.11929"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01553"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/n19-1423"},{"key":"ref9","article-title":"ERNIE 3.0: Large-scale knowledge enhanced pre-training for language understanding and generation","author":"Sun","year":"2021"},{"key":"ref10","article-title":"MOORe: Model-based offline-to-online reinforcement learning","author":"Mao","year":"2022"},{"key":"ref11","first-page":"1702","article-title":"Offline-to-online reinforcement learning via balanced replay and pessimistic Q-ensemble","volume-title":"Proc. Conf. Robot Learn.","author":"Lee"},{"key":"ref12","article-title":"AWAC: Accelerating online reinforcement learning with offline datasets","author":"Nair","year":"2020"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.14428\/esann\/2022.ES2022-110"},{"key":"ref14","first-page":"1179","article-title":"Conservative Q-learning for offline reinforcement learning","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Kumar"},{"key":"ref15","first-page":"20132","article-title":"A minimalist approach to offline reinforcement learning","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Fujimoto"},{"key":"ref16","first-page":"2750","article-title":"# Exploration: A study of count-based exploration for deep reinforcement learning","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Tang"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1016\/0196-8858(85)90002-8"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1023\/A:1017984413808"},{"key":"ref19","first-page":"213","article-title":"R-max-A general polynomial time algorithm for near-optimal reinforcement learning","volume":"3","author":"Brafman","year":"2002","journal-title":"J. Mach. Learn. Res."},{"key":"ref20","first-page":"1787","article-title":"Better exploration with optimistic actor critic","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Ciosek"},{"key":"ref21","first-page":"1126","article-title":"Model-agnostic meta-learning for fast adaptation of deep networks","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Finn"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v32i1.11596"},{"key":"ref23","article-title":"D4RL: Datasets for deep data-driven reinforcement learning","author":"Fu","year":"2020"},{"issue":"1","key":"ref24","first-page":"103","article-title":"Reinforcement learning: An introduction","volume":"21","author":"Thrun","year":"2000","journal-title":"AI Mag."},{"key":"ref25","first-page":"1587","article-title":"Addressing function approximation error in actor-critic methods","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Fujimoto"},{"key":"ref26","first-page":"2052","article-title":"Off-policy deep reinforcement learning without exploration","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Fujimoto"},{"key":"ref27","first-page":"11784","article-title":"Stabilizing off-policy Q-learning via Bootstrapping error reduction","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Kumar"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1109\/tnnls.2023.3250269"},{"key":"ref29","article-title":"Trust region optimization of optimistic actor critic","author":"Kappes","year":"2022"},{"key":"ref30","first-page":"1861","article-title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Haarnoja"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1214\/aoms\/1177729586"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/IROS.2012.6386109"},{"key":"ref33","first-page":"8026","article-title":"PyTorch: An imperative style, high-performance deep learning library","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Paszke"},{"key":"ref34","article-title":"OpenAI Gym","author":"Brockman","year":"2016"},{"key":"ref35","first-page":"17662","article-title":"Online meta-critic learning for off-policy actor-critic methods","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Zhou"},{"key":"ref36","article-title":"Continuous control with deep reinforcement learning","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Lillicrap"},{"key":"ref37","article-title":"Mildly conservative Q-learning for offline reinforcement learning","author":"Lyu","year":"2022"},{"key":"ref38","first-page":"158","article-title":"Implicit behavioral cloning","volume-title":"Proc. Conf. Robot Learn.","author":"Florence"},{"key":"ref39","article-title":"Know your boundaries: The necessity of explicit behavioral cloning in offline RL","author":"Goo","year":"2022"},{"key":"ref40","article-title":"Offline reinforcement learning with implicit Q-learning","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Kostrikov"},{"key":"ref41","first-page":"27042","article-title":"Online decision transformer","volume-title":"Proc. 39th Int. Conf. Mach. Learn.","author":"Zheng"},{"key":"ref42","article-title":"Training agents using upside-down reinforcement learning","author":"Srivastava","year":"2019"},{"key":"ref43","doi-asserted-by":"crossref","DOI":"10.59350\/dht9d-ckm41","article-title":"Optimism in the face of uncertainty: The UCB1 algorithm","author":"Kun","year":"2013"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v37i6.25864"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2021.3079209"},{"key":"ref46","first-page":"5307","article-title":"Meta-reinforcement learning of structured exploration strategies","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Gupta"},{"key":"ref47","article-title":"Meta-SAC: Auto-tune the entropy temperature of soft actor-critic via metagradient","author":"Wang","year":"2020"}],"container-title":["IEEE Transactions on Knowledge and Data Engineering"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/69\/10422839\/10210487.pdf?arnumber=10210487","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,10,25]],"date-time":"2024-10-25T20:55:22Z","timestamp":1729889722000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/10210487\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,3]]},"references-count":47,"journal-issue":{"issue":"3"},"URL":"https:\/\/doi.org\/10.1109\/tkde.2023.3302804","relation":{},"ISSN":["1041-4347","1558-2191","2326-3865"],"issn-type":[{"value":"1041-4347","type":"print"},{"value":"1558-2191","type":"electronic"},{"value":"2326-3865","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024,3]]}}}