{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,18]],"date-time":"2026-07-18T18:37:43Z","timestamp":1784399863286,"version":"3.55.0"},"reference-count":184,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"11","license":[{"start":{"date-parts":[[2023,11,1]],"date-time":"2023-11-01T00:00:00Z","timestamp":1698796800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2023,11,1]],"date-time":"2023-11-01T00:00:00Z","timestamp":1698796800000},"content-version":"am","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2023,11,1]],"date-time":"2023-11-01T00:00:00Z","timestamp":1698796800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2023,11,1]],"date-time":"2023-11-01T00:00:00Z","timestamp":1698796800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Pattern Anal. Mach. Intell."],"published-print":{"date-parts":[[2023,11,1]]},"DOI":"10.1109\/tpami.2023.3292075","type":"journal-article","created":{"date-parts":[[2023,7,4]],"date-time":"2023-07-04T17:31:42Z","timestamp":1688491902000},"page":"13344-13362","source":"Crossref","is-referenced-by-count":657,"title":["Transfer Learning in Deep Reinforcement Learning: A Survey"],"prefix":"10.1109","volume":"45","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-7418-731X","authenticated-orcid":false,"given":"Zhuangdi","family":"Zhu","sequence":"first","affiliation":[{"name":"Department of Computer Science and Engineering, Michigan State University, East Lansing, MI, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-8626-8934","authenticated-orcid":false,"given":"Kaixiang","family":"Lin","sequence":"additional","affiliation":[{"name":"Department of Computer Science and Engineering, Michigan State University, East Lansing, MI, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-6369-6995","authenticated-orcid":false,"given":"Anil K.","family":"Jain","sequence":"additional","affiliation":[{"name":"Department of Computer Science and Engineering, Michigan State University, East Lansing, MI, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-4336-6777","authenticated-orcid":false,"given":"Jiayu","family":"Zhou","sequence":"additional","affiliation":[{"name":"Department of Computer Science and Engineering, Michigan State University, East Lansing, MI, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref57","article-title":"Generalizing goal-conditioned reinforcement learning with variational causal reasoning","author":"ding","year":"2022"},{"key":"ref56","first-page":"10 104","article-title":"Improving policy optimization with generalist-specialist learning","author":"jia","year":"2022","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref59","first-page":"2859","article-title":"Learning from limited demonstrations","author":"kim","year":"2013","journal-title":"Proc Int Conf Neural Inf Process"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.1613\/jair.1.14174"},{"key":"ref53","first-page":"166","article-title":"Modular multitask reinforcement learning with policy sketches","author":"andreas","year":"2017","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2017.7989250"},{"key":"ref55","first-page":"5149","article-title":"Meta-learning in neural networks: A survey","volume":"44","author":"hospedales","year":"2022","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"ref168","doi-asserted-by":"publisher","DOI":"10.1126\/sciadv.aap7885"},{"key":"ref54","first-page":"4767","article-title":"Multi-task reinforcement learning with soft modularization","author":"yang","year":"2020","journal-title":"Proc Int Conf Neural Inf Process"},{"key":"ref169","doi-asserted-by":"publisher","DOI":"10.1109\/ICMLA.2005.40"},{"key":"ref170","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v31i1.11065"},{"key":"ref177","first-page":"936","article-title":"Enhancing Q-learning for optimal asset allocation","author":"neuneier","year":"1998","journal-title":"Proc Int Conf Neural Inf Process"},{"key":"ref178","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2016.2522401"},{"key":"ref51","article-title":"Actor-mimic: Deep multitask and transfer reinforcement learning","author":"parisotto","year":"2016","journal-title":"Proc Int Conf Learn Representations"},{"key":"ref175","doi-asserted-by":"publisher","DOI":"10.1002\/(SICI)1099-131X(1998090)17:5\/6<441::AID-FOR707>3.0.CO;2-#"},{"key":"ref50","first-page":"4499","article-title":"Distral: Robust multitask reinforcement learning","author":"teh","year":"2017","journal-title":"Proc Int Conf Neural Inf Process"},{"key":"ref176","doi-asserted-by":"publisher","DOI":"10.1109\/IntelliSys.2017.8324237"},{"key":"ref173","doi-asserted-by":"publisher","DOI":"10.1145\/3219819.3219993"},{"key":"ref174","doi-asserted-by":"publisher","DOI":"10.1145\/3068287"},{"key":"ref171","doi-asserted-by":"publisher","DOI":"10.1007\/s40708-016-0042-6"},{"key":"ref172","doi-asserted-by":"crossref","first-page":"247","DOI":"10.1109\/JAS.2016.7508798","article-title":"Traffic signal timing via deep reinforcement learning","volume":"3","author":"li","year":"2016","journal-title":"IEEE\/CAA Journal of Automatica Sinica"},{"key":"ref46","first-page":"1043","article-title":"Reinforcement learning with hierarchies of machines","author":"parr","year":"1998","journal-title":"Proc Int Conf Neural Inf Process"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1016\/S0004-3702(99)00052-1"},{"key":"ref48","first-page":"599","article-title":"Bayesian multi-task reinforcement learning","author":"lazaric","year":"2010","journal-title":"Proc 27th Int Conf Mach Learn"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.1613\/jair.639"},{"key":"ref42","article-title":"Improving PILCO with Bayesian neural network dynamics models","author":"gal","year":"2016","journal-title":"Proc Data-Efficient Mach Learn Workshop"},{"key":"ref41","first-page":"465","article-title":"PILCO: A model-based and data-efficient approach to policy search","author":"deisenroth","year":"2011","journal-title":"Proc 28th Int Conf Mach Learn"},{"key":"ref44","first-page":"271","article-title":"Feudal reinforcement learning","author":"dayan","year":"1993","journal-title":"Proc Int Conf Neural Inf Process"},{"key":"ref179","first-page":"2197","article-title":"Hierarchical decision making in electricity grid management","author":"dalal","year":"2016","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2009.5206594"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1109\/TKDE.2021.3070203"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/TITS.2013.2255286"},{"key":"ref180","doi-asserted-by":"publisher","DOI":"10.1109\/TSG.2016.2517211"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1016\/j.ifacol.2017.08.1217"},{"key":"ref181","doi-asserted-by":"publisher","DOI":"10.1109\/TSG.2015.2396993"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1145\/3219819.3220096"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1177\/0278364917710318"},{"key":"ref3","first-page":"1334","article-title":"End-to-end training of deep visuomotor policies","volume":"17","author":"levine","year":"2016","journal-title":"J Mach Learn Res"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1137\/1.9781611974188"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1613\/jair.3912"},{"key":"ref100","first-page":"627","article-title":"A reduction of imitation learning and structured prediction to no-regret online learning","author":"ross","year":"2011","journal-title":"Proc Int Conf Artif Intell Statist"},{"key":"ref101","article-title":"Reinforcement learning from imperfect demonstrations","author":"gao","year":"2018"},{"key":"ref40","first-page":"277","article-title":"Model-predictive control via cross-entropy and gradient-based optimization","author":"bharadhwaj","year":"2020","journal-title":"Proc Learn Dyn Control"},{"key":"ref184","first-page":"3512","article-title":"RETAIN: An interpretable predictive model for healthcare using reverse time attention mechanism","author":"choi","year":"2016","journal-title":"Proc Int Conf Neural Inf Process"},{"key":"ref182","first-page":"3815","article-title":"InfoGAIL: Interpretable imitation learning from visual demonstrations","author":"li","year":"2017","journal-title":"Proc Int Conf Neural Inf Process"},{"key":"ref183","article-title":"Towards interpretable explanations for transfer learning in sequential tasks","author":"ramakrishnan","year":"2016","journal-title":"Proc AAAI Spring Symp Ser"},{"key":"ref35","doi-asserted-by":"crossref","first-page":"35","DOI":"10.1016\/B978-0-444-53859-8.00003-5","article-title":"The cross-entropy method for optimization","volume":"31","author":"botev","year":"2013","journal-title":"Handbook of Statistics"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2018.8463189"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1016\/B978-1-55860-141-3.50030-4"},{"key":"ref36","first-page":"4759","article-title":"Deep reinforcement learning in a handful of trials using probabilistic dynamics models","author":"chua","year":"2018","journal-title":"Proc Int Conf Neural Inf Process"},{"key":"ref31","first-page":"387","article-title":"Deterministic policy gradient algorithms","author":"silver","year":"2014","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref148","article-title":"Playing Atari with deep reinforcement learning","author":"mnih","year":"2013"},{"key":"ref30","article-title":"Proximal policy optimization algorithms","author":"schulman","year":"2017"},{"key":"ref149","doi-asserted-by":"publisher","DOI":"10.1145\/3166054.3166058"},{"key":"ref33","article-title":"Addressing function approximation error in actor-critic methods","author":"fujimoto","year":"2018"},{"key":"ref146","article-title":"Control of memory, active perception, and action in Minecraft","author":"oh","year":"2016"},{"key":"ref32","article-title":"Continuous control with deep reinforcement learning","author":"lillicrap","year":"2015"},{"key":"ref147","doi-asserted-by":"publisher","DOI":"10.1109\/TG.2019.2896986"},{"key":"ref39","first-page":"1","article-title":"Guided policy search","author":"levine","year":"2013","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref38","article-title":"Model-based value estimation for efficient model-free reinforcement learning","author":"feinberg","year":"2018"},{"key":"ref155","article-title":"An actor-critic algorithm for sequence prediction","author":"bahdanau","year":"2016"},{"key":"ref156","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/N19-2016"},{"key":"ref153","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.128"},{"key":"ref154","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/N16-1181"},{"key":"ref151","article-title":"Neural architecture search with reinforcement learning","author":"zoph","year":"2016"},{"key":"ref152","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.93"},{"key":"ref150","first-page":"956","article-title":"Reinforcement learning for spoken dialogue systems","author":"singh","year":"2000","journal-title":"Proc Int Conf Neural Inf Process"},{"key":"ref24","first-page":"1861","article-title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","author":"haarnoja","year":"2018","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref23","first-page":"1928","article-title":"Asynchronous methods for deep reinforcement learning","author":"mnih","year":"2016","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref26","doi-asserted-by":"crossref","first-page":"529","DOI":"10.1038\/nature14236","article-title":"Human-level control through deep reinforcement learning","volume":"518","author":"mnih","year":"2015","journal-title":"Nature"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1007\/BF00992698"},{"key":"ref20","author":"rummery","year":"1994","journal-title":"On-line Q-learning using connectionist systems"},{"key":"ref159","article-title":"GPT-4 technical report","year":"2023"},{"key":"ref22","first-page":"1008","article-title":"Actor-critic algorithms","author":"konda","year":"2000","journal-title":"Proc Int Conf Neural Inf Process"},{"key":"ref157","first-page":"2058","article-title":"Learning to search better than your teacher","author":"chang","year":"2015","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/ADPRL.2009.4927542"},{"key":"ref158","first-page":"313","article-title":"Best of both worlds: Transferring knowledge from discriminative learning to a generative visual dialog model","author":"lu","year":"2017","journal-title":"Proc Int Conf Neural Inf Process"},{"key":"ref28","doi-asserted-by":"crossref","first-page":"229","DOI":"10.1007\/BF00992696","article-title":"Simple statistical gradient-following algorithms for connectionist reinforcement learning","volume":"8","author":"williams","year":"1992","journal-title":"Mach Learn"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v32i1.11796"},{"key":"ref29","first-page":"1889","article-title":"Trust region policy optimization","author":"schulman","year":"2015","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref166","article-title":"Reinforcement learning for primary care e appointment scheduling","author":"gomes","year":"2017"},{"key":"ref167","doi-asserted-by":"publisher","DOI":"10.1145\/3229710.3229731"},{"key":"ref164","doi-asserted-by":"publisher","DOI":"10.1016\/j.media.2019.02.007"},{"key":"ref165","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-66182-7_28"},{"key":"ref162","article-title":"LaMDA: Language models for dialog applications","author":"thoppilan","year":"2022"},{"key":"ref163","article-title":"Reinforcement learning in healthcare: A survey","author":"yu","year":"2019"},{"key":"ref160","article-title":"Improving alignment of dialogue agents via targeted human judgements","author":"glaese","year":"2022"},{"key":"ref161","article-title":"PaLM: Scaling language modeling with pathways","author":"chowdhery","year":"2022"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1512\/iumj.1957.6.56038"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-27645-3_5"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.24963\/ijcai.2022\/770"},{"key":"ref128","doi-asserted-by":"publisher","DOI":"10.1109\/IROS.2017.8206049"},{"key":"ref14","first-page":"449","article-title":"A distributional perspective on reinforcement learning","author":"bellemare","year":"2017","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref129","doi-asserted-by":"publisher","DOI":"10.1007\/s10994-008-5061-y"},{"key":"ref97","first-page":"2469","article-title":"Policy optimization with demonstrations","author":"kang","year":"2018","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref126","doi-asserted-by":"publisher","DOI":"10.1162\/neco.1993.5.4.613"},{"key":"ref96","first-page":"3352","article-title":"Reinforcement learning from demonstration through shaping","author":"brys","year":"2015","journal-title":"Proc Int Joint Conf Artif Intell"},{"key":"ref127","article-title":"Deep successor reinforcement learning","author":"kulkarni","year":"2016"},{"key":"ref11","first-page":"1633","article-title":"Transfer learning for reinforcement learning domains: A survey","volume":"10","author":"taylor","year":"2009","journal-title":"J Mach Learn Res"},{"key":"ref99","article-title":"Prioritized experience replay","author":"schaul","year":"2016","journal-title":"Proc Int Conf Learn Representations"},{"key":"ref124","first-page":"126","article-title":"The microbial genetic algorithm","author":"harvey","year":"2009","journal-title":"Proc Eur Conf Artif Life"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/TKDE.2009.191"},{"key":"ref98","doi-asserted-by":"publisher","DOI":"10.1007\/s11768-011-1005-3"},{"key":"ref125","article-title":"Decoupling dynamics and reward for transfer learning","author":"zhang","year":"2018"},{"key":"ref17","first-page":"18 226","article-title":"Reinforcement learning in factored MDPs: Oracle-efficient algorithms and tighter regret bounds for the non-episodic setting","author":"xu","year":"2020","journal-title":"Proc Int Conf Neural Inf Process"},{"key":"ref16","first-page":"1515","article-title":"Automatic goal generation for reinforcement learning agents","author":"florensa","year":"2018","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref19","article-title":"Discriminator-actor-critic: Addressing sample inefficiency and reward bias in adversarial imitation learning","author":"kostrikov","year":"2018"},{"key":"ref18","first-page":"24 611","article-title":"The surprising effectiveness of PPO in cooperative multi-agent games","author":"yu","year":"2022","journal-title":"Proc Int Conf Neural Inf Process"},{"key":"ref93","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2018.8463162"},{"key":"ref133","first-page":"1126","article-title":"Model-agnostic meta-learning for fast adaptation of deep networks","author":"finn","year":"2017","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref92","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v32i1.11757"},{"key":"ref134","doi-asserted-by":"publisher","DOI":"10.1145\/1015330.1015425"},{"key":"ref95","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-662-44851-9_35"},{"key":"ref131","article-title":"Advantages and limitations of using successor features for transfer in reinforcement learning","author":"lehnert","year":"2017"},{"key":"ref94","first-page":"3380","article-title":"Direct policy iteration with demonstrations","author":"chemali","year":"2015","journal-title":"Proc Int Joint Conf Artif Intell"},{"key":"ref132","article-title":"Disentangled skill embeddings for reinforcement learning","author":"petangoda","year":"2019"},{"key":"ref130","article-title":"Universal successor features approximators","author":"borsa","year":"2019","journal-title":"Proc Int Conf Learn Representations"},{"key":"ref91","first-page":"1040","article-title":"Learning from demonstration","author":"schaal","year":"1997","journal-title":"Proc Int Conf Neural Inf Process"},{"key":"ref90","doi-asserted-by":"publisher","DOI":"10.1038\/nature16961"},{"key":"ref89","article-title":"Pretraining deep actor-critic reinforcement learning algorithms with expert demonstrations","author":"zhang","year":"2018"},{"key":"ref139","article-title":"CAD2RL: Real single-image flight without a single real image","author":"sadeghi","year":"2016"},{"key":"ref86","first-page":"5286","article-title":"Domain adaptive imitation learning","author":"kim","year":"2020","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref137","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2017.7989385"},{"key":"ref85","article-title":"State alignment-based imitation learning","author":"liu","year":"2019"},{"key":"ref138","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2017.XIII.048"},{"key":"ref88","article-title":"Representation matters: Offline pretraining for sequential decision making","author":"yang","year":"2021"},{"key":"ref135","doi-asserted-by":"publisher","DOI":"10.1016\/j.robot.2008.10.024"},{"key":"ref87","first-page":"2956","article-title":"Imitation-regularized offline learning","author":"ma","year":"2019","journal-title":"Proc Int Conf Artif Intell Statist"},{"key":"ref136","doi-asserted-by":"publisher","DOI":"10.1109\/TASE.2014.2376492"},{"key":"ref82","first-page":"165","article-title":"Potential-based difference rewards for multiagent reinforcement learning","author":"devlin","year":"2014","journal-title":"Proc Int Conf Anal Appl Math"},{"key":"ref144","doi-asserted-by":"crossref","first-page":"354","DOI":"10.1038\/nature24270","article-title":"Mastering the game of Go without human knowledge","volume":"550","author":"silver","year":"2017","journal-title":"Nature"},{"key":"ref81","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/D18-1362"},{"key":"ref145","year":"2019"},{"key":"ref84","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v32i1.11741"},{"key":"ref142","first-page":"1480","article-title":"DARLA: Improving zero-shot transfer in reinforcement learning","author":"higgins","year":"2017","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref83","article-title":"Learning shaping rewards in model-based reinforcement learning","author":"grzes","year":"2009","journal-title":"Proc AAMAS Workshop Adaptive Learn Agents"},{"key":"ref143","doi-asserted-by":"publisher","DOI":"10.1177\/0278364913495721"},{"key":"ref140","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2018.8460875"},{"key":"ref141","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2019.8794310"},{"key":"ref80","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/W15-4655"},{"key":"ref79","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-16952-6_49"},{"key":"ref108","article-title":"Equivalence between policy gradients and soft Q-learning","author":"schulman","year":"2017"},{"key":"ref78","article-title":"Leveraging demonstrations for deep reinforcement learning on robotics problems with sparse rewards","author":"ve?er\u00edk","year":"2017"},{"key":"ref109","first-page":"720","article-title":"Probabilistic policy reuse in a reinforcement learning agent","author":"fern\u00e1ndez","year":"2006","journal-title":"Proc Int Joint Conf Autonomous Agents and Multiagent Systems"},{"key":"ref106","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v31i1.10733"},{"key":"ref107","article-title":"Kickstarting deep reinforcement learning","author":"schmitt","year":"2018"},{"key":"ref75","first-page":"433","article-title":"Dynamic potential-based reward shaping","author":"devlin","year":"2012","journal-title":"Proc 1st Int Conf Autonomous Agents Multiagent Syst"},{"key":"ref104","article-title":"Distilling the knowledge in a neural network","author":"hinton","year":"2014","journal-title":"Proc Deep Learn Representation Learn Workshop"},{"key":"ref74","first-page":"792","article-title":"Principled methods for advising reinforcement learning agents","author":"wiewiora","year":"2003","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref105","article-title":"Policy distillation","author":"rusu","year":"2015"},{"key":"ref77","first-page":"181","article-title":"Policy transfer using reward shaping","author":"brys","year":"2015","journal-title":"Proc Int Conf Anal Appl Math"},{"key":"ref102","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v34i04.5953"},{"key":"ref76","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v29i1.9628"},{"key":"ref103","article-title":"Disagreement-regularized imitation learning","author":"brantley","year":"2019","journal-title":"Proc Int Conf Learn Representations"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/MSP.2017.2743240"},{"key":"ref1","author":"sutton","year":"2018","journal-title":"Reinforcement Learning An Introduction"},{"key":"ref71","doi-asserted-by":"publisher","DOI":"10.1109\/CoG52621.2021.9619000"},{"key":"ref111","doi-asserted-by":"publisher","DOI":"10.1126\/science.153.3731.34"},{"key":"ref70","doi-asserted-by":"publisher","DOI":"10.1109\/SSCI47803.2020.9308468"},{"key":"ref112","doi-asserted-by":"publisher","DOI":"10.1007\/11564096_40"},{"key":"ref73","article-title":"Tight performance bounds on greedy policies based on imperfect value functions","author":"williams","year":"1993"},{"key":"ref72","article-title":"A survey of multi-task deep reinforcement learning","volume":"9","author":"varghese","year":"2020","journal-title":"Electronics"},{"key":"ref110","first-page":"4058","article-title":"Successor features for transfer in reinforcement learning","author":"barreto","year":"2017","journal-title":"Proc Int Conf Neural Inf Process"},{"key":"ref68","first-page":"12402","article-title":"Off-policy imitation learning from observations","author":"zhu","year":"2020","journal-title":"Proc Int Conf Neural Inf Process"},{"key":"ref119","first-page":"2504","article-title":"Unsupervised cross-domain transfer in policy gradient reinforcement learning via manifold alignment","author":"ammar","year":"2015","journal-title":"Proc Conf Assoc Advance Artif Intell"},{"key":"ref67","first-page":"501","article-title":"Transfer in deep reinforcement learning using successor features and generalised policy improvement","author":"barreto","year":"2018","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref117","article-title":"Manifold alignment without correspondence","author":"wang","year":"2009","journal-title":"Proc Int Joint Conf on Artif Intell"},{"key":"ref69","first-page":"4572","article-title":"Generative adversarial imitation learning","author":"ho","year":"2016","journal-title":"Proc Int Conf Neural Inf Process"},{"key":"ref118","doi-asserted-by":"publisher","DOI":"10.1109\/IJCNN.2013.6706721"},{"key":"ref64","first-page":"1312","article-title":"Universal value function approximators","author":"schaul","year":"2015","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref115","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-28499-1_2"},{"key":"ref63","article-title":"Learning sparse rewarded tasks from sub-optimal demonstrations","author":"zhu","year":"2020"},{"key":"ref116","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2016.2644615"},{"key":"ref66","first-page":"2125","article-title":"Transfer learning via inter-task mappings for temporal difference learning","volume":"8","author":"taylor","year":"2007","journal-title":"J Mach Learn Res"},{"key":"ref113","article-title":"Learning invariant feature spaces to transfer skills with reinforcement learning","author":"gupta","year":"2017","journal-title":"Proc Int Conf Learn Representations"},{"key":"ref65","article-title":"Meta-learning: From few-shot learning to rapid reinforcement learning","author":"finn","year":"2019","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref114","doi-asserted-by":"publisher","DOI":"10.1145\/1143844.1143906"},{"key":"ref60","first-page":"1331","article-title":"Distilling policy distillation","author":"czarnecki","year":"2019","journal-title":"Proc 22nd Int Conf Artif Intell Statist"},{"key":"ref122","article-title":"Progressive neural networks","author":"rusu","year":"2016"},{"key":"ref123","article-title":"Pathnet: Evolution channels gradient descent in super neural networks","author":"fernando","year":"2017"},{"key":"ref62","first-page":"2672","article-title":"Generative adversarial nets","author":"goodfellow","year":"2014","journal-title":"Proc Int Conf Neural Inf Process"},{"key":"ref120","first-page":"383","article-title":"Reinforcement learning transfer via sparse coding","author":"ammar","year":"2012","journal-title":"Proc Int Conf Anal Appl Math"},{"key":"ref61","first-page":"278","article-title":"Policy invariance under reward transformations: Theory and application to reward shaping","author":"ng","year":"1999","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref121","doi-asserted-by":"publisher","DOI":"10.1145\/1390156.1390225"}],"container-title":["IEEE Transactions on Pattern Analysis and Machine Intelligence"],"original-title":[],"link":[{"URL":"https:\/\/ieeexplore.ieee.org\/ielam\/34\/10269680\/10172347-aam.pdf","content-type":"application\/pdf","content-version":"am","intended-application":"syndication"},{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/34\/10269680\/10172347.pdf?arnumber=10172347","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,10,4]],"date-time":"2023-10-04T17:39:23Z","timestamp":1696441163000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/10172347\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023,11,1]]},"references-count":184,"journal-issue":{"issue":"11"},"URL":"https:\/\/doi.org\/10.1109\/tpami.2023.3292075","relation":{},"ISSN":["0162-8828","2160-9292","1939-3539"],"issn-type":[{"value":"0162-8828","type":"print"},{"value":"2160-9292","type":"electronic"},{"value":"1939-3539","type":"electronic"}],"subject":[],"published":{"date-parts":[[2023,11,1]]}}}