{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,11]],"date-time":"2026-04-11T13:06:31Z","timestamp":1775912791655,"version":"3.50.1"},"reference-count":77,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"2","license":[{"start":{"date-parts":[[2023,2,1]],"date-time":"2023-02-01T00:00:00Z","timestamp":1675209600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2023,2,1]],"date-time":"2023-02-01T00:00:00Z","timestamp":1675209600000},"content-version":"am","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2023,2,1]],"date-time":"2023-02-01T00:00:00Z","timestamp":1675209600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2023,2,1]],"date-time":"2023-02-01T00:00:00Z","timestamp":1675209600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/501100004543","name":"China Scholarship Council","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100004543","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100012166","name":"National Key Research and Development Program of China","doi-asserted-by":"publisher","award":["2018AAA0101400"],"award-info":[{"award-number":["2018AAA0101400"]}],"id":[{"id":"10.13039\/501100012166","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["61921004"],"award-info":[{"award-number":["61921004"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100004608","name":"Natural Science Foundation of Jiangsu Province of China","doi-asserted-by":"publisher","award":["BK20202006"],"award-info":[{"award-number":["BK20202006"]}],"id":[{"id":"10.13039\/501100004608","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100006831","name":"U.S. Air Force","doi-asserted-by":"publisher","award":["FA8650-17-C-7715"],"award-info":[{"award-number":["FA8650-17-C-7715"]}],"id":[{"id":"10.13039\/100006831","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100000002","name":"National Institutes of Health","doi-asserted-by":"publisher","award":["R01HL159805"],"award-info":[{"award-number":["R01HL159805"]}],"id":[{"id":"10.13039\/100000002","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100017567","name":"Apple","doi-asserted-by":"publisher","id":[{"id":"10.13039\/100017567","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Neural Netw. Learning Syst."],"published-print":{"date-parts":[[2023,2]]},"DOI":"10.1109\/tnnls.2021.3107375","type":"journal-article","created":{"date-parts":[[2021,9,20]],"date-time":"2021-09-20T20:12:11Z","timestamp":1632168731000},"page":"1035-1048","source":"Crossref","is-referenced-by-count":23,"title":["Model-Based Transfer Reinforcement Learning Based on Graphical Model Representations"],"prefix":"10.1109","volume":"34","author":[{"ORCID":"https:\/\/orcid.org\/0000-0001-7534-1297","authenticated-orcid":false,"given":"Yuewen","family":"Sun","sequence":"first","affiliation":[{"name":"School of Automation, Southeast University, Nanjing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Kun","family":"Zhang","sequence":"additional","affiliation":[{"name":"Department of Philosophy, Carnegie Mellon University, Pittsburgh, PA, USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-9269-334X","authenticated-orcid":false,"given":"Changyin","family":"Sun","sequence":"additional","affiliation":[{"name":"School of Automation, Southeast University, Nanjing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"issue":"1","key":"ref1","first-page":"1334","article-title":"End-to-end training of deep visuomotor policies","volume":"17","author":"Levine","year":"2016","journal-title":"J. Mach. Learn. Res."},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1177\/0278364913495721"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2019.2945019"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1126\/scirobotics.abb9764"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1038\/nature14236"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1038\/nature16961"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2019.2948892"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1145\/3178876.3185994"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1145\/3447556.3447565"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1145\/3005745.3005750"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2018.2790388"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2016.2522401"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2018.2885530"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00718"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/JIOT.2020.2988268"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1007\/s11432-019-2663-y"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2016.2586303"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v32i1.11694"},{"key":"ref19","article-title":"Reproducibility of benchmarked deep reinforcement learning tasks for continuous control","volume-title":"arXiv:1708.04133","author":"Islam","year":"2017"},{"key":"ref20","first-page":"465","article-title":"PILCO: A model-based and data-efficient approach to policy search","volume-title":"Proc. 28th Int. Conf. Mach. Learn. (ICML)","author":"Deisenroth"},{"key":"ref21","article-title":"Model-based reinforcement learning for atari","volume-title":"arXiv:1903.00374","author":"Kaiser","year":"2019"},{"key":"ref22","first-page":"8224","article-title":"Sample-efficient reinforcement learning with stochastic ensemble value expansion","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Buckman"},{"key":"ref23","first-page":"463","article-title":"Model-based reinforcement learning with value-targeted regression","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Ayoub"},{"key":"ref24","first-page":"4015","article-title":"On the importance of hyperparameter optimization for model-based reinforcement learning","volume-title":"Proc. Int. Conf. Artif. Intell. Statist.","author":"Zhang"},{"key":"ref25","article-title":"Data-efficient reinforcement learning in continuous-state POMDPs","volume-title":"arXiv:1602.02523","author":"McAllister","year":"2016"},{"key":"ref26","first-page":"34","article-title":"Improving PILCO with Bayesian neural network dynamics models","volume-title":"Proc. Data-Efficient Mach. Learn. Workshop (ICML)","volume":"4","author":"Gal"},{"key":"ref27","volume-title":"Efficient Reinforcement Learning Using Gaussian Processes","volume":"9","author":"Deisenroth","year":"2010"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2018.8463189"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2020.3008249"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1007\/s10846-020-01183-3"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1016\/j.neucom.2020.06.064"},{"key":"ref32","article-title":"Transfer learning in deep reinforcement learning: A survey","volume-title":"arXiv:2009.07888","author":"Zhu","year":"2020"},{"issue":"7","key":"ref33","first-page":"1","article-title":"Transfer learning for reinforcement learning domains: A survey","volume":"10","author":"Taylor","year":"2009","journal-title":"J. Mach. Learn. Res."},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-27645-3_5"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1109\/LRA.2021.3057050"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v34i02.5488"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1109\/TWC.2020.3044597"},{"key":"ref38","first-page":"9481","article-title":"Sequential transfer in reinforcement learning with a generative model","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Tirinzoni"},{"key":"ref39","article-title":"Actor-mimic: Deep multitask and transfer reinforcement learning","volume-title":"arXiv:1511.06342","author":"Parisotto","year":"2015"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2019.8793556"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1109\/COMSNETS.2017.7945411"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1109\/ITSC.2018.8569612"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2020.3028078"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1162\/asep_a_00779"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1109\/TNN.1998.712192"},{"key":"ref46","volume-title":"Handbook of Statistics","volume":"404","author":"Rao","year":"2006"},{"key":"ref47","article-title":"Continuous control with deep reinforcement learning","volume-title":"arXiv:1509.02971","author":"Lillicrap","year":"2015"},{"key":"ref48","first-page":"1928","article-title":"Asynchronous methods for deep reinforcement learning","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Mnih"},{"key":"ref49","article-title":"Proximal policy optimization algorithms","volume-title":"arXiv:1707.06347","author":"Schulman","year":"2017"},{"key":"ref50","first-page":"1889","article-title":"Trust region policy optimization","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Schulman"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1145\/122344.122377"},{"key":"ref52","volume-title":"Probabilistic Graphical Models: Principles and Techniques","author":"Koller","year":"2009"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v28i1.9074"},{"key":"ref54","article-title":"Domain adaptation as a problem of inference on graphical models","volume-title":"arXiv:2002.03278","author":"Zhang","year":"2020"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.3389\/fnhum.2017.00334"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1109\/TKDE.2009.191"},{"key":"ref57","volume-title":"A Comprehensive Hands-on Guide to Transfer Learning With Real-World Applications in Deep Learning","author":"Sarkar","year":"2018"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.1037\/0096-3445.137.1.97"},{"key":"ref59","article-title":"Learning invariant feature spaces to transfer skills with reinforcement learning","volume-title":"arXiv:1703.02949","author":"Gupta","year":"2017"},{"key":"ref60","article-title":"Deep domain confusion: Maximizing for domain invariance","volume-title":"arXiv:1412.3474","author":"Tzeng","year":"2014"},{"key":"ref61","first-page":"281","article-title":"Mutual alignment transfer learning","volume-title":"Proc. Conf. Robot Learn.","author":"Wulfmeier"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.1109\/IROS.2017.8202133"},{"key":"ref63","article-title":"Robust visual domain randomization for reinforcement learning","volume-title":"arXiv:1910.10537","author":"Bahi Slaoui","year":"2019"},{"key":"ref64","doi-asserted-by":"publisher","DOI":"10.15607\/rss.2020.xvi.064"},{"key":"ref65","article-title":"Unsupervised cross-domain image generation","volume-title":"arXiv:1611.02200","author":"Taigman","year":"2016"},{"key":"ref66","doi-asserted-by":"publisher","DOI":"10.7551\/mitpress\/1754.001.0001"},{"key":"ref67","doi-asserted-by":"publisher","DOI":"10.24963\/ijcai.2017\/187"},{"key":"ref68","doi-asserted-by":"publisher","DOI":"10.1109\/ICDM.2017.114"},{"key":"ref69","doi-asserted-by":"publisher","DOI":"10.1016\/0893-6080(91)90009-T"},{"key":"ref70","article-title":"Playing atari with deep reinforcement learning","volume-title":"arXiv:1312.5602","author":"Mnih","year":"2013"},{"key":"ref71","article-title":"OpenAI gym","volume-title":"arXiv:1606.01540","author":"Brockman","year":"2016"},{"key":"ref72","doi-asserted-by":"publisher","DOI":"10.1109\/TSMC.2018.2884725"},{"key":"ref73","doi-asserted-by":"publisher","DOI":"10.1088\/1751-8113\/40\/3\/F01"},{"key":"ref74","article-title":"Efficient memory-based learning for robot control","author":"Moore","year":"1990"},{"key":"ref75","doi-asserted-by":"publisher","DOI":"10.1109\/TSMC.1983.6313077"},{"key":"ref76","article-title":"Correct equations for the dynamics of the cart-pole system","author":"Florian","year":"2007"},{"key":"ref77","doi-asserted-by":"publisher","DOI":"10.1109\/LRA.2017.2720851"}],"container-title":["IEEE Transactions on Neural Networks and Learning Systems"],"original-title":[],"link":[{"URL":"https:\/\/ieeexplore.ieee.org\/ielam\/5962385\/10036162\/9540989-aam.pdf","content-type":"application\/pdf","content-version":"am","intended-application":"syndication"},{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/5962385\/10036162\/09540989.pdf?arnumber=9540989","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,1,11]],"date-time":"2024-01-11T22:23:48Z","timestamp":1705011828000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/9540989\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023,2]]},"references-count":77,"journal-issue":{"issue":"2"},"URL":"https:\/\/doi.org\/10.1109\/tnnls.2021.3107375","relation":{},"ISSN":["2162-237X","2162-2388"],"issn-type":[{"value":"2162-237X","type":"print"},{"value":"2162-2388","type":"electronic"}],"subject":[],"published":{"date-parts":[[2023,2]]}}}