{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,2,14]],"date-time":"2026-02-14T06:29:39Z","timestamp":1771050579337,"version":"3.50.1"},"reference-count":54,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"8","license":[{"start":{"date-parts":[[2023,8,1]],"date-time":"2023-08-01T00:00:00Z","timestamp":1690848000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2023,8,1]],"date-time":"2023-08-01T00:00:00Z","timestamp":1690848000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2023,8,1]],"date-time":"2023-08-01T00:00:00Z","timestamp":1690848000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["51935005"],"award-info":[{"award-number":["51935005"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"name":"Fundamental Research Program","award":["JCKY20200603C010"],"award-info":[{"award-number":["JCKY20200603C010"]}]},{"name":"Science and Technology on Space Intelligent Laboratory","award":["ZDSYS-2018-02"],"award-info":[{"award-number":["ZDSYS-2018-02"]}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Neural Netw. Learning Syst."],"published-print":{"date-parts":[[2023,8]]},"DOI":"10.1109\/tnnls.2021.3129160","type":"journal-article","created":{"date-parts":[[2021,12,1]],"date-time":"2021-12-01T15:31:14Z","timestamp":1638372674000},"page":"4776-4790","source":"Crossref","is-referenced-by-count":14,"title":["Variational Dynamic for Self-Supervised Exploration in Deep Reinforcement Learning"],"prefix":"10.1109","volume":"34","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-8379-9385","authenticated-orcid":false,"given":"Chenjia","family":"Bai","sequence":"first","affiliation":[{"name":"Department of Computer Science and Technology, Harbin Institute of Technology, Harbin, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-6568-1335","authenticated-orcid":false,"given":"Peng","family":"Liu","sequence":"additional","affiliation":[{"name":"Department of Computer Science and Technology, Harbin Institute of Technology, Harbin, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Kaiyu","family":"Liu","sequence":"additional","affiliation":[{"name":"Department of Computer Science and Technology, Harbin Institute of Technology, Harbin, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-1654-4681","authenticated-orcid":false,"given":"Lingxiao","family":"Wang","sequence":"additional","affiliation":[{"name":"Department of Industrial Engineering and Management Sciences, Northwestern University, Evanston, IL, USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yingnan","family":"Zhao","sequence":"additional","affiliation":[{"name":"Department of Computer Science and Technology, Harbin Institute of Technology, Harbin, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-1404-2415","authenticated-orcid":false,"given":"Lei","family":"Han","sequence":"additional","affiliation":[{"name":"Tencent Robotics X, Tencent, Shenzhen, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zhaoran","family":"Wang","sequence":"additional","affiliation":[{"name":"Department of Industrial Engineering and Management Sciences, Northwestern University, Evanston, IL, USA"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref13","first-page":"5062","article-title":"Self-supervised exploration via disagreement","author":"pathak","year":"2019","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref12","first-page":"4754","article-title":"Deep reinforcement learning in a handful of trials using probabilistic dynamics models","author":"chua","year":"2018","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref15","first-page":"3483","article-title":"Learning structured output representation using deep conditional generative models","author":"sohn","year":"2015","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref14","first-page":"1","article-title":"Auto-encoding variational Bayes","author":"kingma","year":"2014","journal-title":"Proc Int Conf Learn Represent"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.1109\/JAS.2019.1911348"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2018.2846646"},{"key":"ref11","first-page":"1","article-title":"Large-scale study of curiosity-driven learning","author":"burda","year":"2019","journal-title":"Proc Int Conf Learn Represent"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/CVPRW.2017.70"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1109\/JAS.2017.7510817"},{"key":"ref17","first-page":"1889","article-title":"Trust region policy optimization","author":"schulman","year":"2015","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref16","first-page":"1057","article-title":"Policy gradient methods for reinforcement learning with function approximation","author":"sutton","year":"2000","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref19","first-page":"1","article-title":"High-dimensional continuous control using generalized advantage estimation","author":"schulman","year":"2016","journal-title":"Proc Int Conf Learn Represent"},{"key":"ref18","article-title":"Proximal policy optimization algorithms","author":"schulman","year":"2017","journal-title":"arXiv 1707 06347"},{"key":"ref51","first-page":"1","article-title":"Improving generalization and stability of generative adversarial networks","author":"thanh-tung","year":"2019","journal-title":"Proc Int Conf Learn Represent"},{"key":"ref50","first-page":"1","article-title":"Progressive growing of GANs for improved quality, stability, and variation","author":"karras","year":"2018","journal-title":"Proc Int Conf Learn Represent"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/P18-1115"},{"key":"ref45","first-page":"1049","article-title":"Efficient model-based deep reinforcement learning with variational state tabulation","author":"corneil","year":"2018","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1613\/jair.5699"},{"key":"ref47","first-page":"1","article-title":"Variational autoencoder with arbitrary conditioning","author":"ivanov","year":"2019","journal-title":"Proc Int Conf Learn Represent"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1109\/JAS.2018.7511249"},{"key":"ref41","first-page":"7122","article-title":"VIREL: A variational inference framework for reinforcement learning","volume":"32","author":"fellows","year":"2019","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref44","first-page":"1109","article-title":"VIME: Variational information maximizing exploration","author":"houthooft","year":"2016","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1109\/SSCI44817.2019.9003114"},{"key":"ref49","first-page":"8583","article-title":"Planning to explore via self-supervised world models","author":"sekar","year":"2020","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref8","article-title":"Addressing hindsight bias in multigoal reinforcement learning","author":"bai","year":"2021","journal-title":"IEEE Trans Cybern"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2018.2805379"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1006\/ceps.1999.1020"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1038\/nature24270"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2018.2790981"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1016\/j.knosys.2020.106140"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1038\/s41586-019-1724-z"},{"key":"ref40","author":"levine","year":"2014","journal-title":"Motor skill learning with local trajectory methods"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1145\/1143844.1143963"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1080\/01621459.2017.1285773"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1109\/JAS.2019.1911645"},{"key":"ref36","first-page":"1433","article-title":"Maximum entropy inverse reinforcement learning","volume":"8","author":"ziebart","year":"2008","journal-title":"Proc AAAI Conf Artif Intell"},{"key":"ref31","first-page":"3379","article-title":"Curiosity-bottleneck: Exploration by distilling task-specific novelty","author":"kim","year":"2019","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref30","first-page":"3360","article-title":"EMI: Exploration with mutual information","author":"kim","year":"2019","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref33","first-page":"1","article-title":"Contingency-aware exploration in reinforcement learning","author":"choi","year":"2019","journal-title":"Proc Int Conf Learn Represent"},{"key":"ref32","first-page":"1","article-title":"Dynamic bottleneck for robust self-supervised exploration","author":"bai","year":"2021","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref2","doi-asserted-by":"crossref","first-page":"529","DOI":"10.1038\/nature14236","article-title":"Human-level control through deep reinforcement learning","volume":"518","author":"mnih","year":"2015","journal-title":"Nature"},{"key":"ref1","author":"sutton","year":"2018","journal-title":"Reinforcement Learning An Introduction"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1145\/1273496.1273590"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1162\/neco.1997.9.2.271"},{"key":"ref24","first-page":"1","article-title":"Never give up: Learning directed exploration strategies","author":"badia","year":"2020","journal-title":"Proc Int Conf Learn Represent"},{"key":"ref23","first-page":"1","article-title":"Exploration by random network distillation","author":"burda","year":"2019","journal-title":"Proc Int Conf Learn Represent"},{"key":"ref26","first-page":"5779","article-title":"Model-based active exploration","author":"shyam","year":"2019","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref25","first-page":"8388","article-title":"Learning to play with intrinsically-motivated, self-aware agents","author":"haber","year":"2018","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref20","first-page":"2721","article-title":"Count-based exploration with neural density models","author":"ostrovski","year":"2017","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref22","first-page":"1","article-title":"Episodic curiosity through reachability","author":"savinov","year":"2019","journal-title":"Proc Int Conf Learn Represent"},{"key":"ref21","first-page":"1471","article-title":"Unifying count-based exploration and intrinsic motivation","author":"bellemare","year":"2016","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref28","article-title":"Scheduled intrinsic drive: A hierarchical take on intrinsically motivated exploration","author":"zhang","year":"2019","journal-title":"arXiv 1903 07400"},{"key":"ref27","first-page":"577","article-title":"Principled exploration via optimistic bootstrapping and backward induction","volume":"139","author":"bai","year":"2021","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref29","first-page":"1","article-title":"Mulex: Disentangling exploitation from exploration in deep RL","author":"beyer","year":"2019","journal-title":"Proc Exploration RL Workshop Int Conf Mach Learn"}],"container-title":["IEEE Transactions on Neural Networks and Learning Systems"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/5962385\/10208115\/09632267.pdf?arnumber=9632267","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,10,27]],"date-time":"2025-10-27T18:05:10Z","timestamp":1761588310000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/9632267\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023,8]]},"references-count":54,"journal-issue":{"issue":"8"},"URL":"https:\/\/doi.org\/10.1109\/tnnls.2021.3129160","relation":{},"ISSN":["2162-237X","2162-2388"],"issn-type":[{"value":"2162-237X","type":"print"},{"value":"2162-2388","type":"electronic"}],"subject":[],"published":{"date-parts":[[2023,8]]}}}