{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2024,10,30]],"date-time":"2024-10-30T05:33:09Z","timestamp":1730266389356,"version":"3.28.0"},"reference-count":40,"publisher":"IEEE","license":[{"start":{"date-parts":[[2023,6,18]],"date-time":"2023-06-18T00:00:00Z","timestamp":1687046400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2023,6,18]],"date-time":"2023-06-18T00:00:00Z","timestamp":1687046400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2023,6,18]]},"DOI":"10.1109\/ijcnn54540.2023.10192041","type":"proceedings-article","created":{"date-parts":[[2023,8,2]],"date-time":"2023-08-02T17:30:03Z","timestamp":1690997403000},"page":"1-8","source":"Crossref","is-referenced-by-count":1,"title":["Pseudo Value Network Distillation for High-Performance Exploration"],"prefix":"10.1109","author":[{"given":"Enmin","family":"Zhao","sequence":"first","affiliation":[{"name":"Institute of Automation, Chinese Academy of Sciences"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Junliang","family":"Xing","sequence":"additional","affiliation":[{"name":"Tsinghua University,Department of Computer Science and Technology,Beijing,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Kai","family":"Li","sequence":"additional","affiliation":[{"name":"Institute of Automation, Chinese Academy of Sciences"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yongxin","family":"Kang","sequence":"additional","affiliation":[{"name":"Institute of Automation, Chinese Academy of Sciences"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Tao","family":"Pin","sequence":"additional","affiliation":[{"name":"Tsinghua University,Department of Computer Science and Technology,Beijing,China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref35","article-title":"Exploration via hindsight goal generation","author":"ren","year":"2019","journal-title":"ArXiv Preprint"},{"key":"ref13","first-page":"2753","article-title":"Exploration: A study of count-based exploration for deep reinforcement learning","author":"tang","year":"2017","journal-title":"Advances in neural information processing systems"},{"key":"ref34","first-page":"113","article-title":"Energy-based hindsight experience prioritization","author":"zhao","year":"2018","journal-title":"Conference on Robot Learning"},{"key":"ref12","first-page":"1471","article-title":"Unifying count-based exploration and intrinsic motivation","author":"bellemare","year":"2016","journal-title":"Advances in neural information processing systems"},{"key":"ref37","first-page":"1928","article-title":"Asynchronous methods for deep rein-forcement learning","author":"mnih","year":"2016","journal-title":"International Conference on Machine Learning"},{"key":"ref15","first-page":"3360","article-title":"EMI: Exploration with mutual information","author":"kim","year":"2019","journal-title":"International Conference on Machine Learning"},{"key":"ref36","first-page":"3682","article-title":"Hierarchical deep reinforcement learning: integrating temporal abstraction and intrinsic motivation","author":"kulkarni","year":"2016","journal-title":"Advances in neural information processing systems"},{"key":"ref14","first-page":"1109","article-title":"VIME: Variational information maximizing exploration","author":"houthooft","year":"2016","journal-title":"Advances in neural information processing systems"},{"key":"ref31","first-page":"8388","article-title":"Learning to play with intrinsically-motivated, self-aware agents","author":"haber","year":"2018","journal-title":"Advances in neural information processing systems"},{"key":"ref30","first-page":"7867","article-title":"A unified bellman opti-mality principle combining reward maximization and empowerment","author":"leibfried","year":"2019","journal-title":"Advances in neural information processing systems"},{"key":"ref33","first-page":"5048","article-title":"Hindsight experience replay","author":"andrychowicz","year":"2017","journal-title":"Advances in neural information processing systems"},{"key":"ref11","doi-asserted-by":"crossref","first-page":"529","DOI":"10.1038\/nature14236","article-title":"Human-level control through deep reinforcement learning","volume":"518","author":"volodymyr","year":"2015","journal-title":"Nature"},{"key":"ref32","first-page":"1","article-title":"Never give up: Learning directed exploration strategies","author":"badia","year":"2020","journal-title":"International Conference on Learning Representations"},{"key":"ref10","first-page":"2469","article-title":"Policy optimization with demonstrations","author":"kang","year":"2018","journal-title":"International Conference on Machine Learning"},{"key":"ref2","first-page":"2935","article-title":"Playing hard exploration games by watching youtube","author":"aytar","year":"2018","journal-title":"Advances in neural information processing systems"},{"key":"ref1","first-page":"2917","article-title":"Hierarchical imitation and reinforcement learning","author":"le","year":"2018","journal-title":"International Conference on Machine Learning"},{"key":"ref39","article-title":"A survey on intrinsic motivation in reinforcement learning","author":"aubret","year":"2019","journal-title":"ArXiv Preprint"},{"key":"ref17","first-page":"1","article-title":"Exploration by random network distillation","author":"burda","year":"2019","journal-title":"International Conference on Learning Representations"},{"key":"ref38","article-title":"Prox-imal policy optimization algorithms","author":"schulman","year":"2017","journal-title":"ar Xiv preprint"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1109\/CVPRW.2017.70"},{"key":"ref19","first-page":"4565","article-title":"Generative adversarial imitation learning","author":"ho","year":"2016","journal-title":"Advances in neural information processing systems"},{"key":"ref18","first-page":"1449","article-title":"A game-theoretic approach to apprentice-ship learning","author":"syed","year":"2008","journal-title":"Advances in neural information processing systems"},{"key":"ref24","first-page":"2721","article-title":"Count-based exploration with neural density models","author":"ostrovski","year":"2017","journal-title":"International Conference on Machine Learning"},{"key":"ref23","first-page":"3878","article-title":"Self-imitation learning","author":"oh","year":"2018","journal-title":"International Conference on Machine Learning"},{"key":"ref26","first-page":"2577","article-title":"EX2: Exploration with exemplar models for deep reinforcement learning","author":"fu","year":"2017","journal-title":"Advances in Neural IInformation Processing Systems"},{"key":"ref25","first-page":"2471","author":"martin","year":"2017","journal-title":"Count-based exploration in feature space for reinforcement learning"},{"key":"ref20","first-page":"627","article-title":"A reduction of imitation learning and structured prediction to no-regret online learning","author":"ross","year":"2011","journal-title":"International Conference on Artificial Intelligence and Statistics"},{"key":"ref22","first-page":"3309","article-title":"Deeply aggrevated: Differentiable imitation learning for sequential prediction","author":"sun","year":"2017","journal-title":"International Conference on Machine Learning"},{"key":"ref21","first-page":"2058","article-title":"Learning to search better than your teacher","author":"chang","year":"2015","journal-title":"International Conference on Machine Learning"},{"key":"ref28","first-page":"5125","author":"machado","year":"2020","journal-title":"Count-based exploration with the successor representation"},{"key":"ref27","first-page":"1","article-title":"Dora the explorer: Directed outreaching reinforcement action-selection","author":"choshen","year":"2018","journal-title":"International Conference on Learning Representations"},{"key":"ref29","first-page":"2125","article-title":"Variational information maximisation for intrinsically motivated reinforcement learning","author":"mohamed","year":"2015","journal-title":"Advances in neural information processing systems"},{"key":"ref8","first-page":"1","article-title":"Exploration via elliptical episodic bonuses","author":"henaff","year":"2022","journal-title":"Advances in neural information processing systems"},{"key":"ref7","first-page":"16223","article-title":"The importance of non-markovianity in maximum state entropy exploration","author":"mutti","year":"2022","journal-title":"International Conference on Machine Learning"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v32i1.11757"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v35i9.16981"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v35i12.17297"},{"key":"ref6","first-page":"1","article-title":"Improving intrinsic exploration with language abstractions","author":"mu","year":"2022","journal-title":"Advances in neural information processing systems"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1038\/s41586-020-03157-9"},{"key":"ref40","first-page":"6118","article-title":"Value prediction network","author":"oh","year":"2017","journal-title":"Advances in neural information processing systems"}],"event":{"name":"2023 International Joint Conference on Neural Networks (IJCNN)","start":{"date-parts":[[2023,6,18]]},"location":"Gold Coast, Australia","end":{"date-parts":[[2023,6,23]]}},"container-title":["2023 International Joint Conference on Neural Networks (IJCNN)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/10190990\/10190992\/10192041.pdf?arnumber=10192041","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,8,21]],"date-time":"2023-08-21T17:44:26Z","timestamp":1692639866000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/10192041\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023,6,18]]},"references-count":40,"URL":"https:\/\/doi.org\/10.1109\/ijcnn54540.2023.10192041","relation":{},"subject":[],"published":{"date-parts":[[2023,6,18]]}}}