{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2024,10,30]],"date-time":"2024-10-30T05:30:46Z","timestamp":1730266246796,"version":"3.28.0"},"reference-count":32,"publisher":"IEEE","license":[{"start":{"date-parts":[[2022,7,18]],"date-time":"2022-07-18T00:00:00Z","timestamp":1658102400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2022,7,18]],"date-time":"2022-07-18T00:00:00Z","timestamp":1658102400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2022,7,18]]},"DOI":"10.1109\/ijcnn55064.2022.9892503","type":"proceedings-article","created":{"date-parts":[[2022,9,30]],"date-time":"2022-09-30T19:56:04Z","timestamp":1664567764000},"page":"1-8","source":"Crossref","is-referenced-by-count":1,"title":["Ensemble Policy Distillation with Reduced Data Distribution Mismatch"],"prefix":"10.1109","author":[{"given":"Yuxiang","family":"Sun","sequence":"first","affiliation":[{"name":"Artificial Intelligence Institute, University of South Carolina"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Qi","family":"Zhang","sequence":"additional","affiliation":[{"name":"Artificial Intelligence Institute, University of South Carolina"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref32","first-page":"457","article-title":"Aleatoric and epistemic uncertainty in machine learning: An introduction to concepts and methods","volume":"110 3","author":"eyke","year":"2021","journal-title":"Machine Learning"},{"key":"ref31","article-title":"Error bounds for approximate value iteration","volume":"20","author":"remi","year":"1999","journal-title":"Proceedings of the National Conference on Artificial Intelligence"},{"journal-title":"PyBullet Gymperium","year":"2019","author":"ellenberger","key":"ref30"},{"key":"ref10","first-page":"2613","article-title":"Double Q-learning","volume":"23","author":"hado","year":"2010","journal-title":"Advances in neural information processing systems"},{"key":"ref11","article-title":"Curriculum learning","author":"yoshua","year":"0","journal-title":"Proceedings of the 26th Annual International Conference on Machine Learning"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v34i04.5963"},{"key":"ref13","article-title":"ZPD teaching strategies for deep reinforcement learning from demonstrations","author":"daniel","year":"2019","journal-title":"ArXiv Preprint"},{"key":"ref14","article-title":"Massively parallel methods for deep reinforcement learning","author":"arun","year":"2015","journal-title":"ArXiv Preprint"},{"key":"ref15","article-title":"Averaged-DQN: Variance reduction and stabilization for deep reinforcement learning","author":"oron","year":"0","journal-title":"International Conference on Machine Learning"},{"key":"ref16","article-title":"Maxmin q-learning: Controlling the estimation bias of q-learning","author":"qingfeng","year":"2020","journal-title":"ArXiv Preprint"},{"key":"ref17","article-title":"UCB exploration via Q-ensembles","author":"chen","year":"2017","journal-title":"ArXiv Preprint"},{"key":"ref18","first-page":"4026","article-title":"Deep exploration via bootstrapped DQN","volume":"29","author":"ian","year":"2016","journal-title":"Advances in neural information processing systems"},{"key":"ref19","article-title":"Ensemble Bootstrapping for Q-Learning","author":"oren","year":"2021","journal-title":"ArXiv Preprint"},{"key":"ref28","article-title":"Reverse kl-divergence training of prior networks: Improved uncertainty and adversarial robustness","author":"andrey","year":"2019","journal-title":"ArXiv Preprint"},{"key":"ref4","article-title":"Off-policy deep reinforcement learning without exploration","author":"scott","year":"0","journal-title":"International Conference on Machine Learning"},{"key":"ref27","article-title":"Ensemble distribution distillation","author":"andrey","year":"2019","journal-title":"ArXiv Preprint"},{"key":"ref3","article-title":"Real-time Policy Distillation in Deep Reinforcement Learning","author":"yuxiang","year":"2019","journal-title":"ArXiv Preprint"},{"key":"ref6","first-page":"529","article-title":"Human-level control through deep reinforcement learning","volume":"518 7540","author":"volodymyr","year":"2015","journal-title":"Nature"},{"key":"ref29","article-title":"Continuous control with deep reinforcement learning","author":"lillicrap","year":"2015","journal-title":"ArXiv Preprint"},{"key":"ref5","article-title":"Stabilizing off-policy q-learning via bootstrapping error reduction","author":"aviral","year":"2019","journal-title":"ArXiv Preprint"},{"key":"ref8","article-title":"Knowledge distillation via route constrained optimization","author":"xiao","year":"0","journal-title":"Proceedings of the IEEE\/CVF International Conference on Computer Vision"},{"key":"ref7","article-title":"Deterministic policy gradient algorithms","author":"david","year":"0","journal-title":"International Conference on Machine Learning"},{"key":"ref2","article-title":"Policy distillation","author":"rusu","year":"2015","journal-title":"ArXiv Preprint"},{"key":"ref9","article-title":"Actor-mimic: Deep multitask and transfer reinforcement learning","author":"emilio","year":"2015","journal-title":"ArXiv Preprint"},{"key":"ref1","article-title":"Distilling the knowledge in a neural network","author":"geoffrey","year":"2015","journal-title":"ArXiv Preprint"},{"key":"ref20","article-title":"Ensemble knowledge distillation for learning improved and efficient networks","author":"umar","year":"2019","journal-title":"ArXiv Preprint"},{"key":"ref22","article-title":"Off-policy deep reinforcement learning without exploration","author":"scott","year":"0","journal-title":"International Conference on Machine Learning"},{"key":"ref21","article-title":"Distilling Knowledge from Ensembles of Neural Networks for Speech Recognition","author":"yevgen","year":"2016","journal-title":"InterSpeech"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v30i1.10295"},{"key":"ref23","article-title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems","author":"sergey","year":"2020","journal-title":"ArXiv Preprint"},{"key":"ref26","article-title":"Error bounds for approximate policy iteration","volume":"3","author":"remi","year":"2003","journal-title":"ICML"},{"key":"ref25","first-page":"2613","article-title":"Double Q-learning","volume":"23","author":"hado","year":"2010","journal-title":"Advances in neural information processing systems"}],"event":{"name":"2022 International Joint Conference on Neural Networks (IJCNN)","start":{"date-parts":[[2022,7,18]]},"location":"Padua, Italy","end":{"date-parts":[[2022,7,23]]}},"container-title":["2022 International Joint Conference on Neural Networks (IJCNN)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/9891857\/9889787\/09892503.pdf?arnumber=9892503","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,11,4]],"date-time":"2022-11-04T01:26:59Z","timestamp":1667525219000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/9892503\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2022,7,18]]},"references-count":32,"URL":"https:\/\/doi.org\/10.1109\/ijcnn55064.2022.9892503","relation":{},"subject":[],"published":{"date-parts":[[2022,7,18]]}}}