{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,7,6]],"date-time":"2025-07-06T12:10:11Z","timestamp":1751803811064,"version":"3.41.0"},"reference-count":31,"publisher":"IEEE","content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2018,6]]},"DOI":"10.23919\/acc.2018.8431647","type":"proceedings-article","created":{"date-parts":[[2018,8,17]],"date-time":"2018-08-17T20:16:10Z","timestamp":1534536970000},"page":"1065-1071","source":"Crossref","is-referenced-by-count":11,"title":["A Boosting-based Deep Neural Networks Algorithm for Reinforcement Learning"],"prefix":"10.23919","author":[{"given":"Yu","family":"Wang","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Hongxia","family":"Jin","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref31","article-title":"A new concept using LSTM Neural Networks for dynamic system identification","author":"yu","year":"2017","journal-title":"2017 American Control Conference (ACC)"},{"journal-title":"Playing atari with deep reinforcement learning","year":"2013","author":"mnih","key":"ref30"},{"key":"ref10","first-page":"67","article-title":"A menu of designs for reinforcement learning over time","author":"werbos","year":"1990","journal-title":"Neural Networks for Control"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1016\/j.neuron.2010.04.016"},{"journal-title":"The Rationale for Second Level Adaptation","year":"2015","author":"narendra","key":"ref12"},{"key":"ref13","doi-asserted-by":"crossref","first-page":"529","DOI":"10.1038\/nature14236","article-title":"Human-level control through deep reinforcement learning","volume":"518","author":"mnih","year":"2015","journal-title":"Nature"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1109\/ACC.2014.6859503"},{"key":"ref15","article-title":"Large scale distributed deep networks","author":"dean","year":"2012","journal-title":"Advances in neural information processing systems"},{"journal-title":"Continuous deep q-learning with model-based acceleration","year":"2016","author":"gu","key":"ref16"},{"key":"ref17","doi-asserted-by":"crossref","DOI":"10.1609\/aaai.v30i1.10295","article-title":"Deep Reinforcement Learning with Double Q-Learning","author":"van hasselt","year":"2016","journal-title":"AAAI"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1007\/BF00992698"},{"journal-title":"Learning from delayed rewards","year":"1989","author":"watkins","key":"ref19"},{"journal-title":"Policy Gradient Methods for Robot Control","year":"2003","author":"peters","key":"ref28"},{"key":"ref4","volume":"1","author":"sutton","year":"1998","journal-title":"Reinforcement Learning An Introduction"},{"key":"ref27","article-title":"Improving the Speed of Response of Learning Algorithms Using Multiple Models: An Introduction","author":"narendra","year":"0","journal-title":"Yale Workshop on Adaptive and Learning Systems"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/72.80202"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/TAC.2011.2152470"},{"key":"ref29","article-title":"Covariant policy search","author":"bagnell","year":"2003","journal-title":"IJCAI"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1007\/BF00115009"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/CDC.2016.7799377"},{"journal-title":"On-line Q-learning using connectionist systems","year":"1994","author":"rummery","key":"ref7"},{"journal-title":"Applied Optimal Control","year":"1969","author":"bryson","key":"ref2"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1002\/9780470182963"},{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1073\/pnas.42.10.767"},{"journal-title":"On-line Q-learning using connectionist systems","year":"1994","author":"rummery","key":"ref20"},{"key":"ref22","first-page":"1329","article-title":"Benchmarking deep reinforcement learning for continuous control[C]","author":"duan","year":"2016","journal-title":"International Conference on Machine Learning"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1162\/neco.1997.9.8.1735"},{"key":"ref24","article-title":"A natural policy gradient","author":"kakade","year":"2002","journal-title":"Advances in neural information processing systems"},{"journal-title":"Continuous control with deep reinforcement learning","year":"2015","author":"lillicrap","key":"ref23"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1109\/ACC.2016.7525529"},{"key":"ref25","article-title":"Trust region policy optimization","author":"schulman","year":"2015","journal-title":"International Conference on Machine Learning"}],"event":{"name":"2018 Annual American Control Conference (ACC)","start":{"date-parts":[[2018,6,27]]},"location":"Milwaukee, WI","end":{"date-parts":[[2018,6,29]]}},"container-title":["2018 Annual American Control Conference (ACC)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/8410068\/8430677\/08431647.pdf?arnumber=8431647","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,7,6]],"date-time":"2025-07-06T11:48:52Z","timestamp":1751802532000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/8431647\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2018,6]]},"references-count":31,"URL":"https:\/\/doi.org\/10.23919\/acc.2018.8431647","relation":{},"subject":[],"published":{"date-parts":[[2018,6]]}}}