{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,29]],"date-time":"2026-05-29T16:47:45Z","timestamp":1780073265325,"version":"3.54.0"},"reference-count":28,"publisher":"IEEE","content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2018,7]]},"DOI":"10.1109\/ijcnn.2018.8489185","type":"proceedings-article","created":{"date-parts":[[2018,10,19]],"date-time":"2018-10-19T18:25:09Z","timestamp":1539973509000},"page":"1-6","source":"Crossref","is-referenced-by-count":9,"title":["Visual Navigation with Actor-Critic Deep Reinforcement Learning"],"prefix":"10.1109","author":[{"given":"Kun","family":"Shao","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Dongbin","family":"Zhao","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yuanheng","family":"Zhu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Qichao","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref10","first-page":"1","article-title":"ViZDoom: A Doom-based AI research platform for visual reinforcement learning","year":"2017","journal-title":"IEEE Conference on Computational Intelligence and Games (CIG)"},{"key":"ref11","first-page":"3357","article-title":"Target-driven visual navigation in indoor scenes using deep reinforcement learning","year":"2017","journal-title":"International Conference on Robotics and Automation (ICRA)"},{"key":"ref12","first-page":"2790","article-title":"Control of memory, active perception, and action in Minecraft","year":"2016","journal-title":"International Conference on Machine Learning (ICML)"},{"key":"ref13","first-page":"1553","article-title":"A deep hierarchical approach to lifelong learning in Minecraft","year":"2017","journal-title":"The AAAI Conference of Artificial Intelligence (AAAI)"},{"key":"ref14","article-title":"Deep successor reinforcement learning","year":"2016","journal-title":"arXiv preprint arXiv 1606 02396"},{"key":"ref15","first-page":"2140","article-title":"Playing FPS games with deep reinforcement learning","year":"2016","journal-title":"The AAAI Conference of Artificial Intelligence (AAAI)"},{"key":"ref16","article-title":"Training agent for ?rst-person shooter game with actor-critic curriculum learning","year":"2017","journal-title":"International Conference on Learning Representations (ICLR)"},{"key":"ref17","article-title":"Learning to act by predicting the future","year":"2017","journal-title":"International Conference on Learning Representations (ICLR)"},{"key":"ref18","year":"1998","journal-title":"Reinforcement Learning An Introduction"},{"key":"ref19","first-page":"1774","article-title":"Policy gradient methods with gaussian process modelling acceleration","year":"2017","journal-title":"International Joint Conference on Neural Networks (IJCNN)"},{"key":"ref28","article-title":"Reinforcement learning with unsupervised auxiliary tasks","year":"2017","journal-title":"International Conference on Learning Representations (ICLR)"},{"key":"ref4","first-page":"1","article-title":"Deep reinforcement learning with experience replay based on Sarsa","year":"2016","journal-title":"IEEE Symposium Series on Computational Intelligence (SSCI)"},{"key":"ref27","first-page":"1285","article-title":"Scalable trust-region method for deep reinforcement learning using kronecker-factored approximation","year":"2017","journal-title":"Advances in Neural Information Processing Systems (NIPS)"},{"key":"ref3","first-page":"529","article-title":"Human-level control through deep reinforcement learning","year":"2015","journal-title":"Nature"},{"key":"ref6","first-page":"292","article-title":"Move prediction in Gomoku using deep learning","year":"2016","journal-title":"Chinese Association of Automation (YAC) Youth Academic Annual Conference of"},{"key":"ref5","doi-asserted-by":"crossref","first-page":"484","DOI":"10.1038\/nature16961","article-title":"Mastering the game of Go with deep neural networks and tree search","volume":"529","year":"2016","journal-title":"Nature"},{"key":"ref8","first-page":"1","article-title":"Cooperative reinforcement learning for multiple units combat in StarCraft","year":"2017","journal-title":"IEEE Symposium Series on Computational Intelligence (SSCI)"},{"key":"ref7","article-title":"StarCraft II: A new challenge for reinforcement learning","year":"2017","journal-title":"arXiv preprint arXiv 1708 04782"},{"key":"ref2","first-page":"1529","article-title":"Recent progress of deep reinforcement learning: from AlphaGo to AlphaGo Zero","volume":"34","year":"2017","journal-title":"Control theory and applications"},{"key":"ref9","article-title":"Learning to navigate in complex environments","year":"2017","journal-title":"International Conference on Learning Representations (ICLR)"},{"key":"ref1","first-page":"701","article-title":"Review of deep reinforcement learning and discussions on the development of computer Go","volume":"33","year":"2016","journal-title":"Control theory and applications"},{"key":"ref20","article-title":"Highdimensional continuous control using generalized advantage estimation","year":"2016","journal-title":"International Conference on Learning Representations (ICLR)"},{"key":"ref22","first-page":"1","article-title":"Ef?cient parallel methods for deep reinforcement learning","year":"2017","journal-title":"Proc Multi-Disciplinary Conf Reinforcement Learn Decision Making"},{"key":"ref21","first-page":"1928","article-title":"Asynchronous methods for deep reinforcement learning","year":"2016","journal-title":"International Conference on Machine Learning (ICML)"},{"key":"ref24","article-title":"Learning to reinforcement learn","year":"2017","journal-title":"International Conference on Learning Representations (ICLR)"},{"key":"ref23","first-page":"4535","article-title":"Heuristic dynamic programming strategy with eligibility traces","year":"2008","journal-title":"American Control Conference (ACC)"},{"key":"ref26","article-title":"Proximal policy optimization algorithms","year":"2017","journal-title":"arXiv preprint arXiv 1707 07816"},{"key":"ref25","article-title":"Sample ef?cient actor-critic with experience replay","year":"2017","journal-title":"International Conference on Learning Representations (ICLR)"}],"event":{"name":"2018 International Joint Conference on Neural Networks (IJCNN)","location":"Rio de Janeiro","start":{"date-parts":[[2018,7,8]]},"end":{"date-parts":[[2018,7,13]]}},"container-title":["2018 International Joint Conference on Neural Networks (IJCNN)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/8465565\/8488986\/08489185.pdf?arnumber=8489185","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2020,8,24]],"date-time":"2020-08-24T01:13:48Z","timestamp":1598231628000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/8489185\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2018,7]]},"references-count":28,"URL":"https:\/\/doi.org\/10.1109\/ijcnn.2018.8489185","relation":{},"subject":[],"published":{"date-parts":[[2018,7]]}}}