{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,9,11]],"date-time":"2025-09-11T18:44:08Z","timestamp":1757616248198,"version":"3.44.0"},"reference-count":45,"publisher":"IEEE","license":[{"start":{"date-parts":[[2019,12,1]],"date-time":"2019-12-01T00:00:00Z","timestamp":1575158400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2019,12,1]],"date-time":"2019-12-01T00:00:00Z","timestamp":1575158400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2019,12]]},"DOI":"10.1109\/icar46387.2019.8981598","type":"proceedings-article","created":{"date-parts":[[2020,2,7]],"date-time":"2020-02-07T01:24:08Z","timestamp":1581038648000},"page":"368-373","source":"Crossref","is-referenced-by-count":0,"title":["Deep Reinforcement Learning Control of an Autonomous Wheeled Robot in a Challenge Task: Combined Visual and Dynamics Sensoring"],"prefix":"10.1109","author":[{"given":"Luiz Afonso","family":"Mar\u00e3o","sequence":"first","affiliation":[{"name":"S&#x00E3;o Carlos School of Engineering, University of S&#x00E3;o Paulo,400 Avenida Trabalhador S&#x00E3;o Carlense, S&#x00E3;o Carlos\/SP,Brazil"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Larissa","family":"Casteluci","sequence":"additional","affiliation":[{"name":"S&#x00E3;o Carlos School of Engineering, University of S&#x00E3;o Paulo,400 Avenida Trabalhador S&#x00E3;o Carlense, S&#x00E3;o Carlos\/SP,Brazil"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Ricardo","family":"Godoy","sequence":"additional","affiliation":[{"name":"S&#x00E3;o Carlos School of Engineering, University of S&#x00E3;o Paulo,400 Avenida Trabalhador S&#x00E3;o Carlense, S&#x00E3;o Carlos\/SP,Brazil"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Henrique","family":"Garcia","sequence":"additional","affiliation":[{"name":"S&#x00E3;o Carlos School of Engineering, University of S&#x00E3;o Paulo,400 Avenida Trabalhador S&#x00E3;o Carlense, S&#x00E3;o Carlos\/SP,Brazil"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Daniel Varela","family":"Magalh\u00e3es","sequence":"additional","affiliation":[{"name":"S&#x00E3;o Carlos School of Engineering, University of S&#x00E3;o Paulo,400 Avenida Trabalhador S&#x00E3;o Carlense, S&#x00E3;o Carlos\/SP,Brazil"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Glauco","family":"Caurin","sequence":"additional","affiliation":[{"name":"S&#x00E3;o Carlos School of Engineering, University of S&#x00E3;o Paulo,400 Avenida Trabalhador S&#x00E3;o Carlense, S&#x00E3;o Carlos\/SP,Brazil"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref39","first-page":"1","article-title":"Universal Value Function Approximators","author":"schaul","year":"2015","journal-title":"International Conference on Machine Learning"},{"key":"ref38","article-title":"Policy Gradient Methods for Reinforcement Learning with Function Approximation","author":"sutton","year":"1999","journal-title":"NIPS"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1016\/B978-1-55860-377-6.50013-X"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1007\/BF00992698"},{"journal-title":"Reinforcement learning for robots using neural networks","year":"1993","author":"lin","key":"ref31"},{"key":"ref30","first-page":"85","article-title":"Nonlinear system control using neural networks","volume":"3","author":"\u017eilkov\u00e1","year":"2006","journal-title":"Acta Polytechnica Hungarica"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1007\/978-0-585-33656-5_5"},{"journal-title":"Neuro-Dynamic Programming","year":"1996","author":"bertsekas","key":"ref36"},{"journal-title":"Chattering in SARSA(A) - a CMU learning lab internal report","year":"1996","author":"gordon","key":"ref35"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1016\/B978-1-55860-377-6.50040-2"},{"journal-title":"Noisy Networks for Exploration","year":"2017","author":"fortunato","key":"ref10"},{"journal-title":"Hindsight Experience Replay","year":"2018","author":"andrychowicz","key":"ref40"},{"journal-title":"Implicit Quantile Networks for Distributional Reinforcement Learning","year":"2018","author":"dabney","key":"ref11"},{"key":"ref12","first-page":"354","volume":"550","author":"silver","year":"2017","journal-title":"Mastering the game of go without human knowledge"},{"journal-title":"Mastering chess and shogi by self-play with a general reinforcement learning algorithm","year":"2017","author":"silver","key":"ref13"},{"key":"ref14","first-page":"-387i","article-title":"Deterministic Policy Gradient Algorithms","volume":"32","author":"silver","year":"2014","journal-title":"Proceedings of the 31st International Conference on International Conference on Machine Learning"},{"key":"ref15","volume":"abs 1509 0","author":"lillicrap","year":"2015","journal-title":"Continuous control with deep reinforcement learning"},{"journal-title":"Continuous deep q-learning with model-based acceleration","year":"2016","author":"gu","key":"ref16"},{"journal-title":"Q-prop Sample-efficient policy gradient with an off-policy critic","year":"2017","author":"gu","key":"ref17"},{"journal-title":"High-Dimensional Continuos Control Using Generalized Advantage Estimation","year":"2018","author":"schulman","key":"ref18"},{"journal-title":"Unicorn Continual Learning with a Universal Off-policy Agent","year":"2018","author":"mankowitz","key":"ref19"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1109\/72.80336"},{"journal-title":"Deep reinforcement learning with double q-learning","year":"2015","author":"van hasselt","key":"ref4"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1016\/0893-6080(91)90003-N"},{"journal-title":"Prioritized experience replay","year":"2015","author":"schaul","key":"ref3"},{"journal-title":"Dueling network architectures for deep reinforcement learning","year":"2016","author":"wang","key":"ref6"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1016\/S0921-8890(02)00172-0"},{"journal-title":"Asynchronous methods for deep reinforcement learning","year":"2016","author":"mnih","key":"ref5"},{"journal-title":"A distributional perspective on reinforcement learning","year":"2017","author":"bellemare","key":"ref8"},{"key":"ref7","article-title":"Rainbow: Combining Improvements in Deep Reinforcement Learning","author":"hessel","year":"2017","journal-title":"AAAI 2017"},{"key":"ref2","first-page":"529","volume":"518","author":"mnih","year":"2015","journal-title":"Human-level control through deep reinforcement learning"},{"journal-title":"Proximal policy optimization algorithms","year":"2017","author":"schulman","key":"ref9"},{"key":"ref1","article-title":"Playing Atari with Deep Reinforcement Learning","volume":"abs 1312 5","author":"mnih","year":"2013","journal-title":"NIPS Deep Learning Workshop"},{"key":"ref20","first-page":"2","article-title":"Deep Reinforcement Learning Control of Autonomous Terrestrial Wheeled Robots in a Challenge Task","author":"mar\u00e3o","year":"2019","journal-title":"IEEE\/RAS II Brazilian Humanoid Robot Workshop\/III Brazilian Workshop on Service Robotics"},{"journal-title":"Regras Robo Trekking","year":"2018","key":"ref45"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2018.8460696"},{"journal-title":"Learning Dexterous in-Hand Manipulation","year":"2018","author":"openai","key":"ref21"},{"key":"ref42","article-title":"Reinforcement Learning and Deep Learning based Lateral Control for Autonomous Driving","author":"li","year":"2018","journal-title":"CoRR"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1109\/LRA.2019.2930489"},{"journal-title":"Multi-goal reinforcement learning Challenging robotics environments and request for research","year":"2018","author":"plappert","key":"ref41"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2019.8793506"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1109\/IROS.2012.6386109"},{"key":"ref26","first-page":"4","author":"narendra","year":"1990","journal-title":"Identification and Control of Dynamical Systems using Neural Networks"},{"journal-title":"OpenAI Gym","year":"2016","author":"brockman","key":"ref43"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1109\/37.1869"}],"event":{"name":"2019 19th International Conference on Advanced Robotics (ICAR)","start":{"date-parts":[[2019,12,2]]},"location":"Belo Horizonte, Brazil","end":{"date-parts":[[2019,12,6]]}},"container-title":["2019 19th International Conference on Advanced Robotics (ICAR)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/8962289\/8981543\/08981598.pdf?arnumber=8981598","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,9,5]],"date-time":"2025-09-05T18:09:52Z","timestamp":1757095792000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/8981598\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2019,12]]},"references-count":45,"URL":"https:\/\/doi.org\/10.1109\/icar46387.2019.8981598","relation":{},"subject":[],"published":{"date-parts":[[2019,12]]}}}