{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,29]],"date-time":"2026-06-29T17:17:05Z","timestamp":1782753425408,"version":"3.54.5"},"reference-count":66,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"2","license":[{"start":{"date-parts":[[2021,6,1]],"date-time":"2021-06-01T00:00:00Z","timestamp":1622505600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2021,6,1]],"date-time":"2021-06-01T00:00:00Z","timestamp":1622505600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2021,6,1]],"date-time":"2021-06-01T00:00:00Z","timestamp":1622505600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"name":"ST Engineering-NTU Corporate Laboratory"},{"DOI":"10.13039\/501100001321","name":"NRF","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100001321","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Cogn. Dev. Syst."],"published-print":{"date-parts":[[2021,6]]},"DOI":"10.1109\/tcds.2019.2928820","type":"journal-article","created":{"date-parts":[[2019,10,3]],"date-time":"2019-10-03T18:18:47Z","timestamp":1570126727000},"page":"249-261","source":"Crossref","is-referenced-by-count":43,"title":["BND*-DDQN: Learn to Steer Autonomously Through Deep Reinforcement Learning"],"prefix":"10.1109","volume":"13","author":[{"ORCID":"https:\/\/orcid.org\/0000-0001-8493-0712","authenticated-orcid":false,"given":"Keyu","family":"Wu","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-5448-9903","authenticated-orcid":false,"given":"Han","family":"Wang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-0709-0534","authenticated-orcid":false,"given":"Mahdi","family":"Abolfazli Esfahani","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Shenghai","family":"Yuan","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref39","article-title":"Exploration by random network distillation","author":"burda","year":"2018","journal-title":"arXiv preprint arXiv 1810 12894"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-46604-0_47"},{"key":"ref33","article-title":"Convnet architecture search for spatiotemporal feature learning","author":"tran","year":"2017","journal-title":"arXiv preprint arXiv 1708 05227"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2015.510"},{"key":"ref31","first-page":"568","article-title":"Two-stream convolutional networks for action recognition in videos","author":"simonyan","year":"2014","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref30","first-page":"3468","article-title":"Spatiotemporal residual networks for video action recognition","author":"feichtenhofer","year":"2016","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1109\/THMS.2015.2504550"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01267-0_19"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00675"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.502"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1007\/s10514-013-9339-y"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.1515\/pjbr-2019-0005"},{"key":"ref61","article-title":"Curiosity-driven exploration for mapless navigation with deep reinforcement learning","author":"zhelo","year":"2018","journal-title":"arXiv preprint arXiv 1804 00209"},{"key":"ref63","doi-asserted-by":"publisher","DOI":"10.1109\/TCDS.2016.2628817"},{"key":"ref28","first-page":"5","article-title":"Deep reinforcement learning with double Q-learning","volume":"2","author":"van hasselt","year":"2016","journal-title":"Proc AAAI"},{"key":"ref64","doi-asserted-by":"publisher","DOI":"10.1109\/IROS.2004.1389727"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.3390\/s18113650"},{"key":"ref65","first-page":"265","article-title":"TensorFlow: A system for large-scale machine learning","author":"abadi","year":"2016","journal-title":"Proc of the 5th Symp on Oper Syst Design and Implementation (OSDI)"},{"key":"ref66","article-title":"The effect of color space selection on detectability and discriminability of colored objects","author":"rasouli","year":"2017","journal-title":"arXiv preprint arXiv 1702 05464"},{"key":"ref29","first-page":"802","article-title":"Convolutional LSTM network: A machine learning approach for precipitation nowcasting","author":"xingjian","year":"2015","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.15406\/iratj.2017.02.00023"},{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1016\/j.artint.2014.11.003"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2017.7989381"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2018.8460968"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/LRA.2018.2851148"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1109\/IROS.2017.8206049"},{"key":"ref23","article-title":"Towards cognitive exploration through deep reinforcement learning for mobile robots","author":"tai","year":"2016","journal-title":"arXiv preprint arXiv 1610 01292"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1038\/nature14236"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1109\/3DV.2016.32"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-32375-1_1"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1038\/s41583-018-0078-0"},{"key":"ref59","article-title":"Surprise-based intrinsic motivation for deep reinforcement learning","author":"achiam","year":"2017","journal-title":"arXiv preprint arXiv 1703 01281"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.1109\/TEVC.2006.890271"},{"key":"ref57","article-title":"Large-scale study of curiosity-driven learning","author":"burda","year":"2018","journal-title":"arXiv preprint arXiv 1808 04355"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1109\/ICTAI.2018.00015"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1109\/CVPRW.2017.70"},{"key":"ref54","first-page":"1","article-title":"Episodic curiosity through reachability","author":"savinov","year":"2019","journal-title":"Proc Int Conf Learn Represent (ICLR)"},{"key":"ref53","first-page":"2721","article-title":"Count-based exploration with neural density models","author":"ostrovski","year":"2017","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref52","first-page":"1471","article-title":"Unifying count-based exploration and intrinsic motivation","author":"bellemare","year":"2016","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/TCDS.2018.2841002"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/LRA.2018.2856922"},{"key":"ref40","article-title":"Playing Atari with deep reinforcement learning","author":"mnih","year":"2013","journal-title":"arXiv preprint arXiv 1312 5602"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2018.8460487"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1016\/j.neucom.2019.05.001"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2017.XIII.034"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2018.8461113"},{"key":"ref16","article-title":"One-shot reinforcement learning for robot navigation with interactive replay","author":"bruce","year":"2017","journal-title":"arXiv preprint arXiv 1711 11585"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/LRA.2018.2869644"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/IROS.2017.8202134"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2018.8461203"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.3390\/s17051061"},{"key":"ref3","article-title":"A furcated visual collision avoidance system for an autonomous micro robot","author":"isakhani","year":"0","journal-title":"IEEE Trans Cogn Develop Syst"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/LRA.2017.2656241"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.3390\/s17122742"},{"key":"ref8","article-title":"Towards monocular vision based obstacle avoidance through deep reinforcement learning","author":"xie","year":"2017","journal-title":"Proc RSS Workshop New Front Deep Learn Robot"},{"key":"ref7","article-title":"Optimization-based collision avoidance","author":"zhang","year":"2017","journal-title":"arXiv preprint arXiv 1711 03890"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1109\/TAMD.2010.2056368"},{"key":"ref9","article-title":"Selfsupervised deep reinforcement learning with generalized computation graphs for robot navigation","author":"kahn","year":"2018","journal-title":"Proc IEEE Int Conf Robot Autom (ICRA)"},{"key":"ref46","first-page":"4131","article-title":"Action branching architectures for deep reinforcement learning","author":"tavakoli","year":"2018","journal-title":"Proc 32nd AAAI Conf Artif Intell"},{"key":"ref45","article-title":"Noisy networks for exploration","author":"fortunato","year":"2017","journal-title":"arXiv preprint arXiv 1706 10295"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.2478\/s13230-013-0110-z"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.1109\/DEVLRN.2009.5175525"},{"key":"ref42","article-title":"Deep reinforcement learning for dexterous manipulation with concept networks","author":"gudimella","year":"2017","journal-title":"arXiv preprint arXiv 1709 06977"},{"key":"ref41","article-title":"Multi-task learning for object localization with deep reinforcement learning","author":"wang","year":"0","journal-title":"IEEE Trans Cogn Develop Syst"},{"key":"ref44","first-page":"1995","article-title":"Dueling network architectures for deep reinforcement learning","author":"wang","year":"2016","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref43","article-title":"Learning to navigate in complex environments","author":"mirowski","year":"2016","journal-title":"arXiv preprint arXiv 1611 03673"}],"container-title":["IEEE Transactions on Cognitive and Developmental Systems"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/7274989\/9448369\/08764461.pdf?arnumber=8764461","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,5,10]],"date-time":"2022-05-10T14:54:26Z","timestamp":1652194466000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/8764461\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2021,6]]},"references-count":66,"journal-issue":{"issue":"2"},"URL":"https:\/\/doi.org\/10.1109\/tcds.2019.2928820","relation":{},"ISSN":["2379-8920","2379-8939"],"issn-type":[{"value":"2379-8920","type":"print"},{"value":"2379-8939","type":"electronic"}],"subject":[],"published":{"date-parts":[[2021,6]]}}}