{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,13]],"date-time":"2026-06-13T12:47:50Z","timestamp":1781354870655,"version":"3.54.1"},"reference-count":93,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","license":[{"start":{"date-parts":[[2022,1,1]],"date-time":"2022-01-01T00:00:00Z","timestamp":1640995200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/legalcode"}],"funder":[{"DOI":"10.13039\/100010661","name":"European Union\u2019s Horizon 2020 Research and Innovation Program through the Very Efficient Deep Learning in IoT (VEDLIoT) Project","doi-asserted-by":"publisher","award":["957197"],"award-info":[{"award-number":["957197"]}],"id":[{"id":"10.13039\/100010661","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Access"],"published-print":{"date-parts":[[2022]]},"DOI":"10.1109\/access.2022.3146518","type":"journal-article","created":{"date-parts":[[2022,1,27]],"date-time":"2022-01-27T21:48:02Z","timestamp":1643320082000},"page":"13753-13767","source":"Crossref","is-referenced-by-count":58,"title":["A Survey of Domain-Specific Architectures for Reinforcement Learning"],"prefix":"10.1109","volume":"10","author":[{"ORCID":"https:\/\/orcid.org\/0000-0003-2886-8197","authenticated-orcid":false,"given":"Marc","family":"Rothmann","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-1005-5753","authenticated-orcid":false,"given":"Mario","family":"Porrmann","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1201\/9781351003827-1"},{"key":"ref2","first-page":"1","article-title":"Reinforcement learning through asynchronous advantage actor-critic on a GPU","volume-title":"Proc. ICLR","author":"Babaeizadeh"},{"key":"ref3","article-title":"Emergent tool use from multi-agent autocurricula","author":"Baker","year":"2019","journal-title":"arXiv:1909.07528"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1145\/3386263.3407649"},{"key":"ref5","article-title":"DeepMind lab","author":"Beattie","year":"2016","journal-title":"arXiv:1612. 03801"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1613\/jair.3912"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1512\/iumj.1957.6.56038"},{"key":"ref8","article-title":"Dota 2 with large scale deep reinforcement learning","author":"Berner","year":"2019","journal-title":"arXiv:1912.06680"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-96133-0_20"},{"key":"ref10","article-title":"OpenAI Gym","author":"Brockman","year":"2016","journal-title":"arXiv:1606.01540"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/ASAP52443.2021.00016"},{"key":"ref12","first-page":"1521","article-title":"Distributed reinforcement learning for power limited many-core system performance optimization","volume-title":"Proc. Design, Autom. Test Eur. Conf. Exhib. (DATE)","author":"Chen"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1145\/3297858.3304058"},{"key":"ref14","article-title":"Efficient parallel methods for deep reinforcement learning","author":"Clemente","year":"2017","journal-title":"arXiv:1705.04862"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/CANDAR.2017.27"},{"key":"ref16","article-title":"GPU-accelerated Atari emulation for reinforcement learning","author":"Dalton","year":"2019","journal-title":"arXiv:1907.08467"},{"key":"ref17","article-title":"SEED RL: Scalable and efficient deep-RL with accelerated central inference","author":"Espeholt","year":"2019","journal-title":"arXiv:1910.06591"},{"key":"ref18","article-title":"IMPALA: Scalable distributed deep-RL with importance weighted actor-learner architectures","author":"Espeholt","year":"2018","journal-title":"arXiv:1802.01561"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.14313\/jamris_3-2018\/15"},{"key":"ref20","article-title":"Addressing function approximation error in actor-critic methods","author":"Fujimoto","year":"2018","journal-title":"arXiv:1802.09477"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/AERO.2017.7943929"},{"key":"ref22","article-title":"FPGA accelerator architecture for Q-learning and its applications in space exploration","author":"Gankidi","year":"2016"},{"key":"ref23","volume-title":"Tensor Processing Unit","year":"2020"},{"key":"ref24","volume-title":"Introduction to Parallel Computing","author":"Grama","year":"2003"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1109\/ASAP.2019.00-24"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1145\/3289185"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/LCA.2019.2892151"},{"key":"ref28","article-title":"Soft actor-critic algorithms and applications","author":"Haarnoja","year":"2018","journal-title":"arXiv:1812.05905"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1109\/ICCD.2016.7753296"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v32i1.11796"},{"key":"ref31","article-title":"Distributed prioritized experience replay","author":"Horgan","year":"2018","journal-title":"arXiv:1803.00933"},{"key":"ref32","first-page":"232","article-title":"On-line sequential extreme learning machine","volume-title":"Proc. IASTED Int. Conf. Comput. Intell.","author":"Huang"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1109\/IJCNN.2004.1380068"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1109\/ACCESS.2019.2941229"},{"key":"ref35","article-title":"QT-Opt: Scalable deep reinforcement learning for vision-based robotic manipulation","author":"Kalashnikov","year":"2018","journal-title":"arXiv:1806.10293"},{"key":"ref36","first-page":"1","article-title":"Recurrent experience replay in distributed reinforcement learning","volume-title":"Proc. ICLR","author":"Kapturowski"},{"key":"ref37","article-title":"QuaRL: Quantization for sustainable reinforcement learning","author":"Krishnan","year":"2019","journal-title":"arXiv:1910.01055"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1561\/1000000005"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1145\/3322645.3322693"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1201\/9781351006620-6"},{"key":"ref41","first-page":"270","article-title":"GPU-accelerated robotic simulation for distributed reinforcement learning","volume-title":"Proc. Conf. Robot Learn.","author":"Liang"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-47436-2_68"},{"key":"ref43","first-page":"1","article-title":"Continuous control with deep reinforcement learning","volume":"abs\/1509.02971","author":"Lillicrap","year":"2015","journal-title":"CoRR"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-540-69052-8_54"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1109\/JETCAS.2020.3015509"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.17577\/ijertv8is120332"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.1109\/FCCM48280.2020.00012"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1109\/IPDPSW50202.2020.00024"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.3390\/make1010005"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1016\/j.sysarc.2020.101839"},{"key":"ref51","first-page":"1928","article-title":"Asynchronous methods for deep reinforcement learning","volume-title":"Proc. ICML","author":"Mnih"},{"key":"ref52","article-title":"Playing Atari with deep reinforcement learning","author":"Mnih","year":"2013","journal-title":"arXiv:1312.5602"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.1038\/nature14236"},{"key":"ref54","article-title":"Massively parallel methods for deep reinforcement learning","author":"Nair","year":"2015","journal-title":"arXiv:1507.04296"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1109\/IRC.2019.00120"},{"key":"ref56","volume-title":"NVIDIA FleX","year":"2020"},{"key":"ref57","article-title":"Deep in-GPU experience replay","author":"Parr","year":"2018","journal-title":"arXiv:1801.03138"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.1162\/neco.1994.6.1.147"},{"key":"ref59","article-title":"Speeding up reinforcement learning with graphics processing units","author":"Postma","year":"2015"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1155\/2007\/65478"},{"key":"ref61","article-title":"On-line Q-learning using connectionist systems","author":"Rummery","year":"1994"},{"key":"ref62","article-title":"Proximal policy optimization algorithms","author":"Schulman","year":"2017","journal-title":"arXiv:1707.06347"},{"key":"ref63","first-page":"1889","article-title":"Trust region policy optimization","volume-title":"Proc. 32nd Int. Conf. Mach. Learn.","volume":"37","author":"Schulman"},{"key":"ref64","doi-asserted-by":"publisher","DOI":"10.1145\/3007787.3001139"},{"key":"ref65","doi-asserted-by":"publisher","DOI":"10.23919\/FPL.2017.8056789"},{"key":"ref66","doi-asserted-by":"publisher","DOI":"10.1109\/ASAP.2018.8445099"},{"key":"ref67","doi-asserted-by":"publisher","DOI":"10.1109\/ACCESS.2018.2885950"},{"key":"ref68","doi-asserted-by":"publisher","DOI":"10.1038\/nature16961"},{"key":"ref69","doi-asserted-by":"publisher","DOI":"10.1016\/j.micpro.2019.102868"},{"key":"ref70","doi-asserted-by":"publisher","DOI":"10.1109\/DSD.2018.00106"},{"key":"ref71","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA.2017.55"},{"key":"ref72","doi-asserted-by":"publisher","DOI":"10.1109\/ACCESS.2019.2961174"},{"key":"ref73","article-title":"Accelerated methods for deep reinforcement learning","author":"Stooke","year":"2018","journal-title":"arXiv:1803.02811"},{"key":"ref74","doi-asserted-by":"publisher","DOI":"10.1145\/3039902.3039915"},{"key":"ref75","doi-asserted-by":"publisher","DOI":"10.1109\/TNN.1998.712192"},{"issue":"2","key":"ref76","first-page":"131","article-title":"Transforming the LSTM training algorithm for efficient FPGA-based adaptive control of nonlinear dynamic systems","volume":"43","author":"Tavcar","year":"2013","journal-title":"Informacije Midem-J. Microelectron. Electron. Compon. Mater."},{"key":"ref77","article-title":"ELF: An extensive, lightweight and flexible research platform for real-time strategy games","author":"Tian","year":"2017","journal-title":"arXiv:1707.01067"},{"key":"ref78","doi-asserted-by":"publisher","DOI":"10.1109\/IROS.2012.6386109"},{"key":"ref79","doi-asserted-by":"publisher","DOI":"10.1145\/3020078.3021744"},{"key":"ref80","doi-asserted-by":"publisher","DOI":"10.1038\/s41586-019-1724-z"},{"key":"ref81","doi-asserted-by":"publisher","DOI":"10.1145\/3193827"},{"key":"ref82","article-title":"ROMA: Multi-agent reinforcement learning with emergent roles","author":"Wang","year":"2020","journal-title":"arXiv:2003.08039"},{"key":"ref83","article-title":"Sample efficient actor-critic with experience replay","author":"Wang","year":"2016","journal-title":"arXiv:1611.01224"},{"key":"ref84","doi-asserted-by":"publisher","DOI":"10.1109\/IPDPSW52791.2021.00022"},{"issue":"3","key":"ref85","doi-asserted-by":"crossref","first-page":"279","DOI":"10.1007\/BF00992698","article-title":"Technical note: Q-learning","volume":"8","author":"Watkins","year":"1992","journal-title":"Mach. Learn."},{"key":"ref86","article-title":"Learning from delayed rewards","author":"Watkins","year":"1989"},{"key":"ref87","doi-asserted-by":"publisher","DOI":"10.1109\/TCAD.2020.3012804"},{"key":"ref88","article-title":"Integer quantization for deep learning inference: Principles and empirical evaluation","author":"Wu","year":"2020","journal-title":"arXiv:2004.09602"},{"key":"ref89","first-page":"5279","article-title":"Scalable trust-region method for deep reinforcement learning using Kronecker-factored approximation","volume-title":"Proc. NIPS","author":"Wu"},{"key":"ref90","volume-title":"System Generator for DSP","year":"2020"},{"key":"ref91","doi-asserted-by":"publisher","DOI":"10.1109\/TSC.2018.2867482"},{"key":"ref92","doi-asserted-by":"publisher","DOI":"10.1109\/ASAP.2016.7760779"},{"key":"ref93","doi-asserted-by":"publisher","DOI":"10.1109\/MWSCAS.2007.4488701"}],"container-title":["IEEE Access"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/6287639\/9668973\/09694573.pdf?arnumber=9694573","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,1,13]],"date-time":"2024-01-13T22:19:40Z","timestamp":1705184380000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/9694573\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2022]]},"references-count":93,"URL":"https:\/\/doi.org\/10.1109\/access.2022.3146518","relation":{},"ISSN":["2169-3536"],"issn-type":[{"value":"2169-3536","type":"electronic"}],"subject":[],"published":{"date-parts":[[2022]]}}}