{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,10,1]],"date-time":"2025-10-01T16:32:32Z","timestamp":1759336352235},"reference-count":62,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","license":[{"start":{"date-parts":[[2020,1,1]],"date-time":"2020-01-01T00:00:00Z","timestamp":1577836800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2020,1,1]],"date-time":"2020-01-01T00:00:00Z","timestamp":1577836800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2020,1,1]],"date-time":"2020-01-01T00:00:00Z","timestamp":1577836800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"name":"Research and Development Program in Key Areas of Guangdong Province","award":["2018B010113001"],"award-info":[{"award-number":["2018B010113001"]}]},{"name":"National Key Research and Development Program of China","award":["2018YFB1800500"],"award-info":[{"award-number":["2018YFB1800500"]}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"crossref","award":["61772305"],"award-info":[{"award-number":["61772305"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"crossref"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Parallel Distrib. Syst."],"published-print":{"date-parts":[[2020]]},"DOI":"10.1109\/tpds.2020.3047966","type":"journal-article","created":{"date-parts":[[2020,12,29]],"date-time":"2020-12-29T20:25:22Z","timestamp":1609273522000},"page":"1-1","source":"Crossref","is-referenced-by-count":6,"title":["Accelerating End-to-End Deep Learning Workflow with Codesign of Data Preprocessing and Scheduling"],"prefix":"10.1109","author":[{"given":"Yang","family":"Cheng","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Dan","family":"Li","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zhiyuan","family":"Guo","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Binyao","family":"Jiang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jinkun","family":"Geng","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jiaxin","family":"Lin","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xi","family":"Fan","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xinyi","family":"Yu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Wei","family":"Bai","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Lei","family":"Qu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Ran","family":"Shu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Peng","family":"Cheng","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yongqiang","family":"Xiong","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jianping","family":"Wu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-015-0816-y"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1038\/nature14539"},{"key":"ref33","year":"2020"},{"key":"ref32","article-title":"NVIDIA tensorrt programmable inference accelerator","year":"2018"},{"key":"ref31","article-title":"Intel, Facebook accelerate datacenters with FPGAs","author":"leopold","year":"2020"},{"key":"ref30","article-title":"FPGA accelerated computing using AWS F1 instances","author":"pellerin","year":"2017","journal-title":"AWS Public Sector Summit"},{"key":"ref37","year":"2020"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1145\/2858788.2688521"},{"key":"ref35","first-page":"578","article-title":"TVM: An automated end-to-end optimizing compiler for deep learning","author":"chen","year":"2018","journal-title":"Proc 13th USENIX Conf Operating Syst Des Implementation"},{"key":"ref34","year":"2020"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1145\/2684746.2689060"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.1145\/3020078.3021745"},{"key":"ref61","doi-asserted-by":"publisher","DOI":"10.1145\/3289602.3293898"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1109\/MM.2018.022071131"},{"key":"ref27","year":"2020"},{"key":"ref29","article-title":"Microsoft goes all in for FPGAs to build out ai cloud","author":"feldman","year":"2017"},{"key":"ref2","first-page":"1097","article-title":"ImageNet classification with deep convolutional neural networks","author":"krizhevsky","year":"2012","journal-title":"Proc 25th Int Conf Neural Inf Process Syst"},{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1145\/3337821.3337892"},{"key":"ref20","article-title":"Creating ImageNet LMDB in Caffe","author":"zou","year":"2020"},{"key":"ref22","article-title":"Introduction to TFRecords","author":"daoust","year":"2020"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1145\/2647868.2654889"},{"key":"ref24","year":"2020"},{"key":"ref23","article-title":"Image transforms and recordio file creation of MXNet","author":"acharya","year":"2018"},{"key":"ref26","first-page":"51","article-title":"Azure accelerated networking: SmartNICs in the public cloud","author":"firestone","year":"2018","journal-title":"Proc 15th USENIX Conf Netw Syst Des Implementation"},{"key":"ref25","year":"2020"},{"key":"ref50","first-page":"53","article-title":"Comparison of learning algorithms for handwritten digit recognition","volume":"60","author":"lecun","year":"1995","journal-title":"Proc Int Conf Artif Neural Netw"},{"key":"ref51","article-title":"The MNIST database of handwritten digits","author":"lecun","year":"2020"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.1145\/2934583.2934644"},{"key":"ref58","first-page":"1","article-title":"Accelerating deep convolutional neural networks using specialized hardware","volume":"2","author":"ovtcharov","year":"2015"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.1145\/3349614.3356027"},{"key":"ref56","article-title":"TicTac: Accelerating distributed deep learning with communication scheduling","author":"hashemi","year":"2018","journal-title":"arXiv 1803 03288"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1145\/3341301.3359642"},{"key":"ref54","article-title":"Tensor comprehensions: Framework-agnostic high-performance machine learning abstractions","author":"vasilache","year":"2018"},{"key":"ref53","first-page":"127","article-title":"Direct universal access: Making data center resources available to FPGA","author":"shu","year":"2019","journal-title":"Proc 16th USENIX Conf Netw Syst Des Implementation"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7298594"},{"key":"ref10","article-title":"AI and machine learning platform in Google cloud","author":"cloud","year":"2019"},{"key":"ref11","article-title":"Intel arria-10 FPGAs","year":"2018"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2017.7952261"},{"key":"ref12","article-title":"An overview ethernet cards in mellanox","year":"2019"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1145\/3123878.3131975"},{"key":"ref14","article-title":"Extremely large minibatch SGD: Training ResNet-50 on ImageNet in 15 minutes","author":"akiba","year":"2017"},{"key":"ref15","article-title":"Accurate, large minibatch SGD: Training ImageNet in 1 hour","author":"goyal","year":"2017","journal-title":"arXiv 1706 02677"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1145\/3225058.3225069"},{"key":"ref17","article-title":"PowerAI DDL","author":"cho","year":"2017"},{"key":"ref18","article-title":"Very deep convolutional networks for large-scale image recognition","author":"simonyan","year":"2014"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2015.123"},{"key":"ref4","article-title":"TensorFlow on AWS","author":"nucleus research","year":"2018"},{"key":"ref3","article-title":"BERT: Pre-training of deep bidirectional transformers for language understanding","author":"devlin","year":"2018"},{"key":"ref6","first-page":"8026","article-title":"PyTorch: An imperative style, high-performance deep learning library","author":"paszke","year":"2019","journal-title":"Proc Int Conf Neural Inf Process"},{"key":"ref5","article-title":"MXNet: A flexible and efficient machine learning library for heterogeneous distributed systems","author":"chen","year":"2015"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1145\/2934872.2934908"},{"key":"ref7","first-page":"265","article-title":"TensorFlow: A system for large-scale machine learning","volume":"16","author":"abadi","year":"2016","journal-title":"Proc 12th USENIX Conf Operating Syst Des Implementation"},{"key":"ref49","year":"2020"},{"key":"ref9","year":"2020"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1145\/3093337.3037745"},{"key":"ref45","year":"2020"},{"key":"ref48","year":"2020"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.1109\/MCSE.2010.69"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2013.6639345"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-015-0823-z"},{"key":"ref44","first-page":"1223","article-title":"More effective distributed ML via a stale synchronous parallel parameter server","author":"ho","year":"2013","journal-title":"Proc 26th Int Conf Neural Inf Process Syst"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-7908-2604-3_16"}],"container-title":["IEEE Transactions on Parallel and Distributed Systems"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/71\/4359390\/09310194.pdf?arnumber=9310194","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,5,10]],"date-time":"2022-05-10T14:50:30Z","timestamp":1652194230000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/9310194\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2020]]},"references-count":62,"URL":"https:\/\/doi.org\/10.1109\/tpds.2020.3047966","relation":{},"ISSN":["1045-9219","1558-2183","2161-9883"],"issn-type":[{"value":"1045-9219","type":"print"},{"value":"1558-2183","type":"electronic"},{"value":"2161-9883","type":"electronic"}],"subject":[],"published":{"date-parts":[[2020]]}}}