{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,3,14]],"date-time":"2026-03-14T18:02:35Z","timestamp":1773511355678,"version":"3.50.1"},"reference-count":46,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"3","license":[{"start":{"date-parts":[[2019,3,1]],"date-time":"2019-03-01T00:00:00Z","timestamp":1551398400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2019,3,1]],"date-time":"2019-03-01T00:00:00Z","timestamp":1551398400000},"content-version":"am","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2019,3,1]],"date-time":"2019-03-01T00:00:00Z","timestamp":1551398400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2019,3,1]],"date-time":"2019-03-01T00:00:00Z","timestamp":1551398400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/501100008982","name":"National Science Foundation","doi-asserted-by":"publisher","award":["CCF-1217906"],"award-info":[{"award-number":["CCF-1217906"]}],"id":[{"id":"10.13039\/501100008982","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100008982","name":"National Science Foundation","doi-asserted-by":"publisher","award":["CNS-1629914"],"award-info":[{"award-number":["CNS-1629914"]}],"id":[{"id":"10.13039\/501100008982","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100008982","name":"National Science Foundation","doi-asserted-by":"publisher","award":["CCF-1617735"],"award-info":[{"award-number":["CCF-1617735"]}],"id":[{"id":"10.13039\/501100008982","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100008982","name":"National Science Foundation","doi-asserted-by":"publisher","award":["CCF-1640081"],"award-info":[{"award-number":["CCF-1640081"]}],"id":[{"id":"10.13039\/501100008982","id-type":"DOI","asserted-by":"publisher"}]},{"name":"Nanoelectronics Research Corporation"},{"DOI":"10.13039\/100000028","name":"Semiconductor Research Corporation","doi-asserted-by":"publisher","id":[{"id":"10.13039\/100000028","id-type":"DOI","asserted-by":"publisher"}]},{"name":"Extremely Energy Efficient Collective Electronics"},{"name":"SRC-NRI Nanoelectronics Research Initiative","award":["2698.004"],"award-info":[{"award-number":["2698.004"]}]},{"name":"SRC-NRI Nanoelectronics Research Initiative","award":["2698.005"],"award-info":[{"award-number":["2698.005"]}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Parallel Distrib. Syst."],"published-print":{"date-parts":[[2019,3,1]]},"DOI":"10.1109\/tpds.2018.2866582","type":"journal-article","created":{"date-parts":[[2018,8,23]],"date-time":"2018-08-23T18:50:36Z","timestamp":1535050236000},"page":"646-661","source":"Crossref","is-referenced-by-count":15,"title":["moDNN: Memory Optimal Deep Neural Network Training on Graphics Processing Units"],"prefix":"10.1109","volume":"30","author":[{"ORCID":"https:\/\/orcid.org\/0000-0001-6565-2884","authenticated-orcid":false,"given":"Xiaoming","family":"Chen","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-7337-1844","authenticated-orcid":false,"given":"Danny Ziyi","family":"Chen","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-0904-6681","authenticated-orcid":false,"given":"Yinhe","family":"Han","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-6636-9738","authenticated-orcid":false,"given":"Xiaobo Sharon","family":"Hu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1145\/384192.384193"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1145\/359436.359453"},{"key":"ref33","author":"goodfellow","year":"2016","journal-title":"Deep Learning"},{"key":"ref32","author":"cormen","year":"2009","journal-title":"Introduction to Algorithms"},{"key":"ref31","first-page":"1","article-title":"MXNet: A flexible and efficient machine learning library for heterogeneous distributed systems","author":"chen","year":"2015","journal-title":"arXiv 1512 01274"},{"key":"ref30","first-page":"13","article-title":"moDNN: Memory optimal DNN training on GPUs","author":"chen","year":"2018","journal-title":"Proc Des Autom Test Eur Conf Exhib"},{"key":"ref37","author":"silberschatz","year":"1998","journal-title":"Operating System Concepts"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.435"},{"key":"ref35","author":"avriel","year":"2003","journal-title":"Nonlinear Programming Analysis and Methods"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1049\/ip-g-2.1992.0050"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1145\/2647868.2654889"},{"key":"ref40","first-page":"326","article-title":"I\/O Complexity: The red-blue pebble game","author":"hong","year":"1981","journal-title":"Proc 13 Annual ACM Symp On Theory of Computing"},{"key":"ref11","first-page":"1","article-title":"Tensorflow: Large-scale machine learning on heterogeneous distributed systems","author":"abadi","year":"2016","journal-title":"arXiv 1603 04467"},{"key":"ref12","first-page":"1","article-title":"Theano: A CPU and GPU math compiler in Python","author":"bergstra","year":"2010","journal-title":"Proc 9th Python in Science Conf"},{"key":"ref13","first-page":"1","article-title":"Torch7: A matlab-like environment for machine learning","author":"collobert","year":"2011","journal-title":"NIPS Workshop BigLearn"},{"key":"ref14","first-page":"1","article-title":"Comparative study of deep learning software frameworks","author":"bahrampour","year":"2016","journal-title":"ArXiv e-prints"},{"key":"ref15","first-page":"265","article-title":"On optimization methods for deep learning","author":"ngiam","year":"2011","journal-title":"Proc 28th Int Conf Mach Learn"},{"key":"ref16","article-title":"cuBLAS.","year":"0"},{"key":"ref17","first-page":"1","article-title":"cuDNN: Efficient primitives for deep learning","volume":"abs 1410 759","author":"chetlur","year":"2014","journal-title":"CoRR"},{"key":"ref18","article-title":"CUDA C Programming Guide.","year":"0"},{"key":"ref19","first-page":"1135","article-title":"Learning both weights and connections for efficient neural networks","author":"han","year":"2015","journal-title":"Proc 28th Int Conf Neural Inf Process Syst"},{"key":"ref28","article-title":"Microsoft Cognitive Toolkit (CNTK).","year":"0"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1613\/jair.4992"},{"key":"ref27","article-title":"Optimizing Memory Consumption in Deep Learning.","year":"0"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/MSP.2012.2205597"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7298594"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1109\/MICRO.2016.7783721"},{"key":"ref5","first-page":"1","article-title":"Very deep convolutional networks for large-scale image recognition","author":"simonyan","year":"2015","journal-title":"arXiv 1409 1556"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.90"},{"key":"ref7","first-page":"234","article-title":"U-Net: Convolutional networks for biomedical image segmentation","author":"ronneberger","year":"2015","journal-title":"Proc Int Conf Med Image Comput Comput -Assisted Intervention"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2014.81"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7298965"},{"key":"ref1","first-page":"1097","article-title":"ImageNet classification with deep convolutional neural networks","author":"krizhevsky","year":"2012","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref46","first-page":"1","article-title":"TernGrad: Ternary gradients to reduce communication in distributed deep learning","author":"wen","year":"2017","journal-title":"Proc 31st Conf Neural Inf Process Syst"},{"key":"ref20","first-page":"806","article-title":"Sparse convolutional neural networks","author":"liu","year":"2015","journal-title":"Proc IEEE Conf Comput Vis Pattern Recognit"},{"key":"ref45","first-page":"1","article-title":"Efficient communications in training large scale neural networks","author":"wang","year":"2017","journal-title":"arXiv 1611 04255"},{"key":"ref22","first-page":"2849","article-title":"Fixed point quantization of deep convolutional networks","volume":"48","author":"lin","year":"2016","journal-title":"Proc 33rd Int Conf Int Conf Mach Learn"},{"key":"ref21","first-page":"1737","article-title":"Deep learning with limited numerical precision","volume":"37","author":"gupta","year":"2015","journal-title":"Proc Int Conf Int Conf Mach Learn"},{"key":"ref42","first-page":"1","article-title":"Coupling adaptive batch sizes with learning rates","author":"balles","year":"2017","journal-title":"arXiv 1612 05086"},{"key":"ref24","first-page":"1","article-title":"Binarized neural networks: Training deep neural networks with weights and activations constrained to + 1 or -1","author":"courbariaux","year":"2016","journal-title":"arXiv 1602 02830 [cs]"},{"key":"ref41","article-title":"Red-blue and standard pebble games: Complexity and applications in the sequential and parallel models","author":"liu","year":"2017"},{"key":"ref23","first-page":"525","article-title":"XNOR-Net: ImageNet classification using binary convolutional neural networks","author":"rastegari","year":"2016","journal-title":"Proc 14th Eur Conf Comput Vis"},{"key":"ref44","first-page":"1223","article-title":"Large scale distributed deep networks","author":"dean","year":"2012","journal-title":"Proc 25th Int Conf Neural Inf Process Syst"},{"key":"ref26","first-page":"1","article-title":"Training deep nets with sublinear memory cost","author":"chen","year":"2016","journal-title":"arXiv 1604 06174"},{"key":"ref43","first-page":"1","article-title":"Fast training of convolutional networks through FFTs","author":"mathieu","year":"2014","journal-title":"Arxiv 1312 5851"},{"key":"ref25","first-page":"4125","article-title":"Memory-efficient backpropagation through time","author":"gruslys","year":"2016","journal-title":"Proc Adv Neural Inf Process Syst"}],"container-title":["IEEE Transactions on Parallel and Distributed Systems"],"original-title":[],"link":[{"URL":"https:\/\/ieeexplore.ieee.org\/ielaam\/71\/8640283\/8444714-aam.pdf","content-type":"application\/pdf","content-version":"am","intended-application":"syndication"},{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/71\/8640283\/08444714.pdf?arnumber=8444714","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,7,13]],"date-time":"2022-07-13T20:53:48Z","timestamp":1657745628000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/8444714\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2019,3,1]]},"references-count":46,"journal-issue":{"issue":"3"},"URL":"https:\/\/doi.org\/10.1109\/tpds.2018.2866582","relation":{},"ISSN":["1045-9219","1558-2183","2161-9883"],"issn-type":[{"value":"1045-9219","type":"print"},{"value":"1558-2183","type":"electronic"},{"value":"2161-9883","type":"electronic"}],"subject":[],"published":{"date-parts":[[2019,3,1]]}}}