{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,3]],"date-time":"2026-07-03T16:28:20Z","timestamp":1783096100985,"version":"3.54.6"},"reference-count":59,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"4","license":[{"start":{"date-parts":[[2022,10,1]],"date-time":"2022-10-01T00:00:00Z","timestamp":1664582400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2022,10,1]],"date-time":"2022-10-01T00:00:00Z","timestamp":1664582400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2022,10,1]],"date-time":"2022-10-01T00:00:00Z","timestamp":1664582400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"name":"National Key R&amp;D Program of China","award":["2019YFB2102404"],"award-info":[{"award-number":["2019YFB2102404"]}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["61772112"],"award-info":[{"award-number":["61772112"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"name":"Science Innovation Foundation of Dalian","award":["2019J12GX037"],"award-info":[{"award-number":["2019J12GX037"]}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Cloud Comput."],"published-print":{"date-parts":[[2022,10,1]]},"DOI":"10.1109\/tcc.2020.3040312","type":"journal-article","created":{"date-parts":[[2020,11,25]],"date-time":"2020-11-25T02:35:49Z","timestamp":1606271749000},"page":"2564-2579","source":"Crossref","is-referenced-by-count":22,"title":["Efficient Online Scheduling for Coflow-Aware Machine Learning Clusters"],"prefix":"10.1109","volume":"10","author":[{"ORCID":"https:\/\/orcid.org\/0000-0001-8507-0339","authenticated-orcid":false,"given":"Wenxin","family":"Li","sequence":"first","affiliation":[{"name":"Department of Computer Science and Engineering, Hong Kong University of Science and Technology, Hong Kong"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-7038-4407","authenticated-orcid":false,"given":"Sheng","family":"Chen","sequence":"additional","affiliation":[{"name":"Tianjin Key Laboratory of Advanced Networking (TANK), College of Intelligence and Computing, Tianjin University, Tianjin, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Keqiu","family":"Li","sequence":"additional","affiliation":[{"name":"Tianjin Key Laboratory of Advanced Networking (TANK), College of Intelligence and Computing, Tianjin University, Tianjin, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-8770-3934","authenticated-orcid":false,"given":"Heng","family":"Qi","sequence":"additional","affiliation":[{"name":"School of Computer Science and Technology, Dalian University of Technology, Dalian, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-0645-157X","authenticated-orcid":false,"given":"Renhai","family":"Xu","sequence":"additional","affiliation":[{"name":"Tianjin Key Laboratory of Advanced Networking (TANK), College of Intelligence and Computing, Tianjin University, Tianjin, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Song","family":"Zhang","sequence":"additional","affiliation":[{"name":"Tianjin Key Laboratory of Advanced Networking (TANK), College of Intelligence and Computing, Tianjin University, Tianjin, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1145\/1592568.1592576"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1145\/2390231.2390237"},{"key":"ref33","article-title":"MLlib: Machine learning in apache spark","volume":"17","author":"meng","year":"0"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.14778\/2212351.2212354"},{"key":"ref31","first-page":"571","article-title":"Project Adam: Building an efficient and scalable deep learning training system","author":"chilimbi","year":"2014","journal-title":"Proc 11th USENIX Conf Operating Syst Des Implementation"},{"key":"ref30","first-page":"265","article-title":"TensorFlow: A system for large-scale machine learning","author":"abadi","year":"2016","journal-title":"Proc 12th USENIX Conf Operating Syst Des Implementation"},{"key":"ref37","first-page":"693","article-title":"HOGWILD: A lock-free approach to parallelizing stochastic gradient descent","author":"recht","year":"2011","journal-title":"Proc Neural Inf Process Syst"},{"key":"ref36","first-page":"1223","article-title":"More effective distributed ML via a stale synchronous parallel parameter server","author":"ho","year":"2013","journal-title":"Proc 26th Int Conf Neural Inf Process Syst"},{"key":"ref35","article-title":"MxNet: A flexible and efficient machine learning library for heterogeneous distributed systems","author":"chen","year":"2015"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1145\/2647868.2654889"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1109\/TBDATA.2015.2472014"},{"key":"ref27","first-page":"485","article-title":"Tiresias: A GPU cluster manager for distributed deep learning","author":"gu","year":"2019","journal-title":"Proc USENIX NSDI"},{"key":"ref29","first-page":"281","article-title":"Map-reduce for machine learning on multicore","author":"chu","year":"2007","journal-title":"Proc Int Conf Neural Inf Process"},{"key":"ref2","article-title":"Accurate, large minibatch SGD: Training imagenet in 1 hour","author":"goyal","year":"2017"},{"key":"ref1","first-page":"1223","article-title":"Large scale distributed deep networks","author":"dean","year":"2012","journal-title":"Proc 25th Int Conf Neural Inf Process Syst"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1145\/2785956.2787480"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/INFOCOM.2017.8057172"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1145\/2934872.2934880"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1145\/2942358.2942367"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/INFOCOM.2016.7524525"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1109\/INFOCOM.2018.8486340"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1145\/3230543.3230569"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1145\/3190508.3190517"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1109\/INFOCOM.2018.8486319"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.1109\/INFOCOM41043.2020.9155446"},{"key":"ref58","article-title":"Priority-based parameter propagation for distributed DNN training","author":"jayarajan","year":"2019","journal-title":"Proc SysML"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.1109\/ICDCS.2018.00013"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1109\/INFOCOM.2018.8485970"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1109\/TNSM.2020.3027498"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1109\/ICC.2016.7511249"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.1145\/2755573.2755592"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1109\/TPDS.2017.2788003"},{"key":"ref10","article-title":"TicTac: Accelerating distributed deep learning with communication scheduling","author":"hashemi","year":"2019","journal-title":"Proc SysML"},{"key":"ref11","first-page":"629","article-title":"Gaia: Geo-distributed machine learning approaching lan speeds","author":"hsieh","year":"2017","journal-title":"Proc 14th USENIX Conf Netw Syst Des Implementation"},{"key":"ref40","doi-asserted-by":"crossref","first-page":"39","DOI":"10.1145\/1594977.1592575","article-title":"Portland: A scalable fault-tolerant layer 2 data center network fabric","author":"mysore","year":"2009","journal-title":"Proc ACM SIGCOMM Comput Commun Rev"},{"key":"ref12","first-page":"583","article-title":"Scaling distributed machine learning with the parameter server","author":"li","year":"2014","journal-title":"Proc 11th USENIX Conf Operating Syst Des Implementation"},{"key":"ref13","first-page":"19","article-title":"Communication efficient distributed machine learning with the parameter server","author":"li","year":"2014","journal-title":"Proc Int Conf Neural Inf Process"},{"key":"ref14","article-title":"Multi-tenant GPU clusters for deep learning workloads: Analysis and implications","author":"jeon","year":"2018"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1145\/3035918.3035933"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1145\/2018436.2018448"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1145\/2619239.2626315"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/INFOCOM.2015.7218408"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1145\/2619239.2626322"},{"key":"ref4","first-page":"595","article-title":"Gandiva: Introspective cluster scheduling for deep learning","author":"xiao","year":"2018","journal-title":"Proc 13th USENIX Conf Operating Syst Des Implementation"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA.2018.00059"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1145\/3267809.3267840"},{"key":"ref5","article-title":"Highly scalable deep learning training system with mixed-precision: Training imagenet in four minutes","author":"jia","year":"2018"},{"key":"ref8","first-page":"181","article-title":"Poseidon: An efficient communication architecture for distributed deep learning on GPU clusters","author":"zhang","year":"2017","journal-title":"Proc USENIX Conf USENIX Annu Tech Conf"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1145\/3079856.3080246"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1145\/3341301.3359642"},{"key":"ref9","first-page":"1707","article-title":"QSGD: Communication-efficient SGD via gradient quantization and encoding","author":"alistarh","year":"2017","journal-title":"Proc 31st Int Conf Neural Inf Process Syst"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1145\/2785956.2787496"},{"key":"ref45","first-page":"1929","article-title":"Dropout: A simple way to prevent neural networks from overfitting","volume":"15","author":"srivastava","year":"2014","journal-title":"J Mach Learn Res"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1145\/3230543.3230551"},{"key":"ref47","first-page":"455","article-title":"Information-agnostic flow scheduling for commodity data centers","author":"bai","year":"2015","journal-title":"Proc USENIX NSDI"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1145\/2486001.2486031"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1145\/3230543.3230564"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1145\/792538.792545"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1145\/2342356.2342389"}],"container-title":["IEEE Transactions on Cloud Computing"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/6245519\/9970353\/09269382.pdf?arnumber=9269382","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,12,26]],"date-time":"2022-12-26T19:13:46Z","timestamp":1672082026000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/9269382\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2022,10,1]]},"references-count":59,"journal-issue":{"issue":"4"},"URL":"https:\/\/doi.org\/10.1109\/tcc.2020.3040312","relation":{},"ISSN":["2168-7161","2372-0018"],"issn-type":[{"value":"2168-7161","type":"electronic"},{"value":"2372-0018","type":"electronic"}],"subject":[],"published":{"date-parts":[[2022,10,1]]}}}