{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,2]],"date-time":"2026-06-02T02:54:35Z","timestamp":1780368875476,"version":"3.54.1"},"reference-count":45,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"6","license":[{"start":{"date-parts":[[2024,12,1]],"date-time":"2024-12-01T00:00:00Z","timestamp":1733011200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2024,12,1]],"date-time":"2024-12-01T00:00:00Z","timestamp":1733011200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2024,12,1]],"date-time":"2024-12-01T00:00:00Z","timestamp":1733011200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["61702267"],"award-info":[{"award-number":["61702267"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100012166","name":"National Key R&D Program of China","doi-asserted-by":"crossref","award":["2020YFB1805503"],"award-info":[{"award-number":["2020YFB1805503"]}],"id":[{"id":"10.13039\/501100012166","id-type":"DOI","asserted-by":"crossref"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Netw. Serv. Manage."],"published-print":{"date-parts":[[2024,12]]},"DOI":"10.1109\/tnsm.2024.3461875","type":"journal-article","created":{"date-parts":[[2024,9,16]],"date-time":"2024-09-16T17:58:41Z","timestamp":1726509521000},"page":"6112-6125","source":"Crossref","is-referenced-by-count":3,"title":["A Fine-Grained Packet Loss Tolerance Transmission Algorithm for Communication Optimization in Distributed Deep Learning"],"prefix":"10.1109","volume":"21","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-1352-5418","authenticated-orcid":false,"given":"Yifei","family":"Lu","sequence":"first","affiliation":[{"name":"School of Computer Science and Engineering, Nanjing University of Science and Technology, Nanjing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jingqi","family":"Li","sequence":"additional","affiliation":[{"name":"School of Computer Science and Engineering, Nanjing University of Science and Technology, Nanjing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Shuren","family":"Li","sequence":"additional","affiliation":[{"name":"School of Computer Science and Engineering, Nanjing University of Science and Technology, Nanjing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Chanying","family":"Huang","sequence":"additional","affiliation":[{"name":"School of Computer Science and Engineering, Nanjing University of Science and Technology, Nanjing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.5555\/2999134.2999257"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2014.223"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/MSP.2012.2205597"},{"key":"ref4","first-page":"4171","article-title":"Bert: Pre-training of deep bidirectional transformers for language understanding","volume-title":"Proc. NAACL-HLT","author":"Kenton"},{"key":"ref5","first-page":"485","article-title":"Tiresias: A GPU cluster manager for distributed deep learning","volume-title":"Proc. 16th USENIX Symp. Netw. Syst. Design Implement. (NSDI)","author":"Gu"},{"key":"ref6","first-page":"947","article-title":"Analysis of large-scale multi-tenant GPU clusters for DNN training workloads","volume-title":"Proc. USENIX Annu. Tech. Conf. (USENIX ATC)","author":"Jeon"},{"key":"ref7","volume-title":"Steel for the AI Age: DGX SuperPOD Reaches New Heights with NVIDIA DGX A100","author":"Paikeday","year":"2020"},{"key":"ref8","first-page":"595","article-title":"Gandiva: Introspective cluster scheduling for deep learning","volume-title":"Proc. 13th USENIX Symp. Oper. Syst. Design Implement. (OSDI)","author":"Xiao"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1145\/3320060"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/INFOCOM.2019.8737587"},{"key":"ref11","first-page":"181","article-title":"Poseidon: An efficient communication architecture for distributed deep learning on GPU clusters","volume-title":"Proc. USENIX Annu. Tech. Conf. (USENIX ATC)","author":"Zhang"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1145\/3627703.3629554"},{"key":"ref13","article-title":"Deep gradient compression: Reducing the communication bandwidth for distributed training","author":"Lin","year":"2017","journal-title":"arXiv:1712.01887"},{"key":"ref14","first-page":"1306","article-title":"Gradient sparsification for communication-efficient distributed optimization","volume-title":"Proc. 32nd Int. Conf. Neural Inf. Process. Syst.","author":"Wangni"},{"key":"ref15","first-page":"1223","article-title":"More effective distributed ML via a stale synchronous parallel parameter server","volume-title":"Proc. 26th Int. Conf. Neural Inf. Process. Syst.","author":"Ho"},{"key":"ref16","first-page":"629","article-title":"Gaia: Geo-distributed machine learning approaching LAN speeds","volume-title":"Proc. 14th USENIX Symp. Netw. Syst. Design Implement. (NSDI)","author":"Hsieh"},{"key":"ref17","first-page":"418","article-title":"TicTac: Accelerating distributed deep learning with communication scheduling","volume-title":"Proc. Mach. Learn. Syst.","author":"Hashemi"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.48550\/arxiv.1811.06965"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1145\/3341301.3359642"},{"key":"ref20","first-page":"132","article-title":"Priority-based parameter propagation for distributed DNN training","volume-title":"Proc. Mach. Learn. Syst.","author":"Jayarajan"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/TNET.2017.2669216"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/TNET.2016.2594235"},{"key":"ref23","article-title":"Domain-specific communication optimization for distributed DNN training","author":"Hao","year":"2020","journal-title":"arXiv:2008.08445"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1038\/nature14539"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-7908-2604-3_16"},{"key":"ref26","article-title":"Adam: A method for stochastic optimization","author":"Kingma","year":"2014","journal-title":"arXiv:1412.6980"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1016\/S0893-6080(98)00116-6"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.5555\/2685048.2685095"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1016\/j.jpdc.2008.09.002"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1016\/j.comnet.2024.110457"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1145\/1851275.1851192"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/ICC45855.2022.9839224"},{"key":"ref33","article-title":"QSGD: Communication-efficient SGD via gradient Quantization and encoding","volume-title":"Advances in Neural Information Processing Systems","volume":"30","author":"Alistarh","year":"2017"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1016\/j.comnet.2023.109777"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1145\/3341301.3359646"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1109\/TPDS.2023.3247883"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1145\/3343180.3343186"},{"key":"ref38","first-page":"1421","article-title":"Towards domain-specific network transport for distributed DNN training","volume-title":"Proc. 21st USENIX Symp. Netw. Syst. Design Implement. (NSDI)","author":"Wang"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1109\/IWQoS57198.2023.10188699"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1145\/3663408.3663432"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1137\/16M1080173"},{"key":"ref42","article-title":"Polynomially coded regression: Optimal straggler mitigation via data encoding","author":"Li","year":"2018","journal-title":"arXiv:1805.09934"},{"key":"ref43","first-page":"3320","article-title":"How transferable are features in deep neural networks?","volume-title":"Proc. 27th Int. Conf. Neural Inf. Process. Syst.","author":"Yosinski"},{"key":"ref44","volume-title":"ns 3","year":"2011"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.17487\/rfc5681"}],"container-title":["IEEE Transactions on Network and Service Management"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/4275028\/10807691\/10681145.pdf?arnumber=10681145","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,12,20]],"date-time":"2024-12-20T06:08:20Z","timestamp":1734674900000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/10681145\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,12]]},"references-count":45,"journal-issue":{"issue":"6"},"URL":"https:\/\/doi.org\/10.1109\/tnsm.2024.3461875","relation":{},"ISSN":["1932-4537","2373-7379"],"issn-type":[{"value":"1932-4537","type":"electronic"},{"value":"2373-7379","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024,12]]}}}