{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,8,18]],"date-time":"2026-08-18T00:35:22Z","timestamp":1787013322720,"version":"build-2736575974"},"reference-count":74,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"4","license":[{"start":{"date-parts":[[2025,8,1]],"date-time":"2025-08-01T00:00:00Z","timestamp":1754006400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2025,8,1]],"date-time":"2025-08-01T00:00:00Z","timestamp":1754006400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2025,8,1]],"date-time":"2025-08-01T00:00:00Z","timestamp":1754006400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/501100013142","name":"Key Research and Development Project of Henan Province","doi-asserted-by":"publisher","award":["241111211300"],"award-info":[{"award-number":["241111211300"]}],"id":[{"id":"10.13039\/501100013142","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Netw."],"published-print":{"date-parts":[[2025,8]]},"DOI":"10.1109\/ton.2025.3539430","type":"journal-article","created":{"date-parts":[[2025,2,25]],"date-time":"2025-02-25T13:46:39Z","timestamp":1740491199000},"page":"1559-1573","source":"Crossref","is-referenced-by-count":6,"title":["Revisiting the In-Network Aggregation in Distributed Machine Learning"],"prefix":"10.1109","volume":"33","author":[{"ORCID":"https:\/\/orcid.org\/0009-0007-8726-6352","authenticated-orcid":false,"given":"Haowen","family":"Zhu","sequence":"first","affiliation":[{"name":"Beijing Institute of Technology, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-7314-410X","authenticated-orcid":false,"given":"Zehua","family":"Guo","sequence":"additional","affiliation":[{"name":"Beijing Institute of Technology, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1145\/3377454"},{"key":"ref2","first-page":"1","article-title":"Communication efficient distributed machine learning with the parameter server","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"27","author":"Li"},{"key":"ref3","article-title":"TensorFlow: Large-scale machine learning on heterogeneous distributed systems","author":"Abadi","year":"2016","journal-title":"arXiv:1603.04467"},{"key":"ref4","article-title":"MXNet: A flexible and efficient machine learning library for heterogeneous distributed systems","author":"Chen","year":"2015","journal-title":"arXiv:1512.01274"},{"key":"ref5","first-page":"1","article-title":"PyTorch: An imperative style, high-performance deep learning library","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"32","author":"Paszke"},{"key":"ref6","article-title":"Performance analysis and comparison of distributed machine learning systems","author":"Alqahtani","year":"2019","journal-title":"arXiv:1909.02061"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/INFOCOM.2019.8737602"},{"key":"ref8","article-title":"Using DeepSpeed and megatron to train megatron-turing NLG 530B, a large-scale generative language model","author":"Smith","year":"2022","journal-title":"arXiv:2201.11990"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1145\/3152434.3152461"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1145\/2656877.2656890"},{"key":"ref11","first-page":"29","article-title":"Camdoop: Exploiting in-network aggregation for big data applications","volume-title":"Proc. 9th USENIX Symp. Networked Syst. Design Implement.","author":"Costa"},{"key":"ref12","first-page":"741","article-title":"ATP: In-network aggregation for multi-tenant learning","volume-title":"Proc. 18th USENIX Symp. Networked Syst. Design Implement.","author":"Lao"},{"key":"ref13","volume-title":"Intel Tofino","year":"2023"},{"key":"ref14","volume-title":"Nvidia Spectrum","year":"2023"},{"key":"ref15","volume-title":"Netfpga","year":"2023"},{"key":"ref16","article-title":"Scaling distributed machine learning with in-network aggregation","author":"Sapio","year":"2019","journal-title":"arXiv:1903.06701"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/TNET.2023.3244794"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/IWQoS57198.2023.10188783"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/COMST.2016.2558818"},{"key":"ref20","first-page":"378","article-title":"Multipath congestion control for shared bottleneck","volume-title":"Proc. PFLDNeT Workshop","author":"Honda"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1016\/0098-1354(93)80015-F"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/GLOCOM.2016.7842042"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1007\/BF02579324"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1145\/3037697.3037731"},{"key":"ref25","first-page":"829","article-title":"In-network aggregation for shared machine learning clusters","volume-title":"Proc. Mach. Learn. Syst.","volume":"3","author":"Gebara"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1109\/IWCMC51323.2021.9498844"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/NetSoft51509.2021.9492644"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1145\/1851182.1851192"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1145\/1402946.1402967"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1109\/MELCON.2016.7495430"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1145\/2829988.2787507"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/TNET.2019.2930721"},{"key":"ref33","first-page":"156","article-title":"Computing the shortest path: A search meets graph theory","volume-title":"Proc. SODA","volume":"5","author":"Goldberg"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1016\/s0167-5060(08)70755-6"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1007\/s10100-016-0437-8"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1109\/MMAR.2013.6670011"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1109\/INFOCOM41043.2020.9155396"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1109\/INFOCOM.2015.7218408"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1016\/S0377-0427(00)00433-7"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1007\/BF01580724"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1109\/GLOCOM.2018.8647774"},{"key":"ref42","first-page":"1","article-title":"Large scale distributed deep networks","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"25","author":"Dean"},{"issue":"1","key":"ref43","first-page":"65","article-title":"Branch-and-cut algorithms for combinatorial optimization problems","volume-title":"Handbook of Applied Optimization","volume":"1","author":"Mitchell","year":"2002"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.48550\/ARXIV.1906.00091"},{"key":"ref45","article-title":"BLOOM: A 176B-parameter open-access multilingual language model","author":"Scao","year":"2022","journal-title":"arXiv:2211.05100"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1109\/JSYST.2019.2953771"},{"key":"ref47","volume-title":"Behavioral Model Version 2 (BMV2)","year":"2023"},{"key":"ref48","volume-title":"An Instant Virtual Network on Your Laptop","year":"2023"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1109\/GLOBECOM46510.2021.9685530"},{"key":"ref50","volume-title":"NS-3 Network Simulator","year":"2023"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1145\/1355734.1355746"},{"key":"ref52","volume-title":"NS-3 OpenFlow Switch Support","year":"2023"},{"key":"ref53","volume-title":"The CIFAR-10 Dataset","year":"2023"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.243"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.308"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.90"},{"key":"ref57","article-title":"Very deep convolutional networks for large-scale image recognition","author":"Simonyan","year":"2014","journal-title":"arXiv:1409.1556"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.1109\/INFOCOM41043.2020.9155282"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.1109\/ICCCN58024.2023.10230140"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1145\/3485983.3494853"},{"key":"ref61","doi-asserted-by":"publisher","DOI":"10.1109\/MNET.107.2100635"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.1145\/3589334.3645394"},{"key":"ref63","doi-asserted-by":"publisher","DOI":"10.1145\/3617232.3624863"},{"key":"ref64","first-page":"279","article-title":"Accelerating distributed reinforcement learning with in-switch computing","volume-title":"Proc. ACM\/IEEE 46th Annu. Int. Symp. Comput. Archit. (ISCA)","author":"Li"},{"key":"ref65","doi-asserted-by":"publisher","DOI":"10.1145\/2934872.2934908"},{"key":"ref66","article-title":"NetReduce: RDMA-compatible in-network reduction for distributed DNN training acceleration","author":"Liu","year":"2020","journal-title":"arXiv:2009.09736"},{"key":"ref67","article-title":"Enabling fast and flexible distributed deep learning with programmable switches","author":"Pan","year":"2022","journal-title":"arXiv:2205.05243"},{"key":"ref68","first-page":"199","article-title":"NetRPC: Enabling in-network computation in remote procedure calls","volume-title":"Proc. 20th USENIX Symp. Networked Syst. Design Implement.","author":"Zhao"},{"key":"ref69","doi-asserted-by":"publisher","DOI":"10.1145\/3575693.3575708"},{"key":"ref70","article-title":"P4COM: In-network computation with programmable switches","author":"Chen","year":"2021","journal-title":"arXiv:2107.13694"},{"key":"ref71","first-page":"17","article-title":"Catch the whole lot in an action: Rapid precise packet loss notification in data center","volume-title":"Proc. USENIX NSDI","author":"Cheng"},{"key":"ref72","doi-asserted-by":"publisher","DOI":"10.1145\/3289602.3293963"},{"key":"ref73","article-title":"Efficient data-plane memory scheduling for in-network aggregation","author":"Wang","year":"2022","journal-title":"arXiv:2201.06398"},{"key":"ref74","doi-asserted-by":"publisher","DOI":"10.1109\/INFOCOM53939.2023.10228956"}],"container-title":["IEEE Transactions on Networking"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/10723154\/11131549\/10903204.pdf?arnumber=10903204","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,8,23]],"date-time":"2025-08-23T00:52:01Z","timestamp":1755910321000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/10903204\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,8]]},"references-count":74,"journal-issue":{"issue":"4"},"URL":"https:\/\/doi.org\/10.1109\/ton.2025.3539430","relation":{},"ISSN":["2998-4157"],"issn-type":[{"value":"2998-4157","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,8]]}}}