{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,11]],"date-time":"2026-07-11T15:46:02Z","timestamp":1783784762497,"version":"3.55.0"},"publisher-location":"New York, NY, USA","reference-count":61,"publisher":"ACM","funder":[{"name":"National Key Research and Development Program of China","award":["2025YFB3003702"],"award-info":[{"award-number":["2025YFB3003702"]}]},{"name":"National Natural Science Founda tion of China","award":["62032023"],"award-info":[{"award-number":["62032023"]}]},{"name":"National Natural Science Founda tion of China","award":["T2125013"],"award-info":[{"award-number":["T2125013"]}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2026,1,28]]},"DOI":"10.1145\/3774934.3786432","type":"proceedings-article","created":{"date-parts":[[2026,1,28]],"date-time":"2026-01-28T15:25:57Z","timestamp":1769613957000},"page":"384-397","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":2,"title":["COCCL: A Collective Communication Library Supporting Easy Integration and Configuration of Customized Compression for Scalable LLM Training"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0009-0006-9410-5365","authenticated-orcid":false,"given":"Xingchen","family":"Liu","sequence":"first","affiliation":[{"name":"University of Chinese Academy of Sciences, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0008-8265-5698","authenticated-orcid":false,"given":"Haoran","family":"Kong","sequence":"additional","affiliation":[{"name":"Shenzhen Loop Area Institute, Shenzhen, China"},{"name":"Chinese University of Hong Kong, Shenzhen, Shenzhen, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0008-7081-5172","authenticated-orcid":false,"given":"Hairui","family":"Zhao","sequence":"additional","affiliation":[{"name":"Jilin University, Jilin, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0000-3264-6074","authenticated-orcid":false,"given":"Shengkai","family":"Lyu","sequence":"additional","affiliation":[{"name":"University of Chinese Academy of Sciences, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0001-8263-1986","authenticated-orcid":false,"given":"Zheng","family":"Wei","sequence":"additional","affiliation":[{"name":"University of Chinese Academy of Sciences, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0006-7390-0220","authenticated-orcid":false,"given":"Man","family":"Liu","sequence":"additional","affiliation":[{"name":"University of Chinese Academy of Sciences, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0005-1880-7886","authenticated-orcid":false,"given":"Xingjian","family":"Tian","sequence":"additional","affiliation":[{"name":"University of Chinese Academy of Sciences, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0007-0447-7171","authenticated-orcid":false,"given":"Liyang","family":"Zhao","sequence":"additional","affiliation":[{"name":"University of Chinese Academy of Sciences, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0001-1920-2855","authenticated-orcid":false,"given":"Zhuohan","family":"Chen","sequence":"additional","affiliation":[{"name":"University of Chinese Academy of Sciences, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0001-5522-0217","authenticated-orcid":false,"given":"Fakang","family":"Wang","sequence":"additional","affiliation":[{"name":"Ant Group, Hangzhou, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-2578-4940","authenticated-orcid":false,"given":"Zizhong","family":"Chen","sequence":"additional","affiliation":[{"name":"Shenzhen Loop Area Institute, Shenzhen, China"},{"name":"Chinese University of Hong Kong, Shenzhen, Shenzhen, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0003-4274-7671","authenticated-orcid":false,"given":"Zhan","family":"Wang","sequence":"additional","affiliation":[{"name":"University of Chinese Academy of Sciences, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-6361-5948","authenticated-orcid":false,"given":"Guangming","family":"Tan","sequence":"additional","affiliation":[{"name":"University of Chinese Academy of Sciences, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-5422-4497","authenticated-orcid":false,"given":"Dingwen","family":"Tao","sequence":"additional","affiliation":[{"name":"University of Chinese Academy of Sciences, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"320","published-online":{"date-parts":[[2026,1,28]]},"reference":[{"key":"e_1_3_2_2_1_1","unstructured":"2016. nccl-tests. https:\/\/github.com\/NVIDIA\/nccl-tests"},{"key":"e_1_3_2_2_2_1","doi-asserted-by":"publisher","DOI":"10.1145\/3477132.3483553"},{"key":"e_1_3_2_2_3_1","first-page":"239","article-title":"Does compressing activations help model parallel training","volume":"6","author":"Bian Song","year":"2024","unstructured":"Song Bian, Dacheng Li, Hongyi Wang, Eric P Xing, and Shivaram Venkataraman. 2024. Does compressing activations help model parallel training? Proceedings of Machine Learning and Systems, 6 (2024), 239\u2013252.","journal-title":"Proceedings of Machine Learning and Systems"},{"key":"e_1_3_2_2_4_1","doi-asserted-by":"publisher","DOI":"10.1145\/3437801.3441620"},{"key":"e_1_3_2_2_5_1","doi-asserted-by":"crossref","unstructured":"Chuyan Chen Yutong He Pengrui Li Weichen Jia and Kun Yuan. 2025. Greedy Low-Rank Gradient Compression for Distributed Learning with Convergence Guarantees. arXiv preprint arXiv:2507.08784.","DOI":"10.1109\/CloudCom67567.2025.11331531"},{"key":"e_1_3_2_2_6_1","doi-asserted-by":"publisher","DOI":"10.1145\/3620666.3651379"},{"key":"e_1_3_2_2_7_1","doi-asserted-by":"publisher","DOI":"10.1145\/3669940.3707223"},{"key":"e_1_3_2_2_8_1","first-page":"1","article-title":"Palm: Scaling language modeling with pathways","volume":"24","author":"Chowdhery Aakanksha","year":"2023","unstructured":"Aakanksha Chowdhery, Sharan Narang, Jacob Devlin, Maarten Bosma, Gaurav Mishra, Adam Roberts, Paul Barham, Hyung Won Chung, Charles Sutton, Sebastian Gehrmann, et al. 2023. Palm: Scaling language modeling with pathways. Journal of Machine Learning Research, 24, 240 (2023), 1\u2013113.","journal-title":"Journal of Machine Learning Research"},{"key":"e_1_3_2_2_9_1","doi-asserted-by":"publisher","DOI":"10.1145\/3575693.3575724"},{"key":"e_1_3_2_2_10_1","volume-title":"21st USENIX Symposium on Networked Systems Design and Implementation (NSDI 24)","author":"Sensi Daniele De","year":"2024","unstructured":"Daniele De Sensi, Tommaso Bonato, David Saam, and Torsten Hoefler. 2024. Swing: Short-cutting rings for higher bandwidth allreduce. In 21st USENIX Symposium on Networked Systems Design and Implementation (NSDI 24). 1445\u20131462."},{"key":"e_1_3_2_2_11_1","doi-asserted-by":"publisher","DOI":"10.1145\/3437801.3441593"},{"key":"e_1_3_2_2_12_1","doi-asserted-by":"crossref","unstructured":"Hao Feng Boyuan Zhang Fanjiang Ye Min Si Ching-Hsiang Chu Jiannan Tian Chunxing Yin Summer Deng Yuchen Hao Pavan Balaji et al. 2024. Accelerating Communication in Deep Learning Recommendation Model Training with Dual-Level Adaptive Lossy Compression. In SC24: International Conference for High Performance Computing Networking Storage and Analysis. 1\u201316.","DOI":"10.1109\/SC41406.2024.00095"},{"key":"e_1_3_2_2_13_1","doi-asserted-by":"publisher","DOI":"10.14778\/3503585.3503590"},{"key":"e_1_3_2_2_14_1","unstructured":"Leo Gao Stella Biderman Sid Black Laurence Golding Travis Hoppe Charles Foster Jason Phang Horace He Anish Thite Noa Nabeshima et al. 2020. The pile: An 800gb dataset of diverse text for language modeling. arXiv preprint arXiv:2101.00027."},{"key":"e_1_3_2_2_15_1","unstructured":"Guangxin He Yuan Cao Yutong He Tianyi Bai Kun Yuan and Binhang Yuan. 2025. TAH-QUANT: Effective Activation Quantization in Pipeline Parallelism over Slow Network. arXiv preprint arXiv:2506.01352."},{"key":"e_1_3_2_2_16_1","doi-asserted-by":"publisher","DOI":"10.1117\/12.3031956"},{"key":"e_1_3_2_2_17_1","doi-asserted-by":"publisher","DOI":"10.1109\/HOTI66940.2025.00024"},{"key":"e_1_3_2_2_18_1","doi-asserted-by":"publisher","DOI":"10.1145\/3721145.3733642"},{"key":"e_1_3_2_2_19_1","doi-asserted-by":"publisher","DOI":"10.1145\/3650200.3656636"},{"key":"e_1_3_2_2_20_1","doi-asserted-by":"publisher","DOI":"10.1145\/3712285.3759825"},{"key":"e_1_3_2_2_21_1","volume-title":"Gpipe: Efficient training of giant neural networks using pipeline parallelism. Advances in neural information processing systems, 32","author":"Huang Yanping","year":"2019","unstructured":"Yanping Huang, Youlong Cheng, Ankur Bapna, Orhan Firat, Dehao Chen, Mia Chen, HyoukJoong Lee, Jiquan Ngiam, Quoc V Le, Yonghui Wu, et al. 2019. Gpipe: Efficient training of giant neural networks using pipeline parallelism. Advances in neural information processing systems, 32 (2019)."},{"key":"e_1_3_2_2_22_1","doi-asserted-by":"publisher","DOI":"10.1109\/SC41406.2024.00021"},{"key":"e_1_3_2_2_23_1","doi-asserted-by":"publisher","DOI":"10.1145\/3503222.3507778"},{"key":"e_1_3_2_2_24_1","first-page":"8734","article-title":"Sdp4bit: Toward 4-bit communication quantization in sharded data parallelism for LLM training","volume":"37","author":"Jia Jinda","year":"2024","unstructured":"Jinda Jia, Cong Xie, Hanlin Lu, Daoce Wang, Hao Feng, Chengming Zhang, Baixi Sun, Haibin Lin, Zhi Zhang, Xin Liu, et al. 2024. Sdp4bit: Toward 4-bit communication quantization in sharded data parallelism for LLM training. Advances in Neural Information Processing Systems, 37 (2024), 8734\u20138759.","journal-title":"Advances in Neural Information Processing Systems"},{"key":"e_1_3_2_2_25_1","unstructured":"Xianyan Jia Shutao Song Wei He Yangzihao Wang Haidong Rong Feihu Zhou Liqiang Xie Zhenyu Guo Yuanzhou Yang Liwei Yu Tiegang Chen Guangxiao Hu Shaohuai Shi and Xiaowen Chu. 2018. Highly Scalable Deep Learning Training System with Mixed-Precision: Training ImageNet in Four Minutes. arxiv:1807.11205. arxiv:1807.11205"},{"key":"e_1_3_2_2_26_1","volume-title":"21st USENIX Symposium on Networked Systems Design and Implementation (NSDI 24)","author":"Jiang Ziheng","year":"2024","unstructured":"Ziheng Jiang, Haibin Lin, Yinmin Zhong, Qi Huang, Yangrui Chen, Zhi Zhang, Yanghua Peng, Xiang Li, Cong Xie, Shibiao Nong, et al. 2024. $MegaScale$: Scaling large language model training to more than 10,000 $GPUs$. In 21st USENIX Symposium on Networked Systems Design and Implementation (NSDI 24). 745\u2013760."},{"key":"e_1_3_2_2_27_1","doi-asserted-by":"publisher","DOI":"10.1145\/3620666.3651362"},{"key":"e_1_3_2_2_28_1","volume-title":"2023 USENIX Annual Technical Conference (USENIX ATC 23)","author":"Li Jiamin","year":"2023","unstructured":"Jiamin Li, Yimin Jiang, Yibo Zhu, Cong Wang, and Hong Xu. 2023. Accelerating distributed $MoE$ training and inference with lina. In 2023 USENIX Annual Technical Conference (USENIX ATC 23). 945\u2013959."},{"key":"e_1_3_2_2_29_1","doi-asserted-by":"publisher","DOI":"10.1109\/TPDS.2024.3406420"},{"key":"e_1_3_2_2_30_1","volume-title":"18th USENIX Symposium on Operating Systems Design and Implementation (OSDI 24)","author":"Lin Zhiqi","year":"2024","unstructured":"Zhiqi Lin, Youshan Miao, Quanlu Zhang, Fan Yang, Yi Zhu, Cheng Li, Saeed Maleki, Xu Cao, Ning Shang, Yilei Yang, et al. 2024. $nnScaler$:$Constraint-Guided$ Parallelization Plan Generation for Deep Learning Training. In 18th USENIX Symposium on Operating Systems Design and Implementation (OSDI 24). 347\u2013363."},{"key":"e_1_3_2_2_31_1","doi-asserted-by":"publisher","DOI":"10.1109\/TVCG.2014.2346458"},{"key":"e_1_3_2_2_32_1","doi-asserted-by":"publisher","DOI":"10.1109\/SC41406.2024.00019"},{"key":"e_1_3_2_2_33_1","doi-asserted-by":"publisher","DOI":"10.1145\/3528535.3565248"},{"key":"e_1_3_2_2_34_1","doi-asserted-by":"publisher","DOI":"10.1145\/3458817.3476209"},{"key":"e_1_3_2_2_35_1","unstructured":"Maxim Naumov John Kim Dheevatsa Mudigere Srinivas Sridharan Xiaodong Wang Whitney Zhao Serhat Yilmaz Changkyu Kim Hector Yuen Mustafa Ozdal et al. 2020. Deep learning training in facebook data centers: Design of scale-up and scale-out systems. arXiv preprint arXiv:2003.09518."},{"key":"e_1_3_2_2_36_1","unstructured":"NBCL. 2025. MVAPICH-Plus 4.1GA. https:\/\/mvapich.cse.ohio-state.edu Accessed: 2025-08-21"},{"key":"e_1_3_2_2_37_1","unstructured":"NVIDIA. 2025. NCCL (NVIDIA Collective Communications Library). https:\/\/github.com\/NVIDIA\/nccl"},{"key":"e_1_3_2_2_38_1","unstructured":"NVIDIA Corporation. 2024. nvCOMP: NVIDIA Compression Library. https:\/\/github.com\/NVIDIA\/nvcomp Accessed: 2025-04-10"},{"key":"e_1_3_2_2_39_1","volume-title":"Zhangir Azerbayev, and Jimmy Ba.","author":"Paster Keiran","year":"2023","unstructured":"Keiran Paster, Marco Dos Santos, Zhangir Azerbayev, and Jimmy Ba. 2023. OpenWebMath: An Open Dataset of High-Quality Mathematical Web Text. arxiv:2310.06786."},{"key":"e_1_3_2_2_40_1","volume-title":"Pytorch: An imperative style, high-performance deep learning library. Advances in neural information processing systems, 32","author":"Paszke Adam","year":"2019","unstructured":"Adam Paszke, Sam Gross, Francisco Massa, Adam Lerer, James Bradbury, Gregory Chanan, Trevor Killeen, Zeming Lin, Natalia Gimelshein, Luca Antiga, et al. 2019. Pytorch: An imperative style, high-performance deep learning library. Advances in neural information processing systems, 32 (2019)."},{"key":"e_1_3_2_2_41_1","volume-title":"International conference on machine learning. 18332\u201318346","author":"Rajbhandari Samyam","year":"2022","unstructured":"Samyam Rajbhandari, Conglong Li, Zhewei Yao, Minjia Zhang, Reza Yazdani Aminabadi, Ammar Ahmad Awan, Jeff Rasley, and Yuxiong He. 2022. Deepspeed-moe: Advancing mixture-of-experts inference and training to power next-generation ai scale. In International conference on machine learning. 18332\u201318346."},{"key":"e_1_3_2_2_42_1","volume-title":"Beyond Top-K: Structured Sparsification for Compression in Pipeline Parallel. In ICLR 2025 Workshop on Modularity for Collaborative, Decentralized, and Continual Deep Learning.","author":"Ramasinghe Sameera","unstructured":"Sameera Ramasinghe, Thalaiyasingam Ajanthan, Gil Avraham, Yan Zuo, and Alexander Long. [n. d.]. Beyond Top-K: Structured Sparsification for Compression in Pipeline Parallel. In ICLR 2025 Workshop on Modularity for Collaborative, Decentralized, and Continual Deep Learning."},{"key":"e_1_3_2_2_43_1","unstructured":"Meta Research. 2022. DietGPU: GPU-Accelerated ANS Entropy Coding for Machine Learning."},{"key":"e_1_3_2_2_44_1","volume-title":"20th USENIX Symposium on Networked Systems Design and Implementation (NSDI 23)","author":"Shah Aashaka","year":"2023","unstructured":"Aashaka Shah, Vijay Chidambaram, Meghan Cowan, Saeed Maleki, Madan Musuvathi, Todd Mytkowicz, Jacob Nelson, Olli Saarikivi, and Rachee Singh. 2023. $TACCL$: Guiding collective algorithm synthesis using communication sketches. In 20th USENIX Symposium on Networked Systems Design and Implementation (NSDI 23). 593\u2013612."},{"key":"e_1_3_2_2_45_1","volume-title":"Megatron-lm: Training multi-billion parameter language models using model parallelism. arXiv preprint arXiv:1909.08053.","author":"Shoeybi Mohammad","year":"2019","unstructured":"Mohammad Shoeybi, Mostofa Patwary, Raul Puri, Patrick LeGresley, Jared Casper, and Bryan Catanzaro. 2019. Megatron-lm: Training multi-billion parameter language models using model parallelism. arXiv preprint arXiv:1909.08053."},{"key":"e_1_3_2_2_46_1","doi-asserted-by":"publisher","DOI":"10.1145\/3575693.3575712"},{"key":"e_1_3_2_2_47_1","doi-asserted-by":"publisher","DOI":"10.1145\/3710848.3710852"},{"key":"e_1_3_2_2_48_1","unstructured":"Qwen Team. 2024. Qwen2.5: A Party of Foundation Models. https:\/\/qwenlm.github.io\/blog\/qwen2.5\/"},{"key":"e_1_3_2_2_49_1","doi-asserted-by":"publisher","DOI":"10.1145\/3410463.3414624"},{"key":"e_1_3_2_2_50_1","volume-title":"16th USENIX Symposium on Operating Systems Design and Implementation (OSDI 22)","author":"Unger Colin","year":"2022","unstructured":"Colin Unger, Zhihao Jia, Wei Wu, Sina Lin, Mandeep Baines, Carlos Efrain Quintero Narvaez, Vinay Ramakrishnaiah, Nirmal Prajapati, Pat McCormick, Jamaludin Mohd-Yusof, et al. 2022. Unity: Accelerating $DNN$ training through joint optimization of algebraic transformations and parallelization. In 16th USENIX Symposium on Operating Systems Design and Implementation (OSDI 22). 267\u2013284."},{"key":"e_1_3_2_2_51_1","doi-asserted-by":"publisher","DOI":"10.1145\/3567955.3567959"},{"key":"e_1_3_2_2_52_1","volume-title":"20th USENIX Symposium on Networked Systems Design and Implementation (NSDI 23)","author":"Wang Weiyang","year":"2023","unstructured":"Weiyang Wang, Moein Khazraee, Zhizhen Zhong, Manya Ghobadi, Zhihao Jia, Dheevatsa Mudigere, Ying Zhang, and Anthony Kewitsch. 2023. $TopoOpt$: Co-optimizing network topology and parallelization strategy for distributed training jobs. In 20th USENIX Symposium on Networked Systems Design and Implementation (NSDI 23). 739\u2013767."},{"key":"e_1_3_2_2_53_1","doi-asserted-by":"publisher","DOI":"10.1145\/3552326.3567505"},{"key":"e_1_3_2_2_54_1","volume-title":"BirdMoE: Reducing Communication Costs for Mixture-of-Experts Training Using Load-Aware Bi-random Quantization. In 2025 62nd ACM\/IEEE Design Automation Conference (DAC). 1\u20137.","author":"Wu Donglei","year":"2025","unstructured":"Donglei Wu, Weihao Yang, Xiangyu Zou, Jinda Jia, Dingwen Tao, Wen Xia, and Zhihong Tian. 2025. BirdMoE: Reducing Communication Costs for Mixture-of-Experts Training Using Load-Aware Bi-random Quantization. In 2025 62nd ACM\/IEEE Design Automation Conference (DAC). 1\u20137."},{"key":"e_1_3_2_2_55_1","volume-title":"22nd USENIX Symposium on Networked Systems Design and Implementation (NSDI 25)","author":"Xu Guanbin","year":"2025","unstructured":"Guanbin Xu, Zhihao Le, Yinhe Chen, Zhiqi Lin, Zewen Jin, Youshan Miao, and Cheng Li. 2025. $AutoCCL$: Automated Collective Communication Tuning for Accelerating Distributed and Parallel $DNN$ Training. In 22nd USENIX Symposium on Networked Systems Design and Implementation (NSDI 25). 667\u2013683."},{"key":"e_1_3_2_2_56_1","unstructured":"An Yang Baosong Yang Binyuan Hui Bo Zheng Bowen Yu Chang Zhou Chengpeng Li Chengyuan Li Dayiheng Liu Fei Huang Guanting Dong Haoran Wei Huan Lin Jialong Tang Jialin Wang Jian Yang Jianhong Tu Jianwei Zhang Jianxin Ma Jin Xu Jingren Zhou Jinze Bai Jinzheng He Junyang Lin Kai Dang Keming Lu Keqin Chen Kexin Yang Mei Li Mingfeng Xue Na Ni Pei Zhang Peng Wang Ru Peng Rui Men Ruize Gao Runji Lin Shijie Wang Shuai Bai Sinan Tan Tianhang Zhu Tianhao Li Tianyu Liu Wenbin Ge Xiaodong Deng Xiaohuan Zhou Xingzhang Ren Xinyu Zhang Xipin Wei Xuancheng Ren Yang Fan Yang Yao Yichang Zhang Yu Wan Yunfei Chu Yuqiong Liu Zeyu Cui Zhenru Zhang and Zhihao Fan. 2024. Qwen2 Technical Report. arXiv preprint arXiv:2407.10671."},{"key":"e_1_3_2_2_57_1","volume-title":"COMET: Fine-grained Computation-communication Overlapping for Mixture-of-Experts. In Eighth Conference on Machine Learning and Systems.","author":"Zhang Shulai","unstructured":"Shulai Zhang, Ningxin Zheng, Haibin Lin, Ziheng Jiang, Wenlei Bao, Chengquan Jiang, Qi Hou, Weihao Cui, Size Zheng, Li-Wen Chang, et al. [n. d.]. COMET: Fine-grained Computation-communication Overlapping for Mixture-of-Experts. In Eighth Conference on Machine Learning and Systems."},{"key":"e_1_3_2_2_58_1","volume-title":"ArrayPipe: Introducing Job-Array Pipeline Parallelism for High Throughput Model Exploration. In IEEE INFOCOM 2025-IEEE Conference on Computer Communications. 1\u201310","author":"Zhao Hairui","year":"2025","unstructured":"Hairui Zhao, Hongliang Li, Qi Tian, Jie Wu, Meng Zhang, Zhewen Xu, Xiang Li, and Haixiao Xu. 2025. ArrayPipe: Introducing Job-Array Pipeline Parallelism for High Throughput Model Exploration. In IEEE INFOCOM 2025-IEEE Conference on Computer Communications. 1\u201310."},{"key":"e_1_3_2_2_59_1","volume-title":"2025 USENIX Annual Technical Conference (USENIX ATC 25)","author":"Zhao Hairui","year":"2025","unstructured":"Hairui Zhao, Qi Tian, Hongliang Li, and Zizhong Chen. 2025. $FlexPipe$: Maximizing training efficiency for transformer-based models with $Variable-Length$ inputs. In 2025 USENIX Annual Technical Conference (USENIX ATC 25). 143\u2013159."},{"key":"e_1_3_2_2_60_1","doi-asserted-by":"publisher","DOI":"10.1109\/IPDPS54959.2023.00023"},{"key":"e_1_3_2_2_61_1","doi-asserted-by":"publisher","DOI":"10.1109\/IPDPS49936.2021.00053"}],"event":{"name":"PPoPP '26: 31st ACM SIGPLAN Annual Symposium on Principles and Practice of Parallel Programming","location":"Sydney NSW Australia","acronym":"PPoPP '26","sponsor":["SIGHPC ACM Special Interest Group on High Performance Computing, Special Interest Group on High Performance Computing","SIGPLAN ACM Special Interest Group on Programming Languages"]},"container-title":["Proceedings of the 31st ACM SIGPLAN Annual Symposium on Principles and Practice of Parallel Programming"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3774934.3786432","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,1,28]],"date-time":"2026-01-28T15:28:42Z","timestamp":1769614122000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3774934.3786432"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,1,28]]},"references-count":61,"alternative-id":["10.1145\/3774934.3786432","10.1145\/3774934"],"URL":"https:\/\/doi.org\/10.1145\/3774934.3786432","relation":{},"subject":[],"published":{"date-parts":[[2026,1,28]]},"assertion":[{"value":"2026-01-28","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}