{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,1,29]],"date-time":"2026-01-29T03:59:59Z","timestamp":1769659199541,"version":"3.49.0"},"publisher-location":"New York, NY, USA","reference-count":59,"publisher":"ACM","funder":[{"name":"National Key Research and Development Program of China","award":["2025YFB3003702"],"award-info":[{"award-number":["2025YFB3003702"]}]},{"name":"National Natural Science Foundation of China","award":["62032023"],"award-info":[{"award-number":["62032023"]}]},{"name":"National Natural Science Foundation of China","award":["T2125013"],"award-info":[{"award-number":["T2125013"]}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2026,1,28]]},"DOI":"10.1145\/3774934.3786429","type":"proceedings-article","created":{"date-parts":[[2026,1,28]],"date-time":"2026-01-28T15:25:57Z","timestamp":1769613957000},"page":"425-438","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":0,"title":["CCL-D: A High-Precision Diagnostic System for Slow and Hang Anomalies in Large-Scale Model Training"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0009-0007-0712-8575","authenticated-orcid":false,"given":"Yida","family":"Gu","sequence":"first","affiliation":[{"name":"University of Chinese Academy of Sciences, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0001-5522-0217","authenticated-orcid":false,"given":"Fakang","family":"Wang","sequence":"additional","affiliation":[{"name":"Ant Group, Hangzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0008-5109-5413","authenticated-orcid":false,"given":"Jianhao","family":"Fu","sequence":"additional","affiliation":[{"name":"Ant Group, Hangzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0002-8424-4979","authenticated-orcid":false,"given":"Zhenhang","family":"Sun","sequence":"additional","affiliation":[{"name":"Ant Group, Hangzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-3805-4480","authenticated-orcid":false,"given":"Qianyu","family":"Zhang","sequence":"additional","affiliation":[{"name":"Ant Group, Hangzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0008-7081-5172","authenticated-orcid":false,"given":"Hairui","family":"Zhao","sequence":"additional","affiliation":[{"name":"Jilin University, Changchun, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0006-9410-5365","authenticated-orcid":false,"given":"Xingchen","family":"Liu","sequence":"additional","affiliation":[{"name":"University of Chinese Academy of Sciences, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0000-1519-466X","authenticated-orcid":false,"given":"Yang","family":"Tian","sequence":"additional","affiliation":[{"name":"Ant Group, Hangzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0009-5541-3519","authenticated-orcid":false,"given":"Wenjing","family":"Huang","sequence":"additional","affiliation":[{"name":"University of Chinese Academy of Sciences, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0008-7625-2008","authenticated-orcid":false,"given":"Zedong","family":"Liu","sequence":"additional","affiliation":[{"name":"University of Chinese Academy of Sciences, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0001-1158-6049","authenticated-orcid":false,"given":"Yifan","family":"Chen","sequence":"additional","affiliation":[{"name":"Ant Group, Hangzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0006-9307-0391","authenticated-orcid":false,"given":"Jinwu","family":"Yang","sequence":"additional","affiliation":[{"name":"University of Chinese Academy of Sciences, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0005-1735-5072","authenticated-orcid":false,"given":"Yueyuan","family":"Zhou","sequence":"additional","affiliation":[{"name":"University of Chinese Academy of Sciences, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0003-7108-9735","authenticated-orcid":false,"given":"Qian","family":"Zhao","sequence":"additional","affiliation":[{"name":"Ant Group, Hangzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0008-9480-0856","authenticated-orcid":false,"given":"Haoxu","family":"Li","sequence":"additional","affiliation":[{"name":"University of Chinese Academy of Sciences, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0001-2779-9057","authenticated-orcid":false,"given":"Tao","family":"Wang","sequence":"additional","affiliation":[{"name":"Ant Group, Hangzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0004-0194-8941","authenticated-orcid":false,"given":"Feng","family":"Yu","sequence":"additional","affiliation":[{"name":"Ant Group, Hangzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0003-4274-7671","authenticated-orcid":false,"given":"Zhan","family":"Wang","sequence":"additional","affiliation":[{"name":"University of Chinese Academy of Sciences, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-6361-5948","authenticated-orcid":false,"given":"Guangming","family":"Tan","sequence":"additional","affiliation":[{"name":"University of Chinese Academy of Sciences, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-5422-4497","authenticated-orcid":false,"given":"Dingwen","family":"Tao","sequence":"additional","affiliation":[{"name":"University of Chinese Academy of Sciences, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2026,1,28]]},"reference":[{"key":"e_1_3_2_2_1_1","volume-title":"International Symposium on Benchmarking, Measuring and Optimization. 157\u2013174","author":"Akhtar Palwisha","year":"2020","unstructured":"Palwisha Akhtar, Erhan Tezcan, Fareed Mohammad Qararyah, and Didem Unat. 2020. ComScribe: identifying intra-node GPU communication. In International Symposium on Benchmarking, Measuring and Optimization. 157\u2013174."},{"key":"e_1_3_2_2_2_1","volume-title":"RCCL: ROCm Communication Collectives Library. https:\/\/github.com\/ROCm\/rccl Accessed","author":"AMD.","year":"2025","unstructured":"AMD. 2025. RCCL: ROCm Communication Collectives Library. https:\/\/github.com\/ROCm\/rccl Accessed August 25, 2025"},{"key":"e_1_3_2_2_3_1","volume-title":"BLOOM 176B Training Log. https:\/\/github.com\/bigscience-workshop\/bigscience\/blob\/master\/train\/tr11-176B-ml\/chronicles.md Accessed","year":"2025","unstructured":"BigScience. 2025. BLOOM 176B Training Log. https:\/\/github.com\/bigscience-workshop\/bigscience\/blob\/master\/train\/tr11-176B-ml\/chronicles.md Accessed August 25, 2025"},{"key":"e_1_3_2_2_4_1","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA56546.2023.10071117"},{"key":"e_1_3_2_2_5_1","doi-asserted-by":"publisher","DOI":"10.1109\/MM.2021.3061394"},{"key":"e_1_3_2_2_6_1","doi-asserted-by":"publisher","DOI":"10.1145\/2491245"},{"key":"e_1_3_2_2_7_1","doi-asserted-by":"publisher","DOI":"10.1109\/WACVW60836.2024.00106"},{"key":"e_1_3_2_2_8_1","unstructured":"Weihao Cui Ji Zhang Han Zhao Chao Liu Wenhao Zhang Jian Sha Quan Chen Bingsheng He and Minyi Guo. 2025. XPUTimer: Anomaly Diagnostics for Divergent LLM Training in GPU Clusters of Thousand-Plus Scale. arXiv preprint arXiv:2502.05413."},{"key":"e_1_3_2_2_9_1","doi-asserted-by":"publisher","DOI":"10.1145\/3712285.3759853"},{"key":"e_1_3_2_2_10_1","volume-title":"22nd USENIX Symposium on Networked Systems Design and Implementation (NSDI 25)","author":"Deng Yangtao","year":"2025","unstructured":"Yangtao Deng, Xiang Shi, Zhuo Jiang, Xingjian Zhang, Lei Zhang, Zhang Zhang, Bo Li, Zuquan Song, Hang Zhu, Gaohong Liu, et al. 2025. Minder: Faulty machine detection for large-scale distributed model training. In 22nd USENIX Symposium on Networked Systems Design and Implementation (NSDI 25). 505\u2013521."},{"key":"e_1_3_2_2_11_1","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA61900.2025.00095"},{"key":"e_1_3_2_2_12_1","unstructured":"Abhimanyu Dubey Abhinav Jauhri Abhinav Pandey Abhishek Kadian Ahmad Al-Dahle Aiesha Letman Akhil Mathur Alan Schelten Amy Yang Angela Fan et al. 2024. The llama 3 herd of models. arXiv preprint arXiv:2407.21783."},{"key":"e_1_3_2_2_13_1","volume-title":"19th USENIX Symposium on Networked Systems Design and Implementation (NSDI 22)","author":"Eisenman Assaf","year":"2022","unstructured":"Assaf Eisenman, Kiran Kumar Matam, Steven Ingram, Dheevatsa Mudigere, Raghuraman Krishnamoorthi, Krishnakumar Nair, Misha Smelyanskiy, and Murali Annavaram. 2022. Check-N-Run: A checkpointing system for training deep learning recommendation models. In 19th USENIX Symposium on Networked Systems Design and Implementation (NSDI 22). 929\u2013943."},{"key":"e_1_3_2_2_14_1","doi-asserted-by":"publisher","DOI":"10.1145\/3696630.3728529"},{"key":"e_1_3_2_2_15_1","doi-asserted-by":"publisher","DOI":"10.1109\/ISCA52012.2021.00023"},{"key":"e_1_3_2_2_16_1","volume-title":"Gpipe: Efficient training of giant neural networks using pipeline parallelism. Advances in neural information processing systems, 32","author":"Huang Yanping","year":"2019","unstructured":"Yanping Huang, Youlong Cheng, Ankur Bapna, Orhan Firat, Dehao Chen, Mia Chen, HyoukJoong Lee, Jiquan Ngiam, Quoc V Le, Yonghui Wu, et al. 2019. Gpipe: Efficient training of giant neural networks using pipeline parallelism. Advances in neural information processing systems, 32 (2019)."},{"key":"e_1_3_2_2_17_1","volume-title":"2019 USENIX Annual Technical Conference (USENIX ATC 19)","author":"Jeon Myeongjae","year":"2019","unstructured":"Myeongjae Jeon, Shivaram Venkataraman, Amar Phanishayee, Junjie Qian, Wencong Xiao, and Fan Yang. 2019. Analysis of Large-Scale Multi-Tenant GPU clusters for DNN training workloads. In 2019 USENIX Annual Technical Conference (USENIX ATC 19). 947\u2013960."},{"key":"e_1_3_2_2_18_1","doi-asserted-by":"publisher","DOI":"10.5555\/3488766.3488792"},{"key":"e_1_3_2_2_19_1","volume-title":"21st USENIX Symposium on Networked Systems Design and Implementation (NSDI 24)","author":"Jiang Ziheng","year":"2024","unstructured":"Ziheng Jiang, Haibin Lin, Yinmin Zhong, Qi Huang, Yangrui Chen, Zhi Zhang, Yanghua Peng, Xiang Li, Cong Xie, Shibiao Nong, et al. 2024. MegaScale: Scaling large language model training to more than 10,000 GPUs. In 21st USENIX Symposium on Networked Systems Design and Implementation (NSDI 24). 745\u2013760."},{"key":"e_1_3_2_2_20_1","unstructured":"Jared Kaplan Sam McCandlish Tom Henighan Tom B Brown Benjamin Chess Rewon Child Scott Gray Alec Radford Jeffrey Wu and Dario Amodei. 2020. Scaling laws for neural language models. arXiv preprint arXiv:2001.08361."},{"key":"e_1_3_2_2_21_1","volume-title":"Proceedings of naacL-HLT. 1.","author":"Ming-Wei Chang Jacob Devlin","year":"2019","unstructured":"Jacob Devlin Ming-Wei Chang Kenton and Lee Kristina Toutanova. 2019. Bert: Pre-training of deep bidirectional transformers for language understanding. In Proceedings of naacL-HLT. 1."},{"key":"e_1_3_2_2_22_1","doi-asserted-by":"publisher","DOI":"10.1145\/3126908.3126938"},{"key":"e_1_3_2_2_23_1","unstructured":"Shen Li Yanli Zhao Rohan Varma Omkar Salpekar Pieter Noordhuis Teng Li Adam Paszke Jeff Smith Brian Vaughan Pritam Damania et al. 2020. Pytorch distributed: Experiences on accelerating data parallel training. arXiv preprint arXiv:2006.15704."},{"key":"e_1_3_2_2_24_1","unstructured":"Wenshuo Li Xinghao Chen Han Shu Yehui Tang and Yunhe Wang. 2024. ExCP: Extreme LLM Checkpoint Compression via Weight-Momentum Joint Shrinking. arXiv preprint arXiv:2406.11257."},{"key":"e_1_3_2_2_25_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00228"},{"key":"e_1_3_2_2_26_1","volume-title":"20th USENIX Symposium on Networked Systems Design and Implementation (NSDI 23)","author":"Liu Kefei","year":"2023","unstructured":"Kefei Liu, Zhuo Jiang, Jiao Zhang, Haoran Wei, Xiaolong Zhong, Lizhuang Tan, Tian Pan, and Tao Huang. 2023. Hostping: Diagnosing intra-host network bottlenecks in RDMA servers. In 20th USENIX Symposium on Networked Systems Design and Implementation (NSDI 23). 15\u201329."},{"key":"e_1_3_2_2_27_1","doi-asserted-by":"publisher","DOI":"10.1145\/3718958.3750513"},{"key":"e_1_3_2_2_28_1","doi-asserted-by":"publisher","DOI":"10.1145\/800221.806730"},{"key":"e_1_3_2_2_29_1","doi-asserted-by":"publisher","DOI":"10.1145\/3625549.3658685"},{"key":"e_1_3_2_2_30_1","volume-title":"a telemetry daemon for performance monitoring and tracing.. https:\/\/github.com\/facebookincubator\/dynolog Accessed","year":"2025","unstructured":"Meta. 2025. Dynolog : a telemetry daemon for performance monitoring and tracing.. https:\/\/github.com\/facebookincubator\/dynolog Accessed August 25, 2025"},{"key":"e_1_3_2_2_31_1","volume-title":"OPT 175B Training Log. https:\/\/github.com\/facebookresearch\/metaseq\/blob\/main\/projects\/OPT\/chronicles\/OPT175B_Logbook.pdf Accessed","year":"2025","unstructured":"Meta. 2025. OPT 175B Training Log. https:\/\/github.com\/facebookresearch\/metaseq\/blob\/main\/projects\/OPT\/chronicles\/OPT175B_Logbook.pdf Accessed August 25, 2025"},{"key":"e_1_3_2_2_32_1","doi-asserted-by":"publisher","DOI":"10.1145\/3341301.3359646"},{"key":"e_1_3_2_2_33_1","unstructured":"Thanh-Dat Nguyen Haoye Tian Bach Le Patanamon Thongtanunam and Shane McIntosh. 2025. A Systematic Survey on Debugging Techniques for Machine Learning Systems. arXiv preprint arXiv:2503.03158."},{"key":"e_1_3_2_2_34_1","volume-title":"Collective Communication Protocol. https:\/\/docs.nvidia.com\/deeplearning\/nccl\/user-guide\/docs\/env.html Accessed","author":"NVIDIA.","year":"2025","unstructured":"NVIDIA. 2025. Collective Communication Protocol. https:\/\/docs.nvidia.com\/deeplearning\/nccl\/user-guide\/docs\/env.html Accessed August 25, 2025"},{"key":"e_1_3_2_2_35_1","volume-title":"https:\/\/docs.nvidia.com\/deeplearning\/nccl\/user-guide\/docs\/troubleshooting\/ras.html Accessed","author":"NVIDIA.","year":"2025","unstructured":"NVIDIA. 2025. NCCL RAS. https:\/\/docs.nvidia.com\/deeplearning\/nccl\/user-guide\/docs\/troubleshooting\/ras.html Accessed August 25, 2025"},{"key":"e_1_3_2_2_36_1","volume-title":"https:\/\/github.com\/NVIDIA\/nccl-tests Accessed","author":"NVIDIA.","year":"2025","unstructured":"NVIDIA. 2025. Nccl-tests. https:\/\/github.com\/NVIDIA\/nccl-tests Accessed August 25, 2025"},{"key":"e_1_3_2_2_37_1","volume-title":"NVIDIA Nsight Compute. https:\/\/docs.nvidia.com\/nsight-compute\/NsightCompute\/index.html Accessed","author":"NVIDIA.","year":"2025","unstructured":"NVIDIA. 2025. NVIDIA Nsight Compute. https:\/\/docs.nvidia.com\/nsight-compute\/NsightCompute\/index.html Accessed August 25, 2025"},{"key":"e_1_3_2_2_38_1","volume-title":"Thomas Wolf, et al.","author":"Penedo Guilherme","year":"2024","unstructured":"Guilherme Penedo, Hynek Kydl\u00ed\u010dek, Anton Lozhkov, Margaret Mitchell, Colin Raffel, Leandro Von Werra, Thomas Wolf, et al. 2024. The fineweb datasets: Decanting the web for the finest text data at scale. arXiv preprint arXiv:2406.17557."},{"key":"e_1_3_2_2_39_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICPP.2013.17"},{"key":"e_1_3_2_2_40_1","doi-asserted-by":"publisher","DOI":"10.1109\/SC41405.2020.00024"},{"key":"e_1_3_2_2_41_1","volume-title":"Megatron-lm: Training multi-billion parameter language models using model parallelism. arXiv preprint arXiv:1909.08053.","author":"Shoeybi Mohammad","year":"2019","unstructured":"Mohammad Shoeybi, Mostofa Patwary, Raul Puri, Patrick LeGresley, Jared Casper, and Bryan Catanzaro. 2019. Megatron-lm: Training multi-billion parameter language models using model parallelism. arXiv preprint arXiv:1909.08053."},{"key":"e_1_3_2_2_42_1","volume-title":"16th USENIX Symposium on Networked Systems Design and Implementation (NSDI 19)","author":"Tan Cheng","year":"2019","unstructured":"Cheng Tan, Ze Jin, Chuanxiong Guo, Tianrong Zhang, Haitao Wu, Karl Deng, Dongming Bi, and Dong Xiang. 2019. NetBouncer: Active device and link failure localization in data center networks. In 16th USENIX Symposium on Networked Systems Design and Implementation (NSDI 19). 599\u2013614."},{"key":"e_1_3_2_2_43_1","volume-title":"Hashimoto","author":"Taori Rohan","year":"2023","unstructured":"Rohan Taori, Ishaan Gulrajani, Tianyi Zhang, Yann Dubois, Xuechen Li, Carlos Guestrin, Percy Liang, and Tatsunori B. Hashimoto. 2023. Stanford Alpaca: An Instruction-following LLaMA model. https:\/\/github.com\/tatsu-lab\/stanford_alpaca"},{"key":"e_1_3_2_2_44_1","volume-title":"https:\/\/github.com\/intelligent-machine-learning\/dlrover Accessed","author":"Team Rover","year":"2025","unstructured":"DLRover Team. 2025. DLRover. https:\/\/github.com\/intelligent-machine-learning\/dlrover Accessed August 25, 2025"},{"key":"e_1_3_2_2_45_1","unstructured":"Ling Team Binwei Zeng Chao Huang Chao Zhang Changxin Tian Cong Chen Dingnan Jin Feng Yu Feng Zhu Feng Yuan et al. 2025. Every FLOP Counts: Scaling a 300B Mixture-of-Experts LING LLM without Premium GPUs. arXiv preprint arXiv:2503.05139."},{"key":"e_1_3_2_2_46_1","volume-title":"https:\/\/pytorch.org\/docs\/stable\/torch_nccl_environment_variables.html Accessed","author":"Team Torch","year":"2025","unstructured":"Torch Team. 2025. Pytorch Watchdog. https:\/\/pytorch.org\/docs\/stable\/torch_nccl_environment_variables.html Accessed August 25, 2025"},{"key":"e_1_3_2_2_47_1","unstructured":"Hugo Touvron Louis Martin Kevin Stone Peter Albert Amjad Almahairi Yasmine Babaei Nikolay Bashlykov Soumya Batra Prajjwal Bhargava Shruti Bhosale et al. 2023. Llama 2: Open foundation and fine-tuned chat models. arXiv preprint arXiv:2307.09288."},{"key":"e_1_3_2_2_48_1","volume-title":"Lisbon","author":"Unat Didem","year":"2022","unstructured":"Didem Unat. 2022. Monitoring Collective Communication Among GPUs. In Euro-Par 2021: Parallel Processing Workshops: Euro-Par 2021 International Workshops, Lisbon, Portugal, August 30-31, 2021, Revised Selected Papers. 13098, 41."},{"key":"e_1_3_2_2_49_1","unstructured":"A Vaswani. 2017. Attention is all you need. Advances in Neural Information Processing Systems."},{"key":"e_1_3_2_2_50_1","doi-asserted-by":"publisher","DOI":"10.1145\/3545008.3545087"},{"key":"e_1_3_2_2_51_1","volume-title":"Bingsheng He, and Xiaowen Chu.","author":"Wang Yuxin","year":"2023","unstructured":"Yuxin Wang, Shaohuai Shi, Xin He, Zhenheng Tang, Xinglin Pan, Yang Zheng, Xiaoyu Wu, Amelie Chi Zhou, Bingsheng He, and Xiaowen Chu. 2023. Reliable and efficient in-memory fault tolerance of large language model pretraining. arXiv preprint arXiv:2310.12670."},{"key":"e_1_3_2_2_52_1","doi-asserted-by":"publisher","DOI":"10.1145\/3600006.3613145"},{"key":"e_1_3_2_2_53_1","volume-title":"2025 USENIX Annual Technical Conference (USENIX ATC 25)","author":"Wu Tianyuan","year":"2025","unstructured":"Tianyuan Wu, Wei Wang, Yinghao Yu, Siran Yang, Wenchao Wu, Qinkai Duan, Guodong Yang, Jiamang Wang, Lin Qu, and Liping Zhang. 2025. GREYHOUND: Hunting Fail-Slows in Hybrid-Parallel Training at Scale. In 2025 USENIX Annual Technical Conference (USENIX ATC 25). 731\u2013747."},{"key":"e_1_3_2_2_54_1","volume-title":"SuperBench: Improving Cloud AI Infrastructure Reliability with Proactive Validation. In 2024 USENIX Annual Technical Conference (USENIX ATC 24)","author":"Xiong Yifan","year":"2024","unstructured":"Yifan Xiong, Yuting Jiang, Ziyue Yang, Lei Qu, Guoshuai Zhao, Shuguang Liu, Dong Zhong, Boris Pinzur, Jie Zhang, Yang Wang, et al. 2024. SuperBench: Improving Cloud AI Infrastructure Reliability with Proactive Validation. In 2024 USENIX Annual Technical Conference (USENIX ATC 24). 835\u2013850."},{"key":"e_1_3_2_2_55_1","volume-title":"Justitia: Software Multi-Tenancy in Hardware Kernel-Bypass Networks. In 19th USENIX Symposium on Networked Systems Design and Implementation (NSDI 22)","author":"Zhang Yiwen","year":"2022","unstructured":"Yiwen Zhang, Yue Tan, Brent Stephens, and Mosharaf Chowdhury. 2022. Justitia: Software Multi-Tenancy in Hardware Kernel-Bypass Networks. In 19th USENIX Symposium on Networked Systems Design and Implementation (NSDI 22). 1307\u20131326."},{"key":"e_1_3_2_2_56_1","volume-title":"ArrayPipe: Introducing Job-Array Pipeline Parallelism for High Throughput Model Exploration. In IEEE INFOCOM 2025-IEEE Conference on Computer Communications. 1\u201310","author":"Zhao Hairui","year":"2025","unstructured":"Hairui Zhao, Hongliang Li, Qi Tian, Jie Wu, Meng Zhang, Zhewen Xu, Xiang Li, and Haixiao Xu. 2025. ArrayPipe: Introducing Job-Array Pipeline Parallelism for High Throughput Model Exploration. In IEEE INFOCOM 2025-IEEE Conference on Computer Communications. 1\u201310."},{"key":"e_1_3_2_2_57_1","volume-title":"2025 USENIX Annual Technical Conference (USENIX ATC 25)","author":"Zhao Hairui","year":"2025","unstructured":"Hairui Zhao, Qi Tian, Hongliang Li, and Zizhong Chen. 2025. $FlexPipe$: Maximizing training efficiency for transformer-based models with $Variable-Length$ inputs. In 2025 USENIX Annual Technical Conference (USENIX ATC 25). 143\u2013159."},{"key":"e_1_3_2_2_58_1","doi-asserted-by":"publisher","DOI":"10.1016\/j.eswa.2023.122836"},{"key":"e_1_3_2_2_59_1","doi-asserted-by":"crossref","unstructured":"Yanli Zhao Andrew Gu Rohan Varma Liang Luo Chien-Chin Huang Min Xu Less Wright Hamid Shojanazeri Myle Ott Sam Shleifer et al. 2023. Pytorch fsdp: experiences on scaling fully sharded data parallel. arXiv preprint arXiv:2304.11277.","DOI":"10.14778\/3611540.3611569"}],"event":{"name":"PPoPP '26: 31st ACM SIGPLAN Annual Symposium on Principles and Practice of Parallel Programming","location":"Sydney NSW Australia","acronym":"PPoPP '26","sponsor":["SIGHPC ACM Special Interest Group on High Performance Computing, Special Interest Group on High Performance Computing","SIGPLAN ACM Special Interest Group on Programming Languages"]},"container-title":["Proceedings of the 31st ACM SIGPLAN Annual Symposium on Principles and Practice of Parallel Programming"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3774934.3786429","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,1,28]],"date-time":"2026-01-28T15:28:14Z","timestamp":1769614094000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3774934.3786429"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,1,28]]},"references-count":59,"alternative-id":["10.1145\/3774934.3786429","10.1145\/3774934"],"URL":"https:\/\/doi.org\/10.1145\/3774934.3786429","relation":{},"subject":[],"published":{"date-parts":[[2026,1,28]]},"assertion":[{"value":"2026-01-28","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}