{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,9]],"date-time":"2026-07-09T04:15:23Z","timestamp":1783570523811,"version":"3.55.0"},"publisher-location":"New York, NY, USA","reference-count":62,"publisher":"ACM","content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2025,10,12]]},"DOI":"10.1145\/3725783.3764395","type":"proceedings-article","created":{"date-parts":[[2025,10,9]],"date-time":"2025-10-09T17:50:12Z","timestamp":1760032212000},"page":"98-105","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":1,"title":["Cloud abstractions for AI workloads"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-5051-4283","authenticated-orcid":false,"given":"Marco","family":"Canini","sequence":"first","affiliation":[{"name":"KAUST, Thuwal, Saudi Arabia"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-5855-8811","authenticated-orcid":false,"given":"Theophilus A.","family":"Benson","sequence":"additional","affiliation":[{"name":"Carnegie Mellon University, Pittsburgh, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-5971-5084","authenticated-orcid":false,"given":"Ricardo","family":"Bianchini","sequence":"additional","affiliation":[{"name":"Microsoft Azure, Redmond, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-2591-4012","authenticated-orcid":false,"given":"\u00cd\u00f1igo","family":"Goiri","sequence":"additional","affiliation":[{"name":"Microsoft, Redmond, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-1256-1070","authenticated-orcid":false,"given":"Dejan","family":"Kosti\u0107","sequence":"additional","affiliation":[{"name":"KTH Royal Institute of Technology, Stockholm, Sweden"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-6963-5640","authenticated-orcid":false,"given":"Peter","family":"Pietzuch","sequence":"additional","affiliation":[{"name":"Imperial College London, London, United Kingdom"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0007-4748-8524","authenticated-orcid":false,"given":"Simon","family":"Peter","sequence":"additional","affiliation":[{"name":"University of Washington, Seattle, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"320","published-online":{"date-parts":[[2025,10,11]]},"reference":[{"key":"e_1_3_2_1_1_1","volume-title":"Abdelmoniem and Marco Canini","author":"Ahmed","year":"2021","unstructured":"Ahmed M. Abdelmoniem and Marco Canini. 2021. DC2: Delay-aware Compression Control for Distributed Machine Learning. In INFOCOM."},{"key":"e_1_3_2_1_2_1","volume-title":"Blox: A Modular Toolkit for Deep Learning Schedulers. In EuroSys.","author":"Agarwal Saurabh","year":"2024","unstructured":"Saurabh Agarwal, Amar Phanishayee, and Shivaram Venkataraman. 2024. Blox: A Modular Toolkit for Deep Learning Schedulers. In EuroSys."},{"key":"e_1_3_2_1_3_1","unstructured":"Amazon Web Services. 2024. AWS SageMaker. https:\/\/aws.amazon.com\/sagemaker"},{"key":"e_1_3_2_1_4_1","volume-title":"Jahanzeb Maqbool Hashmi, and Dhabaleswar K. Panda","author":"Bayatpour Mohammadreza","year":"2021","unstructured":"Mohammadreza Bayatpour, Nick Sarkauskas, Hari Subramoni, Jahanzeb Maqbool Hashmi, and Dhabaleswar K. Panda. 2021. BluesMPI: Efficient MPI Non-blocking Alltoall Offloading Designs on Modern BlueField Smart NICs. In High Performance Computing."},{"key":"e_1_3_2_1_5_1","doi-asserted-by":"crossref","unstructured":"Muhammad Bilal Marco Canini Rodrigo Fonseca and Rodrigo Rodrigues. 2023. With Great Freedom Comes Great Opportunity: Rethinking Resource Allocation for Serverless Functions. In EuroSys.","DOI":"10.1145\/3552326.3567506"},{"key":"e_1_3_2_1_6_1","unstructured":"Weilin Cai Le Qin and Jiayi Huang. 2025. MoC-System: Efficient Fault Tolerance for Sparse Mixture-of-Experts Model Training. In ASPLOS."},{"key":"e_1_3_2_1_7_1","article-title":"TensorOpt: Exploring the Tradeoffs in Distributed DNN Training With Auto-Parallelism","volume":"33","author":"Cai Zhenkun","year":"2022","unstructured":"Zhenkun Cai, Xiao Yan, Kaihao Ma, Yidi Wu, Yuzhen Huang, James Cheng, Teng Su, and Fan Yu. 2022. TensorOpt: Exploring the Tradeoffs in Distributed DNN Training With Auto-Parallelism. IEEE Transactions on Parallel and Distributed Systems 33, 8 (2022).","journal-title":"IEEE Transactions on Parallel and Distributed Systems"},{"key":"e_1_3_2_1_8_1","volume-title":"Crux: GPU-Efficient Communication Scheduling for Deep Learning Training. In SIGCOMM.","author":"Cao Jiamin","year":"2024","unstructured":"Jiamin Cao, Yu Guan, Kun Qian, Jiaqi Gao, Wencong Xiao, Jianbo Dong, Binzhang Fu, Dennis Cai, and Ennan Zhai. 2024. Crux: GPU-Efficient Communication Scheduling for Deep Learning Training. In SIGCOMM."},{"key":"e_1_3_2_1_9_1","doi-asserted-by":"crossref","unstructured":"Shubham Chaudhary Ramachandran Ramjee Muthian Sivathanu Nipun Kwatra and Srinidhi Viswanatha. 2020. Balancing Efficiency and Fairness in Heterogeneous GPU Clusters for Deep Learning. In EuroSys.","DOI":"10.1145\/3342195.3387555"},{"key":"e_1_3_2_1_10_1","unstructured":"Jingrong Chen Hong Zhang Wei Zhang Liang Luo Jeffrey Chase Ion Stoica and Danyang Zhuo. 2022. NetHint: White-Box Networking for Multi-Tenant Data Centers. In NSDI."},{"key":"e_1_3_2_1_11_1","doi-asserted-by":"crossref","unstructured":"Xiaoqi Chen Shay Vargaftik and Ran Ben Basat. 2024. When ML Training Cuts Through Congestion: Just-in-Time Gradient Compression via Packet Trimming. In HotNets.","DOI":"10.1145\/3696348.3696880"},{"key":"e_1_3_2_1_12_1","doi-asserted-by":"crossref","unstructured":"Jae-Won Chung Yile Gu Insu Jang Luoxi Meng Nikhil Bansal and Mosharaf Chowdhury. 2024. Reducing Energy Bloat in Large Model Training. In SOSP.","DOI":"10.1145\/3694715.3695970"},{"key":"e_1_3_2_1_13_1","doi-asserted-by":"crossref","unstructured":"Bryce Cronkite-Ratcliff Aran Bergman Shay Vargaftik Madhusudhan Ravi Nick McKeown Ittai Abraham and Isaac Keslassy. 2016. Virtualized Congestion Control. In SIGCOMM.","DOI":"10.1145\/2934872.2934889"},{"key":"e_1_3_2_1_14_1","unstructured":"Michael Dalton David Schultz Jacob Adriaens Ahsan Arefin Anshuman Gupta Brian Fahs Dima Rubinstein Enrique Cauich Zermeno Erik Rubow James Alexander Docauer Jesse Alpert Jing Ai Jon Olson Kevin DeCabooter Marc de Kruijf Nan Hua Nathan Lewis Nikhil Kasinadhuni Riccardo Crepaldi Srinivas Krishnan Subbaiah Venkata Yossi Richter Uday Naik and Amin Vahdat. 2018. Andromeda: Performance Isolation and Velocity at Scale in Cloud Network Virtualization. In NSDI."},{"key":"e_1_3_2_1_15_1","volume-title":"Parcae: Proactive, Liveput-Optimized DNN Training on Preemptible Instances. In NSDI.","author":"Duan Jiangfei","year":"2024","unstructured":"Jiangfei Duan, Ziang Song, Xupeng Miao, Xiaoli Xi, Dahua Lin, Harry Xu, Minjia Zhang, and Zhihao Jia. 2024. Parcae: Proactive, Liveput-Optimized DNN Training on Preemptible Instances. In NSDI."},{"key":"e_1_3_2_1_16_1","article-title":"Pushing CDN-ISP Collaboration to the Limit","volume":"43","author":"Frank Benjamin","year":"2013","unstructured":"Benjamin Frank, Ingmar Poese, Yin Lin, Georgios Smaragdakis, Anja Feldmann, Bruce Maggs, Jannis Rake, Steve Uhlig, and Rick Weber. 2013. Pushing CDN-ISP Collaboration to the Limit. SIGCOMM Comput. Commun. Rev. 43, 3 (2013).","journal-title":"SIGCOMM Comput. Commun. Rev."},{"key":"e_1_3_2_1_17_1","unstructured":"Google Cloud. 2024. Google Vertex AI. https:\/\/cloud.google.com\/vertex-ai"},{"key":"e_1_3_2_1_18_1","unstructured":"Google Cloud. 2024. Optimize Training Performance with Reduction Server in Vertex AI. https:\/\/cloud.google.com\/blog\/topics\/developers-practitioners\/optimize-training-performance-reduction-server-vertex-ai"},{"key":"e_1_3_2_1_19_1","doi-asserted-by":"crossref","unstructured":"Richard Graham George Bosilca Yong Qin Bradley Settlemyer Gilad Shainer Craig Stunkel Geoffroy Vallee Brody Williams Gerardo Cisneros-Stoianowski Sebastian Ohlmann and Markus Rampp. 2024. Optimizing Application Performance with BlueField: Accelerating Large-Message Blocking and Nonblocking Collective Operations. In ISC.","DOI":"10.23919\/ISC.2024.10528935"},{"key":"e_1_3_2_1_20_1","unstructured":"Tongzhou Gu Jiawei Fei and Marco Canini. 2024. OmNICCL: Zero-cost Sparse AllReduce with Direct Cache Access and SmartNICs. In NAIC."},{"key":"e_1_3_2_1_21_1","doi-asserted-by":"crossref","unstructured":"Tanmaey Gupta Sanjeev Krishnan Rituraj Kumar Abhishek Vijeev Bhargav Gulavani Nipun Kwatra Ramachandran Ramjee and Muthian Sivathanu. 2024. Just-In-Time Checkpointing: Low Cost Error Recovery from Deep Learning Training Failures. In EuroSys.","DOI":"10.1145\/3627703.3650085"},{"key":"e_1_3_2_1_22_1","unstructured":"Keqiang He Eric Rozner Kanak Agarwal Yu (Jason) Gu Wes Felter John Carter and Aditya Akella. 2016. AC\/DC TCP: Virtual Congestion Control Enforcement for Datacenter Networks. In SIGCOMM."},{"key":"e_1_3_2_1_23_1","volume-title":"Unicron: Economizing Self-Healing LLM Training at Scale. arXiv:2401.00134 [cs.DC]","author":"He Tao","year":"2024","unstructured":"Tao He, Xue Li, Zhibin Wang, Kun Qian, Jingbo Xu, Wenyuan Yu, and Jingren Zhou. 2024. Unicron: Economizing Self-Healing LLM Training at Scale. arXiv:2401.00134 [cs.DC]"},{"key":"e_1_3_2_1_24_1","volume-title":"Mesos: A Platform for Fine-Grained Resource Sharing in the Data Center. In NSDI.","author":"Hindman Benjamin","year":"2011","unstructured":"Benjamin Hindman, Andy Konwinski, Matei Zaharia, Ali Ghodsi, Anthony D. Joseph, Randy Katz, Scott Shenker, and Ion Stoica. 2011. Mesos: A Platform for Fine-Grained Resource Sharing in the Data Center. In NSDI."},{"key":"e_1_3_2_1_25_1","doi-asserted-by":"crossref","unstructured":"Samuel Hsia Alicia Golden Bilge Acun Newsha Ardalani Zachary DeVito Gu-Yeon Wei David Brooks and Carole-Jean Wu. 2024. MAD-Max Beyond Single-Node: Enabling Large Machine Learning Model Acceleration on Distributed Systems. In ISCA.","DOI":"10.1109\/ISCA59077.2024.00064"},{"key":"e_1_3_2_1_26_1","volume-title":"Workload Intelligence: Punching Holes Through the Cloud Abstraction. arXiv:2404.19143 [cs.DC]","author":"Huang Lexiang","year":"2024","unstructured":"Lexiang Huang, Anjaly Parayil, Jue Zhang, Xiaoting Qin, Chetan Bansal, Jovan Stojkovic, Pantea Zardoshti, Pulkit Misra, Eli Cortez, Raphael Ghelman, \u00cd\u00f1igo Goiri, Saravan Rajmohan, Jim Kleewein, Rodrigo Fonseca, Timothy Zhu, and Ricardo Bianchini. 2024. Workload Intelligence: Punching Holes Through the Cloud Abstraction. arXiv:2404.19143 [cs.DC]"},{"key":"e_1_3_2_1_27_1","volume-title":"Intel Infrastructure Processing Unit (Intel IPU) ASIC E2000","year":"2023","unstructured":"Intel. 2023. Intel Infrastructure Processing Unit (Intel IPU) ASIC E2000. https:\/\/www.intel.com\/content\/www\/us\/en\/products\/details\/network-io\/ipu\/e2000-asic.html"},{"key":"e_1_3_2_1_28_1","volume-title":"Whale: Efficient Giant Model Training over Heterogeneous GPUs. In USENIX ATC.","author":"Jia Xianyan","year":"2022","unstructured":"Xianyan Jia, Le Jiang, Ang Wang, Wencong Xiao, Ziji Shi, Jie Zhang, Xinyuan Li, Langshi Chen, Yong Li, Zhen Zheng, Xiaoyong Liu, and Wei Lin. 2022. Whale: Efficient Giant Model Training over Heterogeneous GPUs. In USENIX ATC."},{"key":"e_1_3_2_1_29_1","volume-title":"EONA: Experience-Oriented Network Architecture. In HotNets.","author":"Jiang Junchen","year":"2014","unstructured":"Junchen Jiang, Xi Liu, Vyas Sekar, Ion Stoica, and Hui Zhang. 2014. EONA: Experience-Oriented Network Architecture. In HotNets."},{"key":"e_1_3_2_1_30_1","unstructured":"Ziheng Jiang Haibin Lin Yinmin Zhong Qi Huang Yangrui Chen Zhi Zhang Yanghua Peng Xiang Li Cong Xie Shibiao Nong Yulu Jia Sun He Hongmin Chen Zhihao Bai Qi Hou Shipeng Yan Ding Zhou Yiyao Sheng Zhuo Jiang Haohan Xu Haoran Wei Zhang Zhang Pengfei Nie Leqi Zou Sida Zhao Liang Xiang Zherui Liu Zhe Li Xiaoying Jia Jianxi Ye Xin Jin and Xin Liu. 2024. MegaScale: Scaling Large Language Model Training to More Than 10 000 GPUs. In NSDI."},{"key":"e_1_3_2_1_31_1","volume-title":"Joseph Gonzalez, Hao Zhang, and Ion Stoica.","author":"Kwon Woosuk","year":"2023","unstructured":"Woosuk Kwon, Zhuohan Li, Siyuan Zhuang, Ying Sheng, Lianmin Zheng, Cody Hao Yu, Joseph Gonzalez, Hao Zhang, and Ion Stoica. 2023. Efficient Memory Management for Large Language Model Serving with PagedAttention. In SOSP."},{"key":"e_1_3_2_1_32_1","volume-title":"AMP: Automatically Finding Model Parallel Strategies with Heterogeneity Awareness. In NeurIPS.","author":"Li Dacheng","year":"2022","unstructured":"Dacheng Li, Hongyi Wang, Eric Xing, and Hao Zhang. 2022. AMP: Automatically Finding Model Parallel Strategies with Heterogeneity Awareness. In NeurIPS."},{"key":"e_1_3_2_1_33_1","volume-title":"Lev Kurilenko, Masahiro Tanaka, Stas Bekman, Olatunji Ruwase, and Minjia Zhang.","author":"Lian Xinyu","year":"2024","unstructured":"Xinyu Lian, Sam Ade Jacobs, Lev Kurilenko, Masahiro Tanaka, Stas Bekman, Olatunji Ruwase, and Minjia Zhang. 2024. Universal Checkpointing: Efficient and Flexible Checkpointing for Large Scale Distributed Training. arXiv:2406.18820 [cs.DC]"},{"key":"e_1_3_2_1_34_1","unstructured":"Zhiqi Lin Youshan Miao Quanlu Zhang Fan Yang Yi Zhu Cheng Li Saeed Maleki Xu Cao Ning Shang Yilei Yang Weijiang Xu Mao Yang Lintao Zhang and Lidong Zhou. 2024. nnScaler: Constraint-Guided Parallelization Plan Generation for Deep Learning Training. In OSDI."},{"key":"e_1_3_2_1_35_1","volume-title":"Yuhan Ding, and Marco Canini.","author":"Liu Banruo","year":"2024","unstructured":"Banruo Liu, Mubarak Adetunji Ojewale, Yuhan Ding, and Marco Canini. 2024. Towards a Flexible and High-Fidelity Approach to Distributed DNN Training Emulation. In APSys."},{"key":"e_1_3_2_1_36_1","volume-title":"Liangyu Zhao, Vincent Liu, Miguel Castro, Srikanth Kandula, and Luke Marshall.","author":"Liu Xuting","year":"2024","unstructured":"Xuting Liu, Behnaz Arzani, Siva Kesava Reddy Kakarla, Liangyu Zhao, Vincent Liu, Miguel Castro, Srikanth Kandula, and Luke Marshall. 2024. Rethinking Machine Learning Collective Communication as a Multi-Commodity Flow Problem. In SIGCOMM."},{"key":"e_1_3_2_1_37_1","unstructured":"Luo Mai Guo Li Marcel Wagenl\u00e4nder Konstantinos Fertakis Andrei-Octavian Brabete and Peter Pietzuch. 2020. KungFu: Making Training in Distributed Machine Learning Adaptive. In OSDI."},{"key":"e_1_3_2_1_38_1","unstructured":"Ilia Markov Kaveh Alim Elias Frantar and Dan Alistarh. 2024. LGreCo: Layerwise-adaptive Gradient Compression For Efficient Data-parallel Deep Learning. In MLSys."},{"key":"e_1_3_2_1_39_1","doi-asserted-by":"crossref","unstructured":"Avinash Maurya Robert Underwood M. Mustafa Rafique Franck Cappello and Bogdan Nicolae. 2024. DataStates-LLM: Lazy Asynchronous Checkpointing for Large Language Models. In HPDC.","DOI":"10.1145\/3625549.3658685"},{"key":"e_1_3_2_1_40_1","unstructured":"NVIDIA. 2024. NVIDIA Collective Communication Library (NCCL). https:\/\/developer.nvidia.com\/nccl"},{"key":"e_1_3_2_1_41_1","doi-asserted-by":"crossref","unstructured":"Archit Patke Dhemath Reddy Saurabh Jha Haoran Qiu Christian Pinto Chandra Narayanaswami Zbigniew Kalbarczyk and Ravishankar Iyer. 2024. Queue Management for SLO-Oriented Large Language Model Serving. In SoCC.","DOI":"10.1145\/3698038.3698523"},{"key":"e_1_3_2_1_42_1","doi-asserted-by":"crossref","unstructured":"Kun Qian Yongqing Xi Jiamin Cao Jiaqi Gao Yichi Xu Yu Guan Binzhang Fu Xuemei Shi Fangbo Zhu Rui Miao Chao Wang Peng Wang Pengcheng Zhang Xianlong Zeng Eddie Ruan Zhiping Yao Ennan Zhai and Dennis Cai. 2024. Alibaba HPN: A Data Center Network for Large Language Model Training. In SIGCOMM.","DOI":"10.1145\/3651890.3672265"},{"key":"e_1_3_2_1_43_1","volume-title":"Suhas Jayaram Subramanya, Willie Neiswanger, Qirong Ho, Hao Zhang, Gregory R. Ganger, and Eric P. Xing.","author":"Qiao Aurick","year":"2021","unstructured":"Aurick Qiao, Sang Keun Choe, Suhas Jayaram Subramanya, Willie Neiswanger, Qirong Ho, Hao Zhang, Gregory R. Ganger, and Eric P. Xing. 2021. Pollux: Co-adaptive Cluster Scheduling for Goodput-Optimized Deep Learning. In OSDI."},{"key":"e_1_3_2_1_44_1","doi-asserted-by":"crossref","unstructured":"Samyam Rajbhandari Jeff Rasley Olatunji Ruwase and Yuxiong He. 2020. ZeRO: Memory Optimizations Toward Training Trillion Parameter Models. In SC.","DOI":"10.1109\/SC41405.2020.00024"},{"key":"e_1_3_2_1_45_1","unstructured":"D. Sculley Gary Holt Daniel Golovin Eugene Davydov Todd Phillips Dietmar Ebner Vinay Chaudhary Michael Young Jean-Fran\u00e7ois Crespo and Dan Dennison. 2015. Hidden Technical Debt in Machine Learning Systems. In NeurIPS."},{"key":"e_1_3_2_1_46_1","unstructured":"Mohammad Shoeybi Mostofa Patwary Raul Puri Patrick LeGresley Jared Casper and Bryan Catanzaro. 2020. Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism. arXiv:1909.08053 [cs.CL]"},{"key":"e_1_3_2_1_47_1","doi-asserted-by":"crossref","unstructured":"Jovan Stojkovic Chaojie Zhang \u00cd\u00f1igo Goiri Josep Torrellas and Esha Choukse. 2025. DynamoLLM: Designing LLM Inference Clusters for Performance and Energy Efficiency. In HPCA.","DOI":"10.1109\/HPCA61900.2025.00102"},{"key":"e_1_3_2_1_48_1","volume-title":"Piper: Multidimensional Planner for DNN Parallelization. In NeurIPS.","author":"Tarnawski Jakub M.","year":"2021","unstructured":"Jakub M. Tarnawski, Deepak Narayanan, and Amar Phanishayee. 2021. Piper: Multidimensional Planner for DNN Parallelization. In NeurIPS."},{"key":"e_1_3_2_1_49_1","unstructured":"Yi Tay. 2024. Training Great LLMs Entirely from Ground Zero in the Wilderness. https:\/\/www.yitay.net\/blog\/training-great-llms-entirely-from-ground-zero-in-the-wilderness"},{"key":"e_1_3_2_1_50_1","unstructured":"Guanhua Wang Olatunji Ruwase Bing Xie and Yuxiong He. 2024. FastPersist: Accelerating Model Checkpointing in Deep Learning. arXiv:2406.13768 [cs.DC]"},{"key":"e_1_3_2_1_51_1","doi-asserted-by":"crossref","unstructured":"Minjie Wang Chien-chin Huang and Jinyang Li. 2019. Supporting Very Large Models using Automatic Dataflow Graph Partitioning. In EuroSys.","DOI":"10.1145\/3302424.3303953"},{"key":"e_1_3_2_1_52_1","volume-title":"GEMINI: Fast Failure Recovery in Distributed Training with In-Memory Checkpoints. In SOSP.","author":"Wang Zhuang","year":"2023","unstructured":"Zhuang Wang, Zhen Jia, Shuai Zheng, Zhen Zhang, Xinwei Fu, T. S. Eugene Ng, and Yida Wang. 2023. GEMINI: Fast Failure Recovery in Distributed Training with In-Memory Checkpoints. In SOSP."},{"key":"e_1_3_2_1_53_1","volume-title":"Sylvain Gugger, Mariama Drame, Quentin Lhoest, and Alexander M. Rush.","author":"Wolf Thomas","year":"2020","unstructured":"Thomas Wolf, Lysandre Debut, Victor Sanh, Julien Chaumond, Clement Delangue, Anthony Moi, Pierric Cistac, Tim Rault, R\u00e9mi Louf, Morgan Funtowicz, Joe Davison, Sam Shleifer, Patrick von Platen, Clara Ma, Yacine Jernite, Julien Plu, Canwen Xu, Teven Le Scao, Sylvain Gugger, Mariama Drame, Quentin Lhoest, and Alexander M. Rush. 2020. Transformers: State-of-the-Art Natural Language Processing. In EMNLP: System Demonstrations."},{"key":"e_1_3_2_1_54_1","volume-title":"Beyond Efficiency: Scaling AI Sustainably","author":"Wu Carole-Jean","year":"2024","unstructured":"Carole-Jean Wu, Bilge Acun, Ramya Raghavendra, and Kim Hazelwood. 2024. Beyond Efficiency: Scaling AI Sustainably. IEEE Micro 44, 5 (2024)."},{"key":"e_1_3_2_1_55_1","volume-title":"Sustainable AI: Environmental Implications, Challenges and Opportunities. In MLSys.","author":"Wu Carole-Jean","year":"2022","unstructured":"Carole-Jean Wu, Ramya Raghavendra, Udit Gupta, Bilge Acun, Newsha Ardalani, Kiwan Maeng, Gloria Chang, Fiona Aga, Jinshi Huang, Charles Bai, Michael Gschwind, Anurag Gupta, Myle Ott, Anastasia Melnikov, Salvatore Candido, David Brooks, Geeta Chauhan, Benjamin Lee, Hsien-Hsin Lee, Bugra Akyildiz, Maximilian Balandat, Joe Spisak, Ravi Jain, Mike Rabbat, and Kim Hazelwood. 2022. Sustainable AI: Environmental Implications, Challenges and Opportunities. In MLSys."},{"key":"e_1_3_2_1_56_1","volume-title":"MCCS: A Service-based Approach to Collective Communication for Multi-Tenant Cloud. In SIGCOMM.","author":"Wu Yongji","year":"2024","unstructured":"Yongji Wu, Yechen Xu, Jingrong Chen, Zhaodong Wang, Ying Zhang, Matthew Lentz, and Danyang Zhuo. 2024. MCCS: A Service-based Approach to Collective Communication for Multi-Tenant Cloud. In SIGCOMM."},{"key":"e_1_3_2_1_57_1","volume-title":"Yanbin Grace Liu, and Abraham Silberschatz","author":"Xie Haiyong","year":"2008","unstructured":"Haiyong Xie, Y. Richard Yang, Arvind Krishnamurthy, Yanbin Grace Liu, and Abraham Silberschatz. 2008. P4P: Provider Portal for Applications. In SIGCOMM."},{"key":"e_1_3_2_1_58_1","volume-title":"Kimad: Adaptive Gradient Compression with Bandwidth Awareness. In DistributedML.","author":"Xin Jihao","year":"2023","unstructured":"Jihao Xin, Ivan Ilin, Shunkang Zhang, Marco Canini, and Peter Richt\u00e1rik. 2023. Kimad: Adaptive Gradient Compression with Bandwidth Awareness. In DistributedML."},{"key":"e_1_3_2_1_59_1","unstructured":"Yifan Xiong Yuting Jiang Ziyue Yang Lei Qu Guoshuai Zhao Shuguang Liu Dong Zhong Boris Pinzur Jie Zhang Yang Wang Jithin Jose Hossein Pourreza Jeff Baxter Kushal Datta Prabhat Ram Luke Melton Joe Chau Peng Cheng Yongqiang Xiong and Lidong Zhou. 2024. SuperBench: Improving Cloud AI Infrastructure Reliability with Proactive Validation. In USENIX ATC."},{"key":"e_1_3_2_1_60_1","volume-title":"Zeus: Understanding and Optimizing GPU Energy Consumption of DNN Training. In NSDI.","author":"You Jie","year":"2023","unstructured":"Jie You, Jae-Won Chung, and Mosharaf Chowdhury. 2023. Zeus: Understanding and Optimizing GPU Energy Consumption of DNN Training. In NSDI."},{"key":"e_1_3_2_1_61_1","doi-asserted-by":"crossref","unstructured":"Yuxuan Zhao Weikang Weng Rob van Nieuwpoort and Alexandru Uta. 2024. In Serverless OS Scheduler Choice Costs Money: A Hybrid Scheduling Approach for Cheaper FaaS. In Middleware.","DOI":"10.1145\/3652892.3700757"},{"key":"e_1_3_2_1_62_1","volume-title":"Alpa: Automating Inter- and Intra-Operator Parallelism for Distributed Deep Learning. In OSDI.","author":"Zheng Lianmin","year":"2022","unstructured":"Lianmin Zheng, Zhuohan Li, Hao Zhang, Yonghao Zhuang, Zhifeng Chen, Yanping Huang, Yida Wang, Yuanzhong Xu, Danyang Zhuo, Eric P. Xing, Joseph E. Gonzalez, and Ion Stoica. 2022. Alpa: Automating Inter- and Intra-Operator Parallelism for Distributed Deep Learning. In OSDI."}],"event":{"name":"APSys '25: 16th ACM SIGOPS Asia-Pacific Workshop on Systems","location":"Lotte Hotel World, Emerald Hall Seoul Republic of Korea","acronym":"APSys '25","sponsor":["SIGOPS ACM Special Interest Group on Operating Systems"]},"container-title":["Proceedings of the 16th ACM SIGOPS Asia-Pacific Workshop on Systems"],"original-title":[],"deposited":{"date-parts":[[2025,10,9]],"date-time":"2025-10-09T17:52:00Z","timestamp":1760032320000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3725783.3764395"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,10,11]]},"references-count":62,"alternative-id":["10.1145\/3725783.3764395","10.1145\/3725783"],"URL":"https:\/\/doi.org\/10.1145\/3725783.3764395","relation":{},"subject":[],"published":{"date-parts":[[2025,10,11]]},"assertion":[{"value":"2025-10-11","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}