{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,8,7]],"date-time":"2026-08-07T08:01:06Z","timestamp":1786089666952,"version":"3.56.0"},"publisher-location":"New York, NY, USA","reference-count":61,"publisher":"ACM","license":[{"start":{"date-parts":[[2026,4,26]],"date-time":"2026-04-26T00:00:00Z","timestamp":1777161600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/legalcode"}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2026,4,27]]},"DOI":"10.1145\/3767295.3769316","type":"proceedings-article","created":{"date-parts":[[2026,4,24]],"date-time":"2026-04-24T20:20:04Z","timestamp":1777062004000},"page":"72-88","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":2,"title":["FlexPipe: Adapting Dynamic LLM Serving Through Inflight Pipeline Refactoring in Fragmented Serverless Clusters"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-4809-9543","authenticated-orcid":false,"given":"Yanying","family":"Lin","sequence":"first","affiliation":[{"name":"Shenzhen Institutes of Advanced Technology,Chinese Academy of Sciences, Shenzhen, Guangdong, China"},{"name":"University of Chinese Academy of Sciences, Beijing, China"},{"name":"UC San Diego, San Diego, California, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0005-1776-4773","authenticated-orcid":false,"given":"Shijie","family":"Peng","sequence":"additional","affiliation":[{"name":"Shenzhen Institutes of Advanced Technology,Chinese Academy of Sciences, Shenzhen, Guangdong, China"},{"name":"University of Chinese Academy of Sciences, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-6421-3828","authenticated-orcid":false,"given":"Chengzhi","family":"Lu","sequence":"additional","affiliation":[{"name":"University of Macau, Macau, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-9480-0356","authenticated-orcid":false,"given":"ChengZhong","family":"Xu","sequence":"additional","affiliation":[{"name":"University of Macau, Macau, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-6133-407X","authenticated-orcid":false,"given":"Kejiang","family":"Ye","sequence":"additional","affiliation":[{"name":"Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences, Shenzhen, Guangdong, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"320","published-online":{"date-parts":[[2026,4,26]]},"reference":[{"key":"e_1_3_2_1_1_1","volume-title":"Taming Throughput-Latency Tradeoff in LLM Inference with Sarathi-Serve. In 18th USENIX Symp. Oper. Syst. Des. Implement. OSDI 2024 St. Clara CA USA July 10\u201312","author":"Agrawal Amey","year":"2024","unstructured":"Amey Agrawal, Nitin Kedia, Ashish Panwar, Jayashree Mohan, Nipun Kwatra, Bhargav S. Gulavani, Alexey Tumanov, and Ramachandran Ramjee. 2024. Taming Throughput-Latency Tradeoff in LLM Inference with Sarathi-Serve. In 18th USENIX Symp. Oper. Syst. Des. Implement. OSDI 2024 St. Clara CA USA July 10\u201312 2024, Ada Gavrilovska and Douglas B. Terry (Eds.). USENLX Association, 117\u2013134."},{"key":"e_1_3_2_1_2_1","volume-title":"Proc. 2018 USENIX Annu. Tech. Conf. USENIX ATC 2018 Boston MA USA July 11\u201313 2018 (USENIX ATC 2018). 923\u2013935","author":"Akkus Istemi Ekin","year":"2018","unstructured":"Istemi Ekin Akkus, Ruichuan Chen, Ivica Rimac, Manuel Stein, Klaus Satzke, Andre Beck, Paarijaat Aditya, and Volker Hilt. 2018. SAND: Towards High-Performance Serverless Computing.. In Proc. 2018 USENIX Annu. Tech. Conf. USENIX ATC 2018 Boston MA USA July 11\u201313 2018 (USENIX ATC 2018). 923\u2013935."},{"key":"e_1_3_2_1_3_1","doi-asserted-by":"publisher","DOI":"10.1109\/sc41405.2020.00073"},{"key":"e_1_3_2_1_4_1","doi-asserted-by":"publisher","DOI":"10.1145\/3552326.3567503"},{"key":"e_1_3_2_1_5_1","doi-asserted-by":"publisher","DOI":"10.1109\/sc41404.2022.00051"},{"key":"e_1_3_2_1_6_1","unstructured":"Rohan Anil Andrew M. Dai Orhan Firat Melvin Johnson Dmitry Lepikhin Alexandre Passos Siamak Shakeri Emanuel Taropa et al. 2023-09-13. PaLM 2 Technical Report. 10.48550\/arXiv.2305.10403"},{"key":"e_1_3_2_1_7_1","doi-asserted-by":"publisher","DOI":"10.1145\/3492321.3524270"},{"key":"e_1_3_2_1_8_1","doi-asserted-by":"publisher","DOI":"10.1145\/3492321.3519584"},{"key":"e_1_3_2_1_9_1","doi-asserted-by":"publisher","DOI":"10.1145\/3492321.3519584"},{"key":"e_1_3_2_1_10_1","first-page":"1877","article-title":"2020","volume":"33","author":"Brown Tom","year":"2020","unstructured":"Tom Brown, Benjamin Mann, Nick Ryder, Melanie Subbiah, Jared D. Kaplan, Prafulla Dhariwal, Arvind Neelakantan, Pranav Shyam, et al. 2020. Language Models Are Few-Shot Learners. 33 (2020), 1877\u20131901.","journal-title":"Language Models Are Few-Shot Learners."},{"key":"e_1_3_2_1_11_1","doi-asserted-by":"publisher","unstructured":"Lequn Chen Zihao Ye Yongji Wu Danyang Zhuo Luis Ceze and Arvind Krishnamurthy. 2023-10-28. Punica: Multi-Tenant LoRA Serving. 10.48550\/arXiv.2310.18547","DOI":"10.48550\/arXiv.2310.18547"},{"key":"e_1_3_2_1_12_1","doi-asserted-by":"publisher","unstructured":"Jacob Devlin Ming-Wei Chang Kenton Lee and Kristina Toutanova. 2019-05-24. BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. 10.48550\/arXiv.1810.04805","DOI":"10.48550\/arXiv.1810.04805"},{"key":"e_1_3_2_1_13_1","volume-title":"19th USENIX Symp. Networked Syst. Des. Implement. NSDI 2022 Renton WA USA April 4\u20136 2022 (NSDI","author":"Diab Khaled","year":"2022","unstructured":"Khaled Diab, Parham Yassini, and Mohamed Hefeeda. 2022. Orca: Server-assisted Multicast for Datacenter Networks.. In 19th USENIX Symp. Networked Syst. Des. Implement. NSDI 2022 Renton WA USA April 4\u20136 2022 (NSDI 2022). 1075\u20131091."},{"key":"e_1_3_2_1_14_1","doi-asserted-by":"publisher","unstructured":"Jiangfei Duan Runyu Lu Haojie Duanmu Xiuhong Li Xingcheng Zhang Dahua Lin Ion Stoica and Hao Zhang. 2024-06-13. MuxServe: Flexible Spatial-Temporal Multiplexing for Multiple LLM Serving. 10.48550\/arXiv.2404.02015","DOI":"10.48550\/arXiv.2404.02015"},{"key":"e_1_3_2_1_15_1","doi-asserted-by":"publisher","DOI":"10.1145\/3437801.3441593"},{"key":"e_1_3_2_1_16_1","doi-asserted-by":"publisher","DOI":"10.1145\/3366623.3368141"},{"key":"e_1_3_2_1_17_1","volume-title":"ServerlessLLM: Low-Latency Serverless Inference for Large Language Models. In 18th USENIX Symp. Oper. Syst. Des. Implement. OSDI 2024 St. Clara CA USA July 10\u201312","author":"Fu Yao","year":"2024","unstructured":"Yao Fu, Leyang Xue, Yeqi Huang, Andrei-Octavian Brabete, Dmitrii Ustiugov, Yuvraj Patel, and Luo Mai. 2024. ServerlessLLM: Low-Latency Serverless Inference for Large Language Models. In 18th USENIX Symp. Oper. Syst. Des. Implement. OSDI 2024 St. Clara CA USA July 10\u201312 2024, Ada Gavrilovska and Douglas B. Terry (Eds.). USENIX Association, 135\u2013153."},{"key":"e_1_3_2_1_18_1","doi-asserted-by":"publisher","unstructured":"Aaron Grattafiori Abhimanyu Dubey Abhinav Jauhri Abhinav Pandey Abhishek Kadian Ahmad Al-Dahle Aiesha Letman Akhil Mathur et al. 2024-11-23. The Llama 3 Herd of Models. 10.48550\/arXiv.2407.21783","DOI":"10.48550\/arXiv.2407.21783"},{"key":"e_1_3_2_1_19_1","doi-asserted-by":"publisher","unstructured":"Bodun Hu Jiamin Li Le Xu Myungjin Lee Akshay Jajoo Geon-Woo Kim Hong Xu and Aditya Akella. 2024-09-23. BlockLLM: Multi-tenant Finer-grained Serving for Large Language Models. 10.48550\/arXiv.2404.18322","DOI":"10.48550\/arXiv.2404.18322"},{"key":"e_1_3_2_1_20_1","doi-asserted-by":"publisher","unstructured":"Cunchen Hu Heyang Huang Liangliang Xu Xusheng Chen Jiang Xu Shuang Chen Hao Feng Chenxi Wang et al. 2024-01-20. Inference without Interference: Disaggregate LLM Inference for Mixed Downstream Workloads. 10.48550\/arXiv.2401.11181","DOI":"10.48550\/arXiv.2401.11181"},{"key":"e_1_3_2_1_21_1","volume-title":"Proceedings of the 33rd International Conference on Neural Information Processing Systems. Number 10","author":"Huang Yanping","year":"2019","unstructured":"Yanping Huang, Youlong Cheng, Ankur Bapna, Orhan Firat, Mia Xu Chen, Dehao Chen, HyoukJoong Lee, Jiquan Ngiam, et al. 2019-12-08. GPipe: Efficient Training of Giant Neural Networks Using Pipeline Parallelism. In Proceedings of the 33rd International Conference on Neural Information Processing Systems. Number 10. Curran Associates Inc., 103\u2013112."},{"key":"e_1_3_2_1_22_1","doi-asserted-by":"publisher","DOI":"10.1145\/3600006.3613165"},{"key":"e_1_3_2_1_23_1","volume-title":"InfiniGen: Efficient Generative Inference of Large Language Models with Dynamic KV Cache Management. In 18th USENIX Symp. Oper. Syst. Des. Implement. OSDI 2024 St. Clara CA USA July 10\u201312","author":"Lee Wonbeom","year":"2024","unstructured":"Wonbeom Lee, Jungi Lee, Junghwan Seo, and Jaewoong Sim. 2024. InfiniGen: Efficient Generative Inference of Large Language Models with Dynamic KV Cache Management. In 18th USENIX Symp. Oper. Syst. Des. Implement. OSDI 2024 St. Clara CA USA July 10\u201312 2024, Ada Gavrilovska and Douglas B. Terry (Eds.). USENIX Association, 155\u2013172."},{"key":"e_1_3_2_1_24_1","doi-asserted-by":"publisher","unstructured":"Conglong Li Zhewei Yao Xiaoxia Wu Minjia Zhang Connor Holmes Cheng Li and Yuxiong He. 2023-02-07. DeepSpeed Data Efficiency: Improving Deep Learning Model Quality and Training Efficiency via Efficient Data Sampling and Routing. 10.48550\/arXiv.2212.03597","DOI":"10.48550\/arXiv.2212.03597"},{"key":"e_1_3_2_1_25_1","volume-title":"Proc. 2022 USENIX Annu. Tech. Conf. USENIX ATC 2022 Carlsbad CA USA July 11-13 2022 (USENIX ATC 2022). USENIX Association.","author":"Li Jie","year":"2022","unstructured":"Jie Li, Laiping Zhao, Yanan Yang, Kunlin Zhan, and Keqiu Li. 2022. Tetris: Memory-efficient Serverless Inference through Tensor Sharing.. In Proc. 2022 USENIX Annu. Tech. Conf. USENIX ATC 2022 Carlsbad CA USA July 11-13 2022 (USENIX ATC 2022). USENIX Association."},{"key":"e_1_3_2_1_26_1","volume-title":"17th USENIX Symp. Oper. Syst. Des. Implement. OSDI 2023 Boston MA USA July 10\u201312 2023 (OSDI","author":"Li Zhuohan","year":"2023","unstructured":"Zhuohan Li, Lianmin Zheng, Yinmin Zhong, Vincent Liu, Ying Sheng, Xin Jin, Yanping Huang, Zhifeng Chen, et al. 2023. AlpaServe: Statistical Multiplexing with Model Parallelism for Deep Learning Serving.. In 17th USENIX Symp. Oper. Syst. Des. Implement. OSDI 2023 Boston MA USA July 10\u201312 2023 (OSDI 2023). USENIX Association, 663\u2013679."},{"key":"e_1_3_2_1_27_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICDCS60910.2024.00010"},{"key":"e_1_3_2_1_28_1","doi-asserted-by":"publisher","unstructured":"Zhiqi Lin Youshan Miao Guodong Liu Xiaoxiang Shi Quanlu Zhang Fan Yang Saeed Maleki Yi Zhu et al. 2023-01-21. SuperScaler: Supporting Flexible DNN Parallelization via a Unified Abstraction. 10.48550\/arXiv.2301.08984","DOI":"10.48550\/arXiv.2301.08984"},{"key":"e_1_3_2_1_29_1","unstructured":"Yuhan Liu Hanchen Li Yihua Cheng Siddhant Ray Yuyang Huang Qizheng Zhang Kuntai Du Jiayi Yao et al. 2024-08-04. CacheGen: Fast Context Loading for Language Model Applications via KV Cache Streaming."},{"key":"e_1_3_2_1_30_1","doi-asserted-by":"publisher","DOI":"10.1145\/3341301.3359646"},{"key":"e_1_3_2_1_31_1","doi-asserted-by":"publisher","DOI":"10.1145\/3458817.3476209"},{"key":"e_1_3_2_1_32_1","doi-asserted-by":"publisher","DOI":"10.1109\/ISCA59077.2024.00019"},{"key":"e_1_3_2_1_33_1","doi-asserted-by":"publisher","unstructured":"Alec Radford Jong Wook Kim Tao Xu Greg Brockman Christine McLeavey and Ilya Sutskever. 2022-12-06. Robust Speech Recognition via Large-Scale Weak Supervision. 10.48550\/arXiv.2212.04356","DOI":"10.48550\/arXiv.2212.04356"},{"key":"e_1_3_2_1_34_1","doi-asserted-by":"publisher","DOI":"10.1109\/sc41405.2020.00024"},{"key":"e_1_3_2_1_35_1","doi-asserted-by":"publisher","DOI":"10.1145\/3600006.3613155"},{"key":"e_1_3_2_1_36_1","doi-asserted-by":"publisher","DOI":"10.1145\/3689031.3717465"},{"key":"e_1_3_2_1_37_1","volume-title":"Proc. 2020 USENIX Annu. Tech. Conf. USENIX ATC 2020 July 15\u201317 2020 (USENIX ATC 2020). 205\u2013218","author":"Shahrad Mohammad","year":"2020","unstructured":"Mohammad Shahrad, Rodrigo Fonseca, 'I nigo Goiri, Gohar Chaudhry, Paul Batum, Jason Cooke, Eduardo Laureano, Colby Tresness, et al. 2020. Serverless in the Wild: Characterizing and Optimizing the Serverless Workload at a Large Cloud Provider.. In Proc. 2020 USENIX Annu. Tech. Conf. USENIX ATC 2020 July 15\u201317 2020 (USENIX ATC 2020). 205\u2013218."},{"key":"e_1_3_2_1_38_1","doi-asserted-by":"publisher","unstructured":"Ying Sheng Shiyi Cao Dacheng Li Coleman Hooper Nicholas Lee Shuo Yang Christopher Chou Banghua Zhu et al. 2024-06-05. S-LoRA: Serving Thousands of Concurrent LoRA Adapters. 10.48550\/arXiv.2311.03285","DOI":"10.48550\/arXiv.2311.03285"},{"key":"e_1_3_2_1_39_1","volume-title":"Fairness in Serving Large Language Models. In 18th USENIX Symp. Oper. Syst. Des. Implement. OSDI 2024 St. Clara CA USA July 10\u201312","author":"Sheng Ying","year":"2024","unstructured":"Ying Sheng, Shiyi Cao, Dacheng Li, Banghua Zhu, Zhuohan Li, Danyang Zhuo, Joseph E. Gonzalez, and Ion Stoica. 2024. Fairness in Serving Large Language Models. In 18th USENIX Symp. Oper. Syst. Des. Implement. OSDI 2024 St. Clara CA USA July 10\u201312 2024, Ada Gavrilovska and Douglas B. Terry (Eds.). USENIX Association, 965\u2013988."},{"key":"e_1_3_2_1_40_1","volume-title":"Int. Conf. Mach. Learn. ICML 2023 23\u201329","author":"Sheng Ying","year":"2023","unstructured":"Ying Sheng, Lianmin Zheng, Binhang Yuan, Zhuohan Li, Max Ryabinin, Beidi Chen, Percy Liang, Christopher Re, et al. 2023-06-15. FlexGen: High-Throughput Generative Inference of Large Language Models with a Single GPU.. In Int. Conf. Mach. Learn. ICML 2023 23\u201329 July 2023 Honol. Hawaii USA (ICML 2023). 31094\u201331116."},{"key":"e_1_3_2_1_41_1","volume-title":"USHER: Holistic Interference Avoidance for Resource Optimized ML Inference. In 18th USENIX Symp. Oper. Syst. Des. Implement. OSDI 2024 St. Clara CA USA July 10\u201312","author":"Shubha Sudipta Saha","year":"2024","unstructured":"Sudipta Saha Shubha, Haiying Shen, and Anand Iyer. 2024. USHER: Holistic Interference Avoidance for Resource Optimized ML Inference. In 18th USENIX Symp. Oper. Syst. Des. Implement. OSDI 2024 St. Clara CA USA July 10\u201312 2024, Ada Gavrilovska and Douglas B. Terry (Eds.). USENIX Association, 947\u2013964."},{"key":"e_1_3_2_1_42_1","volume-title":"Llumnix: Dynamic Scheduling for Large Language Model Serving. In 18th USENIX Symp. Oper. Syst. Des. Implement. OSDI 2024 St. Clara CA USA July 10\u201312","author":"Sun Biao","year":"2024","unstructured":"Biao Sun, Ziming Huang, Hanyu Zhao, Wencong Xiao, Xinyi Zhang, Yong Li, and Wei Lin. 2024. Llumnix: Dynamic Scheduling for Large Language Model Serving. In 18th USENIX Symp. Oper. Syst. Des. Implement. OSDI 2024 St. Clara CA USA July 10\u201312 2024, Ada Gavrilovska and Douglas B. Terry (Eds.). USENIX Association, 173\u2013191."},{"key":"e_1_3_2_1_43_1","doi-asserted-by":"publisher","DOI":"10.1145\/3676641.3716278"},{"key":"e_1_3_2_1_44_1","doi-asserted-by":"publisher","DOI":"10.1109\/ipdps49936.2021.00109"},{"key":"e_1_3_2_1_45_1","volume-title":"Process. Syst. 34 Annu. Conf. Neural Inf. Process. Syst. 2021 NeurIPS 2021 Dec. 6\u201314 2021 Virtual (NeurIPS","volume":"24840","author":"Tarnawski Jakub M","year":"2021","unstructured":"Jakub M Tarnawski, Deepak Narayanan, and Amar Phanishayee. 2021. Piper: Multidimensional Planner for DNN Parallelization.. In Adv. Neural Inf. Process. Syst. 34 Annu. Conf. Neural Inf. Process. Syst. 2021 NeurIPS 2021 Dec. 6\u201314 2021 Virtual (NeurIPS 2021, Vol. 34). Curran Associates, Inc., 24829\u201324840."},{"key":"e_1_3_2_1_46_1","doi-asserted-by":"publisher","unstructured":"Hugo Touvron Thibaut Lavril Gautier Izacard Xavier Martinet MarieAnne Lachaux Timoth'ee Lacroix Baptiste Rozi'ere Naman Goyal et al. 2023-02-27. LLaMA: Open and Efficient Foundation Language Models. 10.48550\/arXiv.2302.13971","DOI":"10.48550\/arXiv.2302.13971"},{"key":"e_1_3_2_1_47_1","doi-asserted-by":"publisher","unstructured":"Hugo Touvron Louis Martin Kevin Stone Peter Albert Amjad Almahairi Yasmine Babaei Nikolay Bashlykov Soumya Batra et al. 2023-07-19. Llama 2: Open Foundation and Fine-Tuned Chat Models. 10.48550\/arXiv.2307.09288","DOI":"10.48550\/arXiv.2307.09288"},{"key":"e_1_3_2_1_48_1","volume-title":"Proc. 2021 USENIX Annu. Tech. Conf. USENIX ATC 2021 July 14\u201316 2021 (USENIX ATC 2021). USENIX Association, 443\u2013457","author":"Wang Ao","year":"2021","unstructured":"Ao Wang, Shuai Chang, Huangshi Tian, Hongqi Wang, Haoran Yang, Huiba Li, Rui Du, and Yue Cheng. 2021. FaaSNet: Scalable and Fast Provisioning of Custom Serverless Container Runtimes at Alibaba Cloud Function Compute.. In Proc. 2021 USENIX Annu. Tech. Conf. USENIX ATC 2021 July 14\u201316 2021 (USENIX ATC 2021). USENIX Association, 443\u2013457."},{"key":"e_1_3_2_1_49_1","doi-asserted-by":"publisher","DOI":"10.1145\/3552326.3587438"},{"key":"e_1_3_2_1_50_1","volume-title":"19th USENIX Symp. Networked Syst. Des. Implement. NSDI 2022 Renton WA USA April 4\u20136 2022 (NSDI","author":"Weng Qizhen","year":"2022","unstructured":"Qizhen Weng, Wencong Xiao, Yinghao Yu, Wei Wang, Cheng Wang, Jian He, Yong Li, Liping Zhang, et al. 2022. MLaaS in the Wild: Workload Analysis and Scheduling in Large-Scale Heterogeneous GPU Clusters.. In 19th USENIX Symp. Networked Syst. Des. Implement. NSDI 2022 Renton WA USA April 4\u20136 2022 (NSDI 2022). USENIX Association, 945\u2013960."},{"key":"e_1_3_2_1_51_1","volume-title":"Proc. 2023 USENIX Annu. Tech. Conf. USENIX ATC 2023 Boston MA USA July 10\u201312 2023 (USENIX ATC 2023). USENIX Association, 995\u20131008","author":"Weng Qizhen","year":"2023","unstructured":"Qizhen Weng, Lingyun Yang, Yinghao Yu, Wei Wang, Xiaochuan Tang, Guodong Yang, and Liping Zhang. 2023. Beware of Fragmentation: Scheduling GPU-Sharing Workloads with Fragmentation Gradient Descent.. In Proc. 2023 USENIX Annu. Tech. Conf. USENIX ATC 2023 Boston MA USA July 10\u201312 2023 (USENIX ATC 2023). USENIX Association, 995\u20131008."},{"key":"e_1_3_2_1_52_1","doi-asserted-by":"publisher","DOI":"10.14778\/3626292.3626303"},{"key":"e_1_3_2_1_53_1","doi-asserted-by":"publisher","DOI":"10.1145\/3503222.3507709"},{"key":"e_1_3_2_1_54_1","doi-asserted-by":"publisher","DOI":"10.1145\/3689031.3696098"},{"key":"e_1_3_2_1_55_1","volume-title":"16th USENIX Symp. Oper. Syst. Des. Implement. OSDI 2022 Carlsbad CA USA July 11\u201313 2022 (OSDI","author":"Yu Gyeong-In","year":"2022","unstructured":"Gyeong-In Yu, Joo Seong Jeong, Geon-Woo Kim, Soojeong Kim, and Byung-Gon Chun. 2022. Orca: A Distributed Serving System for Transformer-Based Generative Models.. In 16th USENIX Symp. Oper. Syst. Des. Implement. OSDI 2022 Carlsbad CA USA July 11\u201313 2022 (OSDI 2022). USENIX Association, 521\u2013538."},{"key":"e_1_3_2_1_56_1","doi-asserted-by":"publisher","DOI":"10.1145\/3669940.3707285"},{"key":"e_1_3_2_1_57_1","volume-title":"20th USENIX Symp. Networked Syst. Des. Implement. NSDI2023 Boston MA April 17\u201319 2023 (NSDI","author":"Zhang Hong","year":"2023","unstructured":"Hong Zhang, Yupeng Tang, Anurag Khandelwal, and Ion Stoica. 2023. SHEPHERD: Serving DNNs in the Wild.. In 20th USENIX Symp. Networked Syst. Des. Implement. NSDI2023 Boston MA April 17\u201319 2023 (NSDI 2023). USENIX Association, 787\u2013808."},{"key":"e_1_3_2_1_58_1","doi-asserted-by":"publisher","DOI":"10.1145\/3477132.3483580"},{"key":"e_1_3_2_1_59_1","volume-title":"21st USENIX Symp. Networked Syst. Des. Implement. NSDI 2024 St. Clara CA April 15\u201317 2024 (NSDI","author":"Zhang Zili","year":"2024","unstructured":"Zili Zhang, Chao Jin, and Xin Jin. 2024. Jolteon: Unleashing the Promise of Serverless for Serverless Workflows.. In 21st USENIX Symp. Networked Syst. Des. Implement. NSDI 2024 St. Clara CA April 15\u201317 2024 (NSDI 2024). USENIX Association, 167\u2013183."},{"key":"e_1_3_2_1_60_1","volume-title":"16th USENIX Symp. Oper. Syst. Des. Implement. OSDI 2022 Carlsbad CA USA July 11\u201313 2022 (OSDI","author":"Zheng Lianmin","year":"2022","unstructured":"Lianmin Zheng, Zhuohan Li, Hao Zhang, Yonghao Zhuang, Zhifeng Chen, Yanping Huang, Yida Wang, Yuanzhong Xu, et al. 2022. Alpa: Automating Inter- and Intra-Operator Parallelism for Distributed Deep Learning.. In 16th USENIX Symp. Oper. Syst. Des. Implement. OSDI 2022 Carlsbad CA USA July 11\u201313 2022 (OSDI 2022). 559\u2013578."},{"key":"e_1_3_2_1_61_1","volume-title":"DistServe: Disaggregating Prefill and Decoding for Goodput-optimized Large Language Model Serving. In 18th USENIX Symp. Oper. Syst. Des. Implement. OSDI 2024 St. Clara CA USA July 10\u201312","author":"Zhong Yinmin","year":"2024","unstructured":"Yinmin Zhong, Shengyu Liu, Junda Chen, Jianbo Hu, Yibo Zhu, Xuanzhe Liu, Xin Jin, and Hao Zhang. 2024. DistServe: Disaggregating Prefill and Decoding for Goodput-optimized Large Language Model Serving. In 18th USENIX Symp. Oper. Syst. Des. Implement. OSDI 2024 St. Clara CA USA July 10\u201312 2024, Ada Gavrilovska and Douglas B. Terry (Eds.). USENIX Association, 193\u2013210."}],"event":{"name":"EUROSYS '26: 21st European Conference on Computer Systems","location":"McEwan Hall\/The University of Edinburgh Edinburgh Scotland UK","acronym":"EUROSYS '26","sponsor":["SIGOPS ACM Special Interest Group on Operating Systems"]},"container-title":["Proceedings of the 21st European Conference on Computer Systems"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3767295.3769316","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,6,5]],"date-time":"2026-06-05T12:14:18Z","timestamp":1780661658000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3767295.3769316"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,4,26]]},"references-count":61,"alternative-id":["10.1145\/3767295.3769316","10.1145\/3767295"],"URL":"https:\/\/doi.org\/10.1145\/3767295.3769316","relation":{},"subject":[],"published":{"date-parts":[[2026,4,26]]},"assertion":[{"value":"2026-04-26","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}