{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,2]],"date-time":"2026-07-02T13:43:33Z","timestamp":1782999813799,"version":"3.54.5"},"publisher-location":"New York, NY, USA","reference-count":53,"publisher":"ACM","license":[{"start":{"date-parts":[[2026,7,5]],"date-time":"2026-07-05T00:00:00Z","timestamp":1783209600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by-nc-nd\/4.0\/legalcode"}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2026,7,6]]},"DOI":"10.1145\/3797905.3807874","type":"proceedings-article","created":{"date-parts":[[2026,7,2]],"date-time":"2026-07-02T11:50:37Z","timestamp":1782993037000},"page":"919-932","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":0,"title":["Latency-SLO-Aware Memory Offloading for Large Language Model Inference"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0009-0006-3439-6084","authenticated-orcid":false,"given":"Chenxiang","family":"Ma","sequence":"first","affiliation":[{"name":"Peking University, Beijing, Beijing, China and Alibaba Cloud Computing, Beijing, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-2536-0016","authenticated-orcid":false,"given":"Hanyu","family":"Zhao","sequence":"additional","affiliation":[{"name":"Alibaba Cloud Computing, Hangzhou, Zhejiang, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-4568-0244","authenticated-orcid":false,"given":"Zhisheng","family":"Ye","sequence":"additional","affiliation":[{"name":"Peking University, Beijing, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0001-8077-6356","authenticated-orcid":false,"given":"Zehua","family":"Yang","sequence":"additional","affiliation":[{"name":"Peking University, Beijing, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-9084-7165","authenticated-orcid":false,"given":"Tianhao","family":"Fu","sequence":"additional","affiliation":[{"name":"Peking University, Beijing, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0000-4900-6874","authenticated-orcid":false,"given":"Jiaxun","family":"Han","sequence":"additional","affiliation":[{"name":"Peking University, Beijing, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-6299-4683","authenticated-orcid":false,"given":"Jie","family":"Zhang","sequence":"additional","affiliation":[{"name":"Peking University, Beijing, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-7903-0717","authenticated-orcid":false,"given":"Yingwei","family":"Luo","sequence":"additional","affiliation":[{"name":"Peking University, Beijing, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-6951-1613","authenticated-orcid":false,"given":"Xiaolin","family":"Wang","sequence":"additional","affiliation":[{"name":"Peking University, Beijing, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-0429-4371","authenticated-orcid":false,"given":"Zhenlin","family":"Wang","sequence":"additional","affiliation":[{"name":"Michigan Technological University, Houghton, Michigan, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-9072-3170","authenticated-orcid":false,"given":"Yong","family":"Li","sequence":"additional","affiliation":[{"name":"Alibaba Cloud Computing, Beijing, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0003-8620-1064","authenticated-orcid":false,"given":"Diyu","family":"Zhou","sequence":"additional","affiliation":[{"name":"Peking University, Beijing, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"320","published-online":{"date-parts":[[2026,7,5]]},"reference":[{"key":"e_1_3_3_1_2_2","doi-asserted-by":"publisher","DOI":"10.1145\/3604915.3610647"},{"key":"e_1_3_3_1_3_2","first-page":"117","volume-title":"18th USENIX Symposium on Operating Systems Design and Implementation (OSDI 24)","author":"Agrawal Amey","year":"2024","unstructured":"Amey Agrawal, Nitin Kedia, Ashish Panwar, Jayashree Mohan, Nipun Kwatra, Bhargav Gulavani, Alexey Tumanov, and Ramachandran Ramjee. 2024. Taming Throughput-Latency Tradeoff in LLM Inference with Sarathi-Serve. In 18th USENIX Symposium on Operating Systems Design and Implementation (OSDI 24). USENIX Association, Santa Clara, CA, 117\u2013134. https:\/\/www.usenix.org\/conference\/osdi24\/presentation\/agrawal"},{"key":"e_1_3_3_1_4_2","unstructured":"01. AI : Alex Young Bei Chen Chao Li Chengen Huang Ge Zhang Guanwei Zhang Guoyin Wang Heng Li Jiangcheng Zhu Jianqun Chen Jing Chang Kaidong Yu Peng Liu Qiang Liu Shawn Yue Senbin Yang Shiming Yang Wen Xie Wenhao Huang Xiaohui Hu Xiaoyi Ren Xinyao Niu Pengcheng Nie Yanpeng Li Yuchi Xu Yudong Liu Yue Wang Yuxuan Cai Zhenyu Gu Zhiyuan Liu and Zonghong Dai. 2025. Yi: Open Foundation Models by 01.AI. arxiv:https:\/\/arXiv.org\/abs\/2403.04652\u00a0[cs.CL] https:\/\/arxiv.org\/abs\/2403.04652"},{"key":"e_1_3_3_1_5_2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.acl-long.678"},{"key":"e_1_3_3_1_6_2","doi-asserted-by":"publisher","DOI":"10.1109\/SC41404.2022.00051"},{"key":"e_1_3_3_1_7_2","unstructured":"Shuyang Cao and Lu Wang. 2023. AWESOME: GPU Memory-constrained Long Document Summarization using Memory Mechanism and Global Salient Content. arxiv:https:\/\/arXiv.org\/abs\/2305.14806\u00a0[cs.CL] https:\/\/arxiv.org\/abs\/2305.14806"},{"key":"e_1_3_3_1_8_2","unstructured":"Mark Chen Jerry Tworek Heewoo Jun Qiming Yuan Henrique\u00a0Ponde de Oliveira\u00a0Pinto Jared Kaplan Harri Edwards Yuri Burda Nicholas Joseph Greg Brockman Alex Ray Raul Puri Gretchen Krueger Michael Petrov Heidy Khlaaf Girish Sastry Pamela Mishkin Brooke Chan Scott Gray Nick Ryder Mikhail Pavlov Alethea Power Lukasz Kaiser Mohammad Bavarian Clemens Winter Philippe Tillet Felipe\u00a0Petroski Such Dave Cummings Matthias Plappert Fotios Chantzis Elizabeth Barnes Ariel Herbert-Voss William\u00a0Hebgen Guss Alex Nichol Alex Paino Nikolas Tezak Jie Tang Igor Babuschkin Suchir Balaji Shantanu Jain William Saunders Christopher Hesse Andrew\u00a0N. Carr Jan Leike Josh Achiam Vedant Misra Evan Morikawa Alec Radford Matthew Knight Miles Brundage Mira Murati Katie Mayer Peter Welinder Bob McGrew Dario Amodei Sam McCandlish Ilya Sutskever and Wojciech Zaremba. 2021. Evaluating Large Language Models Trained on Code. arxiv:https:\/\/arXiv.org\/abs\/2107.03374\u00a0[cs.LG] https:\/\/arxiv.org\/abs\/2107.03374"},{"key":"e_1_3_3_1_9_2","unstructured":"Siyuan Chen Zelong Guan Yudong Liu and Phillip\u00a0B. Gibbons. 2024. Practical offloading for fine-tuning LLM on commodity GPU via learned subspace projectors. arxiv:https:\/\/arXiv.org\/abs\/2406.10181\u00a0[cs.DC] https:\/\/arxiv.org\/abs\/2406.10181"},{"key":"e_1_3_3_1_10_2","doi-asserted-by":"publisher","unstructured":"Jack Choquette. 2023. NVIDIA Hopper H100 GPU: Scaling Performance. IEEE Micro 43 3 (2023) 9\u201317. 10.1109\/MM.2023.3256796","DOI":"10.1109\/MM.2023.3256796"},{"key":"e_1_3_3_1_11_2","unstructured":"Sumit\u00a0Kumar Dam Choong\u00a0Seon Hong Yu Qiao and Chaoning Zhang. 2024. A Complete Survey on LLM-based AI Chatbots. arxiv:https:\/\/arXiv.org\/abs\/2406.16937\u00a0[cs.CL] https:\/\/arxiv.org\/abs\/2406.16937"},{"key":"e_1_3_3_1_12_2","unstructured":"Sundesh Donthi Maximilian Spencer Om Patel Joon Doh and Eid Rodan. 2024. Improving LLM Abilities in Idiomatic Translation. arxiv:https:\/\/arXiv.org\/abs\/2407.03518\u00a0[cs.CL] https:\/\/arxiv.org\/abs\/2407.03518"},{"key":"e_1_3_3_1_13_2","doi-asserted-by":"publisher","DOI":"10.1145\/3721146.3721961"},{"key":"e_1_3_3_1_14_2","doi-asserted-by":"crossref","unstructured":"Michael Elliott Manuel Luciano and Jose Fortes. 2024. Integrating Large Language Models and the iDigBio Portal for Conversational Data Exploration and Retrieval. Biodiversity Information Science and Standards 8 (2024) e142696.","DOI":"10.3897\/biss.8.142696"},{"key":"e_1_3_3_1_15_2","first-page":"111","volume-title":"2024 USENIX Annual Technical Conference (USENIX ATC 24)","author":"Gao Bin","year":"2024","unstructured":"Bin Gao, Zhuomin He, Puru Sharma, Qingxuan Kang, Djordje Jevdjic, Junbo Deng, Xingkun Yang, Zhou Yu, and Pengfei Zuo. 2024. Cost-Efficient Large Language Model Serving for Multi-turn Conversations with CachedAttention. In 2024 USENIX Annual Technical Conference (USENIX ATC 24). USENIX Association, Santa Clara, CA, 111\u2013126. https:\/\/www.usenix.org\/conference\/atc24\/presentation\/gao-bin-cost"},{"key":"e_1_3_3_1_16_2","unstructured":"Tyler Griggs Xiaoxuan Liu Jiaxiang Yu Doyoung Kim Wei-Lin Chiang Alvin Cheung and Ion Stoica. 2024. M\u00e9lange: Cost Efficient Large Language Model Serving by Exploiting GPU Heterogeneity. arxiv:https:\/\/arXiv.org\/abs\/2404.14527\u00a0[cs.DC] https:\/\/arxiv.org\/abs\/2404.14527"},{"key":"e_1_3_3_1_17_2","doi-asserted-by":"publisher","DOI":"10.1145\/3611643.3617850"},{"key":"e_1_3_3_1_18_2","unstructured":"Jiaao He and Jidong Zhai. 2024. FastDecode: High-Throughput GPU-Efficient LLM Serving using Heterogeneous Pipelines. arxiv:https:\/\/arXiv.org\/abs\/2403.11421\u00a0[cs.DC] https:\/\/arxiv.org\/abs\/2403.11421"},{"key":"e_1_3_3_1_19_2","series-title":"(USENIX ATC \u201925)","volume-title":"Proceedings of the 2025 USENIX Conference on Usenix Annual Technical Conference","author":"He Yongjun","year":"2025","unstructured":"Yongjun He, Haofeng Yang, Yao Lu, Ana Klimovi\u0107, and Gustavo Alonso. 2025. Resource multiplexing in tuning and serving large language models. In Proceedings of the 2025 USENIX Conference on Usenix Annual Technical Conference (Boston, MA, USA) (USENIX ATC \u201925). USENIX Association, USA, Article 97, 17\u00a0pages."},{"key":"e_1_3_3_1_20_2","unstructured":"Sirui Hong Yizhang Lin Bang Liu Bangbang Liu Binhao Wu Ceyao Zhang Chenxing Wei Danyang Li Jiaqi Chen Jiayi Zhang Jinlin Wang Li Zhang Lingyao Zhang Min Yang Mingchen Zhuge Taicheng Guo Tuo Zhou Wei Tao Xiangru Tang Xiangtao Lu Xiawu Zheng Xinbing Liang Yaying Fei Yuheng Cheng Zhibin Gou Zongze Xu and Chenglin Wu. 2024. Data Interpreter: An LLM Agent For Data Science. arxiv:https:\/\/arXiv.org\/abs\/2402.18679\u00a0[cs.AI] https:\/\/arxiv.org\/abs\/2402.18679"},{"key":"e_1_3_3_1_21_2","unstructured":"Cunchen Hu Heyang Huang Liangliang Xu Xusheng Chen Jiang Xu Shuang Chen Hao Feng Chenxi Wang Sa Wang Yungang Bao Ninghui Sun and Yizhou Shan. 2024. Inference without Interference: Disaggregate LLM Inference for Mixed Downstream Workloads. arxiv:https:\/\/arXiv.org\/abs\/2401.11181\u00a0[cs.DC] https:\/\/arxiv.org\/abs\/2401.11181"},{"key":"e_1_3_3_1_22_2","doi-asserted-by":"publisher","DOI":"10.5555\/3691825.3691864"},{"key":"e_1_3_3_1_23_2","unstructured":"interestingLSY\/swiftLLM. 2025. SwiftLLM.https:\/\/github.com\/interestingLSY\/swiftLLM"},{"key":"e_1_3_3_1_24_2","unstructured":"Xuanlin Jiang Yang Zhou Shiyi Cao Ion Stoica and Minlan Yu. 2024. NEO: Saving GPU Memory Crisis with CPU Offloading for Online LLM Inference. arxiv:https:\/\/arXiv.org\/abs\/2411.01142\u00a0[cs.DC] https:\/\/arxiv.org\/abs\/2411.01142"},{"key":"e_1_3_3_1_25_2","unstructured":"Roman Koshkin Katsuhito Sudoh and Satoshi Nakamura. 2024. TransLLaMa: LLM-based Simultaneous Translation System. arxiv:https:\/\/arXiv.org\/abs\/2402.04636\u00a0[cs.CL] https:\/\/arxiv.org\/abs\/2402.04636"},{"key":"e_1_3_3_1_26_2","doi-asserted-by":"publisher","DOI":"10.1145\/3643795.3648384"},{"key":"e_1_3_3_1_27_2","doi-asserted-by":"publisher","DOI":"10.1145\/3600006.3613165"},{"key":"e_1_3_3_1_28_2","first-page":"155","volume-title":"18th USENIX Symposium on Operating Systems Design and Implementation (OSDI 24)","author":"Lee Wonbeom","year":"2024","unstructured":"Wonbeom Lee, Jungi Lee, Junghwan Seo, and Jaewoong Sim. 2024. InfiniGen: Efficient Generative Inference of Large Language Models with Dynamic KV Cache Management. In 18th USENIX Symposium on Operating Systems Design and Implementation (OSDI 24). USENIX Association, Santa Clara, CA, 155\u2013172. https:\/\/www.usenix.org\/conference\/osdi24\/presentation\/lee"},{"key":"e_1_3_3_1_29_2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.findings-acl.280"},{"key":"e_1_3_3_1_30_2","unstructured":"Shang-Ching Liu ShengKun Wang Wenqi Lin Chung-Wei Hsiung Yi-Chen Hsieh Yu-Ping Cheng Sian-Hong Luo Tsungyao Chang and Jianwei Zhang. 2023. JarviX: A LLM No code Platform for Tabular Data Analysis and Optimization. arxiv:https:\/\/arXiv.org\/abs\/2312.02213\u00a0[cs.LG] https:\/\/arxiv.org\/abs\/2312.02213"},{"key":"e_1_3_3_1_31_2","unstructured":"Yinquan Lu Wenhao Zhu Lei Li Yu Qiao and Fei Yuan. 2024. LLaMAX: Scaling Linguistic Horizons of LLM by Enhancing Translation Capabilities Beyond 100 Languages. arxiv:https:\/\/arXiv.org\/abs\/2407.05975\u00a0[cs.CL] https:\/\/arxiv.org\/abs\/2407.05975"},{"key":"e_1_3_3_1_32_2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.emnlp-demo.31"},{"key":"e_1_3_3_1_33_2","unstructured":"NVIDIA. 2023. TensorRT-LLM: A TensorRT Toolbox for Optimized Large Language Model Inference. https:\/\/github.com\/NVIDIA\/TensorRT-LLM. Accessed: 2024-xx-xx."},{"key":"e_1_3_3_1_34_2","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA61900.2025.00113"},{"key":"e_1_3_3_1_35_2","volume-title":"PyTorch: an imperative style, high-performance deep learning library","author":"Paszke Adam","year":"2019","unstructured":"Adam Paszke, Sam Gross, Francisco Massa, Adam Lerer, James Bradbury, Gregory Chanan, Trevor Killeen, Zeming Lin, Natalia Gimelshein, Luca Antiga, Alban Desmaison, Andreas K\u00f6pf, Edward Yang, Zach DeVito, Martin Raison, Alykhan Tejani, Sasank Chilamkurthy, Benoit Steiner, Lu Fang, Junjie Bai, and Soumith Chintala. 2019. PyTorch: an imperative style, high-performance deep learning library. Curran Associates Inc., Red Hook, NY, USA."},{"key":"e_1_3_3_1_36_2","doi-asserted-by":"publisher","DOI":"10.1109\/ISCA59077.2024.00019"},{"key":"e_1_3_3_1_37_2","doi-asserted-by":"publisher","DOI":"10.1145\/3698038.3698523"},{"key":"e_1_3_3_1_38_2","unstructured":"Alec Radford Jeffrey Wu Rewon Child David Luan Dario Amodei Ilya Sutskever et\u00a0al. 2019. Language models are unsupervised multitask learners. OpenAI blog 1 8 (2019) 9."},{"key":"e_1_3_3_1_39_2","series-title":"Proceedings of Machine Learning Research","first-page":"31094","volume-title":"Proceedings of the 40th International Conference on Machine Learning","volume":"202","author":"Sheng Ying","year":"2023","unstructured":"Ying Sheng, Lianmin Zheng, Binhang Yuan, Zhuohan Li, Max Ryabinin, Beidi Chen, Percy Liang, Christopher Re, Ion Stoica, and Ce Zhang. 2023. FlexGen: High-Throughput Generative Inference of Large Language Models with a Single GPU. In Proceedings of the 40th International Conference on Machine Learning(Proceedings of Machine Learning Research, Vol.\u00a0202), Andreas Krause, Emma Brunskill, Kyunghyun Cho, Barbara Engelhardt, Sivan Sabato, and Jonathan Scarlett (Eds.). PMLR, 31094\u201331116. https:\/\/proceedings.mlr.press\/v202\/sheng23a.html"},{"key":"e_1_3_3_1_40_2","unstructured":"Shanmugasundaram Sivakumar. 2024. Performance Optimization of Large Language Models (LLMs) in Web Applications. International Journal of Advanced Scientific Research 8 (02 2024) 1077\u20131096."},{"key":"e_1_3_3_1_41_2","first-page":"173","volume-title":"18th USENIX Symposium on Operating Systems Design and Implementation (OSDI 24)","author":"Sun Biao","year":"2024","unstructured":"Biao Sun, Ziming Huang, Hanyu Zhao, Wencong Xiao, Xinyi Zhang, Yong Li, and Wei Lin. 2024. Llumnix: Dynamic Scheduling for Large Language Model Serving. In 18th USENIX Symposium on Operating Systems Design and Implementation (OSDI 24). USENIX Association, Santa Clara, CA, 173\u2013191. https:\/\/www.usenix.org\/conference\/osdi24\/presentation\/sun-biao"},{"key":"e_1_3_3_1_42_2","unstructured":"Rohan Taori Ishaan Gulrajani Tianyi Zhang Yann Dubois Xuechen Li Carlos Guestrin Percy Liang and Tatsunori\u00a0B Hashimoto. 2023. Stanford alpaca: an instruction-following llama model (2023). URL https:\/\/github.com\/tatsu-lab\/stanford_alpaca 1 9 (2023)."},{"key":"e_1_3_3_1_43_2","unstructured":"Hugo Touvron Louis Martin Kevin Stone Peter Albert Amjad Almahairi Yasmine Babaei Nikolay Bashlykov Soumya Batra Prajjwal Bhargava Shruti Bhosale Dan Bikel Lukas Blecher Cristian\u00a0Canton Ferrer Moya Chen Guillem Cucurull David Esiobu Jude Fernandes Jeremy Fu Wenyin Fu Brian Fuller Cynthia Gao Vedanuj Goswami Naman Goyal Anthony Hartshorn Saghar Hosseini Rui Hou Hakan Inan Marcin Kardas Viktor Kerkez Madian Khabsa Isabel Kloumann Artem Korenev Punit\u00a0Singh Koura Marie-Anne Lachaux Thibaut Lavril Jenya Lee Diana Liskovich Yinghai Lu Yuning Mao Xavier Martinet Todor Mihaylov Pushkar Mishra Igor Molybog Yixin Nie Andrew Poulton Jeremy Reizenstein Rashi Rungta Kalyan Saladi Alan Schelten Ruan Silva Eric\u00a0Michael Smith Ranjan Subramanian Xiaoqing\u00a0Ellen Tan Binh Tang Ross Taylor Adina Williams Jian\u00a0Xiang Kuan Puxin Xu Zheng Yan Iliyan Zarov Yuchen Zhang Angela Fan Melanie Kambadur Sharan Narang Aurelien Rodriguez Robert Stojnic Sergey Edunov and Thomas Scialom. 2023. Llama 2: Open Foundation and Fine-Tuned Chat Models. arxiv:https:\/\/arXiv.org\/abs\/2307.09288\u00a0[cs.CL] https:\/\/arxiv.org\/abs\/2307.09288"},{"key":"e_1_3_3_1_44_2","unstructured":"Shubham Ugare Tarun Suresh Hangoo Kang Sasa Misailovic and Gagandeep Singh. 2024. SynCode: LLM Generation with Grammar Augmentation. arxiv:https:\/\/arXiv.org\/abs\/2403.01632\u00a0[cs.LG] https:\/\/arxiv.org\/abs\/2403.01632"},{"key":"e_1_3_3_1_45_2","unstructured":"Ashish Vaswani Noam Shazeer Niki Parmar Jakob Uszkoreit Llion Jones Aidan\u00a0N Gomez Lukasz Kaiser and Illia Polosukhin. 2017. Attention Is All You Need.(Nips) 2017. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/1706.03762 10 (2017) S0140525X16001837."},{"key":"e_1_3_3_1_46_2","doi-asserted-by":"publisher","DOI":"10.1145\/3676641.3715983"},{"key":"e_1_3_3_1_47_2","doi-asserted-by":"publisher","DOI":"10.1145\/3711896.3737413"},{"key":"e_1_3_3_1_48_2","unstructured":"Yizhong Wang Yeganeh Kordi Swaroop Mishra Alisa Liu Noah\u00a0A. Smith Daniel Khashabi and Hannaneh Hajishirzi. 2023. Self-Instruct: Aligning Language Models with Self-Generated Instructions. arxiv:https:\/\/arXiv.org\/abs\/2212.10560\u00a0[cs.CL] https:\/\/arxiv.org\/abs\/2212.10560"},{"key":"e_1_3_3_1_49_2","unstructured":"Le Xiao and Xiaolin Chen. 2023. Enhancing LLM with Evolutionary Fine Tuning for News Summary Generation. arxiv:https:\/\/arXiv.org\/abs\/2307.02839\u00a0[cs.CL] https:\/\/arxiv.org\/abs\/2307.02839"},{"key":"e_1_3_3_1_50_2","doi-asserted-by":"publisher","unstructured":"Zhisheng Ye Wei Gao Qinghao Hu Peng Sun Xiaolin Wang Yingwei Luo Tianwei Zhang and Yonggang Wen. 2024. Deep Learning Workload Scheduling in GPU Datacenters: A Survey. ACM Comput. Surv. 56 6 Article 146 (Jan. 2024) 38\u00a0pages. 10.1145\/3638757","DOI":"10.1145\/3638757"},{"key":"e_1_3_3_1_51_2","first-page":"521","volume-title":"16th USENIX Symposium on Operating Systems Design and Implementation (OSDI 22)","author":"Yu Gyeong-In","year":"2022","unstructured":"Gyeong-In Yu, Joo\u00a0Seong Jeong, Geon-Woo Kim, Soojeong Kim, and Byung-Gon Chun. 2022. Orca: A Distributed Serving System for Transformer-Based Generative Models. In 16th USENIX Symposium on Operating Systems Design and Implementation (OSDI 22). USENIX Association, Carlsbad, CA, 521\u2013538. https:\/\/www.usenix.org\/conference\/osdi22\/presentation\/yu"},{"key":"e_1_3_3_1_52_2","doi-asserted-by":"publisher","DOI":"10.52202\/079017-2000"},{"key":"e_1_3_3_1_53_2","first-page":"193","volume-title":"18th USENIX Symposium on Operating Systems Design and Implementation (OSDI 24)","author":"Zhong Yinmin","year":"2024","unstructured":"Yinmin Zhong, Shengyu Liu, Junda Chen, Jianbo Hu, Yibo Zhu, Xuanzhe Liu, Xin Jin, and Hao Zhang. 2024. DistServe: Disaggregating Prefill and Decoding for Goodput-optimized Large Language Model Serving. In 18th USENIX Symposium on Operating Systems Design and Implementation (OSDI 24). USENIX Association, Santa Clara, CA, 193\u2013210. https:\/\/www.usenix.org\/conference\/osdi24\/presentation\/zhong-yinmin"},{"key":"e_1_3_3_1_54_2","doi-asserted-by":"publisher","DOI":"10.1145\/3718958.3750506"}],"event":{"name":"ICS '26: 2026 International Conference on Supercomputing","location":"Belfast United Kingdom","acronym":"ICS '26","sponsor":["SIGHPC ACM Special Interest Group on High Performance Computing, Special Interest Group on High Performance Computing","SIGARCH ACM Special Interest Group on Computer Architecture"]},"container-title":["Proceedings of the 40th ACM International Conference on Supercomputing"],"original-title":[],"deposited":{"date-parts":[[2026,7,2]],"date-time":"2026-07-02T12:49:51Z","timestamp":1782996591000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3797905.3807874"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,7,5]]},"references-count":53,"alternative-id":["10.1145\/3797905.3807874","10.1145\/3797905"],"URL":"https:\/\/doi.org\/10.1145\/3797905.3807874","relation":{},"subject":[],"published":{"date-parts":[[2026,7,5]]},"assertion":[{"value":"2026-07-05","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}