{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,20]],"date-time":"2026-06-20T10:53:05Z","timestamp":1781952785580,"version":"3.54.5"},"publisher-location":"New York, NY, USA","reference-count":19,"publisher":"ACM","license":[{"start":{"date-parts":[[2026,6,22]],"date-time":"2026-06-22T00:00:00Z","timestamp":1782086400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by-nc-nd\/4.0\/legalcode"}],"funder":[{"DOI":"10.13039\/501100004147","name":"Tsinghua University","doi-asserted-by":"publisher","award":["No.58302201426"],"award-info":[{"award-number":["No.58302201426"]}],"id":[{"id":"10.13039\/501100004147","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2026,6,22]]},"DOI":"10.1145\/3765611.3815434","type":"proceedings-article","created":{"date-parts":[[2026,6,20]],"date-time":"2026-06-20T09:39:33Z","timestamp":1781948373000},"page":"309-314","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":0,"title":["LLM-GreenServe: Optimized Power Consumption with Power-aware Prefill-Decoding Scheduling"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0009-0005-6092-6053","authenticated-orcid":false,"given":"Zhihua","family":"Cui","sequence":"first","affiliation":[{"name":"Tsinghua University, Beijing, Bejing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0005-6828-8690","authenticated-orcid":false,"given":"Hanglong","family":"Li","sequence":"additional","affiliation":[{"name":"Tsinghua University, Beijing, Bejing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-5503-2630","authenticated-orcid":false,"given":"Zhen","family":"Chen","sequence":"additional","affiliation":[{"name":"Tsinghua University, Beijing, Bejing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0000-6263-6723","authenticated-orcid":false,"given":"Shuoyang","family":"Sun","sequence":"additional","affiliation":[{"name":"Tsinghua University, Beijing, Bejing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0006-3090-7596","authenticated-orcid":false,"given":"Pinze","family":"Ren","sequence":"additional","affiliation":[{"name":"Tsinghua University, Beijing, Bejing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0000-8408-8940","authenticated-orcid":false,"given":"Weiran","family":"Lin","sequence":"additional","affiliation":[{"name":"Tsinghua University, Beijing, Bejing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-9770-5765","authenticated-orcid":false,"given":"Yinjun","family":"Wu","sequence":"additional","affiliation":[{"name":"Peking University, Beijing, Bejing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-0204-1749","authenticated-orcid":false,"given":"Chao","family":"Li","sequence":"additional","affiliation":[{"name":"Tsinghua University, Beijing, Bejing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-1692-4657","authenticated-orcid":false,"given":"Shuangshou","family":"Li","sequence":"additional","affiliation":[{"name":"Tsinghua University, Beijing, Bejing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"320","published-online":{"date-parts":[[2026,6,22]]},"reference":[{"key":"e_1_3_3_1_2_2","unstructured":"Stanford Institute for Human-Centered Artificial Intelligence Artificial Intelligence Index Report 2025. Stanford CA: Stanford HAI 2025."},{"key":"e_1_3_3_1_3_2","doi-asserted-by":"crossref","unstructured":"Z. Chen W. Lin X. Xie Y. Hu C. Li Q. Tong Y. Wu and S. Li \u201cAn Empirical Study on the Power Consumption of LLMs with Different GPU Platforms \u201d in 2024 IEEE International Conference on Big Data (BigData) Washington DC USA 2024 pp. 8640\u20138642.","DOI":"10.1109\/BigData62323.2024.10825662"},{"key":"e_1_3_3_1_4_2","doi-asserted-by":"crossref","unstructured":"J. Fernandez C. Na V. Tiwari Y. Bisk S. Luccioni and E. Strubell \u201cEnergy considerations of large language model inference and efficiency optimizations \u201d in Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics 2025 pp. 32556\u201332569.","DOI":"10.18653\/v1\/2025.acl-long.1563"},{"key":"e_1_3_3_1_5_2","unstructured":"C. Elsworth et al. \u201cMeasuring the environmental impact of delivering AI at Google Scale \u201d arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2508.15734 2025."},{"key":"e_1_3_3_1_6_2","unstructured":"S. Altman \u201cThe Gentle Singularity \u201d Sam Altman\u2019s Blog 2025. [Online]. Available: https:\/\/blog.samaltman.com\/the-gentle-singularity. Accessed: May 11 2026."},{"key":"e_1_3_3_1_7_2","doi-asserted-by":"crossref","unstructured":"T. Dettmers A. Pagnoni A. Holtzman and L. Zettlemoyer \u201cQLoRA: Efficient finetuning of quantized LLMs \u201d arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2305.14314 2023.","DOI":"10.52202\/075280-0441"},{"key":"e_1_3_3_1_8_2","doi-asserted-by":"crossref","unstructured":"T. Dao D. Y. Fu S. Ermon A. Rudra and C. R\u00e9 \u201cFlashAttention: Fast and memory-efficient exact attention with IO-awareness \u201d in Advances in Neural Information Processing Systems vol. 35 2022 pp. 16344\u201316359.","DOI":"10.52202\/068431-1189"},{"key":"e_1_3_3_1_9_2","doi-asserted-by":"crossref","unstructured":"W. Kwon Z. Li S. Zhuang Y. Sheng L. Zheng C. H. Yu J. E. Gonzalez H. Zhang and I. Stoica \u201cEfficient memory management for large language model serving with PagedAttention \u201d arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2309.06180 2023.","DOI":"10.1145\/3600006.3613165"},{"key":"e_1_3_3_1_10_2","unstructured":"L. Zheng et al. \u201cSGLang: Efficient execution of structured language model programs \u201d arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2312.07104 2023."},{"key":"e_1_3_3_1_11_2","unstructured":"P. Patel et al. \u201cSplitwise: Efficient generative LLM inference using phase splitting \u201d arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2311.18677 2023."},{"key":"e_1_3_3_1_12_2","unstructured":"A. Agrawal N. Kedia A. Panwar J. Mohan N. Kwatra B. S. Gulavani A. Tumanov and R. Ramjee \u201cTaming throughput-latency tradeoff in LLM inference with Sarathi-Serve \u201d in Proceedings of the 18th USENIX Symposium on Operating Systems Design and Implementation (OSDI) 2024 pp. 117\u2013134."},{"key":"e_1_3_3_1_13_2","unstructured":"J. Duan R. Lu H. Duanmu X. Li X. Zhang D. Lin I. Stoica and H. Zhang \u201cMuxServe: Flexible spatial-temporal multiplexing for multiple LLM serving \u201d arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2404.02015 2024."},{"key":"e_1_3_3_1_14_2","unstructured":"J. You J. W. Chung and M. Chowdhury \u201cZeus: Understanding and optimizing GPU energy consumption of DNN training \u201d in Proceedings of the 20th USENIX Symposium on Networked Systems Design and Implementation (NSDI) 2023 pp. 119\u2013139."},{"key":"e_1_3_3_1_15_2","doi-asserted-by":"crossref","unstructured":"D. Zhao S. Samsi J. McDonald B. Li D. Bestor M. Jones D. Tiwari and V. Gadepally \u201cSustainable supercomputing for AI: GPU power capping at HPC scale \u201d in Proceedings of the ACM Symposium on Cloud Computing (SoCC) 2023 pp. 588\u2013596.","DOI":"10.1145\/3620678.3624793"},{"key":"e_1_3_3_1_16_2","unstructured":"K. J. \u00c5str\u00f6m and T. H\u00e4gglund Advanced PID Control. Research Triangle Park NC: ISA-The Instrumentation Systems and Automation Society 2006."},{"key":"e_1_3_3_1_17_2","unstructured":"A. Yang et al. \u201cQwen3 technical report \u201d arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2505.09388 2025."},{"key":"e_1_3_3_1_18_2","unstructured":"R. Taori I. Gulrajani T. Zhang et al. \u201cStanford Alpaca: An instruction-following LLaMA model \u201d GitHub Repository 2023. [Online]. Available: https:\/\/github.com\/tatsu-lab\/stanford_alpaca"},{"key":"e_1_3_3_1_19_2","unstructured":"Y. Bai J. Zhang X. Lv L. Zheng S. Zhu L. Hou Y. Dong J. Tang and J. Li \u201cLongWriter: Unleashing 10 000+ word generation from long context LLMs \u201d arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2408.07055 2024."},{"key":"e_1_3_3_1_20_2","doi-asserted-by":"crossref","unstructured":"A. Kornilova and V. Eidelman \u201cBillSum: A corpus for automatic summarization of US legislation \u201d in Proceedings of the 2nd Workshop on New Frontiers in Summarization Hong Kong China 2019 pp. 48\u201356.","DOI":"10.18653\/v1\/D19-5406"}],"event":{"name":"ACM Sustainability Week '26: ACM Sustainability Week 2026","location":"Banff , Alberta , Canada","acronym":"ACM Sustainability Week '26","sponsor":["SIGENERGY ACM Special Interest Group on Energy Systems and Informatics"]},"container-title":["Proceedings of the 2026 ACM Sustainability Week"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3765611.3815434","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,6,20]],"date-time":"2026-06-20T10:46:38Z","timestamp":1781952398000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3765611.3815434"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,6,22]]},"references-count":19,"alternative-id":["10.1145\/3765611.3815434","10.1145\/3765611"],"URL":"https:\/\/doi.org\/10.1145\/3765611.3815434","relation":{},"subject":[],"published":{"date-parts":[[2026,6,22]]},"assertion":[{"value":"2026-06-22","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}