{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,8,18]],"date-time":"2026-08-18T14:42:45Z","timestamp":1787064165294,"version":"3.56.0"},"reference-count":47,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","license":[{"start":{"date-parts":[[2026,1,1]],"date-time":"2026-01-01T00:00:00Z","timestamp":1767225600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/legalcode"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Access"],"published-print":{"date-parts":[[2026]]},"DOI":"10.1109\/access.2026.3677249","type":"journal-article","created":{"date-parts":[[2026,3,24]],"date-time":"2026-03-24T19:49:26Z","timestamp":1774381766000},"page":"46024-46035","source":"Crossref","is-referenced-by-count":1,"title":["Context-Aware Autoscaling for Cost-Efficient Large Language Model Inference With Prefix Cache Integration"],"prefix":"10.1109","volume":"14","author":[{"ORCID":"https:\/\/orcid.org\/0009-0007-8460-2074","authenticated-orcid":false,"given":"Seyed Hossein","family":"Ahmadpanah","sequence":"first","affiliation":[{"name":"Department of Computer Engineering, ST.C., Islamic Azad University, Tehran, Iran"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-6555-670X","authenticated-orcid":false,"given":"Amir","family":"Sahafi","sequence":"additional","affiliation":[{"name":"Department of Computer Engineering, ST.C., Islamic Azad University, Tehran, Iran"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Seyed Hossein","family":"Erfani","sequence":"additional","affiliation":[{"name":"Department of Computer Engineering, ST.C., Islamic Azad University, Tehran, Iran"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","first-page":"193","article-title":"DistServe: Disaggregating prefill and decoding for goodput-optimized large language model serving","volume-title":"Proc. 18th USENIX Symp. Operating Syst. Design Implement. (OSDI)","author":"Zhong"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/ISCA59077.2024.00019"},{"key":"ref3","article-title":"Inference without interference: Disaggregate LLM inference for mixed downstream workloads","author":"Hu","year":"2024","journal-title":"arXiv:2401.11181"},{"key":"ref4","article-title":"Prefill-decode aggregation or disaggregation? Unifying both for goodput-optimized LLM serving","author":"Wang","year":"2025","journal-title":"arXiv:2508.01989"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1145\/3711896.3737413"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1145\/3772052.3772254"},{"key":"ref7","first-page":"663","article-title":"AlpaServe: Statistical multiplexing with model parallelism for deep learning serving","volume-title":"Proc. USENIX Symp. Operating Syst. Design Implement.","author":"Li"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/ISCAIT64916.2025.11010601"},{"key":"ref9","article-title":"EfficientLLM: Efficiency in large language models","author":"Yuan","year":"2025","journal-title":"arXiv:2505.13840"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1007\/s10115-025-02450-1"},{"key":"ref11","article-title":"Concord: A scalable, trace-driven, and reproducible framework for resilient container warming in serverless IoT","volume":"180","author":"Ahmadpanah","year":"2026","journal-title":"Future Gener. Comput. Syst."},{"key":"ref12","article-title":"TokenScale: Timely and accurate autoscaling for disaggregated LLM serving with token velocity","author":"Lai","year":"2025","journal-title":"arXiv:2512.03416"},{"key":"ref13","article-title":"Hierarchical autoscaling for large language model serving with chiron","author":"Patke","year":"2025","journal-title":"arXiv:2501.08090"},{"key":"ref14","first-page":"173","article-title":"Llumnix: Dynamic scheduling for large language model serving","volume-title":"Proc. 18th USENIX Symp. Operating Syst. Design Implement. (OSDI 24)","author":"Sun"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/SCECS65243.2025.11065043"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1016\/j.compeleceng.2024.109419"},{"key":"ref17","article-title":"Beyond efficiency: A systematic survey of resource-efficient large language models","author":"Bai","year":"2024","journal-title":"arXiv:2401.00625"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.3390\/info16080688"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1007\/978-981-96-8898-2_4"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1007\/978-981-96-8898-2_3"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.52202\/079017-2000"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1145\/3600006.3613165"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1145\/3689031.3696086"},{"key":"ref24","article-title":"Compute or load KV cache? Why not both?","author":"Jin","year":"2024","journal-title":"arXiv:2410.03065"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1109\/CLOUD67622.2025.00052"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1145\/3744746"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1016\/j.future.2016.05.025"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1109\/TCAD.2023.3337192"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1109\/ACCESS.2023.3307315"},{"key":"ref30","first-page":"1112","article-title":"SpotServe: Serving generative large language models on preemptible instances","volume-title":"Proc. 29th ACM Int. Conf. Architectural Support Program. Lang. Operating Syst.","author":"Miao"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1145\/2751205.2751237"},{"key":"ref32","article-title":"SkyWalker: A locality-aware cross-region load balancer for LLM inference","author":"Xia","year":"2025","journal-title":"arXiv:2505.24095"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.14778\/3611479.3611486"},{"key":"ref34","first-page":"521","article-title":"Orca: A distributed serving system for transformer-based generative models","volume-title":"Proc. 16th USENIX Symp. Operating Syst. Design Implement. (OSDI)","author":"Yu"},{"key":"ref35","first-page":"117","article-title":"Taming throughput-latency tradeoff in LLM inference with sarathi-serve","volume-title":"Proc. 18th USENIX Symp. Operating Syst. Design Implement. (OSDI)","author":"Agrawal"},{"key":"ref36","volume-title":"DeepSpeed-MII","year":"2023"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1145\/3773772"},{"key":"ref38","article-title":"BiScale: Energy-efficient disaggregated LLM serving via phase-aware placement and DVFS","author":"Basit","year":"2026","journal-title":"arXiv:2602.18755"},{"key":"ref39","article-title":"Taming the chaos: Coordinated autoscaling for heterogeneous and disaggregated LLM inference","author":"Li","year":"2025","journal-title":"arXiv:2508.19559"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1109\/INFOCOM55648.2025.11044522"},{"key":"ref41","first-page":"325","article-title":"Prompt cache: Modular attention reuse for low-latency inference","volume":"6","author":"Gim","year":"2024","journal-title":"Proc. Mach. Learn. Syst."},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1145\/3651890.3672274"},{"key":"ref43","first-page":"8042","article-title":"DynamicKV: Task-aware adaptive KV cache compression for long context LLMs","volume-title":"Proc. Findings Assoc. Comput. Linguistics EMNLP","author":"Zhou"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1145\/3725273"},{"key":"ref45","article-title":"Selective KV-cache sharing to mitigate timing side-channels in LLM inference","author":"Chu","year":"2025","journal-title":"arXiv:2508.08438"},{"key":"ref46","volume-title":"Knative","year":"2025"},{"key":"ref47","article-title":"AIBrix: Towards scalable, cost-effective large language model inference infrastructure","author":"Shan","year":"2025","journal-title":"arXiv:2504.03648"}],"container-title":["IEEE Access"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/6287639\/11323511\/11455169.pdf?arnumber=11455169","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,4,1]],"date-time":"2026-04-01T06:08:27Z","timestamp":1775023707000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11455169\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026]]},"references-count":47,"URL":"https:\/\/doi.org\/10.1109\/access.2026.3677249","relation":{},"ISSN":["2169-3536"],"issn-type":[{"value":"2169-3536","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026]]}}}