{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,8,18]],"date-time":"2026-08-18T00:28:25Z","timestamp":1787012905059,"version":"build-2736575974"},"reference-count":45,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"7","license":[{"start":{"date-parts":[[2026,7,1]],"date-time":"2026-07-01T00:00:00Z","timestamp":1782864000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2026,7,1]],"date-time":"2026-07-01T00:00:00Z","timestamp":1782864000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,7,1]],"date-time":"2026-07-01T00:00:00Z","timestamp":1782864000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/501100013114","name":"National Key Research and Development Program","doi-asserted-by":"publisher","award":["2023YFC3604200"],"award-info":[{"award-number":["2023YFC3604200"]}],"id":[{"id":"10.13039\/501100013114","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100013114","name":"National Key Research and Development Program","doi-asserted-by":"publisher","award":["2023YFC3604201"],"award-info":[{"award-number":["2023YFC3604201"]}],"id":[{"id":"10.13039\/501100013114","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100017677","name":"Shenzhen Science and Technology Program","doi-asserted-by":"publisher","award":["2021Szvup094"],"award-info":[{"award-number":["2021Szvup094"]}],"id":[{"id":"10.13039\/501100017677","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100017677","name":"Shenzhen Science and Technology Program","doi-asserted-by":"publisher","award":["GJHZ20210705142401005"],"award-info":[{"award-number":["GJHZ20210705142401005"]}],"id":[{"id":"10.13039\/501100017677","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100017677","name":"Shenzhen Science and Technology Program","doi-asserted-by":"publisher","award":["JCYJ20190807142805490"],"award-info":[{"award-number":["JCYJ20190807142805490"]}],"id":[{"id":"10.13039\/501100017677","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100012228","name":"Development and Reform Commission of Shenzhen Municipality","doi-asserted-by":"publisher","award":["XMHT20220115007"],"award-info":[{"award-number":["XMHT20220115007"]}],"id":[{"id":"10.13039\/501100012228","id-type":"DOI","asserted-by":"publisher"}]},{"name":"Beijing Engineering Research Center","award":["BG0149"],"award-info":[{"award-number":["BG0149"]}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Circuits Syst. I"],"published-print":{"date-parts":[[2026,7]]},"DOI":"10.1109\/tcsi.2026.3668423","type":"journal-article","created":{"date-parts":[[2026,3,4]],"date-time":"2026-03-04T20:52:51Z","timestamp":1772657571000},"page":"4801-4814","source":"Crossref","is-referenced-by-count":2,"title":["CrossKV: Accelerating Large Language Model Inference via Cross-Stage Dynamic Co-Optimization for KV Cache"],"prefix":"10.1109","volume":"73","author":[{"ORCID":"https:\/\/orcid.org\/0009-0005-2703-9938","authenticated-orcid":false,"given":"Nan","family":"Wu","sequence":"first","affiliation":[{"name":"School of Integrated Circuits, Tsinghua University, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0008-2549-6264","authenticated-orcid":false,"given":"Shenyu","family":"Wang","sequence":"additional","affiliation":[{"name":"College of Biomedical Engineering, Fudan University, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-9763-8208","authenticated-orcid":false,"given":"Huizheng","family":"Wang","sequence":"additional","affiliation":[{"name":"School of Integrated Circuits, Tsinghua University, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-2631-971X","authenticated-orcid":false,"given":"Peng","family":"Wang","sequence":"additional","affiliation":[{"name":"School of Integrated Circuits, Tsinghua University, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-5514-021X","authenticated-orcid":false,"given":"Xiao","family":"Liu","sequence":"additional","affiliation":[{"name":"College of Biomedical Engineering, Fudan University, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-6567-0759","authenticated-orcid":false,"given":"Zhihua","family":"Wang","sequence":"additional","affiliation":[{"name":"School of Integrated Circuits, Tsinghua University, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-6942-4395","authenticated-orcid":false,"given":"Yang","family":"Hu","sequence":"additional","affiliation":[{"name":"School of Integrated Circuits, Tsinghua University, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-4911-0748","authenticated-orcid":false,"given":"Hanjun","family":"Jiang","sequence":"additional","affiliation":[{"name":"School of Integrated Circuits, Tsinghua University, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","article-title":"GPT-4 technical report","volume-title":"arXiv:2303.08774","author":"Achiam","year":"2023"},{"key":"ref2","article-title":"Llama 2: Open foundation and fine-tuned chat models","author":"Touvron","year":"2023","journal-title":"arXiv:2307.09288"},{"key":"ref3","article-title":"OPT: Open pre-trained transformer language models","author":"Zhang","year":"2022","journal-title":"arXiv:2205.01068"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/JSSC.2024.3419808"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/JSSC.2022.3213521"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/JSSC.2024.3402174"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/TCSI.2025.3527541"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/tcsi.2025.3601717"},{"key":"ref9","article-title":"Scaling laws for neural language models","author":"Kaplan","year":"2020","journal-title":"arXiv:2001.08361"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v38i17.29815"},{"key":"ref11","first-page":"1","article-title":"OmniQuant: Omnidirectionally calibrated quantization for large language models","volume-title":"Proc. Int. Conf. Learn. Represent. (ICLR)","author":"Shao"},{"key":"ref12","first-page":"87","article-title":"AWQ: Activation-aware weight quantization for on-device LLM compression and acceleration","volume-title":"Proc. Mach. Learn. Syst.","volume":"6","author":"Lin"},{"key":"ref13","article-title":"SpQR: A sparse-quantized representation for near-lossless LLM weight compression","author":"Dettmers","year":"2023","journal-title":"arXiv:2306.03078"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1109\/ISCA59077.2024.00077"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1145\/3503222.3507738"},{"key":"ref16","article-title":"ShadowKV: KV cache in shadows for high-throughput long-context LLM inference","author":"Sun","year":"2024","journal-title":"arXiv:2410.21465"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/JSSC.2024.3397189"},{"key":"ref18","article-title":"ReCalKV: Low-rank KV cache compression via head reordering and offline calibration","author":"Yan","year":"2025","journal-title":"arXiv:2505.24357"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA61900.2025.00110"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA51647.2021.00018"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA56546.2023.10071047"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA56546.2023.10070997"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA56546.2023.10071081"},{"key":"ref24","first-page":"1","article-title":"LORC: Low-rank compression for LLMs KV cache with a progressive compression strategy","volume-title":"Proc. Workshop Mach. Learn. Compress.","author":"Zhang"},{"key":"ref25","first-page":"1","article-title":"ThinK: Thinner key cache by query-driven pruning","volume-title":"Proc. Int. Conf. Learn. Represent. (ICLR)","author":"Xu"},{"key":"ref26","first-page":"1","article-title":"DeepSeek-V2: A strong, economical, and efficient mixture-of-experts language model","volume-title":"Proc. Mach. Learn. Syst.","author":"Liu"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA57654.2024.00064"},{"key":"ref28","first-page":"1","article-title":"Qserve: W4A8KV4 quantization and system co-design for efficient LLM serving","volume-title":"Proc. Mach. Learn. Syst.","volume":"7","author":"Lin"},{"key":"ref29","article-title":"R-KV: Redundancy-aware KV cache compression for reasoning models","author":"Cai","year":"2025","journal-title":"arXiv:2505.24133"},{"key":"ref30","article-title":"LazyLLM: Dynamic token pruning for efficient long context LLM inference","author":"Fu","year":"2024","journal-title":"arXiv:2407.14057"},{"key":"ref31","article-title":"SVD-free low-rank adaptive gradient optimization for large language models","author":"Modoranu","year":"2025","journal-title":"arXiv:2505.17967"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1145\/103085.103089"},{"key":"ref33","first-page":"1","article-title":"LoRA: Low-rank adaptation of large language models","volume-title":"Proc. Int. Conf. Learn. Represent. (ICLR)","author":"Hu"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.2307\/j.ctvcm4g18.8"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2020.emnlp-demos.6"},{"key":"ref36","article-title":"Training verifiers to solve math word problems","author":"Cobbe","year":"2021","journal-title":"arXiv:2110.14168"},{"key":"ref37","article-title":"Measuring massive multitask language understanding","author":"Hendrycks","year":"2020","journal-title":"arXiv:2009.03300"},{"key":"ref38","article-title":"Evaluating large language models trained on code","author":"Chen","year":"2021","journal-title":"arXiv:2107.03374"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/W18-5446"},{"key":"ref40","article-title":"Compressive transformers for long-range sequence modelling","author":"Rae","year":"2019","journal-title":"arXiv:1911.05507"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1109\/MICRO61859.2024.00093"},{"key":"ref42","volume-title":"TensorRT-LLM","year":"2025"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1109\/ISCA52012.2021.00010"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1109\/TCAD.2022.3170848"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1145\/3725843.3756037"}],"container-title":["IEEE Transactions on Circuits and Systems I: Regular Papers"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/8919\/11578116\/11421352.pdf?arnumber=11421352","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,7,6]],"date-time":"2026-07-06T19:57:45Z","timestamp":1783367865000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11421352\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,7]]},"references-count":45,"journal-issue":{"issue":"7"},"URL":"https:\/\/doi.org\/10.1109\/tcsi.2026.3668423","relation":{},"ISSN":["1549-8328","1558-0806"],"issn-type":[{"value":"1549-8328","type":"print"},{"value":"1558-0806","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026,7]]}}}