{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,3,5]],"date-time":"2026-03-05T07:21:49Z","timestamp":1772695309911,"version":"3.50.1"},"reference-count":37,"publisher":"IEEE","license":[{"start":{"date-parts":[[2026,1,31]],"date-time":"2026-01-31T00:00:00Z","timestamp":1769817600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,1,31]],"date-time":"2026-01-31T00:00:00Z","timestamp":1769817600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2026,1,31]]},"DOI":"10.1109\/hpca68181.2026.11408481","type":"proceedings-article","created":{"date-parts":[[2026,3,4]],"date-time":"2026-03-04T20:47:22Z","timestamp":1772657242000},"page":"1-13","source":"Crossref","is-referenced-by-count":0,"title":["BitDecoding: Unlocking Tensor Cores for Long-Context LLMs with Low-Bit KV Cache"],"prefix":"10.1109","author":[{"given":"Dayou","family":"Du","sequence":"first","affiliation":[{"name":"University of Edinburgh"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Shijie","family":"Cao","sequence":"additional","affiliation":[{"name":"Microsoft Research"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jianyi","family":"Cheng","sequence":"additional","affiliation":[{"name":"University of Edinburgh"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Luo","family":"Mai","sequence":"additional","affiliation":[{"name":"University of Edinburgh"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Ting","family":"Cao","sequence":"additional","affiliation":[{"name":"Institute for AI Industry Research (AIR), Tsinghua University"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Mao","family":"Yang","sequence":"additional","affiliation":[{"name":"Microsoft Research"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.emnlp-main.298"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.52202\/079017-3180"},{"key":"ref3","first-page":"3119","article-title":"LongBench: A bilingual, multitask benchmark for long context understanding","volume-title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","author":"Bai"},{"key":"ref4","article-title":"Booookscore: A systematic exploration of book-length summarization in the era of 11 ms","author":"Chang","year":"2023","journal-title":"arXiv preprint"},{"key":"ref5","volume-title":"Cutlass: Cuda templates for linear algebra subroutines and solvers","year":"2024"},{"key":"ref6","article-title":"FlashAttention-2: Faster attention with better parallelism and work partitioning","volume-title":"International Conference on Learning Representations (ICLR)","author":"Dao","year":"2024"},{"key":"ref7","article-title":"Longrope: Extending llm context window beyond 2 million tokens","author":"Ding","year":"2024","journal-title":"arXiv preprint"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA61900.2025.00091"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1145\/3710848.3710871"},{"key":"ref10","article-title":"The llama 3 herd of models","author":"Grattafiori","year":"2024","journal-title":"arXiv preprint"},{"key":"ref11","article-title":"Deepseek-r1: Incentivizing reasoning capability in 11 ms via reinforcement learning","author":"Guo","year":"2025","journal-title":"arXiv preprint"},{"key":"ref12","article-title":"Kvquant: Towards 10 million context length 11 m inference with kv cache quantization","author":"Hooper","year":"2024","journal-title":"arXiv preprint"},{"key":"ref13","article-title":"Gear: An efficient kv cache compression recipefor nearlossless generative inference of 11 m","author":"Kang","year":"2024","journal-title":"arXiv preprint"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2022.sustainlp-1.6"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1145\/3600006.3613165"},{"key":"ref16","article-title":"Qserve: W4a8kv4 quantization and system co-design for efficient llm serving","author":"Lin","year":"2024","journal-title":"arXiv preprint"},{"key":"ref17","article-title":"Deepseek-v3 technical report","author":"Liu","year":"2024","journal-title":"arXiv preprint"},{"key":"ref18","article-title":"Kivi: A tuning-free asymmetric 2bit quantization for kv cache","author":"Liu","year":"2024","journal-title":"arXiv preprint"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/IPDPS57955.2024.00064"},{"key":"ref20","article-title":"OpenAI Triton on NVIDIA Blackwell Boosts AI Performance and Programmability","year":"2025","journal-title":"NVIDIA and OpenAI"},{"key":"ref21","volume-title":"Nsight Compute - Get Started","year":"2025"},{"key":"ref22","article-title":"Openai o3-mini","year":"2025","journal-title":"OpenAI"},{"key":"ref23","article-title":"Yarn: Efficient context window extension of large language models","author":"Peng","year":"2023","journal-title":"arXiv preprint"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1109\/IntelCIS.2015.7397284"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.52202\/079017-2193"},{"key":"ref26","article-title":"Fast transformer decoding: One write-head is all you need","author":"Shazeer","year":"2019","journal-title":"arXiv preprint"},{"key":"ref27","article-title":"Rotatekv: Accurate and robust 2-bit kv cache quantization for 11 ms via outlieraware adaptive rotations","author":"Su","year":"2025","journal-title":"arXiv preprint"},{"key":"ref28","article-title":"Gta: Grouped-head latent attention","author":"Sun","year":"2025","journal-title":"arXiv preprint"},{"key":"ref29","article-title":"Asymkv: Enabling 1-bit quantization of kv cache with layer-wise asymmetric quantization configurations","author":"Tao","year":"2024","journal-title":"arXiv preprint"},{"key":"ref30","article-title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","author":"Team","year":"2024","journal-title":"arXiv preprint"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1145\/3315508.3329973"},{"key":"ref32","article-title":"Tilelang: A composable tiled programming model for ai systems","author":"Wang","year":"2025","journal-title":"arXiv preprint"},{"key":"ref33","first-page":"307","article-title":"Ladder: Enabling efficient \\{Low-Precision\\} deep learning computing through hardware-aware tensor transformation","volume-title":"18th USENIX Symposium on Operating Systems Design and Implementation (OSDI 24)","author":"Wang","year":"2024"},{"key":"ref34","article-title":"Qwen3 technical report","author":"Yang","year":"2025","journal-title":"arXiv preprint"},{"key":"ref35","article-title":"Mm-bigbench: Evaluating multimodal models on multimodal content comprehension tasks","author":"Yang","year":"2023","journal-title":"arXiv preprint"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.52202\/079017-0109"},{"key":"ref37","first-page":"196","article-title":"Atom: Low-bit quantization for efficient and accurate 11 m serving","volume-title":"Proceedings of Machine Learning and Systems","volume":"6","author":"Zhao","year":"2024"}],"event":{"name":"2026 IEEE International Symposium on High Performance Computer Architecture (HPCA)","location":"Sydney, Australia","start":{"date-parts":[[2026,1,31]]},"end":{"date-parts":[[2026,2,4]]}},"container-title":["2026 IEEE International Symposium on High Performance Computer Architecture (HPCA)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/11408404\/11408433\/11408481.pdf?arnumber=11408481","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,3,5]],"date-time":"2026-03-05T06:50:37Z","timestamp":1772693437000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11408481\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,1,31]]},"references-count":37,"URL":"https:\/\/doi.org\/10.1109\/hpca68181.2026.11408481","relation":{},"subject":[],"published":{"date-parts":[[2026,1,31]]}}}