{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,8,5]],"date-time":"2026-08-05T06:46:33Z","timestamp":1785912393286,"version":"3.56.0"},"reference-count":83,"publisher":"IEEE","license":[{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"name":"National Natural Science Foundation of China","award":["62302300,62432010,62472279,U24B20165"],"award-info":[{"award-number":["62302300,62432010,62472279,U24B20165"]}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2026,6]]},"DOI":"10.1109\/isca66397.2026.00056","type":"proceedings-article","created":{"date-parts":[[2026,8,4]],"date-time":"2026-08-04T19:08:06Z","timestamp":1785870486000},"page":"1-17","source":"Crossref","is-referenced-by-count":0,"title":["CHIME: A Case for Efficient Long-Context Attention-FC Disaggregated Inference with DIMM-PIM"],"prefix":"10.1109","author":[{"given":"Qingyuan","family":"Liu","sequence":"first","affiliation":[{"name":"Shanghai Jiao Tong University","place":["Shanghai, China"]}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Liyan","family":"Chen","sequence":"additional","affiliation":[{"name":"Shanghai Jiao Tong University","place":["Shanghai, China"]}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Haocheng","family":"Wang","sequence":"additional","affiliation":[{"name":"Shanghai Jiao Tong University","place":["Shanghai, China"]}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yanning","family":"Yang","sequence":"additional","affiliation":[{"name":"Shanghai Jiao Tong University","place":["Shanghai, China"]}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Dong","family":"Du","sequence":"additional","affiliation":[{"name":"Shanghai Jiao Tong University","place":["Shanghai, China"]}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zhigang","family":"Mao","sequence":"additional","affiliation":[{"name":"Shanghai Jiao Tong University","place":["Shanghai, China"]}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Naifeng","family":"Jing","sequence":"additional","affiliation":[{"name":"Shanghai Jiao Tong University","place":["Shanghai, China"]}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yubin","family":"Xia","sequence":"additional","affiliation":[{"name":"Shanghai Jiao Tong University","place":["Shanghai, China"]}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Haibo","family":"Chen","sequence":"additional","affiliation":[{"name":"Shanghai Jiao Tong University","place":["Shanghai, China"]}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","volume-title":"Nvidia readying h20 ai gpu for chinese market","year":"2024"},{"key":"ref2","volume-title":"cognitivecomputations\/dolphin-r1 \u22c5 datasets at hugging face","year":"2025"},{"key":"ref3","volume-title":"Keepa: search for ddr4 lrdimm"},{"key":"ref4","volume-title":"Keepa: search for ddr5 rdimm"},{"key":"ref5","volume-title":"open-r1\/openr1-math-220k \u22c5 datasets at hugging face","year":"2025"},{"key":"ref6","volume-title":"open-r1\/openthoughts-114k-math \u22c5 datasets at hugging face","year":"2025"},{"key":"ref7","volume-title":"Inside nvidia grace cpu: Nvidia amps up superchip engineering for hpc and ai","year":"2026"},{"key":"ref8","article-title":"Taming throughput-latency tradeoff in llm inference with sarathi-serve","volume-title":"Proceedings of the 18th USENIX Conference on Operating Systems Design and Implementation, ser. OSDI\u201924","author":"Agrawal"},{"key":"ref9","volume-title":"Palm 2 technical report","author":"Anil","year":"2023"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/MICRO.2016.7783753"},{"key":"ref11","volume-title":"Longbench: A bilingual, multitask benchmark for long context understanding","author":"Bai","year":"2024"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1145\/3669940.3707267"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA61900.2025.00047"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1145\/3458817.3476143"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.52202\/068431-1189"},{"key":"ref16","volume-title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","author":"DeepSeek-AI","year":"2025"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1145\/2499368.2451125"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/HOTCHIPS.2019.8875680"},{"key":"ref19","volume-title":"Bert: Pre-training of deep bidirectional transformers for language understanding","author":"Devlin","year":"2019"},{"key":"ref20","first-page":"111","article-title":"Cost-Efficient large language model serving for multi-turn conversations with CachedAttention","volume-title":"2024 USENIX Annual Technical Conference (USENIX ATC 24)","author":"Gao"},{"key":"ref21","volume-title":"The llama 3 herd of models","author":"Grattafiori","year":"2024"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1145\/3676641.3716267"},{"key":"ref23","first-page":"443","article-title":"Serving DNNs like clockwork: Performance predictability from the bottom up","volume-title":"14th USENIX Symposium on Operating Systems Design and Implementation (OSDI 20)","author":"Gujarati","year":"2020"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1109\/ACCESS.2022.3174101"},{"key":"ref25","volume-title":"Fastdecode: High-throughput gpu-efficient llm serving using heterogeneous pipelines","author":"He","year":"2024"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1109\/MICRO50266.2020.00040"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1145\/3676641.3716009"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1145\/3620666.3651380"},{"key":"ref29","doi-asserted-by":"crossref","DOI":"10.18653\/v1\/2023.findings-acl.67","volume-title":"Towards reasoning in large language models: A survey","author":"Huang","year":"2023"},{"key":"ref30","volume-title":"Neo: Saving gpu memory crisis with cpu offloading for online llm inference","author":"Jiang","year":"2024"},{"key":"ref31","first-page":"294","article-title":"Cactiio: Cacti with off-chip power-area-timing models","volume-title":"2012 IEEE\/ACM International Conference on Computer-Aided Design (ICCAD)","author":"Jouppi","year":"2012"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA61900.2025.00103"},{"key":"ref33","doi-asserted-by":"crossref","DOI":"10.2139\/ssrn.4593895","volume-title":"A survey of gpt-3 family large language models including chatgpt and gpt-4","author":"Kalyan","year":"2023"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1109\/ISCA45697.2020.00070"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1109\/MM.2021.3097700"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1109\/HCS61935.2024.10664793"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA51647.2021.00030"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1109\/HCS52781.2021.9567191"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1109\/HCS52781.2021.9567191"},{"key":"ref40","volume-title":"Lol-pim: Long-context llm decoding with scalable dram-pim system","author":"Kwon","year":"2025"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1145\/3600006.3613165"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1109\/HCS59251.2023.10254717"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1109\/HCS55958.2022.9895629"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1145\/3533737.3535093"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1109\/MICRO61859.2024.00053"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA61900.2025.00126"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.1109\/VLSITechnologyandCir46783.2024.10631397"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1109\/ISSCC42614.2022.9731711"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1109\/ISCA52012.2021.00013"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1145\/3695053.3731008"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1109\/lca.2020.2973991"},{"key":"ref52","volume-title":"Make llm inference affordable to everyone: Augmenting gpu memory with ndp-dimm","author":"Liu","year":"2025"},{"key":"ref53","first-page":"1","article-title":"Harmonizing efficiency and practicability: Optimizing resource utilization in serverless computing with jiagu","volume-title":"2024 USENIX Annual Technical Conference (USENIX ATC 24)","author":"Liu"},{"issue":"3S","key":"ref54","first-page":"450","volume-title":"Heracles: improving resource efficiency at scale","volume":"43","author":"Lo","year":"2015"},{"key":"ref55","article-title":"DRAM power calculator","year":"2017","journal-title":"Micron Technology"},{"key":"ref56","article-title":"Technical Note Calculating Memory Power for DDR4 SDRAM Introduction","year":"2017","journal-title":"Micron Technology"},{"key":"ref57","article-title":"NVIDIA DGX A100","year":"2023","journal-title":"NVIDIA"},{"key":"ref58","article-title":"NVIDIA Blackwell. The engine of the new industrial revolution","year":"2026","journal-title":"[Online], NVIDIA"},{"key":"ref59","first-page":"41","article-title":"Fine-grained dram: Energy-efficient dram for extreme bandwidth systems","volume-title":"2017 50th Annual IEEE\/ACM International Symposium on Microarchitecture (MICRO)","author":"O\u2019Connor","year":"2017"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA61900.2025.00113"},{"key":"ref61","doi-asserted-by":"publisher","DOI":"10.1145\/3620665.3640422"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.1145\/3466752.3480080"},{"key":"ref63","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA57654.2024.00078"},{"key":"ref64","article-title":"PCI Express Specifications","year":"2025","journal-title":"PCI-SIG"},{"key":"ref65","volume-title":"Reasoning with large language models, a survey","author":"Plaat","year":"2024"},{"key":"ref66","article-title":"Hpu: High-bandwidth processing unit for scalable, cost-effective llm inference via gpu co-processing","author":"Rhee","year":"2025","journal-title":"arXiv preprint"},{"key":"ref67","doi-asserted-by":"publisher","DOI":"10.1145\/3620666.3651324"},{"key":"ref68","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA61900.2025.00127"},{"key":"ref69","article-title":"Flexgen: high-throughput generative inference of large language models with a single gpu","volume-title":"Proceedings of the 40th International Conference on Machine Learning, ser. ICML\u201923","author":"Sheng","year":"2023"},{"key":"ref70","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA61900.2025.00102"},{"key":"ref71","volume-title":"Step3: Cost-effective multimodal intelligence","author":"Team"},{"key":"ref72","volume-title":"Step-3 is large yet affordable: Model-system co-design for cost-effective decoding","author":"Team","year":"2025"},{"key":"ref73","doi-asserted-by":"publisher","DOI":"10.48550\/ARXIV.1706.03762"},{"key":"ref74","doi-asserted-by":"publisher","DOI":"10.1109\/ISSCC42615.2023.10067395"},{"key":"ref75","article-title":"Liebig\u2019s law of the minimum","year":"2025","journal-title":"Wikipedia"},{"key":"ref76","doi-asserted-by":"publisher","DOI":"10.1145\/1498765.1498785"},{"key":"ref77","doi-asserted-by":"publisher","DOI":"10.1145\/3503222.3507709"},{"key":"ref78","first-page":"521","article-title":"Orca: A distributed serving system for Transformer-Based generative models","volume-title":"16th USENIX Symposium on Operating Systems Design and Implementation (OSDI 22)","author":"Yu"},{"key":"ref79","doi-asserted-by":"publisher","DOI":"10.1109\/MICRO61859.2024.00105"},{"key":"ref80","doi-asserted-by":"publisher","DOI":"10.1145\/3458817.3476215"},{"key":"ref81","volume-title":"Evaluation of openai o1: Opportunities and challenges of agi","author":"Zhong","year":"2024"},{"key":"ref82","volume-title":"A survey on efficient inference for large language models","author":"Zhou","year":"2024"},{"key":"ref83","doi-asserted-by":"publisher","DOI":"10.1145\/3718958.3750506"}],"event":{"name":"2026 ACM\/IEEE 53rd Annual International Symposium on Computer Architecture (ISCA)","location":"Raleigh, NC, USA","start":{"date-parts":[[2026,6,27]]},"end":{"date-parts":[[2026,7,1]]}},"container-title":["2026 ACM\/IEEE 53rd Annual International Symposium on Computer Architecture (ISCA)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/11617393\/11617394\/11617823.pdf?arnumber=11617823","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,8,5]],"date-time":"2026-08-05T05:59:20Z","timestamp":1785909560000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11617823\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,6]]},"references-count":83,"URL":"https:\/\/doi.org\/10.1109\/isca66397.2026.00056","relation":{},"subject":[],"published":{"date-parts":[[2026,6]]}}}