{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,3]],"date-time":"2026-04-03T07:17:51Z","timestamp":1775200671879,"version":"3.50.1"},"reference-count":20,"publisher":"IEEE","license":[{"start":{"date-parts":[[2025,12,17]],"date-time":"2025-12-17T00:00:00Z","timestamp":1765929600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2025,12,17]],"date-time":"2025-12-17T00:00:00Z","timestamp":1765929600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025,12,17]]},"DOI":"10.1109\/hipcw66559.2025.00021","type":"proceedings-article","created":{"date-parts":[[2026,4,2]],"date-time":"2026-04-02T19:48:12Z","timestamp":1775159292000},"page":"75-79","source":"Crossref","is-referenced-by-count":0,"title":["Evaluating CXL Memory Pooling for Scalable LLM Inference"],"prefix":"10.1109","author":[{"given":"Sai Krishna","family":"Vemuri","sequence":"first","affiliation":[{"name":"Micron Technology"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Venkata","family":"Ravi Shankar Jonnalagadda","sequence":"additional","affiliation":[{"name":"Micron Technology"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Ajay","family":"Joshi","sequence":"additional","affiliation":[{"name":"Micron Technology"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Rohit","family":"Sindhu","sequence":"additional","affiliation":[{"name":"Micron Technology"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Vijay","family":"Kumar Motagi","sequence":"additional","affiliation":[{"name":"Micron Technology"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Amandeep","family":"Singh","sequence":"additional","affiliation":[{"name":"Micron Technology"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Praveen","family":"Kumar Rukmangada","sequence":"additional","affiliation":[{"name":"Micron Technology"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Sachin","family":"Shaw","sequence":"additional","affiliation":[{"name":"Micron Technology"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Vishal","family":"Tanna","sequence":"additional","affiliation":[{"name":"Micron Technology"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1145\/3600006.3613165"},{"key":"ref2","article-title":"Efficient Memory Management for LLM Serving with PagedAttention","year":"2023","journal-title":"Stanford CS240 reading"},{"key":"ref3","article-title":"Paged Attention (kernel\/blocks)","journal-title":"design notes (v0.6\u20130.9)"},{"key":"ref4","article-title":"PCI Express 6.0 Specification (x16 up to 256 GB\/s bidirectional)","year":"2022-2025"},{"key":"ref5","article-title":"CXL 3.1 White Paper\u2014fabric connectivity, PBR, GIM, TEE","year":"2023"},{"key":"ref6","first-page":"Q1","article-title":"Introducing the CXL 3.X Specification","year":"2025","journal-title":"Webinar slides"},{"key":"ref7","article-title":"System Composability Using CXL","volume-title":"2024 Workshop (feature matrix for 3.1, PBR, multi-level switching)"},{"key":"ref8","article-title":"H100 Tensor Core GPU\u2014Datasheet","year":"2022-2024"},{"key":"ref9","article-title":"Instinct MI300X Accelerator\u2014Data Sheet","year":"2025"},{"key":"ref10","article-title":"400 GbE Overview and lane families; 400 GbE ratified 2017","year":"2018"},{"key":"ref11","article-title":"Terabit Ethernet","journal-title":"overview and timelines for 400\/800 GbE (IEEE 802.3bs\/df\/dj)"},{"key":"ref12","article-title":"Dissecting CXL Memory Performance at Scale: Analysis, Modeling, Optimization","author":"Liu","year":"2024"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/MM.2023.3241586"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1145\/3695794.3695809"},{"key":"ref15","article-title":"Exploring CXL-based KV Cache Storage for LLM Serving","volume-title":"NeurIPS MLSys Workshop","author":"Tang"},{"key":"ref16","article-title":"InstInfer: In-Storage Attention Offloading for Long-Context LLM Inference","author":"Pan","year":"2024"},{"key":"ref17","article-title":"LLM Inference Sizing and Performance Guidance","year":"2024"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1145\/3719330.3721230"},{"key":"ref19","first-page":"2024","article-title":"KV cache offloading: when and how","journal-title":"LLM Inference Handbook"},{"key":"ref20","article-title":"Efficient LLM Inference: Bandwidth, Compute, Synchronization, and Capacity are all you need","author":"Davies","year":"2025"}],"event":{"name":"2025 IEEE 32nd International Conference on High Performance Computing, Data and Analytics Workshop (HiPCW)","location":"Hyderabad, India","start":{"date-parts":[[2025,12,17]]},"end":{"date-parts":[[2025,12,20]]}},"container-title":["2025 IEEE 32nd International Conference on High Performance Computing, Data and Analytics Workshop (HiPCW)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/11459184\/11459197\/11459268.pdf?arnumber=11459268","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,4,3]],"date-time":"2026-04-03T05:03:14Z","timestamp":1775192594000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11459268\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,12,17]]},"references-count":20,"URL":"https:\/\/doi.org\/10.1109\/hipcw66559.2025.00021","relation":{},"subject":[],"published":{"date-parts":[[2025,12,17]]}}}