{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,8,5]],"date-time":"2026-08-05T06:49:38Z","timestamp":1785912578410,"version":"3.56.0"},"reference-count":111,"publisher":"IEEE","license":[{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"name":"National Natural Science Foundation of China","award":["62374101"],"award-info":[{"award-number":["62374101"]}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2026,6]]},"DOI":"10.1109\/isca66397.2026.00058","type":"proceedings-article","created":{"date-parts":[[2026,8,4]],"date-time":"2026-08-04T19:10:03Z","timestamp":1785870603000},"page":"654-670","source":"Crossref","is-referenced-by-count":0,"title":["SHyLA: 3D-Stacked NVM-DRAM Hybrid LLM-Inference Architecture Exploiting Data and Memory Heterogeneity"],"prefix":"10.1109","author":[{"given":"Liu","family":"He","sequence":"first","affiliation":[{"name":"Tsinghua University","place":["Beijing, China"],"department":["Department of Electronic Engineering"]}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Fuyao","family":"Zhou","sequence":"additional","affiliation":[{"name":"Tsinghua University","place":["Beijing, China"],"department":["Department of Electronic Engineering"]}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Cheng","family":"Peng","sequence":"additional","affiliation":[{"name":"Tsinghua University","place":["Beijing, China"],"department":["Department of Electronic Engineering"]}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Shunan","family":"Dong","sequence":"additional","affiliation":[{"name":"Tsinghua University","place":["Beijing, China"],"department":["Department of Electronic Engineering"]}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Ziming","family":"Zhang","sequence":"additional","affiliation":[{"name":"Tsinghua University","place":["Beijing, China"],"department":["Department of Electronic Engineering"]}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Huazhong","family":"Yang","sequence":"additional","affiliation":[{"name":"Tsinghua University","place":["Beijing, China"],"department":["Department of Electronic Engineering"]}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yongpan","family":"Liu","sequence":"additional","affiliation":[{"name":"Tsinghua University","place":["Beijing, China"],"department":["Department of Electronic Engineering"]}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Guowei","family":"Zhang","sequence":"additional","affiliation":[{"name":"Huawei Technologies Co., Ltd.","place":["Shanghai, China"]}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Hongyang","family":"Jia","sequence":"additional","affiliation":[{"name":"Tsinghua University","place":["Beijing, China"],"department":["Department of Electronic Engineering"]}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","volume-title":"Cheaper, better, faster, stronger","author":"AI","year":"2024"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.emnlp-main.298"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA51647.2021.00022"},{"key":"ref4","article-title":"AMD","volume-title":"Amd instinct mi300x accelerator","year":"2023"},{"key":"ref5","article-title":"Heterogeneous system partitioning: The 2.5d and 3d integration landscape and roadmap","volume-title":"2025 IEEE VLSI Symposium on Technology and Circuits, Short Course Slides","author":"Beyne","year":"2025"},{"key":"ref6","article-title":"Helix Parallelism: Rethinking Sharding Strategies for Interactive Multi-Million-Token LLM Decoding","author":"Bhatia","year":"2025","journal-title":"arXiv e-prints"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/MICRO.2006.18"},{"key":"ref8","article-title":"Language models are few-shot learners","volume-title":"ser. NIPS \u201920. Red Hook","author":"Brown","year":"2020"},{"key":"ref9","article-title":"Language Models are FewShot Learners","author":"Brown","year":"2020","journal-title":"arXiv e-prints"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA.2017.58"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/DATE.2012.6176428"},{"key":"ref12","article-title":"Extending Context Window of Large Language Models via Positional Interpolation","author":"Chen","year":"2023","journal-title":"arXiv e-prints"},{"key":"ref13","article-title":"PaLM: Scaling Language Modeling with Pathways","author":"Chowdhery","year":"2022","journal-title":"arXiv e-prints"},{"key":"ref14","volume-title":"Gtc china 2020 keynote","author":"Dally","year":"2020"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.23919\/DATE54114.2022.9774636"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1145\/1629911.1630086"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1145\/3575693.3575715"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1145\/3190508.3190524"},{"key":"ref19","article-title":"Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity","author":"Fedus","year":"2021","journal-title":"arXiv e-prints"},{"key":"ref20","article-title":"GadgetVersus","volume-title":"Nvidia h800 pcie 80gb","year":"2023"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1145\/3579371.3589038"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/TCAD.2018.2883981"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/MICRO61859.2024.00118"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1109\/MICRO61859.2024.00051"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1145\/2742854.2742886"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1145\/3620666.3651380"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/ISCA52012.2021.00030"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1145\/3373376.3378465"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.7873\/DATE.2014.047"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA57654.2024.00021"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1109\/ISSCC.2014.6757323"},{"key":"ref32","article-title":"Basic Performance Measurements of the Intel Optane DC Persistent Memory Module","author":"Izraelevitz","year":"2019","journal-title":"arXiv e-prints"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1109\/ACCESS.2024.3352151"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1145\/3575693.3575747"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1109\/TC.2026.3662141"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1109\/ISCA45697.2020.00047"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1109\/ISCA59077.2024.00069"},{"key":"ref38","article-title":"Full Stack Optimization of Transformer Inference: a Survey","author":"Kim","year":"2023","journal-title":"arXiv e-prints"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1109\/IEDM.2016.7838343"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA.2019.00012"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA57654.2024.00091"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1109\/TC.2020.3009498"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1145\/3600006.3613165"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1145\/1555754.1555758"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1109\/ISCA59077.2024.00080"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1145\/3466752.3480089"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.1145\/3243176.3243191"},{"key":"ref48","article-title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","author":"Lepikhin","year":"2020","journal-title":"arXiv e-prints"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1145\/3695053.3731008"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1145\/3620666.3651352"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA56546.2023.10071115"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1145\/3656019.3689612"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.1109\/ISCA.2008.15"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1109\/TCAD.2017.2666604"},{"key":"ref55","article-title":"Meta","volume-title":"Llama3","year":"2024"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1145\/3620666.3651335"},{"key":"ref57","article-title":"MLCommons","volume-title":"Mlperf inference v5.0 advances language model capabilities for genai","year":"2025"},{"key":"ref58","volume-title":"Hbm4 sticks with microbumps, postponing hybrid bonding","author":"Moyer","year":"2026"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.1109\/MICRO61859.2024.00107"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1145\/1365490.1365500"},{"key":"ref61","doi-asserted-by":"publisher","DOI":"10.1109\/ISSCC42614.2022.9731694"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.1109\/ACCESS.2019.2904803"},{"key":"ref63","volume-title":"Nvidia ampere architecture whitepaper","year":"2020"},{"key":"ref64","volume-title":"Next-generation networking for the next wave of ai","year":"2023"},{"key":"ref65","doi-asserted-by":"publisher","DOI":"10.1002\/aic.690440402"},{"key":"ref66","doi-asserted-by":"publisher","DOI":"10.23919\/DATE51398.2021.9474127"},{"key":"ref67","doi-asserted-by":"publisher","DOI":"10.1145\/3620665.3640422"},{"key":"ref68","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA57654.2024.00078"},{"key":"ref69","doi-asserted-by":"publisher","DOI":"10.1109\/ISCA59077.2024.00019"},{"key":"ref70","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA53966.2022.00073"},{"key":"ref71","article-title":"Efficiently Scaling Transformer Inference","author":"Pope","year":"2022","journal-title":"arXiv e-prints"},{"key":"ref72","doi-asserted-by":"publisher","DOI":"10.1109\/MICRO61859.2024.00100"},{"key":"ref73","doi-asserted-by":"publisher","DOI":"10.1109\/ISCA59077.2024.00079"},{"key":"ref74","doi-asserted-by":"publisher","DOI":"10.1145\/1555754.1555760"},{"key":"ref75","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA51647.2021.00057"},{"key":"ref76","doi-asserted-by":"publisher","DOI":"10.1145\/3579371.3589114"},{"key":"ref77","doi-asserted-by":"publisher","DOI":"10.1145\/1816038.1815980"},{"key":"ref78","doi-asserted-by":"publisher","DOI":"10.1145\/3460227"},{"key":"ref79","article-title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","author":"Shazeer","year":"2017","journal-title":"arXiv e-prints"},{"key":"ref80","article-title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","author":"Shoeybi","year":"2019","journal-title":"arXiv e-prints"},{"key":"ref81","doi-asserted-by":"publisher","DOI":"10.1109\/ISCA59077.2024.00068"},{"key":"ref82","doi-asserted-by":"publisher","DOI":"10.1109\/VLSITechnologyandCir46783.2024.10631545"},{"key":"ref83","doi-asserted-by":"publisher","DOI":"10.1145\/3381898.3397210"},{"key":"ref84","doi-asserted-by":"publisher","DOI":"10.1145\/3575693.3575722"},{"key":"ref85","doi-asserted-by":"publisher","DOI":"10.1109\/ICCAD.2010.5653749"},{"key":"ref86","doi-asserted-by":"crossref","first-page":"74","DOI":"10.1016\/j.vlsi.2017.02.002","article-title":"Scaling equations for the accurate prediction of cmos device performance from 180nm to 7nm","volume":"58","author":"Stillmaker","year":"2017","journal-title":"Integration"},{"key":"ref87","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA61900.2025.00128"},{"key":"ref88","doi-asserted-by":"publisher","DOI":"10.1145\/3620666.3651359"},{"key":"ref89","doi-asserted-by":"publisher","DOI":"10.1145\/3240302.3240310"},{"key":"ref90","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA47549.2020.00059"},{"key":"ref91","article-title":"vLLM Team","volume-title":"Disaggregated prefill","year":"2025"},{"key":"ref92","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA56546.2023.10070997"},{"key":"ref93","doi-asserted-by":"publisher","DOI":"10.23919\/VLSITechnologyandCir57934.2023.10185427"},{"key":"ref94","doi-asserted-by":"publisher","DOI":"10.1109\/MICRO50266.2020.00049"},{"key":"ref95","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA.2010.5416628"},{"key":"ref96","article-title":"xAI","volume-title":"Open release of grok-1","year":"2024"},{"key":"ref97","doi-asserted-by":"publisher","DOI":"10.1145\/3786627"},{"key":"ref98","doi-asserted-by":"publisher","DOI":"10.1109\/ISCA59077.2024.00072"},{"key":"ref99","doi-asserted-by":"publisher","DOI":"10.1109\/SC41404.2022.00051"},{"key":"ref100","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA.2011.5749752"},{"key":"ref101","first-page":"521","article-title":"Orca: A distributed serving system for Transformer-Based generative models","volume-title":"16th USENIX Symposium on Operating Systems Design and Implementation (OSDI 22)","author":"Yu"},{"key":"ref102","doi-asserted-by":"publisher","DOI":"10.1145\/3620666.3651368"},{"key":"ref103","doi-asserted-by":"publisher","DOI":"10.1109\/MSSC.2016.2546199"},{"key":"ref104","doi-asserted-by":"publisher","DOI":"10.1109\/MICRO61859.2024.00108"},{"key":"ref105","article-title":"LLM Inference Unveiled: Survey and Roofline Model Insights","author":"Yuan","year":"2024","journal-title":"arXiv e-prints"},{"key":"ref106","doi-asserted-by":"publisher","DOI":"10.1109\/MICRO61859.2024.00105"},{"key":"ref107","doi-asserted-by":"publisher","DOI":"10.1145\/3466752.3480107"},{"key":"ref108","doi-asserted-by":"publisher","DOI":"10.1109\/PACT.2009.30"},{"key":"ref109","first-page":"81","article-title":"Optimizing bandwidth and power of graphics memory with hybrid memory technologies and adaptive data migration","volume-title":"2012 IEEE\/ACM International Conference on Computer-Aided Design (ICCAD)","author":"Zhao","year":"2012"},{"key":"ref110","doi-asserted-by":"crossref","first-page":"1005","DOI":"10.1109\/ISCA59077.2024.00077","article-title":"Alisa: Accelerating large language model inference via sparsity-aware kv caching","volume-title":"2024 ACM\/IEEE 51st Annual International Symposium on Computer Architecture (ISCA)","author":"Zhao","year":"2024"},{"key":"ref111","article-title":"DistServe: Disaggregating Prefill and Decoding for Goodput-optimized Large Language Model Serving","author":"Zhong","year":"2024","journal-title":"arXiv e-prints"}],"event":{"name":"2026 ACM\/IEEE 53rd Annual International Symposium on Computer Architecture (ISCA)","location":"Raleigh, NC, USA","start":{"date-parts":[[2026,6,27]]},"end":{"date-parts":[[2026,7,1]]}},"container-title":["2026 ACM\/IEEE 53rd Annual International Symposium on Computer Architecture (ISCA)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/11617393\/11617394\/11617797.pdf?arnumber=11617797","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,8,5]],"date-time":"2026-08-05T06:16:49Z","timestamp":1785910609000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11617797\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,6]]},"references-count":111,"URL":"https:\/\/doi.org\/10.1109\/isca66397.2026.00058","relation":{},"subject":[],"published":{"date-parts":[[2026,6]]}}}