{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,27]],"date-time":"2026-05-27T06:05:10Z","timestamp":1779861910186,"version":"3.53.1"},"reference-count":48,"publisher":"IEEE","license":[{"start":{"date-parts":[[2026,4,26]],"date-time":"2026-04-26T00:00:00Z","timestamp":1777161600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,4,26]],"date-time":"2026-04-26T00:00:00Z","timestamp":1777161600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/100000028","name":"Semiconductor Research Corporation","doi-asserted-by":"publisher","id":[{"id":"10.13039\/100000028","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2026,4,26]]},"DOI":"10.1109\/ispass69572.2026.00016","type":"proceedings-article","created":{"date-parts":[[2026,5,26]],"date-time":"2026-05-26T19:39:19Z","timestamp":1779824359000},"page":"51-63","source":"Crossref","is-referenced-by-count":0,"title":["HARMONI: Hierarchical ARchitecture MOdeling for LLMs with Near\/In Memory Computing"],"prefix":"10.1109","author":[{"given":"Khyati","family":"Kiyawat","sequence":"first","affiliation":[{"name":"University of Virginia"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yasas","family":"Seneviratne","sequence":"additional","affiliation":[{"name":"University of Virginia"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zhenxing","family":"Fan","sequence":"additional","affiliation":[{"name":"University of Virginia"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Morteza","family":"Baradaran","sequence":"additional","affiliation":[{"name":"University of Virginia"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Kevin","family":"Skadron","sequence":"additional","affiliation":[{"name":"University of Virginia"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","article-title":"A survey on large language model acceleration based on kv cache management","author":"Li","year":"2024","journal-title":"arXiv preprint arXiv:2412.19442"},{"key":"ref2","article-title":"Think: Thinner key cache by query-driven pruning","author":"Xu","year":"2024","journal-title":"arXiv preprint arXiv:2407.21018"},{"key":"ref3","article-title":"GEAR: An efficient kv cache compression recipe for near-lossless generative inference of 11m","author":"Kang","year":"2024"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.52202\/075280-1506"},{"key":"ref5","first-page":"114","article-title":"Keyformer: KV cache reduction through key tokens selection for efficient generative inference","volume-title":"Proceedings of Machine Learning and Systems","volume":"6","author":"Adnan"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/CLOUD67622.2025.00036"},{"key":"ref7","first-page":"117","article-title":"Taming throughput-latency tradeoff in LLM inference with Sarathi-Serve","volume-title":"18th USENIX symposium on operating systems design and implementation (OSDI 24)","author":"Agrawal"},{"key":"ref8","first-page":"193","article-title":"DistServe: Disaggregating prefill and decoding for goodput-optimized large language model serving","volume-title":"18th USENIX Symposium on Operating Systems Design and Implementation (OSDI 24)","author":"Zhong"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/ISCA59077.2024.00019"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1145\/3620665.3640422"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/MICRO61859.2024.00105"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA61900.2025.00129"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1145\/3676641.3716009"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1145\/3620666.3651352"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1145\/3458817.3476146"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1145\/3676641.3716267"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA53966.2022.00082"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1145\/3620666.3651380"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1145\/3620666.3651324"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/HCS55958.2022.9895629"},{"key":"ref21","first-page":"970","article-title":"An LPDDR-based CXL-PNM platform for TCO-efficient inference of transformer-based Large Language Models","volume-title":"2024 IEEE International Symposium on High-Performance Computer Architecture (HPCA)","author":"Park"},{"key":"ref22","article-title":"PIM-AI: A novel architecture for high-efficiency LLM inference","author":"Ortega","year":"2024","journal-title":"arXiv preprint arXiv:2411.17309"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/TC.2025.3576935"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1109\/LCA.2025.3559738"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1109\/TCAD.2024.3410842"},{"issue":"1","key":"ref26","doi-asserted-by":"crossref","first-page":"4","DOI":"10.1038\/s44335-024-00004-2","article-title":"PIM GPT a hybrid process in memory accelerator for autoregressive transformers","volume":"1","author":"Wu","year":"2024","journal-title":"npj Unconventional Computing"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/DAC63849.2025.11133391"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1109\/MM.2022.3202350"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1109\/ISPASS.2009.4919636"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1109\/ISPASS.2013.6557149"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1109\/LCA.2020.2973991"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/LCA.2023.3333759"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.48550\/ARXIV.1706.03762"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1109\/ISPASS64960.2025.00026"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1109\/ISPASS64960.2025.00025"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1109\/LCA.2024.3484648"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1109\/ISPASS48437.2020.00018"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1109\/IISWC63097.2024.00012"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1109\/IISWC63097.2024.00030"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA61900.2025.00054"},{"key":"ref41","article-title":"Chakra: Advancing performance benchmarking and co-design using standardized execution traces","author":"Sridharan","year":"2023","journal-title":"arXiv preprint arXiv:2305.14516"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1201\/9780367810672"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1214\/aoms\/1177728975"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1145\/3600006.3613165"},{"key":"ref45","article-title":"Llama-2-7b model page","year":"2023"},{"key":"ref46","article-title":"Meta-Llama-3-70B model page","year":"2024"},{"key":"ref47","article-title":"Mistral-7B-v0.1 model page","year":"2023"},{"key":"ref48","article-title":"NVIDIA H100 GPU Datasheet"}],"event":{"name":"2026 IEEE International Symposium on Performance Analysis of Systems and Software (ISPASS)","location":"Seoul, Korea, Republic of","start":{"date-parts":[[2026,4,26]]},"end":{"date-parts":[[2026,4,28]]}},"container-title":["2026 IEEE International Symposium on Performance Analysis of Systems and Software (ISPASS)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/11527204\/11527232\/11527269.pdf?arnumber=11527269","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,5,27]],"date-time":"2026-05-27T05:36:25Z","timestamp":1779860185000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11527269\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,4,26]]},"references-count":48,"URL":"https:\/\/doi.org\/10.1109\/ispass69572.2026.00016","relation":{},"subject":[],"published":{"date-parts":[[2026,4,26]]}}}