{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,2]],"date-time":"2026-04-02T16:01:41Z","timestamp":1775145701778,"version":"3.50.1"},"publisher-location":"New York, NY, USA","reference-count":73,"publisher":"ACM","license":[{"start":{"date-parts":[[2025,6,20]],"date-time":"2025-06-20T00:00:00Z","timestamp":1750377600000},"content-version":"vor","delay-in-days":0,"URL":"http:\/\/www.acm.org\/publications\/policies\/copyright_policy#Background"}],"funder":[{"DOI":"10.13039\/100000183","name":"Army Research Office","doi-asserted-by":"publisher","award":["W911NF-23-2-0224"],"award-info":[{"award-number":["W911NF-23-2-0224"]}],"id":[{"id":"10.13039\/100000183","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100000001","name":"National Science Foundation","doi-asserted-by":"publisher","award":["2112562"],"award-info":[{"award-number":["2112562"]}],"id":[{"id":"10.13039\/100000001","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2025,6,21]]},"DOI":"10.1145\/3695053.3731024","type":"proceedings-article","created":{"date-parts":[[2025,6,20]],"date-time":"2025-06-20T16:43:11Z","timestamp":1750437791000},"page":"793-807","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":6,"title":["Ecco: Improving Memory Bandwidth and Capacity for LLMs via Entropy-Aware Cache Compression"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-5936-0030","authenticated-orcid":false,"given":"Feng","family":"Cheng","sequence":"first","affiliation":[{"name":"Duke University, Durham, USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-4479-5525","authenticated-orcid":false,"given":"Cong","family":"Guo","sequence":"additional","affiliation":[{"name":"Duke University, Durham, USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0008-8815-7948","authenticated-orcid":false,"given":"Chiyue","family":"Wei","sequence":"additional","affiliation":[{"name":"Duke University, Durham, USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0008-3913-7879","authenticated-orcid":false,"given":"Junyao","family":"Zhang","sequence":"additional","affiliation":[{"name":"Duke University, Durham, USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0005-3968-5048","authenticated-orcid":false,"given":"Changchun","family":"Zhou","sequence":"additional","affiliation":[{"name":"Duke University, Durham, USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-5179-8401","authenticated-orcid":false,"given":"Edward","family":"Hanson","sequence":"additional","affiliation":[{"name":"Advanced Micro Devices, Inc., Santa Clara, USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-3714-3414","authenticated-orcid":false,"given":"Jiaqi","family":"Zhang","sequence":"additional","affiliation":[{"name":"Advanced Micro Devices, Inc., Santa Clara, USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-6325-1796","authenticated-orcid":false,"given":"Xiaoxiao","family":"Liu","sequence":"additional","affiliation":[{"name":"Advanced Micro Devices, Inc., Santa Clara, USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3228-6544","authenticated-orcid":false,"given":"Hai","family":"Li","sequence":"additional","affiliation":[{"name":"Duke University, Durham, USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-1486-8412","authenticated-orcid":false,"given":"Yiran","family":"Chen","sequence":"additional","affiliation":[{"name":"Duke University, Durham, USA"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2025,6,20]]},"reference":[{"key":"e_1_3_3_1_2_2","volume-title":"AMD Instinct\u2122 MI300X Accelerator: Technical Overview","author":"Devices Advanced Micro","year":"2023","unstructured":"Advanced Micro Devices. 2023. AMD Instinct\u2122 MI300X Accelerator: Technical Overview. Technical Report. AMD. Product Documentation."},{"key":"e_1_3_3_1_3_2","doi-asserted-by":"crossref","unstructured":"Alaa\u00a0R Alameldeen and David\u00a0A Wood. 2004. Adaptive cache compression for high-performance processors. ACM SIGARCH Computer Architecture News 32 2 (2004) 212.","DOI":"10.1145\/1028176.1006719"},{"key":"e_1_3_3_1_4_2","unstructured":"Saleh Ashkboos Amirkeivan Mohtashami Maximilian\u00a0L. Croci Bo Li Pashmina Cameron Martin Jaggi Dan Alistarh Torsten Hoefler and James Hensman. 2024. QuaRot: Outlier-Free 4-Bit Inference in Rotated LLMs. arxiv:https:\/\/arXiv.org\/abs\/2404.00456\u00a0[cs.LG] https:\/\/arxiv.org\/abs\/2404.00456"},{"key":"e_1_3_3_1_5_2","unstructured":"Yonatan Bisk Rowan Zellers Ronan\u00a0Le Bras Jianfeng Gao and Yejin Choi. 2019. PIQA: Reasoning about Physical Commonsense in Natural Language. arxiv:https:\/\/arXiv.org\/abs\/1911.11641\u00a0[cs.CL] https:\/\/arxiv.org\/abs\/1911.11641"},{"key":"e_1_3_3_1_6_2","unstructured":"Tom Brown Benjamin Mann Nick Ryder Melanie Subbiah Jared\u00a0D Kaplan Prafulla Dhariwal Arvind Neelakantan Pranav Shyam Girish Sastry Amanda Askell et\u00a0al. 2020. Language models are few-shot learners. Advances in neural information processing systems 33 (2020) 1877\u20131901."},{"key":"e_1_3_3_1_7_2","doi-asserted-by":"publisher","DOI":"10.1109\/MICRO56248.2022.00092"},{"key":"e_1_3_3_1_8_2","doi-asserted-by":"publisher","unstructured":"Jack Choquette Wishwesh Gandhi Olivier Giroux Nick Stam and Ronny Krashinsky. 2021. NVIDIA A100 Tensor Core GPU: Performance and Innovation. IEEE Micro 41 2 (2021) 29\u201335. 10.1109\/MM.2021.3061394","DOI":"10.1109\/MM.2021.3061394"},{"key":"e_1_3_3_1_9_2","unstructured":"Esha Choukse Michael Sullivan Mike O\u2019Connor Mattan Erez Jeff Pool David Nellans and Steve Keckler. 2019. Buddy Compression: Enabling Larger Memory for Deep Learning and HPC Workloads on GPUs. arxiv:https:\/\/arXiv.org\/abs\/1903.02596\u00a0[cs.AR] https:\/\/arxiv.org\/abs\/1903.02596"},{"key":"e_1_3_3_1_10_2","unstructured":"Peter Clark Isaac Cowhey Oren Etzioni Tushar Khot Ashish Sabharwal Carissa Schoenick and Oyvind Tafjord. 2018. Think you have Solved Question Answering? Try ARC the AI2 Reasoning Challenge. arxiv:https:\/\/arXiv.org\/abs\/1803.05457\u00a0[cs.AI] https:\/\/arxiv.org\/abs\/1803.05457"},{"key":"e_1_3_3_1_11_2","unstructured":"Tim Dettmers Artidoro Pagnoni Ari Holtzman and Luke Zettlemoyer. 2023. QLoRA: Efficient Finetuning of Quantized LLMs. arxiv:https:\/\/arXiv.org\/abs\/2305.14314\u00a0[cs.LG] https:\/\/arxiv.org\/abs\/2305.14314"},{"key":"e_1_3_3_1_12_2","doi-asserted-by":"publisher","DOI":"10.1109\/ISCA45697.2020.00075"},{"key":"e_1_3_3_1_13_2","unstructured":"Elias Frantar Saleh Ashkboos Torsten Hoefler and Dan Alistarh. 2023. GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers. arxiv:https:\/\/arXiv.org\/abs\/2210.17323\u00a0[cs.LG] https:\/\/arxiv.org\/abs\/2210.17323"},{"key":"e_1_3_3_1_14_2","unstructured":"Leo Gao Stella Biderman Sid Black Laurence Golding Travis Hoppe Charles Foster Jason Phang Horace He Anish Thite Noa Nabeshima Shawn Presser and Connor Leahy. 2020. The Pile: An 800GB Dataset of Diverse Text for Language Modeling. arxiv:https:\/\/arXiv.org\/abs\/2101.00027\u00a0[cs.CL] https:\/\/arxiv.org\/abs\/2101.00027"},{"key":"e_1_3_3_1_15_2","doi-asserted-by":"publisher","unstructured":"Leo Gao Jonathan Tow Baber Abbasi Stella Biderman Sid Black Anthony DiPofi Charles Foster Laurence Golding Jeffrey Hsu Alain Le\u00a0Noac\u2019h Haonan Li Kyle McDonell Niklas Muennighoff Chris Ociepa Jason Phang Laria Reynolds Hailey Schoelkopf Aviya Skowron Lintang Sutawika Eric Tang Anish Thite Ben Wang Kevin Wang and Andy Zou. 2024. A framework for few-shot language model evaluation. 10.5281\/zenodo.12608602","DOI":"10.5281\/zenodo.12608602"},{"key":"e_1_3_3_1_16_2","unstructured":"Yunfan Gao Yun Xiong Xinyu Gao Kangxiang Jia Jinliu Pan Yuxi Bi Yi Dai Jiawei Sun Meng Wang and Haofen Wang. 2024. Retrieval-Augmented Generation for Large Language Models: A Survey. arxiv:https:\/\/arXiv.org\/abs\/2312.10997\u00a0[cs.CL] https:\/\/arxiv.org\/abs\/2312.10997"},{"key":"e_1_3_3_1_17_2","unstructured":"Google. 2024. TPU V6e. https:\/\/cloud.google.com\/blog\/products\/compute\/introducing-trillium-6th-gen-tpus"},{"key":"e_1_3_3_1_18_2","doi-asserted-by":"crossref","unstructured":"Cong Guo Feng Cheng Zhixu Du James Kiessling Jonathan Ku Shiyu Li Ziru Li Mingyuan Ma Tergel Molom-Ochir Benjamin Morris et\u00a0al. 2025. A Survey: Collaborative Hardware and Software Design in the Era of Large Language Models. IEEE Circuits and Systems Magazine 25 1 (2025) 35\u201357.","DOI":"10.1109\/MCAS.2024.3476008"},{"key":"e_1_3_3_1_19_2","doi-asserted-by":"publisher","unstructured":"Cong Guo Feng Cheng Zhixu Du James Kiessling Jonathan Ku Shiyu Li Ziru Li Mingyuan Ma Tergel Molom-Ochir Benjamin Morris Haoxuan Shan Jingwei Sun Yitu Wang Chiyue Wei Xueying Wu Yuhao Wu Hao\u00a0Frank Yang Jingyang Zhang Junyao Zhang Qilin Zheng Guanglei Zhou Hai Li and Yiran Chen. 2025. A Survey: Collaborative Hardware and Software Design in the Era of Large Language Models. IEEE Circuits and Systems Magazine 25 1 (2025) 35\u201357. 10.1109\/MCAS.2024.3476008","DOI":"10.1109\/MCAS.2024.3476008"},{"key":"e_1_3_3_1_20_2","doi-asserted-by":"publisher","DOI":"10.5555\/3433701.3433722"},{"key":"e_1_3_3_1_21_2","volume-title":"International Conference on Learning Representations","author":"Guo Cong","year":"2022","unstructured":"Cong Guo, Yuxian Qiu, Jingwen Leng, Xiaotian Gao, Chen Zhang, Yunxin Liu, Fan Yang, Yuhao Zhu, and Minyi Guo. 2022. SQuant: On-the-Fly Data-Free Quantization via Diagonal Hessian Approximation. In International Conference on Learning Representations. https:\/\/openreview.net\/forum?id=JXhROKNZzOc"},{"key":"e_1_3_3_1_22_2","doi-asserted-by":"publisher","DOI":"10.1145\/3579371.3589038"},{"key":"e_1_3_3_1_23_2","doi-asserted-by":"crossref","unstructured":"Cong Guo Fengchen Xue Jingwen Leng Yuxian Qiu Yue Guan Weihao Cui Quan Chen and Minyi Guo. 2024. Accelerating sparse dnns based on tiled gemm. IEEE Trans. Comput. (2024).","DOI":"10.1109\/TC.2024.3365942"},{"key":"e_1_3_3_1_24_2","doi-asserted-by":"publisher","DOI":"10.1109\/MICRO56248.2022.00095"},{"key":"e_1_3_3_1_25_2","doi-asserted-by":"crossref","unstructured":"Song Han Xingyu Liu Huizi Mao Jing Pu Ardavan Pedram Mark\u00a0A Horowitz and William\u00a0J Dally. 2016. EIE: Efficient inference engine on compressed deep neural network. ACM SIGARCH Computer Architecture News 44 3 (2016) 243\u2013254.","DOI":"10.1145\/3007787.3001163"},{"key":"e_1_3_3_1_26_2","unstructured":"Song Han Huizi Mao and William\u00a0J. Dally. 2016. Deep Compression: Compressing Deep Neural Networks with Pruning Trained Quantization and Huffman Coding. arxiv:https:\/\/arXiv.org\/abs\/1510.00149\u00a0[cs.CV] https:\/\/arxiv.org\/abs\/1510.00149"},{"key":"e_1_3_3_1_27_2","doi-asserted-by":"publisher","DOI":"10.1145\/3613424.3614278"},{"key":"e_1_3_3_1_28_2","unstructured":"Coleman Hooper Sehoon Kim Hiva Mohammadzadeh Michael\u00a0W. Mahoney Yakun\u00a0Sophia Shao Kurt Keutzer and Amir Gholami. 2024. KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization. arxiv:https:\/\/arXiv.org\/abs\/2401.18079\u00a0[cs.LG] https:\/\/arxiv.org\/abs\/2401.18079"},{"key":"e_1_3_3_1_29_2","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA61900.2025.00086"},{"key":"e_1_3_3_1_30_2","unstructured":"Jie Huang and Kevin Chen-Chuan Chang. 2023. Towards Reasoning in Large Language Models: A Survey. arxiv:https:\/\/arXiv.org\/abs\/2212.10403\u00a0[cs.CL] https:\/\/arxiv.org\/abs\/2212.10403"},{"key":"e_1_3_3_1_31_2","doi-asserted-by":"crossref","unstructured":"David\u00a0A Huffman. 1952. A method for the construction of minimum-redundancy codes. Proceedings of the IRE 40 9 (1952) 1098\u20131101.","DOI":"10.1109\/JRPROC.1952.273898"},{"key":"e_1_3_3_1_32_2","unstructured":"Intel. 2024. Intel Core Ultra. https:\/\/www.intel.com\/content\/www\/us\/en\/products\/sku\/241747\/intel-core-ultra-9-processor-285h-24m-cache-up-to-5-40-ghz\/specifications.html"},{"key":"e_1_3_3_1_33_2","unstructured":"Benoit Jacob Skirmantas Kligys Bo Chen Menglong Zhu Matthew Tang Andrew Howard Hartwig Adam and Dmitry Kalenichenko. 2017. Quantization and Training of Neural Networks for Efficient Integer-Arithmetic-Only Inference. arxiv:https:\/\/arXiv.org\/abs\/1712.05877\u00a0[cs.LG] https:\/\/arxiv.org\/abs\/1712.05877"},{"key":"e_1_3_3_1_34_2","doi-asserted-by":"publisher","DOI":"10.1109\/ISCA.2018.00070"},{"key":"e_1_3_3_1_35_2","unstructured":"Albert\u00a0Q. Jiang Alexandre Sablayrolles Antoine Roux Arthur Mensch Blanche Savary Chris Bamford Devendra\u00a0Singh Chaplot Diego de\u00a0las Casas Emma\u00a0Bou Hanna Florian Bressand Gianna Lengyel Guillaume Bour Guillaume Lample L\u00e9lio\u00a0Renard Lavaud Lucile Saulnier Marie-Anne Lachaux Pierre Stock Sandeep Subramanian Sophia Yang Szymon Antoniak Teven\u00a0Le Scao Th\u00e9ophile Gervet Thibaut Lavril Thomas Wang Timoth\u00e9e Lacroix and William\u00a0El Sayed. 2024. Mixtral of Experts. arxiv:https:\/\/arXiv.org\/abs\/2401.04088\u00a0[cs.LG] https:\/\/arxiv.org\/abs\/2401.04088"},{"key":"e_1_3_3_1_36_2","unstructured":"Jared Kaplan Sam McCandlish Tom Henighan Tom\u00a0B. Brown Benjamin Chess Rewon Child Scott Gray Alec Radford Jeffrey Wu and Dario Amodei. 2020. Scaling Laws for Neural Language Models. arxiv:https:\/\/arXiv.org\/abs\/2001.08361\u00a0[cs.LG] https:\/\/arxiv.org\/abs\/2001.08361"},{"key":"e_1_3_3_1_37_2","doi-asserted-by":"publisher","DOI":"10.1109\/ISCA45697.2020.00047"},{"key":"e_1_3_3_1_38_2","unstructured":"Sehoon Kim Coleman Hooper Amir Gholami Zhen Dong Xiuyu Li Sheng Shen Michael\u00a0W. Mahoney and Kurt Keutzer. 2024. SqueezeLLM: Dense-and-Sparse Quantization. arxiv:https:\/\/arXiv.org\/abs\/2306.07629\u00a0[cs.CL] https:\/\/arxiv.org\/abs\/2306.07629"},{"key":"e_1_3_3_1_39_2","unstructured":"Young\u00a0Jin Kim Rawn Henry Raffy Fahim and Hany\u00a0Hassan Awadalla. 2022. Who Says Elephants Can\u2019t Run: Bringing Large Scale MoE Models into Cloud Scale Production. arxiv:https:\/\/arXiv.org\/abs\/2211.10017\u00a0[cs.CL] https:\/\/arxiv.org\/abs\/2211.10017"},{"key":"e_1_3_3_1_40_2","doi-asserted-by":"publisher","DOI":"10.1145\/3600006.3613165"},{"key":"e_1_3_3_1_41_2","unstructured":"Jonathan Lew Deval Shah Suchita Pati Shaylin Cattell Mengchi Zhang Amruth Sandhupatla Christopher Ng Negar Goli Matthew\u00a0D. Sinclair Timothy\u00a0G. Rogers and Tor Aamodt. 2019. Analyzing Machine Learning Workloads Using a Detailed GPU Simulator. arxiv:https:\/\/arXiv.org\/abs\/1811.08933\u00a0[cs.DC] https:\/\/arxiv.org\/abs\/1811.08933"},{"key":"e_1_3_3_1_42_2","unstructured":"Jinhao Li Jiaming Xu Shan Huang Yonghua Chen Wen Li Jun Liu Yaoxiu Lian Jiayi Pan Li Ding Hao Zhou Yu Wang and Guohao Dai. 2025. Large Language Model Inference Acceleration: A Comprehensive Hardware Perspective. arxiv:https:\/\/arXiv.org\/abs\/2410.04466\u00a0[cs.AR] https:\/\/arxiv.org\/abs\/2410.04466"},{"key":"e_1_3_3_1_43_2","unstructured":"Ji Lin Jiaming Tang Haotian Tang Shang Yang Wei-Ming Chen Wei-Chen Wang Guangxuan Xiao Xingyu Dang Chuang Gan and Song Han. 2024. AWQ: Activation-aware Weight Quantization for On-Device LLM Compression and Acceleration. Proceedings of Machine Learning and Systems 6 (2024) 87\u2013100."},{"key":"e_1_3_3_1_44_2","unstructured":"Yujun Lin Haotian Tang Shang Yang Zhekai Zhang Guangxuan Xiao Chuang Gan and Song Han. 2024. QServe: W4A8KV4 Quantization and System Co-design for Efficient LLM Serving. arxiv:https:\/\/arXiv.org\/abs\/2405.04532\u00a0[cs.CL] https:\/\/arxiv.org\/abs\/2405.04532"},{"key":"e_1_3_3_1_45_2","first-page":"281","volume-title":"Proceedings of the Fifth Berkeley Symposium on Mathematical Statistics and Probability, Volume 1: Statistics","volume":"5","author":"MacQueen James","year":"1967","unstructured":"James MacQueen. 1967. Some methods for classification and analysis of multivariate observations. In Proceedings of the Fifth Berkeley Symposium on Mathematical Statistics and Probability, Volume 1: Statistics, Vol.\u00a05. University of California press, Oakland, CA, USA, 281\u2013298."},{"key":"e_1_3_3_1_46_2","unstructured":"Stephen Merity Caiming Xiong James Bradbury and Richard Socher. 2016. Pointer Sentinel Mixture Models. arxiv:https:\/\/arXiv.org\/abs\/1609.07843\u00a0[cs.CL] https:\/\/arxiv.org\/abs\/1609.07843"},{"key":"e_1_3_3_1_47_2","doi-asserted-by":"crossref","unstructured":"Bonan Min Hayley Ross Elior Sulem Amir Pouran\u00a0Ben Veyseh Thien\u00a0Huu Nguyen Oscar Sainz Eneko Agirre Ilana Heintz and Dan Roth. 2023. Recent advances in natural language processing via large pre-trained language models: A survey. Comput. Surveys 56 2 (2023) 1\u201340.","DOI":"10.1145\/3605943"},{"key":"e_1_3_3_1_48_2","unstructured":"NVIDIA. 2020. GTC 2020. https:\/\/developer.download.nvidia.cn\/video\/gputechconf\/gtc\/2020\/presentations\/s21819-optimizing-applications-for-nvidia-ampere-gpu-architecture.pdf"},{"key":"e_1_3_3_1_49_2","unstructured":"NVIDIA. 2024. A100 Compute Data Compression. https:\/\/hc32.hotchips.org\/assets\/program\/conference\/day1\/HotChips2020_GPU_NVIDIA_Choquette_v01.pdf#page=22"},{"key":"e_1_3_3_1_50_2","unstructured":"NVIDIA. 2024. Compressible Memory. https:\/\/docs.nvidia.com\/cuda\/cuda-c-programming-guide\/index.html#compressible-memory"},{"key":"e_1_3_3_1_51_2","unstructured":"NVIDIA. 2024. cuBLAS. https:\/\/docs.nvidia.com\/cuda\/cublas\/"},{"key":"e_1_3_3_1_52_2","unstructured":"NVIDIA. 2024. CUTLASS. https:\/\/nvidia.github.io\/cutlass\/"},{"key":"e_1_3_3_1_53_2","unstructured":"NVIDIA. 2024. Hopper Tuning Guide. https:\/\/docs.nvidia.com\/cuda\/hopper-tuning-guide\/index.html#inline-compression"},{"key":"e_1_3_3_1_54_2","unstructured":"NVIDIA. 2024. NVIDIA Turing Architecture In Depth. https:\/\/developer.nvidia.com\/blog\/nvidia-turing-architecture-in-depth\/"},{"key":"e_1_3_3_1_55_2","unstructured":"NVIDIA. 2024. TensorRT-LLM. https:\/\/nvidia.github.io\/TensorRT-LLM\/"},{"key":"e_1_3_3_1_56_2","unstructured":"OpenAI Josh Achiam Steven Adler Sandhini Agarwal Lama Ahmad Ilge Akkaya Florencia\u00a0Leoni Aleman Diogo Almeida Janko Altenschmidt Sam Altman Shyamal Anadkat Red Avila Igor Babuschkin Suchir Balaji Valerie Balcom Paul Baltescu Haiming Bao Mohammad Bavarian Jeff Belgum Irwan Bello Jake Berdine Gabriel Bernadett-Shapiro Christopher Berner Lenny Bogdonoff Oleg Boiko Madelaine Boyd Anna-Luisa Brakman Greg Brockman Tim Brooks Miles Brundage Kevin Button Trevor Cai Rosie Campbell Andrew Cann Brittany Carey Chelsea Carlson Rory Carmichael Brooke Chan Che Chang Fotis Chantzis Derek Chen Sully Chen Ruby Chen Jason Chen Mark Chen Ben Chess Chester Cho Casey Chu Hyung\u00a0Won Chung Dave Cummings Jeremiah Currier Yunxing Dai Cory Decareaux Thomas Degry Noah Deutsch Damien Deville Arka Dhar David Dohan Steve Dowling Sheila Dunning Adrien Ecoffet Atty Eleti Tyna Eloundou David Farhi Liam Fedus Niko Felix Sim\u00f3n\u00a0Posada Fishman Juston Forte Isabella Fulford Leo Gao Elie Georges Christian Gibson Vik Goel Tarun Gogineni Gabriel Goh Rapha Gontijo-Lopes Jonathan Gordon Morgan Grafstein Scott Gray Ryan Greene Joshua Gross Shixiang\u00a0Shane Gu Yufei Guo Chris Hallacy Jesse Han Jeff Harris Yuchen He Mike Heaton Johannes Heidecke Chris Hesse Alan Hickey Wade Hickey Peter Hoeschele Brandon Houghton Kenny Hsu Shengli Hu Xin Hu Joost Huizinga Shantanu Jain Shawn Jain Joanne Jang Angela Jiang Roger Jiang Haozhun Jin Denny Jin Shino Jomoto Billie Jonn Heewoo Jun Tomer Kaftan \u0141ukasz Kaiser Ali Kamali Ingmar Kanitscheider Nitish\u00a0Shirish Keskar Tabarak Khan Logan Kilpatrick Jong\u00a0Wook Kim Christina Kim Yongjik Kim Jan\u00a0Hendrik Kirchner Jamie Kiros Matt Knight Daniel Kokotajlo \u0141ukasz Kondraciuk Andrew Kondrich Aris Konstantinidis Kyle Kosic Gretchen Krueger Vishal Kuo Michael Lampe Ikai Lan Teddy Lee Jan Leike Jade Leung Daniel Levy Chak\u00a0Ming Li Rachel Lim Molly Lin Stephanie Lin Mateusz Litwin Theresa Lopez Ryan Lowe Patricia Lue Anna Makanju Kim Malfacini Sam Manning Todor Markov Yaniv Markovski Bianca Martin Katie Mayer Andrew Mayne Bob McGrew Scott\u00a0Mayer McKinney Christine McLeavey Paul McMillan Jake McNeil David Medina Aalok Mehta Jacob Menick Luke Metz Andrey Mishchenko Pamela Mishkin Vinnie Monaco Evan Morikawa Daniel Mossing Tong Mu Mira Murati Oleg Murk David M\u00e9ly Ashvin Nair Reiichiro Nakano Rajeev Nayak Arvind Neelakantan Richard Ngo Hyeonwoo Noh Long Ouyang Cullen O\u2019Keefe Jakub Pachocki Alex Paino Joe Palermo Ashley Pantuliano Giambattista Parascandolo Joel Parish Emy Parparita Alex Passos Mikhail Pavlov Andrew Peng Adam Perelman Filipe de Avila Belbute\u00a0Peres Michael Petrov Henrique\u00a0Ponde de Oliveira\u00a0Pinto Michael Pokorny Michelle Pokrass Vitchyr\u00a0H. Pong Tolly Powell Alethea Power Boris Power Elizabeth Proehl Raul Puri Alec Radford Jack Rae Aditya Ramesh Cameron Raymond Francis Real Kendra Rimbach Carl Ross Bob Rotsted Henri Roussez Nick Ryder Mario Saltarelli Ted Sanders Shibani Santurkar Girish Sastry Heather Schmidt David Schnurr John Schulman Daniel Selsam Kyla Sheppard Toki Sherbakov Jessica Shieh Sarah Shoker Pranav Shyam Szymon Sidor Eric Sigler Maddie Simens Jordan Sitkin Katarina Slama Ian Sohl Benjamin Sokolowsky Yang Song Natalie Staudacher Felipe\u00a0Petroski Such Natalie Summers Ilya Sutskever Jie Tang Nikolas Tezak Madeleine\u00a0B. Thompson Phil Tillet Amin Tootoonchian Elizabeth Tseng Preston Tuggle Nick Turley Jerry Tworek Juan Felipe\u00a0Cer\u00f3n Uribe Andrea Vallone Arun Vijayvergiya Chelsea Voss Carroll Wainwright Justin\u00a0Jay Wang Alvin Wang Ben Wang Jonathan Ward Jason Wei CJ Weinmann Akila Welihinda Peter Welinder Jiayi Weng Lilian Weng Matt Wiethoff Dave Willner Clemens Winter Samuel Wolrich Hannah Wong Lauren Workman Sherwin Wu Jeff Wu Michael Wu Kai Xiao Tao Xu Sarah Yoo Kevin Yu Qiming Yuan Wojciech Zaremba Rowan Zellers Chong Zhang Marvin Zhang Shengjia Zhao Tianhao Zheng Juntang Zhuang William Zhuk and Barret Zoph. 2024. GPT-4 Technical Report. arxiv:https:\/\/arXiv.org\/abs\/2303.08774\u00a0[cs.CL] https:\/\/arxiv.org\/abs\/2303.08774"},{"key":"e_1_3_3_1_57_2","unstructured":"Pratyush Patel Esha Choukse Chaojie Zhang Aashaka Shah \u00cd\u00f1igo Goiri Saeed Maleki and Ricardo Bianchini. 2024. Splitwise: Efficient generative LLM inference using phase splitting. arxiv:https:\/\/arXiv.org\/abs\/2311.18677\u00a0[cs.AR] https:\/\/arxiv.org\/abs\/2311.18677"},{"key":"e_1_3_3_1_58_2","doi-asserted-by":"publisher","DOI":"10.1145\/2370816.2370870"},{"key":"e_1_3_3_1_59_2","doi-asserted-by":"crossref","unstructured":"Edward\u00a0O Pyzer-Knapp Jed\u00a0W Pitera Peter\u00a0WJ Staar Seiji Takeda Teodoro Laino Daniel\u00a0P Sanders James Sexton John\u00a0R Smith and Alessandro Curioni. 2022. Accelerating materials discovery using artificial intelligence high performance computing and robotics. npj Computational Materials 8 1 (2022) 84.","DOI":"10.1038\/s41524-022-00765-z"},{"key":"e_1_3_3_1_60_2","doi-asserted-by":"crossref","unstructured":"Keisuke Sakaguchi Ronan\u00a0Le Bras Chandra Bhagavatula and Yejin Choi. 2021. Winogrande: An adversarial winograd schema challenge at scale. Commun. ACM 64 9 (2021) 99\u2013106.","DOI":"10.1145\/3474381"},{"key":"e_1_3_3_1_61_2","unstructured":"Mohammad Shoeybi Mostofa Patwary Raul Puri Patrick LeGresley Jared Casper and Bryan Catanzaro. 2020. Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism. arxiv:https:\/\/arXiv.org\/abs\/1909.08053\u00a0[cs.CL] https:\/\/arxiv.org\/abs\/1909.08053"},{"key":"e_1_3_3_1_62_2","volume-title":"High performance computing: modern systems and practices","author":"Sterling Thomas","year":"2017","unstructured":"Thomas Sterling, Maciej Brodowicz, and Matthew Anderson. 2017. High performance computing: modern systems and practices. Morgan Kaufmann."},{"key":"e_1_3_3_1_63_2","unstructured":"Hugo Touvron Thibaut Lavril Gautier Izacard Xavier Martinet Marie-Anne Lachaux Timoth\u00e9e Lacroix Baptiste Rozi\u00e8re Naman Goyal Eric Hambro Faisal Azhar Aurelien Rodriguez Armand Joulin Edouard Grave and Guillaume Lample. 2023. LLaMA: Open and Efficient Foundation Language Models. arxiv:https:\/\/arXiv.org\/abs\/2302.13971\u00a0[cs.CL] https:\/\/arxiv.org\/abs\/2302.13971"},{"key":"e_1_3_3_1_64_2","unstructured":"Hugo Touvron Louis Martin Kevin Stone Peter Albert Amjad Almahairi Yasmine Babaei Nikolay Bashlykov Soumya Batra Prajjwal Bhargava Shruti Bhosale Dan Bikel Lukas Blecher Cristian\u00a0Canton Ferrer Moya Chen Guillem Cucurull David Esiobu Jude Fernandes Jeremy Fu Wenyin Fu Brian Fuller Cynthia Gao Vedanuj Goswami Naman Goyal Anthony Hartshorn Saghar Hosseini Rui Hou Hakan Inan Marcin Kardas Viktor Kerkez Madian Khabsa Isabel Kloumann Artem Korenev Punit\u00a0Singh Koura Marie-Anne Lachaux Thibaut Lavril Jenya Lee Diana Liskovich Yinghai Lu Yuning Mao Xavier Martinet Todor Mihaylov Pushkar Mishra Igor Molybog Yixin Nie Andrew Poulton Jeremy Reizenstein Rashi Rungta Kalyan Saladi Alan Schelten Ruan Silva Eric\u00a0Michael Smith Ranjan Subramanian Xiaoqing\u00a0Ellen Tan Binh Tang Ross Taylor Adina Williams Jian\u00a0Xiang Kuan Puxin Xu Zheng Yan Iliyan Zarov Yuchen Zhang Angela Fan Melanie Kambadur Sharan Narang Aurelien Rodriguez Robert Stojnic Sergey Edunov and Thomas Scialom. 2023. Llama 2: Open Foundation and Fine-Tuned Chat Models. arxiv:https:\/\/arXiv.org\/abs\/2307.09288\u00a0[cs.CL] https:\/\/arxiv.org\/abs\/2307.09288"},{"key":"e_1_3_3_1_65_2","unstructured":"Ashish Vaswani Noam Shazeer Niki Parmar Jakob Uszkoreit Llion Jones Aidan\u00a0N. Gomez Lukasz Kaiser and Illia Polosukhin. 2023. Attention Is All You Need. arxiv:https:\/\/arXiv.org\/abs\/1706.03762\u00a0[cs.CL] https:\/\/arxiv.org\/abs\/1706.03762"},{"key":"e_1_3_3_1_66_2","doi-asserted-by":"publisher","DOI":"10.1145\/3352460.3358307"},{"key":"e_1_3_3_1_67_2","doi-asserted-by":"crossref","unstructured":"Gregory\u00a0K Wallace. 1992. The JPEG still picture compression standard. IEEE Transactions on Consumer Electronics 38 1 (1992) xviii\u2013xxxiv.","DOI":"10.1109\/30.125072"},{"key":"e_1_3_3_1_68_2","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA61900.2025.00066"},{"key":"e_1_3_3_1_69_2","unstructured":"Guangxuan Xiao Ji Lin Mickael Seznec Hao Wu Julien Demouth and Song Han. 2024. SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models. arxiv:https:\/\/arXiv.org\/abs\/2211.10438\u00a0[cs.CL] https:\/\/arxiv.org\/abs\/2211.10438"},{"key":"e_1_3_3_1_70_2","unstructured":"Shunyu Yao Dian Yu Jeffrey Zhao Izhak Shafran Thomas\u00a0L. Griffiths Yuan Cao and Karthik Narasimhan. 2023. Tree of Thoughts: Deliberate Problem Solving with Large Language Models. arxiv:https:\/\/arXiv.org\/abs\/2305.10601\u00a0[cs.CL] https:\/\/arxiv.org\/abs\/2305.10601"},{"key":"e_1_3_3_1_71_2","unstructured":"Zhihang Yuan Yuzhang Shang Yang Zhou Zhen Dong Zhe Zhou Chenhao Xue Bingzhe Wu Zhikai Li Qingyi Gu Yong\u00a0Jae Lee Yan Yan Beidi Chen Guangyu Sun and Kurt Keutzer. 2024. LLM Inference Unveiled: Survey and Roofline Model Insights. arxiv:https:\/\/arXiv.org\/abs\/2402.16363\u00a0[cs.CL] https:\/\/arxiv.org\/abs\/2402.16363"},{"key":"e_1_3_3_1_72_2","doi-asserted-by":"crossref","unstructured":"Rowan Zellers Ari Holtzman Yonatan Bisk Ali Farhadi and Yejin Choi. 2019. HellaSwag: Can a Machine Really Finish Your Sentence? arxiv:https:\/\/arXiv.org\/abs\/1905.07830\u00a0[cs.CL] https:\/\/arxiv.org\/abs\/1905.07830","DOI":"10.18653\/v1\/P19-1472"},{"key":"e_1_3_3_1_73_2","doi-asserted-by":"crossref","unstructured":"Chen Zhang Yang Wang Zhiqiang Xie Cong Guo Yunxin Liu Jingwen Leng Guangyu Sun Zhigang Ji Runsheng Wang Yuan Xie et\u00a0al. 2024. DSTC: Dual-Side Sparsity Tensor Core for DNNs Acceleration on Modern GPU Architectures. IEEE Trans. Comput. (2024).","DOI":"10.1109\/TC.2024.3475814"},{"key":"e_1_3_3_1_74_2","unstructured":"Junyao Zhang Hanrui Wang Qi Ding Jiaqi Gu Reouven Assouly William\u00a0D Oliver Song Han Kenneth\u00a0R Brown Hai Li Yiran Chen et\u00a0al. 2024. Qplacer: Frequency-aware component placement for superconducting quantum computers. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2401.17450 (2024)."}],"event":{"name":"ISCA '25: Proceedings of the 52nd Annual International Symposium on Computer Architecture","location":"Tokyo Japan","acronym":"SIGARCH '25","sponsor":["SIGARCH ACM Special Interest Group on Computer Architecture"]},"container-title":["Proceedings of the 52nd Annual International Symposium on Computer Architecture"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3695053.3731024","content-type":"application\/pdf","content-version":"vor","intended-application":"syndication"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3695053.3731024","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,21]],"date-time":"2025-06-21T11:01:37Z","timestamp":1750503697000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3695053.3731024"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,6,20]]},"references-count":73,"alternative-id":["10.1145\/3695053.3731024","10.1145\/3695053"],"URL":"https:\/\/doi.org\/10.1145\/3695053.3731024","relation":{},"subject":[],"published":{"date-parts":[[2025,6,20]]},"assertion":[{"value":"2025-06-20","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}