{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,9,17]],"date-time":"2025-09-17T06:12:26Z","timestamp":1758089546567,"version":"3.44.0"},"reference-count":24,"publisher":"IEEE","license":[{"start":{"date-parts":[[2025,6,22]],"date-time":"2025-06-22T00:00:00Z","timestamp":1750550400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2025,6,22]],"date-time":"2025-06-22T00:00:00Z","timestamp":1750550400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/100000001","name":"National Science Foundation","doi-asserted-by":"publisher","id":[{"id":"10.13039\/100000001","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025,6,22]]},"DOI":"10.1109\/dac63849.2025.11132101","type":"proceedings-article","created":{"date-parts":[[2025,9,15]],"date-time":"2025-09-15T17:35:41Z","timestamp":1757957741000},"page":"1-7","source":"Crossref","is-referenced-by-count":0,"title":["PacQ: A SIMT Microarchitecture for Efficient Dataflow in Hyper-asymmetric GEMMs"],"prefix":"10.1109","author":[{"given":"Ruokai","family":"Yin","sequence":"first","affiliation":[{"name":"Yale University,New Haven,USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yuhang","family":"Li","sequence":"additional","affiliation":[{"name":"Yale University,New Haven,USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Priyadarshini","family":"Panda","sequence":"additional","affiliation":[{"name":"Yale University,New Haven,USA"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"volume-title":"Autogptq","year":"2024","key":"ref1"},{"key":"ref2","article-title":"Gptq: Accurate post-training quantization for generative pre-trained transformers","author":"Frantar","year":"2022","journal-title":"arXiv preprint arXiv:2210.17323"},{"article-title":"Optq: Accurate quantization for generative pre-trained transformers","volume-title":"The Eleventh International Conference on Learning Representations","author":"Frantar","key":"ref3"},{"key":"ref4","article-title":"High throughput matrix-matrix multiplication between asymmetric bit-width operands","author":"Gope","year":"2020","journal-title":"arXiv preprint arXiv:2008.00638"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00286"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA57654.2024.00064"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2022.sustainlp-1.6"},{"key":"ref8","article-title":"Brecq: Pushing the limit of post-training quantization by block reconstruction","author":"Li","year":"2021","journal-title":"arXiv preprint arXiv:2102.05426"},{"key":"ref9","article-title":"Tesseraq: Ultra low-bit llm post-training quantization with block reconstruction","author":"Li","year":"2024","journal-title":"arXiv preprint arXiv:2410.19103"},{"key":"ref10","first-page":"87","article-title":"Awq: Activation-aware weight quantization for on-device llm compression and acceleration","volume":"6","author":"Lin","year":"2024","journal-title":"Proceedings of Machine Learning and Systems"},{"volume-title":"llmc: Towards accurate and efficient llm compression","year":"2024","key":"ref11"},{"key":"ref12","article-title":"Lut tensor core: Lookup table enables efficient low-bit llm inference acceleration","author":"Mo","year":"2024","journal-title":"arXiv preprint arXiv:2408.06003"},{"key":"ref13","article-title":"Cacti 6.0: A tool to model large caches","author":"Muralimanohar","year":"2009","journal-title":"HP laboratories"},{"volume-title":"NVIDIA TESLA V100 GPU ARCHITECTURE","year":"2017","key":"ref14"},{"key":"ref15","article-title":"Lut-gemm: Quantized matrix multiplication based on luts for efficient inference in large-scale generative language models","author":"Park","year":"2022","journal-title":"arXiv preprint arXiv:2206.09557"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1109\/ISPASS.2019.00016"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA56546.2023.10071076"},{"key":"ref18","first-page":"1","article-title":"Fast implementation of dgemm on fermi gpu","volume-title":"Proceedings of 2011 International Conference for High Performance Computing, Networking, Storage and Analysis","author":"Tan"},{"key":"ref19","article-title":"Llama: Open and efficient foundation language models","author":"Touvron","year":"2023","journal-title":"arXiv preprint arXiv:2302.13971"},{"key":"ref20","article-title":"Bitnet: Scaling 1-bit transformers for large language models","author":"Wang","year":"2023","journal-title":"arXiv preprint arXiv:2310.11453"},{"key":"ref21","first-page":"38 087","article-title":"Smoothquant: Accurate and efficient post-training quantization for large language models","volume-title":"International Conference on Machine Learning","author":"Xiao"},{"key":"ref22","first-page":"521","article-title":"Orca: A distributed serving system for {Transformer-Based} generative models","volume-title":"16th USENIX Symposium on Operating Systems Design and Implementation (OSDI 22)","author":"Yu"},{"key":"ref23","article-title":"Opt: Open pre-trained transformer language models","author":"Zhang","year":"2022","journal-title":"arXiv preprint arXiv:2205.01068"},{"key":"ref24","first-page":"196","article-title":"Atom: Low-bit quantization for efficient and accurate llm serving","volume":"6","author":"Zhao","year":"2024","journal-title":"Proceedings of Machine Learning and Systems"}],"event":{"name":"2025 62nd ACM\/IEEE Design Automation Conference (DAC)","start":{"date-parts":[[2025,6,22]]},"location":"San Francisco, CA, USA","end":{"date-parts":[[2025,6,25]]}},"container-title":["2025 62nd ACM\/IEEE Design Automation Conference (DAC)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/11132383\/11132091\/11132101.pdf?arnumber=11132101","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,9,16]],"date-time":"2025-09-16T05:31:59Z","timestamp":1758000719000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11132101\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,6,22]]},"references-count":24,"URL":"https:\/\/doi.org\/10.1109\/dac63849.2025.11132101","relation":{},"subject":[],"published":{"date-parts":[[2025,6,22]]}}}