{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,4]],"date-time":"2026-07-04T16:16:25Z","timestamp":1783181785319,"version":"3.54.6"},"reference-count":36,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,8,1]],"date-time":"2026-08-01T00:00:00Z","timestamp":1785542400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,8,1]],"date-time":"2026-08-01T00:00:00Z","timestamp":1785542400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,8,1]],"date-time":"2026-08-01T00:00:00Z","timestamp":1785542400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,8,1]],"date-time":"2026-08-01T00:00:00Z","timestamp":1785542400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,8,1]],"date-time":"2026-08-01T00:00:00Z","timestamp":1785542400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,8,1]],"date-time":"2026-08-01T00:00:00Z","timestamp":1785542400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,8,1]],"date-time":"2026-08-01T00:00:00Z","timestamp":1785542400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/501100003453","name":"Guangdong Provincial Natural Science Foundation","doi-asserted-by":"publisher","award":["2024A1515010204"],"award-info":[{"award-number":["2024A1515010204"]}],"id":[{"id":"10.13039\/501100003453","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Journal of Systems Architecture"],"published-print":{"date-parts":[[2026,8]]},"DOI":"10.1016\/j.sysarc.2026.103839","type":"journal-article","created":{"date-parts":[[2026,5,15]],"date-time":"2026-05-15T04:19:04Z","timestamp":1778818744000},"page":"103839","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"C","title":["AscQLUT: A decode-fused INT4 GEMM Kernel for Ascend NPUs"],"prefix":"10.1016","volume":"177","author":[{"given":"Yun","family":"Chen","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-6372-7088","authenticated-orcid":false,"given":"Lu","family":"Lu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.sysarc.2026.103839_b1","first-page":"5998","article-title":"Attention is all you need","volume":"vol. 30","author":"Vaswani","year":"2017"},{"key":"10.1016\/j.sysarc.2026.103839_b2","series-title":"Scaling laws for neural language models","author":"Kaplan","year":"2020"},{"key":"10.1016\/j.sysarc.2026.103839_b3","first-page":"30016","article-title":"Training compute-optimal large language models","volume":"vol. 35","author":"Hoffmann","year":"2022"},{"key":"10.1016\/j.sysarc.2026.103839_b4","unstructured":"E. Frantar, S. Ashkboos, T. Hoefler, D. Alistarh, GPTQ: Accurate post-training quantization for generative pre-trained transformers, in: Proc. ICLR, 2023."},{"key":"10.1016\/j.sysarc.2026.103839_b5","first-page":"87","article-title":"AWQ: Activation-aware weight quantization for on-device LLM compression and acceleration","volume":"vol. 6","author":"Lin","year":"2024"},{"key":"10.1016\/j.sysarc.2026.103839_b6","series-title":"rocBLAS: ROCm basic linear algebra subprograms","author":"AMD","year":"2024"},{"key":"10.1016\/j.sysarc.2026.103839_b7","series-title":"cuBLAS: GPU-accelerated library for linear algebra","author":"NVIDIA","year":"2024"},{"key":"10.1016\/j.sysarc.2026.103839_b8","series-title":"Optimizing deep learning performance","author":"NVIDIA","year":"2023"},{"key":"10.1016\/j.sysarc.2026.103839_b9","series-title":"Catlass: CANN templates for linear algebra subroutines","author":"Ascend","year":"2025"},{"key":"10.1016\/j.sysarc.2026.103839_b10","series-title":"Huawei ascend 910b technical white paper","author":"Huawei","year":"2023"},{"key":"10.1016\/j.sysarc.2026.103839_b11","first-page":"1877","article-title":"Language models are few-shot learners","volume":"vol. 33","author":"Brown","year":"2020"},{"issue":"240","key":"10.1016\/j.sysarc.2026.103839_b12","first-page":"1","article-title":"PaLM: Scaling language modeling with pathways","volume":"24","author":"Chowdhery","year":"2023","journal-title":"J. Mach. Learn. Res."},{"key":"10.1016\/j.sysarc.2026.103839_b13","series-title":"Low-bit quantization favors undertrained LLMs: Scaling laws for quantized LLMs with 100T training tokens","author":"Ouyang","year":"2024"},{"key":"10.1016\/j.sysarc.2026.103839_b14","doi-asserted-by":"crossref","DOI":"10.1016\/j.neunet.2025.107856","article-title":"A survey of low-bit large language models: Basics, systems, and algorithms","volume":"192","author":"Gong","year":"2025","journal-title":"Neural Netw."},{"key":"10.1016\/j.sysarc.2026.103839_b15","first-page":"38087","article-title":"SmoothQuant: Accurate and efficient post-training quantization for large language models","volume":"vol. 202","author":"Xiao","year":"2023"},{"key":"10.1016\/j.sysarc.2026.103839_b16","first-page":"27168","article-title":"ZeroQuant: Efficient and affordable post-training quantization for large-scale transformers","volume":"vol. 35","author":"Yao","year":"2022"},{"key":"10.1016\/j.sysarc.2026.103839_b17","first-page":"66357","article-title":"OneBit: Towards extremely low-bit large language models","volume":"vol. 37","author":"Xu","year":"2024"},{"key":"10.1016\/j.sysarc.2026.103839_b18","doi-asserted-by":"crossref","unstructured":"W. Hu, H. Zhang, C. Guo, Y. Feng, R. Guan, Z. Hua, Z. Liu, Y. Guan, M. Guo, J. Leng, M-ANT: Efficient low-bit group quantization for LLMs via mathematically adaptive numerical type, in: Proc. HPCA, 2025, pp. 1112\u20131126.","DOI":"10.1109\/HPCA61900.2025.00086"},{"key":"10.1016\/j.sysarc.2026.103839_b19","doi-asserted-by":"crossref","unstructured":"Y. Liu, J. Wen, Y. Wang, S. Ye, L.L. Zhang, T. Cao, C. Li, M. Yang, VPTQ: Extreme low-bit vector post-training quantization for large language models, in: Proc. EMNLP, 2024, pp. 8181\u20138196.","DOI":"10.18653\/v1\/2024.emnlp-main.467"},{"key":"10.1016\/j.sysarc.2026.103839_b20","doi-asserted-by":"crossref","unstructured":"Y. Jeon, B. Park, S.J. Kwon, B. Kim, J. Yun, D. Lee, BiQGEMM: Matrix multiplication with lookup table for binary-coding-based quantized DNNs, in: Proc. SC, 2020, pp. 1\u201314.","DOI":"10.1109\/SC41405.2020.00099"},{"key":"10.1016\/j.sysarc.2026.103839_b21","unstructured":"G. Park, B. Park, M. Kim, S. Lee, J. Kim, B. Kwon, S.J. Kwon, B. Kim, Y. Lee, D. Lee, LUT-GEMM: Quantized matrix multiplication based on LUTs for efficient inference in large-scale generative language models, in: Proc. ICLR, 2024."},{"key":"10.1016\/j.sysarc.2026.103839_b22","doi-asserted-by":"crossref","unstructured":"Z. Mo, et al., LUT Tensor Core: A Software-Hardware Co-Design for LUT-Based Low-Bit LLM Inference, in: Proc. ISCA, 2025.","DOI":"10.1145\/3695053.3731057"},{"issue":"6","key":"10.1016\/j.sysarc.2026.103839_b23","doi-asserted-by":"crossref","first-page":"1916","DOI":"10.1109\/TCAD.2021.3095825","article-title":"Multiplication through a single look-up-table (LUT) in CNN inference computation","volume":"41","author":"Xu","year":"2022","journal-title":"IEEE Trans. Comput. -Aided Des. Integr. Circuits Syst."},{"key":"10.1016\/j.sysarc.2026.103839_b24","doi-asserted-by":"crossref","unstructured":"H. Guo, W. Brandon, R. Cholakov, J. Ragan-Kelley, E.P. Xing, Y. Kim, Fast matrix multiplications for lookup table-quantized LLMs, in: Findings of the Association for Computational Linguistics: EMNLP, 2024, pp. 12419\u201312433.","DOI":"10.18653\/v1\/2024.findings-emnlp.724"},{"key":"10.1016\/j.sysarc.2026.103839_b25","doi-asserted-by":"crossref","unstructured":"M. Rastegari, V. Ordonez, J. Redmon, A. Farhadi, XNOR-Net: ImageNet classification using binary convolutional neural networks, in: Proc. ECCV, 2016, pp. 525\u2013542.","DOI":"10.1007\/978-3-319-46493-0_32"},{"key":"10.1016\/j.sysarc.2026.103839_b26","doi-asserted-by":"crossref","unstructured":"B. Jacob, S. Kligys, B. Chen, M. Zhu, M. Tang, A. Howard, H. Adam, D. Kalenichenko, Quantization and training of neural networks for efficient integer-arithmetic-only inference, in: Proc. CVPR, 2018, pp. 2704\u20132713.","DOI":"10.1109\/CVPR.2018.00286"},{"key":"10.1016\/j.sysarc.2026.103839_b27","first-page":"4466","article-title":"Accurate post training quantization with small calibration sets","volume":"vol. 139","author":"Hubara","year":"2021"},{"key":"10.1016\/j.sysarc.2026.103839_b28","unstructured":"S. Wu, G. Li, F. Chen, L. Shi, Training and inference with integers in deep neural networks, in: Proc. ICLR, 2018."},{"key":"10.1016\/j.sysarc.2026.103839_b29","first-page":"10088","article-title":"QLoRA: Efficient finetuning of quantized LLMs","volume":"vol. 36","author":"Dettmers","year":"2023"},{"key":"10.1016\/j.sysarc.2026.103839_b30","first-page":"606","article-title":"Efficiently scaling transformer inference","volume":"vol. 5","author":"Pope","year":"2023"},{"key":"10.1016\/j.sysarc.2026.103839_b31","unstructured":"T. Pegolotti, E. Frantar, D. Alistarh, M. P\u00fcschel, QIGen: Generating efficient kernels for quantized inference on large language models, in: Proc. ASPLOS, 2024, pp. 100\u2013115."},{"key":"10.1016\/j.sysarc.2026.103839_b32","series-title":"Exllama: A fast inference library","author":"Turboderp","year":"2023"},{"key":"10.1016\/j.sysarc.2026.103839_b33","series-title":"AMD quark: model optimization library for ai quantization","author":"AMD","year":"2025"},{"key":"10.1016\/j.sysarc.2026.103839_b34","series-title":"SGEMM-cube: Emulating FP32 GEMM on ascend NPUs using FP16 cube units with precision recovery,","author":"Xue","year":"2025"},{"key":"10.1016\/j.sysarc.2026.103839_b35","doi-asserted-by":"crossref","unstructured":"W. Xue, K. Yang, Y. Liu, D. Fan, P. Xu, Y. Tian, Unlocking high performance with low-bit NPUs and CPUs for highly optimized HPL-MxP on Cloud Brain II, in: Proc. SC, 2024, pp. 1\u201316.","DOI":"10.1109\/SC41406.2024.00088"},{"key":"10.1016\/j.sysarc.2026.103839_b36","first-page":"445","article-title":"Fast on-device LLM inference with NPUs","volume":"vol. 1","author":"Xu","year":"2025"}],"container-title":["Journal of Systems Architecture"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S1383762126001578?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S1383762126001578?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,7,4]],"date-time":"2026-07-04T15:24:26Z","timestamp":1783178666000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S1383762126001578"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,8]]},"references-count":36,"alternative-id":["S1383762126001578"],"URL":"https:\/\/doi.org\/10.1016\/j.sysarc.2026.103839","relation":{},"ISSN":["1383-7621"],"issn-type":[{"value":"1383-7621","type":"print"}],"subject":[],"published":{"date-parts":[[2026,8]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"AscQLUT: A decode-fused INT4 GEMM Kernel for Ascend NPUs","name":"articletitle","label":"Article Title"},{"value":"Journal of Systems Architecture","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.sysarc.2026.103839","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Elsevier B.V. All rights are reserved, including those for text and data mining, AI training, and similar technologies.","name":"copyright","label":"Copyright"}],"article-number":"103839"}}