{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,3]],"date-time":"2026-06-03T19:47:05Z","timestamp":1780516025087,"version":"3.54.1"},"reference-count":47,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","license":[{"start":{"date-parts":[[2025,1,1]],"date-time":"2025-01-01T00:00:00Z","timestamp":1735689600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/legalcode"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Access"],"published-print":{"date-parts":[[2025]]},"DOI":"10.1109\/access.2025.3563196","type":"journal-article","created":{"date-parts":[[2025,4,24]],"date-time":"2025-04-24T18:49:28Z","timestamp":1745520568000},"page":"70282-70297","source":"Crossref","is-referenced-by-count":5,"title":["FPGA Acceleration With Hessian-Based Comprehensive Intra-Layer Mixed-Precision Quantization for Transformer Models"],"prefix":"10.1109","volume":"13","author":[{"ORCID":"https:\/\/orcid.org\/0009-0003-5087-4582","authenticated-orcid":false,"given":"Woohong","family":"Byun","sequence":"first","affiliation":[{"name":"School of Electrical and Computer Engineering, Georgia Institute of Technology, Atlanta, GA, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jongseok","family":"Woo","sequence":"additional","affiliation":[{"name":"Mobile Display Design Team, Samsung Display Company Ltd., Yongin, South Korea"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-8894-3390","authenticated-orcid":false,"given":"Saibal","family":"Mukhopadhyay","sequence":"additional","affiliation":[{"name":"School of Electrical and Computer Engineering, Georgia Institute of Technology, Atlanta, GA, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.23919\/DATE51398.2021.9474043"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1145\/3370748.3406567"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/FPL60245.2023.00012"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1145\/3431920.3439477"},{"key":"ref5","article-title":"BERT: Pre-training of deep bidirectional transformers for language understanding","author":"Devlin","year":"2018","journal-title":"arXiv:1810.04805"},{"key":"ref6","article-title":"ALBERT: A lite BERT for self-supervised learning of language representations","author":"Lan","year":"2019","journal-title":"arXiv:1909.11942"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.48550\/ARXIV.1907.11692"},{"key":"ref8","article-title":"BART: Denoising sequence-to-sequence pre-training for natural language generation, translation, and comprehension","author":"Lewis","year":"2019","journal-title":"arXiv:1910.13461"},{"issue":"140","key":"ref9","first-page":"1","article-title":"Exploring the limits of transfer learning with a unified text-to-text transformer","volume":"21","author":"Raffel","year":"2019","journal-title":"J. Mach. Learn. Res."},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/EMC2-NIPS53020.2019.00016"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v34i05.6409"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2020.emnlp-main.37"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/MICRO50266.2020.00071"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.23919\/DATE54114.2022.9774692"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/MWSCAS57524.2023.10406106"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1109\/MWSCAS60917.2024.10658840"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1145\/3649329.3657325"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/TCAD.2021.3078408"},{"key":"ref19","first-page":"38087","article-title":"SmoothQuant: Accurate and efficient post-training quantization for large language models","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Xiao"},{"key":"ref20","first-page":"87","article-title":"AWQ: Activation-aware weight quantization for on-device LLM compression and acceleration","volume":"6","author":"Lin","year":"2024","journal-title":"Proc. Mach. Learn. Syst."},{"key":"ref21","article-title":"GPTQ: Accurate post-training quantization for generative pre-trained transformers","author":"Frantar","year":"2022","journal-title":"arXiv:2210.17323"},{"key":"ref22","article-title":"QServe: W4A8KV4 quantization and system co-design for efficient LLM serving","author":"Lin","year":"2024","journal-title":"arXiv:2405.04532"},{"key":"ref23","first-page":"100213","article-title":"QuaRot: Outlier-free 4-bit inference in rotated LLMs","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Ashkboos"},{"key":"ref24","article-title":"SpinQuant: LLM quantization with learned rotations","author":"Liu","year":"2024","journal-title":"arXiv:2405.16406"},{"key":"ref25","first-page":"196","article-title":"Atom: Low-bit quantization for efficient and accurate LLM serving","volume":"6","author":"Zhao","year":"2023","journal-title":"Proc. Mach. Learn. Syst."},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1145\/3529399.3529409"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/WACV51458.2022.00099"},{"key":"ref28","article-title":"Integer quantization for deep learning inference: Principles and empirical evaluation","author":"Wu","year":"2020","journal-title":"arXiv:2004.09602"},{"key":"ref29","first-page":"58","article-title":"Accelerated stochastic power iteration","volume-title":"Proc. Int. Conf. Artif. Intell. Statist. (AISTATS)","author":"Xu"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1145\/3656177"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1109\/MICRO56248.2022.00051"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/FPL64840.2024.00054"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1109\/IJCNN54540.2023.10191521"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1109\/ISCA.2018.00069"},{"key":"ref35","first-page":"1","article-title":"Bitblade: Area and energy-efficient precision-scalable neural network accelerator with bitwise summation","volume-title":"Proc. 56th Annu. Design Autom. Conf.","author":"Ryu"},{"key":"ref36","first-page":"11875","article-title":"HAWQ-v3: Dyadic neural network quantization","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Yao"},{"issue":"8","key":"ref37","first-page":"9","article-title":"Language models are unsupervised multitask learners","volume":"1","author":"Radford","year":"2019","journal-title":"OpenAI blog"},{"key":"ref38","article-title":"Llama 2: Open foundation and fine-tuned chat models","author":"Touvron","year":"2023","journal-title":"arXiv:2307.09288"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/W18-5446"},{"key":"ref40","first-page":"5506","article-title":"I-BERT: Integer-only BERT quantization","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Kim"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2022.acl-long.331"},{"key":"ref42","first-page":"27168","article-title":"ZeroQuant: Efficient and affordable post-training quantization for large-scale transformers","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"35","author":"Yao"},{"key":"ref43","first-page":"30318","article-title":"GPT3.int8(): 8-bit matrix multiplication for transformers at scale","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"35","author":"Dettmers"},{"key":"ref44","first-page":"17402","article-title":"Outlier suppression: Pushing the limit of low-bit transformer language models","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"35","author":"Wei"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA51647.2021.00017"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1145\/3490422.3502364"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.1145\/3665314.3670806"}],"container-title":["IEEE Access"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/6287639\/10820123\/10973048.pdf?arnumber=10973048","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,4,29]],"date-time":"2025-04-29T04:36:25Z","timestamp":1745901385000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/10973048\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025]]},"references-count":47,"URL":"https:\/\/doi.org\/10.1109\/access.2025.3563196","relation":{},"ISSN":["2169-3536"],"issn-type":[{"value":"2169-3536","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025]]}}}