{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,19]],"date-time":"2026-06-19T16:17:36Z","timestamp":1781885856945,"version":"3.54.5"},"reference-count":49,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"4","license":[{"start":{"date-parts":[[2025,4,1]],"date-time":"2025-04-01T00:00:00Z","timestamp":1743465600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2025,4,1]],"date-time":"2025-04-01T00:00:00Z","timestamp":1743465600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2025,4,1]],"date-time":"2025-04-01T00:00:00Z","timestamp":1743465600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/501100018537","name":"National Science and Technology Major Project","doi-asserted-by":"publisher","award":["2021ZD0114402"],"award-info":[{"award-number":["2021ZD0114402"]}],"id":[{"id":"10.13039\/501100018537","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["92267203"],"award-info":[{"award-number":["92267203"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Comput.-Aided Des. Integr. Circuits Syst."],"published-print":{"date-parts":[[2025,4]]},"DOI":"10.1109\/tcad.2024.3488572","type":"journal-article","created":{"date-parts":[[2024,10,30]],"date-time":"2024-10-30T17:52:00Z","timestamp":1730310720000},"page":"1475-1488","source":"Crossref","is-referenced-by-count":4,"title":["Improving Transformer Inference Through Optimized Nonlinear Operations With Quantization-Approximation-Based Strategy"],"prefix":"10.1109","volume":"44","author":[{"ORCID":"https:\/\/orcid.org\/0009-0007-1999-6441","authenticated-orcid":false,"given":"Wenxun","family":"Wang","sequence":"first","affiliation":[{"name":"Department of Electronic Engineering, Tsinghua University, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-4793-0972","authenticated-orcid":false,"given":"Wenyu","family":"Sun","sequence":"additional","affiliation":[{"name":"Department of Electronic Engineering, Tsinghua University, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-4892-2309","authenticated-orcid":false,"given":"Yongpan","family":"Liu","sequence":"additional","affiliation":[{"name":"Department of Electronic Engineering, Tsinghua University, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.48550\/ARXIV.1706.03762"},{"key":"ref2","article-title":"BERT: Pre-training of deep bidirectional transformers for language understanding","author":"Devlin","year":"2019","journal-title":"arXiv:1810.04805"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/P16-1122"},{"key":"ref4","first-page":"1","article-title":"End-to-end memory networks","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Sukhbaatar"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00681"},{"key":"ref6","volume-title":"Improving language understanding by generative pre-training","author":"Radford","year":"2018"},{"key":"ref7","article-title":"An image is worth 16 \u00d7 16 words: Transformers for image recognition at scale","author":"Dosovitskiy","year":"2021","journal-title":"arXiv:2010.11929"},{"key":"ref8","article-title":"Deformable DETR: Deformable transformers for end-to-end object detection","author":"Zhu","year":"2021","journal-title":"arXiv:2010.04159"},{"key":"ref9","first-page":"8821","article-title":"Zero-shot text-to-image generation","volume-title":"Proc. 38th Int. Conf. Mach. Learn.","author":"Ramesh"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.48550\/ARXIV.1907.11692"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00986"},{"key":"ref12","article-title":"Scaling vision transformers to 22 billion parameters","author":"Dehghani","year":"2023","journal-title":"arXiv:2302.05442"},{"key":"ref13","article-title":"Very deep convolutional networks for large-scale image recognition","author":"Simonyan","year":"2015","journal-title":"arXiv:1409.1556"},{"key":"ref14","first-page":"1877","article-title":"Language models are few-shot learners","volume-title":"Proc. 34th Adv. Neural Inf. Process. Syst.","author":"Brown"},{"key":"ref15","article-title":"PaLM-E: An embodied multimodal language model","author":"Driess","year":"2023","journal-title":"arXiv:2303.03378"},{"key":"ref16","first-page":"28092","article-title":"Post-training quantization for vision transformer","volume-title":"Proc. 35th Adv. Neural Inf. Process. Syst.","author":"Liu"},{"key":"ref17","article-title":"DoreFa-Net: Training low bitwidth convolutional neural networks with low bitwidth gradients","author":"Zhou","year":"2018","journal-title":"arXiv:1606.06160"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v34i05.6409"},{"key":"ref19","article-title":"Deep compression: Compressing deep neural networks with pruning, trained quantization and Huffman coding","author":"Han","year":"2016","journal-title":"arXiv:1510.00149"},{"key":"ref20","article-title":"Learning N:M fine-grained structured sparse neural networks from scratch","author":"Zhou","year":"2021","journal-title":"arXiv:2102.04010"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1145\/3466752.3480125"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA51647.2021.00018"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA47549.2020.00035"},{"key":"ref24","article-title":"Full stack optimization of transformer inference: A survey","author":"Kim","year":"2023","journal-title":"arXiv:2302.14017"},{"key":"ref25","first-page":"5506","article-title":"I-BERT: Integer-only BERT quantization","volume-title":"Proc. 38th Int. Conf. Mach. Learn.","author":"Kim"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1145\/3489517.3530505"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/DAC18074.2021.9586134"},{"key":"ref28","article-title":"OPT: Open pre-trained transformer language models","author":"Zhang","year":"2022","journal-title":"arXiv:2205.01068"},{"key":"ref29","first-page":"1","article-title":"Post training 4-bit quantization of convolutional networks for rapid-deployment","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Banner"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1109\/ICCVW.2019.00363"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1145\/3291280.3291800"},{"key":"ref32","first-page":"1173","article-title":"Fq-vit: Post-training quantization for fully quantized vision transformer","volume-title":"Proc. 31st Int. Joint Conf. Artif. Intell. (IJCAI)","author":"Lin"},{"key":"ref33","volume-title":"XLA: Compiling machine learning for peak performance","author":"Sabne","year":"2020"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1109\/TPDS.2020.3030548"},{"key":"ref35","first-page":"16344","article-title":"Flashattention: Fast and memory-efficient exact attention with IO-awareness","volume-title":"Proc. 36th Adv. Neural Inf. Process. Syst.","author":"Dao"},{"key":"ref36","volume-title":"Flash-decoding for long-context inference","author":"Dao","year":"2023"},{"key":"ref37","first-page":"148","article-title":"FlashDecoding++: Faster large language model inference with asynchronization, flat GEMM optimization, and heuristics","volume-title":"Proc. Mach. Learn. Syst.","author":"Hong"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1109\/DAC56929.2023.10247855"},{"key":"ref39","article-title":"Online normalizer calculation for Softmax","author":"Milakov","year":"2018","journal-title":"arXiv:1805.02867"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1109\/TEC.1962.5219391"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1109\/SOCC49529.2020.9524802"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2009.5206848"},{"key":"ref43","article-title":"GLUE: A multi-task benchmark and analysis platform for natural language understanding","author":"Wang","year":"2019","journal-title":"arXiv:1804.07461"},{"key":"ref44","article-title":"Squad: 100,000+ questions for machine comprehension of text","author":"Rajpurkar","year":"2016","journal-title":"arXiv:1606.05250"},{"key":"ref45","article-title":"Pointer sentinel mixture models","author":"Merity","year":"2016","journal-title":"arXiv:1609.07843"},{"key":"ref46","article-title":"Training data-efficient image transformers & distillation through attention","author":"Touvron","year":"2021","journal-title":"arXiv:2012.12877"},{"key":"ref47","article-title":"Integer quantization for deep learning inference: Principles and empirical evaluation","author":"Wu","year":"2020","journal-title":"arXiv:2004.09602"},{"key":"ref48","first-page":"38087","article-title":"SmoothQuant: Accurate and efficient post-training quantization for large language models","volume-title":"Proc. 40th Int. Conf. Mach. Learn.","author":"Xiao"},{"key":"ref49","article-title":"GPT-NeoX-20B: An open-source autoregressive language model","author":"Black","year":"2022","journal-title":"arXiv:2204.06745"}],"container-title":["IEEE Transactions on Computer-Aided Design of Integrated Circuits and Systems"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/43\/10934961\/10738457.pdf?arnumber=10738457","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,3,24]],"date-time":"2025-03-24T18:24:23Z","timestamp":1742840663000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/10738457\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,4]]},"references-count":49,"journal-issue":{"issue":"4"},"URL":"https:\/\/doi.org\/10.1109\/tcad.2024.3488572","relation":{},"ISSN":["0278-0070","1937-4151"],"issn-type":[{"value":"0278-0070","type":"print"},{"value":"1937-4151","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,4]]}}}