{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,3]],"date-time":"2026-07-03T05:22:36Z","timestamp":1783056156539,"version":"3.54.6"},"reference-count":70,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,8,1]],"date-time":"2026-08-01T00:00:00Z","timestamp":1785542400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,8,1]],"date-time":"2026-08-01T00:00:00Z","timestamp":1785542400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,5,14]],"date-time":"2026-05-14T00:00:00Z","timestamp":1778716800000},"content-version":"vor","delay-in-days":0,"URL":"http:\/\/creativecommons.org\/licenses\/by\/4.0\/"}],"funder":[{"DOI":"10.13039\/501100003246","name":"Dutch Research Council","doi-asserted-by":"publisher","award":["KICH1.ST02.21.003"],"award-info":[{"award-number":["KICH1.ST02.21.003"]}],"id":[{"id":"10.13039\/501100003246","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Journal of Systems Architecture"],"published-print":{"date-parts":[[2026,8]]},"DOI":"10.1016\/j.sysarc.2026.103841","type":"journal-article","created":{"date-parts":[[2026,5,15]],"date-time":"2026-05-15T02:43:08Z","timestamp":1778812988000},"page":"103841","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"C","title":["Recent developments in Transformer inference deployment on FPGA platforms: A survey"],"prefix":"10.1016","volume":"177","author":[{"ORCID":"https:\/\/orcid.org\/0009-0005-4628-7689","authenticated-orcid":false,"given":"Arjan","family":"Blankestijn","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-1094-0234","authenticated-orcid":false,"given":"Uraz","family":"Odyurt","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-2967-5090","authenticated-orcid":false,"given":"Amirreza","family":"Yousefzadeh","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.sysarc.2026.103841_b1","series-title":"Advances in Neural Information Processing Systems","article-title":"Attention is all you need","author":"Vaswani","year":"2017"},{"key":"10.1016\/j.sysarc.2026.103841_b2","doi-asserted-by":"crossref","DOI":"10.1016\/j.sysarc.2024.103247","article-title":"A survey of FPGA and ASIC designs for transformer inference acceleration and optimization","author":"Kang","year":"2024","journal-title":"J. Syst. Archit."},{"key":"10.1016\/j.sysarc.2026.103841_b3","doi-asserted-by":"crossref","DOI":"10.1016\/j.sysarc.2023.102990","article-title":"A survey of techniques for optimizing transformer inference","author":"Chitty-Venkata","year":"2023","journal-title":"J. Syst. Archit."},{"key":"10.1016\/j.sysarc.2026.103841_b4","series-title":"Vision transformers on the edge: A comprehensive survey of model compression and acceleration strategies","author":"Saha","year":"2025"},{"key":"10.1016\/j.sysarc.2026.103841_b5","series-title":"Hardware acceleration of LLMs: A comprehensive survey and comparison","author":"Koilia","year":"2024"},{"key":"10.1016\/j.sysarc.2026.103841_b6","series-title":"Layer normalization","author":"Ba","year":"2016"},{"key":"10.1016\/j.sysarc.2026.103841_b7","series-title":"An image is worth 16x16 words: Transformers for image recognition at scale","author":"Dosovitskiy","year":"2021"},{"key":"10.1016\/j.sysarc.2026.103841_b8","series-title":"Language models are unsupervised multitask learners","author":"Radford","year":"2019"},{"key":"10.1016\/j.sysarc.2026.103841_b9","series-title":"Proceedings of the 2006 ACM\/SIGDA 14th International Symposium on Field Programmable Gate Arrays","article-title":"Measuring the gap between FPGAs and ASICs","author":"Kuon","year":"2006"},{"key":"10.1016\/j.sysarc.2026.103841_b10","article-title":"Toolflows for mapping convolutional neural networks on FPGAs: A survey and future directions","author":"Venieris","year":"2018","journal-title":"ACM Comput. Surv."},{"key":"10.1016\/j.sysarc.2026.103841_b11","series-title":"UltraScale architecture and product data sheet: Overview (DS890)","year":"2025"},{"key":"10.1016\/j.sysarc.2026.103841_b12","series-title":"Stratix\u00ae 10 GX\/SX device overview","year":"2024"},{"key":"10.1016\/j.sysarc.2026.103841_b13","series-title":"Proceedings of the 2015 ACM\/SIGDA International Symposium on Field-Programmable Gate Arrays","article-title":"Optimizing FPGA-based accelerator design for deep convolutional neural networks","author":"Zhang","year":"2015"},{"key":"10.1016\/j.sysarc.2026.103841_b14","doi-asserted-by":"crossref","DOI":"10.1109\/JPROC.2025.3623023","article-title":"Field-programmable gate array architecture for deep learning: Survey and future directions","author":"Boutros","year":"2025","journal-title":"Proc. IEEE"},{"key":"10.1016\/j.sysarc.2026.103841_b15","series-title":"Proceedings of the 44th Annual International Symposium on Computer Architecture","article-title":"Maximizing CNN accelerator efficiency through resource partitioning","author":"Shen","year":"2017"},{"key":"10.1016\/j.sysarc.2026.103841_b16","series-title":"Proceedings of the 19th ACM\/SIGDA International Symposium on Field Programmable Gate Arrays","article-title":"Legup: high-level synthesis for FPGA-based processor\/accelerator systems","author":"Canis","year":"2011"},{"key":"10.1016\/j.sysarc.2026.103841_b17","doi-asserted-by":"crossref","DOI":"10.1109\/TCAD.2015.2513673","article-title":"A survey and evaluation of FPGA high-level synthesis tools","author":"Nane","year":"2016","journal-title":"IEEE Trans. Comput.-Aided Des. Integr. Circuits Syst."},{"key":"10.1016\/j.sysarc.2026.103841_b18","doi-asserted-by":"crossref","DOI":"10.3390\/app15020586","article-title":"A survey on hardware accelerators for large language models","author":"Kachris","year":"2025","journal-title":"Appl. Sci."},{"key":"10.1016\/j.sysarc.2026.103841_b19","series-title":"FPGA Transformer Inference Survey - Source Code v1.0.0","author":"Blankestijn","year":"2026"},{"key":"10.1016\/j.sysarc.2026.103841_b20","series-title":"A runtime-adaptive transformer neural network accelerator on FPGAs","author":"Kabir","year":"2024"},{"key":"10.1016\/j.sysarc.2026.103841_b21","series-title":"FAMOUS: Flexible accelerator for the attention mechanism of transformer on UltraScale+ FPGAs","author":"Kabir","year":"2024"},{"key":"10.1016\/j.sysarc.2026.103841_b22","series-title":"Design and implementation of an FPGA-based hardware accelerator for transformer","author":"Li","year":"2025"},{"key":"10.1016\/j.sysarc.2026.103841_b23","series-title":"HG-PIPE: Vision transformer acceleration with hybrid-grained pipeline","author":"Guo","year":"2024"},{"key":"10.1016\/j.sysarc.2026.103841_b24","series-title":"ME-vit: A single-load memory-efficient FPGA accelerator for vision transformers","author":"Marino","year":"2024"},{"key":"10.1016\/j.sysarc.2026.103841_b25","series-title":"SC24-W: Workshops of the International Conference for High Performance Computing, Networking, Storage and Analysis","article-title":"ProTEA: Programmable transformer encoder acceleration on FPGA","author":"Kabir","year":"2024"},{"key":"10.1016\/j.sysarc.2026.103841_b26","article-title":"HEAT: Efficient vision transformer accelerator with hybrid-precision quantization","author":"Zhao","year":"2025","journal-title":"IEEE Trans. Circuits Syst. II: Express Briefs"},{"key":"10.1016\/j.sysarc.2026.103841_b27","series-title":"2024 IEEE 17th International Conference on Solid-State & Integrated Circuit Technology","article-title":"Flexible yet efficient transformer acceleration with unified sparse attention support on FPGA","author":"Zhong","year":"2024"},{"key":"10.1016\/j.sysarc.2026.103841_b28","series-title":"2024 IEEE International Symposium on Circuits and Systems","article-title":"An FPGA-based reconfigurable accelerator for convolution-transformer hybrid EfficientViT","author":"Shao","year":"2024"},{"key":"10.1016\/j.sysarc.2026.103841_b29","series-title":"Proceedings of the 61st ACM\/IEEE Design Automation Conference","article-title":"FNM-trans: Efficient FPGA-based transformer architecture with full n:M sparsity","author":"Zhang","year":"2024"},{"key":"10.1016\/j.sysarc.2026.103841_b30","series-title":"An efficient FPGA-based accelerator for swin transformer","author":"Liu","year":"2023"},{"key":"10.1016\/j.sysarc.2026.103841_b31","series-title":"Proceedings of the 2024 ACM\/SIGDA International Symposium on Field Programmable Gate Arrays","article-title":"Flightllm: Efficient large language model inference with a complete mapping flow on FPGAs","author":"Zeng","year":"2024"},{"key":"10.1016\/j.sysarc.2026.103841_b32","series-title":"SWAT: Scalable and efficient window attention-based transformers acceleration on FPGAs","author":"Bai","year":"2024"},{"key":"10.1016\/j.sysarc.2026.103841_b33","series-title":"HLSTransform: Energy-efficient llama 2 inference on FPGAs via high level synthesis","author":"He","year":"2024"},{"key":"10.1016\/j.sysarc.2026.103841_b34","article-title":"A mixed-precision transformer accelerator with vector tiling systolic array for license plate recognition in unconstrained scenarios","author":"Li","year":"2024","journal-title":"IEEE Trans. Intell. Transp. Syst."},{"key":"10.1016\/j.sysarc.2026.103841_b35","series-title":"2025 IEEE International Symposium on Circuits and Systems","article-title":"UbiMoE: A ubiquitous mixture-of-experts vision transformer accelerator with hybrid computation pattern on FPGA","author":"Dong","year":"2025"},{"key":"10.1016\/j.sysarc.2026.103841_b36","series-title":"Proceedings of the 2025 ACM\/SIGDA International Symposium on Field Programmable Gate Arrays","article-title":"FlightVGM: Efficient video generation model inference with online sparsification and hybrid precision on FPGAs","author":"Liu","year":"2025"},{"key":"10.1016\/j.sysarc.2026.103841_b37","series-title":"2024 IEEE 17th International Conference on Solid-State & Integrated Circuit Technology","article-title":"SALTS: An efficient and flexible self-attention accelerator with long token support on FPGA","author":"Chen","year":"2024"},{"key":"10.1016\/j.sysarc.2026.103841_b38","series-title":"COBRA: Algorithm-architecture co-optimized binary transformer accelerator for edge inference","author":"Qiao","year":"2025"},{"key":"10.1016\/j.sysarc.2026.103841_b39","doi-asserted-by":"crossref","DOI":"10.1109\/TCAD.2024.3443692","article-title":"EQ-ViT: Algorithm-hardware co-design for end-to-end acceleration of real-time vision transformer inference on versal ACAP architecture","author":"Dong","year":"2024","journal-title":"IEEE Trans. Comput.-Aided Des. Integr. Circuits Syst."},{"key":"10.1016\/j.sysarc.2026.103841_b40","series-title":"2024 29th Asia and South Pacific Design Automation Conference","article-title":"TransFRU: Efficient deployment of transformers on FPGA with full resource utilization","author":"Wang","year":"2024"},{"key":"10.1016\/j.sysarc.2026.103841_b41","series-title":"Proceedings of the Great Lakes Symposium on VLSI 2024","article-title":"Enhancing long sequence input processing in FPGA-based transformer accelerators through attention fusion","author":"Qin","year":"2024"},{"key":"10.1016\/j.sysarc.2026.103841_b42","doi-asserted-by":"crossref","DOI":"10.1109\/JETCAS.2025.3555970","article-title":"F3: An FPGA-based transformer fine-tuning accelerator with flexible floating point format","author":"He","year":"2025","journal-title":"IEEE J. Emerg. Sel. Top. Circuits Syst."},{"key":"10.1016\/j.sysarc.2026.103841_b43","series-title":"2024 IEEE International Symposium on Circuits and Systems","article-title":"Energy efficient FPGA-based binary transformer accelerator for edge devices","author":"Du","year":"2024"},{"key":"10.1016\/j.sysarc.2026.103841_b44","series-title":"Proceedings of the 29th ACM\/IEEE International Symposium on Low Power Electronics and Design","article-title":"Hardware-friendly hessian-driven row-wise quantization and FPGA acceleration for transformer-based models","author":"Byun","year":"2024"},{"key":"10.1016\/j.sysarc.2026.103841_b45","series-title":"2024 IEEE International Symposium on Circuits and Systems","article-title":"BETA: Binarized energy-efficient transformer accelerator at the edge","author":"Ji","year":"2024"},{"key":"10.1016\/j.sysarc.2026.103841_b46","doi-asserted-by":"crossref","DOI":"10.1109\/TCSVT.2024.3439600","article-title":"A 109-GOPs\/W FPGA-based vision transformer accelerator with weight-loop dataflow featuring data reusing and resource saving","author":"Zhang","year":"2024","journal-title":"IEEE Trans. Circuits Syst. Video Technol."},{"key":"10.1016\/j.sysarc.2026.103841_b47","doi-asserted-by":"crossref","DOI":"10.1016\/j.jpdc.2025.105042","article-title":"DRViT: A dynamic redundancy-aware vision transformer accelerator via algorithm and architecture co-design on FPGA","author":"Sun","year":"2025","journal-title":"J. Parallel Distrib. Comput."},{"key":"10.1016\/j.sysarc.2026.103841_b48","series-title":"2024 13th International Conference on Communications, Circuits and Systems","article-title":"Efficient FPGA-based transformer accelerator using in-block balanced pruning","author":"Wang","year":"2024"},{"key":"10.1016\/j.sysarc.2026.103841_b49","series-title":"2024 13th International Conference on Communications, Circuits and Systems","article-title":"Energy efficient FPGA-based accelerator for dynamic sparse transformer","author":"Li","year":"2024"},{"key":"10.1016\/j.sysarc.2026.103841_b50","doi-asserted-by":"crossref","DOI":"10.1109\/TPDS.2024.3466891","article-title":"Visionagile: A versatile domain-specific accelerator for computer vision tasks","author":"Zhang","year":"2024","journal-title":"IEEE Trans. Parallel Distrib. Syst."},{"key":"10.1016\/j.sysarc.2026.103841_b51","series-title":"2024 IEEE Annual Congress on Artificial Intelligence of Things","article-title":"Integer-only quantized transformers for embedded FPGA-based time-series forecasting in aIoT","author":"Ling","year":"2024"},{"key":"10.1016\/j.sysarc.2026.103841_b52","series-title":"Low latency transformer inference on FPGAs for physics applications with hls4ml","author":"Jiang","year":"2024"},{"key":"10.1016\/j.sysarc.2026.103841_b53","series-title":"CHOSEN: Compilation to hardware optimization stack for efficient vision transformer inference","author":"Sadeghi","year":"2024"},{"key":"10.1016\/j.sysarc.2026.103841_b54","series-title":"On-device qwen2.5: Efficient LLM inference with model compression and hardware acceleration","author":"Xiang","year":"2025"},{"key":"10.1016\/j.sysarc.2026.103841_b55","series-title":"2024 29th Asia and South Pacific Design Automation Conference","article-title":"SWAT: An efficient swin transformer accelerator based on FPGA","author":"Dong","year":"2024"},{"key":"10.1016\/j.sysarc.2026.103841_b56","article-title":"IANUS: Integrated accelerator based on NPU-PIM unified memory system","volume":"vol. 3","author":"Seo","year":"2024"},{"key":"10.1016\/j.sysarc.2026.103841_b57","series-title":"2024 Twelfth International Symposium on Computing and Networking","article-title":"An FPGA-oriented quantization approach for vision transformer with LUT-friendly operations","author":"Xu","year":"2024"},{"key":"10.1016\/j.sysarc.2026.103841_b58","series-title":"Proceedings of the 61st ACM\/IEEE Design Automation Conference","article-title":"PIVOT: Input-aware path selection for energy-efficient ViT inference","author":"Moitra","year":"2024"},{"key":"10.1016\/j.sysarc.2026.103841_b59","doi-asserted-by":"crossref","DOI":"10.1088\/1748-0221\/13\/07\/P07027","article-title":"Fast inference of deep neural networks in FPGAs for particle physics","author":"Duarte","year":"2018","journal-title":"J. Instrum."},{"key":"10.1016\/j.sysarc.2026.103841_b60","series-title":"hls4ml","author":"FastML Team","year":"2025"},{"key":"10.1016\/j.sysarc.2026.103841_b61","doi-asserted-by":"crossref","DOI":"10.1145\/3613963","article-title":"FPGA-based deep learning inference accelerators: Where are we standing?","author":"Nechi","year":"2023","journal-title":"ACM Trans. Reconfigurable Technol. Syst."},{"key":"10.1016\/j.sysarc.2026.103841_b62","series-title":"2023 33rd International Conference on Field-Programmable Logic and Applications","article-title":"HPTA: A high performance transformer accelerator based on FPGA","author":"Han","year":"2023"},{"key":"10.1016\/j.sysarc.2026.103841_b63","series-title":"2019 IEEE\/CVF International Conference on Computer Vision","article-title":"HAWQ: Hessian aware quantization of neural networks with mixed-precision","author":"Dong","year":"2019"},{"key":"10.1016\/j.sysarc.2026.103841_b64","series-title":"A quantitative evaluation of approximate softmax functions for deep neural networks","author":"Leiva-Valverde","year":"2025"},{"key":"10.1016\/j.sysarc.2026.103841_b65","series-title":"Efficient softmax approximation for deep neural networks with attention mechanism","author":"Vasyltsov","year":"2021"},{"key":"10.1016\/j.sysarc.2026.103841_b66","article-title":"Hardware accelerator for approximation-based softmax and layer normalization in transformers","author":"Kim","year":"2025","journal-title":"Electronics"},{"key":"10.1016\/j.sysarc.2026.103841_b67","series-title":"2020 IEEE 5th International Conference on Signal and Image Processing","article-title":"Efficient FPGA implementation of softmax layer in deep neural network","author":"Zhang","year":"2020"},{"key":"10.1016\/j.sysarc.2026.103841_b68","series-title":"Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, Volume 1 (Long and Short Papers)","article-title":"BERT: Pre-training of deep bidirectional transformers for language understanding","author":"Devlin","year":"2019"},{"key":"10.1016\/j.sysarc.2026.103841_b69","series-title":"2021 IEEE\/CVF International Conference on Computer Vision","article-title":"Swin transformer: Hierarchical vision transformer using shifted windows","author":"Liu","year":"2021"},{"key":"10.1016\/j.sysarc.2026.103841_b70","series-title":"Proceedings of the 38th International Conference on Machine Learning","article-title":"Training data-efficient image transformers & distillation through attention","author":"Touvron","year":"2021"}],"container-title":["Journal of Systems Architecture"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S1383762126001591?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S1383762126001591?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,7,3]],"date-time":"2026-07-03T05:09:18Z","timestamp":1783055358000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S1383762126001591"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,8]]},"references-count":70,"alternative-id":["S1383762126001591"],"URL":"https:\/\/doi.org\/10.1016\/j.sysarc.2026.103841","relation":{},"ISSN":["1383-7621"],"issn-type":[{"value":"1383-7621","type":"print"}],"subject":[],"published":{"date-parts":[[2026,8]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"Recent developments in Transformer inference deployment on FPGA platforms: A survey","name":"articletitle","label":"Article Title"},{"value":"Journal of Systems Architecture","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.sysarc.2026.103841","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 The Authors. Published by Elsevier B.V.","name":"copyright","label":"Copyright"}],"article-number":"103841"}}