{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,29]],"date-time":"2026-05-29T02:03:37Z","timestamp":1780020217643,"version":"3.53.1"},"reference-count":51,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,3,19]],"date-time":"2026-03-19T00:00:00Z","timestamp":1773878400000},"content-version":"vor","delay-in-days":0,"URL":"http:\/\/creativecommons.org\/licenses\/by\/4.0\/"}],"funder":[{"DOI":"10.13039\/100020230","name":"Junta de Andaluc\u00eda Consejer\u00eda de Transformaci\u00f3n Econ\u00f3mica Industria Conocimiento y Universidades","doi-asserted-by":"publisher","award":["DGP PRED 2024 00654"],"award-info":[{"award-number":["DGP PRED 2024 00654"]}],"id":[{"id":"10.13039\/100020230","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100008530","name":"European Regional Development Fund","doi-asserted-by":"publisher","award":["Andaluc\\u00EDa 2021-2027"],"award-info":[{"award-number":["Andaluc\\u00EDa 2021-2027"]}],"id":[{"id":"10.13039\/501100008530","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100008723","name":"Universidad de C\u00e1diz","doi-asserted-by":"publisher","award":["+i 2024\/03"],"award-info":[{"award-number":["+i 2024\/03"]}],"id":[{"id":"10.13039\/501100008723","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100025471","name":"Consejer\u00eda de Universidad, Investigaci\u00f3n e Innovaci\u00f3n, Junta de Andaluc\u00eda","doi-asserted-by":"publisher","award":["PIDI_2024_01307"],"award-info":[{"award-number":["PIDI_2024_01307"]}],"id":[{"id":"10.13039\/501100025471","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100004895","name":"European Social Fund Plus","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100004895","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100014440","name":"Espa\u00f1a Ministerio de Ciencia e Innovaci\u00f3n","doi-asserted-by":"publisher","award":["PID2022-137858OB-I00"],"award-info":[{"award-number":["PID2022-137858OB-I00"]}],"id":[{"id":"10.13039\/100014440","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100014440","name":"Espa\u00f1a Ministerio de Ciencia e Innovaci\u00f3n","doi-asserted-by":"publisher","award":["FPU21\/02026"],"award-info":[{"award-number":["FPU21\/02026"]}],"id":[{"id":"10.13039\/100014440","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100014440","name":"Espa\u00f1a Ministerio de Ciencia e Innovaci\u00f3n","doi-asserted-by":"publisher","award":["FPU24\/04054"],"award-info":[{"award-number":["FPU24\/04054"]}],"id":[{"id":"10.13039\/100014440","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Future Generation Computer Systems"],"published-print":{"date-parts":[[2026,9]]},"DOI":"10.1016\/j.future.2026.108483","type":"journal-article","created":{"date-parts":[[2026,3,19]],"date-time":"2026-03-19T07:44:44Z","timestamp":1773906284000},"page":"108483","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"C","title":["Energy-efficient large language models"],"prefix":"10.1016","volume":"182","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-1735-0520","authenticated-orcid":false,"given":"Javier","family":"Jare\u00f1o","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-9835-8793","authenticated-orcid":false,"given":"Jos\u00e9 Miguel","family":"Arag\u00f3n-Jurado","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-3662-6422","authenticated-orcid":false,"given":"Juan Carlos","family":"De La Torre","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-5891-0646","authenticated-orcid":false,"given":"Patricia","family":"Ruiz","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-0481-790X","authenticated-orcid":false,"given":"Bernab\u00e9","family":"Dorronsoro","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.future.2026.108483_bib0001","doi-asserted-by":"crossref","first-page":"26839","DOI":"10.1109\/ACCESS.2024.3365742","article-title":"A review on large language models: architectures, applications, taxonomies, open issues and challenges","volume":"12","author":"Raiaan","year":"2024","journal-title":"IEEE Access"},{"key":"10.1016\/j.future.2026.108483_bib0002","unstructured":"NVIDIA, TensorRT SDK - NVIDIA Developer, 2024. [Accessed Dec. 10, 2024], https:\/\/developer.nvidia.com\/tensorrt."},{"key":"10.1016\/j.future.2026.108483_bib0003","unstructured":"ONNX, ONNX runtime | home, 2024. [Accessed Dec. 10, 2024], https:\/\/onnxruntime.ai\/."},{"key":"10.1016\/j.future.2026.108483_bib0004","unstructured":"I. Ggerganov, llama.cpp: LLM inference in C\/C++, 2024. [Accessed Dec. 10, 2024], https:\/\/github.com\/ggerganov\/llama.cpp."},{"key":"10.1016\/j.future.2026.108483_bib0005","unstructured":"H. Touvron, T. Lavril, G. Izacard, et al., LLaMA: open and efficient foundation language models,(2023) arXiv: 2302.13971."},{"key":"10.1016\/j.future.2026.108483_bib0006","series-title":"2023 IEEE High Performance Extreme Computing Conference (HPEC)","first-page":"1","article-title":"From words to watts: benchmarking the energy costs of large language model inference","author":"Samsi","year":"2023"},{"key":"10.1016\/j.future.2026.108483_bib0007","series-title":"The Twelfth International Conference on Learning Representations","article-title":"WildChat: 1M chatGPT interaction logs in the wild","author":"Zhao","year":"2024"},{"key":"10.1016\/j.future.2026.108483_bib0008","unstructured":"Demandsage, ChatGPT statistics 2024 - 300 million active users (december), 2024, (https:\/\/www.demandsage.com\/chatgpt-statistics\/). [accessed Dec. 10, 2024]."},{"issue":"6","key":"10.1016\/j.future.2026.108483_bib0009","doi-asserted-by":"crossref","DOI":"10.1145\/3530811","article-title":"Efficient transformers: a survey","volume":"55","author":"Tay","year":"2022","journal-title":"ACM Comput. Surv."},{"key":"10.1016\/j.future.2026.108483_bib0010","unstructured":"LLVM, The LLVM compiler infrastructure, (https:\/\/llvm.org\/). [Accessed Jul. 18, 2025]."},{"key":"10.1016\/j.future.2026.108483_bib0011","article-title":"Does faster mean greener? Runtime and energy trade-offs in iOS applications with compiler optimizations","author":"Arag\u00f3n-Jurado","year":"2025","journal-title":"Sustain. Comput. Inform. Syst."},{"key":"10.1016\/j.future.2026.108483_bib0012","series-title":"Encyclopedia of Sustainable Technologies (Second Edition)","first-page":"765","article-title":"A survey on automatic source code transformation for green software generation","author":"Dorronsoro","year":"2024"},{"issue":"29","key":"10.1016\/j.future.2026.108483_bib0013","article-title":"MiCOMP: mitigating the compiler phase-Ordering problem using optimization sub-Sequences and machine learning","volume":"14","author":"Ashouri","year":"2017","journal-title":"ACM Trans. Archit. Code Optim."},{"issue":"2","key":"10.1016\/j.future.2026.108483_bib0014","doi-asserted-by":"crossref","first-page":"165","DOI":"10.1145\/1071604.1071607","article-title":"Fast and efficient searches for effective optimization-phase sequences","volume":"2","author":"Kulkarni","year":"2005","journal-title":"ACM Trans. Archit. Code Optim."},{"issue":"3","key":"10.1016\/j.future.2026.108483_bib0015","doi-asserted-by":"crossref","first-page":"464","DOI":"10.1109\/TSUSC.2023.3330671","article-title":"Automatic software tailoring for optimal performance","volume":"9","author":"Arag\u00f3n-Jurado","year":"2024","journal-title":"IEEE Trans. Sustainable Comput."},{"key":"10.1016\/j.future.2026.108483_bib0016","doi-asserted-by":"crossref","DOI":"10.1016\/j.iot.2025.101521","article-title":"Automatic software tailoring for green internet of things","volume":"30","author":"Arag\u00f3n-Jurado","year":"2025","journal-title":"Internet Things"},{"issue":"5","key":"10.1016\/j.future.2026.108483_bib0017","doi-asserted-by":"crossref","first-page":"1973","DOI":"10.1109\/TAI.2023.3315272","article-title":"Data-centric green artificial intelligence: a survey","volume":"5","author":"Salehi","year":"2024","journal-title":"IEEE Trans. Artif. Intell."},{"key":"10.1016\/j.future.2026.108483_bib0018","series-title":"Cellular Genetic Algorithms","author":"Alba","year":"2008"},{"key":"10.1016\/j.future.2026.108483_bib0019","unstructured":"A. Dubey, A. Jauhri, A. Pandey, A. Kadian, A. Al-Dahle, A. Letman, A. Mathur, A. Schelten, A. Yang, A. Fan, et al., The Llama 3 Herd of Models,(2024) arXiv: 2407.21783\">."},{"issue":"1","key":"10.1016\/j.future.2026.108483_bib0020","doi-asserted-by":"crossref","first-page":"2","DOI":"10.1007\/s10664-023-10407-7","article-title":"Which design decisions in AI-enabled mobile applications contribute to greener AI?","volume":"29","author":"Castanyer","year":"2024","journal-title":"Empir. Softw. Eng."},{"issue":"5","key":"10.1016\/j.future.2026.108483_bib0021","doi-asserted-by":"crossref","first-page":"1973","DOI":"10.1109\/TAI.2023.3315272","article-title":"Data-centric green artificial intelligence: a survey","volume":"5","author":"Salehi","year":"2023","journal-title":"IEEE Trans. Artif. Intell."},{"key":"10.1016\/j.future.2026.108483_bib0022","doi-asserted-by":"crossref","DOI":"10.1109\/ACCESS.2024.3409745","article-title":"Measuring and improving the energy efficiency of large language models inference","author":"Argerich","year":"2024","journal-title":"IEEE Access"},{"key":"10.1016\/j.future.2026.108483_bib0023","doi-asserted-by":"crossref","DOI":"10.1016\/j.sysarc.2023.102990","article-title":"A survey of techniques for optimizing transformer inference","volume":"144","author":"Chitty-Venkata","year":"2023","journal-title":"J. Syst. Archit."},{"issue":"6","key":"10.1016\/j.future.2026.108483_bib0024","first-page":"109","article-title":"Optimization of large models for efficient inference: algorithm, compiler, and system co-design","volume":"2","author":"Gao","year":"2025","journal-title":"J. Comput. Signal Syst. Res."},{"key":"10.1016\/j.future.2026.108483_bib0025","first-page":"1556","article-title":"A survey on model compression for large language models","volume":"12","author":"Zhu","year":"2024","journal-title":"Trans. Assoc. Comput. Lingui."},{"key":"10.1016\/j.future.2026.108483_bib0026","doi-asserted-by":"crossref","DOI":"10.1016\/j.csi.2024.103906","article-title":"Energy-efficient neural network training through runtime layer freezing, model quantization, and early stopping","volume":"92","author":"Reguero","year":"2025","journal-title":"Comput. Stand. Interfaces"},{"key":"10.1016\/j.future.2026.108483_bib0027","first-page":"30318","article-title":"GPT3.Int8: 8-bit matrix multiplication for transformers at scale","volume":"35","author":"Dettmers","year":"2022","journal-title":"Adv. Neural Inf. Process Syst."},{"issue":"11","key":"10.1016\/j.future.2026.108483_bib0028","doi-asserted-by":"crossref","first-page":"1573","DOI":"10.1109\/TVLSI.2022.3197282","article-title":"An algorithm\u2013hardware co-optimized framework for accelerating n: m sparse transformers","volume":"30","author":"Fang","year":"2022","journal-title":"IEEE Trans. Very Large Scale Integr. VLSI Syst."},{"issue":"6","key":"10.1016\/j.future.2026.108483_bib0029","doi-asserted-by":"crossref","first-page":"1789","DOI":"10.1007\/s11263-021-01453-z","article-title":"Knowledge distillation: a survey","volume":"129","author":"Gou","year":"2021","journal-title":"Int. J. Comput. Vis."},{"key":"10.1016\/j.future.2026.108483_bib0030","unstructured":"A. Polino, R. Pascanu, D. Alistarh, Model compression via distillation and quantization, (2018) arXiv: 1802.05668\">."},{"issue":"3","key":"10.1016\/j.future.2026.108483_bib0031","doi-asserted-by":"crossref","first-page":"1483","DOI":"10.3390\/s23031483","article-title":"LAD: Layer-wise adaptive distillation for BERT model compression","volume":"23","author":"Lin","year":"2023","journal-title":"Sensors"},{"issue":"1","key":"10.1016\/j.future.2026.108483_bib0032","doi-asserted-by":"crossref","DOI":"10.1038\/s41598-024-76682-6","article-title":"Reconciling the contrasting narratives on the environmental impact of large language models","volume":"14","author":"Ren","year":"2024","journal-title":"Sci. Rep."},{"key":"10.1016\/j.future.2026.108483_bib0033","series-title":"International Conference on Learning Representations","article-title":"ALBERT: a lite BERT for self-supervised learning of language representations","author":"Lan","year":"2020"},{"issue":"120","key":"10.1016\/j.future.2026.108483_bib0034","first-page":"1","article-title":"Switch transformers: scaling to trillion parameter models with simple and efficient sparsity","volume":"23","author":"Fedus","year":"2022","journal-title":"J. Mach. Learn. Res."},{"key":"10.1016\/j.future.2026.108483_bib0035","doi-asserted-by":"crossref","unstructured":"Z. Zhang, Y. Gu, X. Han, S. Chen, C. Xiao, Z. Sun, Y. Yao, F. Qi, J. Guan, P. Ke, et al., CPM-2: large-scale cost-effective pre-trained language models,(2021) \/arXiv: 2106.10715\">.","DOI":"10.1016\/j.aiopen.2021.12.003"},{"key":"10.1016\/j.future.2026.108483_bib0036","doi-asserted-by":"crossref","DOI":"10.1016\/j.future.2024.107606","article-title":"Reducing inference energy consumption using dual complementary CNNs","volume":"165","author":"Kinnas","year":"2025","journal-title":"Future Gener. Comput. Syst."},{"issue":"2","key":"10.1016\/j.future.2026.108483_bib0037","doi-asserted-by":"crossref","first-page":"586","DOI":"10.3390\/app15020586","article-title":"A survey on hardware accelerators for large language models","volume":"15","author":"Kachris","year":"2025","journal-title":"Appl. Sci."},{"issue":"10","key":"10.1016\/j.future.2026.108483_bib0038","doi-asserted-by":"crossref","first-page":"2299","DOI":"10.3390\/electronics12102299","article-title":"A survey on sparsity exploration in transformer-based accelerators","volume":"12","author":"Fuad","year":"2023","journal-title":"Electronics"},{"key":"10.1016\/j.future.2026.108483_bib0039","unstructured":"Z. Zhou, X. Ning, K. Hong, T. Fu, J. Xu, S. Li, Y. Lou, L. Wang, Z. Yuan, X. Li, et al., A survey on efficient inference for large language models,(2024) arXiv: 2404.14294\">."},{"key":"10.1016\/j.future.2026.108483_bib0040","series-title":"2019 IEEE\/ACM International Symposium on Code Generation and Optimization (CGO)","first-page":"193","article-title":"Tiramisu: a polyhedral compiler for expressing fast and portable code","author":"Baghdadi","year":"2019"},{"key":"10.1016\/j.future.2026.108483_bib0041","series-title":"13th USENIX Symposium on Operating Systems Design and Implementation (OSDI 18)","first-page":"578","article-title":"{TVM}: An automated {End-to-End} optimizing compiler for deep learning","author":"Chen","year":"2018"},{"key":"10.1016\/j.future.2026.108483_bib0042","unstructured":"N. Corporation, NVIDIA TensorRT, 2024, (https:\/\/developer.nvidia.com\/tensorrt). [Accessed: December 15, 2025]."},{"key":"10.1016\/j.future.2026.108483_bib0043","series-title":"SC22: International Conference for High Performance Computing, Networking, Storage and Analysis","first-page":"1","article-title":"Deepspeed-inference: enabling efficient inference of transformer models at unprecedented scale","author":"Aminabadi","year":"2022"},{"key":"10.1016\/j.future.2026.108483_bib0044","doi-asserted-by":"crossref","unstructured":"J. Fernandez, C. Na, V. Tiwari, Y. Bisk, S. Luccioni, E. Strubell, Energy considerations of large language model inference and efficiency optimizations,(2025) arXiv: 2504.17674\">.","DOI":"10.18653\/v1\/2025.acl-long.1563"},{"key":"10.1016\/j.future.2026.108483_bib0045","series-title":"International Conference on Information Processing and Management of Uncertainty in Knowledge-Based Systems","first-page":"272","article-title":"Analyzing the influence of LLVM code optimization passes on software performance","author":"de la Torre","year":"2018"},{"key":"10.1016\/j.future.2026.108483_bib0046","unstructured":"T. Ravitch, Whole program LLVM, 2024, (https:\/\/github.com\/travitch\/whole-program-llvm). [Accessed Dec. 11, 2024]."},{"issue":"2","key":"10.1016\/j.future.2026.108483_bib0047","doi-asserted-by":"crossref","first-page":"126","DOI":"10.1109\/TEVC.2005.843751","article-title":"The exploration\/exploitation tradeoff in dynamic cellular genetic algorithms","volume":"9","author":"Alba","year":"2005","journal-title":"IEEE Trans. Evol. Comput."},{"key":"10.1016\/j.future.2026.108483_bib0048","series-title":"Proceedings of the Genetic and Evolutionary Computation Conference Companion (GECCO)","article-title":"A two-step approach to find short compilation transformation sequences for optimal software runtime performance","author":"de la Torre","year":"2025"},{"issue":"1","key":"10.1016\/j.future.2026.108483_bib0049","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1109\/TSE.2016.2584050","article-title":"An empirical comparison of model validation techniques for defect prediction models","volume":"43","author":"Tantithamthavorn","year":"2016","journal-title":"IEEE Trans. Software Eng."},{"key":"10.1016\/j.future.2026.108483_bib0050","unstructured":"Mozilla, Powermetrics \u2013 firefox source docs documentation, (https:\/\/firefox-source-docs.mozilla.org\/performance\/powermetrics.html). [Accessed Jul. 18, 2025]."},{"issue":"7","key":"10.1016\/j.future.2026.108483_bib0051","doi-asserted-by":"crossref","first-page":"683","DOI":"10.1109\/TSE.2018.2794977","article-title":"The impact of automated parameter optimization on defect prediction models","volume":"45","author":"Tantithamthavorn","year":"2018","journal-title":"IEEE Trans. Software Eng."}],"container-title":["Future Generation Computer Systems"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0167739X26001172?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0167739X26001172?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,5,29]],"date-time":"2026-05-29T01:38:21Z","timestamp":1780018701000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0167739X26001172"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,9]]},"references-count":51,"alternative-id":["S0167739X26001172"],"URL":"https:\/\/doi.org\/10.1016\/j.future.2026.108483","relation":{},"ISSN":["0167-739X"],"issn-type":[{"value":"0167-739X","type":"print"}],"subject":[],"published":{"date-parts":[[2026,9]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"Energy-efficient large language models","name":"articletitle","label":"Article Title"},{"value":"Future Generation Computer Systems","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.future.2026.108483","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 The Authors. Published by Elsevier B.V.","name":"copyright","label":"Copyright"}],"article-number":"108483"}}