{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,4]],"date-time":"2026-07-04T07:23:25Z","timestamp":1783149805516,"version":"3.54.6"},"reference-count":214,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"5","license":[{"start":{"date-parts":[[2026,5,1]],"date-time":"2026-05-01T00:00:00Z","timestamp":1777593600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2026,5,1]],"date-time":"2026-05-01T00:00:00Z","timestamp":1777593600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,5,1]],"date-time":"2026-05-01T00:00:00Z","timestamp":1777593600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"name":"National Key Research and Development Program of China","award":["2023YFC2907600"],"award-info":[{"award-number":["2023YFC2907600"]}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"crossref","award":["62472079"],"award-info":[{"award-number":["62472079"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"crossref"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"crossref","award":["52574193"],"award-info":[{"award-number":["52574193"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"crossref"}]},{"DOI":"10.13039\/501100001809","name":"Science and Technology Innovation and Entrepreneurship Project of TDTEC","doi-asserted-by":"publisher","award":["2025-TD-ZY001"],"award-info":[{"award-number":["2025-TD-ZY001"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"Science and Technology Innovation and Entrepreneurship Project of TDTEC","doi-asserted-by":"publisher","award":["2024-TD-ZD016-04"],"award-info":[{"award-number":["2024-TD-ZD016-04"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Neural Netw. Learning Syst."],"published-print":{"date-parts":[[2026,5]]},"DOI":"10.1109\/tnnls.2025.3628671","type":"journal-article","created":{"date-parts":[[2025,11,14]],"date-time":"2025-11-14T18:50:20Z","timestamp":1763146220000},"page":"2025-2045","source":"Crossref","is-referenced-by-count":6,"title":["Survey on Efficient Large Language Models: Principles, Algorithms, Applications, and Open Issues"],"prefix":"10.1109","volume":"37","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-9805-8870","authenticated-orcid":false,"given":"Jian","family":"Cheng","sequence":"first","affiliation":[{"name":"Research Institute of Mine Artificial Intelligence, Chinese Institute of Coal Science, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-8533-5704","authenticated-orcid":false,"given":"Haidong","family":"Kang","sequence":"additional","affiliation":[{"name":"College of Software, Northeastern University, Shenyang, Liaoning, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yuxin","family":"Shao","sequence":"additional","affiliation":[{"name":"College of Software, Northeastern University, Shenyang, Liaoning, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Nan","family":"Li","sequence":"additional","affiliation":[{"name":"College of Software, Northeastern University, Shenyang, Liaoning, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Pengjun","family":"Chen","sequence":"additional","affiliation":[{"name":"College of Software, Northeastern University, Shenyang, Liaoning, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-9048-2979","authenticated-orcid":false,"given":"Rui","family":"Wang","sequence":"additional","affiliation":[{"name":"National University of Defense Technology, Changsha, Hunan, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-7119-8673","authenticated-orcid":false,"given":"Saiqin","family":"Long","sequence":"additional","affiliation":[{"name":"College of Information Science and Technology, Jinan University, Guangzhou, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-6184-4771","authenticated-orcid":false,"given":"Xiaochun","family":"Yang","sequence":"additional","affiliation":[{"name":"College of Software, Northeastern University, Shenyang, Liaoning, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-9969-211X","authenticated-orcid":false,"given":"Lianbo","family":"Ma","sequence":"additional","affiliation":[{"name":"College of Software, Northeastern University, Shenyang, Liaoning, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","volume-title":"ChatGPT","year":"2022"},{"key":"ref2","volume-title":"Claude","year":"2023"},{"key":"ref3","article-title":"How good are GPT models at machine translation? A comprehensive evaluation","author":"Hendy","year":"2023","journal-title":"arXiv:2302.09210"},{"key":"ref4","article-title":"Exploring the limits of ChatGPT for query or aspect-based text summarization","author":"Yang","year":"2023","journal-title":"arXiv:2302.08081"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1016\/j.patter.2024.100943"},{"key":"ref6","first-page":"1105","article-title":"Understanding the benefits and challenges of using large language model-based conversational agents for mental well-being support","volume-title":"Proc. AMIA Annu. Symp.","author":"Ma"},{"key":"ref7","first-page":"1877","article-title":"Language models are few-shot learners","volume-title":"Proc. NIPS","author":"Brown"},{"issue":"253","key":"ref8","first-page":"1","article-title":"Estimating the carbon footprint of Bloom, a 176B parameter language model","volume":"24","author":"Luccioni","year":"2022","journal-title":"J. Mach. Learn. Res."},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/TEVC.2023.3314766"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/TC.2024.3365949"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/TFUZZ.2024.3373792"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1145\/3603704"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/TCYB.2021.3086501"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1145\/3744746"},{"key":"ref15","article-title":"Efficient large language models: A survey","author":"Wan","year":"2023","journal-title":"arXiv:2312.03863"},{"key":"ref16","article-title":"A survey of resource-efficient LLM and multimodal foundation models","author":"Xu","year":"2024","journal-title":"arXiv:2401.08092"},{"key":"ref17","article-title":"Model compression and efficient inference for large language models: A survey","author":"Wang","year":"2024","journal-title":"arXiv:2402.09748"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1162\/tacl_a_00704"},{"key":"ref19","article-title":"LLM-pruner: On the structural pruning of large language models","author":"Ma","year":"2023","journal-title":"arXiv:2305.11627"},{"key":"ref20","article-title":"A simple and effective pruning approach for large language models","author":"Sun","year":"2023","journal-title":"arXiv:2306.11695"},{"key":"ref21","first-page":"10323","article-title":"SparseGPT: Massive language models can be accurately pruned in one-shot","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Frantar"},{"key":"ref22","article-title":"Outlier weighed layerwise sparsity (OWL): A missing secret sauce for pruning LLMs to high sparsity","author":"Yin","year":"2023","journal-title":"arXiv:2310.05175"},{"key":"ref23","article-title":"GKD: Generalized knowledge distillation for auto-regressive sequence models","author":"Agarwal","year":"2023","journal-title":"arXiv:2306.13649"},{"key":"ref24","article-title":"MiniLLM: Knowledge distillation of large language models","author":"Gu","year":"2023","journal-title":"arXiv:2306.08543"},{"key":"ref25","first-page":"20852","article-title":"Less is more: Task-aware layer-wise distillation for language model compression","volume-title":"Proc. 40th Int. Conf. Mach. Learn.","author":"Liang"},{"key":"ref26","article-title":"Large language model distillation doesn\u2019t need a teacher","author":"Jha","year":"2023","journal-title":"arXiv:2305.14864"},{"key":"ref27","article-title":"In-context learning distillation: Transferring few-shot learning ability of pre-trained language models","author":"Huang","year":"2022","journal-title":"arXiv:2212.10670"},{"key":"ref28","article-title":"Improving in-context learning via bidirectional alignment","author":"Qin","year":"2023","journal-title":"arXiv:2312.17055"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.52202\/068431-1613"},{"key":"ref30","article-title":"Specializing smaller language models towards multi-step reasoning","author":"Fu","year":"2023","journal-title":"arXiv:2301.12726"},{"key":"ref31","article-title":"Knowledge-augmented reasoning distillation for small language models in knowledge-intensive tasks","author":"Kang","year":"2023","journal-title":"arXiv:2305.18395"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.acl-long.150"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.findings-acl.507"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.findings-acl.441"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.findings-emnlp.454"},{"key":"ref36","article-title":"Large language models are reasoning teachers","author":"Ho","year":"2022","journal-title":"arXiv:2212.10071"},{"key":"ref37","article-title":"Teaching small language models to reason","author":"Magister","year":"2022","journal-title":"arXiv:2212.08410"},{"key":"ref38","article-title":"Mixed distillation helps smaller language model better reasoning","author":"Li","year":"2023","journal-title":"arXiv:2312.10730"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.naacl-long.142"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.naacl-long.376"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.emnlp-main.120"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-44207-0_12"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v38i17.29821"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.acl-long.304"},{"key":"ref45","first-page":"38087","article-title":"SmoothQuant: Accurate and efficient post-training quantization for large language models","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Xiao"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.findings-acl.26"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.acl-long.7"},{"key":"ref48","article-title":"BitNet: Scaling 1-bit transformers for large language models","author":"Wang","year":"2023","journal-title":"arXiv:2310.11453"},{"key":"ref49","article-title":"OneBit: Towards extremely low-bit large language models","author":"Xu","year":"2024","journal-title":"arXiv:2402.11295"},{"key":"ref50","article-title":"PB-LLM: Partially binarized large language models","author":"Shang","year":"2023","journal-title":"arXiv:2310.00034"},{"key":"ref51","article-title":"GPTQ: Accurate post-training quantization for generative pre-trained transformers","author":"Frantar","year":"2022","journal-title":"arXiv:2210.17323"},{"key":"ref52","article-title":"TEQ: Trainable equivalent transformation for quantization of LLMs","author":"Cheng","year":"2023","journal-title":"arXiv:2310.10944"},{"key":"ref53","first-page":"1","article-title":"QuIP: 2-bit quantization of large language models with guarantees","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Chee"},{"key":"ref54","article-title":"FineQuant: Unlocking efficiency with fine-grained weight-only quantization for LLMs","author":"Kim","year":"2023","journal-title":"arXiv:2308.09723"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.emnlp-main.892"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.findings-emnlp.662"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.findings-acl.3"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.52202\/068431-2198"},{"key":"ref59","article-title":"OWQ: Lessons learned from activation outliers for weight quantization in large language models","author":"Lee","year":"2023","journal-title":"arXiv:2306.02272"},{"key":"ref60","article-title":"Rethinking channel dimensions to isolate outliers for low-bit weight quantization of large language models","author":"Heo","year":"2023","journal-title":"arXiv:2309.15531"},{"key":"ref61","article-title":"AWQ: Activation-aware weight quantization for LLM compression and acceleration","author":"Lin","year":"2023","journal-title":"arXiv:2306.00978"},{"key":"ref62","article-title":"SpQR: A sparse-quantized representation for near-lossless LLM weight compression","author":"Dettmers","year":"2023","journal-title":"arXiv:2306.03078"},{"key":"ref63","first-page":"1","article-title":"LLM-MQ: Mixed-precision quantization for efficient LLM deployment","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Li"},{"key":"ref64","first-page":"27168","article-title":"ZeroQuant: Efficient and affordable post-training quantization for large-scale transformers","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Yao"},{"key":"ref65","article-title":"ZeroQuant-FP: A leap forward in LLMs post-training W4A8 quantization using floating-point formats","author":"Wu","year":"2023","journal-title":"arXiv:2307.09782"},{"key":"ref66","article-title":"Atom: Low-bit quantization for efficient and accurate LLM serving","author":"Zhao","year":"2023","journal-title":"arXiv:2310.19102"},{"key":"ref67","article-title":"Integer or floating point? New outlooks for low-bit quantization on large language models","author":"Zhang","year":"2023","journal-title":"arXiv:2305.12356"},{"key":"ref68","article-title":"FPTQ: Fine-grained post-training quantization for large language models","author":"Li","year":"2023","journal-title":"arXiv:2308.15987"},{"key":"ref69","article-title":"AWEQ: Post-training quantization with activation-weight equalization for large language models","author":"Li","year":"2023","journal-title":"arXiv:2311.01305"},{"key":"ref70","article-title":"Outlier Suppression+: Accurate quantization of large language models by equivalent and optimal shifting and scaling","author":"Wei","year":"2023","journal-title":"arXiv:2304.09145"},{"key":"ref71","doi-asserted-by":"publisher","DOI":"10.52202\/075280-0441"},{"key":"ref72","article-title":"LoftQ: LoRA-fine-tuning-aware quantization for large language models","author":"Li","year":"2023","journal-title":"arXiv:2310.08659"},{"key":"ref73","article-title":"QA-LoRA: Quantization-aware low-rank adaptation of large language models","author":"Xu","year":"2023","journal-title":"arXiv:2309.14717"},{"key":"ref74","article-title":"LQ-LoRA: Low-rank plus quantized matrix decomposition for efficient language model finetuning","author":"Guo","year":"2023","journal-title":"arXiv:2311.12023"},{"key":"ref75","article-title":"Accurate LoRA-finetuning quantization of LLMs via information retention","author":"Qin","year":"2024","journal-title":"arXiv:2402.05445"},{"key":"ref76","doi-asserted-by":"publisher","DOI":"10.52202\/075280-1569"},{"key":"ref77","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2022.findings-emnlp.240"},{"key":"ref78","article-title":"QFT: Quantized full-parameter tuning of LLMs with affordable resources","author":"Li","year":"2023","journal-title":"arXiv:2310.07147"},{"key":"ref79","article-title":"Kronecker decomposition for GPT compression","author":"Edalati","year":"2021","journal-title":"arXiv:2110.08152"},{"key":"ref80","article-title":"LORD: Low rank decomposition of monolingual code LLMs for one-shot compression","author":"Kaushal","year":"2023","journal-title":"arXiv:2309.14021"},{"key":"ref81","first-page":"20336","article-title":"LoSparse: Structured compression of large language models based on low-rank and sparse approximation","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Li"},{"key":"ref82","first-page":"1","article-title":"Matrix compression via randomized low rank and low precision factorization","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Saha"},{"key":"ref83","article-title":"SVD-LLM: Truncation-aware singular value decomposition for large language model compression","author":"Wang","year":"2024","journal-title":"arXiv:2403.07378"},{"key":"ref84","article-title":"The truth is in there: Improving reasoning in language models with layer-selective rank reduction","author":"Sharma","year":"2023","journal-title":"arXiv:2312.13558"},{"key":"ref85","article-title":"Ternary singular value decomposition as a better parameterized form in linear mapping","author":"Chen","year":"2023","journal-title":"arXiv:2308.07641"},{"key":"ref86","article-title":"TensorGPT: Efficient compression of large language models based on tensor-train decomposition","author":"Xu","year":"2023","journal-title":"arXiv:2307.00526"},{"key":"ref87","first-page":"17283","article-title":"Big bird: Transformers for longer sequences","volume-title":"Proc. 34th Conf. Neural Inf. Process. Syst. (NeurlPS)","author":"Zaheer"},{"key":"ref88","article-title":"Generating long sequences with sparse transformers","author":"Child","year":"2019","journal-title":"arXiv:1904.10509"},{"key":"ref89","doi-asserted-by":"publisher","DOI":"10.1162\/tacl_a_00353"},{"key":"ref90","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2022.emnlp-main.352"},{"key":"ref91","first-page":"4690","article-title":"Monarch: Expressive structured matrices for efficient and accurate training","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Dao"},{"key":"ref92","first-page":"9438","article-title":"Sparse Sinkhorn attention","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Tay"},{"key":"ref93","first-page":"16997","article-title":"SAC: Accelerating and structuring self-attention via sparse adaptive connection","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Li"},{"key":"ref94","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2021.naacl-main.112"},{"key":"ref95","first-page":"5156","article-title":"Transformers are RNNs: Fast autoregressive transformers with linear attention","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Katharopoulos"},{"key":"ref96","article-title":"Linformer: Self-attention with linear complexity","author":"Wang","year":"2020","journal-title":"arXiv:2006.04768"},{"key":"ref97","first-page":"3531","article-title":"Efficient attention: Attention with linear complexities","volume-title":"Proc. IEEE Winter Conf. Appl. Comput. Vis. (WACV)","author":"Shen"},{"key":"ref98","article-title":"Rethinking attention with performers","author":"Choromanski","year":"2020","journal-title":"arXiv:2009.14794"},{"key":"ref99","first-page":"2441","article-title":"Luna: Linear unified nested attention","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Ma"},{"key":"ref100","article-title":"HyperAttention: Long-context attention in near-linear time","author":"Han","year":"2023","journal-title":"arXiv:2310.05869"},{"key":"ref101","first-page":"40605","article-title":"KDEformer: Accelerating transformers via kernel density estimation","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Zandieh"},{"key":"ref102","article-title":"PolySketchFormer: Fast transformers via sketching polynomial kernels","author":"Kacham","year":"2023","journal-title":"arXiv:2310.01655"},{"key":"ref103","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00041"},{"key":"ref104","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v35i16.17664"},{"key":"ref105","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00475"},{"key":"ref106","article-title":"Mega: Moving average equipped gated attention","author":"Ma","year":"2022","journal-title":"arXiv:2209.10655"},{"key":"ref107","first-page":"9099","article-title":"Transformer quality in linear time","volume-title":"Proc. 39th Int. Conf. Mach. Learn.","volume":"162","author":"Hua"},{"key":"ref108","doi-asserted-by":"publisher","DOI":"10.1109\/hpca47549.2020.00035"},{"key":"ref109","doi-asserted-by":"publisher","DOI":"10.52202\/068431-1189"},{"key":"ref110","article-title":"FlashAttention-2: Faster attention with better parallelism and work partitioning","author":"Dao","year":"2023","journal-title":"arXiv:2307.08691"},{"key":"ref111","doi-asserted-by":"publisher","DOI":"10.1145\/3600006.3613165"},{"key":"ref112","article-title":"LightSeq: A high performance inference library for transformers","author":"Wang","year":"2020","journal-title":"arXiv:2010.13887"},{"key":"ref113","doi-asserted-by":"publisher","DOI":"10.1109\/ISCA52012.2021.00060"},{"key":"ref114","article-title":"Efficiently modeling long sequences with structured state spaces","author":"Gu","year":"2021","journal-title":"arXiv:2111.00396"},{"key":"ref115","article-title":"Long range language modeling via gated state spaces","author":"Mehta","year":"2022","journal-title":"arXiv:2206.13947"},{"key":"ref116","doi-asserted-by":"publisher","DOI":"10.52202\/068431-1670"},{"key":"ref117","first-page":"1","article-title":"Sparse modular activation for efficient sequence modeling","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Ren"},{"key":"ref118","article-title":"Block-state transformers","author":"Fathi","year":"2023","journal-title":"arXiv:2306.09539"},{"key":"ref119","article-title":"Hungry hungry hippos: Towards language modeling with state space models","author":"Fu","year":"2022","journal-title":"arXiv:2212.14052"},{"key":"ref120","article-title":"Mamba: Linear-time sequence modeling with selective state spaces","author":"Gu","year":"2023","journal-title":"arXiv:2312.00752"},{"key":"ref121","article-title":"An attention free transformer","author":"Zhai","year":"2021","journal-title":"arXiv:2105.14103"},{"key":"ref122","doi-asserted-by":"publisher","DOI":"10.52202\/068431-0805"},{"key":"ref123","first-page":"1","article-title":"MEGABYTE: Predicting million-byte sequences with multiscale transformers","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Yu"},{"key":"ref124","first-page":"28043","article-title":"Hyena hierarchy: Towards larger convolutional language models","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Poli"},{"key":"ref125","first-page":"26670","article-title":"Resurrecting recurrent neural networks for long sequences","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Orvieto"},{"key":"ref126","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.findings-emnlp.936"},{"key":"ref127","article-title":"Configurable foundation models: Building LLMs from a modular perspective","author":"Xiao","year":"2024","journal-title":"arXiv:2409.02877"},{"key":"ref128","article-title":"GShard: Scaling giant models with conditional computation and automatic sharding","author":"Lepikhin","year":"2020","journal-title":"arXiv:2006.16668"},{"key":"ref129","first-page":"8583","article-title":"Scaling vision with sparse mixture of experts","volume-title":"Proc. NIPS","author":"Riquelme"},{"key":"ref130","first-page":"9564","article-title":"Multimodal contrastive learning with LIMoE: The language-image mixture of experts","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Mustafa"},{"key":"ref131","first-page":"5547","article-title":"GLaM: Efficient scaling of language models with mixture-of-experts","volume-title":"Proc. Int. Conf. Mach. Learn.","volume":"162","author":"Du"},{"key":"ref132","doi-asserted-by":"publisher","DOI":"10.5244\/C.35.338"},{"key":"ref133","doi-asserted-by":"publisher","DOI":"10.52202\/068431-1269"},{"key":"ref134","article-title":"SkipDecode: Autoregressive skip decoding with batching and caching for efficient LLM inference","author":"Del Corro","year":"2023","journal-title":"arXiv:2307.02628"},{"key":"ref135","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v38i17.29922"},{"key":"ref136","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.emnlp-main.362"},{"key":"ref137","article-title":"Rethinking mobile AI ecosystem in the LLM era","author":"Yuan","year":"2023","journal-title":"arXiv:2308.14363"},{"key":"ref138","article-title":"DuoAttention: Efficient long-context LLM inference with retrieval and streaming heads","author":"Xiao","year":"2024","journal-title":"arXiv:2410.10819"},{"key":"ref139","first-page":"1","article-title":"Random-access infinite context length for transformers","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"36","author":"Mohtashami"},{"key":"ref140","doi-asserted-by":"publisher","DOI":"10.52202\/075280-2279"},{"key":"ref141","doi-asserted-by":"publisher","DOI":"10.52202\/075280-2845"},{"key":"ref142","first-page":"1","article-title":"H2O: Heavy-hitter oracle for efficient generative inference of large language models","volume-title":"Proc. Adv. Neural Inf. Process. Syst. (NeurIPS)","author":"Zhang"},{"key":"ref143","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA51647.2021.00018"},{"key":"ref144","doi-asserted-by":"publisher","DOI":"10.1145\/3534678.3539260"},{"key":"ref145","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2022.acl-long.502"},{"key":"ref146","article-title":"Infor-coef: Information bottleneck-based dynamic token downsampling for compact and efficient language model","author":"Tan","year":"2023","journal-title":"arXiv:2305.12458"},{"key":"ref147","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.acl-long.721"},{"key":"ref148","article-title":"SmartTrim: Adaptive tokens and attention pruning for efficient vision-language models","author":"Wang","year":"2023","journal-title":"arXiv:2305.15033"},{"key":"ref149","first-page":"13937","article-title":"DynamicViT: Efficient vision transformers with dynamic token sparsification","volume-title":"Proc. Adv. Neural Inf. Process. Syst. (NIPS)","author":"Rao"},{"key":"ref150","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01199"},{"key":"ref151","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01054"},{"key":"ref152","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-20083-0_37"},{"key":"ref153","first-page":"19274","article-title":"Fast inference from transformers via speculative decoding","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Leviathan"},{"key":"ref154","article-title":"DistillSpec: Improving speculative decoding via knowledge distillation","author":"Zhou","year":"2023","journal-title":"arXiv:2310.08461"},{"key":"ref155","article-title":"Accelerating large language model decoding with speculative sampling","author":"Chen","year":"2023","journal-title":"arXiv:2302.01318"},{"key":"ref156","article-title":"Online speculative decoding","author":"Liu","year":"2023","journal-title":"arXiv:2310.07177"},{"key":"ref157","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2020.findings-emnlp.217"},{"key":"ref158","article-title":"Medusa: Simple LLM inference acceleration framework with multiple decoding heads","author":"Cai","year":"2024","journal-title":"arXiv:2401.10774"},{"key":"ref159","article-title":"Break the sequential dependency of LLM inference using lookahead decoding","author":"Fu","year":"2024","journal-title":"arXiv:2402.02057"},{"key":"ref160","article-title":"EAGLE: Speculative sampling requires rethinking feature uncertainty","author":"Li","year":"2024","journal-title":"arXiv:2401.15077"},{"key":"ref161","article-title":"Inference with reference: Lossless acceleration of large language models","author":"Yang","year":"2023","journal-title":"arXiv:2304.04487"},{"key":"ref162","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.naacl-long.88"},{"key":"ref163","article-title":"Copy is all you need","author":"Lan","year":"2023","journal-title":"arXiv:2307.06962"},{"key":"ref164","volume-title":"DeepSpeed","year":"2023"},{"key":"ref165","volume-title":"LightLLM","year":"2023"},{"key":"ref166","volume-title":"Llama.CPP","year":"2023"},{"key":"ref167","volume-title":"MNN-LLM","year":"2023"},{"key":"ref168","volume-title":"MLLM","year":"2023"},{"key":"ref169","article-title":"ChatGLM: A family of large language models from GLM-130B to GLM-4 all tools","author":"Zeng","year":"2024","journal-title":"arXiv:2406.12793"},{"key":"ref170","article-title":"Qwen technical report","volume-title":"arXiv:2309.16609","author":"Bai","year":"2023"},{"key":"ref171","article-title":"Multi-frame, lightweight & efficient vision-language models for question answering in autonomous driving","author":"Gopalkrishnan","year":"2024","journal-title":"arXiv:2403.19838"},{"key":"ref172","article-title":"Slot-VLM: SlowFast slots for video-language modeling","author":"Xu","year":"2024","journal-title":"arXiv:2402.13088"},{"key":"ref173","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v38i3.27999"},{"key":"ref174","article-title":"Runtime adaptive pruning for LLM inference","author":"Liu","year":"2025","journal-title":"arXiv:2505.17138"},{"key":"ref175","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.findings-naacl.91"},{"key":"ref176","article-title":"A sign language recognition system with pepper, lightweight-transformer, and LLM","author":"Lim","year":"2023","journal-title":"arXiv:2309.16898"},{"key":"ref177","doi-asserted-by":"publisher","DOI":"10.48550\/ARXIV.1706.03762"},{"key":"ref178","article-title":"LLaMA: Open and efficient foundation language models","author":"Touvron","year":"2023","journal-title":"arXiv:2302.13971"},{"key":"ref179","first-page":"1","article-title":"Root mean square layer normalization","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Zhang"},{"key":"ref180","article-title":"GLU variants improve transformer","author":"Shazeer","year":"2020","journal-title":"arXiv:2002.05202"},{"key":"ref181","doi-asserted-by":"publisher","DOI":"10.1016\/j.neucom.2023.127063"},{"issue":"240","key":"ref182","first-page":"1","article-title":"PaLM: Scaling language modeling with pathways","volume":"24","author":"Chowdhery","year":"2022","journal-title":"J. Mach. Learn. Res."},{"key":"ref183","article-title":"LoRA: Low-rank adaptation of large language models","author":"Hu","year":"2021","journal-title":"arXiv:2106.09685"},{"key":"ref184","article-title":"E-sparse: Boosting the large language model inference through entropy-based N:M sparsity","author":"Li","year":"2023","journal-title":"arXiv:2310.15929"},{"key":"ref185","doi-asserted-by":"crossref","DOI":"10.20944\/preprints202310.1487.v1","article-title":"An efficient plug-and-play post-training pruning strategy in large language models","author":"Zhang","year":"2023"},{"key":"ref186","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.1503.02531"},{"key":"ref187","article-title":"FitNets: Hints for thin deep nets","author":"Romero","year":"2014","journal-title":"arXiv:1412.6550"},{"key":"ref188","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2020.2995884"},{"key":"ref189","first-page":"1","article-title":"Paraphrasing complex network: Network compression via factor transfer","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Kim"},{"key":"ref190","article-title":"Longformer: The long-document transformer","author":"Beltagy","year":"2020","journal-title":"arXiv:2004.05150"},{"key":"ref191","article-title":"Reformer: The efficient transformer","author":"Kitaev","year":"2020","journal-title":"arXiv:2001.04451"},{"key":"ref192","article-title":"Retentive network: A successor to transformer for large language models","author":"Sun","year":"2023","journal-title":"arXiv:2307.08621"},{"key":"ref193","article-title":"Efficient large scale language modeling with mixtures of experts","author":"Artetxe","year":"2021","journal-title":"arXiv:2112.10684"},{"key":"ref194","doi-asserted-by":"publisher","DOI":"10.1145\/3651890.3672274"},{"key":"ref195","doi-asserted-by":"publisher","DOI":"10.1109\/TC.2025.3540650"},{"key":"ref196","first-page":"1","article-title":"LUT-GEMM: Quantized matrix multiplication based on LUTs for efficient inference in large-scale generative language models","volume-title":"Proc. 12th Int. Conf. Learn. Represent.","author":"Park"},{"key":"ref197","article-title":"SqueezeLLM: Dense-and-sparse quantization","author":"Kim","year":"2023","journal-title":"arXiv:2306.07629"},{"key":"ref198","article-title":"RPTQ: Reorder-based post-training quantization for large language models","author":"Yuan","year":"2023","journal-title":"arXiv:2304.01089"},{"key":"ref199","doi-asserted-by":"publisher","DOI":"10.1145\/3579371.3589038"},{"key":"ref200","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.emnlp-main.39"},{"key":"ref201","article-title":"OmniQuant: Omnidirectionally calibrated quantization for large language models","author":"Shao","year":"2023","journal-title":"arXiv:2308.13137"},{"key":"ref202","first-page":"1","article-title":"Quantizable transformers: Removing outliers by helping attention heads do nothing","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Bondarenko"},{"key":"ref203","article-title":"WKVQuant: Quantizing weight and key\/value cache for large language models gains more","author":"Yue","year":"2024","journal-title":"arXiv:2402.12065"},{"key":"ref204","article-title":"Dynamic sparse no training: Training-free fine-tuning for sparse LLMs","author":"Zhang","year":"2023","journal-title":"arXiv:2310.08915"},{"key":"ref205","article-title":"One-shot sensitivity-aware mixed sparsity pruning for large language models","author":"Shao","year":"2023","journal-title":"arXiv:2310.09499"},{"key":"ref206","article-title":"Pruning large language models via accuracy predictor","author":"Ji","year":"2023","journal-title":"arXiv:2309.09507"},{"key":"ref207","first-page":"1","article-title":"SliceGPT: Compress large language models by deleting rows and columns","volume-title":"Proc. 12th Int. Conf. Learn. Represent.","author":"Ashkboos"},{"key":"ref208","article-title":"ASVD: Activation-aware singular value decomposition for compressing large language models","author":"Yuan","year":"2023","journal-title":"arXiv:2312.05821"},{"key":"ref209","article-title":"DeepSeek-V3 technical report","volume-title":"arXiv:2412.19437","author":"Liu","year":"2024"},{"key":"ref210","doi-asserted-by":"publisher","DOI":"10.1109\/TSMC.2020.2963943"},{"key":"ref211","doi-asserted-by":"publisher","DOI":"10.1109\/ton.2025.3589017"},{"key":"ref212","article-title":"DeepSeek-r1: Incentivizing reasoning capability in LLMs via reinforcement learning","author":"Guo","year":"2025","journal-title":"arXiv:2501.12948"},{"key":"ref213","volume-title":"Grok-4","year":"2025"},{"key":"ref214","article-title":"GPT-4o system card","author":"Hurst","year":"2024","journal-title":"arXiv:2410.21276"}],"container-title":["IEEE Transactions on Neural Networks and Learning Systems"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/5962385\/11505906\/11247933.pdf?arnumber=11247933","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,5,5]],"date-time":"2026-05-05T04:40:40Z","timestamp":1777956040000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11247933\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,5]]},"references-count":214,"journal-issue":{"issue":"5"},"URL":"https:\/\/doi.org\/10.1109\/tnnls.2025.3628671","relation":{},"ISSN":["2162-237X","2162-2388"],"issn-type":[{"value":"2162-237X","type":"print"},{"value":"2162-2388","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026,5]]}}}