{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,4]],"date-time":"2026-07-04T10:18:38Z","timestamp":1783160318150,"version":"3.54.6"},"reference-count":44,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,8,1]],"date-time":"2026-08-01T00:00:00Z","timestamp":1785542400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,8,1]],"date-time":"2026-08-01T00:00:00Z","timestamp":1785542400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,6,17]],"date-time":"2026-06-17T00:00:00Z","timestamp":1781654400000},"content-version":"vor","delay-in-days":0,"URL":"http:\/\/creativecommons.org\/licenses\/by\/4.0\/"}],"funder":[{"DOI":"10.13039\/100018919","name":"Pengcheng Laboratory","doi-asserted-by":"publisher","award":["PCL2025A09"],"award-info":[{"award-number":["PCL2025A09"]}],"id":[{"id":"10.13039\/100018919","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100018919","name":"Pengcheng Laboratory","doi-asserted-by":"publisher","award":["PCL2023AS1-5"],"award-info":[{"award-number":["PCL2023AS1-5"]}],"id":[{"id":"10.13039\/100018919","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Neurocomputing"],"published-print":{"date-parts":[[2026,8]]},"DOI":"10.1016\/j.neucom.2026.133760","type":"journal-article","created":{"date-parts":[[2026,4,27]],"date-time":"2026-04-27T16:42:42Z","timestamp":1777308162000},"page":"133760","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"C","title":["Adaptive hybrid speculative decoding for accelerating large language model inference"],"prefix":"10.1016","volume":"689","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-3309-4643","authenticated-orcid":false,"given":"Yang","family":"Yong","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Ting Ting","family":"Yang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Shao Shuai","family":"Gao","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Ye Hua","family":"Yin","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"issue":"16","key":"10.1016\/j.neucom.2026.133760_bib0005","first-page":"17682","article-title":"Graph of thoughts: solving elaborate problems with large language models","volume":"38","author":"Besta","year":"2024","journal-title":"Proc. AAAI Conf. Artif. Intell."},{"key":"10.1016\/j.neucom.2026.133760_bib0010","doi-asserted-by":"crossref","unstructured":"S. Yao, D. Yu, J. Zhao, I. Shafran, T.L. Griffiths, Y. Cao, K. Narasimhan, Tree of thoughts: deliberate problem solving with large language models, 2023. [Online]. Available: https:\/\/arxiv.org\/abs\/2305.10601","DOI":"10.52202\/075280-0517"},{"key":"10.1016\/j.neucom.2026.133760_bib0015","doi-asserted-by":"crossref","unstructured":"X. Zhang, C. Du, T. Pang, Q. Liu, W. Gao, M. Lin, Chain of preference optimization: improving chain-of-thought reasoning in llms, 2024. [Online]. Available: https:\/\/arxiv.org\/abs\/2406.09136","DOI":"10.52202\/079017-0011"},{"key":"10.1016\/j.neucom.2026.133760_bib0020","series-title":"Findings of the Association for Computational Linguistics: EMNLP 2023","first-page":"10245","article-title":"Can large language models fix data annotation errors an empirical study using debatepedia for query-focused text summarization","author":"Laskar","year":"2023"},{"key":"10.1016\/j.neucom.2026.133760_bib0025","unstructured":"DeepSeek-AI, A. Liu, B. Feng, B. Xue, B. Wang, E. Bochao Wu, DeepSeek-V3 technical report, 2025. [Online]. Available: https:\/\/arxiv.org\/abs\/2412.19437"},{"key":"10.1016\/j.neucom.2026.133760_bib0035","unstructured":"H. Touvron, L. Martin, K. Stone, P. Albert, E. Amjad Almahairi, Llama 2: open foundation and fine-tuned chat models, 2023. [Online]. Available: https:\/\/arxiv.org\/abs\/2307.09288"},{"key":"10.1016\/j.neucom.2026.133760_bib0040","unstructured":"H. Liu, W. Yan, M. Zaharia, P. Abbeel, World model on million-length video and language with blockwise ringattention, 2025. [Online]. Available: https:\/\/arxiv.org\/abs\/2402.08268"},{"key":"10.1016\/j.neucom.2026.133760_bib0045","doi-asserted-by":"crossref","unstructured":"H. Xia, Z. Yang, Q. Dong, P. Wang, Y. Li, T. Ge, T. Liu, W. Li, Z. Sui, Unlocking efficiency in large language model inference: a comprehensive survey of speculative decoding, 2024. [Online]. Available: https:\/\/arxiv.org\/abs\/2401.07851","DOI":"10.18653\/v1\/2024.findings-acl.456"},{"key":"10.1016\/j.neucom.2026.133760_bib0050","unstructured":"Y. Zhou, K. Lyu, A.S. Rawat, A.K. Menon, A. Rostamizadeh, S. Kumar, J.-F. Kagy, R. Agarwal, DistillSpec: improving speculative decoding via knowledge distillation, 2024. [Online]. Available: https:\/\/arxiv.org\/abs\/2310.08461"},{"key":"10.1016\/j.neucom.2026.133760_bib0055","unstructured":"X. Liu, L. Hu, P. Bailis, A. Cheung, Z. Deng, I. Stoica, H. Zhang, Online speculative decoding, 2024. [Online]. Available: https:\/\/arxiv.org\/abs\/2310.07177"},{"key":"10.1016\/j.neucom.2026.133760_bib0060","unstructured":"Y. Li, F. Wei, C. Zhang, H. Zhang, Eagle: speculative sampling requires rethinking feature uncertainty, 2025. [Online]. Available: https:\/\/arxiv.org\/abs\/2401.15077"},{"key":"10.1016\/j.neucom.2026.133760_bib0065","unstructured":"T. Cai, Y. Li, Z. Geng, H. Peng, J.D. Lee, D. Chen, T. Dao, Medusa: simple LLM inference acceleration framework with multiple decoding heads, 2024. [Online]. Available: https:\/\/arxiv.org\/abs\/2401.10774"},{"key":"10.1016\/j.neucom.2026.133760_bib0070","series-title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","first-page":"11263","article-title":"Draft & verify: lossless large language model acceleration via self-speculative decoding","author":"Zhang","year":"2024"},{"key":"10.1016\/j.neucom.2026.133760_bib0075","unstructured":"B. Spector, C. Re, Accelerating LLM inference with staged speculative decoding, 2023. [Online]. Available: https:\/\/arxiv.org\/abs\/2308.04623"},{"key":"10.1016\/j.neucom.2026.133760_bib0080","series-title":"Proceedings of the 29th ACM International Conference on Architectural Support for Programming Languages and Operating Systems, Volume 3, Ser. ASPLOS \u201924","first-page":"932","article-title":"Specinfer: accelerating large language model serving with tree-based speculative inference and verification","author":"Miao","year":"2024"},{"key":"10.1016\/j.neucom.2026.133760_bib0085","unstructured":"C. Chen, S. Borgeaud, G. Irving, J.-B. Lespiau, L. Sifre, J. Jumper, Accelerating large language model decoding with speculative sampling, 2023. [Online]. Available: https:\/\/arxiv.org\/abs\/2302.01318"},{"key":"10.1016\/j.neucom.2026.133760_bib0090","series-title":"Conference on Empirical Methods in Natural Language Processing","article-title":"Eagle-2: faster inference of language models with dynamic draft trees","author":"Li","year":"2024"},{"key":"10.1016\/j.neucom.2026.133760_bib0095","unstructured":"H. Yin, M. Xiao, R. Lu, X. Zhang, D. Yu, G. Zhang, PipeDec: low-latency pipeline-based inference with dynamic speculative decoding towards large-scale models, 2025. [Online]. Available: https:\/\/arxiv.org\/abs\/2504.04104"},{"key":"10.1016\/j.neucom.2026.133760_bib0100","author":"Xia","year":"2025","journal-title":"Tutorial proposal: speculative decoding for efficient LLM inference"},{"key":"10.1016\/j.neucom.2026.133760_bib0105","series-title":"18th USENIX Symposium on Operating Systems Design and Implementation (OSDI 24)","first-page":"135","article-title":"ServerlessLLM: Low-Latency serverless inference for large language models","author":"Fu","year":"2024"},{"key":"10.1016\/j.neucom.2026.133760_bib0110","series-title":"Neural Information Processing Systems","article-title":"Blockwise parallel decoding for deep autoregressive models","author":"Stern","year":"2018"},{"key":"10.1016\/j.neucom.2026.133760_bib0115","unstructured":"N. Shazeer, Fast transformer decoding: one write-head is all you need, 2019. [Online]. Available: https:\/\/arxiv.org\/abs\/1911.02150"},{"key":"10.1016\/j.neucom.2026.133760_bib0120","series-title":"16th USENIX Symposium on Operating Systems Design and Implementation (OSDI 22)","first-page":"521","article-title":"Orca: a distributed serving system for Transformer-Based generative models","author":"Yu","year":"2022"},{"issue":"12","key":"10.1016\/j.neucom.2026.133760_bib0125","doi-asserted-by":"crossref","first-page":"4326","DOI":"10.1109\/TPDS.2022.3187815","article-title":"AccTFM: an effective intra-layer model parallelization strategy for training large-scale transformer-based models","volume":"33","author":"Zeng","year":"2022","journal-title":"IEEE Trans. Parallel Distrib. Syst."},{"key":"10.1016\/j.neucom.2026.133760_bib0130","first-page":"1","article-title":"Improving computation and memory efficiency for real-world transformer inference on gpus","volume":"20","author":"Du","year":"2023","journal-title":"ACM Trans. Archit. Code Optim."},{"key":"10.1016\/j.neucom.2026.133760_bib0135","doi-asserted-by":"crossref","unstructured":"H. Jiang, Y. Li, C. Zhang, Q. Wu, X. Luo, S. Ahn, Z. Han, A.H. Abdi, D. Li, C.-Y. Lin, Y. Yang, L. Qiu, Minference 1.0: accelerating pre-filling for long-context llms via dynamic sparse attention, 2024. [Online]. Available: https:\/\/arxiv.org\/abs\/2407.02490","DOI":"10.52202\/079017-1663"},{"key":"10.1016\/j.neucom.2026.133760_bib0140","unstructured":"L. Yang, Z. Zhang, Z. Chen, Z. Li, Z. Jia, TidalDecode: fast and accurate LLM decoding with position persistent sparse attention, 2024. [Online]. Available: https:\/\/arxiv.org\/abs\/2410.05076"},{"key":"10.1016\/j.neucom.2026.133760_bib0145","unstructured":"Q. Fu, M. Cho, T. Merth, S. Mehta, M. Rastegari, M. Najibi, LazyLLM: dynamic token pruning for efficient long context LLM inference, 2024. [Online]. Available: https:\/\/arxiv.org\/abs\/2407.14057"},{"key":"10.1016\/j.neucom.2026.133760_bib0150","doi-asserted-by":"crossref","unstructured":"X. Ma, G. Fang, X. Wang, LLM-Pruner: on the structural pruning of large language models, 2023. [Online]. Available: https:\/\/arxiv.org\/abs\/2305.11627","DOI":"10.52202\/075280-0950"},{"key":"10.1016\/j.neucom.2026.133760_bib0155","unstructured":"G. Xiao, J. Lin, M. Seznec, H. Wu, J. Demouth, S. Han, SmoothQuant: accurate and efficient post-training quantization for large language models, 2024. [Online]. Available: https:\/\/arxiv.org\/abs\/2211.10438"},{"key":"10.1016\/j.neucom.2026.133760_bib0160","unstructured":"M. Sun, Z. Liu, A. Bair, J.Z. Kolter, A simple and effective pruning approach for large language models, 2024. [Online]. Available: https:\/\/arxiv.org\/abs\/2306.11695"},{"key":"10.1016\/j.neucom.2026.133760_bib0165","unstructured":"M. Elbayad, J. Gu, E. Grave, M. Auli, Depth-adaptive transformer, 2020. [Online]. Available: https:\/\/arxiv.org\/abs\/1910.10073"},{"key":"10.1016\/j.neucom.2026.133760_bib0170","doi-asserted-by":"crossref","unstructured":"T. Schuster, A. Fisch, J. Gupta, M. Dehghani, D. Bahri, V.Q. Tran, Y. Tay, D. Metzler, Confident adaptive language modeling, 2022. [Online]. Available: https:\/\/arxiv.org\/abs\/2207.07061","DOI":"10.52202\/068431-1269"},{"key":"10.1016\/j.neucom.2026.133760_bib0175","doi-asserted-by":"crossref","unstructured":"S. Kim, K. Mangalam, S. Moon, J. Malik, M.W. Mahoney, A. Gholami, K. Keutzer, Speculative decoding with big little decoder, 2023. [Online]. Available: https:\/\/arxiv.org\/abs\/2302.07863","DOI":"10.52202\/075280-1705"},{"key":"10.1016\/j.neucom.2026.133760_bib0180","unstructured":"Y. Leviathan, M. Kalman, Y. Matias, Fast inference from transformers via speculative decoding, 2023. [Online]. Available: https:\/\/arxiv.org\/abs\/2211.17192"},{"key":"10.1016\/j.neucom.2026.133760_bib0185","doi-asserted-by":"crossref","unstructured":"Y. Li, F. Wei, C. Zhang, H. Zhang, Eagle-2: faster inference of language models with dynamic draft trees, 2024. [Online]. Available: https:\/\/arxiv.org\/abs\/2406.16858","DOI":"10.18653\/v1\/2024.emnlp-main.422"},{"key":"10.1016\/j.neucom.2026.133760_bib0190","unstructured":"H. Touvron, T. Lavril, G. Izacard, X. Martinet, M.-A. Lachaux, T. Lacroix, B. Rozi\u00e8re, N. Goyal, E. Hambro, F. Azhar, A. Rodriguez, A. Joulin, E. Grave, G. Lample, Llama: open and efficient foundation language models, 2023. [Online]. Available: https:\/\/arxiv.org\/abs\/2302.13971"},{"key":"10.1016\/j.neucom.2026.133760_bib0195","unstructured":"D. Hendrycks, C. Burns, S. Basart, A. Zou, M. Mazeika, D. Song, J. Steinhardt, Measuring massive multitask language understanding, 2021. [Online]. Available: https:\/\/arxiv.org\/abs\/2009.03300"},{"key":"10.1016\/j.neucom.2026.133760_bib0200","series-title":"Proceedings of the Ninth Workshop on Statistical Machine Translation","first-page":"12","article-title":"Findings of the 2014 workshop on statistical machine translation","author":"Bojar","year":"2014"},{"key":"10.1016\/j.neucom.2026.133760_bib0205","unstructured":"BELLEGroup, Belle: be everyone\u2019s large language model engine, 2023, https:\/\/github.com\/LianjiaTech\/BELLE"},{"key":"10.1016\/j.neucom.2026.133760_bib0210","series-title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","first-page":"3119","article-title":"LongBench: a bilingual, multitask benchmark for long context understanding","author":"Bai","year":"2024"},{"key":"10.1016\/j.neucom.2026.133760_bib0215","article-title":"Training verifiers to solve math word problems","volume":"abs\/2110.14168","author":"Cobbe","year":"2021","journal-title":"ArXiv"},{"key":"10.1016\/j.neucom.2026.133760_bib0220","unstructured":"Y. Fu, P. Bailis, I. Stoica, H. Zhang, Break the sequential dependency of LLM inference using lookahead decoding, 2024. [Online]. Available: https:\/\/arxiv.org\/abs\/2402.02057"},{"key":"10.1016\/j.neucom.2026.133760_bib0225","unstructured":"Y. Li, F. Wei, C. Zhang, H. Zhang, Eagle: speculative sampling requires rethinking feature uncertainty, 2024. [Online]. Available: https:\/\/arxiv.org\/abs\/2401.15077"}],"container-title":["Neurocomputing"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0925231226011574?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0925231226011574?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,7,4]],"date-time":"2026-07-04T09:54:07Z","timestamp":1783158847000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0925231226011574"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,8]]},"references-count":44,"alternative-id":["S0925231226011574"],"URL":"https:\/\/doi.org\/10.1016\/j.neucom.2026.133760","relation":{},"ISSN":["0925-2312"],"issn-type":[{"value":"0925-2312","type":"print"}],"subject":[],"published":{"date-parts":[[2026,8]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"Adaptive hybrid speculative decoding for accelerating large language model inference","name":"articletitle","label":"Article Title"},{"value":"Neurocomputing","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.neucom.2026.133760","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 The Authors. Published by Elsevier B.V.","name":"copyright","label":"Copyright"}],"article-number":"133760"}}