{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,30]],"date-time":"2026-06-30T05:44:39Z","timestamp":1782798279291,"version":"3.54.5"},"reference-count":39,"publisher":"IEEE","license":[{"start":{"date-parts":[[2026,5,18]],"date-time":"2026-05-18T00:00:00Z","timestamp":1779062400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,5,18]],"date-time":"2026-05-18T00:00:00Z","timestamp":1779062400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2026,5,18]]},"DOI":"10.1109\/infocom59046.2026.11571680","type":"proceedings-article","created":{"date-parts":[[2026,6,29]],"date-time":"2026-06-29T19:38:15Z","timestamp":1782761895000},"page":"1-10","source":"Crossref","is-referenced-by-count":0,"title":["EdgeSpec: Distributed Speculative Decoding for Large Language Models at Edge"],"prefix":"10.1109","author":[{"given":"Yulin","family":"Chen","sequence":"first","affiliation":[{"name":"The International Joint Institute of Tianjin University, Fuzhou, Tianjin University"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Meng","family":"Tian","sequence":"additional","affiliation":[{"name":"Tianjin University,College of Intelligence and Computing"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Chao","family":"Qiu","sequence":"additional","affiliation":[{"name":"Tianjin University,College of Intelligence and Computing"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xiaofei","family":"Wang","sequence":"additional","affiliation":[{"name":"Tianjin University,College of Intelligence and Computing"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Haipeng","family":"Yao","sequence":"additional","affiliation":[{"name":"Beijing University of Posts and Telecommunications,School of Information and Communication Engineering"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yuan","family":"He","sequence":"additional","affiliation":[{"name":"Tsinghua University,School of Software"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yunhao","family":"Liu","sequence":"additional","affiliation":[{"name":"Tsinghua University,Department of Automation"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","article-title":"Chatgpt: Openai language model (gpt-4)","year":"2024"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1145\/3643505"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/TNET.2020.3042320"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/COMST.2025.3527561"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/INFOCOM48880.2022.9796792"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/TWC.2019.2946140"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/TMC.2024.3366186"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/ICDCS.2017.226"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/JPROC.2019.2920341"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v39i22.34566"},{"key":"ref11","first-page":"19 274","article-title":"Fast inference from transformers via speculative decoding","author":"Leviathan","year":"2023","journal-title":"ICML"},{"key":"ref12","article-title":"Medusa: Simple llm inference acceleration framework with multiple decoding heads","author":"Cai","year":"2024"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1145\/3620666.3651335"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.52202\/075280-1705"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/FMEC65595.2025.11119384"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1109\/ICSA-C65153.2025.00081"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/infocom41043.2020.9155226"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/JIOT.2021.3131407"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/JIOT.2024.3524255"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/INFOCOM52122.2024.10621342"},{"key":"ref21","first-page":"1","article-title":"Efficient large-scale language model training on gpu clusters using megatron-lm","author":"Narayanan","year":"2021","journal-title":"SC"},{"key":"ref22","article-title":"Accelerating large language model decoding with speculative sampling","author":"Chen","year":"2023"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/INFOCOM55648.2025.11044522"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.acl-long.681"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.24963\/ijcai.2023\/563"},{"key":"ref26","article-title":"Beyond the 80\/20 rule: High-entropy minority tokens drive effective reinforcement learning for llm reasoning","author":"Wang","year":"2025"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1145\/3600006.3613165"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.52202\/079017-2000"},{"key":"ref29","first-page":"193","article-title":"Distserve: Disaggregating prefill and decoding for goodput-optimized large language model serving","author":"Zhong","year":"2024","journal-title":"OSDI"},{"key":"ref30","article-title":"Sarathi: Efficient llm inference by piggybacking decodes with chunked prefills","author":"Agrawal","year":"2023"},{"key":"ref31","article-title":"Llama 2: Open foundation and fine-tuned chat models","author":"Touvron","year":"2023"},{"key":"ref32","article-title":"Sharegpt-chinese-english-90k: A bilingual chinese-english human-machine dialogue dataset","year":"2023"},{"key":"ref33","article-title":"Evaluating large language models trained on code","author":"Chen","year":"2021"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.acl-long.134"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1145\/3093337.3037698"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1109\/TCAD.2018.2858384"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.23919\/DATE.2017.7927211"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1145\/3241539.3241559"},{"key":"ref39","first-page":"11 285","article-title":"Tinytl: Reduce memory, not parameters for efficient on-device learning","volume":"33","author":"Cai","year":"2020","journal-title":"NeurIPS"}],"event":{"name":"IEEE INFOCOM 2026 - IEEE Conference on Computer Communications","location":"Tokyo, Japan","start":{"date-parts":[[2026,5,18]]},"end":{"date-parts":[[2026,5,21]]}},"container-title":["IEEE INFOCOM 2026 - IEEE Conference on Computer Communications"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/11571071\/11571169\/11571680.pdf?arnumber=11571680","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,6,30]],"date-time":"2026-06-30T05:13:21Z","timestamp":1782796401000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11571680\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,5,18]]},"references-count":39,"URL":"https:\/\/doi.org\/10.1109\/infocom59046.2026.11571680","relation":{},"subject":[],"published":{"date-parts":[[2026,5,18]]}}}