{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,25]],"date-time":"2026-05-25T20:08:03Z","timestamp":1779739683347,"version":"3.53.1"},"reference-count":89,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"11","license":[{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"name":"National Key Research and Development Program of China","award":["2023YFB2904100"],"award-info":[{"award-number":["2023YFB2904100"]}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62502014"],"award-info":[{"award-number":["62502014"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62576045"],"award-info":[{"award-number":["62576045"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"BUPT Excellent Ph.D. Students Foundation","doi-asserted-by":"publisher","award":["CX20242004"],"award-info":[{"award-number":["CX20242004"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Internet Things J."],"published-print":{"date-parts":[[2026,6,1]]},"DOI":"10.1109\/jiot.2026.3669144","type":"journal-article","created":{"date-parts":[[2026,3,2]],"date-time":"2026-03-02T20:57:02Z","timestamp":1772485022000},"page":"22873-22892","source":"Crossref","is-referenced-by-count":0,"title":["<i>SEC<\/i>\n                    : Enabling MLLMs for Low-Latency IoT Video Analysis via Semantic-Aware Edge\u2013Cloud Collaboration"],"prefix":"10.1109","volume":"13","author":[{"ORCID":"https:\/\/orcid.org\/0000-0001-7832-0926","authenticated-orcid":false,"given":"Mengyu","family":"Yang","sequence":"first","affiliation":[{"name":"State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-6683-5524","authenticated-orcid":false,"given":"Ye","family":"Tian","sequence":"additional","affiliation":[{"name":"State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-0563-745X","authenticated-orcid":false,"given":"Peizhuang","family":"Cong","sequence":"additional","affiliation":[{"name":"School of Computer Science, Peking University, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Lanshan","family":"Zhang","sequence":"additional","affiliation":[{"name":"Beijing Key Laboratory of Network System and Network Culture, Beijing University of Posts and Telecommunications, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0008-3702-3667","authenticated-orcid":false,"given":"Gongli","family":"Xi","sequence":"additional","affiliation":[{"name":"State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-9589-4956","authenticated-orcid":false,"given":"Song","family":"Wang","sequence":"additional","affiliation":[{"name":"School of Intelligent Engineering and Automation, Beijing University of Posts and Telecommunications, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-6418-8087","authenticated-orcid":false,"given":"Wendong","family":"Wang","sequence":"additional","affiliation":[{"name":"State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","article-title":"A survey on video analytics in cloud-edge-terminal collaborative systems","author":"Gong","year":"2025","journal-title":"arXiv:2502.06581"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/JIOT.2025.3590733"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/JSAC.2022.3180801"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/COMST.2025.3563377"},{"key":"ref5","first-page":"45682","article-title":"Cost-efficient collaboration between on-device and cloud language models","volume-title":"Proc. 42nd Int. Conf. Mach. Learn.","author":"Narayan"},{"key":"ref6","article-title":"Collaborative inference and learning between edge SLMs and cloud LLMs: A survey of algorithms, execution, and open challenges","author":"Li","year":"2025","journal-title":"arXiv:2507.16731"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/TBC.2025.3549983"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/JIOT.2025.3598979"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/JIOT.2025.3611003"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/JIOT.2024.3379394"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/TMC.2024.3429235"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/TMC.2025.3559919"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/OJCOMS.2024.3439558"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1145\/3581783.3612035"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/JIOT.2024.3388045"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1109\/JIOT.2022.3224750"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.52202\/075280-1516"},{"key":"ref18","article-title":"Qwen2-VL: Enhancing vision-language model\u2019s perception of the world at any resolution","author":"Wang","year":"2024","journal-title":"arXiv:2409.12191"},{"key":"ref19","article-title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","author":"Chen","year":"2024","journal-title":"arXiv:2412.05271"},{"key":"ref20","article-title":"LLaMA: Open and efficient foundation language models","author":"Touvron","year":"2023","journal-title":"arXiv:2302.13971"},{"key":"ref21","article-title":"Internlm: A multilingual language model with progressively enhanced capabilities","author":"Team","year":"2023"},{"key":"ref22","article-title":"Qwen3 technical report","volume-title":"arXiv:2505.09388","author":"Yang","year":"2025"},{"key":"ref23","article-title":"Video-LLaVA: Learning united visual representation by alignment before projection","author":"Lin","year":"2023","journal-title":"arXiv:2311.10122"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v39i1.32104"},{"key":"ref25","article-title":"Fast and cost-effective speculative edge-cloud decoding with early exits","author":"Venkatesha","year":"2025","journal-title":"arXiv:2505.21594"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1109\/TON.2024.3523956"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00137"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.01594"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.48550\/ARXIV.1706.03762"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.findings-emnlp.257"},{"key":"ref31","first-page":"8285","article-title":"On speculative decoding for multimodal large language models","volume-title":"Proc. IEEE\/CVF Conf. Comput. Vis. Pattern Recognit.","author":"Gagrani"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1145\/3620666.3651335"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.2174\/2213275911666180719111118"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1109\/IJCNN60899.2024.10650436"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52734.2025.01279"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51701.2025.02048"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52734.2025.02711"},{"key":"ref38","first-page":"5209","article-title":"Medusa: Simple LLM inference acceleration framework with multiple decoding heads","volume-title":"Proc. 41st Int. Conf. Mach. Learn.","author":"Cai"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52734.2025.02245"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.52202\/079017-0907"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.52202\/075280-1852"},{"key":"ref42","first-page":"5583","article-title":"ViLT: Vision-and-language transformer without convolution or region supervision","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Kim"},{"key":"ref43","first-page":"8748","article-title":"Learning transferable visual models from natural language supervision","volume-title":"Proc. ICML","author":"Radford"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19809-0_27"},{"key":"ref45","article-title":"Qwen2.5-VL technical report","volume-title":"arXiv:2502.13923","author":"Bai","year":"2025"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1007\/s11432-024-4231-5"},{"key":"ref47","first-page":"4904","article-title":"Scaling up visual and vision-language representation learning with noisy text supervision","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Jia"},{"key":"ref48","article-title":"FILIP: Fine-grained interactive language-image pre-training","author":"Yao","year":"2021","journal-title":"arXiv:2111.07783"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.00461"},{"key":"ref50","first-page":"1877","article-title":"Language models are few-shot learners","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"33","author":"Brown"},{"key":"ref51","article-title":"PaLM 2 technical report","volume-title":"arXiv:2305.10403","author":"Anil","year":"2023"},{"key":"ref52","first-page":"27730","article-title":"Training language models to follow instructions with human feedback","volume-title":"Proc. Adv. Neural Inf. Process. Syst. (NeurIPS)","volume":"35","author":"Ouyang"},{"key":"ref53","first-page":"22243","article-title":"Big self-supervised models are strong semi-supervised learners","volume-title":"Proc. Adv. Neural Inf. Process. Syst. (NeurIPS)","volume":"33","author":"Chen"},{"key":"ref54","article-title":"The llama 3 herd of models","author":"Grattafiori","year":"2024","journal-title":"arXiv:2407.21783"},{"key":"ref55","first-page":"9694","article-title":"Align before fuse: Vision and language representation learning with momentum distillation","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"34","author":"Li"},{"key":"ref56","first-page":"12888","article-title":"BLIP: Bootstrapping language-image pre-training for unified vision-language understanding and generation","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Li"},{"key":"ref57","article-title":"Emu3: Next-token prediction is all you need","author":"Wang","year":"2024","journal-title":"arXiv:2409.18869"},{"key":"ref58","article-title":"MoMa: Efficient early-fusion pre-training with mixture of modality-aware experts","author":"Victoria Lin","year":"2024","journal-title":"arXiv:2407.21770"},{"key":"ref59","article-title":"Vision as LoRA","author":"Wang","year":"2025","journal-title":"arXiv:2503.20680"},{"key":"ref60","first-page":"10107","article-title":"Blockwise parallel decoding for deep autoregressive models","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"31","author":"Stern"},{"key":"ref61","article-title":"Accelerating large language model decoding with speculative sampling","author":"Chen","year":"2023","journal-title":"arXiv:2302.01318"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.52202\/075280-1705"},{"key":"ref63","first-page":"19274","article-title":"Fast inference from transformers via speculative decoding","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Leviathan"},{"key":"ref64","doi-asserted-by":"publisher","DOI":"10.1145\/3637528.3671614"},{"key":"ref65","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v39i23.34647"},{"key":"ref66","doi-asserted-by":"publisher","DOI":"10.52202\/075280-1314"},{"key":"ref67","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.findings-acl.179"},{"key":"ref68","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.293"},{"key":"ref69","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00748"},{"key":"ref70","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19772-7_14"},{"key":"ref71","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01943"},{"key":"ref72","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00640"},{"key":"ref73","doi-asserted-by":"publisher","DOI":"10.52202\/079017-0614"},{"key":"ref74","article-title":"GPT-4 technical report","volume-title":"arXiv:2303.08774","author":"Achiam","year":"2023"},{"key":"ref75","article-title":"Gemini: A family of highly capable multimodal models","author":"Team","year":"2023","journal-title":"arXiv:2312.11805"},{"key":"ref76","article-title":"VideoLLaMA 2: Advancing spatial\u2013temporal modeling and audio understanding in video-LLMs","author":"Cheng","year":"2024","journal-title":"arXiv:2406.07476"},{"key":"ref77","article-title":"LLaVA-OneVision: Easy visual task transfer","author":"Li","year":"2024","journal-title":"arXiv:2408.03326"},{"key":"ref78","article-title":"PLLaVA: Parameter-free LLaVA extension from images to videos for video dense captioning","author":"Xu","year":"2024","journal-title":"arXiv:2404.16994"},{"key":"ref79","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.01282"},{"key":"ref80","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.01300"},{"key":"ref81","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.02008"},{"key":"ref82","article-title":"MiniCPM-V: A GPT-4 V level MLLM on your phone","author":"Yao","year":"2024","journal-title":"arXiv:2408.01800"},{"key":"ref83","article-title":"MME: A comprehensive evaluation benchmark for multimodal large language models","author":"Fu","year":"2023","journal-title":"arXiv:2306.13394"},{"key":"ref84","article-title":"MM-Vet: Evaluating large multimodal models for integrated capabilities","author":"Yu","year":"2023","journal-title":"arXiv:2308.02490"},{"key":"ref85","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.00913"},{"key":"ref86","doi-asserted-by":"publisher","DOI":"10.54216\/FPA.160111"},{"key":"ref87","doi-asserted-by":"publisher","DOI":"10.1109\/JIOT.2025.3529723"},{"key":"ref88","doi-asserted-by":"publisher","DOI":"10.1109\/JIOT.2025.3579917"},{"key":"ref89","doi-asserted-by":"publisher","DOI":"10.1109\/INFOCOM55648.2025.11044551"}],"container-title":["IEEE Internet of Things Journal"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/6488907\/11534158\/11417857.pdf?arnumber=11417857","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,5,25]],"date-time":"2026-05-25T19:57:03Z","timestamp":1779739023000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11417857\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,6,1]]},"references-count":89,"journal-issue":{"issue":"11"},"URL":"https:\/\/doi.org\/10.1109\/jiot.2026.3669144","relation":{},"ISSN":["2327-4662","2372-2541"],"issn-type":[{"value":"2327-4662","type":"electronic"},{"value":"2372-2541","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026,6,1]]}}}