{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,4]],"date-time":"2026-07-04T11:22:55Z","timestamp":1783164175461,"version":"3.54.6"},"reference-count":55,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,10,1]],"date-time":"2026-10-01T00:00:00Z","timestamp":1790812800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,10,1]],"date-time":"2026-10-01T00:00:00Z","timestamp":1790812800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,10,1]],"date-time":"2026-10-01T00:00:00Z","timestamp":1790812800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,10,1]],"date-time":"2026-10-01T00:00:00Z","timestamp":1790812800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,10,1]],"date-time":"2026-10-01T00:00:00Z","timestamp":1790812800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,10,1]],"date-time":"2026-10-01T00:00:00Z","timestamp":1790812800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,10,1]],"date-time":"2026-10-01T00:00:00Z","timestamp":1790812800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["U21B2025"],"award-info":[{"award-number":["U21B2025"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62402252"],"award-info":[{"award-number":["62402252"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62536003"],"award-info":[{"award-number":["62536003"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Neurocomputing"],"published-print":{"date-parts":[[2026,10]]},"DOI":"10.1016\/j.neucom.2026.134181","type":"journal-article","created":{"date-parts":[[2026,6,4]],"date-time":"2026-06-04T23:49:48Z","timestamp":1780616988000},"page":"134181","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"C","title":["DyToS: Budget-aware dynamic token scheduling for efficient multi-modal large language models"],"prefix":"10.1016","volume":"697","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-5206-9515","authenticated-orcid":false,"given":"Yifei","family":"Xing","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yijie","family":"Yu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Ruiping","family":"Wang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Wenjun","family":"Huang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Qingfang","family":"Zheng","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Dongmei","family":"Jiang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xiangyuan","family":"Lan","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.neucom.2026.134181_bib0005","doi-asserted-by":"crossref","first-page":"34892","DOI":"10.52202\/075280-1516","article-title":"Visual instruction tuning","volume":"36","author":"Liu","year":"2023","journal-title":"Adv. Neural Inf. Process. Syst."},{"issue":"1","key":"10.1016\/j.neucom.2026.134181_bib0010","doi-asserted-by":"crossref","first-page":"27","DOI":"10.1007\/s44267-025-00099-6","article-title":"Efficient multimodal large language models: a survey","volume":"3","author":"Jin","year":"2025","journal-title":"Vis. Intell."},{"key":"10.1016\/j.neucom.2026.134181_bib0015","series-title":"Proceedings of the Computer Vision and Pattern Recognition Conference","first-page":"9392","article-title":"Divprune: diversity-based visual token pruning for large multimodal models","author":"Alvar","year":"2025"},{"key":"10.1016\/j.neucom.2026.134181_bib0020","series-title":"Proceedings of the Computer Vision and Pattern Recognition Conference","article-title":"PyramidDrop: accelerating your large vision-language models via pyramid visual redundancy reduction","author":"Xing","year":"2025"},{"key":"10.1016\/j.neucom.2026.134181_bib0025","series-title":"Forty-Second International Conference on Machine Learning","article-title":"SparseVLM: visual token sparsification for efficient vision-language model inference","author":"Zhang","year":"2024"},{"key":"10.1016\/j.neucom.2026.134181_bib0030","series-title":"Proceedings of the IEEE\/CVF International Conference on Computer Vision","first-page":"22857","article-title":"Llava-prumerge: adaptive token reduction for efficient large multimodal models","author":"Shang","year":"2025"},{"key":"10.1016\/j.neucom.2026.134181_bib0035","series-title":"Token Pruning in Multimodal Large Language Models: Are We Solving the Right Problem?","author":"Wen","year":"2025"},{"issue":"3","key":"10.1016\/j.neucom.2026.134181_bib0040","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1145\/3641289","article-title":"A survey on evaluation of large language models","volume":"15","author":"Chang","year":"2024","journal-title":"ACM Trans. Intell. Syst. Technol."},{"key":"10.1016\/j.neucom.2026.134181_bib0045","author":"Minaee"},{"key":"10.1016\/j.neucom.2026.134181_bib0050","doi-asserted-by":"crossref","DOI":"10.1007\/s11704-026-60308-3","article-title":"A survey of large language models","volume":"20","author":"Zhao","year":"2026","journal-title":"Front. Comput. Sci."},{"key":"10.1016\/j.neucom.2026.134181_bib0055","author":"Touvron"},{"key":"10.1016\/j.neucom.2026.134181_bib0060","series-title":"2024 International Conference on Current Trends in Advanced Computing (ICCTAC)","first-page":"1","article-title":"The evolution of large language model: models, applications and challenges","author":"Sindhu","year":"2024"},{"key":"10.1016\/j.neucom.2026.134181_bib0065","series-title":"International Conference on Machine Learning","first-page":"5156","article-title":"Transformers are RNNS: fast autoregressive transformers with linear attention","author":"Katharopoulos","year":"2020"},{"key":"10.1016\/j.neucom.2026.134181_bib0070","series-title":"Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing (EMNLP-IJCNLP)","first-page":"2463","article-title":"Language models as knowledge bases?","author":"Petroni","year":"2019"},{"key":"10.1016\/j.neucom.2026.134181_bib0075","article-title":"Attention is all you need","volume":"30","author":"Vaswani","year":"2017","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.neucom.2026.134181_bib0080","series-title":"TinyLLaVA: A Framework of Small-Scale Large Multimodal Models","author":"Zhou","year":"2024"},{"key":"10.1016\/j.neucom.2026.134181_bib0085","series-title":"2nd Workshop on Advancing Neural Network Training: Computational Efficiency, Scalability, and Resource Optimization (WANT@ ICML 2024)","article-title":"TinyGPT-V: efficient multimodal large language model via small backbones","author":"Yuan","year":"2023"},{"key":"10.1016\/j.neucom.2026.134181_bib0090","series-title":"Learning to Inference Adaptively for Multimodal Large Language Models","author":"Xu","year":"2025"},{"key":"10.1016\/j.neucom.2026.134181_bib0095","series-title":"EE-MLLM: A Data-Efficient and Compute-Efficient Multimodal Large Language Model","author":"Ma","year":"2024"},{"key":"10.1016\/j.neucom.2026.134181_bib0100","series-title":"Proceedings of the 28th ACM SIGKDD Conference on Knowledge Discovery and Data Mining","first-page":"784","article-title":"Learned token pruning for transformers","author":"Kim","year":"2022"},{"key":"10.1016\/j.neucom.2026.134181_bib0105","doi-asserted-by":"crossref","DOI":"10.1016\/j.neucom.2025.131216","article-title":"Adaptive layer and token selection for efficient fine-tuning of vision transformers","author":"Devoto","year":"2025","journal-title":"Neurocomputing"},{"key":"10.1016\/j.neucom.2026.134181_bib0110","doi-asserted-by":"crossref","DOI":"10.1016\/j.neucom.2024.128747","article-title":"UCC: a unified cascade compression framework for vision transformer models","volume":"612","author":"Chen","year":"2025","journal-title":"Neurocomputing"},{"key":"10.1016\/j.neucom.2026.134181_bib0115","series-title":"Proceedings of the IEEE\/CVF Winter Conference on Applications of Computer Vision","first-page":"2658","article-title":"Revisiting token pruning for object detection and instance segmentation","author":"Liu","year":"2024"},{"key":"10.1016\/j.neucom.2026.134181_bib0120","series-title":"Proceedings of the IEEE\/CVF International Conference on Computer Vision","first-page":"777","article-title":"Dynamic token pruning in plain vision transformers for semantic segmentation","author":"Tang","year":"2023"},{"key":"10.1016\/j.neucom.2026.134181_bib0125","article-title":"Saliency and location aware pruning of deep visual detectors for autonomous driving","volume":"611","author":"Im Choi","year":"2025","journal-title":"Neurocomputing"},{"key":"10.1016\/j.neucom.2026.134181_bib0130","series-title":"Workshop on Efficient Systems for Foundation Models II@ ICML2024","article-title":"LazyLLM: dynamic token pruning for efficient long context LLM inference","author":"Fu","year":"2024"},{"key":"10.1016\/j.neucom.2026.134181_bib0135","doi-asserted-by":"crossref","DOI":"10.1016\/j.neucom.2025.131071","article-title":"Dchf_t: a multi-dimensional adaptive compression approach for transformer-based models","author":"Yan","year":"2025","journal-title":"Neurocomputing"},{"key":"10.1016\/j.neucom.2026.134181_bib0140","author":"Lee"},{"key":"10.1016\/j.neucom.2026.134181_bib0145","doi-asserted-by":"crossref","DOI":"10.1016\/j.neucom.2025.131615","article-title":"RAAG: redundancy-adaptive and attention-guided token pruning for efficient video action detection","author":"Chen","year":"2025","journal-title":"Neurocomputing"},{"key":"10.1016\/j.neucom.2026.134181_bib0150","series-title":"European Conference on Computer Vision","first-page":"19","article-title":"An image is worth 1\/2 tokens after layer 2: plug-and-play inference acceleration for large vision-language models","author":"Chen","year":"2024"},{"key":"10.1016\/j.neucom.2026.134181_bib0155","first-page":"13937","article-title":"Dynamicvit: efficient vision transformers with dynamic token sparsification","volume":"34","author":"Rao","year":"2021","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.neucom.2026.134181_bib0160","author":"Jang"},{"key":"10.1016\/j.neucom.2026.134181_bib0165","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"26296","article-title":"Improved baselines with visual instruction tuning","author":"Liu","year":"2024"},{"key":"10.1016\/j.neucom.2026.134181_bib0170","series-title":"2022 8th International Conference on Virtual Reality (ICVR)","first-page":"21","article-title":"An improved 3D human pose estimation model based on temporal convolution with Gaussian error linear units","author":"Kang","year":"2022"},{"key":"10.1016\/j.neucom.2026.134181_bib0175","series-title":"SC20: International Conference for High Performance Computing, Networking, Storage and Analysis","first-page":"1","article-title":"Zero: memory optimizations toward training trillion parameter models","author":"Rajbhandari","year":"2020"},{"key":"10.1016\/j.neucom.2026.134181_bib0180","series-title":"European Conference on Computer Vision","first-page":"370","article-title":"Sharegpt4v: improving large multi-modal models with better captions","author":"Chen","year":"2024"},{"key":"10.1016\/j.neucom.2026.134181_bib0185","series-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition","first-page":"6904","article-title":"Making the v in VQA matter: elevating the role of image understanding in visual question answering","author":"Goyal","year":"2017"},{"key":"10.1016\/j.neucom.2026.134181_bib0190","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"6700","article-title":"Gqa: a new dataset for real-world visual reasoning and compositional question answering","author":"Hudson","year":"2019"},{"key":"10.1016\/j.neucom.2026.134181_bib0195","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"3195","article-title":"Ok-vqa: a visual question answering benchmark requiring external knowledge","author":"Marino","year":"2019"},{"key":"10.1016\/j.neucom.2026.134181_bib0200","series-title":"2019 International Conference on Document Analysis and Recognition (ICDAR)","first-page":"947","article-title":"OCR-VQA: visual question answering by reading text in images","author":"Mishra","year":"2019"},{"key":"10.1016\/j.neucom.2026.134181_bib0205","series-title":"European Conference on Computer Vision","first-page":"146","article-title":"A-okvqa: a benchmark for visual question answering using world knowledge","author":"Schwenk","year":"2022"},{"key":"10.1016\/j.neucom.2026.134181_bib0210","series-title":"European Conference on Computer Vision","first-page":"742","article-title":"Textcaps: a dataset for image captioning with reading comprehension","author":"Sidorov","year":"2020"},{"key":"10.1016\/j.neucom.2026.134181_bib0215","series-title":"European Conference on Computer Vision","first-page":"69","article-title":"Modeling context in referring expressions","author":"Yu","year":"2016"},{"issue":"1","key":"10.1016\/j.neucom.2026.134181_bib0220","doi-asserted-by":"crossref","first-page":"32","DOI":"10.1007\/s11263-016-0981-7","article-title":"Visual genome: connecting language and vision using crowdsourced dense image annotations","volume":"123","author":"Krishna","year":"2017","journal-title":"Int. J. Comput. Vis."},{"key":"10.1016\/j.neucom.2026.134181_bib0225","doi-asserted-by":"crossref","first-page":"635","DOI":"10.1162\/tacl_a_00566","article-title":"Visual spatial reasoning","volume":"11","author":"Liu","year":"2023","journal-title":"Trans. Assoc. Comput. Linguist."},{"key":"10.1016\/j.neucom.2026.134181_bib0230","series-title":"European Conference on Computer Vision","first-page":"216","article-title":"Mmbench: is your multi-modal model an all-around player?","author":"Liu","year":"2024"},{"key":"10.1016\/j.neucom.2026.134181_bib0235","author":"Fu"},{"issue":"3","key":"10.1016\/j.neucom.2026.134181_bib0240","doi-asserted-by":"crossref","first-page":"289","DOI":"10.1007\/s00799-022-00329-y","article-title":"Scienceqa: a novel resource for question answering on scholarly articles","volume":"23","author":"Saikh","year":"2022","journal-title":"Int. J. Digit. Libr."},{"key":"10.1016\/j.neucom.2026.134181_bib0245","doi-asserted-by":"crossref","first-page":"661","DOI":"10.1007\/s10579-020-09517-1","article-title":"AI2D-RST: a multimodal corpus of 1000 primary school science diagrams","volume":"55","author":"Hiippala","year":"2021","journal-title":"Lang. Resour. Eval."},{"key":"10.1016\/j.neucom.2026.134181_bib0250","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"13299","article-title":"SEED-bench: benchmarking multimodal large language models","author":"Li","year":"2024"},{"key":"10.1016\/j.neucom.2026.134181_bib0255","series-title":"Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing","first-page":"292","article-title":"Evaluating object hallucination in large vision-language models","author":"Li","year":"2023"},{"key":"10.1016\/j.neucom.2026.134181_bib0260","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"14375","article-title":"HallusionBench: an advanced diagnostic suite for entangled language hallucination and visual illusion in large vision-language models","author":"Guan","year":"2024"},{"key":"10.1016\/j.neucom.2026.134181_bib0265","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"8317","article-title":"Towards VQA models that can read","author":"Singh","year":"2019"},{"issue":"10","key":"10.1016\/j.neucom.2026.134181_bib0270","doi-asserted-by":"crossref","first-page":"6794","DOI":"10.1007\/s11263-025-02491-7","article-title":"Tokenpacker: efficient visual projector for multimodal LLM","volume":"133","author":"Li","year":"2025","journal-title":"Int. J. Comput. Vis."},{"key":"10.1016\/j.neucom.2026.134181_bib0275","author":"Cai"}],"container-title":["Neurocomputing"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0925231226015791?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0925231226015791?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,7,4]],"date-time":"2026-07-04T11:06:10Z","timestamp":1783163170000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0925231226015791"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,10]]},"references-count":55,"alternative-id":["S0925231226015791"],"URL":"https:\/\/doi.org\/10.1016\/j.neucom.2026.134181","relation":{},"ISSN":["0925-2312"],"issn-type":[{"value":"0925-2312","type":"print"}],"subject":[],"published":{"date-parts":[[2026,10]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"DyToS: Budget-aware dynamic token scheduling for efficient multi-modal large language models","name":"articletitle","label":"Article Title"},{"value":"Neurocomputing","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.neucom.2026.134181","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Elsevier B.V. All rights are reserved, including those for text and data mining, AI training, and similar technologies.","name":"copyright","label":"Copyright"}],"article-number":"134181"}}