{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,8,28]],"date-time":"2026-08-28T17:12:50Z","timestamp":1787937170509,"version":"build-2784847793"},"reference-count":34,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,5,14]],"date-time":"2026-05-14T00:00:00Z","timestamp":1778716800000},"content-version":"vor","delay-in-days":0,"URL":"http:\/\/creativecommons.org\/licenses\/by\/4.0\/"}],"funder":[{"DOI":"10.13039\/501100001695","name":"Japan Science and Technology Corporation","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100001695","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100002241","name":"Japan Science and Technology Agency","doi-asserted-by":"publisher","award":["JPMJBS2428"],"award-info":[{"award-number":["JPMJBS2428"]}],"id":[{"id":"10.13039\/501100002241","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Neurocomputing"],"published-print":{"date-parts":[[2026,9]]},"DOI":"10.1016\/j.neucom.2026.133976","type":"journal-article","created":{"date-parts":[[2026,5,15]],"date-time":"2026-05-15T16:11:54Z","timestamp":1778861514000},"page":"133976","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":2,"special_numbering":"C","title":["Rethinking attention reliability for token pruning in vision transformers"],"prefix":"10.1016","volume":"694","author":[{"ORCID":"https:\/\/orcid.org\/0009-0000-3161-2200","authenticated-orcid":false,"given":"Ryuto","family":"Ishibashi","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0003-2294-5208","authenticated-orcid":false,"given":"Hayata","family":"Kaneko","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-4351-6923","authenticated-orcid":false,"given":"Lin","family":"Meng","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.neucom.2026.133976_bib0005","author":"Dosovitskiy"},{"key":"10.1016\/j.neucom.2026.133976_bib0010","first-page":"13937","article-title":"Dynamicvit: efficient vision transformers with dynamic token sparsification","volume":"34","author":"Rao","year":"2021","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.neucom.2026.133976_bib0015","author":"Liang"},{"key":"10.1016\/j.neucom.2026.133976_bib0020","series-title":"European Conference on Computer Vision","first-page":"396","article-title":"Adaptive token sampling for efficient vision transformers","author":"Fayyaz","year":"2022"},{"key":"10.1016\/j.neucom.2026.133976_bib0025","series-title":"The Eleventh International Conference on Learning Representations","article-title":"Token merging: your ViT but faster","author":"Bolya","year":"2023"},{"key":"10.1016\/j.neucom.2026.133976_bib0030","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"782","article-title":"Transformer interpretability beyond attention visualization","author":"Chefer","year":"2021"},{"key":"10.1016\/j.neucom.2026.133976_bib0035","author":"Jain"},{"key":"10.1016\/j.neucom.2026.133976_bib0040","first-page":"12116","article-title":"Do vision transformers see like convolutional neural networks?","volume":"34","author":"Raghu","year":"2021","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.neucom.2026.133976_bib0045","author":"Park"},{"key":"10.1016\/j.neucom.2026.133976_bib0050","series-title":"Proceedings of the IEEE\/CVF International Conference on Computer Vision","first-page":"773","article-title":"Which tokens to use? Investigating token reduction in vision transformers","author":"Haurum","year":"2023"},{"key":"10.1016\/j.neucom.2026.133976_bib0055","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"2092","article-title":"Joint token pruning and squeezing towards more aggressive compression of vision transformers","author":"Wei","year":"2023"},{"key":"10.1016\/j.neucom.2026.133976_bib0060","author":"Liu"},{"key":"10.1016\/j.neucom.2026.133976_bib0065","author":"Molchanov"},{"key":"10.1016\/j.neucom.2026.133976_bib0070","series-title":"Proceedings of the IEEE\/CVF International Conference on Computer Vision","first-page":"9650","article-title":"Emerging properties in self-supervised vision transformers","author":"Caron","year":"2021"},{"key":"10.1016\/j.neucom.2026.133976_bib0075","series-title":"International Conference on Machine Learning","first-page":"10347","article-title":"Training data-efficient image transformers & distillation through attention","author":"Touvron","year":"2021"},{"key":"10.1016\/j.neucom.2026.133976_bib0080","series-title":"2009 IEEE Conference on Computer Vision and Pattern Recognition","first-page":"248","article-title":"ImageNet: a large-scale hierarchical image database","author":"Deng","year":"2009"},{"key":"10.1016\/j.neucom.2026.133976_bib0085","author":"Abnar"},{"issue":"5","key":"10.1016\/j.neucom.2026.133976_bib0090","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1007\/s10489-025-06265-z","article-title":"Automatic pruning rate adjustment for dynamic token reduction in vision transformer","volume":"55","author":"Ishibashi","year":"2025","journal-title":"Appl. Intell."},{"key":"10.1016\/j.neucom.2026.133976_bib0095","series-title":"Proceedings of the IEEE\/CVF Winter Conference on Applications of Computer Vision","first-page":"12","article-title":"Token pooling in vision transformers for image classification","author":"Marin","year":"2023"},{"key":"10.1016\/j.neucom.2026.133976_bib0100","author":"Jeddi"},{"key":"10.1016\/j.neucom.2026.133976_bib0105","series-title":"Concentration in the Steel Industry","author":"Herfindahl","year":"1997"},{"key":"10.1016\/j.neucom.2026.133976_bib0110","article-title":"How to train your ViT? Data, augmentation, and regularization in vision transformers","author":"Steiner","year":"2022","journal-title":"Trans. Mach. Learn. Res."},{"key":"10.1016\/j.neucom.2026.133976_bib0115","author":"Oquab"},{"key":"10.1016\/j.neucom.2026.133976_bib0120","series-title":"ICCV","article-title":"Sigmoid loss for language image pre-training","author":"Zhai","year":"2023"},{"key":"10.1016\/j.neucom.2026.133976_bib0125","series-title":"Proceedings of the IEEE\/CVF International Conference on Computer Vision","first-page":"10012","article-title":"Swin transformer: hierarchical vision transformer using shifted windows","author":"Liu","year":"2021"},{"key":"10.1016\/j.neucom.2026.133976_bib0130","series-title":"Proceedings of the IEEE\/CVF International Conference on Computer Vision","first-page":"568","article-title":"Pyramid vision transformer: a versatile backbone for dense prediction without convolutions","author":"Wang","year":"2021"},{"key":"10.1016\/j.neucom.2026.133976_bib0135","series-title":"The Caltech-Ucsd birds-200-2011 Dataset","author":"Wah","year":"2011"},{"key":"10.1016\/j.neucom.2026.133976_bib0140","series-title":"2006 IEEE Computer Society Conference on Computer Vision and Pattern Recognition (CVPR\u201906)","first-page":"1447","article-title":"A visual vocabulary for flower classification","volume":"vol. 2","author":"Nilsback","year":"2006"},{"key":"10.1016\/j.neucom.2026.133976_bib0145","series-title":"2012 IEEE Conference on Computer Vision and Pattern Recognition","first-page":"3498","article-title":"Cats and dogs","author":"Parkhi","year":"2012"},{"key":"10.1016\/j.neucom.2026.133976_bib0150","series-title":"2009 IEEE Conference on Computer Vision and Pattern Recognition","first-page":"413","article-title":"Recognizing indoor scenes","author":"Quattoni","year":"2009"},{"key":"10.1016\/j.neucom.2026.133976_bib0155","series-title":"Collecting a Large-Scale Dataset of Fine-Grained Cars","author":"Krause","year":"2013"},{"key":"10.1016\/j.neucom.2026.133976_bib0160","series-title":"Learning Multiple Layers of Features From Tiny Images","author":"Krizhevsky","year":"2009"},{"key":"10.1016\/j.neucom.2026.133976_bib0165","article-title":"ImageNet-21K pretraining for the masses","volume":"abs\/2104.10972","author":"Ridnik","year":"2021","journal-title":"CoRR"},{"issue":"1","key":"10.1016\/j.neucom.2026.133976_bib0170","doi-asserted-by":"crossref","first-page":"72","DOI":"10.2307\/1412159","article-title":"The proof and measurement of association between two things","volume":"15","author":"Spearman","year":"1904","journal-title":"Am. J. Psychol."}],"container-title":["Neurocomputing"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0925231226013743?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0925231226013743?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,8,27]],"date-time":"2026-08-27T16:24:01Z","timestamp":1787847841000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0925231226013743"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,9]]},"references-count":34,"alternative-id":["S0925231226013743"],"URL":"https:\/\/doi.org\/10.1016\/j.neucom.2026.133976","relation":{},"ISSN":["0925-2312"],"issn-type":[{"value":"0925-2312","type":"print"}],"subject":[],"published":{"date-parts":[[2026,9]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"Rethinking attention reliability for token pruning in vision transformers","name":"articletitle","label":"Article Title"},{"value":"Neurocomputing","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.neucom.2026.133976","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 The Author(s). Published by Elsevier B.V.","name":"copyright","label":"Copyright"}],"article-number":"133976"}}