{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,7]],"date-time":"2026-07-07T15:51:23Z","timestamp":1783439483106,"version":"3.54.6"},"reference-count":91,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","license":[{"start":{"date-parts":[[2023,1,1]],"date-time":"2023-01-01T00:00:00Z","timestamp":1672531200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2023,1,1]],"date-time":"2023-01-01T00:00:00Z","timestamp":1672531200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2023,1,1]],"date-time":"2023-01-01T00:00:00Z","timestamp":1672531200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Pattern Anal. Mach. Intell."],"published-print":{"date-parts":[[2023]]},"DOI":"10.1109\/tpami.2022.3231442","type":"journal-article","created":{"date-parts":[[2022,12,22]],"date-time":"2022-12-22T18:38:48Z","timestamp":1671734328000},"page":"1-13","source":"Crossref","is-referenced-by-count":11,"title":["What Makes for Good Tokenizers in Vision Transformer?"],"prefix":"10.1109","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-3386-0336","authenticated-orcid":false,"given":"Shengju","family":"Qian","sequence":"first","affiliation":[{"name":"Department of Computer Science and Engineering, The Chinese University of Hong Kong, Hong Kong"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yi","family":"Zhu","sequence":"additional","affiliation":[{"name":"Amazon AI, Amazon.com Inc, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-4604-778X","authenticated-orcid":false,"given":"Wenbo","family":"Li","sequence":"additional","affiliation":[{"name":"Department of Computer Science and Engineering, The Chinese University of Hong Kong, Hong Kong"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Mu","family":"Li","sequence":"additional","affiliation":[{"name":"Amazon AI, Amazon.com Inc, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-1246-553X","authenticated-orcid":false,"given":"Jiaya","family":"Jia","sequence":"additional","affiliation":[{"name":"Department of Computer Science and Engineering, The Chinese University of Hong Kong, Hong Kong"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00009"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00244"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00061"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.167"},{"key":"ref15","first-page":"9640","article-title":"An empirical study of training self-supervised visual transformers","author":"chen","year":"0","journal-title":"Proc IEEE\/CVF Int Conf Comput Vis"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01264-9_9"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00060"},{"key":"ref58","article-title":"cGANs with projection discriminator","author":"miyato","year":"2018"},{"key":"ref53","first-page":"10524","article-title":"On layer normalization in the transformer architecture","author":"xiong","year":"0","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref52","first-page":"302","article-title":"Semantic understanding of scenes through the ade20 k dataset","author":"zhou","year":"0","journal-title":"Int J Comput Vis"},{"key":"ref11","article-title":"Canine: Pre-training an efficient tokenization-free encoder for language representation","author":"clark","year":"2021"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00010"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/P18-1007"},{"key":"ref54","first-page":"8741","article-title":"Powernorm: Rethinking batch normalization in transformers","author":"shen","year":"0","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref17","article-title":"Training data-efficient image transformers & distillation through attention","author":"touvron","year":"2020"},{"key":"ref16","article-title":"Attention is all you need","author":"vaswani","year":"0","journal-title":"Proc Neural Inf Process Syst"},{"key":"ref19","article-title":"Autoaugment: Learning augmentation policies from data","author":"cubuk","year":"2018"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/CVPRW50498.2020.00359"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1145\/3474085.3475467"},{"key":"ref50","first-page":"15908","article-title":"Transformer in transformer","author":"han","year":"0","journal-title":"Proc Neural Inf Process Syst"},{"key":"ref91","article-title":"MMSegmentation: Openmmlab semantic segmentation toolbox and benchmark","author":"contributors","year":"2020"},{"key":"ref90","article-title":"Mocov3","author":"research","year":"2019"},{"key":"ref46","article-title":"Crossformer: A versatile vision transformer hinging on cross-scale attention","author":"wang","year":"2021"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/D19-1448"},{"key":"ref89","first-page":"418","article-title":"Unified perceptual parsing for scene understanding","author":"xiao","year":"0","journal-title":"Proc IEEE Eur Conf Comput Vis"},{"key":"ref48","first-page":"531","article-title":"Mutual information neural estimation","author":"belghazi","year":"0","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00675"},{"key":"ref42","article-title":"Auto-encoding variational bayes","author":"kingma","year":"2013"},{"key":"ref86","article-title":"Mmdetection: Open mmlab detection toolbox and benchmark","author":"chen","year":"2019"},{"key":"ref41","first-page":"3371","article-title":"Stacked denoising autoencoders: Learning useful representations in a deep network with a local denoising criterion","author":"vincent","year":"2010","journal-title":"J Mach Learn Res"},{"key":"ref85","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00644"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1088\/1742-5468\/ab3985"},{"key":"ref88","article-title":"Beit: Bert pre-training of image transformers","author":"bao","year":"2021"},{"key":"ref43","article-title":"Learning deep representations by mutual information estimation and maximization","author":"hjelm","year":"0","journal-title":"Proc Int Conf Learn Representations"},{"key":"ref87","article-title":"Masked autoencoders are scalable vision learners","author":"he","year":"2021"},{"key":"ref49","first-page":"5416","article-title":"Blending anti-aliasing into vision transformer","author":"qian","year":"0","journal-title":"Proc Neural Inf Process Syst"},{"key":"ref8","first-page":"30392","article-title":"Early convolutions help transformers see better","author":"xiao","year":"0","journal-title":"Proc Neural Inf Process Syst"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2020.coling-main.609"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/P16-1162"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00681"},{"key":"ref3","article-title":"Deformable DETR: Deformable transformers for end-to-end object detection","author":"zhu","year":"0","journal-title":"Proc Int Conf Learn Representations"},{"key":"ref6","article-title":"Charformer: Fast character transformers via gradient-based subword tokenization","author":"tay","year":"2021"},{"key":"ref5","article-title":"Segformer: Simple and efficient design for semantic segmentation with transformers","author":"xie","year":"2021"},{"key":"ref82","first-page":"173","article-title":"Object-contextual representations for semantic segmentation","author":"yuan","year":"0","journal-title":"Proc IEEE Eur Conf Comput Vis"},{"key":"ref81","article-title":"Fixing weight decay regularization in Adam","author":"loshchilov","year":"2018"},{"key":"ref40","first-page":"18590","article-title":"All tokens matter: Token labeling for training better vision transformers","author":"jiang","year":"0","journal-title":"Proc Neural Inf Process Syst"},{"key":"ref84","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.322"},{"key":"ref83","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.324"},{"key":"ref80","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.244"},{"key":"ref35","article-title":"Token pooling in vision transformers","author":"marin","year":"2021"},{"key":"ref79","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01264-9_47"},{"key":"ref34","article-title":"Google&#x2019;s neural machine translation system: Bridging the gap between human and machine translation","author":"wu","year":"2016"},{"key":"ref78","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-46475-6_43"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00462"},{"key":"ref36","article-title":"PVTV2: Improved baselines with pyramid vision transformer","author":"wang","year":"2021"},{"key":"ref31","first-page":"13937","article-title":"Dynamicvit: Efficient vision transformers with dynamic token sparsification","author":"rao","year":"0","journal-title":"Proc Neural Inf Process Syst"},{"key":"ref75","first-page":"583","article-title":"Greedy layerwise learning can scale to imagenet","author":"belilovsky","year":"0","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref30","article-title":"Not all images are worth 16x16 words: Dynamic vision transformers with adaptive sequence length","author":"wang","year":"0","journal-title":"Proc Neural Inf Process Syst"},{"key":"ref74","article-title":"Revisiting locally supervised learning: An alternative to end-to-end training","author":"wang","year":"0","journal-title":"Proc Int Conf Learn Representations"},{"key":"ref33","article-title":"Frage: Frequency-agnostic word representation","author":"gong","year":"0","journal-title":"Proc Neural Inf Process Syst"},{"key":"ref77","first-page":"307","article-title":"Noise-contrastive estimation of unnormalized statistical models, with applications to natural image statistics","author":"gutmann","year":"0","journal-title":"J Mach Learn Res"},{"key":"ref32","first-page":"24898","article-title":"Ia-red $^{2}$2: Interpretability-aware redundancy reduction for vision transformers","author":"pan","year":"0","journal-title":"Proc Neural Inf Process Syst"},{"key":"ref76","article-title":"A mutual information maximization perspective of language representation learning","author":"kong","year":"0","journal-title":"Proc Int Conf Learn Representations"},{"key":"ref2","first-page":"213","article-title":"End-to-end object detection with transformers","author":"carion","year":"0","journal-title":"Proc IEEE Eur Conf Comput Vis"},{"key":"ref1","article-title":"An image is worth 16x16 words: Transformers for image recognition at scale","author":"dosovitskiy","year":"0","journal-title":"Proc Int Conf Learn Representations"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00044"},{"key":"ref38","article-title":"Tokenlearner: What can 8 learned tokens do for images and videos?","author":"ryoo","year":"0","journal-title":"Proc Neural Inf Process Syst"},{"key":"ref71","article-title":"Layer normalization","author":"ba","year":"2016"},{"key":"ref70","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01228-1_32"},{"key":"ref73","article-title":"BERT: Pre-training of deep bidirectional transformers for language understanding","author":"devlin","year":"2018"},{"key":"ref72","doi-asserted-by":"publisher","DOI":"10.1109\/ICCVW54120.2021.00050"},{"key":"ref24","first-page":"3965","article-title":"Coatnet: Marrying convolution and attention for all data sizes","author":"dai","year":"2021","journal-title":"Neural Inf Process Syst"},{"key":"ref68","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01225-0_29"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00983"},{"key":"ref67","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00514"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.01270"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00986"},{"key":"ref69","article-title":"Revisiting batch normalization for practical domain adaptation","author":"li","year":"2016"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00063"},{"key":"ref64","article-title":"T2t vit","year":"2021"},{"key":"ref63","article-title":"Swin transformer","year":"2021"},{"key":"ref22","article-title":"Conditional positional encodings for vision transformers","author":"chu","year":"2021"},{"key":"ref66","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2009.5206848"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00041"},{"key":"ref65","article-title":"Pvt","author":"transformer","year":"0"},{"key":"ref28","first-page":"21297","article-title":"Soft: Softmax-free transformer with linear complexity","author":"lu","year":"0","journal-title":"Neural Inf Process Syst"},{"key":"ref27","article-title":"Focal self-attention for local-global interactions in vision transformers","author":"yang","year":"0","journal-title":"Neural Inf Process Syst"},{"key":"ref29","first-page":"9355","article-title":"Twins: Revisiting the design of spatial attention in vision transformers","author":"chu","year":"0","journal-title":"Proc Neural Inf Process Syst"},{"key":"ref60","article-title":"Instance normalization: The missing ingredient for fast stylization","author":"ulyanov","year":"2016"},{"key":"ref62","article-title":"Deit","author":"research","year":"0"},{"key":"ref61","article-title":"Pytorch image models","author":"wightman","year":"2019"}],"container-title":["IEEE Transactions on Pattern Analysis and Machine Intelligence"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/34\/4359286\/09996581.pdf?arnumber=9996581","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,10,4]],"date-time":"2023-10-04T14:40:41Z","timestamp":1696430441000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/9996581\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023]]},"references-count":91,"URL":"https:\/\/doi.org\/10.1109\/tpami.2022.3231442","relation":{},"ISSN":["0162-8828","2160-9292","1939-3539"],"issn-type":[{"value":"0162-8828","type":"print"},{"value":"2160-9292","type":"electronic"},{"value":"1939-3539","type":"electronic"}],"subject":[],"published":{"date-parts":[[2023]]}}}