{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,8,18]],"date-time":"2026-08-18T00:35:36Z","timestamp":1787013336487,"version":"build-2736575974"},"reference-count":77,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"4","license":[{"start":{"date-parts":[[2025,4,1]],"date-time":"2025-04-01T00:00:00Z","timestamp":1743465600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2025,4,1]],"date-time":"2025-04-01T00:00:00Z","timestamp":1743465600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2025,4,1]],"date-time":"2025-04-01T00:00:00Z","timestamp":1743465600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"name":"National Key Research and Development Program of China","award":["2022YFB3104700"],"award-info":[{"award-number":["2022YFB3104700"]}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62425114"],"award-info":[{"award-number":["62425114"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62121002"],"award-info":[{"award-number":["62121002"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["U23B2028"],"award-info":[{"award-number":["U23B2028"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62232006"],"award-info":[{"award-number":["62232006"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62272436"],"award-info":[{"award-number":["62272436"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"name":"CAS Project for Young Scientists in Basic Research","award":["YSBR-067"],"award-info":[{"award-number":["YSBR-067"]}]},{"name":"GPU cluster built by MCC Lab of Information Science and Technology Institution, USTC"},{"name":"advanced computing resources provided by the Supercomputing Center of the USTC"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Pattern Anal. Mach. Intell."],"published-print":{"date-parts":[[2025,4]]},"DOI":"10.1109\/tpami.2025.3528228","type":"journal-article","created":{"date-parts":[[2025,1,10]],"date-time":"2025-01-10T15:26:10Z","timestamp":1736522770000},"page":"2615-2631","source":"Crossref","is-referenced-by-count":11,"title":["DHVT: Dynamic Hybrid Vision Transformer for Small Dataset Recognition"],"prefix":"10.1109","volume":"47","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-1720-7193","authenticated-orcid":false,"given":"Zhiying","family":"Lu","sequence":"first","affiliation":[{"name":"School of Information Science and Technology, University of Science and Technology of China, Hefei, Anhui, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-2840-6235","authenticated-orcid":false,"given":"Chuanbin","family":"Liu","sequence":"additional","affiliation":[{"name":"School of Information Science and Technology, University of Science and Technology of China, Hefei, Anhui, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-7778-8807","authenticated-orcid":false,"given":"Xiaojun","family":"Chang","sequence":"additional","affiliation":[{"name":"School of Information Science and Technology, University of Science and Technology of China, Hefei, Anhui, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-1151-1792","authenticated-orcid":false,"given":"Yongdong","family":"Zhang","sequence":"additional","affiliation":[{"name":"School of Information Science and Technology, University of Science and Technology of China, Hefei, Anhui, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-6249-5315","authenticated-orcid":false,"given":"Hongtao","family":"Xie","sequence":"additional","affiliation":[{"name":"School of Information Science and Technology, University of Science and Technology of China, Hefei, Anhui, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","article-title":"An image is worth 16x16 words: Transformers for image recognition at scale","author":"Dosovitskiy","year":"2020"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00986"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19806-9_19"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00042"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58452-8_13"},{"key":"ref6","article-title":"Deformable DETR: Deformable transformers for end-to-end object detection","author":"Zhu","year":"2020"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2022.3223955"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00717"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00707"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-015-0816-y"},{"key":"ref11","first-page":"12116","article-title":"Do vision transformers see like convolutional neural networks?","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Raghu"},{"key":"ref12","article-title":"How do vision transformers work?","author":"Park","year":"2022"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1088\/1742-5468\/ac9830"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00009"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00062"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01186"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.01172"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00061"},{"key":"ref19","first-page":"14663","article-title":"Bridging the gap between vision transformers and convolutional neural networks on small datasets","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Lu"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00149"},{"key":"ref21","first-page":"1106","article-title":"Imagenet classification with deep convolutional neural networks","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Krizhevsky"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.4324\/9781410605337-29"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.90"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.243"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00745"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00813"},{"key":"ref27","first-page":"1691","article-title":"Generative pretraining from pixels","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Chen"},{"key":"ref28","article-title":"BERT: Pre-training of deep bidirectional transformers for language understanding","author":"Devlin","year":"2018"},{"key":"ref29","first-page":"10347","article-title":"Training data-efficient image transformers & distillation through attention","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Touvron"},{"key":"ref30","first-page":"30392","article-title":"Early convolutions help transformers see better","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Xiao"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1109\/iros55552.2023.10342025"},{"key":"ref32","first-page":"28522","article-title":"ViTAE: Vision transformer advanced by exploring intrinsic inductive bias","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Xu"},{"key":"ref33","first-page":"23818","article-title":"Efficient training of visual transformers with small datasets","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Liu"},{"key":"ref34","article-title":"Escaping the Big Data paradigm with compact transformers","author":"Hassani","year":"2021"},{"key":"ref35","article-title":"Vision transformer for small-size datasets","author":"Lee","year":"2021"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.48550\/ARXIV.1706.03762"},{"key":"ref37","first-page":"864","article-title":"Low-rank bottleneck in multi-head attention models","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Bhojanapalli"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1016\/j.knosys.2021.108075"},{"key":"ref39","article-title":"Talking-heads attention","author":"Shazeer","year":"2020"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00010"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2022.3208922"},{"key":"ref42","article-title":"Gaussian error linear units (GELUs)","author":"Hendrycks","year":"2016"},{"key":"ref43","article-title":"MobileNets: Efficient convolutional neural networks for mobile vision applications","author":"Howard","year":"2017"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.668"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-20077-9_17"},{"key":"ref46","article-title":"Learning multiple layers of features from tiny images","author":"Krizhevsky","year":"2009"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-10602-1_48"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.324"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.322"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.544"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00656"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01228-1_26"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.1007\/s41095-022-0274-8"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01167"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.634"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00060"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.5244\/C.30.87"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2019.2938758"},{"key":"ref59","first-page":"3417","article-title":"Nested hierarchical transformer: Towards accurate, data-efficient and interpretable visual understanding","volume-title":"Proc. AAAI Conf. Artif. Intell.","author":"Zhang"},{"key":"ref60","first-page":"5762","article-title":"FastViT: A fast hybrid vision transformer using structural reparameterization","volume-title":"Proc. IEEE\/CVF Int. Conf. Comput. Vis.","author":"Vasu"},{"key":"ref61","first-page":"3965","article-title":"CoAtNet: Marrying convolution and attention for all data sizes","volume-title":"Proc. Adv. neural Inf. Process. Syst.","author":"Dai"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.01044"},{"key":"ref63","first-page":"238252949","article-title":"ResNet strikes back: An improved training procedure in timm","author":"Wightman","year":"2021"},{"key":"ref64","article-title":"More convnets in the 2020s: Scaling up kernels beyond 51x51 using sparsity","author":"Liu","year":"2022","journal-title":"arXiv:2207.03620"},{"key":"ref65","first-page":"10353","article-title":"HorNet: Efficient high-order spatial interactions with recursive gated convolutions","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Rao"},{"key":"ref66","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01385"},{"key":"ref67","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-20053-3_30"},{"key":"ref68","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01058"},{"key":"ref69","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2023.3265499"},{"key":"ref70","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2022.3207500"},{"key":"ref71","first-page":"9355","article-title":"Twins: Revisiting the design of spatial attention in vision transformers","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Chu"},{"key":"ref72","article-title":"CrossFormer: Transformer utilizing cross-dimension dependency for multivariate time series forecasting","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Zhang"},{"key":"ref73","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.01598"},{"key":"ref74","article-title":"MOAT: Alternating mobile convolution and attention brings strong vision models","author":"Yang","year":"2022"},{"key":"ref75","first-page":"23495","article-title":"Inception transformer","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Si"},{"key":"ref76","article-title":"HiViT: A simpler and more efficient design of hierarchical vision transformer","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Zhang"},{"key":"ref77","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-20053-3_27"}],"container-title":["IEEE Transactions on Pattern Analysis and Machine Intelligence"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/34\/10916529\/10836856.pdf?arnumber=10836856","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,3,7]],"date-time":"2025-03-07T13:39:07Z","timestamp":1741354747000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/10836856\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,4]]},"references-count":77,"journal-issue":{"issue":"4"},"URL":"https:\/\/doi.org\/10.1109\/tpami.2025.3528228","relation":{},"ISSN":["0162-8828","2160-9292","1939-3539"],"issn-type":[{"value":"0162-8828","type":"print"},{"value":"2160-9292","type":"electronic"},{"value":"1939-3539","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,4]]}}}