{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,3,18]],"date-time":"2026-03-18T13:32:46Z","timestamp":1773840766740,"version":"3.50.1"},"reference-count":30,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","license":[{"start":{"date-parts":[[2023,1,1]],"date-time":"2023-01-01T00:00:00Z","timestamp":1672531200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by-nc-nd\/4.0\/"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["61962019"],"award-info":[{"award-number":["61962019"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["61972017"],"award-info":[{"award-number":["61972017"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100003819","name":"Natural Science Foundation of Hubei Province of China","doi-asserted-by":"publisher","award":["2023AFD061"],"award-info":[{"award-number":["2023AFD061"]}],"id":[{"id":"10.13039\/501100003819","id-type":"DOI","asserted-by":"publisher"}]},{"name":"Science and Technology Program of Enshi of China","award":["D20220005"],"award-info":[{"award-number":["D20220005"]}]},{"name":"High-Level Cultivation Program of Hubei Minzu University","award":["PY22011"],"award-info":[{"award-number":["PY22011"]}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Access"],"published-print":{"date-parts":[[2023]]},"DOI":"10.1109\/access.2023.3314573","type":"journal-article","created":{"date-parts":[[2023,9,12]],"date-time":"2023-09-12T17:35:54Z","timestamp":1694540154000},"page":"100042-100051","source":"Crossref","is-referenced-by-count":4,"title":["HAT: A Visual Transformer Model for Image Recognition Based on Hierarchical Attention Transformation"],"prefix":"10.1109","volume":"11","author":[{"given":"Xuanyu","family":"Zhao","sequence":"first","affiliation":[{"name":"College of Intelligent Systems Science and Engineering, Hubei Minzu University, Enshi, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-6586-231X","authenticated-orcid":false,"given":"Tao","family":"Hu","sequence":"additional","affiliation":[{"name":"College of Intelligent Systems Science and Engineering, Hubei Minzu University, Enshi, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Chunxia","family":"Mao","sequence":"additional","affiliation":[{"name":"College of Intelligent Systems Science and Engineering, Hubei Minzu University, Enshi, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Ye","family":"Yuan","sequence":"additional","affiliation":[{"name":"Enshi Audit Office, Enshi, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-8195-8936","authenticated-orcid":false,"given":"Jun","family":"Li","sequence":"additional","affiliation":[{"name":"College of Intelligent Systems Science and Engineering, Hubei Minzu University, Enshi, China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref13","first-page":"1","article-title":"RegionViT: Regional-to-local attention for vision transformers","author":"chen","year":"2022","journal-title":"Proc Int Conf Learn Represent"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00043"},{"key":"ref15","first-page":"15908","article-title":"Transformer in transformer","volume":"34","author":"han","year":"2021","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref14","first-page":"9355","article-title":"Twins: Revisiting the design of spatial attention in vision transformers","volume":"34","author":"chu","year":"2021","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1016\/j.imavis.2023.104790"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2022.findings-naacl.117"},{"key":"ref10","article-title":"Fixup initialization: Residual learning without normalization","author":"zhang","year":"2019","journal-title":"arXiv 1901 09321"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2022.3152247"},{"key":"ref1","first-page":"1","article-title":"Attention is all you need","volume":"30","author":"vaswani","year":"2017","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref17","article-title":"Locally enhanced self-attention: Combining self-attention and convolution as local and context terms","author":"yang","year":"2021","journal-title":"arXiv 2107 05637"},{"key":"ref16","article-title":"DeepViT: Towards deeper vision transformer","author":"zhou","year":"2021","journal-title":"arXiv 2103 11886"},{"key":"ref19","first-page":"10347","article-title":"Training data-efficient image transformers & distillation through attention","author":"touvron","year":"2021","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/ICPR56361.2022.9956379"},{"key":"ref24","article-title":"Learning multiple layers of features from tiny images","author":"krizhevsky","year":"2009"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-015-0816-y"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-018-1140-0"},{"key":"ref25","article-title":"Tiny ImageNet visual recognition challenge","volume":"3","author":"le","year":"2015"},{"key":"ref20","first-page":"2286","article-title":"ConViT: Improving vision transformers with soft convolutional inductive biases","author":"d\u2019ascoli","year":"2021","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref22","article-title":"Decoupled weight decay regularization","author":"loshchilov","year":"2017","journal-title":"arXiv 1711 05101"},{"key":"ref21","article-title":"Focal self-attention for local&#x2013;global interactions in vision transformers","author":"yang","year":"2021","journal-title":"arXiv 2107 00641"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.74"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.90"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1109\/CVPRW56347.2022.00031"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00986"},{"key":"ref7","first-page":"4271","article-title":"Funnel-transformer: Filtering out sequential redundancy for efficient language processing","volume":"33","author":"dai","year":"2020","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref9","first-page":"10524","article-title":"On layer normalization in the transformer architecture","author":"xiong","year":"2020","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-022-01739-w"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1145\/3505244"},{"key":"ref6","article-title":"An image is worth 16&#x00D7;16 words: Transformers for image recognition at scale","author":"dosovitskiy","year":"2020","journal-title":"arXiv 2010 11929"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2023.3268446"}],"container-title":["IEEE Access"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/6287639\/10005208\/10247525.pdf?arnumber=10247525","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,10,9]],"date-time":"2023-10-09T19:17:52Z","timestamp":1696879072000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/10247525\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023]]},"references-count":30,"URL":"https:\/\/doi.org\/10.1109\/access.2023.3314573","relation":{},"ISSN":["2169-3536"],"issn-type":[{"value":"2169-3536","type":"electronic"}],"subject":[],"published":{"date-parts":[[2023]]}}}