{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,8]],"date-time":"2026-06-08T22:20:02Z","timestamp":1780957202752,"version":"3.54.1"},"reference-count":278,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","license":[{"start":{"date-parts":[[2025,1,1]],"date-time":"2025-01-01T00:00:00Z","timestamp":1735689600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/legalcode"}],"funder":[{"DOI":"10.13039\/501100001809","name":"Zhejiang Provincial Natural Science Foundation of China","doi-asserted-by":"publisher","award":["LD25C130001"],"award-info":[{"award-number":["LD25C130001"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["32300238"],"award-info":[{"award-number":["32300238"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Access"],"published-print":{"date-parts":[[2025]]},"DOI":"10.1109\/access.2025.3631774","type":"journal-article","created":{"date-parts":[[2025,11,11]],"date-time":"2025-11-11T18:28:39Z","timestamp":1762885719000},"page":"200446-200496","source":"Crossref","is-referenced-by-count":1,"title":["The Evolution of Convolutional Neural Network Architectures: A Review"],"prefix":"10.1109","volume":"13","author":[{"ORCID":"https:\/\/orcid.org\/0009-0005-2656-4319","authenticated-orcid":false,"given":"Deyong","family":"Mei","sequence":"first","affiliation":[{"name":"Rice Research Institute, Anhui Academy of Agricultural Sciences, Hefei, Anhui, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Junyi","family":"Gong","sequence":"additional","affiliation":[{"name":"China State Key Laboratory of Rice Biology and Breeding, China National Rice Research Institute, Hangzhou, Zhejiang, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Mingding","family":"Qu","sequence":"additional","affiliation":[{"name":"Rice Research Institute, Anhui Academy of Agricultural Sciences, Hefei, Anhui, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Shiquan","family":"Bian","sequence":"additional","affiliation":[{"name":"Rice Research Institute, Anhui Academy of Agricultural Sciences, Hefei, Anhui, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","volume-title":"Deep Learning","author":"Goodfellow","year":"2016"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1111\/j.2517-6161.1958.tb00292.x"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1016\/j.ajodo.2023.08.003"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1007\/bf00116251"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1023\/a:1010933404324"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.21037\/atm.2016.03.37"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/tpami.2013.50"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1007\/bf02478259"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1037\/h0042519"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-70911-1_20"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1007\/bf00344251"},{"key":"ref12","first-page":"396","article-title":"Handwritten digit recognition with a back-propagation network","volume-title":"Proc. 3rd Int. Conf. Neural Inf. Process. Syst. (NIPS)","author":"Le Cun"},{"issue":"276","key":"ref13","first-page":"2","article-title":"Comparison of learning algorithms for handwritten digit recognition","volume":"261","author":"LeCun","year":"1995","journal-title":"Neural Netw. Stat. Mech. Perspect."},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1109\/5.726791"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1162\/neco.2006.18.7.1527"},{"key":"ref16","first-page":"1097","article-title":"ImageNet classification with deep convolutional neural networks","volume-title":"Proc. 26th Int. Conf. Neural Inf. Process. Syst. (NIPS)","author":"Krizhevsky"},{"key":"ref17","article-title":"Very deep convolutional networks for large-scale image recognition","author":"Simonyan","year":"2014","journal-title":"arXiv:1409.1556"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/72.279181"},{"key":"ref19","article-title":"Deep residual learning for image recognition","author":"He","year":"2015","journal-title":"arXiv:1512.03385"},{"key":"ref20","article-title":"Network in network","author":"Lin","year":"2013","journal-title":"arXiv:1312.4400"},{"key":"ref21","article-title":"Going deeper with convolutions","author":"Szegedy","year":"2014","journal-title":"arXiv:1409.4842"},{"key":"ref22","article-title":"Rethinking the inception architecture for computer vision","author":"Szegedy","year":"2015","journal-title":"arXiv:1512.00567"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v31i1.11231"},{"key":"ref24","article-title":"Squeeze-and-excitation networks","author":"Hu","year":"2017","journal-title":"arXiv:1709.01507"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01249-6_34"},{"key":"ref26","article-title":"ESPNetv2: A light-weight, power efficient, and general purpose convolutional neural network","author":"Mehta","year":"2018","journal-title":"arXiv:1811.11431"},{"key":"ref27","article-title":"Interleaved group convolutions for deep neural networks","author":"Zhang","year":"2017","journal-title":"arXiv:1707.02725"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr.2018.00922"},{"key":"ref29","article-title":"IGCV3: Interleaved low-rank group convolutions for efficient deep neural networks","author":"Sun","year":"2018","journal-title":"arXiv:1806.00178"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.48550\/ARXIV.1611.01578"},{"key":"ref31","article-title":"EfficientNet: Rethinking model scaling for convolutional neural networks","author":"Tan","year":"2019","journal-title":"arXiv:1905.11946"},{"key":"ref32","article-title":"MnasNet: Platform-aware neural architecture search for mobile","author":"Tan","year":"2018","journal-title":"arXiv:1807.11626"},{"key":"ref33","article-title":"CondenseNet: An efficient DenseNet using learned group convolutions","author":"Huang","year":"2017","journal-title":"arXiv:1711.09224"},{"key":"ref34","article-title":"MobileNets: Efficient convolutional neural networks for mobile vision applications","author":"Howard","year":"2017","journal-title":"arXiv:1704.04861"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr.2018.00474"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00140"},{"key":"ref37","article-title":"ShuffleNet: An extremely efficient convolutional neural network for mobile devices","author":"Zhang","year":"2017","journal-title":"arXiv:1707.01083"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01264-9_8"},{"key":"ref39","article-title":"SqueezeNet: AlexNet-level accuracy with 50\u00d7 fewer parameters and <0.5MB model size","author":"Iandola","year":"2016","journal-title":"arXiv:1602.07360"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1109\/CVPRW.2018.00215"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1162\/neco_a_00990"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1016\/j.patcog.2017.10.013"},{"key":"ref43","article-title":"Recent advances in convolutional neural network acceleration","author":"Zhang","year":"2018","journal-title":"arXiv:1807.08596"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1007\/s10462-020-09825-6"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1109\/tnnls.2021.3084827"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.3390\/electronics10202470"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.1007\/s10462-022-10213-5"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.3390\/computers12080151"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1109\/access.2024.3376441"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1007\/s10462-024-10721-6"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1186\/s40537-021-00444-8"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1016\/j.asoc.2025.113378"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.1007\/s00521-023-08957-4"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1007\/s10462-023-10466-8"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.48550\/ARXIV.1706.03762"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-66111-3_2"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.1109\/tsmc.1971.4308316"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-7908-2604-3_16"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.1038\/323533a0"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1111\/j.2517-6161.1996.tb02080.x"},{"key":"ref61","doi-asserted-by":"publisher","DOI":"10.2307\/1271436"},{"key":"ref62","article-title":"Early stopping and non-parametric regression: An optimal data-dependent stopping rule","author":"Raskutti","year":"2013","journal-title":"arXiv:1306.3574"},{"key":"ref63","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-35289-8_5"},{"key":"ref64","doi-asserted-by":"publisher","DOI":"10.1007\/s00365-006-0663-2"},{"issue":"1","key":"ref65","first-page":"1929","article-title":"Dropout: A simple way to prevent neural networks from overfitting","volume":"15","author":"Srivastava","year":"2014","journal-title":"J. Mach. Learn. Res."},{"key":"ref66","article-title":"Improving neural networks by preventing co-adaptation of feature detectors","author":"Hinton","year":"2012","journal-title":"arXiv:1207.0580"},{"key":"ref67","doi-asserted-by":"publisher","DOI":"10.1109\/ICCVW.2017.71"},{"key":"ref68","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr.2017.195"},{"key":"ref69","doi-asserted-by":"publisher","DOI":"10.1109\/icsse.2019.8823302"},{"key":"ref70","article-title":"GhostNet: More features from cheap operations","author":"Han","year":"2019","journal-title":"arXiv:1911.11907"},{"key":"ref71","article-title":"Design of efficient convolutional layers using single intra-channel convolution, topological subdivisioning and spatial \u2018bottleneck\u2019 structure","author":"Wang","year":"2016","journal-title":"arXiv:1608.04337"},{"key":"ref72","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr.2016.521"},{"key":"ref73","article-title":"MixConv: Mixed depthwise convolutional kernels","author":"Tan","year":"2019","journal-title":"arXiv:1907.09595"},{"key":"ref74","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00200"},{"key":"ref75","doi-asserted-by":"publisher","DOI":"10.1109\/tpami.2024.3400873"},{"key":"ref76","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.189"},{"key":"ref77","article-title":"SegNeXt: Rethinking convolutional attention design for semantic segmentation","author":"Guo","year":"2022","journal-title":"arXiv:2209.08575"},{"key":"ref78","article-title":"Flattened convolutional neural networks for feedforward acceleration","author":"Jin","year":"2014","journal-title":"arXiv:1412.5474"},{"key":"ref79","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.1511.07122"},{"key":"ref80","doi-asserted-by":"publisher","DOI":"10.1109\/tpami.2017.2699184"},{"key":"ref81","article-title":"Rethinking Atrous convolution for semantic image segmentation","author":"Chen","year":"2017","journal-title":"arXiv:1706.05587"},{"key":"ref82","article-title":"RapidNet: Multi-level dilated convolution based mobile backbone","author":"Munir","year":"2024","journal-title":"arXiv:2412.10995"},{"key":"ref83","article-title":"ENet: A deep neural network architecture for real-time semantic segmentation","author":"Paszke","year":"2016","journal-title":"arXiv:1606.02147"},{"key":"ref84","article-title":"A guide to convolution arithmetic for deep learning","author":"Dumoulin","year":"2016","journal-title":"arXiv:1603.07285"},{"key":"ref85","doi-asserted-by":"publisher","DOI":"10.1109\/tpami.2016.2572683"},{"key":"ref86","article-title":"Unsupervised representation learning with deep convolutional generative adversarial networks","author":"Radford","year":"2016","journal-title":"arXiv:1511.06343"},{"key":"ref87","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.89"},{"key":"ref88","article-title":"CodeNet: A large-scale AI for code dataset for learning a diversity of coding tasks","author":"Puri","year":"2021","journal-title":"arXiv:2105.12655"},{"key":"ref89","article-title":"Deformable DETR: Deformable transformers for end-to-end object detection","author":"Zhu","year":"2020","journal-title":"arXiv:2010.04159"},{"key":"ref90","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00475"},{"key":"ref91","article-title":"Deformable ConvNets v2: More deformable, better results","author":"Zhu","year":"2018","journal-title":"arXiv:1811.11168"},{"key":"ref92","doi-asserted-by":"publisher","DOI":"10.48550\/ARXIV.1710.05941"},{"key":"ref93","doi-asserted-by":"publisher","DOI":"10.1007\/s10489-017-1028-7"},{"key":"ref94","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.1908.08681"},{"key":"ref95","doi-asserted-by":"publisher","DOI":"10.1109\/icassp.2013.6638312"},{"key":"ref96","first-page":"16","article-title":"Rectifier nonlinearities improve neural network acoustic models","volume-title":"Proc. 30th Int. Conf. Mach. Learn.","author":"Maas"},{"key":"ref97","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2015.123"},{"key":"ref98","article-title":"Empirical evaluation of rectified activations in convolutional network","author":"Xu","year":"2015","journal-title":"arXiv:1505.00853"},{"key":"ref99","article-title":"Fast and accurate deep network learning by exponential linear units (ELUs)","author":"Clevert","year":"2015","journal-title":"arXiv:1511.07289"},{"key":"ref100","article-title":"Maxout networks","author":"Goodfellow","year":"2013","journal-title":"arXiv:1302.4389"},{"key":"ref101","article-title":"Improving deep neural networks with probabilistic maxout units","author":"Springenberg","year":"2013","journal-title":"arXiv:1312.6116"},{"key":"ref102","first-page":"111","article-title":"A theoretical analysis of feature pooling in visual recognition","volume-title":"Proc. 27th Int. Conf. Mach. Learn.","author":"Boureau"},{"key":"ref103","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr.2010.5539963"},{"key":"ref104","first-page":"307","article-title":"Signal recovery from pooling representations","volume-title":"Proc. 31st Int. Conf. Mach. Learn.","author":"Bruna"},{"key":"ref105","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-11740-9_34"},{"key":"ref106","article-title":"Training very deep networks","author":"Srivastava","year":"2015","journal-title":"arXiv:1507.06228"},{"key":"ref107","doi-asserted-by":"publisher","DOI":"10.1109\/tpami.2017.2703082"},{"key":"ref108","doi-asserted-by":"publisher","DOI":"10.1109\/icinpro43533.2018.9096860"},{"key":"ref109","doi-asserted-by":"publisher","DOI":"10.1016\/j.neunet.2016.07.003"},{"key":"ref110","doi-asserted-by":"publisher","DOI":"10.1016\/j.eswa.2023.119892"},{"key":"ref111","doi-asserted-by":"publisher","DOI":"10.1038\/s41598-024-51258-6"},{"key":"ref112","doi-asserted-by":"publisher","DOI":"10.1145\/2980179.2980239"},{"key":"ref113","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr.2018.00949"},{"key":"ref114","doi-asserted-by":"publisher","DOI":"10.1109\/iccv.2019.00345"},{"key":"ref115","doi-asserted-by":"publisher","DOI":"10.1109\/iccv48922.2021.01019"},{"key":"ref116","doi-asserted-by":"publisher","DOI":"10.1109\/tip.2022.3227503"},{"key":"ref117","doi-asserted-by":"publisher","DOI":"10.2307\/1932409"},{"key":"ref118","first-page":"1","article-title":"A method of establishing groups of equal amplitude in plant sociology based on similarity of species content and its application to analyses of the vegetation on Danish commons","volume":"5","author":"S\u00f8rensen","year":"1948","journal-title":"Danish Acad. Sci. Lett."},{"key":"ref119","doi-asserted-by":"publisher","DOI":"10.1016\/j.eswa.2021.115084"},{"key":"ref120","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-33709-3_6"},{"key":"ref121","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr.2010.5540039"},{"key":"ref122","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr.2013.104"},{"key":"ref123","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr.2009.5206757"},{"key":"ref124","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr.2006.68"},{"key":"ref125","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr.2010.5540018"},{"key":"ref126","doi-asserted-by":"publisher","DOI":"10.1109\/tpami.2015.2389824"},{"key":"ref127","article-title":"Self-supervised model adaptation for multimodal semantic segmentation","author":"Valada","year":"2018","journal-title":"arXiv:1808.03833"},{"key":"ref128","article-title":"Batch normalization: Accelerating deep network training by reducing internal covariate shift","author":"Ioffe","year":"2015","journal-title":"arXiv:1502.03167"},{"key":"ref129","doi-asserted-by":"publisher","DOI":"10.1016\/j.neucom.2018.07.079"},{"key":"ref130","article-title":"Global weighted average pooling bridges pixel-level localization and image-level classification","author":"Qiu","year":"2018","journal-title":"arXiv:1809.08264"},{"key":"ref131","doi-asserted-by":"publisher","DOI":"10.1109\/access.2020.2997078"},{"key":"ref132","doi-asserted-by":"publisher","DOI":"10.1109\/ictai.2019.00258"},{"key":"ref133","article-title":"Stochastic pooling for regularization of deep convolutional neural networks","author":"Zeiler","year":"2013","journal-title":"arXiv:1301.3557"},{"key":"ref134","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr.2017.426"},{"key":"ref135","article-title":"Fractional max-pooling","author":"Graham","year":"2014","journal-title":"arXiv:1412.6071"},{"key":"ref136","doi-asserted-by":"publisher","DOI":"10.1016\/j.neunet.2018.05.015"},{"key":"ref137","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr42600.2020.00406"},{"key":"ref138","article-title":"Spectral representations for convolutional neural networks","author":"Rippel","year":"2015","journal-title":"arXiv:1506.03767"},{"key":"ref139","first-page":"3084","article-title":"Adaptive dropout for training deep neural networks","volume-title":"Proc. 27th Int. Conf. Neural Inf. Process. Syst. (NIPS)","author":"Ba"},{"key":"ref140","article-title":"Gaussian error linear units (GELUs)","author":"Hendrycks","year":"2016","journal-title":"arXiv:1606.08415"},{"key":"ref141","article-title":"Improved dropout for shallow and deep learning","author":"Li","year":"2016","journal-title":"arXiv:1602.02220"},{"key":"ref142","doi-asserted-by":"publisher","DOI":"10.1109\/slt.2014.7078567"},{"key":"ref143","doi-asserted-by":"publisher","DOI":"10.1109\/iccv.2017.383"},{"key":"ref144","first-page":"1050","article-title":"Dropout as a Bayesian approximation: Representing model uncertainty in deep learning","volume-title":"Proc. 33rd Int. Conf. Mach. Learn.","author":"Gal"},{"key":"ref145","first-page":"118","article-title":"Fast dropout training","volume-title":"Proc. 30th Int. Conf. Mach. Learn.","volume":"9","author":"Wang"},{"key":"ref146","article-title":"Efficient batchwise dropout training using submatrices","author":"Graham","year":"2015","journal-title":"arXiv:1502.02478"},{"key":"ref147","first-page":"1058","article-title":"Regularization of neural networks using dropconnect","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Wan"},{"key":"ref148","article-title":"Variational dropout sparsifies deep neural networks","author":"Molchanov","year":"2017","journal-title":"arXiv:1701.05369"},{"key":"ref149","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.1312.6114"},{"key":"ref150","first-page":"3584","article-title":"Concrete dropout","volume-title":"Proc. 31st Int. Conf. Neural Inf. Process. Syst. (NIPS)","author":"Gal"},{"key":"ref151","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00729"},{"key":"ref152","article-title":"Stochastic backpropagation and approximate inference in deep generative models","author":"Rezende","year":"2014","journal-title":"arXiv:1401.4082"},{"key":"ref153","article-title":"Improved regularization of convolutional neural networks with cutout","author":"DeVries","year":"2017","journal-title":"arXiv:1708.04552"},{"key":"ref154","article-title":"DropBlock: A regularization method for convolutional networks","author":"Ghiasi","year":"2018","journal-title":"arXiv:1810.12890"},{"key":"ref155","doi-asserted-by":"publisher","DOI":"10.1109\/tgrs.2020.3015843"},{"key":"ref156","doi-asserted-by":"publisher","DOI":"10.1016\/j.neucom.2021.04.101"},{"key":"ref157","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr.2015.7298664"},{"key":"ref158","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v33i01.33018425"},{"key":"ref159","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-46493-0_39"},{"key":"ref160","article-title":"Swapout: Learning an ensemble of deep architectures","author":"Singh","year":"2018","journal-title":"arXiv:1605.06465"},{"key":"ref161","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.1605.07648"},{"key":"ref162","article-title":"Learning transferable architectures for scalable image recognition","author":"Zoph","year":"2017","journal-title":"arXiv:1707.07012"},{"key":"ref163","doi-asserted-by":"publisher","DOI":"10.1016\/j.neunet.2018.09.009"},{"key":"ref164","article-title":"Batch renormalization: Towards reducing minibatch dependence in batch-normalized models","author":"Ioffe","year":"2017","journal-title":"arXiv:1702.03275"},{"key":"ref165","article-title":"Cross-iteration batch normalization","author":"Yao","year":"2020","journal-title":"arXiv:2002.05712"},{"key":"ref166","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00747"},{"key":"ref167","article-title":"Layer normalization","author":"Ba","year":"2016","journal-title":"arXiv:1607.06450"},{"key":"ref168","doi-asserted-by":"publisher","DOI":"10.1162\/neco.1989.1.2.270"},{"key":"ref169","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01261-8_1"},{"key":"ref170","article-title":"Instance normalization: The missing ingredient for fast stylization","author":"Ulyanov","year":"2016","journal-title":"arXiv:1607.08022"},{"key":"ref171","article-title":"Generative adversarial networks","author":"Goodfellow","year":"2014","journal-title":"arXiv:1406.2661"},{"key":"ref172","article-title":"Filter response normalization layer: Eliminating batch dependence in the training of deep neural networks","author":"Singh","year":"2019","journal-title":"arXiv:1911.09737"},{"key":"ref173","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.167"},{"key":"ref174","article-title":"Batch-instance normalization for adaptively style-invariant neural networks","author":"Nam","year":"2018","journal-title":"arXiv:1805.07925"},{"key":"ref175","article-title":"Differentiable learning-to-normalize via switchable normalization","author":"Luo","year":"2018","journal-title":"arXiv:1806.10779"},{"key":"ref176","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr.2019.00053"},{"key":"ref177","doi-asserted-by":"publisher","DOI":"10.1038\/381607a0"},{"key":"ref178","article-title":"Weight normalization: A simple reparameterization to accelerate training of deep neural networks","author":"Salimans","year":"2016","journal-title":"arXiv:1602.07868"},{"key":"ref179","doi-asserted-by":"publisher","DOI":"10.1162\/neco.1997.9.8.1735"},{"key":"ref180","article-title":"Spectral normalization for generative adversarial networks","author":"Miyato","year":"2018","journal-title":"arXiv:1802.05957"},{"key":"ref181","article-title":"Spectral norm regularization for improving the generalizability of deep learning","author":"Yoshida","year":"2017","journal-title":"arXiv:1705.10941"},{"key":"ref182","article-title":"Wasserstein GAN","author":"Arjovsky","year":"2017","journal-title":"arXiv:1701.07875"},{"key":"ref183","doi-asserted-by":"publisher","DOI":"10.1109\/iccv.2009.5459469"},{"key":"ref184","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr.2008.4587821"},{"key":"ref185","doi-asserted-by":"publisher","DOI":"10.1007\/978-1-4612-4380-9_35"},{"key":"ref186","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-24574-4_28"},{"key":"ref187","doi-asserted-by":"publisher","DOI":"10.1109\/iccv.2017.324"},{"key":"ref188","doi-asserted-by":"publisher","DOI":"10.1561\/9781680836233"},{"key":"ref189","doi-asserted-by":"publisher","DOI":"10.1023\/a:1026543900054"},{"key":"ref190","first-page":"5769","article-title":"Improved training of Wasserstein GANs","volume-title":"in: Proc. 31st Int. Conf. Neural Inf. Process. Syst.","author":"Gulrajani"},{"key":"ref191","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-24785-9_37"},{"key":"ref192","doi-asserted-by":"publisher","DOI":"10.1145\/2601097.2601175"},{"key":"ref193","doi-asserted-by":"publisher","DOI":"10.1561\/2200000073"},{"key":"ref194","doi-asserted-by":"publisher","DOI":"10.1007\/bf00994018"},{"key":"ref195","first-page":"265","article-title":"On the algorithmic implementation of multiclass kernel-based vector machines","volume":"2","author":"Crammer","year":"2002","journal-title":"J. Mach. Learn. Res."},{"key":"ref196","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2005.202"},{"key":"ref197","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr.2006.100"},{"key":"ref198","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr.2015.7298682"},{"key":"ref199","doi-asserted-by":"publisher","DOI":"10.1145\/1102351.1102363"},{"key":"ref200","doi-asserted-by":"publisher","DOI":"10.1145\/1273496.1273513"},{"key":"ref201","article-title":"A simple framework for contrastive learning of visual representations","author":"Chen","year":"2020","journal-title":"arXiv:2002.05709"},{"key":"ref202","doi-asserted-by":"publisher","DOI":"10.1109\/3dv.2016.79"},{"key":"ref203","article-title":"Dice loss for data-imbalanced NLP tasks","author":"Li","year":"2019","journal-title":"arXiv:1911.02855"},{"key":"ref204","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr.2018.00464"},{"key":"ref205","doi-asserted-by":"publisher","DOI":"10.1016\/j.imavis.2020.103911"},{"key":"ref206","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-46475-6_43"},{"key":"ref207","article-title":"Photo-realistic single image super-resolution using a generative adversarial network","author":"Ledig","year":"2016","journal-title":"arXiv:1609.04802"},{"key":"ref208","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.244"},{"key":"ref209","doi-asserted-by":"publisher","DOI":"10.1109\/icac3n56670.2022.10074437"},{"key":"ref210","doi-asserted-by":"publisher","DOI":"10.1145\/3072959.3073659"},{"key":"ref211","article-title":"ESRGAN: Enhanced super-resolution generative adversarial networks","author":"Wang","year":"2018","journal-title":"arXiv:1809.00219"},{"key":"ref212","doi-asserted-by":"publisher","DOI":"10.1016\/0167-2789(92)90242-f"},{"key":"ref213","doi-asserted-by":"publisher","DOI":"10.1145\/1143844.1143891"},{"key":"ref214","first-page":"1764","article-title":"Towards end-to-end speech recognition with recurrent neural networks","volume-title":"Proc. 31st Int. Conf. Mach. Learn.","author":"Graves"},{"key":"ref215","article-title":"Deep speech: Scaling up end-to-end speech recognition","author":"Hannun","year":"2014","journal-title":"arXiv:1412.5567"},{"key":"ref216","doi-asserted-by":"publisher","DOI":"10.1109\/tpami.2016.2646371"},{"key":"ref217","article-title":"Deep speech 2: End-to-end speech recognition in English and Mandarin","author":"Amodei","year":"2015","journal-title":"arXiv:1512.02595"},{"key":"ref218","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v37i11.26538"},{"key":"ref219","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.01354"},{"key":"ref220","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr.2018.00552"},{"key":"ref221","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr.2019.00482"},{"key":"ref222","doi-asserted-by":"crossref","DOI":"10.1002\/9780470496916","volume-title":"Metaheuristics: From Design to Implementation","author":"Talbi","year":"2009"},{"key":"ref223","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-91086-4"},{"key":"ref224","first-page":"2121","article-title":"Adaptive subgradient methods for online learning and stochastic optimization","volume":"12","author":"Duchi","year":"2011","journal-title":"J. Mach. Learn. Res."},{"key":"ref225","article-title":"Adam: A method for stochastic optimization","author":"Kingma","year":"2014","journal-title":"arXiv:1412.6980"},{"key":"ref226","article-title":"Decoupled weight decay regularization","author":"Loshchilov","year":"2017","journal-title":"arXiv:1711.05101"},{"key":"ref227","doi-asserted-by":"publisher","DOI":"10.1109\/ictai.2019.00071"},{"key":"ref228","volume-title":"Incorporating Nesterov Momentum Into Adam","author":"Dozat","year":"2016"},{"key":"ref229","article-title":"On the variance of the adaptive learning rate and beyond","author":"Liu","year":"2019","journal-title":"arXiv:1908.03265"},{"key":"ref230","article-title":"Adaptive gradient methods with dynamic bound of learning rate","author":"Luo","year":"2019","journal-title":"arXiv:1902.09843"},{"key":"ref231","article-title":"AdaBelief optimizer: Adapting stepsizes by the belief in observed gradients","author":"Zhuang","year":"2020","journal-title":"arXiv:2010.07468"},{"key":"ref232","article-title":"A control theoretic framework for adaptive gradient optimizers in machine learning","author":"Chakrabarti","year":"2022","journal-title":"arXiv:2206.02034"},{"key":"ref233","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-46493-0_38"},{"key":"ref234","doi-asserted-by":"publisher","DOI":"10.1109\/icsai.2016.7811085"},{"key":"ref235","article-title":"SkipNet: Learning dynamic routing in convolutional networks","author":"Wang","year":"2017","journal-title":"arXiv:1711.09485"},{"key":"ref236","article-title":"ResNet in ResNet: Generalizing residual architectures","author":"Targ","year":"2016","journal-title":"arXiv:1603.08029"},{"key":"ref237","doi-asserted-by":"publisher","DOI":"10.1109\/tcsvt.2017.2654543"},{"key":"ref238","doi-asserted-by":"publisher","DOI":"10.5244\/C.30.87"},{"key":"ref239","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr.2017.634"},{"key":"ref240","article-title":"AdaNet: Adaptive structural learning of artificial neural networks","author":"Cortes","year":"2016","journal-title":"arXiv:1607.01097"},{"key":"ref241","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr.2017.243"},{"key":"ref242","article-title":"Multi-scale dense networks for resource efficient image classification","author":"Huang","year":"2017","journal-title":"arXiv:1703.09844"},{"key":"ref243","doi-asserted-by":"publisher","DOI":"10.1109\/cvprw50498.2020.00203"},{"key":"ref244","article-title":"Connectivity learning in multi-branch networks","author":"Ahmed","year":"2017","journal-title":"arXiv:1709.09582"},{"key":"ref245","article-title":"Dual path networks","author":"Chen","year":"2017","journal-title":"arXiv:1707.01629"},{"key":"ref246","article-title":"DiracNets: Training very deep neural networks without skip-connections","author":"Zagoruyko","year":"2017","journal-title":"arXiv:1706.00388"},{"key":"ref247","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr.2017.668"},{"key":"ref248","article-title":"PolyNet: A pursuit of structural diversity in very deep networks","author":"Zhang","year":"2016","journal-title":"arXiv:1611.05725"},{"key":"ref249","article-title":"Competitive inner-imaging squeeze and excitation for residual network","author":"Hu","year":"2018","journal-title":"arXiv:1807.08920"},{"key":"ref250","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01234-2_1"},{"key":"ref251","article-title":"An image is worth 16\u00d716 words: Transformers for image recognition at scale","author":"Dosovitskiy","year":"2020","journal-title":"arXiv:2010.11929"},{"key":"ref252","doi-asserted-by":"publisher","DOI":"10.1109\/access.2023.3237025"},{"key":"ref253","first-page":"3859","article-title":"Dynamic routing between capsules","volume-title":"Proc. 31st Int. Conf. Neural Inf. Process. Syst.","author":"Sabour"},{"key":"ref254","doi-asserted-by":"publisher","DOI":"10.1109\/iccv48922.2021.00009"},{"key":"ref255","first-page":"3965","article-title":"CoAtNet: Marrying convolution and attention for all data sizes","volume-title":"Proc. 35th Int. Conf. Neural Inf. Process. Syst.","author":"Dai"},{"key":"ref256","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr46437.2021.01625"},{"key":"ref257","doi-asserted-by":"publisher","DOI":"10.1088\/1742-5468\/ac9830"},{"key":"ref258","article-title":"UniFormer: Unified transformer for efficient spatiotemporal representation learning","author":"Li","year":"2022","journal-title":"arXiv:2201.04676"},{"key":"ref259","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58452-8_13"},{"key":"ref260","article-title":"DINOv3","author":"Sim\u00e9oni","year":"2025","journal-title":"arXiv:2508.10104"},{"key":"ref261","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52688.2022.01167"},{"key":"ref262","article-title":"Autoformer: Decomposition transformers with auto-correlation for long-term series forecasting","author":"Wu","year":"2021","journal-title":"arXiv:2106.13008"},{"key":"ref263","first-page":"1","article-title":"NasViT: Neural architecture search for efficient vision transformers with gradient conflict-aware SuperNet training","volume-title":"Proc. Int. Conf. Learn. Represent.","author":"Gong"},{"key":"ref264","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.1503.02531"},{"key":"ref265","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr.2018.00454"},{"key":"ref266","article-title":"FitNets: Hints for thin deep nets","author":"Romero","year":"2014","journal-title":"arXiv:1412.6550"},{"key":"ref267","doi-asserted-by":"publisher","DOI":"10.1109\/access.2025.3575203"},{"key":"ref268","doi-asserted-by":"publisher","DOI":"10.1109\/iccv.2019.00201"},{"key":"ref269","article-title":"Contrastive representation distillation","author":"Tian","year":"2019","journal-title":"arXiv:1910.10699"},{"key":"ref270","article-title":"Contrastive representation distillation via multi-scale feature decoupling","author":"Wang","year":"2025","journal-title":"arXiv:2502.05835"},{"key":"ref271","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00409"},{"key":"ref272","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52688.2022.01200"},{"key":"ref273","doi-asserted-by":"publisher","DOI":"10.1109\/icassp49660.2025.10889632"},{"key":"ref274","doi-asserted-by":"publisher","DOI":"10.1109\/tip.2024.3445740"},{"key":"ref275","article-title":"A comprehensive review of model quantization and its applications","author":"He","year":"2024","journal-title":"arXiv:2403.10357"},{"key":"ref276","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-10593-2_13"},{"key":"ref277","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.02436"},{"key":"ref278","doi-asserted-by":"publisher","DOI":"10.1007\/s00521-025-11331-1"}],"container-title":["IEEE Access"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/6287639\/10820123\/11239037.pdf?arnumber=11239037","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,12,3]],"date-time":"2025-12-03T18:43:40Z","timestamp":1764787420000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11239037\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025]]},"references-count":278,"URL":"https:\/\/doi.org\/10.1109\/access.2025.3631774","relation":{},"ISSN":["2169-3536"],"issn-type":[{"value":"2169-3536","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025]]}}}