{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,25]],"date-time":"2026-04-25T08:01:32Z","timestamp":1777104092760,"version":"3.51.4"},"reference-count":155,"publisher":"Springer Science and Business Media LLC","issue":"9","license":[{"start":{"date-parts":[[2024,4,2]],"date-time":"2024-04-02T00:00:00Z","timestamp":1712016000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2024,4,2]],"date-time":"2024-04-02T00:00:00Z","timestamp":1712016000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62103363"],"award-info":[{"award-number":["62103363"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Int J Comput Vis"],"published-print":{"date-parts":[[2024,9]]},"DOI":"10.1007\/s11263-024-02034-6","type":"journal-article","created":{"date-parts":[[2024,4,2]],"date-time":"2024-04-02T20:25:04Z","timestamp":1712089504000},"page":"3509-3536","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":27,"title":["EATFormer: Improving Vision Transformer Inspired by Evolutionary Algorithm"],"prefix":"10.1007","volume":"132","author":[{"given":"Jiangning","family":"Zhang","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xiangtai","family":"Li","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yabiao","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Chengjie","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yibo","family":"Yang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yong","family":"Liu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Dacheng","family":"Tao","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2024,4,2]]},"reference":[{"key":"2034_CR1","unstructured":"Ali, A., Touvron, H., Caron, M., Bojanowski, P., Douze, M., Joulin, A., Laptev, I., Neverova, N., Synnaeve, G., Verbeek, J., & Jegou H (2021). Xcit: Cross-covariance image transformers. In NeurIPS."},{"key":"2034_CR2","unstructured":"Atito, S., Awais, M., & Kittler, J. (2021). Sit: Self-supervised vision transformer. arXiv preprint arXiv:2104.03602"},{"key":"2034_CR3","unstructured":"Baevski, A., Hsu, W.N., Xu, Q., Babu, A., Gu, J., & Auli, M. (2022). Data2vec: A general framework for self-supervised learning in speech, vision and language. In ICML."},{"key":"2034_CR4","unstructured":"Bao, H., Dong, L., Piao, S., & Wei, F. (2022). BEit: BERT pre-training of image transformers. In ICLR."},{"key":"2034_CR5","doi-asserted-by":"crossref","unstructured":"Bartz-Beielstein, T., Branke, J., Mehnen, J., & Mersmann, O. (2014). Evolutionary algorithms. Wiley Interdisciplinary Reviews: Data Mining and Knowledge Discovery.","DOI":"10.1002\/widm.1124"},{"key":"2034_CR6","unstructured":"Bello, I. (2021). Lambdanetworks: Modeling long-range interactions without attention. In ICLR."},{"key":"2034_CR7","unstructured":"Bertasius, G., Wang, H., & Torresani, L. (2021). Is space-time attention all you need for video understanding? In ICML."},{"key":"2034_CR8","doi-asserted-by":"crossref","unstructured":"Bhojanapalli, S., Chakrabarti, A., Glasner, D., Li, D., Unterthiner, T., & Veit, A. (2021). Understanding robustness of transformers for image classification. In ICCV.","DOI":"10.1109\/ICCV48922.2021.01007"},{"key":"2034_CR9","doi-asserted-by":"publisher","first-page":"157","DOI":"10.1007\/s11554-020-00960-5","volume":"18","author":"P Bhowmik","year":"2021","unstructured":"Bhowmik, P., Pantho, M. J. H., & Bobda, C. (2021). Bio-inspired smart vision sensor: Toward a reconfigurable hardware modeling of the hierarchical processing in the brain. Journal of Real-Time Image Processing, 18, 157\u2013174.","journal-title":"Journal of Real-Time Image Processing"},{"key":"2034_CR10","doi-asserted-by":"crossref","unstructured":"Brest, J., Greiner, S., Boskovic, B., Mernik, M., & Zumer, V. (2006). Self-adapting control parameters in differential evolution: A comparative study on numerical benchmark problems. In TEC.","DOI":"10.1109\/TEVC.2006.872133"},{"key":"2034_CR11","doi-asserted-by":"crossref","unstructured":"Brest, J., Zamuda, A., Boskovic, B., Maucec, M. S., & Zumer, V. (2008). High-dimensional real-parameter optimization using self-adaptive differential evolution algorithm with population size reduction. In CEC.","DOI":"10.1109\/CEC.2008.4631067"},{"key":"2034_CR12","doi-asserted-by":"crossref","unstructured":"Brest, J., Zamuda, A., Fister, I., & Mau\u010dec, M. S. (2010). Large scale global optimization using self-adaptive differential evolution algorithm. In CEC.","DOI":"10.1109\/CEC.2010.5585927"},{"key":"2034_CR13","unstructured":"Brown, T., Mann, B., Ryder, N., Subbiah, M., Kaplan, J.D., Dhariwal, P., Neelakantan, A., Shyam, P., Sastry, G., Askell, A., & Agarwal, S. (2020). Language models are few-shot learners. In NeurIPS."},{"key":"2034_CR14","doi-asserted-by":"crossref","unstructured":"Carion, N., Massa, F., Synnaeve, G., Usunier, N., Kirillov, A., & Zagoruyko, S. (2020). End-to-end object detection with transformers. In: ECCV.","DOI":"10.1007\/978-3-030-58452-8_13"},{"key":"2034_CR15","doi-asserted-by":"crossref","unstructured":"Caron, M., Touvron, H., Misra, I., J\u00e9gou, H., Mairal, J., Bojanowski, P., & Joulin, A. (2021). Emerging properties in self-supervised vision transformers. In ICCV.","DOI":"10.1109\/ICCV48922.2021.00951"},{"key":"2034_CR16","doi-asserted-by":"crossref","unstructured":"Chen, B., Li, P., Li, C., Li, B., Bai, L., Lin, C., Sun, M., Yan, J., & Ouyang, W. (2021). Glit: Neural architecture search for global and local image transformer. In ICCV.","DOI":"10.1109\/ICCV48922.2021.00008"},{"key":"2034_CR17","doi-asserted-by":"crossref","unstructured":"Chen, H., Wang, Y., Guo, T., Xu, C., Deng, Y., Liu, Z., Ma, S., Xu, C., Xu, C., & Gao, W. (2021). Pre-trained image processing transformer. In CVPR.","DOI":"10.1109\/CVPR46437.2021.01212"},{"key":"2034_CR18","unstructured":"Chen, J., Lu, Y., Yu, Q., Luo, X., Adeli, E., Wang, Y., Lu, L., Yuille, A. L., & Zhou, Y. (2021). Transunet: Transformers make strong encoders for medical image segmentation. arXiv preprint arXiv:2102.04306"},{"key":"2034_CR19","unstructured":"Chen, K., Wang, J., Pang, J., Cao, Y., Xiong, Y., Li, X., Sun, S., Feng, W., Liu, Z., Xu, J., Zhang, Z., Cheng, D., Zhu, C., Cheng, T., Zhao, Q., Li, B., Lu, X., Zhu, R., Wu, Y., Dai, J., Wang, J., Shi, J., Ouyang, W., Loy, C. C., & Lin, D. (2019). MMDetection: Open mmlab detection toolbox and benchmark. arXiv preprint arXiv:1906.07155"},{"key":"2034_CR20","doi-asserted-by":"crossref","unstructured":"Chen, M., Peng, H., Fu, J., & Ling, H. (2021). Autoformer: Searching transformers for visual recognition. In ICCV.","DOI":"10.1109\/ICCV48922.2021.01205"},{"key":"2034_CR21","unstructured":"Chen, M., Wu, K., Ni, B., Peng, H., Liu, B., Fu, J., Chao, H., & Ling, H. (2021). Searching the search space of vision transformer. In NeurIPS."},{"key":"2034_CR22","doi-asserted-by":"crossref","unstructured":"Chen, Q., Wu, Q., Wang, J., Hu, Q., Hu, T., Ding, E., & Cheng, J., Wang, J. (2022). Mixformer: Mixing features across windows and dimensions. In CVPR.","DOI":"10.1109\/CVPR52688.2022.00518"},{"key":"2034_CR23","unstructured":"Chen, T., Saxena, S., Li, L., Fleet, D. J., & Hinton, G. (2022). Pix2seq: A language modeling framework for object detection. In ICLR."},{"key":"2034_CR24","doi-asserted-by":"crossref","unstructured":"Chen, X., Ding, M., Wang, X., Xin, Y., Mo, S., Wang, Y., Han, S., Luo, P., Zeng, G., & Wang, J. (2023). Context autoencoder for self-supervised representation learning. In IJCV.","DOI":"10.1007\/s11263-023-01852-4"},{"key":"2034_CR25","doi-asserted-by":"crossref","unstructured":"Chen, X., Xie, S., & He, K. (2021). An empirical study of training self-supervised visual transformers. In ICCV.","DOI":"10.1109\/ICCV48922.2021.00950"},{"key":"2034_CR26","doi-asserted-by":"crossref","unstructured":"Chen, Y., Dai, X., Chen, D., Liu, M., Dong, X., Yuan, L., & Liu, Z. (2022). Mobile-former: Bridging mobilenet and transformer. In CVPR.","DOI":"10.1109\/CVPR52688.2022.00520"},{"key":"2034_CR27","doi-asserted-by":"crossref","unstructured":"Chen, Z., & Kang, L. (2005). Multi-population evolutionary algorithm for solving constrained optimization problems. In AIAI.","DOI":"10.1007\/0-387-29295-0_41"},{"key":"2034_CR28","doi-asserted-by":"crossref","unstructured":"Chen, Z., Zhu, Y., Zhao, C., Hu, G., Zeng, W., Wang, J., & Tang, M. (2021). Dpt: Deformable patch-based transformer for visual recognition. In ACM MM.","DOI":"10.1145\/3474085.3475467"},{"key":"2034_CR29","doi-asserted-by":"crossref","unstructured":"Cheng, B., Misra, I., Schwing, A.G., Kirillov, A., & Girdhar, R. (2022). Masked-attention mask transformer for universal image segmentation. In CVPR.","DOI":"10.1109\/CVPR52688.2022.00135"},{"key":"2034_CR30","unstructured":"Cheng, B., Schwing, A., & Kirillov, A. (2021). Per-pixel classification is not all you need for semantic segmentation. In NeurIPS."},{"key":"2034_CR31","unstructured":"Choromanski, K. M., Likhosherstov, V., Dohan, D., Song, X., Gane, A., Sarlos, T., Hawkins, P., Davis, J. Q., Mohiuddin, A., Kaiser, L., Belanger, D. B., Colwell, L. J., & Weller, A. (2021). Rethinking attention with performers. In ICLR."},{"key":"2034_CR32","unstructured":"Chu, X., Tian, Z., Wang, Y., Zhang, B., Ren, H., Wei, X., Xia, H., & Shen, C. (2021). Twins: Revisiting the design of spatial attention in vision transformers. In NeurIPS."},{"key":"2034_CR33","unstructured":"Chu, X., Tian, Z., Zhang, B., Wang, X., Wei, X., Xia, H., & Shen, C. (2023). Conditional positional encodings for vision transformers. In ICLR."},{"key":"2034_CR34","doi-asserted-by":"crossref","unstructured":"Coello, C. A. C., & Lamont, G. B. (2004). Applications of multi-objective evolutionary algorithms (Vol. 1). World Scientific.","DOI":"10.1142\/5712"},{"key":"2034_CR35","unstructured":"Cordonnier, J. B., Loukas, A., & Jaggi, M. (2020). On the relationship between self-attention and convolutional layers. In ICLR."},{"key":"2034_CR36","doi-asserted-by":"crossref","unstructured":"Dai, J., Qi, H., Xiong, Y., Li, Y., Zhang, G., Hu, H., & Wei, Y. (2017). Deformable convolutional networks. In ICCV.","DOI":"10.1109\/ICCV.2017.89"},{"key":"2034_CR37","unstructured":"Das, S., & Suganthan, P. N. (2010). Differential evolution: A survey of the state-of-the-art. TEC."},{"key":"2034_CR38","doi-asserted-by":"crossref","unstructured":"Deng, J., Dong, W., Socher, R., Li, L.J., Li, K., & Fei-Fei, L. (2009). Imagenet: A large-scale hierarchical image database. In CVPR.","DOI":"10.1109\/CVPR.2009.5206848"},{"key":"2034_CR39","unstructured":"Devlin, J., Chang, M. W., Lee, K., & Toutanova, K. (2019). Bert: Pre-training of deep bidirectional transformers for language understanding. In NAACL."},{"key":"2034_CR40","doi-asserted-by":"crossref","unstructured":"Dong, X., Bao, J., Chen, D., Zhang, W., Yu, N., Yuan, L., Chen, D., & Guo, B. (2022). Cswin transformer: A general vision transformer backbone with cross-shaped windows. In CVPR.","DOI":"10.1109\/CVPR52688.2022.01181"},{"key":"2034_CR41","doi-asserted-by":"crossref","unstructured":"Dong, X., Bao, J., Zhang, T., Chen, D., Zhang, W., Yuan, L., Chen, D., Wen, F., Yu, N., & Guo, B. (2023). Peco: Perceptual codebook for Bert pre-training of vision transformers. In AAAI.","DOI":"10.1609\/aaai.v37i1.25130"},{"key":"2034_CR42","unstructured":"Dong, Y., Cordonnier, J. B., & Loukas, A. (2021). Attention is not all you need: Pure attention loses rank doubly exponentially with depth. In ICML."},{"key":"2034_CR43","unstructured":"Dosovitskiy, A., Beyer, L., Kolesnikov, A., Weissenborn, D., Zhai, X., Unterthiner, T., Dehghani, M., Minderer, M., Heigold, G., Gelly, S., Uszkoreit, J., & Houlsby, N. (2021). An image is worth 16 $$\\times $$ 16 words: Transformers for image recognition at scale. In ICLR."},{"key":"2034_CR44","doi-asserted-by":"crossref","unstructured":"d\u2019Ascoli, S., Touvron, H., Leavitt, M. L., Morcos, A. S., Biroli, G., & Sagun, L. (2021). Convit: Improving vision transformers with soft convolutional inductive biases. In ICML.","DOI":"10.1088\/1742-5468\/ac9830"},{"key":"2034_CR45","unstructured":"Fang, Y., Liao, B., Wang, X., Fang, J., Qi, J., Wu, R., Niu, J., & Liu, W. (2021). You only look at one sequence: Rethinking transformer in vision through object detection. In NeurIPS."},{"key":"2034_CR46","doi-asserted-by":"crossref","unstructured":"Felleman, D. J., & Van Essen, D. C. (1991). Distributed hierarchical processing in the primate cerebral cortex. Cerebral Cortex.","DOI":"10.1093\/cercor\/1.1.1"},{"key":"2034_CR47","unstructured":"Gao, P., Ma, T., Li, H., Lin, Z., Dai, J., & Qiao, Y. (2022). Mcmae: Masked convolution meets masked autoencoders. In NeurIPS."},{"key":"2034_CR48","doi-asserted-by":"crossref","unstructured":"Garc\u00eda-Mart\u00ednez, C., & Lozano, M. (2008). Local search based on genetic algorithms. In Advances in metaheuristics for hard optimization. Springer.","DOI":"10.1007\/978-3-540-72960-0_10"},{"key":"2034_CR49","doi-asserted-by":"publisher","first-page":"20210068","DOI":"10.1098\/rspa.2021.0068","volume":"478","author":"A Goyal","year":"2022","unstructured":"Goyal, A., & Bengio, Y. (2022). Inductive biases for deep learning of higher-level cognition. Proceedings of the Royal Society A, 478, 20210068.","journal-title":"Proceedings of the Royal Society A"},{"key":"2034_CR50","doi-asserted-by":"crossref","unstructured":"Guo, J., Han, K., Wu, H., Tang, Y., Chen, X., Wang, Y., & Xu, C. (2022). Cmt: Convolutional neural networks meet vision transformers. In CVPR.","DOI":"10.1109\/CVPR52688.2022.01186"},{"key":"2034_CR51","doi-asserted-by":"crossref","unstructured":"Guo, M. H., Lu, C. Z., Liu, Z.N., Cheng, M. M., & Hu, S. M. (2023). Visual attention network. In CVM.","DOI":"10.1007\/s41095-023-0364-2"},{"key":"2034_CR52","unstructured":"Han, K., Xiao, A., Wu, E., Guo, J., Xu, C., & Wang, Y. (2021). Transformer in transformer. In NeurIPS."},{"key":"2034_CR53","doi-asserted-by":"crossref","unstructured":"Hao, Y., Dong, L., Wei, F., & Xu, K. (2021). Self-attention attribution: Interpreting information interactions inside transformer. In AAAI.","DOI":"10.1609\/aaai.v35i14.17533"},{"key":"2034_CR54","doi-asserted-by":"crossref","unstructured":"Hart, W. E., Krasnogor, N., & Smith, J. E. (2005). Memetic evolutionary algorithms. In Recent advances in memetic algorithms (pp. 3\u201327). Springer.","DOI":"10.1007\/3-540-32363-5_1"},{"key":"2034_CR55","doi-asserted-by":"publisher","first-page":"390","DOI":"10.3390\/info10120390","volume":"10","author":"A Hassanat","year":"2019","unstructured":"Hassanat, A., Almohammadi, K., Alkafaween, E., Abunawas, E., Hammouri, A., & Prasath, V. (2019). Choosing mutation and crossover ratios for genetic algorithms\u2014a review with a new dynamic approach. Information, 10, 390.","journal-title":"Information"},{"key":"2034_CR56","doi-asserted-by":"crossref","unstructured":"Hassani, A., Walton, S., Li, J., Li, S., & Shi, H. (2023). Neighborhood attention transformer. In CVPR.","DOI":"10.1109\/CVPR52729.2023.00599"},{"key":"2034_CR57","doi-asserted-by":"crossref","unstructured":"He, K., Chen, X., Xie, S., Li, Y., Doll\u00e1r, P., & Girshick, R. (2022). Masked autoencoders are scalable vision learners. In CVPR.","DOI":"10.1109\/CVPR52688.2022.01553"},{"key":"2034_CR58","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., & Sun, J. (2016). Deep residual learning for image recognition. In CVPR.","DOI":"10.1109\/CVPR.2016.90"},{"key":"2034_CR59","doi-asserted-by":"crossref","unstructured":"He, R., Ravula, A., Kanagal, B., & Ainslie, J. (2020). Realformer: Transformer likes residual attention. arXiv preprint arXiv:2012.11747.","DOI":"10.18653\/v1\/2021.findings-acl.81"},{"key":"2034_CR60","doi-asserted-by":"crossref","unstructured":"Howard, A., Sandler, M., Chu, G., Chen, L.C., Chen, B., Tan, M., Wang, W., Zhu, Y., Pang, R., Vasudevan, V., & Le, Q. V. (2019). Searching for mobilenetv3. In ICCV.","DOI":"10.1109\/ICCV.2019.00140"},{"key":"2034_CR61","unstructured":"Huang, Z., Ben, Y., Luo, G., Cheng, P., Yu, G., & Fu, B. (2021). Shuffle transformer: Rethinking spatial shuffle for vision transformer. arXiv preprint arXiv:2106.03650."},{"key":"2034_CR62","unstructured":"Hudson, D. A., & Zitnick, L. (2021). Generative adversarial transformers. In ICML."},{"key":"2034_CR63","unstructured":"Jiang, Y., Chang, S., & Wang, Z. (2021). Transgan: Two pure transformers can make one strong gan, and that can scale up. In NeurIPS."},{"key":"2034_CR64","unstructured":"Jiang, Z.H., Hou, Q., Yuan, L., Zhou, D., Shi, Y., Jin, X., Wang, A., & Feng, J. (2021). All tokens matter: Token labeling for training better vision transformers. In NeurIPS."},{"key":"2034_CR65","unstructured":"Katharopoulos, A., Vyas, A., Pappas, N., & Fleuret, F. (2020). Transformers are rnns: Fast autoregressive transformers with linear attention. In ICML."},{"key":"2034_CR66","doi-asserted-by":"crossref","unstructured":"Khare, V., Yao, X., & Deb, K. (2003). Performance scaling of multi-objective evolutionary algorithms. In EMO.","DOI":"10.1007\/3-540-36970-8_27"},{"key":"2034_CR67","unstructured":"Kim, J., Nguyen, D., Min, S., Cho, S., Lee, M., Lee, H., & Hong, S. (2022). Pure transformers are powerful graph learners. In NeurIPS."},{"key":"2034_CR68","unstructured":"Kitaev, N., Kaiser, L., & Levskaya, A. (2020). Reformer: The efficient transformer. In ICLR."},{"key":"2034_CR69","doi-asserted-by":"crossref","unstructured":"Kolen, A., & Pesch, E. (1994). Genetic local search in combinatorial optimization. Discrete Applied Mathematics.","DOI":"10.1016\/0166-218X(92)00180-T"},{"key":"2034_CR70","doi-asserted-by":"crossref","unstructured":"Kumar, S., Sharma, V. K., & Kumari, R. (2014). Memetic search in differential evolution algorithm. arXiv preprint arXiv:1408.0101.","DOI":"10.5120\/15582-4406"},{"key":"2034_CR71","unstructured":"Land, M. W. S. (1998). Evolutionary algorithms with local search for combinatorial optimization. University of California."},{"key":"2034_CR72","doi-asserted-by":"crossref","unstructured":"Lee, Y., Kim, J., Willette, J., & Hwang, S. J. (2022). Mpvit: Multi-path vision transformer for dense prediction. In CVPR.","DOI":"10.1109\/CVPR52688.2022.00714"},{"key":"2034_CR73","doi-asserted-by":"crossref","unstructured":"Li, C., Tang, T., Wang, G., Peng, J., Wang, B., Liang, X., & Chang, X. (2021). Bossnas: Exploring hybrid cnn-transformers with block-wisely self-supervised neural architecture search. In ICCV.","DOI":"10.1109\/ICCV48922.2021.01206"},{"key":"2034_CR74","unstructured":"Li, K., Wang, Y., Peng, G., Song, G., Liu, Y., Li, H., & Qiao, Y. (2022). Uniformer: Unified transformer for efficient spatial-temporal representation learning. In ICLR."},{"key":"2034_CR75","doi-asserted-by":"crossref","unstructured":"Li, K., Wang, Y., Zhang, J., Gao, P., Song, G., Liu, Y., Li, H., & Qiao, Y. (2023). Uniformer: Unifying convolution and self-attention for visual recognition. TPAMI.","DOI":"10.1109\/TPAMI.2023.3282631"},{"key":"2034_CR76","doi-asserted-by":"publisher","first-page":"285","DOI":"10.1016\/j.neucom.2020.09.007","volume":"421","author":"X Li","year":"2021","unstructured":"Li, X., Wang, L., Jiang, Q., & Li, N. (2021). Differential evolution algorithm with multi-population cooperation and multi-strategy integration. Neurocomputing, 421, 285\u2013302.","journal-title":"Neurocomputing"},{"key":"2034_CR77","doi-asserted-by":"crossref","unstructured":"Li, Y., Hu, J., Wen, Y., Evangelidis, G., Salahi, K., Wang, Y., Tulyakov, S., & Ren, J. (2023). Rethinking vision transformers for mobilenet size and speed. In ICCV.","DOI":"10.1109\/ICCV51070.2023.01549"},{"key":"2034_CR78","unstructured":"Li, Y., Zhang, K., Cao, J., Timofte, R., & Van\u00a0Gool, L. (2021). Localvit: Bringing locality to vision transformers. arXiv preprint arXiv:2104.05707"},{"key":"2034_CR79","doi-asserted-by":"crossref","unstructured":"Liang, J., Cao, J., Sun, G., Zhang, K., Van\u00a0Gool, L., & Timofte, R. (2021). Swinir: Image restoration using swin transformer. In ICCV.","DOI":"10.1109\/ICCVW54120.2021.00210"},{"key":"2034_CR80","doi-asserted-by":"crossref","unstructured":"Lin, T.Y., Maire, M., Belongie, S., Hays, J., Perona, P., Ramanan, D., Doll\u00e1r, P., & Zitnick, C. L. (2014). Microsoft coco: Common objects in context. In ECCV.","DOI":"10.1007\/978-3-319-10602-1_48"},{"key":"2034_CR81","doi-asserted-by":"publisher","first-page":"448","DOI":"10.1007\/s00500-004-0363-x","volume":"9","author":"J Liu","year":"2005","unstructured":"Liu, J., & Lampinen, J. (2005). A fuzzy adaptive differential evolution algorithm. Soft Computing, 9, 448\u2013462.","journal-title":"Soft Computing"},{"key":"2034_CR82","unstructured":"Liu, Y., Li, H., Guo, Y., Kong, C., Li, J., & Wang, S. (2022). Rethinking attention-model explainability through faithfulness violation test. In ICML."},{"key":"2034_CR83","doi-asserted-by":"crossref","unstructured":"Liu, Z., Hu, H., Lin, Y., Yao, Z., Xie, Z., Wei, Y., Ning, J., Cao, Y., Zhang, Z., Dong, L., & Wei, F. (2022). Swin transformer v2: Scaling up capacity and resolution. In CVPR.","DOI":"10.1109\/CVPR52688.2022.01170"},{"key":"2034_CR84","doi-asserted-by":"crossref","unstructured":"Liu, Z., Lin, Y., Cao, Y., Hu, H., Wei, Y., Zhang, Z., Lin, S., Guo, B. (2021). Swin transformer: Hierarchical vision transformer using shifted windows. In ICCV.","DOI":"10.1109\/ICCV48922.2021.00986"},{"key":"2034_CR85","unstructured":"Loshchilov, I., & Hutter, F. (2019). Decoupled weight decay regularization. In ICLR."},{"key":"2034_CR86","unstructured":"Lu, J., Mottaghi, R., & Kembhavi, A. (2021). Container: Context aggregation networks. In NeurIPS."},{"key":"2034_CR87","doi-asserted-by":"crossref","unstructured":"Maaz, M., Shaker, A., Cholakkal, H., Khan, S., Zamir, S. W., Anwer, R. M., & Shahbaz\u00a0Khan, F. (2023). Edgenext: Efficiently amalgamated cnn-transformer architecture for mobile vision applications. In ECCVW.","DOI":"10.1007\/978-3-031-25082-8_1"},{"key":"2034_CR88","unstructured":"Mehta, S., & Rastegari, M. (2022). Mobilevit: Light-weight, general-purpose, and mobile-friendly vision transformer. In ICLR."},{"key":"2034_CR89","unstructured":"Min, J., Zhao, Y., Luo, C., & Cho, M. (2022). Peripheral vision transformer. In NeurIPS."},{"key":"2034_CR90","first-page":"1989","volume":"826","author":"P Moscato","year":"1989","unstructured":"Moscato, P., et al. (1989). On evolution, search, optimization, genetic algorithms and martial arts: Towards memetic algorithms. Caltech Concurrent Computation Program, C3P Report, 826, 1989.","journal-title":"Caltech Concurrent Computation Program, C3P Report"},{"key":"2034_CR91","doi-asserted-by":"publisher","first-page":"909","DOI":"10.1152\/jn.1993.70.3.909","volume":"70","author":"BC Motter","year":"1993","unstructured":"Motter, B. C. (1993). Focal attention produces spatially selective processing in visual cortical areas v1, v2, and v4 in the presence of competing stimuli. Journal of Neurophysiology, 70, 909\u2013919.","journal-title":"Journal of Neurophysiology"},{"key":"2034_CR92","doi-asserted-by":"crossref","unstructured":"Nakashima, K., Kataoka, H., Matsumoto, A., Iwata, K., Inoue, N., & Satoh, Y. (2022). Can vision transformers learn without natural images? In AAAI.","DOI":"10.1609\/aaai.v36i2.20094"},{"key":"2034_CR93","doi-asserted-by":"crossref","unstructured":"Neimark, D., Bar, O., Zohar, M., & Asselmann, D. (2021). Video transformer network. In ICCV.","DOI":"10.1109\/ICCVW54120.2021.00355"},{"key":"2034_CR94","doi-asserted-by":"publisher","first-page":"546","DOI":"10.1016\/j.swevo.2018.06.010","volume":"44","author":"KR Opara","year":"2019","unstructured":"Opara, K. R., & Arabas, J. (2019). Differential evolution: A survey of theoretical analyses. Swarm and Evolutionary Computation, 44, 546\u2013558.","journal-title":"Swarm and Evolutionary Computation"},{"key":"2034_CR95","doi-asserted-by":"crossref","unstructured":"Padhye, N., Mittal, P., & Deb, K. (2013). Differential evolution: Performances and analyses. In CEC.","DOI":"10.1109\/CEC.2013.6557799"},{"key":"2034_CR96","doi-asserted-by":"crossref","unstructured":"Pan, X., Ge, C., Lu, R., Song, S., Chen, G., Huang, Z., & Huang, G. (2022). On the integration of self-attention and convolution. In CVPR.","DOI":"10.1109\/CVPR52688.2022.00089"},{"key":"2034_CR97","doi-asserted-by":"publisher","first-page":"103479","DOI":"10.1016\/j.engappai.2020.103479","volume":"90","author":"M Pant","year":"2020","unstructured":"Pant, M., Zaheer, H., Garcia-Hernandez, L., Abraham, A., et al. (2020). Differential evolution: A review of more than two decades of research. Engineering Applications of Artificial Intelligence, 90, 103479.","journal-title":"Engineering Applications of Artificial Intelligence"},{"key":"2034_CR98","unstructured":"Paszke, A., Gross, S., Massa, F., Lerer, A., Bradbury, J., Chanan, G., Killeen, T., Lin, Z., Gimelshein, N., Antiga, L., & Desmaison, A. (2019). Pytorch: An imperative style, high-performance deep learning library. In NeurIPS."},{"key":"2034_CR99","doi-asserted-by":"crossref","unstructured":"Peters, M.E., Neumann, M., Iyyer, M., Gardner, M., Clark, C., Lee, K., & Zettlemoyer, L. (2018). Deep contextualized word representations. In ICLR.","DOI":"10.18653\/v1\/N18-1202"},{"key":"2034_CR100","unstructured":"Qiang, Y., Pan, D., Li, C., Li, X., Jang, R., & Zhu, D. (2022). Attcat: Explaining transformers via attentive class activation tokens. In NeurIPS."},{"key":"2034_CR101","unstructured":"Radford, A., Narasimhan, K., Salimans, T., Sutskever, I., & Sutskever, I. (2018). Improving language understanding by generative pre-training. OpenAI."},{"key":"2034_CR102","unstructured":"Radford, A., Wu, J., Child, R., Luan, D., Amodei, D., Sutskever, I. (2019). Language models are unsupervised multitask learners. OpenAI blog."},{"key":"2034_CR103","unstructured":"Raghu, M., Unterthiner, T., Kornblith, S., & Zhang, C. (2021). Dosovitskiy, A. Do vision transformers see like convolutional neural networks? In NeurIPS."},{"key":"2034_CR104","doi-asserted-by":"crossref","unstructured":"Ren, S., Zhou, D., He, S., Feng, J., & Wang, X. (2022). Shunted self-attention via multi-scale token aggregation. In CVPR.","DOI":"10.1109\/CVPR52688.2022.01058"},{"key":"2034_CR105","doi-asserted-by":"crossref","unstructured":"Selvaraju, R.R., Cogswell, M., Das, A., Vedantam, R., & Parikh, D. (2017). Batra, D. Grad-cam: Visual explanations from deep networks via gradient-based localization. In ICCV.","DOI":"10.1109\/ICCV.2017.74"},{"key":"2034_CR106","doi-asserted-by":"crossref","unstructured":"Shi, E. C., Leung, F. H., & Law, B. N. (2014). Differential evolution with adaptive population size. In ICDSP.","DOI":"10.1109\/ICDSP.2014.6900794"},{"key":"2034_CR107","unstructured":"Si, C., Yu, W., Zhou, P., Zhou, Y., Wang, X., & Yan, S. (2022). Inception transformer. In NeurIPS."},{"key":"2034_CR108","doi-asserted-by":"crossref","unstructured":"Sloss, A. N., & Gustafson, S. (2020). 2019 evolutionary algorithms review. In Genetic programming theory and practice XVII.","DOI":"10.1007\/978-3-030-39958-0_16"},{"key":"2034_CR109","doi-asserted-by":"crossref","unstructured":"Srinivas, A., Lin, T. Y., Parmar, N., Shlens, J., Abbeel, P., & Vaswani, A. (2021). Bottleneck transformers for visual recognition. In CVPR.","DOI":"10.1109\/CVPR46437.2021.01625"},{"key":"2034_CR110","doi-asserted-by":"crossref","unstructured":"Storn, R., & Price, K. (1997). Differential evolution\u2013a simple and efficient heuristic for global optimization over continuous spaces. Journal of Global Optimization 341\u2013359","DOI":"10.1023\/A:1008202821328"},{"key":"2034_CR111","unstructured":"Tan, M., & Le, Q. (2019). Efficientnet: Rethinking model scaling for convolutional neural networks. In ICML."},{"key":"2034_CR112","doi-asserted-by":"crossref","unstructured":"Thatipelli, A., Narayan, S., Khan, S., Anwer, R. M., Khan, F. S., & Ghanem, B. (2022). Spatio-temporal relation modeling for few-shot action recognition. In CVPR.","DOI":"10.1109\/CVPR52688.2022.01933"},{"key":"2034_CR113","doi-asserted-by":"publisher","first-page":"151","DOI":"10.1162\/106365603766646816","volume":"11","author":"A Toffolo","year":"2003","unstructured":"Toffolo, A., & Benini, E. (2003). Genetic diversity as an objective in multi-objective evolutionary algorithms. Evolutionary Computation, 11, 151\u2013167.","journal-title":"Evolutionary Computation"},{"key":"2034_CR114","unstructured":"Touvron, H., Cord, M., Douze, M., Massa, F., Sablayrolles, A., & J\u00e9gou, H. (2021). Training data-efficient image transformers & distillation through attention. In ICML."},{"key":"2034_CR115","doi-asserted-by":"crossref","unstructured":"Touvron, H., Cord, M., Sablayrolles, A., Synnaeve, G., & J\u00e9gou, H. (2021). Going deeper with image transformers. In ICCV.","DOI":"10.1109\/ICCV48922.2021.00010"},{"key":"2034_CR116","doi-asserted-by":"crossref","unstructured":"Tu, Z., Talebi, H., Zhang, H., Yang, F., Milanfar, P., Bovik, A., & Li, Y. (2022). Maxvit: Multi-axis vision transformer. In ECCV.","DOI":"10.1007\/978-3-031-20053-3_27"},{"key":"2034_CR117","doi-asserted-by":"crossref","unstructured":"Valanarasu, J.M.J., Oza, P., Hacihaliloglu, I., & Patel, V. M. (2021). Medical transformer: Gated axial-attention for medical image segmentation. In MICCAI.","DOI":"10.1007\/978-3-030-87193-2_4"},{"key":"2034_CR118","doi-asserted-by":"crossref","unstructured":"Vaswani, A., Ramachandran, P., Srinivas, A., Parmar, N., Hechtman, B., & Shlens, J. (2021). Scaling local self-attention for parameter efficient visual backbones. In CVPR.","DOI":"10.1109\/CVPR46437.2021.01270"},{"key":"2034_CR119","unstructured":"Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A. N., Kaiser, L. u., & Polosukhin, I. (2017). Attention is all you need. In NeurIPS."},{"key":"2034_CR120","doi-asserted-by":"crossref","unstructured":"Vikhar, P. A. (2016). Evolutionary algorithms: A critical review and its future prospects. In ICGTSPICC.","DOI":"10.1109\/ICGTSPICC.2016.7955308"},{"key":"2034_CR121","doi-asserted-by":"crossref","unstructured":"Wan, Z., Chen, H., An, J., Jiang, W., Yao, C., & Luo, J. (2022). Facial attribute transformers for precise and robust makeup transfer. In CACV.","DOI":"10.1109\/WACV51458.2022.00317"},{"key":"2034_CR122","doi-asserted-by":"crossref","unstructured":"Wang, H., Wu, Z., Liu, Z., Cai, H., Zhu, L., Gan, C., & Han, S. (2020). Hat: Hardware-aware transformers for efficient natural language processing. In ACL.","DOI":"10.18653\/v1\/2020.acl-main.686"},{"key":"2034_CR123","doi-asserted-by":"crossref","unstructured":"Wang, R., Chen, D., Wu, Z., Chen, Y., Dai, X., Liu, M., Jiang, Y. G., Zhou, L., & Yuan, L. (2022). Bevt: Bert pretraining of video transformers. In CVPR.","DOI":"10.1109\/CVPR52688.2022.01432"},{"key":"2034_CR124","unstructured":"Wang, S., Li, B., Khabsa, M., Fang, H., & Ma, H. (2020). Linformer: Self-attention with linear complexity. arXiv preprint arXiv:2006.04768"},{"key":"2034_CR125","doi-asserted-by":"crossref","unstructured":"Wang, W., Xie, E., Li, X., Fan, D.P., Song, K., Liang, D., Lu, T., Luo, P., & Shao, L. (2021). Pyramid vision transformer: A versatile backbone for dense prediction without convolutions. In ICCV.","DOI":"10.1109\/ICCV48922.2021.00061"},{"key":"2034_CR126","doi-asserted-by":"crossref","unstructured":"Wang, W., Xie, E., Li, X., Fan, D. P., Song, K., Liang, D., Lu, T., Luo, P., & Shao, L. (2022). Pvt v2: Improved baselines with pyramid vision transformer. CVM.","DOI":"10.1007\/s41095-022-0274-8"},{"key":"2034_CR127","unstructured":"Wang, W., Yao, L., Chen, L., Lin, B., Cai, D., He, X., & Liu, W. (2022). Crossformer: A versatile vision transformer hinging on cross-scale attention. In ICLR."},{"key":"2034_CR128","unstructured":"Wang, Y., Yang, Y., Bai, J., Zhang, M., Bai, J., Yu, J., Zhang, C., Huang, G., & Tong, Y. (2021). Evolving attention with residual convolutions. In ICML."},{"key":"2034_CR129","doi-asserted-by":"crossref","unstructured":"Wei, C., Fan, H., Xie, S., Wu, C. Y., Yuille, A., & Feichtenhofer, C. (2022). Masked feature prediction for self-supervised visual pre-training. In CVPR.","DOI":"10.1109\/CVPR52688.2022.01426"},{"key":"2034_CR130","unstructured":"Wightman, R. (2019). Pytorch image models. https:\/\/github.com\/rwightman\/pytorch-image-models"},{"key":"2034_CR131","unstructured":"Wightman, R., Touvron, H., & Jegou, H. (2021). Resnet strikes back: An improved training procedure in timm. In NeurIPSW."},{"key":"2034_CR132","doi-asserted-by":"crossref","unstructured":"Wu, H., Xiao, B., Codella, N., Liu, M., Dai, X., Yuan, L., & Zhang, L. (2021). Cvt: Introducing convolutions to vision transformers. In ICCV.","DOI":"10.1109\/ICCV48922.2021.00009"},{"key":"2034_CR133","doi-asserted-by":"crossref","unstructured":"Xia, Z., Pan, X., Song, S., Li, L.E., & Huang, G. (2022). Vision transformer with deformable attention. In CVPR.","DOI":"10.1109\/CVPR52688.2022.00475"},{"key":"2034_CR134","doi-asserted-by":"crossref","unstructured":"Xiao, T., Liu, Y., Zhou, B., Jiang, Y., & Sun, J. (2018). Unified perceptual parsing for scene understanding. In ECCV.","DOI":"10.1007\/978-3-030-01228-1_26"},{"key":"2034_CR135","unstructured":"Xie, E., Wang, W., Yu, Z., Anandkumar, A., Alvarez, J. M., & Luo, P. (2021). Segformer: Simple and efficient design for semantic segmentation with transformers. In NeurIPS."},{"key":"2034_CR136","doi-asserted-by":"crossref","unstructured":"Xie, Z., Zhang, Z., Cao, Y., Lin, Y., Bao, J., Yao, Z., Dai, Q., & Hu, H. (2022). Simmim: A simple framework for masked image modeling. In CVPR.","DOI":"10.1109\/CVPR52688.2022.00943"},{"key":"2034_CR137","doi-asserted-by":"crossref","unstructured":"Xu, L., Yan, X., Ding, W., & Liu, Z. (2023). Attribution rollout: a new way to interpret visual transformer. JAIHC.","DOI":"10.1007\/s12652-022-04354-2"},{"key":"2034_CR138","unstructured":"Xu, M., Xiong, Y., Chen, H., Li, X., Xia, W., Tu, Z., & Soatto, S. (2021). Long short-term transformer for online action detection. In NeurIPS."},{"key":"2034_CR139","doi-asserted-by":"crossref","unstructured":"Xu, W., Xu, Y., Chang, T., & Tu, Z. (2021). Co-scale conv-attentional image transformers. In ICCV.","DOI":"10.1109\/ICCV48922.2021.00983"},{"key":"2034_CR140","unstructured":"Xu, Y., Zhang, Q., Zhang, J., & Tao, D. (2021). Vitae: Vision transformer advanced by exploring intrinsic inductive bias. In NeurIPS."},{"key":"2034_CR141","doi-asserted-by":"crossref","unstructured":"Yang, C., Wang, Y., Zhang, J., Zhang, H., Wei, Z., Lin, Z., & Yuille, A. (2022). Lite vision transformer with enhanced self-attention. In CVPR.","DOI":"10.1109\/CVPR52688.2022.01169"},{"key":"2034_CR142","doi-asserted-by":"crossref","unstructured":"Yu, W., Luo, M., Zhou, P., Si, C., Zhou, Y., Wang, X., Feng, J., & Yan, S. (2022). Metaformer is actually what you need for vision. In CVPR.","DOI":"10.1109\/CVPR52688.2022.01055"},{"key":"2034_CR143","doi-asserted-by":"crossref","unstructured":"Yuan, K., Guo, S., Liu, Z., Zhou, A., Yu, F., & Wu, W. (2021). Incorporating convolution designs into visual transformers. In ICCV.","DOI":"10.1109\/ICCV48922.2021.00062"},{"key":"2034_CR144","doi-asserted-by":"crossref","unstructured":"Yuan, L., Chen, Y., Wang, T., Yu, W., Shi, Y., Jiang, Z. H., Tay, F. E., Feng, J., & Yan, S. (2021). Tokens-to-token vit: Training vision transformers from scratch on imagenet. In ICCV.","DOI":"10.1109\/ICCV48922.2021.00060"},{"key":"2034_CR145","doi-asserted-by":"crossref","unstructured":"Yuan, L., Hou, Q., Jiang, Z., Feng, J., & Yan, S. (2022). Volo: Vision outlooker for visual recognition. In TPAMI.","DOI":"10.1109\/TPAMI.2022.3206108"},{"key":"2034_CR146","unstructured":"Yuan, Y., Fu, R., Huang, L., Lin, W., Zhang, C., Chen, X., & Wang, J. (2021). Hrformer: High-resolution vision transformer for dense predict. In NeurIPS."},{"key":"2034_CR147","doi-asserted-by":"crossref","unstructured":"Zamir, S. W., Arora, A., Khan, S., Hayat, M., Khan, F. S., & Yang, M. H. (2022). Restormer: Efficient transformer for high-resolution image restoration. In CVPR.","DOI":"10.1109\/CVPR52688.2022.00564"},{"key":"2034_CR148","doi-asserted-by":"crossref","unstructured":"Zhang, J., Li, X., Li, J., Liu, L., Xue, Z., Zhang, B., Jiang, Z., Huang, T., Wang, Y., & Wang, C. (2023). Rethinking mobile block for efficient attention-based models. In ICCV.","DOI":"10.1109\/ICCV51070.2023.00134"},{"key":"2034_CR149","unstructured":"Zhang, J., Xu, C., Li, J., Chen, W., Wang, Y., Tai, Y., Chen, S., Wang, C., Huang, F., & Liu, Y. (2021). Analogous to evolutionary algorithm: Designing a unified sequence model. In NeurIPS."},{"key":"2034_CR150","doi-asserted-by":"crossref","unstructured":"Zhang, Q., Xu, Y., Zhang, J., & Tao, D. (2023). Vitaev2: Vision transformer advanced by exploring inductive bias for image recognition and beyond. IJCV.","DOI":"10.1007\/s11263-022-01739-w"},{"key":"2034_CR151","doi-asserted-by":"crossref","unstructured":"Zheng, S., Lu, J., Zhao, H., Zhu, X., Luo, Z., Wang, Y., Fu, Y., Feng, J., Xiang, T., Torr, P. H., & Zhang, L. (2021). Rethinking semantic segmentation from a sequence-to-sequence perspective with transformers. In CVPR.","DOI":"10.1109\/CVPR46437.2021.00681"},{"key":"2034_CR152","doi-asserted-by":"crossref","unstructured":"Zhou, B., Zhao, H., Puig, X., Xiao, T., Fidler, S., Barriuso, A., & Torralba, A. (2019). Semantic understanding of scenes through the ade20k dataset. In IJCV.","DOI":"10.1007\/s11263-018-1140-0"},{"key":"2034_CR153","unstructured":"Zhou, D., Kang, B., Jin, X., Yang, L., Lian, X., Hou, Q., & Feng, J. (2021). Deepvit: Towards deeper vision transformer. arXiv preprint arXiv:2103.11886"},{"key":"2034_CR154","doi-asserted-by":"crossref","unstructured":"Zhu, X., Hu, H., Lin, S., & Dai, J. (2019). Deformable convnets v2: More deformable, better results. In CVPR.","DOI":"10.1109\/CVPR.2019.00953"},{"key":"2034_CR155","unstructured":"Zhu, X., Su, W., Lu, L., Li, B., Wang, X., & Dai, J. (2021). Deformable {detr}: Deformable transformers for end-to-end object detection. In ICLR."}],"container-title":["International Journal of Computer Vision"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-024-02034-6.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11263-024-02034-6\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-024-02034-6.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,8,27]],"date-time":"2024-08-27T07:29:29Z","timestamp":1724743769000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11263-024-02034-6"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,4,2]]},"references-count":155,"journal-issue":{"issue":"9","published-print":{"date-parts":[[2024,9]]}},"alternative-id":["2034"],"URL":"https:\/\/doi.org\/10.1007\/s11263-024-02034-6","relation":{},"ISSN":["0920-5691","1573-1405"],"issn-type":[{"value":"0920-5691","type":"print"},{"value":"1573-1405","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024,4,2]]},"assertion":[{"value":"18 June 2022","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"12 February 2024","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"2 April 2024","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}