{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,22]],"date-time":"2026-04-22T17:53:55Z","timestamp":1776880435623,"version":"3.51.2"},"publisher-location":"Cham","reference-count":47,"publisher":"Springer Nature Switzerland","isbn-type":[{"value":"9783031773914","type":"print"},{"value":"9783031773921","type":"electronic"}],"license":[{"start":{"date-parts":[[2025,1,1]],"date-time":"2025-01-01T00:00:00Z","timestamp":1735689600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2025,1,1]],"date-time":"2025-01-01T00:00:00Z","timestamp":1735689600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025]]},"DOI":"10.1007\/978-3-031-77392-1_2","type":"book-chapter","created":{"date-parts":[[2025,1,21]],"date-time":"2025-01-21T18:25:39Z","timestamp":1737483939000},"page":"17-30","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":1,"title":["AFIDAF: Alternating Fourier and\u00a0Image Domain Adaptive Filters as\u00a0an\u00a0Efficient Alternative to\u00a0Attention in\u00a0ViTs"],"prefix":"10.1007","author":[{"ORCID":"https:\/\/orcid.org\/0000-0003-0242-6788","authenticated-orcid":false,"given":"Yunling","family":"Zheng","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0004-8297-3136","authenticated-orcid":false,"given":"Zeyi","family":"Xu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-8366-9591","authenticated-orcid":false,"given":"Fanghui","family":"Xue","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-2153-3247","authenticated-orcid":false,"given":"Biao","family":"Yang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jiancheng","family":"Lyu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-3508-932X","authenticated-orcid":false,"given":"Shuai","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-1430-258X","authenticated-orcid":false,"given":"Yingyong","family":"Qi","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-6438-8476","authenticated-orcid":false,"given":"Jack","family":"Xin","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2025,1,22]]},"reference":[{"key":"2_CR1","doi-asserted-by":"crossref","unstructured":"Cai, H., Li, J., Hu, M., Gan, C., Han, S.: Efficientvit: lightweight multi-scale linear attention for high-resolution dense prediction. In: ICCV (2023)","DOI":"10.1109\/ICCV51070.2023.01587"},{"key":"2_CR2","unstructured":"Chen, L.C., Papandreou, G., Schroff, F., Adam, H.: Rethinking atrous convolution for semantic image segmentation. arXiv preprint arXiv:1706.05587 (2017)"},{"key":"2_CR3","doi-asserted-by":"crossref","unstructured":"Chen, Q., et al.: Mixformer: mixing features across windows and dimensions. In: CVPR (2022)","DOI":"10.1109\/CVPR52688.2022.00518"},{"key":"2_CR4","doi-asserted-by":"crossref","unstructured":"Dong, X., et al.: Cswin transformer: a general vision transformer backbone with cross-shaped windows. In: CVPR (2022)","DOI":"10.1109\/CVPR52688.2022.01181"},{"key":"2_CR5","doi-asserted-by":"publisher","first-page":"98","DOI":"10.1007\/s11263-014-0733-5","volume":"111","author":"M Everingham","year":"2015","unstructured":"Everingham, M., Eslami, S.A., Van Gool, L., Williams, C.K., Winn, J., Zisserman, A.: The pascal visual object classes challenge: a retrospective. Int. J. Comput. Vision 111, 98\u2013136 (2015)","journal-title":"Int. J. Comput. Vision"},{"key":"2_CR6","doi-asserted-by":"crossref","unstructured":"Fan, H., et al.: Multiscale vision transformers. In: ICCV (2021)","DOI":"10.1109\/ICCV48922.2021.00675"},{"key":"2_CR7","doi-asserted-by":"crossref","unstructured":"Graham, B., et al.: Levit: a vision transformer in convnet\u2019s clothing for faster inference. ICCV (2021)","DOI":"10.1109\/ICCV48922.2021.01204"},{"key":"2_CR8","unstructured":"Guibas, J., Mardani, M., Li, Z., Tao, A., Anandkumar, A., Catanzaro, B.: Adaptive fourier neural operators: efficient token mixers for transformers. ICLR (2022)"},{"issue":"4","key":"2_CR9","doi-asserted-by":"publisher","first-page":"733","DOI":"10.1007\/s41095-023-0364-2","volume":"9","author":"M Guo","year":"2023","unstructured":"Guo, M., Lu, C., Liu, Z., Cheng, M., Hu, S.: Visual attention network. Comput. Vis. Media 9(4), 733\u2013752 (2023)","journal-title":"Comput. Vis. Media"},{"key":"2_CR10","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., Sun, J.: Deep residual learning for image recognition. In: CVPR (2016)","DOI":"10.1109\/CVPR.2016.90"},{"key":"2_CR11","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2024.3401450","author":"Q Hou","year":"2024","unstructured":"Hou, Q., Lu, C., Cheng, M., Feng, J.: Conv2former: a simple transformer-style convnet for visual recognition. IEEE Trans PAMI (2024). https:\/\/doi.org\/10.1109\/TPAMI.2024.3401450","journal-title":"IEEE Trans PAMI"},{"key":"2_CR12","doi-asserted-by":"crossref","unstructured":"Huang, Z., Zhang, Z., Lan, C., Zha, Z.J., Lu, Y., Guo, B.: Adaptive frequency filters as efficient global token mixers. In: ICCV (2023)","DOI":"10.1109\/ICCV51070.2023.00556"},{"key":"2_CR13","unstructured":"Huang, Z., Ben, Y., Luo, G., Cheng, P., Yu, G., Fu, B.: Shuffle transformer: ethinking spatial shuffle for vision transformer. arXiv:2106.03650 (2021)"},{"key":"2_CR14","unstructured":"Kolesnikov, A., et al.: An image is worth 16x16 words: transformers for image recognition at scale. ICLR (2021)"},{"key":"2_CR15","unstructured":"LeCun, Y., Bengio, Y.: Convolutional Networks for Images, Speech, and Time Series. MIT press (1998)"},{"key":"2_CR16","doi-asserted-by":"crossref","unstructured":"Lee-Thorp, J., Ainslie, J., Eckstein, I., Ontanon, S.: Fnet: Mixing tokens with Fourier transforms. Proc. 2022 Conf. North Amer. Chapt. Assoc. Comput. Ling.: Human Language Tech pp. 4296 \u2013 4313 (2022)","DOI":"10.18653\/v1\/2022.naacl-main.319"},{"key":"2_CR17","first-page":"1","volume":"61","author":"J Li","year":"2023","unstructured":"Li, J., Leng, Y., Song, R., Liu, W., Li, Y., Du, Q.: Mformer: taming masked transformer for unsupervised spectral reconstruction. IEEE Trans. Geosci Remote Sensing 61, 1\u201312 (2023)","journal-title":"IEEE Trans. Geosci Remote Sensing"},{"issue":"10","key":"2_CR18","doi-asserted-by":"publisher","first-page":"12581","DOI":"10.1109\/TPAMI.2023.3282631","volume":"45","author":"K Li","year":"2023","unstructured":"Li, K., et al.: Uniformer: unifying convolution and self-attention for visual recognition. IEEE Trans PAMI 45(10), 12581\u201312600 (2023)","journal-title":"IEEE Trans PAMI"},{"key":"2_CR19","doi-asserted-by":"crossref","unstructured":"Li, Y., Wu, C.Y., Fan, H., Mangalam, K., Xiong, B., Malik, J., Feichtenhofer, C.: MViTv2: Improved Multiscale Vision Transformers for Classification and Detection. CVPR (2022)","DOI":"10.1109\/CVPR52688.2022.00476"},{"key":"2_CR20","doi-asserted-by":"crossref","unstructured":"Li, Y., et al.: Rethinking vision transformers for MobileNet size and speed. In: ICCV (2023)","DOI":"10.1109\/ICCV51070.2023.01549"},{"key":"2_CR21","doi-asserted-by":"crossref","unstructured":"Lin, T.Y., Maire, M., Belongie, S., Hays, J., Perona, P., Ramanan, D., Doll\u00e1r, P., Zitnick, C.L.: Microsoft COCO: common objects in context. In: ECCV (2014)","DOI":"10.1007\/978-3-319-10602-1_48"},{"key":"2_CR22","doi-asserted-by":"crossref","unstructured":"Liu, W., et al.: Ssd: single shot multibox detector. ECCV (2016)","DOI":"10.1007\/978-3-319-46448-0_2"},{"key":"2_CR23","doi-asserted-by":"crossref","unstructured":"Liu, Z., Mao, H., Wu, C., Feichtenhofer, C., Darrell, T., Xie, S.: A ConvNet for the 2020s. CVPR (2022)","DOI":"10.1109\/CVPR52688.2022.01167"},{"key":"2_CR24","doi-asserted-by":"crossref","unstructured":"Liu, Z., et al.: Swin transformer: hierarchical vision transformer using shifted windows. In: ICCV (2021)","DOI":"10.1109\/ICCV48922.2021.00986"},{"key":"2_CR25","doi-asserted-by":"crossref","unstructured":"Lyu, J., Zhang, S., Qi, Y.Y., Xin, J.: Autoshufflenet: learning permutation matrices via an exact Lipschitz continuous penalty in deep convolutional neural networks. KDD (2020)","DOI":"10.1145\/3394486.3403103"},{"key":"2_CR26","doi-asserted-by":"crossref","unstructured":"Ma, N., Zhang, X., Zheng, H.T., Sun, J.: Shufflenet v2: practical guidelines for efficient cnn architecture design. ECCV (2018)","DOI":"10.1007\/978-3-030-01264-9_8"},{"key":"2_CR27","doi-asserted-by":"crossref","unstructured":"Maaz, M., Shaker, A., Cholakkal, H., Khan, S., Zamir, S., Anwer, R., Khan, F.: Edgenext: efficiently amalgamated CNN-transformer architecture for mobile vision applications. CADL at ECCV (2022)","DOI":"10.1007\/978-3-031-25082-8_1"},{"key":"2_CR28","doi-asserted-by":"crossref","unstructured":"Mehta, R., Sivaswamy, J.: M-net: a convolutional neural network for deep brain structure segmentation. In: IEEE Intern. Symposium Biomed Imaging, pp. 437\u2013440 (2017)","DOI":"10.1109\/ISBI.2017.7950555"},{"key":"2_CR29","unstructured":"Mehta, S., Rastegari, M.: Mobilevit: lightweight, general-purpose, and mobile-friendly vision transformer. ICLR (2022)"},{"key":"2_CR30","doi-asserted-by":"crossref","unstructured":"Pan, J., et al.: EdgeViTs: competing light-weight cnns on mobile devices with vision transformers. In: ECCV (2022)","DOI":"10.1007\/978-3-031-20083-0_18"},{"key":"2_CR31","unstructured":"Pan, Z., Cai, J., Zhuang, B.: Fast vision transformers with hilo attention. In: NeurIPS (2022)"},{"key":"2_CR32","unstructured":"Patro, B.N., Namboodiri, V.P., Agneeswaran, V.S.: Spectformer: frequency and attention is what you need in a vision transformer. arXiv preprint arXiv:2304.06446 (2023)"},{"key":"2_CR33","unstructured":"Qin, D., et al.: Mobilenetv4 - universal models for the mobile ecosystem. arXiv preprint arXiv:2404.10518 (2024)"},{"issue":"9","key":"2_CR34","doi-asserted-by":"publisher","first-page":"10960","DOI":"10.1109\/TPAMI.2023.3263824","volume":"45","author":"Y Rao","year":"2023","unstructured":"Rao, Y., Zhao, W., Zhu, Z., Zhou, J., Lu, J.: Gfnet: global filter networks for visual recognition. IEEE Trans PAMI 45(9), 10960\u201310973 (2023)","journal-title":"IEEE Trans PAMI"},{"key":"2_CR35","doi-asserted-by":"publisher","first-page":"211","DOI":"10.1007\/s11263-015-0816-y","volume":"115","author":"O Russakovsky","year":"2015","unstructured":"Russakovsky, O., et al.: Imagenet large scale visual recognition challenge. Int. J. Comput. Vision 115, 211\u2013252 (2015)","journal-title":"Int. J. Comput. Vision"},{"key":"2_CR36","unstructured":"Touvron, H., Cord, M., Douze, M., Massa, F., Sablayrolles, A., J\u00e9gou, H.: Training data-efficient image transformers & distillation through attention. ICML (2021)"},{"key":"2_CR37","unstructured":"Vaswani, A., et al.: Attention is all you need. NeurIPS 30 (2017)"},{"key":"2_CR38","doi-asserted-by":"crossref","unstructured":"Wang, A., Chen, H., Lin, Z., Han, J., Ding, G.: RepVit: revisiting Mobile CNN from ViT Perspective. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 15909\u201315920 (2024)","DOI":"10.1109\/CVPR52733.2024.01506"},{"key":"2_CR39","doi-asserted-by":"crossref","unstructured":"Woo, S., Debnath, S., Hu, R., Chen, X., Liu, Z., Kweon, I.S., Xie, S.: Convnext v2: co-designing and scaling convnets with masked autoencoders. CVPR (2023)","DOI":"10.1109\/CVPR52729.2023.01548"},{"key":"2_CR40","doi-asserted-by":"crossref","unstructured":"Wu, H., et al.: CvT: introducing convolutions to vision transformers. In: ICCV (2021)","DOI":"10.1109\/ICCV48922.2021.00009"},{"key":"2_CR41","doi-asserted-by":"crossref","unstructured":"Wu, S., Wu1, T., Tan, H., Guo, G.: Pale transformer: a general vision transformer backbone with pale-shaped attention. AAAI (2022)","DOI":"10.1609\/aaai.v36i3.20176"},{"key":"2_CR42","unstructured":"Xie, E., Wang, W., Yu, Z., Alvarez, A.A.J.M., Luo, P.: Segformer: simple and efficient design for semantic segmentation with transformers. NeurIPS (2021)"},{"key":"2_CR43","doi-asserted-by":"crossref","unstructured":"Xu, W., Xu, Y., Chang, T., Tu, Z.: Co-scale conv-attentional image transformers. In: ICCV (2021)","DOI":"10.1109\/ICCV48922.2021.00983"},{"key":"2_CR44","unstructured":"Yang, C., et al.: Moat: alternating mobile convolution and attention brings strong vision models. arXiv:2210.01820 (2022)"},{"key":"2_CR45","doi-asserted-by":"crossref","unstructured":"Yu, W., et al.: Metaformer is actually what you need for vision. In: CVPR, pp. 10819\u201310829 (2022)","DOI":"10.1109\/CVPR52688.2022.01055"},{"key":"2_CR46","doi-asserted-by":"crossref","unstructured":"Yuan, L., et al.: Tokens-to-Token ViT: training Vision Transformers from Scratch on ImageNet. In: ICCV (2021)","DOI":"10.1109\/ICCV48922.2021.00060"},{"key":"2_CR47","doi-asserted-by":"crossref","unstructured":"Zhang, X., Zhou, X., Lin, M., Sun, J.: Shufflenet: an extremely efficient convolutional neural network for mobile devices. In: CVPR (2017)","DOI":"10.1109\/CVPR.2018.00716"}],"container-title":["Lecture Notes in Computer Science","Advances in Visual Computing"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-031-77392-1_2","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,1,21]],"date-time":"2025-01-21T18:25:54Z","timestamp":1737483954000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-3-031-77392-1_2"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025]]},"ISBN":["9783031773914","9783031773921"],"references-count":47,"URL":"https:\/\/doi.org\/10.1007\/978-3-031-77392-1_2","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025]]},"assertion":[{"value":"22 January 2025","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"ISVC","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"International Symposium on Visual Computing","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Lake Tahoe, NV","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"USA","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2024","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"21 October 2024","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"23 October 2024","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"19","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"isvc2024","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/www.isvc.net\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}