{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,11]],"date-time":"2026-07-11T11:12:07Z","timestamp":1783768327558,"version":"3.55.0"},"reference-count":69,"publisher":"Springer Science and Business Media LLC","issue":"4","license":[{"start":{"date-parts":[[2026,5,6]],"date-time":"2026-05-06T00:00:00Z","timestamp":1778025600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2026,5,6]],"date-time":"2026-05-06T00:00:00Z","timestamp":1778025600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Multimedia Systems"],"published-print":{"date-parts":[[2026,6]]},"DOI":"10.1007\/s00530-026-02360-4","type":"journal-article","created":{"date-parts":[[2026,5,6]],"date-time":"2026-05-06T06:00:25Z","timestamp":1778047225000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["DLR-CLIP: dual-level refinement for few-shot vision-language adaptation"],"prefix":"10.1007","volume":"32","author":[{"given":"Xinbiao","family":"Lu","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Tao","family":"Ma","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yuanhang","family":"Li","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zeqing","family":"Zhu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zhibo","family":"Xuan","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Lang","family":"Yu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Binghong","family":"Yu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2026,5,6]]},"reference":[{"key":"2360_CR1","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2024.3369699","author":"J Zhang","year":"2024","unstructured":"Zhang, J., Huang, J., Jin, S., Lu, S.: Vision-language models for vision tasks: a survey. IEEE Trans. Pattern Anal. Mach. Intell. (2024). https:\/\/doi.org\/10.1109\/TPAMI.2024.3369699","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"2360_CR2","unstructured":"Radford, A., Kim, J.W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., et al.: Learning transferable visual models from natural language supervision. In: International Conference on Machine Learning, pp 8748\u20138763. PMLR (2021)"},{"key":"2360_CR3","doi-asserted-by":"crossref","unstructured":"Xiao, B., Wu, H., Xu, W., Dai, X., Hu, H., Lu, Y., Zeng, M., Liu, C., Yuan, L.: Florence-2: Advancing a unified representation for a variety of vision tasks. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp 4818\u20134829 (2024)","DOI":"10.1109\/CVPR52733.2024.00461"},{"key":"2360_CR4","doi-asserted-by":"crossref","unstructured":"Zhai, X., Wang, X., Mustafa, B., Steiner, A., Keysers, D., Kolesnikov, A., Beyer, L.: Lit: Zero-shot transfer with locked-image text tuning. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp 18123\u201318133 (2022)","DOI":"10.1109\/CVPR52688.2022.01759"},{"key":"2360_CR5","doi-asserted-by":"publisher","first-page":"1008","DOI":"10.52202\/068431-0074","volume":"35","author":"J Lee","year":"2022","unstructured":"Lee, J., Kim, J., Shon, H., Kim, B., Kim, S.H., Lee, H., Kim, J.: Uniclip: unified framework for contrastive language-image pretraining. Adv. Neural. Inf. Process. Syst. 35, 1008\u20131019 (2022)","journal-title":"Adv. Neural. Inf. Process. Syst."},{"key":"2360_CR6","doi-asserted-by":"crossref","unstructured":"Shao, S., Bai, Y., Wang, Y., Liu, B., Zhou, Y.: Deil: Direct-and-inverse clip for open-world few-shot learning. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp 28505\u201328514 (2024)","DOI":"10.1109\/CVPR52733.2024.02693"},{"key":"2360_CR7","doi-asserted-by":"crossref","unstructured":"Zhang, R., Zhang, W., Fang, R., Gao, P., Li, K., Dai, J., Qiao, Y., Li, H.: Tip-adapter: Training-free adaption of clip for few-shot classification. In: European Conference on Computer Vision, pp 493\u2013510. Springer (2022)","DOI":"10.1007\/978-3-031-19833-5_29"},{"key":"2360_CR8","doi-asserted-by":"crossref","unstructured":"Marchisio, K., Ko, W.Y., Berard, A., Dehaze, T., Ruder, S.: Understanding and mitigating language confusion in llms. arXiv preprint arXiv:240620052 (2024)","DOI":"10.18653\/v1\/2024.emnlp-main.380"},{"key":"2360_CR9","doi-asserted-by":"crossref","unstructured":"Ngo, B.H., Chae, Y.J., Kwon, J.E., et al.: Improved knowledge transfer for semi-supervised domain adaptation via trico training strategy. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision, pp 19214\u201319223 (2023)","DOI":"10.1109\/ICCV51070.2023.01760"},{"issue":"2","key":"2360_CR10","doi-asserted-by":"publisher","first-page":"66","DOI":"10.1007\/s10462-025-11468-4","volume":"59","author":"J Huan","year":"2026","unstructured":"Huan, J., Li, M., Zhou, H.: Emotion-aware adaptation of CLIP model for facial expression recognition. Artif. Intell. Rev. 59(2), 66 (2026)","journal-title":"Artif. Intell. Rev."},{"key":"2360_CR11","doi-asserted-by":"publisher","DOI":"10.1109\/TGRS.2025.3613964","author":"Y Zhao","year":"2025","unstructured":"Zhao, Y., Li, W., Song, X., et al.: A text-guided graph neural network for predicting long-range trajectories of sea-surface objects. IEEE Trans. Geosci. Remote Sens. (2025). https:\/\/doi.org\/10.1109\/TGRS.2025.3613964","journal-title":"IEEE Trans. Geosci. Remote Sens."},{"key":"2360_CR12","doi-asserted-by":"publisher","DOI":"10.1016\/j.eswa.2025.126597","volume":"271","author":"BH Ngo","year":"2025","unstructured":"Ngo, B.H., Bui, D.C., Choi, T.J.: How to enrich cross-domain representations? Data augmentation, cycle-pseudo labeling, and category-aware graph learning. Expert Syst. Appl. 271, 126597 (2025)","journal-title":"Expert Syst. Appl."},{"key":"2360_CR13","doi-asserted-by":"crossref","unstructured":"Ngo, B.H., Bui, D.C., Do-Tran, N.T., et al.: HiGDA: Hierarchical graph of nodes to learn local-to-global topology for semi-supervised domain adaptation. In: Proceedings of the AAAI Conference on Artificial Intelligence 39(6), pp 6191\u20136199 (2025)","DOI":"10.1609\/aaai.v39i6.32662"},{"key":"2360_CR14","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-023-01891-x","author":"P Gao","year":"2023","unstructured":"Gao, P., Geng, S., Zhang, R., Ma, T., Fang, R., Zhang, Y., Li, H., Qiao, Y.: Clip-adapter: better vision-language models with feature adapters. Int. J. Comput. Vision (2023). https:\/\/doi.org\/10.1007\/s11263-023-01891-x","journal-title":"Int. J. Comput. Vision"},{"key":"2360_CR15","doi-asserted-by":"publisher","DOI":"10.1007\/s00530-025-01707-7","volume":"31","author":"Z Jin","year":"2025","unstructured":"Jin, Z., Wei, Y.: UMPA: Unified multi-modal prompt with adapter for vision-language models. Multimed. Syst. 31, 125 (2025)","journal-title":"Multimed. Syst."},{"issue":"9","key":"2360_CR16","doi-asserted-by":"publisher","first-page":"2337","DOI":"10.1007\/s11263-022-01653-1","volume":"130","author":"K Zhou","year":"2022","unstructured":"Zhou, K., Yang, J., Loy, C.C., Liu, Z.: Learning to prompt for vision-language models. Int. J. Comput. Vision. 130(9), 2337\u20132348 (2022)","journal-title":"Int. J. Comput. Vision"},{"key":"2360_CR17","doi-asserted-by":"crossref","unstructured":"Zhou, K., Yang, J., Loy, C.C., Liu, Z.: Conditional prompt learning for vision-language models. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp 16816\u201316825 (2022)","DOI":"10.1109\/CVPR52688.2022.01631"},{"key":"2360_CR18","unstructured":"Jia, C., Yang, Y., Xia, Y., Chen, Y.T., Parekh, Z., Pham, H., Le, Q., Sung, Y.H., Li, Z., Duerig, T.: Scaling up visual and vision-language representation learning with noisy text supervision. In: International Conference on Machine Learning, pp 4904\u20134916. PMLR (2021)"},{"key":"2360_CR19","unstructured":"Yao, L., Huang, R., Hou, L., Lu, G., Niu, M., Xu, H., Liang, X., Li, Z., Jiang, X., Xu, C.: Filip: fine-grained interactive language-image pre-training. In: International Conference on Learning Representations (2021)"},{"key":"2360_CR20","unstructured":"Yuan, L., Chen, D., Chen, Y.L., Codella, N., Dai, X., Gao, J., Hu, H., Huang, X., Li, B., Li, C., et al.: Florence: a new foundation model for computer vision. arXiv preprint arXiv:211111432 (2021)"},{"key":"2360_CR21","doi-asserted-by":"crossref","unstructured":"Huang, S., Dong, L., Wang, W., Hao, Y., Singhal, S., Ma, S., Lv, T., Cui, L., Mohammed, O.K., Liu, Q., et al.: Language is not all you need: aligning perception with language models. arXiv preprint arXiv:230214045 (2023)","DOI":"10.52202\/075280-3155"},{"key":"2360_CR22","unstructured":"Peng, Z., Wang, W., Dong, L., Hao, Y., Huang, S., Ma, S., Wei, F.: Kosmos-2: Grounding multimodal large language models to the world. arXiv preprint arXiv:230614824 (2023)"},{"key":"2360_CR23","doi-asserted-by":"crossref","unstructured":"Deng, J., Dong, W., Socher, R., Li, L.J., Li, K., Fei-Fei, L.: Imagenet: a large-scale hierarchical image database. In: 2009 IEEE Conference on Computer Vision and Pattern Recognition, pp 248\u2013255. IEEE (2009)","DOI":"10.1109\/CVPR.2009.5206848"},{"key":"2360_CR24","doi-asserted-by":"publisher","DOI":"10.1109\/LSP.2025.3551201","author":"J Liu","year":"2025","unstructured":"Liu, J., Pang, Y., Wang, S.: DCE-Net: a dual-frequency domain knowledge-guided framework for image dehazing via detail and content enhancements. IEEE Signal Process. Lett. (2025). https:\/\/doi.org\/10.1109\/LSP.2025.3551201","journal-title":"IEEE Signal Process. Lett."},{"key":"2360_CR25","doi-asserted-by":"crossref","unstructured":"Wang, S., Ren, W., Gao, P., Yu, J., Liu, J.: ZRID-Net: zero-reference real-world image dehazing framework via deep self-decoupling and reverse knowledge transfer. IEEE Transactions on Circuits and Systems for Video Technology (2025)","DOI":"10.1109\/TCSVT.2025.3609735"},{"issue":"3","key":"2360_CR26","doi-asserted-by":"publisher","first-page":"1921","DOI":"10.1007\/s00371-024-03511-2","volume":"41","author":"S Wang","year":"2025","unstructured":"Wang, S., Hou, Q., Li, J., Liu, J.: TSID-net: a two-stage single image dehazing framework with style transfer and contrastive knowledge transfer. Vis. Comput. 41(3), 1921\u20131938 (2025)","journal-title":"Vis. Comput."},{"key":"2360_CR27","doi-asserted-by":"publisher","DOI":"10.1016\/j.knosys.2026.115362","author":"J Liu","year":"2026","unstructured":"Liu, J., Niu, J., Chen, X., et al.: Dual prompts guided cross-domain transformer for unified day-night image dehazing. Knowl.-Based Syst. (2026). https:\/\/doi.org\/10.1016\/j.knosys.2026.115362","journal-title":"Knowl.-Based Syst."},{"key":"2360_CR28","unstructured":"Ilharco, G., Wortsman, M., Ross, W., Gordon, C., Carlini, N., Taori, R., Dave, A., Shankar, V., Namkoong, H., Miller, J., Hajishirzi, H., Farhadi, A., Schmidt, L.: OpenCLIP. Zenodo (2021)"},{"key":"2360_CR29","doi-asserted-by":"crossref","unstructured":"Tang, B., Zhang, J., Yan, L., Yu, Q., Sheng, L., Xu, D.: Data-free generalized zero-shot learning. In: Proceedings of the AAAI Conference on Artificial Intelligence, pp 5108\u20135117 (2024)","DOI":"10.1609\/aaai.v38i6.28316"},{"key":"2360_CR30","doi-asserted-by":"crossref","unstructured":"Zhou, Z., Lei, Y., Zhang, B., Liu, L., Liu, Y.: Zegclip: Towards adapting clip for zero-shot semantic segmentation. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp 11175\u201311185 (2023)","DOI":"10.1109\/CVPR52729.2023.01075"},{"key":"2360_CR31","doi-asserted-by":"crossref","unstructured":"Zhang, L., Xiang, T., Gong, S.: Learning a deep embedding model for zero-shot learning. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp 2021\u20132030 (2017)","DOI":"10.1109\/CVPR.2017.321"},{"key":"2360_CR32","unstructured":"Wang, Z., Liang, J., He, R., Xu, N., Wang, Z., Tan, T.: Improving zero-shot generalization for clip with synthesized prompts. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision, pp 3032\u20133042 (2023)"},{"key":"2360_CR33","doi-asserted-by":"publisher","DOI":"10.1016\/j.knosys.2024.111978","volume":"299","author":"Y Su","year":"2024","unstructured":"Su, Y., Tan, Y., Xing, M., et al.: VPE-WSVAD: visual prompt exemplars for weakly-supervised video anomaly detection. Knowl.-Based Syst. 299, 111978 (2024)","journal-title":"Knowl.-Based Syst."},{"key":"2360_CR34","doi-asserted-by":"crossref","unstructured":"Xing, M., Feng, Z., Su, Y., et al.: Learning by erasing: conditional entropy based transferable out-of-distribution detection. In: Proceedings of the AAAI Conference on Artificial Intelligence 38(6), pp 6261\u20136269 (2024)","DOI":"10.1609\/aaai.v38i6.28444"},{"key":"2360_CR35","doi-asserted-by":"publisher","DOI":"10.1016\/j.inffus.2025.103633","author":"M Xing","year":"2025","unstructured":"Xing, M., Feng, Z., Zhu, S., et al.: Unbiased spatial-temporal atomic fusion-based zero-shot action recognition. Inform. Fusion (2025). https:\/\/doi.org\/10.1016\/j.inffus.2025.103633","journal-title":"Inform. Fusion"},{"key":"2360_CR36","doi-asserted-by":"publisher","first-page":"4483","DOI":"10.1007\/s10462-021-10004-4","volume":"54","author":"M Huisman","year":"2021","unstructured":"Huisman, M., Rijn, J.N., Plaat, A.: A survey of deep meta-learning. Artif. Intell. Rev. 54, 4483\u20134541 (2021)","journal-title":"Artif. Intell. Rev."},{"issue":"3","key":"2360_CR37","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/3386252","volume":"53","author":"Y Wang","year":"2021","unstructured":"Wang, Y., Yao, Q., Kwok, J.T., Ni, L.M.: Generalizing from a few examples: a survey on few-shot learning. ACM Comput. Surveys 53(3), 1\u201334 (2021)","journal-title":"ACM Comput. Surveys"},{"key":"2360_CR38","doi-asserted-by":"crossref","unstructured":"Bateni, P., Goyal, R., Masrani, V., Wood, F., Sigal, L.: Improved few-shot visual classification. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp 14493\u201314502 (2020)","DOI":"10.1109\/CVPR42600.2020.01450"},{"key":"2360_CR39","doi-asserted-by":"crossref","unstructured":"Li, S., Liu, F., Jiao, L., Liu, X., Chen, P.: Learning salient feature for salient object detection without labels. IEEE Trans. Cybern. (2022)","DOI":"10.1109\/TCYB.2022.3209978"},{"key":"2360_CR40","doi-asserted-by":"crossref","unstructured":"Palanisamy, K., Chao, Y.W., Du, X., Xiang, Y.: Proto-clip: vision-language prototypical network for few-shot learning. arXiv preprint arXiv:230703073 (2023)","DOI":"10.1109\/IROS58592.2024.10801660"},{"key":"2360_CR41","doi-asserted-by":"crossref","unstructured":"Khattak, M.U., Rasheed, H., Maaz, M., Khan, S., Khan, F.S.: Maple: Multi-modal prompt learning. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp 19113\u201319122 (2023)","DOI":"10.1109\/CVPR52729.2023.01832"},{"key":"2360_CR42","doi-asserted-by":"crossref","unstructured":"Tang, Y., Lin, Z., Wang, Q., Zhu, P., Hu, Q.: Amu-tuning: effective logit bias for clip-based few-shot learning. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp 23323\u201323333 (2024)","DOI":"10.1109\/CVPR52733.2024.02201"},{"key":"2360_CR43","unstructured":"Menon, A.K., Jayasumana, S., Rawat, A.S., Jain, H., Veit, A., Kumar, S.: Long-tail learning via logit adjustment. arXiv preprint (2020). arXiv:2007.07314"},{"key":"2360_CR44","unstructured":"Guo, C., Pleiss, G., Sun, Y., Weinberger, K.Q.: On calibration of modern neural networks. In: International Conference on Machine Learning, pp 1321\u20131330. PMLR (2017)"},{"key":"2360_CR45","doi-asserted-by":"crossref","unstructured":"Li, S., Liu, F., Hao, Z., Wang, X., Li, L., Liu, X., Chen, P., Ma, W.: Logits deconfusion with clip for few-shot learning. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp 25411\u201325421 (2025)","DOI":"10.1109\/CVPR52734.2025.02366"},{"key":"2360_CR46","doi-asserted-by":"crossref","unstructured":"Yang, L., Zhang, R.Y., Wang, Y., et al.: MMA: Multi-modal adapter for vision-language models. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp 23826\u201323837 (2024)","DOI":"10.1109\/CVPR52733.2024.02249"},{"key":"2360_CR47","first-page":"1","volume":"62","author":"B Lin","year":"2024","unstructured":"Lin, B., Zheng, J., Xue, C., et al.: Motion-aware correlation filter-based object tracking in satellite videos. IEEE Trans. Geosci. Remote Sens. 62, 1\u201313 (2024)","journal-title":"IEEE Trans. Geosci. Remote Sens."},{"issue":"3","key":"2360_CR48","doi-asserted-by":"publisher","first-page":"1987","DOI":"10.1109\/TCSVT.2024.3486347","volume":"35","author":"C Xue","year":"2024","unstructured":"Xue, C., Zhong, B., Liang, Q., et al.: Unifying motion and appearance cues for visual tracking via shared queries. IEEE Trans. Circuits Syst. Video Technol. 35(3), 1987\u20131998 (2024)","journal-title":"IEEE Trans. Circuits Syst. Video Technol."},{"key":"2360_CR49","doi-asserted-by":"crossref","unstructured":"Xue, C., Zhong, B., Liang, Q., et al.: Similarity-guided layer-adaptive vision transformer for UAV tracking. In: Proceedings of the Computer Vision and Pattern Recognition Conference, pp 6730\u20136740 (2025)","DOI":"10.1109\/CVPR52734.2025.00631"},{"key":"2360_CR50","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2025.3601598","author":"Y Xue","year":"2025","unstructured":"Xue, Y., Jin, G., Zhong, B., et al.: FMTrack: Frequency-aware interaction and multi-expert fusion for RGB-T tracking. IEEE Trans. Circuits Syst. Video Technol. (2025). https:\/\/doi.org\/10.1109\/TCSVT.2025.3601598","journal-title":"IEEE Trans. Circuits Syst. Video Technol."},{"key":"2360_CR51","doi-asserted-by":"crossref","unstructured":"Hu, J., Shen, L., Sun, G.: Squeeze-and-excitation networks. IEEE Trans. Pattern Anal. Mach. Intell. (2019)","DOI":"10.1109\/CVPR.2018.00745"},{"key":"2360_CR52","unstructured":"Fei-Fei, L., Fergus, R., Perona, P.: Learning generative visual models from few training examples: an incremental bayesian approach tested on 101 object categories. In: 2004 Conference on Computer Vision and Pattern Recognition Workshop, pp 178\u2013178. IEEE (2004)"},{"key":"2360_CR53","doi-asserted-by":"crossref","unstructured":"Parkhi, O.M., Vedaldi, A., Zisserman, A., Jawahar, C.V.: Cats and dogs. In: 2012 IEEE Conference on Computer Vision and Pattern Recognition, pp 3498\u20133505. IEEE (2012)","DOI":"10.1109\/CVPR.2012.6248092"},{"key":"2360_CR54","doi-asserted-by":"crossref","unstructured":"Krause, J., Stark, M., Deng, J., Fei-Fei, L.: 3d object representations for fine-grained categorization. In: Proceedings of the IEEE International Conference on Computer Vision Workshops, pp 554\u2013561 (2013)","DOI":"10.1109\/ICCVW.2013.77"},{"key":"2360_CR55","doi-asserted-by":"crossref","unstructured":"Nilsback, M.E., Zisserman, A.: Automated flower classification over a large number of classes. In: 2008 Sixth Indian Conference on Computer Vision, Graphics & Image Processing, pp 722\u2013729. IEEE (2008)","DOI":"10.1109\/ICVGIP.2008.47"},{"key":"2360_CR56","doi-asserted-by":"crossref","unstructured":"Bossard, L., Guillaumin, M., Van Gool, L.: Food-101\u2013mining discriminative components with random forests. In: Computer Vision\u2013ECCV\u00a02014. pp 446\u2013461. Springer (2014)","DOI":"10.1007\/978-3-319-10599-4_29"},{"key":"2360_CR57","unstructured":"Maji, S., Rahtu, E., Kannala, J., Blaschko, M., Vedaldi, A.: Fine-grained visual classification of aircraft. arXiv preprint arXiv:13065151 (2013)"},{"key":"2360_CR58","doi-asserted-by":"crossref","unstructured":"Cimpoi, M., Maji, S., Kokkinos, I., Mohamed, S., Vedaldi, A.: Describing textures in the wild. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 3606\u20133613 (2014)","DOI":"10.1109\/CVPR.2014.461"},{"key":"2360_CR59","doi-asserted-by":"crossref","unstructured":"Xiao, J., Hays, J., Ehinger, K., Oliva, A., Torralba, A.: Sun database: large-scale scene recognition from abbey to zoo. In: 2010 IEEE Computer Society Conference on Computer Vision and Pattern Recognition, pp 3485\u20133492. IEEE (2010)","DOI":"10.1109\/CVPR.2010.5539970"},{"issue":"7","key":"2360_CR60","doi-asserted-by":"publisher","first-page":"2217","DOI":"10.1109\/JSTARS.2019.2918242","volume":"12","author":"P Helber","year":"2019","unstructured":"Helber, P., Bischke, B., Dengel, A., Borth, D.: Eurosat: a novel dataset and deep learning benchmark for land use and land cover classification. IEEE J. Sel. Top. Appl. Earth Obs. Remote Sens. 12(7), 2217\u20132226 (2019)","journal-title":"IEEE J. Sel. Top. Appl. Earth Obs. Remote Sens."},{"key":"2360_CR61","unstructured":"Soomro, K.: Ucf101: A dataset of 101 human actions classes from videos in the wild. arXiv preprint arXiv:12120402 (2012)"},{"key":"2360_CR62","unstructured":"Dosovitskiy, A., Beyer, L., Kolesnikov, A., Weissenborn, D., Zhai, X., Unterthiner, T., Dehghani, M., Minderer, M., Heigold, G., Gelly, S., et al.: An image is worth 16x16 words: transformers for image recognition at scale. (2020). arXiv preprint arXiv:2010.11929"},{"issue":"3","key":"2360_CR63","doi-asserted-by":"publisher","first-page":"127","DOI":"10.1561\/2400000003","volume":"1","author":"N Parikh","year":"2014","unstructured":"Parikh, N., Boyd, S.: Proximal algorithms. Found. Trends Optim. 1(3), 127\u2013239 (2014)","journal-title":"Found. Trends Optim."},{"key":"2360_CR64","unstructured":"Chen, G., Yao, W., Song, X., Li, X., Rao, Y., Zhang, K.: PLOT: Prompt learning with optimal transport for vision-language models. In: The Eleventh International Conference on Learning Representations (2022)"},{"key":"2360_CR65","doi-asserted-by":"crossref","unstructured":"Yao, H., Zhang, R., Xu, C.: Visual language prompt tuning with knowledge-guided context optimization. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp 6757\u20136767 (2023)","DOI":"10.1109\/CVPR52729.2023.00653"},{"key":"2360_CR66","doi-asserted-by":"crossref","unstructured":"Zhu, B., Niu, Y., Han, Y., Wu, Y., Zhang, H.: Prompt-aligned gradient for prompt tuning. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision, pp 15659\u201315669 (2023)","DOI":"10.1109\/ICCV51070.2023.01435"},{"key":"2360_CR67","doi-asserted-by":"crossref","unstructured":"Yu, T., Lu, Z., Jin, X., Chen, Z., Wang, X.: Task residual for tuning vision-language models. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp 10899\u201310909 (2023)","DOI":"10.1109\/CVPR52729.2023.01049"},{"key":"2360_CR68","unstructured":"Recht, B., Roelofs, R., Schmidt, L., Shankar, V.: Do imagenet classifiers generalize to imagenet? In: International conference on machine learning, pp 5389\u20135400. PMLR (2019)"},{"key":"2360_CR69","unstructured":"Wang, H., Ge, S., Lipton, Z., Xing, E.P.: Learning robust global representations by penalizing local predictive power. Adv. Neural. Inf. Process. Syst. 32 (2019)"}],"container-title":["Multimedia Systems"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00530-026-02360-4.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s00530-026-02360-4","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00530-026-02360-4.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,7,11]],"date-time":"2026-07-11T10:19:43Z","timestamp":1783765183000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s00530-026-02360-4"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,5,6]]},"references-count":69,"journal-issue":{"issue":"4","published-print":{"date-parts":[[2026,6]]}},"alternative-id":["2360"],"URL":"https:\/\/doi.org\/10.1007\/s00530-026-02360-4","relation":{},"ISSN":["0942-4962","1432-1882"],"issn-type":[{"value":"0942-4962","type":"print"},{"value":"1432-1882","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026,5,6]]},"assertion":[{"value":"5 January 2026","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"10 March 2026","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"6 May 2026","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors declare no competing interests.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflict of interest"}}],"article-number":"276"}}