{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,7]],"date-time":"2026-07-07T15:53:52Z","timestamp":1783439632534,"version":"3.54.6"},"reference-count":67,"publisher":"Springer Science and Business Media LLC","issue":"5","license":[{"start":{"date-parts":[[2026,4,6]],"date-time":"2026-04-06T00:00:00Z","timestamp":1775433600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2026,4,6]],"date-time":"2026-04-06T00:00:00Z","timestamp":1775433600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Int J Comput Vis"],"published-print":{"date-parts":[[2026,5]]},"DOI":"10.1007\/s11263-026-02759-6","type":"journal-article","created":{"date-parts":[[2026,4,6]],"date-time":"2026-04-06T16:38:22Z","timestamp":1775493502000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":3,"title":["A Closer Look at Conditional Prompt Tuning for Vision-Language Models"],"prefix":"10.1007","volume":"134","author":[{"ORCID":"https:\/\/orcid.org\/0000-0001-6949-3673","authenticated-orcid":false,"given":"Ji","family":"Zhang","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Shihan","family":"Wu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Lianli","family":"Gao","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jingkuan","family":"Song","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Nicu","family":"Sebe","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Heng Tao","family":"Shen","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2026,4,6]]},"reference":[{"key":"2759_CR1","first-page":"23716","volume":"35","author":"JB Alayrac","year":"2022","unstructured":"Alayrac, J. B., Donahue, J., Luc, P., Miech, A., Barr, I., Hasson, Y., et al. (2022). Flamingo: a visual language model for few-shot learning. NeurIPS., 35, 23716\u201323736.","journal-title":"NeurIPS."},{"key":"2759_CR2","doi-asserted-by":"crossref","unstructured":"Bossard, L., Guillaumin, M., & Van\u00a0Gool, L. (2014). Food-101\u2013mining discriminative components with random forests. In: ECCV. Springer. p. 446\u2013461.","DOI":"10.1007\/978-3-319-10599-4_29"},{"key":"2759_CR3","unstructured":"Chen, G., Yao, W., Song, X., Li, X., Rao, Y., & Zhang, K. (2022). Prompt learning with optimal transport for vision-language models. ICLR."},{"key":"2759_CR4","doi-asserted-by":"crossref","unstructured":"Cho, E., Kim, J., & Kim, H.J. (2023). Distribution-aware prompt tuning for vision-language models. In: ICCV. p. 22004\u201322013.","DOI":"10.1109\/ICCV51070.2023.02011"},{"key":"2759_CR5","doi-asserted-by":"crossref","unstructured":"Cimpoi, M., Maji, S., Kokkinos, I., Mohamed, S., & Vedaldi, A. (2014). Describing textures in the wild. In: CVPR. p. 3606\u20133613.","DOI":"10.1109\/CVPR.2014.461"},{"key":"2759_CR6","doi-asserted-by":"crossref","unstructured":"Deng, J., Dong, W., Socher, R., Li, L.J., Li, K., & Fei-Fei, L. (2009). Imagenet: A large-scale hierarchical image database. In: CVPR. Ieee. p. 248\u2013255.","DOI":"10.1109\/CVPR.2009.5206848"},{"key":"2759_CR7","doi-asserted-by":"crossref","unstructured":"Derakhshani, M.M., Sanchez, E., Bulat, A., da\u00a0Costa, V.G.T., Snoek, C.G., Tzimiropoulos, G., & Martinez, B. et\u00a0al. (2023). Bayesian prompt learning for image-language model generalization. In: CVPR. p. 15237\u201315246.","DOI":"10.1109\/ICCV51070.2023.01398"},{"key":"2759_CR8","unstructured":"Fei-Fei, L., Fergus, R., & Perona, P. (2004). Learning generative visual models from few training examples: An incremental bayesian approach tested on 101 object categories. In: CVPRW. IEEE. p. 178\u2013178."},{"key":"2759_CR9","doi-asserted-by":"crossref","unstructured":"Fu, Y., Fu, Y., & Jiang, Y.G. (2021). Meta-fdmixup: Cross-domain few-shot learning guided by labeled target data. In: ACM MM. p. 5326\u20135334.","DOI":"10.1145\/3474085.3475655"},{"key":"2759_CR10","doi-asserted-by":"crossref","unstructured":"Fu, Y., Xie, Y., Fu, Y., & Jiang, Y.G. (2023). StyleAdv: Meta Style Adversarial Training for Cross-Domain Few-Shot Learning. In: CVPR. p. 24575\u201324584.","DOI":"10.1109\/CVPR52729.2023.02354"},{"issue":"2","key":"2759_CR11","doi-asserted-by":"publisher","first-page":"581","DOI":"10.1007\/s11263-023-01891-x","volume":"132","author":"P Gao","year":"2024","unstructured":"Gao, P., Geng, S., Zhang, R., Ma, T., Fang, R., Zhang, Y., et al. (2024). Clip-adapter: Better vision-language models with feature adapters. International Journal of Computer Vision., 132(2), 581\u2013595.","journal-title":"International Journal of Computer Vision."},{"key":"2759_CR12","doi-asserted-by":"publisher","first-page":"175","DOI":"10.1016\/j.neucom.2021.10.089","volume":"471","author":"H Gao","year":"2022","unstructured":"Gao, H., Zhang, H., Yang, X., Li, W., Gao, F., & Wen, Q. (2022). Generating natural adversarial examples with universal perturbations for text classification. Neurocomputing., 471, 175\u2013182.","journal-title":"Neurocomputing."},{"issue":"7","key":"2759_CR13","doi-asserted-by":"publisher","first-page":"2217","DOI":"10.1109\/JSTARS.2019.2918242","volume":"12","author":"P Helber","year":"2019","unstructured":"Helber, P., Bischke, B., Dengel, A., & Borth, D. (2019). Eurosat: A novel dataset and deep learning benchmark for land use and land cover classification. IEEE Journal of Selected Topics in Applied Earth Observations and Remote Sensing., 12(7), 2217\u20132226.","journal-title":"IEEE Journal of Selected Topics in Applied Earth Observations and Remote Sensing."},{"key":"2759_CR14","doi-asserted-by":"crossref","unstructured":"Hendrycks, D., Basart, S., Mu, N., Kadavath, S., Wang, F., Dorundo, E., Desai, R., Zhu, T., Parajuli, S., & Guo, M., et\u00a0al. (2021). The many faces of robustness: A critical analysis of out-of-distribution generalization. In: ICCV. p. 8340\u20138349.","DOI":"10.1109\/ICCV48922.2021.00823"},{"key":"2759_CR15","unstructured":"Houlsby, N., Giurgiu, A., Jastrzebski, S., Morrone, B., De\u00a0Laroussilhe, Q., Gesmundo, A., Attariyan, M., & Gelly, S. (2019). Parameter-efficient transfer learning for NLP. In: ICML. p. 2790\u20132799."},{"key":"2759_CR16","unstructured":"Hu, E.J., Shen, Y., Wallis, P., Allen-Zhu, Z., Li, Y., & Wang, S., et\u00a0al. (2021). Lora: Low-rank adaptation of large language models. arXiv preprint arXiv:2106.09685."},{"key":"2759_CR17","doi-asserted-by":"crossref","unstructured":"Huang, Q., Dong, X., Chen, D., Zhang, W., Wang, F., Hua, G., & Yu, N. (2023). Diversity-Aware Meta Visual Prompting. In: CVPR. p. 10878\u201310887.","DOI":"10.1109\/CVPR52729.2023.01047"},{"key":"2759_CR18","unstructured":"Huo, Y., Zhang, M., Liu, G., Lu, H., Gao, Y., Yang, G., Wen, J., Zhang, H., Xu, B., & Zheng, W., et\u00a0al. (2021). WenLan: Bridging vision and language by large-scale multi-modal pre-training. arXiv preprint arXiv:2103.06561."},{"key":"2759_CR19","doi-asserted-by":"crossref","unstructured":"Jia, M., Tang, L., Chen, B.C., Cardie, C., Belongie, S., Hariharan, B., & Lim, S.-N. (2022). Visual prompt tuning. In: ECCV. p. 709\u2013727.","DOI":"10.1007\/978-3-031-19827-4_41"},{"key":"2759_CR20","unstructured":"Jia, C., Yang, Y., Xia, Y., Chen, Y.T., Parekh, Z., Pham, H., Le, Q., Sung, Y.-H., Li, Z., & Duerig, T. (2021). Scaling up visual and vision-language representation learning with noisy text supervision. In: ICML. p. 4904\u20134916."},{"key":"2759_CR21","doi-asserted-by":"crossref","unstructured":"Jin, Z., Hayat, M., Yang, Y., Guo, Y., & Lei, Y. (2023). Context-aware Alignment and Mutual Masking for 3D-Language Pre-training. In: CVPR. p. 10984\u201310994.","DOI":"10.1109\/CVPR52729.2023.01057"},{"key":"2759_CR22","unstructured":"Joulin, A., Grave, E., Bojanowski, P., Douze, M., J\u00e9gou, H., & Mikolov, T. (2016). FastText.zip: Compressing text classification models. arXiv preprint arXiv:1612.03651."},{"key":"2759_CR23","doi-asserted-by":"crossref","unstructured":"Khattak, M.U., Rasheed, H., Maaz, M., Khan, S., & Khan, F.S. (2023). Maple: Multi-modal prompt learning. In: CVPR. p. 19113\u201319122.","DOI":"10.1109\/CVPR52729.2023.01832"},{"key":"2759_CR24","doi-asserted-by":"crossref","unstructured":"Khattak, M.U., Wasim, S.T., Naseer, M., Khan, S., Yang, M.H., & Khan, F.S. (2023). Self-regulating Prompts: Foundational Model Adaptation without Forgetting. In: ICCV. p. 15190\u201315200.","DOI":"10.1109\/ICCV51070.2023.01394"},{"key":"2759_CR25","doi-asserted-by":"crossref","unstructured":"Khattak, M.U., Wasim, S.T., Naseer, M., Khan, S., Yang, M.H., & Khan, F.S. (2023). Self-regulating prompts: Foundational model adaptation without forgetting. In: ICCV. p. 15190\u201315200.","DOI":"10.1109\/ICCV51070.2023.01394"},{"key":"2759_CR26","unstructured":"Kim, W., Son, B., & Kim, I. (2021). Vilt: Vision-and-language transformer without convolution or region supervision. In: ICML. PMLR. p. 5583\u20135594."},{"key":"2759_CR27","doi-asserted-by":"crossref","unstructured":"Krause, J., Stark, M., Deng, J., & Fei-Fei, L. (2013). 3d object representations for fine-grained categorization. In: ICCVW. p. 554\u2013561.","DOI":"10.1109\/ICCVW.2013.77"},{"key":"2759_CR28","doi-asserted-by":"crossref","unstructured":"Lee, D., Song, S., Suh, J., Choi, J., Lee, S., & Kim, H.J. (2023). Read-only prompt optimization for vision-language few-shot learning. In: ICCV. p. 1401\u20131411.","DOI":"10.1109\/ICCV51070.2023.00135"},{"key":"2759_CR29","doi-asserted-by":"crossref","unstructured":"Li, X.L., & Liang, P. (2021). Prefix-Tuning: Optimizing Continuous Prompts for Generation. In: ACL. p. 4582\u20134597.","DOI":"10.18653\/v1\/2021.acl-long.353"},{"key":"2759_CR30","unstructured":"Li, J., Li, D., Xiong, C., & Hoi, S. (2022). Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation. In: ICML. PMLR. p. 12888\u201312900."},{"key":"2759_CR31","first-page":"9694","volume":"34","author":"J Li","year":"2021","unstructured":"Li, J., Selvaraju, R., Gotmare, A., Joty, S., Xiong, C., & Hoi, S. C. H. (2021). Align before fuse: Vision and language representation learning with momentum distillation. NeurIPS., 34, 9694\u20139705.","journal-title":"NeurIPS."},{"key":"2759_CR32","doi-asserted-by":"crossref","unstructured":"Lu, Y., Liu, J., Zhang, Y., Liu, Y., & Tian, X. (2022). Prompt distribution learning. In: CVPR. p. 5206\u20135215.","DOI":"10.1109\/CVPR52688.2022.00514"},{"key":"2759_CR33","first-page":"32","volume-title":"Lee S","author":"J Lu","year":"2019","unstructured":"Lu, J., Batra, D., & Parikh, D. (2019). Lee S (p. 32). Vilbert: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks. NeurIPS."},{"key":"2759_CR34","unstructured":"Luo, X., Wu, H., Zhang, J., Gao, L., Xu, J., & Song, J. (2023). A closer look at few-shot classification again. In: ICML. PMLR. p. 23103\u201323123."},{"key":"2759_CR35","unstructured":"Maji, S., Rahtu, E., Kannala, J., Blaschko, M., & Vedaldi, A. (2013). Fine-grained visual classification of aircraft. arXiv preprint arXiv:1306.5151."},{"issue":"2","key":"2759_CR36","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/3605943","volume":"56","author":"B Min","year":"2023","unstructured":"Min, B., Ross, H., Sulem, E., Veyseh, A. P. B., Nguyen, T. H., Sainz, O., et al. (2023). Recent advances in natural language processing via large pre-trained language models: A survey. ACM Computing Surveys., 56(2), 1\u201340.","journal-title":"ACM Computing Surveys."},{"key":"2759_CR37","doi-asserted-by":"crossref","unstructured":"Nilsback, M.E., & Zisserman, A. (2008). Automated flower classification over a large number of classes. In: ICVGIP. IEEE. p. 722\u2013729.","DOI":"10.1109\/ICVGIP.2008.47"},{"key":"2759_CR38","doi-asserted-by":"crossref","unstructured":"Ouali, Y., Bulat, A., Matinez, B., & Tzimiropoulos, G. (2023). Black box few-shot adaptation for vision-language models. In: ICCV. p. 15534\u201315546.","DOI":"10.1109\/ICCV51070.2023.01424"},{"key":"2759_CR39","doi-asserted-by":"crossref","unstructured":"Parkhi, O.M., Vedaldi, A., Zisserman, A., & Jawahar, C. (2012). Cats and dogs. In: CVPR. IEEE. p. 3498\u20133505.","DOI":"10.1109\/CVPR.2012.6248092"},{"key":"2759_CR40","doi-asserted-by":"crossref","unstructured":"Patashnik, O., Wu, Z., Shechtman, E., Cohen-Or, D., & Lischinski, D. (2021). Styleclip: Text-driven manipulation of stylegan imagery. In: CVPR. p. 2085\u20132094.","DOI":"10.1109\/ICCV48922.2021.00209"},{"key":"2759_CR41","doi-asserted-by":"crossref","unstructured":"Pennington, J., Socher, R., & Manning, C.D. (2014). Glove: Global vectors for word representation. In: EMNLP. p. 1532\u20131543.","DOI":"10.3115\/v1\/D14-1162"},{"key":"2759_CR42","unstructured":"Radford, A., Kim, J.W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., & Clark, J. et al. (2021). Learning transferable visual models from natural language supervision. In: ICML. p. 8748\u20138763."},{"key":"2759_CR43","doi-asserted-by":"crossref","unstructured":"Rao, Y., Zhao, W., Chen, G., Tang, Y., Zhu, Z., Huang, G., Zhou, J., & Lu, J. (2022). Denseclip: Language-guided dense prediction with context-aware prompting. In: CVPR. p. 18082\u201318091.","DOI":"10.1109\/CVPR52688.2022.01755"},{"key":"2759_CR44","unstructured":"Recht, B., Roelofs, R., Schmidt, L., & Shankar, V. (2019). Do imagenet classifiers generalize to imagenet? In: ICML. PMLR. p. 5389\u20135400."},{"key":"2759_CR45","unstructured":"Soomro, K., Zamir, A.R., & Shah, M. (2012). UCF101: A dataset of 101 human actions classes from videos in the wild. arXiv preprint arXiv:1212.0402."},{"key":"2759_CR46","doi-asserted-by":"crossref","unstructured":"Wang, C., Chai, M., He, M., Chen, D. &, Liao, J. (2022). Clip-nerf: Text-and-image driven manipulation of neural radiance fields. In: CVPR. p. 3835\u20133844.","DOI":"10.1109\/CVPR52688.2022.00381"},{"key":"2759_CR47","unstructured":"Wang, H., Ge, S., Lipton, Z., & Xing, E.P. (2019). Learning robust global representations by penalizing local predictive power. NeurIPS. 32."},{"key":"2759_CR48","unstructured":"Wang, F., Li, M., Lin, X., Lv, H., Schwing, A.G., & Ji, H. (2022). Learning to decompose visual features with latent textual prompts. ICLR."},{"key":"2759_CR49","doi-asserted-by":"crossref","unstructured":"Wu, S., Zhang, J., Zeng, P., Gao, L., Song, J., & Shen, H.T. (2025). Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves. In: CVPR. p. 14723\u201314732.","DOI":"10.1109\/CVPR52734.2025.01372"},{"issue":"12","key":"2759_CR50","doi-asserted-by":"publisher","first-page":"5681","DOI":"10.1007\/s11263-024-02086-8","volume":"132","author":"J Wu","year":"2024","unstructured":"Wu, J., Zhang, T., & Zhang, Y. (2024). HybridPrompt: Domain-Aware Prompting for Cross-Domain Few-Shot Learning. International Journal of Computer Vision., 132(12), 5681\u20135697.","journal-title":"International Journal of Computer Vision."},{"key":"2759_CR51","doi-asserted-by":"crossref","unstructured":"Xiao, J., Hays, J., Ehinger, K.A., Oliva, A., & Torralba, A. (2010). Sun database: Large-scale scene recognition from abbey to zoo. In: CVPR. IEEE. p. 3485\u20133492.","DOI":"10.1109\/CVPR.2010.5539970"},{"issue":"2","key":"2759_CR52","doi-asserted-by":"publisher","first-page":"511","DOI":"10.1007\/s11263-024-02172-x","volume":"133","author":"C Xu","year":"2025","unstructured":"Xu, C., Zhu, Y., Shen, H., Chen, B., Liao, Y., Chen, X., et al. (2025). Progressive visual prompt learning with contrastive feature re-formation. International Journal of Computer Vision., 133(2), 511\u2013526.","journal-title":"International Journal of Computer Vision."},{"key":"2759_CR53","doi-asserted-by":"crossref","unstructured":"Yamada, I., Asai, A., Sakuma, J., Shindo, H., Takeda, H., Takefuji, Y., & Matsumoto, Y. (2020). Wikipedia2Vec: An Efficient Toolkit for Learning and Visualizing the Embeddings of Words and Entities from Wikipedia. In: EMNLP. ACL. p. 23\u201330.","DOI":"10.18653\/v1\/2020.emnlp-demos.4"},{"key":"2759_CR54","doi-asserted-by":"crossref","unstructured":"Yao, H., Zhang, R., & Xu, C. (2023). Visual-language prompt tuning with knowledge-guided context optimization. In: CVPR. p. 6757\u20136767.","DOI":"10.1109\/CVPR52729.2023.00653"},{"key":"2759_CR55","doi-asserted-by":"crossref","unstructured":"Zhang, J., Gao, L., Luo, X., Shen, H., & Song, J. (2024). DETA: Denoised Task Adaptation for Few-Shot Learning. CVPR.","DOI":"10.1109\/ICCV51070.2023.01060"},{"key":"2759_CR56","doi-asserted-by":"crossref","unstructured":"Zhang, R., Hu, X., Li, B., Huang, S., Deng, H., Qiao, Y., Gao, P., & Li, H. (2023). Prompt, generate, then cache: Cascade of foundation models makes strong few-shot learners. In: CVPR. p. 15211\u201315222.","DOI":"10.1109\/CVPR52729.2023.01460"},{"key":"2759_CR57","unstructured":"Zhang, J., Luo, X., Gao, L., Zou, D., Shen, H., & Song, J. (2023). From Channel Bias to Feature Redundancy: Uncovering the\" Less is More\" Principle in Few-Shot Learning. arXiv e-prints. p. arXiv\u20132310."},{"key":"2759_CR58","doi-asserted-by":"crossref","unstructured":"Zhang, J., Song, J., Gao, L., Sebe, N., & Shen, H.T. (2025). Reliable Few-shot Learning under Dual Noises. IEEE Transactions on Pattern Analysis and Machine Intelligence.","DOI":"10.1109\/TPAMI.2025.3584051"},{"key":"2759_CR59","doi-asserted-by":"crossref","unstructured":"Zhang, J., Wu, S., Gao, L., Shen, H., & Song J. (2024). Dept: Decoupled prompt tuning. CVPR.","DOI":"10.1109\/CVPR52733.2024.01228"},{"key":"2759_CR60","doi-asserted-by":"crossref","unstructured":"Zhang, H., Zeng, P., Gao, L., Song, J., & Shen, H.T. (2024). Ump: Unified modality-aware prompt tuning for text-video retrieval. IEEE Transactions on Circuits and Systems for Video Technology.","DOI":"10.1109\/TCSVT.2024.3429192"},{"key":"2759_CR61","doi-asserted-by":"crossref","unstructured":"Zhang, H., Zeng, P., Gao, L., Song, J., Duan, Y., Lyu, X., & Shen, H. T. (2025). Text-video retrieval with global-local semantic consistent learning. IEEE Transactions on Image Processing.","DOI":"10.1109\/TIP.2025.3574925"},{"key":"2759_CR62","doi-asserted-by":"crossref","unstructured":"Zhang, R., Zhang, W., Fang, R., Gao, P., Li, K., Dai, J., Qiao, Y., & Li, H. (2022). Tip-adapter: Training-free adaption of clip for few-shot classification. In: ECCV. Springer. p. 493\u2013510.","DOI":"10.1007\/978-3-031-19833-5_29"},{"key":"2759_CR63","doi-asserted-by":"crossref","unstructured":"Zhou, C., Loy, C.C., & Dai, B. (2022). Extract free dense labels from clip. In: ECCV. Springer. p. 696\u2013712.","DOI":"10.1007\/978-3-031-19815-1_40"},{"key":"2759_CR64","doi-asserted-by":"crossref","unstructured":"Zhou, K., Yang, J., Loy, C.C., & Liu, Z. (2022). Conditional prompt learning for vision-language models. In: CVPR. p. 16816\u201316825.","DOI":"10.1109\/CVPR52688.2022.01631"},{"issue":"9","key":"2759_CR65","doi-asserted-by":"publisher","first-page":"2337","DOI":"10.1007\/s11263-022-01653-1","volume":"130","author":"K Zhou","year":"2022","unstructured":"Zhou, K., Yang, J., Loy, C. C., & Liu, Z. (2022). Learning to prompt for vision-language models. International Journal of Computer Vision., 130(9), 2337\u20132348.","journal-title":"International Journal of Computer Vision."},{"issue":"9","key":"2759_CR66","doi-asserted-by":"publisher","first-page":"2337","DOI":"10.1007\/s11263-022-01653-1","volume":"130","author":"K Zhou","year":"2022","unstructured":"Zhou, K., Yang, J., Loy, C. C., & Liu, Z. (2022). Learning to prompt for vision-language models. International Journal of Computer Vision., 130(9), 2337\u20132348.","journal-title":"International Journal of Computer Vision."},{"key":"2759_CR67","doi-asserted-by":"crossref","unstructured":"Zhu, B., Niu, Y., Han, Y., Wu, Y., & Zhang, H. (2023). Prompt-aligned gradient for prompt tuning. ICCV.","DOI":"10.1109\/ICCV51070.2023.01435"}],"container-title":["International Journal of Computer Vision"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-026-02759-6.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11263-026-02759-6","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-026-02759-6.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,6,18]],"date-time":"2026-06-18T23:06:53Z","timestamp":1781824013000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11263-026-02759-6"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,4,6]]},"references-count":67,"journal-issue":{"issue":"5","published-print":{"date-parts":[[2026,5]]}},"alternative-id":["2759"],"URL":"https:\/\/doi.org\/10.1007\/s11263-026-02759-6","relation":{},"ISSN":["0920-5691","1573-1405"],"issn-type":[{"value":"0920-5691","type":"print"},{"value":"1573-1405","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026,4,6]]},"assertion":[{"value":"20 March 2025","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"8 January 2026","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"6 April 2026","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}],"article-number":"194"}}