{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,2]],"date-time":"2026-07-02T21:24:33Z","timestamp":1783027473770,"version":"3.54.6"},"reference-count":42,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/501100012166","name":"National Key Research and Development Program of China","doi-asserted-by":"publisher","award":["2024YFE0210600"],"award-info":[{"award-number":["2024YFE0210600"]}],"id":[{"id":"10.13039\/501100012166","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Pattern Recognition"],"published-print":{"date-parts":[[2026,12]]},"DOI":"10.1016\/j.patcog.2026.114160","type":"journal-article","created":{"date-parts":[[2026,6,5]],"date-time":"2026-06-05T16:12:15Z","timestamp":1780675935000},"page":"114160","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"PB","title":["ProMML for robust few-shot adaptation of vision-language models"],"prefix":"10.1016","volume":"180","author":[{"given":"Rongfeng","family":"Zhao","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Li","family":"Zhou","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zonghan","family":"Shang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yiwen","family":"Liu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yugui","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Shuang","family":"Li","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jin","family":"Ning","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-7897-1673","authenticated-orcid":false,"given":"Xin","family":"Ning","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.patcog.2026.114160_b1","series-title":"Proceedings of the 38th International Conference on Machine Learning","first-page":"8748","article-title":"Learning transferable visual models from natural language supervision","author":"Radford","year":"2021"},{"key":"10.1016\/j.patcog.2026.114160_b2","series-title":"2024 IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"11375","article-title":"Adapting visual-language models for generalizable anomaly detection in medical images","author":"Huang","year":"2024"},{"key":"10.1016\/j.patcog.2026.114160_b3","doi-asserted-by":"crossref","first-page":"75496","DOI":"10.1109\/ACCESS.2024.3401777","article-title":"A multimodal transfer learning approach using PubMedCLIP for medical image classification","volume":"12","author":"Dao","year":"2024","journal-title":"IEEE Access"},{"key":"10.1016\/j.patcog.2026.114160_b4","series-title":"2022 IEEE\/CVF Conference on Computer Vision and Pattern Recognition Workshops","first-page":"4661","article-title":"The unreasonable effectiveness of CLIP features for image captioning: An experimental analysis","author":"Barraco","year":"2022"},{"key":"10.1016\/j.patcog.2026.114160_b5","series-title":"2023 IEEE International Conference on Image Processing","first-page":"81","article-title":"Video question answering using clip-guided visual-text attention","author":"Ye","year":"2023"},{"key":"10.1016\/j.patcog.2026.114160_b6","series-title":"2022 IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"16795","article-title":"Conditional prompt learning for vision-language models","author":"Zhou","year":"2022"},{"key":"10.1016\/j.patcog.2026.114160_b7","doi-asserted-by":"crossref","unstructured":"J. Zhang, J. Li, X. Yu, L. Huang, L. Gu, J. Zheng, X. Bai, CoR-GS: Sparse-View 3D Gaussian Splatting via Co-regularization, in: A. Leonardis, E. Ricci, S. Roth, O. Russakovsky, T. Sattler, G. Varol (Eds.), in: Computer Vision \u2013 ECCV 2024, vol. 15059, Springer Nature Switzerland, 2025, pp. 335\u2013352, http:\/\/dx.doi.org\/10.1007\/978-3-031-73232-4_19, series Title: Lecture Notes in Computer Science.","DOI":"10.1007\/978-3-031-73232-4_19"},{"key":"10.1016\/j.patcog.2026.114160_b8","first-page":"1","article-title":"DNGaussian++: Improving sparse-view Gaussian radiance fields with depth normalization","author":"Li","year":"2026","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.patcog.2026.114160_b9","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2025.111480","article-title":"ALStereo: Active learning for stereo matching","volume":"164","author":"Zhang","year":"2025","journal-title":"Pattern Recognit."},{"issue":"10","key":"10.1016\/j.patcog.2026.114160_b10","doi-asserted-by":"crossref","first-page":"9113","DOI":"10.1109\/TPAMI.2025.3584847","article-title":"Investigating synthetic-to-real transfer robustness for stereo matching and optical flow estimation","volume":"47","author":"Zhang","year":"2025","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.patcog.2026.114160_b11","series-title":"Proceedings of the 60th Annual Meeting of the Association for Computational Linguistics (ACL 2022): (Short Papers)","first-page":"61","article-title":"P-tuning: Prompt tuning can be comparable to fine-tuning across scales and tasks","volume":"vol. 2","author":"Liu","year":"2022"},{"key":"10.1016\/j.patcog.2026.114160_b12","series-title":"2024 IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"20775","article-title":"DNGaussian: Optimizing sparse-view 3D Gaussian radiance fields with global-local depth normalization","author":"Li","year":"2024"},{"issue":"9","key":"10.1016\/j.patcog.2026.114160_b13","doi-asserted-by":"crossref","first-page":"2337","DOI":"10.1007\/s11263-022-01653-1","article-title":"Learning to prompt for vision-language models","volume":"130","author":"Zhou","year":"2022","journal-title":"Int. J. Comput. Vis."},{"key":"10.1016\/j.patcog.2026.114160_b14","doi-asserted-by":"crossref","unstructured":"M.U. Khattak, H. Rasheed, M. Maaz, S. Khan, F.S. Khan, MaPLe: Multi-modal Prompt Learning, in: 2023 IEEE\/CVF Conference on Computer Vision and Pattern Recognition, CVPR, 2023, pp. 19113\u201319122.","DOI":"10.1109\/CVPR52729.2023.01832"},{"key":"10.1016\/j.patcog.2026.114160_b15","series-title":"2023 IEEE\/CVF International Conference on Computer Vision","first-page":"15144","article-title":"Self-regulating prompts: Foundational model adaptation without forgetting","author":"Khattak","year":"2023"},{"key":"10.1016\/j.patcog.2026.114160_b16","doi-asserted-by":"crossref","unstructured":"H. Yao, R. Zhang, C. Xu, Visual-Language Prompt Tuning with Knowledge-Guided Context Optimization, in: 2023 IEEE\/CVF Conference on Computer Vision and Pattern Recognition, CVPR, 2023, pp. 6757\u20136767.","DOI":"10.1109\/CVPR52729.2023.00653"},{"key":"10.1016\/j.patcog.2026.114160_b17","doi-asserted-by":"crossref","unstructured":"B. Zhu, Y. Niu, Y. Han, Y. Wu, H. Zhang, Prompt-aligned Gradient for Prompt Tuning, in: 2023 IEEE\/CVF International Conference on Computer Vision, ICCV, 2023, pp. 15659\u201315669.","DOI":"10.1109\/ICCV51070.2023.01435"},{"key":"10.1016\/j.patcog.2026.114160_b18","series-title":"2024 IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"23438","article-title":"TCP: Textual-based class-aware prompt tuning for visual-language model","author":"Yao","year":"2024"},{"key":"10.1016\/j.patcog.2026.114160_b19","doi-asserted-by":"crossref","first-page":"1348","DOI":"10.1109\/TIP.2024.3362062","article-title":"Learning domain invariant prompt for vision-language models","volume":"33","author":"Zhao","year":"2024","journal-title":"IEEE Trans. Image Process."},{"key":"10.1016\/j.patcog.2026.114160_b20","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2024.110258","article-title":"Learning adversarial semantic embeddings for zero-shot recognition in open worlds","volume":"149","author":"Li","year":"2024","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.patcog.2026.114160_b21","series-title":"P-tuning v2: Prompt tuning can be comparable to fine-tuning universally across scales and tasks","author":"Liu","year":"2022"},{"key":"10.1016\/j.patcog.2026.114160_b22","series-title":"Computer Vision \u2013 ECCV 2022","first-page":"709","article-title":"Visual prompt tuning","author":"Jia","year":"2022"},{"key":"10.1016\/j.patcog.2026.114160_b23","doi-asserted-by":"crossref","first-page":"511","DOI":"10.1007\/s11263-024-02172-x","article-title":"Progressive visual prompt learning with contrastive feature re-formation","volume":"133","author":"Xu","year":"2025","journal-title":"Int. J. Comput. Vis."},{"key":"10.1016\/j.patcog.2026.114160_b24","series-title":"MMRL++: Parameter-efficient and interaction-aware representation learning for vision-language models","author":"Guo","year":"2025"},{"key":"10.1016\/j.patcog.2026.114160_b25","doi-asserted-by":"crossref","unstructured":"J. Pfeiffer, A. Ruckle, C. Poth, A. Kamath, I. Vulic, S. Ruder, K. Cho, I. Gurevych, AdapterHub: A Framework for Adapting Transformers, in: Proceedings of the 2020 Conference on Empirical Methods in Natural Language Processing: System Demonstrations, 2020, pp. 46\u201354.","DOI":"10.18653\/v1\/2020.emnlp-demos.7"},{"key":"10.1016\/j.patcog.2026.114160_b26","series-title":"LoRA: Low-rank adaptation of large language models","author":"Hu","year":"2021"},{"issue":"2","key":"10.1016\/j.patcog.2026.114160_b27","doi-asserted-by":"crossref","first-page":"581","DOI":"10.1007\/s11263-023-01891-x","article-title":"CLIP-adapter: Better vision-language models with feature adapters","volume":"132","author":"Gao","year":"2024","journal-title":"Int. J. Comput. Vis."},{"issue":"10","key":"10.1016\/j.patcog.2026.114160_b28","doi-asserted-by":"crossref","first-page":"4305","DOI":"10.1007\/s11263-024-02090-y","article-title":"Exploring the usage of pre-trained features for stereo matching","volume":"132","author":"Zhang","year":"2024","journal-title":"Int. J. Comput. Vis."},{"key":"10.1016\/j.patcog.2026.114160_b29","series-title":"2024 IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"23826","article-title":"MMA: Multi-modal adapter for vision-language models","author":"Yang","year":"2024"},{"issue":"7","key":"10.1016\/j.patcog.2026.114160_b30","doi-asserted-by":"crossref","first-page":"4795","DOI":"10.1007\/s11263-025-02407-5","article-title":"Fully decoupled end-to-end person search: An approach without conflicting objectives","volume":"133","author":"Zhang","year":"2025","journal-title":"Int. J. Comput. Vis."},{"key":"10.1016\/j.patcog.2026.114160_b31","series-title":"2025 IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"25015","article-title":"MMRL: Multi-modal representation learning for vision-language models","author":"Guo","year":"2025"},{"key":"10.1016\/j.patcog.2026.114160_b32","series-title":"2009 IEEE Conference on Computer Vision and Pattern Recognition","first-page":"248","article-title":"ImageNet: A large-scale hierarchical image database","author":"Deng","year":"2009"},{"key":"10.1016\/j.patcog.2026.114160_b33","series-title":"2004 Conference on Computer Vision and Pattern Recognition Workshop","first-page":"178","article-title":"Learning generative visual models from few training examples: An incremental Bayesian approach tested on 101 object categories","author":"Fei-Fei","year":"2004"},{"key":"10.1016\/j.patcog.2026.114160_b34","series-title":"2012 IEEE Conference on Computer Vision and Pattern Recognition","first-page":"3498","article-title":"Cats and dogs","author":"Parkhi","year":"2012"},{"key":"10.1016\/j.patcog.2026.114160_b35","doi-asserted-by":"crossref","unstructured":"J. Krause, M. Stark, J. Deng, L. Fei-Fei, 3D object representations for fine-grained categorization, in: Proceedings of the IEEE International Conference on Computer Vision Workshops, 2013, pp. 554\u2013561.","DOI":"10.1109\/ICCVW.2013.77"},{"key":"10.1016\/j.patcog.2026.114160_b36","series-title":"2008 Sixth Indian Conference on Computer Vision, Graphics & Image Processing","first-page":"722","article-title":"Automated flower classification over a large number of classes","author":"Nilsback","year":"2008"},{"key":"10.1016\/j.patcog.2026.114160_b37","series-title":"European Conference on Computer Vision","first-page":"446","article-title":"Food-101\u2013mining discriminative components with random forests","author":"Bossard","year":"2014"},{"key":"10.1016\/j.patcog.2026.114160_b38","series-title":"Fine-grained visual classification of aircraft","author":"Maji","year":"2013"},{"key":"10.1016\/j.patcog.2026.114160_b39","series-title":"2010 IEEE Computer Society Conference on Computer Vision and Pattern Recognition","first-page":"3485","article-title":"Sun database: Large-scale scene recognition from abbey to zoo","author":"Xiao","year":"2010"},{"key":"10.1016\/j.patcog.2026.114160_b40","doi-asserted-by":"crossref","unstructured":"M. Cimpoi, S. Maji, I. Kokkinos, S. Mohamed, A. Vedaldi, Describing textures in the wild, in: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, 2014, pp. 3606\u20133613.","DOI":"10.1109\/CVPR.2014.461"},{"issue":"7","key":"10.1016\/j.patcog.2026.114160_b41","doi-asserted-by":"crossref","first-page":"2217","DOI":"10.1109\/JSTARS.2019.2918242","article-title":"Eurosat: A novel dataset and deep learning benchmark for land use and land cover classification","volume":"12","author":"Helber","year":"2019","journal-title":"IEEE J. Sel. Top. Appl. Earth Obs. Remote. Sens."},{"key":"10.1016\/j.patcog.2026.114160_b42","series-title":"UCF101: A dataset of 101 human actions classes from videos in the wild","author":"Soomro","year":"2012"}],"container-title":["Pattern Recognition"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0031320326011258?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0031320326011258?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,7,2]],"date-time":"2026-07-02T21:04:02Z","timestamp":1783026242000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0031320326011258"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,12]]},"references-count":42,"alternative-id":["S0031320326011258"],"URL":"https:\/\/doi.org\/10.1016\/j.patcog.2026.114160","relation":{},"ISSN":["0031-3203"],"issn-type":[{"value":"0031-3203","type":"print"}],"subject":[],"published":{"date-parts":[[2026,12]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"ProMML for robust few-shot adaptation of vision-language models","name":"articletitle","label":"Article Title"},{"value":"Pattern Recognition","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.patcog.2026.114160","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Published by Elsevier Ltd.","name":"copyright","label":"Copyright"}],"article-number":"114160"}}