{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,5]],"date-time":"2026-06-05T11:05:09Z","timestamp":1780657509199,"version":"3.54.1"},"reference-count":51,"publisher":"Springer Science and Business Media LLC","issue":"3","license":[{"start":{"date-parts":[[2025,2,6]],"date-time":"2025-02-06T00:00:00Z","timestamp":1738800000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by-nc-nd\/4.0"},{"start":{"date-parts":[[2025,2,6]],"date-time":"2025-02-06T00:00:00Z","timestamp":1738800000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by-nc-nd\/4.0"}],"funder":[{"name":"Australian Research Council project","award":["DP220102121"],"award-info":[{"award-number":["DP220102121"]}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Mach Learn"],"published-print":{"date-parts":[[2025,3]]},"DOI":"10.1007\/s10994-025-06742-z","type":"journal-article","created":{"date-parts":[[2025,2,6]],"date-time":"2025-02-06T18:17:46Z","timestamp":1738865866000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":6,"title":["Alignclip: navigating the misalignments for robust vision-language generalization"],"prefix":"10.1007","volume":"114","author":[{"given":"Zhongyi","family":"Han","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Gongxu","family":"Luo","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Hao","family":"Sun","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yaqian","family":"Li","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Bo","family":"Han","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Mingming","family":"Gong","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Kun","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Tongliang","family":"Liu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2025,2,6]]},"reference":[{"key":"6742_CR1","doi-asserted-by":"crossref","unstructured":"Cha, J., Lee, K., Park, S., & Chun, S. (2022). Domain generalization by mutual-information regularization with pre-trained models. arXiv","DOI":"10.1007\/978-3-031-20050-2_26"},{"key":"6742_CR2","doi-asserted-by":"crossref","unstructured":"Deng, J., Dong, W., Socher, R., Li, L.-J., Li, K., & Fei-Fei, L. (2009). Imagenet: A large-scale hierarchical image database. In CVPR.","DOI":"10.1109\/CVPR.2009.5206848"},{"key":"6742_CR3","unstructured":"Dosovitskiy, A., Beyer, L., Kolesnikov, A., Weissenborn, D., Zhai, X., Unterthiner, T., Dehghani, M., Minderer, M., Heigold, G., Gelly, S., et al. (2021). An image is worth 16x16 words: Transformers for image recognition at scale. In ICLR."},{"key":"6742_CR4","unstructured":"Du, X., Wang, Z., Cai, M., & Li, Y. (2022). Vos: Learning what you don\u2019t know by virtual outlier synthesis. In ICLR."},{"key":"6742_CR5","doi-asserted-by":"crossref","unstructured":"Elhoseiny, M., Saleh, B., & Elgammal, A. (2013). Write a classifier: Zero-shot learning using purely textual descriptions. In ICCV.","DOI":"10.1109\/ICCV.2013.321"},{"key":"6742_CR6","unstructured":"Frome, A., Corrado, G. S., Shlens, J., Bengio, S., Dean, J., Ranzato, M., & Mikolov, T. (2013). Devise: A deep visual-semantic embedding model. In NeurIPS."},{"key":"6742_CR7","doi-asserted-by":"crossref","unstructured":"Fu, B., Cao, Z., Long, M., & Wang, J. (2020). Learning to detect open classes for universal domain adaptation. In ECCV (pp. 567\u2013583). Springer.","DOI":"10.1007\/978-3-030-58555-6_34"},{"key":"6742_CR8","unstructured":"Ganin, Y., & Lempitsky, V. (2015). Unsupervised domain adaptation by backpropagation. In ICML (pp. 1180\u20131189). PMLR."},{"key":"6742_CR9","unstructured":"Gao, P., Geng, S., Zhang, R., Ma, T., Fang, R., Zhang, Y., Li, H., & Qiao, Y. (2021). Clip-adapter: Better vision-language models with feature adapters. arXiv"},{"key":"6742_CR10","unstructured":"Gomes, E. D. C., Alberge, F., Duhamel, P., & Piantanida, P. (2022). Igeood: An information geometry approach to out-of-distribution detection. In ICLR."},{"key":"6742_CR11","unstructured":"Gulrajani, I., & Lopez-Paz, D. (2021). In search of lost domain generalization. In ICLR."},{"issue":"5","key":"6742_CR12","first-page":"6460","volume":"45","author":"Z Han","year":"2022","unstructured":"Han, Z., Gui, X.-J., Sun, H., Yin, Y., & Li, S. (2022). Towards accurate and robust domain adaptation under multiple noisy environments. IEEE Transactions on Pattern Analysis and Machine Intelligence, 45(5), 6460\u20136479.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"6742_CR13","doi-asserted-by":"publisher","first-page":"6424","DOI":"10.1109\/TIP.2022.3184848","volume":"31","author":"Z Han","year":"2022","unstructured":"Han, Z., Sun, H., & Yin, Y. (2022). Learning transferable parameters for unsupervised domain adaptation. IEEE Transactions on Image Processing, 31, 6424\u20136439.","journal-title":"IEEE Transactions on Image Processing"},{"key":"6742_CR14","unstructured":"Hendrycks, D., & Gimpel, K. (2017). A baseline for detecting misclassified and out-of-distribution examples in neural networks. In ICLR."},{"key":"6742_CR15","doi-asserted-by":"crossref","unstructured":"Hendrycks, D., Basart, S., Mu, N., Kadavath, S., Wang, F., Dorundo, E., Desai, R., Zhu, T., Parajuli, S., Guo, M., et al. (2021). The many faces of robustness: A critical analysis of out-of-distribution generalization. In ICCV.","DOI":"10.1109\/ICCV48922.2021.00823"},{"key":"6742_CR16","first-page":"38516","volume":"35","author":"P Izmailov","year":"2022","unstructured":"Izmailov, P., Kirichenko, P., Gruver, N., & Wilson, A. G. (2022). On feature learning in the presence of spurious correlations. NeurIPS, 35, 38516\u201338532.","journal-title":"NeurIPS"},{"key":"6742_CR17","unstructured":"Jiang, D., Sun, S., & Yu, Y. (2021). Revisiting flow generative models for out-of-distribution detection. In ICLR."},{"key":"6742_CR18","doi-asserted-by":"crossref","unstructured":"Khattak, M. U., Rasheed, H., Maaz, M., Khan, S., & Khan, F. S. (2023). Maple: Multi-modal prompt learning. In CVPR (pp. 19113\u201319122).","DOI":"10.1109\/CVPR52729.2023.01832"},{"key":"6742_CR19","doi-asserted-by":"crossref","unstructured":"Khattak, M. U., Wasim, S. T., Naseer, M., Khan, S., Yang, M.-H., & Khan, F. S. (2023). Self-regulating prompts: Foundational model adaptation without forgetting. In CVPR.","DOI":"10.1109\/ICCV51070.2023.01394"},{"key":"6742_CR20","unstructured":"Li, J., Li, D., Savarese, S., & Hoi, S. (2023). Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models. arXiv preprint arXiv:2301.12597"},{"key":"6742_CR21","unstructured":"Li, J., Li, D., Xiong, C., & Hoi, S. (2022). Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation. In ICML (pp. 12888\u201312900). PMLR."},{"key":"6742_CR22","doi-asserted-by":"crossref","unstructured":"Li, Y., Tian, X., Gong, M., Liu, Y., Liu, T., Zhang, K., & Tao, D. (2018). Deep domain generalization via conditional invariant adversarial networks. In ECCV (pp. 624\u2013639).","DOI":"10.1007\/978-3-030-01267-0_38"},{"key":"6742_CR23","unstructured":"Li, Y., Wang, H., Duan, Y., & Li, X. (2023). Clip surgery for better explainability with enhancement in open-vocabulary tasks. arXiv"},{"key":"6742_CR24","unstructured":"Li, Y., Wang, H., Duan, Y., Xu, H., & Li, X. (2022). Exploring visual interpretability for contrastive language-image pre-training. arXiv"},{"key":"6742_CR25","unstructured":"Liang, S., Li, Y., & Srikant, R. (2017). Enhancing the reliability of out-of-distribution image detection in neural networks. In ICLR."},{"key":"6742_CR26","unstructured":"Liu, J., Hu, Z., Cui, P., Li, B., & Shen, Z. (2021). Heterogeneous risk minimization. In ICML (pp. 6804\u20136814). PMLR."},{"key":"6742_CR27","doi-asserted-by":"crossref","unstructured":"Liu, H., Li, C., Li, Y., & Lee, Y. J. (2023). Improved baselines with visual instruction tuning. arXiv preprint arXiv:2310.03744","DOI":"10.1109\/CVPR52733.2024.02484"},{"key":"6742_CR28","unstructured":"Loshchilov, I., & Hutter, F. (2019). Decoupled weight decay regularization. In ICLR."},{"key":"6742_CR29","doi-asserted-by":"crossref","unstructured":"Lu, Y., Liu, J., Zhang, Y., Liu, Y., & Tian, X. (2022). Prompt distribution learning. In CVPR.","DOI":"10.1109\/CVPR52688.2022.00514"},{"key":"6742_CR30","doi-asserted-by":"crossref","unstructured":"L\u00fcddecke, T., & Ecker, A. (2022). Image segmentation using text and image prompts. In CVPR (pp. 7086\u20137096).","DOI":"10.1109\/CVPR52688.2022.00695"},{"key":"6742_CR31","unstructured":"Miller, J. P., Taori, R., Raghunathan, A., Sagawa, S., Koh, P. W., Shankar, V., Liang, P., Carmon, Y., & Schmidt, L. (2021). Accuracy on the line: On the strong correlation between out-of-distribution and in-distribution generalization. In ICML."},{"key":"6742_CR32","unstructured":"Muandet, K., Balduzzi, D., & Sch\u00f6lkopf, B. (2013). Domain generalization via invariant feature representation. In ICML (pp. 10\u201318). PMLR."},{"key":"6742_CR33","doi-asserted-by":"crossref","unstructured":"Pourpanah, F., Abdar, M., Luo, Y., Zhou, X., Wang, R., Lim, C. P., Wang, X.-Z., & Wu, Q. J. (2022). A review of generalized zero-shot learning methods. IEEE Transactions on Pattern Analysis and Machine Intelligence.","DOI":"10.1109\/TPAMI.2022.3191696"},{"key":"6742_CR34","unstructured":"Radford, A., Kim, J. W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., et al. (2021). Learning transferable visual models from natural language supervision. In ICML."},{"key":"6742_CR35","unstructured":"Romera-Paredes, B., & Torr, P. (2015). An embarrassingly simple approach to zero-shot learning. In ICML (pp. 2152\u20132161). PMLR."},{"issue":"5","key":"6742_CR36","doi-asserted-by":"publisher","first-page":"612","DOI":"10.1109\/JPROC.2021.3058954","volume":"109","author":"B Sch\u00f6lkopf","year":"2021","unstructured":"Sch\u00f6lkopf, B., Locatello, F., Bauer, S., Ke, N. R., Kalchbrenner, N., Goyal, A., & Bengio, Y. (2021). Toward causal representation learning. Proceedings of the IEEE, 109(5), 612\u2013634.","journal-title":"Proceedings of the IEEE"},{"key":"6742_CR37","unstructured":"Shu, Y., Guo, X., Wu, J., Wang, X., Wang, J., & Long, M. (2023). Clipood: Generalizing clip to out-of-distributions. In ICML."},{"key":"6742_CR38","unstructured":"Shu, M., Nie, W., Huang, D.-A., Yu, Z., Goldstein, T., Anandkumar, A., & Xiao, C. (2022). Test-time prompt tuning for zero-shot generalization in vision-language models. In NeurIPS."},{"key":"6742_CR39","doi-asserted-by":"crossref","unstructured":"Singh, A., Hu, R., Goswami, V., Couairon, G., Galuba, W., Rohrbach, M., & Kiela, D. (2022). Flava: A foundational language and vision alignment model. In CVPR (pp. 15638\u201315650).","DOI":"10.1109\/CVPR52688.2022.01519"},{"key":"6742_CR40","unstructured":"Socher, R., Ganjoo, M., Manning, C. D., & Ng, A. (2013). Zero-shot learning through cross-modal transfer. In NeurIPS."},{"key":"6742_CR41","doi-asserted-by":"crossref","unstructured":"Sun, B., & Saenko, K. (2016). Deep coral: Correlation alignment for deep domain adaptation. In ECCV.","DOI":"10.1007\/978-3-319-49409-8_35"},{"key":"6742_CR42","unstructured":"Taori, R., Dave, A., Shankar, V., Carlini, N., Recht, B., & Schmidt, L. (2020). Measuring robustness to natural distribution shifts in image classification. In NeurIPS."},{"key":"6742_CR43","unstructured":"Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A. N., Kaiser, \u0141., & Polosukhin, I. (2017). Attention is all you need. In NeurIPS."},{"key":"6742_CR44","doi-asserted-by":"crossref","unstructured":"Wortsman, M., Ilharco, G., Kim, J. W., Li, M., Kornblith, S., Roelofs, R., Lopes, R. G., Hajishirzi, H., Farhadi, A., Namkoong, H., et al. (2022). Robust fine-tuning of zero-shot models. In CVPR.","DOI":"10.1109\/CVPR52688.2022.00780"},{"key":"6742_CR45","unstructured":"Yang, J., Zhou, K., Li, Y., & Liu, Z. (2021). Generalized out-of-distribution detection: A survey. arXiv"},{"key":"6742_CR46","doi-asserted-by":"crossref","unstructured":"Ye, N., Li, K., Bai, H., Yu, R., Hong, L., Zhou, F., Li, Z., & Zhu, J. (2022). Ood-bench: Quantifying and understanding two dimensions of out-of-distribution generalization. In CVPR (pp. 7947\u20137958).","DOI":"10.1109\/CVPR52688.2022.00779"},{"key":"6742_CR47","doi-asserted-by":"crossref","unstructured":"Zhang, X., Cui, P., Xu, R., Zhou, L., He, Y., & Shen, Z. (2021). Deep stable learning for out-of-distribution generalization. In CVPR (pp. 5372\u20135382).","DOI":"10.1109\/CVPR46437.2021.00533"},{"key":"6742_CR48","unstructured":"Zhang, R., Fang, R., Zhang, W., Gao, P., Li, K., Dai, J., Qiao, Y., & Li, H. (2021). Tip-adapter: Training-free clip-adapter for better vision-language modeling. arXiv"},{"key":"6742_CR49","unstructured":"Zhang, X., Gu, S. S., Matsuo, Y., & Iwasawa, Y. (2022). Domain prompt learning for efficiently adapting clip to unseen domains. arXiv"},{"key":"6742_CR50","doi-asserted-by":"crossref","unstructured":"Zhou, K., Yang, J., Loy, C. C., & Liu, Z. (2022). Conditional prompt learning for vision-language models. In CVPR.","DOI":"10.1109\/CVPR52688.2022.01631"},{"issue":"9","key":"6742_CR51","doi-asserted-by":"publisher","first-page":"2337","DOI":"10.1007\/s11263-022-01653-1","volume":"130","author":"K Zhou","year":"2022","unstructured":"Zhou, K., Yang, J., Loy, C. C., & Liu, Z. (2022). Learning to prompt for vision-language models. IJCV, 130(9), 2337\u20132348.","journal-title":"IJCV"}],"container-title":["Machine Learning"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10994-025-06742-z.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s10994-025-06742-z\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10994-025-06742-z.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,5,20]],"date-time":"2025-05-20T16:37:29Z","timestamp":1747759049000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s10994-025-06742-z"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,2,6]]},"references-count":51,"journal-issue":{"issue":"3","published-print":{"date-parts":[[2025,3]]}},"alternative-id":["6742"],"URL":"https:\/\/doi.org\/10.1007\/s10994-025-06742-z","relation":{},"ISSN":["0885-6125","1573-0565"],"issn-type":[{"value":"0885-6125","type":"print"},{"value":"1573-0565","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,2,6]]},"assertion":[{"value":"25 April 2024","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"24 September 2024","order":2,"name":"revised","label":"Revised","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"16 January 2025","order":3,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"6 February 2025","order":4,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"There is no Conflict of interest.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflict of interest"}}],"article-number":"58"}}