{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,3,27]],"date-time":"2026-03-27T09:11:01Z","timestamp":1774602661069,"version":"3.50.1"},"reference-count":75,"publisher":"Springer Science and Business Media LLC","issue":"3","license":[{"start":{"date-parts":[[2026,2,21]],"date-time":"2026-02-21T00:00:00Z","timestamp":1771632000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2026,2,21]],"date-time":"2026-02-21T00:00:00Z","timestamp":1771632000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"funder":[{"DOI":"10.13039\/501100007928","name":"Ningbo Municipal Bureau of Science and Technology","doi-asserted-by":"publisher","award":["2024Z291"],"award-info":[{"award-number":["2024Z291"]}],"id":[{"id":"10.13039\/501100007928","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Int J Comput Vis"],"published-print":{"date-parts":[[2026,3]]},"DOI":"10.1007\/s11263-026-02763-w","type":"journal-article","created":{"date-parts":[[2026,2,21]],"date-time":"2026-02-21T07:39:44Z","timestamp":1771659584000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["Multi-Modal Primitive Retrieval for Compositional Zero-Shot Learning"],"prefix":"10.1007","volume":"134","author":[{"ORCID":"https:\/\/orcid.org\/0009-0008-5109-2386","authenticated-orcid":false,"given":"Chenchen","family":"Jing","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Haozhe","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Junbo","family":"Lu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yang","family":"Liu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Hao","family":"Chen","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xiaoqin","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Chunhua","family":"Shen","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2026,2,21]]},"reference":[{"key":"2763_CR1","unstructured":"Achiam, J., Adler, S., Agarwal, S., Ahmad, L., Akkaya, I., Aleman, F. L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S. et al., (2023). Gpt-4 technical report, arXiv preprint arXiv:2303.08774"},{"key":"2763_CR2","doi-asserted-by":"publisher","first-page":"23 716","DOI":"10.52202\/068431-1723","volume":"35","author":"J-B Alayrac","year":"2022","unstructured":"Alayrac, J.-B., Donahue, J., Luc, P., Miech, A., Barr, I., Hasson, Y., Lenc, K., Mensch, A., Millican, K., Reynolds, M., et al. (2022). Flamingo: a visual language model for few-shot learning. Advances in neural information processing systems, 35, 23 716-23 736.","journal-title":"Advances in neural information processing systems"},{"key":"2763_CR3","doi-asserted-by":"crossref","unstructured":"Anwaar, M. U., Pan, Z., & Kleinsteuber, M. (2022). On leveraging variational graph embeddings for open world compositional zero-shot learning, in Proceedings of the 30th ACM International Conference on Multimedia, pp. 4645\u20134654.","DOI":"10.1145\/3503161.3547798"},{"key":"2763_CR4","unstructured":"Atzmon, Y., Kreuk, F., Shalit, U., & Chechik, G. (2021). A causal view of compositional zero-shot recognition, Advances in neural information processing systems (NeurIPS)."},{"key":"2763_CR5","doi-asserted-by":"crossref","unstructured":"Bao, W., Chen, L., Huang, H., & Kong, Y. (2023). Prompting language-informed distribution for compositional zero-shot learning, arXiv preprint arXiv:2305.14428","DOI":"10.1007\/978-3-031-72630-9_7"},{"key":"2763_CR6","doi-asserted-by":"crossref","unstructured":"Bao, W., Chen, L., Huang, H., & Kong, Y. (2024). Prompting language-informed distribution for compositional zero-shot learning, in European Conference on Computer Vision. Springer pp. 107\u2013123.","DOI":"10.1007\/978-3-031-72630-9_7"},{"key":"2763_CR7","doi-asserted-by":"publisher","first-page":"15\u00a0309","DOI":"10.52202\/068431-1114","volume":"35","author":"A Blattmann","year":"2022","unstructured":"Blattmann, A., Rombach, R., Oktay, K., M\u00fcller, J., & Ommer, B. (2022). Retrieval-augmented diffusion models. Advances in Neural Information Processing Systems, 35, 15\u00a0309-15\u00a0324.","journal-title":"Advances in Neural Information Processing Systems"},{"key":"2763_CR8","first-page":"135","volume":"5","author":"P Bojanowski","year":"2017","unstructured":"Bojanowski, P., Grave, E., Joulin, A., & Mikolov, T. (2017). Enriching word vectors with subword information, Transactions of the Association for. Computational Linguistics, 5, 135\u2013146.","journal-title":"Computational Linguistics"},{"key":"2763_CR9","unstructured":"Borgeaud, S., Mensch, A., Hoffmann, J., Cai, T., Rutherford, E., Millican, K., Van Den Driessche, G. B., Lespiau, J.-B., Damoc, B., Clark, A. et al. (2022) Improving language models by retrieving from trillions of tokens, in ICML, pp. 2206\u20132240."},{"key":"2763_CR10","doi-asserted-by":"crossref","unstructured":"Boyd, S. P., & Vandenberghe, L. (2004). Convex optimization. Cambridge university press","DOI":"10.1017\/CBO9780511804441"},{"key":"2763_CR11","doi-asserted-by":"crossref","unstructured":"Changpinyo, S., Sharma, P., Ding, N., & Soricut, R. (2021). Conceptual 12m: Pushing web-scale image-text pre-training to recognize long-tail visual concepts, in Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 3558\u20133568.","DOI":"10.1109\/CVPR46437.2021.00356"},{"key":"2763_CR12","doi-asserted-by":"publisher","first-page":"166","DOI":"10.1007\/s11263-019-01193-1","volume":"128","author":"S Changpinyo","year":"2020","unstructured":"Changpinyo, S., Chao, W.-L., Gong, B., & Sha, F. (2020). Classifier and exemplar synthesis for zero-shot learning. International Journal of Computer Vision (IJCV), 128, 166\u2013201.","journal-title":"International Journal of Computer Vision (IJCV)"},{"key":"2763_CR13","doi-asserted-by":"crossref","unstructured":"Chen, X., Li, L., Zhang, N., Liang, X., Deng, S., Tan, C., Huang, F., Si, L., & Chen, H. (2022). Decoupling knowledge from memorization: Retrieval-augmented prompt learning, Advances in Neural Information Processing Systems, vol. 35, pp. 23 908\u201323 922.","DOI":"10.52202\/068431-1736"},{"key":"2763_CR14","unstructured":"Comanici, G., Bieber, E., Schaekermann, M., Pasupat, I., Sachdeva, N., Dhillon, I., Blistein, M., Ram, O., Zhang, D., Rosen, E. et al., (2025). Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities, arXiv preprintarXiv:2507.06261"},{"key":"2763_CR15","unstructured":"Cover, T. M. (1999). Elements of information theory. John Wiley & Sons,"},{"key":"2763_CR16","unstructured":"Dosovitskiy, A., Beyer, L., Kolesnikov, A., Weissenborn, D., Zhai, X., Unterthiner, T., Dehghani, M., Minderer, M., Heigold, G., Gelly, S., Uszkoreit, J., & Houlsby, N. (2021). An image is worth 16x16 words: Transformers for image recognition at scale, in International Conference on Learning Representations (ICLR), [Online]. Available: https:\/\/openreview.net\/forum?id=YicbFdNTTy"},{"issue":"1\u20132","key":"2763_CR17","doi-asserted-by":"publisher","first-page":"3","DOI":"10.1016\/0010-0277(88)90031-5","volume":"28","author":"JA Fodor","year":"1988","unstructured":"Fodor, J. A., & Pylyshyn, Z. W. (1988). Connectionism and cognitive architecture: A critical analysis. Cognition, 28(1\u20132), 3\u201371.","journal-title":"Cognition"},{"key":"2763_CR18","unstructured":"Furrer, D., van Zee, M., Scales, N., & Sch\u00e4rli, N. (2020). Compositional generalization in semantic parsing: Pre-training vs. specialized architectures, arXiv preprint arXiv:2007.08970."},{"issue":"2","key":"2763_CR19","doi-asserted-by":"publisher","first-page":"581","DOI":"10.1007\/s11263-023-01891-x","volume":"132","author":"P Gao","year":"2024","unstructured":"Gao, P., Geng, S., Zhang, R., Ma, T., Fang, R., Zhang, Y., Li, H., & Qiao, Y. (2024). Clip-adapter: Better vision-language models with feature adapters. International Journal of Computer Vision (IJCV), 132(2), 581\u2013595.","journal-title":"International Journal of Computer Vision (IJCV)"},{"key":"2763_CR20","unstructured":"Guu, K., Lee, K., Tung, Z., Pasupat, P., & Chang, M. (2020). Retrieval augmented language model pre-training, in International Conference on Machine Learning (ICML). PMLR, pp. 3929\u20133938."},{"key":"2763_CR21","unstructured":"Guu, K., Lee, K., Tung, Z., Pasupat, P., Chang, M. (2020). Retrieval augmented language model pre-training, in ICML, pp. 3929\u20133938."},{"key":"2763_CR22","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., & Sun, J. (2016). Deep residual learning for image recognition, in Proceedings of the IEEE conference on Computer Vision and Pattern Recognition (CVPR) pp. 770\u2013778.","DOI":"10.1109\/CVPR.2016.90"},{"key":"2763_CR23","doi-asserted-by":"crossref","unstructured":"Hu, Z., Iscen, A., Sun, C., Wang, Z., Chang, K.-W., Sun, Y., Schmid, C., Ross, D. A., & Fathi, A. (2023). Reveal: Retrieval-augmented visual-language pre-training with multi-source multimodal knowledge memory, in Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp. 23\u00a0369\u201323\u00a0379.","DOI":"10.1109\/CVPR52729.2023.02238"},{"key":"2763_CR24","unstructured":"Hu, E. J., Shen, Y., Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., Wang, L., & Chen, W. (2021). Lora: Low-rank adaptation of large language models, arXiv preprint arXiv:2106.09685"},{"key":"2763_CR25","doi-asserted-by":"crossref","unstructured":"Huang, S., Gong, B., Feng, Y., Lv, Y., & Wang, D. (2023). Troika: Multi-path cross-modal traction for compositional zero-shot learning, arXiv preprint arXiv:2303.15230","DOI":"10.1109\/CVPR52733.2024.02266"},{"key":"2763_CR26","doi-asserted-by":"crossref","unstructured":"Hudson, D. A., & Manning, C. D. (2019). Gqa: A new dataset for real-world visual reasoning and compositional question answering, in Proceedings of the IEEE\/CVF conference on Computer Vision and Pattern Recognition (CVPR), pp. 6700\u20136709.","DOI":"10.1109\/CVPR.2019.00686"},{"issue":"3","key":"2763_CR27","doi-asserted-by":"publisher","first-page":"2265","DOI":"10.1609\/aaai.v38i3.28000","volume":"38","author":"X Hu","year":"2024","unstructured":"Hu, X., & Wang, Z. (2024). A dynamic learning method towards realistic compositional zero-shot learning. Proceedings of the AAAI Conference on Artificial Intelligence, 38(3), 2265\u20132273.","journal-title":"Proceedings of the AAAI Conference on Artificial Intelligence"},{"key":"2763_CR28","volume-title":"Discovering states and transformations in image collections, in Proc","author":"P Isola","year":"2015","unstructured":"Isola, P., Lim, J. J., & Adelson, E. H. (2015). Discovering states and transformations in image collections, in Proc. Recogn: IEEE Conf. Comp. Vis. Patt."},{"key":"2763_CR29","doi-asserted-by":"crossref","unstructured":"Jiang, C., Shen, Y., Chen, D., Zhang, H., Shao, L., & Torr, P. H. (2024). Estimation of near-instance-level attribute bottleneck for zero-shot learning, International Journal of Computer Vision (IJCV), pp. 1\u201327.","DOI":"10.1007\/s11263-024-02021-x"},{"issue":"3","key":"2763_CR30","doi-asserted-by":"publisher","first-page":"2498","DOI":"10.1609\/aaai.v38i3.28026","volume":"38","author":"C Jiang","year":"2024","unstructured":"Jiang, C., & Zhang, H. (2024). Revealing the proximate long-tail distribution in compositional zero-shot learning. Proceedings of the AAAI Conference on Artificial Intelligence, 38(3), 2498\u20132506.","journal-title":"Proceedings of the AAAI Conference on Artificial Intelligence"},{"key":"2763_CR31","unstructured":"Jing, C., Wu, Y., Zhang, X., Jia, Y., & Wu, Q. (2020). Overcoming language priors in vqa via decomposed linguistic representations, in Thirty-Forth AAAI Conference on Artificial Intelligence (AAAI), pp. 11\u00a0181\u201311\u00a0188."},{"issue":"3","key":"2763_CR32","doi-asserted-by":"publisher","first-page":"2652","DOI":"10.1609\/aaai.v38i3.28043","volume":"38","author":"C Jing","year":"2024","unstructured":"Jing, C., Li, Y., Chen, H., & Shen, C. (2024). Retrieval-augmented primitive representations for compositional zero-shot learning. Proceedings of the AAAI Conference on Artificial Intelligence, 38(3), 2652\u20132660.","journal-title":"Proceedings of the AAAI Conference on Artificial Intelligence"},{"key":"2763_CR33","doi-asserted-by":"crossref","unstructured":"Karpukhin, V., O\u011fuz, B., Min, S., Lewis, P., Wu, L., Edunov, S., Chen, D., & Yih, W.-t. (2020). Dense passage retrieval for open-domain question answering, arXiv preprintarXiv:2004.04906","DOI":"10.18653\/v1\/2020.emnlp-main.550"},{"key":"2763_CR34","doi-asserted-by":"crossref","unstructured":"Karthik, S., Mancini, M., & Akata, Z. (2022). Kg-sp: Knowledge guided simple primitives for open world compositional zero-shot learning, in Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR) pp. 9336\u20139345.","DOI":"10.1109\/CVPR52688.2022.00912"},{"key":"2763_CR35","doi-asserted-by":"crossref","unstructured":"Li, C., Jing, C., Li, Z., Zhai, M., Wu, Y., & Jia, Y. (2024). In-context compositional generalization for large vision-language models, in Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing, pp. 17 954\u201317 966.","DOI":"10.18653\/v1\/2024.emnlp-main.996"},{"key":"2763_CR36","unstructured":"Li, C., Li, Z., Jing, C., Jia, Y., & Wu, Y. (2023). Exploring the effect of primitives for compositional generalization in vision-and-language, in Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 19 092\u201319 101."},{"key":"2763_CR37","unstructured":"Li, C., Li, Z., Jing, C., Liu, S., Shao, W., Wu, Y. Luo, P., Qiao, Y., & Zhang, K. (2024). Searchlvlms: A plug-and-play framework for augmenting large vision-language models by searching up-to-date internet knowledge, in The Thirty-eighth Annual Conference on Neural Information Processing Systems,"},{"key":"2763_CR38","unstructured":"Li, Y.-L., Xu, Y., Mao, X., & Lu, C. (2020). Symmetry and group in attribute-object compositions, in Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 11\u00a0316\u201311\u00a0325."},{"key":"2763_CR39","doi-asserted-by":"publisher","first-page":"2810","DOI":"10.1007\/s11263-020-01342-x","volume":"128","author":"A Li","year":"2020","unstructured":"Li, A., Lu, Z., Guan, J., Xiang, T., Wang, L., & Wen, J.-R. (2020). Transferrable feature and projection learning with class hierarchy for zero-shot learning. International Journal of Computer Vision (IJCV), 128, 2810\u20132827.","journal-title":"International Journal of Computer Vision (IJCV)"},{"key":"2763_CR40","doi-asserted-by":"crossref","unstructured":"Lin, T. Y., Maire, M., Belongie, S., Hays, J., Perona, P., Ramanan, D., Doll\u00e1r, P., & L. Zitnick, C. (2014). Microsoft coco: Common objects in context, in European conference on computer vision. Springer, pp. 740\u2013755.","DOI":"10.1007\/978-3-319-10602-1_48"},{"key":"2763_CR41","doi-asserted-by":"crossref","unstructured":"Liu, Y., Zhou, L., Bai, X., Huang, Y., Gu, L., Zhou, J., & Harada, T. (2021). Goal-oriented gaze estimation for zero-shot learning, in Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp. 3794\u20133803.","DOI":"10.1109\/CVPR46437.2021.00379"},{"key":"2763_CR42","doi-asserted-by":"crossref","unstructured":"Long, A., Yin, W., Ajanthan, T., Nguyen, V., Purkait, P., Garg, R., Blair, A., Shen, C., & van den Hengel, A. (2022). Retrieval augmented classification for long-tail visual recognition, in Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition (CVPR), pp. 6959\u20136969.","DOI":"10.1109\/CVPR52688.2022.00683"},{"key":"2763_CR43","doi-asserted-by":"crossref","unstructured":"Lu, X., Guo, S., Liu, Z., & Guo, J. (2023) Decomposed soft prompt guided fusion enhancing for compositional zero-shot learning, in Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 23\u00a0560\u201323\u00a0569.","DOI":"10.1109\/CVPR52729.2023.02256"},{"key":"2763_CR44","doi-asserted-by":"crossref","unstructured":"Mancini, M., Naeem, M. F., Xian, Y., & Akata, Z. (2021). Open world compositional zero-shot learning, in Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 5222\u20135230.","DOI":"10.1109\/CVPR46437.2021.00518"},{"key":"2763_CR45","doi-asserted-by":"crossref","unstructured":"Mancini, M., Naeem, M. F., Xian, Y., & Akata, Z. (2022) Learning graph embeddings for open world compositional zero-shot learning, IEEE Transactions on Pattern Analysis and Machine Intelligence","DOI":"10.1109\/CVPR46437.2021.00518"},{"key":"2763_CR46","unstructured":"Menon, S., & Vondrick, C. (2022) Visual classification via description from large language models, in The Eleventh International Conference on Learning Representations"},{"key":"2763_CR47","unstructured":"Mikolov, T., Sutskever, I., Chen, K., Corrado, G. S., & Dean, J. (2013). Distributed representations of words and phrases and their compositionality, in Advances in neural information processing systems, pp. 3111\u20133119."},{"key":"2763_CR48","doi-asserted-by":"crossref","unstructured":"Misra, I., Gupta, A., & Hebert, M. (2017). From red wine to red tomato: Composition with context, in Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pp. 1792\u20131801.","DOI":"10.1109\/CVPR.2017.129"},{"key":"2763_CR49","doi-asserted-by":"crossref","unstructured":"Naeem, M. F., Xian, Y., Tombari, F. & Akata, Z. (2021). Learning graph embeddings for compositional zero-shot learning, in Proc. IEEE Conf. Comp. Vis. Patt. Recogn.","DOI":"10.1109\/CVPR46437.2021.00101"},{"key":"2763_CR50","unstructured":"Nayak, N. V., Yu, P., & Bach, S. (2023) Learning to compose soft prompts for compositional zero-shot learning, in International Conference on Learning Representations (ICLR), [Online]. Available: https:\/\/openreview.net\/forum?id=S8-A2FXnIh"},{"key":"2763_CR51","doi-asserted-by":"crossref","unstructured":"Pennington, J., Socher, R., & Manning, C. D. (2014). Glove: Global vectors for word representation, in Proceedings of the 2014 conference on empirical methods in natural language processing (EMNLP), pp. 1532\u20131543.","DOI":"10.3115\/v1\/D14-1162"},{"key":"2763_CR52","doi-asserted-by":"crossref","unstructured":"Pourpanah, F., Abdar, M., Luo, Y., Zhou, X., Wang, R., Lim, C., Wang, X.-Z., & Wu, Q. J. (2022). A review of generalized zero-shot learning methods, IEEE transactions on pattern analysis and machine intelligence,","DOI":"10.1109\/TPAMI.2022.3191696"},{"key":"2763_CR53","doi-asserted-by":"crossref","unstructured":"Purushwalkam, S., Nickel, M., Gupta, A., & Ranzato, M. (2019). Task-driven modular networks for zero-shot compositional learning, in Proceedings of the IEEE\/CVF International Conference on Computer Vision, pp. 3593\u20133602.","DOI":"10.1109\/ICCV.2019.00369"},{"key":"2763_CR54","unstructured":"Radford, A., Kim, J. W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J. et al. (2021). Learning transferable visual models from natural language supervision, in International Conference on Machine Learning (ICML). PMLR, pp. 8748\u20138763."},{"key":"2763_CR55","unstructured":"Rong, J., Chen, H., Chen, T., Ou, L., Yu, X., & Liu, Y. (2023). Retrieval-enhanced visual prompt learning for few-shot classification, arXiv preprintarXiv:2306.02243"},{"key":"2763_CR56","unstructured":"Ruis, F., Burghouts, G., & Bucur, D. (2021). Independent prototype propagation for zero-shot compositionality, Advances in Neural Information Processing Systems, vol. 34"},{"key":"2763_CR57","unstructured":"Saini, N., Pham, K., & Shrivastava, A. (2022). Disentangling visual embeddings for attributes and objects, in Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 13\u00a0658\u201313\u00a0667."},{"key":"2763_CR58","doi-asserted-by":"crossref","unstructured":"Salakhutdinov, R., Torralba, A., & Tenenbaum, J. (2011). Learning to share visual appearance for multiclass object detection, in CVPR 2011. IEEE, pp. 1481\u20131488.","DOI":"10.1109\/CVPR.2011.5995720"},{"key":"2763_CR59","doi-asserted-by":"publisher","DOI":"10.1017\/CBO9780511623288","volume-title":"The psychology of associative learning","author":"DR Shanks","year":"1995","unstructured":"Shanks, D. R. (1995). The psychology of associative learning. Cambridge University Press."},{"key":"2763_CR60","doi-asserted-by":"crossref","unstructured":"Sharma, P., Ding, N., Goodman, S., & Soricut, R. (2018). Conceptual captions: A cleaned, hypernymed, image alt-text dataset for automatic image captioning, in Proceedings of the 56th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pp. 2556\u20132565.","DOI":"10.18653\/v1\/P18-1238"},{"key":"2763_CR61","unstructured":"Sun, J., Xu, C., Tang, L., Wang, S., Lin, C., Gong, Y., Shum, H.-Y., & Guo, J. (2023). Think-on-graph: Deep and responsible reasoning of large language model with knowledge graph, arXiv preprint arXiv:2307.07697"},{"key":"2763_CR62","doi-asserted-by":"publisher","first-page":"151","DOI":"10.1016\/S0074-7742(08)60351-7","volume":"41","author":"RF Thompson","year":"1997","unstructured":"Thompson, R. F., Bao, S., Chen, L., Cipriano, B. D., Grethe, J. S., Kim, J. J., Thompson, J. K., Tracy, J. A., Weninger, M. S., & Krupa, D. J. (1997). Associative learning. International review of neurobiology, 41, 151\u2013189.","journal-title":"International review of neurobiology"},{"key":"2763_CR63","unstructured":"Van der Maaten, L., & Hinton, G. (2008). Visualizing data using t-sne. Journal of machine learning research, vol. 9, no. 11"},{"key":"2763_CR64","unstructured":"Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A. N., Kaiser, \u0141., & Polosukhin, I. (2017). Attention is all you need, in Advances in neural information processing systems, pp. 5998\u20136008."},{"key":"2763_CR65","unstructured":"Wang, Q., Liu, L., Jing, C., Chen, H., Liang, G., Wang, P., & Shen, C. (2023). Learning conditional attributes for compositional zero-shot learning, in Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 11 197\u201311 206."},{"key":"2763_CR66","doi-asserted-by":"publisher","first-page":"356","DOI":"10.1007\/s11263-017-1027-5","volume":"124","author":"Q Wang","year":"2017","unstructured":"Wang, Q., & Chen, K. (2017). Zero-shot visual recognition via bidirectional latent embedding. International Journal of Computer Vision (IJCV), 124, 356\u2013383.","journal-title":"International Journal of Computer Vision (IJCV)"},{"key":"2763_CR67","unstructured":"Wiedemer, T., Mayilvahanan, P., Bethge, M., & Brendel, W. (2024). Compositional generalization from first principles, Advances in Neural Information Processing Systems, vol. 36."},{"key":"2763_CR68","doi-asserted-by":"publisher","first-page":"21","DOI":"10.1016\/j.cviu.2017.05.001","volume":"163","author":"Q Wu","year":"2017","unstructured":"Wu, Q., Teney, D., Wang, P., Shen, C., Dick, A., & van den Hengel, A. (2017). Visual question answering: A survey of methods and datasets. Computer Vision and Image Understanding, 163, 21\u201340.","journal-title":"Computer Vision and Image Understanding"},{"key":"2763_CR69","unstructured":"Yang, A., Li, A., Yang, B., Zhang, B., Hui, B., Zheng, B., Yu, B., Gao, C., Huang, C., Lv, C. et al., (2025). Qwen3 technical report, arXiv preprintarXiv:2505.09388"},{"key":"2763_CR70","doi-asserted-by":"crossref","unstructured":"Yang, Z., Ping, W., Liu, Z., Korthikanti, V., Nie, W., Huang, D.-A., Fan, L., Yu, Z., Lan, S., Li. B. et al. (2023). Re-vilm: Retrieval-augmented visual language model for zero and few-shot image captioning, arXiv preprintarXiv:2302.04858","DOI":"10.18653\/v1\/2023.findings-emnlp.793"},{"key":"2763_CR71","doi-asserted-by":"crossref","unstructured":"Yang, M., Xu, C., Wu, A., & Deng, C. (2022). A decomposable causal view of compositional zero-shot learning, IEEE Transactions on Multimedia.","DOI":"10.1109\/TMM.2022.3200578"},{"key":"2763_CR72","unstructured":"Yasunaga, M., Aghajanyan, A., Shi, W., James, R., Leskovec, J., Liang, P., Lewis, M., Zettlemoyer, L., & Yih, W.-T. (2023). Retrieval-augmented multimodal language modeling, in International Conference on Machine Learning. PMLR, pp. 39\u00a0755\u201339\u00a0769."},{"key":"2763_CR73","doi-asserted-by":"crossref","unstructured":"Yu, A., & Grauman, K. (2014). Fine-grained visual comparisons with local learning, in Proc. IEEE Conf. Comp. Vis. Patt. Recogn.","DOI":"10.1109\/CVPR.2014.32"},{"key":"2763_CR74","doi-asserted-by":"crossref","unstructured":"Zhang, T., Liang, K., Du, R., Sun, X., Ma, Z., & Guo, J. (2022). Learning invariant visual representations for compositional zero-shot learning, in European Conference on Computer Vision. Springer, pp. 339\u2013355.","DOI":"10.1007\/978-3-031-20053-3_20"},{"issue":"9","key":"2763_CR75","doi-asserted-by":"publisher","first-page":"2337","DOI":"10.1007\/s11263-022-01653-1","volume":"130","author":"K Zhou","year":"2022","unstructured":"Zhou, K., Yang, J., Loy, C. C., & Liu, Z. (2022). Learning to prompt for vision-language models. International Journal of Computer Vision (IJCV), 130(9), 2337\u20132348.","journal-title":"International Journal of Computer Vision (IJCV)"}],"container-title":["International Journal of Computer Vision"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-026-02763-w.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11263-026-02763-w","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-026-02763-w.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,3,27]],"date-time":"2026-03-27T08:34:21Z","timestamp":1774600461000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11263-026-02763-w"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,2,21]]},"references-count":75,"journal-issue":{"issue":"3","published-print":{"date-parts":[[2026,3]]}},"alternative-id":["2763"],"URL":"https:\/\/doi.org\/10.1007\/s11263-026-02763-w","relation":{},"ISSN":["0920-5691","1573-1405"],"issn-type":[{"value":"0920-5691","type":"print"},{"value":"1573-1405","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026,2,21]]},"assertion":[{"value":"1 January 2025","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"20 January 2026","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"21 February 2026","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors declare that they have no conflict of interest.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Competing Interests"}}],"article-number":"129"}}