{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,16]],"date-time":"2026-06-16T05:17:25Z","timestamp":1781587045541,"version":"3.54.5"},"publisher-location":"Cham","reference-count":41,"publisher":"Springer Nature Switzerland","isbn-type":[{"value":"9783031758225","type":"print"},{"value":"9783031758232","type":"electronic"}],"license":[{"start":{"date-parts":[[2024,10,25]],"date-time":"2024-10-25T00:00:00Z","timestamp":1729814400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2024,10,25]],"date-time":"2024-10-25T00:00:00Z","timestamp":1729814400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025]]},"DOI":"10.1007\/978-3-031-75823-2_9","type":"book-chapter","created":{"date-parts":[[2024,10,24]],"date-time":"2024-10-24T20:33:24Z","timestamp":1729802004000},"page":"97-110","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":9,"title":["Optimizing CLIP Models for\u00a0Image Retrieval with\u00a0Maintained Joint-Embedding Alignment"],"prefix":"10.1007","author":[{"ORCID":"https:\/\/orcid.org\/0000-0003-3548-0537","authenticated-orcid":false,"given":"Konstantin","family":"Schall","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-6309-572X","authenticated-orcid":false,"given":"Kai Uwe","family":"Barthel","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-3957-4672","authenticated-orcid":false,"given":"Nico","family":"Hezel","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-3600-6848","authenticated-orcid":false,"given":"Klaus","family":"Jung","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2024,10,25]]},"reference":[{"key":"9_CR1","unstructured":"Alibaba, T.: CVPR 2020 Aliproducts Challenge: Large-Scale Product Recognition (2020). https:\/\/tianchi.aliyun.com\/competition\/entrance\/231780\/information"},{"key":"9_CR2","unstructured":"Barbu, A., Mayo, D., Alverio, J., Luo, W., Wang, C., Gutfreund, D., Tenenbaum, J., Katz, B.: Objectnet: a large-scale bias-controlled dataset for pushing the limits of object recognition models. In: Wallach, H., Larochelle, H., Beygelzimer, A., d\u2019Alch\u00e9-Buc, F., Fox, E., Garnett, R. (eds.) Advances in Neural Information Processing Systems, vol.\u00a032. Curran Associates, Inc. (2019)"},{"key":"9_CR3","doi-asserted-by":"crossref","unstructured":"Changpinyo, S., Sharma, P., Ding, N., Soricut, R.: Conceptual 12M: pushing web-scale image-text pre-training to recognize long-tail visual concepts. In: CVPR (2021)","DOI":"10.1109\/CVPR46437.2021.00356"},{"key":"9_CR4","doi-asserted-by":"crossref","unstructured":"Deng, J., Guo, J., Xue, N., Zafeiriou, S.: Arcface: additive angular margin loss for deep face recognition. In: CVPR (2019)","DOI":"10.1109\/CVPR.2019.00482"},{"key":"9_CR5","unstructured":"Dosovitskiy, A., Beyer, L., Kolesnikov, A., Weissenborn, D., Zhai, X., Unterthiner, T., Dehghani, M., Minderer, M., Heigold, G., Gelly, S., Uszkoreit, J., Houlsby, N.: An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale. CoRR (2020)"},{"key":"9_CR6","unstructured":"Gadre, S.Y., Ilharco, G., Fang, A., Hayase, J., Smyrnis, G., Nguyen, T., Marten, R., Wortsman, M., Ghosh, D., Zhang, J., Orgad, E., Entezari, R., Daras, G., Pratt, S., Ramanujan, V., Bitton, Y., Marathe, K., Mussmann, S., Vencu, R., Cherti, M., Krishna, R., Koh, P.W., Saukh, O., Ratner, A., Song, S., Hajishirzi, H., Farhadi, A., Beaumont, R., Oh, S., Dimakis, A., Jitsev, J., Carmon, Y., Shankar, V., Schmidt, L.: Datacomp: In Search of the Next Generation of Multimodal Datasets (2023). https:\/\/arxiv.org\/abs\/2304.14108"},{"key":"9_CR7","doi-asserted-by":"publisher","unstructured":"Hendrycks, D., Zhao, K., Basart, S., Steinhardt, J., Song, D.: Natural Adversarial Examples (2019). https:\/\/doi.org\/10.48550\/ARXIV.1907.07174","DOI":"10.48550\/ARXIV.1907.07174"},{"key":"9_CR8","unstructured":"Horn, G.V., Aodha, O.M., Song, Y., Cui, Y., Sun, C., Shepard, A., Adam, H., Perona, P., Belongie, S.J.: The inaturalist species classification and detection dataset. In: CVPR (2018)"},{"key":"9_CR9","unstructured":"Jia, C., Yang, Y., Xia, Y., Chen, Y., Parekh, Z., Pham, H., Le, Q.V., Sung, Y., Li, Z., Duerig, T.: Scaling up visual and vision-language representation learning with noisy text supervision. CoRR abs\/2102.05918 (2021). https:\/\/arxiv.org\/abs\/2102.05918"},{"key":"9_CR10","unstructured":"Lin, T., Maire, M., Belongie, S.J., Bourdev, L.D., Girshick, R.B., Hays, J., Perona, P., Ramanan, D., Doll\u2019a r, P., Zitnick, C.L.: Microsoft COCO: Common Objects in Context. CoRR abs\/1405.0312 (2014). http:\/\/arxiv.org\/abs\/1405.0312"},{"key":"9_CR11","doi-asserted-by":"publisher","unstructured":"Lowe, D.G.: Distinctive image features from scale-invariant keypoints. Int. J. Comput. Vision 60(2), 91\u2013110 (2004). https:\/\/doi.org\/10.1023\/B:VISI.0000029664.99615.94","DOI":"10.1023\/B:VISI.0000029664.99615.94"},{"key":"9_CR12","unstructured":"Maji, S., Kannala, J., Rahtu, E., Blaschko, M., Vedaldi, A.: Fine-grained visual classification of aircraft. Tech. Rep. (2013)"},{"key":"9_CR13","doi-asserted-by":"publisher","unstructured":"Messina, N., Sedmidubsky, J., Falchi, F., Rebok, T.: Text-to-motion retrieval: towards joint understanding of human motion data and natural language. In: Proceedings of the 46th International ACM SIGIR Conference on Research and Development in Information Retrieval, pp. 2420\u20132425. SIGIR \u201923, Association for Computing Machinery, New York, NY, USA (2023). https:\/\/doi.org\/10.1145\/3539618.3592069","DOI":"10.1145\/3539618.3592069"},{"key":"9_CR14","unstructured":"van\u00a0den Oord, A., Li, Y., Vinyals, O.: Representation Learning with Contrastive Predictive Coding (2019). https:\/\/arxiv.org\/abs\/1807.03748"},{"key":"9_CR15","unstructured":"Oquab, M., Darcet, T., Moutakanni, T., Vo, H., Szafraniec, M., Khalidov, V., Fernandez, P., Haziza, D., Massa, F., El-Nouby, A., Assran, M., Ballas, N., Galuba, W., Howes, R., Huang, P.Y., Li, S.W., Misra, I., Rabbat, M., Sharma, V., Synnaeve, G., Xu, H., Jegou, H., Mairal, J., Labatut, P., Joulin, A., Bojanowski, P.: Dinov2: Learning Robust Visual Features Without Supervision (2024). https:\/\/arxiv.org\/abs\/2304.07193"},{"key":"9_CR16","doi-asserted-by":"crossref","unstructured":"Parkhi, O.M., Vedaldi, A., Zisserman, A.: Deep face recognition. In: British Machine Vision Conference (2015)","DOI":"10.5244\/C.29.41"},{"key":"9_CR17","doi-asserted-by":"crossref","unstructured":"Radenovic, F., Iscen, A., Tolias, G., Avrithis, Y., Chum, O.: Revisiting Oxford and Paris: large-scale image retrieval benchmarking. In: CVPR (2018)","DOI":"10.1109\/CVPR.2018.00598"},{"key":"9_CR18","doi-asserted-by":"crossref","unstructured":"Radenovic, F., Tolias, G., Chum, O.: Fine-tuning CNN image retrieval with no human annotation. IEEE Trans. Pattern Anal. Mach. Intell. (2019)","DOI":"10.1109\/TPAMI.2018.2846566"},{"key":"9_CR19","unstructured":"Radford, A., Kim, J.W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., Krueger, G., Sutskever, I.: Learning transferable visual models from natural language supervision. In: Meila, M., Zhang, T. (eds.) Proceedings of the 38th International Conference on Machine Learning, ICML 2021, 18\u201324 July 2021, Virtual Event. Proceedings of Machine Learning Research, vol.\u00a0139, pp. 8748\u20138763. PMLR (2021). http:\/\/proceedings.mlr.press\/v139\/radford21a.html"},{"key":"9_CR20","unstructured":"Ramesh, A., Pavlov, M., Goh, G., Gray, S., Voss, C., Radford, A., Chen, M., Sutskever, I.: Zero-Shot Text-to-Image Generation (2021)"},{"key":"9_CR21","doi-asserted-by":"crossref","unstructured":"Rombach, R., Blattmann, A., Lorenz, D., Esser, P., Ommer, B.: High-Resolution Image Synthesis with Latent Diffusion Models (2021)","DOI":"10.1109\/CVPR52688.2022.01042"},{"key":"9_CR22","doi-asserted-by":"crossref","unstructured":"Russakovsky, O., Deng, J., Su, H., Krause, J., Satheesh, S., Ma, S., Huang, Z., Karpathy, A., Khosla, A., Bernstein, M., Berg, A.C., Fei-Fei, L.: Imagenet large scale visual recognition challenge. Int. J. Comput. Vision (IJCV) (2015)","DOI":"10.1007\/s11263-015-0816-y"},{"key":"9_CR23","doi-asserted-by":"publisher","unstructured":"Schall, K., Barthel, K.U., Hezel, N., Jung, K.: Gpr1200: A benchmark for general-purpose content-based image retrieval. In: Multi-media Modeling: 28th International Conference, MMM 2022, Phu Quoc, Vietnam, June 6\u201310, 2022, Proceedings, Part I, pp. 205\u2013216. Springer-Verlag, Berlin, Heidelberg (2022). https:\/\/doi.org\/10.1007\/978-3-030-98358-1_17","DOI":"10.1007\/978-3-030-98358-1_17"},{"key":"9_CR24","doi-asserted-by":"publisher","unstructured":"Schall, K., Barthel, K.U., Hezel, N., Jung, K.: Improving Image Encoders for General-Purpose Nearest Neighbor Search and Classification, pp. 57\u201366. ICMR \u201923, Association for Computing Machinery, New York, NY, USA (2023). https:\/\/doi.org\/10.1145\/3591106.3592266","DOI":"10.1145\/3591106.3592266"},{"key":"9_CR25","doi-asserted-by":"publisher","unstructured":"Schuhmann, C., Beaumont, R., Vencu, R., Gordon, C., Wightman, R., Cherti, M., Coombes, T., Katta, A., Mullis, C., Wortsman, M., Schramowski, P., Kundurthy, S., Crowson, K., Schmidt, L., Kaczmarczyk, R., Jitsev, J.: Laion-5b: An Open Large-Scale Dataset for Training Next Generation Image-Text Models (2022). https:\/\/doi.org\/10.48550\/ARXIV.2210.08402","DOI":"10.48550\/ARXIV.2210.08402"},{"key":"9_CR26","doi-asserted-by":"crossref","unstructured":"Shao, S., Chen, K., Karpur, A., Cui, Q., Araujo, A., Cao, B.: Global Features Are All You Need for Image Retrieval and Reranking (2023)","DOI":"10.1109\/ICCV51070.2023.01013"},{"key":"9_CR27","unstructured":"Tolias, G., Sicre, R., J\u00e9gou, H.: Particular object retrieval with integral max-pooling of CNN activations. In: ICLR (Poster) (2016)"},{"key":"9_CR28","doi-asserted-by":"publisher","unstructured":"Vadicamo, L., Arnold, R., Bailer, W., Carrara, F., Gurrin, C., Hezel, N., Li, X., Lokoc, J., Lubos, S., Ma, Z., Messina, N., Nguyen, T.N., Peska, L., Rossetto, L., Sauter, L., Sch\u00f6ffmann, K., Spiess, F., Tran, M.T., Vrochidis, S.: Evaluating performance and trends in interactive video retrieval: insights from the 12th VBS competition. IEEE Access 12, 79342\u201379366 (2024). https:\/\/doi.org\/10.1109\/ACCESS.2024.3405638","DOI":"10.1109\/ACCESS.2024.3405638"},{"key":"9_CR29","unstructured":"Wah, C., Branson, S., Welinder, P., Perona, P., Belongie, S.: The Caltech-UCSD Birds-200-2011 dataset. Tech. Rep. CNS-TR-2011-001. California Institute of Technology (2011)"},{"key":"9_CR30","unstructured":"Wang, H., Ge, S., Lipton, Z., Xing, E.P.: Learning robust global representations by penalizing local predictive power. In: Advances in Neural Information Processing Systems, pp. 10506\u201310518 (2019)"},{"key":"9_CR31","doi-asserted-by":"crossref","unstructured":"Wang, S., Jiang, S.: Instre: A New Benchmark for Instance-Level Object Retrieval and Recognition. TOMM (2015)","DOI":"10.1145\/2700292"},{"key":"9_CR32","doi-asserted-by":"crossref","unstructured":"Weyand, T., Araujo, A., Cao, B., Sim, J.: Google landmarks dataset v2\u2014a large-scale benchmark for instance-level recognition and retrieval. In: CVPR (2020)","DOI":"10.1109\/CVPR42600.2020.00265"},{"key":"9_CR33","unstructured":"Wu, W., Timofeev, A., Chen, C., Zhang, B., Duan, K., Liu, S., Zheng, Y., Shlens, J., Du, X., Gan, Z., Yang, Y.: Mofi: Learning Image Representations from Noisy Entity Annotated Images (2024). https:\/\/arxiv.org\/abs\/2306.07952"},{"key":"9_CR34","doi-asserted-by":"crossref","unstructured":"Xie, C.W., Sun, S., Xiong, X., Zheng, Y., Zhao, D., Zhou, J.: Ra-clip: retrieval augmented contrastive language-image pre-training. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 19265\u201319274 (2023)","DOI":"10.1109\/CVPR52729.2023.01846"},{"key":"9_CR35","doi-asserted-by":"crossref","unstructured":"Yang, J., Li, C., Zhang, P., Xiao, B., Liu, C., Yuan, L., Gao, J.: Unified Contrastive Learning in Image-Text-Label Space (2022)","DOI":"10.1109\/CVPR52688.2022.01857"},{"key":"9_CR36","doi-asserted-by":"publisher","unstructured":"Young, P., Lai, A., Hodosh, M., Hockenmaier, J.: From image descriptions to visual denotations: new similarity metrics for semantic inference over event descriptions. Trans. Assoc. Comput. Linguist. 2, 67\u201378 (2014). https:\/\/doi.org\/10.1162\/tacl_a_00166","DOI":"10.1162\/tacl_a_00166"},{"key":"9_CR37","doi-asserted-by":"crossref","unstructured":"Ypsilantis, N.A., Chen, K., Cao, B., Lipovsk\u00fd, M., Dogan-Sch\u00f6nberger, P., Makosa, G., Bluntschli, B., Seyedhosseini, M., Chum, O., Araujo, A.: Towards universal image embeddings: a large-scale dataset and challenge for generic image representations. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision (ICCV), pp. 11290\u201311301 (2023)","DOI":"10.1109\/ICCV51070.2023.01037"},{"key":"9_CR38","unstructured":"Zhai, X., Kolesnikov, A., Houlsby, N., Beyer, L.: Scaling Vision Transformers. CoRR (2021). https:\/\/arxiv.org\/abs\/2106.04560"},{"key":"9_CR39","doi-asserted-by":"crossref","unstructured":"Zhai, X., Mustafa, B., Kolesnikov, A., Beyer, L.: Sigmoid Loss for Language Image Pre-training (2023)","DOI":"10.1109\/ICCV51070.2023.01100"},{"key":"9_CR40","doi-asserted-by":"crossref","unstructured":"Zhai, X., Wang, X., Mustafa, B., Steiner, A., Keysers, D., Kolesnikov, A., Beyer, L.: Lit: Zero-Shot Transfer with Locked-Image Text Tuning (2022). https:\/\/arxiv.org\/abs\/2111.07991","DOI":"10.1109\/CVPR52688.2022.01759"},{"key":"9_CR41","unstructured":"Zhang, H., Zhang, P., Hu, X., Chen, Y.C., Li, L.H., Dai, X., Wang, L., Yuan, L., Hwang, J.N., Gao, J.: Glipv2: Unifying Localization and Vision-Language Understanding. arXiv preprint arXiv:2206.05836 (2022)"}],"container-title":["Lecture Notes in Computer Science","Similarity Search and Applications"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-031-75823-2_9","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,4,23]],"date-time":"2025-04-23T17:05:48Z","timestamp":1745427948000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-3-031-75823-2_9"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,10,25]]},"ISBN":["9783031758225","9783031758232"],"references-count":41,"URL":"https:\/\/doi.org\/10.1007\/978-3-031-75823-2_9","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024,10,25]]},"assertion":[{"value":"25 October 2024","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"SISAP","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"International Conference on Similarity Search and Applications","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Providence, RI","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"USA","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2024","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"5 November 2024","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"7 November 2024","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"17","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"sisap2024","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/www.sisap.org\/2024\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}