{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,28]],"date-time":"2026-07-28T14:44:40Z","timestamp":1785249880509,"version":"3.55.0"},"publisher-location":"Cham","reference-count":68,"publisher":"Springer Nature Switzerland","isbn-type":[{"value":"9783031730290","type":"print"},{"value":"9783031730306","type":"electronic"}],"license":[{"start":{"date-parts":[[2024,11,24]],"date-time":"2024-11-24T00:00:00Z","timestamp":1732406400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2024,11,24]],"date-time":"2024-11-24T00:00:00Z","timestamp":1732406400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025]]},"DOI":"10.1007\/978-3-031-73030-6_18","type":"book-chapter","created":{"date-parts":[[2024,11,25]],"date-time":"2024-11-25T16:57:16Z","timestamp":1732553836000},"page":"320-337","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":34,"title":["CLIP-DINOiser: Teaching CLIP a\u00a0Few DINO Tricks for\u00a0Open-Vocabulary Semantic Segmentation"],"prefix":"10.1007","author":[{"ORCID":"https:\/\/orcid.org\/0000-0001-7785-2277","authenticated-orcid":false,"given":"Monika","family":"Wysocza\u0144ska","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3232-8978","authenticated-orcid":false,"given":"Oriane","family":"Sim\u00e9oni","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Micha\u00ebl","family":"Ramamonjisoa","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-2485-9402","authenticated-orcid":false,"given":"Andrei","family":"Bursuc","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-1486-8906","authenticated-orcid":false,"given":"Tomasz","family":"Trzci\u0144ski","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-8124-1206","authenticated-orcid":false,"given":"Patrick","family":"P\u00e9rez","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2024,11,24]]},"reference":[{"key":"18_CR1","doi-asserted-by":"crossref","unstructured":"Abdelreheem, A., Skorokhodov, I., Ovsjanikov, M., Wonka, P.: Satr: zero-shot semantic segmentation of 3d shapes. In: ICCV (2023)","DOI":"10.1109\/ICCV51070.2023.01392"},{"key":"18_CR2","unstructured":"Bucher, M., Vu, T.H., Cord, M., P\u00e9rez, P.: Zero-shot semantic segmentation. In: NeurIPS (2019)"},{"key":"18_CR3","doi-asserted-by":"crossref","unstructured":"Caesar, H., Uijlings, J., Ferrari, V.: Coco-stuff: thing and stuff classes in context. In: CVPR (2018)","DOI":"10.1109\/CVPR.2018.00132"},{"key":"18_CR4","unstructured":"Caron, M., Misra, I., Mairal, J., Goyal, P., Bojanowski, P., Joulin, A.: Unsupervised learning of visual features by contrasting cluster assignments. In: NeurIPS (2020)"},{"key":"18_CR5","doi-asserted-by":"crossref","unstructured":"Caron, M., Touvron, H., Misra, I., J\u00e9gou, H., Mairal, J., Bojanowski, P., Joulin, A.: Emerging properties in self-supervised vision transformers. In: ICCV (2021)","DOI":"10.1109\/ICCV48922.2021.00951"},{"key":"18_CR6","doi-asserted-by":"crossref","unstructured":"Cha, J., Mun, J., Roh, B.: Learning to generate text-grounded mask for open-world semantic segmentation from only image-text pairs. In: CVPR (2023)","DOI":"10.1109\/CVPR52729.2023.01074"},{"key":"18_CR7","doi-asserted-by":"crossref","unstructured":"Chen, J., et al.: Exploring open-vocabulary semantic segmentation from clip vision encoder distillation only. In: ICCV (2023)","DOI":"10.1109\/ICCV51070.2023.00071"},{"key":"18_CR8","doi-asserted-by":"crossref","unstructured":"Chen, R., et al.: Clip2scene: towards label-efficient 3d scene understanding by clip. In: CVPR (2023)","DOI":"10.1109\/CVPR52729.2023.00678"},{"key":"18_CR9","unstructured":"Chen, X., Fan, H., Girshick, R., He, K.: Improved baselines with momentum contrastive learning. arXiv preprint arXiv:2003.04297 (2020)"},{"key":"18_CR10","unstructured":"Contributors, M.: MMSegmentation: openmmlab semantic segmentation toolbox and benchmark (2020)"},{"key":"18_CR11","doi-asserted-by":"crossref","unstructured":"Cordts, M., et al.: The cityscapes dataset for semantic urban scene understanding. In: CVPR (2016)","DOI":"10.1109\/CVPR.2016.350"},{"key":"18_CR12","unstructured":"Darcet, T., Oquab, M., Mairal, J., Bojanowski, P.: Vision transformers need registers. arXiv preprint arXiv:2309.16588 (2023)"},{"key":"18_CR13","doi-asserted-by":"crossref","unstructured":"Deng, J., Dong, W., Socher, R., Li, L.J., Li, K., Fei-Fei, L.: Imagenet: a large-scale hierarchical image database. In: CVPR (2009)","DOI":"10.1109\/CVPR.2009.5206848"},{"key":"18_CR14","doi-asserted-by":"crossref","unstructured":"Ding, J., Xue, N., Xia, G.S., Dai, D.: Decoupling zero-shot semantic segmentation. In: CVPR (2022)","DOI":"10.1109\/CVPR52688.2022.01129"},{"key":"18_CR15","unstructured":"Dosovitskiy, A., et\u00a0al.: An image is worth 16$$\\times $$16 words: transformers for image recognition at scale. In: ICLR (2021)"},{"key":"18_CR16","unstructured":"Everingham, M., Van\u00a0Gool, L., Williams, C.K.I., Winn, J., Zisserman, A.: The PASCAL Visual Object Classes Challenge 2012 (VOC2012) Results (2012)"},{"key":"18_CR17","unstructured":"Fang, A., Ilharco, G., Wortsman, M., Wan, Y., Shankar, V., Dave, A., Schmidt, L.: Data determines distributional robustness in contrastive language image pre-training (CLIP). In: ICML (2022)"},{"key":"18_CR18","doi-asserted-by":"crossref","unstructured":"Ghiasi, G., Gu, X., Cui, Y., Lin, T.Y.: Scaling open-vocabulary image segmentation with image-level labels. In: ECCV (2022)","DOI":"10.1007\/978-3-031-20059-5_31"},{"key":"18_CR19","doi-asserted-by":"crossref","unstructured":"Girdhar, R., et al.: Imagebind: one embedding space to bind them all. In: CVPR (2023)","DOI":"10.1109\/CVPR52729.2023.01457"},{"key":"18_CR20","doi-asserted-by":"crossref","unstructured":"Gu, Z., Zhou, S., Niu, L., Zhao, Z., Zhang, L.: Context-aware feature generation for zero-shot semantic segmentation. In: ACM MM (2020)","DOI":"10.1145\/3394171.3413593"},{"key":"18_CR21","unstructured":"Hu, P., Sclaroff, S., Saenko, K.: Uncertainty-aware learning for zero-shot semantic segmentation. In: NeurIPS (2020)"},{"key":"18_CR22","doi-asserted-by":"publisher","unstructured":"Ilharco, G., et al.: Openclip (2021). https:\/\/doi.org\/10.5281\/zenodo.5143773","DOI":"10.5281\/zenodo.5143773"},{"key":"18_CR23","doi-asserted-by":"crossref","unstructured":"Jatavallabhula, K.M., et\u00a0al.: Conceptfusion: open-set multimodal 3d mapping. In: RSS (2023)","DOI":"10.15607\/RSS.2023.XIX.066"},{"key":"18_CR24","unstructured":"Jia, C., et al.: Scaling up visual and vision-language representation learning with noisy text supervision. In: ICML (2021)"},{"key":"18_CR25","doi-asserted-by":"crossref","unstructured":"Karazija, L., Laina, I., Vedaldi, A., Rupprecht, C.: Diffusion models for zero-shot open-vocabulary segmentation. arXiv preprint arXiv:2306.09316 (2023)","DOI":"10.1007\/978-3-031-72652-1_18"},{"key":"18_CR26","doi-asserted-by":"crossref","unstructured":"Kato, N., Yamasaki, T., Aizawa, K.: Zero-shot semantic segmentation via variational mapping. In: ICCVW (2019)","DOI":"10.1109\/ICCVW.2019.00172"},{"key":"18_CR27","doi-asserted-by":"crossref","unstructured":"Kerr, J., Kim, C.M., Goldberg, K., Kanazawa, A., Tancik, M.: Lerf: language embedded radiance fields. In: ICCV (2023)","DOI":"10.1109\/ICCV51070.2023.01807"},{"key":"18_CR28","unstructured":"Kingma, D.P., Ba, J.: Adam: a method for stochastic optimization. In: ICLR (2015)"},{"key":"18_CR29","unstructured":"Li, B., Weinberger, K.Q., Belongie, S., Koltun, V., Ranftl, R.: Language-driven semantic segmentation. In: ICLR (2022)"},{"key":"18_CR30","unstructured":"Li, P., Wei, Y., Yang, Y.: Consistent structural relation learning for zero-shot segmentation. In: NeurIPS (2020)"},{"key":"18_CR31","doi-asserted-by":"crossref","unstructured":"Liang, F., et al.: Open-vocabulary semantic segmentation with mask-adapted clip. In: CVPR (2023)","DOI":"10.1109\/CVPR52729.2023.00682"},{"key":"18_CR32","doi-asserted-by":"crossref","unstructured":"Liu, Q., Wen, Y., Han, J., Xu, C., Xu, H., Liang, X.: Open-world semantic segmentation via contrasting and clustering vision-language embedding. In: ECCV (2022)","DOI":"10.1007\/978-3-031-20044-1_16"},{"key":"18_CR33","unstructured":"Luo, H., Bao, J., Wu, Y., He, X., Li, T.: SegCLIP: patch aggregation with learnable centers for open-vocabulary semantic segmentation. In: ICML (2023)"},{"key":"18_CR34","unstructured":"Mayilvahanan, P., Wiedemer, T., Rusak, E., Bethge, M., Brendel, W.: Does CLIP\u2019s generalization performance mainly stem from high train-test similarity? arXiv preprint arXiv:2310.09562 (2023)"},{"key":"18_CR35","unstructured":"Mikolov, T., Chen, K., Corrado, G., Dean, J.: Efficient estimation of word representations in vector space. In: ICLR (2013)"},{"key":"18_CR36","doi-asserted-by":"crossref","unstructured":"Mottaghi, R., et al.: The role of context for object detection and semantic segmentation in the wild. In: CVPR (2014)","DOI":"10.1109\/CVPR.2014.119"},{"key":"18_CR37","doi-asserted-by":"crossref","unstructured":"Mukhoti, J., et al.: Open vocabulary semantic segmentation with patch aligned contrastive learning. In: CVPR (2023)","DOI":"10.1109\/CVPR52729.2023.01860"},{"key":"18_CR38","doi-asserted-by":"crossref","unstructured":"Najibi, M., et al.: Unsupervised 3d perception with 2d vision-language distillation for autonomous driving. In: ICCV (2023)","DOI":"10.1109\/ICCV51070.2023.00790"},{"key":"18_CR39","unstructured":"Oquab, M., et al.: DINOv2: learning robust visual features without supervision. TMLR (2024)"},{"key":"18_CR40","doi-asserted-by":"crossref","unstructured":"Pastore, G., Cermelli, F., Xian, Y., Mancini, M., Akata, Z., Caputo, B.: A closer look at self-training for zero-label semantic segmentation. In: CVPR (2021)","DOI":"10.1109\/CVPRW53098.2021.00303"},{"key":"18_CR41","doi-asserted-by":"crossref","unstructured":"Peng, S., Genova, K., Jiang, C., Tagliasacchi, A., Pollefeys, M., Funkhouser, T., et\u00a0al.: Openscene: 3d scene understanding with open vocabularies. In: CVPR (2023)","DOI":"10.1109\/CVPR52729.2023.00085"},{"key":"18_CR42","doi-asserted-by":"crossref","unstructured":"Pennington, J., Socher, R., Manning, C.D.: Glove: global vectors for word representation. In: EMNLP (2014)","DOI":"10.3115\/v1\/D14-1162"},{"key":"18_CR43","unstructured":"Radford, A., et\u00a0al.: Learning transferable visual models from natural language supervision. In: ICML (2021)"},{"key":"18_CR44","doi-asserted-by":"crossref","unstructured":"Ranasinghe, K., McKinzie, B., Ravi, S., Yang, Y., Toshev, A., Shlens, J.: Perceptual grouping in contrastive vision-language models. In: ICCV (2023)","DOI":"10.1109\/ICCV51070.2023.00513"},{"key":"18_CR45","doi-asserted-by":"crossref","unstructured":"Rao, Y., et al.: Denseclip: language-guided dense prediction with context-aware prompting. In: CVPR (2022)","DOI":"10.1109\/CVPR52688.2022.01755"},{"key":"18_CR46","unstructured":"Ren, P., et al.: Viewco: discovering text-supervised segmentation masks via multi-view semantic consistency. In: ICLR (2023)"},{"key":"18_CR47","doi-asserted-by":"crossref","unstructured":"Rewatbowornwong, P., Chatthee, N., Chuangsuwanich, E., Suwajanakorn, S.: Zero-guidance segmentation using zero segment labels. In: ICCV (2023)","DOI":"10.1109\/ICCV51070.2023.00113"},{"key":"18_CR48","doi-asserted-by":"crossref","unstructured":"Rombach, R., Blattmann, A., Lorenz, D., Esser, P., Ommer, B.: High-resolution image synthesis with latent diffusion models. In: CVPR (2022)","DOI":"10.1109\/CVPR52688.2022.01042"},{"key":"18_CR49","unstructured":"Shin, G., Xie, W., Albanie, S.: Reco: retrieve and co-segment for zero-shot transfer. In: NeurIPS (2022)"},{"key":"18_CR50","doi-asserted-by":"crossref","unstructured":"Shin, G., Xie, W., Albanie, S.: Namedmask: Distilling segmenters from complementary foundation models. In: CVPRW (2023)","DOI":"10.1109\/CVPRW59228.2023.00524"},{"key":"18_CR51","unstructured":"Sim\u00e9oni, O., et al.: Localizing objects with self-supervised transformers and no labels. In: BMVC (2021)"},{"key":"18_CR52","doi-asserted-by":"crossref","unstructured":"Sim\u00e9oni, O., Sekkat, C., Puy, G., Vobeck\u1ef3, A., Zablocki, \u00c9., P\u00e9rez, P.: Unsupervised object localization: observing the background to discover objects. In: CVPR (2023)","DOI":"10.1109\/CVPR52729.2023.00310"},{"key":"18_CR53","doi-asserted-by":"crossref","unstructured":"Sim\u00e9oni, O., Zablocki, \u00c9., Gidaris, S., Puy, G., P\u00e9rez, P.: Unsupervised object localization in the era of self-supervised vits: a survey. arXiv preprint arXiv:2310.12904 (2023)","DOI":"10.1007\/s11263-024-02167-8"},{"key":"18_CR54","unstructured":"Vobeck\u1ef3, A., et al.: Pop-3d: open-vocabulary 3d occupancy prediction from images. In: NeurIPS (2023)"},{"key":"18_CR55","doi-asserted-by":"crossref","unstructured":"Walmer, M., Suri, S., Gupta, K., Shrivastava, A.: Teaching matters: investigating the role of supervision in vision transformers. In: CVPR (2023)","DOI":"10.1109\/CVPR52729.2023.00723"},{"key":"18_CR56","doi-asserted-by":"crossref","unstructured":"Wang, X., Girdhar, R., Yu, S.X., Misra, I.: Cut and learn for unsupervised object detection and instance segmentation. In: CVPR (2023)","DOI":"10.1109\/CVPR52729.2023.00305"},{"key":"18_CR57","doi-asserted-by":"crossref","unstructured":"Wang, Y., Shen, X., Hu, S.X., Yuan, Y., Crowley, J.L., Vaufreydaz, D.: Self-supervised transformers for unsupervised object discovery using normalized cut. In: CVPR (2022)","DOI":"10.1109\/CVPR52688.2022.01414"},{"key":"18_CR58","doi-asserted-by":"crossref","unstructured":"Wu, J., Li, X., Xu, S., Yuan, H., Ding, H., Yang, Y., Li, X., Zhang, J., Tong, Y., Jiang, X., et\u00a0al.: Towards open vocabulary learning: A survey. T-PAMI (2024)","DOI":"10.1109\/TPAMI.2024.3361862"},{"key":"18_CR59","doi-asserted-by":"crossref","unstructured":"Wysoczanska, M., Ramamonjisoa, M., Trzcinski, T., Simeoni, O.: Clip-diy: clip dense inference yields open-vocabulary semantic segmentation for-free. In: WACV (2024)","DOI":"10.1109\/WACV57701.2024.00143"},{"key":"18_CR60","doi-asserted-by":"crossref","unstructured":"Xian, Y., Choudhury, S., He, Y., Schiele, B., Akata, Z.: Semantic projection network for zero-and few-label semantic segmentation. In: CVPR (2019)","DOI":"10.1109\/CVPR.2019.00845"},{"key":"18_CR61","doi-asserted-by":"crossref","unstructured":"Xu, J., et al.: Groupvit: semantic segmentation emerges from text supervision. arXiv preprint arXiv:2202.11094 (2022)","DOI":"10.1109\/CVPR52688.2022.01760"},{"key":"18_CR62","doi-asserted-by":"crossref","unstructured":"Xu, J., et al.: Learning open-vocabulary semantic segmentation models from natural language supervision. In: CVPR (2023)","DOI":"10.1109\/CVPR52729.2023.00287"},{"key":"18_CR63","doi-asserted-by":"crossref","unstructured":"Zhai, X., Mustafa, B., Kolesnikov, A., Beyer, L.: Sigmoid loss for language image pre-training. In: ICCV (2023)","DOI":"10.1109\/ICCV51070.2023.01100"},{"key":"18_CR64","doi-asserted-by":"crossref","unstructured":"Zhao, H., Puig, X., Zhou, B., Fidler, S., Torralba, A.: Open vocabulary scene parsing. In: ICCV (2017)","DOI":"10.1109\/ICCV.2017.221"},{"key":"18_CR65","doi-asserted-by":"crossref","unstructured":"Zhong, Y., et\u00a0al.: Regionclip: region-based language-image pretraining. In: CVPR (2022)","DOI":"10.1109\/CVPR52688.2022.01629"},{"key":"18_CR66","doi-asserted-by":"publisher","first-page":"302","DOI":"10.1007\/s11263-018-1140-0","volume":"127","author":"B Zhou","year":"2019","unstructured":"Zhou, B., et al.: Semantic understanding of scenes through the ade20k dataset. IJCV 127, 302\u2013321 (2019)","journal-title":"IJCV"},{"key":"18_CR67","doi-asserted-by":"crossref","unstructured":"Zhou, C., Loy, C.C., Dai, B.: Extract free dense labels from clip. In: ECCV (2022)","DOI":"10.1007\/978-3-031-19815-1_40"},{"key":"18_CR68","unstructured":"Zhou, J., et alT.: iBOT: image bert pre-training with online tokenizer. In: ICLR (2022)"}],"container-title":["Lecture Notes in Computer Science","Computer Vision \u2013 ECCV 2024"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-031-73030-6_18","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,11,25]],"date-time":"2024-11-25T17:16:00Z","timestamp":1732554960000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-3-031-73030-6_18"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,11,24]]},"ISBN":["9783031730290","9783031730306"],"references-count":68,"URL":"https:\/\/doi.org\/10.1007\/978-3-031-73030-6_18","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024,11,24]]},"assertion":[{"value":"24 November 2024","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"ECCV","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"European Conference on Computer Vision","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Milan","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Italy","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2024","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"29 September 2024","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"4 October 2024","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"18","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"eccv2024","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/eccv2024.ecva.net\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}