{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,16]],"date-time":"2026-07-16T17:04:39Z","timestamp":1784221479786,"version":"3.55.0"},"publisher-location":"Cham","reference-count":26,"publisher":"Springer Nature Switzerland","isbn-type":[{"value":"9783031936937","type":"print"},{"value":"9783031936944","type":"electronic"}],"license":[{"start":{"date-parts":[[2025,7,29]],"date-time":"2025-07-29T00:00:00Z","timestamp":1753747200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2025,7,29]],"date-time":"2025-07-29T00:00:00Z","timestamp":1753747200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2026]]},"DOI":"10.1007\/978-3-031-93694-4_24","type":"book-chapter","created":{"date-parts":[[2025,7,28]],"date-time":"2025-07-28T06:53:48Z","timestamp":1753685628000},"page":"338-352","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["UBI-DET: Towards a\u00a0Unified Framework for\u00a0Open-Set Fine-Grained Object Detection"],"prefix":"10.1007","author":[{"given":"Amit","family":"Raj","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Ronak","family":"Shah","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Kapil","family":"Mehrotra","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Swati","family":"Mehta","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2025,7,29]]},"reference":[{"key":"24_CR1","unstructured":"Awais, M., et al.: Foundational models defining a new era in vision: A survey and outlook (2023)"},{"key":"24_CR2","doi-asserted-by":"crossref","unstructured":"Bansal, A., Sikka, K., Chellappa, R., Divakaran, A.: Zero-shot object detection, Gaurav Sharma (2018)","DOI":"10.1007\/978-3-030-01246-5_24"},{"key":"24_CR3","doi-asserted-by":"crossref","unstructured":"Bianchi, L., Carrara, F., Messina, N., Gennaro, C., Falchi, F.: The devil is in the fine-grained details: evaluating open-vocabulary object detectors for fine-grained understanding (2023)","DOI":"10.1109\/CVPR52733.2024.02125"},{"key":"24_CR4","doi-asserted-by":"crossref","unstructured":"Carion, N., Massa, F., Synnaeve, G., Kirillov, A., Zagoruyko, S.: End-to-end object detection with transformers, Nicolas Usunier (2020)","DOI":"10.1007\/978-3-030-58452-8_13"},{"key":"24_CR5","doi-asserted-by":"crossref","unstructured":"Elhoseiny, M., Zhu, Y., Zhang, H., Elgammal, A.: Link the head to the\" beak\": Zero shot learning from noisy text description at part precision. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 5640\u20135649 (2017)","DOI":"10.1109\/CVPR.2017.666"},{"key":"24_CR6","doi-asserted-by":"crossref","unstructured":"Garg, A., Bagga, S., Singh, Y., Anand, S.: Leveraging label hierarchies for improving semi-supervised learning, Hiermatch (2021)","DOI":"10.1109\/WACV51458.2022.00212"},{"key":"24_CR7","doi-asserted-by":"crossref","unstructured":"Ghiasi, G., Gu, X., Cui, Y., Lin, T.-Y.: Scaling open-vocabulary image segmentation with image-level labels (2022)","DOI":"10.1007\/978-3-031-20059-5_31"},{"key":"24_CR8","doi-asserted-by":"crossref","unstructured":"Ghiasi, G., Zoph, B., Cubuk, E.D., Le, Q.V., Lin, T.-Y.: Multi-task self-training for learning general representations (2021)","DOI":"10.1109\/ICCV48922.2021.00873"},{"key":"24_CR9","doi-asserted-by":"crossref","unstructured":"He, S., Guo, T., Dai, T., Qiao, R., Ren, B., Xia, S.-T.: Open-vocabulary multi-label classification via multi-modal knowledge transfer (2023)","DOI":"10.1609\/aaai.v37i1.25159"},{"key":"24_CR10","unstructured":"Huang, X., et al.: Open-set image tagging with multi-grained text supervision (2023)"},{"key":"24_CR11","unstructured":"Huang, X., et al.: Tag2text: Guiding vision-language model via image tagging (2023)"},{"key":"24_CR12","doi-asserted-by":"crossref","unstructured":"Liu, S., et al.: Marrying dino with grounded pre-training for open-set object detection, Grounding dino (2023)","DOI":"10.1007\/978-3-031-72970-6_3"},{"key":"24_CR13","doi-asserted-by":"crossref","unstructured":"Liu, Z., et al.: Swin transformer: hierarchical vision transformer using shifted windows. In: 2021 IEEE\/CVF International Conference on Computer Vision (ICCV), pp. 9992\u201310002, Los Alamitos, CA, USA. IEEE Computer Society (Oct 2021)","DOI":"10.1109\/ICCV48922.2021.00986"},{"key":"24_CR14","unstructured":"Maji, S., Rahtu, E., Kannala, J., Blaschko, M., Vedaldi, A.: Fine-grained visual classification of aircraft (2013)"},{"key":"24_CR15","doi-asserted-by":"crossref","unstructured":"Minderer, M., et al.: Simple open-vocabulary object detection with vision transformers (2022)","DOI":"10.1007\/978-3-031-20080-9_42"},{"key":"24_CR16","unstructured":"Radford, A., et al.: Learning transferable visual models from natural language supervision. CoRR, abs\/ arXiv: 2103.00020 (2021)"},{"key":"24_CR17","unstructured":"Saranrittichai, P., Munoz, M., Fischer, V., Mummadi, C.K.: Zero-shot visual classification with guided cropping (2023)"},{"key":"24_CR18","doi-asserted-by":"crossref","unstructured":"Singh, B., Li, H., Sharma, A., Davis, L.S.: R-fcn-3000 at 30fps: decoupling detection and classification (2017)","DOI":"10.1109\/CVPR.2018.00119"},{"key":"24_CR19","doi-asserted-by":"crossref","unstructured":"Sun, X., Ping, H., Saenko, K.: Fast adaptation to multi-label recognition with limited annotations, Dualcoop (2022)","DOI":"10.52202\/068431-2216"},{"key":"24_CR20","doi-asserted-by":"crossref","unstructured":"Van\u00a0Horn, G., et al.: Building a bird recognition app and large scale dataset with citizen scientists: The fine print in fine-grained dataset collection. In: 2015 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pp. 595\u2013604 (2015)","DOI":"10.1109\/CVPR.2015.7298658"},{"key":"24_CR21","doi-asserted-by":"crossref","unstructured":"Xu, J., Liu, S., Vahdat, A., Byeon, W., Wang, X., De Mello, S.: Open-vocabulary panoptic segmentation with text-to-image diffusion models (2023)","DOI":"10.1109\/CVPR52729.2023.00289"},{"key":"24_CR22","unstructured":"Jiarui, X., De Mello, S., Liu, S., Byeon, W., Breuel, T., Kautz, J., Wang, X.: Semantic segmentation emerges from text supervision, Groupvit (2022)"},{"key":"24_CR23","unstructured":"Zhang, H., Li, F., Liu, S., Zhang, L., Hang, S., Zhu, J., Ni, L.M., Shum, H.-Y.: Detr with improved denoising anchor boxes for end-to-end object detection, Dino (2022)"},{"key":"24_CR24","doi-asserted-by":"crossref","unstructured":"Zhang, Y., et al.: A strong image tagging model, Recognize anything (2023)","DOI":"10.1109\/CVPRW63382.2024.00179"},{"key":"24_CR25","doi-asserted-by":"crossref","unstructured":"Zhong, Y., et al.: Region-based language-image pretraining, Regionclip (2021)","DOI":"10.1109\/CVPR52688.2022.01629"},{"key":"24_CR26","doi-asserted-by":"crossref","unstructured":"Zhou, X., Girdhar, R., Kr\u00e4henb\u00fchl, P., Misra, I.: Detecting twenty-thousand classes using image-level supervision, Armand Joulin (2022)","DOI":"10.1007\/978-3-031-20077-9_21"}],"container-title":["Communications in Computer and Information Science","Computer Vision and Image Processing"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-031-93694-4_24","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,7,16]],"date-time":"2026-07-16T16:18:20Z","timestamp":1784218700000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-3-031-93694-4_24"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,7,29]]},"ISBN":["9783031936937","9783031936944"],"references-count":26,"URL":"https:\/\/doi.org\/10.1007\/978-3-031-93694-4_24","relation":{},"ISSN":["1865-0929","1865-0937"],"issn-type":[{"value":"1865-0929","type":"print"},{"value":"1865-0937","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,7,29]]},"assertion":[{"value":"29 July 2025","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"CVIP","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"International Conference on Computer Vision and Image Processing","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Chennai","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"India","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2024","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"20 December 2024","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"22 December 2024","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"9","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"cvip2024","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/cvip2024.iiitdm.ac.in\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}