{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,8,17]],"date-time":"2026-08-17T15:02:04Z","timestamp":1786978924566,"version":"build-2736575974"},"publisher-location":"Cham","reference-count":50,"publisher":"Springer Nature Switzerland","isbn-type":[{"value":"9783031728969","type":"print"},{"value":"9783031728976","type":"electronic"}],"license":[{"start":{"date-parts":[[2024,12,2]],"date-time":"2024-12-02T00:00:00Z","timestamp":1733097600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2024,12,2]],"date-time":"2024-12-02T00:00:00Z","timestamp":1733097600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025]]},"DOI":"10.1007\/978-3-031-72897-6_13","type":"book-chapter","created":{"date-parts":[[2024,12,1]],"date-time":"2024-12-01T18:16:52Z","timestamp":1733077012000},"page":"225-241","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":15,"title":["Unified Embedding Alignment for\u00a0Open-Vocabulary Video Instance Segmentation"],"prefix":"10.1007","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-8846-8294","authenticated-orcid":false,"given":"Hao","family":"Fang","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-1137-0720","authenticated-orcid":false,"given":"Peng","family":"Wu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-8948-7892","authenticated-orcid":false,"given":"Yawei","family":"Li","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-6069-5391","authenticated-orcid":false,"given":"Xinxin","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-9543-6960","authenticated-orcid":false,"given":"Xiankai","family":"Lu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2024,12,2]]},"reference":[{"key":"13_CR1","doi-asserted-by":"crossref","unstructured":"Bewley, A., Ge, Z., Ott, L., Ramos, F., Upcroft, B.: Simple online and realtime tracking. In: ICIP, pp. 3464\u20133468. IEEE (2016)","DOI":"10.1109\/ICIP.2016.7533003"},{"key":"13_CR2","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1007\/978-3-030-58568-6_1","volume-title":"Computer Vision \u2013 ECCV 2020","author":"J Cao","year":"2020","unstructured":"Cao, J., Anwer, R.M., Cholakkal, H., Khan, F.S., Pang, Y., Shao, L.: SipMask: spatial information preservation for fast image and video instance segmentation. In: Vedaldi, A., Bischof, H., Brox, T., Frahm, J.-M. (eds.) ECCV 2020. LNCS, vol. 12359, pp. 1\u201318. Springer, Cham (2020). https:\/\/doi.org\/10.1007\/978-3-030-58568-6_1"},{"key":"13_CR3","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"213","DOI":"10.1007\/978-3-030-58452-8_13","volume-title":"Computer Vision \u2013 ECCV 2020","author":"N Carion","year":"2020","unstructured":"Carion, N., Massa, F., Synnaeve, G., Usunier, N., Kirillov, A., Zagoruyko, S.: End-to-end object detection with transformers. In: Vedaldi, A., Bischof, H., Brox, T., Frahm, J.-M. (eds.) ECCV 2020. LNCS, vol. 12346, pp. 213\u2013229. Springer, Cham (2020). https:\/\/doi.org\/10.1007\/978-3-030-58452-8_13"},{"key":"13_CR4","doi-asserted-by":"crossref","unstructured":"Chen, X., Li, S., Lim, S.N., Torralba, A., Zhao, H.: Open-vocabulary panoptic segmentation with embedding modulation. In: ICCV, pp. 1141\u20131150 (2023)","DOI":"10.1109\/ICCV51070.2023.00111"},{"key":"13_CR5","unstructured":"Cheng, B., Choudhuri, A., Misra, I., Kirillov, A., Girdhar, R., Schwing, A.G.: Mask2former for video instance segmentation. arXiv preprint arXiv:2112.10764 (2021)"},{"key":"13_CR6","doi-asserted-by":"crossref","unstructured":"Cheng, B., Misra, I., Schwing, A.G., Kirillov, A., Girdhar, R.: Masked-attention mask transformer for universal image segmentation. In: CVPR, pp. 1290\u20131299 (2022)","DOI":"10.1109\/CVPR52688.2022.00135"},{"key":"13_CR7","series-title":"LNCS","doi-asserted-by":"publisher","first-page":"640","DOI":"10.1007\/978-3-031-19815-1_37","volume-title":"ECCV 2022","author":"HK Cheng","year":"2022","unstructured":"Cheng, H.K., Schwing, A.G.: XMem: long-term video object segmentation with an Atkinson-Shiffrin memory model. In: Avidan, S., Brostow, G., Ciss\u00e9, M., Farinella, G.M., Hassner, T. (eds.) ECCV 2022. LNCS, vol. 13688, pp. 640\u2013658. Springer, Cham (2022). https:\/\/doi.org\/10.1007\/978-3-031-19815-1_37"},{"key":"13_CR8","doi-asserted-by":"crossref","unstructured":"Ding, J., Xue, N., Xia, G.S., Dai, D.: Decoupling zero-shot semantic segmentation. In: CVPR, pp. 11583\u201311592 (2022)","DOI":"10.1109\/CVPR52688.2022.01129"},{"key":"13_CR9","doi-asserted-by":"crossref","unstructured":"Du, Y., Wei, F., Zhang, Z., Shi, M., Gao, Y., Li, G.: Learning to prompt for open-vocabulary object detection with vision-language model. In: CVPR, pp. 14084\u201314093 (2022)","DOI":"10.1109\/CVPR52688.2022.01369"},{"key":"13_CR10","doi-asserted-by":"crossref","unstructured":"Fang, H., Zhang, T., Zhou, X., Zhang, X.: Learning better video query with SAM for video instance segmentation. TCSVT 1\u201312 (2024)","DOI":"10.1109\/TCSVT.2024.3361076"},{"key":"13_CR11","unstructured":"Gu, X., Lin, T.Y., Kuo, W., Cui, Y.: Open-vocabulary object detection via vision and language knowledge distillation. In: ICLR, pp. 1\u201314 (2021)"},{"key":"13_CR12","unstructured":"Guo, P., et al.: Openvis: open-vocabulary video instance segmentation. arXiv preprint arXiv:2305.16835 (2023)"},{"key":"13_CR13","doi-asserted-by":"crossref","unstructured":"Gupta, A., Dollar, P., Girshick, R.: LVIS: a dataset for large vocabulary instance segmentation. In: CVPR, pp. 5356\u20135364 (2019)","DOI":"10.1109\/CVPR.2019.00550"},{"key":"13_CR14","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., Sun, J.: Deep residual learning for image recognition. In: CVPR, pp. 770\u2013778 (2016)","DOI":"10.1109\/CVPR.2016.90"},{"key":"13_CR15","first-page":"23109","volume":"35","author":"M Heo","year":"2022","unstructured":"Heo, M., Hwang, S., Oh, S.W., Lee, J.Y., Kim, S.J.: Vita: video instance segmentation via object token association. NeurIPS 35, 23109\u201323120 (2022)","journal-title":"NeurIPS"},{"key":"13_CR16","first-page":"31265","volume":"35","author":"DA Huang","year":"2022","unstructured":"Huang, D.A., Yu, Z., Anandkumar, A.: Minvis: a minimal video instance segmentation framework without video-based training. NeurIPS 35, 31265\u201331277 (2022)","journal-title":"NeurIPS"},{"key":"13_CR17","first-page":"13352","volume":"34","author":"S Hwang","year":"2021","unstructured":"Hwang, S., Heo, M., Oh, S.W., Kim, S.J.: Video instance segmentation using inter-frame communication transformers. NeurIPS 34, 13352\u201313363 (2021)","journal-title":"NeurIPS"},{"key":"13_CR18","unstructured":"Jia, C., et al.: Scaling up visual and vision-language representation learning with noisy text supervision. In: ICML, pp. 4904\u20134916. PMLR (2021)"},{"issue":"1\u20132","key":"13_CR19","doi-asserted-by":"publisher","first-page":"83","DOI":"10.1002\/nav.3800020109","volume":"2","author":"HW Kuhn","year":"1955","unstructured":"Kuhn, H.W.: The Hungarian method for the assignment problem. Naval Res. Logist. Q. 2(1\u20132), 83\u201397 (1955)","journal-title":"Naval Res. Logist. Q."},{"key":"13_CR20","doi-asserted-by":"crossref","unstructured":"Li, J., Yu, B., Rao, Y., Zhou, J., Lu, J.: Tcovis: temporally consistent online video instance segmentation. In: ICCV, pp. 1097\u20131107 (2023)","DOI":"10.1109\/ICCV51070.2023.00107"},{"key":"13_CR21","doi-asserted-by":"crossref","unstructured":"Li, S., Fischer, T., Ke, L., Ding, H., Danelljan, M., Yu, F.: Ovtrack: open-vocabulary multiple object tracking. In: CVPR, pp. 5567\u20135577 (2023)","DOI":"10.1109\/CVPR52729.2023.00539"},{"key":"13_CR22","doi-asserted-by":"crossref","unstructured":"Lin, H., Wu, R., Liu, S., Lu, J., Jia, J.: Video instance segmentation with a propose-reduce paradigm. In: ICCV, pp. 1739\u20131748 (2021)","DOI":"10.1109\/ICCV48922.2021.00176"},{"key":"13_CR23","unstructured":"Liu, Y., et al.: Opening up open world tracking. In: CVPR, pp. 19045\u201319055 (2022)"},{"key":"13_CR24","doi-asserted-by":"crossref","unstructured":"Liu, Z., et al.: Swin transformer: hierarchical vision transformer using shifted windows. In: ICCV, pp. 10012\u201310022 (2021)","DOI":"10.1109\/ICCV48922.2021.00986"},{"key":"13_CR25","unstructured":"Loshchilov, I., Hutter, F.: Decoupled weight decay regularization. arXiv preprint arXiv:1711.05101 (2017)"},{"issue":"5","key":"13_CR26","first-page":"2386","volume":"44","author":"X Lu","year":"2020","unstructured":"Lu, X., Ma, C., Shen, J., Yang, X., Reid, I., Yang, M.H.: Deep object tracking with shrinkage loss. PAMI 44(5), 2386\u20132401 (2020)","journal-title":"PAMI"},{"issue":"4","key":"13_CR27","first-page":"2228","volume":"44","author":"X Lu","year":"2020","unstructured":"Lu, X., Wang, W., Shen, J., Crandall, D., Luo, J.: Zero-shot video object segmentation with co-attention siamese networks. PAMI 44(4), 2228\u20132242 (2020)","journal-title":"PAMI"},{"issue":"11","key":"13_CR28","doi-asserted-by":"publisher","first-page":"7885","DOI":"10.1109\/TPAMI.2021.3115815","volume":"44","author":"X Lu","year":"2021","unstructured":"Lu, X., Wang, W., Shen, J., Crandall, D.J., Van Gool, L.: Segmenting objects from relational visual data. PAMI 44(11), 7885\u20137897 (2021)","journal-title":"PAMI"},{"key":"13_CR29","unstructured":"Ma, Z., et al.: Open-vocabulary one-stage detection with hierarchical visual-language knowledge distillation. In: CVPR, pp. 14074\u201314083 (2022)"},{"key":"13_CR30","unstructured":"Meinhardt, T., Feiszli, M., Fan, Y., Leal-Taixe, L., Ranjan, R.: Novis: a case for end-to-end near-online video instance segmentation. arXiv preprint arXiv:2308.15266 (2023)"},{"key":"13_CR31","doi-asserted-by":"crossref","unstructured":"Milletari, F., Navab, N., Ahmadi, S.A.: V-net: fully convolutional neural networks for volumetric medical image segmentation. In: 3DV, pp. 565\u2013571. IEEE (2016)","DOI":"10.1109\/3DV.2016.79"},{"issue":"8","key":"13_CR32","doi-asserted-by":"publisher","first-page":"2022","DOI":"10.1007\/s11263-022-01629-1","volume":"130","author":"J Qi","year":"2022","unstructured":"Qi, J., et al.: Occluded video instance segmentation: a benchmark. IJCV 130(8), 2022\u20132039 (2022)","journal-title":"IJCV"},{"key":"13_CR33","unstructured":"Radford, A., et\u00a0al.: Learning transferable visual models from natural language supervision. In: ICML, pp. 8748\u20138763. PMLR (2021)"},{"key":"13_CR34","first-page":"1","volume":"30","author":"A Vaswani","year":"2017","unstructured":"Vaswani, A., et al.: Attention is all you need. NeurIPS 30, 1\u201311 (2017)","journal-title":"NeurIPS"},{"key":"13_CR35","doi-asserted-by":"crossref","unstructured":"Voigtlaender, P., Chai, Y., Schroff, F., Adam, H., Leibe, B., Chen, L.C.: Feelvos: fast end-to-end embedding learning for video object segmentation. In: CVPR, pp. 9481\u20139490 (2019)","DOI":"10.1109\/CVPR.2019.00971"},{"key":"13_CR36","doi-asserted-by":"crossref","unstructured":"Wang, H., et al.: Towards open-vocabulary video instance segmentation. In: ICCV, pp. 4057\u20134066 (2023)","DOI":"10.1109\/ICCV51070.2023.00375"},{"key":"13_CR37","unstructured":"Wang, M., Xing, J., Liu, Y.: Actionclip: a new paradigm for video action recognition. arXiv preprint arXiv:2109.08472 (2021)"},{"key":"13_CR38","doi-asserted-by":"crossref","unstructured":"Wang, Y., et al.: End-to-end video instance segmentation with transformers. In: CVPR, pp. 8741\u20138750 (2021)","DOI":"10.1109\/CVPR46437.2021.00863"},{"key":"13_CR39","doi-asserted-by":"crossref","unstructured":"Wu, J., et al.: Betrayed by captions: joint caption grounding and generation for open vocabulary instance segmentation. In: ICCV, pp. 21938\u201321948 (2023)","DOI":"10.36227\/techrxiv.22082723.v1"},{"key":"13_CR40","series-title":"LNCS","doi-asserted-by":"publisher","first-page":"553","DOI":"10.1007\/978-3-031-19815-1_32","volume-title":"ECCV 2022","author":"J Wu","year":"2022","unstructured":"Wu, J., Jiang, Y., Bai, S., Zhang, W., Bai, X.: Seqformer: sequential transformer for video instance segmentation. In: Avidan, S., Brostow, G., Ciss\u00e9, M., Farinella, G.M., Hassner, T. (eds.) ECCV 2022. LNCS, vol. 13688, pp. 553\u2013569. Springer, Cham (2022). https:\/\/doi.org\/10.1007\/978-3-031-19815-1_32"},{"key":"13_CR41","series-title":"LNCS","doi-asserted-by":"publisher","first-page":"588","DOI":"10.1007\/978-3-031-19815-1_34","volume-title":"ECCV 2022","author":"J Wu","year":"2022","unstructured":"Wu, J., Liu, Q., Jiang, Y., Bai, S., Yuille, A., Bai, X.: In defense of online models for video instance segmentation. In: Avidan, S., Brostow, G., Ciss\u00e9, M., Farinella, G.M., Hassner, T. (eds.) ECCV 2022. LNCS, vol. 13688, pp. 588\u2013605. Springer, Cham (2022). https:\/\/doi.org\/10.1007\/978-3-031-19815-1_34"},{"key":"13_CR42","unstructured":"Wu, Y., Kirillov, A., Massa, F., Lo, W.Y., Girshick, R.: Detectron2 (2019). https:\/\/github.com\/facebookresearch\/detectron2"},{"key":"13_CR43","doi-asserted-by":"crossref","unstructured":"Yang, L., Fan, Y., Xu, N.: Video instance segmentation. In: ICCV, pp. 5188\u20135197 (2019)","DOI":"10.1109\/ICCV.2019.00529"},{"key":"13_CR44","doi-asserted-by":"crossref","unstructured":"Yang, S., et al.: Temporally efficient vision transformer for video instance segmentation. In: CVPR, pp. 2885\u20132895 (2022)","DOI":"10.1109\/CVPR52688.2022.00290"},{"key":"13_CR45","unstructured":"Yang, Z., Miao, J., Wei, Y., Wang, W., Wang, X., Yang, Y.: Scalable video object segmentation with identification mechanism. PAMI 1\u201315 (2024)"},{"key":"13_CR46","doi-asserted-by":"crossref","unstructured":"Ying, K., et al.: CTVIS: consistent training for online video instance segmentation. In: ICCV, pp. 899\u2013908 (2023)","DOI":"10.1109\/ICCV51070.2023.00089"},{"key":"13_CR47","doi-asserted-by":"crossref","unstructured":"Zareian, A., Rosa, K.D., Hu, D.H., Chang, S.F.: Open-vocabulary object detection using captions. In: CVPR, pp. 14393\u201314402 (2021)","DOI":"10.1109\/CVPR46437.2021.01416"},{"key":"13_CR48","doi-asserted-by":"crossref","unstructured":"Zhang, T., et al.: DVIS: decoupled video instance segmentation framework. In: CVPR. pp. 1282\u20131291 (2023)","DOI":"10.1109\/ICCV51070.2023.00124"},{"key":"13_CR49","series-title":"LNCS","doi-asserted-by":"publisher","first-page":"696","DOI":"10.1007\/978-3-031-19815-1_40","volume-title":"ECCV 2022","author":"C Zhou","year":"2022","unstructured":"Zhou, C., Loy, C.C., Dai, B.: Extract free dense labels from clip. In: Avidan, S., Brostow, G., Ciss\u00e9, M., Farinella, G.M., Hassner, T. (eds.) ECCV 2022. LNCS, vol. 13688, pp. 696\u2013712. Springer, Cham (2022). https:\/\/doi.org\/10.1007\/978-3-031-19815-1_40"},{"key":"13_CR50","series-title":"LNCS","doi-asserted-by":"publisher","first-page":"350","DOI":"10.1007\/978-3-031-20077-9_21","volume-title":"ECCV 2022","author":"X Zhou","year":"2022","unstructured":"Zhou, X., Girdhar, R., Joulin, A., Kr\u00e4henb\u00fchl, P., Misra, I.: Detecting twenty-thousand classes using image-level supervision. In: Avidan, S., Brostow, G., Ciss\u00e9, M., Farinella, G.M., Hassner, T. (eds.) ECCV 2022. LNCS, vol. 13669, pp. 350\u2013368. Springer, Cham (2022). https:\/\/doi.org\/10.1007\/978-3-031-20077-9_21"}],"container-title":["Lecture Notes in Computer Science","Computer Vision \u2013 ECCV 2024"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-031-72897-6_13","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,12,1]],"date-time":"2024-12-01T18:18:43Z","timestamp":1733077123000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-3-031-72897-6_13"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,12,2]]},"ISBN":["9783031728969","9783031728976"],"references-count":50,"URL":"https:\/\/doi.org\/10.1007\/978-3-031-72897-6_13","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024,12,2]]},"assertion":[{"value":"2 December 2024","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"ECCV","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"European Conference on Computer Vision","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Milan","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Italy","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2024","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"29 September 2024","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"4 October 2024","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"18","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"eccv2024","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/eccv2024.ecva.net\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}