{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,6]],"date-time":"2026-05-06T15:19:10Z","timestamp":1778080750143,"version":"3.51.4"},"reference-count":51,"publisher":"Springer Science and Business Media LLC","issue":"1","license":[{"start":{"date-parts":[[2024,7,30]],"date-time":"2024-07-30T00:00:00Z","timestamp":1722297600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2024,7,30]],"date-time":"2024-07-30T00:00:00Z","timestamp":1722297600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Int J Comput Vis"],"published-print":{"date-parts":[[2025,1]]},"DOI":"10.1007\/s11263-024-02195-4","type":"journal-article","created":{"date-parts":[[2024,8,6]],"date-time":"2024-08-06T08:49:17Z","timestamp":1722934157000},"page":"398-409","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":4,"title":["Video Instance Segmentation in an Open-World"],"prefix":"10.1007","volume":"133","author":[{"given":"Omkar","family":"Thawakar","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Sanath","family":"Narayan","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Hisham","family":"Cholakkal","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Rao Muhammad","family":"Anwer","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Salman","family":"Khan","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jorma","family":"Laaksonen","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Mubarak","family":"Shah","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Fahad Shahbaz","family":"Khan","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2024,7,30]]},"reference":[{"key":"2195_CR1","doi-asserted-by":"crossref","unstructured":"Athar, A., Mahadevan, S., Osep, A., Leal-Taix\u00e9, L., & Leibe, B. (2020). Stem-seg: Spatio-temporal embeddings for instance segmentation in videos. In ECCV.","DOI":"10.1007\/978-3-030-58621-8_10"},{"key":"2195_CR2","unstructured":"Awais, M., Naseer, M., Khan, S., Anwer, R.M., Cholakkal, H., Shah, M., Yang, M.H., & Khan, F.S. (2023). Foundational models defining a new era in vision: A survey and outlook. arXiv preprint arXiv:2307.13721."},{"key":"2195_CR3","doi-asserted-by":"crossref","unstructured":"Bertasius, G., & Torresani, L. (2020). Classifying, segmenting, and tracking object instances in video with mask propagation. In CVPR.","DOI":"10.1109\/CVPR42600.2020.00976"},{"key":"2195_CR4","unstructured":"Caelles, A., Meinhardt, T., Bras\u00f3, G., & Leal-Taix\u00e9, L. (2022). DeVIS: Making deformable transformers work for video instance segmentation. arXiv:2207.11103."},{"key":"2195_CR5","doi-asserted-by":"crossref","unstructured":"Cao, J., Anwer, R.M., Cholakkal, H., Khan, F.S., Pang, Y., & Shao, L. (2020). Sipmask: Spatial information preservation for fast image and video instance segmentation. In ECCV.","DOI":"10.1007\/978-3-030-58568-6_1"},{"key":"2195_CR6","doi-asserted-by":"crossref","unstructured":"Carion, N., Massa, F., Synnaeve, G., Usunier, N., Kirillov, A., & Zagoruyko, S. (2020). End-to-end object detection with transformers. In ECCV.","DOI":"10.1007\/978-3-030-58452-8_13"},{"key":"2195_CR7","doi-asserted-by":"crossref","unstructured":"Caron, M., Touvron, H., Misra, I., J\u00e9gou, H., Mairal, J., Bojanowski, P., & Joulin, A. (2021). Emerging properties in self-supervised vision transformers. In ICCV.","DOI":"10.1109\/ICCV48922.2021.00951"},{"key":"2195_CR8","doi-asserted-by":"crossref","unstructured":"Cheng, B., Misra, I., Schwing, A.G., Kirillov, A., & Girdhar, R. (2022). Masked-attention mask transformer for universal image segmentation. In CVPR, pp. 1290\u20131299.","DOI":"10.1109\/CVPR52688.2022.00135"},{"key":"2195_CR9","unstructured":"Dudhane, A., Thawakar, O., Zamir, S.W., Khan, S., Khan, F.S., & Yang, M.-H. (2024). Dynamic pre-training: Towards efficient and scalable all-in-one image restoration. arXiv preprint arXiv:2404.02154."},{"key":"2195_CR10","doi-asserted-by":"crossref","unstructured":"Dudhane, A., Zamir, S.W., Khan, S., Khan, F.S., & Yang, M.-H. (2023). Burstormer: Burst image restoration and enhancement transformer. In CVPR, pp. 5703\u20135712. IEEE.","DOI":"10.1109\/CVPR52729.2023.00552"},{"key":"2195_CR11","doi-asserted-by":"crossref","unstructured":"Fu, Y., Yang, L., Liu, D., Huang, T.S., & Shi, H. (2021). Compfeat: Comprehensive feature aggregation for video instance segmentation. AAAI.","DOI":"10.1609\/aaai.v35i2.16225"},{"key":"2195_CR12","doi-asserted-by":"crossref","unstructured":"Geng, Z., Liang, L., Ding, T., & Zharkov, I. (2022). Rstt: Real-time spatial temporal transformer for space-time video super-resolution. In CVPR, pp. 17441\u201317451.","DOI":"10.1109\/CVPR52688.2022.01692"},{"key":"2195_CR13","unstructured":"Gu, X., Lin, T.Y., Kuo, W., & Cui, Y. (2021). Open-vocabulary object detection via vision and language knowledge distillation. arXiv preprint arXiv:2104.13921"},{"key":"2195_CR14","unstructured":"Guo, P., Huang, T., He, P., Liu, X., Xiao, T., Chen, Z., & Zhang, W. (2023). Openvis: Open-vocabulary video instance segmentation. arXiv preprint arXiv:2305.16835."},{"key":"2195_CR15","doi-asserted-by":"crossref","unstructured":"Gupta, A., Narayan, S., Joseph, K., Khan, S., Khan, F.S., & Shah, M. (2022). Ow-detr: Open-world detection transformer. In CVPR.","DOI":"10.1109\/CVPR52688.2022.00902"},{"key":"2195_CR16","unstructured":"Han, W., Jun, T., Xiaodong, L., Shanyan, G., Rong, X., & Li, S. (2022). Ptseformer: Progressive temporal-spatial enhanced transformer towards video object detection. ECCV."},{"key":"2195_CR17","doi-asserted-by":"crossref","unstructured":"He, K., Gkioxari, G., Doll\u00e1r, P., & Girshick, R.B. (2017). Mask r-cnn. In ICCV.","DOI":"10.1109\/ICCV.2017.322"},{"key":"2195_CR18","doi-asserted-by":"crossref","unstructured":"Heo, M., Hwang, S., Hyun, J., Kim, H., Oh, S.W., Lee, J.-Y., & Kim, S.J. (2023). A generalized framework for video instance segmentation. In CVPR, pp. 14623\u201314632.","DOI":"10.1109\/CVPR52729.2023.01405"},{"key":"2195_CR19","first-page":"23109","volume":"35","author":"M Heo","year":"2022","unstructured":"Heo, M., Hwang, S., Oh, S. W., Lee, J. Y., & Kim, S. J. (2022). Vita: Video instance segmentation via object token association. NeurIPS, 35, 23109\u201323120.","journal-title":"NeurIPS"},{"key":"2195_CR20","first-page":"13352","volume":"34","author":"S Hwang","year":"2021","unstructured":"Hwang, S., Heo, M., Oh, S. W., & Kim, S. J. (2021). Video instance segmentation using inter-frame communication transformers. NeurIPS, 34, 13352\u201313363.","journal-title":"NeurIPS"},{"key":"2195_CR21","doi-asserted-by":"crossref","unstructured":"Joseph, K., Khan, S., Khan, F.S., & Balasubramanian, V.N. (2021). Towards open world object detection. In CVPR.","DOI":"10.1109\/CVPR46437.2021.00577"},{"key":"2195_CR22","unstructured":"Ke, L., Li, X., Danelljan, M., Tai, Y. W., Tang, C.K., & Yu, F. (2021). Prototypical cross-attention networks for multiple object tracking and segmentation. In NeurIPS."},{"key":"2195_CR23","doi-asserted-by":"crossref","unstructured":"Kuhn., H.W. (1955). The hungarian method for the assignment problem. Naval Research Logistics Quarterly2(1-2), 83\u201397.","DOI":"10.1002\/nav.3800020109"},{"key":"2195_CR24","unstructured":"Kuniaki, S., Ping, H., Trevor, D., & Saenko, K. (2022). Learning to detect every thing in an open world. ECCV."},{"key":"2195_CR25","unstructured":"Li, X., Ding, H., Yuan, H., Zhang, W., Pang, J., Cheng, G., Chen, K., Liu, Z., & Loy, C.C. (2023). Transformer-based visual segmentation: A survey. arXiv preprint arXiv:2304.09854"},{"key":"2195_CR26","doi-asserted-by":"crossref","unstructured":"Li, X., Yuan, H., Zhang, W., Cheng, G., Pang, J., & Loy, C.C. (2023). Tube-link: A flexible cross tube baseline for universal video segmentation. arXiv preprint arXiv:2303.12782.","DOI":"10.1109\/ICCV51070.2023.01280"},{"key":"2195_CR27","doi-asserted-by":"crossref","unstructured":"Lin, T., Goyal, P., Girshick, R.B., He, K., & Doll\u00e1r, P. (2017). Focal loss for dense object detection. In ICCV.","DOI":"10.1109\/ICCV.2017.324"},{"key":"2195_CR28","doi-asserted-by":"crossref","unstructured":"Lin, C., Hung, Y., Feris, R., & He, L. (2020). Video instance segmentation tracking with a modified vae architecture. In CVPR.","DOI":"10.1109\/CVPR42600.2020.01316"},{"key":"2195_CR29","doi-asserted-by":"crossref","unstructured":"Lin, T., Maire, M., Belongie, S.J., Hays, J., Perona, P., Ramanan, D., Doll\u00e1r, P., & Zitnick, C.L. (2014). Microsoft coco: Common objects in context. In: ECCV.","DOI":"10.1007\/978-3-319-10602-1_48"},{"key":"2195_CR30","doi-asserted-by":"crossref","unstructured":"Liu, D., Cui, Y., Tan, W., & Chen, Y. (2021). Sg-net: Spatial granularity network for one-stage video instance segmentation. In CVPR.","DOI":"10.1109\/CVPR46437.2021.00969"},{"key":"2195_CR31","doi-asserted-by":"crossref","unstructured":"Liu, Y., Zulfikar, I.E., Luiten, J., Dave, A., Ramanan, D., Leibe, B., O\u0161ep, A., & Leal-Taix\u00e9, L. (2021). Opening up open-world tracking. In CVPR.","DOI":"10.1109\/CVPR52688.2022.01846"},{"key":"2195_CR32","unstructured":"Naseer, M., Ranasinghe, K., Khan, S., Khan, F.S., & Porikli, F. (2021). On improving adversarial transferability of vision transformers. arXiv preprint arXiv:2106.04169."},{"key":"2195_CR33","unstructured":"Paszke, A., Gross, S., Massa, F., Lerer, A., Bradbury, J., Chanan, G., Killeen, T., Lin, Z., Gimelshein, N., Antiga, L., Desmaison, A., Kopf, A., Yang, E., DeVito, Z., Raison, M., Tejani, A., Chilamkurthy, S., Steiner, B., Fang, L., Bai, J., & Chintala, S. (2019). Pytorch: An imperative style, high-performance deep learning library. In Wallach, H., Larochelle, H., Beygelzimer, A., Alch\u00e9-Buc, F., Fox, E., Garnett, R. (2019). (eds.) NeurIPS, pp. 8024\u20138035. Curran Associates, Inc.,. http:\/\/papers.neurips.cc\/paper\/9015-pytorch-an-imperative-style-high-performance-deep-learning-library.pdf."},{"key":"2195_CR34","doi-asserted-by":"crossref","unstructured":"Ranasinghe, K., Naseer, M., Khan, S., Khan, F.S., & Ryoo, M.S. (2022). Self-supervised video transformer. In CVPR, pp. 2874\u20132884.","DOI":"10.1109\/CVPR52688.2022.00289"},{"key":"2195_CR35","doi-asserted-by":"crossref","unstructured":"Rasheed, H., Khattak, M.U., Maaz, M., Khan, S., & Khan, F.S. (2023). Fine-tuned clip models are efficient video learners. In CVPR, pp. 6545\u20136554.","DOI":"10.1109\/CVPR52729.2023.00633"},{"key":"2195_CR36","doi-asserted-by":"crossref","unstructured":"Russakovsky, O., Deng, J., Su, H., Krause, J., Satheesh, S., Ma, S., Huang, Z., Karpathy, A., Khosla, A., Bernstein, M.S., Berg, A.C., & Li, F. (2015). Imagenet large scale visual recognition challenge. In IJCV.","DOI":"10.1007\/s11263-015-0816-y"},{"key":"2195_CR37","doi-asserted-by":"crossref","unstructured":"Thawakar, O., Anwer, R.M., Laaksonen, J., Reiner, O., Shah, M., & Khan, F.S. (2023). 3d mitochondria instance segmentation with spatio-temporal transformers. In International Conference on Medical Image Computing and Computer-Assisted Intervention, pp. 613\u2013623. Springer.","DOI":"10.1007\/978-3-031-43993-3_59"},{"key":"2195_CR38","doi-asserted-by":"crossref","unstructured":"Thawakar, O., Narayan, S., Cao, J., Cholakkal, H., Anwer, R.M., Khan, M.H., Khan, S., Felsberg, M., & Khan, F.S. (2022). Video instance segmentation via multi-scale spatio-temporal split attention transformer. In ECCV, pp. 666\u2013681. Springer","DOI":"10.1007\/978-3-031-19818-2_38"},{"key":"2195_CR39","doi-asserted-by":"crossref","unstructured":"Wang, W., Feiszli, M., Wang, H., & Tran, D. (2021). Unidentified video objects: A benchmark for dense, open-world segmentation. In ICCV, pp. 10776\u201310785.","DOI":"10.1109\/ICCV48922.2021.01060"},{"key":"2195_CR40","doi-asserted-by":"crossref","unstructured":"Wang, W., Feiszli, M., Wang, H., Malik, J., & Tran, D. (2022). Open-world instance segmentation: Exploiting pseudo ground truth from learned pairwise affinity. In CVPR, pp. 4422\u20134432.","DOI":"10.1109\/CVPR52688.2022.00438"},{"key":"2195_CR41","doi-asserted-by":"crossref","unstructured":"Wang, Y., Xu, Z., Wang, X., Shen, C., Cheng, B., Shen, H., & Xia, H. (2021). End-to-end video instance segmentation with transformers. CVPR.","DOI":"10.1109\/CVPR46437.2021.00863"},{"key":"2195_CR42","doi-asserted-by":"crossref","unstructured":"Wu, J., Jiang, Y., Zhang, W., Bai, X., & Bai, S. (2022). Seqformer: a frustratingly simple model for video instance segmentation. ECCV.","DOI":"10.1007\/978-3-031-19815-1_32"},{"key":"2195_CR43","doi-asserted-by":"crossref","unstructured":"Wu, J., Li, X., Xu, S., Yuan, H., Ding, H., Yang, Y., Li, X., Zhang, J., Tong, Y., & Jiang, X., et al. (2024). Towards open vocabulary learning: A survey. TPAMI.","DOI":"10.1109\/TPAMI.2024.3361862"},{"key":"2195_CR44","doi-asserted-by":"crossref","unstructured":"Wu, J., Liu, Q., Jiang, Y., Bai, S., Yuille, A., & Bai, X. (2022). In defense of online models for video instance segmentation. In ECCV, pp. 588\u2013605. Springer.","DOI":"10.1007\/978-3-031-19815-1_34"},{"key":"2195_CR45","unstructured":"Xu, N., Yang, L., Yang, J., Yue, D., Fan, Y., Liang, Y., & Huang, T.S. (2021). YouTube-VIS Dataset 2021 Version. https:\/\/youtube-vos.org\/dataset\/vis."},{"key":"2195_CR46","doi-asserted-by":"crossref","unstructured":"Yang, L., Fan, Y., & Xu, N. (2019). Video instance segmentation. In ICCV.","DOI":"10.1109\/ICCV.2019.00529"},{"key":"2195_CR47","doi-asserted-by":"crossref","unstructured":"Yang, S., Fang, Y., Wang, X., Li, Y., Fang, C., Shan, Y., Feng, B., & Liu, W. (2021). Crossover learning for fast online video instance segmentation. In ICCV.","DOI":"10.1109\/ICCV48922.2021.00794"},{"key":"2195_CR48","doi-asserted-by":"crossref","unstructured":"Zhang, T., Tian, X., Wu, Y., Ji, S., Wang, X., Zhang, Y., & Wan, P. (2023). Dvis: Decoupled video instance segmentation framework. arXiv preprint arXiv:2306.03413.","DOI":"10.1109\/ICCV51070.2023.00124"},{"key":"2195_CR49","doi-asserted-by":"crossref","unstructured":"Zhang, T., Tian, X., Wu, Y., Ji, S., Wang, X., Zhang, Y., & Wan, P. (2023). Dvis: Decoupled video instance segmentation framework. In: ICCV, pp. 1282\u20131291.","DOI":"10.1109\/ICCV51070.2023.00124"},{"key":"2195_CR50","doi-asserted-by":"crossref","unstructured":"Zhou, Q., Li, X., He, L., Yang, Y., Cheng, G., Tong, Y., Ma, L., & Tao, D. (2022). Transvod: end-to-end video object detection with spatial-temporal transformers. TPAMI.","DOI":"10.1109\/TPAMI.2022.3223955"},{"key":"2195_CR51","unstructured":"Zhu, X., Su, W., Lu, L., Li, B., Wang, X., & Dai, J. (2021). Deformable detr: Deformable transformers for end-to-end object detection. In ICLR."}],"container-title":["International Journal of Computer Vision"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-024-02195-4.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11263-024-02195-4\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-024-02195-4.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,1,7]],"date-time":"2025-01-07T06:15:01Z","timestamp":1736230501000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11263-024-02195-4"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,7,30]]},"references-count":51,"journal-issue":{"issue":"1","published-print":{"date-parts":[[2025,1]]}},"alternative-id":["2195"],"URL":"https:\/\/doi.org\/10.1007\/s11263-024-02195-4","relation":{},"ISSN":["0920-5691","1573-1405"],"issn-type":[{"value":"0920-5691","type":"print"},{"value":"1573-1405","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024,7,30]]},"assertion":[{"value":"15 December 2023","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"4 July 2024","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"30 July 2024","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}