{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,3,28]],"date-time":"2025-03-28T01:39:02Z","timestamp":1743125942355,"version":"3.40.3"},"publisher-location":"Singapore","reference-count":84,"publisher":"Springer Nature Singapore","isbn-type":[{"type":"print","value":"9789819609000"},{"type":"electronic","value":"9789819609017"}],"license":[{"start":{"date-parts":[[2024,12,8]],"date-time":"2024-12-08T00:00:00Z","timestamp":1733616000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2024,12,8]],"date-time":"2024-12-08T00:00:00Z","timestamp":1733616000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025]]},"DOI":"10.1007\/978-981-96-0901-7_24","type":"book-chapter","created":{"date-parts":[[2024,12,7]],"date-time":"2024-12-07T08:01:07Z","timestamp":1733558467000},"page":"412-431","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["Strike the\u00a0Balance: On-the-Fly Uncertainty Based User Interactions for\u00a0Long-Term Video Object Segmentation"],"prefix":"10.1007","author":[{"ORCID":"https:\/\/orcid.org\/0000-0001-6916-786X","authenticated-orcid":false,"given":"St\u00e9phane","family":"Vujasinovi\u0107","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-7367-2519","authenticated-orcid":false,"given":"Stefan","family":"Becker","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-1584-5319","authenticated-orcid":false,"given":"Sebastian","family":"Bullinger","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-8085-2147","authenticated-orcid":false,"given":"Norbert","family":"Scherer-Negenborn","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-7857-0332","authenticated-orcid":false,"given":"Michael","family":"Arens","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-8046-4945","authenticated-orcid":false,"given":"Rainer","family":"Stiefelhagen","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2024,12,8]]},"reference":[{"key":"24_CR1","doi-asserted-by":"crossref","unstructured":"Athar, A., Luiten, J., Voigtlaender, P., Khurana, T., Dave, A., Leibe, B., Ramanan, D.: Burst: A benchmark for unifying object recognition, segmentation and tracking in video. In: Winter Conference on Applications of Computer Vision (WACV) (2023)","DOI":"10.1109\/WACV56688.2023.00172"},{"key":"24_CR2","doi-asserted-by":"crossref","unstructured":"Bekuzarov, M., Bermudez, A., Lee, J.Y., Li, H.: Xmem++: Production-level video segmentation from few annotated frames (2023)","DOI":"10.1109\/ICCV51070.2023.00065"},{"key":"24_CR3","unstructured":"Benard, A., Gygli, M.: Interactive video object segmentation in the wild. arXiv preprint arXiv:1801.00269 (2017)"},{"key":"24_CR4","doi-asserted-by":"crossref","unstructured":"Caelles, S., Maninis, K.K., Pont-Tuset, J., Leal-Taix\u00e9, L., Cremers, D., Van\u00a0Gool, L.: One-shot video object segmentation. In: Conference on Computer Vision and Pattern Recognition (CVPR) (2017)","DOI":"10.1109\/CVPR.2017.565"},{"key":"24_CR5","doi-asserted-by":"crossref","unstructured":"Caelles, S., Montes, A., Maninis, K.K., Chen, Y., Van Gool, L., Perazzi, F., Pont-Tuset, J.: The 2018 davis challenge on video object segmentation. arXiv:1803.00557 (2018)","DOI":"10.1109\/CVPR.2017.565"},{"key":"24_CR6","doi-asserted-by":"crossref","unstructured":"Cheng, H.K., Oh, S.W., Price, B., Lee, J.Y., Schwing, A.: Putting the object back into video object segmentation. In: Conference on Computer Vision and Pattern Recognition (CVPR) (2024)","DOI":"10.1109\/CVPR52733.2024.00304"},{"key":"24_CR7","doi-asserted-by":"crossref","unstructured":"Cheng, H.K., Oh, S.W., Price, B., Schwing, A., Lee, J.Y.: Tracking anything with decoupled video segmentation. In: International Conference on Computer Vision (ICCV) (2023)","DOI":"10.1109\/ICCV51070.2023.00127"},{"key":"24_CR8","doi-asserted-by":"crossref","unstructured":"Cheng, H.K., Schwing, A.G.: XMem: Long-term video object segmentation with an atkinson-shiffrin memory model. In: European Conference on Computer Vision (ECCV) (2022)","DOI":"10.1007\/978-3-031-19815-1_37"},{"key":"24_CR9","doi-asserted-by":"crossref","unstructured":"Cheng, H.K., Tai, Y.W., Tang, C.K.: Modular interactive video object segmentation: Interaction-to-mask, propagation and difference-aware fusion. In: Conference on Computer Vision and Pattern Recognition (CVPR) (2021)","DOI":"10.1109\/CVPR46437.2021.00551"},{"key":"24_CR10","unstructured":"Cheng, H.K., Tai, Y.W., Tang, C.K.: Rethinking space-time networks with improved memory coverage for efficient video object segmentation. In: Neural Information Processing Systems (NeurIPS) (2021)"},{"key":"24_CR11","unstructured":"Cheng, Y., Li, L., Xu, Y., Li, X., Yang, Z., Wang, W., Yang, Y.: Segment and track anything. arXiv preprint arXiv:2305.06558 (2023)"},{"key":"24_CR12","doi-asserted-by":"crossref","unstructured":"Cho, K., Van\u00a0Merri\u00ebnboer, B., Gulcehre, C., Bahdanau, D., Bougares, F., Schwenk, H., Bengio, Y.: Learning phrase representations using rnn encoder-decoder for statistical machine translation. Conference on Empirical Methods in Natural Language Processing (EMNLP) (2014)","DOI":"10.3115\/v1\/D14-1179"},{"key":"24_CR13","doi-asserted-by":"crossref","unstructured":"Cho, S., Lee, H., Lee, M., Park, C., Jang, S., Kim, M., Lee, S.: Tackling background distraction in video object segmentation. In: European Conference on Computer Vision (ECCV) (2022)","DOI":"10.1007\/978-3-031-20047-2_26"},{"key":"24_CR14","doi-asserted-by":"crossref","unstructured":"Clark, H.H.: Coordinating with each other in a material world. Discourse studies (2005)","DOI":"10.1177\/1461445605054404"},{"key":"24_CR15","doi-asserted-by":"crossref","unstructured":"Delatolas, T., Kalogeiton, V., Papadopoulos, D.P.: Learning the what and how of annotation in video object segmentation. In: Winter Conference on Applications of Computer Vision (WACV) (2024)","DOI":"10.1109\/WACV57701.2024.00680"},{"key":"24_CR16","doi-asserted-by":"crossref","unstructured":"Ding, H., Liu, C., He, S., Jiang, X., Torr, P.H., Bai, S.: MOSE: A new dataset for video object segmentation in complex scenes. In: International Conference on Computer Vision (ICCV) (2023)","DOI":"10.1109\/ICCV51070.2023.01850"},{"key":"24_CR17","doi-asserted-by":"crossref","unstructured":"Dupont, C., Ouakrim, Y., Pham, Q.C.: Ucp-net: Unstructured contour points for instance segmentation. arXiv preprint arXiv:2109.07592 (2021)","DOI":"10.1109\/SMC52423.2021.9658754"},{"key":"24_CR18","doi-asserted-by":"crossref","unstructured":"Firestone, C., Scholl, B.J.: \u201cplease tap the shape, anywhere you like\u201d shape skeletons in human vision revealed by an exceedingly simple measure. Psychological science (2014)","DOI":"10.1177\/0956797613507584"},{"key":"24_CR19","unstructured":"Forte, M., Price, B., Cohen, S., Xu, N., Piti\u00e9, F.: Getting to 99% accuracy in interactive segmentation. arXiv preprint arXiv:2003.07932 (2020)"},{"key":"24_CR20","doi-asserted-by":"crossref","unstructured":"Heo, Y., Jun\u00a0Koh, Y., Kim, C.S.: Interactive video object segmentation using global and local transfer modules. In: European Conference on Computer Vision (ECCV) (2020)","DOI":"10.1007\/978-3-030-58520-4_18"},{"key":"24_CR21","doi-asserted-by":"crossref","unstructured":"Heo, Y., Koh, Y.J., Kim, C.S.: Guided interactive video object segmentation using reliability-based attention maps. In: Conference on Computer Vision and Pattern Recognition (CVPR) (2021)","DOI":"10.1109\/CVPR46437.2021.00724"},{"key":"24_CR22","doi-asserted-by":"crossref","unstructured":"Hong, L., Chen, W., Liu, Z., Zhang, W., Guo, P., Chen, Z., Zhang, W.: Lvos: A benchmark for long-term video object segmentation. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision (ICCV) (2023)","DOI":"10.1109\/ICCV51070.2023.01240"},{"key":"24_CR23","doi-asserted-by":"crossref","unstructured":"Hu, P., Wang, G., Kong, X., Kuen, J., Tan, Y.P.: Motion-guided cascaded refinement network for video object segmentation. In: Conference on Computer Vision and Pattern Recognition (CVPR) (2018)","DOI":"10.1109\/CVPR.2018.00152"},{"key":"24_CR24","doi-asserted-by":"crossref","unstructured":"Huang, Z., Huang, L., Gong, Y., Huang, C., Wang, X.: Mask Scoring R-CNN. In: Conference on Computer Vision and Pattern Recognition (CVPR) (2019)","DOI":"10.1109\/CVPR.2019.00657"},{"key":"24_CR25","doi-asserted-by":"crossref","unstructured":"Jain, S., Grauman, K.: Click carving: Segmenting objects in video with point clicks. In: Association for the Advancement of Artificial Intelligence (AAAI) (2016)","DOI":"10.1609\/hcomp.v4i1.13288"},{"key":"24_CR26","doi-asserted-by":"crossref","unstructured":"Jang, W.D., Kim, C.S.: Online video object segmentation via convolutional trident network. In: Conference on Computer Vision and Pattern Recognition (CVPR) (2017)","DOI":"10.1109\/CVPR.2017.790"},{"key":"24_CR27","doi-asserted-by":"crossref","unstructured":"Jang, W.D., Kim, C.S.: Interactive image segmentation via backpropagating refinement scheme. In: Conference on Computer Vision and Pattern Recognition (CVPR) (2019)","DOI":"10.1109\/CVPR.2019.00544"},{"key":"24_CR28","doi-asserted-by":"crossref","unstructured":"Johnander, J., Danelljan, M., Brissman, E., Khan, F.S., Felsberg, M.: A generative appearance model for end-to-end video object segmentation. In: Conference on Computer Vision and Pattern Recognition (CVPR) (2019)","DOI":"10.1109\/CVPR.2019.00916"},{"key":"24_CR29","unstructured":"Ke, L., Ye, M., Danelljan, M., Liu, Y., Tai, Y.W., Tang, C.K., Yu, F.: Segment anything in high quality. In: Neural Information Processing Systems (NeurIPS) (2023)"},{"key":"24_CR30","doi-asserted-by":"crossref","unstructured":"Kirillov, A., Mintun, E., Ravi, N., Mao, H., Rolland, C., Gustafson, L., Xiao, T., Whitehead, S., Berg, A.C., Lo, W.Y., Doll\u00e1r, P., Girshick, R.: Segment anything. arXiv:2304.02643 (2023)","DOI":"10.1109\/ICCV51070.2023.00371"},{"key":"24_CR31","doi-asserted-by":"crossref","unstructured":"Kontogianni, T., Gygli, M., Uijlings, J., Ferrari, V.: Continuous adaptation for interactive object segmentation by learning from corrections. In: European Conference on Computer Vision (ECCV) (2020)","DOI":"10.1007\/978-3-030-58517-4_34"},{"key":"24_CR32","unstructured":"Kristan, M., et\u00a0al.: The first visual object tracking segmentation vots2023 challenge results. In: International Conference on Computer Vision Workshops (ICCVW) (2023)"},{"key":"24_CR33","doi-asserted-by":"crossref","unstructured":"Li, M., Hu, L., Xiong, Z., Zhang, B., Pan, P., Liu, D.: Recurrent dynamic embedding for video object segmentation. In: Conference on Computer Vision and Pattern Recognition (CVPR) (2022)","DOI":"10.1109\/CVPR52688.2022.00139"},{"key":"24_CR34","doi-asserted-by":"crossref","unstructured":"Li, Y., Shen, Z., Shan, Y.: Fast video object segmentation using the global context module. In: European Conference on Computer Vision (ECCV) (2020)","DOI":"10.1007\/978-3-030-58607-2_43"},{"key":"24_CR35","doi-asserted-by":"crossref","unstructured":"Li, Z., Chen, Q., Koltun, V.: Interactive image segmentation with latent diversity. In: Conference on Computer Vision and Pattern Recognition (CVPR) (2018)","DOI":"10.1109\/CVPR.2018.00067"},{"key":"24_CR36","unstructured":"Liang, Y., Li, X., Jafari, N., Chen, J.: Video object segmentation with adaptive feature bank and uncertain-region refinement. In: Neural Information Processing Systems (NeurIPS) (2020)"},{"key":"24_CR37","doi-asserted-by":"crossref","unstructured":"Liu, Y., Yu, R., Wang, J., Zhao, X., Wang, Y., Tang, Y., Yang, Y.: Global spectral filter memory network for video object segmentation. In: European Conference on Computer Vision (ECCV) (2022)","DOI":"10.1007\/978-3-031-19818-2_37"},{"key":"24_CR38","doi-asserted-by":"crossref","unstructured":"Liu, Y., Yu, R., Yin, F., Zhao, X., Zhao, W., Xia, W., Yang, Y.: Learning quality-aware dynamic memory for video object segmentation. In: European Conference on Computer Vision (ECCV) (2022)","DOI":"10.1007\/978-3-031-19818-2_27"},{"key":"24_CR39","doi-asserted-by":"crossref","unstructured":"Maninis, K.K., Caelles, S., Chen, Y., Pont-Tuset, J., Leal-Taix\u00e9, L., Cremers, D., Van\u00a0Gool, L.: Video object segmentation without temporal information. Transactions on Pattern Analysis and Machine Intelligence (TPAMI) (2018)","DOI":"10.1109\/CVPR.2017.565"},{"key":"24_CR40","doi-asserted-by":"crossref","unstructured":"Maninis, K.K., Caelles, S., Pont-Tuset, J., Van\u00a0Gool, L.: Deep extreme cut: From extreme points to object segmentation. In: Conference on Computer Vision and Pattern Recognition (CVPR) (2018)","DOI":"10.1109\/CVPR.2018.00071"},{"key":"24_CR41","doi-asserted-by":"crossref","unstructured":"Marinov, Z., J\u00e4ger, P.F., Egger, J., Kleesiek, J., Stiefelhagen, R.: Deep interactive segmentation of medical images: A systematic review and taxonomy. arXiv preprint arXiv:2311.13964 (2023)","DOI":"10.1109\/TPAMI.2024.3452629"},{"key":"24_CR42","unstructured":"Meinhardt, T., Leal-Taix\u00e9, L.: Make one-shot video object segmentation efficient again. Neural Information Processing Systems (NeurIPS) (2020)"},{"key":"24_CR43","doi-asserted-by":"crossref","unstructured":"Miao, J., Wei, Y., Yang, Y.: Memory aggregation networks for efficient interactive video object segmentation. In: Conference on Computer Vision and Pattern Recognition (CVPR) (2020)","DOI":"10.1109\/CVPR42600.2020.01038"},{"key":"24_CR44","doi-asserted-by":"crossref","unstructured":"Oh, S.W., Lee, J.Y., Xu, N., Kim, S.J.: Fast user-guided video object segmentation by interaction-and-propagation networks. In: Conference on Computer Vision and Pattern Recognition (CVPR) (2019)","DOI":"10.1109\/CVPR.2019.00539"},{"key":"24_CR45","doi-asserted-by":"crossref","unstructured":"Oh, S.W., Lee, J.Y., Xu, N., Kim, S.J.: Video object segmentation using space-time memory networks. In: International Conference on Computer Vision (ICCV) (2019)","DOI":"10.1109\/ICCV.2019.00932"},{"key":"24_CR46","doi-asserted-by":"crossref","unstructured":"Park, K., Woo, S., Oh, S.W., Kweon, I.S., Lee, J.Y.: Per-clip video object segmentation. In: Conference on Computer Vision and Pattern Recognition (CVPR) (2022)","DOI":"10.1109\/CVPR52688.2022.00141"},{"key":"24_CR47","doi-asserted-by":"crossref","unstructured":"Perazzi, F., Pont-Tuset, J., McWilliams, B., Van Gool, L., Gross, M., Sorkine-Hornung, A.: A benchmark dataset and evaluation methodology for video object segmentation. In: Conference on Computer Vision and Pattern Recognition (CVPR) (2016)","DOI":"10.1109\/CVPR.2016.85"},{"key":"24_CR48","doi-asserted-by":"crossref","unstructured":"Perazzi, F., Khoreva, A., Benenson, R., Schiele, B., Sorkine-Hornung, A.: Learning video object segmentation from static images. In: Conference on Computer Vision and Pattern Recognition (CVPR) (2017)","DOI":"10.1109\/CVPR.2017.372"},{"key":"24_CR49","unstructured":"Pont-Tuset, J., Perazzi, F., Caelles, S., Arbel\u00e1ez, P., Sorkine-Hornung, A., Van Gool, L.: The 2017 davis challenge on video object segmentation. arXiv:1704.00675 (2017)"},{"key":"24_CR50","doi-asserted-by":"crossref","unstructured":"Rother, C., Kolmogorov, V., Blake, A.: \" grabcut\" interactive foreground extraction using iterated graph cuts. ACM transactions on graphics (TOG) (2004)","DOI":"10.1145\/1186562.1015720"},{"key":"24_CR51","doi-asserted-by":"crossref","unstructured":"Seong, H., Hyun, J., Kim, E.: Kernelized memory network for video object segmentation. In: European Conference on Computer Vision (ECCV) (2020)","DOI":"10.1007\/978-3-030-58542-6_38"},{"key":"24_CR52","doi-asserted-by":"crossref","unstructured":"Seong, H., Oh, S.W., Lee, J.Y., Lee, S., Lee, S., Kim, E.: Hierarchical memory matching network for video object segmentation. In: International Conference on Computer Vision (ICCV) (2021)","DOI":"10.1109\/ICCV48922.2021.01265"},{"key":"24_CR53","doi-asserted-by":"crossref","unstructured":"Shannon, C.E.: A mathematical theory of communication. The Bell system technical journal (1948)","DOI":"10.1002\/j.1538-7305.1948.tb00917.x"},{"key":"24_CR54","doi-asserted-by":"crossref","unstructured":"Sofiiuk, K., Petrov, I., Barinova, O., Konushin, A.: f-brs: Rethinking backpropagating refinement for interactive segmentation. In: Conference on Computer Vision and Pattern Recognition (CVPR) (2020)","DOI":"10.1109\/CVPR42600.2020.00865"},{"key":"24_CR55","doi-asserted-by":"crossref","unstructured":"Sofiiuk, K., Petrov, I.A., Konushin, A.: Reviving iterative training with mask guidance for interactive segmentation. In: International Conference on Image Processing (ICIP) (2022)","DOI":"10.1109\/ICIP46576.2022.9897365"},{"key":"24_CR56","doi-asserted-by":"crossref","unstructured":"Spearman, C.: The proof and measurement of association between two things. American Journal of Psychology (1904)","DOI":"10.2307\/1412159"},{"key":"24_CR57","doi-asserted-by":"crossref","unstructured":"Voigtlaender, P., Chai, Y., Schroff, F., Adam, H., Leibe, B., Chen, L.C.: Feelvos: Fast end-to-end embedding learning for video object segmentation. In: Conference on Computer Vision and Pattern Recognition (CVPR) (2019)","DOI":"10.1109\/CVPR.2019.00971"},{"key":"24_CR58","doi-asserted-by":"crossref","unstructured":"Voigtlaender, P., Leibe, B.: Online adaptation of convolutional neural networks for video object segmentation. British Machine Vision Conference (BMVC) (2017)","DOI":"10.5244\/C.31.116"},{"key":"24_CR59","unstructured":"Vujasinovic, S., Bullinger, S., Becker, S., Scherer-Negenborn, N., Arens, M., Stiefelhagen, R.: Readmem: Robust embedding association for a diverse memory in unconstrained video object segmentation. In: British Machine Vision Conference (BMVC) (2023)"},{"key":"24_CR60","doi-asserted-by":"crossref","unstructured":"Vujasinovi\u0107, S., Bullinger, S., Becker, S., Scherer-Negenborn, N., Arens, M., Stiefelhagen, R.: Revisiting click-based interactive video object segmentation. In: International Conference on Image Processing (ICIP) (2022)","DOI":"10.1109\/ICIP46576.2022.9897460"},{"key":"24_CR61","doi-asserted-by":"crossref","unstructured":"Wang, J., Sun, K., Cheng, T., Jiang, B., Deng, C., Zhao, Y., Liu, D., Mu, Y., Tan, M., Wang, X., et\u00a0al.: Deep high-resolution representation learning for visual recognition. Transactions on Pattern Analysis and Machine Intelligence (TPAMI) (2020)","DOI":"10.1109\/TPAMI.2020.2983686"},{"key":"24_CR62","doi-asserted-by":"crossref","unstructured":"Wang, T., Han, B., Collomosse, J.P.: Touchcut: Fast image and video segmentation using single-touch interaction. Computer Vision and Image Understanding (CVIU) (2014)","DOI":"10.1016\/j.cviu.2013.10.013"},{"key":"24_CR63","doi-asserted-by":"crossref","unstructured":"Wu, J., Zhao, Y., Zhu, J.Y., Luo, S., Tu, Z.: Milcut: A sweeping line multiple instance learning paradigm for interactive image segmentation. In: Conference on Computer Vision and Pattern Recognition (CVPR) (2014)","DOI":"10.1109\/CVPR.2014.40"},{"key":"24_CR64","doi-asserted-by":"crossref","unstructured":"Xiao, H., Feng, J., Lin, G., Liu, Y., Zhang, M.: Monet: Deep motion exploitation for video object segmentation. In: Conference on Computer Vision and Pattern Recognition (CVPR) (2018)","DOI":"10.1109\/CVPR.2018.00125"},{"key":"24_CR65","doi-asserted-by":"crossref","unstructured":"Xiao, H., Kang, B., Liu, Y., Zhang, M., Feng, J.: Online meta adaptation for fast video object segmentation. Transactions on Pattern Analysis and Machine Intelligence (TPAMI) (2019)","DOI":"10.1109\/TPAMI.2018.2890659"},{"key":"24_CR66","doi-asserted-by":"crossref","unstructured":"Xie, H., Yao, H., Zhou, S., Zhang, S., Sun, W.: Efficient regional memory network for video object segmentation. In: Conference on Computer Vision and Pattern Recognition (CVPR) (2021)","DOI":"10.1109\/CVPR46437.2021.00134"},{"key":"24_CR67","doi-asserted-by":"crossref","unstructured":"Xu, N., Price, B., Cohen, S., Yang, J., Huang, T.: Deep grabcut for object selection. arXiv preprint arXiv:1707.00243 (2017)","DOI":"10.5244\/C.31.182"},{"key":"24_CR68","doi-asserted-by":"crossref","unstructured":"Xu, N., Price, B., Cohen, S., Yang, J., Huang, T.S.: Deep interactive object selection. In: Conference on Computer Vision and Pattern Recognition (CVPR) (2016)","DOI":"10.1109\/CVPR.2016.47"},{"key":"24_CR69","doi-asserted-by":"crossref","unstructured":"Xu, N., Yang, L., Fan, Y., Yue, D., Liang, Y., Yang, J., Huang, T.: Youtube-vos: A large-scale video object segmentation benchmark. arXiv preprint arXiv:1809.03327 (2018)","DOI":"10.1007\/978-3-030-01228-1_36"},{"key":"24_CR70","unstructured":"Yang, J., Gao, M., Li, Z., Gao, S., Wang, F., Zheng, F.: Track anything: Segment anything meets videos (2023)"},{"key":"24_CR71","doi-asserted-by":"crossref","unstructured":"Yang, Z., Wei, Y., Yang, Y.: Collaborative video object segmentation by foreground-background integration. In: European Conference on Computer Vision (ECCV) (2020)","DOI":"10.1007\/978-3-030-58558-7_20"},{"key":"24_CR72","unstructured":"Yang, Z., Wei, Y., Yang, Y.: Associating objects with transformers for video object segmentation. In: Neural Information Processing Systems (NeurIPS) (2021)"},{"key":"24_CR73","doi-asserted-by":"crossref","unstructured":"Yang, Z., Wei, Y., Yang, Y.: Collaborative video object segmentation by multi-scale foreground-background integration. Transactions on Pattern Analysis and Machine Intelligence (TPAMI) (2021)","DOI":"10.1109\/TPAMI.2021.3081597"},{"key":"24_CR74","unstructured":"Yang, Z., Yang, Y.: Decoupling features in hierarchical propagation for video object segmentation. In: Neural Information Processing Systems (NeurIPS) (2022)"},{"key":"24_CR75","doi-asserted-by":"crossref","unstructured":"Yin, Z., Zheng, J., Luo, W., Qian, S., Zhang, H., Gao, S.: Learning to recommend frame for interactive video object segmentation in the wild. In: Conference on Computer Vision and Pattern Recognition (CVPR) (2021)","DOI":"10.1109\/CVPR46437.2021.01519"},{"key":"24_CR76","doi-asserted-by":"crossref","unstructured":"Yuan, Y., Chen, X., Chen, X., Wang, J.: Segmentation transformer: Object-contextual representations for semantic segmentation. In: European Conference on Computer Vision (ECCV) (2021)","DOI":"10.1007\/978-3-030-58539-6_11"},{"key":"24_CR77","unstructured":"Yunyao, M., Ning, W., Wengang, Z., Houqiang, L.: Joint inductive and transductive learning for video object segmentation. In: International Conference on Computer Vision (ICCV) (2021)"},{"key":"24_CR78","unstructured":"Zhang, C., Han, D., Qiao, Y., Kim, J.U., Bae, S.H., Lee, S., Hong, C.S.: Faster segment anything: Towards lightweight sam for mobile applications. arXiv preprint arXiv:2306.14289 (2023)"},{"key":"24_CR79","unstructured":"Zhang, C., Liu, L., Cui, Y., Huang, G., Lin, W., Yang, Y., Hu, Y.: A comprehensive survey on segment anything model for vision and beyond. arXiv:2305.08196 (2023)"},{"key":"24_CR80","doi-asserted-by":"crossref","unstructured":"Zhang, L., Lin, Z., Zhang, J., Lu, H., He, Y.: Fast video object segmentation via dynamic targeting network. In: International Conference on Computer Vision (ICCV) (2019)","DOI":"10.1109\/ICCV.2019.00568"},{"key":"24_CR81","doi-asserted-by":"crossref","unstructured":"Zhang, S., Liew, J.H., Wei, Y., Wei, S., Zhao, Y.: Interactive object segmentation with inside-outside guidance. In: Conference on Computer Vision and Pattern Recognition (CVPR) (2020)","DOI":"10.1109\/CVPR42600.2020.01225"},{"key":"24_CR82","unstructured":"Zhao, X., Ding, W., An, Y., Du, Y., Yu, T., Li, M., Tang, M., Wang, J.: Fast segment anything (2023)"},{"key":"24_CR83","doi-asserted-by":"crossref","unstructured":"Zhou, T., Porikli, F., Crandall, D.J., Van\u00a0Gool, L., Wang, W.: A survey on deep learning technique for video segmentation. Transactions on Pattern Analysis and Machine Intelligence (TPAMI) (2023)","DOI":"10.1109\/TPAMI.2022.3225573"},{"key":"24_CR84","unstructured":"Zhu, J., Chen, Z., Hao, Z., Chang, S., Zhang, L., Wang, D., Lu, H., Luo, B., He, J.Y., Lan, J.P., Chen, H., Li, C.: Tracking anything in high quality (2023)"}],"container-title":["Lecture Notes in Computer Science","Computer Vision \u2013 ACCV 2024"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-981-96-0901-7_24","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,12,7]],"date-time":"2024-12-07T08:14:34Z","timestamp":1733559274000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-981-96-0901-7_24"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,12,8]]},"ISBN":["9789819609000","9789819609017"],"references-count":84,"URL":"https:\/\/doi.org\/10.1007\/978-981-96-0901-7_24","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"type":"print","value":"0302-9743"},{"type":"electronic","value":"1611-3349"}],"subject":[],"published":{"date-parts":[[2024,12,8]]},"assertion":[{"value":"8 December 2024","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"ACCV","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Asian Conference on Computer Vision","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Hanoi","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Vietnam","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2024","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"8 December 2024","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"12 December 2024","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"17","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"accv2024","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}