{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,1]],"date-time":"2026-05-01T17:32:30Z","timestamp":1777656750767,"version":"3.51.4"},"publisher-location":"Cham","reference-count":50,"publisher":"Springer Nature Switzerland","isbn-type":[{"value":"9783031728549","type":"print"},{"value":"9783031728556","type":"electronic"}],"license":[{"start":{"date-parts":[[2024,11,9]],"date-time":"2024-11-09T00:00:00Z","timestamp":1731110400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2024,11,9]],"date-time":"2024-11-09T00:00:00Z","timestamp":1731110400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025]]},"DOI":"10.1007\/978-3-031-72855-6_6","type":"book-chapter","created":{"date-parts":[[2024,11,8]],"date-time":"2024-11-08T18:49:26Z","timestamp":1731091766000},"page":"91-107","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":4,"title":["Spatial-Temporal Multi-level Association for\u00a0Video Object Segmentation"],"prefix":"10.1007","author":[{"given":"Deshui","family":"Miao","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xin","family":"Li","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zhenyu","family":"He","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Huchuan","family":"Lu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Ming-Hsuan","family":"Yang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2024,11,9]]},"reference":[{"key":"6_CR1","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"777","DOI":"10.1007\/978-3-030-58536-5_46","volume-title":"Computer Vision \u2013 ECCV 2020","author":"G Bhat","year":"2020","unstructured":"Bhat, G., et al.: Learning what to learn for video object segmentation. In: Vedaldi, A., Bischof, H., Brox, T., Frahm, J.-M. (eds.) ECCV 2020. LNCS, vol. 12347, pp. 777\u2013794. Springer, Cham (2020). https:\/\/doi.org\/10.1007\/978-3-030-58536-5_46"},{"key":"6_CR2","doi-asserted-by":"crossref","unstructured":"Caelles, S., Maninis, K., Pont-Tuset, J., Leal-Taix\u00e9, L., Van\u00a0Gool, L.: One-shot video object segmentation. In: CVPR, pp. 221\u2013230 (2017)","DOI":"10.1109\/CVPR.2017.565"},{"key":"6_CR3","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"375","DOI":"10.1007\/978-3-031-20047-2_22","volume-title":"Computer Vision \u2013 ECCV 2022","author":"B Chen","year":"2022","unstructured":"Chen, B., Li, P., Bai, L., Qiao, L., Shen, Q., Li, B.: Backbone is all you need: a simplified architecture for visual object tracking. In: Avidan, S., Brostow, G., Ciss\u00e9, M., Farinella, G.M., Hassner, T. (eds.) ECCV 2022. LNCS, vol. 13682, pp. 375\u2013392. Springer, Cham (2022). https:\/\/doi.org\/10.1007\/978-3-031-20047-2_22"},{"key":"6_CR4","doi-asserted-by":"crossref","unstructured":"Chen, Y., Pont-Tuset, J., Montes, A., Van\u00a0Gool, L.: Blazingly fast video object segmentation with pixel-wise metric learning. In: CVPR, pp. 1189\u20131198 (2018)","DOI":"10.1109\/CVPR.2018.00130"},{"key":"6_CR5","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"640","DOI":"10.1007\/978-3-031-19815-1_37","volume-title":"Computer Vision \u2013 ECCV 2022","author":"HK Cheng","year":"2022","unstructured":"Cheng, H.K., Schwing, A.G.: XMem: long-term video object segmentation with an Atkinson-Shiffrin memory model. In: Avidan, S., Brostow, G., Ciss\u00e9, M., Farinella, G.M., Hassner, T. (eds.) ECCV 2022. LNCS, vol. 13688, pp. 640\u2013658. Springer, Cham (2022). https:\/\/doi.org\/10.1007\/978-3-031-19815-1_37"},{"key":"6_CR6","unstructured":"Cheng, H.K., Tai, Y.W., Tang, C.K.: Rethinking spacetime networks with improved memory coverage for efficient video object segmentation. In: NeurIPS, pp. 11781\u201311794 (2021)"},{"key":"6_CR7","doi-asserted-by":"crossref","unstructured":"Cheng, H., Tau, Y., Tang, C.: Modular interactive video object segmentation: interaction-to-mask, propagation and difference-aware fusion. In: CVPR (2021)","DOI":"10.1109\/CVPR46437.2021.00551"},{"key":"6_CR8","doi-asserted-by":"crossref","unstructured":"Cheng, H.K., Chung, J., Tai, Y.W., Tang, C.K.: CascadePSP: toward class-agnostic and very high-resolution segmentation via global and local refinement. In: CVPR, pp. 8890\u20138899 (2020)","DOI":"10.1109\/CVPR42600.2020.00891"},{"key":"6_CR9","doi-asserted-by":"crossref","unstructured":"Cheng, J., Tsai, Y., Hung, W., Wang, S., Yang, M.: Fast and accurate online video object segmentation via tracking parts. In: CVPR (2018)","DOI":"10.1109\/CVPR.2018.00774"},{"key":"6_CR10","doi-asserted-by":"crossref","unstructured":"Cui, Y., Jiang, C., Wang, L., Wu, G.: MixFormer: end-to-end tracking with iterative mixed attention. In: CVPR, pp. 13608\u201313618 (2022)","DOI":"10.1109\/CVPR52688.2022.01324"},{"key":"6_CR11","doi-asserted-by":"crossref","unstructured":"Duke, B., Ahmed, A., Wolf, C., Taylor, G.W.: SSTVOS: sparse spatiotemporal transformers for video object segmentation. In: CVPR, pp. 5912\u20135921 (2021)","DOI":"10.1109\/CVPR46437.2021.00585"},{"key":"6_CR12","doi-asserted-by":"crossref","unstructured":"Ge, W., Lu, X., Shen, J.: Video object segmentation using global and instance embedding learning. In: CVPR (2021)","DOI":"10.1109\/CVPR46437.2021.01656"},{"key":"6_CR13","doi-asserted-by":"crossref","unstructured":"Hong, L., et al.: LVOS: a benchmark for long-term video object segmentation. In: ICCV (2023)","DOI":"10.1109\/ICCV51070.2023.01240"},{"key":"6_CR14","doi-asserted-by":"crossref","unstructured":"Hu, P., Wang, G., Kong, X., Kuen, J., Tan, Y.P.: Motion-guided cascaded refinement network for video object segmentation. In: CVPR (2018)","DOI":"10.1109\/CVPR.2018.00152"},{"key":"6_CR15","unstructured":"Hu, Y.T., Huang, J.B., Schwing, A.: MaskRNN: instance level video object segmentation. In: NeurIPS (2017)"},{"key":"6_CR16","unstructured":"Kingma, D.P., Ba, J.L.: Adam: a method for stochastic optimization. arXiv preprint arXiv:1412.6980 (2014)"},{"key":"6_CR17","unstructured":"Li, L., et al.: Panoptic scene graph generation with semantics-prototype learning. arXiv preprint arXiv:2307.15567 (2023)"},{"key":"6_CR18","doi-asserted-by":"crossref","unstructured":"Li, M., Hu, L., Xiong, Z., Zhang, B., Pan, P., Liu, D.: Recurrent dynamic embedding for video object segmentation. In: CVPR (2022)","DOI":"10.1109\/CVPR52688.2022.00139"},{"key":"6_CR19","doi-asserted-by":"crossref","unstructured":"Li, X., Wei, T., Chen, Y.P., Tai, Y.W., Tang, C.K.: FSS-1000: a 1000-class dataset for few-shot segmentation. In: CVPR (2020)","DOI":"10.1109\/CVPR42600.2020.00294"},{"key":"6_CR20","doi-asserted-by":"crossref","unstructured":"Li, X., Loy, C.C.: Video object segmentation with joint re-identification and attention-aware mask propagation. In: ECCV (2018)","DOI":"10.1007\/978-3-030-01219-9_6"},{"key":"6_CR21","unstructured":"Liang, Y., Li, X., Jafari, N., Chen, J.: Video object segmentation with adaptive feature bank and uncertain-region refinement. In: NeurIPS (2020)"},{"key":"6_CR22","unstructured":"Liang, Y., Li, X., Jafari, N., Chen, J.: Video object segmentation with adaptive feature bank and uncertain-region refinement. In: Larochelle, H., Ranzato, M., Hadsell, R., Balcan, M.F., Lin, H.T. (eds.) NeurIPS, vol.\u00a033, pp. 3430\u20133441. Curran Associates, Inc. (2020)"},{"key":"6_CR23","doi-asserted-by":"crossref","unstructured":"Luiten, J., Voigtlaender, P., Leibe, B.: PReMVOS: proposal-generation, refinement and merging for video object segmentation. In: CVPR, pp. 565\u2013580 (2018)","DOI":"10.1007\/978-3-030-20870-7_35"},{"key":"6_CR24","doi-asserted-by":"crossref","unstructured":"Mao, Y., Wang, N., Zhao, W., Li, H.: Joint inductive and transductive learning for video object segmentation. In: ICCV (2021)","DOI":"10.1109\/ICCV48922.2021.00953"},{"key":"6_CR25","doi-asserted-by":"crossref","unstructured":"Oh, S.W., Lee, J.Y., Xu, N., Kim, S.J.: Video object segmentation using space-time memory networks. In: ICCV, pp. 9226\u20139235 (2019)","DOI":"10.1109\/ICCV.2019.00932"},{"key":"6_CR26","unstructured":"Pont-Tuset, J., Perazzi, F., Caelles, S., Arbel\u00e1ez, P., Sorkine-Hornung, A., Van\u00a0Gool, L.: The 2017 DAVIS challenge on video object segmentation. arXiv preprint arXiv:1704.00675 (2017)"},{"key":"6_CR27","unstructured":"Seeing, H., Oh, S., Lee, J., Lee, S., Lee, S., Kim, E.: Hierarchical memory matching network for video object segmentation. In: ICCV (2021)"},{"issue":"4","key":"6_CR28","doi-asserted-by":"publisher","first-page":"717","DOI":"10.1109\/TPAMI.2015.2465960","volume":"38","author":"J Shi","year":"2016","unstructured":"Shi, J., Yan, Q., Xu, L., Jia, J.: Hierarchical image saliency detection on extended CSSD. IEEE Trans. Pattern Anal. Mach. Intell. 38(4), 717\u2013729 (2016)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"6_CR29","unstructured":"Vaswani, A., et al.: Attention is all you need. In: NeurIPS (2017)"},{"key":"6_CR30","doi-asserted-by":"crossref","unstructured":"Voigtlaender, P., Chai, Y., Schroff, F., Adam, H., Chen, L.: FEELVOS: fast end-to-end embedding learning for video object segmentation. In: CVPR, pp. 9481\u20139490 (2019)","DOI":"10.1109\/CVPR.2019.00971"},{"key":"6_CR31","doi-asserted-by":"crossref","unstructured":"Voigtlaender, P., Leibe, B.: Online adaptation of convolutional neural networks for video object segmentation. In: BMVC (2017)","DOI":"10.5244\/C.31.116"},{"key":"6_CR32","doi-asserted-by":"crossref","unstructured":"Wang, H., Jiang, X., Ren, H., Hu, Y., Bai, S.: SwiftNet: real-time video object segmentation. In: CVPR (2021)","DOI":"10.1109\/CVPR46437.2021.00135"},{"key":"6_CR33","doi-asserted-by":"crossref","unstructured":"Wang, J., et al.: Look before you match: instance understanding matters in video object segmentation. In: CVPR (2023)","DOI":"10.1109\/CVPR52729.2023.00225"},{"key":"6_CR34","doi-asserted-by":"crossref","unstructured":"Wang, L., et al.: Learning to detect salient objects with image-level supervision. In: CVPR (2017)","DOI":"10.1109\/CVPR.2017.404"},{"key":"6_CR35","doi-asserted-by":"crossref","unstructured":"Wang, Q., Zhang, L., Bertinetto, L., Hu, W., Torr, P.H.: Fast online object tracking and segmentation: a unifying approach. In: CVPR (2019)","DOI":"10.1109\/CVPR.2019.00142"},{"key":"6_CR36","doi-asserted-by":"crossref","unstructured":"Wu, Q., Yang, T., Wu, W., Chan, A.: Scalable video object segmentation with simplified framework. In: ICCV (2023)","DOI":"10.1109\/ICCV51070.2023.01276"},{"key":"6_CR37","doi-asserted-by":"crossref","unstructured":"Xia, Y., et al.: SOE-Net: a self-attention and orientation encoding network for point cloud-based place recognition. In: CVPR (2021)","DOI":"10.1109\/CVPR46437.2021.01119"},{"key":"6_CR38","unstructured":"Xu, M., Xiong, Y., Chen, H., Li, X., Xia, W., Tu, Z., Soatto, S.: Long short-term transformer for online action detection. In: NeurIPS, vol. 34, pp. 1086\u20131099 (2021)"},{"key":"6_CR39","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"603","DOI":"10.1007\/978-3-030-01228-1_36","volume-title":"Computer Vision \u2013 ECCV 2018","author":"N Xu","year":"2018","unstructured":"Xu, N., et al.: YouTube-VOS: sequence-to-sequence video object segmentation. In: Ferrari, V., Hebert, M., Sminchisescu, C., Weiss, Y. (eds.) ECCV 2018. LNCS, vol. 11209, pp. 603\u2013619. Springer, Cham (2018). https:\/\/doi.org\/10.1007\/978-3-030-01228-1_36"},{"key":"6_CR40","doi-asserted-by":"crossref","unstructured":"Xu, X., Wang, J., Ming, X., Lu, Y.: Towards robust video object segmentation with adaptive object calibration. In: ACM MM (2022)","DOI":"10.1145\/3503161.3547824"},{"key":"6_CR41","doi-asserted-by":"crossref","unstructured":"Yang, J., et\u00a0al.: Panoptic video scene graph generation. In: CVPR, pp. 18675\u201318685 (2023)","DOI":"10.1109\/CVPR52729.2023.01791"},{"key":"6_CR42","doi-asserted-by":"crossref","unstructured":"Yang, L., Wang, Y., Xiong, X.: Efficient video object segmentation via network modulation. In: CVPR, pp. 6499\u20136507 (2018)","DOI":"10.1109\/CVPR.2018.00680"},{"key":"6_CR43","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"332","DOI":"10.1007\/978-3-030-58558-7_20","volume-title":"Computer Vision \u2013 ECCV 2020","author":"Z Yang","year":"2020","unstructured":"Yang, Z., Wei, Y., Yang, Y.: Collaborative video object segmentation by foreground-background integration. In: Vedaldi, A., Bischof, H., Brox, T., Frahm, J.-M. (eds.) ECCV 2020. LNCS, vol. 12350, pp. 332\u2013348. Springer, Cham (2020). https:\/\/doi.org\/10.1007\/978-3-030-58558-7_20"},{"key":"6_CR44","unstructured":"Yang, Z., Wei, Y., Yang, Y.: Associating objects with transformers for video object segmentation. In: NeurIPS (2021)"},{"key":"6_CR45","unstructured":"Yang, Z., Yang, Y.: Decoupling features in hierarchical propagation for video object segmentation. In: NeurIPS (2022)"},{"key":"6_CR46","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"341","DOI":"10.1007\/978-3-031-20047-2_20","volume-title":"Computer Vision \u2013 ECCV 2022","author":"B Ye","year":"2022","unstructured":"Ye, B., Chang, H., Ma, B., Shan, S., Chen, X.: Joint feature learning and relation modeling for tracking: a one-stream framework. In: Avidan, S., Brostow, G., Ciss\u00e9, M., Farinella, G.M., Hassner, T. (eds.) ECCV 2022. LNCS, vol. 13682, pp. 341\u2013357. Springer, Cham (2022). https:\/\/doi.org\/10.1007\/978-3-031-20047-2_20"},{"key":"6_CR47","doi-asserted-by":"crossref","unstructured":"Yoo, J.S., Lee, H., Jung, S.W.: Video object segmentation-aware video frame interpolation. In: ICCV, pp. 12322\u201312333 (2023)","DOI":"10.1109\/ICCV51070.2023.01132"},{"key":"6_CR48","doi-asserted-by":"crossref","unstructured":"Zeng, Y., Zhang, P., Zhang, J., Lin, Z., Lu, H.: Towards high-resolution salient object detection. In: ICCV (2019)","DOI":"10.1109\/ICCV.2019.00733"},{"key":"6_CR49","doi-asserted-by":"crossref","unstructured":"Zhang, Y., Wu, Z., Peng, H., Lin, S.: A transductive approach for video object segmentation. In: CVPR (2020)","DOI":"10.1109\/CVPR42600.2020.00698"},{"key":"6_CR50","doi-asserted-by":"crossref","unstructured":"Zhang, Y., Li, L., Wang, W., Xie, R., Song, L., Zhang, W.: Boosting video object segmentation via space-time correspondence learning. In: CVPR (2023)","DOI":"10.1109\/CVPR52729.2023.00223"}],"container-title":["Lecture Notes in Computer Science","Computer Vision \u2013 ECCV 2024"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-031-72855-6_6","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,11,8]],"date-time":"2024-11-08T19:03:55Z","timestamp":1731092635000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-3-031-72855-6_6"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,11,9]]},"ISBN":["9783031728549","9783031728556"],"references-count":50,"URL":"https:\/\/doi.org\/10.1007\/978-3-031-72855-6_6","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024,11,9]]},"assertion":[{"value":"9 November 2024","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"ECCV","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"European Conference on Computer Vision","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Milan","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Italy","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2024","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"29 September 2024","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"4 October 2024","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"18","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"eccv2024","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/eccv2024.ecva.net\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}