{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,12,10]],"date-time":"2025-12-10T04:16:02Z","timestamp":1765340162403,"version":"3.46.0"},"publisher-location":"New York, NY, USA","reference-count":77,"publisher":"ACM","funder":[{"name":"Scientific and Techno- logical innovation action plan of Shanghai Science and Technology Committee","award":["No.22511101502"],"award-info":[{"award-number":["No.22511101502"]}]},{"name":"CAAI-Lenovo Blue Sky Re- search Fund","award":["No. CAAI-LXJJ 2024-05"],"award-info":[{"award-number":["No. CAAI-LXJJ 2024-05"]}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2025,10,27]]},"DOI":"10.1145\/3746027.3755848","type":"proceedings-article","created":{"date-parts":[[2025,10,25]],"date-time":"2025-10-25T07:38:54Z","timestamp":1761377934000},"page":"796-805","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":0,"title":["Shallow Features Matter: Hierarchical Memory with Heterogeneous Interaction for Unsupervised Video Object Segmentation"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0009-0004-6104-1647","authenticated-orcid":false,"given":"Xiangyu","family":"Zheng","sequence":"first","affiliation":[{"name":"Shanghai Key Lab of Intelligent Information Processing, College of Computer Science and Artificial Intelligence, Fudan University, Shanghai, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0008-1496-7585","authenticated-orcid":false,"given":"Songcheng","family":"He","sequence":"additional","affiliation":[{"name":"Shanghai Key Lab of Intelligent Information Processing, College of Computer Science and Artificial Intelligence, Fudan University, Shanghai, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-9224-1618","authenticated-orcid":false,"given":"Wanyun","family":"Li","sequence":"additional","affiliation":[{"name":"Shanghai Key Lab of Intelligent Information Processing, College of Computer Science and Artificial Intelligence, Fudan University, Shanghai, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-7243-2783","authenticated-orcid":false,"given":"Xiaoqiang","family":"Li","sequence":"additional","affiliation":[{"name":"The School of Computer Engineering and Science, Shanghai University, Shang hai, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-2358-8543","authenticated-orcid":false,"given":"Wei","family":"Zhang","sequence":"additional","affiliation":[{"name":"Shanghai Key Lab of Intelligent Information Processing, College of Computer Science and Artificial Intelligence, Fudan University, Shanghai, China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2025,10,27]]},"reference":[{"key":"e_1_3_2_1_1_1","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2010.2101613"},{"key":"e_1_3_2_1_2_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-15555-0_21"},{"key":"e_1_3_2_1_3_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2011.5995508"},{"key":"e_1_3_2_1_4_1","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2015.2481711"},{"key":"e_1_3_2_1_5_1","first-page":"3151","volume-title":"2024 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","author":"Cheng Ho Kei","year":"2023","unstructured":"Ho Kei Cheng, Seoung Wug Oh, Brian L. Price, Joon-Young Lee, and Alexander G. Schwing. 2023. Putting the Object Back into Video Object Segmentation. 2024 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2023), 3151-3161. https:\/\/api.semanticscholar.org\/CorpusID:264305820"},{"volume-title":"European Conference on Computer Vision. https:\/\/api.semanticscholar.org\/CorpusID:250526250","author":"Cheng Ho Kei","key":"e_1_3_2_1_6_1","unstructured":"Ho Kei Cheng and Alexander G. Schwing. 2022. XMem: Long-Term Video Object Segmentation with an Atkinson-Shiffrin Memory Model. In European Conference on Computer Vision. https:\/\/api.semanticscholar.org\/CorpusID:250526250"},{"key":"e_1_3_2_1_7_1","unstructured":"Ho Kei Cheng Yu-Wing Tai and Chi-Keung Tang. 2021. Rethinking Space-Time Networks with Improved Memory Coverage for Efficient Video Object Segmentation. In Neural Information Processing Systems. https:\/\/api.semanticscholar.org\/CorpusID:235376958"},{"key":"e_1_3_2_1_8_1","volume-title":"Dual Prototype Attention for Unsupervised Video Object Segmentation. 2024 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2022)","author":"Cho Suhwan","year":"2022","unstructured":"Suhwan Cho, Minhyeok Lee, Seunghoon Lee, Dogyoon Lee, and Sangyoun Lee. 2022a. Dual Prototype Attention for Unsupervised Video Object Segmentation. 2024 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2022), 19238-19247. https:\/\/api.semanticscholar.org\/CorpusID:257532674"},{"key":"e_1_3_2_1_9_1","first-page":"5129","volume-title":"2023 IEEE\/CVF Winter Conference on Applications of Computer Vision (WACV)","author":"Cho Suhwan","year":"2022","unstructured":"Suhwan Cho, Minhyeok Lee, Seung-Hyun Lee, Chaewon Park, Donghyeon Kim, and Sangyoun Lee. 2022b. Treating Motion as Option to Reduce Motion Dependency in Unsupervised Video Object Segmentation. 2023 IEEE\/CVF Winter Conference on Applications of Computer Vision (WACV) (2022), 5129-5138. https:\/\/api.semanticscholar.org\/CorpusID:252111197"},{"key":"e_1_3_2_1_10_1","first-page":"3150","volume-title":"2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)","author":"Dai Jifeng","year":"2015","unstructured":"Jifeng Dai, Kaiming He, and Jian Sun. 2015. Instance-Aware Semantic Segmentation via Multi-task Network Cascades. 2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (2015), 3150-3158. https:\/\/api.semanticscholar.org\/CorpusID:8510667"},{"key":"e_1_3_2_1_11_1","doi-asserted-by":"publisher","DOI":"10.1109\/JPROC.2002.801448"},{"key":"e_1_3_2_1_12_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00875"},{"key":"e_1_3_2_1_13_1","doi-asserted-by":"publisher","DOI":"10.1145\/3581783.3612017"},{"key":"e_1_3_2_1_14_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2012.6247883"},{"key":"e_1_3_2_1_15_1","doi-asserted-by":"publisher","DOI":"10.5555\/1698924.1699081"},{"key":"e_1_3_2_1_16_1","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2017.2729019"},{"key":"e_1_3_2_1_17_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7299114"},{"key":"e_1_3_2_1_18_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2013.6631249"},{"key":"e_1_3_2_1_19_1","first-page":"770","volume-title":"Deep Residual Learning for Image Recognition. 2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (2015","author":"He Kaiming","year":"2015","unstructured":"Kaiming He, X. Zhang, Shaoqing Ren, and Jian Sun. 2015. Deep Residual Learning for Image Recognition. 2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (2015), 770-778. https:\/\/api.semanticscholar.org\/CorpusID:206594692"},{"key":"e_1_3_2_1_20_1","doi-asserted-by":"publisher","DOI":"10.1145\/3581783.3611804"},{"key":"e_1_3_2_1_21_1","first-page":"9914","volume-title":"DAFormer: Improving Network Architectures and Training Strategies for Domain-Adaptive Semantic Segmentation. 2022 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","author":"Hoyer Lukas","year":"2021","unstructured":"Lukas Hoyer, Dengxin Dai, and Luc Van Gool. 2021. DAFormer: Improving Network Architectures and Training Strategies for Domain-Adaptive Semantic Segmentation. 2022 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2021), 9914-9925. https:\/\/api.semanticscholar.org\/CorpusID:244729413"},{"key":"e_1_3_2_1_22_1","volume-title":"LoRA: Low-Rank Adaptation of Large Language Models. ArXiv","author":"Hu J. Edward","year":"2021","unstructured":"J. Edward Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, and Weizhu Chen. 2021. LoRA: Low-Rank Adaptation of Large Language Models. ArXiv, Vol. abs\/2106.09685 (2021). https:\/\/api.semanticscholar.org\/CorpusID:235458009"},{"key":"e_1_3_2_1_23_1","doi-asserted-by":"publisher","DOI":"10.1007\/s41095-021-0262-4"},{"key":"e_1_3_2_1_24_1","volume-title":"AAAI Conference on Artificial Intelligence. https:\/\/api.semanticscholar.org\/CorpusID:208176127","author":"Jiao Wenxiang","year":"2019","unstructured":"Wenxiang Jiao, Michael R. Lyu, and Irwin King. 2019. Real-Time Emotion Recognition via Attention Gated Hierarchical Memory Network. In AAAI Conference on Artificial Intelligence. https:\/\/api.semanticscholar.org\/CorpusID:208176127"},{"key":"e_1_3_2_1_25_1","doi-asserted-by":"crossref","unstructured":"Dejiang Kong and Fei Wu. 2018. HST-LSTM: A Hierarchical Spatial-Temporal Long-Short Term Memory Network for Location Prediction. In International Joint Conference on Artificial Intelligence. https:\/\/api.semanticscholar.org\/CorpusID:51606411","DOI":"10.24963\/ijcai.2018\/324"},{"key":"e_1_3_2_1_26_1","first-page":"3807","volume-title":"Guided Slot Attention for Unsupervised Video Object Segmentation. 2024 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","author":"Lee Minhyeok","year":"2023","unstructured":"Minhyeok Lee, Suhwan Cho, Dogyoon Lee, Chaewon Park, Jungho Lee, and Sangyoun Lee. 2023. Guided Slot Attention for Unsupervised Video Object Segmentation. 2024 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2023), 3807-3816. https:\/\/api.semanticscholar.org\/CorpusID:257532769"},{"key":"e_1_3_2_1_27_1","first-page":"5913","volume-title":"2023 IEEE\/CVF Winter Conference on Applications of Computer Vision (WACV) (2022","author":"Lee Minhyeok","year":"2022","unstructured":"Minhyeok Lee, Suhwan Cho, Seung-Hyun Lee, Chaewon Park, and Sangyoun Lee. 2022. Unsupervised Video Object Segmentation via Prototype Memory Network. 2023 IEEE\/CVF Winter Conference on Applications of Computer Vision (WACV) (2022), 5913-5923. https:\/\/api.semanticscholar.org\/CorpusID:252118837"},{"key":"e_1_3_2_1_28_1","volume-title":"AAAI Conference on Artificial Intelligence. https:\/\/api.semanticscholar.org\/CorpusID:245424944","author":"Lee Youngjo","year":"2021","unstructured":"Youngjo Lee, Hongje Seong, and Euntai Kim. 2021. Iteratively Selecting an Easy Reference Frame Makes Unsupervised Video Object Segmentation Easier. In AAAI Conference on Artificial Intelligence. https:\/\/api.semanticscholar.org\/CorpusID:245424944"},{"key":"e_1_3_2_1_29_1","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-012-0527-6"},{"key":"e_1_3_2_1_30_1","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2024.3404469"},{"key":"e_1_3_2_1_31_1","volume-title":"OneVOS: Unifying Video Object Segmentation with All-in-One Transformer Framework. ArXiv","author":"Li Wanyun","year":"2024","unstructured":"Wanyun Li, Pinxue Guo, Xinyu Zhou, Lingyi Hong, Yangji He, Xiangyu Zheng, Wei Zhang, and Wenqiang Zhang. 2024b. OneVOS: Unifying Video Object Segmentation with All-in-One Transformer Framework. ArXiv, Vol. abs\/2403.08682 (2024). https:\/\/api.semanticscholar.org\/CorpusID:268379457"},{"key":"e_1_3_2_1_32_1","volume-title":"F2Net: Learning to Focus on the Foreground for Unsupervised Video Object Segmentation. ArXiv","author":"Liu Daizong","year":"2020","unstructured":"Daizong Liu, Dongdong Yu, Changhu Wang, and Pan Zhou. 2020. F2Net: Learning to Focus on the Foreground for Unsupervised Video Object Segmentation. ArXiv, Vol. abs\/2012.02534 (2020). https:\/\/api.semanticscholar.org\/CorpusID:227305215"},{"key":"e_1_3_2_1_33_1","volume-title":"Depth-Aware Test-Time Training for Zero-Shot Video Object Segmentation. 2024 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2024)","author":"Liu Weihuang","year":"2024","unstructured":"Weihuang Liu, Xi Shen, Haolun Li, Xiu-Li Bi, Bo Liu, Chi-Man Pun, and Xiaodong Cun. 2024. Depth-Aware Test-Time Training for Zero-Shot Video Object Segmentation. 2024 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2024), 19218-19227. https:\/\/api.semanticscholar.org\/CorpusID:268264338"},{"key":"e_1_3_2_1_34_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00986"},{"key":"e_1_3_2_1_35_1","first-page":"3618","volume-title":"Know More: Unsupervised Video Object Segmentation With Co-Attention Siamese Networks. 2019 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2019","author":"Lu Xiankai","year":"2019","unstructured":"Xiankai Lu, Wenguan Wang, Chao Ma, Jianbing Shen, Ling Shao, and Fatih Murat Porikli. 2019. See More, Know More: Unsupervised Video Object Segmentation With Co-Attention Siamese Networks. 2019 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2019), 3618-3627. https:\/\/api.semanticscholar.org\/CorpusID:198352766"},{"key":"e_1_3_2_1_36_1","first-page":"272","article-title":"Density Based Multifeature Background Subtraction with Relevance Vector Machine","volume":"8","author":"Mageswari T. Uma","year":"2016","unstructured":"T. Uma Mageswari. 2016. Density Based Multifeature Background Subtraction with Relevance Vector Machine. Artificial Intelligent Systems and Machine Learning, Vol. 8 (2016), 272-274. https:\/\/api.semanticscholar.org\/CorpusID:64841243","journal-title":"Artificial Intelligent Systems and Machine Learning"},{"key":"e_1_3_2_1_37_1","doi-asserted-by":"crossref","unstructured":"Sabarinath Mahadevan Ali Athar Aljosa Osep Sebastian Hennen Laura Leal-Taix\u00e9 and B. Leibe. 2020. Making a Case for 3D Convolutions for Object Segmentation in Videos. ArXiv Vol. abs\/2008.11516 (2020). https:\/\/api.semanticscholar.org\/CorpusID:221319536","DOI":"10.5244\/C.34.65"},{"key":"e_1_3_2_1_38_1","unstructured":"Peter Ochs Jitendra Malik and Thomas Brox. [n.d.]. Ieee Transactions on Pattern Analysis and Machine Intelligence Segmentation of Moving Objects by Long Term Video Analysis. https:\/\/api.semanticscholar.org\/CorpusID:12351806"},{"key":"e_1_3_2_1_39_1","first-page":"9225","volume-title":"Video Object Segmentation Using Space-Time Memory Networks. 2019 IEEE\/CVF International Conference on Computer Vision (ICCV)","author":"Oh Seoung Wug","year":"2019","unstructured":"Seoung Wug Oh, Joon-Young Lee, N. Xu, and Seon Joo Kim. 2019. Video Object Segmentation Using Space-Time Memory Networks. 2019 IEEE\/CVF International Conference on Computer Vision (ICCV) (2019), 9225-9234. https:\/\/api.semanticscholar.org\/CorpusID:90262243"},{"key":"e_1_3_2_1_40_1","first-page":"1777","volume-title":"Fast Object Segmentation in Unconstrained Video. 2013 IEEE International Conference on Computer Vision (2013","author":"Papazoglou Anestis","year":"2013","unstructured":"Anestis Papazoglou and Vittorio Ferrari. 2013. Fast Object Segmentation in Unconstrained Video. 2013 IEEE International Conference on Computer Vision (2013), 1777-1784. https:\/\/api.semanticscholar.org\/CorpusID:3194346"},{"key":"e_1_3_2_1_41_1","volume-title":"Hierarchical Graph Pattern Understanding for Zero-Shot VOS. ArXiv","author":"Pei Gensheng","year":"2023","unstructured":"Gensheng Pei, Fumin Shen, Yazhou Yao, Tao Chen, Xian-Sheng Hua, and Heng Tao Shen. 2023a. Hierarchical Graph Pattern Understanding for Zero-Shot VOS. ArXiv, Vol. abs\/2312.09525 (2023). https:\/\/api.semanticscholar.org\/CorpusID:266335664"},{"key":"e_1_3_2_1_42_1","volume-title":"Hierarchical Feature Alignment Network for Unsupervised Video Object Segmentation. In European Conference on Computer Vision. https:\/\/api.semanticscholar.org\/CorpusID:250627320","author":"Pei Gensheng","year":"2022","unstructured":"Gensheng Pei, Fumin Shen, Yazhou Yao, Guosen Xie, Zhenmin Tang, and Jinhui Tang. 2022. Hierarchical Feature Alignment Network for Unsupervised Video Object Segmentation. In European Conference on Computer Vision. https:\/\/api.semanticscholar.org\/CorpusID:250627320"},{"key":"e_1_3_2_1_43_1","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2023.3267244"},{"key":"e_1_3_2_1_44_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.85"},{"key":"e_1_3_2_1_45_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2012.6248065"},{"key":"e_1_3_2_1_46_1","volume-title":"Nicolas Carion, Chao-Yuan Wu, Ross B. Girshick, Piotr Doll'ar, and Christoph Feichtenhofer.","author":"Ravi Nikhila","year":"2024","unstructured":"Nikhila Ravi, Valentin Gabeur, Yuan-Ting Hu, Ronghang Hu, Chaitanya K. Ryali, Tengyu Ma, Haitham Khedr, Roman R\u00e4dle, Chlo\u00e9 Rolland, Laura Gustafson, Eric Mintun, Junting Pan, Kalyan Vasudev Alwala, Nicolas Carion, Chao-Yuan Wu, Ross B. Girshick, Piotr Doll'ar, and Christoph Feichtenhofer. 2024. SAM 2: Segment Anything in Images and Videos. ArXiv, Vol. abs\/2408.00714 (2024). https:\/\/api.semanticscholar.org\/CorpusID:271601113"},{"key":"e_1_3_2_1_47_1","first-page":"15430","volume-title":"Reciprocal Transformations for Unsupervised Video Object Segmentation. 2021 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","author":"Ren Sucheng","year":"2021","unstructured":"Sucheng Ren, Wenxi Liu, Yongtuo Liu, Haoxin Chen, Guoqiang Han, and Shengfeng He. 2021. Reciprocal Transformations for Unsupervised Video Object Segmentation. 2021 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2021), 15430-15439. https:\/\/api.semanticscholar.org\/CorpusID:235703427"},{"key":"e_1_3_2_1_48_1","first-page":"12869","volume-title":"Hierarchical Memory Matching Network for Video Object Segmentation. 2021 IEEE\/CVF International Conference on Computer Vision (ICCV)","author":"Seong Hongje","year":"2021","unstructured":"Hongje Seong, Seoung Wug Oh, Joon-Young Lee, Seongwon Lee, Suhyeon Lee, and Euntai Kim. 2021. Hierarchical Memory Matching Network for Video Object Segmentation. 2021 IEEE\/CVF International Conference on Computer Vision (ICCV) (2021), 12869-12878. https:\/\/api.semanticscholar.org\/CorpusID:237605255"},{"key":"e_1_3_2_1_49_1","doi-asserted-by":"crossref","first-page":"731","DOI":"10.1109\/CVPR.1997.609407","volume-title":"Proceedings of IEEE Computer Society Conference on Computer Vision and Pattern Recognition","author":"Shi Jianbo","year":"1997","unstructured":"Jianbo Shi and Jitendra Malik. 1997. Normalized cuts and image segmentation. Proceedings of IEEE Computer Society Conference on Computer Vision and Pattern Recognition (1997), 731-737. https:\/\/api.semanticscholar.org\/CorpusID:14848918"},{"key":"e_1_3_2_1_50_1","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2019.2942030"},{"key":"e_1_3_2_1_51_1","first-page":"50","volume-title":"2019 International Conference on Robotics and Automation (ICRA)","author":"Siam Mennatullah","year":"2018","unstructured":"Mennatullah Siam, Chen Jiang, Steven Weikai Lu, Laura Petrich, Mahmoud Gamal, Mohamed Elhoseiny, and Martin J\u00e4gersand. 2018. Video Object Segmentation using Teacher-Student Adaptation in a Human Robot Interaction (HRI) Setting. 2019 International Conference on Robotics and Automation (ICRA) (2018), 50-56. https:\/\/api.semanticscholar.org\/CorpusID:67749821"},{"key":"e_1_3_2_1_52_1","volume-title":"Generalizable Fourier Augmentation for Unsupervised Video Object Segmentation. In AAAI Conference on Artificial Intelligence. https:\/\/api.semanticscholar.org\/CorpusID:268692695","author":"Song Huihui","year":"2024","unstructured":"Huihui Song, Tiankang Su, Yuhui Zheng, Kaihua Zhang, Bo Liu, and Dong Liu. 2024. Generalizable Fourier Augmentation for Unsupervised Video Object Segmentation. In AAAI Conference on Artificial Intelligence. https:\/\/api.semanticscholar.org\/CorpusID:268692695"},{"key":"e_1_3_2_1_53_1","volume-title":"Pyramid Dilated Deeper ConvLSTM for Video Salient Object Detection. In European Conference on Computer Vision. https:\/\/api.semanticscholar.org\/CorpusID:52954448","author":"Song Hongmei","year":"2018","unstructured":"Hongmei Song, Wenguan Wang, Sanyuan Zhao, Jianbing Shen, and Kin-Man Lam. 2018. Pyramid Dilated Deeper ConvLSTM for Video Salient Object Detection. In European Conference on Computer Vision. https:\/\/api.semanticscholar.org\/CorpusID:52954448"},{"key":"e_1_3_2_1_54_1","first-page":"5689","volume-title":"Semi Supervised Semantic Segmentation Using Generative Adversarial Network. 2017 IEEE International Conference on Computer Vision (ICCV) (2017","author":"Souly Nasim","year":"2017","unstructured":"Nasim Souly, Concetto Spampinato, and Mubarak Shah. 2017. Semi Supervised Semantic Segmentation Using Generative Adversarial Network. 2017 IEEE International Conference on Computer Vision (ICCV) (2017), 5689-5697. https:\/\/api.semanticscholar.org\/CorpusID:11996618"},{"key":"e_1_3_2_1_55_1","doi-asserted-by":"crossref","unstructured":"Tiankang Su Huihui Song Dong Liu Bo Liu and Qingshan Liu. 2023. Unsupervised video object segmentation with online adversarial self-tuning. (2023) 688-698.","DOI":"10.1109\/ICCV51070.2023.00070"},{"key":"e_1_3_2_1_56_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2011.5995364"},{"key":"e_1_3_2_1_57_1","doi-asserted-by":"publisher","DOI":"10.1007\/s10462-020-09854-1"},{"key":"e_1_3_2_1_58_1","volume-title":"Hierarchical Multi-Scale Attention for Semantic Segmentation. ArXiv","author":"Tao Andrew","year":"2020","unstructured":"Andrew Tao, Karan Sapra, and Bryan Catanzaro. 2020. Hierarchical Multi-Scale Attention for Semantic Segmentation. ArXiv, Vol. abs\/2005.10821 (2020). https:\/\/api.semanticscholar.org\/CorpusID:218763375"},{"key":"e_1_3_2_1_59_1","unstructured":"Ashish Vaswani Noam M. Shazeer Niki Parmar Jakob Uszkoreit Llion Jones Aidan N. Gomez Lukasz Kaiser and Illia Polosukhin. 2017. Attention is All you Need. In Neural Information Processing Systems. https:\/\/api.semanticscholar.org\/CorpusID:13756489"},{"key":"e_1_3_2_1_60_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00933"},{"key":"e_1_3_2_1_61_1","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2015.2460013"},{"key":"e_1_3_2_1_62_1","first-page":"3059","volume-title":"Learning Unsupervised Video Object Segmentation Through Visual Attention. 2019 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","author":"Wang Wenguan","year":"2019","unstructured":"Wenguan Wang, Hongmei Song, Shuyang Zhao, Jianbing Shen, Sanyuan Zhao, Steven C. H. Hoi, and Haibin Ling. 2019b. Learning Unsupervised Video Object Segmentation Through Visual Attention. 2019 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2019), 3059-3069. https:\/\/api.semanticscholar.org\/CorpusID:92995115"},{"key":"e_1_3_2_1_63_1","first-page":"4238","volume-title":"Semi-Supervised Semantic Segmentation Using Unreliable Pseudo-Labels. 2022 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","author":"Wang Yuchao","year":"2022","unstructured":"Yuchao Wang, Haochen Wang, Yujun Shen, Jingjing Fei, Wei Li, Guoqiang Jin, Liwei Wu, Rui Zhao, and Xinyi Le. 2022. Semi-Supervised Semantic Segmentation Using Unreliable Pseudo-Labels. 2022 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2022), 4238-4247. https:\/\/api.semanticscholar.org\/CorpusID:247315180"},{"key":"e_1_3_2_1_64_1","volume-title":"CBAM: Convolutional Block Attention Module. ArXiv","author":"Woo Sanghyun","year":"2018","unstructured":"Sanghyun Woo, Jongchan Park, Joon-Young Lee, and In-So Kweon. 2018. CBAM: Convolutional Block Attention Module. ArXiv, Vol. abs\/1807.06521 (2018). https:\/\/api.semanticscholar.org\/CorpusID:49867180"},{"key":"e_1_3_2_1_65_1","unstructured":"Enze Xie Wenhai Wang Zhiding Yu Anima Anandkumar Jos\u00e9 Manuel \u00c1lvarez and Ping Luo. 2021. SegFormer: Simple and Efficient Design for Semantic Segmentation with Transformers. In Neural Information Processing Systems. https:\/\/api.semanticscholar.org\/CorpusID:235254713"},{"volume-title":"YouTube-VOS: Sequence-to-Sequence Video Object Segmentation. In European Conference on Computer Vision. https:\/\/api.semanticscholar.org\/CorpusID:52154988","author":"Xu N.","key":"e_1_3_2_1_66_1","unstructured":"N. Xu, L. Yang, Yuchen Fan, Jianchao Yang, Dingcheng Yue, Yuchen Liang, Brian L. Price, Scott D. Cohen, and Thomas S. Huang. 2018. YouTube-VOS: Sequence-to-Sequence Video Object Segmentation. In European Conference on Computer Vision. https:\/\/api.semanticscholar.org\/CorpusID:52154988"},{"key":"e_1_3_2_1_67_1","first-page":"1544","volume-title":"Learning Motion-Appearance Co-Attention for Zero-Shot Video Object Segmentation. 2021 IEEE\/CVF International Conference on Computer Vision (ICCV)","author":"Yang Shu-Hsiang","year":"2021","unstructured":"Shu-Hsiang Yang, Lu Zhang, Jinqing Qi, Huchuan Lu, Shuo Wang, and Xiaoxing Zhang. 2021b. Learning Motion-Appearance Co-Attention for Zero-Shot Video Object Segmentation. 2021 IEEE\/CVF International Conference on Computer Vision (ICCV) (2021), 1544-1553. https:\/\/api.semanticscholar.org\/CorpusID:244306379"},{"key":"e_1_3_2_1_68_1","first-page":"931","volume-title":"Anchor Diffusion for Unsupervised Video Object Segmentation. 2019 IEEE\/CVF International Conference on Computer Vision (ICCV) (2019","author":"Yang Zhao","year":"2017","unstructured":"Zhao Yang, Qiang Wang, Luca Bertinetto, Weiming Hu, Song Bai, and Philip H. S. Torr. 2019. Anchor Diffusion for Unsupervised Video Object Segmentation. 2019 IEEE\/CVF International Conference on Computer Vision (ICCV) (2019), 931-940. https:\/\/api.semanticscholar.org\/CorpusID:201710064"},{"key":"e_1_3_2_1_69_1","unstructured":"Zongxin Yang Yunchao Wei and Yi Yang. 2021a. Associating Objects with Transformers for Video Object Segmentation. In Neural Information Processing Systems. https:\/\/api.semanticscholar.org\/CorpusID:235352901"},{"key":"e_1_3_2_1_70_1","volume-title":"Radev","author":"Yu Tao","year":"2018","unstructured":"Tao Yu, Rui Zhang, Kai-Chou Yang, Michihiro Yasunaga, Dongxu Wang, Zifan Li, James Ma, Irene Z Li, Qingning Yao, Shanelle Roman, Zilin Zhang, and Dragomir R. Radev. 2018. Spider: A Large-Scale Human-Labeled Dataset for Complex and Cross-Domain Semantic Parsing and Text-to-SQL Task. ArXiv, Vol. abs\/1809.08887 (2018). https:\/\/api.semanticscholar.org\/CorpusID:52815560"},{"key":"e_1_3_2_1_71_1","first-page":"966","volume-title":"Isomer: Isomerous Transformer for Zero-shot Video Object Segmentation. 2023 IEEE\/CVF International Conference on Computer Vision (ICCV)","author":"Yuan Yichen","year":"2023","unstructured":"Yichen Yuan, Yifan Wang, Lijun Wang, Xiaoqi Zhao, Huchuan Lu, Yu Wang, Wei Su, and Lei Zhang. 2023. Isomer: Isomerous Transformer for Zero-shot Video Object Segmentation. 2023 IEEE\/CVF International Conference on Computer Vision (ICCV) (2023), 966-976. https:\/\/api.semanticscholar.org\/CorpusID:260887437"},{"key":"e_1_3_2_1_72_1","first-page":"8761","volume-title":"Deep Transport Network for Unsupervised Video Object Segmentation. 2021 IEEE\/CVF International Conference on Computer Vision (ICCV)","author":"Zhang Kaihua","year":"2021","unstructured":"Kaihua Zhang, Zicheng Zhao, Dong Liu, Qingshan Liu, and Bo Liu. 2021. Deep Transport Network for Unsupervised Video Object Segmentation. 2021 IEEE\/CVF International Conference on Computer Vision (ICCV) (2021), 8761-8770. https:\/\/api.semanticscholar.org\/CorpusID:245022221"},{"key":"e_1_3_2_1_73_1","volume-title":"Unsupervised Video Object Segmentation with Joint Hotspot Tracking. In European Conference on Computer Vision. https:\/\/api.semanticscholar.org\/CorpusID:226842087","author":"Zhang Lu","year":"2020","unstructured":"Lu Zhang, Jianming Zhang, Zhe L. Lin, Radom\u00edr M?ch, Huchuan Lu, and You He. 2020. Unsupervised Video Object Segmentation with Joint Hotspot Tracking. In European Conference on Computer Vision. https:\/\/api.semanticscholar.org\/CorpusID:226842087"},{"key":"e_1_3_2_1_74_1","volume-title":"Learning Discriminative Feature with CRF for Unsupervised Video Object Segmentation. ArXiv","author":"Zhen Mingmin","year":"2020","unstructured":"Mingmin Zhen, Shiwei Li, Lei Zhou, Jiaxiang Shang, Haoan Feng, Tian Fang, and Long Quan. 2020. Learning Discriminative Feature with CRF for Unsupervised Video Object Segmentation. ArXiv, Vol. abs\/2008.01270 (2020). https:\/\/api.semanticscholar.org\/CorpusID:220961430"},{"key":"e_1_3_2_1_75_1","unstructured":"Xiangyu Zheng Wanyun Li Songcheng He Xiaoqiang Li and We Zhang. 2025. Intrinsic Saliency Guided Trunk-Collateral Network for Unsupervised Video Object Segmentation. arXiv:2504.05904 [cs.CV] https:\/\/arxiv.org\/abs\/2504.05904"},{"key":"e_1_3_2_1_76_1","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2020.3013162"},{"volume-title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","author":"Zhuge Yunzhi","key":"e_1_3_2_1_77_1","unstructured":"Yunzhi Zhuge, Hongyu Gu, Lu Zhang, Jinqing Qi, and Huchuan Lu. 2024. Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation. IEEE transactions on neural networks and learning systems, Vol. PP (2024). https:\/\/api.semanticscholar.org\/CorpusID:271062835"}],"event":{"name":"MM '25: The 33rd ACM International Conference on Multimedia","sponsor":["SIGMM ACM Special Interest Group on Multimedia"],"location":"Dublin Ireland","acronym":"MM '25"},"container-title":["Proceedings of the 33rd ACM International Conference on Multimedia"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3746027.3755848","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,12,10]],"date-time":"2025-12-10T04:13:59Z","timestamp":1765340039000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3746027.3755848"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,10,27]]},"references-count":77,"alternative-id":["10.1145\/3746027.3755848","10.1145\/3746027"],"URL":"https:\/\/doi.org\/10.1145\/3746027.3755848","relation":{},"subject":[],"published":{"date-parts":[[2025,10,27]]},"assertion":[{"value":"2025-10-27","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}