{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,12,9]],"date-time":"2025-12-09T19:51:51Z","timestamp":1765309911781,"version":"3.46.0"},"publisher-location":"New York, NY, USA","reference-count":47,"publisher":"ACM","funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62371343"],"award-info":[{"award-number":["62371343"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"name":"Shanghai Municipal Science and Technology Major Project","award":["2021SHZDZX0100"],"award-info":[{"award-number":["2021SHZDZX0100"]}]},{"name":"National Key R&D Program of China","award":["2022YFB3305902"],"award-info":[{"award-number":["2022YFB3305902"]}]},{"DOI":"10.13039\/501100012226","name":"Fundamental Research Funds for the Central Universities","doi-asserted-by":"publisher","award":["2024-1-ZD-02"],"award-info":[{"award-number":["2024-1-ZD-02"]}],"id":[{"id":"10.13039\/501100012226","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2025,10,27]]},"DOI":"10.1145\/3746027.3755222","type":"proceedings-article","created":{"date-parts":[[2025,10,25]],"date-time":"2025-10-25T07:26:38Z","timestamp":1761377198000},"page":"3856-3864","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":0,"title":["WaveCL: Wavelet Calibration Learning for Referring Video Object Segmentation"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-8610-8172","authenticated-orcid":false,"given":"Ran","family":"Chen","sequence":"first","affiliation":[{"name":"Tongji University, Shanghai, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-4357-1095","authenticated-orcid":false,"given":"Taiyi","family":"Su","sequence":"additional","affiliation":[{"name":"Tongji University, Shanghai, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-9999-4871","authenticated-orcid":false,"given":"Hanli","family":"Wang","sequence":"additional","affiliation":[{"name":"Tongji University, Shanghai, China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2025,10,27]]},"reference":[{"key":"e_1_3_2_1_1_1","first-page":"4985","volume-title":"Proc. CVPR'22","author":"Botach A.","unstructured":"A. Botach, E. Zheltonozhskii, and C. Baskin. 2022. End-to-End Referring Video Object Segmentation with Multimodal Transformers. In Proc. CVPR'22. 4985-4995."},{"key":"e_1_3_2_1_2_1","first-page":"4416","volume-title":"Proc. ACMMM'22","author":"Chen W. D.","unstructured":"W. D. Chen, D. X. Hong, Y. K. Qi, Z. J. Han, S. H. Wang, L. Y. Qing, Q. M. Huang, and G. R. Li. 2022. Multi-attention Network for Compressed Video Referring Object Segmentation. In Proc. ACMMM'22. 4416-4425."},{"key":"e_1_3_2_1_3_1","first-page":"3435","volume-title":"Proc. ICCV'19","author":"Chen Y.","unstructured":"Y. Chen, H. Fan, B. Xu, Z. Yan, Y. Kalantidis, M. Rohrbach, S. Yan, and J. Feng. 2019. Drop an Octave: Reducing Spatial Redundancy in Convolutional Neural Networks With Octave Convolution. In Proc. ICCV'19. 3435-3444."},{"key":"e_1_3_2_1_4_1","first-page":"4964","volume-title":"Proc. CVPR'22","author":"Ding Z. H.","unstructured":"Z. H. Ding, T. R. Hui, J. S. Huang, X. M. Wei, J. Z. Han, and S. Liu. 2022. Language-bridged Spatial-temporal Interaction for Referring Video Object Segmentation. In Proc. CVPR'22. 4964-4973."},{"key":"e_1_3_2_1_5_1","unstructured":"Z. H. Ding T. R. Hui S. F. Huang S. Liu X. Luo J. S. Huang and X. M. Wei. 2021. Progressive Multimodal Interaction Network for Referring Video Object Segmentation. The 3rd Large-scale Video Object Segmentation Challenge (2021)."},{"key":"e_1_3_2_1_6_1","first-page":"363","volume-title":"Proc. ECCV'24","author":"Finder S. E.","unstructured":"S. E. Finder, R. Amoyal, E. Treister, and O. Freifeld. 2024. Wavelet Convolutions for Large Receptive Fields. In Proc. ECCV'24. 363-380."},{"key":"e_1_3_2_1_7_1","first-page":"1","article-title":"Swagan","volume":"40","author":"Gal R.","year":"2021","unstructured":"R. Gal, D. C. Hochberg, A. Bermano, and D. Cohen-Or. 2021. Swagan: A Style-based Wavelet-driven Generative Model. ACM Trans. Graph., Vol. 40 (2021), 1-11.","journal-title":"A Style-based Wavelet-driven Generative Model. ACM Trans. Graph."},{"key":"e_1_3_2_1_8_1","first-page":"2473","volume-title":"Proc. CVPR'24","author":"Garg M.","unstructured":"M. Garg, D. Ghosh, and P. M. Pradhan. 2024. GestFormer: Multiscale Wavelet Pooling Transformer Network for Dynamic Hand Gesture Recognition. In Proc. CVPR'24. 2473-2483."},{"key":"e_1_3_2_1_9_1","first-page":"5958","volume-title":"Proc. CVPR'18","author":"Gavrilyuk K.","unstructured":"K. Gavrilyuk, A. Ghodrati, Z. Y. Li, and C. G. Snoek. 2018. Actor and Action Video Segmentation from A Sentence. In Proc. CVPR'18. 5958-5966."},{"key":"e_1_3_2_1_10_1","doi-asserted-by":"publisher","DOI":"10.1038\/nrn3476"},{"key":"e_1_3_2_1_11_1","first-page":"478","volume-title":"Proc. NeurIPS'22","author":"Guth F.","unstructured":"F. Guth, S. Coste, V. De Bortoli, and S. Mallat. 2022. Wavelet Score-based Generative Modeling. In Proc. NeurIPS'22. 478-491."},{"key":"e_1_3_2_1_12_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.187"},{"key":"e_1_3_2_1_13_1","first-page":"13414","volume-title":"Proc. ICCV'23","author":"Han M. F.","unstructured":"M. F. Han, Y. L. Wang, Z. H. Li, L. N. Yao, X. J. Chang, and Y. Qiao. 2023. HTML: Hybrid Temporal-scale Multimodal Learning Framework for Referring Video Object Segmentation. In Proc. ICCV'23. 13414-13423."},{"key":"e_1_3_2_1_14_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2013.396"},{"key":"e_1_3_2_1_15_1","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1145\/3618373","article-title":"Low-light Image Enhancement with Wavelet-based Diffusion Models","volume":"238","author":"Jiang H.","year":"2023","unstructured":"H. Jiang, A. Luo, H. Fan, S. Han, and S. Liu. 2023. Low-light Image Enhancement with Wavelet-based Diffusion Models. ACM Trans. Graph., Vol. 238 (2023), 1-14.","journal-title":"ACM Trans. Graph."},{"key":"e_1_3_2_1_16_1","first-page":"123","volume-title":"Proc. ACCV'18","author":"Khoreva A.","unstructured":"A. Khoreva, A. Rohrbach, and B. Schiele. 2018. Video Object Segmentation with Language Referring Expressions. In Proc. ACCV'18. 123-141."},{"key":"e_1_3_2_1_17_1","doi-asserted-by":"publisher","DOI":"10.1016\/j.patcog.2024.110535"},{"key":"e_1_3_2_1_18_1","first-page":"1297","volume-title":"Proc. AAAI'22","author":"Li D. Z.","unstructured":"D. Z. Li, R. Q. Li, L. J. Wang, Y. F. Wang, J. Q. Qi, L. Zhang, T. Liu, Q. Q. Xu, and H. C. Lu. 2022. You Only Infer Once: Cross-modal Meta-transfer for Referring Video Object Segmentation. In Proc. AAAI'22. 1297-1305."},{"key":"e_1_3_2_1_19_1","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2023.3262578"},{"key":"e_1_3_2_1_20_1","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2022.3181516"},{"key":"e_1_3_2_1_21_1","first-page":"740","volume-title":"Proc. ECCV'2014","author":"Lin T. Y.","unstructured":"T. Y. Lin, M. Maire, S. Belongie, J. Hays, P. Perona, D. Ramanan, P. Doll\u00e1r, and C. L. Zitnick. 2014. Microsoft COCO: Common objects in context. In Proc. ECCV'2014. 740-755."},{"key":"e_1_3_2_1_22_1","first-page":"701","volume-title":"Context-gated Convolution. In Proc. ECCV'20","author":"Lin X. D.","unstructured":"X. D. Lin, L. Ma, W. Liu, and S. F. Chang. 2020. Context-gated Convolution. In Proc. ECCV'20. 701-718."},{"key":"e_1_3_2_1_23_1","first-page":"4761","article-title":"Cross-modal Progressive Comprehension for Referring Segmentation","volume":"44","author":"Liu S.","year":"2022","unstructured":"S. Liu, T. R. Hui, S. F. Huang, Y. C. Wei, B. Li, and G. B. Li. 2022a. Cross-modal Progressive Comprehension for Referring Segmentation. IEEE Trans. Pattern Anal. Mach. Intell., Vol. 44 (2022), 4761-4775.","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"e_1_3_2_1_24_1","unstructured":"Y. H. Liu M. Ott N. Goyal J. F. Du M. Joshi D. Q. Chen O. Levy M. Lewis L. Zettlemoyer and V. Stoyanov. 2019. RoBERTa: A Robustly Optimized BERT Pretraining Approach. In arXiv:1907.11692."},{"key":"e_1_3_2_1_25_1","first-page":"3202","volume-title":"Proc. CVPR'22","author":"Liu Z.","unstructured":"Z. Liu, J. Ning, Y. Cao, Y. X. Wei, Z. Zhang, S. Lin, and H. Hu. 2022b. Video Swin Transformer. In Proc. CVPR'22. 3202-3211."},{"key":"e_1_3_2_1_26_1","first-page":"26425","volume-title":"Proc. NeurIPS'23","author":"Luo Z. Y.","unstructured":"Z. Y. Luo, Y. C. Xiao, Y. Liu, S. Y. Li, Y. T. Wang, Y. S. Tang, X. Li, and Y. J. Yang. 2023. SOC: Semantic-assisted Object Cluster for Referring Video Object Segmentation. In Proc. NeurIPS'23. 26425-26437."},{"key":"e_1_3_2_1_27_1","first-page":"11","volume-title":"Proc. CVPR'16","author":"Mao J. H.","unstructured":"J. H. Mao, J. Huang, A. Toshev, O. Camburu, A. L. Yuille, and K. Murphy. 2016. Generation and Comprehension of Unambiguous Object Descriptions. In Proc. CVPR'16. 11-20."},{"key":"e_1_3_2_1_28_1","first-page":"920","volume-title":"Proc. CVPR'23","author":"Miao B.","unstructured":"B. Miao, M. Bennamoun, Y. S. Gao, and A. Mian. 2023. Spectrum-guided Multi-granularity Referring Video Object Segmentation. In Proc. CVPR'23. 920-930."},{"key":"e_1_3_2_1_29_1","first-page":"9226","volume-title":"Proc. ICCV'19","author":"Oh S. W.","unstructured":"S. W. Oh, J. Y. Lee, N. Xu, and S. J. Kim. 2019. Video Object Segmentation Using Space-time Memory Networks. In Proc. ICCV'19. 9226-9235."},{"key":"e_1_3_2_1_30_1","first-page":"724","volume-title":"Proc. CVPR'16","author":"Perazzi F.","unstructured":"F. Perazzi, J. Pont-Tuset, B. McWilliams, L. V. Gool, M. Gross, and A. Sorkine-Hornung. 2016. A Benchmark Dataset and Evaluation Methodology for Video Object Segmentation. In Proc. CVPR'16. 724-732."},{"key":"e_1_3_2_1_31_1","first-page":"10199","volume-title":"Proc. CVPR'23","author":"Phung H.","unstructured":"H. Phung, Q. Dao, and A. Tran. 2023. Wavelet Diffusion Models are Fast and Scalable Image Generators. In Proc. CVPR'23. 10199-10208."},{"key":"e_1_3_2_1_32_1","unstructured":"J. Pont-Tuset F. Perazzi S. Caelles P. Arbelaez A. Sorkine-Hornung and L. V. Gool. 2017. The 2017 DAVIS Challenge on Video Object Segmentation. In arXiv:1704.00675."},{"key":"e_1_3_2_1_33_1","first-page":"7","volume-title":"Proc. CVPR'23","author":"Saragadam V.","year":"1850","unstructured":"V. Saragadam, D. LeJeune, J. Tan, G. Balakrishnan, A. Veeraraghavan, and R. G. Baraniuk. 2023. WIRE: Wavelet Implicit Neural Representations. In Proc. CVPR'23. 18507-18516."},{"key":"e_1_3_2_1_34_1","first-page":"208","volume-title":"Proc. ECCV'20","author":"Seo S.","unstructured":"S. Seo, J. Y. Lee, and B. H. Han. 2020. URVOS: Unified Referring Video Object Segmentation Network with A Large-scale Benchmark. In Proc. ECCV'20. 208-223."},{"key":"e_1_3_2_1_35_1","first-page":"15466","volume-title":"Proc. ICCV'23","author":"Tang J. J.","unstructured":"J. J. Tang, G. Zheng, and S. B. Yang. 2023. Temporal Collection and Distribution for Referring Video Object Segmentation. In Proc. ICCV'23. 15466-15476."},{"key":"e_1_3_2_1_36_1","first-page":"282","volume-title":"Proc. ECCV'20","author":"Tian Z.","unstructured":"Z. Tian, C. H. Shen, and H. Chen. 2020. Conditional Convolutions for Instance Segmentation. In Proc. ECCV'20. 282-298."},{"key":"e_1_3_2_1_37_1","first-page":"5998","volume-title":"Proc. NeurIPS'17","author":"Vaswani A.","unstructured":"A. Vaswani, N. Shazeer, N. Parmar, J. Uszkoreit, L. Jones, A. N Gomez, L. Kaiser, and I. Polosukhin. 2017. Attention is All You Need. In Proc. NeurIPS'17. 5998-6008."},{"key":"e_1_3_2_1_38_1","first-page":"3939","volume-title":"Proc. ICCV'19","author":"Wang H.","unstructured":"H. Wang, C. Deng, J. C. Yan, and D. C. Tao. 2019. Asymmetric Cross-guided Attention Network for Actor and Action Video Segmentation from Natural Language Query. In Proc. ICCV'19. 3939-3948."},{"key":"e_1_3_2_1_39_1","first-page":"8741","volume-title":"Proc. CVPR'21","author":"Wang Y. Q.","unstructured":"Y. Q. Wang, Z. L. Xu, X. L. Wang, C. H. Shen, B. S. Cheng, H. Shen, and H. X. Xia. 2021. End-to-End Video Instance Segmentation with Transformers. In Proc. CVPR'21. 8741-8750."},{"key":"e_1_3_2_1_40_1","first-page":"4996","volume-title":"Proc. CVPR'22","author":"Wu D. M.","unstructured":"D. M. Wu, X. P. Dong, L. Shao, and J. B. Shen. 2022a. Multi-level Representation Learning with Semantic Alignment for Referring Video Object Segmentation. In Proc. CVPR'22. 4996-5005."},{"key":"e_1_3_2_1_41_1","first-page":"4974","volume-title":"Proc. CVPR'22","author":"Wu J. N.","unstructured":"J. N. Wu, Y. Jiang, P. Z. Sun, Z. H. Yuan, and P. Luo. 2022b. Language as Queries for Referring Video Object Segmentation. In Proc. CVPR'22. 4974-4984."},{"key":"e_1_3_2_1_42_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7298839"},{"volume-title":"Proc. BMVC'21","author":"Yang Z.","key":"e_1_3_2_1_43_1","unstructured":"Z. Yang, Y. S. Tang, L. Bertinetto, H. S. Zhao, and P. H. Torr. 2021. Hierarchical Interaction Network for Video Object Segmentation from Referring Expressions. In Proc. BMVC'21."},{"key":"e_1_3_2_1_44_1","first-page":"10502","volume-title":"Proc. CVPR'19","author":"Ye L. W.","unstructured":"L. W. Ye, M. Rochan, Z. Liu, and Y. Wang. 2019. Cross-modal Self-attention Network for Referring Image Segmentation. In Proc. CVPR'19. 10502-10511."},{"key":"e_1_3_2_1_45_1","first-page":"69","volume-title":"Proc. ECCV'16","author":"Yu L. C.","unstructured":"L. C. Yu, P. Poirson, S. Yang, A. C. Berg, and T. L. Berg. 2016. Modeling Context in Referring Expressions. In Proc. ECCV'16. 69-85."},{"key":"e_1_3_2_1_46_1","first-page":"8281","volume-title":"Proc. CVPR'24","author":"Zhao C.","unstructured":"C. Zhao, W. L. Cai, C. Y. Dong, and C. W. Hu. 2024. Wavelet-based Fourier Information Interaction with Frequency Diffusion Adjustment for Underwater Image Restoration. In Proc. CVPR'24. 8281-8291."},{"key":"e_1_3_2_1_47_1","first-page":"11737","volume-title":"Proc. CVPR'22","author":"Zhao W. B.","unstructured":"W. B. Zhao, K. Wang, X. X. Chu, F. Z. Xue, X. C. Wang, and Y. You. 2022. Modeling Motion with Multi-modal Features for Text-based Video Segmentation. In Proc. CVPR'22. 11737-11746."}],"event":{"name":"MM '25: The 33rd ACM International Conference on Multimedia","sponsor":["SIGMM ACM Special Interest Group on Multimedia"],"location":"Dublin Ireland","acronym":"MM '25"},"container-title":["Proceedings of the 33rd ACM International Conference on Multimedia"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3746027.3755222","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,12,9]],"date-time":"2025-12-09T19:49:27Z","timestamp":1765309767000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3746027.3755222"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,10,27]]},"references-count":47,"alternative-id":["10.1145\/3746027.3755222","10.1145\/3746027"],"URL":"https:\/\/doi.org\/10.1145\/3746027.3755222","relation":{},"subject":[],"published":{"date-parts":[[2025,10,27]]},"assertion":[{"value":"2025-10-27","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}