{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,6,19]],"date-time":"2025-06-19T05:04:41Z","timestamp":1750309481813,"version":"3.41.0"},"reference-count":78,"publisher":"Association for Computing Machinery (ACM)","issue":"1","license":[{"start":{"date-parts":[[2024,12,23]],"date-time":"2024-12-23T00:00:00Z","timestamp":1734912000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.acm.org\/publications\/policies\/copyright_policy#Background"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"crossref","award":["62441604, 62476093"],"award-info":[{"award-number":["62441604, 62476093"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"crossref"}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":["ACM Trans. Multimedia Comput. Commun. Appl."],"published-print":{"date-parts":[[2025,1,31]]},"abstract":"<jats:p>\n            Recent advances in scene text removal have attracted growing research interest due to its applications on privacy protection, document restoration, and text editing. While deep learning and generative adversarial network have shown significant progress, existing methods often struggle to generate consistent and plausible textures when erasing texts on complex backgrounds. To address this challenge, we propose a Contextual-guided Text Removal Network (CTRNet). CTRNet utilizes Low-level\/High-level Contextual Guidance blocks (LCG, HCG) to explore both low-level structure and high-level discriminative context features from existing data to guide the text erasure and background restoration process. We further extend CTRNet to CTRNet++ by incorporate an auto-encoder architecture as a novel and effective HCG block, which serves as an additional image-inpainting branch, providing more accurate texture and context clues with the assistance of a large volume of natural images. Then we introduce a Context Embedding and Content Feature Modeling (CECFM) block that combines depth-wise CNN and Transformer layers to capture local features and establish long-term relationships among pixels globally. In addition, an efficient Progressive Feature Fusion Module (PFFM) is proposed to fully utilize multi-scale features from different branches. Experiments on benchmark datasets, SCUT-EnsText and SCUT-Syn, demonstrate that CTRNet++ significantly outperforms existing state-of-the-art methods and exhibits a stronger ability for complex background reconstruction. The code is available at\n            <jats:ext-link xmlns:xlink=\"http:\/\/www.w3.org\/1999\/xlink\" xlink:href=\"https:\/\/github.com\/lcy0604\/CTRNet-plus\">https:\/\/github.com\/lcy0604\/CTRNet-plus<\/jats:ext-link>\n            .\n          <\/jats:p>","DOI":"10.1145\/3697837","type":"journal-article","created":{"date-parts":[[2024,10,24]],"date-time":"2024-10-24T15:25:42Z","timestamp":1729783542000},"page":"1-22","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":0,"title":["CTRNet++: Dual-Path Learning with Local-Global Context Modeling for Scene Text Removal"],"prefix":"10.1145","volume":"21","author":[{"ORCID":"https:\/\/orcid.org\/0000-0003-2516-926X","authenticated-orcid":false,"given":"Chongyu","family":"Liu","sequence":"first","affiliation":[{"name":"South China University of Technology, Guangzhou, China and GRG Banking, Guangzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-3263-3449","authenticated-orcid":false,"given":"Dezhi","family":"Peng","sequence":"additional","affiliation":[{"name":"South China University of Technology, Guangzhou, China and GRG Banking, Guangzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-3037-173X","authenticated-orcid":false,"given":"Yuliang","family":"Liu","sequence":"additional","affiliation":[{"name":"Huazhong University of Science and Technology, Wuhan, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-5456-0957","authenticated-orcid":false,"given":"Lianwen","family":"Jin","sequence":"additional","affiliation":[{"name":"South China University of Technology, Guangzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2024,12,23]]},"reference":[{"key":"e_1_3_1_2_2","first-page":"9365","volume-title":"Proc. CVPR","author":"Baek Youngmin","year":"2019","unstructured":"Youngmin Baek, Bado Lee, Dongyoon Han, Sangdoo Yun, and Hwalsuk Lee. 2019. Character Region Awareness for Text Detection. In Proc. CVPR, 9365\u20139374."},{"key":"e_1_3_1_3_2","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2013.50"},{"key":"e_1_3_1_4_2","doi-asserted-by":"publisher","DOI":"10.1007\/s41095-021-0242-8"},{"key":"e_1_3_1_5_2","first-page":"4479","volume-title":"Proc. NIPS","volume":"33","author":"Chi Lu","year":"2020","unstructured":"Lu Chi, Borui Jiang, and Yadong Mu. 2020. Fast Fourier Convolution. In Proc. NIPS, Vol. 33, 4479\u20134488."},{"key":"e_1_3_1_6_2","first-page":"935","volume-title":"Proc. ICDAR","volume":"1","author":"Ch\u2019ng Chee Kheng","year":"2017","unstructured":"Chee Kheng Ch\u2019ng and Chee Seng Chan. 2017. Total-Text: A Comprehensive Dataset for Scene Text Detection and Recognition. In Proc. ICDAR, Vol. 1, 935\u2013942."},{"key":"e_1_3_1_7_2","first-page":"1571","volume-title":"Proc. ICDAR","author":"Chng C. K.","year":"2019","unstructured":"C. K. Chng, Y. Liu, Y. Sun, C. C. Ng, C. Luo, Z. Ni, C. Fang, S. Zhang, J. Han, E. Ding, et al. 2019. ICDAR2019 Robust Reading Challenge on Arbitrary-Shaped Text - RRC-ArT. In Proc. ICDAR, 1571\u20131576."},{"key":"e_1_3_1_8_2","doi-asserted-by":"publisher","DOI":"10.1109\/ACCESS.2021.3110293"},{"key":"e_1_3_1_9_2","first-page":"1309","volume-title":"Proc. ICIP.","author":"Conrad Benjamin","year":"2021","unstructured":"Benjamin Conrad and Pei-I. Chen. 2021. Two-Stage Seamless Text Erasing on Real-World Scene Images. In Proc. ICIP. IEEE, 1309\u20131313."},{"key":"e_1_3_1_10_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2009.5206848"},{"key":"e_1_3_1_11_2","first-page":"6151","volume-title":"Proc. WACV","author":"Du Xiangcheng","year":"2023","unstructured":"Xiangcheng Du, Zhao Zhou, Yingbin Zheng, Tianlong Ma, Xingjiao Wu, and Cheng Jin. 2023. Modeling Stroke Mask for End-to-End Text Erasing. In Proc. WACV, 6151\u20136159."},{"issue":"1","key":"e_1_3_1_12_2","first-page":"24","article-title":"Learning Pixel Affinity Pyramid for Arbitrary-Shaped Text Detection","volume":"19","author":"Fu Zilong","year":"2023","unstructured":"Zilong Fu, Hongtao Xie, Shancheng Fang, Yuxin Wang, Mengting Xing, and Yongdong Zhang. 2023. Learning Pixel Affinity Pyramid for Arbitrary-Shaped Text Detection. ACM Trans. Multimedia Comput. Commun. Appl. 19, 1s, Article 29 (Feb. 2023), 24 pages.","journal-title":"ACM Trans. Multimedia Comput. Commun. Appl."},{"issue":"2","key":"e_1_3_1_13_2","first-page":"19","article-title":"Real-Time Image Enhancement with Attention Aggregation","volume":"19","author":"Gao Qiqi","year":"2023","unstructured":"Qiqi Gao, Jie Li, Tiejun Zhao, and Yadong Wang. 2023. Real-Time Image Enhancement with Attention Aggregation. ACM Trans. Multimedia Comput. Commun. Appl. 19, 2s, Article 98 (Feb. 2023), 19 pages.","journal-title":"ACM Trans. Multimedia Comput. Commun. Appl."},{"key":"e_1_3_1_14_2","first-page":"2414","volume-title":"Proc. CVPR","author":"Gatys Leon A.","year":"2016","unstructured":"Leon A. Gatys, Alexander S. Ecker, and Matthias Bethge. 2016. Image Style Transfer Using Convolutional Neural Networks. In Proc. CVPR, 2414\u20132423."},{"key":"e_1_3_1_15_2","first-page":"2672","volume-title":"Proc. NIPS","author":"Goodfellow Ian","year":"2014","unstructured":"Ian Goodfellow, Jean Pouget-Abadie, Mehdi Mirza, Bing Xu, David Warde-Farley, Sherjil Ozair, Aaron Courville, and Yoshua Bengio. 2014. Generative Adversarial Nets. In Proc. NIPS, 2672\u20132680."},{"key":"e_1_3_1_16_2","first-page":"14134","volume-title":"Proc. ICCV","author":"Guo Xiefan","year":"2021","unstructured":"Xiefan Guo, Hongyu Yang, and Di Huang. 2021. Image Inpainting via Conditional Texture and Structure Dual Generation. In Proc. ICCV, 14134\u201314143."},{"key":"e_1_3_1_17_2","first-page":"2315","volume-title":"Proc. CVPR","author":"Gupta Ankush","year":"2016","unstructured":"Ankush Gupta, Andrea Vedaldi, and Andrew Zisserman. 2016. Synthetic Data for Text Localisation in Natural Images. In Proc. CVPR, 2315\u20132324."},{"key":"e_1_3_1_18_2","first-page":"1","volume-title":"Proc. ICLR","author":"Han Qi","year":"2022","unstructured":"Qi Han, Zejia Fan, Qi Dai, Lei Sun, Ming-Ming Cheng, Jiaying Liu, and Jingdong Wang. 2022. On the Connection between Local Attention and Dynamic Depth-Wise Convolution. In Proc. ICLR, 1\u201314."},{"key":"e_1_3_1_19_2","first-page":"1333","volume-title":"Proc. ACCV","author":"Hou Yujie","year":"2022","unstructured":"Yujie Hou, Jiwei Ji Chen, and Zengfu Wang. 2022. Multi-Branch Network with Ensemble Learning for Text Removal in the Wild. In Proc. ACCV, 1333\u20131349."},{"key":"e_1_3_1_20_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00745"},{"key":"e_1_3_1_21_2","first-page":"1125","volume-title":"Proc. CVPR","author":"Isola Phillip","year":"2017","unstructured":"Phillip Isola, Jun-Yan Zhu, Tinghui Zhou, and Alexei A. Efros. 2017. Image-to-Image Translation with Conditional Adversarial Networks. In Proc. CVPR, 1125\u20131134."},{"key":"e_1_3_1_22_2","first-page":"1973","volume-title":"Proc. ACM MM","author":"Jiang Gangwei","year":"2022","unstructured":"Gangwei Jiang, Shiyao Wang, Tiezheng Ge, Yuning Jiang, Ying Wei, and Defu Lian. 2022. Self-Supervised Text Erasing with Controllable Image Synthesis. In Proc. ACM MM, 1973\u20131983."},{"key":"e_1_3_1_23_2","first-page":"694","volume-title":"Proc. ECCV","author":"Johnson Justin","year":"2016","unstructured":"Justin Johnson, Alexandre Alahi, and Li Fei-Fei. 2016. Perceptual Losses for Real-Time Style Transfer and Super-Resolution. In Proc. ECCV, 694\u2013711."},{"key":"e_1_3_1_24_2","first-page":"1156","volume-title":"Proc. ICDAR","author":"Karatzas D.","year":"2015","unstructured":"D. Karatzas, L. Gomez-Bigorda, A. Nicolaou, S. Ghosh, A. Bagdanov, M. Iwamura, J. Matas, L. Neumann, V. R. Chandrasekhar, S. Lu, et al. 2015. ICDAR 2015 Competition on Robust Reading. In Proc. ICDAR, 1156\u20131160."},{"key":"e_1_3_1_25_2","first-page":"1484","volume-title":"Proc. ICDAR","author":"Karatzas D.","year":"2013","unstructured":"D. Karatzas, F. Shafait, S. Uchida, M. Iwamura, L. G. I. Bigorda, S. R. Mestre, J. Mas, D. F. Mota, J. A. Almaz\u00e0n, and L. P. de las Heras. 2013. ICDAR 2013 Robust Reading Competition. In Proc. ICDAR, 1484\u20131493."},{"issue":"5","key":"e_1_3_1_26_2","doi-asserted-by":"crossref","first-page":"3152","DOI":"10.1109\/TCSVT.2021.3103922","article-title":"Text Region Conditional Generative Adversarial Network for Text Concealment in the Wild","volume":"32","author":"Keserwani Prateek","year":"2021","unstructured":"Prateek Keserwani and Partha Pratim Roy. 2021. Text Region Conditional Generative Adversarial Network for Text Concealment in the Wild. IEEE Trans. Circuits Syst. Video Technol. 32, 5 (2021), 3152\u20133163.","journal-title":"IEEE Trans. Circuits Syst. Video Technol."},{"key":"e_1_3_1_27_2","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2023.3239736"},{"key":"e_1_3_1_28_2","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-020-01316-z"},{"key":"e_1_3_1_29_2","first-page":"457","volume-title":"Proc. ECCV.","author":"Lee Hyeonsu","year":"2022","unstructured":"Hyeonsu Lee and Chankyu Choi. 2022. The Surprisingly Straightforward Scene Text Removal Method with Gated Attention and Region of Interest Generation: A Comprehensive Prominent Model Analysis. In Proc. ECCV. Springer, 457\u2013472."},{"issue":"5","key":"e_1_3_1_30_2","first-page":"22","article-title":"Exploring the Effect of High-Frequency Components in GANs Training","volume":"19","author":"Li Ziqiang","year":"2023","unstructured":"Ziqiang Li, Pengfei Xia, Xue Rui, and Bin Li. 2023. Exploring the Effect of High-Frequency Components in GANs Training. ACM Trans. Multimedia Comput. Commun. Appl. 19, 5, Article 153 (Mar. 2023), 22 pages.","journal-title":"ACM Trans. Multimedia Comput. Commun. Appl."},{"key":"e_1_3_1_31_2","first-page":"409","volume-title":"Proc. ECCV.","author":"Liu Chongyu","year":"2022","unstructured":"Chongyu Liu, Lianwen Jin, Yuliang Liu, Canjie Luo, Bangdong Chen, Fengjun Guo, and Kai Ding. 2022. Don\u2019t Forget Me: Accurate Background Recovery for Text Removal via Modeling Local-Global Context. In Proc. ECCV. Springer Nature Switzerland, 409\u2013426."},{"key":"e_1_3_1_32_2","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2020.3018859"},{"key":"e_1_3_1_33_2","first-page":"85","volume-title":"Proc. ECCV.","author":"Liu Guilin","year":"2018","unstructured":"Guilin Liu, Fitsum A. Reda, Kevin J. Shih, Ting-Chun Wang, Andrew Tao, and Bryan Catanzaro. 2018. Image Inpainting for Irregular Holes Using Partial Convolutions. In Proc. ECCV. 85\u2013100."},{"key":"e_1_3_1_34_2","first-page":"725","volume-title":"Proc. ECCV.","author":"Liu Hongyu","year":"2020","unstructured":"Hongyu Liu, Bin Jiang, Yibing Song, Wei Huang, and Chao Yang. 2020. Rethinking Image Inpainting via a Mutual Encoder-Decoder with Feature Equalizations. In Proc. ECCV. Springer, 725\u2013741."},{"key":"e_1_3_1_35_2","first-page":"9612","volume-title":"Proc. CVPR","author":"Liu Yuliang","year":"2019","unstructured":"Yuliang Liu, Lianwen Jin, Zecheng Xie, Canjie Luo, Shuaitao Zhang, and Lele Xie. 2019. Tightness-Aware Evaluation Protocol for Scene Text Detection. In Proc. CVPR, 9612\u20139620."},{"key":"e_1_3_1_36_2","doi-asserted-by":"publisher","DOI":"10.1145\/3510821"},{"key":"e_1_3_1_37_2","first-page":"10012","volume-title":"Proc. ICCV","author":"Liu Ze","year":"2021","unstructured":"Ze Liu, Yutong Lin, Yue Cao, Han Hu, Yixuan Wei, Zheng Zhang, Stephen Lin, and Baining Guo. 2021. Swin Transformer: Hierarchical Vision Transformer Using Shifted Windows. In Proc. ICCV, 10012\u201310022."},{"issue":"4","key":"e_1_3_1_38_2","first-page":"23","article-title":"AB-LSTM: Attention-Based Bidirectional LSTM Model for Scene Text Detection","volume":"15","author":"Liu Zhandong","year":"2019","unstructured":"Zhandong Liu, Wengang Zhou, and Houqiang Li. 2019. AB-LSTM: Attention-Based Bidirectional LSTM Model for Scene Text Detection. ACM Trans. Multimedia Comput. Commun. Appl. 15, 4, Article 107 (Dec. 2019), 23 pages.","journal-title":"ACM Trans. Multimedia Comput. Commun. Appl."},{"issue":"3","key":"e_1_3_1_39_2","first-page":"22","article-title":"MFECN: Multi-Level Feature Enhanced Cumulative Network for Scene Text Detection","volume":"17","author":"Liu Zhandong","year":"2021","unstructured":"Zhandong Liu, Wengang Zhou, and Houqiang Li. 2021. MFECN: Multi-Level Feature Enhanced Cumulative Network for Scene Text Detection. ACM Trans. Multimedia Comput. Commun. Appl. 17, 3, Article 78 (Jul. 2021), 22 pages.","journal-title":"ACM Trans. Multimedia Comput. Commun. Appl."},{"key":"e_1_3_1_40_2","doi-asserted-by":"publisher","DOI":"10.1016\/j.patcog.2023.109531"},{"issue":"1","key":"e_1_3_1_41_2","first-page":"18","article-title":"Photorealistic Face Completion with Semantic Parsing and Face Identity-Preserving Features","volume":"15","author":"Ma Ruijun","year":"2019","unstructured":"Ruijun Ma, Haifeng Hu, Weixuan Wang, Jia Xu, and Zhengming Li. 2019. Photorealistic Face Completion with Semantic Parsing and Face Identity-Preserving Features. ACM Trans. Multimedia Comput. Commun. Appl. 15, 1, Article 28 (Feb. 2019), 18 pages.","journal-title":"ACM Trans. Multimedia Comput. Commun. Appl."},{"key":"e_1_3_1_42_2","unstructured":"Mehdi Mirza and Simon Osindero. 2014. Conditional Generative Adversarial Nets. arXiv:1411.1784. Retrieved from https:\/\/doi.org\/10.48550\/arXiv.1411.1784"},{"key":"e_1_3_1_43_2","first-page":"376","volume-title":"Proc. ICLR","author":"Miyato Takeru","year":"2018","unstructured":"Takeru Miyato, Toshiki Kataoka, Masanori Koyama, and Yuichi Yoshida. 2018. Spectral Normalization for Generative Adversarial Networks. In Proc. ICLR, 376\u2013401."},{"key":"e_1_3_1_44_2","first-page":"832","volume-title":"Proc. ICDAR","volume":"1","author":"Nakamura Toshiki","year":"2017","unstructured":"Toshiki Nakamura, Anna Zhu, Keiji Yanai, and Seiichi Uchida. 2017. Scene Text Eraser. In Proc. ICDAR, Vol. 1, 832\u2013837."},{"key":"e_1_3_1_45_2","first-page":"1582","volume-title":"Proc. ICDAR","author":"Nayef Nibal","year":"2019","unstructured":"Nibal Nayef, Yash Patel, Michal Busta, Pinaki Nath Chowdhury, Dimosthenis Karatzas, Wafa Khlif, Jiri Matas, Umapada Pal, Jean-Christophe Burie, Cheng-lin Liu, et al. 2019. ICDAR2019 Robust Reading Challenge on Multi-Lingual Scene Text Detection and Recognition\u2013RRC-MLT-2019. In Proc. ICDAR, 1582\u20131587."},{"key":"e_1_3_1_46_2","first-page":"1454","volume-title":"Proc. IDAR","volume":"1","author":"Nayef N.","year":"2017","unstructured":"N. Nayef, F. Yin, I. Bizid, H. Choi, Y. Feng, D. Karatzas, Z. Luo, U. Pal, C. Rigaud, J. Chazalon, et al. 2017. ICDAR2017 Robust Reading Challenge on Multi-Lingual Scene Text Detection and Script Identification\u2013 RRC-MLT. In Proc. IDAR, Vol. 1, 1454\u20131459."},{"key":"e_1_3_1_47_2","first-page":"3265","volume-title":"Proc. ICCV Workshops","author":"Nazeri Kamyar","year":"2019","unstructured":"Kamyar Nazeri, Eric Ng, Tony Joseph, Faisal Qureshi, and Mehran Ebrahimi. 2019. EdgeConnect: Structure Guided Image Inpainting Using Edge Prediction. In Proc. ICCV Workshops, 3265\u20133274."},{"key":"e_1_3_1_48_2","first-page":"2337","volume-title":"Proc. CVPR","author":"Park Taesung","year":"2019","unstructured":"Taesung Park, Ming-Yu Liu, Ting-Chun Wang, and Jun-Yan Zhu. 2019. Semantic Image Synthesis with Spatially-Adaptive Normalization. In Proc. CVPR, 2337\u20132346."},{"key":"e_1_3_1_49_2","first-page":"1","volume-title":"Proc. BMVC","author":"Qin Siyang","year":"2018","unstructured":"Siyang Qin, Jiahui Wei, and Roberto Manduchi. 2018. Automatic Semantic Content Removal by Learning to Neglect. In Proc. BMVC, 1\u201312."},{"key":"e_1_3_1_50_2","first-page":"181","volume-title":"Proc. ICCV","author":"Ren Yurui","year":"2019","unstructured":"Yurui Ren, Xiaoming Yu, Ruonan Zhang, Thomas H Li, Shan Liu, and Ge Li. 2019. StructureFlow: Image Inpainting via Structure-Aware Appearance Flow. In Proc. ICCV, 181\u2013190."},{"key":"e_1_3_1_51_2","first-page":"3138","volume-title":"Proc. ACCV","author":"Ren Yujin","year":"2022","unstructured":"Yujin Ren, Jiaxin Zhang, Bangdong Chen, Xiaoyi Zhang, and Lianwen Jin. 2022. Looking from a Higher-Level Perspective: Attention and Recognition Enhanced Multi-Scale Scene Text Segmentation. In Proc. ACCV, 3138\u20133154."},{"key":"e_1_3_1_52_2","first-page":"82","volume-title":"Proc. ICCV","author":"Ridnik Tal","year":"2021","unstructured":"Tal Ridnik, Emanuel Ben-Baruch, Nadav Zamir, Asaf Noy, Itamar Friedman, Matan Protter, and Lihi Zelnik-Manor. 2021. Asymmetric Loss for Multi-Label Classification. In Proc. ICCV, 82\u201391."},{"key":"e_1_3_1_53_2","first-page":"1076","volume-title":"Proc. ICCV","author":"Shimoda Wataru","year":"2021","unstructured":"Wataru Shimoda, Daichi Haraguchi, Seiichi Uchida, and Kota Yamaguchi. 2021. De-Rendering Stylized Texts. In Proc. ICCV, 1076\u20131085."},{"key":"e_1_3_1_54_2","first-page":"2149","volume-title":"Proc. WACV","author":"Suvorov Roman","year":"2022","unstructured":"Roman Suvorov, Elizaveta Logacheva, Anton Mashikhin, Anastasia Remizova, Arsenii Ashukha, Aleksei Silvestrov, Naejin Kong, Harshith Goka, Kiwoong Park, and Victor Lempitsky. 2022. Resolution-Robust Large Mask Inpainting with Fourier Convolutions. In Proc. WACV, 2149\u20132159."},{"key":"e_1_3_1_55_2","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2021.3125260"},{"key":"e_1_3_1_56_2","doi-asserted-by":"publisher","DOI":"10.1016\/j.cviu.2020.103066"},{"key":"e_1_3_1_57_2","first-page":"39","volume-title":"Proc. ICDAR.","author":"Tursun Osman","year":"2019","unstructured":"Osman Tursun, Rui Zeng, Simon Denman, Sabesan Sivapalan, Sridha Sridharan, and Clinton Fookes. 2019. MTRNet: A Generic Scene Text Eraser. In Proc. ICDAR. IEEE, 39\u201344."},{"key":"e_1_3_1_58_2","first-page":"6000","volume-title":"Proc. NIPS","author":"Vaswani Ashish","year":"2017","unstructured":"Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N. Gomez, \u0141ukasz Kaiser, and Illia Polosukhin. 2017. Attention Is All You Need. In Proc. NIPS, 6000\u20136010."},{"key":"e_1_3_1_59_2","doi-asserted-by":"publisher","DOI":"10.1145\/129902.129906"},{"key":"e_1_3_1_60_2","unstructured":"Andreas Veit Tomas Matera Lukas Neumann Jiri Matas and Serge Belongie. 2016. COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images. arXiv:1601.07140. Retrieved from https:\/\/doi.org\/10.48550\/arXiv.1601.07140"},{"key":"e_1_3_1_61_2","first-page":"4692","volume-title":"Proc. ICCV","author":"Wan Ziyu","year":"2021","unstructured":"Ziyu Wan, Jingbo Zhang, Dongdong Chen, and Jing Liao. 2021. High-Fidelity Pluralistic Image Completion with Transformers. In Proc. ICCV, 4692\u20134701."},{"key":"e_1_3_1_62_2","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2021.3113157"},{"key":"e_1_3_1_63_2","first-page":"591","volume-title":"Proc. ECCV","author":"Wang Kundong","year":"2010","unstructured":"Kundong Wang and Serge J. Belongie. 2010. Word Spotting in the Wild. In Proc. ECCV, 591\u2013604."},{"key":"e_1_3_1_64_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00956"},{"key":"e_1_3_1_65_2","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00853"},{"key":"e_1_3_1_66_2","unstructured":"Yuxin Wang Hongtao Xie Shancheng Fang Yadong Qu and Yongdong Zhang. 2021. PERT: A Progressively Region-based Network for Scene Text Removal. arXiv:2106.13029. Retrieved from https:\/\/doi.org\/10.48550\/arXiv.2106.13029"},{"key":"e_1_3_1_67_2","first-page":"1500","volume-title":"Proc. ACM MM","author":"Wu Liang","year":"2019","unstructured":"Liang Wu, Chengquan Zhang, Jiaming Liu, Junyu Han, Jingtuo Liu, Errui Ding, and Xiang Bai. 2019. Editing Text in the Wild. In Proc. ACM MM, 1500\u20131508."},{"issue":"6","key":"e_1_3_1_68_2","first-page":"1","article-title":"Structure Extraction from Texture via Relative Total Variation","volume":"31","author":"Xu Li","year":"2012","unstructured":"Li Xu, Qiong Yan, Yang Xia, and Jiaya Jia. 2012. Structure Extraction from Texture via Relative Total Variation. ACM Trans. Graph. 31, 6 (2012), 1\u201310.","journal-title":"ACM Trans. Graph."},{"key":"e_1_3_1_69_2","first-page":"12045","volume-title":"Proc. CVPR","author":"Xu Xingqian","year":"2021","unstructured":"Xingqian Xu, Zhifei Zhang, Zhaowen Wang, Brian Price, Zhonghao Wang, and Humphrey Shi. 2021. Rethinking Text Segmentation: A Novel Dataset and a Text-Specific Refinement Approach. In Proc. CVPR, 12045\u201312055."},{"key":"e_1_3_1_70_2","series-title":"Proceedings of Machine Learning Research","first-page":"11863","volume-title":"Proc. ICML.","volume":"139","author":"Yang Lingxiao","year":"2021","unstructured":"Lingxiao Yang, Ru-Yuan Zhang, Lida Li, and Xiaohua Xie. 2021. SimAM: A Simple, Parameter-Free Attention Module for Convolutional Neural Networks. In Proc. ICML. Marina Meila and Tong Zhang (Eds.), Proceedings of Machine Learning Research, Vol. 139, PMLR, 11863\u201311874."},{"key":"e_1_3_1_71_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00577"},{"key":"e_1_3_1_72_2","first-page":"12733","volume-title":"Proc. AAAI","volume":"34","author":"Yu Tao","year":"2020","unstructured":"Tao Yu, Zongyu Guo, Xin Jin, Shilin Wu, Zhibo Chen, Weiping Li, Zhizheng Zhang, and Sen Liu. 2020. Region Normalization for Image Inpainting. In Proc. AAAI, Vol. 34, 12733\u201312740."},{"key":"e_1_3_1_73_2","doi-asserted-by":"publisher","DOI":"10.1016\/j.patcog.2019.02.002"},{"key":"e_1_3_1_74_2","first-page":"5728","volume-title":"Proc. CVPR","author":"Zamir Syed Waqas","year":"2022","unstructured":"Syed Waqas Zamir, Aditya Arora, Salman Khan, Munawar Hayat, Fahad Shahbaz Khan, and Ming-Hsuan Yang. 2022. Restormer: Efficient Transformer for High-Resolution Image Restoration. In Proc. CVPR, 5728\u20135739."},{"key":"e_1_3_1_75_2","first-page":"2227","volume-title":"Proc. WACV","author":"Zdenek Jan","year":"2020","unstructured":"Jan Zdenek and Hideki Nakayama. 2020. Erasing Scene Text with Weak Supervision. In Proc. WACV, 2227\u20132235."},{"key":"e_1_3_1_76_2","first-page":"801","volume-title":"Proc. AAAI","volume":"33","author":"Zhang Shuaitao","year":"2019","unstructured":"Shuaitao Zhang, Yuliang Liu, Lianwen Jin, Yaoxiong Huang, and Songxuan Lai. 2019. EnsNet: Ensconce Text in the Wild. In Proc. AAAI, Vol. 33, 801\u2013808."},{"key":"e_1_3_1_77_2","first-page":"1323","volume-title":"Proc. IJCAI","author":"Zhang Wendong","year":"2021","unstructured":"Wendong Zhang, Junwei Zhu, Ying Tai, Yunbo Wang, Wenqing Chu, Bingbing Ni, Chengjie Wang, and Xiaokang Yang. 2021. Context-Aware Image Inpainting with Learned Semantic Priors. In Proc. IJCAI, 1323\u20131329."},{"key":"e_1_3_1_78_2","first-page":"1438","volume-title":"Proc. CVPR","author":"Zheng Chuanxia","year":"2019","unstructured":"Chuanxia Zheng, Tat-Jen Cham, and Jianfei Cai. 2019. Pluralistic Image Completion. In Proc. CVPR, 1438\u20131447."},{"key":"e_1_3_1_79_2","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2017.2723009"}],"container-title":["ACM Transactions on Multimedia Computing, Communications, and Applications"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3697837","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3697837","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,19]],"date-time":"2025-06-19T01:17:30Z","timestamp":1750295850000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3697837"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,12,23]]},"references-count":78,"journal-issue":{"issue":"1","published-print":{"date-parts":[[2025,1,31]]}},"alternative-id":["10.1145\/3697837"],"URL":"https:\/\/doi.org\/10.1145\/3697837","relation":{},"ISSN":["1551-6857","1551-6865"],"issn-type":[{"type":"print","value":"1551-6857"},{"type":"electronic","value":"1551-6865"}],"subject":[],"published":{"date-parts":[[2024,12,23]]},"assertion":[{"value":"2023-06-14","order":0,"name":"received","label":"Received","group":{"name":"publication_history","label":"Publication History"}},{"value":"2024-09-13","order":2,"name":"accepted","label":"Accepted","group":{"name":"publication_history","label":"Publication History"}},{"value":"2024-12-23","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}