{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,8,22]],"date-time":"2025-08-22T00:41:23Z","timestamp":1755823283869,"version":"3.44.0"},"publisher-location":"New York, NY, USA","reference-count":59,"publisher":"ACM","license":[{"start":{"date-parts":[[2023,10,26]],"date-time":"2023-10-26T00:00:00Z","timestamp":1698278400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.acm.org\/publications\/policies\/copyright_policy#Background"}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2023,10,26]]},"DOI":"10.1145\/3581783.3611791","type":"proceedings-article","created":{"date-parts":[[2023,10,27]],"date-time":"2023-10-27T07:27:40Z","timestamp":1698391660000},"page":"5786-5795","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":3,"title":["Fine-grained Pseudo Labels for Scene Text Recognition"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0009-0009-8827-0040","authenticated-orcid":false,"given":"Xiaoyu","family":"Li","sequence":"first","affiliation":[{"name":"Ant Group, Hangzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0000-1725-3184","authenticated-orcid":false,"given":"Xiaoxue","family":"Chen","sequence":"additional","affiliation":[{"name":"Ant Group, Hangzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0003-4348-229X","authenticated-orcid":false,"given":"Zuming","family":"Huang","sequence":"additional","affiliation":[{"name":"Ant Group, Hangzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-7731-9341","authenticated-orcid":false,"given":"Lele","family":"Xie","sequence":"additional","affiliation":[{"name":"Ant Group, Hangzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-1872-2592","authenticated-orcid":false,"given":"Jingdong","family":"Chen","sequence":"additional","affiliation":[{"name":"Ant Group, Hangzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-1691-6817","authenticated-orcid":false,"given":"Ming","family":"Yang","sequence":"additional","affiliation":[{"name":"Ant Group, Hangzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2023,10,27]]},"reference":[{"key":"e_1_3_2_1_1_1","volume-title":"Multimodal semi-supervised learning for text recognition. arXiv preprint arXiv:2205.03873","author":"Aberdam Aviad","year":"2022","unstructured":"Aviad Aberdam, Roy Ganz, Shai Mazor, and Ron Litman. 2022. Multimodal semi-supervised learning for text recognition. arXiv preprint arXiv:2205.03873 (2022)."},{"key":"e_1_3_2_1_2_1","doi-asserted-by":"crossref","unstructured":"Aviad Aberdam Ron Litman Shahar Tsiper Oron Anschel Ron Slossberg Shai Mazor R. Manmatha and Pietro Perona. 2021. Sequence-to-Sequence Contrastive Learning for Text Recognition. In CVPR.","DOI":"10.1109\/CVPR46437.2021.01505"},{"key":"e_1_3_2_1_3_1","doi-asserted-by":"crossref","unstructured":"Abulikemu Abuduweili Xingjian Li Humphrey Shi Cheng-Zhong Xu and Dejing Dou. 2021. Adaptive consistency regularization for semi-supervised transfer learning. In CVPR.","DOI":"10.1109\/CVPR46437.2021.00685"},{"key":"e_1_3_2_1_4_1","doi-asserted-by":"crossref","unstructured":"Eric Arazo Diego Ortego Paul Albert Noel E O'Connor and Kevin McGuinness. 2020. Pseudo-labeling and confirmation bias in deep semi-supervised learning. In IJCNN.","DOI":"10.1109\/IJCNN48605.2020.9207304"},{"key":"e_1_3_2_1_5_1","volume-title":"Seong Joon Oh, and Hwalsuk Lee","author":"Baek Jeonghun","year":"2019","unstructured":"Jeonghun Baek, Geewook Kim, Junyeop Lee, Sungrae Park, Dongyoon Han, Sangdoo Yun, Seong Joon Oh, and Hwalsuk Lee. 2019. What is wrong with scene text recognition model comparisons? dataset and model analysis. In ICCV."},{"key":"e_1_3_2_1_6_1","doi-asserted-by":"crossref","unstructured":"Jeonghun Baek Yusuke Matsui and Kiyoharu Aizawa. 2021. What if we only use real datasets for scene text recognition? toward scene text recognition with fewer labels. In CVPR.","DOI":"10.1109\/CVPR46437.2021.00313"},{"key":"e_1_3_2_1_7_1","doi-asserted-by":"crossref","unstructured":"Yoshua Bengio J\u00e9r\u00f4me Louradour Ronan Collobert and Jason Weston. 2009. Curriculum learning. In ICML.","DOI":"10.1145\/1553374.1553380"},{"key":"e_1_3_2_1_8_1","volume-title":"Integrating structured biological data by kernel maximum mean discrepancy. Bioinformatics","author":"Borgwardt Karsten M","year":"2006","unstructured":"Karsten M Borgwardt, Arthur Gretton, Malte J Rasch, Hans-Peter Kriegel, Bernhard Sch\u00f6lkopf, and Alex J Smola. 2006. Integrating structured biological data by kernel maximum mean discrepancy. Bioinformatics (2006)."},{"key":"e_1_3_2_1_9_1","doi-asserted-by":"crossref","unstructured":"Zhanzhan Cheng Fan Bai Yunlu Xu Gang Zheng Shiliang Pu and Shuigeng Zhou. 2017. Focusing attention: Towards accurate text recognition in natural images. In ICCV.","DOI":"10.1109\/ICCV.2017.543"},{"key":"e_1_3_2_1_10_1","unstructured":"Shancheng Fang Hongtao Xie Yuxin Wang Zhendong Mao and Yongdong Zhang. 2021. Read Like Humans: Autonomous Bidirectional and Iterative Language Modeling for Scene Text Recognition. In CVPR."},{"key":"e_1_3_2_1_11_1","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2021.3051485"},{"key":"e_1_3_2_1_12_1","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2016.2563981"},{"key":"e_1_3_2_1_13_1","doi-asserted-by":"crossref","unstructured":"Alex Graves Santiago Fern\u00e1ndez Faustino Gomez and J\u00fcrgen Schmidhuber. 2006. Connectionist temporal classification: labelling unsegmented sequence data with recurrent neural networks. In ICML.","DOI":"10.1145\/1143844.1143891"},{"key":"e_1_3_2_1_14_1","unstructured":"Tongkun Guan Chaochen Gu Jingzheng Tu Xue Yang Qi Feng Yudi Zhao and Wei Shen. 2022. Self-supervised Implicit Glyph Attention for Text Recognition. arxiv: 2203.03382 [cs.CV]"},{"key":"e_1_3_2_1_15_1","doi-asserted-by":"crossref","unstructured":"Ankush Gupta Andrea Vedaldi and Andrew Zisserman. 2016. Synthetic data for text localisation in natural images. In CVPR.","DOI":"10.1109\/CVPR.2016.254"},{"key":"e_1_3_2_1_16_1","doi-asserted-by":"crossref","unstructured":"Y. He C. Chen J. Zhang J. Liu F. He C. Wang and B. Du. 2022. Visual Semantics Allow for Textual Reasoning Better in Scene Text Recognition. In AAAI.","DOI":"10.1609\/aaai.v36i1.19971"},{"key":"e_1_3_2_1_17_1","volume-title":"GTC: Guided Training of CTC Towards Efficient and Accurate Scene Text Recognition. In AAAI.","author":"Hu W.","year":"2020","unstructured":"W. Hu, X. Cai, J. Hou, S. Yi, and Z. Lin. 2020. GTC: Guided Training of CTC Towards Efficient and Accurate Scene Text Recognition. In AAAI."},{"key":"e_1_3_2_1_18_1","volume-title":"NIPS Workshop.","author":"Jaderberg Max","year":"2014","unstructured":"Max Jaderberg, Karen Simonyan, Andrea Vedaldi, and Andrew Zisserman. 2014. Synthetic data and artificial neural networks for natural scene text recognition. In NIPS Workshop."},{"key":"e_1_3_2_1_19_1","doi-asserted-by":"crossref","unstructured":"Klara Janouskova Jiri Matas Lluis Gomez and Dimosthenis Karatzas. 2021. Text recognition-real world data and where to find them. In ICPR.","DOI":"10.1109\/ICPR48806.2021.9412868"},{"key":"e_1_3_2_1_20_1","doi-asserted-by":"crossref","unstructured":"Lei Kang Marcc al Rusinol Alicia Forn\u00e9s Pau Riba and Mauricio Villegas. 2020. Unsupervised writer adaptation for synthetic-to-real handwritten word recognition. In WACV.","DOI":"10.1109\/WACV45572.2020.9093392"},{"key":"e_1_3_2_1_21_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICDAR.2015.7333942"},{"key":"e_1_3_2_1_22_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICDAR.2013.221"},{"key":"e_1_3_2_1_23_1","volume-title":"Temporal ensembling for semi-supervised learning. arXiv preprint arXiv:1610.02242","author":"Laine Samuli","year":"2016","unstructured":"Samuli Laine and Timo Aila. 2016. Temporal ensembling for semi-supervised learning. arXiv preprint arXiv:1610.02242 (2016)."},{"key":"e_1_3_2_1_24_1","volume-title":"Visualizing Data using t-SNE. JMLR","author":"Maaten Laurens Van Der","year":"2008","unstructured":"Van Der Maaten Laurens and Geoffrey Hinton. 2008. Visualizing Data using t-SNE. JMLR (2008)."},{"key":"e_1_3_2_1_25_1","unstructured":"Chen-Yu Lee and Simon Osindero. 2016. Recursive recurrent nets with attention modeling for OCR in the wild. In CVPR."},{"volume-title":"Workshop on challenges in representation learning, ICML.","author":"Dong-Hyun","key":"e_1_3_2_1_26_1","unstructured":"Dong-Hyun Lee et al. 2013. Pseudo-label: The simple and efficient semi-supervised learning method for deep neural networks. In Workshop on challenges in representation learning, ICML."},{"key":"e_1_3_2_1_27_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00743"},{"key":"e_1_3_2_1_28_1","unstructured":"Mingsheng Long Han Zhu Jianmin Wang and Michael I Jordan. 2017. Deep transfer learning with joint adaptation networks. In ICML."},{"key":"e_1_3_2_1_29_1","volume-title":"MORAN: A Multi-Object Rectified Attention Network for Scene Text Recognition. PR","author":"Luo Canjie","year":"2019","unstructured":"Canjie Luo, Lianwen Jin, and Zenghui Sun. 2019. MORAN: A Multi-Object Rectified Attention Network for Scene Text Recognition. PR (2019)."},{"key":"e_1_3_2_1_30_1","doi-asserted-by":"crossref","unstructured":"U. V. Marti and H. Bunke. 2002. The IAM-database: an English sentence database for offline handwriting recognition. International Journal on Document Analysis & Recognition (2002).","DOI":"10.1007\/s100320200071"},{"key":"e_1_3_2_1_31_1","doi-asserted-by":"crossref","unstructured":"Anand Mishra Karteek Alahari and CV Jawahar. 2012. Scene text recognition using higher order language priors. In BMVC.","DOI":"10.5244\/C.26.127"},{"key":"e_1_3_2_1_32_1","unstructured":"Yongqiang Mou Lei Tan Hui Yang Jingying Chen Leyuan Liu Rui Yan and Yaohong Huang. 2020. PlugNet: Degradation Aware Scene Text Recognition Supervised by a Pluggable Super-Resolution Unit. In ECCV."},{"key":"e_1_3_2_1_33_1","volume-title":"Pytorch: An imperative style, high-performance deep learning library. In NeurIPS.","author":"Paszke Adam","year":"2019","unstructured":"Adam Paszke, Sam Gross, Francisco Massa, Adam Lerer, James Bradbury, Gregory Chanan, Trevor Killeen, Zeming Lin, Natalia Gimelshein, Luca Antiga, et al. 2019. Pytorch: An imperative style, high-performance deep learning library. In NeurIPS."},{"key":"e_1_3_2_1_34_1","doi-asserted-by":"publisher","DOI":"10.1109\/WACV56688.2023.00612"},{"key":"e_1_3_2_1_35_1","unstructured":"Trung Quy Phan Palaiahnakote Shivakumara Shangxuan Tian and Chew Lim Tan. 2013. Recognizing text with perspective distortion in natural scenes. In ICCV."},{"key":"e_1_3_2_1_36_1","volume-title":"Chee Seng Chan, and Chew Lim Tan","author":"Risnumawan Anhar","year":"2014","unstructured":"Anhar Risnumawan, Palaiahankote Shivakumara, Chee Seng Chan, and Chew Lim Tan. 2014. A robust arbitrary text detection system for natural scene images. Expert Systems with Applications (2014)."},{"key":"e_1_3_2_1_37_1","unstructured":"Mamshad Nayeem Rizve Kevin Duarte Yogesh S Rawat and Mubarak Shah. 2021. In defense of pseudo-labeling: An uncertainty-aware pseudo-label selection framework for semi-supervised learning. arXiv preprint arXiv:2101.06329 (2021)."},{"key":"e_1_3_2_1_38_1","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2016.2646371"},{"key":"e_1_3_2_1_39_1","volume-title":"ASTER: An Attentional Scene Text Recognizer with Flexible Rectification","author":"Shi Baoguang","year":"2018","unstructured":"Baoguang Shi, Mingkun Yang, Xinggang Wang, Pengyuan Lyu, Cong Yao, and Xiang Bai. 2018. ASTER: An Attentional Scene Text Recognizer with Flexible Rectification. IEEE TPAMI (2018)."},{"key":"e_1_3_2_1_40_1","volume-title":"Alexey Kurakin, and Chun-Liang Li.","author":"Sohn Kihyuk","year":"2020","unstructured":"Kihyuk Sohn, David Berthelot, Nicholas Carlini, Zizhao Zhang, Han Zhang, Colin A Raffel, Ekin Dogus Cubuk, Alexey Kurakin, and Chun-Liang Li. 2020. Fixmatch: Simplifying semi-supervised learning with consistency and confidence. In NeurIPS."},{"key":"e_1_3_2_1_41_1","volume-title":"Accurate recognition of words in scenes without character segmentation using recurrent neural network. PR","author":"Su Bolan","year":"2017","unstructured":"Bolan Su and Shijian Lu. 2017. Accurate recognition of words in scenes without character segmentation using recurrent neural network. PR (2017)."},{"key":"e_1_3_2_1_42_1","unstructured":"Antti Tarvainen and Harri Valpola. 2017a. Mean teachers are better role models: Weight-averaged consistency targets improve semi-supervised deep learning results. In NeurIPS."},{"key":"e_1_3_2_1_43_1","volume-title":"Weight-averaged consistency targets improve semi-supervised deep learning results. CoRR abs\/1703.01780. arXiv preprint arXiv:1703.01780","author":"Tarvainen A","year":"2017","unstructured":"A Tarvainen and H Valpola. 2017b. Weight-averaged consistency targets improve semi-supervised deep learning results. CoRR abs\/1703.01780. arXiv preprint arXiv:1703.01780, Vol. 1, 5 (2017)."},{"key":"e_1_3_2_1_44_1","unstructured":"Ashish Vaswani Noam Shazeer Niki Parmar Jakob Uszkoreit Llion Jones Aidan N Gomez \u0141ukasz Kaiser and Illia Polosukhin. 2017. Attention is all you need. In NeurIPS."},{"key":"e_1_3_2_1_45_1","unstructured":"Jianfeng Wang and Xiaolin Hu. 2017. Gated recurrent convolution neural network for ocr. In NeurIPS."},{"key":"e_1_3_2_1_46_1","doi-asserted-by":"crossref","unstructured":"Kai Wang Boris Babenko and Serge Belongie. 2011. End-to-end scene text recognition. In ICCV.","DOI":"10.1109\/ICCV.2011.6126402"},{"key":"e_1_3_2_1_47_1","doi-asserted-by":"crossref","unstructured":"Tianwei Wang Yuanzhi Zhu Lianwen Jin Canjie Luo Xiaoxue Chen Yaqiang Wu Qianying Wang and Mingxiang Cai. 2020. Decoupled Attention Network for Text Recognition. In AAAI.","DOI":"10.1609\/aaai.v34i07.6903"},{"key":"e_1_3_2_1_48_1","volume-title":"Freematch: Self-adaptive thresholding for semi-supervised learning. arXiv preprint arXiv:2205.07246","author":"Wang Yidong","year":"2022","unstructured":"Yidong Wang, Hao Chen, Qiang Heng, Wenxin Hou, Marios Savvides, Takahiro Shinozaki, Bhiksha Raj, Zhen Wu, and Jindong Wang. 2022a. Freematch: Self-adaptive thresholding for semi-supervised learning. arXiv preprint arXiv:2205.07246 (2022)."},{"key":"e_1_3_2_1_49_1","doi-asserted-by":"crossref","unstructured":"Yuchao Wang Haochen Wang Yujun Shen Jingjing Fei Wei Li Guoqiang Jin Liwei Wu Rui Zhao and Xinyi Le. 2022b. Semi-Supervised Semantic Segmentation Using Unreliable Pseudo-Labels. In CVPR.","DOI":"10.1109\/CVPR52688.2022.00421"},{"key":"e_1_3_2_1_50_1","doi-asserted-by":"crossref","unstructured":"Yuxin Wang Hongtao Xie Shancheng Fang Jing Wang Shenggao Zhu and Yongdong Zhang. 2021. From Two to One: A New Scene Text Recognizer with Visual Language Modeling Network. In ICCV.","DOI":"10.1109\/ICCV48922.2021.01393"},{"key":"e_1_3_2_1_51_1","unstructured":"Deli Yu Xuan Li Chengquan Zhang Tao Liu Junyu Han Jingtuo Liu and Errui Ding. 2020b. Towards Accurate Scene Text Recognition With Semantic Reasoning Networks. In CVPR."},{"key":"e_1_3_2_1_52_1","unstructured":"Qing Yu Daiki Ikami Go Irie and Kiyoharu Aizawa. 2020a. Multi-task curriculum framework for open-set semi-supervised learning. In ECCV."},{"key":"e_1_3_2_1_53_1","unstructured":"Xiaoyu Yue Zhanghui Kuang Chenhao Lin Hongbin Sun and Wayne Zhang. 2020. RobustScanner: Dynamically Enhancing Positional Clues for Robust Text Recognition. In ECCV."},{"key":"e_1_3_2_1_54_1","volume-title":"Adadelta: an adaptive learning rate method. arXiv preprint arXiv:1212.5701","author":"Zeiler Matthew D","year":"2012","unstructured":"Matthew D Zeiler. 2012. Adadelta: an adaptive learning rate method. arXiv preprint arXiv:1212.5701 (2012)."},{"key":"e_1_3_2_1_55_1","volume-title":"Flexmatch: Boosting semi-supervised learning with curriculum pseudo labeling. In NeurIPS.","author":"Zhang Bowen","year":"2021","unstructured":"Bowen Zhang, Yidong Wang, Wenxin Hou, Hao Wu, Jindong Wang, Manabu Okumura, and Takahiro Shinozaki. 2021. Flexmatch: Boosting semi-supervised learning with curriculum pseudo labeling. In NeurIPS."},{"key":"e_1_3_2_1_56_1","volume-title":"SUNw: Scene Understanding Workshop-CVPR","volume":"2017","author":"Zhang Ying","year":"2017","unstructured":"Ying Zhang, Lionel Gueguen, Ilya Zharkov, Peter Zhang, Keith Seifert, and Ben Kadlec. 2017. Uber-text: A large-scale dataset for optical character recognition from street-level imagery. In SUNw: Scene Understanding Workshop-CVPR, Vol. 2017. 5."},{"key":"e_1_3_2_1_57_1","doi-asserted-by":"crossref","unstructured":"Yaping Zhang Shuai Nie Wenju Liu Xing Xu Dongxiang Zhang and Heng Tao Shen. 2019. Sequence-To-Sequence Domain Adaptation Network for Robust Text Image Recognition. In CVPR.","DOI":"10.1109\/CVPR.2019.00285"},{"key":"e_1_3_2_1_58_1","doi-asserted-by":"crossref","unstructured":"Caiyuan Zheng Hui Li Seon-Min Rhee Seungju Han Jae-Joon Han and Peng Wang. 2022. Pushing the Performance Limit of Scene Text Recognizer without Human Annotation. In CVPR.","DOI":"10.1109\/CVPR52688.2022.01372"},{"key":"e_1_3_2_1_59_1","volume-title":"Cdistnet: Perceiving multi-domain character distance for robust text recognition. arXiv preprint arXiv:2111.11011","author":"Zheng Tianlun","year":"2021","unstructured":"Tianlun Zheng, Zhineng Chen, Shancheng Fang, Hongtao Xie, and Yu-Gang Jiang. 2021. Cdistnet: Perceiving multi-domain character distance for robust text recognition. arXiv preprint arXiv:2111.11011 (2021)."}],"event":{"name":"MM '23: The 31st ACM International Conference on Multimedia","sponsor":["SIGMM ACM Special Interest Group on Multimedia"],"location":"Ottawa ON Canada","acronym":"MM '23"},"container-title":["Proceedings of the 31st ACM International Conference on Multimedia"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3581783.3611791","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3581783.3611791","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,8,22]],"date-time":"2025-08-22T00:02:30Z","timestamp":1755820950000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3581783.3611791"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023,10,26]]},"references-count":59,"alternative-id":["10.1145\/3581783.3611791","10.1145\/3581783"],"URL":"https:\/\/doi.org\/10.1145\/3581783.3611791","relation":{},"subject":[],"published":{"date-parts":[[2023,10,26]]},"assertion":[{"value":"2023-10-27","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}