{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,15]],"date-time":"2026-07-15T13:01:54Z","timestamp":1784120514931,"version":"3.55.0"},"publisher-location":"Cham","reference-count":93,"publisher":"Springer Nature Switzerland","isbn-type":[{"value":"9783031198052","type":"print"},{"value":"9783031198069","type":"electronic"}],"license":[{"start":{"date-parts":[[2022,1,1]],"date-time":"2022-01-01T00:00:00Z","timestamp":1640995200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2022,1,1]],"date-time":"2022-01-01T00:00:00Z","timestamp":1640995200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2022]]},"DOI":"10.1007\/978-3-031-19806-9_10","type":"book-chapter","created":{"date-parts":[[2022,10,19]],"date-time":"2022-10-19T23:11:54Z","timestamp":1666221114000},"page":"163-182","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":14,"title":["Background-Insensitive Scene Text Recognition with\u00a0Text Semantic Segmentation"],"prefix":"10.1007","author":[{"given":"Liang","family":"Zhao","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zhenyao","family":"Wu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xinyi","family":"Wu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Greg","family":"Wilsbacher","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Song","family":"Wang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2022,10,20]]},"reference":[{"issue":"3\u20134","key":"10_CR1","doi-asserted-by":"publisher","first-page":"147","DOI":"10.1016\/j.diin.2011.12.001","volume":"8","author":"R Al-Zaidy","year":"2012","unstructured":"Al-Zaidy, R., Fung, B.C., Youssef, A.M., Fortin, F.: Mining criminal networks from unstructured text documents. Digit. Investig. 8(3\u20134), 147\u2013160 (2012)","journal-title":"Digit. Investig."},{"key":"10_CR2","unstructured":"Alsharif, O., Pineau, J.: End-to-end text recognition with hybrid hmm maxout models. arXiv preprint arXiv:1310.1811 (2013)"},{"key":"10_CR3","doi-asserted-by":"crossref","unstructured":"Atienza, R.: Vision transformer for fast and efficient scene text recognition. arXiv preprint arXiv:2105.08582 (2021)","DOI":"10.1007\/978-3-030-86549-8_21"},{"key":"10_CR4","doi-asserted-by":"crossref","unstructured":"Baek, J., et al.: What is wrong with scene text recognition model comparisons? Dataset and model analysis. In: IEEE\/CVF International Conference on Computer Vision (ICCV), pp. 4715\u20134723 (2019)","DOI":"10.1109\/ICCV.2019.00481"},{"key":"10_CR5","doi-asserted-by":"crossref","unstructured":"Baek, J., Matsui, Y., Aizawa, K.: What if we only use real datasets for scene text recognition? Toward scene text recognition with fewer labels. In: IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 3113\u20133122 (2021)","DOI":"10.1109\/CVPR46437.2021.00313"},{"key":"10_CR6","doi-asserted-by":"crossref","unstructured":"Bao, W., Lai, W.S., Ma, C., Zhang, X., Gao, Z., Yang, M.H.: Depth-aware video frame interpolation. In: IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 3703\u20133712 (2019)","DOI":"10.1109\/CVPR.2019.00382"},{"key":"10_CR7","unstructured":"Bartz, C., Bethge, J., Yang, H., Meinel, C.: Kiss: keeping it simple for scene text recognition. arXiv preprint arXiv:1911.08400 (2019)"},{"key":"10_CR8","doi-asserted-by":"crossref","unstructured":"Bau, D., et al.: Seeing what a GAN cannot generate. In: IEEE\/CVF International Conference on Computer Vision (ICCV), pp. 4502\u20134511 (2019)","DOI":"10.1109\/ICCV.2019.00460"},{"key":"10_CR9","doi-asserted-by":"crossref","unstructured":"Bhunia, A.K., Sain, A., Kumar, A., Ghose, S., Chowdhury, P.N., Song, Y.Z.: Joint visual semantic reasoning: multi-stage decoder for text recognition. In: IEEE\/CVF International Conference on Computer Vision (ICCV), pp. 14940\u201314949 (2021)","DOI":"10.1109\/ICCV48922.2021.01467"},{"key":"10_CR10","doi-asserted-by":"crossref","unstructured":"Bissacco, A., Cummins, M., Netzer, Y., Neven, H.: PhotooCR: reading text in uncontrolled conditions. In: IEEE\/CVF International Conference on Computer Vision (ICCV), pp. 785\u2013792 (2013)","DOI":"10.1109\/ICCV.2013.102"},{"key":"10_CR11","doi-asserted-by":"publisher","first-page":"261","DOI":"10.1016\/j.neucom.2019.11.049","volume":"381","author":"X Chen","year":"2020","unstructured":"Chen, X., Wang, T., Zhu, Y., Jin, L., Luo, C.: Adaptive embedding gate for attention-based scene text recognition. Neurocomputing 381, 261\u2013271 (2020)","journal-title":"Neurocomputing"},{"key":"10_CR12","doi-asserted-by":"crossref","unstructured":"Chen, Y., Li, V.O., Cho, K., Bowman, S.R.: A stable and effective learning strategy for trainable greedy decoding. arXiv preprint arXiv:1804.07915 (2018)","DOI":"10.18653\/v1\/D18-1035"},{"key":"10_CR13","doi-asserted-by":"crossref","unstructured":"Cheng, Z., Xu, Y., Bai, F., Niu, Y., Pu, S., Zhou, S.: Aon: towards arbitrarily-oriented text recognition. In: IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 5571\u20135579 (2018)","DOI":"10.1109\/CVPR.2018.00584"},{"key":"10_CR14","doi-asserted-by":"crossref","unstructured":"Ch\u2019ng, C.K., Chan, C.S.: Total-text: a comprehensive dataset for scene text detection and recognition. In: 2017 14th IAPR International Conference on Document Analysis and Recognition (ICDAR), vol. 1, pp. 935\u2013942. IEEE (2017)","DOI":"10.1109\/ICDAR.2017.157"},{"key":"10_CR15","doi-asserted-by":"crossref","unstructured":"Chng, C.K., et al.: ICDAR 2019 robust reading challenge on arbitrary-shaped text-RRC-art. In: 2019 International Conference on Document Analysis and Recognition (ICDAR), pp. 1571\u20131576. IEEE (2019)","DOI":"10.1109\/ICDAR.2019.00252"},{"key":"10_CR16","unstructured":"Devlin, J., Chang, M.W., Lee, K., Toutanova, K.: BERT: pre-training of deep bidirectional transformers for language understanding. arXiv preprint arXiv:1810.04805 (2018)"},{"key":"10_CR17","doi-asserted-by":"crossref","unstructured":"Diaz-Escobar, J., Kober, V.: Natural scene text detection and segmentation using phase-based regions and character retrieval. In: Mathematical Problems in Engineering 2020 (2020)","DOI":"10.1155\/2020\/7067251"},{"key":"10_CR18","doi-asserted-by":"crossref","unstructured":"Engelmann, F., Kontogianni, T., Hermans, A., Leibe, B.: Exploring spatial context for 3D semantic segmentation of point clouds. In: IEEE International Conference on Computer Vision workshops, pp. 716\u2013724 (2017)","DOI":"10.1109\/ICCVW.2017.90"},{"key":"10_CR19","doi-asserted-by":"crossref","unstructured":"Fang, S., Xie, H., Wang, Y., Mao, Z., Zhang, Y.: Read like humans: autonomous, bidirectional and iterative language modeling for scene text recognition. In: IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 7098\u20137107 (2021)","DOI":"10.1109\/CVPR46437.2021.00702"},{"key":"10_CR20","doi-asserted-by":"crossref","unstructured":"Fang, S., Xie, H., Zha, Z.J., Sun, N., Tan, J., Zhang, Y.: Attention and language ensemble for scene text recognition with convolutional sequence modeling. In: ACM International Conference on Multimedia, pp. 248\u2013256 (2018)","DOI":"10.1145\/3240508.3240571"},{"key":"10_CR21","unstructured":"Gidaris, S., Singh, P., Komodakis, N.: Unsupervised representation learning by predicting image rotations. arXiv preprint arXiv:1803.07728 (2018)"},{"key":"10_CR22","unstructured":"Goodfellow, I., et al.: Generative adversarial nets. In: Advances in Neural Information Processing Systems (NeurIPS), vol. 27 (2014)"},{"key":"10_CR23","doi-asserted-by":"crossref","unstructured":"Gupta, A., Vedaldi, A., Zisserman, A.: Synthetic data for text localisation in natural images. In: IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 2315\u20132324 (2016)","DOI":"10.1109\/CVPR.2016.254"},{"key":"10_CR24","doi-asserted-by":"crossref","unstructured":"Hong, T., Hull, J.J.: Visual inter-word relations and their use in OCR postprocessing. In: Proceedings of 3rd International Conference on Document Analysis and Recognition (ICDAR), vol. 1, pp. 442\u2013445. IEEE (1995)","DOI":"10.1109\/ICDAR.1995.599031"},{"key":"10_CR25","doi-asserted-by":"crossref","unstructured":"Hu, W., Cai, X., Hou, J., Yi, S., Lin, Z.: GTC: guided training of CTC towards efficient and accurate scene text recognition. In: Association for the Advancement of Artificial Intelligence (AAAI), vol. 34, pp. 11005\u201311012 (2020)","DOI":"10.1609\/aaai.v34i07.6735"},{"key":"10_CR26","unstructured":"Jaderberg, M., Simonyan, K., Vedaldi, A., Zisserman, A.: Deep structured output learning for unconstrained text recognition. arXiv preprint arXiv:1412.5903 (2014)"},{"key":"10_CR27","unstructured":"Jaderberg, M., Simonyan, K., Vedaldi, A., Zisserman, A.: Synthetic data and artificial neural networks for natural scene text recognition. arXiv preprint arXiv:1406.2227 (2014)"},{"issue":"1","key":"10_CR28","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1007\/s11263-015-0823-z","volume":"116","author":"M Jaderberg","year":"2016","unstructured":"Jaderberg, M., Simonyan, K., Vedaldi, A., Zisserman, A.: Reading text in the wild with convolutional neural networks. Int. J. Comput. Vision (IJCV) 116(1), 1\u201320 (2016)","journal-title":"Int. J. Comput. Vision (IJCV)"},{"key":"10_CR29","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"512","DOI":"10.1007\/978-3-319-10593-2_34","volume-title":"Computer Vision \u2013 ECCV 2014","author":"M Jaderberg","year":"2014","unstructured":"Jaderberg, M., Vedaldi, A., Zisserman, A.: Deep features for text spotting. In: Fleet, D., Pajdla, T., Schiele, B., Tuytelaars, T. (eds.) ECCV 2014. LNCS, vol. 8692, pp. 512\u2013528. Springer, Cham (2014). https:\/\/doi.org\/10.1007\/978-3-319-10593-2_34"},{"key":"10_CR30","doi-asserted-by":"crossref","unstructured":"Jung, S., Lee, U., Jung, J., Shim, D.H.: Real-time traffic sign recognition system with deep convolutional neural network. In: International Conference on Ubiquitous Robots and Ambient Intelligence (URAI), pp. 31\u201334. IEEE (2016)","DOI":"10.1109\/URAI.2016.7734014"},{"key":"10_CR31","doi-asserted-by":"crossref","unstructured":"Karatzas, D., et al.: ICDAR 2015 competition on robust reading. In: 2015 13th International Conference on Document Analysis and Recognition (ICDAR), pp. 1156\u20131160. IEEE (2015)","DOI":"10.1109\/ICDAR.2015.7333942"},{"key":"10_CR32","doi-asserted-by":"crossref","unstructured":"Karatzas, D., et al.: ICDAR 2013 robust reading competition. In: 2013 12th International Conference on Document Analysis and Recognition (ICDAR), pp. 1484\u20131493. IEEE (2013)","DOI":"10.1109\/ICDAR.2013.221"},{"key":"10_CR33","unstructured":"Krishnan, P., Kovvuri, R., Pang, G., Vassilev, B., Hassner, T.: Textstylebrush: transfer of text aesthetics from a single example. arXiv preprint arXiv:2106.08385 (2021)"},{"key":"10_CR34","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"703","DOI":"10.1007\/978-3-319-10599-4_45","volume-title":"Computer Vision \u2013 ECCV 2014","author":"A Kundu","year":"2014","unstructured":"Kundu, A., Li, Y., Dellaert, F., Li, F., Rehg, J.M.: Joint semantic segmentation and 3D reconstruction from monocular video. In: Fleet, D., Pajdla, T., Schiele, B., Tuytelaars, T. (eds.) ECCV 2014. LNCS, vol. 8694, pp. 703\u2013718. Springer, Cham (2014). https:\/\/doi.org\/10.1007\/978-3-319-10599-4_45"},{"key":"10_CR35","doi-asserted-by":"crossref","unstructured":"Laina, I., Rupprecht, C., Navab, N.: Towards unsupervised image captioning with shared multimodal embeddings. In: IEEE\/CVF International Conference on Computer Vision (ICCV), pp. 7414\u20137424 (2019)","DOI":"10.1109\/ICCV.2019.00751"},{"key":"10_CR36","doi-asserted-by":"crossref","unstructured":"Lee, C.Y., Osindero, S.: Recursive recurrent nets with attention modeling for OCR in the wild. In: IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 2231\u20132239 (2016)","DOI":"10.1109\/CVPR.2016.245"},{"key":"10_CR37","unstructured":"Lee, D.H., et al.: Pseudo-label: the simple and efficient semi-supervised learning method for deep neural networks. In: Workshop on challenges in representation learning, International Conference on Machine Learning (ICML), vol. 3, p. 896 (2013)"},{"key":"10_CR38","doi-asserted-by":"crossref","unstructured":"Li, H., Wang, P., Shen, C., Zhang, G.: Show, attend and read: a simple and strong baseline for irregular text recognition. In: Association for the Advancement of Artificial Intelligence (AAAI), vol. 33, pp. 8610\u20138617 (2019)","DOI":"10.1609\/aaai.v33i01.33018610"},{"key":"10_CR39","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"706","DOI":"10.1007\/978-3-030-58621-8_41","volume-title":"Computer Vision \u2013 ECCV 2020","author":"M Liao","year":"2020","unstructured":"Liao, M., Pang, G., Huang, J., Hassner, T., Bai, X.: Mask TextSpotter v3: segmentation proposal network for robust scene text spotting. In: Vedaldi, A., Bischof, H., Brox, T., Frahm, J.-M. (eds.) ECCV 2020. LNCS, vol. 12356, pp. 706\u2013722. Springer, Cham (2020). https:\/\/doi.org\/10.1007\/978-3-030-58621-8_41"},{"key":"10_CR40","doi-asserted-by":"crossref","unstructured":"Liao, M., et al.: Scene text recognition from two-dimensional perspective. In: Association for the Advancement of Artificial Intelligence (AAAI), vol. 33, pp. 8714\u20138721 (2019)","DOI":"10.1609\/aaai.v33i01.33018714"},{"key":"10_CR41","doi-asserted-by":"crossref","unstructured":"Litman, R., Anschel, O., Tsiper, S., Litman, R., Mazor, S., Manmatha, R.: Scatter: selective context attentional scene text recognizer. In: IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 11962\u201311972 (2020)","DOI":"10.1109\/CVPR42600.2020.01198"},{"key":"10_CR42","doi-asserted-by":"crossref","unstructured":"Liu, W., Chen, C., Wong, K.Y.K.: Char-net: A character-aware neural network for distorted scene text recognition. In: Association for the Advancement of Artificial Intelligence (AAAI) (2018)","DOI":"10.1609\/aaai.v32i1.12246"},{"key":"10_CR43","doi-asserted-by":"crossref","unstructured":"Liu, W., Chen, C., Wong, K.Y.K., Su, Z., Han, J.: Star-net: a spatial attention residue network for scene text recognition. In: British Machine Vision Conference (BMVC), vol. 2, p. 7 (2016)","DOI":"10.5244\/C.30.43"},{"key":"10_CR44","doi-asserted-by":"crossref","unstructured":"Liu, X., Kawanishi, T., Wu, X., Kashino, K.: Scene text recognition with CNN classifier and WFST-based word labeling. In: 2016 23rd International Conference on Pattern Recognition (ICPR), pp. 3999\u20134004. IEEE (2016)","DOI":"10.1109\/ICPR.2016.7900259"},{"issue":"6","key":"10_CR45","doi-asserted-by":"publisher","first-page":"386","DOI":"10.1016\/j.ijhcs.2009.08.007","volume":"68","author":"R Looije","year":"2010","unstructured":"Looije, R., Neerincx, M.A., Cnossen, F.: Persuasive robotic assistant for health self-management of older adults: design and evaluation of social behaviors. Int. J. Hum.-Comput. Stud. (IJHCS) 68(6), 386\u2013397 (2010)","journal-title":"Int. J. Hum.-Comput. Stud. (IJHCS)"},{"issue":"4","key":"10_CR46","doi-asserted-by":"publisher","first-page":"960","DOI":"10.1007\/s11263-020-01411-1","volume":"129","author":"C Luo","year":"2021","unstructured":"Luo, C., Lin, Q., Liu, Y., Jin, L., Shen, C.: Separating content from style using adversarial learning for recognizing text in the wild. Int. J. Comput. Vision (IJCV) 129(4), 960\u2013976 (2021)","journal-title":"Int. J. Comput. Vision (IJCV)"},{"key":"10_CR47","doi-asserted-by":"crossref","unstructured":"Mishra, A., Alahari, K., Jawahar, C.: Scene text recognition using higher order language priors. In: British Machine Vision Conference (BMVC). BMVA (2012)","DOI":"10.5244\/C.26.127"},{"key":"10_CR48","doi-asserted-by":"publisher","first-page":"30","DOI":"10.1016\/j.cviu.2016.01.002","volume":"145","author":"A Mishra","year":"2016","unstructured":"Mishra, A., Alahari, K., Jawahar, C.: Enhancing energy minimization framework for scene text recognition with top-down cues. Comput. Vision Image Underst. (CVIU) 145, 30\u201342 (2016)","journal-title":"Comput. Vision Image Underst. (CVIU)"},{"key":"10_CR49","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"158","DOI":"10.1007\/978-3-030-58555-6_10","volume-title":"Computer Vision \u2013 ECCV 2020","author":"Y Mou","year":"2020","unstructured":"Mou, Y., et al.: PlugNet: degradation aware scene text recognition supervised by a pluggable super-resolution unit. In: Vedaldi, A., Bischof, H., Brox, T., Frahm, J.-M. (eds.) ECCV 2020. LNCS, vol. 12360, pp. 158\u2013174. Springer, Cham (2020). https:\/\/doi.org\/10.1007\/978-3-030-58555-6_10"},{"key":"10_CR50","doi-asserted-by":"crossref","unstructured":"Nayef, N., et al.: ICDAR 2019 robust reading challenge on multi-lingual scene text detection and recognition-RRC-MLT-2019. In: 2019 International Conference on Document Analysis and Recognition (ICDAR), pp. 1582\u20131587. IEEE (2019)","DOI":"10.1109\/ICDAR.2019.00254"},{"key":"10_CR51","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"770","DOI":"10.1007\/978-3-642-19318-7_60","volume-title":"Computer Vision \u2013 ACCV 2010","author":"L Neumann","year":"2011","unstructured":"Neumann, L., Matas, J.: A method for text localization and recognition in real-world images. In: Kimmel, R., Klette, R., Sugimoto, A. (eds.) ACCV 2010. LNCS, vol. 6494, pp. 770\u2013783. Springer, Heidelberg (2011). https:\/\/doi.org\/10.1007\/978-3-642-19318-7_60"},{"key":"10_CR52","doi-asserted-by":"crossref","unstructured":"Park, T., Liu, M.Y., Wang, T.C., Zhu, J.Y.: Semantic image synthesis with spatially-adaptive normalization. In: IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2019)","DOI":"10.1109\/CVPR.2019.00244"},{"key":"10_CR53","doi-asserted-by":"crossref","unstructured":"Phan, T.Q., Shivakumara, P., Tian, S., Tan, C.L.: Recognizing text with perspective distortion in natural scenes. In: IEEE\/CVF International Conference on Computer Vision (ICCV), pp. 569\u2013576 (2013)","DOI":"10.1109\/ICCV.2013.76"},{"key":"10_CR54","doi-asserted-by":"crossref","unstructured":"Qiao, Z., et al.: PimNet: a parallel, iterative and mimicking network for scene text recognition. In: ACM International Conference on Multimedia, pp. 2046\u20132055 (2021)","DOI":"10.1145\/3474085.3475238"},{"key":"10_CR55","doi-asserted-by":"crossref","unstructured":"Qiao, Z., Zhou, Y., Yang, D., Zhou, Y., Wang, W.: Seed: semantics enhanced encoder-decoder framework for scene text recognition. In: IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 13528\u201313537 (2020)","DOI":"10.1109\/CVPR42600.2020.01354"},{"key":"10_CR56","unstructured":"Ramesh, A., et al.: Zero-shot text-to-image generation. In: International Conference on Machine Learning (ICML), pp. 8821\u20138831. PMLR (2021)"},{"issue":"4","key":"10_CR57","doi-asserted-by":"publisher","first-page":"1895","DOI":"10.1109\/TIP.2018.2876178","volume":"28","author":"W Ren","year":"2018","unstructured":"Ren, W., et al.: Deep video dehazing with semantic segmentation. IEEE Trans. Image Process. (TIP) 28(4), 1895\u20131908 (2018)","journal-title":"IEEE Trans. Image Process. (TIP)"},{"issue":"18","key":"10_CR58","doi-asserted-by":"publisher","first-page":"8027","DOI":"10.1016\/j.eswa.2014.07.008","volume":"41","author":"A Risnumawan","year":"2014","unstructured":"Risnumawan, A., Shivakumara, P., Chan, C.S., Tan, C.L.: A robust arbitrary text detection system for natural scene images. Expert Syst. Appl. 41(18), 8027\u20138048 (2014)","journal-title":"Expert Syst. Appl."},{"issue":"11","key":"10_CR59","doi-asserted-by":"publisher","first-page":"2298","DOI":"10.1109\/TPAMI.2016.2646371","volume":"39","author":"B Shi","year":"2016","unstructured":"Shi, B., Bai, X., Yao, C.: An end-to-end trainable neural network for image-based sequence recognition and its application to scene text recognition. IEEE Trans. Pattern Anal. Mach. Intell. (TPAMI) 39(11), 2298\u20132304 (2016)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell. (TPAMI)"},{"key":"10_CR60","doi-asserted-by":"crossref","unstructured":"Shi, B., Wang, X., Lyu, P., Yao, C., Bai, X.: Robust scene text recognition with automatic rectification. In: IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 4168\u20134176 (2016)","DOI":"10.1109\/CVPR.2016.452"},{"issue":"9","key":"10_CR61","doi-asserted-by":"publisher","first-page":"2035","DOI":"10.1109\/TPAMI.2018.2848939","volume":"41","author":"B Shi","year":"2018","unstructured":"Shi, B., Yang, M., Wang, X., Lyu, P., Yao, C., Bai, X.: Aster: an attentional scene text recognizer with flexible rectification. IEEE Trans. Pattern Anal. Mach. Intell. (TPAMI) 41(9), 2035\u20132048 (2018)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell. (TPAMI)"},{"key":"10_CR62","doi-asserted-by":"crossref","unstructured":"Shi, B., et al.: ICDAR 2017 competition on reading Chinese text in the wild (RCTW-17). In: 2017 14th IAPR International Conference on Document Analysis and Recognition (ICDAR), vol. 1, pp. 1429\u20131434. IEEE (2017)","DOI":"10.1109\/ICDAR.2017.233"},{"key":"10_CR63","doi-asserted-by":"crossref","unstructured":"Sivic, J., Zisserman, A.: Video Google: a text retrieval approach to object matching in videos. In: IEEE\/CVF International Conference on Computer Vision (ICCV), vol. 3, pp. 1470\u20131470. IEEE Computer Society (2003)","DOI":"10.1109\/ICCV.2003.1238663"},{"key":"10_CR64","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"35","DOI":"10.1007\/978-3-319-16865-4_3","volume-title":"Computer Vision \u2013 ACCV 2014","author":"B Su","year":"2015","unstructured":"Su, B., Lu, S.: Accurate scene text recognition based on recurrent neural network. In: Cremers, D., Reid, I., Saito, H., Yang, M.-H. (eds.) ACCV 2014. LNCS, vol. 9003, pp. 35\u201348. Springer, Cham (2015). https:\/\/doi.org\/10.1007\/978-3-319-16865-4_3"},{"key":"10_CR65","doi-asserted-by":"crossref","unstructured":"Sun, Y., et al.: ICDAR 2019 competition on large-scale street view text with partial labeling-RRC-LSVT. In: 2019 International Conference on Document Analysis and Recognition (ICDAR), pp. 1557\u20131562. IEEE (2019)","DOI":"10.1109\/ICDAR.2019.00250"},{"key":"10_CR66","doi-asserted-by":"crossref","unstructured":"Tchapmi, L., Choy, C., Armeni, I., Gwak, J., Savarese, S.: SegCloud: semantic segmentation of 3D point clouds. In: 2017 International Conference on 3D Vision (3DV), pp. 537\u2013547. IEEE (2017)","DOI":"10.1109\/3DV.2017.00067"},{"key":"10_CR67","doi-asserted-by":"crossref","unstructured":"Tewel, Y., Shalev, Y., Schwartz, I., Wolf, L.: Zero-shot image-to-text generation for visual-semantic arithmetic. arXiv preprint arXiv:2111.14447 (2021)","DOI":"10.1109\/CVPR52688.2022.01739"},{"key":"10_CR68","unstructured":"Vaswani, A., et al.: Attention is all you need. In: Advances in Neural Information Processing Systems (NeurIPS), pp. 5998\u20136008 (2017)"},{"key":"10_CR69","unstructured":"Veit, A., Matera, T., Neumann, L., Matas, J., Belongie, S.: Coco-text: dataset and benchmark for text detection and recognition in natural images. arXiv preprint arXiv:1601.07140 (2016)"},{"key":"10_CR70","doi-asserted-by":"crossref","unstructured":"Wan, Z., He, M., Chen, H., Bai, X., Yao, C.: TextScanner: reading characters in order for robust scene text recognition. In: Association for the Advancement of Artificial Intelligence (AAAI), vol. 34, pp. 12120\u201312127 (2020)","DOI":"10.1609\/aaai.v34i07.6891"},{"key":"10_CR71","doi-asserted-by":"crossref","unstructured":"Wang, J., Li, X., Yang, J.: Stacked conditional generative adversarial networks for jointly learning shadow detection and shadow removal. In: IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 1788\u20131797 (2018)","DOI":"10.1109\/CVPR.2018.00192"},{"key":"10_CR72","unstructured":"Wang, J., et al.: Deep high-resolution representation learning for visual recognition. IEEE Trans. Pattern Anal. Mach. Intell. (TPAMI) (2020)"},{"key":"10_CR73","unstructured":"Wang, K., Babenko, B., Belongie, S.: End-to-end scene text recognition. In: IEEE\/CVF International Conference on Computer Vision (ICCV), pp. 1457\u20131464. IEEE (2011)"},{"key":"10_CR74","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"591","DOI":"10.1007\/978-3-642-15549-9_43","volume-title":"Computer Vision \u2013 ECCV 2010","author":"K Wang","year":"2010","unstructured":"Wang, K., Belongie, S.: Word spotting in the wild. In: Daniilidis, K., Maragos, P., Paragios, N. (eds.) ECCV 2010. LNCS, vol. 6311, pp. 591\u2013604. Springer, Heidelberg (2010). https:\/\/doi.org\/10.1007\/978-3-642-15549-9_43"},{"key":"10_CR75","doi-asserted-by":"crossref","unstructured":"Wang, S., Wang, Y., Qin, X., Zhao, Q., Tang, Z.: Scene text recognition via gated cascade attention. In: IEEE International Conference on Multimedia and Expo (ICME), pp. 1018\u20131023. IEEE (2019)","DOI":"10.1109\/ICME.2019.00179"},{"key":"10_CR76","doi-asserted-by":"crossref","unstructured":"Wang, T., et al.: Decoupled attention network for text recognition. In: Association for the Advancement of Artificial Intelligence (AAAI), vol. 34, pp. 12216\u201312224 (2020)","DOI":"10.1609\/aaai.v34i07.6903"},{"key":"10_CR77","doi-asserted-by":"crossref","unstructured":"Wang, X., Yu, K., Dong, C., Loy, C.C.: Recovering realistic texture in image super-resolution by deep spatial feature transform. In: IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 606\u2013615 (2018)","DOI":"10.1109\/CVPR.2018.00070"},{"key":"10_CR78","doi-asserted-by":"crossref","unstructured":"Xu, X., Zhang, Z., Wang, Z., Price, B., Wang, Z., Shi, H.: Rethinking text segmentation: a novel dataset and a text-specific refinement approach. In: IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 12045\u201312055 (2021)","DOI":"10.1109\/CVPR46437.2021.01187"},{"key":"10_CR79","doi-asserted-by":"crossref","unstructured":"Yan, R., Peng, L., Xiao, S., Yao, G.: Primitive representation learning for scene text recognition. In: IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 284\u2013293 (2021)","DOI":"10.1109\/CVPR46437.2021.00035"},{"key":"10_CR80","doi-asserted-by":"crossref","unstructured":"Yang, M., et al.: Symmetry-constrained rectification network for scene text recognition. In: IEEE\/CVF International Conference on Computer Vision (ICCV), pp. 9147\u20139156 (2019)","DOI":"10.1109\/ICCV.2019.00924"},{"key":"10_CR81","doi-asserted-by":"crossref","unstructured":"Yang, X., He, D., Zhou, Z., Kifer, D., Giles, C.L.: Learning to read irregular text with attention mechanisms. In: International Joint Conference on Artificial Intelligence (IJCAI), vol. 1, p. 3 (2017)","DOI":"10.24963\/ijcai.2017\/458"},{"key":"10_CR82","doi-asserted-by":"crossref","unstructured":"Yao, C., Bai, X., Shi, B., Liu, W.: Strokelets: a learned multi-scale representation for scene text recognition. In: IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 4042\u20134049 (2014)","DOI":"10.1109\/CVPR.2014.515"},{"key":"10_CR83","doi-asserted-by":"crossref","unstructured":"Ye, J., Chen, Z., Liu, J., Du, B.: TextFuseNet: scene text detection with richer fused features. In: International Joint Conference on Artificial Intelligence (IJCAI), pp. 516\u2013522 (2020)","DOI":"10.24963\/ijcai.2020\/72"},{"key":"10_CR84","doi-asserted-by":"crossref","unstructured":"Yu, D., et al.: Towards accurate scene text recognition with semantic reasoning networks. In: IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 12113\u201312122 (2020)","DOI":"10.1109\/CVPR42600.2020.01213"},{"key":"10_CR85","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"135","DOI":"10.1007\/978-3-030-58529-7_9","volume-title":"Computer Vision \u2013 ECCV 2020","author":"X Yue","year":"2020","unstructured":"Yue, X., Kuang, Z., Lin, C., Sun, H., Zhang, W.: RobustScanner: dynamically enhancing positional clues for robust text recognition. In: Vedaldi, A., Bischof, H., Brox, T., Frahm, J.-M. (eds.) ECCV 2020. LNCS, vol. 12364, pp. 135\u2013151. Springer, Cham (2020). https:\/\/doi.org\/10.1007\/978-3-030-58529-7_9"},{"key":"10_CR86","doi-asserted-by":"crossref","unstructured":"Zhan, F., Lu, S.: ESIR: end-to-end scene text recognition via iterative image rectification. In: IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 2059\u20132068 (2019)","DOI":"10.1109\/CVPR.2019.00216"},{"key":"10_CR87","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"751","DOI":"10.1007\/978-3-030-58586-0_44","volume-title":"Computer Vision \u2013 ECCV 2020","author":"H Zhang","year":"2020","unstructured":"Zhang, H., Yao, Q., Yang, M., Xu, Y., Bai, X.: AutoSTR: efficient backbone search for scene text recognition. In: Vedaldi, A., Bischof, H., Brox, T., Frahm, J.-M. (eds.) ECCV 2020. LNCS, vol. 12369, pp. 751\u2013767. Springer, Cham (2020). https:\/\/doi.org\/10.1007\/978-3-030-58586-0_44"},{"key":"10_CR88","doi-asserted-by":"crossref","unstructured":"Zhang, R., et al.: ICDAR 2019 robust reading challenge on reading Chinese text on signboard. In: 2019 International Conference on Document Analysis and Recognition (ICDAR), pp. 1577\u20131581. IEEE (2019)","DOI":"10.1109\/ICDAR.2019.00253"},{"issue":"9","key":"10_CR89","doi-asserted-by":"publisher","first-page":"3855","DOI":"10.1109\/TCYB.2020.2992433","volume":"50","author":"X Zhang","year":"2020","unstructured":"Zhang, X., Wei, Y., Yang, Y., Huang, T.S.: SG-ONE: similarity guidance network for one-shot semantic segmentation. IEEE Trans. Cybern. 50(9), 3855\u20133865 (2020)","journal-title":"IEEE Trans. Cybern."},{"key":"10_CR90","doi-asserted-by":"crossref","unstructured":"Zhang, Y., Nie, S., Liu, W., Xu, X., Zhang, D., Shen, H.T.: Sequence-to-sequence domain adaptation network for robust text image recognition. In: IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 2740\u20132749 (2019)","DOI":"10.1109\/CVPR.2019.00285"},{"key":"10_CR91","unstructured":"Zhang, Y., Gueguen, L., Zharkov, I., Zhang, P., Seifert, K., Kadlec, B.: Uber-text: a large-scale dataset for optical character recognition from street-level imagery. In: IEEE International Conference on Computer Vision workshops, vol. 2017, p. 5 (2017)"},{"key":"10_CR92","doi-asserted-by":"crossref","unstructured":"Zhu, J.Y., Park, T., Isola, P., Efros, A.A.: Unpaired image-to-image translation using cycle-consistent adversarial networks. In: IEEE\/CVF International Conference on Computer Vision (ICCV), pp. 2223\u20132232 (2017)","DOI":"10.1109\/ICCV.2017.244"},{"key":"10_CR93","doi-asserted-by":"crossref","unstructured":"Zhu, Y., Wang, S., Huang, Z., Chen, K.: Text recognition in images based on transformer with hierarchical attention. In: IEEE International Conference on Image Processing (ICIP), pp. 1945\u20131949. IEEE (2019)","DOI":"10.1109\/ICIP.2019.8803203"}],"container-title":["Lecture Notes in Computer Science","Computer Vision \u2013 ECCV 2022"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-031-19806-9_10","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,10,6]],"date-time":"2024-10-06T04:31:25Z","timestamp":1728189085000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-3-031-19806-9_10"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2022]]},"ISBN":["9783031198052","9783031198069"],"references-count":93,"URL":"https:\/\/doi.org\/10.1007\/978-3-031-19806-9_10","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2022]]},"assertion":[{"value":"20 October 2022","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"ECCV","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"European Conference on Computer Vision","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Tel Aviv","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Israel","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2022","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"23 October 2022","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"27 October 2022","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"17","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"eccv2022","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/eccv2022.ecva.net\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Double-blind","order":1,"name":"type","label":"Type","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"CMT","order":2,"name":"conference_management_system","label":"Conference Management System","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"5804","order":3,"name":"number_of_submissions_sent_for_review","label":"Number of Submissions Sent for Review","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"1645","order":4,"name":"number_of_full_papers_accepted","label":"Number of Full Papers Accepted","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"0","order":5,"name":"number_of_short_papers_accepted","label":"Number of Short Papers Accepted","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"28% - The value is computed by the equation \"Number of Full Papers Accepted \/ Number of Submissions Sent for Review * 100\" and then rounded to a whole number.","order":6,"name":"acceptance_rate_of_full_papers","label":"Acceptance Rate of Full Papers","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"3.21","order":7,"name":"average_number_of_reviews_per_paper","label":"Average Number of Reviews per Paper","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"3.91","order":8,"name":"average_number_of_papers_per_reviewer","label":"Average Number of Papers per Reviewer","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"Yes","order":9,"name":"external_reviewers_involved","label":"External Reviewers Involved","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}}]}}