{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,20]],"date-time":"2026-07-20T04:12:56Z","timestamp":1784520776750,"version":"3.55.0"},"reference-count":113,"publisher":"Springer Science and Business Media LLC","issue":"1","license":[{"start":{"date-parts":[[2026,1,1]],"date-time":"2026-01-01T00:00:00Z","timestamp":1767225600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2026,1,1]],"date-time":"2026-01-01T00:00:00Z","timestamp":1767225600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Int J Comput Vis"],"published-print":{"date-parts":[[2026,1]]},"DOI":"10.1007\/s11263-025-02653-7","type":"journal-article","created":{"date-parts":[[2026,1,7]],"date-time":"2026-01-07T13:02:13Z","timestamp":1767790933000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":3,"title":["Multi-Granularity Prediction with Learnable Fusion for Scene Text Recognition"],"prefix":"10.1007","volume":"134","author":[{"given":"Cheng","family":"Da","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Peng","family":"Wang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-6564-4796","authenticated-orcid":false,"given":"Cong","family":"Yao","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2026,1,7]]},"reference":[{"key":"2653_CR1","unstructured":"Gpt-4v(ision) system card (2023)."},{"key":"2653_CR2","doi-asserted-by":"crossref","unstructured":"Aberdam, A., Litman, R., Tsiper, S., Anschel, O., Slossberg, R., Mazor, S., Manmatha, R. & Perona, P. (2021) Sequence-to-sequence contrastive learning for text recognition. In: IEEE Conf. Comput. Vis. Pattern Recog., pp. 15302\u201315312","DOI":"10.1109\/CVPR46437.2021.01505"},{"key":"2653_CR3","first-page":"319","volume":"12821","author":"R Atienza","year":"2021","unstructured":"Atienza, R. (2021). Vision transformer for fast and efficient scene text recognition. ICDAR,12821, 319\u2013334.","journal-title":"ICDAR"},{"key":"2653_CR4","doi-asserted-by":"crossref","unstructured":"Baek, J., Kim, G., Lee, J., Park, S., Han, D., Yun, S., Oh, S.J. & Lee, H. (2019) What is wrong with scene text recognition model comparisons? dataset and model analysis. In: Int. Conf. Comput. Vis., pp. 4714\u20134722","DOI":"10.1109\/ICCV.2019.00481"},{"key":"2653_CR5","doi-asserted-by":"crossref","unstructured":"Baek, J., Matsui, Y. & Aizawa, K. (2021) What if we only use real datasets for scene text recognition? toward scene text recognition with fewer labels. In: IEEE Conf. Comput. Vis. Pattern Recog., pp. 3113\u20133122","DOI":"10.1109\/CVPR46437.2021.00313"},{"key":"2653_CR6","first-page":"178","volume":"13688","author":"D Bautista","year":"2022","unstructured":"Bautista, D., & Atienza, R. (2022). Scene text recognition with permuted autoregressive sequence models. Eur. Conf. Comput. Vis.,13688, 178\u2013196.","journal-title":"Eur. Conf. Comput. Vis."},{"issue":"2\u20133","key":"2653_CR7","doi-asserted-by":"publisher","first-page":"174","DOI":"10.5964\/bioling.8783","volume":"4","author":"TG Bever","year":"2010","unstructured":"Bever, T. G., & Poeppel, D. (2010). Analysis by synthesis: a (re-)emerging program of research for language and vision. Biolinguistics,4(2\u20133), 174\u2013200.","journal-title":"Biolinguistics"},{"key":"2653_CR8","doi-asserted-by":"crossref","unstructured":"Bhunia, A.K., Das, A., Bhunia, A.K., Kishore, P.S.R. & Roy, P.P. (2019) Handwriting recognition in low-resource scripts using adversarial learning. In: IEEE Conf. Comput. Vis. Pattern Recog., pp. 4767\u20134776","DOI":"10.1109\/CVPR.2019.00490"},{"key":"2653_CR9","doi-asserted-by":"crossref","unstructured":"Borisyuk, F., Gordo, A. & Sivakumar, V. (2018) Rosetta: Large scale system for text detection and recognition in images. In: Y.\u00a0Guo, F.\u00a0Farooq (eds.) SIGKDD, pp. 71\u201379","DOI":"10.1145\/3219819.3219861"},{"key":"2653_CR10","first-page":"9912","volume":"33","author":"M Caron","year":"2020","unstructured":"Caron, M., Misra, I., Mairal, J., Goyal, P., Bojanowski, P., & Joulin, A. (2020). Unsupervised learning of visual features by contrasting cluster assignments. Adv. Neural Inform. Process. Syst.,33, 9912\u20139924.","journal-title":"Adv. Neural Inform. Process. Syst."},{"key":"2653_CR11","doi-asserted-by":"crossref","unstructured":"Caron, M., Touvron, H., Misra, I., J\u00e9gou, H., Mairal, J., Bojanowski, P. & Joulin, A. (2021). Emerging properties in self-supervised vision transformers. In: Int. Conf. Comput. Vis., pp. 9630\u20139640","DOI":"10.1109\/ICCV48922.2021.00951"},{"issue":"1","key":"2653_CR12","doi-asserted-by":"publisher","first-page":"38","DOI":"10.1007\/s11633-022-1369-5","volume":"20","author":"FL Chen","year":"2023","unstructured":"Chen, F. L., Zhang, D. Z., Han, M. L., Chen, X. Y., Shi, J., Xu, S., & Xu, B. (2023). Vlp: A survey on vision-language pre-training. Machine Intelligence Research,20(1), 38\u201356.","journal-title":"Machine Intelligence Research"},{"key":"2653_CR13","unstructured":"Chen, T., Kornblith, S., Norouzi, M. & Hinton, G. (2020) A simple framework for contrastive learning of visual representations. In: Int. Conf. Mach. Learn., pp. 1597\u20131607"},{"key":"2653_CR14","first-page":"22243","volume":"33","author":"T Chen","year":"2020","unstructured":"Chen, T., Kornblith, S., Swersky, K., Norouzi, M., & Hinton, G. E. (2020). Big self-supervised models are strong semi-supervised learners. Adv. Neural Inform. Process. Syst.,33, 22243\u201322255.","journal-title":"Adv. Neural Inform. Process. Syst."},{"issue":"2","key":"2653_CR15","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/3440756","volume":"54","author":"X Chen","year":"2021","unstructured":"Chen, X., Jin, L., Zhu, Y., Luo, C., & Wang, T. (2021). Text recognition in the wild: A survey. ACM Computing Surveys (CSUR),54(2), 1\u201335.","journal-title":"ACM Computing Surveys (CSUR)"},{"key":"2653_CR16","doi-asserted-by":"crossref","unstructured":"Cheng, Z., Bai, F., Xu, Y., Zheng, G., Pu, S. & Zhou, S. (2017) Focusing attention: Towards accurate text recognition in natural images. In: IEEE Conf. Comput. Vis. Pattern Recog., pp. 5086\u20135094","DOI":"10.1109\/ICCV.2017.543"},{"key":"2653_CR17","doi-asserted-by":"crossref","unstructured":"Chng, C.K., Ding, E., Liu, J., Karatzas, D., Chan, C.S., Jin, L., Liu, Y., Sun, Y., Ng, C.C., Luo, C., Ni, Z., Fang, C., Zhang, S. & Han, J. (2019). ICDAR2019 robust reading challenge on arbitrary-shaped text - rrc-art. In: ICDAR, pp. 1571\u20131576","DOI":"10.1109\/ICDAR.2019.00252"},{"key":"2653_CR18","doi-asserted-by":"crossref","unstructured":"Cubuk, E.D., Zoph, B., Shlens, J. & Le, Q.V. (2020) Randaugment: Practical automated data augmentation with a reduced search space. In: CVPR Workshops, pp. 3008\u20133017","DOI":"10.1109\/CVPRW50498.2020.00359"},{"key":"2653_CR19","first-page":"322","volume":"13688","author":"C Da","year":"2022","unstructured":"Da, C., Wang, P., & Yao, C. (2022). Levenshtein OCR. Eur. Conf. Comput. Vis.,13688, 322\u2013338.","journal-title":"Eur. Conf. Comput. Vis."},{"key":"2653_CR20","doi-asserted-by":"crossref","unstructured":"Devlin, J., Chang, M., Lee, K. & Toutanova, K. (2019). BERT: pre-training of deep bidirectional transformers for language understanding. In: NAACL-HLT, pp. 4171\u20134186","DOI":"10.18653\/v1\/N19-1423"},{"key":"2653_CR21","unstructured":"Dosovitskiy, A., Beyer, L., Kolesnikov, A., Weissenborn, D., Zhai, X., Unterthiner, T., Dehghani, M., Minderer, M., Heigold, G., Gelly, S., Uszkoreit, J. & Houlsby, N. (2021) An image is worth 16x16 words: Transformers for image recognition at scale. In: Int. Conf. Learn. Represent."},{"key":"2653_CR22","doi-asserted-by":"crossref","unstructured":"Dutta, K., Krishnan, P., Mathew, M. & Jawahar, C. (2018). Improving cnn-rnn hybrid networks for handwriting recognition. In: 2018 16th international conference on frontiers in handwriting recognition (ICFHR), pp. 80\u201385. IEEE","DOI":"10.1109\/ICFHR-2018.2018.00023"},{"issue":"6","key":"2653_CR23","doi-asserted-by":"publisher","first-page":"7123","DOI":"10.1109\/TPAMI.2022.3223908","volume":"45","author":"S Fang","year":"2023","unstructured":"Fang, S., Mao, Z., Xie, H., Wang, Y., Yan, C., & Zhang, Y. (2023). Abinet++: Autonomous, bidirectional and iterative language modeling for scene text spotting. IEEE Trans. Pattern Anal. Mach. Intell.,45(6), 7123\u20137141.","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"2653_CR24","doi-asserted-by":"crossref","unstructured":"Fang, S., Xie, H., Wang, Y., Mao, Z. & Zhang, Y. (2021) Read like humans: Autonomous, bidirectional and iterative language modeling for scene text recognition. In: IEEE Conf. Comput. Vis. Pattern Recog., pp. 7098\u20137107","DOI":"10.1109\/CVPR46437.2021.00702"},{"key":"2653_CR25","unstructured":"Feng, H., Wang, Z., Tang, J., Lu, J., gang Zhou, W., Li, H. & Huang, C. (2023). Unidoc: A universal large multimodal model for simultaneous text detection, recognition, spotting and understanding. arXiv:2308.11592"},{"key":"2653_CR26","doi-asserted-by":"crossref","unstructured":"Fogel, S., Averbuch-Elor, H., Cohen, S., Mazor, S. & Litman, R. (2020). Scrabblegan: Semi-supervised varying length handwritten text generation. In: IEEE Conf. Comput. Vis. Pattern Recog., pp. 4324\u20134333","DOI":"10.1109\/CVPR42600.2020.00438"},{"key":"2653_CR27","unstructured":"Goodfellow, I.J., Pouget-Abadie, J., Mirza, M., Xu, B., Warde-Farley, D., Ozair, S., Courville, A.C. & Bengio, Y. (2014) Generative adversarial nets. In: Adv. Neural Inform. Process. Syst., pp. 2672\u20132680"},{"key":"2653_CR28","doi-asserted-by":"crossref","unstructured":"Graves, A., Fern\u00e1ndez, S., Gomez, F.J. & Schmidhuber, J. (2006) Connectionist temporal classification: labelling unsegmented sequence data with recurrent neural networks. In: Int. Conf. Mach. Learn., vol. 148, pp. 369\u2013376","DOI":"10.1145\/1143844.1143891"},{"key":"2653_CR29","doi-asserted-by":"crossref","unstructured":"Grosicki, E., Carr\u00e9, M., Brodin, J. & Geoffrois, E. (2009). Results of the RIMES evaluation campaign for handwritten mail processing. In: 10th International Conference on Document Analysis and Recognition, ICDAR 2009, Barcelona, Spain, 26-29 July 2009, pp. 941\u2013945. IEEE Computer Society","DOI":"10.1109\/ICDAR.2009.224"},{"key":"2653_CR30","doi-asserted-by":"crossref","unstructured":"Gu, J., Meng, G., Da, C., Xiang, S., Pan, C.: No-reference image quality assessment with reinforcement recursive list-wise ranking. In: AAAI, pp. 8336\u20138343 (2019)","DOI":"10.1609\/aaai.v33i01.33018336"},{"key":"2653_CR31","doi-asserted-by":"crossref","unstructured":"Gupta, A., Vedaldi, A. & Zisserman, A. (2016). Synthetic data for text localisation in natural images. In: IEEE Conf. Comput. Vis. Pattern Recog., pp. 2315\u20132324","DOI":"10.1109\/CVPR.2016.254"},{"key":"2653_CR32","doi-asserted-by":"crossref","unstructured":"He, K., Chen, X., Xie, S., Li, Y., Doll\u00e1r, P. & Girshick, R.B. (2022). Masked autoencoders are scalable vision learners. In: IEEE Conf. Comput. Vis. Pattern Recog., pp. 15979\u201315988","DOI":"10.1109\/CVPR52688.2022.01553"},{"key":"2653_CR33","doi-asserted-by":"crossref","unstructured":"He, K., Fan, H., Wu, Y., Xie, S. & Girshick, R. (2020). Momentum contrast for unsupervised visual representation learning. In: IEEE Conf. Comput. Vis. Pattern Recog., pp. 9729\u20139738","DOI":"10.1109\/CVPR42600.2020.00975"},{"key":"2653_CR34","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S. & Sun, J. (2016) Deep residual learning for image recognition. In: IEEE Conf. Comput. Vis. Pattern Recog., pp. 770\u2013778","DOI":"10.1109\/CVPR.2016.90"},{"key":"2653_CR35","doi-asserted-by":"crossref","unstructured":"He, P., Huang, W., Qiao, Y., Loy, C.C., Tang, X.: Reading scene text in deep convolutional sequences. In: AAAI, pp. 3501\u20133508 (2016)","DOI":"10.1609\/aaai.v30i1.10465"},{"key":"2653_CR36","doi-asserted-by":"crossref","unstructured":"Hu, W., Cai, X., Hou, J., Yi, S. & Lin, Z. (2020). GTC: guided training of CTC towards efficient and accurate scene text recognition. In: AAAI, pp. 11005\u201311012","DOI":"10.1609\/aaai.v34i07.6735"},{"key":"2653_CR37","unstructured":"Jaderberg, M., Simonyan, K., Vedaldi, A. & Zisserman, A. (2014). Synthetic data and artificial neural networks for natural scene text recognition. NIPS Deep Learning Workshop"},{"issue":"1","key":"2653_CR38","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1007\/s11263-015-0823-z","volume":"116","author":"M Jaderberg","year":"2016","unstructured":"Jaderberg, M., Simonyan, K., Vedaldi, A., & Zisserman, A. (2016). Reading text in the wild with convolutional neural networks. Int. J. Comput. Vis.,116(1), 1\u201320.","journal-title":"Int. J. Comput. Vis."},{"key":"2653_CR39","doi-asserted-by":"crossref","unstructured":"Karatzas, D., Gomez-Bigorda, L., Nicolaou, A., Ghosh, S.K., Bagdanov, A.D., Iwamura, M., Matas, J., Neumann, L., Chandrasekhar, V.R., Lu, S., Shafait, F., Uchida, S. & Valveny, E. (2015). ICDAR 2015 competition on robust reading. In: ICDAR, pp. 1156\u20131160","DOI":"10.1109\/ICDAR.2015.7333942"},{"key":"2653_CR40","doi-asserted-by":"crossref","unstructured":"Karatzas, D., Shafait, F., Uchida, S., Iwamura, M., i\u00a0Bigorda, L.G., Mestre, S.R., Mas, J., Mota, D.F., Almaz\u00e1n, J. & de\u00a0las Heras, L. (2013). ICDAR 2013 robust reading competition. In: ICDAR, pp. 1484\u20131493","DOI":"10.1109\/ICDAR.2013.221"},{"key":"2653_CR41","doi-asserted-by":"crossref","unstructured":"Kleber, F., Fiel, S., Diem, M. & Sablatnig, R. (2013). Cvl-database: An off-line database for writer retrieval, writer identification and word spotting. In: ICDAR, pp. 560\u2013564","DOI":"10.1109\/ICDAR.2013.117"},{"key":"2653_CR42","unstructured":"Krylov, I., Nosov, S. & Sovrasov, V. (2021). Open images V5 text annotation and yet another mask text spotter. In: V.N. Balasubramanian, I.W. Tsang (eds.) Asian Conference on Machine Learning, vol. 157, pp. 379\u2013389"},{"key":"2653_CR43","doi-asserted-by":"crossref","unstructured":"Labeau, M. & Allauzen, A. (2017). Character and subword-based word representation for neural language modeling prediction. In: SWCN@EMNLP, pp. 1\u201313","DOI":"10.18653\/v1\/W17-4101"},{"key":"2653_CR44","doi-asserted-by":"crossref","unstructured":"Lee, C., Osindero, S.: Recursive recurrent nets with attention modeling for OCR in the wild. In: IEEE Conf. Comput. Vis. Pattern Recog., pp. 2231\u20132239 (2016)","DOI":"10.1109\/CVPR.2016.245"},{"key":"2653_CR45","doi-asserted-by":"crossref","unstructured":"Lee, J., Park, S., Baek, J., Oh, S.J., Kim, S. & Lee, H. (2020). On recognizing texts of arbitrary shapes with 2d self-attention. In: CVPR Workshops, pp. 2326\u20132335","DOI":"10.1109\/CVPRW50498.2020.00281"},{"key":"2653_CR46","unstructured":"Li, J., Li, D., Xiong, C. & Hoi, S.C.H. (2022). BLIP: bootstrapping language-image pre-training for unified vision-language understanding and generation. In: Int. Conf. Mach. Learn., vol. 162, pp. 12888\u201312900"},{"key":"2653_CR47","doi-asserted-by":"crossref","unstructured":"Li, M., Lv, T., Cui, L., Lu, Y., Flor\u00eancio, D.A.F., Zhang, C., Li, Z. & Wei, F. (2023). Trocr: Transformer-based optical character recognition with pre-trained models. In: AAAI, pp. 13094\u201313102","DOI":"10.1609\/aaai.v37i11.26538"},{"key":"2653_CR48","unstructured":"Li, Z., Yang, B., Liu, Q., Ma, Z., Zhang, S., Yang, J., Sun, Y., Liu, Y. & Bai, X. (2023). Monkey: Image resolution and text label are important things for large multi-modal models. arXiv:abs\/2311.06607"},{"issue":"2","key":"2653_CR49","doi-asserted-by":"publisher","first-page":"532","DOI":"10.1109\/TPAMI.2019.2937086","volume":"43","author":"M Liao","year":"2021","unstructured":"Liao, M., Lyu, P., He, M., Yao, C., Wu, W., & Bai, X. (2021). Mask textspotter: An end-to-end trainable neural network for spotting text with arbitrary shapes. IEEE Trans. Pattern Anal. Mach. Intell.,43(2), 532\u2013548.","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"2653_CR50","doi-asserted-by":"crossref","unstructured":"Liao, M., Zhang, J., Wan, Z., Xie, F., Liang, J., Lyu, P., Yao, C. & Bai, X. (2019). Scene text recognition from two-dimensional perspective. In: AAAI, pp. 8714\u20138721","DOI":"10.1609\/aaai.v33i01.33018714"},{"key":"2653_CR51","unstructured":"Liu, H., Li, C., Li, Y. & Lee, Y.J. (2023). Improved baselines with visual instruction tuning. ArXiv arXiv:abs\/2310.03744"},{"key":"2653_CR52","doi-asserted-by":"crossref","unstructured":"Liu, H., Wang, B., Bao, Z., Xue, M., Kang, S., Jiang, D., Liu, Y., Ren, B.: Perceiving stroke-semantic context: Hierarchical contrastive learning for robust scene text recognition. In: AAAI, pp. 1702\u20131710 (2022)","DOI":"10.1609\/aaai.v36i2.20062"},{"key":"2653_CR53","doi-asserted-by":"crossref","unstructured":"Liu, W., Chen, C., Wong, K.K., Su, Z. & Han, J. (2016). Star-net: A spatial attention residue network for scene text recognition. In: BMVC","DOI":"10.5244\/C.30.43"},{"key":"2653_CR54","unstructured":"Liu, Y., Li, Z., Li, H., Yu, W., Huang, M., Peng, D., Liu, M., Chen, M., Li, C., Jin, L. & Bai, X. (2023). On the hidden mystery of OCR in large multimodal models. CoRR arXiv:abs\/2305.07895"},{"key":"2653_CR55","doi-asserted-by":"crossref","unstructured":"Liu, Z., Lin, Y., Cao, Y., Hu, H., Wei, Y., Zhang, Z., Lin, S. & Guo, B. (2021) Swin transformer: Hierarchical vision transformer using shifted windows. In: Int. Conf. Comput. Vis., pp. 9992\u201310002","DOI":"10.1109\/ICCV48922.2021.00986"},{"issue":"1","key":"2653_CR56","doi-asserted-by":"publisher","first-page":"161","DOI":"10.1007\/s11263-020-01369-0","volume":"129","author":"S Long","year":"2021","unstructured":"Long, S., He, X., & Yao, C. (2021). Scene text detection and recognition: The deep learning era. Int. J. Comput. Vis.,129(1), 161\u2013184.","journal-title":"Int. J. Comput. Vis."},{"key":"2653_CR57","unstructured":"Loshchilov, I. & Hutter, F. (2017) SGDR: stochastic gradient descent with warm restarts. In: Int. Conf. Learn. Represent."},{"key":"2653_CR58","doi-asserted-by":"publisher","DOI":"10.1016\/j.patcog.2021.107980","volume":"117","author":"N Lu","year":"2021","unstructured":"Lu, N., Yu, W., Qi, X., Chen, Y., Gong, P., Xiao, R., & Bai, X. (2021). MASTER: Multi-aspect non-local network for scene text recognition. Pattern Recognition,117, Article 107980.","journal-title":"Pattern Recognition"},{"key":"2653_CR59","unstructured":"Luo, C., Zhu, Y., Jin, L., Li, Z. & Peng, D. (2022). SLOGAN: handwriting style synthesis for arbitrary-length and out-of-vocabulary text. IEEE Trans. Neural Networks Learn. Syst. arXiv:abs\/2202.11456"},{"key":"2653_CR60","doi-asserted-by":"crossref","unstructured":"Luo, C., Zhu, Y., Jin, L. & Wang, Y. (2020) Learn to augment: Joint data augmentation and network optimization for text recognition. In: IEEE Conf. Comput. Vis. Pattern Recog., pp. 13743\u201313752","DOI":"10.1109\/CVPR42600.2020.01376"},{"issue":"1","key":"2653_CR61","doi-asserted-by":"publisher","first-page":"39","DOI":"10.1007\/s100320200071","volume":"5","author":"U Marti","year":"2002","unstructured":"Marti, U., & Bunke, H. (2002). The iam-database: an english sentence database for offline handwriting recognition. Int. J. Document Anal. Recognit.,5(1), 39\u201346.","journal-title":"Int. J. Document Anal. Recognit."},{"key":"2653_CR62","doi-asserted-by":"crossref","unstructured":"Mishra, A., Alahari, K. & Jawahar, C.V. (2012). Scene text recognition using higher order language priors. In: BMVC, pp. 1\u201311","DOI":"10.5244\/C.26.127"},{"key":"2653_CR63","doi-asserted-by":"crossref","unstructured":"Na, B., Kim, Y. & Park, S. (2022). Multi-modal text recognition networks: Interactive enhancements between visual and semantic features. In: Eur. Conf. Comput. Vis., vol. 13688, pp. 446\u2013463","DOI":"10.1007\/978-3-031-19815-1_26"},{"key":"2653_CR64","doi-asserted-by":"crossref","unstructured":"Nayef, N., Liu, C., Ogier, J., Patel, Y., Busta, M., Chowdhury, P.N., Karatzas, D., Khlif, W., Matas, J., Pal, U. & Burie, J. (2019). ICDAR2019 robust reading challenge on multi-lingual scene text detection and recognition - RRC-MLT-2019. In: ICDAR, pp. 1582\u20131587","DOI":"10.1109\/ICDAR.2019.00254"},{"key":"2653_CR65","doi-asserted-by":"crossref","unstructured":"Nuriel, O., Fogel, S. & Litman, R. (2022). Textadain: Paying attention to shortcut learning in text recognizers. In: Eur. Conf. Comput. Vis., vol. 13688, pp. 427\u2013445","DOI":"10.1007\/978-3-031-19815-1_25"},{"key":"2653_CR66","unstructured":"van\u00a0den Oord, A., Li, Y. & Vinyals, O. (2018). Representation learning with contrastive predictive coding. CoRR arXiv:abs\/1807.03748"},{"key":"2653_CR67","unstructured":"Oquab, M., Darcet, T., Moutakanni, T., Vo, H., Szafraniec, M., Khalidov, V., Fernandez, P., Haziza, D., Massa, F., El-Nouby, A., Assran, M., Ballas, N., Galuba, W., Howes, R., Huang, P., Li, S., Misra, I., Rabbat, M.G., Sharma, V., Synnaeve, G., Xu, H., J\u00e9gou, H., Mairal, J., Labatut, P., Joulin, A. & Bojanowski, P. (2023). Dinov2: Learning robust visual features without supervision. CoRR arXiv:abs\/2304.07193"},{"key":"2653_CR68","doi-asserted-by":"crossref","unstructured":"Phan, T.Q., Shivakumara, P., Tian, S., & Tan, C.L. (2013). Recognizing text with perspective distortion in natural scenes. In: Int. Conf. Comput. Vis., pp. 569\u2013576","DOI":"10.1109\/ICCV.2013.76"},{"key":"2653_CR69","doi-asserted-by":"crossref","unstructured":"Poznanski, A., & Wolf, L. (2016). Cnn-n-gram for handwriting word recognition. In: IEEE Conf. Comput. Vis. Pattern Recog., pp. 2305\u20132314","DOI":"10.1109\/CVPR.2016.253"},{"key":"2653_CR70","doi-asserted-by":"crossref","unstructured":"Priya, A., Mishra, S., Raj, S., Mandal, S., & Datta, S. (2016). Online and offline character recognition: A survey. In: 2016 International conference on communication and signal processing (ICCSP), pp. 0967\u20130970. IEEE","DOI":"10.1109\/ICCSP.2016.7754291"},{"issue":"1","key":"2653_CR71","first-page":"1","volume":"7","author":"A Purohit","year":"2016","unstructured":"Purohit, A., & Chauhan, S. S. (2016). A literature survey on handwritten character recognition. International Journal of Computer Science and Information Technologies (IJCSIT),7(1), 1\u20135.","journal-title":"International Journal of Computer Science and Information Technologies (IJCSIT)"},{"key":"2653_CR72","doi-asserted-by":"crossref","unstructured":"Qiao, Z., Zhou, Y., Wei, J., Wang, W., Zhang, Y., Jiang, N., Wang, H. & Wang, W. (2021). Pimnet: A parallel, iterative and mimicking network for scene text recognition. In: ACM Int. Conf. Multimedia, pp. 2046\u20132055","DOI":"10.1145\/3474085.3475238"},{"key":"2653_CR73","doi-asserted-by":"crossref","unstructured":"Qiao, Z., Zhou, Y., Yang, D., Zhou, Y. & Wang, W. (2020) SEED: semantics enhanced encoder-decoder framework for scene text recognition. In: IEEE Conf. Comput. Vis. Pattern Recog., pp. 13525\u201313534 (2020)","DOI":"10.1109\/CVPR42600.2020.01354"},{"key":"2653_CR74","unstructured":"Radford, A., Kim, J.W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., Krueger, G., & Sutskever, I. (2021). Learning transferable visual models from natural language supervision. In: Int. Conf. Mach. Learn., vol. 139, pp. 8748\u20138763"},{"key":"2653_CR75","unstructured":"Radford, A., Wu, J., Child, R., Luan, D., Amodei, D., & Sutskever, I. Language models are unsupervised multitask learners. In: OpenAI blog, pp. 1\u201324 (2019)"},{"issue":"18","key":"2653_CR76","doi-asserted-by":"publisher","first-page":"8027","DOI":"10.1016\/j.eswa.2014.07.008","volume":"41","author":"A Risnumawan","year":"2014","unstructured":"Risnumawan, A., Shivakumara, P., Chan, C. S., & Tan, C. L. (2014). A robust arbitrary text detection system for natural scene images. Expert Syst. Appl.,41(18), 8027\u20138048.","journal-title":"Expert Syst. Appl."},{"key":"2653_CR77","unstructured":"Ryoo, M.S., Piergiovanni, A.J., Arnab, A., Dehghani, M. & Angelova, A. (2021). Tokenlearner: What can 8 learned tokens do for images and videos? CoRR arXiv:abs\/2106.11297"},{"key":"2653_CR78","doi-asserted-by":"crossref","unstructured":"Schuster, M. & Nakajima, K. (2012). Japanese and korean voice search. In: ICASSP, pp. 5149\u20135152","DOI":"10.1109\/ICASSP.2012.6289079"},{"key":"2653_CR79","doi-asserted-by":"crossref","unstructured":"Sennrich, R., Haddow, B. & Birch, A. (2016). Neural machine translation of rare words with subword units. In: ACL. The Association for Computer Linguistics","DOI":"10.18653\/v1\/P16-1162"},{"issue":"11","key":"2653_CR80","doi-asserted-by":"publisher","first-page":"2298","DOI":"10.1109\/TPAMI.2016.2646371","volume":"39","author":"B Shi","year":"2017","unstructured":"Shi, B., Bai, X., & Yao, C. (2017). An end-to-end trainable neural network for image-based sequence recognition and its application to scene text recognition. IEEE Trans. Pattern Anal. Mach. Intell.,39(11), 2298\u20132304.","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"2653_CR81","doi-asserted-by":"crossref","unstructured":"Shi, B., Wang, X., Lyu, P., Yao, C. & Bai, X. (2016). Robust scene text recognition with automatic rectification. In: IEEE Conf. Comput. Vis. Pattern Recog., pp. 4168\u20134176","DOI":"10.1109\/CVPR.2016.452"},{"issue":"9","key":"2653_CR82","doi-asserted-by":"publisher","first-page":"2035","DOI":"10.1109\/TPAMI.2018.2848939","volume":"41","author":"B Shi","year":"2019","unstructured":"Shi, B., Yang, M., Wang, X., Lyu, P., Yao, C., & Bai, X. (2019). ASTER: an attentional scene text recognizer with flexible rectification. IEEE Trans. Pattern Anal. Mach. Intell.,41(9), 2035\u20132048.","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"2653_CR83","doi-asserted-by":"crossref","unstructured":"Shi, B., Yao, C., Liao, M., Yang, M., Xu, P., Cui, L., Belongie, S.J., Lu, S. & Bai, X. (2017). ICDAR2017 competition on reading chinese text in the wild (RCTW-17). In: ICDAR, pp. 1429\u20131434","DOI":"10.1109\/ICDAR.2017.233"},{"key":"2653_CR84","unstructured":"Simonyan, K. & Zisserman, A. (2015). Very deep convolutional networks for large-scale image recognition. In: Int. Conf. Learn. Represent."},{"key":"2653_CR85","doi-asserted-by":"crossref","unstructured":"Singh, A., Pang, G., Toh, M., Huang, J., Galuba, W. & Hassner, T. (2021). Textocr: Towards large-scale end-to-end reasoning for arbitrary-shaped scene text. In: IEEE Conf. Comput. Vis. Pattern Recog., pp. 8802\u20138812","DOI":"10.1109\/CVPR46437.2021.00869"},{"key":"2653_CR86","doi-asserted-by":"crossref","unstructured":"Sudholt, S. & Fink, G.A. (2016) .Phocnet: A deep convolutional neural network for word spotting in handwritten documents. In: 2016 15th International Conference on Frontiers in Handwriting Recognition (ICFHR), pp. 277\u2013282. IEEE","DOI":"10.1109\/ICFHR.2016.0060"},{"key":"2653_CR87","doi-asserted-by":"publisher","first-page":"119","DOI":"10.1016\/j.neucom.2018.02.008","volume":"289","author":"J Sueiras","year":"2018","unstructured":"Sueiras, J., Ruiz, V., Sanchez, A., & Velez, J. F. (2018). Offline continuous handwriting recognition using sequence to sequence neural networks. Neurocomputing,289, 119\u2013128.","journal-title":"Neurocomputing"},{"key":"2653_CR88","doi-asserted-by":"crossref","unstructured":"Sun, Y., Karatzas, D., Chan, C.S., Jin, L., Ni, Z., Chng, C.K., Liu, Y., Luo, C., Ng, C.C., Han, J., Ding, E. & Liu, J. (2019). ICDAR 2019 competition on large-scale street view text with partial labeling - RRC-LSVT. In: ICDAR, pp. 1557\u20131562","DOI":"10.1109\/ICDAR.2019.00250"},{"key":"2653_CR89","doi-asserted-by":"crossref","unstructured":"Tan, Y.L., Kong, A.W., Kim, J. (2022). Pure transformer with integrated experts for scene text recognition. In: Eur. Conf. Comput. Vis., vol. 13688, pp. 481\u2013497","DOI":"10.1007\/978-3-031-19815-1_28"},{"key":"2653_CR90","unstructured":"Touvron, H., Cord, M., Douze, M., Massa, F., Sablayrolles, A. & J\u00e9gou, H. (2021). Training data-efficient image transformers & distillation through attention. In: Int. Conf. Mach. Learn., vol. 139, pp. 10347\u201310357"},{"key":"2653_CR91","unstructured":"Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A.N., Kaiser, L. & Polosukhin, I. (2017). Attention is all you need. In: Adv. Neural Inform. Process. Syst., pp. 5998\u20136008"},{"key":"2653_CR92","unstructured":"Veit, A., Matera, T., Neumann, L., Matas, J. & Belongie, S.J. (2016) Coco-text: Dataset and benchmark for text detection and recognition in natural images. CoRR arXiv:abs\/1601.07140"},{"key":"2653_CR93","doi-asserted-by":"crossref","unstructured":"Wan, Z., He, M., Chen, H., Bai, X. & Yao, C. (2020) Textscanner: Reading characters in order for robust scene text recognition. In: AAAI, pp. 12120\u201312127","DOI":"10.1609\/aaai.v34i07.6891"},{"key":"2653_CR94","unstructured":"Wan, Z., Xie, F., Liu, Y., Bai, X. & Yao, C. (2019) 2d-ctc for scene text recognition. arXiv preprint arXiv:1907.09705"},{"key":"2653_CR95","doi-asserted-by":"crossref","unstructured":"Wan, Z., Zhang, J., Zhang, L., Luo, J. & Yao, C. (2020) On vocabulary reliance in scene text recognition. In: IEEE Conf. Comput. Vis. Pattern Recog., pp. 11422\u201311431","DOI":"10.1109\/CVPR42600.2020.01144"},{"key":"2653_CR96","unstructured":"Wang J. & Hu, X. (2017). Gated recurrent convolution neural network for OCR. In: Adv. Neural Inform. Process. Syst., pp. 335\u2013344"},{"key":"2653_CR97","doi-asserted-by":"crossref","unstructured":"Wang, K., Babenko, B. & Belongie, S.J. (2011). End-to-end scene text recognition. In: Int. Conf. Comput. Vis., pp. 1457\u20131464","DOI":"10.1109\/ICCV.2011.6126402"},{"key":"2653_CR98","doi-asserted-by":"crossref","unstructured":"Wang, P., Da, C. & Yao, C. (2022). Multi-granularity prediction for scene text recognition. In: Eur. Conf. Comput. Vis., vol. 13688, pp. 339\u2013355","DOI":"10.1007\/978-3-031-19815-1_20"},{"key":"2653_CR99","doi-asserted-by":"crossref","unstructured":"Wang, T., Zhu, Y., Jin, L., Luo, C., Chen, X., Wu, Y., Wang, Q. & Cai, M. (2020). Decoupled attention network for text recognition. In: AAAI, pp. 12216\u201312224","DOI":"10.1609\/aaai.v34i07.6903"},{"key":"2653_CR100","doi-asserted-by":"crossref","unstructured":"Wang, Y., Xie, H., Fang, S., Wang, J., Zhu, S. & Zhang, Y. (2021). From two to one: A new scene text recognizer with visual language modeling network. In: Int. Conf. Comput. Vis., pp. 1\u201310","DOI":"10.1109\/ICCV48922.2021.01393"},{"key":"2653_CR101","unstructured":"Xie, E., Wang, W., Yu, Z., Anandkumar, A., Alvarez, J.M. & Luo, P. (2021). Segformer: Simple and efficient design for semantic segmentation with transformers. CoRR arXiv:abs\/2105.15203"},{"key":"2653_CR102","doi-asserted-by":"crossref","unstructured":"Yang, M., Liao, M., Lu, P., Wang, J., Zhu, S., Luo, H., Tian, Q. & Bai, X. (2022). Reading and writing: Discriminative and generative modeling for self-supervised text recognition. In: MM \u201922: The 30th ACM International Conference on Multimedia, Lisboa, Portugal, October 10 - 14, 2022, pp. 4214\u20134223. ACM","DOI":"10.1145\/3503161.3547784"},{"key":"2653_CR103","doi-asserted-by":"crossref","unstructured":"Ye, Q., Xu, H., Ye, J., Yan, M., Hu, A., Liu, H., Qian, Q., Zhang, J., Huang, F. & Zhou, J. (2023). mplug-owl2: Revolutionizing multi-modal large language model with modality collaboration. CoRR arXiv:abs\/2311.04257","DOI":"10.1109\/CVPR52733.2024.01239"},{"key":"2653_CR104","doi-asserted-by":"crossref","unstructured":"Yu, D., Li, X., Zhang, C., Liu, T., Han, J., Liu, J. & Ding, E. (2020) Towards accurate scene text recognition with semantic reasoning networks. In: IEEE Conf. Comput. Vis. Pattern Recog., pp. 12110\u201312119","DOI":"10.1109\/CVPR42600.2020.01213"},{"key":"2653_CR105","doi-asserted-by":"crossref","unstructured":"Yue, X., Kuang, Z., Lin, C., Sun, H. & Zhang, W. Robustscanner: Dynamically enhancing positional clues for robust text recognition. In: Eur. Conf. Comput. Vis., vol. 12364, pp. 135\u2013151 (2020)","DOI":"10.1007\/978-3-030-58529-7_9"},{"issue":"7","key":"2653_CR106","doi-asserted-by":"publisher","first-page":"301","DOI":"10.1016\/j.tics.2006.05.002","volume":"10","author":"A Yuille","year":"2006","unstructured":"Yuille, A., & Kersten, D. (2006). Vision as bayesian inference: analysis by synthesis? Trends in cognitive sciences,10(7), 301\u2013308.","journal-title":"Trends in cognitive sciences"},{"key":"2653_CR107","unstructured":"Zeiler, M.D. (2012). ADADELTA: an adaptive learning rate method. CoRR arXiv:abs\/1212.5701"},{"key":"2653_CR108","doi-asserted-by":"crossref","unstructured":"Zhan, F. & Lu, S. (2019). ESIR: end-to-end scene text recognition via iterative image rectification. In: CVPR, pp. 2059\u20132068","DOI":"10.1109\/CVPR.2019.00216"},{"key":"2653_CR109","doi-asserted-by":"crossref","unstructured":"Zhang, R., Yang, M., Bai, X., Shi, B., Karatzas, D., Lu, S., Jawahar, C.V., Zhou, Y., Jiang, Q., Song, Q., Li, N., Zhou, K., Wang, L., Wang, D. & Liao, M. (2019). ICDAR 2019 robust reading challenge on reading chinese text on signboard. In: ICDAR, pp. 1577\u20131581","DOI":"10.1109\/ICDAR.2019.00253"},{"key":"2653_CR110","doi-asserted-by":"crossref","unstructured":"Zhang, X., Zhu, B., Yao, X., Sun, Q., Li, R. & Yu, B. (2022). Context-based contrastive learning for scene text recognition. In: AAAI, pp. 888\u2013896","DOI":"10.1609\/aaai.v36i3.20245"},{"key":"2653_CR111","unstructured":"Zhang, Y., Gueguen, L., Zharkov, I., Zhang, P., Seifert, K. & Kadlec, B. (2017). Uber-text: A large-scale dataset for optical character recognition from street-level imagery. In: SUNw: Scene Understanding Workshop-CVPR, vol. 2017, pp. 1\u20135"},{"key":"2653_CR112","doi-asserted-by":"crossref","unstructured":"Zhong, Z., Zheng, L., Kang, G., Li, S. & Yang, Y. (2020). Random erasing data augmentation. In: AAAI, pp. 13001\u201313008","DOI":"10.1609\/aaai.v34i07.7000"},{"issue":"1","key":"2653_CR113","doi-asserted-by":"publisher","first-page":"19","DOI":"10.1007\/s11704-015-4488-0","volume":"10","author":"Y Zhu","year":"2016","unstructured":"Zhu, Y., Yao, C., & Bai, X. (2016). Scene text detection and recognition: Recent advances and future trends. Frontiers of Computer Science,10(1), 19\u201336.","journal-title":"Frontiers of Computer Science"}],"container-title":["International Journal of Computer Vision"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-025-02653-7.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11263-025-02653-7","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-025-02653-7.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,2,20]],"date-time":"2026-02-20T15:41:02Z","timestamp":1771602062000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11263-025-02653-7"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,1]]},"references-count":113,"journal-issue":{"issue":"1","published-print":{"date-parts":[[2026,1]]}},"alternative-id":["2653"],"URL":"https:\/\/doi.org\/10.1007\/s11263-025-02653-7","relation":{},"ISSN":["0920-5691","1573-1405"],"issn-type":[{"value":"0920-5691","type":"print"},{"value":"1573-1405","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026,1]]},"assertion":[{"value":"17 April 2024","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"14 October 2025","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"7 January 2026","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}],"article-number":"47"}}