{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,4,9]],"date-time":"2025-04-09T13:12:53Z","timestamp":1744204373994,"version":"3.37.3"},"reference-count":53,"publisher":"Springer Science and Business Media LLC","issue":"10","license":[{"start":{"date-parts":[[2021,2,10]],"date-time":"2021-02-10T00:00:00Z","timestamp":1612915200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2021,2,10]],"date-time":"2021-02-10T00:00:00Z","timestamp":1612915200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Appl Intell"],"published-print":{"date-parts":[[2021,10]]},"DOI":"10.1007\/s10489-021-02219-3","type":"journal-article","created":{"date-parts":[[2021,2,10]],"date-time":"2021-02-10T08:27:35Z","timestamp":1612945655000},"page":"6698-6707","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":10,"title":["PIEED: Position information enhanced encoder-decoder framework for scene text recognition"],"prefix":"10.1007","volume":"51","author":[{"given":"Xitao","family":"Ma","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-8529-7960","authenticated-orcid":false,"given":"Kai","family":"He","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Dazhuang","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Dashuang","family":"Li","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2021,2,10]]},"reference":[{"issue":"9","key":"2219_CR1","doi-asserted-by":"publisher","first-page":"1872","DOI":"10.1109\/TPAMI.2015.2496234","volume":"38","author":"L Neumann","year":"2016","unstructured":"Neumann L, Matas J (2016) Real-Time Lexicon-Free Scene Text Localization and Recognition. IEEE Trans Pattern Anal Mach Intell 38(9):1872\u20131885","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"2219_CR2","doi-asserted-by":"publisher","first-page":"193","DOI":"10.1007\/s11263-014-0793-6","volume":"113","author":"J Rodriguez","year":"2015","unstructured":"Rodriguez J, Gordo A, Perronnin F (2015) Label embedding: a frugal baseline for text recognition. Int J Comput Vis 113:193\u2013 207","journal-title":"Int J Comput Vis"},{"issue":"6","key":"2219_CR3","doi-asserted-by":"publisher","first-page":"2789","DOI":"10.1109\/TIP.2016.2555080","volume":"25","author":"X Bai","year":"2016","unstructured":"Bai X, Yao C, Liu W (2016) Strokelets: a learned Multi-Scale Mid-Level representation for scene text recognition. IEEE Trans Image Process 25(6):2789\u20132802","journal-title":"IEEE Trans Image Process"},{"issue":"7","key":"2219_CR4","doi-asserted-by":"publisher","first-page":"605","DOI":"10.1049\/iet-cvi.2016.0404","volume":"11","author":"S Li","year":"2017","unstructured":"Li S, Tang M, Guo Q, Lei J, Zhang J (2017) Deep neural network with attention model for scene text recognition. IET Comput Vis 11(7):605\u2013612","journal-title":"IET Comput Vis"},{"key":"2219_CR5","doi-asserted-by":"publisher","first-page":"202","DOI":"10.1016\/j.neucom.2019.10.010","volume":"376","author":"Y Huang","year":"2020","unstructured":"Huang Y, Sun X, Jin L, Luo C (2020) EPAN: Effective Parts attention network for scene text recognition. Neurocomputing 376:202\u2013213","journal-title":"Neurocomputing"},{"issue":"1","key":"2219_CR6","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1007\/s11263-015-0823-z","volume":"116","author":"M Jaderberg","year":"2016","unstructured":"Jaderberg M, Simonyan K, Vedaldi A, Zisserman A (2016) Reading text in the wild with convolutional neural networks. Int J Comput Vis 116(1):1\u201320","journal-title":"Int J Comput Vis"},{"key":"2219_CR7","doi-asserted-by":"publisher","unstructured":"Wang Y, Wang M, Fujita H (2020) Word Sense Disambiguation: A comprehensive knowledge exploitation framework. Knowledge-Based Systems. https:\/\/doi.org\/10.1016\/j.knosys.2019.105030","DOI":"10.1016\/j.knosys.2019.105030"},{"key":"2219_CR8","doi-asserted-by":"publisher","first-page":"1376","DOI":"10.1007\/s10489-018-1338-4","volume":"49","author":"R Soni","year":"2019","unstructured":"Soni R, Kumar B, Chand S (2019) Text detection and localization in natural scene images based on text awareness score. Appl Intell 49:1376\u20131405","journal-title":"Appl Intell"},{"key":"2219_CR9","doi-asserted-by":"crossref","unstructured":"Baek J, Kim G, Lee J, Park S, Han D, Yun S, Oh S, Lee H (2019) What is wrong with scene text recognition model comparisons? dataset and model analysis. In: IEEE International Conference on Computer Vision, pp 4715\u20134723","DOI":"10.1109\/ICCV.2019.00481"},{"issue":"9","key":"2219_CR10","doi-asserted-by":"publisher","first-page":"2035","DOI":"10.1109\/TPAMI.2018.2848939","volume":"41","author":"B Shi","year":"2019","unstructured":"Shi B, Yang M, Wang X, Lyu P, Co Yao, Bai X (2019) Aster: an attentional scene text recognizer with flexible rectification. IEEE Trans Pattern Anal Mach Intell 41(9):2035\u20132048","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"2219_CR11","doi-asserted-by":"crossref","unstructured":"Zhan F, Lu S (2019) ESIR: End-to-end scene text recognition via iterative image rectification. In: IEEE Conference on Computer Vision and Pattern Recognition, pp 2059\u20132068","DOI":"10.1109\/CVPR.2019.00216"},{"key":"2219_CR12","doi-asserted-by":"publisher","first-page":"109","DOI":"10.1016\/j.patcog.2019.01.020","volume":"90","author":"C Luo","year":"2019","unstructured":"Luo C, Jin L, Sun Z (2019) MORAN: A multi-object rectified attention network for scene text recognition. Pattern Recogn 90:109\u2013118","journal-title":"Pattern Recogn"},{"key":"2219_CR13","doi-asserted-by":"crossref","unstructured":"Yang M, Guan Y, Liao M, He X, Bian K, Bai S, Yao C, Bai X (2019) Symmetry-constrained rectification network for scene text recognition. In: IEEE International Conference on Computer Vision, pp 9147\u20139156","DOI":"10.1109\/ICCV.2019.00924"},{"key":"2219_CR14","unstructured":"Simonyan K, Zisserman A (2015) Very deep convolutional networks for large-scale image recognition. In: International Conference on Learning Representations"},{"key":"2219_CR15","doi-asserted-by":"crossref","unstructured":"He K, Zhang X, Ren S, Sun J (2016) Deep residual learning for image recognition. In: IEEE Conference on Computer Vision and Pattern Recognition, pp 770\u2013778","DOI":"10.1109\/CVPR.2016.90"},{"key":"2219_CR16","doi-asserted-by":"crossref","unstructured":"Lee C, Osindero S (2016) Recursive recurrent nets with attention modeling for ocr in the wild. In: IEEE Conference on Computer Vision and Pattern Recognition, pp 2231\u20132239","DOI":"10.1109\/CVPR.2016.245"},{"issue":"11","key":"2219_CR17","doi-asserted-by":"publisher","first-page":"2298","DOI":"10.1109\/TPAMI.2016.2646371","volume":"39","author":"B Shi","year":"2016","unstructured":"Shi B, Bai X, Yao C (2016) An end-to-end trainable neural network for image-based sequence recognition and its application to scene text recognition. IEEE Trans Pattern Anal Mach Intell 39(11):2298\u20132304","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"2219_CR18","doi-asserted-by":"crossref","unstructured":"Shi B, Wang X, Lyu P, Yao C, Bai X (2016) Robust scene text recognition with automatic rectification. In: IEEE Conference on Computer Vision and Pattern Recognition, pp 4167\u20134176","DOI":"10.1109\/CVPR.2016.452"},{"issue":"8","key":"2219_CR19","first-page":"115","volume":"3","author":"F Gers","year":"2002","unstructured":"Gers F, Schraudolph N, Schmidhuber J (2002) Learning precise timing with LSTM recurrent networks. J Mach Learn Res 3(8):115\u2013143","journal-title":"J Mach Learn Res"},{"key":"2219_CR20","unstructured":"Graves A, Fern\u00e1ndez S, Gomez F, Schmidhuber J (2019) Connectionist temporal classification: labelling unsegmented sequence data with recurrent neural networks. In: International Conference on Machine Learning, pp 369-376"},{"key":"2219_CR21","doi-asserted-by":"crossref","unstructured":"Cheng Z, Bai F, Xu Y, Zheng G, Pu S, Zhou S (2017) Focusing attention: Towards accurate text recognition in natural images. In: IEEE International Conference on Computer Vision, pp 5076\u20135084","DOI":"10.1109\/ICCV.2017.543"},{"key":"2219_CR22","doi-asserted-by":"crossref","unstructured":"Qiao Z, Zhou Y, Yang D, Zhou Y, Wang W (2020) SEED: Semantics Enhanced Encoder-Decoder Framework for Scene Text Recognition. In: IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp 13528\u201313537","DOI":"10.1109\/CVPR42600.2020.01354"},{"key":"2219_CR23","doi-asserted-by":"crossref","unstructured":"Yang X, He D, Zhou Z, Kifer D, Giles C (2017) Learning to Read Irregular Text with Attention Mechanisms. In: International Joint Conference on Artificial Intelligence, pp 3280\u20133286","DOI":"10.24963\/ijcai.2017\/458"},{"key":"2219_CR24","doi-asserted-by":"crossref","unstructured":"Li H, Wang P, Shen C, Zhang G (2019) Show, attend and read: A simple and strong baseline for irregular text recognition. In: AAAI Conference on Artificial Intelligence, pp 8610\u20138617","DOI":"10.1609\/aaai.v33i01.33018610"},{"key":"2219_CR25","doi-asserted-by":"publisher","first-page":"67","DOI":"10.1016\/j.neucom.2020.07.010","volume":"414","author":"P Wang","year":"2020","unstructured":"Wang P, Yang L, Li H, Deng Y, Shen C, Zhang Y (2020) A holistic representation guided attention network for scene text recognition. Neurocomputing 414:67\u201375","journal-title":"Neurocomputing"},{"key":"2219_CR26","doi-asserted-by":"crossref","unstructured":"Neumann L, Matas J (2010) A method for text localization and recognition in real-world images. In: Asian Conference on Computer Vision, pp 770\u2013783","DOI":"10.1007\/978-3-642-19318-7_60"},{"key":"2219_CR27","doi-asserted-by":"crossref","unstructured":"Epshtein B, Ofek E, Wexler Y (2010) Detecting text in natural scenes with stroke width transform. In: IEEE Conference on Computer Vision and Pattern Recognition, pp 2963\u20132970","DOI":"10.1109\/CVPR.2010.5540041"},{"issue":"11","key":"2219_CR28","doi-asserted-by":"publisher","first-page":"4737","DOI":"10.1109\/TIP.2014.2353813","volume":"23","author":"C Yao","year":"2014","unstructured":"Yao C, Bai X, Liu W (2014) A unified framework for multi oriented text detection and recognition. IEEE Trans Image Process 23(11):4737\u20134749","journal-title":"IEEE Trans Image Process"},{"key":"2219_CR29","doi-asserted-by":"publisher","first-page":"161","DOI":"10.1016\/j.neucom.2019.01.094","volume":"339","author":"Y Gao","year":"2019","unstructured":"Gao Y, Chen Y, Wang J, Tang M, Lu H (2019) Reading scene text with fully convolutional sequence modeling. Neurocomputing 339:161\u2013170","journal-title":"Neurocomputing"},{"key":"2219_CR30","doi-asserted-by":"publisher","first-page":"397","DOI":"10.1016\/j.patcog.2016.10.016","volume":"63","author":"B Su","year":"2017","unstructured":"Su B, Lu S (2017) Accurate recognition of words in scenes without character segmentation using recurrent neural network. Pattern Recogn 63:397\u2013405","journal-title":"Pattern Recogn"},{"key":"2219_CR31","unstructured":"Phan T, Shivakumara P, Tian S, Tan C (2019) Recognizing text with perspective distortion in natural scenes. In: IEEE International Conference on Computer Vision, pp 569\u2013576"},{"key":"2219_CR32","unstructured":"Jaderberg M, Simonyan K, Zisserman A (2015) Spatial transformer networks. In: Advances in Neural Information Processing Systems, pp 2017\u20132025"},{"key":"2219_CR33","unstructured":"Sutskever I, Vinyals O, Le Q (2014) Sequence to sequence learning with neural networks. In: Advances in Neural Information Processing Systems, pp 3104\u20133112"},{"key":"2219_CR34","doi-asserted-by":"crossref","unstructured":"Luong M T, Pham H, Manning C D (2015) Effective approaches to attention-based neural machine translation. Computer Science","DOI":"10.18653\/v1\/D15-1166"},{"key":"2219_CR35","doi-asserted-by":"crossref","unstructured":"Litman R, Anschel O, Tsiper S, Litman R, Mazor S, Manmatha R (2020) SCATTER: Selective context attentional scene text recognizer. In: IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp 11962\u201311972","DOI":"10.1109\/CVPR42600.2020.01198"},{"key":"2219_CR36","doi-asserted-by":"publisher","first-page":"261","DOI":"10.1016\/j.neucom.2019.11.049","volume":"381","author":"K Chen","year":"2020","unstructured":"Chen K, Wang T, Zhu Y, Jin L, Luo C (2020) Adaptive embedding gate for attention-based scene text recognition. Neurocomputing 381:261\u2013271","journal-title":"Neurocomputing"},{"key":"2219_CR37","doi-asserted-by":"crossref","unstructured":"Wang T, Zhu Y, Jin L, Luo C, Chen X, Wu Y, Wang Q, Cai M (2020) Decoupled Attention Network for Text Recognition. In: AAAI Conference on Artificial Intelligence, pp 12216\u201312224","DOI":"10.1609\/aaai.v34i07.6903"},{"key":"2219_CR38","unstructured":"Vaswani A, Shazeer N, Parmar N, Uszkoreit J, Jones L, Gomez A, Kaiser L, Polosukhin I (2017) Attention is all you need. In: Advances in Neural Information Processing Systems, pp 5998\u20136008"},{"key":"2219_CR39","doi-asserted-by":"crossref","unstructured":"Sheng F, Chen Z, Xu B (2019) NRTR: A no-recurrence sequence-to-sequence model for scene text recognition. In: International Conference on Document Analysis and Recognition, pp 781\u2013 786","DOI":"10.1109\/ICDAR.2019.00130"},{"key":"2219_CR40","doi-asserted-by":"crossref","unstructured":"Mishra A, Alahari K, Jawahar C (2012) Scene text recognition using higher order language priors. In: British Machine Vision Conference, pp 1\u201311","DOI":"10.5244\/C.26.127"},{"key":"2219_CR41","unstructured":"Wang K, Babenko B, Belongie S (2011) End-to-end scene text recognition. In: IEEE International Conference on Computer Vision, pp 1457\u20131464"},{"key":"2219_CR42","doi-asserted-by":"crossref","unstructured":"Karatzas D, Shafait F, Uchida S, Iwamura M et al (2013) ICDAR 2013 robust reading competition. In: International Conference on Document Analysis and Recognition, pp 1484\u20131493","DOI":"10.1109\/ICDAR.2013.221"},{"key":"2219_CR43","doi-asserted-by":"crossref","unstructured":"Karatzas D, Gomez-Bigorda L, Nicolaou A, Ghosh S et al (2015) ICDAR 2015 competition on robust reading. In: International Conference on Document Analysis and Recognition, pp 1156\u20131160","DOI":"10.1109\/ICDAR.2015.7333942"},{"key":"2219_CR44","unstructured":"Quy T, Shivakumara P, Tian S, Lim T (2013) Recognizing text with perspective distortion in natural scenes. In: IEEE International Conference on Computer Vision, pp 569\u2013576"},{"issue":"18","key":"2219_CR45","doi-asserted-by":"publisher","first-page":"8027","DOI":"10.1016\/j.eswa.2014.07.008","volume":"41","author":"A Risnumawan","year":"2014","unstructured":"Risnumawan A, Shivakumara P, Chan C, Tan C (2014) A robust arbitrary text detection system for natural scene images. Expert Syst Appl 41(18):8027\u20138048","journal-title":"Expert Syst Appl"},{"issue":"1","key":"2219_CR46","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1007\/s11263-015-0823-z","volume":"116","author":"M Jaderberg","year":"2016","unstructured":"Jaderberg M, Simonyan K, Vedaldi A, Zisserman A (2016) Reading text in the wild with convolutional neural networks. Int J Comput Vis 116(1):1\u201320","journal-title":"Int J Comput Vis"},{"key":"2219_CR47","doi-asserted-by":"crossref","unstructured":"Gupta A, Vedaldi A, Zisserman A (2016) Synthetic data for text localisation in natural images. In: IEEE Conference on Computer Vision and Pattern Recognition, pp 2315\u20132324","DOI":"10.1109\/CVPR.2016.254"},{"key":"2219_CR48","unstructured":"Paszke A, Gross S, Massa F, Lerer A, Bradbury J, Chanan G, Killeen T, Lin Z et al (2019) Pytorch: An imperative style, high-performance deep learning library. In: Advances in Neural Information Processing Systems, pp 8026\u20138037"},{"key":"2219_CR49","doi-asserted-by":"crossref","unstructured":"Liu W, Chen C, Wong K, Su Z, Han J (2016) STAR-Net: A Spatial Attention Residue Network for Scene Text Recognition. In: British Machine Vision Conference, pp 2\u20137","DOI":"10.5244\/C.30.43"},{"key":"2219_CR50","doi-asserted-by":"crossref","unstructured":"Liu W, Chen C, Wong K (2018) Char-Net: A Character-Aware Neural Network for Distorted Scene Text Recognition. In: AAAI on Artificial Intelligence, pp 7154\u20137161","DOI":"10.1609\/aaai.v32i1.12246"},{"key":"2219_CR51","doi-asserted-by":"crossref","unstructured":"Cheng Z, Xu Y, Bai F, Niu Y, Pu S, Zhou S (2018) Aon: Towards arbitrarily-oriented text recognition. In: IEEE Conference on Computer Vision and Pattern Recognition, pp 5571\u20135579","DOI":"10.1109\/CVPR.2018.00584"},{"key":"2219_CR52","doi-asserted-by":"crossref","unstructured":"Xie Z, Huang Y, Zhu Y, Jin L, Liu Y, Xie L (2019) Aggregation cross-entropy for sequence recognition. In: IEEE Conference on Computer Vision and Pattern Recognition, pp 6538\u20136547","DOI":"10.1109\/CVPR.2019.00670"},{"key":"2219_CR53","doi-asserted-by":"crossref","unstructured":"Wan Z, He M, Chen H, Bai X, Yao C (2019) Textscanner: Reading characters in order for robust scene text recognition. In: AAAI Conference on Artificial Intelligence, pp 12120\u201312127","DOI":"10.1609\/aaai.v34i07.6891"}],"container-title":["Applied Intelligence"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10489-021-02219-3.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s10489-021-02219-3\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10489-021-02219-3.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,12,16]],"date-time":"2022-12-16T08:01:19Z","timestamp":1671177679000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s10489-021-02219-3"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2021,2,10]]},"references-count":53,"journal-issue":{"issue":"10","published-print":{"date-parts":[[2021,10]]}},"alternative-id":["2219"],"URL":"https:\/\/doi.org\/10.1007\/s10489-021-02219-3","relation":{},"ISSN":["0924-669X","1573-7497"],"issn-type":[{"type":"print","value":"0924-669X"},{"type":"electronic","value":"1573-7497"}],"subject":[],"published":{"date-parts":[[2021,2,10]]},"assertion":[{"value":"14 January 2021","order":1,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"10 February 2021","order":2,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}