{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,9]],"date-time":"2026-07-09T21:42:58Z","timestamp":1783633378496,"version":"3.55.0"},"reference-count":47,"publisher":"Springer Science and Business Media LLC","issue":"2","license":[{"start":{"date-parts":[[2016,2,23]],"date-time":"2016-02-23T00:00:00Z","timestamp":1456185600000},"content-version":"tdm","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["IJDAR"],"published-print":{"date-parts":[[2016,6]]},"DOI":"10.1007\/s10032-016-0261-7","type":"journal-article","created":{"date-parts":[[2016,2,23]],"date-time":"2016-02-23T18:24:41Z","timestamp":1456251881000},"page":"83-98","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":1,"title":["Bidirectional extraction and recognition of scene text with layout consistency"],"prefix":"10.1007","volume":"19","author":[{"ORCID":"https:\/\/orcid.org\/0000-0003-1542-2612","authenticated-orcid":false,"given":"Ryota","family":"Hinami","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xinhao","family":"Liu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Naoki","family":"Chiba","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Shin\u2019ichi","family":"Satoh","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2016,2,23]]},"reference":[{"key":"261_CR1","unstructured":"Abbyy FineReader 9.0. http:\/\/www.abbyy.com"},{"key":"261_CR2","doi-asserted-by":"crossref","unstructured":"Almaz\u00e1n, J., Gordo, G., Forn\u00e9s, A., Valveny, E.: Word spotting and recognition with embedded attributes. IEEE Trans. Pattern Anal. Mach. Intell. 36(12), 2552\u20132566 (2014)","DOI":"10.1109\/TPAMI.2014.2339814"},{"key":"261_CR3","unstructured":"Alsharif, O., Pineau, J.: End-to-end text recognition with hybrid HMM maxout models. In: ICLP, Oct 2013"},{"issue":"6","key":"261_CR4","doi-asserted-by":"crossref","first-page":"495","DOI":"10.1109\/34.771314","volume":"21","author":"I Bazzi","year":"1999","unstructured":"Bazzi, I., Schwartz, R., Makhoul, J.: An omnifont open-vocabulary OCR system for English and Arabic. PAMI 21(6), 495\u2013504 (1999)","journal-title":"PAMI"},{"key":"261_CR5","unstructured":"Bengio, Y., LeCun, Y.: Word normalization for on-line handwritten word recognition. In: IAPR (1994)"},{"key":"261_CR6","doi-asserted-by":"crossref","unstructured":"Bissacco, A., Cummins, M., Netzer, Y., Neven, H.: Photocr: reading text in uncontrolled conditions. In: ICCV (2013)","DOI":"10.1109\/ICCV.2013.102"},{"key":"261_CR7","doi-asserted-by":"crossref","unstructured":"Caesar, T., Gloger, J.M., Mandler, E.: Estimating the baseline for written material. In: ICDAR (1995)","DOI":"10.1109\/ICDAR.1995.599018"},{"issue":"3","key":"261_CR8","first-page":"27","volume":"2","author":"C-C Chang","year":"2011","unstructured":"Chang, C.-C., Lin, C.-J.: LIBSVM: a library for support vector machines. ACM Trans. Intell. Syst. Technol. 2(3), 27 (2011)","journal-title":"ACM Trans. Intell. Syst. Technol."},{"key":"261_CR9","doi-asserted-by":"crossref","unstructured":"Dalal, N., Triggs, B.: Histograms of oriented gradients for human detection. In: CVPR (2005)","DOI":"10.1109\/CVPR.2005.177"},{"key":"261_CR10","unstructured":"de Campos, T., Babu, B.R., Varma, M.: Character recognition in natural images. In: VISAPP (2009)"},{"key":"261_CR11","doi-asserted-by":"crossref","unstructured":"Goel, V., Ecole, W.: Whole is greater than sum of parts: recognizing scene text words. In: ICDAR (2013)","DOI":"10.1109\/ICDAR.2013.87"},{"key":"261_CR12","doi-asserted-by":"crossref","unstructured":"Gordo, A.: Supervised mid-level features for word image representation. In: CVPR (2015)","DOI":"10.1109\/CVPR.2015.7298914"},{"key":"261_CR13","doi-asserted-by":"crossref","unstructured":"Huang, W., Qiao, Y., Tang, X.: Robust scene text detection with convolution neural network induced mser trees. In: ECCV (2014)","DOI":"10.1007\/978-3-319-10593-2_33"},{"issue":"1","key":"261_CR14","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1007\/s11263-015-0823-z","volume":"116","author":"M Jaderberg","year":"2016","unstructured":"Jaderberg, M., Simonyan, K., Vedaldi, A., Zisserman, A.: Reading text in the wild with convolutional neural networks. Int. J. Comput. Vision. 116(1), 1\u201320 (2016)","journal-title":"Int. J. Comput. Vision."},{"key":"261_CR15","unstructured":"Jaderberg, M., Simonyan, K., Vedaldi, A., Zisserman, A.: Synthetic data and artificial neural networks for natural scene text recognition. In: NIPS Deep Learning Workshop, pp. 1\u201310 (2014)"},{"key":"261_CR16","unstructured":"Jones, M.A., Story, G.A., Ballard, B.W.: Integrating multiple knowledge sources in a bayesian ocr post-processor. In: ICDAR (1991)"},{"key":"261_CR17","doi-asserted-by":"crossref","unstructured":"Karatzas, D., Gomez-bigorda, L., Nicolaou, A., Ghosh, S., Bagdanov, A., Iwamura, M., Matas, J., Neumann, L., Chandrasekhar, V.R., Lu, S., Shafait, F., Uchida, S., Valveny, E.: ICDAR 2015 competition on robust reading. In: ICDAR (2015)","DOI":"10.1109\/ICDAR.2015.7333942"},{"key":"261_CR18","doi-asserted-by":"crossref","unstructured":"Karatzas, D., Shafait, F., Uchida, S., Iwamura, M., Bigorda, L.G.I., Mestre, S.R., Mas, J., Mota, D.F., Almazan, J.A., de\u00a0las Heras, L.P.: ICDAR 2013 robust reading competition. In: ICDAR, Aug 2013","DOI":"10.1109\/ICDAR.2013.221"},{"issue":"10","key":"261_CR19","doi-asserted-by":"crossref","first-page":"1568","DOI":"10.1109\/TPAMI.2006.200","volume":"28","author":"V Kolmogorov","year":"2006","unstructured":"Kolmogorov, V.: Convergent tree-reweighted message passing for energy minimization. IEEE Trans. Pattern Anal. Mach. Intell. 28(10), 1568\u20131583 (2006)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"261_CR20","doi-asserted-by":"crossref","unstructured":"Kumar, D., Prasad, M., Ramakrishnan, A.: Maps: midline analysis and propagation of segmentation. In: Proceedings of the Eighth Indian Conference on Computer Vision, Graphics and Image Processing, p.\u00a015. ACM (2012)","DOI":"10.1145\/2425333.2425348"},{"key":"261_CR21","doi-asserted-by":"crossref","unstructured":"Kumar, D., Prasad, M.A., Ramakrishnan, A.: Nesp: nonlinear enhancement and selection of plane for optimal segmentation and recognition of scene word images. In: IS&T\/SPIE Electronic Imaging, pp. 865806\u2013865806. International Society for Optics and Photonics (2013)","DOI":"10.1117\/12.2008519"},{"key":"261_CR22","doi-asserted-by":"crossref","unstructured":"Lee, C.-Y., Bhardwaj, A., Di, W., Jagadeesh, V., Piramuthu, R.: Region-based discriminative feature pooling for scene text recognition. In: CVPR (2014)","DOI":"10.1109\/CVPR.2014.516"},{"key":"261_CR23","doi-asserted-by":"crossref","unstructured":"Lucas, S., Panaretos, A., Sosa, L., Tang, A., Wong, S., Young, R.: ICDAR 2003 robust reading competitions. In: ICDAR (2003)","DOI":"10.1109\/ICDAR.2003.1227749"},{"issue":"10","key":"261_CR24","doi-asserted-by":"crossref","first-page":"761","DOI":"10.1016\/j.imavis.2004.02.006","volume":"22","author":"J Matas","year":"2004","unstructured":"Matas, J., Chum, O., Urban, M., Pajdla, T.: Robust wide-baseline stereo from maximally stable extremal regions. Image Vis. Comput. 22(10), 761\u2013767 (2004)","journal-title":"Image Vis. Comput."},{"key":"261_CR25","unstructured":"Miller, E.G., Viola, P.A.: Ambiguity and constraint in mathematical expression recognition. In: AAAI\/IAAI, pp. 784\u2013791 (1998)"},{"key":"261_CR26","doi-asserted-by":"crossref","unstructured":"Mishra, A., Alahari, K., Jawahar, C.V.: Scene text recognition using higher order language priors. In: BMVC (2012)","DOI":"10.5244\/C.26.127"},{"key":"261_CR27","doi-asserted-by":"crossref","unstructured":"Mishra, A., Alahari, K., Jawahar, C.V.: Top-down and bottom-up cues for scene text recognition. In: CVPR (2012)","DOI":"10.1109\/CVPR.2012.6247990"},{"key":"261_CR28","doi-asserted-by":"crossref","unstructured":"Neumann, L., Matas, J.: A method for text localization and recognition in real-world images. In: ACCV (2010)","DOI":"10.1007\/978-3-642-19318-7_60"},{"key":"261_CR29","doi-asserted-by":"crossref","unstructured":"Neumann, L., Matas, J.: Text localization in real-world images using efficiently pruned exhaustive search. In: ICDAR (2011)","DOI":"10.1109\/ICDAR.2011.144"},{"key":"261_CR30","doi-asserted-by":"crossref","unstructured":"Neumann, L., Matas, J.: Real-time scene text localization and recognition. In: CVPR (2012)","DOI":"10.1109\/CVPR.2012.6248097"},{"key":"261_CR31","doi-asserted-by":"crossref","unstructured":"Novikova, T., Barinova, O., Kohli, P., Lempitsky, V.: Large-lexicon attribute-consistent text recognition in natural images. In: ECCV (2012)","DOI":"10.1007\/978-3-642-33783-3_54"},{"key":"261_CR32","unstructured":"Otsu, N.: A threshold selection method from gray-level histograms. Automatica 11(285\u2013296), 23\u201327 (1975)"},{"key":"261_CR33","doi-asserted-by":"crossref","unstructured":"Sarkar, P., Nagy, G.: Style consistent classification of isogenous patterns. IEEE Trans. Pattern Anal. Mach. Intell. 27(1), 88\u201398 (2005)","DOI":"10.1109\/TPAMI.2005.18"},{"key":"261_CR34","doi-asserted-by":"crossref","unstructured":"Shi, C., Wang, C., Xiao, B., Zhang, Y., Gao, S., Zhang, Z.: Scene text recognition using part-based tree-structured character detection. In: CVPR (2013)","DOI":"10.1109\/CVPR.2013.381"},{"key":"261_CR35","doi-asserted-by":"crossref","unstructured":"Su, B., Lu, S., Tian, S., Lim, J.-H., Tan, C.-L.: Character recognition in natural scenes using convolutional co-occurrence hog. In: ICPR (2014)","DOI":"10.1109\/ICPR.2014.504"},{"issue":"6","key":"261_CR36","doi-asserted-by":"crossref","first-page":"1247","DOI":"10.1162\/089976600300015349","volume":"12","author":"JB Tenenbaum","year":"2000","unstructured":"Tenenbaum, J.B., Freeman, W.T.: Separating style and content with bilinear models. Neural Comput. 12(6), 1247\u20131283 (2000)","journal-title":"Neural Comput."},{"key":"261_CR37","first-page":"2005","volume":"2127\u20132135","author":"C Thillou","year":"2005","unstructured":"Thillou, C., Ferreira, S., Gosselin, B.: An embedded application for degraded text recognition. EURASIP J. Appl. Signal Process. 2127\u20132135, 2005 (2005)","journal-title":"EURASIP J. Appl. Signal Process."},{"key":"261_CR38","doi-asserted-by":"crossref","unstructured":"Tian, S., Lu, S., Su, B.: Scene text recognition using co-occurrence of histogram of oriented gradients. In: ICDAR (2013)","DOI":"10.1109\/ICDAR.2013.186"},{"key":"261_CR39","unstructured":"Wang, K., Babenko, B., Belongie, S.: End-to-end scene text recognition. In: ICCV (2011)"},{"key":"261_CR40","doi-asserted-by":"crossref","unstructured":"Wang, K., Belongie, S.: Word spotting in the wild. In: ECCV (2010)","DOI":"10.1007\/978-3-642-15549-9_43"},{"key":"261_CR41","unstructured":"Wang, T., Wu, D.J., Ng, A.Y.: End-to-end text recognition with convolutional neural networks. In: ICPR (2012)"},{"key":"261_CR42","doi-asserted-by":"crossref","unstructured":"Weinman, J., Learned-Miller, E.: Improving recognition of novel input with similarity. In: IEEE Computer Soceity Conference on Computer Vision and Pattern Recognition (CVPR), vol. 1, 17\u201322 June 2006, pp. 308\u2013315 (2006)","DOI":"10.1109\/CVPR.2006.151"},{"key":"261_CR43","doi-asserted-by":"crossref","unstructured":"Weinman, J.J.: Typographical features for scene text recognition. In: ICPR (2010)","DOI":"10.1109\/ICPR.2010.970"},{"key":"261_CR44","doi-asserted-by":"crossref","unstructured":"Weinman, J.J., Butler, Z., Knoll, D., Feild, J.: Toward integrated scene text reading. IEEE Trans. Pattern Anal. Mach. Intell. 36(2), 375\u2013389 (2014)","DOI":"10.1109\/TPAMI.2013.126"},{"key":"261_CR45","doi-asserted-by":"crossref","unstructured":"Weinman, J.J., Learned-Miller, E., Hanson, A.R.: Scene text recognition using similarity and a lexicon with sparse belief propagation. IEEE Trans. Pattern Anal. Mach. Intell. 31(10), 1733\u20131746 (2009)","DOI":"10.1109\/TPAMI.2009.38"},{"key":"261_CR46","doi-asserted-by":"crossref","unstructured":"Yao, C., Bai, X., Shi, B., Liu, W.: Strokelets: a learned multi-scale representation for scene text recognition. In: CVPR (2014)","DOI":"10.1109\/CVPR.2014.515"},{"key":"261_CR47","unstructured":"ICDAR.: http:\/\/rrc.cvc.uab.es\/?com=evaluation&ch=4&view=task3_method&id_submit=3895 (2015) . Accessed 23 Feb 2016"}],"container-title":["International Journal on Document Analysis and Recognition (IJDAR)"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s10032-016-0261-7.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/article\/10.1007\/s10032-016-0261-7\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s10032-016-0261-7","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,1]],"date-time":"2025-06-01T13:49:06Z","timestamp":1748785746000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/s10032-016-0261-7"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2016,2,23]]},"references-count":47,"journal-issue":{"issue":"2","published-print":{"date-parts":[[2016,6]]}},"alternative-id":["261"],"URL":"https:\/\/doi.org\/10.1007\/s10032-016-0261-7","relation":{},"ISSN":["1433-2833","1433-2825"],"issn-type":[{"value":"1433-2833","type":"print"},{"value":"1433-2825","type":"electronic"}],"subject":[],"published":{"date-parts":[[2016,2,23]]}}}