{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2023,2,4]],"date-time":"2023-02-04T04:40:36Z","timestamp":1675485636211},"reference-count":44,"publisher":"Institute of Electronics, Information and Communications Engineers (IEICE)","issue":"5","content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEICE Trans. Inf. &amp; Syst."],"published-print":{"date-parts":[[2022,5,1]]},"DOI":"10.1587\/transinf.2021edp7143","type":"journal-article","created":{"date-parts":[[2022,4,30]],"date-time":"2022-04-30T22:17:19Z","timestamp":1651357039000},"page":"1075-1084","source":"Crossref","is-referenced-by-count":0,"title":["Localization of Pointed-At Word in Printed Documents via a Single Neural Network"],"prefix":"10.1587","volume":"E105.D","author":[{"given":"Rubin","family":"ZHAO","sequence":"first","affiliation":[{"name":"College of Electronics and Information, Hangzhou Dianzi University"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xiaolong","family":"ZHENG","sequence":"additional","affiliation":[{"name":"College of Electronics and Information, Hangzhou Dianzi University"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zhihua","family":"YING","sequence":"additional","affiliation":[{"name":"College of Electronics and Information, Hangzhou Dianzi University"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Lingyan","family":"FAN","sequence":"additional","affiliation":[{"name":"College of Electronics and Information, Hangzhou Dianzi University"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"532","reference":[{"key":"1","doi-asserted-by":"crossref","unstructured":"[1] R. Shilkrot, J. Huber, W.M. Ee, P. Maes, and S.C. Nanayakkara, \u201cFingerReader: A Wearable Device to Explore Printed Text on the Go,\u201d Annual ACM Conference on Human Factors in Computing Systems, Seoul, Republic of Korea, pp.2363-2372, 2015. 10.1145\/2702123.2702421","DOI":"10.1145\/2702123.2702421"},{"key":"2","unstructured":"[2] M. Liao, B. Shi, X. Bai, X. Wang, et al., \u201cTextBoxes: A fast text detector with a single deep neural network,\u201d AAAI Conf. on Artificial Intelligence, San Francisco, California, USA, pp.4161-4167, 2017."},{"key":"3","doi-asserted-by":"crossref","unstructured":"[3] D. Deng, H. Liu, X. Li, et al., \u201cPixellink: detecxelting scene text via instance segmentation,\u201d Thirty-Second AAAI Conf. on Artificial Intelligence, New Orleans, Louisiana, USA, 2018.","DOI":"10.1609\/aaai.v32i1.12269"},{"key":"4","doi-asserted-by":"crossref","unstructured":"[4] X. Zhou, C. Yao, H. Wen, Y. Wang, S. Zhou, W. He, and J. Liang, \u201cEast: an efficient and accurate scene text detector,\u201d 2017 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), Honolulu, HI, USA, pp.2642-2651, 2017. 10.1109\/cvpr.2017.283","DOI":"10.1109\/CVPR.2017.283"},{"key":"5","doi-asserted-by":"crossref","unstructured":"[5] A. Dwivedi, R. Saluja, and R.k. Sarvadevabhatla, \u201cAn OCR for Classical Indic Documents Containing Arbitrarily Long Words,\u201d 2020 IEEE\/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW), pp.2386-2393, 2020. 10.1109\/cvprw50498.2020.00288","DOI":"10.1109\/CVPRW50498.2020.00288"},{"key":"6","doi-asserted-by":"crossref","unstructured":"[6] Z. Tian, W. Huang, T. He, P. He, and Y. Qiao, \u201cDetecting Text in Natural Image with Connectionist Text Proposal Network,\u201d Computer Vision-ECCV 2016, Lecture Notes in Computer Science, vol.9912, pp.56-72, Springer International Publishing, Cham, 2016. 10.1007\/978-3-319-46484-8_4","DOI":"10.1007\/978-3-319-46484-8_4"},{"key":"7","doi-asserted-by":"crossref","unstructured":"[7] T. Ganji, M.S. Velpuru, and R. Dugyala, \u201cMulti Variant Handwritten Telugu Character Recognition Using Transfer Learning,\u201d IOP Conf. Ser.: Mater. Sci. Eng., vol.1042, no.1, p.12-26, 2021. 10.1088\/1757-899x\/1042\/1\/012026","DOI":"10.1088\/1757-899X\/1042\/1\/012026"},{"key":"8","doi-asserted-by":"crossref","unstructured":"[8] A. Ranjan, V.N.J. Behera, and M. Reza, \u201cOCR Using Computer Vision and Machine Learning,\u201d Machine Learning Algorithms for Industrial Applications, Studies in Computational Intelligence, vol.907, pp.83-105, Springer International Publishing, Cham, 2021. 10.1007\/978-3-030-50641-4_6","DOI":"10.1007\/978-3-030-50641-4_6"},{"key":"9","doi-asserted-by":"publisher","unstructured":"[9] M. Rahmati, M. Fateh, M. Rezvani, A. Tajary, and V. Abolghasemi, \u201cPrinted Persian OCR system using deep learning,\u201d IET Image Processing, vol.14, no.15, pp.3920-3931, 2020. 10.1049\/iet-ipr.2019.0728","DOI":"10.1049\/iet-ipr.2019.0728"},{"key":"10","doi-asserted-by":"crossref","unstructured":"[10] R. Girshick, J. Donahue, T. Darrell, and J. Malik, \u201cRich Feature Hierarchies for Accurate Object Detection and Semantic Segmentation,\u201d 2014 IEEE Conference on Computer Vision and Pattern Recognition, pp.580-587, 2014. 10.1109\/cvpr.2014.81","DOI":"10.1109\/CVPR.2014.81"},{"key":"11","doi-asserted-by":"publisher","unstructured":"[11] S. Ren, K. He, R. Girshick, and J. Sun, \u201cFaster R-CNN: Towards Real-Time Object Detection with Region Proposal Networks,\u201d IEEE Trans. Pattern Anal. Mach. Intell., vol.39, no.6, pp.1137-1149, 2017. 10.1109\/tpami.2016.2577031","DOI":"10.1109\/TPAMI.2016.2577031"},{"key":"12","doi-asserted-by":"crossref","unstructured":"[12] J. Redmon, S. Divvala, R. Girshick, and A. Farhadi, \u201cYou Only Look Once: Unified, Real-Time Object Detection,\u201d 2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pp.779-788, 2016. 10.1109\/cvpr.2016.91","DOI":"10.1109\/CVPR.2016.91"},{"key":"13","doi-asserted-by":"crossref","unstructured":"[13] T.-Y. Lin, P. Dollar, R. Girshick, K. He, B. Hariharan, and S. Belongie, \u201cFeature Pyramid Networks for Object Detection,\u201d 2017 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pp.936-944, 2017. 10.1109\/cvpr.2017.106","DOI":"10.1109\/CVPR.2017.106"},{"key":"14","doi-asserted-by":"publisher","unstructured":"[14] S. Long, X. He, and C. Yao, \u201cScene text detection and recognition: The deep learning era,\u201d Int. J. Comput. Vision., vol.129, no.1, pp.161-184, 2021. 10.1007\/s11263-020-01369-0","DOI":"10.1007\/s11263-020-01369-0"},{"key":"15","doi-asserted-by":"crossref","unstructured":"[15] B. Epshtein, E. Ofek, and Y. Wexler, \u201cDetecting text in natural scenes with stroke width transform,\u201d 2010 IEEE Computer Society Conference on Computer Vision and Pattern Recognition, pp.2963-2970, 2010. 10.1109\/cvpr.2010.5540041","DOI":"10.1109\/CVPR.2010.5540041"},{"key":"16","doi-asserted-by":"crossref","unstructured":"[16] W. Huang, Z. Lin, J. Yang, and J. Wang, \u201cText Localization in Natural Images Using Stroke Feature Transform and Text Covariance Descriptors,\u201d 2013 IEEE International Conference on Computer Vision, pp.1241-1248, 2013. 10.1109\/iccv.2013.157","DOI":"10.1109\/ICCV.2013.157"},{"key":"17","doi-asserted-by":"crossref","unstructured":"[17] M. Jaderberg, A. Vedaldi, and A. Zisserman, \u201cDeep Features for Text Spotting,\u201d Computer Vision-ECCV 2014, Lecture Notes in Computer Science, vol.8692, pp.512-528, Springer International Publishing, Cham, 2014. 10.1007\/978-3-319-10593-2_34","DOI":"10.1007\/978-3-319-10593-2_34"},{"key":"18","doi-asserted-by":"crossref","unstructured":"[18] W. Huang, Y. Qiao, and X. Tang, \u201cRobust scene text detection with convolution neural network induced MSER trees,\u201d Computer Vision-ECCV 2014, Lecture Notes in Computer Science, vol.8692, pp.497-511, Springer International Publishing, Cham, 2014. 10.1007\/978-3-319-10593-2_33","DOI":"10.1007\/978-3-319-10593-2_33"},{"key":"19","doi-asserted-by":"publisher","unstructured":"[19] X.-C. Yin, X. Yin, K. Huang, and H.-W. Hao, \u201cRobust Text Detection in Natural Scene Images,\u201d IEEE Trans. Pattern Anal. Mach. Intell., vol.36, no.5, pp.970-983, 2014. 10.1109\/tpami.2013.182","DOI":"10.1109\/TPAMI.2013.182"},{"key":"20","unstructured":"[20] P. He, W. Huang, Y. Qiao, et al., \u201cReading scene text in deep convolutional sequences,\u201d Thirtieth AAAI Conf. on Artificial Intelligence, Phoenix, Arizona, USA, vol.116, no.1, pp.3501-3508, 2016."},{"key":"21","doi-asserted-by":"crossref","unstructured":"[21] J. Long, E. Shelhamer, and T. Darrell, \u201cFully convolutional networks for semantic segmentation,\u201d 2015 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pp.3431-3440, 2015. 10.1109\/cvpr.2015.7298965","DOI":"10.1109\/CVPR.2015.7298965"},{"key":"22","unstructured":"[22] L. Huang, Y. Yang, Y.T. Deng, et al., \u201cDensebox: Unifying landmark localization with end to end object detection,\u201d Comput. Sci., arXiv:1509.04874, 2015."},{"key":"23","doi-asserted-by":"crossref","unstructured":"[23] X. Yu, Y. Gong, N. Jiang, Q. Ye, and Z. Han, \u201cScale Match for Tiny Person Detection,\u201d 2020 IEEE Winter Conference on Applications of Computer Vision (WACV), pp.1246-1254, 2020. 10.1109\/wacv45572.2020.9093394","DOI":"10.1109\/WACV45572.2020.9093394"},{"key":"24","doi-asserted-by":"crossref","unstructured":"[24] G.-S. Xia, X. Bai, J. Ding, Z. Zhu, S. Belongie, J. Luo, M. Datcu, M. Pelillo, and L. Zhang, \u201cDOTA: A Large-Scale Dataset for Object Detection in Aerial Images,\u201d 2018 IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp.3974-3983, 2018. 10.1109\/cvpr.2018.00418","DOI":"10.1109\/CVPR.2018.00418"},{"key":"25","doi-asserted-by":"publisher","unstructured":"[25] M.P. Beddoes and C.Y. Suen, \u201cEvaluation and a Method of Presentation of the Sound Output From the Lexiphone-A reading pen for the Blind,\u201d IEEE Trans. Biomed. Eng., vol.BME-18, no.2, pp.85-91, 1971. 10.1109\/tbme.1971.4502807","DOI":"10.1109\/TBME.1971.4502807"},{"key":"26","doi-asserted-by":"publisher","unstructured":"[26] F. Cooper, J. Gaitenby, I. Mattingly, and N. Umeda, \u201cReading aids for the blind: A special case of machine-to-man communication,\u201d IEEE Trans. Audio Electroacoust., vol.17, no.4, pp.266-270, 1969. 10.1109\/tau.1969.1162063","DOI":"10.1109\/TAU.1969.1162063"},{"key":"27","doi-asserted-by":"publisher","unstructured":"[27] C.Y. Suen and M.P. Beddoes, \u201cDevelopment of a Digital Spelled-Speech Reading Machine for the Blind,\u201d IEEE Trans. Biomed. Eng., vol.BME-20, no.6, pp.452-459, 1973. 10.1109\/tbme.1973.324219","DOI":"10.1109\/TBME.1973.324219"},{"key":"28","doi-asserted-by":"publisher","unstructured":"[28] E.A. Parrish, J.W. Moore, and E.S. McVey, \u201cAn Experimental Personal Reading Machine for the Blind,\u201d IEEE Trans. Biomed. Eng., vol.BME-17, no.2, pp.158-161, 1970. 10.1109\/tbme.1970.4502717","DOI":"10.1109\/TBME.1970.4502717"},{"key":"29","unstructured":"[29] J. Dai, Y. Li, K. He, et al., \u201cR-FCN: Object detection via region-based fully convolutional networks,\u201d 30th International Conference on Neural Information Processing Systems, Barcelona, Spain, pp.379-387, 2016."},{"key":"30","doi-asserted-by":"crossref","unstructured":"[30] R. Girshick, \u201cFast R-CNN,\u201d 2015 IEEE International Conference on Computer Vision (ICCV), pp.1440-1448, 2015. 10.1109\/iccv.2015.169","DOI":"10.1109\/ICCV.2015.169"},{"key":"31","unstructured":"[31] B. Singh, M. Najibi, and L.S. Davis, \u201cSNIPER: Efficient multi-scale training,\u201d 32nd Conference on Neural Information Processing Systems, Montr\u00e9al, Canada, pp.9310-9320, 2018."},{"key":"32","doi-asserted-by":"crossref","unstructured":"[32] K. He, G. Gkioxari, P. Dollar, and R. Girshick, \u201cMask R-CNN,\u201d 2017 IEEE International Conference on Computer Vision (ICCV), pp.2980-2988, 2017. 10.1109\/iccv.2017.322","DOI":"10.1109\/ICCV.2017.322"},{"key":"33","unstructured":"[33] P. Sermanet, D. Eigen, X. Zhang, et al., \u201cOverFeat: Integrated recognition, localization and detection using convolutional networks,\u201d International Conference on Learning Representations, Banff, Canada, pp.1-16, 2014."},{"key":"34","doi-asserted-by":"crossref","unstructured":"[34] J. Redmon and A. Farhadi, \u201cYOLO9000: better, faster, stronger,\u201d 2017 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pp.6517-6525, 2017. 10.1109\/cvpr.2017.690","DOI":"10.1109\/CVPR.2017.690"},{"key":"35","unstructured":"[35] J. Redmon and A. Farhadi, \u201cYolov3: An incremental improvement,\u201d arXiv preprint, arXiv:1804.02767, 2018."},{"key":"36","doi-asserted-by":"publisher","unstructured":"[36] Z. Xu, X. Xu, L. Wang, R. Yang, and F. Pu, \u201cDeformable ConvNet with Aspect Ratio Constrained NMS for Object Detection in Remote Sensing Imagery,\u201d Remote Sensing, vol.9, no.12, p.1312, 2017. 10.3390\/rs9121312","DOI":"10.3390\/rs9121312"},{"key":"37","doi-asserted-by":"crossref","unstructured":"[37] F. Bai, Z. Cheng, Y. Niu, S. Pu, and S. Zhou, \u201cEdit Probability for Scene Text Recognition,\u201d 2018 IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp.1508-1516, 2018. 10.1109\/cvpr.2018.00163","DOI":"10.1109\/CVPR.2018.00163"},{"key":"38","doi-asserted-by":"crossref","unstructured":"[38] A. Bissacco, M. Cummins, Y. Netzer, and H. Neven, \u201cPhotoOCR: Reading Text in Uncontrolled Conditions,\u201d 2013 IEEE International Conference on Computer Vision, pp.785-792, 2013. 10.1109\/iccv.2013.102","DOI":"10.1109\/ICCV.2013.102"},{"key":"39","doi-asserted-by":"crossref","unstructured":"[39] F. Borisyuk, A. Gordo, and V. Sivakumar, \u201cRosetta: Large Scale System for Text Detection and Recognition in Images,\u201d Proc. 24th ACM SIGKDD International Conference on Knowledge Discovery &amp; Data Mining, pp.71-79, 2018. 10.1145\/3219819.3219861","DOI":"10.1145\/3219819.3219861"},{"key":"40","doi-asserted-by":"crossref","unstructured":"[40] Z. Cheng, Y. Xu, F. Bai, Y. Niu, S. Pu, and S. Zhou, \u201cAON: Towards Arbitrarily-Oriented Text Recognition,\u201d 2018 IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp.5571-5579, 2018. 10.1109\/cvpr.2018.00584","DOI":"10.1109\/CVPR.2018.00584"},{"key":"41","doi-asserted-by":"crossref","unstructured":"[41] X. Yang, D. He, Z. Zhou, D. Kifer, and C.L. Giles, \u201cLearning to Read Irregular Text with Attention Mechanisms,\u201d Proc. Twenty-Sixth International Joint Conference on Artificial Intelligence, pp.3280-3286, 2017. 10.24963\/ijcai.2017\/458","DOI":"10.24963\/ijcai.2017\/458"},{"key":"42","doi-asserted-by":"publisher","unstructured":"[42] R. Chandrakar, \u201cDigital object identifier system: An overview,\u201d The Electronic Library, vol.24, no.4, pp.445-452, 2006. 10.1108\/02640470610689151","DOI":"10.1108\/02640470610689151"},{"key":"43","doi-asserted-by":"crossref","unstructured":"[43] C. Szegedy, W. Liu, Y. Jia, P. Sermanet, S. Reed, D. Anguelov, D. Erhan, V. Vanhoucke, and A. Rabinovich, \u201cGoing deeper with convolutions,\u201d 2015 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pp.1-9, 2015. 10.1109\/cvpr.2015.7298594","DOI":"10.1109\/CVPR.2015.7298594"},{"key":"44","doi-asserted-by":"crossref","unstructured":"[44] K. He, X. Zhang, S. Ren, and J. Sun, \u201cDeep Residual Learning for Image Recognition,\u201d 2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pp.770-778, 2016. 10.1109\/cvpr.2016.90","DOI":"10.1109\/CVPR.2016.90"}],"container-title":["IEICE Transactions on Information and Systems"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/www.jstage.jst.go.jp\/article\/transinf\/E105.D\/5\/E105.D_2021EDP7143\/_pdf","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,2,4]],"date-time":"2023-02-04T04:03:43Z","timestamp":1675483423000},"score":1,"resource":{"primary":{"URL":"https:\/\/www.jstage.jst.go.jp\/article\/transinf\/E105.D\/5\/E105.D_2021EDP7143\/_article"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2022,5,1]]},"references-count":44,"journal-issue":{"issue":"5","published-print":{"date-parts":[[2022]]}},"URL":"https:\/\/doi.org\/10.1587\/transinf.2021edp7143","relation":{},"ISSN":["0916-8532","1745-1361"],"issn-type":[{"value":"0916-8532","type":"print"},{"value":"1745-1361","type":"electronic"}],"subject":[],"published":{"date-parts":[[2022,5,1]]},"article-number":"2021EDP7143"}}