{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,9,17]],"date-time":"2025-09-17T15:45:39Z","timestamp":1758123939318,"version":"3.37.3"},"reference-count":49,"publisher":"Springer Science and Business Media LLC","issue":"23","license":[{"start":{"date-parts":[[2024,1,8]],"date-time":"2024-01-08T00:00:00Z","timestamp":1704672000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2024,1,8]],"date-time":"2024-01-08T00:00:00Z","timestamp":1704672000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["61603256"],"award-info":[{"award-number":["61603256"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100000038","name":"Natural Sciences and Engineering Research Council of Canada","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100000038","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Multimed Tools Appl"],"DOI":"10.1007\/s11042-023-17986-z","type":"journal-article","created":{"date-parts":[[2024,1,8]],"date-time":"2024-01-08T06:02:23Z","timestamp":1704693743000},"page":"62677-62699","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":4,"title":["Adaptive feature fusion for scene text script identification"],"prefix":"10.1007","volume":"83","author":[{"given":"Fuyou","family":"Peng","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Hui","family":"Ma","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Li","family":"Liu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yue","family":"Lu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Ching Y.","family":"Suen","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2024,1,8]]},"reference":[{"issue":"3","key":"17986_CR1","doi-asserted-by":"publisher","first-page":"1217","DOI":"10.1016\/j.patcog.2013.09.035","volume":"47","author":"V Alabau","year":"2014","unstructured":"Alabau V, Sanchis A, Casacuberta F (2014) Improving on-line handwritten recognition in interactive machine translation. Pattern Recogn 47(3):1217\u20131228","journal-title":"Pattern Recogn"},{"key":"17986_CR2","doi-asserted-by":"publisher","first-page":"33701","DOI":"10.1007\/s11042-021-11345-6","volume":"80","author":"M Bansal","year":"2021","unstructured":"Bansal M, Lobiyal DK (2021) Multilingual sequence to sequence convolutional machine translation. Multimed Tools and Appl 80:33701\u201333726","journal-title":"Multimed Tools and Appl"},{"key":"17986_CR3","doi-asserted-by":"publisher","first-page":"6271","DOI":"10.1007\/s11042-022-13596-3","volume":"82","author":"M Garg","year":"2023","unstructured":"Garg M, Ubhi JS, Aggarwal AK (2023) Neural style transfer for image steganography and destylization with supervised image to image translation. Multimed Tools Appl 82:6271\u20136288","journal-title":"Multimed Tools Appl"},{"key":"17986_CR4","doi-asserted-by":"publisher","first-page":"231","DOI":"10.1016\/j.eswa.2016.07.015","volume":"63","author":"Z Yuan","year":"2016","unstructured":"Yuan Z, Wang H, Wang L, Lu T, Palaiahnakote S, Tan CL (2016) Modeling spatial layout for scene image understanding via a novel multiscale sum-product network. Expert Syst Appl 63:231\u2013240","journal-title":"Expert Syst Appl"},{"key":"17986_CR5","doi-asserted-by":"publisher","first-page":"42573","DOI":"10.1007\/s11042-021-11453-3","volume":"81","author":"S Chen","year":"2022","unstructured":"Chen S, Shao D, Zhang L, Zhang C (2022) Learning depth-aware features for indoor scene understanding. Multimed Tools Appl 81:42573\u201342590","journal-title":"Multimed Tools Appl"},{"key":"17986_CR6","doi-asserted-by":"publisher","first-page":"35475","DOI":"10.1007\/s11042-019-07882-w","volume":"79","author":"W Li","year":"2020","unstructured":"Li W, Gu J, Dong Y, Han J (2020) Indoor scene understanding via RGB-D image segmentation employing depth-based CNN and CRFs. Multimedia Tools and Applications 79:35475\u201335489","journal-title":"Multimedia Tools and Applications"},{"key":"17986_CR7","doi-asserted-by":"publisher","first-page":"29095","DOI":"10.1007\/s11042-021-11103-8","volume":"80","author":"M Ghosh","year":"2021","unstructured":"Ghosh M, Mukherjee H, Obaidullah SM, Santosh KC, Das N, Roy K (2021) LWSINet: A deep learning-based approach towards video script identification. Multimed Tools Appl 80:29095\u201329128","journal-title":"Multimed Tools Appl"},{"issue":"2","key":"17986_CR8","doi-asserted-by":"publisher","first-page":"176","DOI":"10.1109\/34.574802","volume":"19","author":"J Hochberg","year":"1997","unstructured":"Hochberg J, Kelly P, Thomas T, Kerns L (1997) Automatic script identification from document images using cluster-based templates. IEEE Trans Pattern Anal Mach Intell 19(2):176\u2013181","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"17986_CR9","doi-asserted-by":"crossref","unstructured":"Chaudhury S, Sheth R (1999) Trainable script identification strategies for Indian languages. In: Fifth international conference on document analysis and recognition, pp 657-660","DOI":"10.1109\/ICDAR.1999.791873"},{"key":"17986_CR10","doi-asserted-by":"crossref","unstructured":"Hu J, Shen L, Sun G (2018) Squeeze-and-Excitation networks. In: IEEE Conference on computer vision and pattern recognition, pp 7132-7141","DOI":"10.1109\/CVPR.2018.00745"},{"issue":"8","key":"17986_CR11","doi-asserted-by":"publisher","first-page":"1735","DOI":"10.1162\/neco.1997.9.8.1735","volume":"9","author":"S Hochreiter","year":"1997","unstructured":"Hochreiter S, Schmidhuber J (1997) Long short-term memory. Neural Comput 9(8):1735\u20131780","journal-title":"Neural Comput"},{"key":"17986_CR12","doi-asserted-by":"publisher","first-page":"109216","DOI":"10.1016\/j.patcog.2022.109216","volume":"136","author":"X Ning","year":"2023","unstructured":"Ning X, Tian W, He F, Bai X, Sun L, Li W (2023) Hyper-sausage coverage function neuron model and learning algorithm for image classification. Pattern Recogn 136:109216","journal-title":"Pattern Recogn"},{"key":"17986_CR13","doi-asserted-by":"publisher","first-page":"108873","DOI":"10.1016\/j.patcog.2022.108873","volume":"131","author":"X Ning","year":"2022","unstructured":"Ning X, Tian W, Yu Z, Li W, Bai X, Wang Y (2022) HCFNN: High-order coverage function neural network for image classification. Pattern Recogn 131:108873","journal-title":"Pattern Recogn"},{"key":"17986_CR14","doi-asserted-by":"crossref","unstructured":"Shi B, Yao C, Zhang C, Guo X, Huang F, Bai X (2015) Automatic script identification in the wild. In: 2015 13th International conference on document analysis and recognition, pp 531-535","DOI":"10.1109\/ICDAR.2015.7333818"},{"key":"17986_CR15","unstructured":"Mei J, Dai L, Shi B, Bai X (2016) Scene text script identification with convolutional recurrent neural networks. In: 2016 23rd International Conference on Pattern Recognition, pp 4053-4058"},{"key":"17986_CR16","doi-asserted-by":"crossref","unstructured":"G\u00f3mez L, Karatzas D (2016) A fine-grained approach to scene text script identification. In: 2016 12th IAPR Workshop on document analysis systems, pp 192-197","DOI":"10.1109\/DAS.2016.64"},{"key":"17986_CR17","doi-asserted-by":"publisher","first-page":"702","DOI":"10.1007\/978-3-319-70136-3_74","volume-title":"Neural Information Processing","author":"M Tounsi","year":"2017","unstructured":"Tounsi M, Moalla I, Lebourgeois F, Alim AM (2017) CNN based transfer learning for scene script identification. In: Liu D, Xie S, Li Y, Zhao D, El-Alfy ES (eds) Neural Information Processing. Springer, Cham, pp 702\u2013711"},{"issue":"3","key":"17986_CR18","first-page":"67","volume":"16","author":"Y Cao","year":"2019","unstructured":"Cao Y, Li J, Wang Q, Huang K, Zhang R (2019) Improving script identification by integrating text recognition information. J Inform Process Syst 16(3):67\u201375","journal-title":"J Inform Process Syst"},{"key":"17986_CR19","doi-asserted-by":"crossref","unstructured":"Cheng C, Huang Q, Bai X, Feng B, Liu W (2019) Patch aggregator for scene text script identification. In: 2019 International conference on document analysis and recognition, pp 1077-1083","DOI":"10.1109\/ICDAR.2019.00175"},{"key":"17986_CR20","doi-asserted-by":"publisher","first-page":"107832","DOI":"10.1016\/j.patcog.2021.107832","volume":"113","author":"A Cheikhrouhou","year":"2021","unstructured":"Cheikhrouhou A, Kessentini Y, Kanoun S (2021) Multi-task learning for simultaneous script identification and keyword spotting in document images. Pattern Recogn 113:107832","journal-title":"Pattern Recogn"},{"key":"17986_CR21","doi-asserted-by":"crossref","unstructured":"Li Y, Wu S, Yu J, Wang Z (2021) Fine-grained language identification in scene text images. In: 29th ACM International conference on multimedia, pp 4573\u20134581","DOI":"10.1145\/3474085.3475615"},{"key":"17986_CR22","doi-asserted-by":"publisher","first-page":"104916","DOI":"10.1016\/j.engappai.2022.104916","volume":"113","author":"K Yang","year":"2022","unstructured":"Yang K, Yi J, Chen A, Liu J, Chen W, Jin Z (2022) ConvPatchTrans: A script identification network with global and local semantics deeply integrated. Eng Appl Artif Intell 113:104916","journal-title":"Eng Appl Artif Intell"},{"issue":"7","key":"17986_CR23","doi-asserted-by":"publisher","first-page":"4434","DOI":"10.3390\/app13074434","volume":"13","author":"Z Zhang","year":"2023","unstructured":"Zhang Z, Mamat H, Xu X, Aysa A, Ubul K (2023) FAS-Res2net: An improved res2net-based script identification method for natural scenes. Appl Sci 13(7):4434","journal-title":"Appl Sci"},{"key":"17986_CR24","doi-asserted-by":"publisher","first-page":"85","DOI":"10.1016\/j.patcog.2017.01.032","volume":"67","author":"L G\u00f3mez","year":"2017","unstructured":"G\u00f3mez L, Nicolaou A, Karatzas D (2017) Improving patch-based scene text script identification with ensembles of conjoined networks. Pattern Recogn 67:85\u201396","journal-title":"Pattern Recogn"},{"key":"17986_CR25","doi-asserted-by":"publisher","first-page":"52669","DOI":"10.1109\/ACCESS.2019.2911964","volume":"7","author":"L Lu","year":"2019","unstructured":"Lu L, Yi Y, Huang F, Wang K, Wang Q (2019) Integrating Local CNN and Global CNN for script identification in natural scene images. IEEE Access 7:52669\u201352679","journal-title":"IEEE Access"},{"key":"17986_CR26","doi-asserted-by":"publisher","first-page":"458","DOI":"10.1007\/978-3-031-11346-8_40","volume-title":"Computer Vision and Image Processing","author":"K Dutta","year":"2022","unstructured":"Dutta K, Dastidar SG, Das N, Kundu M, Nasipuri M (2022) Script identification in natural scene text images by learning local and global features on inception net. In: Raman B, Murala S, Chowdhury A, Dhall A, Goyal P (eds) Computer Vision and Image Processing. Springer, Cham, pp 458\u2013467"},{"issue":"8","key":"17986_CR27","doi-asserted-by":"publisher","first-page":"5319","DOI":"10.1109\/TCSVT.2022.3144186","volume":"32","author":"T Yan","year":"2022","unstructured":"Yan T, Li H, Sun B, Wang Z, Luo Z (2022) Discriminative feature mining and enhancement network for low-resolution fine-grained image recognition. IEEE Trans Circuits Syst Video Technol 32(8):5319\u20135330","journal-title":"IEEE Trans Circuits Syst Video Technol"},{"key":"17986_CR28","doi-asserted-by":"crossref","unstructured":"Meng L, Li H, Chen BC et al (2022) AdaViT: Adaptive vision transformers for efficient image recognition. In: IEEE\/CVF Conference on computer vision and pattern recognition, pp 12309-12318","DOI":"10.1109\/CVPR52688.2022.01199"},{"key":"17986_CR29","doi-asserted-by":"crossref","unstructured":"Qin Z, Zhang P, Wu F, Li X (2021) Fcanet: Frequency channel attention networks. In: IEEE\/CVF International conference on computer vision, pp 783\u2013792","DOI":"10.1109\/ICCV48922.2021.00082"},{"key":"17986_CR30","unstructured":"Zhang H, Zu K, Lu J, Zou Y, Meng D (2022) EPSANet: An efficient pyramid squeeze attention block on convolutional neural network. In: Asian conference on computer vision, pp 1161\u20131177"},{"key":"17986_CR31","first-page":"9423","volume":"31","author":"J Hu","year":"2018","unstructured":"Hu J, Shen L, Albanie S, Sun G, Vedaldi A (2018) Gather-excite: Exploiting feature context in convolutional neural networks. Adv Neural Inf Process Syst 31:9423\u20139433","journal-title":"Adv Neural Inf Process Syst"},{"key":"17986_CR32","unstructured":"Ramachandran P, Parmar N, Vaswani A, Bello I, Levskaya A, Shlens J (2019) Stand-alone self-attention in vision models. arXiv preprint arXiv:1906.05909"},{"key":"17986_CR33","doi-asserted-by":"crossref","unstructured":"Woo S, Park J, Lee JY, Kweon IS (2018) CBAM: Convolutional block attention module. In: European Conference on Computer Vision, pp 3-19","DOI":"10.1007\/978-3-030-01234-2_1"},{"key":"17986_CR34","unstructured":"Park J, Woo S, Lee JY, Kweon IS (2018) BAM: Bottleneck attention module. arXiv preprint arXiv:1807.06514"},{"issue":"6","key":"17986_CR35","doi-asserted-by":"publisher","first-page":"3707","DOI":"10.3390\/app13063707","volume":"13","author":"J Wang","year":"2023","unstructured":"Wang J, Li P, Zhao R, Zhou R, Han Y (2023) CNN attention enhanced vit network for occluded person re-identification. Appl Sci 13(6):3707","journal-title":"Appl Sci"},{"key":"17986_CR36","doi-asserted-by":"publisher","first-page":"11","DOI":"10.1007\/s43684-022-00030-6","volume":"2","author":"Y Liu","year":"2022","unstructured":"Liu Y, Chen C, Wang T, Cheng L (2022) An attention enhanced dilated CNN approach for cross-axis industrial robotics fault diagnosis. Auton Intell Syst 2:11","journal-title":"Auton Intell Syst"},{"key":"17986_CR37","doi-asserted-by":"publisher","first-page":"172","DOI":"10.1016\/j.patcog.2018.07.034","volume":"85","author":"AK Bhunia","year":"2019","unstructured":"Bhunia AK, Konwer A, Bhunia AK, Bhowmick A, Roy PP, Pal U (2019) Script identification in natural scene image and video frames using an attention based Convolutional-LSTM network. Pattern Recogn 85:172\u2013184","journal-title":"Pattern Recogn"},{"key":"17986_CR38","doi-asserted-by":"publisher","first-page":"222","DOI":"10.1016\/j.neucom.2020.09.015","volume":"421","author":"M Ma","year":"2021","unstructured":"Ma M, Wang Q, Huang S, Huang S, Goulermas Y, Huang K (2021) Residual attention-based multi-scale script identification in scene text images. Neurocomputing 421:222\u2013233","journal-title":"Neurocomputing"},{"key":"17986_CR39","doi-asserted-by":"publisher","first-page":"45","DOI":"10.1016\/j.patrec.2023.04.015","volume":"171","author":"X Li","year":"2023","unstructured":"Li X, Zhan H, Shivakumara P, Pal U, Lu Y (2023) SANet-SI: A new self-attention-network for script identification in scene images. Pattern Recogn Lett 171:45\u201352","journal-title":"Pattern Recogn Lett"},{"key":"17986_CR40","doi-asserted-by":"publisher","first-page":"28669","DOI":"10.1007\/s11042-022-14222-y","volume":"82","author":"SK Ladi","year":"2023","unstructured":"Ladi SK, Panda GK, Dash R, Ladi PK, Dhupar R (2023) Correction to: A novel grey wolf optimisation based CNN classifier for hyperspectral image classification. Multimed Tools Appl 82:28669","journal-title":"Multimed Tools Appl"},{"key":"17986_CR41","doi-asserted-by":"publisher","first-page":"14247","DOI":"10.1007\/s11042-022-12447-5","volume":"81","author":"B Mahaur","year":"2022","unstructured":"Mahaur B, Singh N, Mishra KK (2022) Road object detection: a comparative study of deep learning-based algorithms. Multimed Tools Appl 81:14247\u201314282","journal-title":"Multimed Tools Appl"},{"key":"17986_CR42","doi-asserted-by":"publisher","first-page":"1375","DOI":"10.1007\/s11042-021-11435-5","volume":"81","author":"J Li","year":"2022","unstructured":"Li J, Han Y, Zhang M, Li G, Zhang B (2022) Multi-scale residual network model combined with Global Average Pooling for action recognition. Multimed Tools Appl 81:1375\u20131393","journal-title":"Multimed Tools Appl"},{"key":"17986_CR43","doi-asserted-by":"crossref","unstructured":"Lin TY, Goyal P, Girshick R, He K, Dollar P (2017) Focal loss for dense object detection. In: IEEE International conference on computer vision, pp 2980\u20132988","DOI":"10.1109\/ICCV.2017.324"},{"key":"17986_CR44","doi-asserted-by":"crossref","unstructured":"Nayef N, Yin F, Bizid I et al (2017) ICDAR2017 robust reading challenge on multi-lingual scene text detection and script identification-RRC-MLT. In: 2017 International conference on document analysis and recognition, pp 1454\u20131459","DOI":"10.1109\/ICDAR.2017.237"},{"key":"17986_CR45","doi-asserted-by":"publisher","first-page":"448","DOI":"10.1016\/j.patcog.2015.11.005","volume":"52","author":"B Shi","year":"2016","unstructured":"Shi B, Bai X, Yao C (2016) Script identification in the wild via discriminative convolutional neural network. Pattern Recogn 52:448\u2013458","journal-title":"Pattern Recogn"},{"key":"17986_CR46","doi-asserted-by":"crossref","unstructured":"Sharma N, Mandal R, Sharma R, Pal U, Blumenstein M (2015) ICDAR2015 competition on video script identification (CVSI 2015). In: 2015 International conference on document analysis and recognition, pp 1196\u20131200","DOI":"10.1109\/ICDAR.2015.7333950"},{"key":"17986_CR47","unstructured":"Kingma DP, Ba J (2014) Adam: A method for stochastic optimization. arXiv preprint arXiv:1412.6980"},{"key":"17986_CR48","doi-asserted-by":"crossref","unstructured":"Wang Q, Wu B, Zhu P, Li P, Zuo W, Hu Q (2020) ECA-Net: Efficient channel attention for deep convolutional neural networks. In: IEEE\/CVF Conference on computer vision and pattern recognition, pp 13\u201319","DOI":"10.1109\/CVPR42600.2020.01155"},{"issue":"4","key":"17986_CR49","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/3506699","volume":"21","author":"S Mahajan","year":"2022","unstructured":"Mahajan S, Rani R (2022) Word level script identification using convolutional neural network enhancement for scenic images. ACM Trans Asian Low-Resource Lang Inform Process 21(4):1\u201329","journal-title":"ACM Trans Asian Low-Resource Lang Inform Process"}],"container-title":["Multimedia Tools and Applications"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-023-17986-z.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11042-023-17986-z\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-023-17986-z.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,7,5]],"date-time":"2024-07-05T16:08:28Z","timestamp":1720195708000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11042-023-17986-z"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,1,8]]},"references-count":49,"journal-issue":{"issue":"23","published-online":{"date-parts":[[2024,7]]}},"alternative-id":["17986"],"URL":"https:\/\/doi.org\/10.1007\/s11042-023-17986-z","relation":{},"ISSN":["1573-7721"],"issn-type":[{"type":"electronic","value":"1573-7721"}],"subject":[],"published":{"date-parts":[[2024,1,8]]},"assertion":[{"value":"19 September 2023","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"15 December 2023","order":2,"name":"revised","label":"Revised","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"25 December 2023","order":3,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"8 January 2024","order":4,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors declare that no conflicts of interest exist regarding the publication of this paper.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflict of interest"}}]}}