{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,4]],"date-time":"2026-07-04T06:19:29Z","timestamp":1783145969693,"version":"3.54.6"},"reference-count":43,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/501100005230","name":"Natural Science Foundation of Chongqing Municipality","doi-asserted-by":"publisher","award":["CSTB2023NSCQ-MSX0879"],"award-info":[{"award-number":["CSTB2023NSCQ-MSX0879"]}],"id":[{"id":"10.13039\/501100005230","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62473299"],"award-info":[{"award-number":["62473299"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100012669","name":"Natural Science Foundation Project of Chongqing","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100012669","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Pattern Recognition"],"published-print":{"date-parts":[[2026,11]]},"DOI":"10.1016\/j.patcog.2026.113930","type":"journal-article","created":{"date-parts":[[2026,5,12]],"date-time":"2026-05-12T15:48:15Z","timestamp":1778600895000},"page":"113930","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"PD","title":["Cross-modal local and global alignment for Chinese Character Recognition"],"prefix":"10.1016","volume":"179","author":[{"given":"Junjie","family":"Yang","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-9328-7068","authenticated-orcid":false,"given":"Anna","family":"Zhu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Hongyi","family":"Cai","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.patcog.2026.113930_b1","series-title":"23rd International Conference on Pattern Recognition","first-page":"3380","article-title":"A novel text structure feature extractor for Chinese scene text detection and recognition","author":"Ren","year":"2016"},{"key":"10.1016\/j.patcog.2026.113930_b2","doi-asserted-by":"crossref","unstructured":"H. Yu, X. Wang, B. Li, X. Xue, Chinese text recognition with a pre-trained clip-like model through image-ids aligning, in: Proceedings of the IEEE\/CVF International Conference on Computer Vision, 2023, pp. 11943\u201311952.","DOI":"10.1109\/ICCV51070.2023.01097"},{"key":"10.1016\/j.patcog.2026.113930_b3","doi-asserted-by":"crossref","unstructured":"J. Chen, B. Li, X. Xue, Zero-shot Chinese character recognition with stroke-level decomposition, in: Proceedings of the Thirtieth International Joint Conference on Artificial Intelligence, 2021, pp. 615\u2013621.","DOI":"10.24963\/ijcai.2021\/85"},{"key":"10.1016\/j.patcog.2026.113930_b4","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2020.107488","article-title":"Zero-shot handwritten Chinese character recognition with hierarchical decomposition embedding","volume":"107","author":"Cao","year":"2020","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.patcog.2026.113930_b5","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2023.109598","article-title":"Self-information of radicals: A new clue for zero-shot Chinese character recognition","volume":"140","author":"Luo","year":"2023","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.patcog.2026.113930_b6","series-title":"16th International Conference on Frontiers in Handwriting Recognition","first-page":"104","article-title":"Denseran for offline handwritten Chinese character recognition","author":"Wang","year":"2018"},{"key":"10.1016\/j.patcog.2026.113930_b7","series-title":"Proceedings of the 38th International Conference on Machine Learning","first-page":"8748","article-title":"Learning transferable visual models from natural language supervision","author":"Radford","year":"2021"},{"key":"10.1016\/j.patcog.2026.113930_b8","doi-asserted-by":"crossref","unstructured":"Y. Chen, J. Yuan, Y. Tian, S. Geng, X. Li, D. Zhou, D.N. Metaxas, H. Yang, Revisiting multimodal representation in contrastive learning: from patch and token embeddings to finite discrete tokens, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, CVPR, 2023, pp. 15095\u201315104.","DOI":"10.1109\/CVPR52729.2023.01449"},{"key":"10.1016\/j.patcog.2026.113930_b9","doi-asserted-by":"crossref","unstructured":"Y. Huang, Q. Wu, C. Song, L. Wang, Learning semantic concepts and order for image and sentence matching, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, CVPR, 2018, pp. 6163\u20136171.","DOI":"10.1109\/CVPR.2018.00645"},{"key":"10.1016\/j.patcog.2026.113930_b10","doi-asserted-by":"crossref","unstructured":"J. Yang, J. Duan, S. Tran, Y. Xu, S. Chanda, L. Chen, B. Zeng, T. Chilimbi, J. Huang, Vision-language pre-training with triple contrastive learning, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, CVPR, 2022, pp. 15671\u201315680.","DOI":"10.1109\/CVPR52688.2022.01522"},{"key":"10.1016\/j.patcog.2026.113930_b11","article-title":"Neural discrete representation learning","volume":"30","author":"Van Den Oord","year":"2017","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.patcog.2026.113930_b12","series-title":"Deep ViT features as dense visual descriptors","author":"Amir","year":"2021"},{"issue":"11","key":"10.1016\/j.patcog.2026.113930_b13","doi-asserted-by":"crossref","first-page":"1422","DOI":"10.1109\/TPAMI.2003.1240117","article-title":"Statistical character structure modeling and its application to handwritten Chinese character recognition","volume":"25","author":"Kim","year":"2003","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"issue":"4","key":"10.1016\/j.patcog.2026.113930_b14","doi-asserted-by":"crossref","first-page":"406","DOI":"10.1109\/TPAMI.1984.4767546","article-title":"Analysis and design of a decision tree based on entropy reduction and its application to large character set recognition","volume":"PAMI-6","author":"Wang","year":"1984","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.patcog.2026.113930_b15","doi-asserted-by":"crossref","unstructured":"K. He, X. Zhang, S. Ren, J. Sun, Deep residual learning for image recognition, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, CVPR, 2016, pp. 770\u2013778.","DOI":"10.1109\/CVPR.2016.90"},{"key":"10.1016\/j.patcog.2026.113930_b16","doi-asserted-by":"crossref","unstructured":"G. Huang, Z. Liu, L. Van Der Maaten, K.Q. Weinberger, Densely connected convolutional networks, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, CVPR, 2017, pp. 4700\u20134708.","DOI":"10.1109\/CVPR.2017.243"},{"key":"10.1016\/j.patcog.2026.113930_b17","series-title":"Proceedings of the 36th International Conference on Machine Learning","first-page":"6105","article-title":"Efficientnet: Rethinking model scaling for convolutional neural networks","author":"Tan","year":"2019"},{"key":"10.1016\/j.patcog.2026.113930_b18","unstructured":"A. Dosovitskiy, L. Beyer, A. Kolesnikov, D. Weissenborn, X. Zhai, T. Unterthiner, M. Dehghani, M. Minderer, G. Heigold, S. Gelly, J. Uszkoreit, N. Houlsby, An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale, in: International Conference on Learning Representations, 2021."},{"key":"10.1016\/j.patcog.2026.113930_b19","article-title":"Attention is all you need","volume":"30","author":"Vaswani","year":"2017","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.patcog.2026.113930_b20","series-title":"International Joint Conference on Neural Networks","first-page":"1","article-title":"Multi-column deep neural networks for offline handwritten Chinese character classification","author":"Ciresan","year":"2015"},{"key":"10.1016\/j.patcog.2026.113930_b21","series-title":"International Conference on Document Analysis and Recognition","first-page":"315","article-title":"Template-instance loss for offline handwritten chinese character recognition","author":"Xiao","year":"2019"},{"key":"10.1016\/j.patcog.2026.113930_b22","series-title":"International Joint Conference on Neural Networks","first-page":"1","article-title":"Zero-shot Chinese character recognition with stroke-and radical-level decompositions","author":"Zeng","year":"2023"},{"key":"10.1016\/j.patcog.2026.113930_b23","first-page":"29150","article-title":"Explore how to inject beneficial noise in MLLMs","volume":"vol. 40","author":"Zhu","year":"2026"},{"key":"10.1016\/j.patcog.2026.113930_b24","doi-asserted-by":"crossref","first-page":"97499","DOI":"10.52202\/079017-3093","article-title":"Harmonizing visual text comprehension and generation","volume":"37","author":"Zhao","year":"2024","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.patcog.2026.113930_b25","doi-asserted-by":"crossref","first-page":"23716","DOI":"10.52202\/068431-1723","article-title":"Flamingo: a visual language model for few-shot learning","volume":"35","author":"Alayrac","year":"2022","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.patcog.2026.113930_b26","first-page":"49250","article-title":"InstructBLIP: Towards general-purpose vision-language models with instruction tuning","volume":"36","author":"Dai","year":"2023"},{"key":"10.1016\/j.patcog.2026.113930_b27","first-page":"17449","article-title":"Enhance vision-language alignment with noise","volume":"vol. 39","author":"Huang","year":"2025"},{"key":"10.1016\/j.patcog.2026.113930_b28","doi-asserted-by":"crossref","unstructured":"X. Zhai, B. Mustafa, A. Kolesnikov, L. Beyer, Sigmoid loss for language image pre-training, in: Proceedings of the IEEE\/CVF International Conference on Computer Vision, 2023, pp. 11975\u201311986.","DOI":"10.1109\/ICCV51070.2023.01100"},{"key":"10.1016\/j.patcog.2026.113930_b29","doi-asserted-by":"crossref","first-page":"6893","DOI":"10.1109\/TIP.2024.3512354","article-title":"CLIP4str: a simple baseline for scene text recognition with pre-trained vision-language model","volume":"33","author":"Zhao","year":"2024","journal-title":"IEEE Trans. Image Process."},{"key":"10.1016\/j.patcog.2026.113930_b30","doi-asserted-by":"crossref","unstructured":"T. Guan, W. Shen, X. Yang, Q. Feng, Z. Jiang, X. Yang, Self-supervised character-to-character distillation for text recognition, in: Proceedings of the IEEE\/CVF International Conference on Computer Vision, 2023, pp. 19473\u201319484.","DOI":"10.1109\/ICCV51070.2023.01784"},{"key":"10.1016\/j.patcog.2026.113930_b31","doi-asserted-by":"crossref","unstructured":"J. Xu, Y. Wang, H. Xie, Y. Zhang, OTE: Exploring Accurate Scene Text Recognition Using One Token, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, CVPR, 2024, pp. 28327\u201328336.","DOI":"10.1109\/CVPR52733.2024.02676"},{"key":"10.1016\/j.patcog.2026.113930_b32","unstructured":"J. Devlin, M.-W. Chang, K. Lee, K. Toutanova, Bert: Pre-training of deep bidirectional transformers for language understanding, in: Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, Volume 1 (Long and Short Papers), 2019, pp. 4171\u20134186."},{"issue":"1","key":"10.1016\/j.patcog.2026.113930_b33","doi-asserted-by":"crossref","first-page":"155","DOI":"10.1016\/j.patcog.2012.06.021","article-title":"Online and offline handwritten Chinese character recognition: benchmarking on new databases","volume":"46","author":"Liu","year":"2013","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.patcog.2026.113930_b34","series-title":"2013 12th International Conference on Document Analysis and Recognition","first-page":"1464","article-title":"ICDAR 2013 Chinese handwriting recognition competition","author":"Yin","year":"2013"},{"key":"10.1016\/j.patcog.2026.113930_b35","doi-asserted-by":"crossref","first-page":"509","DOI":"10.1007\/s11390-019-1923-y","article-title":"A large chinese text dataset in the wild","volume":"34","author":"Yuan","year":"2019","journal-title":"J. Comput. Sci. Tech."},{"key":"10.1016\/j.patcog.2026.113930_b36","doi-asserted-by":"crossref","unstructured":"X. Zu, H. Yu, B. Li, X. Xue, Chinese character recognition with augmented character profile matching, in: Proceedings of the 30th ACM International Conference on Multimedia, 2022, pp. 6094\u20136102.","DOI":"10.1145\/3503161.3547827"},{"key":"10.1016\/j.patcog.2026.113930_b37","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2023.110208","article-title":"SideNet: Learning representations from interactive side information for zero-shot Chinese character recognition","volume":"148","author":"Li","year":"2024","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.patcog.2026.113930_b38","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2024.110963","article-title":"Hiercode: A lightweight hierarchical codebook for zero-shot chinese text recognition","volume":"158","author":"Zhang","year":"2025","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.patcog.2026.113930_b39","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2024.111286","article-title":"Joint radical embedding and detection for zero-shot Chinese character recognition","volume":"161","author":"Luo","year":"2025","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.patcog.2026.113930_b40","doi-asserted-by":"crossref","first-page":"821","DOI":"10.1016\/j.patrec.2019.08.005","article-title":"Radical aggregation network for few-shot offline handwritten Chinese character recognition","volume":"125","author":"Wang","year":"2019","journal-title":"Pattern Recognit. Lett."},{"key":"10.1016\/j.patcog.2026.113930_b41","series-title":"Qwen-VL: A versatile vision-language model for understanding, localization, text reading, and beyond","author":"Bai","year":"2023"},{"key":"10.1016\/j.patcog.2026.113930_b42","doi-asserted-by":"crossref","unstructured":"D. Yu, X. Li, C. Zhang, T. Liu, J. Han, J. Liu, E. Ding, Towards accurate scene text recognition with semantic reasoning networks, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, CVPR, 2020, pp. 12113\u201312122.","DOI":"10.1109\/CVPR42600.2020.01213"},{"key":"10.1016\/j.patcog.2026.113930_b43","doi-asserted-by":"crossref","unstructured":"X. Yue, Z. Kuang, C. Lin, H. Sun, W. Zhang, RobustScanner: Dynamically Enhancing Positional Clues for Robust Text Recognition, in: European Conference on Computer Vision, 2020, pp. 135\u2013151.","DOI":"10.1007\/978-3-030-58529-7_9"}],"container-title":["Pattern Recognition"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0031320326008952?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0031320326008952?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,7,4]],"date-time":"2026-07-04T05:45:43Z","timestamp":1783143943000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0031320326008952"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,11]]},"references-count":43,"alternative-id":["S0031320326008952"],"URL":"https:\/\/doi.org\/10.1016\/j.patcog.2026.113930","relation":{},"ISSN":["0031-3203"],"issn-type":[{"value":"0031-3203","type":"print"}],"subject":[],"published":{"date-parts":[[2026,11]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"Cross-modal local and global alignment for Chinese Character Recognition","name":"articletitle","label":"Article Title"},{"value":"Pattern Recognition","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.patcog.2026.113930","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Elsevier Ltd. All rights are reserved, including those for text and data mining, AI training, and similar technologies.","name":"copyright","label":"Copyright"}],"article-number":"113930"}}