{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,4]],"date-time":"2026-05-04T04:59:48Z","timestamp":1777870788283,"version":"3.51.4"},"reference-count":54,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/501100002241","name":"Japan Science and Technology Agency","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100002241","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001691","name":"Japan Society for the Promotion of Science","doi-asserted-by":"publisher","award":["JP22K12729"],"award-info":[{"award-number":["JP22K12729"]}],"id":[{"id":"10.13039\/501100001691","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Pattern Recognition"],"published-print":{"date-parts":[[2026,9]]},"DOI":"10.1016\/j.patcog.2026.113273","type":"journal-article","created":{"date-parts":[[2026,2,9]],"date-time":"2026-02-09T08:03:22Z","timestamp":1770624202000},"page":"113273","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"C","title":["Multi-masking strategies for self-supervised Low- and High-level text representation learning"],"prefix":"10.1016","volume":"177","author":[{"ORCID":"https:\/\/orcid.org\/0000-0003-2011-8105","authenticated-orcid":false,"given":"Zhengmi","family":"Tang","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0005-2525-4837","authenticated-orcid":false,"given":"Yuto","family":"Mitsui","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-5205-0542","authenticated-orcid":false,"given":"Tomo","family":"Miyazaki","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-7706-9995","authenticated-orcid":false,"given":"Shinichiro","family":"Omachi","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"78","reference":[{"key":"10.1016\/j.patcog.2026.113273_bib0001","doi-asserted-by":"crossref","first-page":"87","DOI":"10.1109\/TIP.2003.819223","article-title":"Automatic detection and recognition of signs from natural scenes","volume":"13","author":"Chen","year":"2004","journal-title":"IEEE Trans. Image Process."},{"issue":"1","key":"10.1016\/j.patcog.2026.113273_bib0002","doi-asserted-by":"crossref","first-page":"209","DOI":"10.1109\/TITS.2017.2768827","article-title":"Cascaded segmentation-detection networks for text-based traffic sign detection","volume":"19","author":"Zhu","year":"2017","journal-title":"IEEE Trans. Intell. Transp. Syst."},{"key":"10.1016\/j.patcog.2026.113273_bib0003","series-title":"Proc. Adv. Neural Inf. Process. Syst.","article-title":"Synthetic data and artificial neural networks for natural scene text recognition","author":"Jaderberg","year":"2014"},{"key":"10.1016\/j.patcog.2026.113273_bib0004","series-title":"Proc. IEEE Conf. Comput. Vis. Pattern Recognit.","first-page":"2315","article-title":"Synthetic data for text localisation in natural images","author":"Gupta","year":"2016"},{"key":"10.1016\/j.patcog.2026.113273_bib0005","doi-asserted-by":"crossref","first-page":"5837","DOI":"10.1109\/TIP.2023.3326685","article-title":"A scene-Text synthesis engine achieved through learning from decomposed real-World data","volume":"32","author":"Tang","year":"2023","journal-title":"IEEE Trans. Image Process."},{"key":"10.1016\/j.patcog.2026.113273_bib0006","series-title":"Proc. IEEE\/CVF Conf. Comput. Vis. Pattern Recognit.","first-page":"15297","article-title":"Sequence-to-Sequence contrastive learning for text recognition","author":"Aberdam","year":"2021"},{"key":"10.1016\/j.patcog.2026.113273_bib0007","series-title":"Proc. AAAI Conf. Artif. Intell.","article-title":"Perceiving stroke-Semantic context: hierarchical contrastive learning for robust scene text recognition","author":"Liu","year":"2022"},{"key":"10.1016\/j.patcog.2026.113273_bib0008","series-title":"Proc. IEEE\/CVF Int. Conf. Comput. Vis.","first-page":"19473","article-title":"Self-Supervised character-to-Character distillation for text recognition","author":"Guan","year":"2023"},{"key":"10.1016\/j.patcog.2026.113273_bib0009","series-title":"Proc. 30Th ACM Int. Conf. Multimed.","article-title":"Reading and writing: discriminative and generative modeling for self-Supervised text recognition","author":"Yang","year":"2022"},{"key":"10.1016\/j.patcog.2026.113273_bib0010","series-title":"Proc. IEEE\/CVF Conf. Comput. Vis. Pattern Recognit.","first-page":"7918","article-title":"Understanding masked autoencoders via hierarchical latent variable models","author":"Kong","year":"2023"},{"key":"10.1016\/j.patcog.2026.113273_bib0011","series-title":"Proc. IEEE\/CVF Conf. Comput. Vis. Pattern Recognit.","first-page":"15979","article-title":"Masked autoencoders are scalable vision learners","author":"He","year":"2021"},{"key":"10.1016\/j.patcog.2026.113273_bib0012","doi-asserted-by":"crossref","DOI":"10.1016\/j.knosys.2025.113306","article-title":"VQ-STE: Scene text erasing with mask refinement and vector-quantized texture dictionary","volume":"315","author":"Tang","year":"2025","journal-title":"Knowl.-Based Syst."},{"key":"10.1016\/j.patcog.2026.113273_bib0013","series-title":"Proc. IEEE Conf. Comput. Vis. Pattern Recognit.","article-title":"Robust scene text recognition with automatic rectification","author":"Shi","year":"2016"},{"key":"10.1016\/j.patcog.2026.113273_bib0014","doi-asserted-by":"crossref","first-page":"109","DOI":"10.1016\/j.patcog.2019.01.020","article-title":"MORAN: A multi-Object rectified attention network for scene text recognition","volume":"90","author":"Luo","year":"2019","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.patcog.2026.113273_bib0015","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2020.107692","article-title":"STAN: A sequential transformation attention-based network for scene text recognition","volume":"111","author":"Lin","year":"2021","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.patcog.2026.113273_bib0016","series-title":"Proc. Adv. Neural Inf. Process. Syst.","first-page":"2017","article-title":"Spatial transformer networks","author":"Jaderberg","year":"2015"},{"key":"10.1016\/j.patcog.2026.113273_bib0017","series-title":"Proc. Eur. Conf. Comput. Vis.","first-page":"71","article-title":"Mask textspotter: an end-to-End trainable neural network for spotting text with arbitrary shapes","author":"Lyu","year":"2018"},{"key":"10.1016\/j.patcog.2026.113273_bib0018","series-title":"Proc. AAAI Conf. Artif. Intell.","first-page":"8714","article-title":"Scene text recognition from two-dimensional perspective","volume":"33","author":"Liao","year":"2019"},{"key":"10.1016\/j.patcog.2026.113273_bib0019","series-title":"Proc. AAAI Conf. Artif. Intell.","first-page":"12120","article-title":"Textscanner: reading characters in order for robust scene text recognition","volume":"34","author":"Wan","year":"2020"},{"key":"10.1016\/j.patcog.2026.113273_bib0020","first-page":"15285","article-title":"Self-Supervised implicit glyph attention for text recognition","author":"Guan","year":"2023","journal-title":"Proc. IEEE\/CVF Conf. Comput. Vis. Pattern Recognit."},{"key":"10.1016\/j.patcog.2026.113273_bib0021","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2021.107980","article-title":"MASTER: Multi-aspect non-local network for scene text recognition","volume":"117","author":"Lu","year":"2021","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.patcog.2026.113273_bib0022","series-title":"Proc. IEEE\/CVF Conf. Comput. Vis. Pattern Recognit. Work.","first-page":"2326","article-title":"On recognizing texts of arbitrary shapes with 2D self-Attention","author":"Lee","year":"2020"},{"key":"10.1016\/j.patcog.2026.113273_bib0023","series-title":"Proc. Eur. Conf. Comput. Vis.","article-title":"Toward understanding wordart: corner-Guided transformer for scene text recognition","author":"Xie","year":"2022"},{"key":"10.1016\/j.patcog.2026.113273_bib0024","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2024.111013","article-title":"Scene chinese recognition with local and global attention","volume":"158","author":"Chen","year":"2025","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.patcog.2026.113273_bib0025","series-title":"Proc. Eur. Conf. Comput. Vis.","article-title":"SGBANet: Semantic GAN and balanced attention network for arbitrarily oriented scene text recognition","author":"Zhong","year":"2022"},{"key":"10.1016\/j.patcog.2026.113273_bib0026","series-title":"Proc. IEEE\/CVF Conf. Comput. Vis. Pattern Recognit.","first-page":"7094","article-title":"Read like humans: autonomous, bidirectional and iterative language modeling for scene text recognition","author":"Fang","year":"2021"},{"key":"10.1016\/j.patcog.2026.113273_bib0027","series-title":"Proc. Eur. Conf. Comput. Vis.","article-title":"Levenshtein OCR","author":"Da","year":"2022"},{"key":"10.1016\/j.patcog.2026.113273_bib0028","series-title":"Proc. Adv. Neural Inf. Process. Syst.","article-title":"Levenshtein transformer","author":"Gu","year":"2019"},{"key":"10.1016\/j.patcog.2026.113273_bib0029","series-title":"Proc. Eur. Conf. Comput. Vis.","article-title":"Scene text recognition with permuted autoregressive sequence models","author":"Bautista","year":"2022"},{"key":"10.1016\/j.patcog.2026.113273_bib0030","series-title":"Proc. IEEE\/CVF Conf. Comput. Vis. Pattern Recognit.","first-page":"9726","article-title":"Momentum contrast for unsupervised visual representation learning","author":"He","year":"2020"},{"key":"10.1016\/j.patcog.2026.113273_bib0031","series-title":"Proc. 37Th Int. Conf. Mach. Learn.","first-page":"1597","article-title":"A simple framework for contrastive learning of visual representations","author":"Chen","year":"2020"},{"key":"10.1016\/j.patcog.2026.113273_bib0032","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2023.110016","article-title":"Self-distillation and self-supervision for partial label learning","volume":"146","author":"Yu","year":"2024","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.patcog.2026.113273_bib0033","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2024.110998","article-title":"MNN: Mixed nearest-neighbors for self-supervised learning","volume":"158","author":"Long","year":"2025","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.patcog.2026.113273_bib0034","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2024.111081","article-title":"Self-supervised learning from images: no negative pairs, no cluster-balancing","volume":"159","author":"Mei","year":"2025","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.patcog.2026.113273_bib0035","series-title":"Iclr","article-title":"BEiT: BERT pre-Training of image transformers","author":"Bao","year":"2022"},{"key":"10.1016\/j.patcog.2026.113273_bib0036","series-title":"Proc. IEEE\/CVF Conf. Comput. Vis. Pattern Recognit.","first-page":"9643","article-title":"SimMIM: a simple framework for masked image modeling","author":"Xie","year":"2022"},{"key":"10.1016\/j.patcog.2026.113273_bib0037","series-title":"Proc. IEEE\/CVF Conf. Comput. Vis. Pattern Recognit.","first-page":"14648","article-title":"Masked feature prediction for self-Supervised visual pre-Training","author":"Wei","year":"2022"},{"key":"10.1016\/j.patcog.2026.113273_bib0038","unstructured":"P. Lyu, C. Zhang, S. Liu, M. Qiao, Y. Xu, L. Wu, K. Yao, J. Han, E. Ding, J. Wang, MaskOCR: Text Recognition with Masked Encoder-Decoder Pretraining, ArXiv (2022)."},{"key":"10.1016\/j.patcog.2026.113273_bib0039","series-title":"Proc. Int. Conf. Doc. Anal. Recognit.","first-page":"261","article-title":"Decoupling visual-Semantic features learning with dual masked autoencoder for self-Supervised scene text recognition","volume":"14188","author":"Qiao","year":"2023"},{"key":"10.1016\/j.patcog.2026.113273_bib0040","series-title":"Iclr","article-title":"Language modelling with pixels","author":"Rust","year":"2023"},{"key":"10.1016\/j.patcog.2026.113273_bib0041","series-title":"Proc. IEEE\/CVF Conf. Comput. Vis. Pattern Recognit.","first-page":"8798","article-title":"TextOCR: towards large-scale end-to-end reasoning for arbitrary-shaped scene text","author":"Singh","year":"2021"},{"key":"10.1016\/j.patcog.2026.113273_bib0042","doi-asserted-by":"crossref","first-page":"337","DOI":"10.1016\/j.patcog.2019.02.002","article-title":"Curved scene text detection via transverse and longitudinal sequence connection","volume":"90","author":"Liu","year":"2019","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.patcog.2026.113273_bib0043","series-title":"Proc. IEEE\/CVF Int. Conf. Comput. Vis.","first-page":"14174","article-title":"From two to one: a new scene text recognizer with visual language modeling network","author":"Wang","year":"2021"},{"key":"10.1016\/j.patcog.2026.113273_bib0044","series-title":"Proc. IEEE\/CVF Conf. Comput. Vis. Pattern Recognit.","first-page":"12040","article-title":"Rethinking text segmentation: a novel dataset and a text-Specific refinement approach","author":"Xu","year":"2020"},{"key":"10.1016\/j.patcog.2026.113273_bib0045","series-title":"Proc. Eur. Conf. Comput. Vis.","first-page":"650","article-title":"Scene text image super-Resolution in the wild","author":"Wang","year":"2020"},{"key":"10.1016\/j.patcog.2026.113273_bib0046","series-title":"Proc. IEEE\/CVF Int. Conf. Comput. Vis.","first-page":"9630","article-title":"Emerging properties in self-Supervised vision transformers","author":"Caron","year":"2021"},{"key":"10.1016\/j.patcog.2026.113273_bib0047","series-title":"Proc. AAAI Conf. Artif. Intell.","first-page":"3353","article-title":"Context-Based contrastive learning for scene text recognition","volume":"36","author":"Zhang","year":"2022"},{"key":"10.1016\/j.patcog.2026.113273_bib0048","series-title":"Proc. AAAI Conf. Artif. Intell.","article-title":"Visual semantics allow for textual reasoning better in scene text recognition","author":"He","year":"2021"},{"key":"10.1016\/j.patcog.2026.113273_bib0049","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2023.110244","article-title":"Class-Aware mask-guided feature refinement for scene text recognition","volume":"149","author":"Yang","year":"2024","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.patcog.2026.113273_bib0050","series-title":"Proc. Eur. Conf. Comput. Vis.","article-title":"Multi-Granularity prediction for scene text recognition","author":"Wang","year":"2022"},{"issue":"2","key":"10.1016\/j.patcog.2026.113273_bib0051","doi-asserted-by":"crossref","first-page":"295","DOI":"10.1109\/TPAMI.2015.2439281","article-title":"Image super-Resolution using deep convolutional networks","volume":"38","author":"Dong","year":"2016","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.patcog.2026.113273_bib0052","series-title":"Proc. IEEE Conf. Comput. Vis. Pattern Recognit.","first-page":"105","article-title":"Photo-realistic single image super-resolution using a generative adversarial network","author":"Ledig","year":"2017"},{"key":"10.1016\/j.patcog.2026.113273_bib0053","series-title":"Proc. IEEE Comput. Soc. Conf. Comput. Vis. Pattern Recognit.","first-page":"12021","article-title":"Scene text telescope: text-focused scene image super-resolution","author":"Chen","year":"2021"},{"key":"10.1016\/j.patcog.2026.113273_bib0054","series-title":"Proc. 29Th ACM Int. Conf. Multimed.","first-page":"2908","article-title":"Scene text image super-Resolution via parallelly contextual attention network","author":"Zhao","year":"2021"}],"container-title":["Pattern Recognition"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0031320326002384?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0031320326002384?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,4,30]],"date-time":"2026-04-30T16:41:15Z","timestamp":1777567275000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0031320326002384"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,9]]},"references-count":54,"alternative-id":["S0031320326002384"],"URL":"https:\/\/doi.org\/10.1016\/j.patcog.2026.113273","relation":{},"ISSN":["0031-3203"],"issn-type":[{"value":"0031-3203","type":"print"}],"subject":[],"published":{"date-parts":[[2026,9]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"Multi-masking strategies for self-supervised Low- and High-level text representation learning","name":"articletitle","label":"Article Title"},{"value":"Pattern Recognition","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.patcog.2026.113273","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Elsevier Ltd. All rights are reserved, including those for text and data mining, AI training, and similar technologies.","name":"copyright","label":"Copyright"}],"article-number":"113273"}}