{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,8,25]],"date-time":"2026-08-25T14:44:02Z","timestamp":1787669042895,"version":"build-2736575974"},"publisher-location":"Cham","reference-count":37,"publisher":"Springer Nature Switzerland","isbn-type":[{"value":"9783032046161","type":"print"},{"value":"9783032046178","type":"electronic"}],"license":[{"start":{"date-parts":[[2025,9,15]],"date-time":"2025-09-15T00:00:00Z","timestamp":1757894400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2025,9,15]],"date-time":"2025-09-15T00:00:00Z","timestamp":1757894400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2026]]},"DOI":"10.1007\/978-3-032-04617-8_9","type":"book-chapter","created":{"date-parts":[[2025,9,15]],"date-time":"2025-09-15T11:45:04Z","timestamp":1757936704000},"page":"149-166","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":3,"title":["Dual Downsample Vision Transformer for\u00a0Handwritten Text Recognition"],"prefix":"10.1007","author":[{"given":"Yew Lee","family":"Tan","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Ernest Yu-Kai","family":"Chew","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jung-jae","family":"Kim","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Adams Wai-Kin","family":"Kong","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2025,9,15]]},"reference":[{"key":"9_CR1","doi-asserted-by":"crossref","unstructured":"Al\u00a0Azawi, M., Liwicki, M., Breuel, T.M.: Combination of multiple aligned recognition outputs using wfst and lstm. In: Proceedings of International Conference on Document Analysis and Recognition, pp. 31\u201335. IEEE (2015)","DOI":"10.1109\/ICDAR.2015.7333720"},{"key":"9_CR2","unstructured":"Augustin, E., Carr\u00e9, M., Grosicki, E., Brodin, J.M., Geoffrois, E., Pr\u00eateux, F.: Rimes evaluation campaign for handwritten mail processing. In: Proceedings of International Workshop on Frontiers in Handwriting Recognition, pp. 231\u2013235 (2006)"},{"key":"9_CR3","unstructured":"Bluche, T.: Joint line segmentation and transcription for end-to-end handwritten paragraph recognition. In: Advances in Neural Information Processing Systems, vol. 29 (2016)"},{"key":"9_CR4","doi-asserted-by":"crossref","unstructured":"Bluche, T., Louradour, J., Messina, R.: Scan, attend and read: end-to-end handwritten paragraph recognition with mdlstm attention. In: Proceedings ofInternational Conference on Document Analysis and Recognition, vol.\u00a01, pp. 1050\u20131055. IEEE (2017)","DOI":"10.1109\/ICDAR.2017.174"},{"key":"9_CR5","doi-asserted-by":"crossref","unstructured":"Cascianelli, S., et al.: The lam dataset: a novel benchmark for line-level handwritten text recognition. In: Proceedings of International Conference on Pattern Recognition, pp. 1506\u20131513. IEEE (2022)","DOI":"10.1109\/ICPR56361.2022.9956189"},{"issue":"1","key":"9_CR6","doi-asserted-by":"publisher","first-page":"508","DOI":"10.1109\/TPAMI.2022.3144899","volume":"45","author":"D Coquenet","year":"2022","unstructured":"Coquenet, D., Chatelain, C., Paquet, T.: End-to-end handwritten paragraph text recognition using a vertical attention network. IEEE Trans. Pattern Anal. Mach. Intell. 45(1), 508\u2013524 (2022)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"9_CR7","doi-asserted-by":"crossref","unstructured":"Devlin, J., Chang, M.W., Lee, K., Toutanova, K.: Bert: pre-training of deep bidirectional transformers for language understanding. In: Proceedings of the 2019 conference of the North American chapter of the association for computational linguistics: human language technologies, volume 1 (long and short papers), pp. 4171\u20134186 (2019)","DOI":"10.18653\/v1\/N19-1423"},{"key":"9_CR8","unstructured":"Diaz, D.H., Qin, S., Ingle, R., Fujii, Y., Bissacco, A.: Rethinking text line recognition models. arXiv preprint arXiv:2104.07787 (2021)"},{"key":"9_CR9","unstructured":"Dosovitskiy, A., et\u00a0al.: An image is worth 16x16 words: transformers for image recognition at scale. In: Proceedings of International Conference on Learning Representations (2021)"},{"key":"9_CR10","doi-asserted-by":"crossref","unstructured":"Graves, A., Fern\u00e1ndez, S., Gomez, F., Schmidhuber, J.: Connectionist temporal classification: labelling unsegmented sequence data with recurrent neural networks. In: Proceedings of International Conference on Machine Learning, pp. 369\u2013376 (2006)","DOI":"10.1145\/1143844.1143891"},{"issue":"5","key":"9_CR11","doi-asserted-by":"publisher","first-page":"855","DOI":"10.1109\/TPAMI.2008.137","volume":"31","author":"A Graves","year":"2008","unstructured":"Graves, A., Liwicki, M., Fern\u00e1ndez, S., Bertolami, R., Bunke, H., Schmidhuber, J.: A novel connectionist system for unconstrained handwriting recognition. IEEE Trans. Pattern Anal. Mach. Intell. 31(5), 855\u2013868 (2008)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"9_CR12","unstructured":"Gui, L., Liang, X., Chang, X., Hauptmann, A.G.: Adaptive context-aware reinforced agent for handwritten text recognition. In: Proceedings of British Machine Vision Conference, vol.\u00a0207 (2018)"},{"issue":"2","key":"9_CR13","doi-asserted-by":"publisher","first-page":"131","DOI":"10.1007\/s10032-022-00422-7","volume":"26","author":"M Hamdan","year":"2023","unstructured":"Hamdan, M., Chaudhary, H., Bali, A., Cheriet, M.: Refocus attention span networks for handwriting line recognition. Int. J. Doc. Anal. Recogn. 26(2), 131\u2013147 (2023)","journal-title":"Int. J. Doc. Anal. Recogn."},{"key":"9_CR14","doi-asserted-by":"crossref","unstructured":"Huang, G., Sun, Y., Liu, Z., Sedra, D., Weinberger, K.Q.: Deep networks with stochastic depth. In: Proceedings of European Conference on Computer Vision, pp. 646\u2013661. Springer (2016)","DOI":"10.1007\/978-3-319-46493-0_39"},{"key":"9_CR15","doi-asserted-by":"publisher","first-page":"108766","DOI":"10.1016\/j.patcog.2022.108766","volume":"129","author":"L Kang","year":"2022","unstructured":"Kang, L., Riba, P., Rusi\u00f1ol, M., Forn\u00e9s, A., Villegas, M.: Pay attention to what you read: non-recurrent handwritten text-line recognition. Pattern Recogn. 129, 108766 (2022)","journal-title":"Pattern Recogn."},{"key":"9_CR16","doi-asserted-by":"publisher","first-page":"107790","DOI":"10.1016\/j.patcog.2020.107790","volume":"112","author":"L Kang","year":"2021","unstructured":"Kang, L., Riba, P., Villegas, M., Forn\u00e9s, A., Rusi\u00f1ol, M.: Candidate fusion: integrating language modelling into a sequence-to-sequence handwritten word recognition architecture. Pattern Recogn. 112, 107790 (2021)","journal-title":"Pattern Recogn."},{"key":"9_CR17","doi-asserted-by":"crossref","unstructured":"Kang, L., Toledo, J.I., Riba, P., Villegas, M., Forn\u00e9s, A., Rusinol, M.: Convolve, attend and spell: an attention-based sequence-to-sequence model for handwritten word recognition. In: Proceedings of German Conference on Pattern Recognition, pp. 459\u2013472. Springer (2018)","DOI":"10.1007\/978-3-030-12939-2_32"},{"key":"9_CR18","doi-asserted-by":"crossref","unstructured":"Kizilirmak, F., Yanikoglu, B.: Cnn-bilstm model for english handwriting recognition: comprehensive evaluation on the iam dataset. arXiv preprint arXiv:2307.00664 (2023)","DOI":"10.21203\/rs.3.rs-2274499\/v1"},{"key":"9_CR19","doi-asserted-by":"crossref","unstructured":"Li, M., et al.: Trocr: transformer-based optical character recognition with pre-trained models. In: Proceedings of AAAI Conference on Artificial Intelligence, vol.\u00a037, pp. 13094\u201313102 (2023)","DOI":"10.1609\/aaai.v37i11.26538"},{"key":"9_CR20","doi-asserted-by":"publisher","first-page":"110967","DOI":"10.1016\/j.patcog.2024.110967","volume":"158","author":"Y Li","year":"2025","unstructured":"Li, Y., Chen, D., Tang, T., Shen, X.: Htr-vt: handwritten text recognition with vision transformer. Pattern Recogn. 158, 110967 (2025)","journal-title":"Pattern Recogn."},{"key":"9_CR21","unstructured":"Lyu, P., et al.: Maskocr: scene text recognition with masked vision-language pre-training. Trans. Mach. Learn. Res. (2024)"},{"key":"9_CR22","doi-asserted-by":"publisher","first-page":"39","DOI":"10.1007\/s100320200071","volume":"5","author":"UV Marti","year":"2002","unstructured":"Marti, U.V., Bunke, H.: The iam-database: an english sentence database for offline handwriting recognition. Int. J. Doc. Anal. Recogn. 5, 39\u201346 (2002)","journal-title":"Int. J. Doc. Anal. Recogn."},{"key":"9_CR23","doi-asserted-by":"crossref","unstructured":"Michael, J., Labahn, R., Gr\u00fcning, T., Z\u00f6llner, J.: Evaluating sequence-to-sequence models for handwritten text recognition. In: Proceedings of International Conference on Document Analysis and Recognition, pp. 1286\u20131293. IEEE (2019)","DOI":"10.1109\/ICDAR.2019.00208"},{"key":"9_CR24","unstructured":"Poulos, J., Valle, R.: Attention networks for image-to-text. ArXiv abs\/1712.04046 (2017), https:\/\/api.semanticscholar.org\/CorpusID:29748509"},{"issue":"16","key":"9_CR25","doi-asserted-by":"publisher","first-page":"10563","DOI":"10.1007\/s00521-021-05813-1","volume":"33","author":"J Poulos","year":"2021","unstructured":"Poulos, J., Valle, R.: Character-based handwritten text transcription with attention networks. Neural Comput. Appl. 33(16), 10563\u201310573 (2021). https:\/\/doi.org\/10.1007\/s00521-021-05813-1","journal-title":"Neural Comput. Appl."},{"key":"9_CR26","doi-asserted-by":"crossref","unstructured":"Puigcerver, J.: Are multidimensional recurrent layers really necessary for handwritten text recognition? In: Proceedings of International Conference on Document Analysis and Recognition, vol.\u00a01, pp. 67\u201372. IEEE (2017)","DOI":"10.1109\/ICDAR.2017.20"},{"key":"9_CR27","doi-asserted-by":"crossref","unstructured":"Reul, C., Springmann, U., Wick, C., Puppe, F.: Improving ocr accuracy on early printed books by utilizing cross fold training and voting. In: Proceedings of International Workshop on Document Analysis Systems, pp. 423\u2013428. IEEE (2018)","DOI":"10.1109\/DAS.2018.30"},{"key":"9_CR28","doi-asserted-by":"crossref","unstructured":"Sandler, M., Howard, A., Zhu, M., Zhmoginov, A., Chen, L.C.: Mobilenetv2: inverted residuals and linear bottlenecks. In: Proceedings of Conference on Computer Vision and Pattern Recognition, pp. 4510\u20134520 (2018)","DOI":"10.1109\/CVPR.2018.00474"},{"key":"9_CR29","doi-asserted-by":"crossref","unstructured":"Tan, Y.L., Kong, A.W.K., Kim, J.J.: Pure transformer with integrated experts for scene text recognition. In: Proceedings of European Conference on Computer Vision, pp. 481\u2013497. Springer (2022)","DOI":"10.1007\/978-3-031-19815-1_28"},{"key":"9_CR30","doi-asserted-by":"crossref","unstructured":"Touvron, H., Cord, M., Sablayrolles, A., Synnaeve, G., J\u00e9gou, H.: Going deeper with image transformers. In: Proceedings of International Conference on Computer Vision, pp. 32\u201342 (2021)","DOI":"10.1109\/ICCV48922.2021.00010"},{"key":"9_CR31","unstructured":"Vaswani, A., et al.: Attention is all you need. In: Proceedings of Advances in Neural Information Processing Systems, vol.\u00a030 (2017)"},{"key":"9_CR32","doi-asserted-by":"publisher","unstructured":"Wang, T., et al.: Decoupled attention network for text recognition. In: Proceedings of AAAI Conference on Artificial Intelligence, vol.\u00a034, pp. 12216\u201312224, April 2020. https:\/\/doi.org\/10.1609\/aaai.v34i07.6903, https:\/\/ojs.aaai.org\/index.php\/AAAI\/article\/view\/6903","DOI":"10.1609\/aaai.v34i07.6903"},{"key":"9_CR33","doi-asserted-by":"crossref","unstructured":"Wemhoener, D., Yalniz, I.Z., Manmatha, R.: Creating an improved version using noisy ocr from multiple editions. In: Proceedings of International Conference on Document Analysis and Recognition, pp. 160\u2013164. IEEE (2013)","DOI":"10.1109\/ICDAR.2013.39"},{"key":"9_CR34","doi-asserted-by":"crossref","unstructured":"Wick, C., Z\u00f6llner, J., Gr\u00fcning, T.: Transformer for handwritten text recognition using bidirectional post-decoding. In: International Conference on Document Analysis and Recognition, pp. 112\u2013126. Springer (2021)","DOI":"10.1007\/978-3-030-86334-0_8"},{"key":"9_CR35","doi-asserted-by":"crossref","unstructured":"Wick, C., Z\u00f6llner, J., Gr\u00fcning, T.: Rescoring sequence-to-sequence models for text line recognition with ctc-prefixes. In: Proceedings of International Workshop on Document Analysis Systems, pp. 260\u2013274. Springer (2022)","DOI":"10.1007\/978-3-031-06555-2_18"},{"key":"9_CR36","doi-asserted-by":"publisher","first-page":"107482","DOI":"10.1016\/j.patcog.2020.107482","volume":"108","author":"M Yousef","year":"2020","unstructured":"Yousef, M., Hussain, K.F., Mohammed, U.S.: Accurate, data-efficient, unconstrained text recognition with convolutional neural networks. Pattern Recogn. 108, 107482 (2020)","journal-title":"Pattern Recogn."},{"key":"9_CR37","first-page":"17283","volume":"33","author":"M Zaheer","year":"2020","unstructured":"Zaheer, M., Guruganesh, G., Dubey, K.A., Ainslie, J., Alberti, C., Ontanon, S., Pham, P., Ravula, A., Wang, Q., Yang, L., et al.: Big bird: transformers for longer sequences. Adv. Neural. Inf. Process. Syst. 33, 17283\u201317297 (2020)","journal-title":"Adv. Neural. Inf. Process. Syst."}],"container-title":["Lecture Notes in Computer Science","Document Analysis and Recognition \u2013 ICDAR 2025"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-032-04617-8_9","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,8,25]],"date-time":"2026-08-25T13:23:06Z","timestamp":1787664186000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-3-032-04617-8_9"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,9,15]]},"ISBN":["9783032046161","9783032046178"],"references-count":37,"URL":"https:\/\/doi.org\/10.1007\/978-3-032-04617-8_9","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,9,15]]},"assertion":[{"value":"15 September 2025","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"ICDAR","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"International Conference on Document Analysis and Recognition","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Wuhan","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"China","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2025","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"16 September 2025","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"21 September 2025","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"18","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"icdar2025","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/iapr.org\/icdar2025","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}