{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,20]],"date-time":"2026-06-20T07:50:30Z","timestamp":1781941830559,"version":"3.54.5"},"reference-count":45,"publisher":"Springer Science and Business Media LLC","issue":"2","license":[{"start":{"date-parts":[[2026,3,28]],"date-time":"2026-03-28T00:00:00Z","timestamp":1774656000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0"},{"start":{"date-parts":[[2026,3,28]],"date-time":"2026-03-28T00:00:00Z","timestamp":1774656000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0"}],"funder":[{"DOI":"10.13039\/501100003359","name":"Generalitat Valenciana","doi-asserted-by":"publisher","award":["CIPROM\/2023\/17"],"award-info":[{"award-number":["CIPROM\/2023\/17"]}],"id":[{"id":"10.13039\/501100003359","id-type":"DOI","asserted-by":"publisher"}]},{"name":"FEDER, UE","award":["MICIU\/AEI\/10.13039\/501100011033"],"award-info":[{"award-number":["MICIU\/AEI\/10.13039\/501100011033"]}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["IJDAR"],"published-print":{"date-parts":[[2026,6]]},"abstract":"<jats:title>Abstract<\/jats:title>\n                  <jats:p>Optical Music Recognition aims to transcribe musical manuscript images into digital formats by using automatic methods for enhanced accessibility and preservation. This task is challenging for handwritten historical musical pieces from the Late Middle Ages, Early Renaissance, and previous time periods. This music has the interesting characteristic that both musical and lyrical elements are present with an implicit time alignment between them. This paper introduces techniques for simultaneously transcribing the musical and lyrical elements. We research how to automatically obtain the time alignment for an accurate musicological interpretation. Convolutional and Recurrent Neural Networks and Transformer models are explored for holistically transcribing and aligning historical pieces. This paper explores different techniques to improve the training of the models in limited data scenarios. Experiments are conducted on two different datasets from the same time period. Our findings highlight the potential of Transformer models in overcoming the alignment challenge, providing the best alignment capabilities without compromising the quality of transcriptions and offering a promising direction for future research in the automatic recognition of historical musical documents.<\/jats:p>","DOI":"10.1007\/s10032-026-00574-w","type":"journal-article","created":{"date-parts":[[2026,3,28]],"date-time":"2026-03-28T08:19:25Z","timestamp":1774685965000},"page":"659-674","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["Full-page recognition and alignment of historical musical documents"],"prefix":"10.1007","volume":"29","author":[{"given":"Manuel","family":"Villarreal","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Joan Andreu","family":"S\u00e1nchez","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Daniel","family":"Parres","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2026,3,28]]},"reference":[{"key":"574_CR1","doi-asserted-by":"publisher","DOI":"10.1016\/j.patrec.2019.08.021","author":"J Calvo-Zaragoza","year":"2019","unstructured":"Calvo-Zaragoza, J., Toselli, A.H., Vidal, E.: Handwritten music recognition for mensural notation with convolutional recurrent neural networks. Pattern Recogn. Lett. (2019). https:\/\/doi.org\/10.1016\/j.patrec.2019.08.021","journal-title":"Pattern Recogn. Lett."},{"key":"574_CR2","volume-title":"Solmization Syllables in Musical Theory, 1100 to 1600","author":"RV Henderson","year":"1969","unstructured":"Henderson, R.V.: Solmization Syllables in Musical Theory, 1100 to 1600. Columbia University, New York, NY, USA (1969)"},{"key":"574_CR3","doi-asserted-by":"publisher","first-page":"185","DOI":"10.1007\/978-3-031-41676-7_11","volume-title":"Document Analysis and Recognition - ICDAR 2023","author":"JC Martinez-Sevilla","year":"2023","unstructured":"Martinez-Sevilla, J.C., Rios-Vila, A., Castellanos, F.J., Calvo-Zaragoza, J.: A holistic approach for aligned music and lyrics transcription. In: Fink, G.A., Jain, R., Kise, K., Zanibbi, R. (eds.) Document Analysis and Recognition - ICDAR 2023, pp. 185\u2013201. Springer, Cham (2023)"},{"key":"574_CR4","doi-asserted-by":"crossref","unstructured":"Gupta, C., Y\u0131lmaz, E., Li, H.: Automatic lyrics alignment and transcription in polyphonic music: Does background music help? In: ICASSP 2020-2020 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 496\u2013500 (2020). IEEE","DOI":"10.1109\/ICASSP40776.2020.9054567"},{"key":"574_CR5","doi-asserted-by":"crossref","unstructured":"Stoller, D., Durand, S., Ewert, S.: End-to-end lyrics alignment for polyphonic music using an audio-to-character recognition model. In: ICASSP 2019-2019 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 181\u2013185 (2019). IEEE","DOI":"10.1109\/ICASSP.2019.8683470"},{"key":"574_CR6","doi-asserted-by":"publisher","unstructured":"Villarreal, M., S\u00e1nchez, J.A.: Synchronous recognition of music images using coupled n-gram models. In: ACM Symposium on Document Engineering 2023. DocEng \u201923. Association for Computing Machinery, New York, NY, USA (2023). https:\/\/doi.org\/10.1145\/3573128.3604895","DOI":"10.1145\/3573128.3604895"},{"key":"574_CR7","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1016\/j.patrec.2019.02.029","volume":"123","author":"A Bar\u00f3","year":"2019","unstructured":"Bar\u00f3, A., Riba, P., Calvo-Zaragoza, J., Forn\u00e9s, A.: From optical music recognition to handwritten music recognition: a baseline. Pattern Recogn. Lett. 123, 1\u20138 (2019). https:\/\/doi.org\/10.1016\/j.patrec.2019.02.029","journal-title":"Pattern Recogn. Lett."},{"key":"574_CR8","unstructured":"Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A.N., Kaiser, L., Polosukhin, I.: Attention is all you need. Advances in neural information processing systems 30 (2017)"},{"key":"574_CR9","doi-asserted-by":"publisher","DOI":"10.1007\/s13735-012-0004-6","author":"A Rebelo","year":"2012","unstructured":"Rebelo, A., Fujinaga, I., Paszkiewicz, F., Mar\u00e7al, A., Guedes, C., Cardoso, J.: Optical music recognition: state-of-the-art and open issues. Int. J. Multimedia Inform. Retrieval (2012). https:\/\/doi.org\/10.1007\/s13735-012-0004-6","journal-title":"Int. J. Multimedia Inform. Retrieval"},{"key":"574_CR10","unstructured":"Burgoyne, J.A., Pugin, L.X., Eustace, G., Fujinaga, I.: A comparative survey of image binarisation algorithms for optical recognition on degraded musical sources. In: 8th International Conference on Music Information Retrieval (ISMIR 2007), pp. 509\u2013512 (2007). Austrian Computer Society"},{"key":"574_CR11","doi-asserted-by":"publisher","first-page":"1134","DOI":"10.1109\/TPAMI.2009.34","volume":"31","author":"J Cardoso","year":"2009","unstructured":"Cardoso, J., Capela, A., Rebelo, A., Guedes, C., Costa, J.: Staff detection with stable paths. IEEE Trans. Pattern Anal. Mach. Intell. 31, 1134\u20139 (2009). https:\/\/doi.org\/10.1109\/TPAMI.2009.34","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"574_CR12","doi-asserted-by":"crossref","unstructured":"Forn\u00e9s, A., Llad\u00f3s, J., S\u00e1nchez, G.: Old handwritten musical symbol classification by a dynamic time warping based method. In: Liu, W., Llad\u00f3s, J., Ogier, J.-M. (eds.) Graphics Recognition. Recent Advances and New Opportunities, pp. 51\u201360. Springer, Berlin, Heidelberg (2008)","DOI":"10.1007\/978-3-540-88188-9_6"},{"key":"574_CR13","doi-asserted-by":"publisher","DOI":"10.1155\/2007\/81541","author":"F Rossant","year":"2007","unstructured":"Rossant, F., Isabelle, B.: Robust and adaptive omr system including fuzzy modeling, fusion of musical rules, and possible error detection. EURASIP J. Adv. Signal Process. (2007). https:\/\/doi.org\/10.1155\/2007\/81541","journal-title":"EURASIP J. Adv. Signal Process."},{"key":"574_CR14","doi-asserted-by":"publisher","DOI":"10.1007\/s10044-014-0415-5","author":"J Calvo-Zaragoza","year":"2014","unstructured":"Calvo-Zaragoza, J., Barbancho, I., Tardon, L., Barbancho, A.: Avoiding staff removal stage in optical music recognition: application to scores written in white mensural notation. Formal Pattern Anal. Appl. (2014). https:\/\/doi.org\/10.1007\/s10044-014-0415-5","journal-title":"Formal Pattern Anal. Appl."},{"key":"574_CR15","doi-asserted-by":"publisher","unstructured":"Calvo-Zaragoza, J., Toselli, A.H., Vidal, E.: Early handwritten music recognition with hidden markov models. In: 2016 15th International Conference on Frontiers in Handwriting Recognition (ICFHR), pp. 319\u2013324 (2016). https:\/\/doi.org\/10.1109\/ICFHR.2016.0067","DOI":"10.1109\/ICFHR.2016.0067"},{"key":"574_CR16","doi-asserted-by":"publisher","unstructured":"Villarreal, M., S\u00e1nchez, J.A.: Handwritten music recognition improvement through language model re-interpretation for mensural notation. In: 2020 17th International Conference on Frontiers in Handwriting Recognition (ICFHR), pp. 199\u2013204 (2020). https:\/\/doi.org\/10.1109\/ICFHR2020.2020.00045","DOI":"10.1109\/ICFHR2020.2020.00045"},{"key":"574_CR17","doi-asserted-by":"publisher","unstructured":"Torras, P., Bar\u00f3, A., Kang, L., Forn\u00e9s., A.: On the Integration of Language Models into Sequence to Sequence Architectures for Handwritten Music Recognition. In: Proceedings of the 22nd International Society for Music Information Retrieval Conference, pp. 690\u2013696 (2021). https:\/\/doi.org\/10.5281\/zenodo.5624451","DOI":"10.5281\/zenodo.5624451"},{"key":"574_CR18","doi-asserted-by":"publisher","DOI":"10.1016\/j.patrec.2022.04.032","author":"M Alfaro-Contreras","year":"2022","unstructured":"Alfaro-Contreras, M., R\u00edos Vila, A., Valero-Mas, J., I\u00f1esta, J., Calvo-Zaragoza, J.: Decoupling music notation to improve end-to-end optical music recognition. Pattern Recogn. Lett. (2022). https:\/\/doi.org\/10.1016\/j.patrec.2022.04.032","journal-title":"Pattern Recogn. Lett."},{"key":"574_CR19","doi-asserted-by":"publisher","unstructured":"Mayer, J., Straka, M., Haji\u010d, J., Pecina, P.: Practical End-to-End Optical Music Recognition for Pianoform Music, pp. 55\u201373. Springer, Athens, Greece (2024). https:\/\/doi.org\/10.1007\/978-3-031-70552-6_4","DOI":"10.1007\/978-3-031-70552-6_4"},{"key":"574_CR20","unstructured":"Burgoyne, J., Devaney, J., Ouyang, Y., Pugin, L., Himmelman, T., Fujinaga, I.: Lyric extraction and recognition on digital images of early music sources. ismir. Proceedings of the 10th International Society for Music Information Retrieval Conference, ISMIR 2009 (2009)"},{"key":"574_CR21","doi-asserted-by":"publisher","first-page":"470","DOI":"10.1007\/978-3-031-04881-4_37","volume-title":"Pattern Recognition and Image Analysis","author":"A R\u00edos-Vila","year":"2022","unstructured":"R\u00edos-Vila, A., I\u00f1esta, J.M., Calvo-Zaragoza, J.: On the use of transformers for end-to-end optical music recognition. In: Pinho, A.J., Georgieva, P., Teixeira, L.F., S\u00e1nchez, J.A. (eds.) Pattern Recognition and Image Analysis, pp. 470\u2013481. Springer, Cham (2022)"},{"key":"574_CR22","unstructured":"Lacoste, D., Kol\u00e1\u010dek, J.: Cantus index: Catalogue of chant texts and melodies. Acceso el 14 (2020)"},{"key":"574_CR23","unstructured":"Wick, C., Puppe, F.: Ommr4all\u2013a semiautomatic online editor for medieval music notations. In: 2nd International Workshop on Reading Music Systems, pp. 31\u201334 (2019). https:\/\/ommr4all.informatik.uni-wuerzburg.de\/en\/"},{"key":"574_CR24","doi-asserted-by":"publisher","unstructured":"R\u00edos Vila, A., I\u00f1esta, J., Calvo-Zaragoza, J.: End-to-end full-page optical music recognition for mensural notation. (2022). https:\/\/doi.org\/10.5281\/zenodo.7342678","DOI":"10.5281\/zenodo.7342678"},{"key":"574_CR25","doi-asserted-by":"publisher","unstructured":"Li, Y., Liu, H., Jin, Q., Cai, M., Li, P.: Tromr:transformer-based polyphonic optical music recognition. In: ICASSP 2023 - 2023 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 1\u20135 (2023). https:\/\/doi.org\/10.1109\/ICASSP49357.2023.10096055","DOI":"10.1109\/ICASSP49357.2023.10096055"},{"key":"574_CR26","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1007\/s10032-023-00432-z","volume":"26","author":"A R\u00edos Vila","year":"2023","unstructured":"R\u00edos Vila, A., Rizo, D., I\u00f1esta, J., Calvo-Zaragoza, J.: End-to-end optical music recognition for pianoform sheet music. Int. J. Document Anal. Recognition (IJDAR) 26, 1\u201316 (2023). https:\/\/doi.org\/10.1007\/s10032-023-00432-z","journal-title":"Int. J. Document Anal. Recognition (IJDAR)"},{"key":"574_CR27","doi-asserted-by":"publisher","unstructured":"Li, M., Lv, T., Chen, J., Cui, L., Lu, Y., Florencio, D., Zhang, C., Li, Z., Wei, F.: Trocr: Transformer-based optical character recognition with pre-trained models. In: 37th AAAI Conference on Artificial Intelligence, pp. 13094\u201313102 (2023). https:\/\/doi.org\/10.1609\/aaai.v37i11.26538","DOI":"10.1609\/aaai.v37i11.26538"},{"key":"574_CR28","unstructured":"Dosovitskiy, A., Beyer, L., Kolesnikov, A., Weissenborn, D., Zhai, X., Unterthiner, T., Dehghani, M., Minderer, M., Heigold, G., Gelly, S., Uszkoreit, J., Houlsby, N.: An image is worth 16x16 words: Transformers for image recognition at scale. CoRR arXiv:2010.11929 (2020)"},{"key":"574_CR29","doi-asserted-by":"crossref","unstructured":"Kim, G., Hong, T., Yim, M., Nam, J., Park, J., Yim, J., Hwang, W., Yun, S., Han, D., Park, S.: Ocr-free document understanding transformer. In: European Conference on Computer Vision, pp. 498\u2013517 (2022). Springer","DOI":"10.1007\/978-3-031-19815-1_29"},{"key":"574_CR30","doi-asserted-by":"publisher","unstructured":"Liu, Z., Lin, Y., Cao, Y., Hu, H., Wei, Y., Zhang, Z., Lin, S., Guo, B.: Swin Transformer: Hierarchical vision transformer using shifted windows. In: IEEE\/CVF International Conference on Computer Vision, pp. 10012\u201310022 (2021). https:\/\/doi.org\/10.1109\/ICCV48922.2021.00986","DOI":"10.1109\/ICCV48922.2021.00986"},{"key":"574_CR31","doi-asserted-by":"publisher","unstructured":"Villarreal, M., S\u00e1nchez, J.A.: Enhancing recognition of historical musical pieces with synthetic and composed images. In: ICDAR 2024, pp. 74\u201390. Springer, Berlin, Heidelberg (2024). https:\/\/doi.org\/10.1007\/978-3-031-70543-4_5","DOI":"10.1007\/978-3-031-70543-4_5"},{"key":"574_CR32","unstructured":"Gal, Y., Ghahramani, Z.: A theoretically grounded application of dropout in recurrent neural networks, pp. 1027\u20131035 (2016)"},{"key":"574_CR33","unstructured":"He, K., Zhang, X., Ren, S., Sun, J.: Deep Residual Learning for Image Recognition (2015). https:\/\/arxiv.org\/abs\/1512.03385"},{"key":"574_CR34","doi-asserted-by":"publisher","unstructured":"Hecht-Nielsen: Theory of the backpropagation neural network. In: International 1989 Joint Conference on Neural Networks, pp. 593\u20136051 (1989).https:\/\/doi.org\/10.1109\/IJCNN.1989.118638","DOI":"10.1109\/IJCNN.1989.118638"},{"key":"574_CR35","unstructured":"Williams, R.J., Zipser, D.: Gradient-Based Learning Algorithms for Recurrent Networks and Their Computational Complexity, pp. 433\u2013486 (1995)"},{"key":"574_CR36","doi-asserted-by":"publisher","unstructured":"Graves, A., Fern\u00e1ndez, S., Gomez, F., Schmidhuber, J.: Connectionist temporal classification: Labelling unsegmented sequence data with recurrent neural \u2019networks 2006, 369\u2013376 (2006). https:\/\/doi.org\/10.1145\/1143844.1143891","DOI":"10.1145\/1143844.1143891"},{"key":"574_CR37","doi-asserted-by":"publisher","first-page":"3","DOI":"10.1007\/978-3-031-70549-6_1","volume-title":"Document Analysis and Recognition - ICDAR 2024","author":"D Anitei","year":"2024","unstructured":"Anitei, D., Parres, D., S\u00e1nchez, J.A., Bened\u00ed, J.M.: Improving efficiency and performance through ctc-based transformers for mathematical expression recognition. In: Barney Smith, E.H., Liwicki, M., Peng, L. (eds.) Document Analysis and Recognition - ICDAR 2024, pp. 3\u201320. Springer, Cham (2024)"},{"key":"574_CR38","doi-asserted-by":"crossref","unstructured":"Lewis, M., Liu, Y., Goyal, N., Ghazvininejad, M., Mohamed, A., Levy, O., Stoyanov, V., Zettlemoyer, L.: Bart: Denoising sequence-to-sequence pre-training for natural language generation, translation, and comprehension. CoRR arXiv:1910.13461 (2019)","DOI":"10.18653\/v1\/2020.acl-main.703"},{"key":"574_CR39","unstructured":"Loshchilov, I., Hutter, F.: Decoupled weight decay regularization. In: 7th International Conference on Learning Representations, New Orleans (2019). https:\/\/dblp.org\/rec\/conf\/iclr\/LoshchilovH19.html"},{"key":"574_CR40","unstructured":"Wu, Y., Kirillov, A., Massa, F., Lo, W.-Y., Girshick, R.: Detectron2. https:\/\/github.com\/facebookresearch\/detectron2 (2019)"},{"key":"574_CR41","doi-asserted-by":"publisher","unstructured":"Bengio, Y., Louradour, J., Collobert, R., Weston, J.: Curriculum learning. In: Proceedings of the 26th Annual International Conference on Machine Learning. ICML \u201909, pp. 41\u201348. Association for Computing Machinery, New York, NY, USA (2009). https:\/\/doi.org\/10.1145\/1553374.1553380","DOI":"10.1145\/1553374.1553380"},{"key":"574_CR42","unstructured":"Fujinaga, I.: Salzinnes, CDN-Hsmu M2149.L4, Halifax (Canada), St. Mary\u2019s University - Patrick Power Library, M2149.L4 1554. https:\/\/github.com\/DDMAL\/e2e-omr-resources\/tree\/main\/resulting_mei_files\/Salzinnes"},{"key":"574_CR43","unstructured":"Fujinaga, I.: Einsiedeln, CH-E 611, Einsiedeln, Kloster Einsiedeln - Musikbibliothek, 611. https:\/\/github.com\/DDMAL\/e2e-omr-resources\/tree\/main\/resulting_mei_files\/Einsiedeln"},{"key":"574_CR44","unstructured":"Collins, M.: Statistical machine translation: Ibm models 1 and 2. Columbia Columbia Univ (2011)"},{"key":"574_CR45","unstructured":"Dyer, C., Chahuneau, V., Smith, N.A.: A simple, fast, and effective reparameterization of IBM model 2. In: Vanderwende, L., Daum\u00e9\u00a0III, H., Kirchhoff, K. (eds.) Proceedings of the 2013 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, pp. 644\u2013648. Association for Computational Linguistics, Atlanta, Georgia (2013). https:\/\/aclanthology.org\/N13-1073\/"}],"container-title":["International Journal on Document Analysis and Recognition (IJDAR)"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10032-026-00574-w.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s10032-026-00574-w","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10032-026-00574-w.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,6,20]],"date-time":"2026-06-20T07:08:19Z","timestamp":1781939299000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s10032-026-00574-w"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,3,28]]},"references-count":45,"journal-issue":{"issue":"2","published-print":{"date-parts":[[2026,6]]}},"alternative-id":["574"],"URL":"https:\/\/doi.org\/10.1007\/s10032-026-00574-w","relation":{},"ISSN":["1433-2833","1433-2825"],"issn-type":[{"value":"1433-2833","type":"print"},{"value":"1433-2825","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026,3,28]]},"assertion":[{"value":"8 May 2025","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"12 February 2026","order":2,"name":"revised","label":"Revised","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"1 March 2026","order":3,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"28 March 2026","order":4,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors declare no competing interests.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Competing interests"}}]}}