{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,1]],"date-time":"2026-07-01T18:27:04Z","timestamp":1782930424936,"version":"3.54.5"},"publisher-location":"Cham","reference-count":45,"publisher":"Springer Nature Switzerland","isbn-type":[{"value":"9783031705519","type":"print"},{"value":"9783031705526","type":"electronic"}],"license":[{"start":{"date-parts":[[2024,1,1]],"date-time":"2024-01-01T00:00:00Z","timestamp":1704067200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2024,1,1]],"date-time":"2024-01-01T00:00:00Z","timestamp":1704067200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2024]]},"DOI":"10.1007\/978-3-031-70552-6_4","type":"book-chapter","created":{"date-parts":[[2024,9,10]],"date-time":"2024-09-10T04:02:14Z","timestamp":1725940934000},"page":"55-73","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":10,"title":["Practical End-to-End Optical Music Recognition for\u00a0Pianoform Music"],"prefix":"10.1007","author":[{"ORCID":"https:\/\/orcid.org\/0000-0001-6503-3442","authenticated-orcid":false,"given":"Ji\u0159\u00ed","family":"Mayer","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3295-5576","authenticated-orcid":false,"given":"Milan","family":"Straka","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-9207-567X","authenticated-orcid":false,"given":"Jan","family":"Haji\u010d","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-1855-5931","authenticated-orcid":false,"given":"Pavel","family":"Pecina","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2024,9,11]]},"reference":[{"key":"4_CR1","doi-asserted-by":"publisher","unstructured":"Alfaro-Contreras, M., Calvo-Zaragoza, J., I\u00f1esta, J.M.: Approaching end-to-end optical music recognition for homophonic scores. In: 9th Iberian Conference on Pattern Recognition and Image Analysis (IbPRIA), pp. 147\u2013158. Madrid, Spain (2019). https:\/\/doi.org\/10.1007\/978-3-030-31321-0_13","DOI":"10.1007\/978-3-030-31321-0_13"},{"key":"4_CR2","doi-asserted-by":"publisher","unstructured":"Alfaro-Contreras, M., I\u00f1esta, J.M., Calvo-Zaragoza, J.: Optical music recognition for homophonic scores with neural networks and synthetic music generation. Int. J. Multimedia Inf. Retrieval 12(1), 12 (2023). https:\/\/doi.org\/10.1007\/s13735-023-00278-5","DOI":"10.1007\/s13735-023-00278-5"},{"key":"4_CR3","unstructured":"Bahdanau, D., Cho, K., Bengio, Y.: Neural machine translation by jointly learning to align and translate. In: 3rd International Conference on Learning Representations, (ICLR), pp.\u00a07\u20139. San Diego, CA, USA (2015). http:\/\/arxiv.org\/abs\/1409.0473"},{"key":"4_CR4","doi-asserted-by":"publisher","unstructured":"Barrere, K., Soullard, Y., Lemaitre, A., Co\u00fcasnon, B.: A light transformer-based architecture for handwritten text recognition. Doc. Anal. Syst. 13237, 275\u2013290 (2022). https:\/\/doi.org\/10.1007\/978-3-031-06555-2_19","DOI":"10.1007\/978-3-031-06555-2_19"},{"key":"4_CR5","doi-asserted-by":"publisher","unstructured":"Bellini, P., Bruno, I., Nesi, P.: Assessing optical music recognition tools. Comput. Music J. 31(1), 68\u201393 (2007). https:\/\/doi.org\/10.1162\/comj.2007.31.1.68","DOI":"10.1162\/comj.2007.31.1.68"},{"key":"4_CR6","unstructured":"Byrd, D., Guerin, W., Schindele, M., Knopke, I.: OMR evaluation and prospects for improved OMR via multiple recognizers. Technical report, Indiana University, Bloomington, IN, USA (2010). http:\/\/homes.soic.indiana.edu\/donbyrd\/MROMR2010Pap\/OMREvaluation+Prospects4MROMR.doc"},{"key":"4_CR7","doi-asserted-by":"publisher","unstructured":"Byrd, D., Simonsen, J.G.: Towards a standard testbed for optical music recognition: definitions, metrics, and page images. J. New Music Res. 44(3), 169\u2013195 (2015). https:\/\/doi.org\/10.1080\/09298215.2015.1045424","DOI":"10.1080\/09298215.2015.1045424"},{"key":"4_CR8","doi-asserted-by":"publisher","unstructured":"Calvo-Zaragoza, J., Haji\u010d\u00a0jr., J., Pacha, A.: Discussion group summary: optical music recognition. In: Graphics Recognition, Current Trends and Evolutions (GREC 2017), pp. 152\u2013157. Online (2018). https:\/\/doi.org\/10.1007\/978-3-030-02284-6_12","DOI":"10.1007\/978-3-030-02284-6_12"},{"key":"4_CR9","doi-asserted-by":"publisher","unstructured":"Calvo-Zaragoza, J., Haji\u010d\u00a0jr., J., Pacha, A.: Understanding optical music recognition. ACM Comput. Surv. 53(4), 77 (2020). https:\/\/doi.org\/10.1145\/3397499","DOI":"10.1145\/3397499"},{"key":"4_CR10","unstructured":"Calvo-Zaragoza, J., Rizo, D.: Camera-primus: neural end-to-end optical music recognition on realistic monophonic scores. In: 19th International Society for Music Information Retrieval Conference (ISMIR), pp. 248\u2013255. Paris, France (2018). http:\/\/ismir2018.ircam.fr\/doc\/pdfs\/33_Paper.pdf"},{"key":"4_CR11","unstructured":"Calvo-Zaragoza, J., Rizo, D.: Camera-primus: neural end-to-end optical music recognition on realistic monophonic scores. In: 19th International Society for Music Information Retrieval Conference (ISMIR), pp. 248\u2013255. Paris, France (2018). https:\/\/ismir2018.ircam.fr\/doc\/pdfs\/33_Paper.pdf"},{"issue":"4","key":"4_CR12","doi-asserted-by":"publisher","first-page":"606","DOI":"10.3390\/app8040606","volume":"8","author":"J Calvo-Zaragoza","year":"2018","unstructured":"Calvo-Zaragoza, J., Rizo, D.: End-to-End Neural Optical Music Recognition of Monophonic Scores. Appl. Sci. 8(4), 606 (2018). https:\/\/doi.org\/10.3390\/app8040606","journal-title":"Appl. Sci."},{"key":"4_CR13","doi-asserted-by":"publisher","unstructured":"Calvo-Zaragoza, J., Toselli, A.H., Vidal, E.: Handwritten music recognition for mensural notation with convolutional recurrent neural networks. Pattern Recognition Letters 128, 115\u2013121 (2019).https:\/\/doi.org\/10.1016\/j.patrec.2019.08.021","DOI":"10.1016\/j.patrec.2019.08.021"},{"key":"4_CR14","doi-asserted-by":"publisher","unstructured":"Calvo-Zaragoza, J., Toselli, A.H., Vidal, E.: Hybrid hidden markov models and artificial neural networks for handwritten music recognition in mensural notation. Pattern Analysis and Applications 22, 1573\u20131584 (2019).https:\/\/doi.org\/10.1007\/s10044-019-00807-1","DOI":"10.1007\/s10044-019-00807-1"},{"key":"4_CR15","unstructured":"Calvo-Zaragoza, J., Valero-Mas, J.J., Pertusa, A.: End-to-end optical music recognition using neural networks. In: 18th International Society for Music Information Retrieval Conference (ISMIR). Suzhou, China (2017). https:\/\/ismir2017.smcnus.org\/wp-content\/uploads\/2017\/10\/34_Paper.pdf"},{"key":"4_CR16","doi-asserted-by":"publisher","unstructured":"Cho, K., et al.: Learning phrase representations using RNN encoder\u2013decoder for statistical machine translation. In: Conference on Empirical Methods in Natural Language Processing (EMNLP), pp. 1724\u20131734. Doha, Qatar (2014). https:\/\/doi.org\/10.3115\/v1\/D14-1179","DOI":"10.3115\/v1\/D14-1179"},{"key":"4_CR17","unstructured":"Droettboom, M., Fujinaga, I.: Symbol-level groundtruthing environment for OMR. In: 5th International Conference on Music Information Retrieval, pp. 497\u2013500. Barcelona, Spain (2004). http:\/\/ismir2004.ismir.net\/proceedings\/p090-page-497-paper117.pdf"},{"key":"4_CR18","doi-asserted-by":"publisher","unstructured":"Forn\u00e9s, A., Dutta, A., Gordo, A., Llad\u00f3s, J.: CVC-MUSCIMA: a ground truth of handwritten music score images for writer identification and staff removal. Int. J. Doc. Anal. Recogn. (IJDAR) 15, 243\u2013251 (2011). https:\/\/doi.org\/10.1007\/s10032-011-0168-2","DOI":"10.1007\/s10032-011-0168-2"},{"key":"4_CR19","doi-asserted-by":"publisher","unstructured":"Gers, F.A., Schmidhuber, J., Cummins, F.: Continual prediction using LSTM with forget gates. In: Neural Nets WIRN Vietri-99, pp. 133\u2013138. London, England (1999). https:\/\/doi.org\/10.1007\/978-1-4471-0877-1_10","DOI":"10.1007\/978-1-4471-0877-1_10"},{"key":"4_CR20","doi-asserted-by":"publisher","unstructured":"Gotham, M., Jonas, P., Bower, B., Bosworth, W., Rootham, D., VanHandel, L.: Scores of scores: an OpenScore project to encode and share sheet music. In: 5th International Conference on Digital Libraries for Musicology (DLfM), pp. 87\u201395. Paris, France (2018). https:\/\/doi.org\/10.1145\/3273024.3273026","DOI":"10.1145\/3273024.3273026"},{"key":"4_CR21","doi-asserted-by":"publisher","unstructured":"Gotham, M.R.H., Jonas, P.: The OpenScore lieder corpus. In: Music Encoding Conference, pp. 131\u2013136. Alicante, Spain (2022). https:\/\/doi.org\/10.17613\/1my2-dm23","DOI":"10.17613\/1my2-dm23"},{"key":"4_CR22","doi-asserted-by":"publisher","unstructured":"Graves, A., Fern\u00e1ndez, S., Gomez, F., Schmidhuber, J.: Connectionist temporal classification: labelling unsegmented sequence data with recurrent neural networks. In: 23rd International Conference on Machine Learning (ICML), pp. 369\u2013376. New York, NY, USA (2006). https:\/\/doi.org\/10.1145\/1143844.1143891","DOI":"10.1145\/1143844.1143891"},{"issue":"5","key":"4_CR23","doi-asserted-by":"publisher","first-page":"602","DOI":"10.1016\/j.neunet.2005.06.042","volume":"18","author":"A Graves","year":"2005","unstructured":"Graves, A., Schmidhuber, J.: Framewise phoneme classification with bidirectional LSTM and other neural network architectures. Neural Netw. 18(5), 602\u2013610 (2005). https:\/\/doi.org\/10.1016\/j.neunet.2005.06.042","journal-title":"Neural Netw."},{"key":"4_CR24","unstructured":"Haji\u010d\u00a0Jr., J.: A case for intrinsic evaluation of optical music recognition. In: 1st International Workshop on Reading Music Systems (WoRMS), pp. 15\u201316. Paris, France (2018). https:\/\/sites.google.com\/view\/worms2018\/proceedings"},{"key":"4_CR25","unstructured":"Haji\u010d\u00a0Jr., J., Dorfer, M., Widmer, G., Pecina, P.: Towards full-pipeline handwritten OMR with musical symbol detection by u-nets. In: 19th International Society for Music Information Retrieval Conference (ISMIR), pp. 225\u2013232. Paris, France (2018). http:\/\/ismir2018.ircam.fr\/doc\/pdfs\/175_Paper.pdf"},{"key":"4_CR26","unstructured":"Haji\u010d\u00a0Jr., J., Novotn\u00fd, J., Pecina, P., Pokorn\u00fd, J.: Further steps towards a standard testbed for optical music recognition. In: 17th International Society for Music Information Retrieval Conference (ISMIR), pp. 157\u2013163. New York, USA (2016). https:\/\/wp.nyu.edu\/ismir2016\/event\/proceedings\/"},{"key":"4_CR27","doi-asserted-by":"publisher","unstructured":"Haji\u010d\u00a0Jr., J., Pecina, P.: The MUSCIMA++ dataset for handwritten optical music recognition. In: 14th IAPR International Conference on Document Analysis and Recognition (ICDAR). pp. 39\u201346. Kyoto, Japan (2017).https:\/\/doi.org\/10.1109\/ICDAR.2017.16","DOI":"10.1109\/ICDAR.2017.16"},{"key":"4_CR28","doi-asserted-by":"publisher","unstructured":"He, K., Chen, X., Xie, S., Li, Y., Doll\u00e1r, P., Girshick, R.: Masked autoencoders are scalable vision learners. In: Conference on Computer Vision and Pattern Recognition (CVPR), pp. 15979\u201315988. New Orleans, LA, USA (2022). https:\/\/doi.org\/10.1109\/CVPR52688.2022.01553","DOI":"10.1109\/CVPR52688.2022.01553"},{"key":"4_CR29","doi-asserted-by":"publisher","unstructured":"He, K., Zhang, X., Ren, S., Sun, J.: Deep residual learning for image recognition. In: IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pp. 770\u2013778. Las Vegas, NV, USA (2016). https:\/\/doi.org\/10.1109\/CVPR.2016.90","DOI":"10.1109\/CVPR.2016.90"},{"issue":"8","key":"4_CR30","doi-asserted-by":"publisher","first-page":"1735","DOI":"10.1162\/neco.1997.9.8.1735","volume":"9","author":"S Hochreiter","year":"1997","unstructured":"Hochreiter, S., Schmidhuber, J.: Long short-term memory. Neural Comput. 9(8), 1735\u20131780 (1997). https:\/\/doi.org\/10.1162\/neco.1997.9.8.1735","journal-title":"Neural Comput."},{"key":"4_CR31","unstructured":"Ioffe, S., Szegedy, C.: Batch normalization: accelerating deep network training by reducing internal covariate shift. In: Proceedings of the 32nd International Conference on International Conference on Machine Learning, vol. 37, pp. 448\u2013456. Lille, France (2015). https:\/\/arxiv.org\/abs\/1502.03167"},{"key":"4_CR32","unstructured":"Kang, L., Riba, P., Rusi\u00f1ol, M., Forn\u00e9s, A., Villegas, M.: Pay attention to what you read: non-recurrent handwritten text-line recognition (2020). https:\/\/arxiv.org\/abs\/2005.13044"},{"key":"4_CR33","unstructured":"Kingma, D.P., Ba, J.: Adam: a method for stochastic optimization. In: 3rd International Conference on Learning Representations (ICLR), pp.\u00a07\u20139. San Diego, CA, USA (2015). http:\/\/arxiv.org\/abs\/1412.6980"},{"key":"4_CR34","unstructured":"Knopke, I., Byrd, D.: Towards musicdiff: a foundation for improved optical music recognition using multiple recognizers. In: 8th International Society on Music Information Retrieval Conference (ISMIR), pp. 123\u2013126. Vienna, Austria (2007). http:\/\/homes.sice.indiana.edu\/donbyrd\/Papers\/ismir_2007_omr.pdf"},{"key":"4_CR35","unstructured":"Loshchilov, I., Hutter, F.: SGDR: stochastic gradient descent with warm restarts. In: International Conference on Learning Representations (ICLR). Toulon, France (2017). https:\/\/openreview.net\/forum?id=Skq89Scxx"},{"key":"4_CR36","doi-asserted-by":"publisher","unstructured":"Padilla, V., Marsden, A., McLean, A., Ng, K.: Improving OMR for digital music libraries with multiple recognisers and multiple sources. In: 1st International Workshop on Digital Libraries for Musicology (DLfM), pp.\u00a01\u20138. London, United Kingdom (2014). https:\/\/doi.org\/10.1145\/2660168.2660175","DOI":"10.1145\/2660168.2660175"},{"key":"4_CR37","unstructured":"Pugin, L., Zitellini, R., Roland, P.: Verovio: a library for engraving MEI music notation into SVG. In: 15th International Society for Music Information Retrieval Conference (ISMIR), pp. 107\u2013112. Taipei, Taiwan (2014). https:\/\/archives.ismir.net\/ismir2014\/paper\/000221.pdf"},{"key":"4_CR38","unstructured":"R\u00edos-Vila, A., I\u00f1esta, J.M., Calvo-Zaragoza, J.: End-to-end full-page optical music recognition of monophonic documents via score unfolding. In: 4th International Workshop on Reading Music Systems (WoRMS), pp. 20\u201324. Online (2022). https:\/\/sites.google.com\/view\/worms2022\/proceedings"},{"issue":"3","key":"4_CR39","doi-asserted-by":"publisher","first-page":"347","DOI":"10.1007\/s10032-023-00432-z","volume":"26","author":"A R\u00edos-Vila","year":"2023","unstructured":"R\u00edos-Vila, A., Rizo, D., I\u00f1esta, J.M., Calvo-Zaragoza, J.: End-to-end optical music recognition for pianoform sheet music. Int. J. Doc. Analy. Recogn. (IJDAR) 26(3), 347\u2013362 (2023). https:\/\/doi.org\/10.1007\/s10032-023-00432-z","journal-title":"Int. J. Doc. Analy. Recogn. (IJDAR)"},{"key":"4_CR40","doi-asserted-by":"crossref","unstructured":"R\u00edos-Vila, A., Calvo-Zaragoza, J., Paquet, T.: Sheet music transformer: end-to-end optical music recognition beyond monophonic transcription (2024). https:\/\/arxiv.org\/abs\/2402.07596","DOI":"10.1007\/978-3-031-70552-6_2"},{"issue":"11","key":"4_CR41","doi-asserted-by":"publisher","first-page":"2298","DOI":"10.1109\/TPAMI.2016.2646371","volume":"39","author":"B Shi","year":"2017","unstructured":"Shi, B., Bai, X., Yao, C.: An end-to-end trainable neural network for image-based sequence recognition and its application to scene text recognition. IEEE Trans. Pattern Anal. Mach. Intell. 39(11), 2298\u20132304 (2017). https:\/\/doi.org\/10.1109\/TPAMI.2016.2646371","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"4_CR42","unstructured":"Sutskever, I., Vinyals, O., Le, Q.V.: Sequence to sequence learning with neural networks. In: 27th International Conference on Neural Information Processing Systems, vol. 2, pp. 3104\u20133112. Montreal, Canada (2014). https:\/\/proceedings.neurips.cc\/paper_files\/paper\/2014\/file\/a14ac55a4f27472c5d894ec1c3c743d2-Paper.pdf"},{"key":"4_CR43","unstructured":"Vaswani, A., et al.: Attention is all you need. In: Advances in Neural Information Processing Systems. Long Beach, CA, USA (2017). https:\/\/proceedings.neurips.cc\/paper\/2017\/file\/3f5ee243547dee91fbd053c1c4a845aa-Paper.pdf"},{"key":"4_CR44","doi-asserted-by":"publisher","unstructured":"Wick, C., Z\u00f6llner, J., Gr\u00fcning, T.: Transformer for handwritten text recognition using bidirectional post-decoding. In: 16th IAPR International Conference on Document Analysis and Recognition (ICDAR), pp. 112\u2013126. Lausanne, Switzerland (2021). https:\/\/doi.org\/10.1007\/978-3-030-86334-0_8","DOI":"10.1007\/978-3-030-86334-0_8"},{"key":"4_CR45","doi-asserted-by":"publisher","unstructured":"Zhang, K., Shasha, D.: Simple fast algorithms for the editing distance between trees and related problems. SIAM J. Comput. 18(6), 1245\u20131262 (1989). https:\/\/doi.org\/10.1137\/0218082","DOI":"10.1137\/0218082"}],"container-title":["Lecture Notes in Computer Science","Document Analysis and Recognition - ICDAR 2024"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-031-70552-6_4","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,15]],"date-time":"2025-06-15T14:07:06Z","timestamp":1749996426000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-3-031-70552-6_4"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024]]},"ISBN":["9783031705519","9783031705526"],"references-count":45,"URL":"https:\/\/doi.org\/10.1007\/978-3-031-70552-6_4","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024]]},"assertion":[{"value":"11 September 2024","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"ICDAR","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"International Conference on Document Analysis and Recognition","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Athens","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Greece","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2024","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"30 August 2024","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"4 September 2024","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"icdar2024","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/icdar2024.net\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}