{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,1]],"date-time":"2026-04-01T18:15:18Z","timestamp":1775067318561,"version":"3.50.1"},"reference-count":59,"publisher":"Springer Science and Business Media LLC","issue":"1","license":[{"start":{"date-parts":[[2025,1,21]],"date-time":"2025-01-21T00:00:00Z","timestamp":1737417600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by-nc-nd\/4.0"},{"start":{"date-parts":[[2025,1,21]],"date-time":"2025-01-21T00:00:00Z","timestamp":1737417600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by-nc-nd\/4.0"}],"funder":[{"name":"Macau Polytechnic University","award":["RP\/FCA-03\/2022"],"award-info":[{"award-number":["RP\/FCA-03\/2022"]}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["J AUDIO SPEECH MUSIC PROC."],"DOI":"10.1186\/s13636-024-00388-w","type":"journal-article","created":{"date-parts":[[2025,1,21]],"date-time":"2025-01-21T08:39:16Z","timestamp":1737448756000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":2,"title":["A review on speech recognition approaches and challenges for Portuguese: exploring the feasibility of fine-tuning large-scale end-to-end models"],"prefix":"10.1186","volume":"2025","author":[{"given":"Yan","family":"Li","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-1085-5091","authenticated-orcid":false,"given":"Yapeng","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Lap Man","family":"Hoi","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Dingcheng","family":"Yang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Sio-Kei","family":"Im","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2025,1,21]]},"reference":[{"key":"388_CR1","doi-asserted-by":"publisher","unstructured":"R.O. Ogundokun, O.C. Abikoye, A.A. Adegun, J.B. Awotunde, Speech recognition system: overview of the state-of-the-arts. Int. J. Eng. Res. Technol. 13(3), 384 (2020). https:\/\/doi.org\/10.37624\/IJERT\/13.3.2020.384-392","DOI":"10.37624\/IJERT\/13.3.2020.384-392"},{"key":"388_CR2","doi-asserted-by":"publisher","unstructured":"X.\u00a0Qi, W.\u00a0Wang, M.\u00a0Yuan, Y.\u00a0Wang, M.\u00a0Li, L.\u00a0Xue, Y.\u00a0Sun, Building Semantic Grid Maps for Domestic Robot Navigation. Int. J. Adv. Robot. Syst. 17(1), 172988141990,006 (2020). https:\/\/doi.org\/10.1177\/1729881419900066","DOI":"10.1177\/1729881419900066"},{"key":"388_CR3","doi-asserted-by":"publisher","unstructured":"A.\u00a0Munir, S.\u00a0Kashif\u00a0Ehsan, S.M. Mohsin\u00a0Raza, M.\u00a0Mudassir, in 2019 International Conference on Engineering and Emerging Technologies (ICEET), Face and Speech Recognition Based Smart Home (IEEE, Lahore, 2019), pp. 1\u20135. https:\/\/doi.org\/10.1109\/CEET1.2019.8711849","DOI":"10.1109\/CEET1.2019.8711849"},{"issue":"6","key":"388_CR4","doi-asserted-by":"publisher","first-page":"2403","DOI":"10.3390\/su12062403","volume":"12","author":"A Ismail","year":"2020","unstructured":"A. Ismail, S. Abdlerazek, I.M. El-Henawy, Development of Smart Healthcare System Based on Speech Recognition Using Support Vector Machine and Dynamic Time Warping. Sustainability 12(6), 2403 (2020). https:\/\/doi.org\/10.3390\/su12062403","journal-title":"Sustainability"},{"key":"388_CR5","doi-asserted-by":"publisher","unstructured":"S.G. Bhable, R.R. Deshmukh, C.N. Kayte, in Proceedings of the International Conference on Applications of Machine Intelligence and Data Analytics (ICAMIDA 2022), vol. 105, ed. by S.\u00a0Tamane, S.\u00a0Ghosh, S.\u00a0Deshmukh, Comparative Analysis of Automatic Speech Recognition Techniques (Atlantis Press International BV, Dordrecht, 2023), pp. 897\u2013904. https:\/\/doi.org\/10.2991\/978-94-6463-136-4_79","DOI":"10.2991\/978-94-6463-136-4_79"},{"issue":"6","key":"388_CR6","doi-asserted-by":"publisher","first-page":"9411","DOI":"10.1007\/s11042-020-10073-7","volume":"80","author":"M Malik","year":"2021","unstructured":"M. Malik, M.K. Malik, K. Mehmood, I. Makhdoom, Automatic speech recognition: A survey. Multimedia Tools Appl. 80(6), 9411\u20139457 (2021). https:\/\/doi.org\/10.1007\/s11042-020-10073-7","journal-title":"Multimedia Tools Appl."},{"issue":"7","key":"388_CR7","doi-asserted-by":"publisher","first-page":"1527","DOI":"10.1162\/neco.2006.18.7.1527","volume":"18","author":"GE Hinton","year":"2006","unstructured":"G.E. Hinton, S. Osindero, Y.W. Teh, A Fast Learning Algorithm for Deep Belief Nets. Neural Comput. 18(7), 1527\u20131554 (2006). https:\/\/doi.org\/10.1162\/neco.2006.18.7.1527","journal-title":"Neural Comput."},{"key":"388_CR8","unstructured":"R.G. Gordon, B.F. Grimes (eds.), Ethnologue: Languages of Africa and Europe, 15th edn. No. Ed. 15.2005 in Ethnologue (SIL International, Dallas, 2005)"},{"key":"388_CR9","doi-asserted-by":"publisher","unstructured":"T.\u00a0Aguiar De\u00a0Lima, M.\u00a0Da\u00a0Costa-Abreu, A survey on automatic speech recognition systems for Portuguese language and its variations. Comput. Speech Lang. 62, 101055 (2020). https:\/\/doi.org\/10.1016\/j.csl.2019.101055","DOI":"10.1016\/j.csl.2019.101055"},{"issue":"1","key":"388_CR10","doi-asserted-by":"publisher","first-page":"14","DOI":"10.1109\/TSA.2004.834466","volume":"13","author":"P Pujol","year":"2005","unstructured":"P. Pujol, S. Pol, C. Nadeu, A. Hagen, H. Bourlard, Comparison and combination of features in a hybrid HMM\/MLP and a HMM\/GMM speech recognition system. IEEE Trans. Speech Audio Process. 13(1), 14\u201322 (2005). https:\/\/doi.org\/10.1109\/TSA.2004.834466","journal-title":"IEEE Trans. Speech Audio Process."},{"key":"388_CR11","unstructured":"A.r. Mohamed, G.\u00a0Dahl, G.\u00a0Hinton, Deep Belief Networks for phone recognition. Nips workshop on deep learning for speech recognition and related applications 1(9), 1\u20139 (2009)"},{"key":"388_CR12","doi-asserted-by":"publisher","first-page":"19143","DOI":"10.1109\/ACCESS.2019.2896880","volume":"7","author":"AB Nassif","year":"2019","unstructured":"A.B. Nassif, I. Shahin, I. Attili, M. Azzeh, K. Shaalan, Speech Recognition Using Deep Neural Networks: A Systematic Review. IEEE Access. 7, 19143\u201319165 (2019). https:\/\/doi.org\/10.1109\/ACCESS.2019.2896880","journal-title":"IEEE Access."},{"key":"388_CR13","doi-asserted-by":"publisher","first-page":"12","DOI":"10.1016\/j.specom.2022.12.002","volume":"147","author":"Q Li","year":"2023","unstructured":"Q. Li, C. Zhang, P.C. Woodland, Combining hybrid DNN-HMM ASR systems with attention-based models using lattice rescoring. Speech Commun. 147, 12\u201321 (2023). https:\/\/doi.org\/10.1016\/j.specom.2022.12.002","journal-title":"Speech Commun."},{"issue":"4","key":"388_CR14","doi-asserted-by":"publisher","first-page":"154705","DOI":"10.1007\/s11704-020-9419-z","volume":"15","author":"A Dutta","year":"2021","unstructured":"A. Dutta, G. Ashishkumar, C.V.R. Rao, Performance analysis of ASR system in hybrid DNN-HMM framework using a PWL euclidean activation function. Front. Comput. Sci. 15(4), 154705 (2021). https:\/\/doi.org\/10.1007\/s11704-020-9419-z","journal-title":"Front. Comput. Sci."},{"key":"388_CR15","doi-asserted-by":"publisher","unstructured":"J.\u00a0Novoa, J.\u00a0Wuth, J.P. Escudero, J.\u00a0Fredes, R.\u00a0Mahu, N.B. Yoma, in Proceedings of the 2018 ACM\/IEEE International Conference on Human-Robot Interaction, DNN-HMM based Automatic Speech Recognition for HRI Scenarios (ACM, Chicago, 2018), pp. 150\u2013159. https:\/\/doi.org\/10.1145\/3171221.3171280","DOI":"10.1145\/3171221.3171280"},{"key":"388_CR16","unstructured":"Carnegie Mellon University. The CMU pronunciation dictionary (2000). http:\/\/www.speech.cs.cmu.edu. Accessed 24 Dec 2024"},{"key":"388_CR17","unstructured":"J.\u00a0Du, X.\u00a0Na, X.\u00a0Liu, H.\u00a0Bu, AISHELL-2: Transforming Mandarin ASR Research Into Industrial Scale (2018). arXiv:1808.10583"},{"key":"388_CR18","doi-asserted-by":"crossref","unstructured":"K.\u00a0Park, S.\u00a0Lee, g2pM: A Neural Grapheme-to-Phoneme Conversion Package for Mandarin Chinese Based on a New Open Benchmark Dataset (2020). arXiv:2004.03136","DOI":"10.21437\/Interspeech.2020-1094"},{"key":"388_CR19","doi-asserted-by":"publisher","unstructured":"C.\u00a0Zhao, J.\u00a0Wang, X.\u00a0Qu, H.\u00a0Wang, J.\u00a0Xiao, in ICASSP 2022 - 2022 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), R-G2P: Evaluating and Enhancing Robustness of Grapheme to Phoneme Conversion by Controlled Noise Introducing and Contextual Information Incorporation (IEEE, Singapore, 2022), pp. 6197\u20136201. https:\/\/doi.org\/10.1109\/ICASSP43922.2022.9746051","DOI":"10.1109\/ICASSP43922.2022.9746051"},{"key":"388_CR20","doi-asserted-by":"publisher","unstructured":"W.\u00a0Chan, N.\u00a0Jaitly, Q.\u00a0Le, O.\u00a0Vinyals, in 2016 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), Listen, attend and spell: A neural network for large vocabulary conversational speech recognition (IEEE, Shanghai, 2016), pp. 4960\u20134964. https:\/\/doi.org\/10.1109\/ICASSP.2016.7472621","DOI":"10.1109\/ICASSP.2016.7472621"},{"key":"388_CR21","doi-asserted-by":"publisher","unstructured":"C.C. Chiu, T.N. Sainath, Y.\u00a0Wu, R.\u00a0Prabhavalkar, P.\u00a0Nguyen, Z.\u00a0Chen, A.\u00a0Kannan, R.J. Weiss, K.\u00a0Rao, E.\u00a0Gonina, N.\u00a0Jaitly, B.\u00a0Li, J.\u00a0Chorowski, M.\u00a0Bacchiani, in 2018 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), State-of-the-Art Speech Recognition with Sequence-to-Sequence Models (IEEE, Calgary, 2018), pp. 4774\u20134778. https:\/\/doi.org\/10.1109\/ICASSP.2018.8462105","DOI":"10.1109\/ICASSP.2018.8462105"},{"key":"388_CR22","doi-asserted-by":"crossref","unstructured":"Z.\u00a0Yao, D.\u00a0Wu, X.\u00a0Wang, B.\u00a0Zhang, F.\u00a0Yu, C.\u00a0Yang, Z.\u00a0Peng, X.\u00a0Chen, L.\u00a0Xie, X.\u00a0Lei, WeNet: Production oriented Streaming and Non-streaming End-to-End Speech Recognition Toolkit (2021). arXiv:2102.01547","DOI":"10.21437\/Interspeech.2021-1983"},{"key":"388_CR23","doi-asserted-by":"crossref","unstructured":"B.\u00a0Zhang, D.\u00a0Wu, Z.\u00a0Peng, X.\u00a0Song, Z.\u00a0Yao, H.\u00a0Lv, L.\u00a0Xie, C.\u00a0Yang, F.\u00a0Pan, J.\u00a0Niu, WeNet 2.0: More Productive End-to-End Speech Recognition Toolkit (2022). arXiv:2203.15455","DOI":"10.21437\/Interspeech.2022-483"},{"key":"388_CR24","doi-asserted-by":"crossref","unstructured":"S.\u00a0Schneider, A.\u00a0Baevski, R.\u00a0Collobert, M.\u00a0Auli, Wav2vec: Unsupervised Pre-training for Speech Recognition (2019). arXiv:1904.05862","DOI":"10.21437\/Interspeech.2019-1873"},{"key":"388_CR25","unstructured":"A.\u00a0Baevski, H.\u00a0Zhou, A.\u00a0Mohamed, M.\u00a0Auli, Wav2vec 2.0: A Framework for Self-Supervised Learning of Speech Representations. Advances in Neural Information Processing Systems. 33 12449-12460 (2020)"},{"key":"388_CR26","doi-asserted-by":"crossref","unstructured":"S.\u00a0Bansal, H.\u00a0Kamper, K.\u00a0Livescu, A.\u00a0Lopez, S.\u00a0Goldwater, Pre-training on high-resource speech recognition improves low-resource speech-to-text translation (2019). arXiv:1809.01431","DOI":"10.21437\/Interspeech.2018-1326"},{"key":"388_CR27","unstructured":"C.\u00a0Wang, Y.\u00a0Tang, X.\u00a0Ma, A.\u00a0Wu, S.\u00a0Popuri, D.\u00a0Okhonko, J.\u00a0Pino, Fairseq S2T: Fast Speech-to-Text Modeling with fairseq (2022). arXiv:2010.05171"},{"key":"388_CR28","unstructured":"A.\u00a0Radford, J.W. Kim, T.\u00a0Xu, G.\u00a0Brockman, C.\u00a0McLeavey, I.\u00a0Sutskever, Robust Speech Recognition via Large-Scale Weak Supervision (2022). arXiv:2212.04356"},{"key":"388_CR29","unstructured":"L.R.S. Gris, E.\u00a0Casanova, F.S.d. Oliveira, A.d.S. Soares, A.C. Junior, Brazilian Portuguese Speech Recognition Using Wav2vec 2.0 (2021). arXiv:2107.11414"},{"issue":"4","key":"388_CR30","doi-asserted-by":"publisher","first-page":"546","DOI":"10.1109\/TLA.2023.10128886","volume":"21","author":"JPR Alvarenga","year":"2023","unstructured":"J.P.R. Alvarenga, L.H.D.C. Merschmann, E.J.D.S. Luz, A data-centric approach for portuguese speech recognition: Language model and its implications. IEEE Lat. Am. Trans. 21(4), 546\u2013556 (2023). https:\/\/doi.org\/10.1109\/TLA.2023.10128886","journal-title":"IEEE Lat. Am. Trans."},{"key":"388_CR31","doi-asserted-by":"publisher","unstructured":"T.F. De\u00a0Toledo, H.D. Lee, N.\u00a0Spola\u00f4r, C.S. Rodrigues\u00a0Coy, F.C. Wu, Web System Prototype based on speech recognition to construct medical reports in Brazilian Portuguese. Int. J. Med. Inform. 121, 39\u201352 (2019). https:\/\/doi.org\/10.1016\/j.ijmedinf.2018.10.010","DOI":"10.1016\/j.ijmedinf.2018.10.010"},{"key":"388_CR32","doi-asserted-by":"publisher","unstructured":"C.\u00a0Carvalho, A.\u00a0Abad, in IberSPEECH 2021, TRIBUS: An end-to-end automatic speech recognition system for European Portuguese (Valladolid, 2021), pp. 185\u2013189. https:\/\/doi.org\/10.21437\/IberSPEECH.2021-40","DOI":"10.21437\/IberSPEECH.2021-40"},{"key":"388_CR33","doi-asserted-by":"crossref","unstructured":"T.\u00a0Pellegrini, A.\u00a0Hamalainen, in Proceedings of the 14th Annual Conference of the International Speech Communication Association (INTERSPEECH 2013), A Corpus-Based Study of Elderly and Young Speakers of European Portuguese: Acoustic Correlates and Their Impact on Speech Recognition Performance (France, 2013), pp. 852\u2013856","DOI":"10.21437\/Interspeech.2013-241"},{"key":"388_CR34","doi-asserted-by":"publisher","unstructured":"F.\u00a0Farias, W.\u00a0Lobato, W.\u00a0Cruz, M.\u00a0Amadeus. Bilingual Asr Model With Language Identification for Brazilian Portuguese and South-American Spanish (2022). https:\/\/doi.org\/10.20944\/preprints202210.0480.v1","DOI":"10.20944\/preprints202210.0480.v1"},{"key":"388_CR35","doi-asserted-by":"publisher","unstructured":"W.\u00a0Hou, Y.\u00a0Dong, B.\u00a0Zhuang, L.\u00a0Yang, J.\u00a0Shi, T.\u00a0Shinozaki, in Interspeech 2020, Large-Scale End-to-End Multilingual Speech Recognition and Language Identification with Multi-Task Learning (Shanghai, 2020), pp. 1037\u20131041. https:\/\/doi.org\/10.21437\/Interspeech.2020-2164","DOI":"10.21437\/Interspeech.2020-2164"},{"key":"388_CR36","doi-asserted-by":"publisher","unstructured":"B.\u00a0Houston, K.\u00a0Kirchhoff, in 2022 IEEE Spoken Language Technology Workshop (SLT), Exploration of Language-Specific Self-Attention Parameters for Multilingual End-to-End Speech Recognition (IEEE, Doha, 2023), pp. 755\u2013762. https:\/\/doi.org\/10.1109\/SLT54892.2023.10022937","DOI":"10.1109\/SLT54892.2023.10022937"},{"key":"388_CR37","doi-asserted-by":"publisher","unstructured":"J.\u00a0Bai, B.\u00a0Li, Y.\u00a0Zhang, A.\u00a0Bapna, N.\u00a0Siddhartha, K.\u00a0Chai\u00a0Sim, T.N. Sainath, in ICASSP 2022 - 2022 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), Joint Unsupervised and Supervised Training for Multilingual ASR (IEEE, Singapore, 2022), pp. 6402\u20136406. https:\/\/doi.org\/10.1109\/ICASSP43922.2022.9746038","DOI":"10.1109\/ICASSP43922.2022.9746038"},{"key":"388_CR38","doi-asserted-by":"publisher","unstructured":"B.\u00a0Li, R.\u00a0Pang, T.N. Sainath, A.\u00a0Gulati, Y.\u00a0Zhang, J.\u00a0Qin, P.\u00a0Haghani, W.R. Huang, M.\u00a0Ma, J.\u00a0Bai, in 2021 IEEE Automatic Speech Recognition and Understanding Workshop (ASRU), Scaling End-to-End Models for Large-Scale Multilingual ASR (IEEE, Cartagena, 2021), pp. 1011\u20131018. https:\/\/doi.org\/10.1109\/ASRU51503.2021.9687871","DOI":"10.1109\/ASRU51503.2021.9687871"},{"key":"388_CR39","unstructured":"C. Chen, Y. Hu, C.H.H. Yang, S.M. Siniscalchi, P.Y. Chen, E.S. Chng, HyPoradise: An Open Baseline for Generative Speech Recognition with Large Language Models (2023). arXiv:2309.15701"},{"key":"388_CR40","unstructured":"C.\u00a0Tang, W.\u00a0Yu, G.\u00a0Sun, X.\u00a0Chen, T.\u00a0Tan, W.\u00a0Li, L.\u00a0Lu, Z.\u00a0Ma, C.\u00a0Zhang, SALMONN: Towards Generic Hearing Abilities for Large Language Models (2023). arXiv:2310.13289"},{"key":"388_CR41","doi-asserted-by":"crossref","unstructured":"J. Wu, Y. Gaur, Z. Chen, L. Zhou, Y. Zhu, T. Wang, J. Li, S. Liu, B. Ren, L. Liu, Y. Wu, On decoder-only architecture for speech-to-text and large language model integration (2023). arXiv:2307.03917","DOI":"10.1109\/ASRU57964.2023.10389705"},{"key":"388_CR42","unstructured":"Z.\u00a0Yu, Y.\u00a0Zhang, K.\u00a0Qian, C.\u00a0Wan, Y.\u00a0Fu, Y.\u00a0Zhang, in International Conference on Machine Learning, Master-ASR: Achieving Multilingual Scalability and Low-Resource Adaptation in ASR with Modular Learning (Hawaii, 2023), pp. 40475\u201340487"},{"key":"388_CR43","doi-asserted-by":"crossref","unstructured":"K.W. Chang, M.H. Chen, Y.P. Lin, J.N. Hsu, P.K.M. Huang, C.y. Huang, S.W. Li, H.y. Lee, Prompting and Adapter Tuning for Self-supervised Encoder-Decoder Speech Model (2023). arXiv:2310.02971","DOI":"10.1109\/ASRU57964.2023.10389731"},{"key":"388_CR44","doi-asserted-by":"crossref","unstructured":"Y.\u00a0Fathullah, C.\u00a0Wu, E.\u00a0Lakomkin, J.\u00a0Jia, Y.\u00a0Shangguan, K.\u00a0Li, J.\u00a0Guo, W.\u00a0Xiong, J.\u00a0Mahadeokar, O.\u00a0Kalinli, C.\u00a0Fuegen, M.\u00a0Seltzer, Prompting Large Language Models with Speech Recognition Abilities (2023). arXiv:2307.11795","DOI":"10.1109\/ICASSP48485.2024.10447605"},{"key":"388_CR45","doi-asserted-by":"publisher","unstructured":"V.F.S. Alencar, A.\u00a0Alcaim, in 2008 42nd Asilomar Conference on Signals, Systems and Computers, LSF and LPC - derived features for Large Vocabulary Distributed Continuous Speech Recognition in Brazilian Portuguese (IEEE, Pacific Grove, 2008), pp. 1237\u20131241. https:\/\/doi.org\/10.1109\/ACSSC.2008.5074614","DOI":"10.1109\/ACSSC.2008.5074614"},{"issue":"1","key":"388_CR46","doi-asserted-by":"publisher","first-page":"53","DOI":"10.1007\/s13173-010-0023-1","volume":"17","author":"N Neto","year":"2011","unstructured":"N. Neto, C. Patrick, A. Klautau, I. Trancoso, Free tools and resources for Brazilian Portuguese speech recognition. J. Braz. Comput. Soc. 17(1), 53\u201368 (2011). https:\/\/doi.org\/10.1007\/s13173-010-0023-1","journal-title":"J. Braz. Comput. Soc."},{"key":"388_CR47","unstructured":"R.\u00a0Ardila, M.\u00a0Branson, K.\u00a0Davis, M.\u00a0Henretty, M.\u00a0Kohler, J.\u00a0Meyer, R.\u00a0Morais, L.\u00a0Saunders, F.M. Tyers, G.\u00a0Weber, Common Voice: A Massively-Multilingual Speech Corpus (2020). arXiv:1912.06670"},{"key":"388_CR48","doi-asserted-by":"publisher","unstructured":"P.H.L. Leite, E.\u00a0Hoyle, l.\u00a0Antelo, L.F. Kruszielski, L.W.P. Biscainho, in Computational Processing of the Portuguese Language, vol. 13208, ed. by V.\u00a0Pinheiro, P.\u00a0Gamallo, R.\u00a0Amaro, C.\u00a0Scarton, F.\u00a0Batista, D.\u00a0Silva, C.\u00a0Magro, H.\u00a0Pinto, A Corpus of Neutral Voice Speech in Brazilian Portuguese (Springer International Publishing, Cham, 2022), pp. 344\u2013352. https:\/\/doi.org\/10.1007\/978-3-030-98305-5_32","DOI":"10.1007\/978-3-030-98305-5_32"},{"key":"388_CR49","doi-asserted-by":"publisher","unstructured":"V.\u00a0Pratap, Q.\u00a0Xu, A.\u00a0Sriram, G.\u00a0Synnaeve, R.\u00a0Collobert, in Interspeech 2020, MLS: A Large-Scale Multilingual Dataset for Speech Research (2020), pp. 2757\u20132761.https:\/\/doi.org\/10.21437\/Interspeech.2020-2826","DOI":"10.21437\/Interspeech.2020-2826"},{"key":"388_CR50","doi-asserted-by":"publisher","unstructured":"I.\u00a0Quintanilha, S.\u00a0Netto, L.\u00a0Biscainho, An open-source end-to-end ASR system for Brazilian Portuguese using DNNs built from newly assembled corpora. J. Commun. Inf. Syst. 35(1), 230\u2013242 (2020). https:\/\/doi.org\/10.14209\/jcis.2020.25","DOI":"10.14209\/jcis.2020.25"},{"key":"388_CR51","doi-asserted-by":"crossref","unstructured":"E.\u00a0Salesky, M.\u00a0Wiesner, J.\u00a0Bremerman, R.\u00a0Cattoni, M.\u00a0Negri, M.\u00a0Turchi, D.W. Oard, M.\u00a0Post, The Multilingual TEDx Corpus for Speech Recognition and Translation (2021). arXiv:2102.01757","DOI":"10.21437\/Interspeech.2021-11"},{"key":"388_CR52","doi-asserted-by":"publisher","unstructured":"A.\u00a0Candido\u00a0Junior, E.\u00a0Casanova, A.\u00a0Soares, F.S. De\u00a0Oliveira, L.\u00a0Oliveira, R.C.F. Junior, D.P.P. Da\u00a0Silva, F.G. Fayet, B.B. Carlotto, L.R.S. Gris, S.M. Alu\u00edsio, CORAA ASR: A large corpus of spontaneous and prepared speech manually valiyeard for speech recognition in Brazilian Portuguese. Lang. Resour. Eval. (2022). https:\/\/doi.org\/10.1007\/s10579-022-09621-4","DOI":"10.1007\/s10579-022-09621-4"},{"key":"388_CR53","doi-asserted-by":"publisher","unstructured":"A.\u00a0Conneau, M.\u00a0Ma, S.\u00a0Khanuja, Y.\u00a0Zhang, V.\u00a0Axelrod, S.\u00a0Dalmia, J.\u00a0Riesa, C.\u00a0Rivera, A.\u00a0Bapna, in 2022 IEEE Spoken Language Technology Workshop (SLT), FLEURS: FEW-Shot Learning Evaluation of Universal Representations of Speech (IEEE, Doha, 2023), pp. 798\u2013805. https:\/\/doi.org\/10.1109\/SLT54892.2023.10023141","DOI":"10.1109\/SLT54892.2023.10023141"},{"key":"388_CR54","doi-asserted-by":"publisher","unstructured":"J.P. Neto, C.A. Martins, H.\u00a0Meinedo, L.B. Almeida, in 5th European Conference on Speech Communication and Technology (Eurospeech 1997), The design of a large vocabulary speech corpus for portuguese (ISCA, 1997), pp. 1707\u20131710. https:\/\/doi.org\/10.21437\/Eurospeech.1997-485","DOI":"10.21437\/Eurospeech.1997-485"},{"key":"388_CR55","doi-asserted-by":"publisher","unstructured":"H.\u00a0Meinedo, N.\u00a0Souto, J.\u00a0Neto, in IEEE Workshop on Automatic Speech Recognition and Understanding, 2001. ASRU\u201901., Speech recognition of broadcast news for the European Portuguese language (IEEE, Madonna di Campiglio, 2001), pp. 319\u2013322. https:\/\/doi.org\/10.1109\/ASRU.2001.1034651","DOI":"10.1109\/ASRU.2001.1034651"},{"key":"388_CR56","unstructured":"A. H\u00e4m\u00e4l\u00e4inen, J. Avelar, S. Rodrigues, M.S. Dias, A. Kolesi, T. Fegy\u00f3, G. N\u00e9meth, P. Csob\u00e1nka, K.L.H. Ting, D. Hewson, in The Ninth International Conference on Language Resources and Evaluation (LREC 2014), The EASR Corpora of European Portuguese, French, Hungarian and Polish Elderly Speech (Reykjavik: ELRA, 2014), pp. 1458\u20131464"},{"key":"388_CR57","unstructured":"L.\u00a0Hao-Chien, W.\u00a0Chung-Chun, L.\u00a0Jhen-Ke, L.\u00a0Tien-Hong, in The 35th Conference on Computational Linguistics and Speech Processing (ROCLING 2023), The NTNU ASR System for Formosa Speech Recognition Challenge 2023 (Taipei City, 2023), pp. 397\u2013402"},{"key":"388_CR58","unstructured":"Z.\u00a0Fangyuan, M.\u00a0Zhiqiang, C.\u00a0Yan, Z.\u00a0Xiaoxu, W.\u00a0Hongbin, A Review of Speaker Adaptive Methods in Speech Recognition (in Chinese). Comput. Sci. Explor. 15 2241-2255 (2021)"},{"key":"388_CR59","doi-asserted-by":"publisher","unstructured":"Y.\u00a0Zhang, S.\u00a0Sun, L.\u00a0Ma, in ICASSP 2021 - 2021 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), Tiny Transducer: A Highly-Efficient Speech Recognition Model on Edge Devices (IEEE, Toronto, 2021), pp. 6024\u20136028. https:\/\/doi.org\/10.1109\/ICASSP39728.2021.9413854","DOI":"10.1109\/ICASSP39728.2021.9413854"}],"container-title":["EURASIP Journal on Audio, Speech, and Music Processing"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1186\/s13636-024-00388-w.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1186\/s13636-024-00388-w\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1186\/s13636-024-00388-w.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,1,21]],"date-time":"2025-01-21T08:39:44Z","timestamp":1737448784000},"score":1,"resource":{"primary":{"URL":"https:\/\/asmp-eurasipjournals.springeropen.com\/articles\/10.1186\/s13636-024-00388-w"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,1,21]]},"references-count":59,"journal-issue":{"issue":"1","published-online":{"date-parts":[[2025,12]]}},"alternative-id":["388"],"URL":"https:\/\/doi.org\/10.1186\/s13636-024-00388-w","relation":{},"ISSN":["1687-4722"],"issn-type":[{"value":"1687-4722","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,1,21]]},"assertion":[{"value":"5 February 2024","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"11 December 2024","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"21 January 2025","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"Not applicable.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Ethics approval and consent to participate"}},{"value":"Not applicable.","order":3,"name":"Ethics","group":{"name":"EthicsHeading","label":"Consent for publication"}},{"value":"The authors declare that they have no competing interests.","order":4,"name":"Ethics","group":{"name":"EthicsHeading","label":"Competing interests"}}],"article-number":"3"}}