{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,8,19]],"date-time":"2026-08-19T20:19:14Z","timestamp":1787170754524,"version":"build-2736575974"},"publisher-location":"Cham","reference-count":36,"publisher":"Springer International Publishing","isbn-type":[{"value":"9783030878016","type":"print"},{"value":"9783030878023","type":"electronic"}],"license":[{"start":{"date-parts":[[2021,1,1]],"date-time":"2021-01-01T00:00:00Z","timestamp":1609459200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2021,1,1]],"date-time":"2021-01-01T00:00:00Z","timestamp":1609459200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2021]]},"DOI":"10.1007\/978-3-030-87802-3_41","type":"book-chapter","created":{"date-parts":[[2021,9,21]],"date-time":"2021-09-21T19:36:52Z","timestamp":1632253012000},"page":"448-459","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":15,"title":["A Study of Multilingual End-to-End Speech Recognition for Kazakh, Russian, and English"],"prefix":"10.1007","author":[{"given":"Saida","family":"Mussakhojayeva","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yerbolat","family":"Khassanov","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Huseyin","family":"Atakan Varol","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2021,9,22]]},"reference":[{"key":"41_CR1","unstructured":"The state program on development and use of languages in the Republic of Kazakhstan for the years 2011\u20132020. https:\/\/online.zakon.kz\/document\/?doc_id=31024348. Accessed 22 Apr 2021"},{"key":"41_CR2","unstructured":"Voxforge. http:\/\/www.voxforge.org\/. Accessed 11 May 2021"},{"issue":"10","key":"41_CR3","doi-asserted-by":"publisher","first-page":"3465","DOI":"10.3390\/s21103465","volume":"21","author":"M Abdrakhmanova","year":"2021","unstructured":"Abdrakhmanova, M., Kuzdeuov, A., Jarju, S., Khassanov, Y., Lewis, M., Varol, H.A.: Speakingfaces: a large-scale multimodal dataset of voice commands with visual and thermal video streams. Sensors 21(10), 3465 (2021)","journal-title":"Sensors"},{"key":"41_CR4","doi-asserted-by":"crossref","unstructured":"Adams, O., Wiesner, M., Watanabe, S., Yarowsky, D.: Massively multilingual adversarial speech recognition. In: NAACL-HLT, pp. 96\u2013108. ACL (2019)","DOI":"10.18653\/v1\/N19-1009"},{"issue":"10","key":"41_CR5","first-page":"414","volume":"11","author":"D Akynova","year":"2014","unstructured":"Akynova, D., Aimoldina, A., Agmanova, A.: English in higher education: pragmatic factors of Kazakh-English code-switching. Life Sci. J. 11(10), 414\u2013420 (2014)","journal-title":"Life Sci. J."},{"key":"41_CR6","unstructured":"Ardila, R., et al.: Common voice: a massively-multilingual speech corpus. In: LREC, pp. 4218\u20134222. ELRA (2020)"},{"key":"41_CR7","doi-asserted-by":"publisher","first-page":"85","DOI":"10.1016\/j.specom.2013.07.008","volume":"56","author":"L Besacier","year":"2014","unstructured":"Besacier, L., Barnard, E., Karpov, A., Schultz, T.: Automatic speech recognition for under-resourced languages: a survey. Speech Commun. 56, 85\u2013100 (2014)","journal-title":"Speech Commun."},{"key":"41_CR8","doi-asserted-by":"crossref","unstructured":"Cho, J., et al.: Multilingual sequence-to-sequence speech recognition: architecture, transfer learning, and language modeling. In: Proceedings of SLT, pp. 521\u2013527. IEEE (2018)","DOI":"10.1109\/SLT.2018.8639655"},{"key":"41_CR9","doi-asserted-by":"crossref","unstructured":"Dalmia, S., Sanabria, R., Metze, F., Black, A.W.: Sequence-based multi-lingual low resource speech recognition. In: Proceedings of ICASSP, pp. 4909\u20134913. IEEE (2018)","DOI":"10.1109\/ICASSP.2018.8461802"},{"key":"41_CR10","doi-asserted-by":"crossref","unstructured":"Ghoshal, A., Swietojanski, P., Renals, S.: Multilingual training of deep neural networks. In: Proceedings of ICASSP, pp. 7319\u20137323. IEEE (2013)","DOI":"10.1109\/ICASSP.2013.6639084"},{"key":"41_CR11","doi-asserted-by":"crossref","unstructured":"Graves, A., Fern\u00e1ndez, S., Gomez, F.J., Schmidhuber, J.: Connectionist temporal classification: labelling unsegmented sequence data with recurrent neural networks. In: Proceedings of ICML, Pennsylvania, USA, 25\u201329 June 2006, pp. 369\u2013376 (2006)","DOI":"10.1145\/1143844.1143891"},{"key":"41_CR12","unstructured":"Graves, A., Jaitly, N.: Towards end-to-end speech recognition with recurrent neural networks. In: Proceedings of ICML, vol. 32, pp. 1764\u20131772. JMLR.org (2014)"},{"key":"41_CR13","unstructured":"G\u00fcl\u00e7ehre, \u00c7., Firat, O., Xu, K., Cho, K., Barrault, L., et al.: On using monolingual corpora in neural machine translation (2015). http:\/\/arxiv.org\/abs\/1503.03535"},{"key":"41_CR14","unstructured":"Hannun, A.Y., et al.: Deep Speech: Scaling up end-to-end speech recognition (2014). http:\/\/arxiv.org\/abs\/1412.5567"},{"issue":"8","key":"41_CR15","doi-asserted-by":"publisher","first-page":"1735","DOI":"10.1162\/neco.1997.9.8.1735","volume":"9","author":"S Hochreiter","year":"1997","unstructured":"Hochreiter, S., Schmidhuber, J.: Long short-term memory. Neural Comput. 9(8), 1735\u20131780 (1997)","journal-title":"Neural Comput."},{"key":"41_CR16","doi-asserted-by":"crossref","unstructured":"Hou, W., Dong, Y., Zhuang, B., Yang, L., Shi, J., Shinozaki, T.: Large-scale end-to-end multilingual speech recognition and language identification with multi-task learning. In: Proceedings of INTERSPEECH, pp. 1037\u20131041. ISCA (2020)","DOI":"10.21437\/Interspeech.2020-2164"},{"key":"41_CR17","doi-asserted-by":"crossref","unstructured":"Kannan, A., et al.: Large-scale multilingual speech recognition with a streaming end-to-end model. In: Proceedings of INTERSPEECH, pp. 2130\u20132134 (2019)","DOI":"10.21437\/Interspeech.2019-2858"},{"key":"41_CR18","doi-asserted-by":"crossref","unstructured":"Karafi\u00e1t, M., et al.: 2016 BUT babel system: multilingual BLSTM acoustic model with i-vector based adaptation. In: Proceedings of INTERSPEECH, pp. 719\u2013723. ISCA (2017)","DOI":"10.21437\/Interspeech.2017-1775"},{"key":"41_CR19","doi-asserted-by":"crossref","unstructured":"Khassanov, Y., Mussakhojayeva, S., Mirzakhmetov, A., Adiyev, A., Nurpeiissov, M., Varol, H.A.: A crowdsourced open-source Kazakh speech corpus and initial speech recognition baseline. In: Proceedings of EACL, pp. 697\u2013706. ACL (2021)","DOI":"10.18653\/v1\/2021.eacl-main.58"},{"key":"41_CR20","doi-asserted-by":"crossref","unstructured":"Khassanov, Y., et al.: Constrained output embeddings for end-to-end code-switching speech recognition with only monolingual data. In: Proceedings of INTERSPEECH, pp. 2160\u20132164. ISCA (2019)","DOI":"10.21437\/Interspeech.2019-1867"},{"key":"41_CR21","series-title":"Lecture Notes in Computer Science (Lecture Notes in Artificial Intelligence)","doi-asserted-by":"publisher","first-page":"25","DOI":"10.1007\/978-3-319-23132-7_3","volume-title":"Speech and Computer","author":"O Khomitsevich","year":"2015","unstructured":"Khomitsevich, O., Mendelev, V., Tomashenko, N., Rybin, S., Medennikov, I., Kudubayeva, S.: A bilingual Kazakh-Russian system for automatic speech recognition and synthesis. In: Ronzhin, A., Potapova, R., Fakotakis, N. (eds.) SPECOM 2015. LNCS (LNAI), vol. 9319, pp. 25\u201333. Springer, Cham (2015). https:\/\/doi.org\/10.1007\/978-3-319-23132-7_3"},{"key":"41_CR22","doi-asserted-by":"crossref","unstructured":"Kim, S., Hori, T., Watanabe, S.: Joint CTC-attention based end-to-end speech recognition using multi-task learning. In: Proceedings of IEEE ICASSP, pp. 4835\u20134839 (2017)","DOI":"10.1109\/ICASSP.2017.7953075"},{"key":"41_CR23","doi-asserted-by":"crossref","unstructured":"Ko, T., Peddinti, V., Povey, D., Khudanpur, S.: Audio augmentation for speech recognition. In: Proceedings of INTERSPEECH, pp. 3586\u20133589 (2015)","DOI":"10.21437\/Interspeech.2015-711"},{"key":"41_CR24","unstructured":"Li, B., et al.: Scaling end-to-end models for large-scale multilingual ASR. CoRR abs\/2104.14830 (2021). https:\/\/arxiv.org\/abs\/2104.14830"},{"key":"41_CR25","series-title":"Communications in Computer and Information Science","doi-asserted-by":"publisher","first-page":"54","DOI":"10.1007\/978-3-319-71746-3_5","volume-title":"Artificial Intelligence and Natural Language","author":"N Markovnikov","year":"2018","unstructured":"Markovnikov, N., Kipyatkova, I., Karpov, A., Filchenkov, A.: Deep neural networks in Russian speech recognition. In: Filchenkov, A., Pivovarova, L., \u017di\u017eka, J. (eds.) AINL 2017. CCIS, vol. 789, pp. 54\u201367. Springer, Cham (2018). https:\/\/doi.org\/10.1007\/978-3-319-71746-3_5"},{"key":"41_CR26","doi-asserted-by":"crossref","unstructured":"Mussakhojayeva, S., Janaliyeva, A., Mirzakhmetov, A., Khassanov, Y., Varol, H.A.: KazakhTTS: an open-source Kazakh text-to-speech synthesis dataset. CoRR abs\/2104.08459 (2021). https:\/\/arxiv.org\/abs\/2104.08459","DOI":"10.21437\/Interspeech.2021-2124"},{"key":"41_CR27","doi-asserted-by":"crossref","unstructured":"Park, D.S., et al.: Specaugment: a simple data augmentation method for automatic speech recognition. In: Proceedings of INTERSPEECH, pp. 2613\u20132617 (2019)","DOI":"10.21437\/Interspeech.2019-2680"},{"key":"41_CR28","doi-asserted-by":"crossref","unstructured":"Pratap, V., et al.: Massively multilingual ASR: 50 languages, 1 model, 1 billion parameters. In: Proceedings of INTERSPEECH, pp. 4751\u20134755. ISCA (2020)","DOI":"10.21437\/Interspeech.2020-2831"},{"key":"41_CR29","unstructured":"Simonyan, K., Zisserman, A.: Very deep convolutional networks for large-scale image recognition. In: Proceedings of ICLR (2015)"},{"key":"41_CR30","unstructured":"Slizhikova, A., Veysov, A., Nurtdinova, D., Voronin, D.: Russian open speech to text dataset. https:\/\/github.com\/snakers4\/open_stt. Accessed 15 Jan 2021"},{"key":"41_CR31","unstructured":"Solak, I.: The M-AILABS speech dataset. https:\/\/www.caito.de\/2019\/01\/the-m-ailabs-speech-dataset\/. Accessed 11 May 2021"},{"key":"41_CR32","doi-asserted-by":"crossref","unstructured":"Toshniwal, S., et al.: Multilingual speech recognition with a single end-to-end model. In: Proceedings of ICASSP, Calgary, AB, Canada, 15\u201320 April 2018, pp. 4904\u20134908. IEEE (2018)","DOI":"10.1109\/ICASSP.2018.8461972"},{"key":"41_CR33","unstructured":"Ubskii, D., Matveev, Y., Minker, W.: Impact of using a bilingual model on Kazakh-Russian code-switching speech recognition. In: Proceedings of MICSECS (2019)"},{"key":"41_CR34","unstructured":"Vaswani, A., et al.: Attention is all you need. In: Proceedings of NIPS, pp. 5998\u20136008 (2017)"},{"key":"41_CR35","doi-asserted-by":"crossref","unstructured":"Watanabe, S., et al.: Espnet: end-to-end speech processing toolkit. In: Proceedings of INTERSPEECH, pp. 2207\u20132211. ISCA (2018)","DOI":"10.21437\/Interspeech.2018-1456"},{"key":"41_CR36","doi-asserted-by":"crossref","unstructured":"Zeng, Z., Khassanov, Y., Pham, V.T., Xu, H., Chng, E.S., Li, H.: On the end-to-end solution to Mandarin-English code-switching speech recognition. In: Proceedings of INTERSPEECH, pp. 2165\u20132169. ISCA (2019)","DOI":"10.21437\/Interspeech.2019-1429"}],"container-title":["Lecture Notes in Computer Science","Speech and Computer"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-030-87802-3_41","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,1,9]],"date-time":"2023-01-09T17:01:04Z","timestamp":1673283664000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-3-030-87802-3_41"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2021]]},"ISBN":["9783030878016","9783030878023"],"references-count":36,"URL":"https:\/\/doi.org\/10.1007\/978-3-030-87802-3_41","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2021]]},"assertion":[{"value":"22 September 2021","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"SPECOM","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"International Conference on Speech and Computer","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"St Petersburg","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Russia","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2021","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"27 September 2021","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"30 September 2021","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"23","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"specom2021","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"http:\/\/specom.nw.ru\/2021\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Single-blind","order":1,"name":"type","label":"Type","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"EasyChair","order":2,"name":"conference_management_system","label":"Conference Management System","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"163","order":3,"name":"number_of_submissions_sent_for_review","label":"Number of Submissions Sent for Review","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"74","order":4,"name":"number_of_full_papers_accepted","label":"Number of Full Papers Accepted","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"0","order":5,"name":"number_of_short_papers_accepted","label":"Number of Short Papers Accepted","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"45% - The value is computed by the equation \"Number of Full Papers Accepted \/ Number of Submissions Sent for Review * 100\" and then rounded to a whole number.","order":6,"name":"acceptance_rate_of_full_papers","label":"Acceptance Rate of Full Papers","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"3.5","order":7,"name":"average_number_of_reviews_per_paper","label":"Average Number of Reviews per Paper","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"5.5","order":8,"name":"average_number_of_papers_per_reviewer","label":"Average Number of Papers per Reviewer","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"Yes","order":9,"name":"external_reviewers_involved","label":"External Reviewers Involved","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"The conference was held online due to the COVID-19 pandemic.","order":10,"name":"additional_info_on_review_process","label":"Additional Info on Review Process","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}}]}}