{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,10]],"date-time":"2026-07-10T16:15:11Z","timestamp":1783700111136,"version":"3.55.0"},"reference-count":55,"publisher":"Springer Science and Business Media LLC","issue":"1","license":[{"start":{"date-parts":[[2018,7,17]],"date-time":"2018-07-17T00:00:00Z","timestamp":1531785600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["No. 61370034"],"award-info":[{"award-number":["No. 61370034"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["No. 61403224"],"award-info":[{"award-number":["No. 61403224"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["J AUDIO SPEECH MUSIC PROC."],"published-print":{"date-parts":[[2018,12]]},"DOI":"10.1186\/s13636-018-0128-6","type":"journal-article","created":{"date-parts":[[2018,7,17]],"date-time":"2018-07-17T12:10:18Z","timestamp":1531829418000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":15,"title":["Advanced recurrent network-based hybrid acoustic models for low resource speech recognition"],"prefix":"10.1186","volume":"2018","author":[{"given":"Jian","family":"Kang","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Wei-Qiang","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Wei-Wei","family":"Liu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jia","family":"Liu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Michael T.","family":"Johnson","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2018,7,17]]},"reference":[{"issue":"6","key":"128_CR1","doi-asserted-by":"publisher","first-page":"82","DOI":"10.1109\/MSP.2012.2205597","volume":"29","author":"G Hinton","year":"2012","unstructured":"G Hinton, L Deng, D Yu, GE Dahl, A-r Mohamed, N Jaitly, A Senior, V Vanhoucke, P Nguyen, TN Sainath, et al, Deep neural networks for acoustic modeling in speech recognition: the shared views of four research groups. IEEE Signal Proc. Mag. 29(6), 82\u201397 (2012).","journal-title":"IEEE Signal Proc. Mag"},{"key":"128_CR2","doi-asserted-by":"crossref","unstructured":"F Seide, G Li, D Yu, in Proc. Interspeech. Conversational speech transcription using context-dependent deep neural networks (Florence, 2011), pp. 437\u2013440.","DOI":"10.21437\/Interspeech.2011-169"},{"key":"128_CR3","first-page":"24","volume-title":"Proc ASRU","author":"F Seide","year":"2011","unstructured":"F Seide, L Gang, C Xie, et al, in Proc ASRU. Feature engineering in context-dependent deep neural networks for conversational speech transcription (IEEEWaikoloa, 2011), pp. 24\u201329."},{"issue":"1","key":"128_CR4","doi-asserted-by":"publisher","first-page":"30","DOI":"10.1109\/TASL.2011.2134090","volume":"20","author":"GE Dahl","year":"2012","unstructured":"GE Dahl, D Yu, L Deng, A Acero, Context-dependent pre-trained deep neural networks for large-vocabulary speech recognition. IEEE Trans. Audio, Speech, Lang. Process. 20(1), 30\u201342 (2012).","journal-title":"IEEE Trans. Audio, Speech, Lang. Process"},{"key":"128_CR5","doi-asserted-by":"publisher","first-page":"233","DOI":"10.1007\/978-1-4613-1367-0_10","volume-title":"Automatic speech and speaker recognition","author":"T Robinson","year":"1996","unstructured":"T Robinson, M Hochberg, S Renals, in Automatic speech and speaker recognition. The use of recurrent neural networks in continuous speech recognition (SpringerBoston, 1996), pp. 233\u2013258."},{"key":"128_CR6","volume-title":"Proc. Interspeech","author":"T Mikolov","year":"2010","unstructured":"T Mikolov, et al, in Proc. Interspeech. Recurrent neural network based language model (ISCAMakuhari, 2010)."},{"key":"128_CR7","first-page":"5569","volume-title":"Proc ICASSP","author":"W Chao","year":"2014","unstructured":"W Chao, Y Dong, S Watanabe, et al, in Proc ICASSP. Recurrent deep neural networks for robust speech recognition (IEEEFlorence, 2014), pp. 5569\u20135573."},{"key":"128_CR8","first-page":"5417","volume-title":"Proc ICASSP","author":"N Boulanger-Lewandowski","year":"2014","unstructured":"N Boulanger-Lewandowski, J Droppo, M Seltzer, et al, in Proc ICASSP. Phone sequence modeling with recurrent neural networks (IEEEFlorence, 2014), pp. 5417\u20135421."},{"key":"128_CR9","first-page":"6645","volume-title":"Proc ICASSP","author":"A Graves","year":"2013","unstructured":"A Graves, A Mohamed, GE Hinton, in Proc ICASSP. Speech recognition with deep recurrent neural networks (IEEEVancouver, 2013), pp. 6645\u20136649."},{"key":"128_CR10","doi-asserted-by":"crossref","unstructured":"AL Maas, QV Le, et al, Recurrent neural networks for noise reduction in robust ASR (Proc INTERSPEECH: ISCA, 2012).","DOI":"10.21437\/Interspeech.2012-6"},{"issue":"2","key":"128_CR11","doi-asserted-by":"publisher","first-page":"157","DOI":"10.1109\/72.279181","volume":"5","author":"Y Bengio","year":"1994","unstructured":"Y Bengio, P Simard, P Frasconi, Learning long-term dependencies with gradient descent is difficult. IEEE Trans. Neural Netw. 5(2), 157\u2013166 (1994).","journal-title":"IEEE Trans. Neural Netw"},{"issue":"8","key":"128_CR12","doi-asserted-by":"publisher","first-page":"1735","DOI":"10.1162\/neco.1997.9.8.1735","volume":"9","author":"S Hochreiter","year":"1997","unstructured":"S Hochreiter, J Schmidhuber, Long short-term memory. Neural Comput.9(8), 1735\u20131780 (1997).","journal-title":"Neural Comput."},{"key":"128_CR13","first-page":"4580","volume-title":"Proc ICASSP","author":"TN Sainath","year":"2015","unstructured":"TN Sainath, et al, in Proc ICASSP. Convolutional, long short-term memory, fully connected deep neural networks (IEEESouth Brisbane, 2015), pp. 4580\u20134584."},{"key":"128_CR14","first-page":"631","volume-title":"Proc INTERSPEECH","author":"JT Geiger","year":"2014","unstructured":"JT Geiger, et al, in Proc INTERSPEECH. Robust speech recognition using long short-term memory recurrent neural networks for hybrid acoustic modelling (ISCASingapore, 2014), pp. 631\u2013635."},{"key":"128_CR15","first-page":"4585","volume-title":"Proc ICASSP","author":"A Senior","year":"2015","unstructured":"A Senior, H Sak, I Shafran, in Proc ICASSP. Context dependent phone models for LSTM RNN acoustic modelling (IEEESouth Brisbane, 2015), pp. 4585\u20134589."},{"key":"128_CR16","unstructured":"H Sak, AW Senior, F Beaufays, in INTERSPEECH. Long short-term memory recurrent neural network architectures for large scale acoustic modeling, (2014), pp. 338\u2013342."},{"issue":"16","key":"128_CR17","first-page":"17","volume":"15","author":"H Sak","year":"2014","unstructured":"H Sak, O Vinyals, G Heigold, A Senior, E McDermott, R Monga, M Mao, Sequence discriminative distributed training of long short-term memory recurrent neural networks. Entropy. 15(16), 17\u201318 (2014).","journal-title":"Entropy"},{"key":"128_CR18","first-page":"1","volume-title":"Proc ISCSLP","author":"J Kang","year":"2016","unstructured":"J Kang, WQ Zhang, J Liu, in Proc ISCSLP. Gated recurrent units based hybrid acoustic models for robust speech recognition (IEEETianjin, 2016), pp. 1\u20135."},{"key":"128_CR19","first-page":"4954","volume-title":"Proc ICASSP","author":"J Kang","year":"2015","unstructured":"J Kang, C Lu, M Cai, WQ Zhang, J Liu, in Proc ICASSP. Neuron sparseness versus connection sparseness in deep neural network for large vocabulary speech recognition (IEEEBrisbane, 2015), pp. 4954\u20134958."},{"key":"128_CR20","first-page":"215","volume-title":"Proc ASRU","author":"C Meng","year":"2015","unstructured":"C Meng, Lv Zhiqiang, L Cheng, et al, in Proc ASRU. High-performance Swahili keyword search with very limited language pack: the THUEE system for the OpenKWS15 evaluation (IEEEScottsdale, 2015), pp. 215\u2013222."},{"key":"128_CR21","doi-asserted-by":"publisher","first-page":"53","DOI":"10.1016\/j.specom.2015.12.003","volume":"77","author":"M Cai","year":"2016","unstructured":"M Cai, J Liu, Maxout neurons for deep convolutional and LSTM neural networks in speech recognition. Speech Comm.77:, 53\u201364 (2016).","journal-title":"Speech Comm."},{"issue":"11","key":"128_CR22","doi-asserted-by":"publisher","first-page":"2673","DOI":"10.1109\/78.650093","volume":"45","author":"M Schuster","year":"1997","unstructured":"M Schuster, KK Paliwal, Bidirectional recurrent neural networks. IEEE Trans. Sig. Process. 45(11), 2673\u20132681 (1997).","journal-title":"IEEE Trans. Sig. Process"},{"key":"128_CR23","first-page":"273","volume-title":"Proc ASRU","author":"A Graves","year":"2013","unstructured":"A Graves, N Jaitly, Mohamed A-r, in Proc ASRU. Hybrid speech recognition with deep bidirectional LSTM (IEEEOlomouc, 2013), pp. 273\u2013278."},{"issue":"5-6","key":"128_CR24","doi-asserted-by":"publisher","first-page":"602","DOI":"10.1016\/j.neunet.2005.06.042","volume":"18","author":"A Graves","year":"2005","unstructured":"A Graves, J Schmidhuber, Framewise phoneme classification with bidirectional LSTM and other neural network architectures. Neural Netw. 18(5-6), 602\u2013610 (2005).","journal-title":"Neural Netw"},{"issue":"7","key":"128_CR25","doi-asserted-by":"publisher","first-page":"1185","DOI":"10.1109\/TASLP.2016.2539499","volume":"24","author":"K Chen","year":"2016","unstructured":"K Chen, Q Huo, Training deep bidirectional LSTMm acoustic model for lvcsr by a context-sensitive-chunk bptt approach. IEEE\/ACM Trans. Audio, Speech Lang. Process. (TASLP).24(7), 1185\u20131193 (2016).","journal-title":"IEEE\/ACM Trans. Audio, Speech Lang. Process. (TASLP)."},{"key":"128_CR26","first-page":"5755","volume-title":"Proc ICASSP","author":"Y Zhang","year":"2016","unstructured":"Y Zhang, et al, in Proc ICASSP. Highway long short-term memory rnns for distant speech recognition (IEEEShanghai, 2016), pp. 5755\u20135759."},{"key":"128_CR27","doi-asserted-by":"crossref","unstructured":"K Cho, et al, On the properties of neural machine translation: encoder-decoder approaches. arXiv preprint arXiv: 1409.1259 (2014).","DOI":"10.3115\/v1\/W14-4012"},{"key":"128_CR28","unstructured":"J Chung, C Gulcehre, K Cho, Y Bengio, Empirical evaluation of gated recurrent neural networks on sequence modeling. arXiv preprint arXiv: 1412.3555 (2014)."},{"key":"128_CR29","first-page":"2342","volume-title":"Proc ICML","author":"R Jozefowicz","year":"2015","unstructured":"R Jozefowicz, W Zaremba, I Sutskever, in Proc ICML. An empirical exploration of recurrent network architectures (International Machine Learning SocietyLille, 2015), pp. 2342\u20132350."},{"issue":"10","key":"128_CR30","doi-asserted-by":"publisher","first-page":"2222","DOI":"10.1109\/TNNLS.2016.2582924","volume":"28","author":"K Greff","year":"2017","unstructured":"K Greff, RK Srivastava, J Koutn\u00edk, BR Steunebrink, J Schmidhuber, LSTM: a search space odyssey. IEEE Trans. Neural Netw. Learn. Syst.28(10), 2222\u20132232 (2017).","journal-title":"IEEE Trans. Neural Netw. Learn. Syst."},{"key":"128_CR31","doi-asserted-by":"crossref","unstructured":"H Kaiming, et al, Deep residual learning for image recognition. Proceedings of the IEEE, 770\u2013778 (2016).","DOI":"10.1109\/CVPR.2016.90"},{"key":"128_CR32","unstructured":"Srivastava, R Kumar, K Greff, et al, Highway networks. arXiv preprint arXiv: 1505.00387 (2015)."},{"key":"128_CR33","unstructured":"JG Zilly, et al, Recurrent highway networks. arXiv preprint arXiv: 1607.03474 (2016)."},{"key":"128_CR34","unstructured":"K Jaeyoung, M El-Khamy, J Lee, Residual LSTM: Design of a deep recurrent architecture for distant speech recognition. arXiv preprint arXiv: 1701.03360 (2017)."},{"key":"128_CR35","unstructured":"NIST, Kws16 keyword search evaluation plan. https:\/\/www.nist.gov\/itl\/iad\/mig\/openkws16-evaluation ."},{"key":"128_CR36","unstructured":"D Povey, A Ghoshal, G Boulianne, L Burget, O Glembek, Goel N, M Hannemann, P Motlicek, Y Qian, P Schwarz, et al, in IEEE 2011 Workshop on Automatic Speech Recognition and Understanding. The Kaldi speech recognition toolkit (IEEE Signal Processing Society, 2011). number EPFL-CONF-.192584."},{"key":"128_CR37","first-page":"259","volume-title":"Proc ASRU","author":"J Cui","year":"2015","unstructured":"J Cui, et al, in Proc ASRU. Multilingual representations for low resource speech recognition and keyword search (IEEEScottsdale, 2015), pp. 259\u2013266."},{"key":"128_CR38","first-page":"2440","volume-title":"Proc INTERSPEECH","author":"V Peddinti","year":"2015","unstructured":"V Peddinti, D Povey, S Khudanpur, in Proc INTERSPEECH. A time delay neural network architecture for efficient modeling of long temporal contexts (ISCADresden, 2015), pp. 2440\u20132444."},{"key":"128_CR39","first-page":"7304","volume-title":"Proc ICASSP","author":"JT Huang","year":"2013","unstructured":"JT Huang, L Jinyu, Y Dong, et al, in Proc ICASSP. Cross-language knowledge transfer using multilingual deep neural network with shared hidden layers (IEEEVancouver, 2013), pp. 7304\u20137308."},{"key":"128_CR40","first-page":"105","volume-title":"Proc ICASSP","author":"D Povey","year":"2002","unstructured":"D Povey, PC Woodland, in Proc ICASSP. Minimum phone error and I-smoothing for improved discriminative training (IEEEOrlando, 2002), pp. 105\u2013108."},{"key":"128_CR41","first-page":"3761","volume-title":"Proc ICASSP","author":"B Kingsbury","year":"2009","unstructured":"B Kingsbury, in Proc ICASSP. Lattice-based optimization of sequence classification criteria for neural-network acoustic modeling (IEEETaipei, 2009), pp. 3761\u20133764."},{"key":"128_CR42","doi-asserted-by":"crossref","first-page":"2589","DOI":"10.21437\/Interspeech.2013-582","volume-title":"Proc INTERSPEECH","author":"M Karafiat","year":"2013","unstructured":"M Karafiat, F Grezl, M Hannemann, et al, in Proc INTERSPEECH. BUT BABEL system for spontaneous Cantonese (ISCALyon, 2013), pp. 2589\u20132593."},{"key":"128_CR43","volume-title":"BUT 2014 Babel system: Analysis of adaptation in NN based systems","author":"K Martin","year":"2014","unstructured":"K Martin, et al, BUT 2014 Babel system: Analysis of adaptation in NN based systems (ISCA, Singapore, 2014)."},{"key":"128_CR44","first-page":"4149","volume-title":"Proc ICASSP","author":"NF Chen","year":"2014","unstructured":"NF Chen, S Sivadas, BP Lim, et al, in Proc ICASSP. Strategies for Vietnamese keyword search (IEEEFlorence, 2014), pp. 4149\u20134153."},{"key":"128_CR45","first-page":"5755","volume-title":"Proc ICASSP","author":"A Tanel","year":"2017","unstructured":"A Tanel, et al, in Proc ICASSP. The 2016 BBN Georgian telephone speech keyword spotting system (New OrleansIEEE, 2017), pp. 5755\u20135759."},{"key":"128_CR46","first-page":"5650","volume-title":"Proc ICASSP","author":"C Ni","year":"2017","unstructured":"C Ni, et al, in Proc ICASSP. Efficient methods to train multilingual bottleneck feature extractors for low resource keyword search (IEEENew Orleans, 2017), pp. 5650\u20135654."},{"key":"128_CR47","first-page":"5765","volume-title":"Proc ICASSP","author":"W Hartmann","year":"2017","unstructured":"W Hartmann, et al, in Proc ICASSP. Analysis of keyword spotting performance across IARPA babel languages (IEEENew Orleans, 2017), pp. 5765\u20135769."},{"key":"128_CR48","unstructured":"CUDA Nvidia, Programming guide (2010)."},{"issue":"10","key":"128_CR49","doi-asserted-by":"publisher","first-page":"1533","DOI":"10.1109\/TASLP.2014.2339736","volume":"22","author":"O Abdel-Hamid","year":"2014","unstructured":"O Abdel-Hamid, A-r Mohamed, H Jiang, L Deng, G Penn, D Yu, Convolutional neural networks for speech recognition. IEEE\/ACM Trans. Audio, Speech, Lang. Process. 22(10), 1533\u20131545 (2014).","journal-title":"IEEE\/ACM Trans. Audio, Speech, Lang. Process"},{"key":"128_CR50","doi-asserted-by":"crossref","unstructured":"T Sercu, C Puhrsch, B Kingsbury, Y LeCun, in Acoustics, Speech and Signal Processing (ICASSP), 2016 IEEE International Conference on. Very deep multilingual convolutional neural networks for LVCSR (IEEE, 2016), pp. 4955\u20134959.","DOI":"10.1109\/ICASSP.2016.7472620"},{"key":"128_CR51","unstructured":"C Szegedy, W Liu, Y Jia, et al, in Proc CVPR. Going deeper with convolutions, (2015), pp. 1\u20139."},{"issue":"4","key":"128_CR52","doi-asserted-by":"publisher","first-page":"802","DOI":"10.1016\/j.csl.2011.03.001","volume":"25","author":"H Xu","year":"2011","unstructured":"H Xu, D Povey, L Mangu, J Zhu, Minimum Bayes Risk decoding and system combination based on a recursion for edit distance. Comput. Speech Lang. 25(4), 802\u2013828 (2011).","journal-title":"Comput. Speech Lang"},{"key":"128_CR53","unstructured":"opensat. https:\/\/www.nist.gov\/itl\/iad\/mig\/nist-2017-pilot-speech-analytic-technologies-evaluation ."},{"key":"128_CR54","doi-asserted-by":"crossref","unstructured":"Z Tang, Y Shi, D Wang, Y Feng, S Zhang, in Acoustics, Speech and Signal Processing (ICASSP), 2017 IEEE International Conference on. Memory visualization for gated recurrent neural networks in speech recognition (IEEE, 2017), pp. 2736\u20132740.","DOI":"10.1109\/ICASSP.2017.7952654"},{"key":"128_CR55","first-page":"2579","volume":"9","author":"LVD Maaten","year":"2008","unstructured":"LVD Maaten, GE Hinton, Visualizing highdimensional data using t-SNE. J. Mach. Learn. Res. 9:, 2579\u20132605 (2008).","journal-title":"J. Mach. Learn. Res"}],"container-title":["EURASIP Journal on Audio, Speech, and Music Processing"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1186\/s13636-018-0128-6.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/article\/10.1186\/s13636-018-0128-6\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1186\/s13636-018-0128-6.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,7,5]],"date-time":"2025-07-05T21:19:48Z","timestamp":1751750388000},"score":1,"resource":{"primary":{"URL":"https:\/\/asmp-eurasipjournals.springeropen.com\/articles\/10.1186\/s13636-018-0128-6"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2018,7,17]]},"references-count":55,"journal-issue":{"issue":"1","published-print":{"date-parts":[[2018,12]]}},"alternative-id":["128"],"URL":"https:\/\/doi.org\/10.1186\/s13636-018-0128-6","relation":{},"ISSN":["1687-4722"],"issn-type":[{"value":"1687-4722","type":"electronic"}],"subject":[],"published":{"date-parts":[[2018,7,17]]},"assertion":[{"value":"25 October 2017","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"19 June 2018","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"17 July 2018","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"The authors declare that they have no competing interests.","order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Competing interests"}},{"value":"Springer Nature remains neutral with regard to jurisdictional claims in published maps and institutional affiliations.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Publisher\u2019s Note"}}],"article-number":"6"}}