{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,6,10]],"date-time":"2025-06-10T22:40:03Z","timestamp":1749595203729,"version":"3.41.0"},"reference-count":44,"publisher":"Institute of Electronics, Information and Communications Engineers (IEICE)","issue":"10","content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEICE Trans. Inf. &amp; Syst."],"published-print":{"date-parts":[[2016]]},"DOI":"10.1587\/transinf.2016slp0013","type":"journal-article","created":{"date-parts":[[2016,9,30]],"date-time":"2016-09-30T22:23:05Z","timestamp":1475274185000},"page":"2452-2461","source":"Crossref","is-referenced-by-count":4,"title":["Investigation of Combining Various Major Language Model Technologies including Data Expansion and Adaptation"],"prefix":"10.1587","volume":"E99.D","author":[{"given":"Ryo","family":"MASUMURA","sequence":"first","affiliation":[{"name":"NTT Media Intelligence Laboratories, NTT Corporation"},{"name":"Graduate School of Engineering, Tohoku University"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Taichi","family":"ASAMI","sequence":"additional","affiliation":[{"name":"NTT Media Intelligence Laboratories, NTT Corporation"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Takanobu","family":"OBA","sequence":"additional","affiliation":[{"name":"NTT Media Intelligence Laboratories, NTT Corporation"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Hirokazu","family":"MASATAKI","sequence":"additional","affiliation":[{"name":"NTT Media Intelligence Laboratories, NTT Corporation"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Sumitaka","family":"SAKAUCHI","sequence":"additional","affiliation":[{"name":"NTT Media Intelligence Laboratories, NTT Corporation"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Akinori","family":"ITO","sequence":"additional","affiliation":[{"name":"Graduate School of Engineering, Tohoku University"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"532","reference":[{"key":"1","doi-asserted-by":"crossref","unstructured":"[1] S. Young, \u201cA review of large-vocabulary continuous-speech recognition,\u201d IEEE Signal Process. Mag., vol.13, pp.45-57, 1996.","DOI":"10.1109\/79.536824"},{"key":"2","doi-asserted-by":"crossref","unstructured":"[2] G. Hinton, L. Deng, D. Yu, G. Dahl, A. rahman Mohamed, N. Jaitly, A. Senior, V. Vanhoucke, P. Nguyen, T. Sainath, and B. Kingsbury, \u201cDeep neural networks for acoustic modeling in speech recognition,\u201d IEEE Signal Processing Magazine, vol.29, pp.82-97, 2012.","DOI":"10.1109\/MSP.2012.2205597"},{"key":"3","doi-asserted-by":"crossref","unstructured":"[3] F. Seide, G. Li, and D. Yu, \u201cConversational speech transcription using context-dependent deep neural networks,\u201d In Proc. INTERSPEECH, pp.437-440, 2011.","DOI":"10.21437\/Interspeech.2011-169"},{"key":"4","doi-asserted-by":"crossref","unstructured":"[4] R. Rosenfeld, \u201cTwo decades of statistical language modeling: Where do we go from here?,\u201d Proc. IEEE, vol.88, no.8, pp.1270-1278, 2000.","DOI":"10.1109\/5.880083"},{"key":"5","doi-asserted-by":"crossref","unstructured":"[5] S.F. Chen and J. Goodman, \u201cAn empirical study of smoothing techniques for language modeling,\u201d Computer Speech &amp; Language, vol.13, no.4, pp.359-393, 1999.","DOI":"10.1006\/csla.1999.0128"},{"key":"6","doi-asserted-by":"crossref","unstructured":"[6] T. Mikolov, A. Deoras, S. Kombrink, L. Burget, and J. Cernocky, \u201cEmpirical evaluation and combination of advanced language modeling techniques,\u201d In Proc. INTERSPEECH, pp.605-608, 2011.","DOI":"10.21437\/Interspeech.2011-242"},{"key":"7","unstructured":"[7] C. Chelba, T. Mikolov, M. Schuster, Q. Ge, T. Brants, P. Koehn, and T. Robinson, \u201cOne billion word benchmark for measuring progress in statistical language modeling,\u201d In Proc. INTERSPEECH, pp.2635-2639, 2014."},{"key":"8","doi-asserted-by":"crossref","unstructured":"[8] C. Chelba, J. Schalkwyk, T. Brants, V. Ha, B. Harb, W. Neveitt, C. Parada, and P. Xu, \u201cQuery language modeling for voice search,\u201d In Proc. SLT, pp.127-132, 2010.","DOI":"10.1109\/SLT.2010.5700834"},{"key":"9","doi-asserted-by":"crossref","unstructured":"[9] D. Klakow, \u201cSelecting articles from the language model training corpus,\u201d In Proc. ICASSP, vol.3, pp.1695-1698, 2000.","DOI":"10.1109\/ICASSP.2000.862077"},{"key":"10","doi-asserted-by":"crossref","unstructured":"[10] I. Bulyko, M. Ostendorf, M. Siu, T. Ng, A. Stolcke, and \u00d6. \u00c7etin, \u201cWeb resources for language modeling in conversational speech recognition,\u201d ACM Transactions on Speech and Language Processing, vol.5, no.1, pp.1-25, 2007.","DOI":"10.1145\/1322391.1322392"},{"key":"11","unstructured":"[11] R. Masumura, S. Hahm, and A. Ito, \u201cTraining a language model using webdata for large vocabulary Japanese spontaneous speech recognition,\u201d In Proc. Interspeech 2011, pp.1465-1468, 2011."},{"key":"12","unstructured":"[12] R.C. Moore and W. Lewis, \u201cIntelligent selection of language model training data,\u201d In Proc. ACL, pp.220-224, 2010."},{"key":"13","doi-asserted-by":"crossref","unstructured":"[13] L. Chen, J.L.G.L. Lamel, G. Adda, and M. Adda, \u201cUsing information retrieval methods for language model adaptation,\u201d In Proc.EUROSPEECH, pp.255-258, 2001.","DOI":"10.21437\/Eurospeech.2001-86"},{"key":"14","unstructured":"[14] T. Niesler and D. Willet, \u201cUnsupervised language model adaptation for lecture speech transcription,\u201d In Proc. ICSLP, pp.1413-1416, 2002."},{"key":"15","doi-asserted-by":"crossref","unstructured":"[15] M. Bacchiani and B. Roark, \u201cUnsupervised language model adaptation,\u201d In Proc. ICASSP, pp.224-227, 2003.","DOI":"10.1109\/ICASSP.2003.1198758"},{"key":"16","doi-asserted-by":"crossref","unstructured":"[16] R. Masumura, T. Asami, T. Oba, H. Masataki, S. Sakauchi, and A. Ito, \u201cCombinations of various language model technologies including data expansion and adaptation in spointaneous speech recognition,\u201d In Proc. INTERSPEECH, pp.463-467, 2015.","DOI":"10.21437\/Interspeech.2015-176"},{"key":"17","doi-asserted-by":"crossref","unstructured":"[17] J.T. Goodman, \u201cA bit of progress in language modeling,\u201d Computer Speech &amp; Language, vol.15, no.4, pp.403-434, 2001.","DOI":"10.1006\/csla.2001.0174"},{"key":"18","doi-asserted-by":"crossref","unstructured":"[18] M. Mohri, F. Pereira, and M. Riley, \u201cWeighted finite-state transducers in speech recognition,\u201d Computer Speech &amp; Language, vol.16, no.1, pp.69-88, 2002.","DOI":"10.1006\/csla.2001.0184"},{"key":"19","doi-asserted-by":"crossref","unstructured":"[19] T. Hori, C. Hori, Y. Minami, and A. Nakamura, \u201cEfficient WFST-based one-pass decoding with on-the-fly hypothesis rescoring in extremely large vocabulary continuous speech recognition,\u201d IEEE Trans. Audio, Speech, Language Process., vol.15, no.4, pp.1352-1365, 2007.","DOI":"10.1109\/TASL.2006.889790"},{"key":"20","doi-asserted-by":"crossref","unstructured":"[20] R. Kneser and H. Ney, \u201cImproved backing-off for m-gram language modeling,\u201d In Proc. ICASSP, vol.1, pp.181-184, 1995.","DOI":"10.1109\/ICASSP.1995.479394"},{"key":"21","doi-asserted-by":"crossref","unstructured":"[21] Y.W. Teh, \u201cA hierarchical Bayesian language model based on Pitman-Yor processes,\u201d In Proc. COLING\/ACL, pp.985-992, 2006.","DOI":"10.3115\/1220175.1220299"},{"key":"22","doi-asserted-by":"crossref","unstructured":"[22] S. Huang and M. Yor, \u201cHierarchical Pitman-Yor language models for ASR in meetings,\u201d In Proc. ASRU, pp.124-129, 2007.","DOI":"10.1109\/ASRU.2007.4430096"},{"key":"23","doi-asserted-by":"crossref","unstructured":"[23] R. Masumura, H. Masataki, T. Oba, O. Yoshioka, and S. Takahashi, \u201cUse of latent words language models in ASR: a sampling-based implementation,\u201d In Proc. ICASSP, pp.8445-8449, 2013.","DOI":"10.1109\/ICASSP.2013.6639313"},{"key":"24","doi-asserted-by":"crossref","unstructured":"[24] A. Deoras, T. Mikolov, S. Kombrink, M. Karafiat, and S.Khudanpur, \u201cVariational approximation of long-span language models in LVCSR,\u201d In Proc. ICASSP, pp.5532-5535, 2011.","DOI":"10.1109\/ICASSP.2011.5947612"},{"key":"25","doi-asserted-by":"crossref","unstructured":"[25] K. Deschacht, J.D. Belder, and M.F. Moens, \u201cThe latent wordslanguage model,\u201d Computer Speech &amp; Language, vol.26, no.5, pp.384-409, 2012.","DOI":"10.1016\/j.csl.2012.04.001"},{"key":"26","unstructured":"[26] A. Stolcke, \u201cEntropy-based pruning of backoff language models,\u201d In Proc. DARPA Broadcast News Transcription and Understanding Workshop, pp.270-274, 1998."},{"key":"27","doi-asserted-by":"crossref","unstructured":"[27] M. Federico, \u201cLanguage model adaptation through topic decomposition and MDI estimation,\u201d In Proc. ICASSP, vol.1, pp.703-706, 2002.","DOI":"10.1109\/ICASSP.2002.5743832"},{"key":"28","unstructured":"[28] Y.C. Tam and T. Schultz, \u201cUnsupervised language model adaptation using latent semantic marginals,\u201d In Proc. INTERSPEECH, pp.2207-2209, 2006."},{"key":"29","unstructured":"[29] D.M. Blei, A.Y. Ng, and M.I. Jordan, \u201cLatent Dirichlet allocation,\u201d J. Mach. Learn. Res., pp.993-1022, 2003."},{"key":"30","doi-asserted-by":"crossref","unstructured":"[30] R. Masumura, A. Ito, Y. Uno, M. Ito, and S. Makino, \u201cDocument expansion using relevant web documents for spoken document retrieval,\u201d In Proc. NLP-KE, pp.612-619, 2010.","DOI":"10.1109\/NLPKE.2010.5587854"},{"key":"31","unstructured":"[31] R. Masumura, S. Hahm, and A. Ito, \u201cLanguage model expansion using webdata for spoken document retrieval,\u201d In Proc.INTERSPEECH, pp.2133-2136, 2011."},{"key":"32","doi-asserted-by":"crossref","unstructured":"[32] H. Nanjo and T. Kawahara, \u201cLanguage model and speaking rate adaptation for spontaneous presentation speech recognition,\u201d IEEE Transaction on Speech and Audio Processing, vol.12, no.4, pp.391-400, 2004.","DOI":"10.1109\/TSA.2004.828641"},{"key":"33","unstructured":"[33] F. Jelinek and R.L. Mercer, \u201cInterpolated estimation of Markov source parameters from sparse data,\u201d pattern Recognition in Practice, pp.381-397, 1980."},{"key":"34","unstructured":"[34] Y. Bengio, R. Ducharme, P. Vincent, and C. Jauvin, \u201cA neural probabilistic language model,\u201d J. Mach. Learn. Res., vol.3, pp.1137-1155, 2003."},{"key":"35","unstructured":"[35] P. Xu and F. Jelinek, \u201cRandom forests in language modeling,\u201d In Proc. EMNLP, pp.325-332, 2004."},{"key":"36","unstructured":"[36] T. Mikolov, M. Karafiat, L. Burget, J. Cernocky, and S. Khudanpur,\u201cRecurrent neural network based language model,\u201d In Proc.INTERSPEECH, pp.1045-1048, 2010."},{"key":"37","doi-asserted-by":"crossref","unstructured":"[37] T. Mikolov, S.K. Stefan, L. Burget, J. Cernocky, and S. Khudanpur, \u201cExtensions of recurrent neural network language model,\u201d In Proc. ICASSP, pp.5528-5531, 2011.","DOI":"10.1109\/ICASSP.2011.5947611"},{"key":"38","doi-asserted-by":"crossref","unstructured":"[38] B. Roark, M. Saraclar, and M. Collins, \u201cCorrective language modeling for large vocabulary ASR with the perceptron algorithm,\u201d In Proc. ICASSP, pp.749-752, 2004.","DOI":"10.1109\/ICASSP.2004.1326094"},{"key":"39","doi-asserted-by":"crossref","unstructured":"[39] T. Oba, T. Hori, and A. Nakamura, \u201cA comparative study on methods of weighted language model training for reranking LVCSR n-best hypotheses,\u201d In Proc. ICASSP, pp.5126-5129, 2010.","DOI":"10.1109\/ICASSP.2010.5495028"},{"key":"40","doi-asserted-by":"crossref","unstructured":"[40] T. Oba, T. Hori, A. Nakamura, and A. Ito, \u201cRound-robin duel discriminative language model,\u201d IEEE Trans. Audio, Speech, Language Process., vol.20, no.4, pp.1244-1255, 2012.","DOI":"10.1109\/TASL.2011.2174225"},{"key":"41","unstructured":"[41] K. Maekawa, H. Koiso, S. Furui, and H. Isahara, \u201cSpontaneous speech corpus of Japanese,\u201d In Proc. LREC, pp.947-952, 2000."},{"key":"42","unstructured":"[42] S. Kogure, H. Nishizaki, M. Tsuchiya, K. Yamamoto, S. Togashi,and S. Nakagawa, \u201cSpeech recognition performance of CJLC: Corpus of Japanese lecture contents,\u201d In Proc. INTERSPEECH, pp.1554-1557, 2008."},{"key":"43","unstructured":"[43] H. Masataki, D. Shibata, Y. Nakazawa, S. Kobashikawa, A. Ogawa, and K. Ohtsuki, \u201cVoiceRex spontaneous speech recognition technology for contact-center conversations,\u201d NTT Technical Review, vol.5, no.1, pp.22-27, 2007."},{"key":"44","doi-asserted-by":"crossref","unstructured":"[44] T. Fuchi and S. Takagi, \u201cJapanese morphological analyzer using word co-occurrence: JTAG,\u201d In Proc. COLING\/ACL, pp.409-413, 1998.","DOI":"10.3115\/980845.980915"}],"container-title":["IEICE Transactions on Information and Systems"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/www.jstage.jst.go.jp\/article\/transinf\/E99.D\/10\/E99.D_2016SLP0013\/_pdf","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,10]],"date-time":"2025-06-10T22:12:52Z","timestamp":1749593572000},"score":1,"resource":{"primary":{"URL":"https:\/\/www.jstage.jst.go.jp\/article\/transinf\/E99.D\/10\/E99.D_2016SLP0013\/_article"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2016]]},"references-count":44,"journal-issue":{"issue":"10","published-print":{"date-parts":[[2016]]}},"URL":"https:\/\/doi.org\/10.1587\/transinf.2016slp0013","relation":{},"ISSN":["0916-8532","1745-1361"],"issn-type":[{"type":"print","value":"0916-8532"},{"type":"electronic","value":"1745-1361"}],"subject":[],"published":{"date-parts":[[2016]]}}}