{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,22]],"date-time":"2026-07-22T19:49:07Z","timestamp":1784749747590,"version":"3.55.0"},"reference-count":273,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"5","license":[{"start":{"date-parts":[[2013,5,1]],"date-time":"2013-05-01T00:00:00Z","timestamp":1367366400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Audio Speech Lang. Process."],"published-print":{"date-parts":[[2013,5]]},"DOI":"10.1109\/tasl.2013.2244083","type":"journal-article","created":{"date-parts":[[2013,1,30]],"date-time":"2013-01-30T19:04:32Z","timestamp":1359572672000},"page":"1060-1089","source":"Crossref","is-referenced-by-count":342,"title":["Machine Learning Paradigms for Speech Recognition: An Overview"],"prefix":"10.1109","volume":"21","author":[{"given":"Li","family":"Deng","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xiao","family":"Li","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref271","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2012.6288897"},{"key":"ref270","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2011.2129911"},{"key":"ref170","doi-asserted-by":"publisher","DOI":"10.1007\/3-540-44816-0_31"},{"key":"ref273","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2013.6639344"},{"key":"ref272","article-title":"Large scale distributed deep networks","author":"dean","year":"2012","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref172","first-page":"999","article-title":"Support vector machine active learning with applications to text classification","author":"tong","year":"2000","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref171","doi-asserted-by":"publisher","DOI":"10.3115\/1613715.1613855"},{"key":"ref174","doi-asserted-by":"publisher","DOI":"10.1023\/A:1007330508534"},{"key":"ref173","doi-asserted-by":"publisher","DOI":"10.1145\/130385.130417"},{"key":"ref176","doi-asserted-by":"publisher","DOI":"10.1145\/1015330.1015349"},{"key":"ref175","doi-asserted-by":"publisher","DOI":"10.1016\/B978-1-55860-377-6.50027-X"},{"key":"ref178","article-title":"Interactive submodular set cover","author":"guillory","year":"2010","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref177","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2009-730"},{"key":"ref168","author":"settles","year":"2010","journal-title":"?Active Learning Literature Survey ?"},{"key":"ref169","doi-asserted-by":"publisher","DOI":"10.1016\/B978-1-55860-335-6.50026-X"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1016\/S0167-6393(97)00018-6"},{"key":"ref38","article-title":"Modeling long term variability information in mixture stochastic trajectory framework","author":"gong","year":"1996","journal-title":"Proc Int Conf Spoken Lang Process"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1016\/0165-1684(92)90112-A"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/89.536930"},{"key":"ref31","article-title":"Continuous word recognition based on the stochastic segment model","author":"ostendorf","year":"1992","journal-title":"Proc DARPA Workshop CSR"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1109\/MSP.2009.932707"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1109\/LSP.2008.917004"},{"key":"ref267","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2010-623"},{"key":"ref36","first-page":"191","article-title":"An introduction of trajectory model into HMM-based speech synthesis","author":"zen","year":"2004","journal-title":"Proc ISCA SSW5"},{"key":"ref268","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2011.2129510"},{"key":"ref269","first-page":"211","article-title":"Sparse Bayesian learning and the relevance vector machine","author":"tipping","year":"2001","journal-title":"J Mach Learn Res"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1006\/csla.1998.0048"},{"key":"ref34","first-page":"101","article-title":"Speech recognition using hidden Markov models with polynomial regression functions as non-stationary states","volume":"2","author":"deng","year":"1994","journal-title":"IEEE Trans Acoust Speech Signal Process"},{"key":"ref181","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2004.1326014"},{"key":"ref180","doi-asserted-by":"publisher","DOI":"10.1109\/TSA.2005.848882"},{"key":"ref185","article-title":"Learning bounds for domain adaptation","author":"blitzer","year":"2008","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref184","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2005-302"},{"key":"ref183","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2010.5495650"},{"key":"ref182","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2002.5745510"},{"key":"ref189","doi-asserted-by":"publisher","DOI":"10.1109\/89.279278"},{"key":"ref188","doi-asserted-by":"publisher","DOI":"10.3115\/112405.112457"},{"key":"ref187","doi-asserted-by":"publisher","DOI":"10.1145\/1015330.1015436"},{"key":"ref186","article-title":"Incremental learning with support vector machines","author":"r\ufffdping","year":"2001","journal-title":"Proc IEEE Int Conf Data Mining"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2002.5743867"},{"key":"ref27","first-page":"869","article-title":"HMM adaptation using vector taylor series for noisy speech recognition","author":"acero","year":"2000","journal-title":"Proc Int Conf Spoken Lang Process"},{"key":"ref179","article-title":"Adaptive submodularity: A new approach to active learning and stochastic optimization","author":"golovin","year":"2010","journal-title":"Proc Int Conf Learn Theory"},{"key":"ref29","article-title":"Algonquin: Iterating Laplaces method to remove multiple types of acoustic distortion for robust speech recognition","author":"frey","year":"2000","journal-title":"Proc EUROSPEECH"},{"key":"ref20","doi-asserted-by":"crossref","first-page":"30","DOI":"10.1109\/TASL.2011.2134090","article-title":"Context-dependent pre-trained deep neural networks for large-vocabulary speech recognition","volume":"20","author":"dahl","year":"2012","journal-title":"IEEE Trans Audio Speech Lang Process"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/PROC.1976.10159"},{"key":"ref21","author":"baker","year":"1976","journal-title":"Speech Recognit"},{"key":"ref24","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1111\/j.2517-6161.1977.tb01600.x","article-title":"Maximum-likelihood from incomplete data via the EM algorithm","volume":"39","author":"dempster","year":"1977","journal-title":"J R Statist Soc Ser B"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1214\/aoms\/1177699147"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1109\/89.536929"},{"key":"ref25","author":"huang","year":"2001","journal-title":"Spoken Language Processing A Guide to Theory Algorithm System Development"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2003.1198920"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2004.1326145"},{"key":"ref154","doi-asserted-by":"publisher","DOI":"10.1145\/279943.279962"},{"key":"ref153","doi-asserted-by":"publisher","DOI":"10.3115\/981658.981684"},{"key":"ref156","article-title":"Learning from labeled and unlabeled data using graph mincut","author":"blum","year":"2001","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref155","doi-asserted-by":"publisher","DOI":"10.1145\/354756.354805"},{"key":"ref150","first-page":"368","article-title":"Semi-supervised support vector machines","author":"bennett","year":"1998","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref152","article-title":"Large scale transductive SVMs","author":"collobert","year":"2006","journal-title":"J Mach Learn Res"},{"key":"ref151","doi-asserted-by":"publisher","DOI":"10.1145\/1143844.1143868"},{"key":"ref146","doi-asserted-by":"publisher","DOI":"10.3115\/1220175.1220202"},{"key":"ref147","article-title":"Generalized expectation criteria for semi-supervised learning of conditional random fields","author":"mann","year":"2008","journal-title":"Proc Assoc Comput Linguist"},{"key":"ref148","doi-asserted-by":"publisher","DOI":"10.3115\/1699648.1699675"},{"key":"ref149","author":"bilmes","year":"2004","journal-title":"?On soft evidence in Bayesian networks ?"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2011.2165280"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.1109\/MSP.2005.1511827"},{"key":"ref57","author":"bilmes","year":"2003","journal-title":"Mathematical Foundations of Speech and Language Processing"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2010.2050717"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2009.2022198"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1109\/MSP.2010.937999"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2004.1326109"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2007.901312"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1016\/S0167-6393(98)00023-5"},{"key":"ref167","doi-asserted-by":"publisher","DOI":"10.1006\/csla.2001.0186"},{"key":"ref166","doi-asserted-by":"publisher","DOI":"10.1016\/j.csl.2009.03.004"},{"key":"ref165","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2008-116"},{"key":"ref164","doi-asserted-by":"publisher","DOI":"10.1109\/TSA.2004.838537"},{"key":"ref163","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2001.940841"},{"key":"ref162","article-title":"Unsupervised training of a speech recognizer: Recent experiments","author":"kemp","year":"1999","journal-title":"Proc EUROSPEECH"},{"key":"ref161","article-title":"Entropic graph regularization in non-parametric semi-supervised classification","author":"subramanya","year":"2009","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref160","article-title":"Manifold regularization: A geometric framework for learning from labeled and unlabeled examples","volume":"7","author":"sindhwani","year":"2006","journal-title":"J Mach Learn Res"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/MSP.2010.938078"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/MSP.2010.938115"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1198\/016214505000000907"},{"key":"ref5","first-page":"66","article-title":"Single-channel multitalker speech recognition?Graphical modeling approaches","volume":"33","author":"rennie","year":"2010","journal-title":"IEEE Signal Process Mag"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1007\/BF00994018"},{"key":"ref159","article-title":"Learning with local and global consistency","author":"zhou","year":"2003","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref7","author":"vapnik","year":"1998","journal-title":"Statistical Learning Theory"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-60087-6_20"},{"key":"ref157","article-title":"Partially labeled classification with Markov random walks","volume":"14","author":"szummer","year":"2001","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1145\/279943.279989"},{"key":"ref158","article-title":"Semi-supervised learning using Gaussian fields and harmonic functions","author":"zhu","year":"2003","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1016\/S0885-2308(03)00010-X"},{"key":"ref45","doi-asserted-by":"crossref","DOI":"10.1007\/978-3-031-02555-6","author":"deng","year":"2006","journal-title":"Dynamic Speech Models?Theory Algorithm Applications"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1109\/TSA.2005.854107"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2006.878265"},{"key":"ref42","article-title":"An investigation fo segmental hidden dynamic models of speech coarticulation for automatic speech recognition","author":"bridle","year":"1998","journal-title":"Final Rep for 1998 Workshop on Language Engineering CLSP Johns Hopkins"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.1999.758074"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1016\/j.csl.2004.08.001"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1006\/csla.1999.0136"},{"key":"ref73","first-page":"105","article-title":"Minimum phone error and i-smoothing for improved discriminative training","author":"povey","year":"2002","journal-title":"Proc IEEE Int Conf Acoust Speech Signal Process"},{"key":"ref72","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2010-307"},{"key":"ref71","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2005-126"},{"key":"ref70","first-page":"282","article-title":"Conditional random fields: Probabilistic models for segmenting and labeling sequence data","author":"lafferty","year":"2001","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref76","article-title":"Minimum Bayes-risk decoding for statistical machine translation","author":"kumar","year":"2004","journal-title":"Proc HLT-NAACL"},{"key":"ref77","doi-asserted-by":"publisher","DOI":"10.1109\/MSP.2011.941852"},{"key":"ref74","doi-asserted-by":"crossref","first-page":"14","DOI":"10.1109\/MSP.2008.926652","article-title":"Discriminative learning in sequential pattern recognition?A unifying review for optimization-oriented speech recognition","volume":"25","author":"he","year":"2008","journal-title":"IEEE Signal Process Mag"},{"key":"ref75","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2012.2203805"},{"key":"ref78","first-page":"292","article-title":"Maximum expected BLEU training of phrase and lexicon translation models","author":"he","year":"2012","journal-title":"Proc Assoc Comput Linguist"},{"key":"ref79","doi-asserted-by":"publisher","DOI":"10.1109\/89.568732"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1109\/MSP.2010.938028"},{"key":"ref62","first-page":"115","author":"deng","year":"2003","journal-title":"Mathematical Foundations of Speech and Language Processing"},{"key":"ref61","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2010.2092764"},{"key":"ref63","doi-asserted-by":"publisher","DOI":"10.1121\/1.1315288"},{"key":"ref64","doi-asserted-by":"publisher","DOI":"10.1109\/TSA.2003.820201"},{"key":"ref65","article-title":"Empirical risk minimization of graphical model parameters given approximate inference, decoding, model structure","author":"stoyanov","year":"2011","journal-title":"Proc AISTAT"},{"key":"ref66","doi-asserted-by":"publisher","DOI":"10.1006\/csla.2000.0138"},{"key":"ref67","doi-asserted-by":"publisher","DOI":"10.1109\/TSA.2004.825678"},{"key":"ref68","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2010.2091635"},{"key":"ref69","author":"bishop","year":"2006","journal-title":"Pattern Recognit Mach Learn"},{"key":"ref197","doi-asserted-by":"publisher","DOI":"10.1145\/225298.225336"},{"key":"ref198","first-page":"1","article-title":"Domain adaptation for statistical classifiers","volume":"26","author":"daum\ufffd and d marcu","year":"2006","journal-title":"J Artif Intell Res"},{"key":"ref199","article-title":"Multiple source adaptation and the Renyi divergence","author":"mansour","year":"2009","journal-title":"Proc Uncertainty Artif Intell"},{"key":"ref193","doi-asserted-by":"publisher","DOI":"10.1006\/csla.1996.0013"},{"key":"ref194","doi-asserted-by":"crossref","DOI":"10.21437\/Eurospeech.1995-411","article-title":"Speaker-adaptation for hybrid HMM-ANN continuous speech recognition system","author":"neto","year":"1995","journal-title":"Proc EUROSPEECH"},{"key":"ref195","doi-asserted-by":"crossref","DOI":"10.21437\/Eurospeech.1995-414","article-title":"Connectionist speaker normalization and adaptation","author":"abrash","year":"1995","journal-title":"Proc EUROSPEECH"},{"key":"ref196","doi-asserted-by":"publisher","DOI":"10.1023\/A:1007379606734"},{"key":"ref95","article-title":"Hybrid SVM\/HMM architectures for speech recognition","author":"ganapathiraju","year":"2000","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref94","doi-asserted-by":"publisher","DOI":"10.1109\/MSP.2005.1511826"},{"key":"ref190","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2003.1198758"},{"key":"ref93","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2010.2045943"},{"key":"ref191","article-title":"Adaptation of maximum entropy capitalizer: Little data can help a lot","author":"chelba","year":"2004","journal-title":"Proc EMNLP"},{"key":"ref92","doi-asserted-by":"publisher","DOI":"10.1007\/BFb0054006"},{"key":"ref192","doi-asserted-by":"publisher","DOI":"10.1006\/csla.1995.0010"},{"key":"ref91","doi-asserted-by":"publisher","DOI":"10.1007\/978-1-4615-3210-1"},{"key":"ref90","doi-asserted-by":"publisher","DOI":"10.1109\/72.286885"},{"key":"ref98","article-title":"Structured log linear models for noise robust speech recognition","volume":"17","author":"zhang","year":"2010","journal-title":"IEEE Signal Process Lett"},{"key":"ref99","first-page":"49","article-title":"Maximum mutual information estimation of HMM parameters for speech recognition","author":"bahl","year":"1986","journal-title":"Proc IEEE Int Conf Acoust Speech Signal Process"},{"key":"ref96","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2004-265"},{"key":"ref97","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2005.1415088"},{"key":"ref82","doi-asserted-by":"publisher","DOI":"10.1145\/1015330.1015341"},{"key":"ref81","first-page":"219","article-title":"Support vector machines for multi-class pattern recognition","author":"weston","year":"1999","journal-title":"Eur Symp Artif Neural Netw"},{"key":"ref84","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2006-218"},{"key":"ref83","doi-asserted-by":"crossref","first-page":"873","DOI":"10.1109\/TSA.2005.858064","article-title":"Maximum entropy direct models for speech recognition","volume":"14","author":"kuo","year":"2006","journal-title":"IEEE Audio Speech Lang Process"},{"key":"ref80","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2011.2165279"},{"key":"ref89","doi-asserted-by":"publisher","DOI":"10.1109\/89.260359"},{"key":"ref85","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2009.2022204"},{"key":"ref86","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2008.2010286"},{"key":"ref87","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2009-235"},{"key":"ref88","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2010-35"},{"key":"ref200","article-title":"Domain adaptation: Learning bounds and algorithms","author":"mansour","year":"2009","journal-title":"Proc Workshop Comput Learn Theory"},{"key":"ref101","doi-asserted-by":"publisher","DOI":"10.1006\/csla.2001.0182"},{"key":"ref100","doi-asserted-by":"publisher","DOI":"10.1109\/18.52483"},{"key":"ref209","doi-asserted-by":"publisher","DOI":"10.1109\/TSA.2003.818076"},{"key":"ref203","article-title":"Maximum a posteriori linear regression for hidden Markov model adaptation","author":"chesta","year":"1999","journal-title":"Proc EUROSPEECH"},{"key":"ref204","article-title":"Structural maximum a posteriori linear regression for unsupervised speaker adaptation","author":"myrvoll","year":"2000","journal-title":"Proc Int Conf Spoken Lang Process"},{"key":"ref201","author":"deng","year":"2011","journal-title":"Front-End Back-End Hybrid Techniques to Noise-Robust Speech Recognition Chapter 4 in Book Robust Speech Recognition of Uncertain Data"},{"key":"ref202","doi-asserted-by":"crossref","DOI":"10.21437\/Eurospeech.1995-283","article-title":"Adaptation algorithms for large scale HMM recognizers","author":"zavaliagkos","year":"1995","journal-title":"Proc EUROSPEECH"},{"key":"ref207","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2010.2040522"},{"key":"ref208","first-page":"2409","article-title":"Distributed speech processing in mipad's multimodal user interface","volume":"20","author":"deng","year":"2012","journal-title":"IEEE Audio Speech Lang Process"},{"key":"ref205","doi-asserted-by":"publisher","DOI":"10.1109\/ICSLP.1996.607807"},{"key":"ref206","first-page":"806","article-title":"Large vocabulary speech recognition under adverse acoustic environment","author":"deng","year":"2000","journal-title":"Proc Int Conf Spoken Lang Process"},{"key":"ref211","doi-asserted-by":"publisher","DOI":"10.1016\/j.csl.2009.02.001"},{"key":"ref210","first-page":"65","article-title":"High-performance HMM adaptation with joint compensation of additive and convolutive distortions via vector Taylor series","author":"li","year":"2007","journal-title":"Proc IEEE Workshop Autom Speech Recog and Understanding"},{"key":"ref212","doi-asserted-by":"publisher","DOI":"10.1109\/89.650313"},{"key":"ref213","doi-asserted-by":"publisher","DOI":"10.1109\/89.848223"},{"key":"ref214","doi-asserted-by":"publisher","DOI":"10.1109\/89.876308"},{"key":"ref215","doi-asserted-by":"publisher","DOI":"10.3115\/1220175.1220245"},{"key":"ref216","article-title":"Semisupervised alignment of manifolds","author":"ham","year":"2005","journal-title":"Proc Int Workshop Artif Intell Statist"},{"key":"ref217","article-title":"Manifold alignment without correspondence","author":"wang","year":"2009","journal-title":"Proc 21st Int Joint Conf Artif Intell"},{"key":"ref218","article-title":"Translated learning: Transfer learning across different feature spaces","author":"dai","year":"2008","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref219","doi-asserted-by":"publisher","DOI":"10.3115\/1613715.1613800"},{"key":"ref220","doi-asserted-by":"publisher","DOI":"10.1613\/jair.731"},{"key":"ref222","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-540-45167-9_41"},{"key":"ref221","doi-asserted-by":"publisher","DOI":"10.1007\/978-1-4615-5529-2"},{"key":"ref229","first-page":"615","article-title":"Learning multiple tasks with kernel methods","volume":"6","author":"evgeniou","year":"2005","journal-title":"J Mach Learn Res"},{"key":"ref228","article-title":"Bayesian multitask learning with latent hierarchies","author":"daume","year":"2009","journal-title":"Proc Uncertainty in Artif Intell"},{"key":"ref227","first-page":"35","article-title":"Multi-task learning for classification with Dirichlet process priors","volume":"8","author":"xue","year":"2007","journal-title":"J Mach Learn Res"},{"key":"ref226","doi-asserted-by":"publisher","DOI":"10.1145\/1102351.1102479"},{"key":"ref225","article-title":"Empirical Bayes for learning to learn","author":"heskes","year":"2000","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref224","doi-asserted-by":"publisher","DOI":"10.1023\/A:1007327622663"},{"key":"ref223","first-page":"1817","article-title":"A framework for learning predictive structures from multiple tasks and unlabeled data","volume":"6","author":"ando","year":"2005","journal-title":"J Mach Learn Res"},{"key":"ref127","doi-asserted-by":"publisher","DOI":"10.1109\/TSA.2003.819951"},{"key":"ref126","doi-asserted-by":"publisher","DOI":"10.1109\/89.902277"},{"key":"ref125","doi-asserted-by":"publisher","DOI":"10.1109\/89.568731"},{"key":"ref124","doi-asserted-by":"publisher","DOI":"10.1016\/S0167-6393(00)00035-2"},{"key":"ref129","doi-asserted-by":"publisher","DOI":"10.1016\/j.csl.2007.03.004"},{"key":"ref128","doi-asserted-by":"publisher","DOI":"10.1109\/89.725317"},{"key":"ref130","doi-asserted-by":"publisher","DOI":"10.1121\/1.2404622"},{"key":"ref133","doi-asserted-by":"publisher","DOI":"10.1126\/science.1127647"},{"key":"ref134","doi-asserted-by":"publisher","DOI":"10.1162\/neco.2006.18.7.1527"},{"key":"ref131","article-title":"Exploiting generative models in discriminative classifiers","volume":"11","author":"jaakkola","year":"1998","journal-title":"Adv Neural Inf Process Syst"},{"key":"ref132","article-title":"Multi-conditional learning: Generative\/discriminative training for clustering and classification","author":"mccallum","year":"2006","journal-title":"Proc AAAI"},{"key":"ref232","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2010-487"},{"key":"ref233","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2009.4960588"},{"key":"ref230","article-title":"Spectral regularization framework for multi-task structure learning","author":"argyriou","year":"2007","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref231","article-title":"Multimodal deep learning","author":"ngiam","year":"2011","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref239","doi-asserted-by":"publisher","DOI":"10.1109\/MSP.2012.2205597"},{"key":"ref238","doi-asserted-by":"publisher","DOI":"10.1121\/1.1420380"},{"key":"ref235","first-page":"109","article-title":"From knowledge-ignorant to knowledge-rich modeling: A new speech research paradigm for next-generation automatic speech recognition","author":"lee","year":"2004","journal-title":"Proc Int Conf Spoken Lang Process"},{"key":"ref234","first-page":"4193","article-title":"Cross-lingual speech recognition under run-time resource constraints","author":"yu","year":"2009","journal-title":"Proc IEEE Int Conf Acoust Speech Signal Process"},{"key":"ref237","doi-asserted-by":"publisher","DOI":"10.1121\/1.409839"},{"key":"ref236","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2007-510"},{"key":"ref136","author":"little","year":"1987","journal-title":"Statistical Analysis with Missing Data"},{"key":"ref135","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2010.2082532"},{"key":"ref138","doi-asserted-by":"publisher","DOI":"10.1109\/5.18626"},{"key":"ref137","author":"bilmes","year":"1997","journal-title":"?A gentle tutorial of the EM algorithm and its application to parameter estimation for Gaussian mixture and hidden Markov models ?"},{"key":"ref139","author":"zhu","year":"2006","journal-title":"?Semi-supervised learning literature survey ?"},{"key":"ref140","article-title":"Transductive inference for text classification using support vector machines","author":"joachims","year":"1999","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref141","author":"zhu","year":"2002","journal-title":"?Learning from labeled and unlabeled data with label propagation ?"},{"key":"ref142","article-title":"Transductive learning via spectral graph partitioning","author":"joachims","year":"2003","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref143","article-title":"A mixture of experts classifier with learning based on both labeled and unlabeled data","author":"miller","year":"1996","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref2","author":"huang","year":"0","journal-title":"Handbook of Natural Language Processing Second Edition"},{"key":"ref144","doi-asserted-by":"publisher","DOI":"10.1023\/A:1007692713085"},{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/MSP.2009.932166"},{"key":"ref145","article-title":"Semi-supervised learning by entropy minimization","author":"grandvalet","year":"2004","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref241","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2011.2109382"},{"key":"ref242","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2012.6288994"},{"key":"ref243","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2012.268"},{"key":"ref244","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2012.6288861"},{"key":"ref240","doi-asserted-by":"publisher","DOI":"10.1162\/NECO_a_00052"},{"key":"ref248","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2012.6288333"},{"key":"ref247","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2012.6288833"},{"key":"ref246","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2011.5947401"},{"key":"ref245","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2012.6288837"},{"key":"ref249","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2012.6288864"},{"key":"ref109","first-page":"1249","article-title":"Large margin hidden Markov models for automatic speech recognition","volume":"19","author":"sha","year":"2007","journal-title":"Adv Neural Inf Process Syst"},{"key":"ref108","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2012-3"},{"key":"ref107","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2011.5947631"},{"key":"ref106","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2008.2001106"},{"key":"ref105","doi-asserted-by":"publisher","DOI":"10.1109\/5.880082"},{"key":"ref104","doi-asserted-by":"publisher","DOI":"10.1016\/j.csl.2008.03.002"},{"key":"ref103","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2006-606"},{"key":"ref102","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2006.876778"},{"key":"ref111","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2006.879805"},{"key":"ref112","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2007.905151"},{"key":"ref110","doi-asserted-by":"publisher","DOI":"10.1109\/MSP.2010.936016"},{"key":"ref250","article-title":"Roles of pre-training and fine-tuning in context-dependent DBN-HMMs for real-world speech recognition","author":"yu","year":"2010","journal-title":"Proc NIPS Workshop Deep Learn Unsupervised Feature Learn"},{"key":"ref251","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2011.5947494"},{"key":"ref254","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2012-4"},{"key":"ref255","article-title":"Discriminative learning of sum-product networks","author":"gens","year":"2012","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref252","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2012-2"},{"key":"ref253","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2012-5"},{"key":"ref257","doi-asserted-by":"publisher","DOI":"10.1561\/2200000006"},{"key":"ref256","article-title":"Learning with recursive perceptual representations","author":"vinyals","year":"2012","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref10","author":"jaakkola","year":"1999","journal-title":"?Maximum entropy discrimination ?"},{"key":"ref259","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2012.2227738"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/MSP.2012.2207140"},{"key":"ref258","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2011.2116010"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2012.2227734"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1145\/1102351.1102434"},{"key":"ref14","author":"koller","year":"2009","journal-title":"Probabilistic Graphical Models Principles and Techniques"},{"key":"ref15","author":"rabiner","year":"1993","journal-title":"Fundamentals of speech recognition"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1109\/TIT.1986.1057145"},{"key":"ref118","doi-asserted-by":"publisher","DOI":"10.1109\/MSP.2010.938085"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/78.134406"},{"key":"ref117","first-page":"4053","article-title":"A convex optimization method for joint mean and variance parameter estimation of large-margin CDHMM","author":"chang","year":"2008","journal-title":"Proc IEEE Int Conf Acoust Speech Signal Process"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1093\/ietisy\/e89-d.3.869"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1016\/0885-2308(90)90015-X"},{"key":"ref119","doi-asserted-by":"publisher","DOI":"10.2200\/S00134ED1V01Y200807SAP004"},{"key":"ref114","doi-asserted-by":"publisher","DOI":"10.1109\/MSP.2010.936018"},{"key":"ref113","first-page":"265","article-title":"On the algorithmic implementation of multi-class kernel-based vector machines","volume":"2","author":"crammer","year":"2001","journal-title":"J Mach Learn Res"},{"key":"ref116","article-title":"A Bayesian divergence prior for classifier adaptation","author":"li","year":"2007","journal-title":"Proc Int Conf Artif Intell Statist"},{"key":"ref115","first-page":"265","article-title":"Large margin Gaussian mixture modeling for phonetic classification and recognition","author":"sha","year":"2006","journal-title":"Proc IEEE Int Conf Acoust Speech Signal Process"},{"key":"ref120","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2010.5495228"},{"key":"ref121","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2011.2144969"},{"key":"ref122","article-title":"Phone-discriminating minimum classification error (p-mce) training for phonetic recognition","author":"fu","year":"2007","journal-title":"Proc INTERSPEECH"},{"key":"ref123","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2009.2032607"},{"key":"ref260","doi-asserted-by":"publisher","DOI":"10.1016\/j.neucom.2012.11.008"},{"key":"ref261","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2010-304"},{"key":"ref262","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2010-619"},{"key":"ref263","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2011.2155060"},{"key":"ref264","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2007.894524"},{"key":"ref265","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2010-621"},{"key":"ref266","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2011.2112350"}],"container-title":["IEEE Transactions on Audio, Speech, and Language Processing"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx5\/10376\/6428687\/06423821.pdf?arnumber=6423821","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,5,5]],"date-time":"2024-05-05T09:18:53Z","timestamp":1714900733000},"score":1,"resource":{"primary":{"URL":"http:\/\/ieeexplore.ieee.org\/document\/6423821\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2013,5]]},"references-count":273,"journal-issue":{"issue":"5"},"URL":"https:\/\/doi.org\/10.1109\/tasl.2013.2244083","relation":{},"ISSN":["1558-7916","1558-7924"],"issn-type":[{"value":"1558-7916","type":"print"},{"value":"1558-7924","type":"electronic"}],"subject":[],"published":{"date-parts":[[2013,5]]}}}