{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,10,10]],"date-time":"2025-10-10T21:37:22Z","timestamp":1760132242795},"reference-count":83,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"6","license":[{"start":{"date-parts":[[2012,11,1]],"date-time":"2012-11-01T00:00:00Z","timestamp":1351728000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Signal Process. Mag."],"published-print":{"date-parts":[[2012,11]]},"DOI":"10.1109\/msp.2012.2210952","type":"journal-article","created":{"date-parts":[[2012,10,19]],"date-time":"2012-10-19T20:36:29Z","timestamp":1350678989000},"page":"44-57","source":"Crossref","is-referenced-by-count":25,"title":["Subword Modeling for Automatic Speech Recognition: Past, Present, and Emerging Approaches"],"prefix":"10.1109","volume":"29","author":[{"given":"Karen","family":"Livescu","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Eric","family":"Fosler-Lussier","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Florian","family":"Metze","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref73","first-page":"282","article-title":"Conditional random fields: Probabilistic models for segmenting and labeling sequence data","author":"lafferty","year":"0","journal-title":"Proc Int Conf Machine Learning (ICML)"},{"key":"ref72","author":"koller","year":"0","journal-title":"Probabilistic Graphical Models Principles and Techniques"},{"key":"ref71","doi-asserted-by":"crossref","DOI":"10.1093\/oso\/9780198522195.001.0001","author":"lauritzen","year":"1996","journal-title":"Graphical Models"},{"key":"ref70","doi-asserted-by":"publisher","DOI":"10.1109\/MSP.2005.1511827"},{"key":"ref76","first-page":"2181","article-title":"Discriminative learning of Bayesian networks via factorized conditional log-likelihood","volume":"12","author":"carvalho","year":"2011","journal-title":"J Mach Learn Res"},{"key":"ref77","first-page":"iv-645","article-title":"An articulatory feature-based tandem approach and factored observation modeling","author":"\u00e7etin","year":"0","journal-title":"Proc Int Conf Acoustics Speech and Signal Processing (ICASSP)"},{"key":"ref74","first-page":"1453","article-title":"Large margin methods for structured and interdependent output variables","volume":"6","author":"tsochantaridis","year":"2005","journal-title":"J Machine Learning Research"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2011.5947455"},{"key":"ref75","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1111\/j.2517-6161.1977.tb01600.x","article-title":"Maximum likelihood from incomplete data via the EM algorithm","volume":"39","author":"dempster","year":"1977","journal-title":"J Roy Statist Soc"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1109\/ICSLP.1996.607274"},{"key":"ref78","doi-asserted-by":"publisher","DOI":"10.1109\/ASRU.2011.6163909"},{"key":"ref79","first-page":"194","article-title":"Discriminative pronunciation modeling: A large-margin, feature-rich approach","author":"tang","year":"0","journal-title":"Proc Association for Computational Linguistics (ACL)"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1016\/j.specom.2005.03.004"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/ASRU.1997.659009"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1016\/S0167-6393(99)00036-9"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1016\/S0167-6393(99)00037-0"},{"key":"ref37","first-page":"53","article-title":"On the road to improved lexical confusability metrics","author":"fosler-lussier","year":"0","journal-title":"Proc ITRW PMLA"},{"key":"ref36","first-page":"107","article-title":"Measuring the confusability of pronunciations in speech recognition","author":"karanasou","year":"0","journal-title":"Proc 9th Int Workshop Finite State Methods and Natural Language Processing"},{"key":"ref35","first-page":"4445","article-title":"Discriminative pronunciation learning using phonetic decoder and minimum-classification-error criterion","author":"vinyals","year":"0","journal-title":"Proc Int Conf Acoustics Speech and Signal Processing (ICASSP)"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1016\/S0885-2308(02)00030-X"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2011.5947454"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.1109\/ASRU.2003.1318394"},{"key":"ref61","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2011.5947522"},{"key":"ref63","doi-asserted-by":"publisher","DOI":"10.1109\/LSP.2010.2077626"},{"key":"ref28","year":"0","journal-title":"Proc Int Tutorial and Research Workshop Pronunciation Modeling and Lexicon Adaptation for Spoken Language Technology"},{"key":"ref64","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2010.2082532"},{"key":"ref27","article-title":"Special issue on modeling pronunciation variation for automatic speech recognition","volume":"29","author":"bourlard","year":"0","journal-title":"Speech Commun"},{"key":"ref65","first-page":"5044","article-title":"Speech recognition with segmental conditional random fields: A summary of the JHU CLSP summer workshop","author":"zweig","year":"0","journal-title":"Proc Int Conf Acoustics Speech and Signal Processing (ICASSP)"},{"key":"ref66","first-page":"1117","article-title":"Hidden conditional random fields for phone classification","author":"gunawardana","year":"0","journal-title":"Proc INTERSPEECH"},{"key":"ref29","article-title":"Modeling systematic variations in pronunciation via a language-dependent hidden speaking mode","author":"ostendorf","year":"0","journal-title":"Proc Int Conf Spoken Language Processing (ICSLP)"},{"key":"ref67","doi-asserted-by":"publisher","DOI":"10.1109\/ASRU.2009.5373329"},{"key":"ref68","author":"zweig","year":"1998","journal-title":"Speech Recognition Using Dynamic Bayesian Networks"},{"key":"ref69","author":"bilmes","year":"1999","journal-title":"Natural statistical models for automatic speech recognition"},{"key":"ref2","article-title":"Moving beyond the &#x2018;beads-on-a-string&#x2019; model of speech","author":"ostendorf","year":"0","journal-title":"Proc IEEE Workshop Automatic Speech Recognition and Understanding (ASRU)"},{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1121\/1.385779"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2002.5743871"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1016\/S0167-6393(03)00031-1"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1121\/1.409839"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1121\/1.2404622"},{"key":"ref23","first-page":"2529","article-title":"Hidden feature models for speech recognition using dynamic Bayesian networks","author":"livescu","year":"0","journal-title":"Proc EUROSPEECH"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1016\/S0167-6393(01)00020-6"},{"key":"ref25","first-page":"2133","article-title":"A flexible stream architecture for ASR using articulatory features","author":"metze","year":"0","journal-title":"Proc Int Conf Spoken Language Processing (ICSLP)"},{"key":"ref50","author":"livescu","year":"2005","journal-title":"Feature-based pronunciation modeling for automatic speech recognition"},{"key":"ref51","first-page":"1033","article-title":"Integrating multilingual articulatory features into speech recognition","author":"st\u00fcker","year":"0","journal-title":"Proc EUROSPEECH"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2007.366989"},{"key":"ref58","first-page":"677","article-title":"Feature-based pronunciation modeling with trainable asynchrony probabilities","author":"livescu","year":"0","journal-title":"Proc Int Conf Spoken Language Processing (ICSLP)"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.1016\/S0167-6393(98)00023-5"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1016\/S0167-6393(97)00018-6"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1159\/000261913"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2008.916057"},{"key":"ref53","first-page":"15","article-title":"Speech recognition via phonetically-featured syllables","author":"king","year":"0","journal-title":"Proc Workshop Phonetics and Phonology in ASR &#x201C;Phonus 5 &#x201D;"},{"key":"ref52","article-title":"Language independent and language adaptive large vocabulary speech recognition","author":"schultz","year":"0","journal-title":"Proc Int Conf Spoken Language Processing (ICSLP)"},{"key":"ref10","author":"fosler-lussier","year":"1999","journal-title":"Dynamic Pronunciation Models for Automatic Speech Recognition"},{"key":"ref11","first-page":"841","article-title":"Compensating for hyperarticulation by modeling articulatory properties","author":"soltau","year":"0","journal-title":"Proc Int Conf Spoken Language Processing (ICSLP)"},{"key":"ref40","first-page":"549","article-title":"Pronunciation learning from continuous speech","author":"badr","year":"0","journal-title":"Proc INTERSPEECH"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1044\/jshr.2801.96"},{"key":"ref13","article-title":"Insights into spoken language gleaned from phonetic transcription of the Switchboard corpus","author":"greenberg","year":"0","journal-title":"Proc Int Conf Spoken Language Processing (ICSLP)"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1016\/j.specom.2005.03.006"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1121\/1.381666"},{"key":"ref82","author":"keshet","year":"0","journal-title":"Automatic Speech and Speaker Recognition Large Margin and Kernel Methods"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1109\/TASSP.1975.1162631"},{"key":"ref81","doi-asserted-by":"publisher","DOI":"10.3115\/1219840.1219882"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/89.917681"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1016\/S0167-6393(99)00033-3"},{"key":"ref83","doi-asserted-by":"crossref","first-page":"104","DOI":"10.1109\/TASSP.1975.1162639","article-title":"The role of phonological rules in speech undersanding research","volume":"23","author":"oshika","year":"0","journal-title":"IEEE Trans Acoust Speech Signal Processing"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/89.985546"},{"key":"ref80","article-title":"Using automatically-derived acoustic subword units in large vocabulary speech recognition","author":"bacchiani","year":"0","journal-title":"Proc Int Conf Spoken Language Processing (ICSLP)"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1561\/2000000004"},{"key":"ref3","author":"odell","year":"1995","journal-title":"The use of context in large vocabulary speech recognition"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1121\/1.3183593"},{"key":"ref5","article-title":"Effect of speaking style on LVCSR performance","author":"weintraub","year":"0","journal-title":"Proc Int Conf Spoken Language Processing (ICSLP)"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2005.1416462"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1016\/S0167-6393(99)00032-1"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1016\/j.specom.2005.03.008"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2001.940897"},{"key":"ref46","first-page":"1333","article-title":"Automatically learning speaker-independent acoustic subword units","author":"varadarajan","year":"0","journal-title":"Proc INTERSPEECH"},{"key":"ref45","doi-asserted-by":"crossref","first-page":"137","DOI":"10.1006\/csla.2000.0140","article-title":"Pronunciation modeling by sharing Gaussian densities across phonetic models","volume":"14","author":"sara\u00e7lar","year":"0","journal-title":"Comput Speech Lang"},{"key":"ref48","first-page":"1327","article-title":"Dynamic HMM selection for continuous speech recognition","author":"hain","year":"0","journal-title":"Proc EUROSPEECH"},{"key":"ref47","first-page":"40","article-title":"A nonparametric Bayesian approach to acoustic model discovery","author":"lee","year":"0","journal-title":"Proc Association for Computational Linguistics (ACL)"},{"key":"ref42","doi-asserted-by":"crossref","first-page":"375","DOI":"10.1016\/j.csl.2003.09.005","article-title":"Pronunciation change in conversational speech and its implications for automatic speech recognition","volume":"18","author":"sara\u00e7lar","year":"0","journal-title":"Comput Speech Lang"},{"key":"ref41","first-page":"i-773-6","article-title":"The 2003 ISL rich transcription system for conversational telephony speechm","author":"soltau","year":"0","journal-title":"Proc Int Conf Acoustics Speech and Signal Processing (ICASSP)"},{"key":"ref44","first-page":"129","article-title":"Implicit pronunciation modeling","author":"hain","year":"0","journal-title":"Proc ITRW PMLA"},{"key":"ref43","first-page":"108","article-title":"An improved subword based speech recognizer","author":"svendsen","year":"0","journal-title":"Proc ICASSP"}],"container-title":["IEEE Signal Processing Magazine"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx5\/79\/6296521\/06296531.pdf?arnumber=6296531","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,4,30]],"date-time":"2024-04-30T12:56:45Z","timestamp":1714481805000},"score":1,"resource":{"primary":{"URL":"http:\/\/ieeexplore.ieee.org\/document\/6296531\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2012,11]]},"references-count":83,"journal-issue":{"issue":"6"},"URL":"https:\/\/doi.org\/10.1109\/msp.2012.2210952","relation":{},"ISSN":["1053-5888"],"issn-type":[{"value":"1053-5888","type":"print"}],"subject":[],"published":{"date-parts":[[2012,11]]}}}