{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,7,27]],"date-time":"2025-07-27T07:37:34Z","timestamp":1753601854457,"version":"3.38.0"},"reference-count":75,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"6","license":[{"start":{"date-parts":[[2010,12,1]],"date-time":"2010-12-01T00:00:00Z","timestamp":1291161600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE J. Sel. Top. Signal Process."],"published-print":{"date-parts":[[2010,12]]},"DOI":"10.1109\/jstsp.2010.2079315","type":"journal-article","created":{"date-parts":[[2010,9,29]],"date-time":"2010-09-29T19:24:40Z","timestamp":1285788280000},"page":"1046-1058","source":"Crossref","is-referenced-by-count":11,"title":["Measuring the Gap Between HMM-Based ASR and TTS"],"prefix":"10.1109","volume":"4","author":[{"given":"John","family":"Dines","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Junichi","family":"Yamagishi","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Simon","family":"King","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref73","doi-asserted-by":"crossref","first-page":"823","DOI":"10.21437\/Eurospeech.1999-213","article-title":"synthesis of regional english using a keyword lexicon","volume":"2","author":"fitt","year":"1999","journal-title":"Proc EUROSPEECH"},{"journal-title":"The CMU Pronouncing Dictionary","year":"0","key":"ref72"},{"key":"ref71","article-title":"the blizzard challenge 2008","author":"karaiskos","year":"2008","journal-title":"Proc Blizzard Challenge Workshop"},{"key":"ref70","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2007.907344"},{"key":"ref74","doi-asserted-by":"publisher","DOI":"10.1109\/89.326623"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2008.916519"},{"key":"ref75","doi-asserted-by":"publisher","DOI":"10.1109\/JSTSP.2010.2079315"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1016\/S0167-6393(98)00085-5"},{"key":"ref33","first-page":"223","article-title":"an hmm-based mandarin chinese text-to-speech system","author":"qian","year":"2006","journal-title":"Proc ISCSLP'06"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2009.2016394"},{"journal-title":"Text to Speech Synthesis New Paradigms and Advances","year":"2004","author":"tokuda","key":"ref31"},{"key":"ref30","doi-asserted-by":"crossref","first-page":"2347","DOI":"10.21437\/Eurospeech.1999-596","article-title":"Simultaneous modeling of spectrum, pitch and duration in HMM-based speech synthesis","author":"yoshimura","year":"1999","journal-title":"Proc EUROSPEECH"},{"key":"ref37","first-page":"1043","article-title":"Mel-generalized cepstral analysis&#x2014;A unified approach to speech spectral estimation","volume":"3","author":"koishida","year":"1994","journal-title":"Proc ICSLP"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1121\/1.399423"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.1997.598872"},{"journal-title":"Hidden model sequence models for automatic speech recognition","year":"2001","author":"hain","key":"ref34"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.3115\/1075527.1075620"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2010.2045237"},{"key":"ref61","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2010.2045237"},{"key":"ref63","first-page":"409","article-title":"bootstrap estimates for confidence intervals in asr performance evaluation","volume":"1","author":"bisani","year":"1994","journal-title":"IEEE Proc ICASSP 94"},{"journal-title":"The HTK Book","year":"2006","author":"young","key":"ref28"},{"key":"ref64","doi-asserted-by":"publisher","DOI":"10.1109\/TASSP.1976.1162849"},{"key":"ref27","first-page":"4469","article-title":"Acoustic modeling with contextual additive structure for HMM-based speech recognition","author":"nankaku","year":"2008","journal-title":"Proc ICASSP"},{"key":"ref65","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.1980.1171078"},{"key":"ref66","doi-asserted-by":"publisher","DOI":"10.1109\/TASSP.1980.1163420"},{"journal-title":"The HMM-Based Speech Synthesis System (HTS)","year":"0","author":"tokuda","key":"ref29"},{"key":"ref67","doi-asserted-by":"publisher","DOI":"10.1002\/ecja.4410691006"},{"key":"ref68","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.1992.225953"},{"key":"ref69","doi-asserted-by":"publisher","DOI":"10.1109\/PACRIM.1993.407206"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1561\/2000000004"},{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/WSS.2002.1224382"},{"key":"ref20","doi-asserted-by":"crossref","first-page":"1499","DOI":"10.21437\/Eurospeech.1999-287","article-title":"a statistical coarticulatory model for the hidden vocal-tract-resonance dynamics","author":"deng","year":"1999","journal-title":"Proc EUROSPEECH"},{"key":"ref22","doi-asserted-by":"crossref","DOI":"10.21437\/Interspeech.2010-184","article-title":"autoregressive clustering for hmm speech synthesis","author":"shannon","year":"2010","journal-title":"Proc INTERSPEECH"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2007.901312"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1162\/neco.2006.18.7.1527"},{"journal-title":"Learning Deep Architectures for AI","year":"2007","author":"bengio","key":"ref23"},{"journal-title":"Decision trees do not generalize to new variations","year":"2006","author":"bengio","key":"ref26"},{"key":"ref25","article-title":"deep belief networks for phone recognition","author":"mohamed","year":"2009","journal-title":"Proc NIPS Workshop Deep Learn Speech Recogn Relat Applicat"},{"key":"ref50","first-page":"104","article-title":"flexible speaker adaptation using maximum likelihood linear regression","author":"leggetter","year":"1995","journal-title":"Proc ARPA Spoken Lang Technol Workshop"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1006\/csla.2001.0181"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.1093\/ietisy\/e90-d.5.816"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2000.861820"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.1093\/ietisy\/e90-d.5.825"},{"key":"ref56","article-title":"the hts-2008 system: yet another evaluation of the speaker-adaptive hmm-based speech synthesis system in the 2008 blizzard challenge","author":"yamagishi","year":"2008","journal-title":"Proc Blizzard Challenge Workshop"},{"key":"ref55","doi-asserted-by":"crossref","first-page":"1395","DOI":"10.21437\/Interspeech.2009-430","article-title":"speech recognition with speech synthesis models by marginalising over decision tree leaves","author":"dines","year":"2009","journal-title":"Proc INTERSPEECH"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2006.1659950"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.1109\/ICSLP.1996.607807"},{"key":"ref52","first-page":"2286","article-title":"Constrained structural maximum a posteriori linear regression for average-voice-based speech synthesis","author":"nakano","year":"2006","journal-title":"Proc ICSLP'06"},{"key":"ref10","first-page":"89","article-title":"minimum generation error training for hmm-based speech synthesis","author":"wu","year":"2006","journal-title":"Proc ICASSP"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/5.18626"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1093\/ietisy\/e90-d.2.533"},{"key":"ref12","first-page":"187","article-title":"a hidden markov model approach to speech synthesis","author":"falaschi","year":"1989","journal-title":"Proc EUROSPEECH"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/TASSP.1981.1163530"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1016\/j.artint.2009.11.011"},{"key":"ref15","doi-asserted-by":"crossref","first-page":"865","DOI":"10.21437\/Eurospeech.2003-195","article-title":"trajectory modeling based on hmms with explicit relationship between static and dynamic features","author":"tokuda","year":"2003","journal-title":"Proc EUROSPEECH"},{"key":"ref16","doi-asserted-by":"crossref","first-page":"65","DOI":"10.1016\/0165-1684(92)90112-A","article-title":"a generalised hidden markov model with state-conditioned trend functions of time for the speech signal","volume":"27","author":"deng","year":"1992","journal-title":"Signal Process"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2001.941044"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.1987.1169614"},{"key":"ref19","doi-asserted-by":"crossref","DOI":"10.21437\/Interspeech.2009-135","article-title":"autoregressive hmms for speech synthesis","author":"shannon","year":"2009","journal-title":"Proc INTERSPEECH"},{"key":"ref4","doi-asserted-by":"crossref","first-page":"1869","DOI":"10.21437\/Interspeech.2008-186","article-title":"unsupervised adaptation for hmm-based speech synthesis","author":"king","year":"2008","journal-title":"Proc Interspeech'08"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1016\/j.specom.2009.04.004"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2010.5495559"},{"key":"ref5","doi-asserted-by":"crossref","first-page":"1791","DOI":"10.21437\/Interspeech.2009-151","article-title":"two-pass decision tree construction for unsupervised adaptation of hmm-based synthesis models","author":"gibson","year":"2009","journal-title":"Proc INTERSPEECH"},{"key":"ref8","doi-asserted-by":"crossref","DOI":"10.21236\/ADA188529","author":"brown","year":"1987","journal-title":"The Acoustic-Modeling Problem in Automatic Speech Recognition"},{"key":"ref7","first-page":"282","article-title":"conditional random fields: probabilistic models for segmenting and labeling sequence data","author":"lafferty","year":"2001","journal-title":"Proc ICML"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1109\/89.506933"},{"key":"ref9","first-page":"105","article-title":"minimum phone error and i-smoothing for improved discriminative training","author":"povey","year":"2002","journal-title":"Proc ICASSP"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2008.2006647"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1250\/ast.21.79"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1109\/89.279278"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.1006\/csla.1998.0043"},{"journal-title":"The use of context in large vocabulary speech recognition","year":"1995","author":"odell","key":"ref42"},{"key":"ref41","first-page":"2545","article-title":"evaluation of a speech recognition\/generation method based on hmm and straight","author":"irino","year":"2002","journal-title":"Proc ICSLP"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2006.1660155"},{"key":"ref43","doi-asserted-by":"crossref","first-page":"99","DOI":"10.21437\/Eurospeech.1997-52","article-title":"acoustic modeling based on the mdl criterion for speech recognition","volume":"1","author":"shinoda","year":"1997","journal-title":"Proc EUROSPEECH"}],"container-title":["IEEE Journal of Selected Topics in Signal Processing"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx5\/4200690\/5623290\/05585692.pdf?arnumber=5585692","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,2,26]],"date-time":"2025-02-26T03:59:47Z","timestamp":1740542387000},"score":1,"resource":{"primary":{"URL":"http:\/\/ieeexplore.ieee.org\/document\/5585692\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2010,12]]},"references-count":75,"journal-issue":{"issue":"6"},"URL":"https:\/\/doi.org\/10.1109\/jstsp.2010.2079315","relation":{},"ISSN":["1932-4553","1941-0484"],"issn-type":[{"type":"print","value":"1932-4553"},{"type":"electronic","value":"1941-0484"}],"subject":[],"published":{"date-parts":[[2010,12]]}}}