{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,9]],"date-time":"2026-06-09T16:17:54Z","timestamp":1781021874638,"version":"3.54.1"},"reference-count":63,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","license":[{"start":{"date-parts":[[2023,1,1]],"date-time":"2023-01-01T00:00:00Z","timestamp":1672531200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/legalcode"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE\/ACM Trans. Audio Speech Lang. Process."],"published-print":{"date-parts":[[2023]]},"DOI":"10.1109\/taslp.2023.3288418","type":"journal-article","created":{"date-parts":[[2023,6,27]],"date-time":"2023-06-27T17:39:25Z","timestamp":1687887565000},"page":"2738-2750","source":"Crossref","is-referenced-by-count":7,"title":["Improving Speech Enhancement Performance by Leveraging Contextual Broad Phonetic Class Information"],"prefix":"10.1109","volume":"31","author":[{"ORCID":"https:\/\/orcid.org\/0000-0001-8400-4188","authenticated-orcid":false,"given":"Yen-Ju","family":"Lu","sequence":"first","affiliation":[{"name":"Research Center for Information Technology Innovation, Academia Sinica, Taipei, Taiwan"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Chia-Yu","family":"Chang","sequence":"additional","affiliation":[{"name":"Research Center for Information Technology Innovation, Academia Sinica, Taipei, Taiwan"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-5544-7449","authenticated-orcid":false,"given":"Cheng","family":"Yu","sequence":"additional","affiliation":[{"name":"Research Center for Information Technology Innovation, Academia Sinica, Taipei, Taiwan"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Ching-Feng","family":"Liu","sequence":"additional","affiliation":[{"name":"Chi Mei Hospital, Tainan, Taiwan"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-9366-3070","authenticated-orcid":false,"given":"Jeih-weih","family":"Hung","sequence":"additional","affiliation":[{"name":"Department of Electrical Engineering, National Chi Nan University, Puli, Taiwan"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-5970-8631","authenticated-orcid":false,"given":"Shinji","family":"Watanabe","sequence":"additional","affiliation":[{"name":"School of Computer Science, Carnegie Mellon University, Pittsburgh, PA, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-6956-0418","authenticated-orcid":false,"given":"Yu","family":"Tsao","sequence":"additional","affiliation":[{"name":"Research Center for Information Technology Innovation, Academia Sinica, Taipei, Taiwan"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2014.2352935"},{"key":"ref57","article-title":"Adam: A method for stochastic optimization","author":"kingma","year":"0","journal-title":"Proc Int Conf Learn Representations"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2014.2364452"},{"key":"ref56","first-page":"455","article-title":"Boosting objective scores of a speech enhancement model by metricGAN post-processing","author":"fu","year":"0","journal-title":"Proc IEEE Asia-Pacific Signal Inf Process Assoc Annu Summit Conf"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2016.2628641"},{"key":"ref59","article-title":"Speech recognition (version 3.8)[software]","author":"zhang","year":"0","journal-title":"Proc Int Conf Commun China"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2019.8683385"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2007.911054"},{"key":"ref53","article-title":"Timit acoustic phonetic continuous speech corpus","author":"garofolo","year":"0","journal-title":"Proc Linguistic Data Consortium"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2020-1066"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2013-130"},{"key":"ref55","article-title":"100 nonspeech environmental sounds","author":"hu","year":"2004"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP40776.2020.9053266"},{"key":"ref54","article-title":"Development of Taiwan mandarin hearing in noise test","author":"huang","year":"2005"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1016\/j.specom.2014.02.001"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2019.2935891"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2016-1284"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2014-574"},{"key":"ref51","first-page":"21","article-title":"Layer normalization","volume":"1050","author":"ba","year":"2016","journal-title":"Stat"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP40776.2020.9053214"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2019.8683713"},{"key":"ref45","article-title":"The kaldi speech recognition toolkit","author":"povey","year":"0","journal-title":"Proc Automatic Speech Recognition and Understanding"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2019.8683169"},{"key":"ref47","article-title":"Attention is all you need","author":"vaswani","year":"0","journal-title":"Proc Neural Inf Process Syst"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2020-1139"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1016\/j.neucom.2012.11.008"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1109\/JSTSP.2017.2763455"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1186\/1687-6180-2012-158"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP40776.2020.9053288"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2015.7178061"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-22482-4_11"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/ASRU51503.2021.9687924"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/SCFT.1999.781519"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.1999.758097"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2014.2304637"},{"key":"ref5","first-page":"2008","article-title":"Conditional generative adversarial networks for speech enhancement and noise-robust speaker verification","author":"michelsanti","year":"0","journal-title":"Proc INTERSPEECH"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1007\/s11265-018-1334-2"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1109\/WASPAA.2019.8937250"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2019-1242"},{"key":"ref37","author":"ladefoged","year":"2014","journal-title":"A Course in Phonetics"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2020-1400"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2018.8462622"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP39728.2021.9413555"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2020.3039600"},{"key":"ref32","article-title":"Perceptual loss with recognition model for single-channel enhancement and robust asr","author":"plantinga","year":"2021"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/MSPEC.2017.7864754"},{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/TBME.2016.2613960"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1016\/j.neucom.2014.03.005"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2006.885907"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1109\/TETCI.2017.2784878"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2020.2987441"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2019-1924"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2019-1777"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2020-2537"},{"key":"ref63","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2022.3153265"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1016\/j.neunet.2021.05.017"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP40776.2020.9052938"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2021-582"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2019-2792"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2022-11161"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2016.2528171"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2018.2870725"},{"key":"ref61","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2015.2416653"}],"container-title":["IEEE\/ACM Transactions on Audio, Speech, and Language Processing"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/6570655\/9970249\/10164201.pdf?arnumber=10164201","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,8,14]],"date-time":"2023-08-14T17:59:51Z","timestamp":1692035991000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/10164201\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023]]},"references-count":63,"URL":"https:\/\/doi.org\/10.1109\/taslp.2023.3288418","relation":{},"ISSN":["2329-9290","2329-9304"],"issn-type":[{"value":"2329-9290","type":"print"},{"value":"2329-9304","type":"electronic"}],"subject":[],"published":{"date-parts":[[2023]]}}}