{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,11]],"date-time":"2026-07-11T03:40:55Z","timestamp":1783741255598,"version":"3.55.0"},"reference-count":41,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"9","license":[{"start":{"date-parts":[[2015,9,1]],"date-time":"2015-09-01T00:00:00Z","timestamp":1441065600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE\/ACM Trans. Audio Speech Lang. Process."],"published-print":{"date-parts":[[2015,9]]},"DOI":"10.1109\/taslp.2015.2438544","type":"journal-article","created":{"date-parts":[[2015,6,3]],"date-time":"2015-06-03T20:42:24Z","timestamp":1433364144000},"page":"1469-1477","source":"Crossref","is-referenced-by-count":230,"title":["Data Augmentation for Deep Neural Network Acoustic Modeling"],"prefix":"10.1109","volume":"23","author":[{"family":"Xiaodong Cui","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Vaibhava","family":"Goel","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Brian","family":"Kingsbury","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref39","first-page":"129","article-title":"Lattice-based search for spoken utterance retrieval","author":"saraclar","year":"2004","journal-title":"Proc Human Lang Technol North Amer Chap Assoc Comp Linguistics (HLT-NAACL)"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2013.6638969"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2015.7178831"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2014.6854669"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1109\/ASRU.2013.6707749"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1006\/csla.1995.0010"},{"key":"ref37","first-page":"51","article-title":"Results of the 2006 spoken term detection evaluation","author":"fiscus","year":"2007","journal-title":"Proc SIGIR Workshop Search Spontan Conversat Speech"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1109\/SLT.2010.5700829"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2012.2199982"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2014.6854825"},{"key":"ref10","article-title":"Speech recognition and keyword spotting for low resource languages: Babel project research at CUED","author":"gales","year":"2014","journal-title":"Proc Spoken Lang Technol Under-Resource Lang (SLTU'14)"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1145\/502585.502657"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/5.726791"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/ICDAR.2003.1227801"},{"key":"ref13","first-page":"1106","article-title":"ImageNet classification with deep convolutional neural networks","author":"krizhevsky","year":"2012","journal-title":"Neural Inf Process Syst (NIPS)"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.1987.1169544"},{"key":"ref15","first-page":"806","article-title":"Large-vocabulary speech recognition under adverse acoustic environments","author":"deng","year":"2000","journal-title":"Proc INTERSPEECH"},{"key":"ref16","doi-asserted-by":"crossref","DOI":"10.21437\/Eurospeech.2003-745","article-title":"Noise robustness in speech to speech translation","author":"liu","year":"2003","journal-title":"Proc EUROSPEECH"},{"key":"ref17","article-title":"Distance measures for speech recognition","author":"hunt","year":"1989","journal-title":"Aeronautical Note NAE-AN-57"},{"key":"ref18","article-title":"Vocal tract length perturbation (VTLP) improves speech recognition","author":"jaitly","year":"2013","journal-title":"Proc Int Conf Mach Learn (ICML) Workshop Deep Learn Audio Speech Lang Process"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2014.6854671"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1109\/89.759034"},{"key":"ref4","doi-asserted-by":"crossref","DOI":"10.21437\/Interspeech.2012-3","article-title":"Scalable minimum Bayes risk training of deep neural network acoustic models using distributed Hessian-free optimization","author":"kingsbury","year":"2012","journal-title":"Proc INTERSPEECH"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/89.650310"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/ASRU.2011.6163899"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2011.2134090"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1006\/csla.1998.0043"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2014.2339736"},{"key":"ref8","article-title":"Improving deep neural network acoustic modeling for audio corpus indexing under the IARPA Babel program","author":"cui","year":"2013","journal-title":"Proc INTERSPEECH"},{"key":"ref7","year":"0"},{"key":"ref2","doi-asserted-by":"crossref","first-page":"437","DOI":"10.21437\/Interspeech.2011-169","article-title":"Conversational speech transcription using context-dependent deep neural networks","author":"seide","year":"2011","journal-title":"Proc INTERSPEECH"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2014.6854679"},{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/MSP.2012.2205597"},{"key":"ref20","first-page":"810","article-title":"Data augmentation for low resource languages","author":"ragni","year":"2014","journal-title":"Proc INTERSPEECH"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/ASRU.2013.6707748"},{"key":"ref21","first-page":"1420","article-title":"Data augmentation, feature combination, and multilingual neural networks to improve ASR and KWS performance for low-resource languages","author":"tuske","year":"2014","journal-title":"Proc INTERSPEECH"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2007.907344"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/89.661472"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2013.6639278"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2013.6639279"},{"key":"ref25","first-page":"655","article-title":"Voice conversion through vector quantization","author":"abe","year":"1998","journal-title":"Proc Int Conf Acoust Speech Signal Process (ICASSP)"}],"container-title":["IEEE\/ACM Transactions on Audio, Speech, and Language Processing"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/6570655\/7118277\/07113823.pdf?arnumber=7113823","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,8,11]],"date-time":"2023-08-11T03:06:50Z","timestamp":1691723210000},"score":1,"resource":{"primary":{"URL":"http:\/\/ieeexplore.ieee.org\/document\/7113823\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2015,9]]},"references-count":41,"journal-issue":{"issue":"9"},"URL":"https:\/\/doi.org\/10.1109\/taslp.2015.2438544","relation":{},"ISSN":["2329-9290","2329-9304"],"issn-type":[{"value":"2329-9290","type":"print"},{"value":"2329-9304","type":"electronic"}],"subject":[],"published":{"date-parts":[[2015,9]]}}}