{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,11,9]],"date-time":"2025-11-09T07:42:05Z","timestamp":1762674125229,"version":"3.37.3"},"reference-count":87,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"10","license":[{"start":{"date-parts":[[2016,10,1]],"date-time":"2016-10-01T00:00:00Z","timestamp":1475280000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"}],"funder":[{"DOI":"10.13039\/501100000266","name":"EPSRC","doi-asserted-by":"publisher","award":["EP\/I031022\/1"],"award-info":[{"award-number":["EP\/I031022\/1"]}],"id":[{"id":"10.13039\/501100000266","id-type":"DOI","asserted-by":"publisher"}]},{"name":"Natural Speech Technology and the European Union","award":["H2020"],"award-info":[{"award-number":["H2020"]}]},{"name":"SUMMA","award":["688139"],"award-info":[{"award-number":["688139"]}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE\/ACM Trans. Audio Speech Lang. Process."],"published-print":{"date-parts":[[2016,10]]},"DOI":"10.1109\/taslp.2016.2584700","type":"journal-article","created":{"date-parts":[[2016,6,24]],"date-time":"2016-06-24T18:52:48Z","timestamp":1466794368000},"page":"1773-1784","source":"Crossref","is-referenced-by-count":9,"title":["Differentiable Pooling for Unsupervised Acoustic Model Adaptation"],"prefix":"10.1109","volume":"24","author":[{"given":"Pawel","family":"Swietojanski","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Steve","family":"Renals","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref73","doi-asserted-by":"publisher","DOI":"10.1007\/s10579-007-9040-x"},{"key":"ref72","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.1992.225858"},{"key":"ref71","first-page":"261","article-title":"Wit $^3$: Web inventory of transcribed and translated talks","author":"cettolo","year":"0","journal-title":"Proc EAMT"},{"key":"ref70","first-page":"318","article-title":"Learning internal representations by error-propagation","volume":"1","author":"rumelhart","year":"1986","journal-title":"Parallel Distributed Processing Foundations"},{"key":"ref76","first-page":"26","article-title":"The UEDIN system for the IWSLT 2014 evaluation","author":"bell","year":"0","journal-title":"Proc IWSLT"},{"key":"ref77","doi-asserted-by":"publisher","DOI":"10.1109\/ASRU.2013.6707744"},{"key":"ref74","doi-asserted-by":"publisher","DOI":"10.1109\/ASRU.2007.4430116"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2016.7472634"},{"key":"ref75","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2011.2134090"},{"key":"ref38","doi-asserted-by":"crossref","first-page":"1713","DOI":"10.1109\/TASLP.2014.2346313","article-title":"Fast adaptation of deep neural network based on discriminant codes for speech recognition","volume":"22","author":"xue","year":"2014","journal-title":"IEEE\/ACM Trans Audio Speech Lang Process"},{"key":"ref78","first-page":"69","article-title":"The Fisher corpus: A resource for the next generations of speech-to-text","author":"cieri","year":"0","journal-title":"Proc 4th Int Conf Lang Eval"},{"key":"ref79","first-page":"2345","article-title":"Sequence-discriminative training of deep neural networks","author":"vesely","year":"0","journal-title":"Proc ISCA Interspeech"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2015.2457612"},{"key":"ref32","first-page":"2180","article-title":"Adaptation of deep neural network acoustic models using factorised i-vectors","author":"karanasou","year":"0","journal-title":"Proc ISCA Interspeech"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2014.6854823"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2014.6853591"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2013.6639211"},{"key":"ref36","first-page":"234","article-title":"Recnorm: Simultaneous normalisation and classification applied to speech recognition","author":"bridle","year":"0","journal-title":"Proc Adv Neural Inform Process Syst"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2014.6854663"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2016.7472684"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1109\/ASRU.2013.6707745"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.1109\/HSCMA.2014.6843274"},{"key":"ref61","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2014.6855088"},{"key":"ref63","doi-asserted-by":"publisher","DOI":"10.1186\/s13636-015-0068-3"},{"key":"ref28","first-page":"152","article-title":"I-vector-based discriminative adaptation for automatic speech recognition","author":"karafiat","year":"0","journal-title":"Proc IEEE Workshop Autom Speech Recognit Understanding"},{"key":"ref64","article-title":"Differentiable pooling for hierarchical feature learning","volume":"abs 1207 151","author":"zeiler","year":"2012","journal-title":"CoRR"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2010.2064307"},{"key":"ref65","article-title":"Convolutional neural networks applied to house numbers digit classification","volume":"abs 1204 3968","author":"sermanet","year":"2012","journal-title":"CoRR"},{"key":"ref66","doi-asserted-by":"publisher","DOI":"10.1109\/ASRU.2013.6707749"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1109\/ASRU.2013.6707705"},{"key":"ref67","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2014.6853589"},{"key":"ref68","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2016.2560534"},{"key":"ref69","first-page":"530","article-title":"Learned-norm pooling for deep feedforward and recurrent neural networks","author":"g\u00fcl\u00e7ehre","year":"0","journal-title":"Proc Eur Conf Mach Learn Knowl Discovery Databases"},{"key":"ref2","article-title":"Feature learning in deep neural networks&#x2014;Studies on speech recognition","author":"yu","year":"0","journal-title":"Proc ICLR"},{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/MSP.2012.2205597"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2011.5947494"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2012.6288833"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2011.2163395"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2013.6639014"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2013.6639347"},{"key":"ref26","first-page":"2183","article-title":"Connectionist speaker normalization and adaptation","author":"abrash","year":"0","journal-title":"Proc EUROSPEECH"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2014.6854825"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2015.7178783"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1113\/jphysiol.1962.sp006837"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.1109\/ASRU.2013.6707763"},{"key":"ref58","first-page":"1319","article-title":"Maxout networks","author":"goodfellow","year":"0","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref57","first-page":"111","article-title":"A theoretical analysis of feature pooling in visual recognition","author":"boureau","year":"0","journal-title":"Proc 27th Int Conf Mach Learn"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2007.383157"},{"key":"ref55","doi-asserted-by":"crossref","first-page":"1019","DOI":"10.1038\/14819","article-title":"Hierarchical models of object recognition in cortex","volume":"2","author":"riesenhuber","year":"1999","journal-title":"Nature Neurosci"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1109\/5.726791"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.1162\/neco.1989.1.4.541"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1016\/0031-3203(82)90024-3"},{"key":"ref10","first-page":"1248","article-title":"Rapid and effective speaker adaptation of convolutional neural network based models for speech recognition","author":"abdel-hamid","year":"0","journal-title":"Proc ISCA Interspeech"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/SLT.2014.7078569"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2013.6639212"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1006\/csla.1998.0043"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1006\/csla.1994.1019"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1007\/978-1-4615-3210-1"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/89.260359"},{"key":"ref82","first-page":"1929","article-title":"Dropout: A simple way to prevent neural networks from overfitting","volume":"15","author":"srivastava","year":"2014","journal-title":"J Mach Learn Res"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-76153-9_28"},{"key":"ref81","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.1992.225837"},{"key":"ref17","first-page":"131","article-title":"Rectified linear units improve restricted Boltzmann machines","author":"nair","year":"0","journal-title":"Proc 27th Int Conf Mach Learn"},{"key":"ref84","doi-asserted-by":"publisher","DOI":"10.1109\/ICSLP.1996.607807"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2000.862024"},{"key":"ref83","first-page":"3224","article-title":"Parameterised sigmoid and ReLU hidden activation functions for DNN acoustic modelling","author":"zhang","year":"0","journal-title":"Proc ISCA Interspeech"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2007.367023"},{"key":"ref80","first-page":"3224","article-title":"The Kaldi speech recognition toolkit","author":"povey","year":"0","journal-title":"Proc IEEE Workshop Autom Speech Recognit Understanding"},{"key":"ref4","first-page":"526","article-title":"Comparison of discriminative input and output transformations for speaker adaptation in the hybrid NN\/HMM systems","author":"li","year":"0","journal-title":"Proc 11th Annu Conf Int Speech Commun Assoc"},{"key":"ref3","first-page":"2171","article-title":"Speaker adaptation for hybrid HMM&#x2013;ANN continuous speech recognition system","author":"neto","year":"0","journal-title":"Proc 4th Eur Conf Speech Commun Technol"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/ASRU.2011.6163899"},{"key":"ref5","first-page":"554","article-title":"On speaker adaptive training of artificial neural networks","author":"trmal","year":"0","journal-title":"Proc ISCA Interspeech"},{"key":"ref85","doi-asserted-by":"publisher","DOI":"10.1109\/89.848223"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2013.6638967"},{"article-title":"Discriminative training for large vocabulary speech recognition","year":"2003","author":"povey","key":"ref86"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/SLT.2012.6424251"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1109\/SLT.2014.7078566"},{"key":"ref87","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2009.4960445"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2013.6639201"},{"key":"ref46","doi-asserted-by":"crossref","DOI":"10.21437\/Interspeech.2015-285","article-title":"Maximum a-posteriori adaptation of network parameters in deep models","author":"huang","year":"2015"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2016.7472631"},{"key":"ref48","first-page":"3605","article-title":"Structured output layer with auxiliary targets for context-dependent acoustic modelling","author":"swietojanski","year":"0","journal-title":"Proc ISCA Interspeech"},{"key":"ref47","first-page":"3625","article-title":"Rapid adaptation for deep neural networks through multi-task learning","author":"huang","year":"0","journal-title":"Proc ISCA Interspeech"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2014.6854826"},{"key":"ref41","first-page":"1081","article-title":"Regularized sequence-level deep neural network model adaptation","author":"huang","year":"0","journal-title":"Proc ISCA Interspeech"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2015.7178784"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2013.2270370"}],"container-title":["IEEE\/ACM Transactions on Audio, Speech, and Language Processing"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/6570655\/7524661\/07499870.pdf?arnumber=7499870","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,7,2]],"date-time":"2022-07-02T04:30:11Z","timestamp":1656736211000},"score":1,"resource":{"primary":{"URL":"http:\/\/ieeexplore.ieee.org\/document\/7499870\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2016,10]]},"references-count":87,"journal-issue":{"issue":"10"},"URL":"https:\/\/doi.org\/10.1109\/taslp.2016.2584700","relation":{},"ISSN":["2329-9290","2329-9304"],"issn-type":[{"type":"print","value":"2329-9290"},{"type":"electronic","value":"2329-9304"}],"subject":[],"published":{"date-parts":[[2016,10]]}}}