{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,8,3]],"date-time":"2026-08-03T02:19:07Z","timestamp":1785723547730,"version":"3.56.0"},"reference-count":61,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"7","license":[{"start":{"date-parts":[[2018,7,1]],"date-time":"2018-07-01T00:00:00Z","timestamp":1530403200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"}],"funder":[{"name":"National Science Foundation CAREER","award":["IIS-1453781"],"award-info":[{"award-number":["IIS-1453781"]}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE\/ACM Trans. Audio Speech Lang. Process."],"published-print":{"date-parts":[[2018,7]]},"DOI":"10.1109\/taslp.2018.2815268","type":"journal-article","created":{"date-parts":[[2018,3,12]],"date-time":"2018-03-12T18:15:04Z","timestamp":1520878504000},"page":"1290-1302","source":"Crossref","is-referenced-by-count":45,"title":["Gating Neural Network for Large Vocabulary Audiovisual Speech Recognition"],"prefix":"10.1109","volume":"26","author":[{"ORCID":"https:\/\/orcid.org\/0000-0003-4834-8949","authenticated-orcid":false,"given":"Fei","family":"Tao","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-4075-4072","authenticated-orcid":false,"given":"Carlos","family":"Busso","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1121\/1.2229005"},{"key":"ref38","first-page":"2017","article-title":"CUAVE: A new audio-visual database for multimodal human-computer interface research","author":"patterson","year":"2002","journal-title":"Proc IEEE Int Conf Acoust Speech Signal Process"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1109\/JPROC.2015.2459017"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1162\/neco.2006.18.7.1527"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2011.2109382"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2011.2134090"},{"key":"ref37","first-page":"251","article-title":"Out of time: Automated lip sync in the wild","author":"chung","year":"0","journal-title":"Proc Asian Conf Comput Vis"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2017.7953172"},{"key":"ref35","first-page":"2135","article-title":"Dynamic stream weighting for turbo-decodingbased audiovisual ASR","author":"gergen","year":"2016","journal-title":"Proc Annu Conf Int Speech Commun Assoc"},{"key":"ref34","first-page":"563","article-title":"Integration of deep bottleneck features for audio-visual speech recognition","author":"ninomiya","year":"2015","journal-title":"Proc Annu Conf Int Speech Commun Assoc"},{"key":"ref60","first-page":"249","article-title":"Understanding the difficulty of training deep feedforward neural networks","author":"glorot","year":"2010","journal-title":"Proc Int Conf Artif Intell Statist"},{"key":"ref61","article-title":"NIST speech recognition scoring toolkit","year":"2015"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.1993.319179"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/APSIPA.2015.7415335"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2015.7178347"},{"key":"ref2","doi-asserted-by":"crossref","DOI":"10.21437\/Interspeech.2017-405","article-title":"English conversational telephone speech recognition by humans and machines","author":"saon","year":"2017"},{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/MSP.2012.2205597"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/CISP.2010.5646264"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.367"},{"key":"ref21","first-page":"3652","article-title":"Combining residual networks with LSTMs for lipreading","author":"stafylakis","year":"2017","journal-title":"Proc Annu Conf Int Speech Commun Assoc"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1109\/5.726791"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2017.7952625"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2016.7472088"},{"key":"ref25","first-page":"1149","article-title":"Lipreading using convolutional neural network","author":"noda","year":"2014","journal-title":"Proc Annu Conf Int Speech Commun Assoc"},{"key":"ref50","article-title":"The HTK Book","author":"young","year":"0"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1109\/5.18626"},{"key":"ref59","first-page":"2377","article-title":"Training very deep networks","author":"greff","year":"2015","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2016.7472618"},{"key":"ref57","first-page":"1929","article-title":"Dropout: A simple way to prevent neural networks from overfitting","volume":"15","author":"hinton","year":"2014","journal-title":"J Mach Learn Res"},{"key":"ref56","first-page":"1","article-title":"Maxout networks","author":"goodfellow","year":"2013","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref55","doi-asserted-by":"crossref","first-page":"213","DOI":"10.7551\/mitpress\/1888.003.0013","article-title":"Learning representations by back-propagating errors","author":"rumelhart","year":"2002","journal-title":"Cognitive Modeling"},{"key":"ref54","first-page":"2121","article-title":"Adaptive subgradient methods for online learning and stochastic optimization","volume":"12","author":"duchi","year":"2011","journal-title":"J Mach Learn Res"},{"key":"ref53","article-title":"Kaldi+ PDNN: Building DNN-based ASR systems with Kaldi and PDNN","author":"miao","year":"2014","journal-title":"ArXiv e-prints (arXiv 1401 6984)"},{"key":"ref52","article-title":"The Kaldi speech recognition toolkit","author":"povey","year":"2011","journal-title":"Proc IEEE Workshop Autom Speech Recog and Understanding"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/TCYB.2013.2250954"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2013.6639140"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1109\/FG.2015.7163155"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1007\/s10489-014-0629-7"},{"key":"ref13","first-page":"127","article-title":"Improving lip-reading performance for robust audiovisual speech recognition using DNNs","author":"thangthai","year":"2015","journal-title":"Proc Joint Conf Facial Anal Animation Auditory-Visual Speech Process"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1162\/neco.1997.9.8.1735"},{"key":"ref15","first-page":"1154","article-title":"Lipreading approach for isolated digits recognition under whisper and neutral speech","author":"tao","year":"2014","journal-title":"Proc Annu Conf Int Speech Commun Assoc"},{"key":"ref16","first-page":"1069","article-title":"Audio-visual speech recognition by speechreading","volume":"2","author":"zhang","year":"2002","journal-title":"Proc Int Conf Digital Signal Process"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1155\/S1110865702206137"},{"key":"ref18","first-page":"193","article-title":"Audiovisual automatic speech recognition","author":"potamianos","year":"2015","journal-title":"Audio-visual speech processing"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2013.6638089"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1044\/jslhr.4002.432"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.3758\/BF03193531"},{"key":"ref6","article-title":"Audio-visual speech recognition","author":"neti","year":"2000"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.3109\/03005369009077840"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2001.940794"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/JPROC.2003.817150"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.3115\/1289189.1289244"},{"key":"ref9","first-page":"689","article-title":"Multimodal deep learning","author":"ngiam","year":"2011","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref46","first-page":"2302","article-title":"An unsupervised visual-only voice activity detection approach using temporal orofacial features","author":"tao","year":"2015","journal-title":"Proc Annu Conf Int Speech Commun Assoc"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2013.75"},{"key":"ref48","first-page":"1938","article-title":"Bimodal recurrent neural network for audiovisual voice activity detection","author":"tao","year":"2017","journal-title":"Proc Annu Conf Int Speech Commun Assoc"},{"key":"ref47","first-page":"2130","article-title":"Improving boundary estimation in audiovisual speech activity detection using Bayesian information criterion","author":"tao","year":"2016","journal-title":"Proc Annu Conf Int Speech Commun Assoc"},{"key":"ref42","first-page":"841","article-title":"Building an audio-visual corpus of Australian English: Large corpus collection with an economical portable and replicable black box","author":"burnham","year":"2011","journal-title":"Proc Annu Conf Int Speech Commun Assoc"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2015.2407694"},{"key":"ref44","article-title":"NIST speech SNR tool","author":"stanford","year":"2005"},{"key":"ref43","first-page":"12","article-title":"The AMI meeting corpus: A pre-announcement","author":"carletta","year":"0","journal-title":"Proc Workshop Machine Learning for Multimodal Interaction"}],"container-title":["IEEE\/ACM Transactions on Audio, Speech, and Language Processing"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/6570655\/8345723\/08314740.pdf?arnumber=8314740","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,7,2]],"date-time":"2025-07-02T18:50:15Z","timestamp":1751482215000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/8314740\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2018,7]]},"references-count":61,"journal-issue":{"issue":"7"},"URL":"https:\/\/doi.org\/10.1109\/taslp.2018.2815268","relation":{},"ISSN":["2329-9290","2329-9304"],"issn-type":[{"value":"2329-9290","type":"print"},{"value":"2329-9304","type":"electronic"}],"subject":[],"published":{"date-parts":[[2018,7]]}}}