{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,2,9]],"date-time":"2026-02-09T15:20:33Z","timestamp":1770650433215,"version":"3.49.0"},"reference-count":24,"publisher":"IEEE","content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2013,5]]},"DOI":"10.1109\/icassp.2013.6639140","type":"proceedings-article","created":{"date-parts":[[2013,10,29]],"date-time":"2013-10-29T23:19:46Z","timestamp":1383088786000},"page":"7596-7599","source":"Crossref","is-referenced-by-count":115,"title":["Audio-visual deep learning for noise robust speech recognition"],"prefix":"10.1109","author":[{"given":"Jing","family":"Huang","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Brian","family":"Kingsbury","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"19","article-title":"Audio-visual speech recognition using red exclusion and neural networks","author":"lewis","year":"2003","journal-title":"Journal of Research and Practice in Information Technology"},{"key":"22","doi-asserted-by":"publisher","DOI":"10.1109\/ICME.2003.1221384"},{"key":"17","article-title":"See me, hear me: Integrating automatic speech recognition and lipreading","author":"duchnowski","year":"1994","journal-title":"Proceedings of ICSLP"},{"key":"23","article-title":"Adaptive multimodal fusion by uncertainty compensation","author":"pitsikalis","year":"2006","journal-title":"Proceedings of ICSLP"},{"key":"18","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.1996.543250"},{"key":"24","doi-asserted-by":"publisher","DOI":"10.1162\/neco.2006.18.7.1527"},{"key":"15","doi-asserted-by":"publisher","DOI":"10.1109\/MSP.2012.2205597"},{"key":"16","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2012.6288863"},{"key":"13","article-title":"Discriminatively trained features using fmpe for multi-stream audio-visual speech recognition","author":"huang","year":"2005","journal-title":"Proceedings of Interspeech"},{"key":"14","doi-asserted-by":"crossref","DOI":"10.21437\/Interspeech.2009-426","article-title":"Combined discriminative training for multi-stream hmm-based audio-visual speech recognition","author":"huang","year":"2009","journal-title":"Proceedings of Interspeech"},{"key":"11","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2002.1005687"},{"key":"12","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2005.1415275"},{"key":"3","first-page":"591","article-title":"Multi-stream speech recognition: Ready for prime time","author":"janin","year":"1999","journal-title":"Proc Europ Conf Speech Technol"},{"key":"21","article-title":"Multimodal deep learning","author":"ngiam","year":"2011","journal-title":"International Conference on Machine Learning"},{"key":"2","doi-asserted-by":"publisher","DOI":"10.1109\/5.664274"},{"key":"20","doi-asserted-by":"publisher","DOI":"10.1007\/11539117_25"},{"key":"1","doi-asserted-by":"publisher","DOI":"10.1121\/1.1907309"},{"key":"10","article-title":"Efficient likelihood computation in multi-stream hmm based audio-visual speech recognition","author":"marcheret","year":"2004","journal-title":"Int Conf Speech Language Processing 98"},{"key":"7","doi-asserted-by":"publisher","DOI":"10.1109\/JPROC.2003.817150"},{"key":"6","doi-asserted-by":"crossref","first-page":"1260","DOI":"10.1155\/S1110865702206150","article-title":"Noise adaptive stream weighting in audio-visual speech recognition","author":"heckmann","year":"2002","journal-title":"EURASIP J Appl Signal Process 2002"},{"key":"5","doi-asserted-by":"publisher","DOI":"10.1109\/6046.985551"},{"key":"4","doi-asserted-by":"publisher","DOI":"10.1109\/6046.865479"},{"key":"9","doi-asserted-by":"publisher","DOI":"10.1016\/j.specom.2004.10.007"},{"key":"8","article-title":"Audio-visual speech recognition","author":"potamianos","year":"2006","journal-title":"Encyclopedia of Language and Linguistics Second Edition (Speech Technology Section-Computer Understanding of Speech)"}],"event":{"name":"ICASSP 2013 - 2013 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","location":"Vancouver, BC, Canada","start":{"date-parts":[[2013,5,26]]},"end":{"date-parts":[[2013,5,31]]}},"container-title":["2013 IEEE International Conference on Acoustics, Speech and Signal Processing"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/6619549\/6637585\/06639140.pdf?arnumber=6639140","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,3,10]],"date-time":"2022-03-10T22:41:39Z","timestamp":1646952099000},"score":1,"resource":{"primary":{"URL":"http:\/\/ieeexplore.ieee.org\/document\/6639140\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2013,5]]},"references-count":24,"URL":"https:\/\/doi.org\/10.1109\/icassp.2013.6639140","relation":{},"subject":[],"published":{"date-parts":[[2013,5]]}}}