{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,10,15]],"date-time":"2025-10-15T10:32:19Z","timestamp":1760524339022},"reference-count":36,"publisher":"IEEE","license":[{"start":{"date-parts":[[2021,10,6]],"date-time":"2021-10-06T00:00:00Z","timestamp":1633478400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2021,10,6]],"date-time":"2021-10-06T00:00:00Z","timestamp":1633478400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2021,10,6]]},"DOI":"10.1109\/mmsp53017.2021.9733452","type":"proceedings-article","created":{"date-parts":[[2022,3,16]],"date-time":"2022-03-16T20:00:32Z","timestamp":1647460832000},"page":"1-6","source":"Crossref","is-referenced-by-count":5,"title":["Large-vocabulary Audio-visual Speech Recognition in Noisy Environments"],"prefix":"10.1109","author":[{"given":"Wentao","family":"Yu","sequence":"first","affiliation":[{"name":"Ruhr University,Institute of Communication Acoustics,Bochum,Germany"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Steffen","family":"Zeiler","sequence":"additional","affiliation":[{"name":"Ruhr University,Institute of Communication Acoustics,Bochum,Germany"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Dorothea","family":"Kolossa","sequence":"additional","affiliation":[{"name":"Ruhr University,Institute of Communication Acoustics,Bochum,Germany"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1523\/JNEUROSCI.1396-16.2016"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1038\/264746a0"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2017-421"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2017.7953172"},{"key":"ref5","first-page":"237","article-title":"Dynamic modality weighting for multi-stream HMMs in audio-visual speech recognition","volume-title":"Proc. ICMI","author":"Gurban"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2018-2112"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2020.2980436"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/tpami.2018.2889052"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/TCYB.2013.2250954"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2015.2409785"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/JPROC.2003.817150"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2001.940794"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1155\/S1110865702206083"},{"key":"ref14","doi-asserted-by":"crossref","DOI":"10.1109\/ICASSP.2019.8683733","article-title":"Modality attention for end-to-end audio-visual speech recognition","volume-title":"Proc. ICASSP","author":"Zhou"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP40776.2020.9054127"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1007\/s00521-019-04559-1"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1155\/S1110865702206150"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1002\/ima.20046"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2006.879876"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.23919\/Eusipco47968.2020.9287841"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/JPROC.2012.2236871"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2005-375"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2016.2520364"},{"article-title":"CVX: Matlab Software for Disciplined Convex Programming, version 2.1","year":"2014","author":"Grant","key":"ref24"},{"article-title":"The Kaldi speech recognition toolkit","volume-title":"Proc. IEEE","author":"Povey","key":"ref25"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.367"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-540-49127-9_28"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1016\/j.specom.2019.06.002"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2006.876776"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2014.6854049"},{"article-title":"OpenFace: A generalpurpose face recognition library with mobile applications","year":"2016","author":"Amos","key":"ref31"},{"article-title":"MUSAN: A Music, Speech, and Noise Corpus","year":"2015","author":"Snyder","key":"ref32"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1145\/357311.357312"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2014.6853589"},{"key":"ref35","first-page":"8026","article-title":"Pytorch: An imperative style, high-performance deep learning library","author":"Paszke","year":"2019","journal-title":"Advances in neural information processing systems"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2017-85"}],"event":{"name":"2021 IEEE 23rd International Workshop on Multimedia Signal Processing (MMSP)","start":{"date-parts":[[2021,10,6]]},"location":"Tampere, Finland","end":{"date-parts":[[2021,10,8]]}},"container-title":["2021 IEEE 23rd International Workshop on Multimedia Signal Processing (MMSP)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/9733399\/9733432\/09733452.pdf?arnumber=9733452","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,9,3]],"date-time":"2024-09-03T05:34:19Z","timestamp":1725341659000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/9733452\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2021,10,6]]},"references-count":36,"URL":"https:\/\/doi.org\/10.1109\/mmsp53017.2021.9733452","relation":{},"subject":[],"published":{"date-parts":[[2021,10,6]]}}}