{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,8,26]],"date-time":"2026-08-26T05:16:32Z","timestamp":1787721392125,"version":"build-2784847793"},"reference-count":171,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"9","license":[{"start":{"date-parts":[[2015,9,1]],"date-time":"2015-09-01T00:00:00Z","timestamp":1441065600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"}],"funder":[{"DOI":"10.13039\/100000015","name":"U.S. Department of Energy","doi-asserted-by":"publisher","award":["DE-NA0002520"],"award-info":[{"award-number":["DE-NA0002520"]}],"id":[{"id":"10.13039\/100000015","id-type":"DOI","asserted-by":"publisher"}]},{"name":"Spanish Ministry of Economy and Competitiveness"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["Proc. IEEE"],"published-print":{"date-parts":[[2015,9]]},"DOI":"10.1109\/jproc.2015.2459017","type":"journal-article","created":{"date-parts":[[2015,8,14]],"date-time":"2015-08-14T14:34:31Z","timestamp":1439562871000},"page":"1635-1653","source":"Crossref","is-referenced-by-count":111,"title":["Audiovisual Fusion: Challenges and New Approaches"],"prefix":"10.1109","volume":"103","author":[{"given":"Aggelos K.","family":"Katsaggelos","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Sara","family":"Bahaadini","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Rafael","family":"Molina","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref170","first-page":"814","article-title":"Facesync: A linear operator for measuring synchronization of video facial images and audio tracks","author":"slaney","year":"2000","journal-title":"Advances in neural information processing systems"},{"key":"ref171","first-page":"772","article-title":"Learning joint statistical models for audio-visual fusion and segregation","author":"fisher","year":"2000","journal-title":"Advances in neural information processing systems"},{"key":"ref168","first-page":"2222","article-title":"Multimodal learning with deep Boltzmann machines","author":"srivastava","year":"2012","journal-title":"Advances in neural information processing systems"},{"key":"ref169","article-title":"Audio-vision: Using audio-visual synchrony to locate sounds","author":"hershey","year":"2000","journal-title":"Advances in Neural Information Processing Systems 12"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1109\/ICARCV.2004.1469293"},{"key":"ref38","doi-asserted-by":"crossref","first-page":"1589","DOI":"10.1109\/ICME.2000.871073","article-title":"Look who's talking: Speaker detection using video and audio correlation","volume":"3","author":"cutler","year":"0","journal-title":"Proc IEEE Int Conf Multimedia Expo"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1109\/ICIP.2003.1247172"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2001.937600"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1109\/79.911196"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1109\/MMSP.2006.285306"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1109\/ASPAA.2005.1540183"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1109\/HUMANOIDS.2013.7029977"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1155\/S1110865702206058"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1145\/1088463.1088477"},{"key":"ref28","first-page":"4","article-title":"Tracking humans using multi-modal fusion","author":"zou","year":"0","journal-title":"Proc IEEE Comput Soc Conf Comput Vis Pattern Recognit Workshops"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1145\/957013.957065"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2003.1206512"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1007\/3-540-44887-X_89"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/JPROC.2006.886017"},{"key":"ref21","article-title":"Audio\/video fusion: A preprocessing step for multimodal person identification","author":"jaffre","year":"2006","journal-title":"Int Workshop MultiModal User Authentification"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1007\/s00530-006-0063-8"},{"key":"ref23","author":"ivanov","year":"2005","journal-title":"Error Weighted Classifier Combination for Multi-modal Human Identification"},{"key":"ref101","author":"anderson","year":"2012","journal-title":"Optimal Filtering"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1145\/1027527.1027665"},{"key":"ref100","doi-asserted-by":"publisher","DOI":"10.1007\/s10458-009-9092-y"},{"key":"ref25","doi-asserted-by":"crossref","first-page":"170","DOI":"10.1155\/S1110865703211173","article-title":"Semantic indexing of multimedia content using visual, audio, text cues","volume":"2003","author":"adams","year":"1900","journal-title":"EURASIP J Adv Signal Process"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1023\/A:1023622605600"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1109\/79.888862"},{"key":"ref154","first-page":"873","article-title":"Sparse deep belief net model for visual area","author":"lee","year":"2008","journal-title":"Advances in neural information processing systems"},{"key":"ref153","first-page":"2222","article-title":"Multimodal learning with deep boltzmann machines","author":"srivastava","year":"2012","journal-title":"Advances in neural information processing systems"},{"key":"ref156","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2013.6639140"},{"key":"ref155","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2013.6638346"},{"key":"ref150","doi-asserted-by":"publisher","DOI":"10.1016\/j.robot.2014.03.003"},{"key":"ref152","doi-asserted-by":"publisher","DOI":"10.1145\/2663204.2663236"},{"key":"ref151","first-page":"2141","article-title":"Improved multimodal deep learning with variation of information","author":"sohn","year":"2014","journal-title":"Advances in neural information processing systems"},{"key":"ref146","first-page":"1274","article-title":"Dynamic Bayesian networks for audio-visual speech recognition","author":"nefian","year":"2002","journal-title":"EURASIP J Appl Signal Process"},{"key":"ref147","article-title":"A new EM estimation of dynamic stream weights for coupled-HMM-based audio-visual ASR","author":"abdelaziz","year":"0","journal-title":"Proc IEEE Int Conf Acoust Speech Signal Process"},{"key":"ref148","doi-asserted-by":"publisher","DOI":"10.1109\/TCYB.2013.2250954"},{"key":"ref149","doi-asserted-by":"crossref","DOI":"10.1561\/9781601988157","author":"deng","year":"2014","journal-title":"Deep Learning Methods and Applications"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.1109\/MSP.2013.2296173"},{"key":"ref58","first-page":"101","article-title":"Challenges in multimodal data fusion","author":"lahat","year":"0","journal-title":"Proc Eur Signal Process Conf"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.1007\/s00530-010-0182-0"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1016\/j.imavis.2014.06.004"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1109\/TSP.2013.2277834"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2014.2322824"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2006.872619"},{"key":"ref52","first-page":"1","article-title":"A visual voice activity detection method with adaboosting","author":"liu","year":"0","journal-title":"Proc Sensor Signal Process Defence"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2014.2301977"},{"key":"ref167","first-page":"1247","article-title":"Deep canonical correlation analysis","author":"andrew","year":"0","journal-title":"Proc 30th Int Conf Mach Learn"},{"key":"ref166","doi-asserted-by":"publisher","DOI":"10.1142\/S012906570000034X"},{"key":"ref165","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2007.906583"},{"key":"ref164","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2006.1660095"},{"key":"ref163","doi-asserted-by":"publisher","DOI":"10.1109\/ASRU.2009.5373462"},{"key":"ref162","doi-asserted-by":"publisher","DOI":"10.1145\/1553374.1553391"},{"key":"ref161","doi-asserted-by":"publisher","DOI":"10.1162\/0899766042321814"},{"key":"ref160","doi-asserted-by":"publisher","DOI":"10.2307\/2333955"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1038\/264746a0"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1016\/S0167-6393(98)00048-X"},{"key":"ref6","author":"llagostera casanovas","year":"2012","journal-title":"Audio-visual object extraction using graph cuts"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2004.1327194"},{"key":"ref159","doi-asserted-by":"publisher","DOI":"10.1145\/1180995.1181013"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.5772\/54000"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1145\/1027933.1027964"},{"key":"ref7","doi-asserted-by":"crossref","first-page":"488","DOI":"10.1007\/3-540-45113-7_48","article-title":"Speaker localisation using audio-visual synchrony: An empirical study","author":"nock","year":"2003","journal-title":"Image and Video Retrieval"},{"key":"ref157","doi-asserted-by":"publisher","DOI":"10.1109\/ISCAS.2014.6865245"},{"key":"ref158","doi-asserted-by":"publisher","DOI":"10.1145\/279943.279962"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/ICIP.2008.4712005"},{"key":"ref46","first-page":"-329i","article-title":"Audio-visual synchrony for detection of monologues in video archives","volume":"1","author":"iyengar","year":"0","journal-title":"Proc IEEE Int Conf Multimedia Expo"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-24571-8_47"},{"key":"ref48","first-page":"223","article-title":"Multimodal input fusion in human-computer interaction","volume":"198","author":"corradini","year":"2005","journal-title":"Nato Sci Ser Comput Syst Sci"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.1145\/1027527.1027661"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2006.886337"},{"key":"ref41","first-page":"37","article-title":"Fusion of multimodal information in music content analysis","volume":"3","author":"essid","year":"2012","journal-title":"Multimodal Music Processing"},{"key":"ref44","author":"konar","year":"2014","journal-title":"Emotion Recognition A Pattern Analysis Approach"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1109\/T-AFFC.2011.40"},{"key":"ref127","doi-asserted-by":"publisher","DOI":"10.1007\/s00530-002-0069-9"},{"key":"ref126","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2008.303"},{"key":"ref125","first-page":"ii-2013","article-title":"A coupled HMM for audio-visual speech recognition","volume":"2","author":"nefian","year":"0","journal-title":"Proc IEEE Int Conf Acoust Speech Signal Process"},{"key":"ref124","doi-asserted-by":"publisher","DOI":"10.1121\/1.2229005"},{"key":"ref73","doi-asserted-by":"publisher","DOI":"10.1007\/11608288_66"},{"key":"ref72","doi-asserted-by":"publisher","DOI":"10.1145\/1101149.1101236"},{"key":"ref129","first-page":"80","article-title":"An audio-visual person identification and verification system using FAPS as visual features","author":"aleksic","year":"0","journal-title":"Proc ACM Workshop on Multimodal User Authentication"},{"key":"ref71","doi-asserted-by":"publisher","DOI":"10.1145\/2070481.2070485"},{"key":"ref128","article-title":"IBM research TRECVID-2007 video retrieval system","author":"campbell","year":"0","journal-title":"Proc TRECVID"},{"key":"ref70","doi-asserted-by":"publisher","DOI":"10.1109\/6046.865479"},{"key":"ref76","doi-asserted-by":"crossref","first-page":"182","DOI":"10.1007\/978-3-540-30568-2_16","article-title":"Av16. 3: An audio-visual corpus for speaker localization and tracking","author":"lathoud","year":"2005","journal-title":"Machine Learning for Multimodal Interaction"},{"key":"ref130","first-page":"ii-377","article-title":"Joint audio-video processing for biometric speaker identification","volume":"2","author":"kanak","year":"0","journal-title":"Proc IEEE Int Conf Acoust Speech Signal Process"},{"key":"ref77","year":"0","journal-title":"TREC Video Retrieval Evaluation (TRECVID)"},{"key":"ref74","first-page":"1612","article-title":"A short introduction to boosting","volume":"14","author":"freund","year":"1999","journal-title":"J Jpn Soc Artif Intell"},{"key":"ref75","year":"2009","journal-title":"Performance Evaluation of Tracking and Surveillance"},{"key":"ref133","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.1997.596176"},{"key":"ref134","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.1998.679695"},{"key":"ref131","first-page":"17","article-title":"Audio-visual multimodal fusion for biometric person authentication and liveness verification","volume":"57","author":"chetty","year":"0","journal-title":"Proc NICTA-HCSNet Multimodal User Interact Workshop (MMUI)"},{"key":"ref78","doi-asserted-by":"publisher","DOI":"10.1007\/3-540-44887-X_98"},{"key":"ref132","doi-asserted-by":"publisher","DOI":"10.1145\/1126004.1126007"},{"key":"ref79","doi-asserted-by":"crossref","first-page":"403","DOI":"10.1007\/BFb0016021","article-title":"The M2VTS multimodal face database (release 1.00)","author":"pigeon","year":"1997","journal-title":"Audio-and Video-Based Biometric Person Authentication"},{"key":"ref136","first-page":"-853i","article-title":"Maximum entropy and MCE based HMM stream weight estimation for audio-visual ASR","author":"gravier","year":"0","journal-title":"Proc IEEE Int Conf Acoust Speech Signal Process"},{"key":"ref135","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.1990.115863"},{"key":"ref138","doi-asserted-by":"crossref","first-page":"1260","DOI":"10.1155\/S1110865702206150","article-title":"Noise adaptive stream weighting in audio-visual speech recognition","author":"heckmann","year":"2002","journal-title":"EURASIP J Appl Signal Process"},{"key":"ref137","first-page":"iii-605-8","article-title":"Frame-dependent multi-stream reliability indicators for audio-visual speech recognition","volume":"3","author":"garg","year":"0","journal-title":"Proc Int Conf Multimedia Expo"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2008.52"},{"key":"ref139","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2007.367227"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.1007\/978-0-387-76316-3"},{"key":"ref61","first-page":"23","article-title":"Audio-visual automatic speech recognition: An overview","volume":"22","author":"potamianos","year":"2004","journal-title":"Issues in Visual and Audio-Visual Speech Processing"},{"key":"ref63","doi-asserted-by":"publisher","DOI":"10.1017\/ATSIP.2014.11"},{"key":"ref64","doi-asserted-by":"publisher","DOI":"10.1007\/BF01238023"},{"key":"ref140","first-page":"237","article-title":"Dynamic modality weighting for multi-stream HMMs in audio-visual speech recognition","author":"gurban","year":"0","journal-title":"Proc of Int Conf on Multimodal Interfaces"},{"key":"ref65","author":"chen","year":"1976","journal-title":"Pattern Recognition and Artificial Intelligence"},{"key":"ref141","author":"mihelic","year":"2008","journal-title":"Speech Recognition Technologies and Applications I-Tech"},{"key":"ref66","author":"waibel","year":"1990","journal-title":"Readings in Speech Recognition"},{"key":"ref142","doi-asserted-by":"publisher","DOI":"10.1007\/s11265-011-0578-x"},{"key":"ref67","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-96868-6_123"},{"key":"ref143","doi-asserted-by":"publisher","DOI":"10.1109\/ICIP.2008.4712005"},{"key":"ref68","first-page":"2454","article-title":"Posterior-based sparse representation for automatic speech recognition","author":"bahaadini","year":"0","journal-title":"Proc INTERSPEECH"},{"key":"ref144","doi-asserted-by":"publisher","DOI":"10.1016\/j.specom.2007.11.002"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/89.841215"},{"key":"ref69","doi-asserted-by":"publisher","DOI":"10.1109\/ACSSC.2012.6489302"},{"key":"ref145","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2011.2172427"},{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/21.44007"},{"key":"ref109","first-page":"1144","article-title":"Dynamic stream weight estimation in coupled-HMM-based audio-visual speech recognition using multilayer perceptrons","author":"abdelaziz","year":"0","journal-title":"Proc INTERSPEECH"},{"key":"ref95","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2005.49"},{"key":"ref108","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2011.2172427"},{"key":"ref94","doi-asserted-by":"publisher","DOI":"10.1145\/641007.641070"},{"key":"ref107","doi-asserted-by":"publisher","DOI":"10.1016\/j.specom.2007.11.002"},{"key":"ref93","author":"makkook","year":"2007","journal-title":"A multimodal sensor fusion architecture for audio-visual speech recognition"},{"key":"ref106","article-title":"Audio-visual fusion: New methods and applications","author":"casanovas","year":"2011","journal-title":"Ph D Dissertation"},{"key":"ref92","doi-asserted-by":"publisher","DOI":"10.1109\/ICME.2002.1035364"},{"key":"ref105","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2010.2050650"},{"key":"ref91","doi-asserted-by":"publisher","DOI":"10.1007\/3-540-45683-X_60"},{"key":"ref104","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2014.2377515"},{"key":"ref90","doi-asserted-by":"publisher","DOI":"10.1109\/ISM.2007.4412354"},{"key":"ref103","doi-asserted-by":"publisher","DOI":"10.1109\/78.984773"},{"key":"ref102","first-page":"43","article-title":"Kalman and extended Kalman filters: Concept, derivation and properties","author":"ribeiro","year":"2004","journal-title":"Institute for Systems and Robotics"},{"key":"ref111","doi-asserted-by":"publisher","DOI":"10.1109\/ICME.2004.1394400"},{"key":"ref112","doi-asserted-by":"publisher","DOI":"10.1109\/SLT.2006.326841"},{"key":"ref110","doi-asserted-by":"publisher","DOI":"10.1145\/1052199.1052204"},{"key":"ref98","author":"dean","year":"2008","journal-title":"Synchronous HMMs for audio-visual speech processing"},{"key":"ref99","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2007.1124"},{"key":"ref96","doi-asserted-by":"publisher","DOI":"10.1016\/j.inffus.2003.04.001"},{"key":"ref97","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.1997.609450"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/JPROC.2010.2057231"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/ICPR.2008.4761927"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/ICME.2003.1221658"},{"key":"ref13","doi-asserted-by":"crossref","first-page":"1213","DOI":"10.1155\/S1110865702206162","article-title":"Audio-visual speech recognition using MPEG-4 compliant visual features","volume":"2002","author":"aleksic","year":"2002","journal-title":"EURASIP J Appl Signal Process"},{"key":"ref14","doi-asserted-by":"crossref","first-page":"1274","DOI":"10.1155\/S1110865702206083","article-title":"Dynamic Bayesian networks for audio-visual speech recognition","volume":"2002","author":"nefian","year":"1900","journal-title":"EURASIP J Adv Signal Process"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/ISIMP.2001.925455"},{"key":"ref118","doi-asserted-by":"publisher","DOI":"10.1006\/jpho.2002.0177"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.4018\/978-1-60566-186-5.ch002"},{"key":"ref82","doi-asserted-by":"publisher","DOI":"10.1016\/0167-6393(90)90010-7"},{"key":"ref117","doi-asserted-by":"publisher","DOI":"10.1121\/1.428111"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.4018\/978-1-60566-186-5.ch001"},{"key":"ref81","author":"sanderson","year":"2002","journal-title":"The VidTIMIT database"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1016\/j.csl.2009.03.007"},{"key":"ref84","article-title":"The realistic multi-modal VALID database and visual speaker identification comparison experiments","author":"fox","year":"0","journal-title":"Int Conf Audio and Video based Biometric Person Authentication"},{"key":"ref119","doi-asserted-by":"publisher","DOI":"10.1017\/S095267570000230X"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1155\/2007\/70186"},{"key":"ref83","author":"chibelushi","year":"1996","journal-title":"Bt DAVID databasevinternal rep"},{"key":"ref114","author":"terry","year":"2011","journal-title":"Audio-visual asynchrony modeling and analysis for speech alignment and recognition"},{"key":"ref113","first-page":"2682","article-title":"Audio-visual anticipatory coarticulation modeling by human and machine","author":"terry","year":"0","journal-title":"Proc INTERSPEECH"},{"key":"ref116","doi-asserted-by":"publisher","DOI":"10.1007\/s10489-014-0629-7"},{"key":"ref80","first-page":"965","article-title":"XM2VTSDB: The extended M2VTS database","volume":"964","author":"messer","year":"0","journal-title":"Proc 2nd Int Conf Audio Video-Based Biometric Person Authenticat"},{"key":"ref115","first-page":"689","article-title":"Multimodal deep learning","author":"ngiam","year":"0","journal-title":"Proc 28th Int Conf Mach Learn"},{"key":"ref120","author":"henke","year":"1966","journal-title":"Dynamic Articulatory Model of Speech Production Using Computer Simulation"},{"key":"ref89","doi-asserted-by":"publisher","DOI":"10.1109\/MSP.2005.1511827"},{"key":"ref121","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.1994.389567"},{"key":"ref122","first-page":"32","article-title":"The intrinsic bimodality of speech communication and the synthesis of talking faces","volume":"43","author":"benoit","year":"1992","journal-title":"J Commun"},{"key":"ref123","first-page":"3","article-title":"Overcoming barriers to progress in multimodal fusion research","author":"garofolo","year":"0","journal-title":"Proc AAAI Fall Symp Multimedia Inf Extraction"},{"key":"ref85","first-page":"2489","article-title":"AVICAR: Audio-visual speech corpus in a car environment","author":"lee","year":"0","journal-title":"Proc INTERSPEECH"},{"key":"ref86","first-page":"625","article-title":"The BANCA database and evaluation protocol","author":"messer","year":"2003","journal-title":"Audio-and Video-Based Biometric Person Authentication"},{"key":"ref87","first-page":"ii-2017","article-title":"CUAVE: A new audio-visual database for multimodal human-computer interface research","volume":"2","author":"patterson","year":"0","journal-title":"Proc IEEE Int Conf Acoust Speech Signal Process"},{"key":"ref88","doi-asserted-by":"publisher","DOI":"10.1145\/1180995.1181037"}],"container-title":["Proceedings of the IEEE"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/5\/7214335\/07194741.pdf?arnumber=7194741","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,1,12]],"date-time":"2022-01-12T16:03:22Z","timestamp":1642003402000},"score":1,"resource":{"primary":{"URL":"http:\/\/ieeexplore.ieee.org\/document\/7194741\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2015,9]]},"references-count":171,"journal-issue":{"issue":"9"},"URL":"https:\/\/doi.org\/10.1109\/jproc.2015.2459017","relation":{},"ISSN":["0018-9219","1558-2256"],"issn-type":[{"value":"0018-9219","type":"print"},{"value":"1558-2256","type":"electronic"}],"subject":[],"published":{"date-parts":[[2015,9]]}}}