{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,12]],"date-time":"2026-07-12T04:30:58Z","timestamp":1783830658293,"version":"3.55.0"},"reference-count":41,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"7","license":[{"start":{"date-parts":[[2009,11,1]],"date-time":"2009-11-01T00:00:00Z","timestamp":1257033600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Multimedia"],"published-print":{"date-parts":[[2009,11]]},"DOI":"10.1109\/tmm.2009.2030637","type":"journal-article","created":{"date-parts":[[2009,8,21]],"date-time":"2009-08-21T12:22:31Z","timestamp":1250857351000},"page":"1254-1265","source":"Crossref","is-referenced-by-count":235,"title":["Lipreading With Local Spatiotemporal Descriptors"],"prefix":"10.1109","volume":"11","author":[{"family":"Guoying Zhao","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"M.","family":"Barnard","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"M.","family":"Pietikainen","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2007.1110"},{"key":"ref38","first-page":"179","article-title":"boosting local binary pattern (lbp)-based face recognition","volume":"3338","author":"zhang","year":"2004","journal-title":"Sinobiometrics"},{"key":"ref33","author":"potamianos","year":"2004","journal-title":"Issues in Visual and Audio-Visual Speech Processing"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/JPROC.2003.817150"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1109\/ICIP.1998.999008"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2002.1017623"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2001.990517"},{"key":"ref36","article-title":"the vidtimit database","author":"sanderson","year":"2002","journal-title":"IDIAP Communication 02-06"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2005.1416343"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2005.251"},{"key":"ref10","author":"cohen","year":"1993","journal-title":"Models and Techniques in Computer Animation"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1145\/1290128.1290138"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.1995.479285"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1145\/982507.982512"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/2.820041"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2004.1326155"},{"key":"ref15","article-title":"audio-visual speech recognition with a hybrid svm-hmm system","author":"gurban","year":"2005","journal-title":"Proc 13th Eur Signal Processing Conf"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-540-75690-3_1"},{"key":"ref17","article-title":"a segment-based audio-visual speech recognizer: data collection, development, and initial experiments","author":"hazen","year":"2005","journal-title":"Proc ICMI"},{"key":"ref18","first-page":"2489","article-title":"avicar: audio-visual speech corpus in a car environment","author":"lee","year":"2004","journal-title":"Proc Int Conf Spoken Language"},{"key":"ref19","first-page":"563","article-title":"audio-to-visual conversion using hidden markov models","author":"lee","year":"2002","journal-title":"Proc 2nd Pacific Rim Int Conf Artificial Intelligence"},{"key":"ref28","first-page":"1216","article-title":"2d cascaded adaboost for eye localization","author":"niu","year":"2006","journal-title":"Proc Int Conf Pattern Recognition"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/JPROC.2006.886017"},{"key":"ref27","article-title":"audio-visual speech recognition","author":"neti","year":"2000","journal-title":"Center for Language and Speech Processing The Johns Hopkins University Baltimore MD Final Workshop 2000 Report"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/ICME.2003.1221658"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/MMSP.1999.793893"},{"key":"ref29","article-title":"feature based representation for audio-visual speech recognition","author":"niyogi","year":"1999","journal-title":"Proc Audio-Visual Speech Processing Conf"},{"key":"ref5","article-title":"mutual information engenlips for audio-visual speech","author":"arsic","year":"2006","journal-title":"Proc 14th Eur Signal Processing Conf"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/5.664274"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/ICSLP.1996.607943"},{"key":"ref2","doi-asserted-by":"crossref","first-page":"1213","DOI":"10.1155\/S1110865702206162","article-title":"audio-visual speech recognition using mpeg-4 compliant visual features","volume":"11","author":"aleksic","year":"2002","journal-title":"EURASIP J Appl Signal Process"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/83.605417"},{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2006.244"},{"key":"ref20","article-title":"confusability of phonemes grouped according to their viseme classes in noisy environments","author":"lucey","year":"2004","journal-title":"Proc 4th Australian Int Conf Speech Science and Technology"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1002\/scj.4690220607"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/ICSLP.1996.607030"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1109\/34.982900"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1016\/j.patrec.2009.03.018"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1038\/264746a0"},{"key":"ref26","doi-asserted-by":"crossref","first-page":"1274","DOI":"10.1155\/S1110865702206083","article-title":"dynamic bayesian networks for audio-visual speech recognition","volume":"11","author":"nefian","year":"2002","journal-title":"EURASIP J Appl Signal Process"},{"key":"ref25","article-title":"xm2vtsdb: the extended m2vts database","author":"messer","year":"1999","journal-title":"Proc 2nd Int Conf Audio and Video-Based Biometric Person Authentication"}],"container-title":["IEEE Transactions on Multimedia"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx5\/6046\/5286795\/05208233.pdf?arnumber=5208233","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2021,10,10]],"date-time":"2021-10-10T23:52:30Z","timestamp":1633909950000},"score":1,"resource":{"primary":{"URL":"http:\/\/ieeexplore.ieee.org\/document\/5208233\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2009,11]]},"references-count":41,"journal-issue":{"issue":"7"},"URL":"https:\/\/doi.org\/10.1109\/tmm.2009.2030637","relation":{},"ISSN":["1520-9210","1941-0077"],"issn-type":[{"value":"1520-9210","type":"print"},{"value":"1941-0077","type":"electronic"}],"subject":[],"published":{"date-parts":[[2009,11]]}}}