{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,6,1]],"date-time":"2025-06-01T04:12:17Z","timestamp":1748751137576,"version":"3.41.0"},"reference-count":24,"publisher":"Springer Science and Business Media LLC","issue":"3","license":[{"start":{"date-parts":[[2015,12,6]],"date-time":"2015-12-06T00:00:00Z","timestamp":1449360000000},"content-version":"tdm","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["61175016"],"award-info":[{"award-number":["61175016"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["61471259"],"award-info":[{"award-number":["61471259"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Multimedia Systems"],"published-print":{"date-parts":[[2016,6]]},"DOI":"10.1007\/s00530-015-0499-9","type":"journal-article","created":{"date-parts":[[2015,12,6]],"date-time":"2015-12-06T07:14:33Z","timestamp":1449386073000},"page":"315-323","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":16,"title":["Audio-visual speech recognition integrating 3D lip information obtained from the Kinect"],"prefix":"10.1007","volume":"22","author":[{"given":"Jianrong","family":"Wang","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Ju","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Kiyoshi","family":"Honda","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jianguo","family":"Wei","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jianwu","family":"Dang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2015,12,6]]},"reference":[{"key":"499_CR1","volume-title":"Hearing by Eye: The Psychology of Lip-Reading","author":"BE Dodd","year":"1987","unstructured":"Dodd, B.E., Campbell, R.E.: Hearing by Eye: The Psychology of Lip-Reading. Lawrence Erlbaum Associates Inc, New Jersey (1987)"},{"issue":"5588","key":"499_CR2","doi-asserted-by":"crossref","first-page":"746","DOI":"10.1038\/264746a0","volume":"264","author":"H McGurk","year":"1976","unstructured":"McGurk, H., MacDonald, J.: Hearing lips and seeing voices. Nature 264(5588), 746\u2013748 (1976)","journal-title":"Nature"},{"issue":"1","key":"499_CR3","doi-asserted-by":"crossref","first-page":"29","DOI":"10.3109\/03005369009077840","volume":"24","author":"A Macleod","year":"1990","unstructured":"Macleod, A., Summerfield, Q.: A procedure for measuring auditory and audiovisual speech-reception thresholds for sentences in noise: Rationale, evaluation, and recommendations for use. Br. J. Audiol. 24(1), 29\u201343 (1990)","journal-title":"Br. J. Audiol."},{"issue":"1","key":"499_CR4","first-page":"64","volume":"5","author":"A Mehrabian","year":"1971","unstructured":"Mehrabian, A.: Nonverbal betrayal of feeling. J. Exp. Res. Personal. 5(1), 64\u201373 (1971)","journal-title":"J. Exp. Res. Personal."},{"doi-asserted-by":"crossref","unstructured":"Potamianos, G., Graf, H.P., Cosatto, E.: An image transform approach for HMM based automatic lipreading. In: Proceedings of the International Conference on Image Processing, pp. 173\u2013177 (1998)","key":"499_CR5","DOI":"10.1109\/ICIP.1998.999008"},{"issue":"3\u20134","key":"499_CR6","doi-asserted-by":"crossref","first-page":"193","DOI":"10.1023\/A:1011352422845","volume":"4","author":"G Potamianos","year":"2001","unstructured":"Potamianos, G., Neti, C., Iyengar, G., Senior, A.W., Verma, A.: A cascade visual front end for speaker independent automatic speechreading. Int. J. Speech Technol. 4(3\u20134), 193\u2013208 (2001)","journal-title":"Int. J. Speech Technol."},{"doi-asserted-by":"crossref","unstructured":"Neti, C., Potamianos, G., Luettin, J., Matthews, I., Glotin, H., Vergyri, D.: Large-vocabulary audio-visual speech recognition: a summary of the Johns Hopkins summer 2000 workshop. In: Proceedings of the IEEE Fourth Workshop on Multimedia Signal Processing, pp. 619\u2013624 (2001)","key":"499_CR7","DOI":"10.1109\/MMSP.2001.962801"},{"issue":"9","key":"499_CR8","doi-asserted-by":"crossref","first-page":"1306","DOI":"10.1109\/JPROC.2003.817150","volume":"91","author":"G Potamianos","year":"2003","unstructured":"Potamianos, G., Neti, C., Gravier, G., Garg, A., Senior, A.W.: Recent advances in the automatic recognition of audio-visual speech. Proc. IEEE 91(9), 1306\u20131326 (2003)","journal-title":"Proc. IEEE"},{"doi-asserted-by":"crossref","unstructured":"Xu, C., Wang, Y., Tan, T., Quan, L.: Depth vs. intensity: which is more important for face recognition?. In: Proceedings of the International Conference on Pattern Recognition, pp. 342\u2013345 (2004)","key":"499_CR9","DOI":"10.1109\/ICPR.2004.1334122"},{"doi-asserted-by":"crossref","unstructured":"Goecke, R., Millar. J.B.: The audio-video Australian English speech data corpus AVOZES. In: Proceedings of the International Conference on Spoken Language Processing, pp. 2525\u20132528 (2004)","key":"499_CR10","DOI":"10.21437\/Interspeech.2004-433"},{"unstructured":"Ortega, A., Sukno, F., Lleida, E., Frangi, A.F., Miguel, A., Buera, L., Zacur, E.: AV@ CAR: a Spanish multichannel multimodal corpus for invehicle automatic audio-visual speech recognition. In: Proceedings of the International Conference on Language Resources and Evaluation, pp. 763\u2013766 (2004)","key":"499_CR11"},{"issue":"6","key":"499_CR12","doi-asserted-by":"crossref","first-page":"591","DOI":"10.1109\/TMM.2010.2052239","volume":"12","author":"G Fanelli","year":"2010","unstructured":"Fanelli, G., Gall, J., Romsdorfer, H., Weise, T., Van Gool, L.: Acquisition of a 3D audio-visual corpus of affective speech. IEEE Trans. Multimed. 12(6), 591\u2013598 (2010)","journal-title":"IEEE Trans. Multimed."},{"unstructured":"Vorwerk, A., Wang, X., Kolossa, D., Zeiler, S., Orglmeister, R.: WAPUSK20-a database for robust audio-visual speech recognition. In: Proceedings of the International Conference on Language Resources and Evaluation, pp. 3016\u20133019 (2010)","key":"499_CR13"},{"key":"499_CR14","doi-asserted-by":"crossref","DOI":"10.1007\/978-1-4302-4105-8","volume-title":"Beginning Kinect Programming with the Microsoft Kinect SDK","author":"J Webb","year":"2012","unstructured":"Webb, J., Ashley, J.: Beginning Kinect Programming with the Microsoft Kinect SDK. Apress, California (2012)"},{"unstructured":"Galatas, G., Potamianos, G., Kosmopoulos, D.I., McMurrough, C., Makedon, F.: Bilingual corpus for AVASR using multiple sensors and depth information. In: Proceedings of the International Conference on Auditory-Visual Speech Processing, pp. 103\u2013106 (2011)","key":"499_CR15"},{"doi-asserted-by":"crossref","unstructured":"Galatas, G., Potamianos, G., Makedon, F.: Audio-visual speech recognition incorporating facial depth information captured by the Kinect. In: Proceedings of the European Signal Processing Conference, pp. 2714\u20132717 (2012)","key":"499_CR16","DOI":"10.1145\/2413097.2413100"},{"unstructured":"Ahlberg, J.: Candide-3-an updated parameterized face. Report No. LiTH-ISY-R-2326. Linkoping University, Sweden (2001)","key":"499_CR17"},{"doi-asserted-by":"crossref","unstructured":"Yuan, J., Ryant, N., Liberman, M., Stolcke, A., Mitra, V., Wang, W.: Automatic phonetic segmentation using boundary models. In: Proceedings of the Annual Conference of the International Speech Communication Association, pp. 2306\u20132310 (2013)","key":"499_CR18","DOI":"10.21437\/Interspeech.2013-540"},{"doi-asserted-by":"crossref","unstructured":"Yargic, A., Dogan, M.: A lip reading application on MS Kinect camera. In: Proceedings of the International Symposium on Innovations in Intelligent Systems and Applications, pp. 1\u20135 (2013)","key":"499_CR19","DOI":"10.1109\/INISTA.2013.6577656"},{"issue":"1","key":"499_CR20","first-page":"62","volume":"5","author":"S Werda","year":"2013","unstructured":"Werda, S., Mahdi, W., Hamadou, A.B.: Lip localization and viseme classification for visual speech recognition. Int. J. Comput. Inf. Sci. 5(1), 62\u201375 (2013)","journal-title":"Int. J. Comput. Inf. Sci."},{"key":"499_CR21","volume-title":"Kinect Basics. Arduino and Kinect Projects","author":"E Ramos","year":"2012","unstructured":"Ramos, E.: Kinect Basics. Arduino and Kinect Projects. Apress, California (2012)"},{"doi-asserted-by":"crossref","unstructured":"Hong, X., Yao, H., Wan, Y., Chen, R.: A PCA based visual DCT feature extraction method for Lip-Reading. In: Proceedings of the International Conference on Intelligent Information Hiding and Multimedia Signal Processing, pp. 321\u2013326 (2006)","key":"499_CR22","DOI":"10.1109\/IIH-MSP.2006.265008"},{"key":"499_CR23","volume-title":"Introduction to Multivariate Analysis","author":"C Chatfield","year":"2013","unstructured":"Chatfield, C., Collins, A.J.: Introduction to Multivariate Analysis. Springer, Berlin (2013)"},{"key":"499_CR24","volume-title":"The Hidden Markov Model Toolkit Book (version 3.4)","author":"S Young","year":"1995","unstructured":"Young, S., Evermann, G., Gales, M., Hain, T., Kershaw, D., Moore, G., Odell, J., Ollason, D., Povey, D., Valtchev, V., et al.: The Hidden Markov Model Toolkit Book (version 3.4). Entropic Cambridge Research Laboratory, Cambridge (1995)"}],"container-title":["Multimedia Systems"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s00530-015-0499-9.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/article\/10.1007\/s00530-015-0499-9\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s00530-015-0499-9","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,5,31]],"date-time":"2025-05-31T17:37:50Z","timestamp":1748713070000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/s00530-015-0499-9"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2015,12,6]]},"references-count":24,"journal-issue":{"issue":"3","published-print":{"date-parts":[[2016,6]]}},"alternative-id":["499"],"URL":"https:\/\/doi.org\/10.1007\/s00530-015-0499-9","relation":{},"ISSN":["0942-4962","1432-1882"],"issn-type":[{"type":"print","value":"0942-4962"},{"type":"electronic","value":"1432-1882"}],"subject":[],"published":{"date-parts":[[2015,12,6]]}}}