{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,1]],"date-time":"2026-07-01T06:26:57Z","timestamp":1782887217885,"version":"3.54.5"},"reference-count":60,"publisher":"Springer Science and Business Media LLC","issue":"14","license":[{"start":{"date-parts":[[2015,7,9]],"date-time":"2015-07-09T00:00:00Z","timestamp":1436400000000},"content-version":"tdm","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Multimed Tools Appl"],"published-print":{"date-parts":[[2016,7]]},"DOI":"10.1007\/s11042-015-2774-3","type":"journal-article","created":{"date-parts":[[2015,7,8]],"date-time":"2015-07-08T06:52:10Z","timestamp":1436338330000},"page":"8609-8636","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":23,"title":["An adaptive approach for lip-reading using image and depth data"],"prefix":"10.1007","volume":"75","author":[{"given":"Ahmed","family":"Rekik","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-0073-3023","authenticated-orcid":false,"given":"Achraf","family":"Ben-Hamadou","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Walid","family":"Mahdi","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2015,7,9]]},"reference":[{"key":"2774_CR1","unstructured":"Ahlberg J (2001) Candide-3 - an updated parameterised face. Tech. rep."},{"key":"2774_CR2","doi-asserted-by":"crossref","unstructured":"Aleksic PS, Katsaggelos AK (2003) Product hmms for audio-visual continuous speech recognition using facial animation parameters. In: International conference on multimedia and expo, vol 2, pp II\u2013481","DOI":"10.1109\/ICME.2003.1221658"},{"key":"2774_CR3","doi-asserted-by":"crossref","unstructured":"Bakry A, Elgammal A (2013) Mkpls: manifold kernel partial least squares for lipreading and speaker identification. In: International conference on computer vision and pattern recognition, pp 684\u2013 691","DOI":"10.1109\/CVPR.2013.94"},{"key":"2774_CR4","doi-asserted-by":"crossref","unstructured":"Baltru\u0161aitis T, Robinson P, Morency LP (2012) 3D constrained local model for rigid and non-rigid facial tracking. In: International conference on computer vision and pattern recognition, pp 2610\u20132617","DOI":"10.1109\/CVPR.2012.6247980"},{"issue":"10","key":"2774_CR5","doi-asserted-by":"crossref","first-page":"1468","DOI":"10.1016\/j.cviu.2013.06.002","volume":"117","author":"A Ben-Hamadou","year":"2013","unstructured":"Ben-Hamadou A, Soussen C, Daul C, Blondel W, Wolf D (2013) Flexible calibration of structured-light systems projecting point patterns. Comput Vis Image Underst 117(10):1468\u20131481","journal-title":"Comput Vis Image Underst"},{"key":"2774_CR6","doi-asserted-by":"crossref","unstructured":"Breitenstein MD, K\u00fcttel D, Weise T, Gool LJV, Pfister H (2008) Real-time face pose estimation from single range images. In: International conference on computer vision and pattern recognition, pp 1\u20138","DOI":"10.1109\/CVPR.2008.4587807"},{"key":"2774_CR7","doi-asserted-by":"crossref","unstructured":"Cai Q, Gallup D, Zhang C, Zhang Z (2010) 3D deformable face tracking with a commodity depth camera. In: European conference on computer vision, pp 229\u2013242","DOI":"10.1007\/978-3-642-15558-1_17"},{"key":"2774_CR8","doi-asserted-by":"crossref","unstructured":"Dalal N, Triggs B (2005) Histograms of oriented gradients for human detection. In: International conference on computer vision and pattern recognition, vol 1, pp 886\u2013893","DOI":"10.1109\/CVPR.2005.177"},{"key":"2774_CR9","doi-asserted-by":"crossref","unstructured":"Dalal N, Triggs B, Schmid C (2006) Human detection using oriented histograms of flow and appearance. In: European conference on computer vision, pp 428\u2013441","DOI":"10.1007\/11744047_33"},{"key":"2774_CR10","unstructured":"Danelakis A, Theoharis T, Pratikakis I (2014) A survey on facial expression recognition in 3d video sequences. Multimedia Tools and Applications, pp 1\u201339"},{"key":"2774_CR11","unstructured":"Duda RO, Hart PE, Stork DG (2012) Pattern classification. Wiley"},{"issue":"1","key":"2774_CR12","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1186\/1687-6180-2012-1","volume":"2012","author":"V Estellers","year":"2012","unstructured":"Estellers V, Thiran JP (2012) Multi-pose lipreading and audio-visual speech recognition. Journal on Advances in Signal Processing 2012(1):1\u201323","journal-title":"Journal on Advances in Signal Processing"},{"key":"2774_CR13","doi-asserted-by":"crossref","unstructured":"Fanelli G, Gall J, Gool LJV (2011) Real time head pose estimation with random regression forests. In: International conference on computer vision and pattern recognition, pp 617\u2013624","DOI":"10.1109\/CVPR.2011.5995458"},{"key":"2774_CR14","doi-asserted-by":"crossref","unstructured":"Fanelli G, Weise T, Gall J, Gool LV (2011) Real time head pose estimation from consumer depth cameras. In: International conference on pattern recognition, pp 101\u2013110","DOI":"10.1007\/978-3-642-23123-0_11"},{"issue":"3","key":"2774_CR15","doi-asserted-by":"crossref","first-page":"437","DOI":"10.1007\/s11263-012-0549-0","volume":"101","author":"G Fanelli","year":"2013","unstructured":"Fanelli G, Dantone M, Gall J, Fossati A, Van Gool L (2013) Random forests for real time 3D face analysis. Int J Comput Vis 101(3):437\u2013458","journal-title":"Int J Comput Vis"},{"key":"2774_CR16","doi-asserted-by":"crossref","unstructured":"Farneb\u00e4ck G (2003) Two-frame motion estimation based on polynomial expansion. In: Image analysis. Springer, pp 363\u2013370","DOI":"10.1007\/3-540-45103-X_50"},{"key":"2774_CR17","doi-asserted-by":"crossref","first-page":"1546","DOI":"10.1016\/j.procs.2015.02.080","volume":"46","author":"UR Gogoi","year":"2015","unstructured":"Gogoi UR, Bhowmik MK, Saha P, Bhattacharjee D, De BK (2015) Facial mole detection: an approach towards face identification. Procedia Computer Science 46:1546\u20131553","journal-title":"Procedia Computer Science"},{"key":"2774_CR18","doi-asserted-by":"crossref","unstructured":"Gowdy JN, Subramanya A, Bartels C, Bilmes J (2004) Dbn based multi-stream models for audio-visual speech recognition. In: IEEE International conference on acoustics, speech, and signal processing, vol 1, pp I\u2013993","DOI":"10.1109\/ICASSP.2004.1326155"},{"key":"2774_CR19","volume-title":"Hidden Markov models for speech recognition, vol 2004","author":"XD Huang","year":"1990","unstructured":"Huang XD, Ariki Y, Jack MA (1990) Hidden Markov models for speech recognition. Columbia University Press, New York. ISBN: 0748601627"},{"key":"2774_CR20","doi-asserted-by":"crossref","unstructured":"Kumar K, Chen T, Stern RM (2007) Profile view lip reading. In: IEEE International conference on acoustics, speech and signal Processing, 2007. ICASSP 2007. IEEE, vol 4, pp IV\u2013429","DOI":"10.1109\/ICASSP.2007.366941"},{"key":"2774_CR21","doi-asserted-by":"crossref","unstructured":"Lan Y, Theobald BJ, Harvey R (2012) View independent computer lip-reading. In: International conference on multimedia and expo, pp 432\u2013437","DOI":"10.1109\/ICME.2012.192"},{"key":"2774_CR22","doi-asserted-by":"crossref","unstructured":"Livescu K, Cetin O, Hasegawa-Johnson M, King S, Bartels C, Borges N, Kantor A, Lal P, Yung L, Bezman A et al (2007) Articulatory feature-based methods for acoustic and audio-visual speech recognition: summary from the 2006 jhu summer workshop. In: IEEE International conference on acoustics, speech and signal processing, 2007. ICASSP 2007. IEEE, vol 4, pp IV\u2013621","DOI":"10.1109\/ICASSP.2007.366989"},{"key":"2774_CR23","doi-asserted-by":"crossref","unstructured":"Lucey P, Potamianos G (2006) Lipreading using profile versus frontal views. In: 2006 IEEE 8th workshop on multimedia signal processing. IEEE, pp 24\u201328","DOI":"10.1109\/MMSP.2006.285261"},{"key":"2774_CR24","unstructured":"Lucey P, Sridharan S (2006) Patch-based representation of visual speech. In: Proceedings of the HCSNet workshop on use of vision in human-computer interaction, pp 79\u201385"},{"key":"2774_CR25","doi-asserted-by":"crossref","unstructured":"Lucey PJ, Potamianos G, Sridharan S (2007) A unified approach to multi-pose audio-visual asr","DOI":"10.21437\/Interspeech.2007-281"},{"key":"2774_CR26","doi-asserted-by":"crossref","unstructured":"Lucey PJ, Sridharan S, Dean DB (2008) Continuous pose-invariant lipreading. In: Interspeech, casual productions, pp 2679\u20132682","DOI":"10.21437\/Interspeech.2008-664"},{"issue":"3","key":"2774_CR27","doi-asserted-by":"crossref","first-page":"253","DOI":"10.3233\/ICA-2008-15305","volume":"15","author":"W Mahdi","year":"2008","unstructured":"Mahdi W, Werda S, Hamadou AB (2008) A hybrid approach for automatic lip localization and viseme classification to enhance visual speech recognition. Integrated Computer-Aided Engineering 15(3):253\u2013266","journal-title":"Integrated Computer-Aided Engineering"},{"issue":"2","key":"2774_CR28","doi-asserted-by":"crossref","first-page":"431","DOI":"10.1137\/0111030","volume":"11","author":"DW Marquardt","year":"1963","unstructured":"Marquardt DW (1963) An algorithm for least-squares estimation of nonlinear parameters. J Soc Ind Appl Math 11(2):431\u2013441","journal-title":"J Soc Ind Appl Math"},{"issue":"2","key":"2774_CR29","doi-asserted-by":"crossref","first-page":"198","DOI":"10.1109\/34.982900","volume":"24","author":"I Matthews","year":"2002","unstructured":"Matthews I, Cootes TF, Bangham JA, Cox S, Harvey R (2002) Extraction of visual features for lipreading. IEEE Trans Pattern Anal Mach Intell 24(2):198\u2013213","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"2774_CR30","unstructured":"Maurel P (2008) Shape gradients, shape warping and medical application to facial expression analysis. PhD thesis, Ecole Doctorale de Sciences Math\u00e9matiques de Paris Centre"},{"issue":"4","key":"2774_CR31","doi-asserted-by":"crossref","first-page":"607","DOI":"10.1109\/TPAMI.2008.106","volume":"31","author":"E Murphy-Chutorian","year":"2009","unstructured":"Murphy-Chutorian E, Trivedi MM (2009) Head pose estimation in computer vision: a survey. IEEE Trans Pattern Anal Mach Intell 31(4):607\u2013626","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"issue":"3","key":"2774_CR32","doi-asserted-by":"crossref","first-page":"3634","DOI":"10.1016\/j.eswa.2011.09.054","volume":"39","author":"L Nanni","year":"2012","unstructured":"Nanni L, Lumini A, Brahnam S (2012) Survey on lbp based texture descriptors for image classification. Expert Syst Appl 39(3):3634\u20133641","journal-title":"Expert Syst Appl"},{"key":"2774_CR33","doi-asserted-by":"crossref","unstructured":"Nefian AV, Liang L, Pi X, Xiaoxiang L, Mao C, Murphy K (2002) A coupled hmm for audio-visual speech recognition. In: Acoustics, speech, and signal processing, vol 2, pp II\u20132013","DOI":"10.1109\/ICASSP.2002.5745027"},{"issue":"4","key":"2774_CR34","doi-asserted-by":"crossref","first-page":"308","DOI":"10.1093\/comjnl\/7.4.308","volume":"7","author":"JA Nelder","year":"1965","unstructured":"Nelder JA, Mead R (1965) A simplex method for function minimization. Comput J 7(4):308\u2013313","journal-title":"Comput J"},{"key":"2774_CR35","doi-asserted-by":"crossref","unstructured":"Padeleris P, Zabulis X, Argyros AA (2012) Head pose estimation on depth data based on particle swarm optimization. In: Computer vision and pattern recognition workshops, pp 42\u201349","DOI":"10.1109\/CVPRW.2012.6239236"},{"key":"2774_CR36","doi-asserted-by":"crossref","unstructured":"Pale\u010dek K (2014) Extraction of features for lip-reading using autoencoders. In: Speech and computer. Springer, pp 209\u2013216","DOI":"10.1007\/978-3-319-11581-8_26"},{"issue":"3","key":"2774_CR37","doi-asserted-by":"crossref","first-page":"423","DOI":"10.1109\/TASL.2008.2011515","volume":"17","author":"G Papandreou","year":"2009","unstructured":"Papandreou G, Katsamanis A, Pitsikalis V, Maragos P (2009) Adaptive multimodal fusion by uncertainty compensation with application to audiovisual speech recognition. Audio, Speech, and Language Processing 17(3):423\u2013435","journal-title":"Audio, Speech, and Language Processing"},{"key":"2774_CR38","doi-asserted-by":"crossref","unstructured":"Patterson EK, Gurbuz S, Tufekci Z, Gowdy J (2002) Cuave: a new audio-visual database for multimodal human-computer interface research. In: Acoustics, speech, and signal processing, vol 2, pp 2017\u20132020","DOI":"10.1109\/ICASSP.2002.5745028"},{"key":"2774_CR39","doi-asserted-by":"crossref","unstructured":"Pei Y, Kim TK, Zha H (2013) Unsupervised random forest manifold alignment for lipreading. In: International conference on computer vision, pp 129\u2013136","DOI":"10.1109\/ICCV.2013.23"},{"issue":"9","key":"2774_CR40","doi-asserted-by":"crossref","first-page":"1306","DOI":"10.1109\/JPROC.2003.817150","volume":"91","author":"G Potamianos","year":"2003","unstructured":"Potamianos G, Neti C, Gravier G, Garg A, Senior AW (2003) Recent advances in the automatic recognition of audiovisual speech. Proc IEEE 91(9):1306\u20131326","journal-title":"Proc IEEE"},{"issue":"1","key":"2774_CR41","doi-asserted-by":"crossref","first-page":"4","DOI":"10.1109\/MASSP.1986.1165342","volume":"3","author":"L Rabiner","year":"1986","unstructured":"Rabiner L, Juang BH (1986) An introduction to hidden markov models. IEEE ASSP Mag 3(1):4\u201316","journal-title":"IEEE ASSP Mag"},{"key":"2774_CR42","unstructured":"Rekik A, Ben-Hamadou A, Mahdi W (2013) 3D face pose tracking using low quality depth cameras. In: International conference on computer vision theory and applications, pp 223\u2013228"},{"key":"2774_CR43","doi-asserted-by":"crossref","unstructured":"Rekik A, Ben-Hamadou A, Mahdi W (2014) A new visual speech recognition approach for RGB-D cameras. In: International conference on image analysis and recognition, pp 21\u201328","DOI":"10.1007\/978-3-319-11755-3_3"},{"key":"2774_CR44","doi-asserted-by":"crossref","unstructured":"Romero M, Pears N (2009) Landmark localisation in 3d face data. In: 6th IEEE International conference on advanced video and signal based surveillance, 2009. AVSS\u201909. IEEE, pp 73\u201378","DOI":"10.1109\/AVSS.2009.90"},{"key":"2774_CR45","doi-asserted-by":"crossref","unstructured":"Saeed U (2011) Person identification using behavioral features from lip motion. In: 2011 IEEE International Conference on Automatic Face & Gesture Recognition and Workshops (FG 2011). IEEE, pp 131\u2013136","DOI":"10.1109\/FG.2011.5771386"},{"key":"2774_CR46","doi-asserted-by":"crossref","unstructured":"Shaikh AA, Kumar DK, Yau WC, Che Azemin M, Gubbi J (2010) Lip reading using optical flow and support vector machines. In: Image and Signal Processing (CISP), vol 1, pp 327\u2013330","DOI":"10.1109\/CISP.2010.5646264"},{"issue":"3","key":"2774_CR47","doi-asserted-by":"crossref","first-page":"559","DOI":"10.1016\/j.patcog.2010.09.011","volume":"44","author":"J Shin","year":"2011","unstructured":"Shin J, Lee J, Kim D (2011) Real-time lip reading system for isolated korean word recognition. Pattern Recogn 44(3):559\u2013571","journal-title":"Pattern Recogn"},{"key":"2774_CR48","doi-asserted-by":"crossref","unstructured":"Smisek J, Jancosek M, Pajdla T (2013) 3D with kinect. In: Consumer depth cameras for computer vision, pp 3\u201325","DOI":"10.1007\/978-1-4471-4640-7_1"},{"key":"2774_CR49","doi-asserted-by":"crossref","unstructured":"Valstar MF, Martinez B, Binefa X, Pantic M (2010) Facial point detection using boosted regression and graph models. In: International conference on computer vision and pattern recognition, pp 2729\u2013 2736","DOI":"10.1109\/CVPR.2010.5539996"},{"key":"2774_CR50","doi-asserted-by":"crossref","unstructured":"Vapnik V (2000) The nature of statistical learning theory. Springer","DOI":"10.1007\/978-1-4757-3264-1"},{"issue":"10","key":"2774_CR51","doi-asserted-by":"crossref","first-page":"698","DOI":"10.1016\/j.imavis.2012.02.007","volume":"30","author":"E Vezzetti","year":"2012","unstructured":"Vezzetti E, Marcolin F (2012) 3d human face description: landmarks measures and geometrical features. Image Vis Comput 30(10):698\u2013712","journal-title":"Image Vis Comput"},{"issue":"2","key":"2774_CR52","doi-asserted-by":"crossref","first-page":"218","DOI":"10.1016\/j.bjps.2008.09.031","volume":"63","author":"E Vezzetti","year":"2010","unstructured":"Vezzetti E, Calignano F, Moos S (2010) Computer-aided morphological analysis for maxillo-facial diagnostic: a preliminary study. J Plast Reconstr Aesthet Surg 63(2):218\u2013226","journal-title":"J Plast Reconstr Aesthet Surg"},{"issue":"2","key":"2774_CR53","doi-asserted-by":"crossref","first-page":"137","DOI":"10.1023\/B:VISI.0000013087.49260.fb","volume":"57","author":"P Viola","year":"2004","unstructured":"Viola P, Jones MJ (2004) Robust real-time face detection. Int J Comput Vis 57(2):137\u2013154","journal-title":"Int J Comput Vis"},{"key":"2774_CR54","unstructured":"Werda S, Mahdi W, Hamadou AB (2007) A new lip-reading approach for human computer interaction. In: Proceedings of the 9th International conference on enterprise information systems, ICEIS 2007, Volume HCI, Funchal, Madeira, Portugal, June 12\u201316, 2007, pp 27\u201336"},{"key":"2774_CR55","doi-asserted-by":"crossref","unstructured":"Yargic A, Dogan M (2013) A lip reading application on ms kinect camera. In: Innovations in intelligent systems and applications, pp 1\u20135","DOI":"10.1109\/INISTA.2013.6577656"},{"issue":"7","key":"2774_CR56","doi-asserted-by":"crossref","first-page":"1254","DOI":"10.1109\/TMM.2009.2030637","volume":"11","author":"G Zhao","year":"2009","unstructured":"Zhao G, Barnard M, Pietikainen M (2009) Lipreading with local spatiotemporal descriptors. IEEE Trans Multimedia 11(7):1254\u20131265","journal-title":"IEEE Trans Multimedia"},{"key":"2774_CR57","doi-asserted-by":"crossref","unstructured":"Zhou Z, Zhao G, Pietikainen M (2010) Lipreading: a graph embedding approach. In: International conference on pattern recognition, pp 523\u2013526","DOI":"10.1109\/ICPR.2010.133"},{"key":"2774_CR58","doi-asserted-by":"crossref","unstructured":"Zhou Z, Zhao G, Pietikainen M (2011) Towards a practical lipreading system. In: International conference on computer vision and pattern recognition, pp 137\u2013144","DOI":"10.1109\/CVPR.2011.5995345"},{"issue":"1","key":"2774_CR59","first-page":"181","volume":"36","author":"Z Zhou","year":"2014","unstructured":"Zhou Z, Hong X, Zhao G, Pietikainen M (2014) A compact representation of visual speech data using latent variables. IEEE Trans Pattern Anal Mach Intell 36(1):181\u2013187","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"issue":"9","key":"2774_CR60","doi-asserted-by":"crossref","first-page":"590","DOI":"10.1016\/j.imavis.2014.06.004","volume":"32","author":"Z Zhou","year":"2014","unstructured":"Zhou Z, Zhao G, Hong X, Pietik\u00e4inen M (2014) A review of recent advances in visual speech decoding. Image Vis Comput 32(9):590\u2013605","journal-title":"Image Vis Comput"}],"container-title":["Multimedia Tools and Applications"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-015-2774-3.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/article\/10.1007\/s11042-015-2774-3\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-015-2774-3","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,5,17]],"date-time":"2022-05-17T20:19:12Z","timestamp":1652818752000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/s11042-015-2774-3"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2015,7,9]]},"references-count":60,"journal-issue":{"issue":"14","published-print":{"date-parts":[[2016,7]]}},"alternative-id":["2774"],"URL":"https:\/\/doi.org\/10.1007\/s11042-015-2774-3","relation":{},"ISSN":["1380-7501","1573-7721"],"issn-type":[{"value":"1380-7501","type":"print"},{"value":"1573-7721","type":"electronic"}],"subject":[],"published":{"date-parts":[[2015,7,9]]}}}