{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,4]],"date-time":"2026-05-04T13:30:47Z","timestamp":1777901447694,"version":"3.51.4"},"reference-count":45,"publisher":"Springer Science and Business Media LLC","issue":"27-28","license":[{"start":{"date-parts":[[2020,4,20]],"date-time":"2020-04-20T00:00:00Z","timestamp":1587340800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2020,4,20]],"date-time":"2020-04-20T00:00:00Z","timestamp":1587340800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Multimed Tools Appl"],"published-print":{"date-parts":[[2020,7]]},"DOI":"10.1007\/s11042-020-08837-2","type":"journal-article","created":{"date-parts":[[2020,4,20]],"date-time":"2020-04-20T07:02:48Z","timestamp":1587366168000},"page":"20461-20481","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":11,"title":["A multimodel keyword spotting system based on lip movement and speech features"],"prefix":"10.1007","volume":"79","author":[{"given":"Anand","family":"Handa","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Rashi","family":"Agarwal","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Narendra","family":"Kohli","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2020,4,20]]},"reference":[{"key":"8837_CR1","doi-asserted-by":"publisher","first-page":"142","DOI":"10.3389\/fnana.2015.00142","volume":"9","author":"I Arganda-Carreras","year":"2015","unstructured":"Arganda-Carreras I, Turaga SC, Berger DR, Cire\u015fan D, Giusti A, Gambardella LM, Schmidhuber J, Laptev D, Dwivedi S, Buhmann JM, et al. (2015) Crowdsourcing the creation of image segmentation algorithms for connectomics. Frontiers in neuroanatomy 9:142. http:\/\/brainiac2.mit.edu\/isbi_challenge\/","journal-title":"Frontiers in neuroanatomy"},{"key":"8837_CR2","doi-asserted-by":"crossref","unstructured":"Bakry A, Elgammal A (2013) Mkpls: manifold kernel partial least squares for lipreading and speaker identification. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 684\u2013691","DOI":"10.1109\/CVPR.2013.94"},{"key":"8837_CR3","unstructured":"Basu S, Oliver N, Pentland A (1998) 3d modeling and tracking of human lip motions. In: Sixth international conference on computer vision (IEEE cat. no. 98 CH 36271), pp. 337\u2013343. IEEE"},{"key":"8837_CR4","unstructured":"Bourlard HA, Morgan N (2012) Connectionist speech recognition: a hybrid approach, vol. 247 Springer Science & Business Media"},{"key":"8837_CR5","doi-asserted-by":"crossref","unstructured":"Chung JS, Senior A, Vinyals O, Zisserman A (2017) Lip reading sentences in the wild 2017 IEEE Conference on computer vision and pattern recognition (CVPR), pp. 3444\u20133453. IEEE","DOI":"10.1109\/CVPR.2017.367"},{"key":"8837_CR6","doi-asserted-by":"crossref","unstructured":"Chung JS, Zisserman A (2016) Lip reading in the wild. In: Asian conference on computer vision, pp. 87\u2013103. Springer","DOI":"10.1007\/978-3-319-54184-6_6"},{"issue":"5","key":"8837_CR7","doi-asserted-by":"publisher","first-page":"2421","DOI":"10.1121\/1.2229005","volume":"120","author":"M Cooke","year":"2006","unstructured":"Cooke M, Barker J, Cunningham S, Shao X (2006) An audio-visual corpus for speech perception and automatic speech recognition. J Acoust Soc Am 120 (5):2421\u20132424","journal-title":"J Acoust Soc Am"},{"key":"8837_CR8","unstructured":"Cox SJ, Harvey RW, Lan Y, Newman JL, Theobald BJ (2008) The challenge of multispeaker lip-reading. In: AVSP, pp. 179\u2013184. Citeseer"},{"issue":"1","key":"8837_CR9","doi-asserted-by":"publisher","first-page":"51","DOI":"10.1186\/1687-6180-2012-51","volume":"2012","author":"V Estellers","year":"2012","unstructured":"Estellers V, Thiran JP (2012) Multi-pose lipreading and audio-visual speech recognition. EURASIP J Adv Sig Pr 2012(1):51","journal-title":"EURASIP J Adv Sig Pr"},{"key":"8837_CR10","doi-asserted-by":"crossref","unstructured":"Galatas G, Potamianos G, Makedon F (2012) Audio-visual speech recognition incorporating facial depth information captured by the kinect. In: 2012 Proceedings of the 20th European Signal Processing Conference (EUSIPCO), pp. 2714\u20132717. IEEE","DOI":"10.1145\/2413097.2413100"},{"key":"8837_CR11","doi-asserted-by":"publisher","first-page":"310","DOI":"10.1016\/j.patcog.2017.02.023","volume":"68","author":"AP Giotis","year":"2017","unstructured":"Giotis AP, Sfikas G, Gatos B, Nikou C (2017) A survey of document image word spotting techniques. Pattern Recogn 68:310\u2013332","journal-title":"Pattern Recogn"},{"key":"8837_CR12","unstructured":"Glorot X, Bengio Y (2010) Understanding the difficulty of training deep feedforward neural networks. In: Proceedings of the thirteenth international conference on artificial intelligence and statistics, pp. 249\u2013256"},{"key":"8837_CR13","unstructured":"Gowdy JN, Subramanya A, Bartels C, Bilmes J (2004) Dbn based multi-stream models for audio-visual speech recognition. In: 2004 IEEE International conference on acoustics, speech, and signal processing, vol. 1, pp. i\u2013993. IEEE"},{"key":"8837_CR14","doi-asserted-by":"crossref","unstructured":"Hecht-Nielsen R (1992) Theory of the backpropagation neural network. In: Neural networks for perception, pp. 65\u201393. Elsevier","DOI":"10.1016\/B978-0-12-741252-8.50010-8"},{"issue":"8","key":"8837_CR15","doi-asserted-by":"publisher","first-page":"1735","DOI":"10.1162\/neco.1997.9.8.1735","volume":"9","author":"S Hochreiter","year":"1997","unstructured":"Hochreiter S, Schmidhuber J (1997) Long short-term memory. Neural comput 9(8):1735\u20131780","journal-title":"Neural comput"},{"key":"8837_CR16","unstructured":"Ioffe S, Szegedy C (2015) Batch normalization: Accelerating deep network training by reducing internal covariate shift. In: ICML 2015"},{"key":"8837_CR17","doi-asserted-by":"crossref","unstructured":"Jha A, Namboodiri VP, Jawahar C (2018) Word spotting in silent lip videos. In: 2018 IEEE Winter conference on applications of computer vision (WACV), pp. 150\u2013159. IEEE","DOI":"10.1109\/WACV.2018.00023"},{"key":"8837_CR18","doi-asserted-by":"crossref","unstructured":"Jha A, Namboodiri VP, Jawahar C (2019) Spotting words in silent speech videos: a retrieval-based approach. Machine Vision and Application, pp. 1\u201313","DOI":"10.1007\/s00138-019-01006-y"},{"issue":"1","key":"8837_CR19","doi-asserted-by":"publisher","first-page":"221","DOI":"10.1109\/TPAMI.2012.59","volume":"35","author":"S Ji","year":"2013","unstructured":"Ji S., Xu W., Yang M., Yu k. (2013) 3d convolutional neural networks for human action recognition. IEEE transactions on pattern analysis and machine intelligence 35 (1):221\u2013231","journal-title":"IEEE transactions on pattern analysis and machine intelligence"},{"key":"8837_CR20","doi-asserted-by":"crossref","unstructured":"Krishnan P, Jawahar C (2013) Bringing semantics in word image retrieval. In: 2013 12Th international conference on document analysis and recognition, pp. 733\u2013737. IEEE","DOI":"10.1109\/ICDAR.2013.150"},{"key":"8837_CR21","unstructured":"Krizhevsky A, Sutskever I, Hinton GE (2012) Imagenet classification with deep convolutional neural networks. In: Advances in neural information processing systems, pp. 1097\u20131105"},{"issue":"11","key":"8837_CR22","doi-asserted-by":"publisher","first-page":"2278","DOI":"10.1109\/5.726791","volume":"86","author":"Y LeCun","year":"1998","unstructured":"LeCun Y, Bottou L, Bengio Y, Haffner P (1998) Gradient-based learning applied to document recognition. Proc IEEE 86(11):2278\u20132324","journal-title":"Proc IEEE"},{"key":"8837_CR23","doi-asserted-by":"crossref","unstructured":"Lucey PJ, Sridharan S, Dean DB (2008) Continuous pose-invariant lipreading","DOI":"10.21437\/Interspeech.2008-664"},{"key":"8837_CR24","doi-asserted-by":"crossref","unstructured":"Manmatha R, Han C, Riseman EM (1996) Word spotting: a new approach to indexing handwriting. In: Proceedings CVPR IEEE Computer Society Conference on Computer Vision and Pattern Recognition, pp. 631\u2013637. IEEE","DOI":"10.1109\/CVPR.1996.517139"},{"issue":"5588","key":"8837_CR25","doi-asserted-by":"publisher","first-page":"746","DOI":"10.1038\/264746a0","volume":"264","author":"H McGurk","year":"1976","unstructured":"McGurk H, MacDonald J (1976) Hearing lips and seeing voices. Nature 264 (5588):746","journal-title":"Nature"},{"key":"8837_CR26","doi-asserted-by":"crossref","unstructured":"Mroueh Y, Marcheret E, Goel V. (2015) Deep multimodal learning for audio-visual speech recognition. In: 2015 IEEE International conference on acoustics, speech and signal processing (ICASSP), pp. 2130\u20132134. IEEE","DOI":"10.1109\/ICASSP.2015.7178347"},{"issue":"4","key":"8837_CR27","doi-asserted-by":"publisher","first-page":"722","DOI":"10.1007\/s10489-014-0629-7","volume":"42","author":"K Noda","year":"2015","unstructured":"Noda K, Yamaguchi Y, Nakadai K, Okuno HG, Ogata T (2015) Audio-visual speech recognition using deep learning. Appl Intell 42(4):722\u2013737","journal-title":"Appl Intell"},{"issue":"10","key":"8837_CR28","doi-asserted-by":"publisher","first-page":"1345","DOI":"10.1109\/TKDE.2009.191","volume":"22","author":"SJ Pan","year":"2010","unstructured":"Pan SJ, Yang Q, et al. (2010) A survey on transfer learning. IEEE Transactions on knowledge and data engineering 22(10):1345\u20131359","journal-title":"IEEE Transactions on knowledge and data engineering"},{"issue":"3","key":"8837_CR29","doi-asserted-by":"publisher","first-page":"423","DOI":"10.1109\/TASL.2008.2011515","volume":"17","author":"G Papandreou","year":"2009","unstructured":"Papandreou G, Katsamanis A, Pitsikalis V, Maragos P (2009) Adaptive multimodal fusion by uncertainty compensation with application to audiovisual speech recognition. IEEE Transactions on Audio Speech, and Language Processing 17 (3):423\u2013435","journal-title":"IEEE Transactions on Audio Speech, and Language Processing"},{"key":"8837_CR30","doi-asserted-by":"crossref","unstructured":"Patterson EK, Gurbuz S, Tufekci Z, Gowdy JN (2002) Cuave: a new audio-visual database for multimodal human-computer interface research. In: 2002 IEEE International conference on acoustics, speech, and signal processing, vol. 2, pp. II\u20132017. IEEE","DOI":"10.1109\/ICASSP.2002.5745028"},{"key":"8837_CR31","doi-asserted-by":"crossref","unstructured":"Pei Y, Kim TK, Zha H (2013) Unsupervised random forest manifold alignment for lipreading. In: Proceedings of the IEEE International Conference on Computer Vision, pp. 129\u2013136","DOI":"10.1109\/ICCV.2013.23"},{"key":"8837_CR32","first-page":"23","volume":"22","author":"G Potamianos","year":"2004","unstructured":"Potamianos G, Neti C, Luettin J, Matthews I (2004) Audio-visual automatic speech recognition: an overview. Issues in visual and audio-visual speech processing 22:23","journal-title":"Issues in visual and audio-visual speech processing"},{"key":"8837_CR33","doi-asserted-by":"crossref","unstructured":"Rekik A, Ben-Hamadou A, Mahdi W (2014) A new visual speech recognition approach for rgb-d cameras. In: International conference image analysis and recognition, pp. 21\u201328. Springer","DOI":"10.1007\/978-3-319-11755-3_3"},{"issue":"14","key":"8837_CR34","doi-asserted-by":"publisher","first-page":"8609","DOI":"10.1007\/s11042-015-2774-3","volume":"75","author":"A Rekik","year":"2016","unstructured":"Rekik A, Ben-Hamadou A, Mahdi W (2016) An adaptive approach for lip-reading using image and depth data. Multimedia Tools and Applications 75(14):8609\u20138636","journal-title":"Multimedia Tools and Applications"},{"key":"8837_CR35","doi-asserted-by":"crossref","unstructured":"Ronneberger O, Fischer P, Brox T (2015) U-net: Convolutional networks for biomedical image segmentation. In: International conference on medical image computing and computer-assisted intervention, pp. 234\u2013241. Springer","DOI":"10.1007\/978-3-319-24574-4_28"},{"key":"8837_CR36","doi-asserted-by":"crossref","unstructured":"Saenko K, Livescu K, Siracusa M, Wilson K, Glass J, Darrell T (2005) Visual speech recognition with loosely synchronized feature streams. In: 10th IEEE international conference on computer vision (ICCV\u201905) volume 1, vol. 2, pp. 1424\u20131431. IEEE","DOI":"10.1109\/ICCV.2005.251"},{"key":"8837_CR37","doi-asserted-by":"crossref","unstructured":"Shaikh AA, Kumar DK, Yau WC, Azemin MC, Gubbi J (2010) Lip reading using optical flow and support vector machines. In: 2010 3Rd international congress on image and signal processing, vol. 1, pp. 327\u2013330. IEEE","DOI":"10.1109\/CISP.2010.5646264"},{"issue":"3","key":"8837_CR38","doi-asserted-by":"publisher","first-page":"559","DOI":"10.1016\/j.patcog.2010.09.011","volume":"44","author":"J Shin","year":"2011","unstructured":"Shin J, Lee J, Kim D (2011) Real-time lip reading system for isolated korean word recognition. Pattern Recogn 44(3):559\u2013571","journal-title":"Pattern Recogn"},{"key":"8837_CR39","doi-asserted-by":"crossref","unstructured":"Tamura S, Ninomiya H, Kitaoka N, Osuga S, Iribe Y, Takeda K, Hayamizu S (2015) Audio-visual speech recognition using deep bottleneck features and high-performance lipreading. In: 2015 Asia-pacific signal and information processing association annual summit and conference (APSIPA), pp. 575\u2013582. IEEE","DOI":"10.1109\/APSIPA.2015.7415335"},{"key":"8837_CR40","doi-asserted-by":"crossref","unstructured":"Wang K, Belongie S (2010) Word spotting in the wild. In: European conference on computer vision, pp. 591\u2013604. Springer","DOI":"10.1007\/978-3-642-15549-9_43"},{"key":"8837_CR41","doi-asserted-by":"crossref","unstructured":"Yarg\u0131\u010b A, Do\u0121an M (2013) A lip reading application on ms kinect camera. In: 2013 IEEE INISTA, pp. 1\u20135. IEEE","DOI":"10.1109\/INISTA.2013.6577656"},{"issue":"9","key":"8837_CR42","doi-asserted-by":"publisher","first-page":"11,779","DOI":"10.1007\/s11042-018-6735-5","volume":"78","author":"H Yu","year":"2019","unstructured":"Yu H, He F, Pan Y (2019) A novel segmentation model for medical images with intensity inhomogeneity based on adaptive perturbation. Multimed Tools Appl 78 (9):11,779\u201311,798","journal-title":"Multimed Tools Appl"},{"issue":"7","key":"8837_CR43","doi-asserted-by":"publisher","first-page":"1254","DOI":"10.1109\/TMM.2009.2030637","volume":"11","author":"G Zhao","year":"2009","unstructured":"Zhao G, Barnard M, Pietikainen M (2009) Lipreading with local spatiotemporal descriptors. IEEE T Multimed 11(7):1254\u20131265","journal-title":"IEEE T Multimed"},{"issue":"9","key":"8837_CR44","doi-asserted-by":"publisher","first-page":"590","DOI":"10.1016\/j.imavis.2014.06.004","volume":"32","author":"Z Zhou","year":"2014","unstructured":"Zhou Z, Zhao G, Hong X, Pietik\u00e4inen M (2014) A review of recent advances in visual speech decoding. Image vision comput 32(9):590\u2013605","journal-title":"Image vision comput"},{"key":"8837_CR45","doi-asserted-by":"crossref","unstructured":"Zhou Z, Zhao G, Pietikainen M (2010) Lipreading: a graph embedding approach. In: 2010 20Th international conference on pattern recognition, pp. 523\u2013526. IEEE","DOI":"10.1109\/ICPR.2010.133"}],"container-title":["Multimedia Tools and Applications"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-020-08837-2.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11042-020-08837-2\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-020-08837-2.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,9,30]],"date-time":"2023-09-30T03:45:19Z","timestamp":1696045519000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11042-020-08837-2"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2020,4,20]]},"references-count":45,"journal-issue":{"issue":"27-28","published-print":{"date-parts":[[2020,7]]}},"alternative-id":["8837"],"URL":"https:\/\/doi.org\/10.1007\/s11042-020-08837-2","relation":{},"ISSN":["1380-7501","1573-7721"],"issn-type":[{"value":"1380-7501","type":"print"},{"value":"1573-7721","type":"electronic"}],"subject":[],"published":{"date-parts":[[2020,4,20]]},"assertion":[{"value":"18 April 2019","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"12 February 2020","order":2,"name":"revised","label":"Revised","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"9 March 2020","order":3,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"20 April 2020","order":4,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}