{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,1,25]],"date-time":"2026-01-25T15:37:38Z","timestamp":1769355458013,"version":"3.49.0"},"publisher-location":"Berlin, Heidelberg","reference-count":16,"publisher":"Springer Berlin Heidelberg","isbn-type":[{"value":"9783642130212","type":"print"},{"value":"9783642130229","type":"electronic"}],"license":[{"start":{"date-parts":[[2010,1,1]],"date-time":"2010-01-01T00:00:00Z","timestamp":1262304000000},"content-version":"tdm","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2010]]},"DOI":"10.1007\/978-3-642-13022-9_6","type":"book-chapter","created":{"date-parts":[[2011,1,21]],"date-time":"2011-01-21T20:50:16Z","timestamp":1295643016000},"page":"51-61","source":"Crossref","is-referenced-by-count":6,"title":["An Improvement in Audio-Visual Voice Activity Detection for Automatic Speech Recognition"],"prefix":"10.1007","author":[{"given":"Takami","family":"Yoshida","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Kazuhiro","family":"Nakadai","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Hiroshi G.","family":"Okuno","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","reference":[{"key":"6_CR1","unstructured":"Nakadai, K., Lourens, T., Okuno, H.G., Kitano, H.: Active audition for humanoid. In: Proceedings of 17th National Conference on Artificial Intelligence, pp. 832\u2013839 (2000)"},{"key":"6_CR2","doi-asserted-by":"crossref","unstructured":"Yamamoto, S., Nakadai, K., Nakano, M., Tsujino, H., Valin, J.M., Komatani, K., Ogata, T., Okuno, H.G.: Real-time robot audition system that recognizes simultaneous speech in the real world. In: Proceedings of IEEE\/RSJ International Conference on Intelligent Robots and Systems, pp. 5333\u20135338 (2006)","DOI":"10.1109\/IROS.2006.282037"},{"key":"6_CR3","first-page":"193","volume":"4","author":"G. Potamianos","year":"2001","unstructured":"Potamianos, G., Neti, C., Iyengar, G., Senior, A., Verma, A.: A cascade visual front end for speaker independent automatic speechreading. Speech Technology, Special Issue on Multimedia\u00a04, 193\u2013208 (2001)","journal-title":"Speech Technology, Special Issue on Multimedia"},{"key":"6_CR4","doi-asserted-by":"crossref","unstructured":"Tamura, S., Iwano, K., Furui, S.: A stream-weight optimization method for multi-stream hmms based on likelihood value normalization. In: Proceedings of IEEE International Conference on Acoustics, Speech, and Signal Processing, pp. 469\u2013472 (2005)","DOI":"10.1109\/ICASSP.2005.1415152"},{"key":"6_CR5","unstructured":"Fiscus, J.: A post-processing systems to yield reduced word error rates: Recognizer Output Voting Error Reduction (ROVER). In: Proceedings of Workshop on Automatic Speech Recognition and Understanding, pp. 347\u2013354 (1997)"},{"key":"6_CR6","doi-asserted-by":"crossref","unstructured":"Yoshida, T., Nakadai, K., Okuno, G.H.: Automatic speech recognition improved by two-layered audio-visual speech recognition for robot audition. In: Proceedings of 9th IEEE-RAS International Conference on Humanoid Robots, pp. 604\u2013609 (2009)","DOI":"10.1109\/ICHR.2009.5379586"},{"key":"6_CR7","unstructured":"Liu, P., Wang, Z.: Voice activity detection using visual information. In: Proceedings of IEEE International Conference on Acoustics, Speech and Signal Processing, pp. 609\u2013612 (2004)"},{"key":"6_CR8","doi-asserted-by":"publisher","first-page":"667","DOI":"10.1016\/j.specom.2007.04.008","volume":"49","author":"B. Rivet","year":"2007","unstructured":"Rivet, B., Girin, L., Jutten, C.: Visual voice activity detection as a help for speech source separation from convolutive mixtures. Speech Communication\u00a049, 667\u2013677 (2007)","journal-title":"Speech Communication"},{"key":"6_CR9","first-page":"505","volume":"E86-D","author":"K. Murai","year":"2003","unstructured":"Murai, K., Nakamura, S.: Face-to-talk: audio-visual speech detection for robust speech recognition in noisy environment. IEICE TRANSACTIONS on Information and Systems\u00a0E86-D, 505\u2013513 (2003)","journal-title":"IEICE TRANSACTIONS on Information and Systems"},{"key":"6_CR10","doi-asserted-by":"crossref","unstructured":"Asano, F., Motomura, Y., Aso, H., Yoshimura, T., Ichimura, N., Nakamura, S.: Fusion of audio and video information for detecting speech events. In: Proceedings of International Conference on Information Fusion, pp. 386\u2013393 (2003)","DOI":"10.1109\/ICIF.2003.177472"},{"key":"6_CR11","doi-asserted-by":"publisher","first-page":"97","DOI":"10.1016\/j.specom.2004.10.010","volume":"44","author":"K. Nakadai","year":"2004","unstructured":"Nakadai, K., Matsuura, D., Okuno, H.G., Tsujino, H.: Improvement of recognition of simultaneous speech signals using av integration and scattering theory for humanoid robots. Speech Communication\u00a044, 97\u2013112 (2004)","journal-title":"Speech Communication"},{"key":"6_CR12","doi-asserted-by":"crossref","unstructured":"Asano, F., Goto, M., Itou, K., Asoh, H.: Real-time sound source localization and separation system and its application to automatic speech recognition. In: Proceedings of International Conference on Speech Processing, pp. 1013\u20131016 (2001)","DOI":"10.21437\/Eurospeech.2001-291"},{"key":"6_CR13","doi-asserted-by":"crossref","unstructured":"Valin, J.M., Rouat, J., Michaud, F.: Enhanced robot audition based on microphone array source separation with post-filter. In: Proceedings of IEEE\/RSJ International Conference on Intelligent Robots and Systems, pp. 2123\u20132128 (2004)","DOI":"10.1109\/IROS.2004.1389723"},{"key":"6_CR14","doi-asserted-by":"crossref","first-page":"2480","DOI":"10.1121\/1.4784906","volume":"116","author":"Y. Nishimura","year":"2004","unstructured":"Nishimura, Y., Shinozaki, T., Iwano, K., Furui, S.: Noise-robust speech recognition using multi-band spectral features. Acoustical Society of America Journal\u00a0116, 2480\u20132480 (2004)","journal-title":"Acoustical Society of America Journal"},{"key":"6_CR15","doi-asserted-by":"crossref","unstructured":"Koiwa, T., Nakadai, K., Imura, J.: Coarse speech recognition by audio-visual integration based on missing feature theory. In: Proceedings of IEEE\/RAS International Conference on Intelligent Robots and Systems, pp. 1751\u20131756 (2007)","DOI":"10.1109\/IROS.2007.4399300"},{"key":"6_CR16","doi-asserted-by":"crossref","unstructured":"Nishimura, Y., Ishizuka, M., Nakadai, K., Nakano, M., Tsujino, H.: Speech recognition for a humanoid with motor noise utilizing missing feature theory. In: Proceedings of 6th IEEE-RAS International Conference on Humanoid Robots, pp. 26\u201333 (2006)","DOI":"10.1109\/ICHR.2006.321359"}],"container-title":["Lecture Notes in Computer Science","Trends in Applied Intelligent Systems"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-642-13022-9_6","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,3,2]],"date-time":"2025-03-02T01:21:10Z","timestamp":1740878470000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/978-3-642-13022-9_6"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2010]]},"ISBN":["9783642130212","9783642130229"],"references-count":16,"URL":"https:\/\/doi.org\/10.1007\/978-3-642-13022-9_6","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2010]]}}}