{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,24]],"date-time":"2026-07-24T14:51:49Z","timestamp":1784904709774,"version":"3.55.0"},"publisher-location":"Cham","reference-count":77,"publisher":"Springer International Publishing","isbn-type":[{"value":"9783030012304","type":"print"},{"value":"9783030012311","type":"electronic"}],"license":[{"start":{"date-parts":[[2018,1,1]],"date-time":"2018-01-01T00:00:00Z","timestamp":1514764800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2018,1,1]],"date-time":"2018-01-01T00:00:00Z","timestamp":1514764800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2018]]},"DOI":"10.1007\/978-3-030-01231-1_39","type":"book-chapter","created":{"date-parts":[[2018,10,5]],"date-time":"2018-10-05T16:03:25Z","timestamp":1538755405000},"page":"639-658","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":399,"title":["Audio-Visual Scene Analysis with Self-Supervised Multisensory Features"],"prefix":"10.1007","author":[{"given":"Andrew","family":"Owens","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Alexei A.","family":"Efros","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2018,10,6]]},"reference":[{"issue":"1\u20132","key":"39_CR1","doi-asserted-by":"publisher","first-page":"13","DOI":"10.1162\/1064546053278973","volume":"11","author":"L Smith","year":"2005","unstructured":"Smith, L., Gasser, M.: The development of embodied cognition: six lessons from babies. Artif. Life 11(1\u20132), 13\u201329 (2005)","journal-title":"Artif. Life"},{"issue":"6614","key":"39_CR2","doi-asserted-by":"publisher","first-page":"308","DOI":"10.1038\/385308a0","volume":"385","author":"Robert Sekuler","year":"1997","unstructured":"Sekuler, R.: Sound alters visual motion perception. Nature 385, 308 (1997)","journal-title":"Nature"},{"key":"39_CR3","unstructured":"de Sa, V.R.: Learning classification with unlabeled data. In: Advances in Neural Information Processing Systems (1994)"},{"issue":"4","key":"39_CR4","doi-asserted-by":"publisher","first-page":"505","DOI":"10.1016\/S0959-4388(00)00241-5","volume":"11","author":"S Shimojo","year":"2001","unstructured":"Shimojo, S., Shams, L.: Sensory modalities are not separate modalities: plasticity and interactions. Curr. Opin. Neurobiol. 11, 505\u2013509 (2001)","journal-title":"Current Opinion in Neurobiology"},{"key":"39_CR5","doi-asserted-by":"crossref","unstructured":"McGurk, H., MacDonald, J.: Hearing lips and seeing voices. Nature 264, 746 (1976)","DOI":"10.1038\/264746a0"},{"key":"39_CR6","unstructured":"British Broadcasting Corporation: Is seeing believing? (2010)"},{"key":"39_CR7","doi-asserted-by":"crossref","unstructured":"Schwartz, J.L., Berthommier, F., Savariaux, C.: Audio-visual scene analysis: evidence for a \u201cvery-early\u201d integration process in audio-visual speech perception. In: Seventh International Conference on Spoken Language Processing (2002)","DOI":"10.21437\/ICSLP.2002-437"},{"key":"39_CR8","doi-asserted-by":"crossref","unstructured":"Omata, K., Mogi, K.: Fusion and combination in audio-visual integration. In: Proceedings of the Royal Society of London A: Mathematical, Physical and Engineering Sciences (2008)","DOI":"10.1098\/rspa.2007.1910"},{"issue":"2","key":"39_CR9","doi-asserted-by":"publisher","first-page":"1061","DOI":"10.1121\/1.4728187","volume":"132","author":"O Nahorna","year":"2012","unstructured":"Nahorna, O., Berthommier, F., Schwartz, J.L.: Binding and unbinding the auditory and visual streams in the McGurk effect. J. Acoust. Soc. Am. 132(2), 1061\u20131077 (2012)","journal-title":"J. Acoust. Soc. Am."},{"issue":"1","key":"39_CR10","doi-asserted-by":"publisher","first-page":"362","DOI":"10.1121\/1.4904536","volume":"137","author":"O Nahorna","year":"2015","unstructured":"Nahorna, O., Berthommier, F., Schwartz, J.L.: Audio-visual speech scene analysis: characterization of the dynamics of unbinding and rebinding the McGurk effect. J. Acoust. Soc. Am. 137(1), 362\u2013377 (2015)","journal-title":"J. Acoust. Soc. Am."},{"key":"39_CR11","unstructured":"Barker, J.P., Berthommier, F., Schwartz, J.L.: Is primitive AV coherence an aid to segment the scene? In: International Conference on Auditory-Visual Speech Processing, AVSP 1998 (1998)"},{"key":"39_CR12","doi-asserted-by":"crossref","unstructured":"Hershey, J., Attias, H., Jojic, N., Kristjansson, T.: Audio-visual graphical models for speech processing. In: Proceedings of IEEE International Conference on Acoustics, Speech, and Signal Processing, (ICASSP 2004), vol. 5, p. V-649. IEEE (2004)","DOI":"10.1109\/ICASSP.2004.1327194"},{"key":"39_CR13","unstructured":"Ngiam, J., Khosla, A., Kim, M., Nam, J., Lee, H., Ng, A.Y.: Multimodal deep learning. In: ICML (2011)"},{"key":"39_CR14","doi-asserted-by":"crossref","unstructured":"Owens, A., Isola, P., McDermott, J., Torralba, A., Adelson, E.H., Freeman, W.T.: Visually indicated sounds. In: CVPR (2016)","DOI":"10.1109\/CVPR.2016.264"},{"key":"39_CR15","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"801","DOI":"10.1007\/978-3-319-46448-0_48","volume-title":"Computer Vision \u2013 ECCV 2016","author":"A Owens","year":"2016","unstructured":"Owens, A., Wu, J., McDermott, J.H., Freeman, W.T., Torralba, A.: Ambient sound provides supervision for visual learning. In: Leibe, B., Matas, J., Sebe, N., Welling, M. (eds.) ECCV 2016. LNCS, vol. 9905, pp. 801\u2013816. Springer, Cham (2016). https:\/\/doi.org\/10.1007\/978-3-319-46448-0_48"},{"key":"39_CR16","doi-asserted-by":"crossref","unstructured":"Arandjelovi\u0107, R., Zisserman, A.: Look, listen and learn. In: ICCV (2017)","DOI":"10.1109\/ICCV.2017.73"},{"key":"39_CR17","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"527","DOI":"10.1007\/978-3-319-46448-0_32","volume-title":"Computer Vision \u2013 ECCV 2016","author":"I Misra","year":"2016","unstructured":"Misra, I., Zitnick, C.L., Hebert, M.: Shuffle and learn: unsupervised learning using temporal order verification. In: Leibe, B., Matas, J., Sebe, N., Welling, M. (eds.) ECCV 2016. LNCS, vol. 9905, pp. 527\u2013544. Springer, Cham (2016). https:\/\/doi.org\/10.1007\/978-3-319-46448-0_32"},{"key":"39_CR18","doi-asserted-by":"crossref","unstructured":"Wei, D., Lim, J.J., Zisserman, A., Freeman, W.T.: Learning and using the arrow of time. In: CVPR (2018)","DOI":"10.1109\/CVPR.2018.00840"},{"key":"39_CR19","doi-asserted-by":"crossref","unstructured":"Fernando, B., Bilen, H., Gavves, E., Gould, S.: Self-supervised video representation learning with odd-one-out networks. In: 2017 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pp. 5729\u20135738. IEEE (2017)","DOI":"10.1109\/CVPR.2017.607"},{"key":"39_CR20","doi-asserted-by":"crossref","unstructured":"McAllister, D.F., Rodman, R.D., Bitzer, D.L., Freeman, A.S.: Lip synchronization of speech. In: Audio-Visual Speech Processing: Computational & Cognitive Science Approaches (1997)","DOI":"10.1145\/259081.259312"},{"key":"39_CR21","doi-asserted-by":"crossref","unstructured":"Marcheret, E., Potamianos, G., Vopicka, J., Goel, V.: Detecting audio-visual synchrony using deep neural networks. In: Sixteenth Annual Conference of the International Speech Communication Association (2015)","DOI":"10.21437\/Interspeech.2015-201"},{"key":"39_CR22","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"251","DOI":"10.1007\/978-3-319-54427-4_19","volume-title":"Computer Vision \u2013 ACCV 2016 Workshops","author":"JS Chung","year":"2017","unstructured":"Chung, J.S., Zisserman, A.: Out of time: automated lip sync in the wild. In: Chen, C.-S., Lu, J., Ma, K.-K. (eds.) ACCV 2016. LNCS, vol. 10117, pp. 251\u2013263. Springer, Cham (2017). https:\/\/doi.org\/10.1007\/978-3-319-54427-4_19"},{"key":"39_CR23","doi-asserted-by":"crossref","unstructured":"Chung, J.S., Senior, A., Vinyals, O., Zisserman, A.: Lip reading sentences in the wild. In: CVPR (2017)","DOI":"10.1109\/CVPR.2017.367"},{"key":"39_CR24","unstructured":"Hershey, J.R., Movellan, J.R.: Audio vision: using audio-visual synchrony to locate sounds. In: NIPS (1999)"},{"key":"39_CR25","unstructured":"Fisher III, J.W., Darrell, T., Freeman, W.T., Viola, P.A.: Learning joint statistical models for audio-visual fusion and segregation. In: NIPS (2000)"},{"key":"39_CR26","unstructured":"Kidron, E., Schechner, Y.Y., Elad, M.: Pixels that sound. In: CVPR (2005)"},{"key":"39_CR27","doi-asserted-by":"crossref","unstructured":"Barzelay, Z., Schechner, Y.Y.: Harmony in motion. In: Conference on Computer Vision and Pattern Recognition, CVPR 2007 (2007)","DOI":"10.1109\/CVPR.2007.383344"},{"issue":"5","key":"39_CR28","doi-asserted-by":"publisher","first-page":"975","DOI":"10.1121\/1.1907229","volume":"25","author":"E. Colin Cherry","year":"1953","unstructured":"Cherry, E.C.: Some experiments on the recognition of speech, with one and with two ears. J. Acoust. Soc. Am. 25, 975\u2013979 (1953)","journal-title":"The Journal of the Acoustical Society of America"},{"key":"39_CR29","doi-asserted-by":"crossref","unstructured":"Bregman, A.S.: Auditory Scene Analysis: The Perceptual Organization of Sound. MIT Press, Cambridge (1994)","DOI":"10.1121\/1.408434"},{"key":"39_CR30","doi-asserted-by":"crossref","unstructured":"Ghahramani, Z., Jordan, M.I.: Factorial hidden Markov models. In: Advances in Neural Information Processing Systems, pp. 472\u2013478 (1996)","DOI":"10.21236\/ADA307097"},{"key":"39_CR31","unstructured":"Roweis, S.T.: One microphone source separation. In: Advances in Neural Information Processing Systems, pp. 793\u2013799 (2001)"},{"issue":"1","key":"39_CR32","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1016\/j.csl.2009.02.006","volume":"24","author":"M Cooke","year":"2010","unstructured":"Cooke, M., Hershey, J.R., Rennie, S.J.: Monaural speech separation and recognition challenge. Comput. Speech Lang. 24(1), 1\u201315 (2010)","journal-title":"Comput. Speech Lang."},{"issue":"3","key":"39_CR33","doi-asserted-by":"publisher","first-page":"1066","DOI":"10.1109\/TASL.2006.885253","volume":"15","author":"T Virtanen","year":"2007","unstructured":"Virtanen, T.: Monaural sound source separation by nonnegative matrix factorization with temporal continuity and sparseness criteria. IEEE Trans. Audio Speech Lang. Process. 15(3), 1066\u20131074 (2007)","journal-title":"IEEE Trans. Audio Speech Lang. Process."},{"key":"39_CR34","doi-asserted-by":"crossref","unstructured":"Hershey, J.R., Chen, Z., Le Roux, J., Watanabe, S.: Deep clustering: discriminative embeddings for segmentation and separation. In: 2016 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 31\u201335. IEEE (2016)","DOI":"10.1109\/ICASSP.2016.7471631"},{"key":"39_CR35","doi-asserted-by":"crossref","unstructured":"Chen, Z., Luo, Y., Mesgarani, N.: Deep attractor network for single-microphone speaker separation. In: 2017 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 246\u2013250, March 2017","DOI":"10.1109\/ICASSP.2017.7952155"},{"key":"39_CR36","doi-asserted-by":"crossref","unstructured":"Yu, D., Kolb\u00e6k, M., Tan, Z.H., Jensen, J.: Permutation invariant training of deep models for speaker-independent multi-talker speech separation. In: Acoustics, Speech and Signal Processing (ICASSP) (2017)","DOI":"10.1109\/ICASSP.2017.7952154"},{"key":"39_CR37","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"32","DOI":"10.1007\/3-540-40063-X_5","volume-title":"Advances in Multimodal Interfaces \u2014 ICMI 2000","author":"T Darrell","year":"2000","unstructured":"Darrell, T., Fisher, J.W., Viola, P.: Audio-visual segmentation and \u201cThe Cocktail Party Effect\u201d. In: Tan, T., Shi, Y., Gao, W. (eds.) ICMI 2000. LNCS, vol. 1948, pp. 32\u201340. Springer, Heidelberg (2000). https:\/\/doi.org\/10.1007\/3-540-40063-X_5"},{"key":"39_CR38","doi-asserted-by":"crossref","unstructured":"Pu, J., et al.: Audio-visual object localization and separation using low-rank and sparsity. In: ICASSP (2017)","DOI":"10.1109\/ICASSP.2017.7952687"},{"key":"39_CR39","doi-asserted-by":"crossref","unstructured":"Casanovas, A.L., et al.: Blind audiovisual source separation based on sparse redundant representations. Trans. Multimedia 12, 358\u2013371 (2010)","DOI":"10.1109\/TMM.2010.2050650"},{"issue":"3","key":"39_CR40","doi-asserted-by":"publisher","first-page":"125","DOI":"10.1109\/MSP.2013.2296173","volume":"31","author":"Bertrand Rivet","year":"2014","unstructured":"Rivet, B., et al.: Audiovisual speech source separation: an overview of key methodologies. IEEE Sig. Process. Mag. 31, 125\u2013134 (2014)","journal-title":"IEEE Signal Processing Magazine"},{"key":"39_CR41","unstructured":"Khan, F., Milner, B.: Speaker separation using visually-derived binary masks. In: Auditory-Visual Speech Processing (AVSP) (2013)"},{"key":"39_CR42","doi-asserted-by":"crossref","unstructured":"Hou, J.C., Wang, S.S., Lai, Y.H., Tsao, Y., Chang, H.W., Wang, H.M.: Audio-visual speech enhancement using multimodal deep convolutional neural networks (2017)","DOI":"10.1109\/APSIPA.2016.7820732"},{"key":"39_CR43","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"234","DOI":"10.1007\/978-3-319-24574-4_28","volume-title":"Medical Image Computing and Computer-Assisted Intervention \u2013 MICCAI 2015","author":"O Ronneberger","year":"2015","unstructured":"Ronneberger, O., Fischer, P., Brox, T.: U-Net: convolutional networks for biomedical image segmentation. In: Navab, N., Hornegger, J., Wells, W.M., Frangi, A.F. (eds.) MICCAI 2015. LNCS, vol. 9351, pp. 234\u2013241. Springer, Cham (2015). https:\/\/doi.org\/10.1007\/978-3-319-24574-4_28"},{"key":"39_CR44","doi-asserted-by":"crossref","unstructured":"Gabbay, A., Ephrat, A., Halperin, T., Peleg, S.: Seeing through noise: Speaker separation and enhancement using visually-derived speech. arXiv preprint arXiv:1708.06767 (2017)","DOI":"10.1109\/ICASSP.2018.8462527"},{"key":"39_CR45","doi-asserted-by":"crossref","unstructured":"Gabbay, A., Shamir, A., Peleg, S.: Visual speech enhancement using noise-invariant training. arXiv preprint arXiv:1711.08789 (2017)","DOI":"10.21437\/Interspeech.2018-1955"},{"key":"39_CR46","doi-asserted-by":"crossref","unstructured":"Ephrat, A., et al.: Looking to listen at the cocktail party: a speaker-independent audio-visual model for speech separation. In: SIGGRAPH (2018)","DOI":"10.1145\/3197517.3201357"},{"key":"39_CR47","doi-asserted-by":"crossref","unstructured":"Afouras, T., Chung, J.S., Zisserman, A.: The conversation: Deep audio-visual speech enhancement. arXiv preprint arXiv:1804.04121 (2018)","DOI":"10.21437\/Interspeech.2018-1400"},{"key":"39_CR48","doi-asserted-by":"crossref","unstructured":"Zhao, H., Gan, C., Rouditchenko, A., Vondrick, C., McDermott, J., Torralba, A.: The sound of pixels. arXiv preprint arXiv:1804.03160 (2018)","DOI":"10.1007\/978-3-030-01246-5_35"},{"key":"39_CR49","doi-asserted-by":"crossref","unstructured":"Gao, R., Feris, R., Grauman, K.: Learning to Separate Object Sounds by Watching Unlabeled Video. arXiv preprint arXiv:1804.01665 (2018)","DOI":"10.1007\/978-3-030-01219-9_3"},{"key":"39_CR50","doi-asserted-by":"crossref","unstructured":"Senocak, A., Oh, T.H., Kim, J., Yang, M.H., Kweon, I.S.: Learning to localize sound source in visual scenes. arXiv preprint arXiv:1803.03849 (2018)","DOI":"10.1109\/CVPR.2018.00458"},{"key":"39_CR51","unstructured":"Arandjelovi\u0107, R., Zisserman, A.: Objects that sound. arXiv preprint arXiv:1712.06651 (2017)"},{"key":"39_CR52","doi-asserted-by":"crossref","unstructured":"Owens, A., Wu, J., McDermott, J.H., Freeman, W.T., Torralba, A.: Learning sight from sound: Ambient sound provides supervision for visual learning. arXiv preprint arXiv:1712.07271 (2017)","DOI":"10.1007\/s11263-018-1083-5"},{"key":"39_CR53","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., Sun, J.: Deep residual learning for image recognition. In: CVPR (2016)","DOI":"10.1109\/CVPR.2016.90"},{"key":"39_CR54","unstructured":"Gutmann, M., Hyv\u00e4rinen, A.: Noise-contrastive estimation: a new estimation principle for unnormalized statistical models. In: Proceedings of the Thirteenth International Conference on Artificial Intelligence and Statistics (2010)"},{"key":"39_CR55","unstructured":"Lin, M., Chen, Q., Yan, S.: Network in network. arXiv preprint arXiv:1312.4400 (2013)"},{"key":"39_CR56","doi-asserted-by":"crossref","unstructured":"Carreira, J., Zisserman, A.: Quo vadis, action recognition? a new model and the kinetics dataset. arXiv preprint arXiv:1705.07750 (2017)","DOI":"10.1109\/CVPR.2017.502"},{"key":"39_CR57","doi-asserted-by":"crossref","unstructured":"Gemmeke, J.F., et al.: Audio set: an ontology and human-labeled dataset for audio events. In: ICASSP (2017)","DOI":"10.1109\/ICASSP.2017.7952261"},{"key":"39_CR58","unstructured":"Kay, W., et al.: The kinetics human action video dataset. arXiv preprint arXiv:1705.06950 (2017)"},{"key":"39_CR59","doi-asserted-by":"crossref","unstructured":"Zhou, B., Khosla, A., Lapedriza, A., Oliva, A., Torralba, A.: Learning deep features for discriminative localization. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 2921\u20132929 (2016)","DOI":"10.1109\/CVPR.2016.319"},{"key":"39_CR60","unstructured":"Isola, P., Zoran, D., Krishnan, D., Adelson, E.H.: Learning visual groups from co-occurrences in space and time. arXiv preprint arXiv:1511.06811 (2015)"},{"key":"39_CR61","unstructured":"Purushwalkam, S., Gupta, A.: Pose from action: Unsupervised learning of pose features based on motion. arXiv preprint arXiv:1609.05420 (2016)"},{"key":"39_CR62","doi-asserted-by":"crossref","unstructured":"Tran, D., Bourdev, L., Fergus, R., Torresani, L., Paluri, M.: Learning spatiotemporal features with 3D convolutional networks. In: ICCV (2015)","DOI":"10.1109\/ICCV.2015.510"},{"key":"39_CR63","doi-asserted-by":"crossref","unstructured":"Wang, X., Gupta, A.: Unsupervised learning of visual representations using videos. In: ICCV (2015)","DOI":"10.1109\/ICCV.2015.320"},{"key":"39_CR64","unstructured":"Soomro, K., Zamir, A.R., Shah, M.: Ucf101: A dataset of 101 human actions classes from videos in the wild. arXiv preprint arXiv:1212.0402 (2012)"},{"key":"39_CR65","unstructured":"Simonyan, K., Zisserman, A.: Two-stream convolutional networks for action recognition in videos. In: Advances in Neural Information Processing Systems (2014)"},{"key":"39_CR66","doi-asserted-by":"crossref","unstructured":"Deng, J., Dong, W., Socher, R., Li, L.J., Li, K., Fei-Fei, L.: Imagenet: a large-scale hierarchical image database. In: CVPR (2009)","DOI":"10.1109\/CVPR.2009.5206848"},{"issue":"12","key":"39_CR67","doi-asserted-by":"publisher","first-page":"2136","DOI":"10.1109\/TASLP.2015.2468583","volume":"23","author":"PS Huang","year":"2015","unstructured":"Huang, P.S., Kim, M., Hasegawa-Johnson, M., Smaragdis, P.: Joint optimization of masks and deep recurrent neural networks for monaural source separation. IEEE\/ACM Trans. Audio Speech Lang. Process. 23(12), 2136\u20132147 (2015)","journal-title":"IEEE\/ACM Trans. Audio Speech Lang. Process."},{"issue":"4","key":"39_CR68","doi-asserted-by":"publisher","first-page":"1462","DOI":"10.1109\/TSA.2005.858005","volume":"14","author":"E. Vincent","year":"2006","unstructured":"Vincent, E., Gribonval, R., F\u00e9votte, C.: Performance measurement in blind audio source separation. IEEE Trans. Audio Speech Lang. Process. 14, 1462\u20131469 (2006)","journal-title":"IEEE Transactions on Audio, Speech and Language Processing"},{"key":"39_CR69","doi-asserted-by":"crossref","unstructured":"Isola, P., Zhu, J.Y., Zhou, T., Efros, A.A.: Image-to-image translation with conditional adversarial networks. arXiv preprint arXiv:1611.07004 (2016)","DOI":"10.1109\/CVPR.2017.632"},{"key":"39_CR70","doi-asserted-by":"crossref","unstructured":"Michelsanti, D., Tan, Z.H.: Conditional generative adversarial networks for speech enhancement and noise-robust speaker verification. arXiv preprint arXiv:1709.01703 (2017)","DOI":"10.21437\/Interspeech.2017-1620"},{"key":"39_CR71","doi-asserted-by":"crossref","unstructured":"Nagrani, A., Chung, J.S., Zisserman, A.: Voxceleb: a large-scale speaker identification dataset. arXiv preprint arXiv:1706.08612 (2017)","DOI":"10.21437\/Interspeech.2017-950"},{"key":"39_CR72","doi-asserted-by":"crossref","unstructured":"Karpathy, A., Toderici, G., Shetty, S., Leung, T., Sukthankar, R., Fei-Fei, L.: Large-scale video classification with convolutional neural networks. In: CVPR (2014)","DOI":"10.1109\/CVPR.2014.223"},{"issue":"5","key":"39_CR73","doi-asserted-by":"publisher","first-page":"2421","DOI":"10.1121\/1.2229005","volume":"120","author":"Martin Cooke","year":"2006","unstructured":"Cooke, M., Barker, J., Cunningham, S., Shao, X.: An audio-visual corpus for speech perception and automatic speech recognition. J. Acoust. Soc. Am. 120, 2421\u20132424 (2006)","journal-title":"The Journal of the Acoustical Society of America"},{"key":"39_CR74","unstructured":"Simonyan, K., Zisserman, A.: Very deep convolutional networks for large-scale image recognition. arXiv preprint arXiv:1409.1556 (2014)"},{"key":"39_CR75","unstructured":"Kabal, P.: Tsp speech database. McGill University, Database Version (2002)"},{"key":"39_CR76","doi-asserted-by":"crossref","unstructured":"Viola, P., Jones, M.: Rapid object detection using a boosted cascade of simple features. In: Proceedings of the 2001 IEEE Computer Society Conference on Computer Vision and Pattern Recognition, CVPR 2001, vol. 1, p. I. IEEE (2001)","DOI":"10.1109\/CVPR.2001.990517"},{"key":"39_CR77","doi-asserted-by":"crossref","unstructured":"Chung, J.S., Nagrani, A., Zisserman, A.: Voxceleb2: Deep speaker recognition. arXiv preprint arXiv:1806.05622 (2018)","DOI":"10.21437\/Interspeech.2018-1929"}],"container-title":["Lecture Notes in Computer Science","Computer Vision \u2013 ECCV 2018"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-030-01231-1_39","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,4,3]],"date-time":"2026-04-03T18:37:19Z","timestamp":1775241439000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-3-030-01231-1_39"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2018]]},"ISBN":["9783030012304","9783030012311"],"references-count":77,"URL":"https:\/\/doi.org\/10.1007\/978-3-030-01231-1_39","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2018]]},"assertion":[{"value":"6 October 2018","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"ECCV","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"European Conference on Computer Vision","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Munich","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Germany","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2018","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"8 September 2018","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"14 September 2018","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"15","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"eccv2018","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/eccv2018.org\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"This content has been made available to all.","name":"free","label":"Free to read"}]}}