{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,6]],"date-time":"2026-05-06T15:16:08Z","timestamp":1778080568611,"version":"3.51.4"},"publisher-location":"Cham","reference-count":73,"publisher":"Springer Nature Switzerland","isbn-type":[{"value":"9783031938054","type":"print"},{"value":"9783031938061","type":"electronic"}],"license":[{"start":{"date-parts":[[2025,1,1]],"date-time":"2025-01-01T00:00:00Z","timestamp":1735689600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2025,1,1]],"date-time":"2025-01-01T00:00:00Z","timestamp":1735689600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025]]},"DOI":"10.1007\/978-3-031-93806-1_15","type":"book-chapter","created":{"date-parts":[[2025,5,31]],"date-time":"2025-05-31T18:29:20Z","timestamp":1748716160000},"page":"195-213","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":2,"title":["Attend-Fusion: Efficient Audio-Visual Fusion for\u00a0Video Classification"],"prefix":"10.1007","author":[{"given":"Mahrukh","family":"Awan","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Asmar","family":"Nadeem","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Muhammad Junaid","family":"Awan","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Armin","family":"Mustafa","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Syed Sameed","family":"Husain","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2025,5,20]]},"reference":[{"key":"15_CR1","doi-asserted-by":"crossref","unstructured":"Abdullah, M., Ahmad, M., Han, D.: Facial expression recognition in videos: an cnn-lstm based model for video classification. In: 2020 International Conference on Electronics, Information, and Communication (ICEIC), pp.\u00a01\u20133. IEEE (2020)","DOI":"10.1109\/ICEIC49074.2020.9051332"},{"key":"15_CR2","unstructured":"Abu-El-Haija, S., et al.: Youtube-8m: a large-scale video classification benchmark. arXiv preprint arXiv:1609.08675 (2016)"},{"key":"15_CR3","unstructured":"Abu-El-Haija, S., et al.: Youtube-8m: a large-scale video classification benchmark (2016)"},{"key":"15_CR4","doi-asserted-by":"crossref","unstructured":"Arandjelovic, R., Zisserman, A.: Look, listen and learn. In: Proceedings of the IEEE International Conference on Computer Vision, pp. 609\u2013617 (2017)","DOI":"10.1109\/ICCV.2017.73"},{"key":"15_CR5","unstructured":"Berghi, D., et\u00a0al.: Forecasterflexobm: a multi-view audio-visual dataset for flexible object-based media production"},{"issue":"4","key":"15_CR6","doi-asserted-by":"publisher","first-page":"5455","DOI":"10.1007\/s11042-022-12796-1","volume":"82","author":"S Bhaskar","year":"2023","unstructured":"Bhaskar, S., Thasleema, T.: Lstm model for visual speech recognition through facial expressions. Multimedia Tools Appl. 82(4), 5455\u20135472 (2023)","journal-title":"Multimedia Tools Appl."},{"key":"15_CR7","unstructured":"Bober-Irizar, M., Husain, S., Ong, E.J., Bober, M.: Cultivating dnn diversity for large scale video labelling. arXiv preprint arXiv:1707.04272 (2017)"},{"issue":"6","key":"15_CR8","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1007\/s00138-021-01249-8","volume":"32","author":"SY Boulahia","year":"2021","unstructured":"Boulahia, S.Y., Amamra, A., Madi, M.R., Daikh, S.: Early, intermediate and late fusion strategies for robust deep learning-based multimodal action recognition. Mach. Vis. Appl. 32(6), 1\u201318 (2021). https:\/\/doi.org\/10.1007\/s00138-021-01249-8","journal-title":"Mach. Vis. Appl."},{"key":"15_CR9","doi-asserted-by":"crossref","unstructured":"Brousmiche, M., Rouat, J., Dupont, S.: Multi-level attention fusion network for audio-visual event recognition. arXiv preprint arXiv:2106.06736 (2021)","DOI":"10.1016\/j.inffus.2022.03.001"},{"key":"15_CR10","doi-asserted-by":"crossref","unstructured":"Chen, L., Srivastava, S., Duan, Z., Xu, C.: Deep cross-modal audio-visual generation. In: Proceedings of the on Thematic Workshops of ACM Multimedia 2017, pp. 349\u2013357 (2017)","DOI":"10.1145\/3126686.3126723"},{"key":"15_CR11","doi-asserted-by":"crossref","unstructured":"Chen, P., Liu, S., Zhao, H., Jia, J.: Distilling knowledge via knowledge review. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 5008\u20135017 (2021)","DOI":"10.1109\/CVPR46437.2021.00497"},{"key":"15_CR12","doi-asserted-by":"crossref","unstructured":"Cheng, Y., Wang, R., Pan, Z., Feng, R., Zhang, Y.: Look, listen, and attend: co-attention network for self-supervised audio-visual representation learning. In: Proceedings of the 28th ACM International Conference on Multimedia, pp. 3884\u20133892 (2020)","DOI":"10.1145\/3394171.3413869"},{"key":"15_CR13","doi-asserted-by":"crossref","unstructured":"Deng, J., Dong, W., Socher, R., Li, L.J., Li, K., Fei-Fei, L.: Imagenet: a large-scale hierarchical image database, pp. 248\u2013255 (2009)","DOI":"10.1109\/CVPR.2009.5206848"},{"key":"15_CR14","doi-asserted-by":"crossref","unstructured":"Ding, Y., Xu, Y., Zhang, S.X., Cong, Y., Wang, L.: Self-supervised learning for audio-visual speaker diarization. In: ICASSP 2020-2020 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 4367\u20134371. IEEE (2020)","DOI":"10.1109\/ICASSP40776.2020.9054376"},{"key":"15_CR15","doi-asserted-by":"crossref","unstructured":"Feichtenhofer, C., Pinz, A., Wildes, R.P.: Spatiotemporal multiplier networks for video action recognition. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 4768\u20134777 (2017)","DOI":"10.1109\/CVPR.2017.787"},{"key":"15_CR16","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"214","DOI":"10.1007\/978-3-030-58548-8_13","volume-title":"Computer Vision \u2013 ECCV 2020","author":"V Gabeur","year":"2020","unstructured":"Gabeur, V., Sun, C., Alahari, K., Schmid, C.: Multi-modal transformer for video retrieval. In: Vedaldi, A., Bischof, H., Brox, T., Frahm, J.-M. (eds.) ECCV 2020. LNCS, vol. 12349, pp. 214\u2013229. Springer, Cham (2020). https:\/\/doi.org\/10.1007\/978-3-030-58548-8_13"},{"issue":"5","key":"15_CR17","doi-asserted-by":"publisher","first-page":"829","DOI":"10.1162\/neco_a_01273","volume":"32","author":"J Gao","year":"2020","unstructured":"Gao, J., Li, P., Chen, Z., Zhang, J.: A survey on deep learning for multimodal data fusion. Neural Comput. 32(5), 829\u2013864 (2020)","journal-title":"Neural Comput."},{"key":"15_CR18","doi-asserted-by":"crossref","unstructured":"Gkalelis, N., Mezaris, V.: Subclass deep neural networks: re-enabling neglected classes in deep network training for multimedia classification. In: International Conference on Multimedia Modeling, pp. 227\u2013238. Springer (2019)","DOI":"10.1007\/978-3-030-37731-1_19"},{"key":"15_CR19","unstructured":"Gu, Y., Yang, K., Fu, S., Chen, S., Li, X., Marsic, I.: Hybrid attention based multimodal network for spoken language classification. In: Proceedings of the Conference. Association for Computational Linguistics. Meeting, vol.\u00a02018, p.\u00a02379. NIH Public Access (2018)"},{"issue":"10","key":"15_CR20","doi-asserted-by":"publisher","first-page":"7120","DOI":"10.1109\/TCSVT.2022.3169842","volume":"32","author":"Y Hao","year":"2022","unstructured":"Hao, Y., et al.: Attention in attention: modeling context correlation for efficient video classification. IEEE Trans. Circuits Syst. Video Technol. 32(10), 7120\u20137132 (2022)","journal-title":"IEEE Trans. Circuits Syst. Video Technol."},{"key":"15_CR21","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., Sun, J.: Deep residual learning for image recognition. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 770\u2013778 (2016)","DOI":"10.1109\/CVPR.2016.90"},{"key":"15_CR22","doi-asserted-by":"crossref","unstructured":"Hershey, S., et\u00a0al.: Cnn architectures for large-scale audio classification. In: 2017 IEEE International Conference on Acoustics, Speech and Signal Processing (icassp), pp. 131\u2013135. IEEE (2017)","DOI":"10.1109\/ICASSP.2017.7952132"},{"key":"15_CR23","doi-asserted-by":"crossref","unstructured":"Hori, C., et al.: Attention-based multimodal fusion for video description. In: Proceedings of the IEEE International Conference on Computer Vision, pp. 4193\u20134202 (2017)","DOI":"10.1109\/ICCV.2017.450"},{"key":"15_CR24","doi-asserted-by":"crossref","unstructured":"Iashin, V., Rahtu, E.: Multi-modal dense video captioning. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition Workshops, pp. 958\u2013959 (2020)","DOI":"10.1109\/CVPRW50498.2020.00487"},{"key":"15_CR25","unstructured":"Joze, H.R.V., Shaban, A., Iuzzolino, M.L., Koishida, K.: Mmtm: multimodal transfer module for cnn fusion. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), June 2020"},{"key":"15_CR26","doi-asserted-by":"crossref","unstructured":"Karpathy, A., Toderici, G., Shetty, S., Leung, T., Sukthankar, R., Fei-Fei, L.: Large-scale video classification with convolutional neural networks. In: Proceedings of the IEEE conference on Computer Vision and Pattern Recognition, pp. 1725\u20131732 (2014)","DOI":"10.1109\/CVPR.2014.223"},{"key":"15_CR27","unstructured":"Khosravan, N., Ardeshir, S., Puri, R.: On attention modules for audio-visual synchronization. In: CVPR Workshops, pp. 25\u201328 (2019)"},{"key":"15_CR28","unstructured":"Korbar, B., Tran, D., Torresani, L.: Cooperative learning of audio and video models from self-supervised synchronization. In: Advances in Neural Information Processing Systems, vol. 31 (2018)"},{"issue":"9","key":"15_CR29","doi-asserted-by":"publisher","first-page":"1449","DOI":"10.1109\/JPROC.2015.2460697","volume":"103","author":"D Lahat","year":"2015","unstructured":"Lahat, D., Adali, T., Jutten, C.: Multimodal data fusion: an overview of methods, challenges, and prospects. Proc. IEEE 103(9), 1449\u20131477 (2015)","journal-title":"Proc. IEEE"},{"key":"15_CR30","doi-asserted-by":"crossref","unstructured":"Lee, J., Reade, W., Sukthankar, R., Toderici, G., et\u00a0al.: The 2nd youtube-8m large-scale video understanding challenge. In: Proceedings of the European Conference on Computer Vision (ECCV) Workshops (2018)","DOI":"10.1007\/978-3-030-11018-5_18"},{"key":"15_CR31","doi-asserted-by":"publisher","first-page":"53","DOI":"10.1016\/j.patrec.2022.01.003","volume":"156","author":"X Li","year":"2022","unstructured":"Li, X., Wu, H., Li, M., Liu, H.: Multi-label video classification via coupling attentional multiple instance learning with label relation graph. Pattern Recogn. Lett. 156, 53\u201359 (2022)","journal-title":"Pattern Recogn. Lett."},{"key":"15_CR32","doi-asserted-by":"crossref","unstructured":"Lin, Y.B., Wang, Y.C.F.: Audiovisual transformer with instance attention for audio-visual event localization. In: Proceedings of the Asian Conference on Computer Vision (2020)","DOI":"10.1007\/978-3-030-69544-6_17"},{"key":"15_CR33","unstructured":"Loshchilov, I., Hutter, F.: Decoupled weight decay regularization. arXiv preprint arXiv:1711.05101 (2017)"},{"key":"15_CR34","doi-asserted-by":"crossref","unstructured":"Lv, F., Chen, X., Huang, Y., Duan, L., Lin, G.: Progressive modality reinforcement for human multimodal emotion recognition from unaligned multimodal sequences. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 2554\u20132562 (2021)","DOI":"10.1109\/CVPR46437.2021.00258"},{"key":"15_CR35","doi-asserted-by":"crossref","unstructured":"Mercea, O.B., Hummel, T., Koepke, A.S., Akata, Z.: Temporal and cross-modal attention for audio-visual zero-shot learning. In: European Conference on Computer Vision, pp. 488\u2013505. Springer (2022)","DOI":"10.1007\/978-3-031-20044-1_28"},{"key":"15_CR36","doi-asserted-by":"crossref","unstructured":"Mercea, O.B., Riesch, L., Koepke, A., Akata, Z.: Audio-visual generalised zero-shot learning with cross-modal attention and language. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 10553\u201310563 (2022)","DOI":"10.1109\/CVPR52688.2022.01030"},{"key":"15_CR37","unstructured":"Miech, A., Laptev, I., Sivic, J.: Learnable pooling with context gating for video classification. arXiv preprint arXiv:1706.06905 (2017)"},{"key":"15_CR38","first-page":"4733","volume":"33","author":"P Morgado","year":"2020","unstructured":"Morgado, P., Li, Y., Nvasconcelos, N.: Learning representations from audio-visual spatial alignment. Adv. Neural. Inf. Process. Syst. 33, 4733\u20134744 (2020)","journal-title":"Adv. Neural. Inf. Process. Syst."},{"key":"15_CR39","doi-asserted-by":"crossref","unstructured":"Morgado, P., Vasconcelos, N., Misra, I.: Audio-visual instance discrimination with cross-modal agreement. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 12475\u201312486 (2021)","DOI":"10.1109\/CVPR46437.2021.01274"},{"key":"15_CR40","doi-asserted-by":"crossref","unstructured":"Nadeem, A., Hilton, A., Dawes, R., Thomas, G., Mustafa, A.: Sem-pos: grammatically and semantically correct video captioning. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 2605\u20132615 (2023)","DOI":"10.1109\/CVPRW59228.2023.00259"},{"key":"15_CR41","doi-asserted-by":"crossref","unstructured":"Nadeem, A., Hilton, A., Dawes, R., Thomas, G., Mustafa, A.: Cad-contextual multi-modal alignment for dynamic avqa. In: Proceedings of the IEEE\/CVF Winter Conference on Applications of Computer Vision, pp. 7251\u20137263 (2024)","DOI":"10.1109\/WACV57701.2024.00709"},{"key":"15_CR42","unstructured":"Nadeem, A., Sardari, F., Dawes, R., Husain, S.S., Hilton, A., Mustafa, A.: Narrativebridge: enhancing video captioning with causal-temporal narrative. arXiv preprint arXiv:2406.06499 (2024)"},{"key":"15_CR43","first-page":"14200","volume":"34","author":"A Nagrani","year":"2021","unstructured":"Nagrani, A., Yang, S., Arnab, A., Jansen, A., Schmid, C., Sun, C.: Attention bottlenecks for multimodal fusion. Adv. Neural. Inf. Process. Syst. 34, 14200\u201314213 (2021)","journal-title":"Adv. Neural. Inf. Process. Syst."},{"key":"15_CR44","unstructured":"Okazaki, S., Kong, Q., Yoshinaga, T.: A multi-modal fusion approach for audio-visual scene classification enhanced by clip variants. In: DCASE, pp. 95\u201399 (2021)"},{"issue":"12","key":"15_CR45","doi-asserted-by":"publisher","first-page":"3568","DOI":"10.1109\/TCSVT.2018.2881842","volume":"29","author":"EJ Ong","year":"2018","unstructured":"Ong, E.J., Husain, S.S., Bober-Irizar, M., Bober, M.: Deep architectures and ensembles for semantic video classification. IEEE Trans. Circuits Syst. Video Technol. 29(12), 3568\u20133582 (2018)","journal-title":"IEEE Trans. Circuits Syst. Video Technol."},{"key":"15_CR46","doi-asserted-by":"crossref","unstructured":"Planamente, M., Plizzari, C., Alberti, E., Caputo, B.: Domain generalization through audio-visual relative norm alignment in first person action recognition. In: Proceedings of the IEEE\/CVF Winter Conference on Applications of Computer Vision, pp. 1807\u20131818 (2022)","DOI":"10.1109\/WACV51458.2022.00024"},{"issue":"6","key":"15_CR47","doi-asserted-by":"publisher","first-page":"976","DOI":"10.1016\/j.imavis.2009.11.014","volume":"28","author":"R Poppe","year":"2010","unstructured":"Poppe, R.: A survey on vision-based human action recognition. Image Vis. Comput. 28(6), 976\u2013990 (2010)","journal-title":"Image Vis. Comput."},{"key":"15_CR48","unstructured":"Powers, D.M.: Evaluation: from precision, recall and f-measure to roc, informedness, markedness and correlation. arXiv preprint arXiv:2010.16061 (2020)"},{"key":"15_CR49","doi-asserted-by":"crossref","unstructured":"Praveen, R.G., Granger, E., Cardinal, P.: Recursive joint attention for audio-visual fusion in regression based emotion recognition. In: ICASSP 2023-2023 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp.\u00a01\u20135. IEEE (2023)","DOI":"10.1109\/ICASSP49357.2023.10095234"},{"key":"15_CR50","doi-asserted-by":"crossref","unstructured":"Praveen, R.G., et\u00a0al.: A joint cross-attention model for audio-visual fusion in dimensional emotion recognition. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 2486\u20132495 (2022)","DOI":"10.1109\/CVPRW56347.2022.00278"},{"issue":"4","key":"15_CR51","doi-asserted-by":"publisher","first-page":"501","DOI":"10.1109\/PROC.1976.10158","volume":"64","author":"DR Reddy","year":"1976","unstructured":"Reddy, D.R.: Speech recognition by machine: a review. Proc. IEEE 64(4), 501\u2013531 (1976)","journal-title":"Proc. IEEE"},{"key":"15_CR52","doi-asserted-by":"crossref","unstructured":"Rehman, A., Belhaouari, S.B.: Deep learning for video classification: a review (2021)","DOI":"10.36227\/techrxiv.15172920"},{"key":"15_CR53","doi-asserted-by":"crossref","unstructured":"Shah, A., et al.: Audio-visual scene-aware dialog and reasoning using audio-visual transformers with joint student-teacher learning. In: ICASSP 2022-2022 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 7732\u20137736. IEEE (2022)","DOI":"10.1109\/ICASSP43922.2022.9746481"},{"key":"15_CR54","doi-asserted-by":"crossref","unstructured":"Sharafi, M., Yazdchi, M., Rasti, J.: Audio-visual emotion recognition using k-means clustering and spatio-temporal cnn. In: 2023 6th International Conference on Pattern Recognition and Image Analysis (IPRIA), pp.\u00a01\u20136. IEEE (2023)","DOI":"10.1109\/IPRIA59240.2023.10147192"},{"key":"15_CR55","unstructured":"Simonyan, K., Zisserman, A.: Two-stream convolutional networks for action recognition in videos. In: Advances in neural Information Processing Systems, vol. 27 (2014)"},{"key":"15_CR56","doi-asserted-by":"crossref","unstructured":"Song, Q., Sun, B., Li, S.: Multimodal sparse transformer network for audio-visual speech recognition. IEEE Trans. Neural Netw. Learn. Syst. (2022)","DOI":"10.1109\/TNNLS.2022.3163771"},{"key":"15_CR57","unstructured":"Soomro, K., Zamir, A.R., Shah, M.: Ucf101: a dataset of 101 human actions classes from videos in the wild. arXiv preprint arXiv:1212.0402 (2012)"},{"issue":"1","key":"15_CR58","first-page":"1929","volume":"15","author":"N Srivastava","year":"2014","unstructured":"Srivastava, N., Hinton, G., Krizhevsky, A., Sutskever, I., Salakhutdinov, R.: Dropout: a simple way to prevent neural networks from overfitting. J. Mach. Learn. Res. 15(1), 1929\u20131958 (2014)","journal-title":"J. Mach. Learn. Res."},{"key":"15_CR59","doi-asserted-by":"crossref","unstructured":"Sun, Z., Ke, Q., Rahmani, H., Bennamoun, M., Wang, G., Liu, J.: Human action recognition from various data modalities: a review. IEEE Trans. Pattern Anal. Mach. Intell. (2022)","DOI":"10.1109\/TPAMI.2022.3183112"},{"key":"15_CR60","doi-asserted-by":"crossref","unstructured":"Sundar, A., Heck, L.: Multimodal conversational AI: a survey of datasets and approaches. arXiv preprint arXiv:2205.06907 (2022)","DOI":"10.18653\/v1\/2022.nlp4convai-1.12"},{"key":"15_CR61","doi-asserted-by":"crossref","unstructured":"Tsai, Y.H.H., et al.: Multimodal transformer for unaligned multimodal language sequences. In: Proceedings of the Conference. Association for Computational Linguistics. Meeting, vol.\u00a02019, p.\u00a06558. NIH Public Access (2019)","DOI":"10.18653\/v1\/P19-1656"},{"key":"15_CR62","doi-asserted-by":"crossref","unstructured":"Tschannen, M., et al.: Self-supervised learning of video-induced visual invariances. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 13806\u201313815 (2020)","DOI":"10.1109\/CVPR42600.2020.01382"},{"key":"15_CR63","unstructured":"Vaswani, A., et al.: Attention is all you need. In: Advances in Neural Information Processing Systems, vol. 30 (2017)"},{"key":"15_CR64","unstructured":"Vila\u00e7a, L., Yu, Y., Viana, P.: Recent advances and challenges in deep audio-visual correlation learning (2022)"},{"key":"15_CR65","doi-asserted-by":"crossref","unstructured":"Wang, G., Chen, C., Fan, D.P., Hao, A., Qin, H.: From semantic categories to fixations: a novel weakly-supervised visual-auditory saliency detection approach. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 15119\u201315128 (2021)","DOI":"10.1109\/CVPR46437.2021.01487"},{"key":"15_CR66","unstructured":"Wang, H.D., Zhang, T., Wu, J.: The monkeytyping solution to the youtube-8m video understanding challenge. arXiv preprint arXiv:1706.05150 (2017)"},{"key":"15_CR67","unstructured":"Wei, Y., Hu, D., Tian, Y., Li, X.: Learning in audio-visual context: a review, analysis, and new perspective (2022)"},{"key":"15_CR68","doi-asserted-by":"crossref","unstructured":"Wu, Y., Zhu, L., Yan, Y., Yang, Y.: Dual attention matching for audio-visual event localization. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision (ICCV), October 2019","DOI":"10.1109\/ICCV.2019.00639"},{"key":"15_CR69","doi-asserted-by":"crossref","unstructured":"Yu, J., Cheng, Y., Zhao, R.W., Feng, R., Zhang, Y.: Mm-pyramid: multimodal pyramid attentional network for audio-visual event localization and video parsing. In: Proceedings of the 30th ACM International Conference on Multimedia, pp. 6241\u20136249 (2022)","DOI":"10.1145\/3503161.3547869"},{"issue":"3s","key":"15_CR70","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/3575658","volume":"19","author":"J Zhang","year":"2023","unstructured":"Zhang, J., Yu, Y., Tang, S., Wu, J., Li, W.: Variational autoencoder with cca for audio-visual cross-modal retrieval. ACM Trans. Multimed. Comput. Commun. Appl. 19(3s), 1\u201321 (2023)","journal-title":"ACM Trans. Multimed. Comput. Commun. Appl."},{"issue":"10","key":"15_CR71","doi-asserted-by":"publisher","first-page":"3030","DOI":"10.1109\/TCSVT.2017.2719043","volume":"28","author":"S Zhang","year":"2017","unstructured":"Zhang, S., Zhang, S., Huang, T., Gao, W., Tian, Q.: Learning affective features with a hybrid deep model for audio-visual emotion recognition. IEEE Trans. Circuits Syst. Video Technol. 28(10), 3030\u20133043 (2017)","journal-title":"IEEE Trans. Circuits Syst. Video Technol."},{"key":"15_CR72","doi-asserted-by":"crossref","unstructured":"Zhang, Z., An, L., Cui, Z., Dong, T., et\u00a0al.: Facial affect recognition based on transformer encoder and audiovisual fusion for the abaw5 challenge. arXiv preprint arXiv:2303.09158 (2023)","DOI":"10.1109\/CVPRW59228.2023.00607"},{"key":"15_CR73","unstructured":"Zhu, H., Luo, M., Wang, R., Zheng, A., He, R.: Deep audio-visual learning: a survey (2020)"}],"container-title":["Lecture Notes in Computer Science","Computer Vision \u2013 ECCV 2024 Workshops"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-031-93806-1_15","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,5,31]],"date-time":"2025-05-31T18:29:39Z","timestamp":1748716179000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-3-031-93806-1_15"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025]]},"ISBN":["9783031938054","9783031938061"],"references-count":73,"URL":"https:\/\/doi.org\/10.1007\/978-3-031-93806-1_15","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025]]},"assertion":[{"value":"20 May 2025","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"ECCV","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"European Conference on Computer Vision","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Milan","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Italy","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2024","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"29 September 2024","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"4 October 2024","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"18","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"eccv2024","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/eccv2024.ecva.net\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}