{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,3,25]],"date-time":"2025-03-25T18:16:15Z","timestamp":1742926575438,"version":"3.40.3"},"publisher-location":"Cham","reference-count":50,"publisher":"Springer Nature Switzerland","isbn-type":[{"type":"print","value":"9783031483080"},{"type":"electronic","value":"9783031483097"}],"license":[{"start":{"date-parts":[[2023,1,1]],"date-time":"2023-01-01T00:00:00Z","timestamp":1672531200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2023,1,1]],"date-time":"2023-01-01T00:00:00Z","timestamp":1672531200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2023]]},"DOI":"10.1007\/978-3-031-48309-7_2","type":"book-chapter","created":{"date-parts":[[2023,11,21]],"date-time":"2023-11-21T20:03:21Z","timestamp":1700597001000},"page":"18-31","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["EMO-AVSR: Two-Level Approach for\u00a0Audio-Visual Emotional Speech Recognition"],"prefix":"10.1007","author":[{"ORCID":"https:\/\/orcid.org\/0000-0003-0412-7765","authenticated-orcid":false,"given":"Denis","family":"Ivanko","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-4135-6949","authenticated-orcid":false,"given":"Elena","family":"Ryumina","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-7935-0569","authenticated-orcid":false,"given":"Dmitry","family":"Ryumin","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-7479-2851","authenticated-orcid":false,"given":"Alexandr","family":"Axyonov","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-6503-1447","authenticated-orcid":false,"given":"Alexey","family":"Kashevnik","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3424-652X","authenticated-orcid":false,"given":"Alexey","family":"Karpov","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2023,11,22]]},"reference":[{"key":"2_CR1","doi-asserted-by":"publisher","unstructured":"Boh\u00e1\u010dek, M., Hr\u00faz, M.: Sign pose-based transformer for word-level sign language recognition. In: Winter Conference on Applications of Computer Vision (WACV), pp. 182\u2013191 (2022). https:\/\/doi.org\/10.1109\/WACVW54805.2022.00024","DOI":"10.1109\/WACVW54805.2022.00024"},{"issue":"4","key":"2_CR2","doi-asserted-by":"publisher","first-page":"377","DOI":"10.1109\/TAFFC.2014.2336244","volume":"5","author":"H Cao","year":"2014","unstructured":"Cao, H., Cooper, D.G., Keutmann, M.K., Gur, R.C., Nenkova, A., Verma, R.: Crema-D: crowd-sourced emotional multimodal actors dataset. IEEE Trans. Affect. Comput. 5(4), 377\u2013390 (2014). https:\/\/doi.org\/10.1109\/TAFFC.2014.2336244","journal-title":"IEEE Trans. Affect. Comput."},{"key":"2_CR3","doi-asserted-by":"publisher","unstructured":"Chen, C., Hu, Y., Zhang, Q., Zou, H., Zhu, B., Chng, E.S.: Leveraging modality-specific representations for audio-visual speech recognition via reinforcement learning. In: AAAI Conference on Artificial Intelligence, vol. 37, pp. 12607\u201312615 (2023). https:\/\/doi.org\/10.48550\/arXiv.2212.05301","DOI":"10.48550\/arXiv.2212.05301"},{"key":"2_CR4","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"87","DOI":"10.1007\/978-3-319-54184-6_6","volume-title":"Computer Vision \u2013 ACCV 2016","author":"JS Chung","year":"2017","unstructured":"Chung, J.S., Zisserman, A.: Lip reading in the wild. In: Lai, S.-H., Lepetit, V., Nishino, K., Sato, Y. (eds.) ACCV 2016, Part II. LNCS, vol. 10112, pp. 87\u2013103. Springer, Cham (2017). https:\/\/doi.org\/10.1007\/978-3-319-54184-6_6"},{"key":"2_CR5","doi-asserted-by":"publisher","unstructured":"Deng, D., Chen, Z., Zhou, Y., Shi, B.: Mimamo net: integrating micro-and macro-motion for video emotion recognition. In: AAAI Conference on Artificial Intelligence, vol. 34, pp. 2621\u20132628 (2020). https:\/\/doi.org\/10.1609\/AAAI.V34I03.5646","DOI":"10.1609\/AAAI.V34I03.5646"},{"issue":"2","key":"2_CR6","doi-asserted-by":"publisher","first-page":"11","DOI":"10.3390\/mti6020011","volume":"6","author":"D Dresvyanskiy","year":"2022","unstructured":"Dresvyanskiy, D., Ryumina, E., Kaya, H., Markitantov, M., Karpov, A., Minker, W.: End-to-end modeling and transfer learning for audiovisual emotion recognition in-the-wild. Multimodal Technol. Interact. 6(2), 11 (2022). https:\/\/doi.org\/10.3390\/mti6020011","journal-title":"Multimodal Technol. Interact."},{"issue":"2","key":"2_CR7","doi-asserted-by":"publisher","first-page":"199","DOI":"10.1007\/s13748-022-00278-2","volume":"12","author":"Y Du","year":"2023","unstructured":"Du, Y., Crespo, R.G., Mart\u00ednez, O.S.: Human emotion recognition for enhanced performance evaluation in E-learning. Progr. Artif. Intell. 12(2), 199\u2013211 (2023). https:\/\/doi.org\/10.1007\/s13748-022-00278-2","journal-title":"Progr. Artif. Intell."},{"issue":"1","key":"2_CR8","doi-asserted-by":"publisher","first-page":"88","DOI":"10.1080\/00332747.1969.11023575","volume":"32","author":"P Ekman","year":"1969","unstructured":"Ekman, P., Friesen, W.V.: Nonverbal leakage and clues to deception. Psychiatry 32(1), 88\u2013106 (1969). https:\/\/doi.org\/10.1080\/00332747.1969.11023575","journal-title":"Psychiatry"},{"key":"2_CR9","doi-asserted-by":"publisher","unstructured":"Feng, D., Yang, S., Shan, S.: An efficient software for building lip reading models without pains. In: International Conference on Multimedia & Expo Workshops (ICMEW), pp. 1\u20132. IEEE (2021). https:\/\/doi.org\/10.1109\/ICMEW53276.2021.9456014","DOI":"10.1109\/ICMEW53276.2021.9456014"},{"key":"2_CR10","doi-asserted-by":"publisher","unstructured":"Feng, T., Hashemi, H., Annavaram, M., Narayanan, S.S.: Enhancing privacy through domain adaptive noise injection for speech emotion recognition. In: International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 7702\u20137706. IEEE (2022). https:\/\/doi.org\/10.1109\/icassp43922.2022.9747265","DOI":"10.1109\/icassp43922.2022.9747265"},{"key":"2_CR11","doi-asserted-by":"publisher","unstructured":"Ghaleb, E., Popa, M., Asteriadis, S.: Multimodal and temporal perception of audio-visual cues for emotion recognition. In: International Conference on Affective Computing and Intelligent Interaction (ACII), pp. 552\u2013558. IEEE (2019). https:\/\/doi.org\/10.1109\/ACII.2019.8925444","DOI":"10.1109\/ACII.2019.8925444"},{"issue":"4","key":"2_CR12","doi-asserted-by":"publisher","first-page":"300","DOI":"10.1109\/THMS.2021.3086003","volume":"51","author":"L Guo","year":"2021","unstructured":"Guo, L., Lu, Z., Yao, L.: Human-machine interaction sensing technology based on hand gesture recognition: a review. IEEE Trans. Hum.-Mach. Syst. 51(4), 300\u2013309 (2021). https:\/\/doi.org\/10.1109\/THMS.2021.3086003","journal-title":"IEEE Trans. Hum.-Mach. Syst."},{"key":"2_CR13","unstructured":"Haq, S., Jackson, P.J., Edge, J.: Audio-visual feature selection and reduction for emotion classification. In: Auditory-Visual Speech Processing (AVSP), Tangalooma, Australia (2008)"},{"key":"2_CR14","doi-asserted-by":"publisher","unstructured":"He, K., Zhang, X., Ren, S., Sun, J.: Deep residual learning for image recognition. In: Conference on Computer Vision and Pattern Recognition (CVPR), pp. 770\u2013778 (2016). https:\/\/doi.org\/10.1109\/cvpr.2016.90","DOI":"10.1109\/cvpr.2016.90"},{"key":"2_CR15","doi-asserted-by":"publisher","unstructured":"Ivanko, D., et al.: MIDriveSafely: multimodal interaction for drive safely. In: International Conference on Multimodal Interaction (ICMI), pp. 733\u2013735 (2022). https:\/\/doi.org\/10.1145\/3536221.3557037","DOI":"10.1145\/3536221.3557037"},{"key":"2_CR16","series-title":"Lecture Notes in Computer Science (Lecture Notes in Artificial Intelligence)","doi-asserted-by":"publisher","first-page":"291","DOI":"10.1007\/978-3-030-87802-3_27","volume-title":"Speech and Computer","author":"D Ivanko","year":"2021","unstructured":"Ivanko, D., Ryumin, D., Axyonov, A., Kashevnik, A.: Speaker-dependent visual command recognition in vehicle cabin: methodology and evaluation. In: Karpov, A., Potapova, R. (eds.) SPECOM 2021. LNCS (LNAI), vol. 12997, pp. 291\u2013302. Springer, Cham (2021). https:\/\/doi.org\/10.1007\/978-3-030-87802-3_27"},{"issue":"12","key":"2_CR17","doi-asserted-by":"publisher","first-page":"2665","DOI":"10.3390\/math11122665","volume":"11","author":"D Ivanko","year":"2023","unstructured":"Ivanko, D., Ryumin, D., Karpov, A.: A review of recent advances on deep learning methods for audio-visual speech recognition. Mathematics 11(12), 2665 (2023). https:\/\/doi.org\/10.3390\/math11122665","journal-title":"Mathematics"},{"key":"2_CR18","unstructured":"Ivanko, D., et al.: DAVIS: driver\u2019s audio-visual speech recognition. In: Interspeech, pp. 1141\u20131142 (2022)"},{"key":"2_CR19","doi-asserted-by":"publisher","first-page":"34986","DOI":"10.1109\/ACCESS.2021.3062752","volume":"9","author":"A Kashevnik","year":"2021","unstructured":"Kashevnik, A., et al.: Multimodal corpus design for audio-visual speech recognition in vehicle cabin. IEEE Access 9, 34986\u201335003 (2021). https:\/\/doi.org\/10.1109\/ACCESS.2021.3062752","journal-title":"IEEE Access"},{"issue":"4","key":"2_CR20","doi-asserted-by":"publisher","first-page":"245","DOI":"10.5391\/IJFIS.2018.18.4.245","volume":"18","author":"B Kim","year":"2018","unstructured":"Kim, B., Lee, J.: A deep-learning based model for emotional evaluation of video clips. Int. J. Fuzzy Log. Intell. Syst. 18(4), 245\u2013253 (2018). https:\/\/doi.org\/10.5391\/IJFIS.2018.18.4.245","journal-title":"Int. J. Fuzzy Log. Intell. Syst."},{"key":"2_CR21","doi-asserted-by":"publisher","unstructured":"Koller, O., Ney, H., Bowden, R.: Deep learning of mouth shapes for sign language. In: International Conference on Computer Vision Workshops (ICCVW), pp. 85\u201391 (2015). https:\/\/doi.org\/10.1109\/ICCVW.2015.69","DOI":"10.1109\/ICCVW.2015.69"},{"issue":"5","key":"2_CR22","doi-asserted-by":"publisher","first-page":"e0196391","DOI":"10.1371\/journal.pone.0196391","volume":"13","author":"SR Livingstone","year":"2018","unstructured":"Livingstone, S.R., Russo, F.A.: The ryerson audio-visual database of emotional speech and song (RAVDESS): a dynamic, multimodal set of facial and vocal expressions in north American English. PLoS ONE 13(5), e0196391 (2018). https:\/\/doi.org\/10.1371\/journal.pone.0196391","journal-title":"PLoS ONE"},{"issue":"8","key":"2_CR23","doi-asserted-by":"publisher","first-page":"1599","DOI":"10.3390\/APP9081599","volume":"9","author":"Y Lu","year":"2019","unstructured":"Lu, Y., Li, H.: Automatic lip-reading system based on deep convolutional neural network and attention-based long short-term memory. Appl. Sci. 9(8), 1599 (2019). https:\/\/doi.org\/10.3390\/APP9081599","journal-title":"Appl. Sci."},{"issue":"1","key":"2_CR24","doi-asserted-by":"publisher","first-page":"327","DOI":"10.3390\/app12010327","volume":"12","author":"C Luna-Jim\u00e9nez","year":"2021","unstructured":"Luna-Jim\u00e9nez, C., Kleinlein, R., Griol, D., Callejas, Z., Montero, J.M., Fern\u00e1ndez-Mart\u00ednez, F.: A proposal for multimodal emotion recognition using aural transformers and action units on RAVDESS dataset. Appl. Sci. 12(1), 327 (2021). https:\/\/doi.org\/10.3390\/app12010327","journal-title":"Appl. Sci."},{"key":"2_CR25","doi-asserted-by":"publisher","unstructured":"Ma, P., Haliassos, A., Fernandez-Lopez, A., Chen, H., Petridis, S., Pantic, M.: Auto-AVSR: audio-visual speech recognition with automatic labels. In: International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 1\u20135. IEEE (2023). https:\/\/doi.org\/10.1109\/ICASSP49357.2023.10096889","DOI":"10.1109\/ICASSP49357.2023.10096889"},{"key":"2_CR26","doi-asserted-by":"publisher","unstructured":"Ma, P., Wang, Y., Petridis, S., Shen, J., Pantic, M.: Training strategies for improved lip-reading. In: International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 8472\u20138476. IEEE (2022). https:\/\/doi.org\/10.1109\/ICASSP43922.2022.9746706","DOI":"10.1109\/ICASSP43922.2022.9746706"},{"key":"2_CR27","doi-asserted-by":"publisher","first-page":"186","DOI":"10.1016\/j.patrec.2021.11.003","volume":"155","author":"U Mahbub","year":"2022","unstructured":"Mahbub, U., Ahad, M.A.R.: Advances in human action, activity and gesture recognition. Pattern Recogn. Lett. 155, 186\u2013190 (2022). https:\/\/doi.org\/10.1016\/j.patrec.2021.11.003","journal-title":"Pattern Recogn. Lett."},{"key":"2_CR28","doi-asserted-by":"publisher","unstructured":"Makino, T., et al.: Recurrent neural network transducer for audio-visual speech recognition. In: Automatic Speech Recognition and Understanding Workshop (ASRU), pp. 905\u2013912. IEEE (2019). https:\/\/doi.org\/10.1109\/ASRU46091.2019.9004036","DOI":"10.1109\/ASRU46091.2019.9004036"},{"key":"2_CR29","doi-asserted-by":"crossref","unstructured":"Martin, O., Kotsia, I., Macq, B., Pitas, I.: The eNTERFACE\u201905 audio-visual emotion database. In: International Conference on Data Engineering Workshops (ICDEW), pp. 8\u20138. IEEE (2006)","DOI":"10.1109\/ICDEW.2006.145"},{"key":"2_CR30","doi-asserted-by":"publisher","unstructured":"McFee, B., et al.: Librosa: audio and music signal analysis in python. In: Python in Science Conference, vol. 8, pp. 18\u201325 (2015). https:\/\/doi.org\/10.25080\/MAJORA-7B98E3ED-003","DOI":"10.25080\/MAJORA-7B98E3ED-003"},{"key":"2_CR31","unstructured":"Milo\u0161evi\u0107, M., Glavitsch, U.: Combining Gaussian mixture models and segmental feature models for speaker recognition. In: Interspeech, pp. 2042\u20132043 (2017)"},{"key":"2_CR32","doi-asserted-by":"publisher","unstructured":"Milo\u0161evi\u0107, M., Glavitsch, U.: Robust self-supervised audio-visual speech recognition. In: Interspeech, pp. 2118\u20132122 (2022). https:\/\/doi.org\/10.21437\/interspeech.2022-99","DOI":"10.21437\/interspeech.2022-99"},{"key":"2_CR33","doi-asserted-by":"publisher","unstructured":"Muppidi, A., Radfar, M.: Speech emotion recognition using quaternion convolutional neural networks. In: International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 6309\u20136313. IEEE (2021). https:\/\/doi.org\/10.1109\/ICASSP39728.2021.9414248","DOI":"10.1109\/ICASSP39728.2021.9414248"},{"key":"2_CR34","doi-asserted-by":"publisher","first-page":"48807","DOI":"10.1109\/ACCESS.2019.2907271","volume":"7","author":"X Pan","year":"2019","unstructured":"Pan, X., Ying, G., Chen, G., Li, H., Li, W.: A deep spatial and temporal aggregation framework for video-based facial expression recognition. IEEE Access 7, 48807\u201348815 (2019). https:\/\/doi.org\/10.1109\/ACCESS.2019.2907271","journal-title":"IEEE Access"},{"key":"2_CR35","doi-asserted-by":"publisher","first-page":"209","DOI":"10.5194\/isprs-archives-xlviii-2-w3-2023-209-2023","volume":"48","author":"D Ryumin","year":"2023","unstructured":"Ryumin, D., Ivanko, D., Axyonov, A.: Cross-language transfer learning using visual information for automatic sign gesture recognition. Int. Arch. Photogramm. Remote. Sens. Spat. Inf. Sci. 48, 209\u2013216 (2023). https:\/\/doi.org\/10.5194\/isprs-archives-xlviii-2-w3-2023-209-2023","journal-title":"Int. Arch. Photogramm. Remote. Sens. Spat. Inf. Sci."},{"issue":"4","key":"2_CR36","doi-asserted-by":"publisher","first-page":"2284","DOI":"10.3390\/s23042284","volume":"23","author":"D Ryumin","year":"2023","unstructured":"Ryumin, D., Ivanko, D., Ryumina, E.: Audio-visual speech and gesture recognition by sensors of mobile devices. Sensors 23(4), 2284 (2023). https:\/\/doi.org\/10.3390\/s23042284","journal-title":"Sensors"},{"key":"2_CR37","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"89","DOI":"10.1007\/978-3-319-58703-5_7","volume-title":"Universal Access in Human\u2013Computer Interaction. Designing Novel Interactions","author":"D Ryumin","year":"2017","unstructured":"Ryumin, D., Karpov, A.A.: Towards automatic recognition of sign language gestures using kinect 2.0. In: Antona, M., Stephanidis, C. (eds.) UAHCI 2017, Part II. LNCS, vol. 10278, pp. 89\u2013101. Springer, Cham (2017). https:\/\/doi.org\/10.1007\/978-3-319-58703-5_7"},{"key":"2_CR38","doi-asserted-by":"publisher","first-page":"435","DOI":"10.1016\/j.neucom.2022.10.013","volume":"514","author":"E Ryumina","year":"2022","unstructured":"Ryumina, E., Dresvyanskiy, D., Karpov, A.: In search of a robust facial expressions recognition model: a large-scale visual cross-corpus study. Neurocomputing 514, 435\u2013450 (2022). https:\/\/doi.org\/10.1016\/j.neucom.2022.10.013","journal-title":"Neurocomputing"},{"key":"2_CR39","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"616","DOI":"10.1007\/978-3-031-20980-2_52","volume-title":"Speech and Computer","author":"E Ryumina","year":"2022","unstructured":"Ryumina, E., Ivanko, D.: Emotional speech recognition based on lip-reading. In: Prasanna, S.R.M., Karpov, A., Samudravijaya, K., Agrawal, S.S. (eds.) SPECOM 2022. LNCS, vol. 13721, pp. 616\u2013625. Springer, Cham (2022). https:\/\/doi.org\/10.1007\/978-3-031-20980-2_52"},{"key":"2_CR40","doi-asserted-by":"publisher","unstructured":"Ryumina, E., Karpov, A.: Comparative analysis of methods for imbalance elimination of emotion classes in video data of facial expressions. J. Tech. Inf. Technol. Mech. Opt. 129(5), 683 (2020). https:\/\/doi.org\/10.17586\/2226-1494-2020-20-5-683-691","DOI":"10.17586\/2226-1494-2020-20-5-683-691"},{"key":"2_CR41","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1016\/j.patrec.2021.03.007","volume":"146","author":"L Schoneveld","year":"2021","unstructured":"Schoneveld, L., Othmani, A., Abdelkawy, H.: Leveraging recent advances in deep learning for audio-visual emotion recognition. Pattern Recogn. Lett. 146, 1\u20137 (2021). https:\/\/doi.org\/10.1016\/j.patrec.2021.03.007","journal-title":"Pattern Recogn. Lett."},{"key":"2_CR42","unstructured":"Simonyan, K., Zisserman, A.: Very deep convolutional networks for large-scale image recognition. arXiv preprint arXiv:1409.1556 (2014)"},{"key":"2_CR43","doi-asserted-by":"publisher","unstructured":"Son Chung, J., Senior, A., Vinyals, O., Zisserman, A.: Lip reading sentences in the wild. In: Conference on Computer Vision and Pattern Recognition (CVPR), pp. 6447\u20136456 (2017). https:\/\/doi.org\/10.1109\/CVPR.2017.367","DOI":"10.1109\/CVPR.2017.367"},{"key":"2_CR44","doi-asserted-by":"publisher","unstructured":"Takashima, Y., et al.: Audio-visual speech recognition using bimodal-trained bottleneck features for a person with severe hearing loss. In: Interspeech, pp. 277\u2013281 (2016). https:\/\/doi.org\/10.21437\/Interspeech.2016-721","DOI":"10.21437\/Interspeech.2016-721"},{"key":"2_CR45","doi-asserted-by":"publisher","unstructured":"Tamura, S., et al.: Audio-visual speech recognition using deep bottleneck features and high-performance lipreading. In: Asia-Pacific Signal and Information Processing Association Annual Summit and Conference (APSIPA), pp. 575\u2013582. IEEE (2015). https:\/\/doi.org\/10.1109\/APSIPA.2015.7415335","DOI":"10.1109\/APSIPA.2015.7415335"},{"key":"2_CR46","doi-asserted-by":"publisher","unstructured":"Tran, D., Bourdev, L., Fergus, R., Torresani, L., Paluri, M.: Learning spatiotemporal features with 3D convolutional networks. In: International Conference on Computer Vision (ICCV), pp. 4489\u20134497 (2015). https:\/\/doi.org\/10.1109\/ICCV.2015.510","DOI":"10.1109\/ICCV.2015.510"},{"key":"2_CR47","doi-asserted-by":"publisher","unstructured":"Valstar, M., et al.: AVEC 2016: depression, mood, and emotion recognition workshop and challenge. In: International Workshop on Audio\/Visual Emotion Challenge, pp. 3\u201310 (2016). https:\/\/doi.org\/10.1145\/2988257.2988258","DOI":"10.1145\/2988257.2988258"},{"key":"2_CR48","unstructured":"Vaswani, A., et al.: Attention is all you need. In: Advances in Neural Information Processing Systems (NIPS), vol. 30 (2017)"},{"key":"2_CR49","doi-asserted-by":"publisher","unstructured":"Xu, X., Wang, Y., Jia, J., Chen, B., Li, D.: Improving visual speech enhancement network by learning audio-visual affinity with multi-head attention. arXiv preprint arXiv:2206.14964 (2022). https:\/\/doi.org\/10.48550\/arXiv.2206.14964","DOI":"10.48550\/arXiv.2206.14964"},{"key":"2_CR50","doi-asserted-by":"publisher","unstructured":"Yang, J., Wang, K., Peng, X., Qiao, Y.: Deep recurrent multi-instance learning with spatio-temporal features for engagement intensity prediction. In: International Conference on Multimodal Interaction (ICMI), pp. 594\u2013598 (2018). https:\/\/doi.org\/10.1145\/3242969.3264981","DOI":"10.1145\/3242969.3264981"}],"container-title":["Lecture Notes in Computer Science","Speech and Computer"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-031-48309-7_2","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,11,21]],"date-time":"2023-11-21T20:10:10Z","timestamp":1700597410000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-3-031-48309-7_2"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023]]},"ISBN":["9783031483080","9783031483097"],"references-count":50,"URL":"https:\/\/doi.org\/10.1007\/978-3-031-48309-7_2","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"type":"print","value":"0302-9743"},{"type":"electronic","value":"1611-3349"}],"subject":[],"published":{"date-parts":[[2023]]},"assertion":[{"value":"22 November 2023","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"SPECOM","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"International Conference on Speech and Computer","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Dharwad","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"India","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2023","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"29 November 2023","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2 December 2023","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"25","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"specom2023","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/www.iitdh.ac.in\/specom-2023\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Single-blind","order":1,"name":"type","label":"Type","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"Easychair","order":2,"name":"conference_management_system","label":"Conference Management System","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"174","order":3,"name":"number_of_submissions_sent_for_review","label":"Number of Submissions Sent for Review","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"94","order":4,"name":"number_of_full_papers_accepted","label":"Number of Full Papers Accepted","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"0","order":5,"name":"number_of_short_papers_accepted","label":"Number of Short Papers Accepted","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"54% - The value is computed by the equation \"Number of Full Papers Accepted \/ Number of Submissions Sent for Review * 100\" and then rounded to a whole number.","order":6,"name":"acceptance_rate_of_full_papers","label":"Acceptance Rate of Full Papers","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"3","order":7,"name":"average_number_of_reviews_per_paper","label":"Average Number of Reviews per Paper","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"4","order":8,"name":"average_number_of_papers_per_reviewer","label":"Average Number of Papers per Reviewer","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"Yes","order":9,"name":"external_reviewers_involved","label":"External Reviewers Involved","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}}]}}