{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,25]],"date-time":"2026-06-25T11:47:22Z","timestamp":1782388042432,"version":"3.54.5"},"reference-count":37,"publisher":"Springer Science and Business Media LLC","issue":"1","license":[{"start":{"date-parts":[[2024,10,18]],"date-time":"2024-10-18T00:00:00Z","timestamp":1729209600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2024,10,18]],"date-time":"2024-10-18T00:00:00Z","timestamp":1729209600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["J Supercomput"],"published-print":{"date-parts":[[2025,1]]},"DOI":"10.1007\/s11227-024-06582-z","type":"journal-article","created":{"date-parts":[[2024,10,18]],"date-time":"2024-10-18T18:02:57Z","timestamp":1729274577000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":15,"title":["Audiovisual emotion recognition based on bi-layer LSTM and multi-head attention mechanism on RAVDESS dataset"],"prefix":"10.1007","volume":"81","author":[{"given":"Zeyu","family":"Jin","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Wenjiao","family":"Zai","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2024,10,18]]},"reference":[{"key":"6582_CR1","doi-asserted-by":"publisher","first-page":"99","DOI":"10.1007\/s10772-011-9125-1","volume":"15","author":"SG Koolagudi","year":"2012","unstructured":"Koolagudi SG, Rao KS (2012) Emotion recognition from speech: a review. Int J Speech Technol 15:99\u2013117","journal-title":"Int J Speech Technol"},{"issue":"16","key":"6582_CR2","doi-asserted-by":"publisher","first-page":"23745","DOI":"10.1007\/s11042-020-09874-7","volume":"80","author":"R Jahangir","year":"2021","unstructured":"Jahangir R, Teh YW, Hanif F, Mujtaba G (2021) Deep learning approaches for speech emotion recognition: state of the art and research challenges. Multimedia Tools Appl 80(16):23745\u201323812","journal-title":"Multimedia Tools Appl"},{"key":"6582_CR3","doi-asserted-by":"publisher","DOI":"10.1016\/j.neucom.2023.126866","volume":"561","author":"B Pan","year":"2023","unstructured":"Pan B, Hirota K, Jia Z, Dai Y (2023) A review of multimodal emotion recognition from datasets, preprocessing, features, and fusion methods. Neurocomputing 561:126866","journal-title":"Neurocomputing"},{"issue":"1","key":"6582_CR4","doi-asserted-by":"publisher","first-page":"60","DOI":"10.1109\/TAFFC.2017.2713783","volume":"10","author":"F Noroozi","year":"2017","unstructured":"Noroozi F, Marjanovic M, Njegus A, Escalera S, Anbarjafari G (2017) Audio-visual emotion recognition in video clips. IEEE Trans Affect Comput 10(1):60\u201375","journal-title":"IEEE Trans Affect Comput"},{"key":"6582_CR5","doi-asserted-by":"publisher","first-page":"47795","DOI":"10.1109\/ACCESS.2021.3068045","volume":"9","author":"TM Wani","year":"2021","unstructured":"Wani TM, Gunawan TS, Qadri SAA, Kartiwi M, Ambikairajah E (2021) A comprehensive review of speech emotion recognition systems. IEEE Access 9:47795\u201347814","journal-title":"IEEE Access"},{"key":"6582_CR6","doi-asserted-by":"crossref","unstructured":"Chumachenko K, Iosifidis A, Gabbouj M (2022) Self-attention fusion for audiovisual emotion recognition with incomplete data. In: 2022 26th International Conference on Pattern Recognition (ICPR), pp. 2822\u20132828. IEEE","DOI":"10.1109\/ICPR56361.2022.9956592"},{"issue":"1","key":"6582_CR7","doi-asserted-by":"publisher","first-page":"60","DOI":"10.1109\/TAFFC.2017.2713783","volume":"10","author":"F Noroozi","year":"2017","unstructured":"Noroozi F, Marjanovic M, Njegus A, Escalera S, Anbarjafari G (2017) Audio-visual emotion recognition in video clips. IEEE Trans Affect Comput 10(1):60\u201375","journal-title":"IEEE Trans Affect Comput"},{"issue":"2","key":"6582_CR8","doi-asserted-by":"publisher","first-page":"1587","DOI":"10.3233\/JIFS-18594","volume":"36","author":"AH Ton-That","year":"2019","unstructured":"Ton-That AH, Cao NT (2019) Speech emotion recognition using a fuzzy approach. J Intell Fuzzy Syst 36(2):1587\u20131597","journal-title":"J Intell Fuzzy Syst"},{"key":"6582_CR9","doi-asserted-by":"crossref","unstructured":"Foo LS, Yap W-S, Hum YC, Kadim Z, Hon HW, Tee YK (2020) Real-time baby crying detection in the noisy everyday environment. In: 2020 11th IEEE Control and System Graduate Research Colloquium (ICSGRC), pp. 26\u201331. IEEE","DOI":"10.1109\/ICSGRC49013.2020.9232488"},{"key":"6582_CR10","doi-asserted-by":"publisher","first-page":"221640","DOI":"10.1109\/ACCESS.2020.3043201","volume":"8","author":"MB Er","year":"2020","unstructured":"Er MB (2020) A novel approach for classification of speech emotions based on deep and acoustic features. IEEE Access 8:221640\u2013221653","journal-title":"IEEE Access"},{"key":"6582_CR11","doi-asserted-by":"crossref","unstructured":"Bandela SR, Kumar TK (2018) Emotion recognition of stressed speech using teager energy and linear prediction features. In: 2018 IEEE 18th International Conference on Advanced Learning Technologies (ICALT), pp. 422\u2013425. IEEE","DOI":"10.1109\/ICALT.2018.00107"},{"key":"6582_CR12","doi-asserted-by":"publisher","first-page":"320","DOI":"10.1016\/j.apacoust.2018.11.028","volume":"146","author":"T \u00d6zseven","year":"2019","unstructured":"\u00d6zseven T (2019) A novel feature selection method for speech emotion recognition. Appl Acoust 146:320\u2013326","journal-title":"Appl Acoust"},{"issue":"04","key":"6582_CR13","first-page":"414","volume":"38","author":"H Tingting","year":"2019","unstructured":"Tingting H, Yaqin F, Lingjie S, Wei W (2019) Selection of main features of lstm speech emotion based on attention mechanism. Acoust Technol 38(04):414\u2013421","journal-title":"Acoust Technol"},{"key":"6582_CR14","doi-asserted-by":"publisher","DOI":"10.1007\/s00500-023-07969-5","author":"KL Lakshmi","year":"2023","unstructured":"Lakshmi KL, Muthulakshmi P, Nithya AA, Jeyavathana RB, Usharani R, Das NS, Devi GNR (2023) Recognition of emotions in speech using deep cnn and resnet. Soft Comput. https:\/\/doi.org\/10.1007\/s00500-023-07969-5","journal-title":"Soft Comput"},{"key":"6582_CR15","unstructured":"Liang K, Zhang N, Liu Y, et al. (2023) Hybrid multiscale convolution combined with two-layer lstm for speech emotion recognition. Computer and Modernization (01)"},{"key":"6582_CR16","unstructured":"Ekman P, Friesen WV, Ellsworth P (2013) Emotion in the Human Face: Guidelines for Research and an Integration of Findings vol. 11. Elsevier, ???"},{"key":"6582_CR17","unstructured":"Tang Y (2013) Deep learning using linear support vector machines. arXiv preprint arXiv:1306.0239"},{"key":"6582_CR18","doi-asserted-by":"crossref","unstructured":"Liu K, Zhang M, Pan Z (2016) Facial expression recognition with cnn ensemble. In: 2016 International Conference on Cyberworlds (CW), pp. 163\u2013166. IEEE","DOI":"10.1109\/CW.2016.34"},{"key":"6582_CR19","doi-asserted-by":"crossref","unstructured":"Shi J, Zhu S, Liang Z (2021) Learning to amend facial expression representation via de-albino and affinity. arXiv preprint arXiv:2103.10189","DOI":"10.23919\/CCC55666.2022.9901738"},{"issue":"2","key":"6582_CR20","doi-asserted-by":"publisher","first-page":"544","DOI":"10.1109\/TAFFC.2018.2880201","volume":"12","author":"M Li","year":"2018","unstructured":"Li M, Xu H, Huang X, Song Z, Liu X, Li X (2018) Facial expression recognition with identity and emotion joint learning. IEEE Trans Affect Comput 12(2):544\u2013550","journal-title":"IEEE Trans Affect Comput"},{"key":"6582_CR21","doi-asserted-by":"publisher","first-page":"203","DOI":"10.1016\/j.neucom.2019.01.068","volume":"337","author":"W Sun","year":"2019","unstructured":"Sun W, Song Y, Jin Z, Zhao H, Chen C (2019) Unsupervised orthogonal facial representation extraction via image reconstruction with correlation minimization. Neurocomputing 337:203\u2013217","journal-title":"Neurocomputing"},{"issue":"6","key":"6582_CR22","doi-asserted-by":"publisher","first-page":"6355","DOI":"10.1007\/s12652-020-02221-6","volume":"12","author":"WT Meshach","year":"2021","unstructured":"Meshach WT, Hemajothi S, Anita EM (2021) Retracted article: real-time facial expression recognition for affect identification using multi-dimensional svm. J Ambient Intell Humaniz Comput 12(6):6355\u20136365","journal-title":"J Ambient Intell Humaniz Comput"},{"issue":"9","key":"6582_CR23","doi-asserted-by":"publisher","first-page":"3046","DOI":"10.3390\/s21093046","volume":"21","author":"S Minaee","year":"2021","unstructured":"Minaee S, Minaei M, Abdolrashidi A (2021) Deep-emotion: facial expression recognition using attentional convolutional network. Sensors 21(9):3046","journal-title":"Sensors"},{"key":"6582_CR24","doi-asserted-by":"publisher","DOI":"10.1016\/j.eswa.2023.121290","volume":"236","author":"E Pei","year":"2024","unstructured":"Pei E, Hu Z, He L, Ning H, Berenguer AD (2024) An ensemble learning-enhanced multitask learning method for continuous affect recognition from facial images. Expert Syst Appl 236:121290","journal-title":"Expert Syst Appl"},{"key":"6582_CR25","doi-asserted-by":"crossref","unstructured":"De\u00a0Silva LC, Miyasato T, Nakatsu R (1997) Facial emotion recognition using multi-modal information. In: Proceedings of ICICS, 1997 International Conference on Information, Communications and Signal Processing. Theme: Trends in Information Systems Engineering and Wireless Multimedia Communications (Cat., vol. 1, pp. 397\u2013401. IEEE","DOI":"10.1109\/ICICS.1997.647126"},{"key":"6582_CR26","doi-asserted-by":"crossref","unstructured":"Chen LS, Huang TS, Miyasato T, Nakatsu R (1998) Multimodal human emotion\/expression recognition. In: Proceedings Third IEEE International Conference on Automatic Face and Gesture Recognition, pp. 366\u2013371. IEEE","DOI":"10.1109\/AFGR.1998.670976"},{"key":"6582_CR27","doi-asserted-by":"publisher","first-page":"66553","DOI":"10.1109\/ACCESS.2020.2985453","volume":"8","author":"W Sun","year":"2020","unstructured":"Sun W, Song Y, Zhao H, Jin Z (2020) A face spoofing detection method based on domain adaptation and lossless size adaptation. IEEE access 8:66553\u201366563","journal-title":"IEEE access"},{"key":"6582_CR28","doi-asserted-by":"publisher","first-page":"7","DOI":"10.1007\/s12193-009-0032-6","volume":"3","author":"F Eyben","year":"2010","unstructured":"Eyben F, W\u00f6llmer M, Graves A, Schuller B, Douglas-Cowie E, Cowie R (2010) On-line emotion recognition in a 3-d activation-valence-time continuum using acoustic and linguistic cues. J Multimodal User Interface 3:7\u201319","journal-title":"J Multimodal User Interface"},{"key":"6582_CR29","doi-asserted-by":"crossref","unstructured":"Poria S, Cambria E, Hazarika D, Mazumder N, Zadeh A, Morency L-P (2017) Multi-level multiple attentions for contextual multimodal sentiment analysis. In: 2017 IEEE International Conference on Data Mining (ICDM), pp. 1033\u20131038. IEEE","DOI":"10.1109\/ICDM.2017.134"},{"key":"6582_CR30","doi-asserted-by":"crossref","unstructured":"Krishna D, Patil A (2020) Multimodal emotion recognition using cross-modal attention and 1d convolutional neural networks. In: Interspeech, pp. 4243\u20134247","DOI":"10.21437\/Interspeech.2020-1190"},{"key":"6582_CR31","unstructured":"Fu Z, Liu F, Wang H, Qi J, Fu X, Zhou A, Li Z (2021) A cross-modal fusion network based on self-attention and residual structure for multimodal emotion recognition. arXiv preprint arXiv:2111.02172"},{"issue":"22","key":"6582_CR32","doi-asserted-by":"publisher","first-page":"7665","DOI":"10.3390\/s21227665","volume":"21","author":"C Luna-Jim\u00e9nez","year":"2021","unstructured":"Luna-Jim\u00e9nez C, Griol D, Callejas Z, Kleinlein R, Montero JM, Fern\u00e1ndez-Mart\u00ednez F (2021) Multimodal emotion recognition on ravdess dataset using transfer learning. Sensors 21(22):7665","journal-title":"Sensors"},{"key":"6582_CR33","doi-asserted-by":"publisher","first-page":"74539","DOI":"10.1109\/ACCESS.2021.3067460","volume":"9","author":"M Xu","year":"2021","unstructured":"Xu M, Zhang F, Zhang W (2021) Head fusion: improving the accuracy and robustness of speech emotion recognition on the iemocap and ravdess dataset. IEEE Access 9:74539\u201374549","journal-title":"IEEE Access"},{"issue":"11","key":"6582_CR34","doi-asserted-by":"publisher","first-page":"16359","DOI":"10.1007\/s11042-022-14185-0","volume":"82","author":"G Tang","year":"2023","unstructured":"Tang G, Xie Y, Li K, Liang R, Zhao L (2023) Multimodal emotion recognition from facial expression and speech based on feature fusion. Multimedia Tools Appl 82(11):16359\u201316373","journal-title":"Multimedia Tools Appl"},{"key":"6582_CR35","doi-asserted-by":"crossref","unstructured":"Kumar P, Malik S, Raman B (2023) Interpretable multimodal emotion recognition using hybrid fusion of speech and image data. Multimedia Tools and Applications, 1\u201322","DOI":"10.1007\/s11042-023-16443-1"},{"key":"6582_CR36","doi-asserted-by":"publisher","DOI":"10.1016\/j.imavis.2023.104676","volume":"133","author":"B Mocanu","year":"2023","unstructured":"Mocanu B, Tapu R, Zaharia T (2023) Multimodal emotion recognition using cross modal audio-video fusion with attention and deep metric learning. Image Vision Comput 133:104676","journal-title":"Image Vision Comput"},{"key":"6582_CR37","doi-asserted-by":"crossref","unstructured":"Zhao Z, Liu Q, Zhou F (2021) Robust lightweight facial expression recognition network with label distribution training. In: Proceedings of the AAAI Conference on Artificial Intelligence, vol. 35, pp. 3510\u20133519","DOI":"10.1609\/aaai.v35i4.16465"}],"container-title":["The Journal of Supercomputing"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11227-024-06582-z.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11227-024-06582-z\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11227-024-06582-z.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,11,29]],"date-time":"2024-11-29T22:11:14Z","timestamp":1732918274000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11227-024-06582-z"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,10,18]]},"references-count":37,"journal-issue":{"issue":"1","published-print":{"date-parts":[[2025,1]]}},"alternative-id":["6582"],"URL":"https:\/\/doi.org\/10.1007\/s11227-024-06582-z","relation":{},"ISSN":["0920-8542","1573-0484"],"issn-type":[{"value":"0920-8542","type":"print"},{"value":"1573-0484","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024,10,18]]},"assertion":[{"value":"21 August 2024","order":1,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"18 October 2024","order":2,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors declare no conflict of interest.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflict of interest"}}],"article-number":"31"}}