{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,19]],"date-time":"2026-05-19T06:09:29Z","timestamp":1779170969554,"version":"3.51.4"},"reference-count":67,"publisher":"Springer Science and Business Media LLC","issue":"3","license":[{"start":{"date-parts":[[2026,5,19]],"date-time":"2026-05-19T00:00:00Z","timestamp":1779148800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2026,5,19]],"date-time":"2026-05-19T00:00:00Z","timestamp":1779148800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Evolving Systems"],"published-print":{"date-parts":[[2026,9]]},"DOI":"10.1007\/s12530-026-09834-w","type":"journal-article","created":{"date-parts":[[2026,5,19]],"date-time":"2026-05-19T05:50:26Z","timestamp":1779169826000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["FG-T-FBP: fine-grained temporal factorized bilinear pooling fusion using graph attention mechanism for cross-modal emotion recognition"],"prefix":"10.1007","volume":"17","author":[{"ORCID":"https:\/\/orcid.org\/0000-0001-8831-9291","authenticated-orcid":false,"given":"Himanshu","family":"Kumar","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Martin","family":"A","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2026,5,19]]},"reference":[{"key":"9834_CR1","doi-asserted-by":"publisher","first-page":"142","DOI":"10.30574\/ijsra.2024.12.1.0723","volume":"12","author":"S Nithyasri","year":"2024","unstructured":"Nithyasri S, Hemavarthini B, Bharathi N, Gopalsamy (2024) Multimodal emotion recognition from audio and video. Int J Sci Res Arch 12:142\u2013149. https:\/\/doi.org\/10.30574\/ijsra.2024.12.1.0723","journal-title":"Int J Sci Res Arch"},{"key":"9834_CR2","doi-asserted-by":"crossref","unstructured":"Dai W, Cahyawijaya S, Liu Z, Fung P (2021) Multimodal End-to-End Sparse Model for Emotion Recognition. In: Proceedings of the 2021 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies. Association for Computational Linguistics (ACL), pp 5305\u20135316","DOI":"10.18653\/v1\/2021.naacl-main.417"},{"key":"9834_CR3","doi-asserted-by":"publisher","first-page":"104676","DOI":"10.1016\/j.imavis.2023.104676","volume":"133","author":"B Mocanu","year":"2023","unstructured":"Mocanu B, Tapu R, Zaharia T (2023) Multimodal emotion recognition using cross modal audio-video fusion with attention and deep metric learning. Image Vis Comput 133:104676. https:\/\/doi.org\/10.1016\/j.imavis.2023.104676","journal-title":"Image Vis Comput"},{"key":"9834_CR4","doi-asserted-by":"publisher","first-page":"1","DOI":"10.3390\/app11041890","volume":"11","author":"SW Byun","year":"2021","unstructured":"Byun SW, Lee SP (2021) A study on a speech emotion recognition system with effective acoustic features using deep learning algorithms. Appl Sci 11:1\u201315. https:\/\/doi.org\/10.3390\/app11041890","journal-title":"Appl Sci"},{"key":"9834_CR5","doi-asserted-by":"crossref","unstructured":"Aouani H, Ayed Y, Ben (2020) Speech Emotion Recognition with deep learning. In: 24th International Conference on Knowledge-Based and Intelligent Information & Engineering Speech Emotion Recognition with deep learning Systems. Elsevier B.V. pp 251\u2013260","DOI":"10.1016\/j.procs.2020.08.027"},{"key":"9834_CR6","doi-asserted-by":"publisher","first-page":"75557","DOI":"10.1007\/s11042-024-18316-7","volume":"83","author":"WA Khan","year":"2024","unstructured":"Khan WA, ul Qudous H, Farhan AA (2024) Speech emotion recognition using feature fusion: a hybrid approach to deep learning. Multimed Tools Appl 83:75557\u201375584. https:\/\/doi.org\/10.1007\/s11042-024-18316-7","journal-title":"Multimed Tools Appl"},{"key":"9834_CR7","doi-asserted-by":"publisher","first-page":"42763","DOI":"10.1007\/s11042-023-15275-3","volume":"82","author":"SK Panda","year":"2023","unstructured":"Panda SK, Jena AK, Panda MR, Panda S (2023) Speech emotion recognition using multimodal feature fusion with machine learning approach. Multimed Tools Appl 82:42763\u201342781. https:\/\/doi.org\/10.1007\/s11042-023-15275-3","journal-title":"Multimed Tools Appl"},{"key":"9834_CR8","doi-asserted-by":"publisher","unstructured":"Jin Z, Zai W (2025) Audiovisual emotion recognition based on bi-layer LSTM and multi-head attention mechanism on RAVDESS dataset. J Supercomput 81. https:\/\/doi.org\/10.1007\/s11227-024-06582-z","DOI":"10.1007\/s11227-024-06582-z"},{"key":"9834_CR9","doi-asserted-by":"crossref","unstructured":"Gu A (2025) A facial and vocal emotion recognition system based on deep learning. In: Proceedings of the 6th International Conference on Computing and Data Science. pp 246\u2013252","DOI":"10.54254\/2755-2721\/88\/20241733"},{"key":"9834_CR10","doi-asserted-by":"publisher","first-page":"73","DOI":"10.1016\/j.specom.2020.12.009","volume":"127","author":"S Zhang","year":"2021","unstructured":"Zhang S, Tao X, Chuang Y, Zhao X (2021) Learning deep multimodal affective features for spontaneous speech emotion recognition. Speech Commun 127:73\u201381. https:\/\/doi.org\/10.1016\/j.specom.2020.12.009","journal-title":"Speech Commun"},{"key":"9834_CR11","doi-asserted-by":"publisher","first-page":"5862","DOI":"10.3390\/s24185862","volume":"24","author":"A Das","year":"2024","unstructured":"Das A, Sarma M, Sen, Hoque MM, Siddique N, Dewan MAA (2024) AVaTER: fusing audio, visual, and textual modalities using cross-modal attention for emotion recognition. Sensors 24:5862. https:\/\/doi.org\/10.3390\/s24185862","journal-title":"Sensors"},{"key":"9834_CR12","doi-asserted-by":"publisher","first-page":"19947","DOI":"10.1109\/ACCESS.2025.3534176","volume":"13","author":"A Jo","year":"2025","unstructured":"Jo A, Keun C (2025) Classification of speech emotion state based on feature map fusion of TCN and pretrained CNN model from korean speech emotion data. IEEE Access 13:19947\u201319963. https:\/\/doi.org\/10.1109\/ACCESS.2025.3534176","journal-title":"IEEE Access"},{"key":"9834_CR13","doi-asserted-by":"publisher","first-page":"3536","DOI":"10.1049\/iet-ipr.2019.1566","volume":"14","author":"N Hajarolasvadi","year":"2020","unstructured":"Hajarolasvadi N, Demirel H (2020) Deep facial emotion recognition in video using eigenframes. IET Image Process 14:3536\u20133546. https:\/\/doi.org\/10.1049\/iet-ipr.2019.1566","journal-title":"IET Image Process"},{"key":"9834_CR14","doi-asserted-by":"crossref","unstructured":"Zhao Z, Yiqin Z, Zhongtian B, Wang H, Zixing Z, Chao L (2018) Deep spectrum feature representations for speech emotion recognition. Joint Workshop of the 4th Workshop on Affective Social Multimedia Computing and first Multi-Modal Affective Computing of Large-Scale Multimedia Data (ASMMC-MMAC\u201918). ACM, New York. pp 27\u201333","DOI":"10.1145\/3267935.3267948"},{"key":"9834_CR15","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1016\/j.neucom.2023.126427","volume":"550","author":"J Li","year":"2023","unstructured":"Li J, Wang X, Lv G, Zeng Z (2023) GraphMFT: a graph network based multimodal fusion technique for emotion recognition in conversation. Neurocomputing. 550:1\u201312. https:\/\/doi.org\/10.1016\/j.neucom.2023.126427","journal-title":"Neurocomputing"},{"key":"9834_CR16","doi-asserted-by":"publisher","unstructured":"Fen L, Jianfeng C, Kemeng L, Weijie T, Chang C, Muhammad SA (2022) A parallel multi-modal factorized bilinear pooling fusion method based on the semi-tensor product for emotion recognition. https:\/\/doi.org\/10.3390\/e24121836. Entropy","DOI":"10.3390\/e24121836"},{"key":"9834_CR17","doi-asserted-by":"publisher","first-page":"38","DOI":"10.1016\/j.neucom.2020.01.067","volume":"392","author":"F Zhou","year":"2020","unstructured":"Zhou F, Kong S, Fowlkes CC, Chen T, Lei B (2020) Fine-grained facial expression analysis using dimensional emotion model. Neurocomputing 392:38\u201349. https:\/\/doi.org\/10.1016\/j.neucom.2020.01.067","journal-title":"Neurocomputing"},{"key":"9834_CR18","unstructured":"Pranesh R (2022) Exploring multimodal features and fusion strategies for analyzing disaster tweets. proc eighth work noisy user-generated text (W-NUT 2022) 62\u201368"},{"key":"9834_CR19","doi-asserted-by":"publisher","first-page":"79","DOI":"10.7840\/kics.2022.47.1.79","volume":"47","author":"JN Njoku","year":"2022","unstructured":"Njoku JN, Caliwag AC, Lim W, Kim S, Hwang H-J, Jeong J-W (2022) Deep learning based data fusion methods for multimodal emotion recognition. J Korean Inst Commun Inf Sci 47:79\u201387. https:\/\/doi.org\/10.7840\/kics.2022.47.1.79","journal-title":"J Korean Inst Commun Inf Sci"},{"key":"9834_CR20","doi-asserted-by":"publisher","first-page":"122579","DOI":"10.1016\/j.eswa.2023.122579","volume":"240","author":"C Dixit","year":"2024","unstructured":"Dixit C, Satapathy SM (2024) Deep CNN with late fusion for real time multimodal emotion recognition. Expert Syst Appl 240:122579. https:\/\/doi.org\/10.1016\/j.eswa.2023.122579","journal-title":"Expert Syst Appl"},{"key":"9834_CR21","doi-asserted-by":"publisher","first-page":"28373","DOI":"10.1007\/s11042-023-16443-1","volume":"83","author":"P Kumar","year":"2024","unstructured":"Kumar P, Malik S, Raman B (2024) Interpretable multimodal emotion recognition using hybrid fusion of speech and image data. Multimed Tools Appl 83:28373\u201328394. https:\/\/doi.org\/10.1007\/s11042-023-16443-1","journal-title":"Multimed Tools Appl"},{"key":"9834_CR22","doi-asserted-by":"publisher","unstructured":"Sahoo S, Routray A (2017) Emotion recognition from audio-visual data using rule based decision level fusion. 2016 IEEE Students\u2019 Technol Symp TechSym 2016 7\u201312. https:\/\/doi.org\/10.1109\/TechSym.2016.7872646","DOI":"10.1109\/TechSym.2016.7872646"},{"key":"9834_CR23","doi-asserted-by":"publisher","unstructured":"Zhu H, Wang Z, Shi Y, Hua Y, Xu G, Deng L (2020) Multimodal fusion method based on self-attention mechanism. Wirel Commun Mob Comput 2020. https:\/\/doi.org\/10.1155\/2020\/8843186","DOI":"10.1155\/2020\/8843186"},{"key":"9834_CR24","doi-asserted-by":"publisher","first-page":"6672","DOI":"10.1109\/TCSS.2024.3412074","volume":"11","author":"C Cheng","year":"2024","unstructured":"Cheng C, Liu W, Feng L, Jia Z (2024) Dense graph convolutional with joint cross-attention network for multimodal emotion recognition. IEEE Trans Comput Soc Syst 11:6672\u20136683. https:\/\/doi.org\/10.1109\/TCSS.2024.3412074","journal-title":"IEEE Trans Comput Soc Syst"},{"key":"9834_CR25","doi-asserted-by":"publisher","first-page":"18","DOI":"10.1155\/2023\/9645611","volume":"2023","author":"X Liu","year":"2023","unstructured":"Liu X, Xu Z, Huang K (2023) Multimodal emotion recognition based on cascaded multichannel and hierarchical fusion. Comput Intell Neurosci 2023:18. https:\/\/doi.org\/10.1155\/2023\/9645611","journal-title":"Comput Intell Neurosci"},{"key":"9834_CR26","doi-asserted-by":"crossref","unstructured":"Ho NH, Yang HJ, Kim SH, Lee G (2020) Multimodal Approach of Speech Emotion Recognition Using Multi-Level Multi-Head Fusion Attention-Based Recurrent Neural Network. In: IEEE Access IEEE. pp 61672\u201361686","DOI":"10.1109\/ACCESS.2020.2984368"},{"key":"9834_CR27","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1038\/s41598-023-41373-1","volume":"13","author":"Q Liu","year":"2023","unstructured":"Liu Q, Dong L, Zeng Z, Zhu W, Zhu Y, Meng C (2023) SSD with multi-scale feature fusion and attention mechanism. Sci Rep 13:1\u201314. https:\/\/doi.org\/10.1038\/s41598-023-41373-1","journal-title":"Sci Rep"},{"key":"9834_CR28","doi-asserted-by":"publisher","unstructured":"Zadeh A, Chen M, Cambria E, Poria S, Morency LP (2017) Tensor fusion network for multimodal sentiment analysis. EMNLP 2017 - Conf Empir Methods Nat Lang Process Proc. pp 1103\u20131114. https:\/\/doi.org\/10.18653\/v1\/d17-1115","DOI":"10.18653\/v1\/d17-1115"},{"key":"9834_CR29","doi-asserted-by":"publisher","unstructured":"Sahay S, Okur E, Kumar SH, Nachman L (2020) Low rank fusion based transformers for multimodal sequences. Proc Annu Meet Assoc Comput Linguist 29\u201334. https:\/\/doi.org\/10.18653\/v1\/2020.challengehml-1.4","DOI":"10.18653\/v1\/2020.challengehml-1.4"},{"key":"9834_CR30","doi-asserted-by":"publisher","first-page":"1","DOI":"10.3390\/sym11081033","volume":"11","author":"W Wang","year":"2019","unstructured":"Wang W, Zhang J, Wang F (2019) Attention bilinear pooling for fine-grained classification. Symmetry (Basel) 11:1\u201317. https:\/\/doi.org\/10.3390\/sym11081033","journal-title":"Symmetry (Basel)"},{"key":"9834_CR31","doi-asserted-by":"publisher","first-page":"8403","DOI":"10.1007\/s11760-024-03482-w","volume":"18","author":"Y Li","year":"2024","unstructured":"Li Y, Zheng X, Zhu M, Mei J, Chen Z, Tao Y (2024) Compact bilinear pooling and multi-loss network for social media multimodal classification. Signal Image Video Process 18:8403\u20138412. https:\/\/doi.org\/10.1007\/s11760-024-03482-w","journal-title":"Signal Image Video Process"},{"key":"9834_CR32","doi-asserted-by":"publisher","unstructured":"Liu P, Li K, Meng H (2020) Group gated fusion on attention-based bidirectional alignment for multimodal emotion recognition. Proc Annu Conf Int Speech Commun Assoc INTERSPEECH 2020-Octob 379\u2013383. https:\/\/doi.org\/10.21437\/Interspeech.2020-2067","DOI":"10.21437\/Interspeech.2020-2067"},{"key":"9834_CR33","doi-asserted-by":"publisher","first-page":"103877","DOI":"10.1016\/j.bspc.2022.103877","volume":"77","author":"Y Zhang","year":"2022","unstructured":"Zhang Y, Cheng C, Wang S, Xia T (2022) Emotion recognition using heterogeneous convolutional neural networks combined with multimodal factorized bilinear pooling. Biomed Signal Process Control 77:103877. https:\/\/doi.org\/10.1016\/j.bspc.2022.103877","journal-title":"Biomed Signal Process Control"},{"key":"9834_CR34","doi-asserted-by":"publisher","unstructured":"Nguyen D, Nguyen K, Sridharan S, Ghasemi A, Dean D, Fookes C (2017) Deep spatio-temporal features for multimodal emotion recognition. Proc\u2009\u2013\u20092017. IEEE Winter Conf Appl Comput Vis WACV 2017:1215\u20131223. https:\/\/doi.org\/10.1109\/WACV.2017.140","DOI":"10.1109\/WACV.2017.140"},{"key":"9834_CR35","doi-asserted-by":"crossref","unstructured":"Zhang Y, Wang Z-R, Du J (2019) Deep fusion: an attention guided factorized bilinear pooling for audio-video emotion recognition. In: International Joint Conference on Neural Networks (IJCNN),. IEEE","DOI":"10.1109\/IJCNN.2019.8851942"},{"key":"9834_CR36","doi-asserted-by":"publisher","DOI":"10.1145\/3340555.3355713","author":"H Zhou","year":"2019","unstructured":"Zhou H, Meng D, Zhang Y, Peng X, Du J, Wang K, Qiao Y (2019) Exploring emotion features and fusion strategies for audio-video emotion recognition. Assoc Comput Mach ACM. https:\/\/doi.org\/10.1145\/3340555.3355713","journal-title":"Assoc Comput Mach ACM"},{"key":"9834_CR37","doi-asserted-by":"publisher","first-page":"2617","DOI":"10.1109\/TASLP.2021.3096037","volume":"29","author":"H Zhou","year":"2021","unstructured":"Zhou H, Du J, Zhang Y, Wang Q, Liu QF, Lee CH (2021) Information fusion in attention networks using adaptive and multi-level factorized bilinear pooling for audio-visual emotion recognition. IEEE\/ACM Trans Audio Speech Lang Process 29:2617\u20132629. https:\/\/doi.org\/10.1109\/TASLP.2021.3096037","journal-title":"IEEE\/ACM Trans Audio Speech Lang Process"},{"key":"9834_CR38","doi-asserted-by":"publisher","DOI":"10.1145\/3487075.3487164","author":"H Miao","year":"2021","unstructured":"Miao H, Zhang Y, Wang D, Feng S (2021) Multimodal emotion recognition with factorized bilinear pooling and adversarial learning. ACM Int Conf Proceeding Ser. https:\/\/doi.org\/10.1145\/3487075.3487164","journal-title":"ACM Int Conf Proceeding Ser"},{"key":"9834_CR39","doi-asserted-by":"publisher","first-page":"1898","DOI":"10.1109\/LSP.2021.3112314","volume":"28","author":"K Zhang","year":"2021","unstructured":"Zhang K, Li Y, Wang J, Wang Z, Li X (2021) Feature fusion for multimodal emotion recognition based on deep canonical correlation analysis. IEEE Signal Process Lett 28:1898\u20131902. https:\/\/doi.org\/10.1109\/LSP.2021.3112314","journal-title":"IEEE Signal Process Lett"},{"key":"9834_CR40","doi-asserted-by":"publisher","first-page":"3793","DOI":"10.1109\/TMM.2020.3032037","volume":"23","author":"W Nie","year":"2021","unstructured":"Nie W, Ren M, Nie J, Zhao S (2021) C-GCN: correlation based graph convolutional network for audio-video emotion recognition. IEEE Trans Multimed 23:3793\u20133804. https:\/\/doi.org\/10.1109\/TMM.2020.3032037","journal-title":"IEEE Trans Multimed"},{"key":"9834_CR41","doi-asserted-by":"crossref","unstructured":"Huang J, Tao J, Liu B, Lian Z, Niu M (2020) Multimodal transformer fusion for continuous emotion recognition. ICASSP 2020\u20132020. IEEE Int Conf Acoust Speech Signal Process 3507\u20133511","DOI":"10.1109\/ICASSP40776.2020.9053762"},{"key":"9834_CR42","doi-asserted-by":"publisher","first-page":"14742","DOI":"10.1109\/ACCESS.2023.3244390","volume":"11","author":"HD Le","year":"2023","unstructured":"Le HD, Lee GS, Kim SH, Kim S, Yang HJ (2023) Multi-label multimodal emotion recognition with transformer-based fusion and emotion-level representation learning. IEEE Access 11:14742\u201314751. https:\/\/doi.org\/10.1109\/ACCESS.2023.3244390","journal-title":"IEEE Access"},{"key":"9834_CR43","doi-asserted-by":"publisher","first-page":"184","DOI":"10.1016\/j.inffus.2018.06.003","volume":"46","author":"Y Ma","year":"2019","unstructured":"Ma Y, Hao Y, Chen M, Chen J, Lu P, Ko\u0161ir A (2019) Audio-visual emotion fusion(AVEF):a deep efficient weighted approach. Inf Fusion 46:184\u2013192. https:\/\/doi.org\/10.1016\/j.inffus.2018.06.003","journal-title":"Inf Fusion"},{"key":"9834_CR44","doi-asserted-by":"publisher","first-page":"94557","DOI":"10.1109\/ACCESS.2021.3092735","volume":"9","author":"S Lee","year":"2021","unstructured":"Lee S, Han DK, Ko H (2021) Multimodal emotion recognition fusion analysis adapting BERT with heterogeneous feature unification. IEEE Access 9:94557\u201394572. https:\/\/doi.org\/10.1109\/ACCESS.2021.3092735","journal-title":"IEEE Access"},{"key":"9834_CR45","doi-asserted-by":"publisher","first-page":"0","DOI":"10.1007\/s13735-024-00347-3","volume":"13","author":"R Wang","year":"2024","unstructured":"Wang R, Zhu J, Wang S, Wang T, Huang J, Zhu X (2024) Multi-modal emotion recognition using tensor decomposition fusion and self-supervised multi-tasking. Int J Multimed Inf Retr 13:0\u201320. https:\/\/doi.org\/10.1007\/s13735-024-00347-3","journal-title":"Int J Multimed Inf Retr"},{"key":"9834_CR46","doi-asserted-by":"publisher","first-page":"2247","DOI":"10.18653\/v1\/p18-1209","volume":"1","author":"Z Liu","year":"2018","unstructured":"Liu Z, Shen Y, Lakshminarasimhan VB, Liang PP, Zadeh A, Morency LP (2018) Efficient low-rank multimodal fusion with modality-specific factors. ACL 2018\u201356th Annu Meet Assoc Comput Linguist Proc Conf. (Long Pap 1:2247\u20132256. https:\/\/doi.org\/10.18653\/v1\/p18-1209","journal-title":"(Long Pap"},{"key":"9834_CR47","first-page":"2","volume":"abs\/211102172","author":"Z Fu","year":"2021","unstructured":"Fu Z, Liu F, Wang H, Qi J, Fu X, Zhou A, Li Z (2021) A cross-modal fusion network based on self-attention and residual structure for multimodal emotion recognition. ArXiv abs\/211102172:2\u20136","journal-title":"ArXiv"},{"key":"9834_CR48","doi-asserted-by":"publisher","first-page":"103976","DOI":"10.1109\/ACCESS.2024.3430850","volume":"12","author":"S Kalateh","year":"2024","unstructured":"Kalateh S, Estrada-Jimenez LA, Nikghadam-Hojjati S, Barata J (2024) A systematic review on multimodal emotion recognition: building blocks, current state, applications, and challenges. IEEE Access 12:103976\u2013104019. https:\/\/doi.org\/10.1109\/ACCESS.2024.3430850","journal-title":"IEEE Access"},{"key":"9834_CR49","doi-asserted-by":"crossref","unstructured":"Deng J, Dong W, Socher R, Li L, Li K, Fei-fei L (2009) ImageNet: a large-scale hierarchical image database. In: IEEE Conference on Computer Vision and Pattern Recognition,. pp 248\u2013255","DOI":"10.1109\/CVPR.2009.5206848"},{"key":"9834_CR50","doi-asserted-by":"publisher","first-page":"61","DOI":"10.1109\/TNN.2008.2005605","volume":"20","author":"F Scarselli","year":"2009","unstructured":"Scarselli F, Gori M, Tsoi AC, Hagenbuchner M, Monfardini G (2009) The graph neural network model. IEEE Trans Neural Networks 20:61\u201380. https:\/\/doi.org\/10.1109\/TNN.2008.2005605","journal-title":"IEEE Trans Neural Networks"},{"key":"9834_CR51","doi-asserted-by":"publisher","unstructured":"Veli\u010dkovi\u0107 P, Casanova A, Li\u00f2 P, Cucurull G, Romero A, Bengio Y (2018) Graph attention networks. 6th Int Conf Learn Represent ICLR 2018 - Conf Track Proc 1\u201312. https:\/\/doi.org\/10.1007\/978-3-031-01587-8_7","DOI":"10.1007\/978-3-031-01587-8_7"},{"key":"9834_CR52","doi-asserted-by":"crossref","unstructured":"Ghaleb E, Niehues J, Asteriadis S (2019) Multimodal attention-mechanism for temporal emotion recognition. In: 8th International Conference on Affective Computing and Intelligent Interaction (ACII), Cambridge, UK, 2019. pp 552\u2013558","DOI":"10.1109\/ACII.2019.8925444"},{"key":"9834_CR53","doi-asserted-by":"publisher","unstructured":"Bachiri K, Yahyaouy A, Malek M, Rogovschi N (2025) MM-HGNN: multimodal representation learning heterogeneous graph neural network. Int J Comput Intell Syst 18. https:\/\/doi.org\/10.1007\/s44196-025-00820-9","DOI":"10.1007\/s44196-025-00820-9"},{"key":"9834_CR54","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.229","author":"Y Li","year":"2017","unstructured":"Li Y, Wang N, Liu J, Hou X (2017) Factorized bilinear models for image recognition. Proc IEEE Int Conf Comput Vis. https:\/\/doi.org\/10.1109\/ICCV.2017.229. 2017-Octob:2098\u20132106"},{"key":"9834_CR55","doi-asserted-by":"publisher","first-page":"82","DOI":"10.1109\/MIS.2016.94","volume":"31","author":"A Zadeh","year":"2016","unstructured":"Zadeh A, Zellers R, Pincus E, Morency L-P (2016) MOSI: multimodal corpus of sentiment intensity and subjectivity analysis in online opinion videos. IEEE Intell Syst 31:82\u201388","journal-title":"IEEE Intell Syst"},{"key":"9834_CR56","doi-asserted-by":"publisher","first-page":"335","DOI":"10.1007\/s10579-008-9076-6","volume":"42","author":"C Busso","year":"2008","unstructured":"Busso C, Bulut M, Lee CC, Kazemzadeh A, Mower E, Kim S, Chang JN, Lee S, Narayanan SS (2008) IEMOCAP: interactive emotional dyadic motion capture database. Lang Resour Eval 42:335\u2013359. https:\/\/doi.org\/10.1007\/s10579-008-9076-6","journal-title":"Lang Resour Eval"},{"key":"9834_CR57","doi-asserted-by":"publisher","first-page":"105081","DOI":"10.1016\/j.dsp.2025.105081","volume":"161","author":"Z Sun","year":"2025","unstructured":"Sun Z, Liu H, Li H, Li Y, Zhang W (2025) AVERFormer: end-to-end audio-visual emotion recognition transformer framework with balanced modal contributions. Digit Signal Process Rev J 161:105081. https:\/\/doi.org\/10.1016\/j.dsp.2025.105081","journal-title":"Digit Signal Process Rev J"},{"key":"9834_CR58","doi-asserted-by":"publisher","first-page":"13059","DOI":"10.1007\/s11042-020-10285-x","volume":"80","author":"MG Huddar","year":"2021","unstructured":"Huddar MG, Sannakki SS, Rajpurohit VS (2021) Attention-based multimodal contextual fusion for sentiment and emotion classification using bidirectional LSTM. Multimed Tools Appl 80:13059\u201313076. https:\/\/doi.org\/10.1007\/s11042-020-10285-x","journal-title":"Multimed Tools Appl"},{"key":"9834_CR59","doi-asserted-by":"publisher","first-page":"124","DOI":"10.1016\/j.knosys.2018.07.041","volume":"161","author":"N Majumder","year":"2018","unstructured":"Majumder N, Hazarika D, Gelbukh A, Cambria E, Poria S (2018) Multimodal sentiment analysis using hierarchical fusion with context modeling. Knowledge-Based Syst 161:124\u2013133. https:\/\/doi.org\/10.1016\/j.knosys.2018.07.041","journal-title":"Knowledge-Based Syst"},{"key":"9834_CR60","doi-asserted-by":"publisher","first-page":"94557","DOI":"10.1109\/ACCESS.2021.3092735","volume":"9","author":"S Lee","year":"2021","unstructured":"Lee S, Han DK (2021) Multimodal emotion recognition fusion analysis adapting BERT with heterogeneous feature unification. IEEE Access 9:94557\u201394572. https:\/\/doi.org\/10.1109\/ACCESS.2021.3092735","journal-title":"IEEE Access"},{"key":"9834_CR61","doi-asserted-by":"publisher","unstructured":"Hu D, Hou X, Wei L, Jiang L, Mo Y (2022) Mm-Dfn: multimodal dynamic fusion network for emotion recognition in conversations. ICASSP, IEEE Int Conf Acoust Speech Signal Process - Proc 2022-May. 7037\u20137041. https:\/\/doi.org\/10.1109\/ICASSP43922.2022.9747397","DOI":"10.1109\/ICASSP43922.2022.9747397"},{"key":"9834_CR62","doi-asserted-by":"publisher","first-page":"5666","DOI":"10.18653\/v1\/2021.acl-long.440","volume":"1","author":"J Hu","year":"2021","unstructured":"Hu J, Liu Y, Zhao J, Jin Q (2021) MMGCN: Multimodal fusion via deep graph convolution network for emotion recognition in conversation. ACL-IJCNLP 2021\u201359th Annu Meet Assoc Comput Linguist 11th Int Jt Conf Nat Lang. Process Proc Conf 1:5666\u20135675. https:\/\/doi.org\/10.18653\/v1\/2021.acl-long.440","journal-title":"Process Proc Conf"},{"key":"9834_CR63","doi-asserted-by":"publisher","unstructured":"ChudasamaV, Kar P, Gudmalwar A, Shah N, Wasnik P, Onoe N (2022) M2FNet: Multi-modal Fusion Network for Emotion Recognition in Conversation. IEEE\/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW), New Orleans, LA, USA, pp 4652\u20134661 https:\/\/doi.org\/10.1109\/CVPRW56347.2022.00511","DOI":"10.1109\/CVPRW56347.2022.00511"},{"key":"9834_CR64","doi-asserted-by":"publisher","first-page":"1","DOI":"10.3390\/math13071100","volume":"13","author":"S Moorthy","year":"2025","unstructured":"Moorthy S, Moon YK (2025) Hybrid multi-attention network for audio\u2013visual emotion recognition through multimodal feature fusion. Mathematics 13:1\u201330. https:\/\/doi.org\/10.3390\/math13071100","journal-title":"Mathematics"},{"key":"9834_CR65","doi-asserted-by":"publisher","first-page":"193","DOI":"10.1007\/978-981-97-0293-0_15","volume":"191","author":"D Sharma","year":"2024","unstructured":"Sharma D, Jayabalan M, Sultanova N, Mustafina J, Yao DNL (2024) Multimodal emotion recognition using attention-based model with language, audio, and video modalities. Lect Notes Data Eng Commun Technol 191:193\u2013210. https:\/\/doi.org\/10.1007\/978-981-97-0293-0_15","journal-title":"Lect Notes Data Eng Commun Technol"},{"key":"9834_CR66","doi-asserted-by":"publisher","first-page":"176274","DOI":"10.1109\/ACCESS.2020.3026823","volume":"8","author":"S Siriwardhana","year":"2020","unstructured":"Siriwardhana S, Kaluarachchi T, Billinghurst M, Nanayakkara S (2020) Multimodal emotion recognition with transformer-based self supervised feature fusion. IEEE Access 8:176274\u2013176285. https:\/\/doi.org\/10.1109\/ACCESS.2020.3026823","journal-title":"IEEE Access"},{"key":"9834_CR67","doi-asserted-by":"publisher","first-page":"913","DOI":"10.53106\/160792642021072204018","volume":"22","author":"Z Bai","year":"2021","unstructured":"Bai Z, Chen X, Zhou M, Yi T, Chien WC (2021) Low-rank multimodal fusion algorithm based on context modeling. J Internet Technol 22:913\u2013921. https:\/\/doi.org\/10.53106\/160792642021072204018","journal-title":"J Internet Technol"}],"container-title":["Evolving Systems"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s12530-026-09834-w.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s12530-026-09834-w","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s12530-026-09834-w.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,5,19]],"date-time":"2026-05-19T05:50:30Z","timestamp":1779169830000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s12530-026-09834-w"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,5,19]]},"references-count":67,"journal-issue":{"issue":"3","published-print":{"date-parts":[[2026,9]]}},"alternative-id":["9834"],"URL":"https:\/\/doi.org\/10.1007\/s12530-026-09834-w","relation":{"references":[{"id-type":"doi","id":"10.1109\/ICCV.2017.229","asserted-by":"subject"}]},"ISSN":["1868-6478","1868-6486"],"issn-type":[{"value":"1868-6478","type":"print"},{"value":"1868-6486","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026,5,19]]},"assertion":[{"value":"23 January 2025","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"31 March 2026","order":2,"name":"revised","label":"Revised","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"20 April 2026","order":3,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"19 May 2026","order":4,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"No competing interests.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflict of interest"}},{"value":"No funding.","order":3,"name":"Ethics","group":{"name":"EthicsHeading","label":"Funding"}}],"article-number":"70"}}