{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,19]],"date-time":"2026-05-19T22:06:13Z","timestamp":1779228373701,"version":"3.51.4"},"reference-count":52,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,10,1]],"date-time":"2026-10-01T00:00:00Z","timestamp":1790812800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,10,1]],"date-time":"2026-10-01T00:00:00Z","timestamp":1790812800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,10,1]],"date-time":"2026-10-01T00:00:00Z","timestamp":1790812800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,10,1]],"date-time":"2026-10-01T00:00:00Z","timestamp":1790812800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,10,1]],"date-time":"2026-10-01T00:00:00Z","timestamp":1790812800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,10,1]],"date-time":"2026-10-01T00:00:00Z","timestamp":1790812800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,10,1]],"date-time":"2026-10-01T00:00:00Z","timestamp":1790812800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/501100007957","name":"Chongqing Municipal Education Commission","doi-asserted-by":"publisher","award":["HZ2021008"],"award-info":[{"award-number":["HZ2021008"]}],"id":[{"id":"10.13039\/501100007957","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100007957","name":"Chongqing Municipal Education Commission","doi-asserted-by":"publisher","award":["yjg223087"],"award-info":[{"award-number":["yjg223087"]}],"id":[{"id":"10.13039\/501100007957","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Computer Speech &amp; Language"],"published-print":{"date-parts":[[2026,10]]},"DOI":"10.1016\/j.csl.2026.101978","type":"journal-article","created":{"date-parts":[[2026,3,6]],"date-time":"2026-03-06T20:27:17Z","timestamp":1772828837000},"page":"101978","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"C","title":["HRDF-MER: Hierarchical feature refinement and cascaded dynamic fusion for multimodal emotion recognition"],"prefix":"10.1016","volume":"100","author":[{"given":"Jianjun","family":"Lei","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zhenmei","family":"Mu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-4402-0102","authenticated-orcid":false,"given":"Ying","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"78","reference":[{"key":"10.1016\/j.csl.2026.101978_b1","doi-asserted-by":"crossref","first-page":"335","DOI":"10.1007\/s10579-008-9076-6","article-title":"IEMOCAP: Interactive emotional dyadic motion capture database","volume":"42","author":"Busso","year":"2008","journal-title":"Lang. Resour. Eval."},{"key":"10.1016\/j.csl.2026.101978_b2","doi-asserted-by":"crossref","DOI":"10.1016\/j.knosys.2024.111954","article-title":"Multi-modal graph context extraction and consensus-aware learning for emotion recognition in conversation","volume":"298","author":"Dai","year":"2024","journal-title":"Knowl.-Based Syst."},{"key":"10.1016\/j.csl.2026.101978_b3","doi-asserted-by":"crossref","DOI":"10.3389\/fnins.2023.1330077","article-title":"Attention-based 3D convolutional recurrent neural network model for multimodal emotion recognition","volume":"17","author":"Du","year":"2024","journal-title":"Front. Neurosci."},{"key":"10.1016\/j.csl.2026.101978_b4","doi-asserted-by":"crossref","DOI":"10.1016\/j.specom.2025.103198","article-title":"Coordination attention based transformers with bidirectional contrastive loss for multimodal speech emotion recognition","author":"Fan","year":"2025","journal-title":"Speech Commun."},{"key":"10.1016\/j.csl.2026.101978_b5","article-title":"Multimodal emotion recognition with deep learning: advancements, challenges, and future directions","volume":"105","author":"Geetha","year":"2024","journal-title":"Inf. Fusion"},{"issue":"2","key":"10.1016\/j.csl.2026.101978_b6","article-title":"A multi-level circulant cross-modal transformer for multimodal speech emotion recognition","volume":"74","author":"Gong","year":"2023","journal-title":"Comput. Mater. Contin."},{"key":"10.1016\/j.csl.2026.101978_b7","series-title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","first-page":"1726","article-title":"Multimodal prompt learning with missing modalities for sentiment analysis and emotion recognition","author":"Guo","year":"2024"},{"key":"10.1016\/j.csl.2026.101978_b8","doi-asserted-by":"crossref","DOI":"10.1016\/j.knosys.2024.111969","article-title":"Speaker-aware cognitive network with cross-modal attention for multimodal emotion recognition in conversation","volume":"296","author":"Guo","year":"2024","journal-title":"Knowl.-Based Syst."},{"key":"10.1016\/j.csl.2026.101978_b9","doi-asserted-by":"crossref","DOI":"10.1016\/j.engappai.2024.108339","article-title":"Using transformers for multimodal emotion recognition: Taxonomies and state of the art review","volume":"133","author":"Hazmoune","year":"2024","journal-title":"Eng. Appl. Artif. Intell."},{"issue":"9","key":"10.1016\/j.csl.2026.101978_b10","doi-asserted-by":"crossref","first-page":"5318","DOI":"10.1109\/TCSVT.2023.3247822","article-title":"Semantic alignment network for multi-modal emotion recognition","volume":"33","author":"Hou","year":"2023","journal-title":"IEEE Trans. Circuits Syst. Video Technol."},{"key":"10.1016\/j.csl.2026.101978_b11","series-title":"2023 IEEE International Conference on Multimedia and Expo","first-page":"1715","article-title":"A joint network based on interactive attention for speech emotion recognition","author":"Hu","year":"2023"},{"key":"10.1016\/j.csl.2026.101978_b12","doi-asserted-by":"crossref","unstructured":"Hu, Y., Yang, H., Huang, H., He, L., 2024. Cross-modal Features Interaction-and-Aggregation Network with Self-consistency Training for Speech Emotion Recognition. In: Proc. Interspeech 2024. pp. 2335\u20132339.","DOI":"10.21437\/Interspeech.2024-1733"},{"key":"10.1016\/j.csl.2026.101978_b13","series-title":"2024 IEEE 9th International Conference for Convergence in Technology","first-page":"1","article-title":"Deep learning approaches for effective human computer interaction: A comprehensive survey on single and multimodal emotion detection","author":"Jagadeesh","year":"2024"},{"issue":"12","key":"10.1016\/j.csl.2026.101978_b14","doi-asserted-by":"crossref","first-page":"7928","DOI":"10.1109\/TCSVT.2023.3275708","article-title":"A brain-inspired hierarchical interactive in-memory computing system and its application in video sentiment analysis","volume":"33","author":"Ji","year":"2023","journal-title":"IEEE Trans. Circuits Syst. Video Technol."},{"key":"10.1016\/j.csl.2026.101978_b15","doi-asserted-by":"crossref","DOI":"10.1109\/ACCESS.2024.3430850","article-title":"A systematic review on multimodal emotion recognition: building blocks, current state, applications, and challenges","author":"Kalateh","year":"2024","journal-title":"IEEE Access"},{"key":"10.1016\/j.csl.2026.101978_b16","doi-asserted-by":"crossref","DOI":"10.1016\/j.eswa.2023.122946","article-title":"MSER: Multimodal speech emotion recognition using cross-attention with deep fusion","volume":"245","author":"Khan","year":"2024","journal-title":"Expert Syst. Appl."},{"issue":"17","key":"10.1016\/j.csl.2026.101978_b17","doi-asserted-by":"crossref","first-page":"8478","DOI":"10.1007\/s10489-024-05630-8","article-title":"Multi-level attention fusion network assisted by relative entropy alignment for multimodal speech emotion recognition","volume":"54","author":"Lei","year":"2024","journal-title":"Appl. Intell."},{"key":"10.1016\/j.csl.2026.101978_b18","doi-asserted-by":"crossref","first-page":"67","DOI":"10.1016\/j.neunet.2022.09.022","article-title":"BAT: Block and token self-attention for speech emotion recognition","volume":"156","author":"Lei","year":"2022","journal-title":"Neural Netw."},{"key":"10.1016\/j.csl.2026.101978_b19","series-title":"International Conference on Multimedia Modeling","first-page":"325","article-title":"WavFusion: Towards wav2vec 2.0 multimodal speech emotion recognition","author":"Li","year":"2025"},{"key":"10.1016\/j.csl.2026.101978_b20","doi-asserted-by":"crossref","first-page":"825","DOI":"10.1613\/jair.1.15301","article-title":"Multi-modal attentive prompt learning for few-shot emotion recognition in conversations","volume":"79","author":"Liang","year":"2024","journal-title":"J. Artificial Intelligence Res."},{"key":"10.1016\/j.csl.2026.101978_b21","article-title":"EEG-based multimodal emotion recognition: A machine learning perspective","author":"Liu","year":"2024","journal-title":"IEEE Trans. Instrum. Meas."},{"issue":"7","key":"10.1016\/j.csl.2026.101978_b22","doi-asserted-by":"crossref","first-page":"1010","DOI":"10.3390\/e24071010","article-title":"Lgcct: A light gated and crossed complementation transformer for multimodal speech emotion recognition","volume":"24","author":"Liu","year":"2022","journal-title":"Entropy"},{"issue":"3","key":"10.1016\/j.csl.2026.101978_b23","doi-asserted-by":"crossref","first-page":"144","DOI":"10.1007\/s00530-024-01310-2","article-title":"Semantic-wise guidance for efficient multimodal emotion recognition with missing modalities","volume":"30","author":"Liu","year":"2024","journal-title":"Multimedia Syst."},{"key":"10.1016\/j.csl.2026.101978_b24","doi-asserted-by":"crossref","DOI":"10.1016\/j.engappai.2025.111297","article-title":"Integrating multiple syntactic structures for enhanced aspect-based sentiment analysis","volume":"158","author":"Liu","year":"2025","journal-title":"Eng. Appl. Artif. Intell."},{"key":"10.1016\/j.csl.2026.101978_b25","series-title":"ICASSP 2023-2023 IEEE International Conference on Acoustics, Speech and Signal Processing","first-page":"1","article-title":"Multimodal emotion recognition based on deep temporal features using cross-modal transformer and self-attention","author":"Maji","year":"2023"},{"issue":"10","key":"10.1016\/j.csl.2026.101978_b26","doi-asserted-by":"crossref","first-page":"4199","DOI":"10.3390\/app14104199","article-title":"Enhancing multimodal emotion recognition through attention mechanisms in BERT and CNN architectures","volume":"14","author":"Makhmudov","year":"2024","journal-title":"Appl. Sci."},{"key":"10.1016\/j.csl.2026.101978_b27","doi-asserted-by":"crossref","DOI":"10.1109\/TASLP.2024.3434495","article-title":"Masked graph learning with recurrent alignment for multimodal emotion recognition in conversation","author":"Meng","year":"2024","journal-title":"IEEE\/ACM Trans. Audio Speech Lang. Process."},{"issue":"5","key":"10.1016\/j.csl.2026.101978_b28","doi-asserted-by":"crossref","first-page":"131","DOI":"10.1007\/s10462-025-11126-9","article-title":"A review on EEG-based multimodal learning for emotion recognition","volume":"58","author":"Pillalamarri","year":"2025","journal-title":"Artif. Intell. Rev."},{"key":"10.1016\/j.csl.2026.101978_b29","series-title":"Meld: A multimodal multi-party dataset for emotion recognition in conversations","author":"Poria","year":"2018"},{"key":"10.1016\/j.csl.2026.101978_b30","first-page":"4543","article-title":"Dual memory fusion for multimodal speech emotion recognition","volume":"vol. 2023","author":"Priyasad","year":"2023"},{"key":"10.1016\/j.csl.2026.101978_b31","doi-asserted-by":"crossref","DOI":"10.1016\/j.neucom.2024.128646","article-title":"MFGCN: Multimodal fusion graph convolutional network for speech emotion recognition","volume":"611","author":"Qi","year":"2025","journal-title":"Neurocomputing"},{"issue":"6","key":"10.1016\/j.csl.2026.101978_b32","article-title":"Multimodal emotion recognition: A comprehensive review, trends, and challenges","volume":"14","author":"Ramaswamy","year":"2024","journal-title":"Wiley Interdiscip. Rev.: Data Min. Knowl. Discov."},{"key":"10.1016\/j.csl.2026.101978_b33","first-page":"1","article-title":"Multimodal emotion recognition based on a fusion of audiovisual information with temporal dynamics","author":"Salas-C\u00e1ceres","year":"2024","journal-title":"Multimedia Tools Appl."},{"key":"10.1016\/j.csl.2026.101978_b34","article-title":"Multimodal fusion: A study on speech-text emotion recognition with the integration of deep learning","volume":"24","author":"Shang","year":"2024","journal-title":"Intell. Syst. Appl."},{"key":"10.1016\/j.csl.2026.101978_b35","series-title":"Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","first-page":"14752","article-title":"MultiEMO: An attention-based correlation-aware multimodal fusion framework for emotion recognition in conversations","author":"Shi","year":"2023"},{"key":"10.1016\/j.csl.2026.101978_b36","doi-asserted-by":"crossref","first-page":"629","DOI":"10.1016\/j.neucom.2022.06.072","article-title":"Conversational emotion recognition studies based on graph convolutional neural networks and a dependent syntactic analysis","volume":"501","author":"Shou","year":"2022","journal-title":"Neurocomputing"},{"key":"10.1016\/j.csl.2026.101978_b37","series-title":"ICASSP 2023-2023 IEEE International Conference on Acoustics, Speech and Signal Processing","first-page":"1","article-title":"Using auxiliary tasks in multimodal fusion of wav2vec 2.0 and bert for multimodal emotion recognition","author":"Sun","year":"2023"},{"key":"10.1016\/j.csl.2026.101978_b38","article-title":"Connecting cross-modal representations for compact and robust multimodal sentiment analysis with sentiment word substitution error","author":"Sun","year":"2024","journal-title":"IEEE Trans. Affect. Comput."},{"issue":"4","key":"10.1016\/j.csl.2026.101978_b39","doi-asserted-by":"crossref","first-page":"3043","DOI":"10.1109\/TAFFC.2025.3566059","article-title":"Generalizing to unseen speakers: Multimodal emotion recognition in conversations with speaker generalization","volume":"16","author":"Tu","year":"2025","journal-title":"IEEE Trans. Affect. Comput."},{"key":"10.1016\/j.csl.2026.101978_b40","doi-asserted-by":"crossref","DOI":"10.1016\/j.specom.2025.103278","article-title":"Multimodal speech emotion recognition via modality constraint with hierarchical bottleneck feature fusion","author":"Wang","year":"2025","journal-title":"Speech Commun."},{"key":"10.1016\/j.csl.2026.101978_b41","series-title":"ICASSP 2023-2023 IEEE International Conference on Acoustics, Speech and Signal Processing","first-page":"1","article-title":"Exploring complementary features in multi-modal speech emotion recognition","author":"Wang","year":"2023"},{"key":"10.1016\/j.csl.2026.101978_b42","doi-asserted-by":"crossref","DOI":"10.3390\/biomimetics10070418","article-title":"A comprehensive review of multimodal emotion recognition: Techniques, challenges, and future directions","author":"Wu","year":"2025","journal-title":"Biomimetics"},{"key":"10.1016\/j.csl.2026.101978_b43","series-title":"ICASSP 2024-2024 IEEE International Conference on Acoustics, Speech and Signal Processing","first-page":"10496","article-title":"Multi-modal emotion recognition using multiple acoustic features and dual cross-modal transformer","author":"Wu","year":"2024"},{"key":"10.1016\/j.csl.2026.101978_b44","series-title":"AAAI Conference on Artificial Intelligence","first-page":"25642","article-title":"MSE-adapter: A lightweight plugin endowing LLMs with the capability to perform multimodal sentiment analysis and emotion recognition","author":"Yang","year":"2025"},{"key":"10.1016\/j.csl.2026.101978_b45","doi-asserted-by":"crossref","DOI":"10.1016\/j.apacoust.2023.109752","article-title":"Speech emotion recognition based on multi-dimensional feature extraction and multi-scale feature fusion","volume":"216","author":"Yu","year":"2024","journal-title":"Appl. Acoust."},{"key":"10.1016\/j.csl.2026.101978_b46","doi-asserted-by":"crossref","DOI":"10.1109\/TASLP.2024.3430543","article-title":"Multimodal consistency-based teacher for semi-supervised multimodal sentiment analysis","author":"Yuan","year":"2024","journal-title":"IEEE\/ACM Trans. Audio Speech Lang. Process."},{"key":"10.1016\/j.csl.2026.101978_b47","article-title":"NLAFE: Non-linear aspect-based sentiment feature enhancement combined with aspect cross attention","author":"Zhang","year":"2025","journal-title":"Expert Syst. Appl."},{"key":"10.1016\/j.csl.2026.101978_b48","doi-asserted-by":"crossref","DOI":"10.1016\/j.eswa.2023.121692","article-title":"Deep learning-based multimodal emotion recognition from audio, visual, and text modalities: A systematic review of recent advancements and future prospects","volume":"237","author":"Zhang","year":"2024","journal-title":"Expert Syst. Appl."},{"key":"10.1016\/j.csl.2026.101978_b49","doi-asserted-by":"crossref","unstructured":"Zhao, Z., Gao, T., Wang, H., Schuller, B., 2024. MFDR: Multiple-stage Fusion and Dynamically Refined Network for Multimodal Emotion Recognition. In: Proc. Interspeech 2024. pp. 3719\u20133723.","DOI":"10.21437\/Interspeech.2024-1735"},{"key":"10.1016\/j.csl.2026.101978_b50","series-title":"ICASSP 2023-2023 IEEE International Conference on Acoustics, Speech and Signal Processing","first-page":"1","article-title":"Knowledge-aware bayesian co-attention for multimodal emotion recognition","author":"Zhao","year":"2023"},{"issue":"1","key":"10.1016\/j.csl.2026.101978_b51","first-page":"32","article-title":"Dynamic continuous emotion recognition method based on electroencephalography and eye movement signals","volume":"42","author":"Zou","year":"2025","journal-title":"Sheng Wu Yi Xue Gong Cheng Xue Za Zhi=J. Biomed. Eng.=Shengwu Yixue Gongchengxue Zazhi"},{"key":"10.1016\/j.csl.2026.101978_b52","series-title":"ICASSP 2022-2022 IEEE International Conference on Acoustics, Speech and Signal Processing","first-page":"7367","article-title":"Speech emotion recognition with co-attention based multi-level acoustic information","author":"Zou","year":"2022"}],"container-title":["Computer Speech &amp; Language"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0885230826000410?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0885230826000410?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,5,19]],"date-time":"2026-05-19T21:12:01Z","timestamp":1779225121000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0885230826000410"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,10]]},"references-count":52,"alternative-id":["S0885230826000410"],"URL":"https:\/\/doi.org\/10.1016\/j.csl.2026.101978","relation":{},"ISSN":["0885-2308"],"issn-type":[{"value":"0885-2308","type":"print"}],"subject":[],"published":{"date-parts":[[2026,10]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"HRDF-MER: Hierarchical feature refinement and cascaded dynamic fusion for multimodal emotion recognition","name":"articletitle","label":"Article Title"},{"value":"Computer Speech & Language","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.csl.2026.101978","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Elsevier Ltd. All rights are reserved, including those for text and data mining, AI training, and similar technologies.","name":"copyright","label":"Copyright"}],"article-number":"101978"}}