{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,3]],"date-time":"2026-07-03T05:22:18Z","timestamp":1783056138919,"version":"3.54.6"},"reference-count":55,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/501100013317","name":"Shanxi Provincial Key Research and Development Project","doi-asserted-by":"publisher","award":["202202020101007"],"award-info":[{"award-number":["202202020101007"]}],"id":[{"id":"10.13039\/501100013317","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100003398","name":"Shanxi Scholarship Council of China","doi-asserted-by":"publisher","award":["2024-61"],"award-info":[{"award-number":["2024-61"]}],"id":[{"id":"10.13039\/501100003398","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Applied Soft Computing"],"published-print":{"date-parts":[[2026,9]]},"DOI":"10.1016\/j.asoc.2026.115725","type":"journal-article","created":{"date-parts":[[2026,6,8]],"date-time":"2026-06-08T16:01:59Z","timestamp":1780934519000},"page":"115725","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"PC","title":["Cross-modal dynamic fusion and grouped wavelet feature aggregation for multimodal emotion recognition in conversation"],"prefix":"10.1016","volume":"201","author":[{"given":"Ping","family":"Liu","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0009-6305-128X","authenticated-orcid":false,"given":"Yuan","family":"Zheng","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Huadong","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Shufeng","family":"Hao","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Hui","family":"Song","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-2407-8756","authenticated-orcid":false,"given":"Li","family":"Tang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.asoc.2026.115725_bib0005","doi-asserted-by":"crossref","first-page":"335","DOI":"10.1007\/s10579-008-9076-6","article-title":"IEMOCAP: interactive emotional dyadic motion capture database","volume":"42","author":"Busso","year":"2008","journal-title":"Lang. Resour. Evaluation"},{"key":"10.1016\/j.asoc.2026.115725_bib0010","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"10761","article-title":"Multivariate, multi-frequency and multimodal: rethinking graph neural networks for emotion recognition in conversation","author":"Chen","year":"2023"},{"key":"10.1016\/j.asoc.2026.115725_bib0015","article-title":"Deformable convolutional networks","volume":"abs\/1703.06211","author":"Dai","year":"2017","journal-title":"CoRR"},{"key":"10.1016\/j.asoc.2026.115725_bib0020","series-title":"Forty-First International Conference on Machine Learning, Vienna, Austria, July 21\u201327","article-title":"Transformers are SSMs: generalized models and efficient algorithms through structured state space duality","author":"Dao","year":"2024"},{"key":"10.1016\/j.asoc.2026.115725_bib0025","series-title":"ACM Multimedia Conference, Barcelona, Spain, October 21\u201325","first-page":"835","article-title":"Recent developments in openSMILE, the Munich open-source multimedia feature extractor","author":"Eyben","year":"2013"},{"key":"10.1016\/j.asoc.2026.115725_bib0030","series-title":"Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing, Hong Kong, China, November 3\u20137","first-page":"154","article-title":"DialogueGCN: a graph convolutional neural network for emotion recognition in conversation","author":"Ghosal","year":"2019"},{"key":"10.1016\/j.asoc.2026.115725_bib0035","article-title":"Mamba: linear-time sequence modeling with selective state spaces","volume":"abs\/2312.00752","author":"Gu","year":"2023","journal-title":"CoRR"},{"key":"10.1016\/j.asoc.2026.115725_bib0040","series-title":"Proceedings of the Conference on Empirical Methods in Natural Language Processing, Brussels, Belgium, October 31 - November 4","first-page":"2594","article-title":"ICON: interactive conversational memory network for multimodal emotion detection","author":"Hazarika","year":"2018"},{"key":"10.1016\/j.asoc.2026.115725_bib0045","series-title":"IEEE International Conference on Acoustics, Speech and Signal Processing, Virtual and Singapore, 23\u201327 May","first-page":"7037","article-title":"MM-DFN: multimodal dynamic fusion network for emotion recognition in conversations","author":"Hu","year":"2022"},{"key":"10.1016\/j.asoc.2026.115725_bib0050","series-title":"Proceedings of the 2022 Conference on Empirical Methods in Natural Language Processing","first-page":"7837","article-title":"UniMSE: towards unified multimodal sentiment analysis and emotion recognition","author":"Hu","year":"2022"},{"key":"10.1016\/j.asoc.2026.115725_bib0055","series-title":"Proceedings of the 59th Annual Meeting of the Association for Computational Linguistics and the 11th International Joint Conference on Natural Language Processing (Volume 1: Long Papers)","first-page":"5666","article-title":"MMGCN: multimodal fusion via deep graph convolution network for emotion recognition in conversation","author":"Hu","year":"2021"},{"key":"10.1016\/j.asoc.2026.115725_bib0060","series-title":"IEEE International Conference on Big Data and Smart Computing, BigComp, Kota Kinabalu, Malaysia, February 9\u201312","first-page":"191","article-title":"Enhancing speech emotion recognition through segmental average pooling of self-supervised learning features","author":"Hyeon","year":"2025"},{"key":"10.1016\/j.asoc.2026.115725_bib0065","series-title":"Proceedings of the 2020 Conference on Empirical Methods in Natural Language Processing (EMNLP)","first-page":"7360","article-title":"Relation-aware graph attention networks with relational position encodings for emotion recognition in conversations","author":"Ishiwatari","year":"2020"},{"key":"10.1016\/j.asoc.2026.115725_bib0070","series-title":"Proceedings of the Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, Minneapolis, MN, USA, June 2\u20137","first-page":"397","article-title":"HiGRU: hierarchical gated recurrent units for utterance-level emotion recognition","author":"Jiao","year":"2019"},{"key":"10.1016\/j.asoc.2026.115725_bib0075","series-title":"IEEE International Conference on Multimedia and Expo, ICME, Niagara Falls, ON, Canada, July 15\u201319","first-page":"1","article-title":"MFHCA: enhancing speech emotion recognition via multi-spatial fusion and hierarchical cooperative attention","author":"Jiao","year":"2024"},{"key":"10.1016\/j.asoc.2026.115725_bib0080","author":"Joshi"},{"key":"10.1016\/j.asoc.2026.115725_bib0085","series-title":"Joyful: joint modality fusion and graph contrastive learning for multimodal emotion recognition","first-page":"16051","author":"Li","year":"2023"},{"key":"10.1016\/j.asoc.2026.115725_bib0090","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2024.111340","article-title":"FrameERC: framelet transform based multimodal graph neural networks for emotion recognition in conversation","volume":"161","author":"Li","year":"2025","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.asoc.2026.115725_bib0095","article-title":"Coupled Mamba: enhanced multi-modal fusion with coupled state space model","volume":"abs\/2405.18014","author":"Li","year":"2024","journal-title":"CoRR"},{"key":"10.1016\/j.asoc.2026.115725_bib0100","article-title":"Mamba-enhanced text-audio-video alignment network for emotion recognition in conversations","volume":"abs\/2409.05243","author":"Li","year":"2024","journal-title":"CoRR"},{"key":"10.1016\/j.asoc.2026.115725_bib0105","series-title":"Long-short distance graph neural networks and improved curriculum learning for emotion recognition in conversation","author":"Li","year":"2025"},{"key":"10.1016\/j.asoc.2026.115725_bib0110","series-title":"Proceedings of 21st ACM SIGGRAPH Conference on Visual Media Production","article-title":"Low-light video enhancement with conditional diffusion models and wavelet interscale attentions","author":"Lin","year":"2024"},{"key":"10.1016\/j.asoc.2026.115725_bib0115","article-title":"RoBERTa: a robustly optimized BERT pretraining approach","volume":"abs\/1907.11692","author":"Liu","year":"2019","journal-title":"CoRR"},{"key":"10.1016\/j.asoc.2026.115725_bib0120","doi-asserted-by":"crossref","first-page":"776","DOI":"10.1109\/TMM.2023.3271019","article-title":"A transformer-based model with self-distillation for multimodal emotion recognition in conversations","volume":"26","author":"Ma","year":"2024","journal-title":"IEEE Trans. Multimed."},{"key":"10.1016\/j.asoc.2026.115725_bib0125","series-title":"ICASSP 2023 - 2023 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","first-page":"1","article-title":"Multimodal emotion recognition based on deep temporal features using cross-modal transformer and self-attention","author":"Maji","year":"2023"},{"key":"10.1016\/j.asoc.2026.115725_bib0130","series-title":"The Thirty-Third AAAI Conference on Artificial Intelligence, Honolulu, Hawaii, USA, January 27 - February 1","first-page":"6818","article-title":"DialogueRNN: an attentive RNN for emotion detection in conversations","author":"Majumder","year":"2019"},{"key":"10.1016\/j.asoc.2026.115725_bib0135","doi-asserted-by":"crossref","first-page":"674","DOI":"10.1109\/34.192463","article-title":"A theory for multiresolution signal decomposition: the wavelet representation","volume":"11","author":"Mallat","year":"1989","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.asoc.2026.115725_bib0140","author":"Masserano"},{"key":"10.1016\/j.asoc.2026.115725_bib0145","series-title":"Masked graph learning with recurrent alignment for multimodal emotion recognition in conversation","first-page":"4298","author":"Meng","year":"2024"},{"key":"10.1016\/j.asoc.2026.115725_bib0150","series-title":"The 5th International Conference on Computer Science and Application Engineering, Sanya, China, October 19 - 21","first-page":":89:1","article-title":"Multimodal emotion recognition with factorized bilinear pooling and adversarial learning","author":"Miao","year":"2021"},{"key":"10.1016\/j.asoc.2026.115725_bib0155","first-page":"1","article-title":"SigWavNet: learning multiresolution signal wavelet network for speech emotion recognition","author":"Nfissi","year":"2025","journal-title":"IEEE Trans. Affect. Comput."},{"key":"10.1016\/j.asoc.2026.115725_bib0160","doi-asserted-by":"crossref","first-page":"98","DOI":"10.1016\/j.inffus.2017.02.003","article-title":"A review of affective computing: from unimodal analysis to multimodal fusion","volume":"37","author":"Poria","year":"2017","journal-title":"Inf. Fusion"},{"key":"10.1016\/j.asoc.2026.115725_bib0165","series-title":"Proceedings of the 55th Annual Meeting of the Association for Computational Linguistics, Vancouver, Canada, July 30 - August 4","first-page":"873","article-title":"Context-dependent sentiment analysis in user-generated videos","author":"Poria","year":"2017"},{"key":"10.1016\/j.asoc.2026.115725_bib0170","series-title":"Proceedings of the 57th Conference of the Association for Computational Linguistics, Florence, Italy, July 28- August 2","first-page":"527","article-title":"MELD: a multimodal multi-party dataset for emotion recognition in conversations","author":"Poria","year":"2019"},{"key":"10.1016\/j.asoc.2026.115725_bib0175","series-title":"IEEE International Conference on Acoustics, Speech and Signal Processing, Hyderabad, India, April 6\u201311","first-page":"1","article-title":"Leveraging joint spectral and spatial learning with MAMBA for multichannel speech enhancement","author":"Ren","year":"2025"},{"key":"10.1016\/j.asoc.2026.115725_bib0180","series-title":"Proceedings of the 59th Annual Meeting of the Association for Computational Linguistics and the 11th International Joint Conference on Natural Language Processing","first-page":"1551","article-title":"Directed acyclic graph network for conversational emotion recognition","author":"Shen","year":"2021"},{"key":"10.1016\/j.asoc.2026.115725_bib0185","series-title":"International Joint Conference on Artificial Intelligence","article-title":"MATCH: modality-calibrated hypergraph fusion network for conversational emotion recognition","author":"Shi","year":"2025"},{"key":"10.1016\/j.asoc.2026.115725_bib0190","doi-asserted-by":"crossref","DOI":"10.1016\/j.ins.2024.121393","article-title":"Multimodal graph learning with framelet-based stochastic configuration networks for emotion recognition in conversation","volume":"686","author":"Shi","year":"2025","journal-title":"Inf. Sci."},{"key":"10.1016\/j.asoc.2026.115725_bib0195","article-title":"Efficient long-distance latent relation-aware graph neural network for multi-modal emotion recognition in conversations","volume":"abs\/2407.00119","author":"Shou","year":"2024","journal-title":"CoRR"},{"key":"10.1016\/j.asoc.2026.115725_bib0200","series-title":"Proceedings of the 31st International Conference on Computational Linguistics, Abu Dhabi, UAE, January 19\u201324","first-page":"256","article-title":"Dynamic graph neural ODE network for multi-modal emotion recognition in conversation","author":"Shou","year":"2025"},{"key":"10.1016\/j.asoc.2026.115725_bib0205","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1109\/TCSS.2025.3613939","article-title":"CIME: contextual interaction-based multimodal emotion analysis with enhanced semantic information","author":"Wang","year":"2025","journal-title":"IEEE Trans. Comput. Soc. Syst."},{"key":"10.1016\/j.asoc.2026.115725_bib0210","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1007\/s12559-025-10463-9","article-title":"Contrastive-based removal of negative information in multimodal emotion analysis","volume":"17","author":"Wang","year":"2025","journal-title":"Cogn. Comput."},{"key":"10.1016\/j.asoc.2026.115725_bib0215","doi-asserted-by":"crossref","DOI":"10.1016\/j.array.2025.100445","article-title":"RAFT: robust adversarial fusion transformer for multimodal sentiment analysis","volume":"27","author":"Wang","year":"2025","journal-title":"Array"},{"key":"10.1016\/j.asoc.2026.115725_bib0220","article-title":"Multimodal emotion recognition in conversations: a survey of methods, trends, challenges and prospects","volume":"abs\/2505.20511","author":"Wu","year":"2025","journal-title":"CoRR"},{"key":"10.1016\/j.asoc.2026.115725_bib0225","doi-asserted-by":"crossref","DOI":"10.1016\/j.inffus.2025.103809","article-title":"Integrating audio\u2013visual text generation with contrastive learning for enhanced multimodal emotion analysis","volume":"127","author":"Xiang","year":"2026","journal-title":"Inf. Fusion"},{"key":"10.1016\/j.asoc.2026.115725_bib0230","doi-asserted-by":"crossref","first-page":"1426","DOI":"10.1109\/TAFFC.2020.3005660","article-title":"Adapted dynamic memory network for emotion recognition in conversation","volume":"13","author":"Xing","year":"2022","journal-title":"IEEE Trans. Affect. Comput."},{"key":"10.1016\/j.asoc.2026.115725_bib0235","series-title":"Proceedings of the 17th European Conference of Computer Vision, Tel Aviv, Israel, October 23\u201327","first-page":"328","article-title":"Wave-ViT: unifying wavelet and transformers for visual representation learning","author":"Yao","year":"2022"},{"key":"10.1016\/j.asoc.2026.115725_bib0240","series-title":"Proceedings of the 32nd ACM International Conference on Multimedia","first-page":"4341","article-title":"Multimodal fusion via hypergraph autoencoder and contrastive learning for emotion recognition in conversation","author":"Yi","year":"2024"},{"key":"10.1016\/j.asoc.2026.115725_bib0245","doi-asserted-by":"crossref","first-page":"62","DOI":"10.1109\/MIS.2025.3597120","article-title":"A generative random modality dropout framework for robust multimodal emotion recognition","volume":"40","author":"Zhang","year":"2025","journal-title":"IEEE Intell. Syst."},{"key":"10.1016\/j.asoc.2026.115725_bib0250","series-title":"Proceedings of the 33rd ACM International Conference on Multimedia","article-title":"HeLo: heterogeneous multi-modal fusion with label correlation for emotion distribution learning","author":"Zheng","year":"2025"},{"key":"10.1016\/j.asoc.2026.115725_bib0255","doi-asserted-by":"crossref","first-page":"1358","DOI":"10.1109\/TAFFC.2023.3340924","article-title":"Dynamic confidence-aware multi-modal emotion recognition","volume":"15","author":"Zhu","year":"2024","journal-title":"IEEE Trans. Affect. Comput."},{"key":"10.1016\/j.asoc.2026.115725_bib0260","doi-asserted-by":"crossref","first-page":"2102","DOI":"10.1109\/TAFFC.2025.3554399","article-title":"Multi-modal cross-subject emotion feature alignment and recognition with EEG and eye movements","volume":"16","author":"Zhu","year":"2025","journal-title":"Affective Computing, IEEE Transactions on"},{"key":"10.1016\/j.asoc.2026.115725_bib0265","doi-asserted-by":"crossref","first-page":"56039","DOI":"10.1007\/s11042-023-17347-w","article-title":"Emotion recognition based on brain-like multimodal hierarchical perception","volume":"83","author":"Zhu","year":"2024","journal-title":"Multim. Tools Appl."},{"key":"10.1016\/j.asoc.2026.115725_bib0270","doi-asserted-by":"crossref","DOI":"10.1016\/j.inffus.2025.103268","article-title":"RMER-DT: robust multimodal emotion recognition in conversational contexts based on diffusion and transformers","volume":"123","author":"Zhu","year":"2025","journal-title":"Inf. Fusion"},{"key":"10.1016\/j.asoc.2026.115725_bib0275","series-title":"Proceedings of the 31st ACM International Conference on Multimedia, Ottawa, ON, Canada, 29 October - 3 November","first-page":"5994","article-title":"Multimodal prompt transformer with hybrid contrastive learning for emotion recognition in conversation","author":"Zou","year":"2023"}],"container-title":["Applied Soft Computing"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S1568494626011737?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S1568494626011737?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,7,3]],"date-time":"2026-07-03T05:10:28Z","timestamp":1783055428000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S1568494626011737"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,9]]},"references-count":55,"alternative-id":["S1568494626011737"],"URL":"https:\/\/doi.org\/10.1016\/j.asoc.2026.115725","relation":{},"ISSN":["1568-4946"],"issn-type":[{"value":"1568-4946","type":"print"}],"subject":[],"published":{"date-parts":[[2026,9]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"Cross-modal dynamic fusion and grouped wavelet feature aggregation for multimodal emotion recognition in conversation","name":"articletitle","label":"Article Title"},{"value":"Applied Soft Computing","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.asoc.2026.115725","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Elsevier B.V. All rights are reserved, including those for text and data mining, AI training, and similar technologies.","name":"copyright","label":"Copyright"}],"article-number":"115725"}}