{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,15]],"date-time":"2026-07-15T11:17:23Z","timestamp":1784114243446,"version":"3.55.0"},"reference-count":43,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,7,1]],"date-time":"2026-07-01T00:00:00Z","timestamp":1782864000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,7,1]],"date-time":"2026-07-01T00:00:00Z","timestamp":1782864000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,7,1]],"date-time":"2026-07-01T00:00:00Z","timestamp":1782864000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,7,1]],"date-time":"2026-07-01T00:00:00Z","timestamp":1782864000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,7,1]],"date-time":"2026-07-01T00:00:00Z","timestamp":1782864000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,7,1]],"date-time":"2026-07-01T00:00:00Z","timestamp":1782864000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,7,1]],"date-time":"2026-07-01T00:00:00Z","timestamp":1782864000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["69189338"],"award-info":[{"award-number":["69189338"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Expert Systems with Applications"],"published-print":{"date-parts":[[2026,7]]},"DOI":"10.1016\/j.eswa.2026.132002","type":"journal-article","created":{"date-parts":[[2026,3,14]],"date-time":"2026-03-14T07:49:24Z","timestamp":1773474564000},"page":"132002","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":1,"special_numbering":"C","title":["AMB-DSGDN: Adaptive modality-balanced dynamic semantic graph differential network for multimodal emotion recognition"],"prefix":"10.1016","volume":"319","author":[{"ORCID":"https:\/\/orcid.org\/0009-0001-3941-816X","authenticated-orcid":false,"given":"Yunsheng","family":"Wang","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3270-6238","authenticated-orcid":false,"given":"Yuntao","family":"Shou","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0007-0508-5460","authenticated-orcid":false,"given":"Yilong","family":"Tan","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0002-1487-7877","authenticated-orcid":false,"given":"Wei","family":"Ai","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-9787-2002","authenticated-orcid":false,"given":"Tao","family":"Meng","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-5224-4048","authenticated-orcid":false,"given":"Keqin","family":"Li","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"issue":"3","key":"10.1016\/j.eswa.2026.132002_bib0001","doi-asserted-by":"crossref","first-page":"4908","DOI":"10.1109\/TNNLS.2024.3367940","article-title":"Der-gcn: Dialog and event relation-aware graph convolutional neural network for multimodal dialog emotion recognition","volume":"36","author":"Ai","year":"2024","journal-title":"IEEE Transactions on Neural Networks and Learning Systems"},{"key":"10.1016\/j.eswa.2026.132002_bib0002","series-title":"Proceedings of the AAAI conference on artificial intelligence","first-page":"11418","article-title":"Revisiting multimodal emotion recognition in conversation from the perspective of graph spectrum","volume":"vol. 39","author":"Ai","year":"2025"},{"issue":"4","key":"10.1016\/j.eswa.2026.132002_bib0003","doi-asserted-by":"crossref","first-page":"335","DOI":"10.1007\/s10579-008-9076-6","article-title":"Iemocap: Interactive emotional dyadic motion capture database","volume":"42","author":"Busso","year":"2008","journal-title":"Language Resources and Evaluation"},{"key":"10.1016\/j.eswa.2026.132002_bib0004","series-title":"ICASSP 2024-2024 IEEE international conference on acoustics, speech and signal processing (icassp)","first-page":"76","article-title":"Serc-gcn: speech emotion recognition in conversation using graph convolutional networks","author":"Chandola","year":"2024"},{"key":"10.1016\/j.eswa.2026.132002_bib0005","doi-asserted-by":"crossref","unstructured":"Chen, J., Yang, D., Jiang, Y., Li, M., Wei, J., Hou, X., & Zhang, L. (2024). Efficiency in focus: Layernorm as a catalyst for fine-tuning medical visual language pre-trained models. arXiv preprint arXiv: 2404.16385,.","DOI":"10.1145\/3664647.3680834"},{"key":"10.1016\/j.eswa.2026.132002_bib0006","doi-asserted-by":"crossref","first-page":"110805","DOI":"10.52202\/079017-3518","article-title":"Emotion-llama: Multimodal emotion recognition and reasoning with instruction tuning","volume":"37","author":"Cheng","year":"2024","journal-title":"Advances in Neural Information Processing Systems"},{"key":"10.1016\/j.eswa.2026.132002_bib0007","series-title":"Proceedings of the 18th ACM international conference on multimedia","first-page":"1459","article-title":"Opensmile: The munich versatile and fast open-source audio feature extractor","author":"Eyben","year":"2010"},{"key":"10.1016\/j.eswa.2026.132002_bib0008","series-title":"Proceedings of the 2nd international workshop on multimodal and responsible affective computing","first-page":"116","article-title":"Learning noise-robust joint representation for multimodal emotion recognition under incomplete data scenarios","author":"Fan","year":"2024"},{"key":"10.1016\/j.eswa.2026.132002_bib0009","unstructured":"Farhadipour, A., Ranjbar, H., Chapariniya, M., Vukovic, T., Ebling, S., & Dellwo, V. (2025). Multimodal emotion recognition and sentiment analysis in multi-party conversation contexts. arXiv preprint arXiv: 2503.06805."},{"key":"10.1016\/j.eswa.2026.132002_bib0010","doi-asserted-by":"crossref","DOI":"10.1016\/j.knosys.2024.112876","article-title":"Feature-enhanced multimodal interaction model for emotion recognition in conversation","volume":"309","author":"Fu","year":"2025","journal-title":"Knowledge-Based Systems"},{"key":"10.1016\/j.eswa.2026.132002_bib0011","doi-asserted-by":"crossref","unstructured":"Ghosal, D., Majumder, N., Poria, S., Chhaya, N., & Gelbukh, A. (2019). Dialoguegcn: A graph convolutional neural network for emotion recognition in conversation. arXiv preprint arXiv: 1908.11540.","DOI":"10.18653\/v1\/D19-1015"},{"key":"10.1016\/j.eswa.2026.132002_bib0012","doi-asserted-by":"crossref","DOI":"10.1016\/j.knosys.2024.111969","article-title":"Speaker-aware cognitive network with cross-modal attention for multimodal emotion recognition in conversation","volume":"296","author":"Guo","year":"2024","journal-title":"Knowledge-Based Systems"},{"key":"10.1016\/j.eswa.2026.132002_bib0013","unstructured":"Guo, Z., Jin, T., & Zhao, Z. (2024b). Multimodal prompt learning with missing modalities for sentiment analysis and emotion recognition. arXiv preprint arXiv: 2407.05374."},{"key":"10.1016\/j.eswa.2026.132002_bib0014","series-title":"ICASSP 2022-2022 IEEE international conference on acoustics, speech and signal processing (icassp)","first-page":"7037","article-title":"Mm-dfn: multimodal dynamic fusion network for emotion recognition in conversations","author":"Hu","year":"2022"},{"key":"10.1016\/j.eswa.2026.132002_bib0015","unstructured":"Hu, J., Liu, Y., Zhao, J., & Jin, Q. (2021). Mmgcn: Multimodal fusion via deep graph convolution network for emotion recognition in conversation. arXiv preprint arXiv: 2107.06779."},{"key":"10.1016\/j.eswa.2026.132002_bib0016","series-title":"Proceedings of the IEEE conference on computer vision and pattern recognition","first-page":"4700","article-title":"Densely connected convolutional networks","author":"Huang","year":"2017"},{"key":"10.1016\/j.eswa.2026.132002_bib0017","doi-asserted-by":"crossref","unstructured":"Joshi, A., Bhat, A., Jain, A., Singh, A. V., & Modi, A. (2022). Cogmen: Contextualized gnn based multimodal emotion recognition. arXiv preprint arXiv: 2205.02455.","DOI":"10.18653\/v1\/2022.naacl-main.306"},{"key":"10.1016\/j.eswa.2026.132002_bib0018","series-title":"2024\u202fIEEE international conference on medical artificial intelligence (medAI)","first-page":"294","article-title":"Emotional EEG recognition and classification based on GCN combined with LSTM","author":"Kong","year":"2024"},{"key":"10.1016\/j.eswa.2026.132002_bib0019","doi-asserted-by":"crossref","first-page":"77","DOI":"10.1109\/TMM.2023.3260635","article-title":"GraphCFC: A directed graph based cross-modal feature complementation approach for multimodal conversational emotion recognition","volume":"26","author":"Li","year":"2023","journal-title":"IEEE Transactions on Multimedia"},{"issue":"10","key":"10.1016\/j.eswa.2026.132002_bib0020","doi-asserted-by":"crossref","first-page":"1440","DOI":"10.3390\/e25101440","article-title":"A survey of deep learning-based multimodal emotion recognition: speech, text, and face","volume":"25","author":"Lian","year":"2023","journal-title":"Entropy"},{"key":"10.1016\/j.eswa.2026.132002_bib0021","unstructured":"Lian, Z., Chen, H., Chen, L., Sun, H., Sun, L., Ren, Y., Cheng, Z., Liu, B., Liu, R., Peng, X. et al. (2025). Affectgpt: A new dataset, model, and benchmark for emotion understanding with multimodal large language models. arXiv preprint arXiv: 2501.16566."},{"key":"10.1016\/j.eswa.2026.132002_bib0022","series-title":"Proceedings of the 2nd international workshop on multimodal and responsible affective computing","first-page":"41","article-title":"Mer 2024: Semi-supervised learning, noise robustness, and open-vocabulary multimodal emotion recognition","author":"Lian","year":"2024"},{"key":"10.1016\/j.eswa.2026.132002_bib0023","unstructured":"Lian, Z., Sun, L., Ren, Y., Gu, H., Sun, H., Chen, L., Liu, B., & Tao, J. (2024b). Merbench: A unified evaluation benchmark for multimodal emotion recognition. arXiv preprint arXiv: 2401.03429."},{"key":"10.1016\/j.eswa.2026.132002_bib0024","unstructured":"Liu, Y., Ott, M., Goyal, N., Du, J., Joshi, M., Chen, D., Levy, O., Lewis, M., Zettlemoyer, L., & Stoyanov, V. (2019). Roberta: A robustly optimized bert pretraining approach. arXiv preprint arXiv: 1907.11692."},{"key":"10.1016\/j.eswa.2026.132002_bib0025","first-page":"1","article-title":"Noise-resistant multimodal transformer for emotion recognition","volume":"133","author":"Liu","year":"2024","journal-title":"International Journal of Computer Vision"},{"key":"10.1016\/j.eswa.2026.132002_bib0026","doi-asserted-by":"crossref","first-page":"776","DOI":"10.1109\/TMM.2023.3271019","article-title":"A transformer-based model with self-distillation for multimodal emotion recognition in conversations","volume":"26","author":"Ma","year":"2024","journal-title":"IEEE Transactions on Multimedia"},{"key":"10.1016\/j.eswa.2026.132002_bib0027","series-title":"Proceedings of the AAAI conference on artificial intelligence","first-page":"6818","article-title":"Dialoguernn: An attentive rnn for emotion detection in conversations","volume":"vol. 33","author":"Majumder","year":"2019"},{"key":"10.1016\/j.eswa.2026.132002_bib0028","series-title":"Proceedings of the 6th international conference on bio-engineering for smart technologies (bioSMART)","first-page":"1","article-title":"Multimodal emotion recognition for conversational systems in continuous affective space","author":"Mehrez","year":"2025"},{"key":"10.1016\/j.eswa.2026.132002_bib0029","doi-asserted-by":"crossref","unstructured":"Poria, S., Hazarika, D., Majumder, N., Naik, G., Cambria, E., & Mihalcea, R. (2018). Meld: A multimodal multi-party dataset for emotion recognition in conversations. arXiv preprint arXiv: 1810.02508.","DOI":"10.18653\/v1\/P19-1050"},{"issue":"8","key":"10.1016\/j.eswa.2026.132002_bib0030","doi-asserted-by":"crossref","first-page":"4655","DOI":"10.1007\/s11042-024-18943-0","article-title":"Optimized recurrent neural network based brain emotion recognition technique","volume":"84","author":"Reddy","year":"2025","journal-title":"Multimedia Tools and Applications"},{"key":"10.1016\/j.eswa.2026.132002_bib0031","series-title":"Proceedings of the 61st annual meeting of the association for computational linguistics (volume 1: Long papers)","first-page":"14752","article-title":"MultiEMO: An attention-based correlation-aware multimodal fusion framework for emotion recognition in conversations","author":"Shi","year":"2023"},{"key":"10.1016\/j.eswa.2026.132002_bib0032","unstructured":"Shou, Y., Meng, T., Ai, W., & Li, K. (2024). Dynamic graph neural ode network for multi-modal emotion recognition in conversation. arXiv preprint arXiv: 2412.02935."},{"key":"10.1016\/j.eswa.2026.132002_bib0033","doi-asserted-by":"crossref","first-page":"9036","DOI":"10.1109\/TMM.2024.3385180","article-title":"Muti-modal emotion recognition via hierarchical knowledge distillation","volume":"26","author":"Sun","year":"2024","journal-title":"IEEE Transactions on Multimedia"},{"key":"10.1016\/j.eswa.2026.132002_bib0034","first-page":"1","article-title":"DialogueMLLM: Transforming multimodal emotion recognition in conversation through instruction-tuned MLLM","volume":"13","author":"Sun","year":"2025","journal-title":"IEEE Access"},{"key":"10.1016\/j.eswa.2026.132002_bib0035","series-title":"Proceedings of the 32nd ACM international conference on multimedia","first-page":"9621","article-title":"Multimodal emotion recognition calibration in conversations","author":"Tu","year":"2024"},{"key":"10.1016\/j.eswa.2026.132002_bib0036","unstructured":"Wang, H., Yang, W., Zhong, X., Zhou, J., Liu, F., & Zhang, W. (2025). Mitigating modality quantity and quality imbalance in multimodal online federated learning. arXiv preprint arXiv: 2508.11159."},{"key":"10.1016\/j.eswa.2026.132002_bib0037","doi-asserted-by":"crossref","first-page":"712","DOI":"10.1109\/TAFFC.2024.3461148","article-title":"Dynamic emotion-dependent network with relational subgraph interaction for multimodal emotion recognition","volume":"16","author":"Wang","year":"2024","journal-title":"IEEE Transactions on Affective Computing"},{"key":"10.1016\/j.eswa.2026.132002_bib0038","series-title":"Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition","first-page":"27338","article-title":"Enhancing multimodal cooperation via sample-level modality valuation","author":"Wei","year":"2024"},{"key":"10.1016\/j.eswa.2026.132002_bib0039","doi-asserted-by":"crossref","unstructured":"Wu, C., Cai, Y., Liu, Y., Zhu, P., Xue, Y., Gong, Z., Hirschberg, J., & Ma, B. (2025a). Multimodal emotion recognition in conversations: A survey of methods, trends, challenges and prospects. arXiv preprint arXiv: 2505.20511.","DOI":"10.18653\/v1\/2025.findings-emnlp.332"},{"issue":"1","key":"10.1016\/j.eswa.2026.132002_bib0040","doi-asserted-by":"crossref","first-page":"8855","DOI":"10.1038\/s41598-025-89758-8","article-title":"Multi-modal emotion recognition in conversation based on prompt learning with text-audio fusion features","volume":"15","author":"Wu","year":"2025","journal-title":"Scientific Reports"},{"key":"10.1016\/j.eswa.2026.132002_bib0041","series-title":"ICASSP 2024-2024 IEEE international conference on acoustics, speech and signal processing (icassp)","first-page":"10246","article-title":"Rl-emo: A reinforcement learning framework for multimodal emotion recognition","author":"Zhang","year":"2024"},{"key":"10.1016\/j.eswa.2026.132002_bib0042","series-title":"ICASSP 2025-2025 IEEE international conference on acoustics, speech and signal processing (icassp)","first-page":"1","article-title":"Enhanced multimodal emotion recognition in conversations via contextual filtering and multi-frequency graph propagation","author":"Zhao","year":"2025"},{"issue":"1","key":"10.1016\/j.eswa.2026.132002_bib0043","article-title":"Cross-modal gated feature enhancement for multimodal emotion recognition in conversations","volume":"15","author":"Zhao","year":"2025","journal-title":"Scientific Reports"}],"container-title":["Expert Systems with Applications"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0957417426009152?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0957417426009152?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,6,9]],"date-time":"2026-06-09T02:57:07Z","timestamp":1780973827000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0957417426009152"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,7]]},"references-count":43,"alternative-id":["S0957417426009152"],"URL":"https:\/\/doi.org\/10.1016\/j.eswa.2026.132002","relation":{},"ISSN":["0957-4174"],"issn-type":[{"value":"0957-4174","type":"print"}],"subject":[],"published":{"date-parts":[[2026,7]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"AMB-DSGDN: Adaptive modality-balanced dynamic semantic graph differential network for multimodal emotion recognition","name":"articletitle","label":"Article Title"},{"value":"Expert Systems with Applications","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.eswa.2026.132002","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Elsevier Ltd. All rights are reserved, including those for text and data mining, AI training, and similar technologies.","name":"copyright","label":"Copyright"}],"article-number":"132002"}}