{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,3]],"date-time":"2026-07-03T17:25:30Z","timestamp":1783099530160,"version":"3.54.6"},"reference-count":49,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/501100002383","name":"King Saud University","doi-asserted-by":"publisher","award":["ORF-2026-34"],"award-info":[{"award-number":["ORF-2026-34"]}],"id":[{"id":"10.13039\/501100002383","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Pattern Recognition"],"published-print":{"date-parts":[[2026,12]]},"DOI":"10.1016\/j.patcog.2026.114157","type":"journal-article","created":{"date-parts":[[2026,6,5]],"date-time":"2026-06-05T06:35:06Z","timestamp":1780641306000},"page":"114157","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"PB","title":["Quantum-driven attention and relation-aware distillation for multi-modal emotion recognition in conversations"],"prefix":"10.1016","volume":"180","author":[{"given":"Xu","family":"Xu","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-9781-3969","authenticated-orcid":false,"given":"Ghulam","family":"Muhammad","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.patcog.2026.114157_b1","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2024.111340","article-title":"FrameERC: Framelet transform based multimodal graph neural networks for emotion recognition in conversation","volume":"161","author":"Li","year":"2025","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.patcog.2026.114157_b2","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2026.113087","article-title":"Is multimodal conversational emotion recognition satisfactory? exploring the gaps in performance, generalization, and confidence","author":"Tu","year":"2026","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.patcog.2026.114157_b3","article-title":"Speaker-independent speech emotion recognition using group sparse-based adversarial local Fisher discriminant analysis","author":"Lu","year":"2026","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.patcog.2026.114157_b4","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2025.111870","article-title":"Towards robust sentiment analysis with multimodal interaction graph and hybrid contrastive learning","volume":"169","author":"Gong","year":"2026","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.patcog.2026.114157_b5","article-title":"CMTNet: A collaborative mamba-transformer network with spatial-temporal cross-fusion for speech emotion recognition","author":"Dong","year":"2026","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.patcog.2026.114157_b6","article-title":"A systematic review of interpretability and explainability for speech emotion features in automatic speech emotion recognition","author":"Jayasinghe","year":"2025","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.patcog.2026.114157_b7","first-page":"13492","article-title":"BERT-ERC: Fine-tuning bert is enough for emotion recognition in conversation","volume":"vol. 37","author":"Qin","year":"2023"},{"issue":"3","key":"10.1016\/j.patcog.2026.114157_b8","doi-asserted-by":"crossref","first-page":"1711","DOI":"10.1109\/TAFFC.2024.3369726","article-title":"Vesper: A compact and effective pretrained model for speech emotion recognition","volume":"15","author":"Chen","year":"2024","journal-title":"IEEE Trans. Affect. Comput."},{"issue":"8","key":"10.1016\/j.patcog.2026.114157_b9","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1145\/3643133","article-title":"Understanding the performance of ai algorithms in text-based emotion detection for conversational agents","volume":"23","author":"Kusal","year":"2024","journal-title":"ACM Trans. Asian Low-Resource Lang. Inf. Process."},{"key":"10.1016\/j.patcog.2026.114157_b10","series-title":"Proceedings of the International Conference on Multimedia Modeling","first-page":"454","article-title":"TS-MEFM: A new multimodal speech emotion recognition network based on speech and text fusion","author":"Wei","year":"2025"},{"key":"10.1016\/j.patcog.2026.114157_b11","doi-asserted-by":"crossref","DOI":"10.1016\/j.knosys.2024.112900","article-title":"LECM: A model leveraging emotion cause to improve real-time emotion recognition in conversations","volume":"309","author":"Lu","year":"2025","journal-title":"Knowl.-Based Syst."},{"key":"10.1016\/j.patcog.2026.114157_b12","doi-asserted-by":"crossref","first-page":"4361","DOI":"10.1109\/TMM.2025.3535347","article-title":"Identity and modality attributes driven multimodal fusion networks for emotion recognition in conversations","volume":"27","author":"Shi","year":"2025","journal-title":"IEEE Trans. Multimed."},{"issue":"4","key":"10.1016\/j.patcog.2026.114157_b13","doi-asserted-by":"crossref","first-page":"3523","DOI":"10.1109\/TAFFC.2025.3605133","article-title":"Hypercomplex neural network and cross-modal attention for multi-modal emotion recognition using physiological signals","volume":"16","author":"Xu","year":"2025","journal-title":"IEEE Trans. Affect. Comput."},{"key":"10.1016\/j.patcog.2026.114157_b14","doi-asserted-by":"crossref","DOI":"10.1016\/j.engappai.2026.114192","article-title":"Quantum-driven neural network with masked self-attention for multi-modal driving fatigue detection","volume":"171","author":"Xu","year":"2026","journal-title":"Eng. Appl. Artif. Intell."},{"issue":"12","key":"10.1016\/j.patcog.2026.114157_b15","doi-asserted-by":"crossref","first-page":"10184","DOI":"10.1109\/TPAMI.2024.3434974","article-title":"QKSAN: A quantum kernel self-attention network","volume":"46","author":"Zhao","year":"2024","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.patcog.2026.114157_b16","doi-asserted-by":"crossref","DOI":"10.1016\/j.neucom.2024.128658","article-title":"QSIM: a quantum-inspired hierarchical semantic interaction model for text classification","volume":"611","author":"Gao","year":"2025","journal-title":"Neurocomputing"},{"key":"10.1016\/j.patcog.2026.114157_b17","series-title":"Proceedings of the ICASSP 2025-2025 IEEE International Conference on Acoustics, Speech and Signal Processing","first-page":"1","article-title":"Emotional knowledge self-distillation in dialogue","author":"Jian","year":"2025"},{"key":"10.1016\/j.patcog.2026.114157_b18","doi-asserted-by":"crossref","first-page":"4643","DOI":"10.1109\/TMM.2025.3535344","article-title":"DISD-Net: A dynamic interactive network with self-distillation for cross-subject multi-modal emotion recognition","volume":"27","author":"Cheng","year":"2025","journal-title":"IEEE Trans. Multimed."},{"key":"10.1016\/j.patcog.2026.114157_b19","doi-asserted-by":"crossref","first-page":"335","DOI":"10.1007\/s10579-008-9076-6","article-title":"IEMOCAP: Interactive emotional dyadic motion capture database","volume":"42","author":"Busso","year":"2008","journal-title":"Lang. Resour. Eval."},{"key":"10.1016\/j.patcog.2026.114157_b20","series-title":"MELD: A multimodal multi-party dataset for emotion recognition in conversations","author":"Poria","year":"2018"},{"key":"10.1016\/j.patcog.2026.114157_b21","article-title":"EEG-based multimodal emotion recognition: Recent progress, challenges, and future directions","author":"Muhammad","year":"2025","journal-title":"ACM Trans. Multimed. Comput. Commun. Appl."},{"key":"10.1016\/j.patcog.2026.114157_b22","first-page":"1","article-title":"Graph attention network with collaborative learning for conversational emotion recognition","author":"Xu","year":"2025","journal-title":"IEEE Trans. Comput. Soc. Syst."},{"issue":"5","key":"10.1016\/j.patcog.2026.114157_b23","doi-asserted-by":"crossref","first-page":"699","DOI":"10.1109\/TAI.2022.3149234","article-title":"Context-and sentiment-aware networks for emotion recognition in conversation","volume":"3","author":"Tu","year":"2022","journal-title":"IEEE Trans. Artif. Intell."},{"key":"10.1016\/j.patcog.2026.114157_b24","series-title":"Proceedings of the 2nd Conference of the Asia-Pacific Chapter of the Association for Computational Linguistics and the 12th International Joint Conference on Natural Language Processing (Volume 1: Long Papers)","first-page":"148","article-title":"S+PAGE: A speaker and position-aware graph neural network model for emotion recognition in conversation","author":"Liang","year":"2022"},{"issue":"4","key":"10.1016\/j.patcog.2026.114157_b25","doi-asserted-by":"crossref","first-page":"3269","DOI":"10.1109\/TAFFC.2023.3243463","article-title":"Cluster-level contrastive learning for emotion recognition in conversations","volume":"14","author":"Yang","year":"2023","journal-title":"IEEE Trans. Affect. Comput."},{"issue":"3","key":"10.1016\/j.patcog.2026.114157_b26","doi-asserted-by":"crossref","first-page":"1567","DOI":"10.1109\/TAFFC.2024.3360979","article-title":"Emotion recognition in conversation based on a dynamic complementary graph convolutional network","volume":"15","author":"Yang","year":"2024","journal-title":"IEEE Trans. Affect. Comput."},{"key":"10.1016\/j.patcog.2026.114157_b27","series-title":"ICASSP 2022-2022 IEEE International Conference on Acoustics, Speech and Signal Processing","first-page":"7037","article-title":"MM-DFN: Multimodal dynamic fusion network for emotion recognition in conversations","author":"Hu","year":"2022"},{"key":"10.1016\/j.patcog.2026.114157_b28","doi-asserted-by":"crossref","first-page":"776","DOI":"10.1109\/TMM.2023.3271019","article-title":"A Transformer-based model with self-distillation for multimodal emotion recognition in conversations","volume":"26","author":"Ma","year":"2024","journal-title":"IEEE Trans. Multimed."},{"issue":"3","key":"10.1016\/j.patcog.2026.114157_b29","doi-asserted-by":"crossref","first-page":"4908","DOI":"10.1109\/TNNLS.2024.3367940","article-title":"DER-GCN: Dialog and event relation-aware graph convolutional neural network for multimodal dialog emotion recognition","volume":"36","author":"Ai","year":"2025","journal-title":"IEEE Trans. Neural Netw. Learn. Syst."},{"issue":"01","key":"10.1016\/j.patcog.2026.114157_b30","first-page":"1","article-title":"Contrastive learning based modality-invariant feature acquisition for robust multimodal emotion recognition with missing modalities","author":"Liu","year":"2024","journal-title":"IEEE Trans. Affect. Comput."},{"key":"10.1016\/j.patcog.2026.114157_b31","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2025.111630","article-title":"Advancing evolution characterization in dynamic networks: A quantum walk and thermodynamics perspective","volume":"165","author":"Pan","year":"2025","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.patcog.2026.114157_b32","doi-asserted-by":"crossref","DOI":"10.1016\/j.knosys.2021.107557","article-title":"Quantum probability-inspired graph attention network for modeling complex text interaction","volume":"234","author":"Yan","year":"2021","journal-title":"Knowl.-Based Syst."},{"key":"10.1016\/j.patcog.2026.114157_b33","series-title":"Proceedings of the 2021 IEEE 33rd International Conference on Tools with Artificial Intelligence","first-page":"943","article-title":"Quantum-inspired hierarchical attention mechanism for question answering","author":"Guo","year":"2021"},{"key":"10.1016\/j.patcog.2026.114157_b34","series-title":"Findings of the Association for Computational Linguistics: ACL 2023","first-page":"12191","article-title":"QAP: A quantum-inspired adaptive-priority-learning model for multimodal emotion recognition","author":"Li","year":"2023"},{"issue":"10","key":"10.1016\/j.patcog.2026.114157_b35","doi-asserted-by":"crossref","first-page":"5973","DOI":"10.1109\/TCYB.2024.3398692","article-title":"Pretrained quantum-inspired deep neural network for natural language processing","volume":"54","author":"Shi","year":"2024","journal-title":"IEEE Trans. Cybern."},{"key":"10.1016\/j.patcog.2026.114157_b36","article-title":"Language-dominated fusion and self-distillation for multimodal sentiment analysis with incomplete modalities","author":"Shi","year":"2025","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.patcog.2026.114157_b37","series-title":"Proceedings of the ICASSP 2023-2023 IEEE International Conference on Acoustics, Speech and Signal Processing","first-page":"1","article-title":"Fast yet effective speech emotion recognition with self-distillation","author":"Ren","year":"2023"},{"key":"10.1016\/j.patcog.2026.114157_b38","doi-asserted-by":"crossref","DOI":"10.1016\/j.knosys.2024.111724","article-title":"Multi-grained fusion network with self-distillation for aspect-based multimodal sentiment analysis","volume":"293","author":"Yang","year":"2024","journal-title":"Knowl.-Based Syst."},{"issue":"3","key":"10.1016\/j.patcog.2026.114157_b39","doi-asserted-by":"crossref","first-page":"2474","DOI":"10.1109\/TETCI.2024.3449926","article-title":"Distillation-based domain generalization for cross-dataset EEG-Based emotion recognition","volume":"9","author":"Li","year":"2025","journal-title":"IEEE Trans. Emerg. Top. Comput. Intell."},{"key":"10.1016\/j.patcog.2026.114157_b40","doi-asserted-by":"crossref","DOI":"10.1016\/j.asoc.2024.111762","article-title":"A gradual self distillation network with adaptive channel attention for facial expression recognition","volume":"161","author":"Zhang","year":"2024","journal-title":"Appl. Soft Comput."},{"key":"10.1016\/j.patcog.2026.114157_b41","article-title":"Attention is all you need","volume":"30","author":"Vaswani","year":"2017","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.patcog.2026.114157_b42","first-page":"2122","article-title":"Conversational memory network for emotion recognition in dyadic dialogue videos","volume":"vol. 2018","author":"Hazarika","year":"2018"},{"key":"10.1016\/j.patcog.2026.114157_b43","doi-asserted-by":"crossref","unstructured":"D. Hazarika, S. Poria, R. Mihalcea, E. Cambria, R. Zimmermann, ICON: Interactive conversational memory network for multimodal emotion detection, in: Proceedings of the 2018 Conference on Empirical Methods in Natural Language Processing, 2018, pp. 2594\u20132604.","DOI":"10.18653\/v1\/D18-1280"},{"key":"10.1016\/j.patcog.2026.114157_b44","first-page":"6818","article-title":"DialogueRNN: An attentive rnn for emotion detection in conversations","volume":"vol. 33","author":"Majumder","year":"2019"},{"key":"10.1016\/j.patcog.2026.114157_b45","series-title":"Proceedings of the 59th Annual Meeting of the Association for Computational Linguistics and the 11th International Joint Conference on Natural Language Processing (Volume 1: Long Papers)","article-title":"MMGCN: Multimodal fusion via deep graph convolution network for emotion recognition in conversation","author":"Hu","year":"2021"},{"key":"10.1016\/j.patcog.2026.114157_b46","series-title":"Findings of the Association for Computational Linguistics: EMNLP 2021","article-title":"DialogueTRM: Exploring multi-modal emotional dynamics in a conversation","author":"Mao","year":"2021"},{"key":"10.1016\/j.patcog.2026.114157_b47","doi-asserted-by":"crossref","DOI":"10.1016\/j.knosys.2022.109978","article-title":"Improving multimodal fusion with main modal transformer for emotion recognition in conversation","volume":"258","author":"Zou","year":"2022","journal-title":"Knowl.-Based Syst."},{"key":"10.1016\/j.patcog.2026.114157_b48","unstructured":"D.P. Kingma, J. Ba, Adam: A method for stochastic optimization, in: Proceedings of the 3rd International Conference on Learning Representations, ICLR 2015, San Diego, CA, USA, May 7-9, 2015, Conference Track Proceedings, 2015."},{"key":"10.1016\/j.patcog.2026.114157_b49","doi-asserted-by":"crossref","DOI":"10.1016\/j.inffus.2025.103028","article-title":"MSF-Net: Multi-stage fusion network for emotion recognition from multimodal signals in scalable healthcare","volume":"119","author":"Islam","year":"2025","journal-title":"Inf. Fusion"}],"container-title":["Pattern Recognition"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0031320326011222?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0031320326011222?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,7,3]],"date-time":"2026-07-03T17:10:23Z","timestamp":1783098623000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0031320326011222"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,12]]},"references-count":49,"alternative-id":["S0031320326011222"],"URL":"https:\/\/doi.org\/10.1016\/j.patcog.2026.114157","relation":{},"ISSN":["0031-3203"],"issn-type":[{"value":"0031-3203","type":"print"}],"subject":[],"published":{"date-parts":[[2026,12]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"Quantum-driven attention and relation-aware distillation for multi-modal emotion recognition in conversations","name":"articletitle","label":"Article Title"},{"value":"Pattern Recognition","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.patcog.2026.114157","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Elsevier Ltd. All rights are reserved, including those for text and data mining, AI training, and similar technologies.","name":"copyright","label":"Copyright"}],"article-number":"114157"}}