{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,21]],"date-time":"2026-04-21T12:38:50Z","timestamp":1776775130181,"version":"3.51.2"},"reference-count":54,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/100031935","name":"Xi'an Jiaotong University","doi-asserted-by":"publisher","award":["HMHAI-202407"],"award-info":[{"award-number":["HMHAI-202407"]}],"id":[{"id":"10.13039\/100031935","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62476178"],"award-info":[{"award-number":["62476178"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100004826","name":"Natural Science Foundation of Beijing Municipality","doi-asserted-by":"publisher","award":["4242034"],"award-info":[{"award-number":["4242034"]}],"id":[{"id":"10.13039\/501100004826","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100004826","name":"Natural Science Foundation of Beijing Municipality","doi-asserted-by":"publisher","award":["L252009"],"award-info":[{"award-number":["L252009"]}],"id":[{"id":"10.13039\/501100004826","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Neurocomputing"],"published-print":{"date-parts":[[2026,6]]},"DOI":"10.1016\/j.neucom.2026.133494","type":"journal-article","created":{"date-parts":[[2026,4,3]],"date-time":"2026-04-03T01:55:24Z","timestamp":1775181324000},"page":"133494","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"C","title":["Multimodal sentiment analysis with query-based distillation and asymmetric fusion"],"prefix":"10.1016","volume":"683","author":[{"ORCID":"https:\/\/orcid.org\/0009-0001-2014-2204","authenticated-orcid":false,"given":"Han","family":"Zhang","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yuanyuan","family":"Shang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Tie","family":"Liu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-2334-3623","authenticated-orcid":false,"given":"Wei","family":"Song","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jingyi","family":"Liu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"78","reference":[{"issue":"13s","key":"10.1016\/j.neucom.2026.133494_bib0005","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1145\/3586075","article-title":"Multimodal sentiment analysis: a survey of methods, trends, and challenges","volume":"55","author":"Das","year":"2023","journal-title":"ACM Comput. Surv."},{"issue":"1\u20132","key":"10.1016\/j.neucom.2026.133494_bib0010","doi-asserted-by":"crossref","first-page":"55","DOI":"10.1016\/S1071-5819(03)00052-1","article-title":"Affective computing: challenges","volume":"59","author":"Picard","year":"2003","journal-title":"Int. J. Hum.-Comput. Stud."},{"key":"10.1016\/j.neucom.2026.133494_bib0015","author":"Zadeh"},{"key":"10.1016\/j.neucom.2026.133494_bib0020","series-title":"Proceedings of the 28th ACM International Conference on Multimedia","first-page":"1122","article-title":"MISA: Modality-Invariant and -specific representations for multimodal sentiment analysis","author":"Hazarika","year":"2020"},{"key":"10.1016\/j.neucom.2026.133494_bib0025","series-title":"Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics","first-page":"6558","article-title":"Multimodal transformer for unaligned multimodal language sequences","author":"Tsai","year":"2019"},{"key":"10.1016\/j.neucom.2026.133494_bib0030","author":"Jiang"},{"issue":"23","key":"10.1016\/j.neucom.2026.133494_bib0035","doi-asserted-by":"crossref","first-page":"63379","DOI":"10.1007\/s11042-023-18079-7","article-title":"A depression detection model based on multimodal graph neural network","volume":"83","author":"Xia","year":"2024","journal-title":"Multimed. Tools Appl."},{"key":"10.1016\/j.neucom.2026.133494_bib0040","author":"Ye"},{"key":"10.1016\/j.neucom.2026.133494_bib0045","doi-asserted-by":"crossref","DOI":"10.1016\/j.bspc.2025.108113","article-title":"Cfgmamba: cross frame group mamba for video-based depression recognition","volume":"110","author":"Liu","year":"2025","journal-title":"Biomed. Signal Process. Control"},{"key":"10.1016\/j.neucom.2026.133494_bib0050","doi-asserted-by":"crossref","first-page":"424","DOI":"10.1016\/j.inffus.2022.09.025","article-title":"Multimodal sentiment analysis: a systematic review of history, datasets, multimodal fusion methods, applications, challenges and future directions","volume":"91","author":"Gandhi","year":"2023","journal-title":"Inf. Fusion"},{"issue":"4","key":"10.1016\/j.neucom.2026.133494_bib0055","doi-asserted-by":"crossref","first-page":"2776","DOI":"10.1109\/TAFFC.2022.3233070","article-title":"TensorFormer: a Tensor-Based multimodal transformer for multimodal sentiment analysis and depression detection","volume":"14","author":"Sun","year":"2023","journal-title":"IEEE Trans. Affect. Comput."},{"key":"10.1016\/j.neucom.2026.133494_bib0060","author":"Jaegle"},{"key":"10.1016\/j.neucom.2026.133494_bib0065","series-title":"International Conference on Affective Computing and Intelligent Interaction","first-page":"981","article-title":"Affective computing: a review","author":"Tao","year":"2005"},{"issue":"6","key":"10.1016\/j.neucom.2026.133494_bib0070","doi-asserted-by":"crossref","first-page":"345","DOI":"10.1007\/s00530-010-0182-0","article-title":"Multimodal fusion for multimedia analysis: a survey","volume":"16","author":"Atrey","year":"2010","journal-title":"Multimed. Syst."},{"key":"10.1016\/j.neucom.2026.133494_bib0075","author":"Liu"},{"issue":"1","key":"10.1016\/j.neucom.2026.133494_bib0080","article-title":"Memory fusion network for multi-view sequential learning","volume":"32","author":"Zadeh","year":"2018","journal-title":"Proc. AAAI Conf. Artif. Intell."},{"issue":"10","key":"10.1016\/j.neucom.2026.133494_bib0085","doi-asserted-by":"crossref","first-page":"18523","DOI":"10.3934\/mbe.2023822","article-title":"AB-GRU: an attention-based bidirectional GRU model for multimodal sentiment fusion and analysis","volume":"20","author":"Wu","year":"2023","journal-title":"Math. Biosci. Eng."},{"issue":"4","key":"10.1016\/j.neucom.2026.133494_bib0090","doi-asserted-by":"crossref","first-page":"1568","DOI":"10.1109\/TCSS.2023.3263128","article-title":"Depression detection from social networks data based on machine learning and deep learning techniques: an interrogative survey","volume":"10","author":"Hasib","year":"2023","journal-title":"IEEE Trans. Comput. Soc. Syst."},{"key":"10.1016\/j.neucom.2026.133494_bib0095","series-title":"Proceedings of the 9th International on Audio\/Visual Emotion Challenge and Workshop","first-page":"65","article-title":"A Multi-Modal hierarchical recurrent neural network for depression detection","author":"Yin","year":"2019"},{"key":"10.1016\/j.neucom.2026.133494_bib0100","series-title":"Proceedings of the 9th International on Audio\/Visual Emotion Challenge and Workshop","first-page":"73","article-title":"Multi-modality depression detection via multi-scale temporal dilated CNNs","author":"Fan","year":"2019"},{"key":"10.1016\/j.neucom.2026.133494_bib0105","author":"Dosovitskiy"},{"key":"10.1016\/j.neucom.2026.133494_bib0110","author":"Han"},{"issue":"4","key":"10.1016\/j.neucom.2026.133494_bib0115","doi-asserted-by":"crossref","first-page":"196","DOI":"10.1007\/s40747-025-01806-y","article-title":"H 2 can: heterogeneous hypergraph attention network with counterfactual learning for multimodal sentiment analysis","volume":"11","author":"Huang","year":"2025","journal-title":"Complex Intell. Syst."},{"key":"10.1016\/j.neucom.2026.133494_bib0120","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2022.109259","article-title":"Tetfn: a text enhanced transformer fusion network for multimodal sentiment analysis","volume":"136","author":"Wang","year":"2023","journal-title":"Pattern Recognit."},{"issue":"2","key":"10.1016\/j.neucom.2026.133494_bib0125","doi-asserted-by":"crossref","first-page":"549","DOI":"10.1109\/TAFFC.2023.3282410","article-title":"Multi-task momentum distillation for multimodal sentiment analysis","volume":"15","author":"Lin","year":"2023","journal-title":"IEEE Trans. Affect. Comput."},{"key":"10.1016\/j.neucom.2026.133494_bib0130","doi-asserted-by":"crossref","DOI":"10.1016\/j.knosys.2023.111346","article-title":"Tmbl: transformer-based multimodal binding learning model for multimodal sentiment analysis","volume":"285","author":"Huang","year":"2024","journal-title":"Knowl.-based Syst."},{"key":"10.1016\/j.neucom.2026.133494_bib0135","doi-asserted-by":"crossref","DOI":"10.1016\/j.neucom.2023.127201","article-title":"Hybrid cross-modal interaction learning for multimodal sentiment analysis","volume":"571","author":"Fu","year":"2024","journal-title":"Neurocomputing"},{"key":"10.1016\/j.neucom.2026.133494_bib0140","first-page":"1","article-title":"Decoupled multi-perspective fusion for speech depression detection","author":"Zhao","year":"2025","journal-title":"IEEE Trans. Affect. Comput."},{"key":"10.1016\/j.neucom.2026.133494_bib0145","series-title":"Proceedings of the 9th International on Audio\/Visual Emotion Challenge and Workshop","first-page":"55","article-title":"Multimodal fusion of BERT-CNN and gated CNN representations for depression detection","author":"Rodrigues Makiuchi","year":"2019"},{"key":"10.1016\/j.neucom.2026.133494_bib0150","series-title":"Proceedings of the 30th ACM International Conference on Multimedia","first-page":"3722","article-title":"CubeMLP: an MLP-based model for multimodal sentiment analysis and depression estimation","author":"Sun","year":"2022"},{"key":"10.1016\/j.neucom.2026.133494_bib0155","first-page":"1","article-title":"Multimodal sentiment analysis with mutual information-based disentangled representation learning","author":"Sun","year":"2025","journal-title":"IEEE Trans. Affect. Comput."},{"key":"10.1016\/j.neucom.2026.133494_bib0160","doi-asserted-by":"crossref","first-page":"23716","DOI":"10.52202\/068431-1723","article-title":"Flamingo: a visual language model for Few-Shot learning","volume":"35","author":"Alayrac","year":"2022","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.neucom.2026.133494_bib0165","series-title":"Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing","first-page":"756","article-title":"Learning language-guided adaptive hyper-modality representation for multimodal sentiment analysis","author":"Zhang","year":"2023"},{"key":"10.1016\/j.neucom.2026.133494_bib0170","series-title":"Proceedings of the AAAI Conference on Artificial Intelligence","first-page":"21180","article-title":"Dlf: disentangled-language-focused multimodal sentiment analysis","volume":"vol. 39","author":"Wang","year":"2025"},{"key":"10.1016\/j.neucom.2026.133494_bib0175","author":"Liu"},{"key":"10.1016\/j.neucom.2026.133494_bib0180","first-page":"24206","article-title":"VATT: transformers for multimodal Self-Supervised learning from raw video, audio and text","volume":"34","author":"Akbari","year":"2021","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.neucom.2026.133494_bib0185","doi-asserted-by":"crossref","DOI":"10.1016\/j.inffus.2025.103268","article-title":"Rmer-dt: robust multimodal emotion recognition in conversational contexts based on diffusion and transformers","author":"Zhu","year":"2025","journal-title":"Inf. Fusion"},{"issue":"5","key":"10.1016\/j.neucom.2026.133494_bib0190","doi-asserted-by":"crossref","first-page":"62","DOI":"10.1109\/MIS.2025.3597120","article-title":"A generative random modality dropout framework for robust multimodal emotion recognition","volume":"40","author":"Zhang","year":"2025","journal-title":"IEEE Intell. Syst."},{"key":"10.1016\/j.neucom.2026.133494_bib0195","doi-asserted-by":"crossref","DOI":"10.1016\/j.array.2025.100445","article-title":"Raft: robust adversarial fusion transformer for multimodal sentiment analysis","author":"Wang","year":"2025","journal-title":"Array"},{"issue":"6","key":"10.1016\/j.neucom.2026.133494_bib0200","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1145\/3736415","article-title":"Actual cause guided adaptive gradient scaling for balanced multimodal sentiment analysis","volume":"21","author":"Chen","year":"2025","journal-title":"ACM Trans. Multimedia Comput. Commun. Appl."},{"key":"10.1016\/j.neucom.2026.133494_bib0205","doi-asserted-by":"crossref","DOI":"10.1016\/j.knosys.2023.111149","article-title":"Co-space representation interaction network for multimodal sentiment analysis","volume":"283","author":"Shi","year":"2024","journal-title":"Knowl.-based Syst."},{"key":"10.1016\/j.neucom.2026.133494_bib0210","doi-asserted-by":"crossref","DOI":"10.1016\/j.cmpb.2023.107923","article-title":"SFTNet: a microexpression-based method for depression detection","volume":"243","author":"Li","year":"2024","journal-title":"Comput. Methods Programs Biomed."},{"issue":"7","key":"10.1016\/j.neucom.2026.133494_bib0215","doi-asserted-by":"crossref","first-page":"2956","DOI":"10.1109\/TKDE.2024.3350071","article-title":"DepMSTAT: multimodal Spatio-Temporal attentional transformer for depression detection","volume":"36","author":"Tao","year":"2024","journal-title":"IEEE Trans. Knowl. Data Eng."},{"key":"10.1016\/j.neucom.2026.133494_bib0220","doi-asserted-by":"crossref","DOI":"10.1016\/j.dsp.2025.105359","article-title":"Attention-guided bi-direction temporal-aware network for speech-based depression recognition","author":"Liu","year":"2025","journal-title":"Digit. Signal Process."},{"key":"10.1016\/j.neucom.2026.133494_bib0225","author":"Liu"},{"key":"10.1016\/j.neucom.2026.133494_bib0230","author":"Zadeh"},{"key":"10.1016\/j.neucom.2026.133494_bib0235","series-title":"Proceedings of the 56th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","first-page":"2236","article-title":"Multimodal language analysis in the wild: CMU-MOSEI dataset and interpretable dynamic fusion graph","author":"Bagher Zadeh","year":"2018"},{"key":"10.1016\/j.neucom.2026.133494_bib0240","author":"Ringeval"},{"key":"10.1016\/j.neucom.2026.133494_bib0245","series-title":"Proceedings of Grand Challenge and Workshop on Human Multimodal Language (Challenge-HML)","first-page":"64","article-title":"DNN multimodal fusion techniques for predicting video sentiment","author":"Williams","year":"2018"},{"key":"10.1016\/j.neucom.2026.133494_bib0250","series-title":"Proceedings of the Conference. Association for Computational Linguistics. Meeting","first-page":"2359","article-title":"Integrating multimodal information in large pretrained transformers","volume":"vol. 2020","author":"Rahman","year":"2020"},{"key":"10.1016\/j.neucom.2026.133494_bib0255","doi-asserted-by":"crossref","first-page":"37","DOI":"10.1016\/j.inffus.2022.11.022","article-title":"Aobert: all-modalities-in-one BERT for multimodal sentiment analysis","volume":"92","author":"Kim","year":"2023","journal-title":"Inf. Fusion"},{"key":"10.1016\/j.neucom.2026.133494_bib0260","doi-asserted-by":"crossref","DOI":"10.1016\/j.knosys.2024.111982","article-title":"Video multimodal sentiment analysis using cross-modal feature translation and dynamical propagation","volume":"299","author":"Gan","year":"2024","journal-title":"Knowl.-based Syst."},{"key":"10.1016\/j.neucom.2026.133494_bib0265","series-title":"Proceedings of the 9th International on Audio\/Visual Emotion Challenge and Workshop","first-page":"27","article-title":"Predicting depression and emotions in the cross-roads of cultures, para-linguistics, and non-linguistics","author":"Kaya","year":"2019"},{"issue":"14","key":"10.1016\/j.neucom.2026.133494_bib0270","doi-asserted-by":"crossref","first-page":"4764","DOI":"10.3390\/s21144764","article-title":"Multi-Modal adaptive fusion transformer network for the estimation of depression level","volume":"21","author":"Sun","year":"2021","journal-title":"Sensors"}],"container-title":["Neurocomputing"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S092523122600891X?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S092523122600891X?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,4,21]],"date-time":"2026-04-21T11:43:09Z","timestamp":1776771789000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S092523122600891X"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,6]]},"references-count":54,"alternative-id":["S092523122600891X"],"URL":"https:\/\/doi.org\/10.1016\/j.neucom.2026.133494","relation":{},"ISSN":["0925-2312"],"issn-type":[{"value":"0925-2312","type":"print"}],"subject":[],"published":{"date-parts":[[2026,6]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"Multimodal sentiment analysis with query-based distillation and asymmetric fusion","name":"articletitle","label":"Article Title"},{"value":"Neurocomputing","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.neucom.2026.133494","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Elsevier B.V. All rights are reserved, including those for text and data mining, AI training, and similar technologies.","name":"copyright","label":"Copyright"}],"article-number":"133494"}}