{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,28]],"date-time":"2026-04-28T00:39:57Z","timestamp":1777336797904,"version":"3.51.4"},"reference-count":54,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,7,1]],"date-time":"2026-07-01T00:00:00Z","timestamp":1782864000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,7,1]],"date-time":"2026-07-01T00:00:00Z","timestamp":1782864000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,7,1]],"date-time":"2026-07-01T00:00:00Z","timestamp":1782864000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,7,1]],"date-time":"2026-07-01T00:00:00Z","timestamp":1782864000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,7,1]],"date-time":"2026-07-01T00:00:00Z","timestamp":1782864000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,7,1]],"date-time":"2026-07-01T00:00:00Z","timestamp":1782864000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,7,1]],"date-time":"2026-07-01T00:00:00Z","timestamp":1782864000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["61572448"],"award-info":[{"award-number":["61572448"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62172378"],"award-info":[{"award-number":["62172378"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Neurocomputing"],"published-print":{"date-parts":[[2026,7]]},"DOI":"10.1016\/j.neucom.2026.133570","type":"journal-article","created":{"date-parts":[[2026,4,6]],"date-time":"2026-04-06T16:48:40Z","timestamp":1775494120000},"page":"133570","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"C","title":["AttMamba: Mamba with attention mechanism for multimodal depression detection"],"prefix":"10.1016","volume":"684","author":[{"given":"Xiangyun","family":"Zheng","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yingjian","family":"Liu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zonghai","family":"Zha","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Minghuan","family":"Lv","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Hao","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"78","reference":[{"issue":"7","key":"10.1016\/j.neucom.2026.133570_bib0005","doi-asserted-by":"crossref","first-page":"1320","DOI":"10.1109\/JAS.2025.125393","article-title":"Machine Learning-Based prediction of depressive disorders via various data modalities: a survey","volume":"12","author":"Li","year":"2025","journal-title":"IEEE\/CAA J. Autom. Sin."},{"issue":"9","key":"10.1016\/j.neucom.2026.133570_bib0010","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1145\/3649447","article-title":"Deep multimodal data fusion","volume":"56","author":"Zhao","year":"2024","journal-title":"ACM Comput. Surv."},{"key":"10.1016\/j.neucom.2026.133570_bib0015","doi-asserted-by":"crossref","first-page":"127","DOI":"10.1016\/j.inffus.2020.01.008","article-title":"Feature-level fusion approaches based on multimodal EEG data for depression recognition","volume":"59","author":"Cai","year":"2020","journal-title":"Inf. Fusion"},{"issue":"1","key":"10.1016\/j.neucom.2026.133570_bib0020","doi-asserted-by":"crossref","first-page":"3392","DOI":"10.1109\/TCE.2024.3370310","article-title":"A depression detection auxiliary decision system based on Multi-Modal Feature-Level fusion of EEG and speech","volume":"70","author":"Ning","year":"2024","journal-title":"IEEE Trans. Consum. Electron."},{"key":"10.1016\/j.neucom.2026.133570_bib0025","series-title":"Proceedings of the International Workshop on Audio\/Visual Emotion Challenge","first-page":"33","article-title":"Multimodal prediction of affective dimensions and depression in human-computer interactions","author":"Gupta","year":"2014"},{"key":"10.1016\/j.neucom.2026.133570_bib0030","series-title":"Proceedings of the ACM International Workshop on Audio\/Visual Emotion Challenge","first-page":"11","article-title":"Diagnosis of depression by behavioural signals: a multimodal approach","author":"Cummins","year":"2013"},{"key":"10.1016\/j.neucom.2026.133570_bib0035","series-title":"Proceedings of the International Workshop on Audio\/Visual Emotion Challenge","first-page":"43","article-title":"Multimodal and multiresolution depression detection from speech and facial landmark features","author":"Nasir","year":"2016"},{"issue":"6","key":"10.1016\/j.neucom.2026.133570_bib0040","doi-asserted-by":"crossref","first-page":"2265","DOI":"10.1109\/JBHI.2019.2938247","article-title":"Multimodal depression detection: fusion of electroencephalography and paralinguistic behaviors using a novel strategy for classifier ensemble","volume":"23","author":"Zhang","year":"2019","journal-title":"IEEE J. Biomed. Health Inform."},{"issue":"7","key":"10.1016\/j.neucom.2026.133570_bib0045","doi-asserted-by":"crossref","first-page":"3466","DOI":"10.1109\/JBHI.2022.3165640","article-title":"Computer-aided recognition based on decision-level multimodal fusion for depression","volume":"26","author":"Zhang","year":"2022","journal-title":"IEEE J. Biomed. Health Inform."},{"key":"10.1016\/j.neucom.2026.133570_bib0050","series-title":"Proceedings of the IEEE Symposium on Computers and Communications","first-page":"1","article-title":"Multimodal depression detection using task-oriented transformer-based embedding","author":"Rasipuram","year":"2022"},{"key":"10.1016\/j.neucom.2026.133570_bib0055","series-title":"Proceedings of the AAAI Conference on Artificial Intelligence","first-page":"12226","article-title":"D-vlog: multimodal vlog dataset for depression detection","volume":"vol. 36","author":"Yoon","year":"2022"},{"key":"10.1016\/j.neucom.2026.133570_bib0060","doi-asserted-by":"crossref","DOI":"10.1016\/j.inffus.2023.102161","article-title":"Transformer-based multimodal feature enhancement networks for multimodal depression detection integrating video, audio and remote photoplethysmograph signals","volume":"104","author":"Fan","year":"2024","journal-title":"Inf. Fusion"},{"issue":"7","key":"10.1016\/j.neucom.2026.133570_bib0065","doi-asserted-by":"crossref","first-page":"2956","DOI":"10.1109\/TKDE.2024.3350071","article-title":"DepMSTAT: multimodal spatio-temporal attentional transformer for depression detection","volume":"36","author":"Tao","year":"2024","journal-title":"IEEE Trans. Knowl. Data Eng."},{"key":"10.1016\/j.neucom.2026.133570_bib0070","series-title":"Proceedings of the Annual Meeting of the Association for Computational Linguistics","article-title":"Multimodal transformer for unaligned multimodal language sequences","author":"Tsai","year":"2019"},{"key":"10.1016\/j.neucom.2026.133570_bib0075","series-title":"Proceedings of the ACM International Conference on Multimedia","first-page":"1122","article-title":"MISA: Modality-Invariant and -specific representations for multimodal sentiment analysis","author":"Hazarika","year":"2020"},{"key":"10.1016\/j.neucom.2026.133570_bib0080","series-title":"Proceedings of the AAAI Conference on Artificial Intelligence","first-page":"10790","article-title":"Learning Modality-Specific representations with Self-Supervised Multi-Task learning for multimodal sentiment analysis","volume":"vol. 35","author":"Yu","year":"2021"},{"issue":"3","key":"10.1016\/j.neucom.2026.133570_bib0085","doi-asserted-by":"crossref","DOI":"10.1016\/j.ipm.2024.103675","article-title":"A cross modal hierarchical fusion multimodal sentiment analysis method based on multi-task learning","volume":"61","author":"Wang","year":"2024","journal-title":"Inf. Process. Manag."},{"key":"10.1016\/j.neucom.2026.133570_bib0090","series-title":"Proceedings of the Conference on Empirical Methods in Natural Language Processing","first-page":"9180","article-title":"Improving multimodal fusion with hierarchical mutual information maximization for multimodal sentiment analysis","author":"Han","year":"2021"},{"key":"10.1016\/j.neucom.2026.133570_bib0095","doi-asserted-by":"crossref","DOI":"10.1016\/j.neucom.2023.127201","article-title":"Hybrid cross-modal interaction learning for multimodal sentiment analysis","volume":"571","author":"Fu","year":"2024","journal-title":"Neurocomputing"},{"key":"10.1016\/j.neucom.2026.133570_bib0100","series-title":"Proceedings of the IEEE International Conference on Acoustics, Speech and Signal Processing","first-page":"4235","article-title":"HCAG: a hierarchical Context-Aware graph attention model for depression detection","author":"Niu","year":"2021"},{"key":"10.1016\/j.neucom.2026.133570_bib0105","doi-asserted-by":"crossref","DOI":"10.1016\/j.neucom.2024.129106","article-title":"Facial action units guided graph representation learning for multimodal depression detection","volume":"619","author":"Fu","year":"2025","journal-title":"Neurocomputing"},{"issue":"1","key":"10.1016\/j.neucom.2026.133570_bib0110","doi-asserted-by":"crossref","first-page":"5335","DOI":"10.1038\/s41598-024-54872-6","article-title":"Hierarchical graph contrastive learning of local and global presentation for multimodal sentiment analysis","volume":"14","author":"Du","year":"2024","journal-title":"Sci. Rep."},{"key":"10.1016\/j.neucom.2026.133570_bib0115","series-title":"Proceedings of the International Joint Conference on Artificial Intelligence","first-page":"3838","article-title":"Depression detection via harvesting social media: a multimodal dictionary learning solution","author":"Shen","year":"2017"},{"key":"10.1016\/j.neucom.2026.133570_bib0120","series-title":"Proceedings of the International Conference on Advanced Data Mining and Applications","first-page":"19","article-title":"Textual cues for online depression in community and personal settings","author":"Nguyen","year":"2016"},{"key":"10.1016\/j.neucom.2026.133570_bib0125","series-title":"Proceedings of the Pacific Asia Conference on Language, Information and Computation","first-page":"1","article-title":"Feature attention network: interpretable depression detection from social media","author":"Song","year":"2018"},{"key":"10.1016\/j.neucom.2026.133570_bib0130","article-title":"Depression detection from speech signals using a multiple temporal-frequency scale channel attention mechanism","volume":"113","author":"Wang","year":"2026","journal-title":"Biomed. Signal Process. Control"},{"issue":"1","key":"10.1016\/j.neucom.2026.133570_bib0135","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1109\/TCSVT.2020.2967424","article-title":"A Covariate-Guided graph attention network for depression recognition via pure facial movements","volume":"1","author":"Zhao","year":"2026","journal-title":"IEEE Trans. Circuits Syst. Video Technol."},{"issue":"1","key":"10.1016\/j.neucom.2026.133570_bib0140","doi-asserted-by":"crossref","first-page":"161","DOI":"10.1109\/TAFFC.2024.3415770","article-title":"Two-Stage temporal modelling framework for Video-Based depression recognition using graph representation","volume":"16","author":"Xu","year":"2025","journal-title":"IEEE Trans. Affect. Comput."},{"key":"10.1016\/j.neucom.2026.133570_bib0145","doi-asserted-by":"crossref","DOI":"10.1016\/j.bspc.2026.109681","article-title":"Eeg-based depression detection using a local\u2013global feature fusion deep learning network","volume":"118","author":"Li","year":"2026","journal-title":"Biomed. Signal Process. Control"},{"key":"10.1016\/j.neucom.2026.133570_bib0150","doi-asserted-by":"crossref","DOI":"10.1016\/j.inffus.2025.104077","article-title":"DepressInstruct: instruction tuning of large speech-language models for depression detection","volume":"130","author":"Li","year":"2026","journal-title":"Inf. Fusion"},{"key":"10.1016\/j.neucom.2026.133570_bib0155","doi-asserted-by":"crossref","first-page":"6872","DOI":"10.1109\/TMM.2025.3590939","article-title":"Multi-Modal depression detection in interview via exploring emotional distribution information","volume":"27","author":"Zhou","year":"2025","journal-title":"IEEE Trans. Multimed."},{"key":"10.1016\/j.neucom.2026.133570_bib0160","series-title":"Proceedings of the International Conference on Neural Information Processing Systems","first-page":"6000","article-title":"Attention is all you need","author":"Vaswani","year":"2017"},{"key":"10.1016\/j.neucom.2026.133570_bib0165","series-title":"Proceedings of the International Conference on Learning Representations","first-page":"1","article-title":"Efficiently modeling long sequences with structured state spaces","author":"Gu","year":"2022"},{"key":"10.1016\/j.neucom.2026.133570_bib0170","series-title":"Proceedings of the Conference on Language Modeling","first-page":"1","article-title":"Mamba: linear-time sequence modeling with selective state spaces","author":"Gu","year":"2024"},{"key":"10.1016\/j.neucom.2026.133570_bib0175","series-title":"Proceedings of the IEEE International Conference on Bioinformatics and Biomedicine","first-page":"2726","article-title":"EMO-mamba: multimodal selective structured state space model for depression detection","author":"Xing","year":"2024"},{"key":"10.1016\/j.neucom.2026.133570_bib0180","series-title":"Proceedings of the IEEE International Conference on Acoustics, Speech and Signal Processing","first-page":"1","article-title":"STE-mamba: automated multimodal depression detection through emotional analysis and Spatio-Temporal information ensemble","author":"Lin","year":"2025"},{"key":"10.1016\/j.neucom.2026.133570_bib0185","series-title":"Proceedings of the IEEE International Conference on Acoustics, Speech and Signal Processing","first-page":"1","article-title":"DepMamba: progressive fusion mamba for multimodal depression detection","author":"Ye","year":"2025"},{"issue":"2","key":"10.1016\/j.neucom.2026.133570_bib0190","article-title":"MSLMamba: mamba-driven cross-modal fusion network with modality-specific learning for multimodal sentiment analysis","volume":"665","author":"Ma","year":"2026","journal-title":"Neurocomputing"},{"key":"10.1016\/j.neucom.2026.133570_bib0195","doi-asserted-by":"crossref","DOI":"10.1016\/j.inffus.2026.104213","article-title":"FDA-CAPMA: federated domain adaptation with co-activation pattern and multimodal mamba for fMRI depression detection","volume":"132","author":"He","year":"2026","journal-title":"Inf. Fusion"},{"key":"10.1016\/j.neucom.2026.133570_bib0200","doi-asserted-by":"crossref","DOI":"10.1016\/j.eswa.2024.126274","article-title":"Learning fine-grained representation with token-level alignment for multimodal sentiment analysis","volume":"269","author":"Li","year":"2025","journal-title":"Expert Syst. Appl."},{"key":"10.1016\/j.neucom.2026.133570_bib0205","doi-asserted-by":"crossref","DOI":"10.1016\/j.neucom.2024.129163","article-title":"Transformer-based correlation mining network with self-supervised label generation for multimodal sentiment analysis","volume":"618","author":"Wang","year":"2025","journal-title":"Neurocomputing"},{"issue":"3","key":"10.1016\/j.neucom.2026.133570_bib0210","doi-asserted-by":"crossref","first-page":"2087","DOI":"10.1109\/TCSVT.2024.3491098","article-title":"DEP-former: multimodal depression recognition based on facial expressions and audio features via emotional changes","volume":"35","author":"Ye","year":"2025","journal-title":"IEEE Trans. Circuits Syst. Video Technol."},{"key":"10.1016\/j.neucom.2026.133570_bib0215","doi-asserted-by":"crossref","DOI":"10.1016\/j.bspc.2025.108379","article-title":"Multimodal hierarchical transformer enriched by temporal features and the CTC loss model: depression detection model based on multimodal hierarchical transformer","volume":"112","author":"Yue","year":"2026","journal-title":"Biomed. Signal Process. Control"},{"issue":"3","key":"10.1016\/j.neucom.2026.133570_bib0220","doi-asserted-by":"crossref","first-page":"1855","DOI":"10.1109\/TAFFC.2025.3543226","article-title":"Automatic depression recognition with an ensemble of multimodal Spatio-Temporal routing features","volume":"16","author":"Wang","year":"2025","journal-title":"IEEE Trans. Affect. Comput."},{"key":"10.1016\/j.neucom.2026.133570_bib0225","series-title":"Proceedings of the IEEE International Conference on Image Processing","first-page":"2041","article-title":"Synchronized Audio-Visual frames with fractional positional encoding for transformers in Video-to-Text translation","author":"Harzig","year":"2022"},{"key":"10.1016\/j.neucom.2026.133570_bib0230","series-title":"Proceedings of the International Conference on Machine Learning","first-page":"5156","article-title":"Transformers are RNNs: fast autoregressive transformers with linear attention","volume":"vol. 119","author":"Katharopoulos","year":"2020"},{"issue":"10","key":"10.1016\/j.neucom.2026.133570_bib0235","article-title":"Lmvd: a large-scale multimodal vlog dataset for depression detection in the wild","volume":"126","author":"He","year":"2026","journal-title":"Inf. Fusion"},{"key":"10.1016\/j.neucom.2026.133570_bib0240","doi-asserted-by":"crossref","first-page":"669","DOI":"10.1109\/TNSRE.2022.3224135","article-title":"TAMFN: time-aware attention multimodal fusion network for depression detection","volume":"31","author":"Zhou","year":"2022","journal-title":"IEEE Trans. Neural Syst. Rehabil. Eng."},{"issue":"6","key":"10.1016\/j.neucom.2026.133570_bib0245","doi-asserted-by":"crossref","first-page":"82","DOI":"10.1109\/MIS.2016.94","article-title":"Multimodal sentiment intensity analysis in videos: facial gestures and verbal messages","volume":"31","author":"Zadeh","year":"2016","journal-title":"IEEE Intell. Syst."},{"key":"10.1016\/j.neucom.2026.133570_bib0250","series-title":"Proceedings of the Annual International Conference of the IEEE Engineering in Medicine and Biology Society","first-page":"1433","article-title":"Facial geometry and speech analysis for depression detection","author":"Pampouchidou","year":"2017"},{"key":"10.1016\/j.neucom.2026.133570_bib0255","series-title":"Proceedings of the International Workshop on Audio\/Visual Emotion Challenge and Workshop","first-page":"65","article-title":"A multi-modal hierarchical recurrent neural network for depression detection","author":"Yin","year":"2019"},{"key":"10.1016\/j.neucom.2026.133570_bib0260","series-title":"Proceedings of the IEEE\/CVF International Conference on Computer Vision","first-page":"5492","article-title":"Epic-fusion: audio-visual temporal binding for egocentric action recognition","author":"Kazakos","year":"2019"},{"issue":"3","key":"10.1016\/j.neucom.2026.133570_bib0265","doi-asserted-by":"crossref","first-page":"577","DOI":"10.1016\/j.dcan.2023.03.007","article-title":"Depressive semantic awareness from vlog facial and vocal streams via spatio-temporal transformer","volume":"10","author":"Tao","year":"2024","journal-title":"Digit. Commun. Netw."},{"key":"10.1016\/j.neucom.2026.133570_bib0270","series-title":"Proceedings of the Conference on Empirical Methods in Natural Language Processing","first-page":"1103","article-title":"Tensor fusion network for multimodal sentiment analysis","author":"Zadeh","year":"2017"}],"container-title":["Neurocomputing"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0925231226009677?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0925231226009677?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,4,27]],"date-time":"2026-04-27T23:45:59Z","timestamp":1777333559000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0925231226009677"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,7]]},"references-count":54,"alternative-id":["S0925231226009677"],"URL":"https:\/\/doi.org\/10.1016\/j.neucom.2026.133570","relation":{},"ISSN":["0925-2312"],"issn-type":[{"value":"0925-2312","type":"print"}],"subject":[],"published":{"date-parts":[[2026,7]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"AttMamba: Mamba with attention mechanism for multimodal depression detection","name":"articletitle","label":"Article Title"},{"value":"Neurocomputing","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.neucom.2026.133570","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Elsevier B.V. All rights are reserved, including those for text and data mining, AI training, and similar technologies.","name":"copyright","label":"Copyright"}],"article-number":"133570"}}