{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,8,17]],"date-time":"2026-08-17T16:40:04Z","timestamp":1786984804473,"version":"build-2736575974"},"reference-count":38,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/501100012579","name":"Natural Science Foundation of Qinghai Province","doi-asserted-by":"publisher","award":["2022-ZJ-925"],"award-info":[{"award-number":["2022-ZJ-925"]}],"id":[{"id":"10.13039\/501100012579","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62066039"],"award-info":[{"award-number":["62066039"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Applied Soft Computing"],"published-print":{"date-parts":[[2026,9]]},"DOI":"10.1016\/j.asoc.2026.115637","type":"journal-article","created":{"date-parts":[[2026,6,4]],"date-time":"2026-06-04T07:06:28Z","timestamp":1780556788000},"page":"115637","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":1,"special_numbering":"PC","title":["Residual attention network for audio-based speech emotion recognition"],"prefix":"10.1016","volume":"201","author":[{"ORCID":"https:\/\/orcid.org\/0009-0002-8660-4835","authenticated-orcid":false,"given":"Puyang","family":"Zhao","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-9672-1539","authenticated-orcid":false,"given":"Huiyun","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0002-3440-0902","authenticated-orcid":false,"given":"Zhiyi","family":"Yue","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-2134-2651","authenticated-orcid":false,"given":"Zongjin","family":"Li","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0005-2251-9342","authenticated-orcid":false,"given":"Nan","family":"Mi","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xinhui","family":"Liu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.asoc.2026.115637_bib0005","series-title":"ICASSP 2024-2024 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","first-page":"11686","article-title":"Disentanglement network: disentangle the emotional features from acoustic features for speech emotion recognition","author":"Yuan","year":"2024"},{"issue":"9","key":"10.1016\/j.asoc.2026.115637_bib0010","doi-asserted-by":"crossref","first-page":"5318","DOI":"10.1109\/TCSVT.2023.3247822","article-title":"Semantic alignment network for multi-modal emotion recognition","volume":"33","author":"Hou","year":"2023","journal-title":"IEEE Trans. Circuits Syst. Video Technol."},{"key":"10.1016\/j.asoc.2026.115637_bib0015","series-title":"ICASSP 2024-2024 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","first-page":"12386","article-title":"A robust pitch-fusion model for speech emotion recognition in tonal languages","author":"Thanh","year":"2024"},{"key":"10.1016\/j.asoc.2026.115637_bib0020","series-title":"ICASSP 2024-2024 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","first-page":"12271","article-title":"MS-SENet: enhancing speech emotion recognition through multi-scale feature fusion with squeeze-and-excitation blocks","author":"Li","year":"2024"},{"key":"10.1016\/j.asoc.2026.115637_bib0025","doi-asserted-by":"crossref","DOI":"10.1016\/j.engappai.2025.110060","article-title":"Sparse temporal aware capsule network for robust speech emotion recognition","volume":"144","author":"Zhang","year":"2025","journal-title":"Eng. Appl. Artif. Intell."},{"key":"10.1016\/j.asoc.2026.115637_bib0030","series-title":"ICASSP 2023-2023 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","first-page":"1","article-title":"Designing and evaluating speech emotion recognition systems: a reality check case study with IEMOCAP","author":"Antoniou","year":"2023"},{"key":"10.1016\/j.asoc.2026.115637_bib0035","author":"Hendrycks"},{"key":"10.1016\/j.asoc.2026.115637_bib0040","series-title":"Proc. ICML","first-page":"3","article-title":"Rectifier nonlinearities improve neural network acoustic models","volume":"vol. 30","author":"Maas","year":"2013"},{"key":"10.1016\/j.asoc.2026.115637_bib0045","doi-asserted-by":"crossref","first-page":"61672","DOI":"10.1109\/ACCESS.2020.2984368","article-title":"Multimodal approach of speech emotion recognition using multi-level multi-head fusion attention-based recurrent neural network","volume":"8","author":"Ho","year":"2020","journal-title":"IEEE Access"},{"issue":"11","key":"10.1016\/j.asoc.2026.115637_bib0050","doi-asserted-by":"crossref","first-page":"6965","DOI":"10.1109\/TCSVT.2023.3273577","article-title":"Maln: multimodal adversarial learning network for conversational emotion recognition","volume":"33","author":"Ren","year":"2023","journal-title":"IEEE Trans. Circuits Syst. Video Technol."},{"key":"10.1016\/j.asoc.2026.115637_bib0055","series-title":"2018 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","first-page":"2906","article-title":"Advanced LSTM: a study about better time dependency modeling in emotion recognition","author":"Tao","year":"2018"},{"issue":"7","key":"10.1016\/j.asoc.2026.115637_bib0060","doi-asserted-by":"crossref","DOI":"10.1109\/TCSVT.2024.3362270","article-title":"A versatile multimodal learning framework for zero-shot emotion recognition","volume":"34","author":"Qi","year":"2024","journal-title":"IEEE Trans. Circuits Syst. Video Technol."},{"key":"10.1016\/j.asoc.2026.115637_bib0065","series-title":"2017 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","first-page":"2227","article-title":"Automatic speech emotion recognition using recurrent neural networks with local attention","author":"Mirsamadi","year":"2017"},{"key":"10.1016\/j.asoc.2026.115637_bib0070","article-title":"Dynamic routing between capsules","volume":"30","author":"Sabour","year":"2017","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.asoc.2026.115637_bib0075","series-title":"ICASSP 2019-2019 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","first-page":"6695","article-title":"Speech emotion recognition using capsule networks","author":"Wu","year":"2019"},{"key":"10.1016\/j.asoc.2026.115637_bib0080","author":"Gr\u00f3sz"},{"issue":"11","key":"10.1016\/j.asoc.2026.115637_bib0085","doi-asserted-by":"crossref","first-page":"8923","DOI":"10.1109\/TNNLS.2022.3154090","article-title":"Deep PLS: a lightweight deep learning model for interpretable and efficient data analytics","volume":"34","author":"Kong","year":"2022","journal-title":"IEEE Trans. Neural Netw. Learn. Syst."},{"key":"10.1016\/j.asoc.2026.115637_bib0090","doi-asserted-by":"crossref","first-page":"1063","DOI":"10.1109\/TASLP.2023.3245401","article-title":"A discriminative feature representation method based on cascaded attention network with adversarial strategy for speech emotion recognition","volume":"31","author":"Liu","year":"2023","journal-title":"IEEE\/ACM Trans. Audio Speech Lang. Process."},{"issue":"1","key":"10.1016\/j.asoc.2026.115637_bib0095","doi-asserted-by":"crossref","first-page":"1016","DOI":"10.1109\/TIE.2022.3150097","article-title":"K-means clustering-based kernel canonical correlation analysis for multimodal emotion recognition in human\u2013robot interaction","volume":"70","author":"Chen","year":"2022","journal-title":"IEEE Trans. Ind. Electron."},{"key":"10.1016\/j.asoc.2026.115637_bib0100","doi-asserted-by":"crossref","DOI":"10.1016\/j.knosys.2024.112499","article-title":"CENN: capsule-enhanced neural network with innovative metrics for robust speech emotion recognition","volume":"304","author":"Zhang","year":"2024","journal-title":"Knowl.-based Syst."},{"key":"10.1016\/j.asoc.2026.115637_bib0105","series-title":"2013 IEEE International Conference on Acoustics, Speech and Signal Processing","first-page":"7547","article-title":"Detecting depression: a comparison between spontaneous and read speech","author":"Alghowinem","year":"2013"},{"key":"10.1016\/j.asoc.2026.115637_bib0110","series-title":"Enhanced Living Environments: Algorithms, Architectures, Platforms, and Systems","first-page":"152","article-title":"Towards truly affective AAL systems","author":"Pudane","year":"2019"},{"key":"10.1016\/j.asoc.2026.115637_bib0115","doi-asserted-by":"crossref","DOI":"10.1016\/j.bspc.2025.107996","article-title":"Reproducible and generalizable speech emotion recognition via an intelligent fusion network","volume":"109","author":"Zhang","year":"2025","journal-title":"Biomed. Signal Process. Control"},{"key":"10.1016\/j.asoc.2026.115637_bib0120","doi-asserted-by":"crossref","DOI":"10.1016\/j.bspc.2025.108782","article-title":"Pre-attentive speech signal processing with adaptive routing for emotion recognition","volume":"112","author":"Zhang","year":"2026","journal-title":"Biomed. Signal Process. Control"},{"key":"10.1016\/j.asoc.2026.115637_bib0125","series-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition","first-page":"770","article-title":"Deep residual learning for image recognition","author":"He","year":"2016"},{"key":"10.1016\/j.asoc.2026.115637_bib0130","doi-asserted-by":"crossref","first-page":"238","DOI":"10.1016\/j.neucom.2021.02.094","article-title":"Spatiotemporal and frequential cascaded attention networks for speech emotion recognition","volume":"448","author":"Li","year":"2021","journal-title":"Neurocomputing"},{"issue":"43","key":"10.1016\/j.asoc.2026.115637_bib0135","doi-asserted-by":"crossref","first-page":"32917","DOI":"10.1007\/s11042-020-09693-w","article-title":"Speech emotion recognition using convolutional neural network and long-short TermMemory","volume":"79","author":"Dangol","year":"2020","journal-title":"Multimed. Tools Appl."},{"issue":"10","key":"10.1016\/j.asoc.2026.115637_bib0140","doi-asserted-by":"crossref","first-page":"1440","DOI":"10.1109\/LSP.2018.2860246","article-title":"3-D convolutional recurrent neural networks with attention model for speech emotion recognition","volume":"25","author":"Chen","year":"2018","journal-title":"IEEE Signal Process. Lett."},{"issue":"8","key":"10.1016\/j.asoc.2026.115637_bib0145","doi-asserted-by":"crossref","first-page":"2297","DOI":"10.3390\/s20082297","article-title":"Speech emotion recognition based on selective interpolation synthetic minority over-sampling technique in small sample environment","volume":"20","author":"Liu","year":"2020","journal-title":"Sensors"},{"key":"10.1016\/j.asoc.2026.115637_bib0150","series-title":"2023 4th International Conference on Computer Engineering and Application (ICCEA)","first-page":"680","article-title":"Speech emotion recognition using channel attention mechanism","author":"Zhu","year":"2023"},{"key":"10.1016\/j.asoc.2026.115637_bib0155","series-title":"International Conference on Image, Signal Processing, and Pattern Recognition (ISPP 2023)","first-page":"1019","article-title":"Speech emotion recognition based on CNN-MGU-attention","volume":"vol. 12707","author":"Wang","year":"2023"},{"issue":"1","key":"10.1016\/j.asoc.2026.115637_bib0160","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1186\/s13636-018-0145-5","article-title":"Decision tree SVM model with fisher feature selection for speech emotion recognition","volume":"2019","author":"Sun","year":"2019","journal-title":"EURASIP J. Audio Speech Music Process."},{"key":"10.1016\/j.asoc.2026.115637_bib0165","doi-asserted-by":"crossref","first-page":"150","DOI":"10.1016\/j.ins.2019.09.005","article-title":"Two-layer fuzzy multiple random forest for speech emotion recognition in human-robot interaction","volume":"509","author":"Chen","year":"2020","journal-title":"Inf. Sci."},{"key":"10.1016\/j.asoc.2026.115637_bib0170","series-title":"International Conference on Frontiers of Electronics, Information and Computation Technologies","first-page":"1","article-title":"A DenseNet-GRU technology for Chinese speech emotion recognition","author":"Cheng","year":"2021"},{"issue":"3","key":"10.1016\/j.asoc.2026.115637_bib0175","doi-asserted-by":"crossref","first-page":"462","DOI":"10.4218\/etrij.2020-0458","article-title":"Speech emotion recognition based on genetic algorithm\u2013decision tree fusion of deep and acoustic features","volume":"44","author":"Sun","year":"2022","journal-title":"ETRI J."},{"key":"10.1016\/j.asoc.2026.115637_bib0180","series-title":"2020 28th European Signal Processing Conference (EUSIPCO)","first-page":"1","article-title":"An end-to-end multitask learning model to improve speech emotion recognition","author":"Fu","year":"2021"},{"key":"10.1016\/j.asoc.2026.115637_bib0185","series-title":"Interspeech","first-page":"1517","article-title":"A database of German emotional speech","volume":"vol. 5","author":"Burkhardt","year":"2005"},{"key":"10.1016\/j.asoc.2026.115637_bib0190","series-title":"2022 IEEE International Conference on Electronics, Computing and Communication Technologies (CONECCT)","first-page":"1","article-title":"EnsembleWave: an ensembled approach for automatic speech emotion recognition","author":"Barkur","year":"2022"}],"container-title":["Applied Soft Computing"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S1568494626010859?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S1568494626010859?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,7,27]],"date-time":"2026-07-27T08:01:26Z","timestamp":1785139286000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S1568494626010859"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,9]]},"references-count":38,"alternative-id":["S1568494626010859"],"URL":"https:\/\/doi.org\/10.1016\/j.asoc.2026.115637","relation":{},"ISSN":["1568-4946"],"issn-type":[{"value":"1568-4946","type":"print"}],"subject":[],"published":{"date-parts":[[2026,9]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"Residual attention network for audio-based speech emotion recognition","name":"articletitle","label":"Article Title"},{"value":"Applied Soft Computing","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.asoc.2026.115637","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Elsevier B.V. All rights are reserved, including those for text and data mining, AI training, and similar technologies.","name":"copyright","label":"Copyright"}],"article-number":"115637"}}