{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,1]],"date-time":"2026-07-01T19:44:14Z","timestamp":1782935054865,"version":"3.54.5"},"reference-count":42,"publisher":"Springer Science and Business Media LLC","issue":"7","license":[{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"funder":[{"name":"China National Natural Science Foundation for the Key Program","award":["62237001"],"award-info":[{"award-number":["62237001"]}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["SIViP"],"published-print":{"date-parts":[[2026,6]]},"DOI":"10.1007\/s11760-026-05443-x","type":"journal-article","created":{"date-parts":[[2026,6,2]],"date-time":"2026-06-02T08:28:54Z","timestamp":1780388934000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["Multimodal emotion recognition using cross-modal convolutional attention and multi-acoustic feature fusion"],"prefix":"10.1007","volume":"20","author":[{"given":"Yanxiang","family":"Chen","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Wenchao","family":"Jiang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jianing","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Hong","family":"Xiao","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zhiming","family":"Zhao","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Tao","family":"Wu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2026,6,2]]},"reference":[{"key":"5443_CR1","doi-asserted-by":"publisher","unstructured":"Sivarambabu, P.V., Agrawal, R., Tirumala, A., Subani, S.M., Parisae, V., Nukala, S.V.L.S.: Enhancing Cloud Security Through AI-Driven Intrusion Detection Utilizing Deep Learning Methods and Autoencoder Technology, pp. 249\u2013264. John Wiley & Sons, Ltd, Hoboken, NJ (2025). Chap. 15. https:\/\/doi.org\/10.1002\/9781394209835.ch15","DOI":"10.1002\/9781394209835.ch15"},{"key":"5443_CR2","doi-asserted-by":"publisher","first-page":"184","DOI":"10.1016\/j.inffus.2018.06.003","volume":"46","author":"Y Ma","year":"2019","unstructured":"Ma, Y., Hao, Y., Chen, M., Chen, J., Lu, P., Ko\u0161ir, A.: Audio-visual emotion fusion (AVEF): A deep efficient weighted approach. Information Fusion 46, 184\u2013192 (2019)","journal-title":"Information Fusion"},{"key":"5443_CR3","doi-asserted-by":"publisher","first-page":"42","DOI":"10.1016\/j.neucom.2020.01.048","volume":"391","author":"M Hao","year":"2020","unstructured":"Hao, M., Cao, W.H., Liu, Z.T., Wu, M., Xiao, P.: Visual-audio emotion recognition based on multi-task and ensemble learning with multiple features. Neurocomputing 391, 42\u201351 (2020)","journal-title":"Neurocomputing"},{"issue":"17","key":"5443_CR4","doi-asserted-by":"publisher","first-page":"7962","DOI":"10.3390\/app11177962","volume":"11","author":"P Koromilas","year":"2021","unstructured":"Koromilas, P., Giannakopoulos, T.: Deep multimodal emotion recognition on human speech: A review. Appl. Sci. 11(17), 7962 (2021)","journal-title":"Appl. Sci."},{"key":"5443_CR5","doi-asserted-by":"publisher","first-page":"67","DOI":"10.1016\/j.cviu.2017.07.001","volume":"163","author":"M Luo","year":"2017","unstructured":"Luo, M., Chang, X., Li, Z., Nie, L., Hauptmann, A.G., Zheng, Q.: Simple to complex cross-modal learning to rank. Comput. Vis. Image Underst. 163, 67\u201377 (2017)","journal-title":"Comput. Vis. Image Underst."},{"key":"5443_CR6","doi-asserted-by":"publisher","DOI":"10.1016\/j.iswa.2022.200171","volume":"17","author":"N Ahmed","year":"2024","unstructured":"Ahmed, N., Al Aghbari, Z., Girija, S.: A systematic survey on multimodal emotion recognition using learning algorithms. Intelligent Systems with Applications 17, 200171 (2024)","journal-title":"Intelligent Systems with Applications"},{"key":"5443_CR7","doi-asserted-by":"crossref","unstructured":"Eyben, F., W\u00f6llmer, M., Schuller, B.: Opensmile: the munich versatile and fast open-source audio feature extractor. In: Proceedings of the 18th ACM International Conference on Multimedia, pp. 1459\u20131462. (2010)","DOI":"10.1145\/1873951.1874246"},{"key":"5443_CR8","doi-asserted-by":"crossref","unstructured":"McFee, B. and Raffel, C. and Liang, D. and Ellis, D. P. and McVicar, M. and Battenberg, E. and Nieto, O.: librosa: Audio and music signal analysis in python. In: Proceedings of the 14th Python in Science Conference, vol. 8, pp. 18\u201325 (2015)","DOI":"10.25080\/Majora-7b98e3ed-003"},{"key":"5443_CR9","doi-asserted-by":"publisher","unstructured":"Jannu, C., Bharath, D., Sanjay, V.N., Kothakotamaana, H., Adapa, S., Parisae, V.: Deep learning-based speech emotion recognition: Evaluating cnn, clstm, and lstm models. In: 2025 9th International Conference on Inventive Systems and Control (ICISC), pp. 108\u2013115 (2025). https:\/\/doi.org\/10.1109\/ICISC65841.2025.11188229","DOI":"10.1109\/ICISC65841.2025.11188229"},{"key":"5443_CR10","doi-asserted-by":"publisher","unstructured":"Zhao, J., Mao, X., Chen, L.: Speech emotion recognition using deep 1d & 2d cnn-lstm networks. Biomedical Signal Processing and Control47, 312\u2013323 (2019) https:\/\/doi.org\/10.1016\/j.bspc.2018.08.035","DOI":"10.1016\/j.bspc.2018.08.035"},{"key":"5443_CR11","doi-asserted-by":"crossref","unstructured":"Bhangale, K., Mohanaprasad, K.: Speech emotion recognition using mel frequency log spectrogram and deep convolutional neural network. In: International Conference on Futuristic Communication and Network Technologies, pp. 241\u2013250. Springer (2020)","DOI":"10.1007\/978-981-16-4625-6_24"},{"issue":"8","key":"5443_CR12","doi-asserted-by":"publisher","first-page":"11897","DOI":"10.1007\/s11042-022-13725-y","volume":"82","author":"S Patnaik","year":"2024","unstructured":"Patnaik, S.: Speech emotion recognition by using complex MFCC and deep sequential model. Multimedia Tools and Applications 82(8), 11897\u201311922 (2024)","journal-title":"Multimedia Tools and Applications"},{"key":"5443_CR13","doi-asserted-by":"crossref","unstructured":"Zou, H. and Si, Y. and Chen, C. and Rajan, D. and Chng, E. S.: Speech emotion recognition with co-attention based multi-level acoustic information. In: ICASSP 2022-2022 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 7367\u20137371 (2022). IEEE","DOI":"10.1109\/ICASSP43922.2022.9747095"},{"key":"5443_CR14","doi-asserted-by":"publisher","first-page":"43","DOI":"10.1007\/s13042-010-0001-0","volume":"1","author":"Y Zhang","year":"2010","unstructured":"Zhang, Y., Jin, R., Zhou, Z.H.: Understanding bag-of-words model: a statistical framework. Int. J. Mach. Learn. Cybern. 1, 43\u201352 (2010)","journal-title":"Int. J. Mach. Learn. Cybern."},{"issue":"1","key":"5443_CR15","doi-asserted-by":"publisher","first-page":"27","DOI":"10.1080\/03081079.2017.1291635","volume":"46","author":"L Havrlant","year":"2017","unstructured":"Havrlant, L., Kreinovich, V.: A simple probabilistic explanation of term frequency-inverse document frequency (TF-IDF) heuristic (and variations motivated by this explanation). Int. J. Gen Syst 46(1), 27\u201336 (2017)","journal-title":"Int. J. Gen Syst"},{"issue":"1","key":"5443_CR16","doi-asserted-by":"publisher","first-page":"71","DOI":"10.3126\/jiee.v3i1.34327","volume":"3","author":"J Bhatta","year":"2020","unstructured":"Bhatta, J., Shrestha, D., Nepal, S., Pandey, S., Koirala, S.: Efficient estimation of Nepali word representations in vector space. J. Innov. Eng. Edu. 3(1), 71\u201377 (2020)","journal-title":"J. Innov. Eng. Edu."},{"issue":"17","key":"5443_CR17","doi-asserted-by":"publisher","first-page":"6327","DOI":"10.3390\/s22176327","volume":"22","author":"W Lin","year":"2022","unstructured":"Lin, W., Li, C., Zhang, Y.: Interactive Application of Data Glove Based on Emotion Recognition and Judgment System. Sensors 22(17), 6327 (2022)","journal-title":"Sensors"},{"key":"5443_CR18","doi-asserted-by":"crossref","unstructured":"Acheampong, F.A., Nunoo-Mensah, H., Chen, W.: Transformer models for text-based emotion detection: a review of BERT-based approaches. Artif. Intell. Rev. , 1\u201341 (2021)","DOI":"10.1007\/s10462-021-09958-2"},{"key":"5443_CR19","doi-asserted-by":"crossref","unstructured":"Lammerse, M., Hassan, S.Z., Sabet, S.S., Riegler, M.A., Halvorsen, P.: GPT-3: The challenges of extracting emotions from child responses. In: 2022 14th International Conference on Quality of Multimedia Experience (QoMEX), pp. 1\u20134. IEEE (2022) . (Human vs)","DOI":"10.1109\/QoMEX55416.2022.9900885"},{"key":"5443_CR20","unstructured":"Chiorrini, A., Diamantini, C., Mircoli, A., Potena, D.: Emotion and sentiment analysis of tweets using BERT. In: EDBT\/ICDT Workshops, vol. 3, (2021)"},{"key":"5443_CR21","unstructured":"Lu, J., Batra, D., Parikh, D., Lee, S.: Vilbert: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks. In: Advances in Neural Information Processing Systems, vol. 32, (2019)"},{"issue":"4","key":"5443_CR22","doi-asserted-by":"publisher","first-page":"923","DOI":"10.1007\/s13042-019-01056-8","volume":"11","author":"Z Wang","year":"2020","unstructured":"Wang, Z., Zhou, X., Wang, W., Liang, C.: Emotion recognition using multimodal deep learning in multiple psychophysiological signals and video. Int. J. Mach. Learn. Cybern. 11(4), 923\u2013934 (2020)","journal-title":"Int. J. Mach. Learn. Cybern."},{"key":"5443_CR23","doi-asserted-by":"crossref","unstructured":"Liu, P., Li, K., Meng, H.: Group gated fusion on attention-based bidirectional alignment for multimodal emotion recognition, pp. 379\u2013383. Interspeech (2020)","DOI":"10.21437\/Interspeech.2020-2067"},{"key":"5443_CR24","doi-asserted-by":"crossref","unstructured":"Chen, M., Zhao, X.: A Multi-Scale Fusion Framework for Bimodal Speech Emotion Recognition, pp. 374\u2013378. Interspeech (2020)","DOI":"10.21437\/Interspeech.2020-3156"},{"issue":"9","key":"5443_CR25","doi-asserted-by":"publisher","first-page":"4345","DOI":"10.1109\/TIP.2018.2831454","volume":"27","author":"L Liu","year":"2018","unstructured":"Liu, L., Nie, F., Wiliem, A., Li, Z., Zhang, T., Lovell, B.C.: Multi-modal joint clustering with application for unsupervised attribute discovery. IEEE Trans. Image Process. 27(9), 4345\u20134356 (2018)","journal-title":"IEEE Trans. Image Process."},{"key":"5443_CR26","doi-asserted-by":"crossref","unstructured":"Krishna, D. N. and Patil, A.: Multimodal Emotion Recognition Using Cross-Modal Attention and 1D Convolutional Neural Networks. In: Interspeech, pp. 4243\u20134247 (2020)","DOI":"10.21437\/Interspeech.2020-1190"},{"key":"5443_CR27","doi-asserted-by":"crossref","unstructured":"Makiuchi, M.R., Uto, K., Shinoda, K.: Multimodal emotion recognition with high-level speech and text features. In: 2021 IEEE Automatic Speech Recognition and Understanding Workshop (ASRU), pp. 350\u2013357. IEEE (2021)","DOI":"10.1109\/ASRU51503.2021.9688036"},{"key":"5443_CR28","doi-asserted-by":"crossref","unstructured":"Zhao, Z. and Wang, Y. and Wang, Y.: Multi-level fusion of wav2vec 2.0 and BERT for multimodal emotion recognition. In: Interspeech, pp. 4725\u20134729 (2022)","DOI":"10.21437\/Interspeech.2022-10230"},{"key":"5443_CR29","doi-asserted-by":"crossref","unstructured":"Kumar, P. and Kaushik, V. and Raman, B.: Towards the Explainability of Multimodal Speech Emotion Recognition. In: Interspeech, pp. 1748\u20131752 (2021)","DOI":"10.21437\/Interspeech.2021-1718"},{"key":"5443_CR30","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1016\/j.specom.2022.02.006","volume":"139","author":"Y Liu","year":"2022","unstructured":"Liu, Y., Sun, H., Guan, W., Xia, Y., Zhao, Z.: Multi-modal speech emotion recognition using self-attention mechanism and multi-scale fusion framework. Speech Commun. 139, 1\u20139 (2022)","journal-title":"Speech Commun."},{"issue":"1","key":"5443_CR31","doi-asserted-by":"publisher","first-page":"951","DOI":"10.1007\/s40747-022-00841-3","volume":"9","author":"Y Xu","year":"2023","unstructured":"Xu, Y., Su, H., Ma, G., Liu, X.: A novel dual-modal emotion recognition algorithm with fusing hybrid features of audio signal and speech context. Complex & Intelligent Systems 9(1), 951\u2013963 (2023)","journal-title":"Complex & Intelligent Systems"},{"issue":"3","key":"5443_CR32","doi-asserted-by":"publisher","first-page":"3918","DOI":"10.1109\/TPAMI.2022.3181116","volume":"45","author":"M Li","year":"2022","unstructured":"Li, M., Huang, P.Y., Chang, X., Hu, J., Yang, Y., Hauptmann, A.: Video pivoting unsupervised multi-modal machine translation. IEEE Trans. Pattern Anal. Mach. Intell. 45(3), 3918\u20133932 (2022)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"5443_CR33","doi-asserted-by":"publisher","DOI":"10.1007\/s11227-025-07412-y","author":"A Kumar","year":"2025","unstructured":"Kumar, A., Kumar, R., Chandra, M.: Enhanced audio classification leveraging pre-trained deep visual models. J. Supercomput. (2025). https:\/\/doi.org\/10.1007\/s11227-025-07412-y","journal-title":"J. Supercomput."},{"key":"5443_CR34","doi-asserted-by":"publisher","unstructured":"Jannu, C., Burra, M., Vanambathina, S.D., Parisae, V.: Speech enhancement using neural free attention with multi-stage squeeze temporal convolutional networks. Multimedia Tools and Applications85, 195 (2026) https:\/\/doi.org\/10.1007\/s11042-026-21428-x","DOI":"10.1007\/s11042-026-21428-x"},{"key":"5443_CR35","doi-asserted-by":"publisher","first-page":"335","DOI":"10.1007\/s10579-008-9076-6","volume":"42","author":"C Busso","year":"2008","unstructured":"Busso, C., Bulut, M., Lee, C.C., Kazemzadeh, A., Mower, E., Kim, S.: IEMOCAP: Interactive emotional dyadic motion capture database. Lang. Resour. Eval. 42, 335\u2013359 (2008)","journal-title":"Lang. Resour. Eval."},{"key":"5443_CR36","doi-asserted-by":"crossref","unstructured":"Cao, Q. and Hou, M. and Chen, B. and Zhang, Z. and Lu, G.: Hierarchical network based on the fusion of static and dynamic features for speech emotion recognition. In: ICASSP 2021-2021 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 6334\u20136338 (2021). IEEE","DOI":"10.1109\/ICASSP39728.2021.9414540"},{"key":"5443_CR37","doi-asserted-by":"crossref","unstructured":"Wu, W. and Zhang, C. and Woodland, P. C.: Emotion recognition by fusing time synchronous and time asynchronous representations. In: ICASSP 2021-2021 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 6269\u20136273 (2021). IEEE","DOI":"10.1109\/ICASSP39728.2021.9414880"},{"key":"5443_CR38","doi-asserted-by":"crossref","unstructured":"Guo, L. and Wang, L. and Xu, C. and Dang, J. and Chng, E. S. and Li, H.: Representation learning with spectro-temporal-channel attention for speech emotion recognition. In: ICASSP 2021-2021 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 6304\u20136308 (2021). IEEE","DOI":"10.1109\/ICASSP39728.2021.9414006"},{"key":"5443_CR39","doi-asserted-by":"crossref","unstructured":"McAuliffe, M. and Socolof, M. and Mihuc, S. and Wagner, M. and Sonderegger, M.: Montreal forced aligner: Trainable text-speech alignment using kaldi. In: Interspeech, vol. 2017, pp. 498\u2013502 (2017)","DOI":"10.21437\/Interspeech.2017-1386"},{"key":"5443_CR40","doi-asserted-by":"crossref","unstructured":"Zhao, Z. and Wang, Y. and Wang, Y.: Knowledge-Aware Bayesian Co-Attention for Multimodal Emotion Recognition. In: ICASSP IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 1\u20135 (2025). IEEE","DOI":"10.1109\/ICASSP49357.2023.10095798"},{"issue":"19","key":"5443_CR41","doi-asserted-by":"publisher","first-page":"28917","DOI":"10.1007\/s11042-023-14600-0","volume":"82","author":"L Feng","year":"2023","unstructured":"Feng, L., Liu, L.Y., Liu, S.L., Zhou, J., Yang, H.Q., Yang, J.: Multimodal speech emotion recognition based on multi-scale MFCCs and multi-view attention mechanism. Multimedia Tools and Applications 82(19), 28917\u201328935 (2023)","journal-title":"Multimedia Tools and Applications"},{"issue":"17","key":"5443_CR42","doi-asserted-by":"publisher","first-page":"8478","DOI":"10.1007\/s10489-024-05630-8","volume":"54","author":"J Lei","year":"2024","unstructured":"Lei, J., Wang, J., Wang, Y.: Multi-level attention fusion network assisted by relative entropy alignment for multimodal speech emotion recognition. Appl. Intell. 54(17), 8478\u20138490 (2024)","journal-title":"Appl. Intell."}],"container-title":["Signal, Image and Video Processing"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11760-026-05443-x.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11760-026-05443-x","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11760-026-05443-x.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,7,1]],"date-time":"2026-07-01T17:54:31Z","timestamp":1782928471000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11760-026-05443-x"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,6]]},"references-count":42,"journal-issue":{"issue":"7","published-print":{"date-parts":[[2026,6]]}},"alternative-id":["5443"],"URL":"https:\/\/doi.org\/10.1007\/s11760-026-05443-x","relation":{},"ISSN":["1863-1703","1863-1711"],"issn-type":[{"value":"1863-1703","type":"print"},{"value":"1863-1711","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026,6]]},"assertion":[{"value":"17 October 2025","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"25 April 2026","order":2,"name":"revised","label":"Revised","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"14 May 2026","order":3,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"2 June 2026","order":4,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"All authors declare no conflict of interest.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflict of interest"}}],"article-number":"391"}}