{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,29]],"date-time":"2026-05-29T12:11:02Z","timestamp":1780056662382,"version":"3.54.0"},"reference-count":66,"publisher":"Springer Science and Business Media LLC","issue":"9","license":[{"start":{"date-parts":[[2026,4,21]],"date-time":"2026-04-21T00:00:00Z","timestamp":1776729600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2026,4,21]],"date-time":"2026-04-21T00:00:00Z","timestamp":1776729600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Neural Comput &amp; Applic"],"published-print":{"date-parts":[[2026,5]]},"DOI":"10.1007\/s00521-026-12056-5","type":"journal-article","created":{"date-parts":[[2026,4,21]],"date-time":"2026-04-21T05:11:16Z","timestamp":1776748276000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["Efficient audiovisual fusion architectures for emotion recognition"],"prefix":"10.1007","volume":"38","author":[{"given":"Leila Ben","family":"Letaifa","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Amine","family":"Bohi","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2026,4,21]]},"reference":[{"key":"12056_CR1","doi-asserted-by":"publisher","DOI":"10.1109\/taffc.2025.3558141","author":"C Palmero","year":"2025","unstructured":"Palmero C, deVelasco M, Hmani MA, Mtibaa A, Letaifa LB, Buch-Cardona P, Justo R, Amorese T, Gonz\u00e1lez-Fraile E, Fern\u00e1ndez-Ruanova B, Tenorio-Laranga J, Johansen AT, Silva MR, Martinussen LJ, Korsnes MS, Cordasco G, Esposito A, El-Yacoubi MA, Petrovska-Delacr\u00e9taz D, Torres MI, Escalera S (2025) Exploring emotion expression recognition in older adults interacting with a virtual coach. IEEE Trans Affect Comput. https:\/\/doi.org\/10.1109\/taffc.2025.3558141","journal-title":"IEEE Trans Affect Comput"},{"key":"12056_CR2","unstructured":"Rios A, Reichel U, Bhuvaneshwara C, Filntisis P, Maragos P, Burkhardt F, Eyben F, Schuller B, Nunnari F, Ebling S (2023) Multimodal recognition of valence, arousal and dominance via late-fusion of text, audio and facial expressions. In: Proceedings of the European Symposium on Artificial Neural Networks, Computational Intelligence and Machine Learning (ESANN 2023)"},{"key":"12056_CR3","doi-asserted-by":"publisher","first-page":"6125","DOI":"10.1007\/s12652-020-01983-3","volume":"11","author":"R Justo","year":"2020","unstructured":"Justo R, Letaifa LB, Palmero C, Fraile EG, Johansen AT, Vazquez A, Cordasco G, Schlogl S, Ruanova BF, Silva MR, Escalera S, Velasco MD, Laranga JT, Esposito A, Kornes M, Torres MI (2020) Analysis of the interaction between elderly people and a simulated virtual coach. J Ambient Intell Humaniz Comput 11:6125\u20136140","journal-title":"J Ambient Intell Humaniz Comput"},{"key":"12056_CR4","doi-asserted-by":"publisher","DOI":"10.1017\/ATSIP.2014.11","author":"C-H Wu","year":"2014","unstructured":"Wu C-H, Lin J-C, Wei W-L (2014) Survey on audiovisual emotion recognition: databases, features, and data fusion strategies. APSIPA Trans Signal Inf Process. https:\/\/doi.org\/10.1017\/ATSIP.2014.11","journal-title":"APSIPA Trans Signal Inf Process"},{"key":"12056_CR5","unstructured":"Joze HRV, Shaban A, Iuzzolino ML, Koishida K (2020) MMTM: Multimodal Transfer Module for CNN Fusion. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR)"},{"key":"12056_CR6","doi-asserted-by":"publisher","first-page":"7921","DOI":"10.1007\/s11042-016-3428-9","volume":"76","author":"D Ghimire","year":"2017","unstructured":"Ghimire D, Lee J, Li Z-N, Jeong S (2017) Recognition of facial expressions based on salient geometric features and support vector machines. Multimedia Tools Appl 76:7921\u20137946","journal-title":"Multimedia Tools Appl"},{"issue":"1","key":"12056_CR7","doi-asserted-by":"publisher","first-page":"172","DOI":"10.1109\/TIP.2006.884954","volume":"16","author":"I Kotsia","year":"2006","unstructured":"Kotsia I, Pitas I (2006) Facial expression recognition in image sequences using geometric deformation features and support vector machines. IEEE Trans Image Process 16(1):172\u2013187","journal-title":"IEEE Trans Image Process"},{"issue":"6","key":"12056_CR8","doi-asserted-by":"publisher","first-page":"803","DOI":"10.1016\/j.imavis.2008.08.005","volume":"27","author":"C Shan","year":"2009","unstructured":"Shan C, Gong S, McOwan PW (2009) Facial expression recognition based on local binary patterns: a comprehensive study. Image Vis Comput 27(6):803\u2013816","journal-title":"Image Vis Comput"},{"key":"12056_CR9","unstructured":"Chen J, Chen Z, Chi Z, Fu H et al (2014) Facial expression recognition based on facial components detection and hog features. In: International Workshops on Electrical and Computer Engineering Subfields, pp. 884\u2013888"},{"key":"12056_CR10","doi-asserted-by":"crossref","unstructured":"Eyben F, W\u00f6llmer M, Schuller B (2010) Opensmile: the munich versatile and fast open-source audio feature extractor. In: Proceedings of the 18th ACM International Conference on Multimedia, pp. 1459\u20131462","DOI":"10.1145\/1873951.1874246"},{"key":"12056_CR11","doi-asserted-by":"crossref","unstructured":"Letaifa L, Torres M, Justo R (2021) Adding dimensional features for emotion recognition on speech. In: Proceedings of the International Conference on Advanced Technologies for Signal and Image Processing","DOI":"10.1109\/ATSIP49331.2020.9231766"},{"issue":"9\u201310","key":"12056_CR12","doi-asserted-by":"publisher","first-page":"1062","DOI":"10.1016\/j.specom.2011.01.011","volume":"53","author":"B Schuller","year":"2011","unstructured":"Schuller B, Batliner A, Steidl S, Seppi D (2011) Recognising realistic emotions and affect in speech: state of the art and lessons learnt from the first challenge. Speech Commun 53(9\u201310):1062\u20131087","journal-title":"Speech Commun"},{"key":"12056_CR13","doi-asserted-by":"crossref","unstructured":"Zhang T (2018) Facial expression recognition based on deep learning: a survey. In: Advances in Intelligent Systems and Interactive Applications: Proceedings of the 2nd International Conference on Intelligent and Interactive Systems and Applications (IISA2017), pp. 345\u2013352 Springer","DOI":"10.1007\/978-3-319-69096-4_48"},{"issue":"3","key":"12056_CR14","doi-asserted-by":"publisher","first-page":"1195","DOI":"10.1109\/TAFFC.2020.2981446","volume":"13","author":"S Li","year":"2020","unstructured":"Li S, Deng W (2020) Deep facial expression recognition: a survey. IEEE Trans Affect Comput 13(3):1195\u20131215","journal-title":"IEEE Trans Affect Comput"},{"key":"12056_CR15","doi-asserted-by":"publisher","DOI":"10.1016\/j.bspc.2020.101894","volume":"59","author":"D Issa","year":"2020","unstructured":"Issa D, Demirci MF, Yazici A (2020) Speech emotion recognition with deep convolutional neural networks. Biomed Signal Process Control 59:101894","journal-title":"Biomed Signal Process Control"},{"key":"12056_CR16","doi-asserted-by":"publisher","first-page":"55939","DOI":"10.1109\/ACCESS.2021.3071485","volume":"9","author":"LB Letaifa","year":"2021","unstructured":"Letaifa LB, Torres MI (2021) Perceptual borderline for balancing multi-class spontaneous emotional data. IEEE Access 9:55939\u201355954","journal-title":"IEEE Access"},{"issue":"6","key":"12056_CR17","doi-asserted-by":"publisher","first-page":"5235","DOI":"10.1007\/s00521-024-10938-0","volume":"37","author":"A Bohi","year":"2025","unstructured":"Bohi A, Boudouri YE, Sfeir I (2025) A novel deep learning approach for facial emotion recognition: application to detecting emotional responses in elderly individuals with Alzheimer\u2019s disease. Neural Comput Appl 37(6):5235\u20135253","journal-title":"Neural Comput Appl"},{"key":"12056_CR18","doi-asserted-by":"crossref","unstructured":"El Boudouri Y, Bohi A (2023) Emonext: an adapted convnext for facial emotion recognition. In: 2023 IEEE 25th International Workshop on Multimedia Signal Processing (MMSP), pp. 1\u20136 IEEE","DOI":"10.1109\/MMSP59012.2023.10337732"},{"key":"12056_CR19","doi-asserted-by":"crossref","unstructured":"Letaifa LB, Rouas J (2022) Transformer model compression for end-to-end speech recognition on mobile devices. In: Proceedings of the 30th European Signal Processing Conference (EUSIPCO 2022), Belgrade, Serbia, pp. 439\u2013443","DOI":"10.23919\/EUSIPCO55093.2022.9909765"},{"key":"12056_CR20","doi-asserted-by":"crossref","unstructured":"Rouas J, Brazier C, Letaifa LB, Medina R, Palacios P, Atienza D, Ansaloni G (2025) Structured pruning for efficient systolic array accelerated cascade speech-to-text translation. In: Proceedings of the 26th Annual Interspeech Conference, Interspeech 2025","DOI":"10.21437\/Interspeech.2025-478"},{"key":"12056_CR21","doi-asserted-by":"crossref","unstructured":"Oujabour M, Letaifa LB, Dollinger J, Rouas J (2025) Adaptive compression of supervised and self-supervised models for green speech recognition. In: Proceedings of the 2025 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), Hyderabad, India","DOI":"10.1109\/ICASSP49660.2025.10888220"},{"key":"12056_CR22","doi-asserted-by":"crossref","unstructured":"Goodfellow IJ, Erhan D, Carrier PL, Courville A, Mirza M, Hamner B, Cukierski W, Tang Y, Thaler D, Lee D-H, et al (2013) Challenges in representation learning: A report on three machine learning contests. In: Neural Information Processing. 20th International Conference, ICONIP, pp. 117\u2013124 Springer","DOI":"10.1007\/978-3-642-42051-1_16"},{"key":"12056_CR23","doi-asserted-by":"crossref","unstructured":"Li S, Deng W, Du J (2017) Reliable crowdsourcing and deep locality-preserving learning for expression recognition in the wild. In: 2017 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pp. 2584\u20132593 IEEE","DOI":"10.1109\/CVPR.2017.277"},{"issue":"1","key":"12056_CR24","doi-asserted-by":"publisher","first-page":"18","DOI":"10.1109\/TAFFC.2017.2740923","volume":"10","author":"A Mollahosseini","year":"2017","unstructured":"Mollahosseini A, Hasani B, Mahoor MH (2017) Affectnet: a database for facial expression, valence, and arousal computing in the wild. IEEE Trans Affect Comput 10(1):18\u201331","journal-title":"IEEE Trans Affect Comput"},{"key":"12056_CR25","doi-asserted-by":"crossref","unstructured":"Farzaneh AH, Qi X (2021) Facial expression recognition in the wild via deep attentive center loss. In: Proceedings of the IEEE\/CVF Winter Conference on Applications of Computer Vision, pp. 2402\u20132411","DOI":"10.1109\/WACV48630.2021.00245"},{"issue":"9","key":"12056_CR26","doi-asserted-by":"publisher","DOI":"10.3390\/info13090419","volume":"13","author":"R Pecoraro","year":"2022","unstructured":"Pecoraro R, Basile V, Bono V (2022) Local multi-head channel self-attention for facial expression recognition. Information 13(9):419","journal-title":"Information"},{"issue":"10","key":"12056_CR27","doi-asserted-by":"publisher","DOI":"10.3390\/sym14102055","volume":"14","author":"B Han","year":"2022","unstructured":"Han B, Hu M, Wang X, Ren F (2022) A triple-structure network model based upon mobilenet v1 and multi-loss function for facial expression recognition. Symmetry 14(10):2055","journal-title":"Symmetry"},{"key":"12056_CR28","doi-asserted-by":"publisher","first-page":"26756","DOI":"10.1109\/ACCESS.2022.3156598","volume":"10","author":"AP Fard","year":"2022","unstructured":"Fard AP, Mahoor MH (2022) Ad-corre: adaptive correlation-based loss for facial expression recognition in the wild. IEEE Access 10:26756\u201326768","journal-title":"IEEE Access"},{"key":"12056_CR29","doi-asserted-by":"publisher","DOI":"10.1007\/s41095-023-0369-x","author":"F Zhang","year":"2024","unstructured":"Zhang F, Chen G, Wang H, Zhang C (2024) Cf-dan: facial-expression recognition based on cross-fusion dual-attention network. Comput Vis Media. https:\/\/doi.org\/10.1007\/s41095-023-0369-x","journal-title":"Comput Vis Media"},{"key":"12056_CR30","doi-asserted-by":"crossref","unstructured":"Zheng C, Mendieta M, Chen C (2023) Poster: A pyramid cross-fusion transformer network for facial expression recognition. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision, pp. 3146\u20133155","DOI":"10.1109\/ICCVW60793.2023.00339"},{"issue":"15","key":"12056_CR31","doi-asserted-by":"publisher","first-page":"6471","DOI":"10.3390\/app14156471","volume":"14","author":"Y Tian","year":"2024","unstructured":"Tian Y, Zhu J, Yao H, Chen D (2024) Facial expression recognition based on vision transformer with hybrid local attention. Appl Sci 14(15):6471","journal-title":"Appl Sci"},{"issue":"3","key":"12056_CR32","doi-asserted-by":"publisher","first-page":"1968","DOI":"10.3390\/app13031968","volume":"13","author":"X Lu","year":"2023","unstructured":"Lu X, Zhang H, Zhang Q, Han X (2023) Multi-channel expression recognition network based on channel weighting. Appl Sci 13(3):1968","journal-title":"Appl Sci"},{"key":"12056_CR33","doi-asserted-by":"crossref","unstructured":"Yahyaoui MA, Oujabour M, Ben Letaifa L, Bohi A (2025) Multi-Face Emotion Detection for Effective Human-Robot Interaction. In: Proceedings of the 17th International Conference on Agents and Artificial Intelligence - Volume 1: ICAART, pp. 91\u201399 INSTICC","DOI":"10.5220\/0013170300003890"},{"issue":"3","key":"12056_CR34","doi-asserted-by":"publisher","first-page":"776","DOI":"10.3390\/math11030776","volume":"11","author":"SB Punuri","year":"2023","unstructured":"Punuri SB, Kuanar SK, Kolhar M, Mishra TK, Alameen A, Mohapatra H, Mishra SR (2023) Efficient net-xgboost: an implementation for facial emotion recognition using transfer learning. Mathematics 11(3):776","journal-title":"Mathematics"},{"key":"12056_CR35","doi-asserted-by":"crossref","unstructured":"Xiang P, Lin C, Wu K, Bai O (2024) Multimae-der: Multimodal masked autoencoder for dynamic emotion recognition. In: 2024 14th International Conference on Pattern Recognition Systems (ICPRS), pp. 1\u20137 IEEE","DOI":"10.1109\/ICPRS62101.2024.10677820"},{"issue":"8","key":"12056_CR36","doi-asserted-by":"publisher","first-page":"1301","DOI":"10.1109\/JSTSP.2017.2764438","volume":"11","author":"P Tzirakis","year":"2017","unstructured":"Tzirakis P, Trigeorgis G, Nicolaou MA, Schuller BW, Zafeiriou S (2017) End-to-end multimodal emotion recognition using deep neural networks. IEEE J Sel Top Signal Process 11(8):1301\u20131309","journal-title":"IEEE J Sel Top Signal Process"},{"key":"12056_CR37","doi-asserted-by":"publisher","first-page":"335","DOI":"10.1007\/s10579-008-9076-6","volume":"42","author":"C Busso","year":"2008","unstructured":"Busso C, Bulut M, Lee C-C, Kazemzadeh A, Mower E, Kim S, Chang JN, Lee S, Narayanan SS (2008) Iemocap: interactive emotional dyadic motion capture database. Lang Resour Eval 42:335\u2013359","journal-title":"Lang Resour Eval"},{"issue":"6","key":"12056_CR38","doi-asserted-by":"publisher","first-page":"907","DOI":"10.1007\/s11263-019-01158-4","volume":"127","author":"D Kollias","year":"2019","unstructured":"Kollias D, Tzirakis P, Nicolaou MA, Papaioannou A, Zhao G, Schuller B, Kotsia I, Zafeiriou S (2019) Deep affect prediction in-the-wild: Aff-wild database and challenge, deep architectures, and beyond. Int J Comput Vis 127(6):907\u2013929","journal-title":"Int J Comput Vis"},{"issue":"22","key":"12056_CR39","doi-asserted-by":"publisher","first-page":"7665","DOI":"10.3390\/s21227665","volume":"21","author":"C Luna-Jim\u00e9nez","year":"2021","unstructured":"Luna-Jim\u00e9nez C, Griol D, Callejas Z, Kleinlein R, Montero JM, Fern\u00e1ndez-Mart\u00ednez F (2021) Multimodal emotion recognition on ravdess dataset using transfer learning. Sensors 21(22):7665","journal-title":"Sensors"},{"issue":"4","key":"12056_CR40","doi-asserted-by":"publisher","first-page":"377","DOI":"10.1109\/TAFFC.2014.2336244","volume":"5","author":"H Cao","year":"2014","unstructured":"Cao H, Cooper DG, Keutmann MK, Gur RC, Nenkova A, Verma R (2014) Crema-d: crowd-sourced emotional multimodal actors dataset. IEEE Trans Affect Comput 5(4):377\u2013390. https:\/\/doi.org\/10.1109\/TAFFC.2014.2336244","journal-title":"IEEE Trans Affect Comput"},{"key":"12056_CR41","unstructured":"Letaifa LB, Develasco M, Justo R, Torres MI (2019) First steps to develop a corpus of interactions between elderly and virtual agents in spanish with emotion. In: International Conference on Statistical Language and Speech Processing"},{"key":"12056_CR42","doi-asserted-by":"crossref","unstructured":"Justo R, Letaifa LB, Olaso JM, L\u00f3pez-Zorrilla A, Develasco M, V\u00e1zquez A, Torres MI (2021) A spanish corpus for talking to the elderly. Conversational Dialogue Systems for the Next Decade, 183\u2013192","DOI":"10.1007\/978-981-15-8395-7_13"},{"key":"12056_CR43","doi-asserted-by":"crossref","unstructured":"Farhat N, Bohi A, Letaifa LB, Slama R (2024) Cg-mer: a card game-based multimodal dataset for emotion recognition. In: Sixteenth International Conference on Machine Vision (ICMV 2023), vol. 13072, pp. 399\u2013406. SPIE","DOI":"10.1117\/12.3023377"},{"key":"12056_CR44","doi-asserted-by":"publisher","DOI":"10.1007\/s12193-025-00468-x","author":"L Ben Letaifa","year":"2025","unstructured":"Ben Letaifa L, Bohi A, Slama R (2025) The cg-mer dyadic multimodal dataset for spontaneous french conversations: annotation, analysis and assessment benchmark. J Multimodal User Interfaces. https:\/\/doi.org\/10.1007\/s12193-025-00468-x","journal-title":"J Multimodal User Interfaces"},{"key":"12056_CR45","unstructured":"Lian Z, Li Y, Tao J, Huang J (2018) Investigation of multimodal features, classifiers and fusion methods for emotion recognition. arXiv preprint arXiv:1809.06225"},{"key":"12056_CR46","doi-asserted-by":"crossref","unstructured":"Zhang S, Ding Y, Wei Z, Guan C (2021) Continuous emotion recognition with audio-visual leader-follower attentive fusion. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision, pp. 3567\u20133574","DOI":"10.1109\/ICCVW54120.2021.00397"},{"key":"12056_CR47","doi-asserted-by":"publisher","first-page":"94557","DOI":"10.1109\/ACCESS.2021.3092735","volume":"9","author":"S Lee","year":"2021","unstructured":"Lee S, Han DK, Ko H (2021) Multimodal emotion recognition fusion analysis adapting bert with heterogeneous feature unification. IEEE Access 9:94557\u201394572","journal-title":"IEEE Access"},{"issue":"1","key":"12056_CR48","doi-asserted-by":"publisher","first-page":"327","DOI":"10.3390\/app12010327","volume":"12","author":"C Luna-Jim\u00e9nez","year":"2021","unstructured":"Luna-Jim\u00e9nez C, Kleinlein R, Griol D, Callejas Z, Montero JM, Fern\u00e1ndez-Mart\u00ednez F (2021) A proposal for multimodal emotion recognition using aural transformers and action units on ravdess dataset. Appl Sci 12(1):327","journal-title":"Appl Sci"},{"issue":"4","key":"12056_CR49","doi-asserted-by":"publisher","first-page":"2156","DOI":"10.1109\/TAFFC.2022.3216993","volume":"13","author":"L Goncalves","year":"2022","unstructured":"Goncalves L, Busso C (2022) Robust audiovisual emotion recognition: aligning modalities, capturing temporal information, and handling missing features. IEEE Trans Affect Comput 13(4):2156\u20132170","journal-title":"IEEE Trans Affect Comput"},{"key":"12056_CR50","doi-asserted-by":"crossref","unstructured":"Deng J, Dong W, Socher R, Li L-J, Li K, Fei-Fei L (2009) Imagenet: A large-scale hierarchical image database. In: 2009 IEEE Conference on Computer Vision and Pattern Recognition, pp. 248\u2013255 Ieee","DOI":"10.1109\/CVPR.2009.5206848"},{"issue":"2","key":"12056_CR51","doi-asserted-by":"publisher","first-page":"423","DOI":"10.1109\/TPAMI.2018.2798607","volume":"41","author":"T Baltru\u0161aitis","year":"2018","unstructured":"Baltru\u0161aitis T, Ahuja C, Morency L-P (2018) Multimodal machine learning: a survey and taxonomy. IEEE Trans Pattern Anal Mach Intell 41(2):423\u2013443","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"12056_CR52","unstructured":"Vaswani A, Shazeer N, Parmar N, Uszkoreit J, Jones L, Gomez AN, Kaiser L, Polosukhin I (2017) Attention is all you need. In: Advances in Neural Information Processing Systems (NeurIPS), pp. 5998\u20136008"},{"issue":"9","key":"12056_CR53","doi-asserted-by":"publisher","DOI":"10.3390\/a16090398","volume":"16","author":"L Ben Letaifa","year":"2023","unstructured":"Ben Letaifa L, Rouas J-L (2023) Variable scale pruning for transformer model compression in end-to-end speech recognition. Algorithms 16(9):398. https:\/\/doi.org\/10.3390\/a16090398","journal-title":"Algorithms"},{"key":"12056_CR54","unstructured":"Howard AG, Zhu M, Chen B, Kalenichenko D, Wang W, Weyand T, Andreetto M, Adam H (2017) Mobilenets: Efficient convolutional neural networks for mobile vision applications. arXiv preprint arXiv:1704.04861"},{"key":"12056_CR55","doi-asserted-by":"crossref","unstructured":"Huang G, Liu Z, Van Der Maaten L, Weinberger KQ (2017) Densely connected convolutional networks. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 4700\u20134708","DOI":"10.1109\/CVPR.2017.243"},{"key":"12056_CR56","doi-asserted-by":"crossref","unstructured":"He K, Zhang X, Ren S, Sun J (2016) Identity mappings in deep residual networks. In: Computer Vision\u2013ECCV 2016: 14th European Conference, Amsterdam, The Netherlands, October 11\u201314, 2016, Proceedings, Part IV 14, pp. 630\u2013645 Springer","DOI":"10.1007\/978-3-319-46493-0_38"},{"key":"12056_CR57","doi-asserted-by":"crossref","unstructured":"He K, Zhang X, Ren S, Sun J (2016) Deep residual learning for image recognition. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 770\u2013778","DOI":"10.1109\/CVPR.2016.90"},{"key":"12056_CR58","doi-asserted-by":"crossref","unstructured":"Chollet F (2017) Xception: Deep learning with depthwise separable convolutions. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 1251\u20131258","DOI":"10.1109\/CVPR.2017.195"},{"key":"12056_CR59","unstructured":"Tan M, Le Q (2021) Efficientnetv2: Smaller models and faster training. In: International Conference on Machine Learning, pp. 10096\u201310106 PMLR"},{"key":"12056_CR60","doi-asserted-by":"crossref","unstructured":"Szegedy C, Ioffe S, Vanhoucke V, Alemi A (2017) Inception-v4, inception-resnet and the impact of residual connections on learning. In: Proceedings of the AAAI Conference on Artificial Intelligence, vol. 31","DOI":"10.1609\/aaai.v31i1.11231"},{"key":"12056_CR61","unstructured":"Karen S (2014) Very deep convolutional networks for large-scale image recognition. arXiv preprint arXiv: 1409.1556"},{"key":"12056_CR62","doi-asserted-by":"crossref","unstructured":"Liu Z, Mao H, Wu C-Y, Feichtenhofer C, Darrell T, Xie S (2022) A convnet for the 2020s. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 11976\u201311986","DOI":"10.1109\/CVPR52688.2022.01167"},{"key":"12056_CR63","unstructured":"Zouari L (2007) Vers le temps r\u00e9el en transcription automatique de la parole grand vocabulaire. PhD thesis"},{"key":"12056_CR64","unstructured":"Gradilla R (2020) Multi-task cascaded convolutional networks (mtcnn) for face detection and facial landmark alignment Accessed: 2020"},{"key":"12056_CR65","doi-asserted-by":"publisher","first-page":"38","DOI":"10.1016\/j.patrec.2022.07.012","volume":"161","author":"S Verbitskiy","year":"2022","unstructured":"Verbitskiy S, Berikov V, Vyshegorodtsev V (2022) Eranns: Efficient residual audio neural networks for audio pattern recognition. Pattern Recognit Lett 161:38\u201344","journal-title":"Pattern Recognit Lett"},{"key":"12056_CR66","doi-asserted-by":"crossref","unstructured":"Chumachenko K, Iosifidis A, Gabbouj M (2022) Self-attention fusion for audiovisual emotion recognition with incomplete data. In: 2022 26th International Conference on Pattern Recognition (ICPR), pp. 2822\u20132828","DOI":"10.1109\/ICPR56361.2022.9956592"}],"container-title":["Neural Computing and Applications"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00521-026-12056-5.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s00521-026-12056-5","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00521-026-12056-5.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,5,29]],"date-time":"2026-05-29T11:51:07Z","timestamp":1780055467000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s00521-026-12056-5"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,4,21]]},"references-count":66,"journal-issue":{"issue":"9","published-print":{"date-parts":[[2026,5]]}},"alternative-id":["12056"],"URL":"https:\/\/doi.org\/10.1007\/s00521-026-12056-5","relation":{},"ISSN":["0941-0643","1433-3058"],"issn-type":[{"value":"0941-0643","type":"print"},{"value":"1433-3058","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026,4,21]]},"assertion":[{"value":"9 September 2025","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"25 February 2026","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"21 April 2026","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors have no relevant financial or non-financial interests to disclose. There are no competing interests to declare that are relevant to the content of this article. All authors certify that they have no affiliations with or involvement in any organization or entity with any financial interest or non-financial interest in the subject matter or materials discussed in this manuscript. Furthermore, the authors have no financial or proprietary interests in any material discussed in this article.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Competing interests"}}],"article-number":"320"}}