{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,15]],"date-time":"2026-07-15T11:17:27Z","timestamp":1784114247852,"version":"3.55.0"},"reference-count":30,"publisher":"Springer Science and Business Media LLC","issue":"3","license":[{"start":{"date-parts":[[2024,8,31]],"date-time":"2024-08-31T00:00:00Z","timestamp":1725062400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2024,8,31]],"date-time":"2024-08-31T00:00:00Z","timestamp":1725062400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Int J Speech Technol"],"published-print":{"date-parts":[[2024,9]]},"DOI":"10.1007\/s10772-024-10138-0","type":"journal-article","created":{"date-parts":[[2024,8,31]],"date-time":"2024-08-31T07:01:50Z","timestamp":1725087710000},"page":"817-830","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":22,"title":["Speech emotion recognition for human\u2013computer interaction"],"prefix":"10.1007","volume":"27","author":[{"given":"D.","family":"Thiripurasundari","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Kishor","family":"Bhangale","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"V.","family":"Aashritha","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Sisira","family":"Mondreti","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3938-7495","authenticated-orcid":false,"given":"Mohanaprasad","family":"Kothandaraman","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2024,8,31]]},"reference":[{"issue":"4","key":"10138_CR1","doi-asserted-by":"publisher","first-page":"2525","DOI":"10.1007\/s11277-023-10244-3","volume":"129","author":"MJ Al-Dujaili","year":"2023","unstructured":"Al-Dujaili, M. J., & Ebrahimi-Moghadam, A. (2023). Speech emotion recognition: A comprehensive survey. Wireless Personal Communications, 129(4), 2525\u20132561.","journal-title":"Wireless Personal Communications"},{"issue":"8","key":"10138_CR2","doi-asserted-by":"publisher","first-page":"4750","DOI":"10.3390\/app13084750","volume":"13","author":"AS Alluhaidan","year":"2023","unstructured":"Alluhaidan, A. S., Saidani, O., Jahangir, R., Nauman, M. A., & Neffati, O. S. (2023). Speech emotion recognition through hybrid features and convolutional neural network. Applied Sciences, 13(8), 4750.","journal-title":"Applied Sciences"},{"key":"10138_CR3","doi-asserted-by":"publisher","first-page":"36018","DOI":"10.1109\/ACCESS.2022.3163856","volume":"10","author":"F Andayani","year":"2022","unstructured":"Andayani, F., Lau, B. T., Mark, K. T., & Chua, C. (2022). Hybrid LSTM-transformer model for emotion recognition from speech audio files. IEEE Access, 10, 36018\u201336027.","journal-title":"IEEE Access"},{"key":"10138_CR4","unstructured":"Aouf, A. (2019, September 21). Basic Arabic vocal emotions dataset (BAVED)\u2014Github. https:\/\/github.com\/40uf411\/Basic-Arabic-Vocal-Emotions-Dataset"},{"issue":"2","key":"10138_CR5","doi-asserted-by":"publisher","first-page":"1913","DOI":"10.1007\/s11277-022-09640-y","volume":"125","author":"KB Bhangale","year":"2022","unstructured":"Bhangale, K. B., & Kothandaraman, M. (2022). Survey of deep learning paradigms for speech processing. Wireless Personal Communications, 125(2), 1913\u20131949.","journal-title":"Wireless Personal Communications"},{"issue":"4","key":"10138_CR6","doi-asserted-by":"publisher","first-page":"839","DOI":"10.3390\/electronics12040839","volume":"12","author":"KB Bhangale","year":"2023","unstructured":"Bhangale, K. B., & Kothandaraman, M. (2023a). Speech emotion recognition based on multiple acoustic features and deep convolutional neural networks. Electronics, 12(4), 839.","journal-title":"Electronics"},{"key":"10138_CR7","doi-asserted-by":"publisher","DOI":"10.1016\/j.apacoust.2023.109613","volume":"212","author":"KB Bhangale","year":"2023","unstructured":"Bhangale, K. B., & Kothandaraman, M. (2023b). Speech emotion recognition using the novel PEmoNet (Parallel Emotion Network). Applied Acoustics, 212, 109613.","journal-title":"Applied Acoustics"},{"issue":"4","key":"10138_CR8","doi-asserted-by":"publisher","first-page":"2341","DOI":"10.1007\/s00034-023-02562-5","volume":"43","author":"KB Bhangale","year":"2024","unstructured":"Bhangale, K. B., & Kothandaraman, M. (2024). Speech emotion recognition using generative adversarial network and deep convolutional neural network. Circuits, Systems, and Signal Processing, 43(4), 2341\u20132384.","journal-title":"Circuits, Systems, and Signal Processing"},{"key":"10138_CR9","doi-asserted-by":"crossref","unstructured":"Bhangale, K., & Mohanaprasad, K. (2020). Speech emotion recognition using Mel frequency log spectrogram and deep convolutional neural network. In International conference on futuristic communication and network technologies (VICFCNT 2020) (pp. 241\u2013250). Springer.","DOI":"10.1007\/978-981-16-4625-6_24"},{"key":"10138_CR10","first-page":"1517","volume":"5","author":"F Burkhardt","year":"2005","unstructured":"Burkhardt, F., Paeschke, A., Rolfes, M., Sendlmeier, W. F., & Weiss, B. (2005). A database of German emotional speech. Interspeech, 5, 1517\u20131520.","journal-title":"Interspeech"},{"key":"10138_CR11","doi-asserted-by":"crossref","unstructured":"Cai, L., Dong, J., & Wei, M. (2020). Multi-modal emotion recognition from speech and facial expression based on deep learning. In 2020 Chinese automation congress (CAC 2020). IEEE.","DOI":"10.1109\/CAC51589.2020.9327178"},{"key":"10138_CR12","unstructured":"Costantini, G., Iaderola, I., Paoloni, A., & Todisco, M. (2014). EMOVO corpus: An Italian emotional speech database. In Proceedings of the ninth international conference on language resources and evaluation (LREC'14) (pp. 3501\u20133504). European Language Resources Association (ELRA)."},{"key":"10138_CR20","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1016\/j.neucom.2023.01.002","volume":"528","author":"J de Lope","year":"2023","unstructured":"de Lope, J., & Grana, M. (2023). An ongoing review of speech emotion recognition. Neurocomputing, 528, 1\u201311.","journal-title":"Neurocomputing"},{"key":"10138_CR13","doi-asserted-by":"publisher","first-page":"221640","DOI":"10.1109\/ACCESS.2020.3043201","volume":"8","author":"MB Er","year":"2020","unstructured":"Er, M. B. (2020). A novel approach for classification of speech emotions based on deep and acoustic features. IEEE Access, 8, 221640\u2013221653.","journal-title":"IEEE Access"},{"key":"10138_CR14","doi-asserted-by":"crossref","unstructured":"Gupta, N., Thakur, V., Patil, V., Vishnoi, T., & Bhangale, K. (2023, May). Analysis of affective computing for Marathi corpus using deep learning. In 2023 4th International conference for emerging technology (INCET 2023) (pp. 1\u20138). IEEE.","DOI":"10.1109\/INCET57972.2023.10170346"},{"key":"10138_CR15","doi-asserted-by":"publisher","DOI":"10.1016\/j.bspc.2020.101894","volume":"59","author":"D Issa","year":"2020","unstructured":"Issa, D., Demirci, M. F., & Yazici, A. (2020). Speech emotion recognition with deep convolutional neural networks. Biomedical Signal Processing and Control, 59, 101894.","journal-title":"Biomedical Signal Processing and Control"},{"issue":"1","key":"10138_CR16","doi-asserted-by":"publisher","first-page":"1523","DOI":"10.32604\/cmc.2023.028631","volume":"74","author":"S Kumar","year":"2023","unstructured":"Kumar, S., Haq, M. A., Jain, A., Jason, C. A., Moparthi, N. R., Mittal, N., & Alzamil, Z. S. (2023). Multilayer neural network based speech emotion recognition for smart assistance. Computers, Materials and Continua, 74(1), 1523\u20131540.","journal-title":"Computers, Materials and Continua"},{"issue":"7","key":"10138_CR19","doi-asserted-by":"publisher","first-page":"1010","DOI":"10.3390\/e24071010","volume":"24","author":"F Liu","year":"2022","unstructured":"Liu, F., Shen, S. Y., Fu, Z. W., Wang, H. Y., Zhou, A. M., & Qi, J. Y. (2022). LGCCT: A light gated and crossed complementation transformer for multimodal speech emotion recognition. Entropy, 24(7), 1010.","journal-title":"Entropy"},{"issue":"21","key":"10138_CR17","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1007\/s11042-023-17829-x","volume":"83","author":"Y Liu","year":"2024","unstructured":"Liu, Y., Chen, A., Zhou, G., Yi, J., Xiang, J., & Wang, Y. (2024). Combined CNN LSTM with attention for speech emotion recognition based on feature-level fusion. Multimedia Tools and Applications, 83(21), 1\u201321.","journal-title":"Multimedia Tools and Applications"},{"key":"10138_CR18","doi-asserted-by":"publisher","DOI":"10.1016\/j.apacoust.2022.109178","volume":"202","author":"ZT Liu","year":"2023","unstructured":"Liu, Z. T., Han, M. T., Wu, B. H., & Rehman, A. (2023). Speech emotion recognition based on convolutional neural network with attention-based bidirectional long short-term memory network and multi-task learning. Applied Acoustics, 202, 109178.","journal-title":"Applied Acoustics"},{"key":"10138_CR21","doi-asserted-by":"publisher","DOI":"10.1016\/j.iswa.2023.200266","volume":"20","author":"S Madanian","year":"2023","unstructured":"Madanian, S., Chen, T., Adeleye, O., Templeton, J. M., Poellabauer, C., Parry, D., & Schneider, S. L. (2023). Speech emotion recognition using machine learning\u2014A systematic review. Intelligent Systems with Applications, 20, 200266.","journal-title":"Intelligent Systems with Applications"},{"key":"10138_CR22","doi-asserted-by":"publisher","first-page":"125868","DOI":"10.1109\/ACCESS.2019.2938007","volume":"7","author":"H Meng","year":"2019","unstructured":"Meng, H., Yan, T., Yuan, F., & Wei, H. (2019). Speech emotion recognition from 3D log-Mel spectrograms with deep learning network. IEEE Access, 7, 125868\u2013125881.","journal-title":"IEEE Access"},{"key":"10138_CR23","doi-asserted-by":"crossref","unstructured":"Patamia, R. A., Kingsley, N. A., Sarpong, K., & Tenagyei, E. (2021). Transformer based multimodal speech emotion recognition with improved neural networks. In 2021 IEEE 2nd international conference on pattern recognition and machine learning (PRML 2021). IEEE.","DOI":"10.1109\/PRML52754.2021.9520692"},{"issue":"10","key":"10138_CR24","first-page":"1","volume":"82","author":"S Patnaik","year":"2022","unstructured":"Patnaik, S. (2022). Speech emotion recognition by using complex MFCC and deep sequential model. Multimedia Tools and Applications, 82(10), 1\u201326.","journal-title":"Multimedia Tools and Applications"},{"issue":"6","key":"10138_CR25","doi-asserted-by":"publisher","first-page":"5140","DOI":"10.3390\/ijerph20065140","volume":"20","author":"J Singh","year":"2023","unstructured":"Singh, J., Saheer, L. B., & Faust, O. (2023). Speech emotion recognition using attention model. International Journal of Environmental Research and Public Health, 20(6), 5140.","journal-title":"International Journal of Environmental Research and Public Health"},{"key":"10138_CR26","doi-asserted-by":"crossref","unstructured":"Vlasenko, B., Schuller, B., Wendemuth, A., & Rigoll, G. (2007). Combining frame and turn-level information for robust recognition of emotions within speech. In Proceedings of. INTERSPEECH 2007, Antwerp, Belgium, 2007","DOI":"10.21437\/Interspeech.2007-611"},{"issue":"9","key":"10138_CR27","doi-asserted-by":"publisher","first-page":"10745","DOI":"10.1109\/TPAMI.2023.3263585","volume":"45","author":"J Wagner","year":"2023","unstructured":"Wagner, J., Triantafyllopoulos, A., Wierstorf, H., Schmitt, M., Burkhardt, F., Eyben, F., & Schuller, B. W. (2023). Dawn of the transformer era in speech emotion recognition: Closing the valence gap. IEEE Transactions on Pattern Analysis and Machine Intelligence, 45(9), 10745\u201310759.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"10138_CR28","doi-asserted-by":"publisher","DOI":"10.1016\/j.neucom.2024.128177","volume":"601","author":"Z Yang","year":"2024","unstructured":"Yang, Z., Li, Z., Zhou, S., Zhang, L., & Serikawa, S. (2024). Speech emotion recognition based on multi-feature speed rate and LSTM. Neurocomputing, 601, 128177.","journal-title":"Neurocomputing"},{"issue":"6","key":"10138_CR29","doi-asserted-by":"publisher","first-page":"713","DOI":"10.1049\/iet-spr.2017.0320","volume":"12","author":"J Zhao","year":"2018","unstructured":"Zhao, J., Mao, X., & Chen, L. (2018). Learning deep features to recognise speech emotion using merged deep CNN. IET Signal Processing, 12(6), 713\u2013721.","journal-title":"IET Signal Processing"},{"key":"10138_CR30","doi-asserted-by":"publisher","first-page":"312","DOI":"10.1016\/j.bspc.2018.08.035","volume":"47","author":"J Zhao","year":"2019","unstructured":"Zhao, J., Mao, X., & Chen, L. (2019). Speech emotion recognition using deep 1D and 2D CNN LSTM networks. Biomedical Signal Processing and Control, 47, 312\u2013323.","journal-title":"Biomedical Signal Processing and Control"}],"container-title":["International Journal of Speech Technology"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10772-024-10138-0.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s10772-024-10138-0\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10772-024-10138-0.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,9,12]],"date-time":"2024-09-12T12:14:47Z","timestamp":1726143287000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s10772-024-10138-0"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,8,31]]},"references-count":30,"journal-issue":{"issue":"3","published-print":{"date-parts":[[2024,9]]}},"alternative-id":["10138"],"URL":"https:\/\/doi.org\/10.1007\/s10772-024-10138-0","relation":{},"ISSN":["1381-2416","1572-8110"],"issn-type":[{"value":"1381-2416","type":"print"},{"value":"1572-8110","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024,8,31]]},"assertion":[{"value":"28 April 2024","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"25 August 2024","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"31 August 2024","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"Both authors do not have any conflict of interest.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflict of interest"}}]}}