{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,15]],"date-time":"2026-07-15T11:17:21Z","timestamp":1784114241491,"version":"3.55.0"},"reference-count":27,"publisher":"Springer Science and Business Media LLC","issue":"3","license":[{"start":{"date-parts":[[2025,9,1]],"date-time":"2025-09-01T00:00:00Z","timestamp":1756684800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2025,9,1]],"date-time":"2025-09-01T00:00:00Z","timestamp":1756684800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Int J Speech Technol"],"published-print":{"date-parts":[[2025,9]]},"DOI":"10.1007\/s10772-025-10212-1","type":"journal-article","created":{"date-parts":[[2025,9,19]],"date-time":"2025-09-19T14:10:48Z","timestamp":1758291048000},"page":"761-772","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":2,"title":["Emotion detection in Urdu speech: a deep hybrid learning approach"],"prefix":"10.1007","volume":"28","author":[{"given":"Muhammad","family":"Owais","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Khadija","family":"Sarwar","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Khurram Khan","family":"Jadoon","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Junaid","family":"Yousaf","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2025,9,19]]},"reference":[{"key":"10212_CR1","doi-asserted-by":"publisher","first-page":"49\u2009265","DOI":"10.1109\/ACCESS.2022.3172954","volume":"10","author":"A. A. Abdelhamid","year":"2022","unstructured":"Abdelhamid, A. A., El-Kenawy, E.-S. M., Alotaibi, B., Amer, G. M., Abdelkader, M. Y., Ibrahim, A., & Eid, M. M. (2022). Robust speech emotion recognition using cnn+lstm based on stochastic fractal search optimization algorithm. IEEE Access, 10, \u200949\u2009265\u2013\u200949\u2009284.","journal-title":"IEEE Access"},{"key":"10212_CR2","doi-asserted-by":"publisher","first-page":"122\u2009136","DOI":"10.1109\/ACCESS.2022.3223444","volume":"10","author":"Z. K. Abdul","year":"2022","unstructured":"Abdul, Z. K., & Al-Talabani, A. K. (2022). Mel frequency cepstral coefficient and its applications: A review. IEEE Access, 10, 122\u2009136\u2013\u2009122\u2009158.","journal-title":"IEEE Access"},{"key":"10212_CR3","doi-asserted-by":"crossref","unstructured":"Afzal, S., Khan, H. A., Piran, M. J., and Lee, J. W. (2024). A comprehensive survey on affective computing; challenges, trends, applications, and future directions. IEEE Access.","DOI":"10.1109\/ACCESS.2024.3422480"},{"key":"10212_CR4","doi-asserted-by":"publisher","first-page":"119633","DOI":"10.1016\/j.eswa.2023.119633","volume":"218","author":"M. R. Ahmed","year":"2023","unstructured":"Ahmed, M. R., Islam, S., Islam, A. M., and Shatabda, S. (2023). An ensemble 1d-cnn-lstm-gru model with data augmentation for speech emotion recognition. Expert Systems with Applications, 218, 119633.","journal-title":"Expert Systems with Applications"},{"issue":"1","key":"10212_CR5","doi-asserted-by":"publisher","first-page":"13126","DOI":"10.1038\/s41598-024-63776-4","volume":"14","author":"S. Akinpelu","year":"2024","unstructured":"Akinpelu, S., Viriri, S., & Adegun, A. (2024). An enhanced speech emotion recognition using vision transformer. Scientific Reports, 14(1), 13126.","journal-title":"Scientific Reports"},{"key":"10212_CR6","unstructured":"Ali, H., Ahmad, N., Yahya, K. M., & Farooq, O. (2012). A medium vocabulary Urdu isolated words balanced corpus for automatic speech recognition. In 2012 International conference on electronics computer technology (ICECT 2012) (pp. 473\u2013476."},{"key":"10212_CR7","doi-asserted-by":"publisher","first-page":"e954","DOI":"10.7717\/peerj-cs.954","volume":"8","author":"A. Asghar","year":"2022","unstructured":"Asghar, A., Sohaib, S., Iftikhar, S., Shafi, M., & Fatima, K. (2022). An Urdu speech corpus for emotion recognition. PeerJ Computer Science, 8, e954.","journal-title":"PeerJ Computer Science"},{"issue":"2","key":"10212_CR8","doi-asserted-by":"publisher","first-page":"993","DOI":"10.1007\/s12065-022-00772-5","volume":"17","author":"K. R. Bagadi","year":"2024","unstructured":"Bagadi, K. R., & Sivappagari, C. M. R. (2024). A robust feature selection method based on meta-heuristic optimization for speech emotion recognition. Evolutionary Intelligence, 17(2), 993\u20131004.","journal-title":"Evolutionary Intelligence"},{"key":"10212_CR9","doi-asserted-by":"crossref","unstructured":"Bhavani, R., & Kathirvelu, K. (2024). Advancements in speech recognition: Exploring feature extraction techniques for enhanced accuracy and human-machine communication. In 2024 Fourth international conference on advances in electrical, computing, communication and sustainable technologies (ICAECT) (pp. 1\u20138). IEEE.","DOI":"10.1109\/ICAECT60202.2024.10468885"},{"key":"10212_CR10","doi-asserted-by":"publisher","first-page":"279","DOI":"10.1007\/s10462-016-9482-x","volume":"47","author":"A. Daud","year":"2017","unstructured":"Daud, A., Khan, W., & Che, D. (2017). Urdu language processing: A survey. Artificial Intelligence Review, 47, 279\u2013311.","journal-title":"Artificial Intelligence Review"},{"key":"10212_CR11","doi-asserted-by":"crossref","unstructured":"Desai, P., Chakraborty, S., Sujatha, C., Desai, P., & Ansuman, S. (2023). Speech emotions detection and classification based on speech features using deep neural network. In 2023 first international conference on advances in electrical, electronics and computational intelligence (ICAEECI) (pp. 1\u20137). IEEE.","DOI":"10.1109\/ICAEECI58247.2023.10370971"},{"key":"10212_CR12","doi-asserted-by":"publisher","first-page":"652801","DOI":"10.3389\/fenrg.2021.652801","volume":"9","author":"C. Fan","year":"2021","unstructured":"Fan, C., Chen, M., Wang, X., Wang, J., & Huang, B. (2021). A review on data preprocessing techniques toward efficient and reliable knowledge discovery from building operational data. Frontiers in Energy Research, 9, 652801.","journal-title":"Frontiers in Energy Research"},{"key":"10212_CR13","doi-asserted-by":"crossref","unstructured":"Hossan, M. A., Memon, S., & Gregory, M. A. (2010). A novel approach for mfcc feature extraction. In 2010 4th international conference on signal processing and communication systems (pp. 1\u20135). IEEE.","DOI":"10.1109\/ICSPCS.2010.5709752"},{"issue":"2","key":"10212_CR14","doi-asserted-by":"publisher","first-page":"13\u2009757","DOI":"10.48084\/etasr.7134","volume":"14","author":"W. Ismaiel","year":"2024","unstructured":"Ismaiel, W., Alhalangy, A., Mohamed, A. O., & Musa, A. I. A. (2024). Deep learning, ensemble and supervised machine learning for arabic speech emotion recognition. Engineering, Technology & Applied Science Research, 14(2), \u200913\u2009757\u2013\u200913\u2009764.","journal-title":"Engineering, Technology & Applied Science Research"},{"key":"10212_CR15","doi-asserted-by":"crossref","unstructured":"Jakubec, M., Lieskovska, E., Jarina, R., Spisiak, M., & Kasak, P. (2024). Speech emotion recognition using transfer learning: Integration of advanced speaker embeddings and image recognition models. Applied Sciences, 14(21). Available https:\/\/www.mdpi.com\/2076-3417\/14\/21\/9981","DOI":"10.3390\/app14219981"},{"key":"10212_CR16","unstructured":"Lee, J., Kim, T., Park, J., & Nam, J. (2017). Raw waveform-based audio classification using sample-level cnn architectures, arXiv preprint arXiv:1712.00866."},{"key":"10212_CR17","doi-asserted-by":"crossref","unstructured":"Madanian, S., Chen, T., Adeleye, O., Templeton, J. M., Poellabauer, C., Parry, D., and Schneider, S. L. (2023). Speech emotion recognition using machine learning\u2014a systematic review. Intelligent Systems with Applications, 200266.","DOI":"10.1016\/j.iswa.2023.200266"},{"key":"10212_CR18","doi-asserted-by":"crossref","unstructured":"Mohmad, G., & Delhibabu, R. (2024). Speech databases, speech features and classifiers in speech emotion recognition: A review. IEEE Access.","DOI":"10.1109\/ACCESS.2024.3476960"},{"issue":"11","key":"10212_CR19","doi-asserted-by":"publisher","first-page":"2436","DOI":"10.3390\/electronics12112436","volume":"12","author":"S.-T. Pan","year":"2023","unstructured":"Pan, S.-T., & Wu, H.-J. (2023). Performance improvement of speech emotion recognition systems by combining 1d cnn and lstm with data augmentation. Electronics, 12(11), 2436.","journal-title":"Electronics"},{"issue":"14","key":"10212_CR20","doi-asserted-by":"publisher","first-page":"6640","DOI":"10.3390\/s23146640","volume":"23","author":"I. Pulatov","year":"2023","unstructured":"Pulatov, I., Oteniyazov, R., Makhmudov, F., & Cho, Y.-I. (2023). Enhancing speech emotion recognition using dual feature extraction encoders. Sensors, 23(14), 6640.","journal-title":"Sensors"},{"issue":"6","key":"10212_CR21","doi-asserted-by":"publisher","first-page":"1057","DOI":"10.47974\/JIOS-1431","volume":"44","author":"P. Rawat","year":"2023","unstructured":"Rawat, P., Bajaj, M., Vats, S., & Sharma, V. (2023). A comprehensive study based on mfcc and spectrogram for audio classification. Journal of Information & Optimization Sciences, 44(6), 1057\u20131074.","journal-title":"Journal of Information & Optimization Sciences"},{"key":"10212_CR22","doi-asserted-by":"crossref","unstructured":"Taj, S., Shaikh, G. M., & Hassan, S., et al. (2023). Urdu speech emotion recognition using speech spectral features and deep learning techniques. In 2023 4th international conference on computing, mathematics and engineering technologies (iCoMET) (pp. 1\u20136). IEEE.","DOI":"10.1109\/iCoMET57998.2023.10099289"},{"key":"10212_CR23","doi-asserted-by":"crossref","unstructured":"Wang, J., Xue, M., Culhane, R., Diao, E., Ding, J., & Tarokh, V. (2020). Speech emotion recognition with dual-sequence lstm architecture. In 2020 IEEE international conference on acoustics, speech and signal processing (ICASSP) (pp. 6474\u20136478). IEEE.","DOI":"10.1109\/ICASSP40776.2020.9054629"},{"key":"10212_CR24","doi-asserted-by":"publisher","first-page":"47\u2009795","DOI":"10.1109\/ACCESS.2021.3068045","volume":"9","author":"T. M. Wani","year":"2021","unstructured":"Wani, T. M., Gunawan, T. S., Qadri, S. A. A., Kartiwi, M., & Ambikairajah, E. (2021). A comprehensive review of speech emotion recognition systems. IEEE Access, 9, \u200947\u2009795\u2013\u200947\u2009814.","journal-title":"IEEE Access"},{"key":"10212_CR25","doi-asserted-by":"crossref","unstructured":"Yan, T., Meng, H., Parada-Cabaleiro, E., Tao, J., & Schuller, B. (2023). A residual multi-scale convolutional transformer network with chunk-level log-mel spectrograms for speech emotion recognition. Authorea Preprints.","DOI":"10.36227\/techrxiv.21309600.v1"},{"issue":"1","key":"10212_CR26","doi-asserted-by":"publisher","first-page":"17696","DOI":"10.1038\/s41598-024-68864-z","volume":"14","author":"L. Yue","year":"2024","unstructured":"Yue, L., Hu, P., & Zhu, J. (2024). Advanced differential evolution for gender-aware English speech emotion recognition. Scientific Reports, 14(1), 17696.","journal-title":"Scientific Reports"},{"issue":"2","key":"10212_CR27","doi-asserted-by":"publisher","first-page":"915","DOI":"10.1007\/s10579-022-09610-7","volume":"57","author":"N. Zaheer","year":"2023","unstructured":"Zaheer, N., Ahmad, O. U., Shabbir, M., & Raza, A. A. (2023). Speech emotion recognition for the Urdu language: Dataset and evaluation. Language Resources and Evaluation, 57(2), 915\u2013944.","journal-title":"Language Resources and Evaluation"}],"container-title":["International Journal of Speech Technology"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10772-025-10212-1.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s10772-025-10212-1\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10772-025-10212-1.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,9,26]],"date-time":"2025-09-26T11:40:36Z","timestamp":1758886836000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s10772-025-10212-1"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,9]]},"references-count":27,"journal-issue":{"issue":"3","published-print":{"date-parts":[[2025,9]]}},"alternative-id":["10212"],"URL":"https:\/\/doi.org\/10.1007\/s10772-025-10212-1","relation":{},"ISSN":["1381-2416","1572-8110"],"issn-type":[{"value":"1381-2416","type":"print"},{"value":"1572-8110","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,9]]},"assertion":[{"value":"16 April 2025","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"22 August 2025","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"19 September 2025","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors declare no competing interests.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Competing interests"}}]}}