{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,9,11]],"date-time":"2025-09-11T19:20:00Z","timestamp":1757618400622,"version":"3.44.0"},"publisher-location":"Singapore","reference-count":28,"publisher":"Springer Nature Singapore","isbn-type":[{"type":"print","value":"9789819681792"},{"type":"electronic","value":"9789819681808"}],"license":[{"start":{"date-parts":[[2025,1,1]],"date-time":"2025-01-01T00:00:00Z","timestamp":1735689600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2025,1,1]],"date-time":"2025-01-01T00:00:00Z","timestamp":1735689600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025]]},"DOI":"10.1007\/978-981-96-8180-8_7","type":"book-chapter","created":{"date-parts":[[2025,6,19]],"date-time":"2025-06-19T09:15:39Z","timestamp":1750324539000},"page":"79-90","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["Bridging Semantic and\u00a0Emotional Gaps in\u00a0Speech Emotion Recognition: A Novel LightGBM-Stacking Architecture"],"prefix":"10.1007","author":[{"given":"Zhilong","family":"Duan","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Lin","family":"Zhou","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Degen","family":"Huang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xuewen","family":"Shi","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2025,6,20]]},"reference":[{"key":"7_CR1","doi-asserted-by":"crossref","unstructured":"Akiba, T., Sano, S., Yanase, T., Ohta, T., Koyama, M.: Optuna: a next-generation hyperparameter optimization framework. In: Proceedings of the 25th ACM SIGKDD International Conference on Knowledge Discovery & Data Mining, pp. 2623\u20132631 (2019)","DOI":"10.1145\/3292500.3330701"},{"issue":"3","key":"7_CR2","doi-asserted-by":"publisher","first-page":"1386","DOI":"10.3390\/s23031386","volume":"23","author":"W Alsabhan","year":"2023","unstructured":"Alsabhan, W.: Human-computer interaction with a real-time speech emotion recognition with ensembling techniques 1d convolution neural network and attention. Sensors 23(3), 1386 (2023)","journal-title":"Sensors"},{"key":"7_CR3","unstructured":"Baevski, A., Babu, A., Hsu, W.N., Auli, M.: Efficient self-supervised learning with contextualized target representations for vision, speech and language. In: International Conference on Machine Learning, pp. 1416\u20131429. PMLR (2023)"},{"key":"7_CR4","unstructured":"Baevski, A., Hsu, W.N., Xu, Q., Babu, A., Gu, J., Auli, M.: Data2vec: a general framework for self-supervised learning in speech, vision and language. In: International Conference on Machine Learning, pp. 1298\u20131312. PMLR (2022)"},{"key":"7_CR5","unstructured":"Baevski, A., Zhou, Y., Mohamed, A., Auli, M.: wav2vec 2.0: a framework for self-supervised learning of speech representations. Adv. Neural Inf. Process. Syst. 33, 12449\u201312460 (2020)"},{"key":"7_CR6","doi-asserted-by":"publisher","first-page":"335","DOI":"10.1007\/s10579-008-9076-6","volume":"42","author":"C Busso","year":"2008","unstructured":"Busso, C., et al.: Iemocap: interactive emotional dyadic motion capture database. Lang. Resour. Eval. 42, 335\u2013359 (2008)","journal-title":"Lang. Resour. Eval."},{"issue":"6","key":"7_CR7","doi-asserted-by":"publisher","first-page":"1505","DOI":"10.1109\/JSTSP.2022.3188113","volume":"16","author":"S Chen","year":"2022","unstructured":"Chen, S., et al.: Wavlm: large-scale self-supervised pre-training for full stack speech processing. IEEE J. Selected Topics Signal Process. 16(6), 1505\u20131518 (2022)","journal-title":"IEEE J. Selected Topics Signal Process."},{"key":"7_CR8","doi-asserted-by":"crossref","unstructured":"Chen, W., Xing, X., Chen, P., Xu, X.: Vesper: a compact and effective pretrained model for speech emotion recognition. IEEE Trans. Affect. Comput. (2024)","DOI":"10.1109\/TAFFC.2024.3369726"},{"issue":"1","key":"7_CR9","doi-asserted-by":"publisher","first-page":"32","DOI":"10.1109\/79.911197","volume":"18","author":"R Cowie","year":"2001","unstructured":"Cowie, R., et al.: Emotion recognition in human-computer interaction. IEEE Signal Process. Mag. 18(1), 32\u201380 (2001)","journal-title":"IEEE Signal Process. Mag."},{"key":"7_CR10","doi-asserted-by":"crossref","unstructured":"Diatlova, D., Udalov, A., Shutov, V., Spirin, E.: Adapting wavlm for speech emotion recognition. arXiv preprint arXiv:2405.04485 (2024)","DOI":"10.21437\/odyssey.2024-43"},{"key":"7_CR11","doi-asserted-by":"publisher","unstructured":"Enrique Hern\u00e1ndez Calabr\u00e9s: wav2vec2-lg-xlsr-en-speech-emotion-recognition (revision 17cf17c) (2024). https:\/\/doi.org\/10.57967\/hf\/2045. https:\/\/huggingface.co\/ehcalabres\/wav2vec2-lg-xlsr-en-speech-emotion-recognition","DOI":"10.57967\/hf\/2045"},{"key":"7_CR12","doi-asserted-by":"crossref","unstructured":"Gao, Y., Shi, H., Chu, C., Kawahara, T.: Speech emotion recognition with multi-level acoustic and semantic information extraction and interaction. In: Proceedings of Interspeech 2024, pp. 1060\u20131064 (2024)","DOI":"10.21437\/Interspeech.2024-2385"},{"key":"7_CR13","doi-asserted-by":"crossref","unstructured":"Goron, E., Asai, L., Rut, E., Dinov, M.: Improving domain generalization in speech emotion recognition with whisper. In: ICASSP 2024-2024 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 11631\u201311635. IEEE (2024)","DOI":"10.1109\/ICASSP48485.2024.10446997"},{"key":"7_CR14","unstructured":"Ke, G., et al.: Lightgbm: a highly efficient gradient boosting decision tree. Adv. Neural Inf. Process. Syst. 30 (2017)"},{"issue":"6","key":"7_CR15","doi-asserted-by":"publisher","first-page":"4097","DOI":"10.1007\/s11063-021-10581-z","volume":"53","author":"D Li","year":"2021","unstructured":"Li, D., Sun, L., Xu, X., Wang, Z., Zhang, J., Du, W.: Blstm and cnn stacking architecture for speech emotion recognition. Neural Process. Lett. 53(6), 4097\u20134115 (2021)","journal-title":"Neural Process. Lett."},{"key":"7_CR16","series-title":"Lecture Notes in Computer Science (Lecture Notes in Artificial Intelligence)","doi-asserted-by":"publisher","first-page":"217","DOI":"10.1007\/978-3-540-39666-6_14","volume-title":"Mining Multimedia and Complex Data","author":"W-H Lin","year":"2003","unstructured":"Lin, W.-H., Hauptmann, A.: Meta-classification: combining multimodal classifiers. In: Za\u00efane, O.R., Simoff, S.J., Djeraba, C. (eds.) PAKDD 2002. LNCS (LNAI), vol. 2797, pp. 217\u2013231. Springer, Heidelberg (2003). https:\/\/doi.org\/10.1007\/978-3-540-39666-6_14"},{"issue":"5","key":"7_CR17","doi-asserted-by":"publisher","DOI":"10.1371\/journal.pone.0196391","volume":"13","author":"SR Livingstone","year":"2018","unstructured":"Livingstone, S.R., Russo, F.A.: The ryerson audio-visual database of emotional speech and song (ravdess): a dynamic, multimodal set of facial and vocal expressions in north american english. PLoS ONE 13(5), e0196391 (2018)","journal-title":"PLoS ONE"},{"key":"7_CR18","doi-asserted-by":"crossref","unstructured":"Ma, Z., et al.: Emobox: multilingual multi-corpus speech emotion recognition toolkit and benchmark. arXiv preprint arXiv:2406.07162 (2024)","DOI":"10.21437\/Interspeech.2024-788"},{"key":"7_CR19","doi-asserted-by":"crossref","unstructured":"Ma, Z., et al.: emotion2vec: self-supervised pre-training for speech emotion representation. arXiv preprint arXiv:2312.15185 (2023)","DOI":"10.18653\/v1\/2024.findings-acl.931"},{"key":"7_CR20","doi-asserted-by":"crossref","unstructured":"Pepino, L., Riera, P., Ferrer, L.: Emotion recognition from speech using wav2vec 2.0 embeddings (2021)","DOI":"10.21437\/Interspeech.2021-703"},{"key":"7_CR21","unstructured":"Radford, A., Kim, J.W., Xu, T., Brockman, G., McLeavey, C., Sutskever, I.: Robust speech recognition via large-scale weak supervision. In: International Conference on Machine Learning, pp. 28492\u201328518. PMLR (2023)"},{"key":"7_CR22","doi-asserted-by":"publisher","first-page":"1467","DOI":"10.1007\/s11235-011-9624-z","volume":"52","author":"S Ramakrishnan","year":"2013","unstructured":"Ramakrishnan, S., El Emary, I.M.: Speech emotion recognition approaches in human computer interaction. Telecommun. Syst. 52, 1467\u20131478 (2013)","journal-title":"Telecommun. Syst."},{"key":"7_CR23","unstructured":"Ravanelli, M., et al.: SpeechBrain: a general-purpose speech toolkit (2021). arXiv:2106.04624"},{"key":"7_CR24","doi-asserted-by":"crossref","unstructured":"Salah, M., Alaa, A., Adel, A., Amr, A., Saad, S., Gamal, A., Aly, S.: Emotion recognition: enhancing human-computer interaction. In: 2023 Eleventh International Conference on Intelligent Computing and Information Systems (ICICIS), pp. 542\u2013548. IEEE (2023)","DOI":"10.1109\/ICICIS58388.2023.10391108"},{"issue":"1\u20132","key":"7_CR25","doi-asserted-by":"publisher","first-page":"227","DOI":"10.1016\/S0167-6393(02)00084-5","volume":"40","author":"KR Scherer","year":"2003","unstructured":"Scherer, K.R.: Vocal communication of emotion: a review of research paradigms. Speech Commun. 40(1\u20132), 227\u2013256 (2003)","journal-title":"Speech Commun."},{"key":"7_CR26","doi-asserted-by":"crossref","unstructured":"Sun, C., Zhou, Y., Huang, X., Yang, J., Hou, X.: Combining wav2vec 2.0 fine-tuning and conlearnnet for speech emotion recognition. Electronics 13(6), 1103 (2024)","DOI":"10.3390\/electronics13061103"},{"issue":"3","key":"7_CR27","doi-asserted-by":"publisher","first-page":"817","DOI":"10.1007\/s10772-024-10138-0","volume":"27","author":"D Thiripurasundari","year":"2024","unstructured":"Thiripurasundari, D., Bhangale, K., Aashritha, V., Mondreti, S., Kothandaraman, M.: Speech emotion recognition for human-computer interaction. Int. J. Speech Technol. 27(3), 817\u2013830 (2024)","journal-title":"Int. J. Speech Technol."},{"issue":"2","key":"7_CR28","doi-asserted-by":"publisher","first-page":"241","DOI":"10.1016\/S0893-6080(05)80023-1","volume":"5","author":"DH Wolpert","year":"1992","unstructured":"Wolpert, D.H.: Stacked generalization. Neural Netw. 5(2), 241\u2013259 (1992)","journal-title":"Neural Netw."}],"container-title":["Lecture Notes in Computer Science","Advances in Knowledge Discovery and Data Mining"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-981-96-8180-8_7","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,9,6]],"date-time":"2025-09-06T20:44:18Z","timestamp":1757191458000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-981-96-8180-8_7"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025]]},"ISBN":["9789819681792","9789819681808"],"references-count":28,"URL":"https:\/\/doi.org\/10.1007\/978-981-96-8180-8_7","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"type":"print","value":"0302-9743"},{"type":"electronic","value":"1611-3349"}],"subject":[],"published":{"date-parts":[[2025]]},"assertion":[{"value":"20 June 2025","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"PAKDD","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Pacific-Asia Conference on Knowledge Discovery and Data Mining","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Sydney, NSW","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Australia","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2025","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"10 June 2025","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"13 June 2025","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"29","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"pakdd2025","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/pakdd2025.org\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}