{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,3]],"date-time":"2026-07-03T05:20:13Z","timestamp":1783056013389,"version":"3.54.6"},"reference-count":66,"publisher":"Springer Science and Business Media LLC","issue":"11","license":[{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Neural Comput &amp; Applic"],"published-print":{"date-parts":[[2026,6]]},"DOI":"10.1007\/s00521-026-12160-6","type":"journal-article","created":{"date-parts":[[2026,6,2]],"date-time":"2026-06-02T08:27:27Z","timestamp":1780388847000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["Leveraging self-paced curriculum learning for enhanced modality balance in multimodal conversational emotion recognition"],"prefix":"10.1007","volume":"38","author":[{"given":"Phuong-Anh","family":"Nguyen","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"The-Son","family":"Le","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Duc-Trong","family":"Le","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0001-9675-2105","authenticated-orcid":false,"given":"Cam-Van Thi","family":"Nguyen","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2026,6,2]]},"reference":[{"issue":"7","key":"12160_CR1","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/3713070","volume":"57","author":"Y Yuan","year":"2025","unstructured":"Yuan Y, Li Z, Zhao B (2025) A survey of multimodal learning: methods, applications, and future. ACM Comput Surv 57(7):1\u201334","journal-title":"ACM Comput Surv"},{"issue":"2","key":"12160_CR2","doi-asserted-by":"publisher","first-page":"423","DOI":"10.1109\/TPAMI.2018.2798607","volume":"41","author":"T Baltru\u0161aitis","year":"2018","unstructured":"Baltru\u0161aitis T, Ahuja C, Morency LP (2018) Multimodal machine learning: a survey and taxonomy. IEEE Trans Pattern Anal Mach Intell 41(2):423\u2013443","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"issue":"DB1","key":"12160_CR3","first-page":"1","volume":"2021","author":"PP Liang","year":"2021","unstructured":"Liang PP, Lyu Y, Fan X, Wu Z, Cheng Y, Wu J, Chen L, Wu P, Lee MA, Zhu Y et al (2021) Multibench: Multiscale benchmarks for multimodal representation learning. Adv Neural Inf Process Syst 2021(DB1):1","journal-title":"Adv Neural Inf Process Syst"},{"issue":"10","key":"12160_CR4","first-page":"1","volume":"56","author":"PP Liang","year":"2024","unstructured":"Liang PP, Zadeh A, Morency LP (2024) Foundations & trends in multimodal machine learning: principles, challenges, and open questions. ACM Comput Surv 56(10):1\u201342","journal-title":"ACM Comput Surv"},{"key":"12160_CR5","doi-asserted-by":"publisher","DOI":"10.1016\/j.neucom.2023.126693","volume":"556","author":"AA Gladys","year":"2023","unstructured":"Gladys AA, Vetriselvi V (2023) Survey on multimodal approaches to emotion recognition. Neurocomputing 556:126693","journal-title":"Neurocomputing"},{"key":"12160_CR6","doi-asserted-by":"publisher","unstructured":"Ghosal D, Majumder N, Gelbukh A, Mihalcea R, Poria S (2020) COSMIC: COmmonSense knowledge for eMotion identification in conversations. In: Findings of the Association for Computational Linguistics: EMNLP 2020, pp. 2470\u20132481. Association for Computational Linguistics, Online https:\/\/doi.org\/10.18653\/v1\/2020.findings-emnlp.224","DOI":"10.18653\/v1\/2020.findings-emnlp.224"},{"key":"12160_CR7","doi-asserted-by":"crossref","unstructured":"Hu J, Liu Y, Zhao J, Jin Q (2021) Mmgcn: Multimodal fusion via deep graph convolution network for emotion recognition in conversation. In: Proceedings of the 59th Annual Meeting of the Association for Computational Linguistics and the 11th International Joint Conference on Natural Language Processing (Volume 1: Long Papers), pp 5666\u20135675","DOI":"10.18653\/v1\/2021.acl-long.440"},{"key":"12160_CR8","doi-asserted-by":"publisher","unstructured":"Nguyen CVT, Mai T, The S, Kieu D, Le DT (2023) Conversation understanding using relational temporal graph neural networks with auxiliary cross-modality interaction. In: Bouamor H, Pino J, Bali K (eds) Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing. Association for Computational Linguistics, Singapore, pp 15154\u201315167. https:\/\/doi.org\/10.18653\/v1\/2023.emnlp-main.937","DOI":"10.18653\/v1\/2023.emnlp-main.937"},{"key":"12160_CR9","doi-asserted-by":"crossref","unstructured":"Peng X, Wei Y, Deng A, Wang D, Hu D (2022) Balanced multimodal learning via on-the-fly gradient modulation. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp 8238\u20138247","DOI":"10.1109\/CVPR52688.2022.00806"},{"key":"12160_CR10","doi-asserted-by":"crossref","unstructured":"Wang W, Tran D, Feiszli M (2020) What makes training multi-modal classification networks hard? In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp 12695\u201312705","DOI":"10.1109\/CVPR42600.2020.01271"},{"key":"12160_CR11","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2025.3608664","author":"Q Shi","year":"2025","unstructured":"Shi Q, Ye M, Huang W, Du B, Zong X (2025) Gradient and structure consistency in multimodal emotion recognition. IEEE Trans Image Process. https:\/\/doi.org\/10.1109\/TIP.2025.3608664","journal-title":"IEEE Trans Image Process"},{"key":"12160_CR12","doi-asserted-by":"crossref","unstructured":"Wang Y, Liu M, Li Z, Hu Y, Luo X, Nie L (2023) Unlocking the power of multimodal learning for emotion recognition in conversation. In: Proceedings of the 31st ACM International Conference on Multimedia, pp 5947\u20135955","DOI":"10.1145\/3581783.3613846"},{"key":"12160_CR13","unstructured":"Zhang Q, Wei Y, Han Z, Fu H, Peng X, Deng C, Hu Q, Xu C, Wen J, Hu D et al (2024) Multimodal fusion on low-quality data: A comprehensive survey. arXiv preprint arXiv:2404.18947"},{"key":"12160_CR14","unstructured":"Du C, Teng J, Li T, Liu Y, Yuan T, Wang Y, Yuan Y, Zhao H (2023) On uni-modal feature learning in supervised multi-modal learning. In: International Conference on Machine Learning,\u00a0PMLR, pp 8632\u20138656"},{"key":"12160_CR15","unstructured":"Wu N, Jastrzebski S, Cho K, Geras KJ (2022) Characterizing and overcoming the greedy nature of learning in multi-modal deep neural networks. In: International Conference on Machine Learning, PMLR, pp 24043\u201324055"},{"key":"12160_CR16","doi-asserted-by":"crossref","unstructured":"Xu R, Feng R, Zhang SX, Hu D (2023) Mmcosine: Multi-modal cosine loss towards balanced audio-visual fine-grained learning. In: ICASSP 2023-2023 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), IEEE, pp 1\u20135","DOI":"10.1109\/ICASSP49357.2023.10096655"},{"key":"12160_CR17","doi-asserted-by":"crossref","unstructured":"Zhou Y, Wang X, Chen H, Duan X, Zhu W (2023) Intra-and inter-modal curriculum for multimodal learning. In: Proceedings of the 31st ACM International Conference on Multimedia, pp 3724\u20133735","DOI":"10.1145\/3581783.3612468"},{"key":"12160_CR18","doi-asserted-by":"crossref","unstructured":"Fan Y, Xu W, Wang H, Wang J, Guo S (2023) Pmr: Prototypical modal rebalance for multimodal learning. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp 20029\u201320038","DOI":"10.1109\/CVPR52729.2023.01918"},{"key":"12160_CR19","doi-asserted-by":"crossref","unstructured":"Nguyen DA, Kamboj A, Do MN (2025) Robult: Leveraging redundancy and modality-specific features for robust multimodal learning. In: IJCAI","DOI":"10.24963\/ijcai.2025\/666"},{"key":"12160_CR20","unstructured":"Ismail AA, Hasan M, Ishtiaq F (2020) Improving multimodal accuracy through modality pre-training and attention. arXiv preprint arXiv:2011.06102"},{"key":"12160_CR21","doi-asserted-by":"crossref","unstructured":"Huang C, Wei Y, Yang Z, Hu D (2025) Adaptive unimodal regulation for balanced multimodal information acquisition. In: Proceedings of the Computer Vision and Pattern Recognition Conference, pp 25854\u201325863","DOI":"10.1109\/CVPR52734.2025.02408"},{"key":"12160_CR22","unstructured":"Wu Q, Shao Y, Wang J, Sun X (2025) Learning optimal multimodal information bottleneck representations. In: Forty-second International Conference on Machine Learning"},{"key":"12160_CR23","doi-asserted-by":"crossref","unstructured":"Li H, Li X, Hu P, Lei Y, Li C, Zhou Y (2023) Boosting multi-modal model performance with adaptive gradient modulation. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision, pp 22214\u201322224","DOI":"10.1109\/ICCV51070.2023.02030"},{"key":"12160_CR24","doi-asserted-by":"publisher","DOI":"10.1109\/tcss.2025.3566373","author":"F Liu","year":"2025","unstructured":"Liu F, Fu Z, Wang Y (2025) Reward-based gradient modulation for multimodal emotion recognition with lora. IEEE Trans Comput Soc Syst. https:\/\/doi.org\/10.1109\/tcss.2025.3566373","journal-title":"IEEE Trans Comput Soc Syst"},{"key":"12160_CR25","doi-asserted-by":"publisher","first-page":"335","DOI":"10.1007\/s10579-008-9076-6","volume":"42","author":"C Busso","year":"2008","unstructured":"Busso C, Bulut M, Lee CC, Kazemzadeh A, Mower E, Kim S, Chang JN, Lee S, Narayanan SS (2008) Iemocap: Interactive emotional dyadic motion capture database. Lang Resour Eval 42:335\u2013359","journal-title":"Lang Resour Eval"},{"key":"12160_CR26","doi-asserted-by":"crossref","unstructured":"Poria S, Hazarika D, Majumder N, Naik G, Cambria E, Mihalcea R (2019) Meld: A multimodal multi-party dataset for emotion recognition in conversations. In: Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics, pp 527\u2013536","DOI":"10.18653\/v1\/P19-1050"},{"key":"12160_CR27","doi-asserted-by":"crossref","unstructured":"Ghosal D, Majumder N, Poria S, Chhaya N, Gelbukh A (2019) Dialoguegcn: A graph convolutional neural network for emotion recognition in conversation. In: Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing (EMNLP-IJCNLP), pp 154\u2013164","DOI":"10.18653\/v1\/D19-1015"},{"key":"12160_CR28","doi-asserted-by":"crossref","unstructured":"Nguyen CVT, Nguyen CB, Le DT, Ha QT (2024) Curriculum learning meets directed acyclic graph for multimodal emotion recognition. In: Calzolari, N, Kan, M.-Y, Hoste, V, Lenci, A, Sakti, S, Xue, N. (eds.) Proceedings of the 2024 Joint International Conference on Computational Linguistics, Language Resources and Evaluation (LREC-COLING 2024), ELRA and ICCL, Torino, Italia, pp 4259\u20134265","DOI":"10.63317\/3eikm2yttbsc"},{"key":"12160_CR29","doi-asserted-by":"publisher","unstructured":"Hu D, Wei L, Huai X (2021) DialogueCRN: Contextual reasoning networks for emotion recognition in conversations. In: Proceedings of the 59th Annual Meeting of the Association for Computational Linguistics and the 11th International Joint Conference on Natural Language Processing (Volume 1: Long Papers), pp 7042\u20137052. Association for Computational Linguistics, Online https:\/\/doi.org\/10.18653\/v1\/2021.acl-long.547","DOI":"10.18653\/v1\/2021.acl-long.547"},{"key":"12160_CR30","doi-asserted-by":"crossref","unstructured":"Shen W, Chen J, Quan X, Xie Z (2021) Dialogxl: All-in-one xlnet for multi-party conversation emotion recognition. In: Proceedings of the AAAI Conference on Artificial Intelligence, vol 35, pp 13789\u201313797","DOI":"10.1609\/aaai.v35i15.17625"},{"key":"12160_CR31","doi-asserted-by":"publisher","unstructured":"Poria S, Cambria E, Hazarika D, Majumder N, Zadeh A, Morency LP (2017) Context-dependent sentiment analysis in user-generated videos. In: Barzilay, R, Kan, M.-Y. (eds.) Proceedings of the 55th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pp 873\u2013883. Association for Computational Linguistics, Vancouver, Canada. https:\/\/doi.org\/10.18653\/v1\/P17-1081","DOI":"10.18653\/v1\/P17-1081"},{"key":"12160_CR32","doi-asserted-by":"publisher","unstructured":"Hazarika D, Poria S, Zadeh A, Cambria E, Morency LP, Zimmermann R (2018) Conversational memory network for emotion recognition in dyadic dialogue videos. In: Walker, M, Ji, H, Stent, A. (eds) Proceedings of the 2018 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, Volume 1 (Long Papers), pp 2122\u20132132. Association for Computational Linguistics, New Orleans, Louisiana. https:\/\/doi.org\/10.18653\/v1\/N18-1193","DOI":"10.18653\/v1\/N18-1193"},{"key":"12160_CR33","doi-asserted-by":"publisher","unstructured":"Hazarika D, Poria S, Mihalcea R, Cambria E, Zimmermann R (2018) ICON: Interactive conversational memory network for multimodal emotion detection. In: Riloff E, Chiang D, Hockenmaier J, Tsujii J (eds) Proceedings of the 2018 Conference on Empirical Methods in Natural Language Processing, pp 2594\u20132604. Association for Computational Linguistics, Brussels, Belgium. https:\/\/doi.org\/10.18653\/v1\/D18-1280","DOI":"10.18653\/v1\/D18-1280"},{"key":"12160_CR34","doi-asserted-by":"crossref","unstructured":"Li B, Fei H, Liao L, Zhao Y, Teng C, Chua TS, Ji D, Li F (2023) Revisiting disentanglement and fusion on modality and context in conversational multimodal emotion recognition. In: Proceedings of the 31st ACM International Conference on Multimedia, pp 5923\u20135934","DOI":"10.1145\/3581783.3612053"},{"key":"12160_CR35","doi-asserted-by":"publisher","unstructured":"Shi T, Huang SL (2023) MultiEMO: An attention-based correlation-aware multimodal fusion framework for emotion recognition in conversations. In: Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pp 14752\u201314766. Association for Computational Linguistics, Toronto, Canada. https:\/\/doi.org\/10.18653\/v1\/2023.acl-long.824","DOI":"10.18653\/v1\/2023.acl-long.824"},{"key":"12160_CR36","doi-asserted-by":"publisher","unstructured":"Delbrouck JB, Tits N, Brousmiche M, Dupont S (2020) A transformer-based joint-encoding for emotion recognition and sentiment analysis. In: Zadeh A, Morency L-P, Liang PP, Poria S (eds) Second Grand-Challenge and Workshop on Multimodal Language (Challenge-HML). Association for Computational Linguistics, Seattle, USA, pp 1\u20137. https:\/\/doi.org\/10.18653\/v1\/2020.challengehml-1.1","DOI":"10.18653\/v1\/2020.challengehml-1.1"},{"key":"12160_CR37","doi-asserted-by":"crossref","unstructured":"Tu G, Xie T, Liang B, Wang H, Xu R (2024) Adaptive graph learning for multimodal conversational emotion detection. In: Proceedings of the AAAI Conference on Artificial Intelligence, vol 38, pp 19089\u201319097","DOI":"10.1609\/aaai.v38i17.29876"},{"key":"12160_CR38","doi-asserted-by":"crossref","unstructured":"Joshi A, Bhat A, Jain A, Singh A, Modi A (2022) Cogmen: Contextualized gnn based multimodal emotion recognition. In: Proceedings of the 2022 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, pp 4148\u20134164","DOI":"10.18653\/v1\/2022.naacl-main.306"},{"key":"12160_CR39","unstructured":"Huang Y, Lin J, Zhou C, Yang H, Huang L (2022) Modality competition: What makes joint training of multi-modal network fail in deep learning?(provably). In: International Conference on Machine Learning, PMLR, pp 9226\u20139259"},{"key":"12160_CR40","doi-asserted-by":"crossref","unstructured":"Fan Y, Xu W, Wang H, Liu J, Guo S (2024) Detached and interactive multimodal learning. In: Proceedings of the 32nd ACM International Conference on Multimedia, pp 5470\u20135478","DOI":"10.1145\/3664647.3680697"},{"key":"12160_CR41","doi-asserted-by":"crossref","unstructured":"Wei Y, Li S, Feng R, Hu D (2025) Diagnosing and re-learning for balanced multimodal learning. In: European Conference on Computer Vision, Springer, pp 71\u201386","DOI":"10.1007\/978-3-031-73039-9_5"},{"key":"12160_CR42","doi-asserted-by":"crossref","unstructured":"Guo Z, Jin T, Zhao Z (2024) Multimodal prompt learning with missing modalities for sentiment analysis and emotion recognition. In: Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pp 1726\u20131736","DOI":"10.18653\/v1\/2024.acl-long.94"},{"key":"12160_CR43","doi-asserted-by":"crossref","unstructured":"Nguyen CVT, Le TS, Mai AT, Le, DT (2024) Ada2i: Enhancing modality balance for multimodal conversational emotion recognition. In: Proceedings of the 32nd ACM International Conference on Multimedia, pp 9330\u20139339","DOI":"10.1145\/3664647.3681648"},{"key":"12160_CR44","doi-asserted-by":"crossref","unstructured":"Planamente M, Plizzari C, Alberti E, Caputo B (2022) Domain generalization through audio-visual relative norm alignment in first person action recognition. In: Proceedings of the IEEE\/CVF Winter Conference on Applications of Computer Vision, pp 1807\u20131818","DOI":"10.1109\/WACV51458.2022.00024"},{"key":"12160_CR45","unstructured":"Hua C, Xu Q, Bao S, Yang, , Huang Q (2024) Reconboost: Boosting can achieve modality reconcilement. In: The Forty-first International Conference on Machine Learning"},{"key":"12160_CR46","unstructured":"Du C, Li T, Liu Y, Wen Z, Hua T, Wang Y, Zhao H (2021) Improving multi-modal learning with uni-modal teachers. arXiv preprint arXiv:2106.11059"},{"key":"12160_CR47","doi-asserted-by":"crossref","unstructured":"Wei Y, Hu D, Du H, Wen JR (2024) On-the-fly modulation for balanced multimodal learning, IEEE Transactions on Pattern Analysis and Machine Intelligence","DOI":"10.1109\/TPAMI.2024.3468315"},{"key":"12160_CR48","doi-asserted-by":"crossref","unstructured":"Bengio Y, Louradour J, Collobert R, Weston J (2009) Curriculum learning. In: Proceedings of the 26th Annual International Conference on Machine Learning, pp 41\u201348","DOI":"10.1145\/1553374.1553380"},{"issue":"6","key":"12160_CR49","doi-asserted-by":"publisher","first-page":"1526","DOI":"10.1007\/s11263-022-01611-x","volume":"130","author":"P Soviany","year":"2022","unstructured":"Soviany P, Ionescu RT, Rota P, Sebe N (2022) Curriculum learning: a survey. Int J Comput Vision 130(6):1526\u20131565","journal-title":"Int J Comput Vision"},{"key":"12160_CR50","doi-asserted-by":"crossref","unstructured":"Wang X, Zhou Y, Chen H, Zhu W (2024) Curriculum learning for multimedia in the era of large language models. In: Proceedings of the 32nd ACM International Conference on Multimedia, pp 11296\u201311297","DOI":"10.1145\/3664647.3689178"},{"issue":"3","key":"12160_CR51","doi-asserted-by":"publisher","first-page":"1305","DOI":"10.1109\/TCSVT.2022.3210271","volume":"33","author":"A Tong","year":"2022","unstructured":"Tong A, Tang C, Wang W (2022) Semi-supervised action recognition from temporal augmentation using curriculum learning. IEEE Trans Circuits Syst Video Technol 33(3):1305\u20131319","journal-title":"IEEE Trans Circuits Syst Video Technol"},{"key":"12160_CR52","doi-asserted-by":"publisher","DOI":"10.1016\/j.neucom.2024.129195","volume":"620","author":"T Yu","year":"2025","unstructured":"Yu T, Wang J, Luo J, Wang J, Zhou G (2025) Tacl: a trusted action-enhanced curriculum learning approach to multimodal affective computing. Neurocomputing 620:129195","journal-title":"Neurocomputing"},{"issue":"181","key":"12160_CR53","first-page":"1","volume":"21","author":"S Narvekar","year":"2020","unstructured":"Narvekar S, Peng B, Leonetti M, Sinapov J, Taylor ME, Stone P (2020) Curriculum learning for reinforcement learning domains: A framework and survey. J Mach Learn Res 21(181):1\u201350","journal-title":"J Mach Learn Res"},{"key":"12160_CR54","unstructured":"Qian C, Han K, Wang J, Yuan Z, Lyu C, Chen J, Liu Z (2025) Dyncim: Dynamic curriculum for imbalanced multimodal learning. arXiv preprint arXiv:2503.06456"},{"issue":"2","key":"12160_CR55","doi-asserted-by":"publisher","first-page":"109","DOI":"10.1016\/j.jml.2010.11.002","volume":"64","author":"JG Tullis","year":"2011","unstructured":"Tullis JG, Benjamin AS (2011) On the effectiveness of self-paced learning. J Mem Lang 64(2):109\u2013118","journal-title":"J Mem Lang"},{"key":"12160_CR56","doi-asserted-by":"crossref","unstructured":"Han K, Lyu C, Ma L, Qian C, Ma S, Pang Z, Chen J, Liu Z (2025) Climd: A curriculum learning framework for imbalanced multimodal diagnosis. In: International Conference on Medical Image Computing and Computer-Assisted Intervention, Springer, pp 65\u201374","DOI":"10.1007\/978-3-032-05182-0_7"},{"key":"12160_CR57","doi-asserted-by":"crossref","unstructured":"Zhou Y, Liang X, Xu Y, Gao B (2025) Sample-level self-paced learning to tackle multimodal imbalance problem. In: ICASSP 2025-2025 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), IEEE, pp 1\u20135","DOI":"10.1109\/ICASSP49660.2025.10888208"},{"issue":"9","key":"12160_CR58","first-page":"4555","volume":"44","author":"X Wang","year":"2021","unstructured":"Wang X, Chen Y, Zhu W (2021) A survey on curriculum learning. IEEE Trans Pattern Anal Mach Intell 44(9):4555\u20134576","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"12160_CR59","unstructured":"Hacohen G, Weinshall D (2019) On the power of curriculum learning in training deep networks. In: International Conference on Machine Learning, PMLR, pp 2535\u20132544"},{"key":"12160_CR60","doi-asserted-by":"crossref","unstructured":"Zhang D, Zhang W, Li S, Zhu Q, Zhou G (2020) Modeling both intra-and inter-modal influence for real-time emotion detection in conversations. In: Proceedings of the 28th ACM International Conference on Multimedia, pp 503\u2013511","DOI":"10.1145\/3394171.3413949"},{"key":"12160_CR61","doi-asserted-by":"crossref","unstructured":"Hu D, Hou X, Wei L, Jiang L, Mo Y (2022) Mm-dfn: Multimodal dynamic fusion network for emotion recognition in conversations. In: ICASSP 2022-2022 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), IEEE, pp 7037\u20137041","DOI":"10.1109\/ICASSP43922.2022.9747397"},{"key":"12160_CR62","doi-asserted-by":"crossref","unstructured":"Eyben F, W\u00f6llmer M, Schuller B (2010) Opensmile: the munich versatile and fast open-source audio feature extractor. In: Proceedings of the 18th ACM International Conference on Multimedia, pp 1459\u20131462","DOI":"10.1145\/1873951.1874246"},{"key":"12160_CR63","doi-asserted-by":"crossref","unstructured":"Baltrusaitis T, Zadeh A, Lim YC, Morency LP (2018) Openface 2.0: Facial behavior analysis toolkit. In: 2018 13th IEEE International Conference on Automatic Face & Gesture Recognition (FG 2018),\u00a0IEEE, pp 59\u201366\u00a0","DOI":"10.1109\/FG.2018.00019"},{"key":"12160_CR64","doi-asserted-by":"publisher","unstructured":"Reimers N, Gurevych I (2019) Sentence-BERT: Sentence embeddings using Siamese BERT-networks. In: Inui K, Jiang J, Ng V, Wan X (eds) Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing (EMNLP-IJCNLP), pp 3982\u20133992. Association for Computational Linguistics, Hong Kong, China . https:\/\/doi.org\/10.18653\/v1\/D19-1410","DOI":"10.18653\/v1\/D19-1410"},{"key":"12160_CR65","doi-asserted-by":"crossref","unstructured":"Platanios EA, Stretcu O, Neubig G, Poczos B, Mitchell T (2019) Competence-based curriculum learning for neural machine translation. In: Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, Volume 1 (long and Short Papers), pp 1162\u20131172","DOI":"10.18653\/v1\/N19-1119"},{"issue":"1","key":"12160_CR66","doi-asserted-by":"publisher","first-page":"293","DOI":"10.1038\/s41597-020-00630-y","volume":"7","author":"CY Park","year":"2020","unstructured":"Park CY, Cha N, Kang S, Kim A, Khandoker AH, Hadjileontiadis L, Oh A, Jeong Y, Lee U (2020) K-emocon, a multimodal sensor dataset for continuous emotion recognition in naturalistic conversations. Sci Data 7(1):293","journal-title":"Sci Data"}],"container-title":["Neural Computing and Applications"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00521-026-12160-6.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s00521-026-12160-6","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00521-026-12160-6.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,7,3]],"date-time":"2026-07-03T04:55:18Z","timestamp":1783054518000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s00521-026-12160-6"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,6]]},"references-count":66,"journal-issue":{"issue":"11","published-print":{"date-parts":[[2026,6]]}},"alternative-id":["12160"],"URL":"https:\/\/doi.org\/10.1007\/s00521-026-12160-6","relation":{},"ISSN":["0941-0643","1433-3058"],"issn-type":[{"value":"0941-0643","type":"print"},{"value":"1433-3058","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026,6]]},"assertion":[{"value":"17 March 2025","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"27 April 2026","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"2 June 2026","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors declare that they have no known competing financial interests or personal relationships that could have appeared to influence this work.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflict of interest"}},{"value":"The code will be made available upon publications.","order":3,"name":"Ethics","group":{"name":"EthicsHeading","label":"Code availability"}}],"article-number":"459"}}