{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,2]],"date-time":"2026-07-02T16:27:08Z","timestamp":1783009628754,"version":"3.54.5"},"reference-count":211,"publisher":"Springer Science and Business Media LLC","issue":"25","license":[{"start":{"date-parts":[[2024,1,22]],"date-time":"2024-01-22T00:00:00Z","timestamp":1705881600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2024,1,22]],"date-time":"2024-01-22T00:00:00Z","timestamp":1705881600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["61772125"],"award-info":[{"award-number":["61772125"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100012226","name":"Fundamental Research Funds for the Central Universities","doi-asserted-by":"publisher","award":["N2217001"],"award-info":[{"award-number":["N2217001"]}],"id":[{"id":"10.13039\/501100012226","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Multimed Tools Appl"],"DOI":"10.1007\/s11042-023-17944-9","type":"journal-article","created":{"date-parts":[[2024,1,22]],"date-time":"2024-01-22T02:03:31Z","timestamp":1705889011000},"page":"66223-66262","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":27,"title":["Survey of deep emotion recognition in dynamic data using facial, speech and textual cues"],"prefix":"10.1007","volume":"83","author":[{"given":"Tao","family":"Zhang","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-9870-8925","authenticated-orcid":false,"given":"Zhenhua","family":"Tan","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2024,1,22]]},"reference":[{"key":"17944_CR1","doi-asserted-by":"crossref","unstructured":"Dolan RJ (2002) Emotion, cognition, and behavior. Science","DOI":"10.1126\/science.1076358"},{"issue":"3","key":"17944_CR2","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/3388790","volume":"53","author":"S Zepf","year":"2020","unstructured":"Zepf S, Hernandez J, Schmitt A, Minker W, Picard RW (2020) Driver emotion recognition for intelligent vehicles: a survey. ACM Computing Surveys (CSUR) 53(3):1\u201330","journal-title":"ACM Computing Surveys (CSUR)"},{"issue":"4","key":"17944_CR3","doi-asserted-by":"publisher","first-page":"21","DOI":"10.5120\/ijais2016451597","volume":"11","author":"WEM Nawaf Hazim Barnouti","year":"2016","unstructured":"Nawaf Hazim Barnouti WEM, Al-dabbagh SSM (2016) Face recognition: a literature review. Int J Appl Inf Syst 11(4):21\u201331. https:\/\/doi.org\/10.5120\/ijais2016451597","journal-title":"Int J Appl Inf Syst"},{"key":"17944_CR4","doi-asserted-by":"publisher","unstructured":"D\u2019mello SK, Kory J (2015) A review and meta-analysis of multimodal affect detection systems. ACM Comput Surv 47(3). https:\/\/doi.org\/10.1145\/2682899","DOI":"10.1145\/2682899"},{"issue":"8","key":"17944_CR5","doi-asserted-by":"publisher","first-page":"1735","DOI":"10.1162\/neco.1997.9.8.1735","volume":"9","author":"S Hochreiter","year":"1997","unstructured":"Hochreiter S, Schmidhuber J (1997) Long short-term memory. Neural Comput 9(8):1735\u20131780","journal-title":"Neural Comput"},{"key":"17944_CR6","unstructured":"Graves A (2013) Generating sequences with recurrent neural networks. arXiv:1308.0850"},{"key":"17944_CR7","doi-asserted-by":"crossref","unstructured":"Cho K, van Merri\u00ebnboer B, Bahdanau D, Bengio Y (2014) On the properties of neural machine translation: encoder\u2013decoder approaches. In: Proceedings of SSST-8, eighth workshop on syntax, semantics and structure in statistical translation, pp 103\u2013111","DOI":"10.3115\/v1\/W14-4012"},{"key":"17944_CR8","unstructured":"Krizhevsky A, Sutskever I, Hinton GE (2012) Imagenet classification with deep convolutional neural networks. In: Pereira F, Burges CJ, Bottou L, Weinberger KQ (eds) Advances in neural information processing systems, vol 25"},{"key":"17944_CR9","unstructured":"Simonyan K, Zisserman A (2014) Very deep convolutional networks for largescale image recognition. arXiv:1409.1556"},{"key":"17944_CR10","doi-asserted-by":"crossref","unstructured":"He K, Zhang X, Ren S, Sun J (2016) Deep residual learning for image recognition. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR)","DOI":"10.1109\/CVPR.2016.90"},{"key":"17944_CR11","unstructured":"Defferrard M, Bresson X, Vandergheynst P (2016) Convolutional neural networks on graphs with fast localized spectral filtering. In: Lee D, Sugiyama M, Luxburg U, Guyon I, Garnett R (eds) Advances in neural information processing systems, vol 29"},{"key":"17944_CR12","unstructured":"Kipf TN, Welling M (2016) Semi-supervised classification with graph convolutional networks. arXiv:1609.02907"},{"key":"17944_CR13","unstructured":"Thost V, Chen J (2021) Directed acyclic graph neural networks. arXiv:2101.07965"},{"key":"17944_CR14","unstructured":"Vaswani A, Shazeer N, Parmar N, Uszkoreit J, Jones L, Gomez AN, Kaiser Lu, Polosukhin I (2017) Attention is all you need. In: Guyon I, Luxburg UV, Bengio S, Wallach H, Fergus R, Vishwanathan S, Garnett R (eds) Advances in neural information processing systems, vol 30"},{"issue":"2","key":"17944_CR15","doi-asserted-by":"publisher","first-page":"679","DOI":"10.1109\/TMECH.2018.2799724","volume":"23","author":"Z Zhang","year":"2018","unstructured":"Zhang Z, Fu T, Yan Z, Jin L, Xiao L, Sun Y, Yu Z, Li Y (2018) A varying-parameter convergent-differential neural network for solving joint-angular-drift problems of redundant robot manipulators. IEEE\/ASME Trans Mechatron 23(2):679\u2013689. https:\/\/doi.org\/10.1109\/TMECH.2018.2799724","journal-title":"IEEE\/ASME Trans Mechatron"},{"issue":"12","key":"17944_CR16","doi-asserted-by":"publisher","first-page":"4110","DOI":"10.1109\/TAC.2018.2810039","volume":"63","author":"Z Zhang","year":"2018","unstructured":"Zhang Z, Lu Y, Zheng L, Li S, Yu Z, Li Y (2018) A new varying-parameter convergent-differential neural-network for solving time-varying convex qp problem constrained by linear-equality. IEEE Trans Autom Control 63(12):4110\u20134125. https:\/\/doi.org\/10.1109\/TAC.2018.2810039","journal-title":"IEEE Trans Autom Control"},{"issue":"11","key":"17944_CR17","doi-asserted-by":"publisher","first-page":"3135","DOI":"10.1109\/TCYB.2017.2760883","volume":"48","author":"Z Zhang","year":"2018","unstructured":"Zhang Z, Zheng L, Weng J, Mao Y, Lu W, Xiao L (2018) A new varyingparameter recurrent neural-network for online solution of time-varying sylvester equation. IEEE Trans Cybern 48(11):3135\u20133148. https:\/\/doi.org\/10.1109\/TCYB.2017.2760883","journal-title":"IEEE Trans Cybern"},{"key":"17944_CR18","doi-asserted-by":"publisher","DOI":"10.1109\/TAFFC.2020.2981446","author":"S Li","year":"2020","unstructured":"Li S, Deng W (2020) Deep facial expression recognition: a survey. IEEE Trans Affect Comput. https:\/\/doi.org\/10.1109\/TAFFC.2020.2981446","journal-title":"IEEE Trans Affect Comput"},{"key":"17944_CR19","doi-asserted-by":"publisher","first-page":"90495","DOI":"10.1109\/ACCESS.2020.2993803","volume":"8","author":"K Patel","year":"2020","unstructured":"Patel K, Mehta D, Mistry C, Gupta R, Tanwar S, Kumar N, Alazab M (2020) Facial sentiment analysis using ai techniques: state-of-theart, taxonomies, and challenges. IEEE Access 8:90495\u201390519. https:\/\/doi.org\/10.1109\/ACCESS.2020.2993803","journal-title":"IEEE Access"},{"key":"17944_CR20","doi-asserted-by":"publisher","unstructured":"Latif S, Rana R, Khalifa S, Jurdak R, Qadir J, Schuller BW (2021) Survey of deep representation learning for speech emotion recognition. IEEE Trans Affect Comput 1\u20131. https:\/\/doi.org\/10.1109\/TAFFC.2021.3114365","DOI":"10.1109\/TAFFC.2021.3114365"},{"issue":"16","key":"17944_CR21","doi-asserted-by":"publisher","first-page":"23745","DOI":"10.1007\/s11042-020-09874-7","volume":"80","author":"R Jahangir","year":"2021","unstructured":"Jahangir R, Teh YW, Hanif F, Mujtaba G (2021) Deep learning approaches for speech emotion recognition: state of the art and research challenges. Multimed Tools Appl 80(16):23745\u201323812","journal-title":"Multimed Tools Appl"},{"key":"17944_CR22","doi-asserted-by":"publisher","first-page":"56","DOI":"10.1016\/j.specom.2019.12.001","volume":"116","author":"A Mba","year":"2020","unstructured":"Mba A, Ko B (2020) Speech emotion recognition: emotional models, databases, features, preprocessing methods, supporting modalities, and classifiers - sciencedirect. Speech Commun 116:56\u201376","journal-title":"Speech Commun"},{"key":"17944_CR23","doi-asserted-by":"crossref","unstructured":"Alswaidan N, Menai M (2020) A survey of state-of-the-art approaches for emotion recognition in text. Knowl Inf Syst(16)","DOI":"10.1007\/s10115-020-01449-0"},{"key":"17944_CR24","unstructured":"Deng J, Ren F (2021) A survey of textual emotion recognition and its challenges. IEEE Trans Affect Comput PP(99):1\u20131"},{"key":"17944_CR25","doi-asserted-by":"crossref","unstructured":"Jiang Y, Li W, Hossain MS, Chen M, Al-Hammadi M (2019) A snapshot research and implementation of multimodal information fusion for datadriven emotion recognition. Inf Fusion 53","DOI":"10.1016\/j.inffus.2019.06.019"},{"key":"17944_CR26","unstructured":"Rouast PV, Adam M, Chiong R (2018) Deep learning for human affect recognition: insights and new developments. IEEE Trans Affect Comput 1\u20131"},{"key":"17944_CR27","doi-asserted-by":"publisher","first-page":"98","DOI":"10.1016\/j.inffus.2017.02.003","volume":"37","author":"S Poria","year":"2017","unstructured":"Poria S, Cambria E, Bajpai R, Hussain A (2017) A review of affective computing: From unimodal analysis to multimodal fusion. Inf Fusion 37:98\u2013125","journal-title":"Inf Fusion"},{"key":"17944_CR28","doi-asserted-by":"publisher","unstructured":"He Z, Li Z, Yang F, Wang L, Li J, Zhou C, Pan J (2020) Advances in multimodal emotion recognition based on brain\u2013computer interfaces. Brain Sci 10(10). https:\/\/doi.org\/10.3390\/brainsci10100687","DOI":"10.3390\/brainsci10100687"},{"key":"17944_CR29","doi-asserted-by":"publisher","unstructured":"Koromilas P, Giannakopoulos T (2021) Deep multimodal emotion recognition on human speech: a review. Appl Sci 11(17). https:\/\/doi.org\/10.3390\/app11177962","DOI":"10.3390\/app11177962"},{"issue":"3\u20134","key":"17944_CR30","doi-asserted-by":"publisher","first-page":"169","DOI":"10.1080\/02699939208411068","volume":"6","author":"P Ekman","year":"1992","unstructured":"Ekman P (1992) An argument for basic emotions. Cogn Emo 6(3\u20134):169\u2013200","journal-title":"Cogn Emo"},{"key":"17944_CR31","doi-asserted-by":"crossref","unstructured":"Plutchik R (2001) The nature of emotions: Human emotions have deep evolutionary roots","DOI":"10.1511\/2001.28.739"},{"issue":"6","key":"17944_CR32","doi-asserted-by":"publisher","first-page":"1161","DOI":"10.1037\/h0077714","volume":"39","author":"JA Russell","year":"1980","unstructured":"Russell JA (1980) A circumplex model of affect. J Pers Soc Psychol 39(6):1161\u20131178","journal-title":"J Pers Soc Psychol"},{"issue":"4","key":"17944_CR33","doi-asserted-by":"publisher","first-page":"261","DOI":"10.1007\/BF02686918","volume":"14","author":"A Mehrabian","year":"1996","unstructured":"Mehrabian A (1996) Pleasure-arousal-dominance: a general framework for describing and measuring individual differences in temperament. Curr Psychol 14(4):261\u2013292","journal-title":"Curr Psychol"},{"key":"17944_CR34","doi-asserted-by":"publisher","unstructured":"Viola P, Jones M (2001) Rapid object detection using a boosted cascade of simple features. In: Proceedings of the 2001 IEEE computer society conference on computer vision and pattern recognition. CVPR 2001, vol. 1, p. https:\/\/doi.org\/10.1109\/CVPR.2001.990517","DOI":"10.1109\/CVPR.2001.990517"},{"key":"17944_CR35","unstructured":"(2001) Active appearance models. IEEE Trans Pattern Anal Mach Intell"},{"key":"17944_CR36","unstructured":"Zhu X, Ramanan D (2012) Face detection, pose estimation, and landmark localization in the wild. In: Computer Vision and Pattern Recognition (CVPR), 2012 IEEE Conference On"},{"key":"17944_CR37","doi-asserted-by":"publisher","unstructured":"Asthana A, Zafeiriou S, Cheng S, Pantic M (2013) Robust discriminative response map fitting with constrained local models. In: 2013 IEEE Conference on computer vision and pattern recognition, pp 3444\u20133451. https:\/\/doi.org\/10.1109\/CVPR.2013.442","DOI":"10.1109\/CVPR.2013.442"},{"key":"17944_CR38","doi-asserted-by":"publisher","unstructured":"Xiong X, De la Torre F (2013) Supervised descent method and its applications to face alignment. In: 2013 IEEE Conference on computer vision and pattern recognition, pp 532\u2013539. https:\/\/doi.org\/10.1109\/CVPR.2013.75","DOI":"10.1109\/CVPR.2013.75"},{"key":"17944_CR39","doi-asserted-by":"publisher","unstructured":"Ren S, Cao X, Wei Y, Sun J (2014) Face alignment at 3000 fps via regressing local binary features. In: 2014 IEEE Conference on computer vision and pattern recognition, pp 1685\u20131692. https:\/\/doi.org\/10.1109\/CVPR.2014.218","DOI":"10.1109\/CVPR.2014.218"},{"key":"17944_CR40","doi-asserted-by":"publisher","unstructured":"Asthana A, Zafeiriou S, Cheng S, Pantic M (2014) Incremental face alignment in the wild. In: 2014 IEEE conference on computer vision and pattern recognition, pp 1859\u20131866. https:\/\/doi.org\/10.1109\/CVPR.2014.240","DOI":"10.1109\/CVPR.2014.240"},{"key":"17944_CR41","doi-asserted-by":"publisher","unstructured":"Sun Y, Wang X, Tang X (2013) Deep convolutional network cascade for facial point detection. In: 2013 IEEE Conference on computer vision and pattern recognition, pp 3476\u20133483. https:\/\/doi.org\/10.1109\/CVPR.2013.446","DOI":"10.1109\/CVPR.2013.446"},{"issue":"10","key":"17944_CR42","doi-asserted-by":"publisher","first-page":"1499","DOI":"10.1109\/LSP.2016.2603342","volume":"23","author":"K Zhang","year":"2016","unstructured":"Zhang K, Zhang Z, Li Z, Qiao Y (2016) Joint face detection and alignment using multitask cascaded convolutional networks. IEEE Signal Process Lett 23(10):1499\u20131503. https:\/\/doi.org\/10.1109\/LSP.2016.2603342","journal-title":"IEEE Signal Process Lett"},{"key":"17944_CR43","doi-asserted-by":"crossref","unstructured":"Pizer SM, Amburn EP, Austin JD, Cromartie R, Geselowitz A, Greer T, ter Haar Romeny B, Zimmerman JB, Zuiderveld K (1987) Adaptive histogramequalization and its variations. Computer vision, graphics, and image processing","DOI":"10.1016\/S0734-189X(87)80186-X"},{"issue":"7","key":"17944_CR44","first-page":"81","volume":"4","author":"AB Watson","year":"1994","unstructured":"Watson AB (1994) Image compression using the discrete cosine transform. Math J 4(7):81\u201388","journal-title":"Math J"},{"key":"17944_CR45","doi-asserted-by":"crossref","unstructured":"Dabbaghchian S, Aghagolzadeh A, Moin MS (2007) Feature extraction using discrete cosine transform for face recognition. In: International symposium on signal processing & its applications","DOI":"10.1109\/ISSPA.2007.4555358"},{"key":"17944_CR46","unstructured":"Zhang Y, Xiong F, Zhang GL (2008) A preprocessing algorithm for illumination invariant face recognition. J Image Graph"},{"issue":"24","key":"17944_CR47","doi-asserted-by":"publisher","first-page":"4942","DOI":"10.1016\/j.optcom.2010.07.047","volume":"283","author":"P Birch","year":"2010","unstructured":"Birch P, Mitra B, Bangalore NM, Rehman S, Young R, Chatwin C (2010) Approximate bandpass and frequency response models of the difference of gaussian filter. Opt Commun 283(24):4942\u20134948","journal-title":"Opt Commun"},{"key":"17944_CR48","doi-asserted-by":"crossref","unstructured":"Short J, Kittler J, Messer K (2004) A comparison of photometric normalisation algorithms for face verification. Proceedings of Automatic Face & Gesture Recognition","DOI":"10.1007\/11527923_64"},{"key":"17944_CR49","doi-asserted-by":"crossref","unstructured":"Hassner T, Harel S, Paz E, Enbar R (2014) Effective face frontalization in unconstrained images. IEEE","DOI":"10.1109\/CVPR.2015.7299058"},{"key":"17944_CR50","doi-asserted-by":"crossref","unstructured":"Yao A, Cai D, Ping H, Wang S, Chen Y (2016) Holonet: towards robust emotion recognition in the wild. In: Acm international conference on multimodal interaction","DOI":"10.1145\/2993148.2997639"},{"key":"17944_CR51","doi-asserted-by":"publisher","unstructured":"Hu P, Cai D, Wang S, Yao A, Chen Y (2017) Learning supervised scoring ensemble for emotion recognition in the wild. ICMI \u201917, Association for Computing Machinery, New York, USA, pp 553\u2013560. https:\/\/doi.org\/10.1145\/3136755.3143009","DOI":"10.1145\/3136755.3143009"},{"key":"17944_CR52","doi-asserted-by":"publisher","unstructured":"Kollias D, Zafeiriou SP (2020) Exploiting multi-cnn features in cnn-rnn based dimensional emotion recognition on the omg in-the-wild dataset. IEEE Trans Affect Comput 1\u20131. https:\/\/doi.org\/10.1109\/TAFFC.2020.3014171","DOI":"10.1109\/TAFFC.2020.3014171"},{"key":"17944_CR53","doi-asserted-by":"publisher","DOI":"10.1109\/TAFFC.2019.2928297","author":"J Han","year":"2019","unstructured":"Han J, Zhang Z, Ren Z, Schuller BW (2019) Emobed: Strengthening monomodal emotion recognition via training with crossmodal emotion embeddings. IEEE Trans Affect Comput. https:\/\/doi.org\/10.1109\/TAFFC.2019.2928297","journal-title":"IEEE Trans Affect Comput"},{"key":"17944_CR54","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2020.3032037","author":"W Nie","year":"2020","unstructured":"Nie W, Ren M, Nie J, Zhao S (2020) C-gcn: Correlation based graph convolutional network for audio-video emotion recognition. IEEE Trans Multimed. https:\/\/doi.org\/10.1109\/TMM.2020.3032037","journal-title":"IEEE Trans Multimed"},{"key":"17944_CR55","doi-asserted-by":"publisher","DOI":"10.1109\/TAFFC.2020.2988455","author":"M Dahmane","year":"2020","unstructured":"Dahmane M, Alam J, St-Charles P-L, Lalonde M, Heffner K, Foucher S (2020) A multimodal non-intrusive stress monitoring from the pleasure-arousal emotional dimensions. IEEE Trans Affect Comput. https:\/\/doi.org\/10.1109\/TAFFC.2020.2988455","journal-title":"IEEE Trans Affect Comput"},{"key":"17944_CR56","unstructured":"Peng S, Zhang L, Ban Y, Fang M, Winkler S (2018) A deep network for arousal-valence emotion prediction with acoustic-visual cues"},{"key":"17944_CR57","unstructured":"Kollias D, Zafeiriou S (2018) A multi-component cnn-rnn approach for dimensional emotion recognition in-the-wild"},{"key":"17944_CR58","unstructured":"Deng D, Zhou Y, Pi J, Shi BE (2018) Multimodal utterance-level affect analysis using visual, audio and text features"},{"key":"17944_CR59","unstructured":"Zheng Z, Cao C, Chen X, Xu G (2018) Multimodal emotion recognition for one-minute-gradual emotion challenge"},{"key":"17944_CR60","unstructured":"Triantafyllopoulos A, Sagha H, Eyben F, Schuller B (2018) audeering\u2019s approach to the one-minute-gradual emotion challenge"},{"key":"17944_CR61","doi-asserted-by":"crossref","unstructured":"Parkhi OM, Vedaldi A, Zisserman A (2015) Deep face recognition. In: British Machine Vision Conference","DOI":"10.5244\/C.29.41"},{"key":"17944_CR62","unstructured":"Chung J, Gulcehre C, Cho KH, Bengio Y (2014) Empirical evaluation of gated recurrent neural networks on sequence modeling. Eprint Arxiv"},{"issue":"8","key":"17944_CR63","doi-asserted-by":"publisher","first-page":"1735","DOI":"10.1162\/neco.1997.9.8.1735","volume":"9","author":"S Hochreiter","year":"1997","unstructured":"Hochreiter S, Schmidhuber J (1997) Long short-term memory. Neural Comput 9(8):1735\u20131780","journal-title":"Neural Comput"},{"issue":"1","key":"17944_CR64","doi-asserted-by":"publisher","first-page":"221","DOI":"10.1109\/TPAMI.2012.59","volume":"35","author":"S Ji","year":"2013","unstructured":"Ji S, Xu W, Yang M, Yu K (2013) 3d convolutional neural networks for human action recognition. IEEE Trans Pattern Anal Mach Intell 35(1):221\u2013231. https:\/\/doi.org\/10.1109\/TPAMI.2012.59","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"17944_CR65","doi-asserted-by":"crossref","unstructured":"Li Q, Gkoumas D, Sordoni A, Nie J, Melucci M (2021) Quantuminspired neural network for conversational emotion recognition. In: Thirty-Fifth AAAI Conference on Artificial Intelligence, AAAI 2021, Thirty-Third Conference on Innovative Applications of Artificial Intelligence, IAAI 2021, The Eleventh Symposium on Educational Advances in Artificial Intelligence, EAAI 2021, Virtual Event, February 2-9, 2021, pp 13270\u201313278. https:\/\/ojs.aaai.org\/index.php\/AAAI\/article\/view\/17567","DOI":"10.1609\/aaai.v35i15.17567"},{"key":"17944_CR66","doi-asserted-by":"publisher","unstructured":"Poria S, Cambria E, Hazarika D, Majumder N, Zadeh A, Morency L-P (2017) Context-dependent sentiment analysis in user-generated videos. In: Proceedings of the 55th annual meeting of the association for computational linguistics (Volume 1: Long Papers), Association for Computational Linguistics, Vancouver, Canada, pp. 873-883. https:\/\/doi.org\/10.18653\/v1\/P17-1081. https:\/\/aclanthology.org\/P17-1081","DOI":"10.18653\/v1\/P17-1081"},{"key":"17944_CR67","doi-asserted-by":"publisher","unstructured":"Tran D, Bourdev L, Fergus R, Torresani L, Paluri M (2015) Learning spatiotemporal features with 3d convolutional networks. In: 2015 IEEE International Conference on Computer Vision (ICCV), pp 4489\u20134497. https:\/\/doi.org\/10.1109\/ICCV.2015.510","DOI":"10.1109\/ICCV.2015.510"},{"key":"17944_CR68","doi-asserted-by":"publisher","DOI":"10.1109\/TAFFC.2020.3005660","author":"S Xing","year":"2020","unstructured":"Xing S, Mai S, Hu H (2020) Adapted dynamic memory network for emotion recognition in conversation. IEEE Trans Affect Comput. https:\/\/doi.org\/10.1109\/TAFFC.2020.3005660","journal-title":"IEEE Trans Affect Comput"},{"key":"17944_CR69","first-page":"6818","volume":"3","author":"N Majumder","year":"2019","unstructured":"Majumder N, Poria S, Hazarika D, Mihalcea R, Cambria E (2019) Dialoguernn: an attentive rnn for emotion detection in conversations. Proc AAAI Conf Artif Intell 3:6818\u20136825","journal-title":"Proc AAAI Conf Artif Intell"},{"key":"17944_CR70","doi-asserted-by":"publisher","first-page":"69","DOI":"10.1016\/j.inffus.2018.09.008","volume":"49","author":"MS Hossain","year":"2019","unstructured":"Hossain MS, Muhammad G (2019) Emotion recognition using deep learning approach from audio-visual emotional big data. Inf Fusion 49:69\u201378. https:\/\/doi.org\/10.1016\/j.inffus.2018.09.008","journal-title":"Inf Fusion"},{"key":"17944_CR71","doi-asserted-by":"publisher","first-page":"184","DOI":"10.1016\/j.inffus.2018.06.003","volume":"46","author":"Y Ma","year":"2018","unstructured":"Ma Y, Hao Y, Min C, Chen J, Ping L, Andrej K (2018) Audio-visual emotion fusion(avef):a deep efficient weighted approach. Inf Fusion 46:184\u2013192","journal-title":"Inf Fusion"},{"key":"17944_CR72","doi-asserted-by":"publisher","unstructured":"Hazarika D, Poria S, Zadeh A, Cambria E, Morency L-P, Zimmermann R (2018) Conversational memory network for emotion recognition in dyadic dialogue videos. In: Proceedings of the 2018 conference of the north american chapter of the association for computational linguistics: human language technologies, vol 1 (LongPapers), Association for Computational Linguistics, New Orleans, Louisiana, pp 2122\u20132132. https:\/\/doi.org\/10.18653\/v1\/N18-1193. https:\/\/aclanthology.org\/N18-1193","DOI":"10.18653\/v1\/N18-1193"},{"key":"17944_CR73","doi-asserted-by":"publisher","unstructured":"Hazarika D, Poria S, Mihalcea R, Cambria E, Zimmermann R (2018) ICON: Interactive conversational memory network for multimodal emotion detection. In: Proceedings of the 2018 conference on empirical methods in natural language processing, Association for Computational Linguistics, Brussels, Belgium, pp 2594\u20132604. https:\/\/doi.org\/10.18653\/v1\/D18-1280. https:\/\/aclanthology.org\/D18-1280","DOI":"10.18653\/v1\/D18-1280"},{"key":"17944_CR74","doi-asserted-by":"publisher","unstructured":"Hara K, Kataoka H, Satoh Y (2018) Can spatiotemporal 3d cnns retrace the history of 2d cnns and imagenet? In: 2018 IEEE\/CVF Conference on computer vision and pattern recognition, pp 6546\u20136555. https:\/\/doi.org\/10.1109\/CVPR.2018.00685","DOI":"10.1109\/CVPR.2018.00685"},{"key":"17944_CR75","unstructured":"Kay W, Carreira J, Simonyan K, Zhang B, Zisserman A (2017) The kinetics human action video dataset"},{"issue":"1","key":"17944_CR76","first-page":"303","volume":"34","author":"S Zhao","year":"2020","unstructured":"Zhao S, Ma Y, Gu Y, Yang J, Keutzer K (2020) An end-to-end visualaudio attention network for emotion recognition in user-generated videos. Proc AAAI Conf Artif Intell 34(1):303\u2013311","journal-title":"Proc AAAI Conf Artif Intell"},{"key":"17944_CR77","doi-asserted-by":"crossref","unstructured":"Deng D, Chen Z, Zhou Y, Shi BE (2020) MIMAMO net: Integrating micro- and macro-motion for video emotion recognition. In: The Thirty\u2013 Fourth AAAI Conference on Artificial Intelligence, AAAI 2020, The Thirty-Second Innovative Applications of Artificial Intelligence Conference, IAAI 2020, The Tenth AAAI Symposium on Educational Advances in Artificial Intelligence, EAAI 2020, New York, NY, USA, February 7\u201312, 2020, pp 2621\u20132628","DOI":"10.1609\/aaai.v34i03.5646"},{"issue":"1","key":"17944_CR78","doi-asserted-by":"publisher","first-page":"49","DOI":"10.1023\/A:1026553619983","volume":"40","author":"J Portilla","year":"2000","unstructured":"Portilla J, Simoncelli EP (2000) A parametric texture model based on joint statistics of complex wavelet coefficients. Int J Comput Vis 40(1):49\u201370","journal-title":"Int J Comput Vis"},{"key":"17944_CR79","doi-asserted-by":"crossref","unstructured":"Albanie S, Nagrani A, Vedaldi A, Zisserman A (2018) Emotion recognition in speech using cross-modal transfer in the wild, 292\u2013301","DOI":"10.1145\/3240508.3240578"},{"key":"17944_CR80","doi-asserted-by":"crossref","unstructured":"Cao Q, Shen L, Xie W, Parkhi OM, Zisserman A (2017) Vggface2: A dataset for recognising faces across pose and age. In: IEEE International conference on automatic face & gesture recognition","DOI":"10.1109\/FG.2018.00020"},{"key":"17944_CR81","doi-asserted-by":"publisher","first-page":"48807","DOI":"10.1109\/ACCESS.2019.2907271","volume":"7","author":"X Pan","year":"2019","unstructured":"Pan X, Ying G, Chen G, Li H, Li W (2019) A deep spatial and temporal aggregation framework for video-based facial expression recognition. IEEE Access 7:48807\u201348815. https:\/\/doi.org\/10.1109\/ACCESS.2019.2907271","journal-title":"IEEE Access"},{"key":"17944_CR82","doi-asserted-by":"crossref","unstructured":"Feng D, Ren F (2018) Dynamic facial expression recognition based on twostream\u2013cnn with lbp-top. In: 2018 5th IEEE International conference on cloud computing and intelligence systems (CCIS)","DOI":"10.1109\/CCIS.2018.8691380"},{"key":"17944_CR83","first-page":"1553","volume-title":"Former-DFER: dynamic facial expression recognition transformer","author":"Z Zhao","year":"2021","unstructured":"Zhao Z, Liu Q (2021) Former-DFER: dynamic facial expression recognition transformer. Association for Computing Machinery, New York, NY, USA, pp 1553\u20131561"},{"key":"17944_CR84","doi-asserted-by":"publisher","first-page":"279","DOI":"10.1007\/978-90-481-3660-5_47","volume-title":"Advanced techniques in computing sciences and software engineering","author":"RG Bachu","year":"2010","unstructured":"Bachu RG, Kopparthi S, Adapa B, Barkana BD (2010) Voiced\/unvoiced decision for speech signals based on zero-crossing rate and energy. In: Elleithy K (ed) Advanced techniques in computing sciences and software engineering. Springer, Dordrecht, pp 279\u2013282"},{"issue":"1","key":"17944_CR85","doi-asserted-by":"publisher","first-page":"142","DOI":"10.1109\/TMM.2011.2171334","volume":"14","author":"J Lin","year":"2012","unstructured":"Lin J, Wu C, Wei W (2012) Error weighted semi-coupled hidden markov model for audio-visual emotion recognition. IEEE Trans Multim 14(1):142\u2013156. https:\/\/doi.org\/10.1109\/TMM.2011.2171334","journal-title":"IEEE Trans Multim"},{"key":"17944_CR86","doi-asserted-by":"crossref","unstructured":"Shirian A, Guha T (2021) Compact graph architecture for speech emotion recognition. In: ICASSP 2021 \u2013 2021 IEEE International conference on acoustics, speech and signal processing (ICASSP), pp 6284\u20136288","DOI":"10.1109\/ICASSP39728.2021.9413876"},{"key":"17944_CR87","doi-asserted-by":"publisher","unstructured":"Wang X, Wang M, Qi W, Su W, Wang X, Zhou H (2021) A novel end-to-end speech emotion recognition network with stacked transformer layers. In: ICASSP 2021 \u2013 2021 IEEE International conference on acoustics, speech and signal processing (ICASSP), pp 6289\u20136293. https:\/\/doi.org\/10.1109\/ICASSP39728.2021.9414314","DOI":"10.1109\/ICASSP39728.2021.9414314"},{"key":"17944_CR88","doi-asserted-by":"publisher","unstructured":"Lin W-C, Busso C (2021) Chunk-level speech emotion recognition: a general framework of sequence-to-one dynamic temporal modeling. IEEE Trans Affect Comput. https:\/\/doi.org\/10.1109\/TAFFC.2021.3083821","DOI":"10.1109\/TAFFC.2021.3083821"},{"key":"17944_CR89","unstructured":"Sl A, Xx B, Wf B, Bc C, Pf B (2021) Spatiotemporal and frequential cascaded attention networks for speech emotion recognition. Neurocomputing"},{"issue":"1","key":"17944_CR90","doi-asserted-by":"publisher","first-page":"68","DOI":"10.1109\/TCE.2021.3056421","volume":"67","author":"R Chatterjee","year":"2021","unstructured":"Chatterjee R, Mazumdar S, Sherratt RS, Halder R, Maitra T, Giri D (2021) Real-time speech emotion analysis for smart home assistants. IEEE Trans Consum Electron 67(1):68\u201376. https:\/\/doi.org\/10.1109\/TCE.2021.3056421","journal-title":"IEEE Trans Consum Electron"},{"key":"17944_CR91","doi-asserted-by":"crossref","unstructured":"Mustaqeem Kwon S (2021) Att-net: enhanced emotion recognition system using lightweight self-attention module. Appl Soft Comput 102(4)","DOI":"10.1016\/j.asoc.2021.107101"},{"key":"17944_CR92","doi-asserted-by":"publisher","unstructured":"Nediyanchath A, Paramasivam P, Yenigalla P (2020) Multi-head attention for speech emotion recognition with auxiliary learning of gender recognition. In: ICASSP 2020 - 2020 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp 7179\u20137183. https:\/\/doi.org\/10.1109\/ICASSP40776.2020.9054073","DOI":"10.1109\/ICASSP40776.2020.9054073"},{"key":"17944_CR93","doi-asserted-by":"publisher","unstructured":"Zhang S, Zhao X, Tian Q (2019) Spontaneous speech emotion recognition using multiscale deep convolutional lstm. IEEE Trans Affect Comput 1\u20131. https:\/\/doi.org\/10.1109\/TAFFC.2019.2947464","DOI":"10.1109\/TAFFC.2019.2947464"},{"key":"17944_CR94","doi-asserted-by":"crossref","unstructured":"Lotfian R, Busso C (2019) Curriculum learning for speech emotion recognition from crowdsourced labels. IEEE\/ACM Trans Audio Speech Lang Process PP(99):1\u20131","DOI":"10.1109\/TASLP.2019.2898816"},{"key":"17944_CR95","doi-asserted-by":"publisher","unstructured":"Kim J, Englebienne G, Truong KP, Evers V (2017) Deep temporal models using identity skip-connections for speech emotion recognition. In: Liu Q, Lienhart R, Wang H, Chen SK, Boll S, Chen YP, Friedland G, Li J, Yan S (eds) Proceedings of the 2017 ACM on multimedia conference, MM 2017, Mountain View, CA, USA, October 23\u201327, 2017, pp 1006\u20131013. https:\/\/doi.org\/10.1145\/3123266.3123353","DOI":"10.1145\/3123266.3123353"},{"key":"17944_CR96","doi-asserted-by":"crossref","unstructured":"Han J, Zhang Z, Ringeval F, Schuller B (2017) Reconstruction-error-based learning for continuous emotion recognition in speech. In: ICASSP 2017 \u2013 2017 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","DOI":"10.1109\/ICASSP.2017.7952580"},{"key":"17944_CR97","doi-asserted-by":"crossref","unstructured":"Latif S, Rana R, Qadir J, Epps J (2017) Variational autoencoders for learning latent representations of speech emotion: a preliminary study. In: Interspeech 2018","DOI":"10.21437\/Interspeech.2018-1568"},{"key":"17944_CR98","unstructured":"Xi M, Wu Z, Jia J, Xu M, Cai L (2018) Emotion recognition from variable-length speech segments using deep learning on spectrograms. In: Interspeech 2018"},{"key":"17944_CR99","doi-asserted-by":"crossref","unstructured":"Shi B, Fu Z, Bing L, Lam W (2018) Learning domain-sensitive and sentiment-aware word embeddings. In: Proceedings of the 56th annual meeting of the association for computational linguistics (Volume 1: Long Papers)","DOI":"10.18653\/v1\/P18-1232"},{"key":"17944_CR100","doi-asserted-by":"crossref","unstructured":"Etienne C, Fidanza G, Petrovskii A, Devillers L, Schmauch B (2018) Cnn+lstm architecture for speech emotion recognition with data augmentation","DOI":"10.21437\/SMM.2018-5"},{"key":"17944_CR101","doi-asserted-by":"crossref","unstructured":"Neumann M, Vu NT (2017) Attentive convolutional neural network based speech emotion recognition: A study on the impact of input features, signal length, and acted speech","DOI":"10.21437\/Interspeech.2017-917"},{"key":"17944_CR102","doi-asserted-by":"crossref","unstructured":"Lim W, Jang D, Lee T (2017) Speech emotion recognition using convolutional and recurrent neural networks. In: 2016 Asia-Pacific Signal and Information Processing Association Annual Summit and Conference (APSIPA)","DOI":"10.1109\/APSIPA.2016.7820699"},{"key":"17944_CR103","unstructured":"Chernykh V, Sterling G, Prihodko P (2017) Emotion recognition from speech with recurrent neural networks"},{"key":"17944_CR104","doi-asserted-by":"crossref","unstructured":"Trigeorgis G, Ringeval F, Brueckner R, Marchi E, Zafeiriou S (2016) Adieu features? end-to-end speech emotion recognition using a deep convolutional recurrent network. In: IEEE International conference on acoustics","DOI":"10.1109\/ICASSP.2016.7472669"},{"key":"17944_CR105","doi-asserted-by":"crossref","unstructured":"Huang Z, Dong M, Mao Q, Zhan Y (2014) Speech emotion recognition using cnn. In: Acm International Conference","DOI":"10.1145\/2647868.2654984"},{"key":"17944_CR106","doi-asserted-by":"publisher","unstructured":"Zhu Z, Sato Y (2023) Deep investigation of intermediate representations in self-supervised learning models for speech emotion recognition. In: 2023 IEEE International conference on acoustics, speech, and signal processing workshops (ICASSPW), pp 1\u20135. https:\/\/doi.org\/10.1109\/ICASSPW59220.2023.10193018","DOI":"10.1109\/ICASSPW59220.2023.10193018"},{"key":"17944_CR107","doi-asserted-by":"publisher","unstructured":"Sadok S, Leglaive S, S\u00e9guier R (2023) A vector quantized masked autoencoder for speech emotion recognition. In: 2023 IEEE International conference on acoustics, speech, and signal processing workshops (ICASSPW), pp 1\u20135. https:\/\/doi.org\/10.1109\/ICASSPW59220.2023.10193151","DOI":"10.1109\/ICASSPW59220.2023.10193151"},{"key":"17944_CR108","unstructured":"Mikolov T, Sutskever I, Kai C, Corrado G, Dean J (2013) Distributed representations of words and phrases and their compositionality. In: Advances in neural information processing systems"},{"key":"17944_CR109","unstructured":"Mikolov T, Chen K, Corrado G, Dean J (2013) Efficient estimation of word representations in vector space. Comput Sci"},{"key":"17944_CR110","doi-asserted-by":"crossref","unstructured":"Pennington J, Socher R, Manning C (2014) Glove: Global vectors for word representation. In: Conference on empirical methods in natural language processing","DOI":"10.3115\/v1\/D14-1162"},{"key":"17944_CR111","doi-asserted-by":"crossref","unstructured":"Peters M, Neumann M, Iyyer M, Gardner M, Zettlemoyer L (2018) Deep contextualized word representations. In: Proceedings of the 2018 conference of the north american chapter of the association for computational linguistics: human language technologies, volume 1 (Long Papers)","DOI":"10.18653\/v1\/N18-1202"},{"key":"17944_CR112","unstructured":"Devlin J, Chang MW, Lee K, Toutanova K (2018) Bert: Pre-training of deep bidirectional transformers for language understanding"},{"key":"17944_CR113","doi-asserted-by":"crossref","unstructured":"Camacho-Collados J, Pilehvar MT (2018) From word to sense embeddings: a survey on vector representations of meaning. J Artif Intell Res","DOI":"10.1613\/jair.1.11259"},{"key":"17944_CR114","unstructured":"Song K, Tan X, Qin T, Lu J, Liu TY (2019) Mass: Masked sequence to sequence pre-training for language generation"},{"key":"17944_CR115","unstructured":"Yang Z, Dai Z, Yang Y, Carbonell J, Salakhutdinov R, Le QV (2019) Xlnet: Generalized autoregressive pretraining for language understanding"},{"key":"17944_CR116","doi-asserted-by":"crossref","unstructured":"Xu P, Madotto A, Wu CS, Park JH, Fung P (2018) Emo2vec: Learning generalized emotion representation by multi-task training","DOI":"10.18653\/v1\/W18-6243"},{"key":"17944_CR117","doi-asserted-by":"crossref","unstructured":"Felbo B, Mislove A, Sgaard A, Rahwan I, Lehmann S (2017) Using millions of emoji occurrences to learn any-domain representations for detecting sentiment, emotion and sarcasm. In: Proceedings of the 2017 conference on empirical methods in natural language processing","DOI":"10.18653\/v1\/D17-1169"},{"key":"17944_CR118","doi-asserted-by":"crossref","unstructured":"Winata GI, Madotto A, Lin Z, Shin J, Xu Y, Xu P, Fung P (2019) Caire hkust at semeval-2019 task 3: Hierarchical attention for dialogue emotion classification","DOI":"10.18653\/v1\/S19-2021"},{"key":"17944_CR119","doi-asserted-by":"publisher","DOI":"10.1109\/TAFFC.2020.3034215","author":"J Deng","year":"2020","unstructured":"Deng J, Ren F (2020) Multi-label emotion detection via emotion-specified feature extraction and emotion correlation learning. IEEE Trans Affect Comput. https:\/\/doi.org\/10.1109\/TAFFC.2020.3034215","journal-title":"IEEE Trans Affect Comput"},{"issue":"5","key":"17944_CR120","first-page":"8002","volume":"34","author":"W Jiao","year":"2020","unstructured":"Jiao W, Lyu M, King I (2020) Real-time emotion recognition via attention gated hierarchical memory network. Proc AAAI Conf Artif Intell 34(5):8002\u20138009","journal-title":"Proc AAAI Conf Artif Intell"},{"key":"17944_CR121","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1016\/j.inffus.2020.06.005","volume":"65","author":"D Hazarika","year":"2021","unstructured":"Hazarika D, Poria S, Zimmermann R, Mihalcea R (2021) Conversational transfer learning for emotion recognition. Inf Fusion 65:1\u201312. https:\/\/doi.org\/10.1016\/j.inffus.2020.06.005","journal-title":"Inf Fusion"},{"key":"17944_CR122","doi-asserted-by":"publisher","unstructured":"Hu D, Bao Y, Wei L, Zhou W, Hu S (2023) Supervised adversarial contrastive learning for emotion recognition in conversations. In: Rogers A, Boyd-Graber JL, Okazaki N (eds) Proceedings of the 61st annual meeting of the association for computational linguistics (Volume 1: Long Papers), ACL 2023, Toronto, Canada, July 9-14, 2023, pp 10835\u201310852. https:\/\/doi.org\/10.18653\/v1\/2023.acl-long.606","DOI":"10.18653\/v1\/2023.acl-long.606"},{"key":"17944_CR123","doi-asserted-by":"crossref","unstructured":"Ghosal D, Majumder N, Poria S, Chhaya N, Gelbukh A (2019) Dialoguegcn: a graph convolutional neural network for emotion recognition in conversation. arXiv:1908.11540","DOI":"10.18653\/v1\/D19-1015"},{"key":"17944_CR124","doi-asserted-by":"crossref","unstructured":"Shen W, Wu S, Yang Y, Quan X (2021) Directed acyclic graph network for conversational emotion recognition. arXiv:2105.12907","DOI":"10.18653\/v1\/2021.acl-long.123"},{"issue":"11","key":"17944_CR125","doi-asserted-by":"publisher","first-page":"13121","DOI":"10.1609\/aaai.v37i11.26541","volume":"37","author":"W Li","year":"2023","unstructured":"Li W, Zhu L, Mao R, Cambria E (2023) Skier: a symbolic knowledge integrated model for conversational emotion recognition. Proc AAAI Conf Artif Intell 37(11):13121\u201313129. https:\/\/doi.org\/10.1609\/aaai.v37i11.26541","journal-title":"Proc AAAI Conf Artif Intell"},{"key":"17944_CR126","doi-asserted-by":"publisher","first-page":"13789","DOI":"10.1609\/aaai.v35i15.17625","volume":"35","author":"W Shen","year":"2021","unstructured":"Shen W, Chen J, Quan X, Xie Z (2021) Dialogxl: All-in-one xlnet for multi-party conversation emotion recognition. Proceedings of the AAAI conference on artificial intelligence 35:13789\u201313797","journal-title":"Proceedings of the AAAI conference on artificial intelligence"},{"key":"17944_CR127","doi-asserted-by":"crossref","unstructured":"Zhu L, Pergola G, Gui L, Zhou D, He Y (2021) Topic-driven and knowledge-aware transformer for dialogue emotion detection. arXiv:2106.01071","DOI":"10.18653\/v1\/2021.acl-long.125"},{"key":"17944_CR128","doi-asserted-by":"publisher","unstructured":"Zhang T, Chen Z, Zhong M, Qian T (2023) Mimicking the thinking process for emotion recognition in conversation with prompts and paraphrasing. In: Proceedings of the thirty-second international joint conference on artificial intelligence, IJCAI 2023, 19th-25th August 2023, Macao, SAR, China, pp 6299\u20136307. https:\/\/doi.org\/10.24963\/ijcai.2023\/699","DOI":"10.24963\/ijcai.2023\/699"},{"key":"17944_CR129","doi-asserted-by":"publisher","unstructured":"Lewis M, Liu Y, Goyal N, Ghazvininejad M, Mohamed A, Levy O, Stoyanov V, Zettlemoyer L (2020) BART: Denoising sequence-tosequence pre-training for natural language generation, translation, and comprehension. In: Proceedings of the 58th annual meeting of the association for computational linguistics, Association for Computational Linguistics, Online, pp 7871\u20137880. https:\/\/doi.org\/10.18653\/v1\/2020.acl-main.703. https:\/\/aclanthology.org\/2020.acl-main.703","DOI":"10.18653\/v1\/2020.acl-main.703"},{"key":"17944_CR130","doi-asserted-by":"publisher","unstructured":"Lee J, Lee W (2022) CoMPM: Context modeling with speaker\u2019s pre\u2013trained memory tracking for emotion recognition in conversation. In: Proceedings of the 2022 conference of the North American chapter of the association for computational linguistics: human language technologies, Association for Computational Linguistics, Seattle, United States, pp 5669\u20135679. https:\/\/doi.org\/10.18653\/v1\/2022.naaclmain.416. https:\/\/aclanthology.org\/2022.naacl-main.416","DOI":"10.18653\/v1\/2022.naaclmain.416"},{"key":"17944_CR131","doi-asserted-by":"publisher","unstructured":"Zhang D, Chen F, Chen X (2023) DualGATs: Dual graph attention networks for emotion recognition in conversations. In: Proceedings of the 61st annual meeting of the association for computational linguistics (Volume 1: Long Papers), Association for Computational Linguistics, Toronto, Canada, pp 7395\u20137408. https:\/\/doi.org\/10.18653\/v1\/2023.acl-long.408. https:\/\/aclanthology.org\/2023.acl-long.408","DOI":"10.18653\/v1\/2023.acl-long.408"},{"issue":"11","key":"17944_CR132","doi-asserted-by":"publisher","first-page":"13492","DOI":"10.1609\/aaai.v37i11.26582","volume":"37","author":"X Qin","year":"2023","unstructured":"Qin X, Wu Z, Zhang T, Li Y, Luan J, Wang B, Wang L, Cui J (2023) Bert-erc: Fine-tuning bert is enough for emotion recognition in conversation. Proc AAAI Conf Artif Intell 37(11):13492\u201313500. https:\/\/doi.org\/10.1609\/aaai.v37i11.26582","journal-title":"Proc AAAI Conf Artif Intell"},{"key":"17944_CR133","doi-asserted-by":"crossref","unstructured":"Zhang D, Ju X, Zhang W, Li J, Li S, Zhu Q, Zhou G (2021) Multimodal multi-label emotion recognition with heterogeneous hierarchical message passing. In: Thirty-Fifth AAAI conference on artificial intelligence, AAAI 2021, thirty-third conference on innovative applications of artificial intelligence, IAAI 2021, the eleventh symposium on educational advances in artificial intelligence, EAAI 2021, Virtual Event, February 2\u20139, 2021, pp 14338\u201314346","DOI":"10.1609\/aaai.v35i16.17686"},{"key":"17944_CR134","doi-asserted-by":"crossref","unstructured":"Xu G, Li W, Liu J (2019) A social emotion classification approach using multi-model fusion. Futur Gener Comput Syst 102","DOI":"10.1016\/j.future.2019.07.007"},{"key":"17944_CR135","doi-asserted-by":"publisher","unstructured":"Liang J, Li R, Jin Q (2020) Semi-supervised multi-modal emotion recognition with cross-modal distribution matching. In: Proceedings of the 28th ACM international conference on multimedia. MM \u201920, Association for Computing Machinery, New York, USA , pp 2852\u20132861. https:\/\/doi.org\/10.1145\/3394171.3413579","DOI":"10.1145\/3394171.3413579"},{"issue":"5","key":"17944_CR136","first-page":"7985","volume":"34","author":"M Jaiswal","year":"2020","unstructured":"Jaiswal M, Provost EM (2020) Privacy enhanced multimodal neural representations for emotion recognition. Proc AAAI Conf Artif Intell 34(5):7985\u20137993","journal-title":"Proc AAAI Conf Artif Intell"},{"key":"17944_CR137","doi-asserted-by":"crossref","unstructured":"Li R, Wu Z, Jia J, Bu Y, Meng H (2019) Towards discriminative representation learning for speech emotion recognition. In: Twenty-eighth international joint conference on artificial intelligence IJCAI-19","DOI":"10.24963\/ijcai.2019\/703"},{"key":"#cr-split#-17944_CR138.1","doi-asserted-by":"crossref","unstructured":"Zhang D, Wu L, Sun C, Li S, Zhu Q, Zhou G (2019) Modeling both context- and speaker-sensitive dependence for emotion detection in multi-speaker conversations. In: Kraus S","DOI":"10.24963\/ijcai.2019\/752"},{"key":"#cr-split#-17944_CR138.2","unstructured":"(ed) Proceedings of the twenty-eighth international joint conference on artificial intelligence, IJCAI 2019, Macao, China, August 10-16, 2019, pp 5415-5421"},{"key":"17944_CR139","doi-asserted-by":"crossref","unstructured":"Zhou S, Jia J, Wang Q, Dong Y, Yin Y, Lei K (2018) Inferring emotion from conversational voice data: a semi-supervised multi-path generative neural network approach. In: McIlraith SA, Weinberger KQ (eds) Proceedings of the thirty-second AAAI conference on artificial intelligence(AAAI\u201318), pp 579\u2013587","DOI":"10.1609\/aaai.v32i1.11280"},{"key":"17944_CR140","unstructured":"Zhang Z, Han J, Coutinho E, Schuller BW (2018) Dynamic difficulty awareness training for continuous emotion prediction. IEEE Trans Multimed 1\u20131"},{"issue":"8","key":"17944_CR141","doi-asserted-by":"publisher","first-page":"1301","DOI":"10.1109\/JSTSP.2017.2764438","volume":"11","author":"P Tzirakis","year":"2017","unstructured":"Tzirakis P, Trigeorgis G, Nicolaou MA, Schuller BW, Zafeiriou S (2017) End-to-end multimodal emotion recognition using deep neural networks. IEEE J Sel Top Signal Process 11(8):1301\u20131309. https:\/\/doi.org\/10.1109\/JSTSP.2017.2764438","journal-title":"IEEE J Sel Top Signal Process"},{"key":"17944_CR142","doi-asserted-by":"crossref","unstructured":"Han J, Zhang Z, Cummins N, Ringeval F, Schuller B (2017) Strength modelling for real-world automatic continuous affect recognition from audiovisual signals. Image Vis Comput 65(sep.):76\u201386","DOI":"10.1016\/j.imavis.2016.11.020"},{"key":"17944_CR143","doi-asserted-by":"crossref","unstructured":"Poria S, Cambria E, Hazarika D, Majumder N, Zadeh A, Morency L-P (2017) Context-dependent sentiment analysis in user-generated videos. In: Proceedings of the 55th annual meeting of the association for computational linguistics (volume 1: Long Papers), pp 873\u2013883","DOI":"10.18653\/v1\/P17-1081"},{"issue":"10","key":"17944_CR144","doi-asserted-by":"publisher","first-page":"3030","DOI":"10.1109\/TCSVT.2017.2719043","volume":"28","author":"S Zhang","year":"2018","unstructured":"Zhang S, Zhang S, Huang T, Gao W, Tian Q (2018) Learning affective features with a hybrid deep model for audio-visual emotion recognition. IEEE Trans Circuits Syst Video Technol 28(10):3030\u20133043. https:\/\/doi.org\/10.1109\/TCSVT.2017.2719043","journal-title":"IEEE Trans Circuits Syst Video Technol"},{"key":"17944_CR145","doi-asserted-by":"crossref","unstructured":"W\u00f6llmer M, Metallinou A, Eyben F, Schuller B, Narayanan SS (2010) Context-sensitive multimodal emotion recognition from speech and facial expression using bidirectional lstm modeling. In: INTERSPEECH","DOI":"10.21437\/Interspeech.2010-646"},{"key":"17944_CR146","unstructured":"Vaswani A, Shazeer N, Parmar N, Uszkoreit J, Jones L, Gomez AN, Kaiser L, Polosukhin I (2017) Attention is all you need. arXiv"},{"key":"17944_CR147","doi-asserted-by":"publisher","first-page":"46","DOI":"10.1016\/j.inffus.2020.10.011","volume":"68","author":"P Tzirakis","year":"2021","unstructured":"Tzirakis P, Chen J, Zafeiriou S, Schuller B (2021) End-to-end multimodal affect recognition in real-world environments. Inf Fusion 68:46\u201353","journal-title":"Inf Fusion"},{"key":"17944_CR148","doi-asserted-by":"crossref","unstructured":"Mittal T, Bhattacharya U, Chandra R, Bera A, Manocha D (2020) M3er: Multiplicative multimodal emotion recognition using facial, textual, and speech cues. Proceedings of the AAAI Conference on Artificial Intelligence","DOI":"10.1609\/aaai.v34i02.5492"},{"key":"17944_CR149","doi-asserted-by":"publisher","first-page":"985","DOI":"10.1109\/TASLP.2021.3049898","volume":"29","author":"Z Lian","year":"2021","unstructured":"Lian Z, Liu B, Tao J (2021) Ctnet: conversational transformer network for emotion recognition. IEEE\/ACM Trans Audio Speech Lang Process 29:985\u20131000. https:\/\/doi.org\/10.1109\/TASLP.2021.3049898","journal-title":"IEEE\/ACM Trans Audio Speech Lang Process"},{"key":"17944_CR150","doi-asserted-by":"crossref","unstructured":"Zadeh A, Poria S, Liang PP, Cambria E, Mazumder N, Morency L-P (2018) Memory fusion network for multi-view sequential learning, New Orleans, LA, United states, pp 5634\u20135641. Attention mechanisms; Benchmark datasets;Multi-views;Neural architectures;Sequential learning;Specific interaction; State of the art;","DOI":"10.1609\/aaai.v32i1.12021"},{"issue":"2","key":"17944_CR151","first-page":"1351","volume":"34","author":"E Mansouri-Benssassi","year":"2020","unstructured":"Mansouri-Benssassi E, Ye J (2020) Synch-graph: Multisensory emotion recognition through neural synchrony via graph convolutional networks. Proc AAAI Conf Artif Intell 34(2):1351\u20131358","journal-title":"Proc AAAI Conf Artif Intell"},{"key":"17944_CR152","unstructured":"Mao Y, Sun Q, Liu G, Wang X, Gao W, Li X, Shen J (2020) Dialoguetrm: exploring the intra-and inter-modal emotional behaviors in the conversation. arXiv:2010.07637"},{"key":"17944_CR153","doi-asserted-by":"publisher","unstructured":"Xie B, Sidulova M, Park CH (2021) Robust multimodal emotion recognition from conversation with transformer-based crossmodality fusion. Sensors 21(14). https:\/\/doi.org\/10.3390\/s21144913","DOI":"10.3390\/s21144913"},{"key":"17944_CR154","doi-asserted-by":"publisher","first-page":"176274","DOI":"10.1109\/ACCESS.2020.3026823","volume":"8","author":"S Siriwardhana","year":"2020","unstructured":"Siriwardhana S, Kaluarachchi T, Billinghurst M, Nanayakkara S (2020) Multimodal emotion recognition with transformer-based self supervised feature fusion. IEEE Access 8:176274\u2013176285. https:\/\/doi.org\/10.1109\/ACCESS.2020.3026823","journal-title":"IEEE Access"},{"key":"17944_CR155","doi-asserted-by":"crossref","unstructured":"Huang J, Tao J, Liu B, Lian Z, Niu M (2020) Multimodal transformer fusion for continuous emotion recognition. In: ICASSP 2020 - 2020 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","DOI":"10.1109\/ICASSP40776.2020.9053762"},{"key":"17944_CR156","doi-asserted-by":"crossref","unstructured":"Li Y, Wang Y, Cui Z (2023) Decoupled multimodal distilling for emotion recognition. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition (CVPR), pp 6631\u20136640","DOI":"10.1109\/CVPR52729.2023.00641"},{"key":"17944_CR157","doi-asserted-by":"publisher","unstructured":"Yang D, Huang S, Kuang H, Du Y, Zhang L (2022) Disentangled representation learning for multimodal emotion recognition. In: Proceedings of the 30th ACM International Conference on Multimedia. MM \u201922, Association for Computing Machinery, New York, USA, pp 1642\u20131651. https:\/\/doi.org\/10.1145\/3503161.3547754","DOI":"10.1145\/3503161.3547754"},{"key":"17944_CR158","doi-asserted-by":"publisher","unstructured":"Sun J, Han S, Ruan Y-P, Zhang X, Zheng S-K, Liu Y, Huang Y, Li T (2023) Layer-wise fusion with modality independence modeling for multi-modal emotion recognition. In: Proceedings of the 61st annual meeting of the association for computational linguistics (Volume 1: Long Papers), Association for Computational Linguistics, Toronto, Canada, pp 658\u2013670. https:\/\/doi.org\/10.18653\/v1\/2023.acl-long.39. https:\/\/aclanthology.org\/2023.acl-long.39","DOI":"10.18653\/v1\/2023.acl-long.39"},{"key":"17944_CR159","doi-asserted-by":"publisher","unstructured":"Hu G, Lin T-E, Zhao Y, Lu G, Wu Y, Li Y (2022) UniMSE: Towards unified multimodal sentiment analysis and emotion recognition. In: Proceedings of the 2022 conference on empirical methods in natural language processing, Association for Computational Linguistics, Abu Dhabi, United Arab Emirates, pp 7837\u20137851. https:\/\/doi.org\/10.18653\/v1\/2022.emnlp-main.534. https:\/\/aclanthology.org\/2022.emnlp-main.534","DOI":"10.18653\/v1\/2022.emnlp-main.534"},{"key":"17944_CR160","doi-asserted-by":"crossref","unstructured":"Zhang T, Tan Z, Wu X (2023) Haan-erc: hierarchical adaptive attention network for multimodal emotion recognition in conversation. Neural Comput & Applic 1\u201314","DOI":"10.1007\/s00521-023-08638-2"},{"key":"17944_CR161","doi-asserted-by":"publisher","unstructured":"Joshi A, Bhat A, Jain A, Singh A, Modi A (2022) COGMEN: COntextualized GNN based multimodal emotion recognitioN. In: Proceedings of the 2022 conference of the north american chapter of the association for computational linguistics: human language technologies, Association for Computational Linguistics, Seattle, United States, pp 4148\u20134164. https:\/\/doi.org\/10.18653\/v1\/2022.naaclmain.306. https:\/\/aclanthology.org\/2022.naacl-main.306","DOI":"10.18653\/v1\/2022.naaclmain.306"},{"key":"17944_CR162","doi-asserted-by":"publisher","unstructured":"Ge S, Jiang Z, Cheng Z, Wang C, Yin Y, Gu Q (2023) Learning robust multi-modal representation for multi-label emotion recognition via adversarial masking and perturbation. In: Proceedings of the ACM Web Conference 2023. WWW \u201923, Association for Computing Machinery, New York, USA, pp 1510\u20131518. https:\/\/doi.org\/10.1145\/3543507.3583258","DOI":"10.1145\/3543507.3583258"},{"key":"17944_CR163","doi-asserted-by":"publisher","unstructured":"Wu M, Su W, Chen L, Pedrycz W, Hirota K (2020) Two-stage fuzzy fusion based-convolution neural network for dynamic emotion recognition. IEEE Trans Affect Comput 1\u20131. https:\/\/doi.org\/10.1109\/TAFFC.2020.2966440","DOI":"10.1109\/TAFFC.2020.2966440"},{"key":"17944_CR164","doi-asserted-by":"crossref","unstructured":"Zhang Y, Wang ZR, Du J (2019) Deep fusion: an attention guided factorized bilinear pooling for audio-video emotion recognition","DOI":"10.1109\/IJCNN.2019.8851942"},{"key":"17944_CR165","unstructured":"Shuang F, Chen C (2018) Fuzzy broad learning system: a novel neurofuzzy model for regression and classification. IEEE Trans Cybern PP(99):1\u201311"},{"key":"17944_CR166","doi-asserted-by":"publisher","first-page":"42","DOI":"10.1016\/j.neucom.2020.01.048","volume":"391","author":"M Hao","year":"2020","unstructured":"Hao M, Cao W-H, Liu Z-T, Wu M, Xiao P (2020) Visual-audio emotion recognition based on multi-task and ensemble learning with multiple features. Neurocomputing 391:42\u201351. https:\/\/doi.org\/10.1016\/j.neucom.2020.01.048","journal-title":"Neurocomputing"},{"key":"17944_CR167","doi-asserted-by":"crossref","unstructured":"Han J, Zhang Z, Schmitt M, Pantic M, Schuller B (2017) From hard to soft: Towards more human-like emotion recognition by modelling the perception uncertainty. In: the 2017 ACM","DOI":"10.1145\/3123266.3123383"},{"key":"17944_CR168","doi-asserted-by":"crossref","unstructured":"Hu P, Cai D, Wang S, Yao A, Chen Y (2017) Learning supervised scoring ensemble for emotion recognition in the wild. In: the 19th ACM International Conference","DOI":"10.1145\/3136755.3143009"},{"key":"17944_CR169","doi-asserted-by":"crossref","unstructured":"Sahoo S, Routray A (2017) Emotion recognition from audio-visual data using rule based decision level fusion. IEEE","DOI":"10.1109\/TechSym.2016.7872646"},{"key":"17944_CR170","doi-asserted-by":"crossref","unstructured":"(2008) Iemocap: interactive emotional dyadic motion capture database. Lang Resour Eval 42(4):335\u2013359","DOI":"10.1007\/s10579-008-9076-6"},{"key":"17944_CR171","doi-asserted-by":"crossref","unstructured":"Schuller B, Valstar M, Cowie R, Pantic M (2012) Avec 2012: the continuous audio\/visual emotion challenge. In: Acm international conference on multimodal interaction","DOI":"10.1145\/2388676.2388758"},{"key":"17944_CR172","doi-asserted-by":"publisher","unstructured":"Bagher Zadeh A, Liang PP, Poria S, Cambria E, Morency L-P (2018) Multimodal language analysis in the wild: CMU-MOSEI dataset and interpretable dynamic fusion graph. In: Proceedings of the 56th annual meeting of the association for computational linguistics (Volume 1: Long Papers), Association for Computational Linguistics, Melbourne, Australia, pp 2236\u20132246. https:\/\/doi.org\/10.18653\/v1\/P18-1208. https:\/\/www.aclweb.org\/anthology\/P18-1208","DOI":"10.18653\/v1\/P18-1208"},{"key":"17944_CR173","doi-asserted-by":"crossref","unstructured":"Barros P, Churamani N, Lakomkin E, Siqueira H, Sutherland A, Wermter S (2018) The omg-emotion behavior dataset. In: 2018 International Joint Conference on Neural Networks (IJCNN)","DOI":"10.1109\/IJCNN.2018.8489099"},{"key":"17944_CR174","doi-asserted-by":"crossref","unstructured":"Poria S, Hazarika D, Majumder N, Naik G, Mihalcea R (2019) Meld: A multimodal multi-party dataset for emotion recognition in conversations. In: Proceedings of the 57th annual meeting of the association for computational linguistics","DOI":"10.18653\/v1\/P19-1050"},{"key":"17944_CR175","doi-asserted-by":"publisher","unstructured":"Chou H-C, Lin W-C, Chang L-C, Li C-C, Ma H-P, Lee C-C (2017) Nnime: The nthu-ntua chinese interactive multimodal emotion corpus. In: 2017 Seventh international conference on affective computing and intelligent interaction (ACII), pp 292\u2013298. https:\/\/doi.org\/10.1109\/ACII.2017.8273615","DOI":"10.1109\/ACII.2017.8273615"},{"issue":"3","key":"17944_CR176","doi-asserted-by":"publisher","first-page":"1022","DOI":"10.1109\/TPAMI.2019.2944808","volume":"43","author":"J Kossaifi","year":"2021","unstructured":"Kossaifi J, Walecki R, Panagakis Y, Shen J, Schmitt M, Ringeval F, Han J, Pandit V, Toisoul A, Schuller B, Star K, Hajiyev E, Pantic M (2021) Sewa db: A rich database for audio-visual emotion and sentiment research in the wild. IEEE Trans Pattern Anal Mach Intell 43(3):1022\u20131040. https:\/\/doi.org\/10.1109\/TPAMI.2019.2944808","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"17944_CR177","doi-asserted-by":"crossref","unstructured":"Martin O, Kotsia I, Macq B, Pitas I (2006) The enterface\u201905 audio-visual emotion database. In: International conference on data engineering workshops","DOI":"10.1109\/ICDEW.2006.145"},{"key":"17944_CR178","unstructured":"Haq S, Jackson PJB, Edge J (2008) Audio-visual feature selection and reduction for emotion classification. In: Proc. Int. Conf. on Auditory\u2013 Visual Speech Processing (AVSP\u201908), Tangalooma, Australia"},{"issue":"3","key":"17944_CR179","doi-asserted-by":"publisher","first-page":"0034","DOI":"10.1109\/MMUL.2012.26","volume":"19","author":"A Dhall","year":"2012","unstructured":"Dhall A, Goecke R, Lucey S, Gedeon T (2012) Collecting large, richly annotated facial-expression databases from movies. IEEE Multimed 19(3):0034","journal-title":"IEEE Multimed"},{"key":"17944_CR180","doi-asserted-by":"publisher","unstructured":"Ringeval F, Sonderegger A, Sauer J, Lalanne D (2013) Introducing the recola multimodal corpus of remote collaborative and affective interactions. In: 2013 10th IEEE International conference and workshops on automatic face and gesture recognition (FG), pp 1\u20138. https:\/\/doi.org\/10.1109\/FG.2013.6553805","DOI":"10.1109\/FG.2013.6553805"},{"key":"17944_CR181","doi-asserted-by":"crossref","unstructured":"Jiang YG, Xu B, Xue X (2014) Predicting emotions in user-generated videos. AAAI Press","DOI":"10.1609\/aaai.v28i1.8724"},{"issue":"4","key":"17944_CR182","doi-asserted-by":"publisher","first-page":"377","DOI":"10.1109\/TAFFC.2014.2336244","volume":"5","author":"H Cao","year":"2014","unstructured":"Cao H, Cooper DG, Keutmann MK, Gur RC, Nenkova A, Verma R (2014) Crema-d: Crowd-sourced emotional multimodal actors dataset. IEEE Trans Affect Comput 5(4):377\u2013390. https:\/\/doi.org\/10.1109\/TAFFC.2014.2336244","journal-title":"IEEE Trans Affect Comput"},{"issue":"1","key":"17944_CR183","doi-asserted-by":"publisher","first-page":"43","DOI":"10.1109\/TAFFC.2015.2396531","volume":"6","author":"Y Baveye","year":"2015","unstructured":"Baveye Y, Dellandr\u00e9a E, Chamaret C, Chen L (2015) Liris-accede: a video database for affective content analysis. IEEE Trans Affect Comput 6(1):43\u201355. https:\/\/doi.org\/10.1109\/TAFFC.2015.2396531","journal-title":"IEEE Trans Affect Comput"},{"issue":"3","key":"17944_CR184","doi-asserted-by":"publisher","first-page":"300","DOI":"10.1109\/TAFFC.2016.2553038","volume":"8","author":"S Zhalehpour","year":"2017","unstructured":"Zhalehpour S, Onder O, Akhtar Z, Erdem CE (2017) Baum-1: A spontaneous audio-visual face database of affective and mental states. IEEE Trans Affect Comput 8(3):300\u2013313. https:\/\/doi.org\/10.1109\/TAFFC.2016.2553038","journal-title":"IEEE Trans Affect Comput"},{"issue":"1","key":"17944_CR185","doi-asserted-by":"publisher","first-page":"67","DOI":"10.1109\/TAFFC.2016.2515617","volume":"8","author":"C Busso","year":"2017","unstructured":"Busso C, Parthasarathy S, Burmania A, AbdelWahab M, Sadoughi N, Provost EM (2017) Msp-improv: An acted corpus of dyadic interactions to study emotion perception. IEEE Trans Affect Comput 8(1):67\u201380. https:\/\/doi.org\/10.1109\/TAFFC.2016.2515617","journal-title":"IEEE Trans Affect Comput"},{"issue":"99","key":"17944_CR186","doi-asserted-by":"publisher","first-page":"255","DOI":"10.1109\/TAFFC.2016.2622690","volume":"9","author":"B Xu","year":"2018","unstructured":"Xu B, Fu Y, Jiang YG, Li B, Sigal L (2018) Heterogeneous knowledge transfer in video emotion recognition, attribution and summarization. IEEE Trans Affect Comput 9(99):255\u2013270","journal-title":"IEEE Trans Affect Comput"},{"issue":"5","key":"17944_CR187","doi-asserted-by":"publisher","first-page":"0196391","DOI":"10.1371\/journal.pone.0196391","volume":"13","author":"SR Livingstone","year":"2018","unstructured":"Livingstone SR, Russo FA, Joseph N (2018) The ryerson audio-visual database of emotional speech and song (ravdess): A dynamic, multimodal set of facial and vocal expressions in north american english. PLoS ONE 13(5):0196391","journal-title":"PLoS ONE"},{"key":"17944_CR188","doi-asserted-by":"crossref","unstructured":"Burkhardt F, Paeschke A, Rolfes M, Sendlmeier W, Weiss B (2005) A database of german emotional speech. In: INTERSPEECH","DOI":"10.21437\/Interspeech.2005-446"},{"issue":"4","key":"17944_CR189","doi-asserted-by":"publisher","first-page":"471","DOI":"10.1109\/TAFFC.2017.2736999","volume":"10","author":"R Lotfian","year":"2019","unstructured":"Lotfian R, Busso C (2019) Building naturalistic emotionally balanced speech corpus by retrieving emotional speech from existing podcast recordings. IEEE Trans Affect Comput 10(4):471\u2013483. https:\/\/doi.org\/10.1109\/TAFFC.2017.2736999","journal-title":"IEEE Trans Affect Comput"},{"key":"17944_CR190","doi-asserted-by":"publisher","DOI":"10.5683\/SP2\/E8H2MF","author":"MK Pichora-Fuller","year":"2011","unstructured":"Pichora-Fuller MK, Dupuis K (2011). Toronto Emotional Speech Set (TESS). https:\/\/doi.org\/10.5683\/SP2\/E8H2MF","journal-title":"Toronto Emotional Speech Set (TESS)."},{"key":"17944_CR191","unstructured":"(2010) Sentence emotion analysis and recognition based on emotion words using ren-cecps. Int J Adv Intell Paradig 2(1):105\u2013117"},{"key":"17944_CR192","doi-asserted-by":"crossref","unstructured":"Buechel S, Hahn U (2017) Emobank: Studying the impact of annotation perspective and representation format on dimensional emotion analysis. In: EACL 2017","DOI":"10.18653\/v1\/E17-2092"},{"key":"17944_CR193","unstructured":"Li Y, Hui S, Shen X, Li W, Niu S (2017) Dailydialog: a manually labelled multi-turn dialogue dataset"},{"key":"17944_CR194","doi-asserted-by":"publisher","unstructured":"McKeown G, Valstar M, Cowie R, Pantic M, Schroder M (2012) The semaine database: Annotated multimodal records of emotionally colored conversations between a person and a limited agent. IEEE Trans Affect Comput 3(1):5\u201317. https:\/\/doi.org\/10.1109\/TAFFC.2011.20","DOI":"10.1109\/TAFFC.2011.20"},{"key":"17944_CR195","unstructured":"Hsu C-C, Chen S-Y, Kuo C-C, Huang T-H, Ku L-W (2018) Emotion\u2013Lines: an emotion corpus of multi-party conversations. In: Proceedings of the eleventh international conference on language resources and evaluation (LREC 2018). European Language Resources Association (ELRA), Miyazaki, Japan. https:\/\/www.aclweb.org\/anthology\/L18-1252"},{"key":"17944_CR196","doi-asserted-by":"publisher","unstructured":"Heaton CT, Schwartz DM (2020) Language models as emotional classifiers for textual conversation. In: Proceedings of the 28th ACM international conference on multimedia. MM \u201920, Association for Computing Machinery, New York, USA, pp 2918\u20132926. https:\/\/doi.org\/10.1145\/3394171.3413755","DOI":"10.1145\/3394171.3413755"},{"key":"17944_CR197","doi-asserted-by":"publisher","DOI":"10.1109\/TAFFC.2020.2983669","author":"S Latif","year":"2020","unstructured":"Latif S, Rana R, Khalifa S, Jurdak R, Epps J, Schuller BW (2020) Multi-task semi-supervised adversarial autoencoding for speech emotion recognition. IEEE Trans Affect Comput. https:\/\/doi.org\/10.1109\/TAFFC.2020.2983669","journal-title":"IEEE Trans Affect Comput"},{"key":"17944_CR198","doi-asserted-by":"publisher","unstructured":"Shukla A, Petridis S, Pantic M (2021) Does visual self-supervision improve learning of speech representations for emotion recognition. IEEE Trans Affect Comput 1\u20131. https:\/\/doi.org\/10.1109\/TAFFC.2021.3062406","DOI":"10.1109\/TAFFC.2021.3062406"},{"key":"17944_CR199","unstructured":"Zheng L, Bl A, Jtab C (2021) Decn: Dialogical emotion correction network for conversational emotion recognition. Neurocomputing"},{"issue":"4","key":"17944_CR200","doi-asserted-by":"publisher","first-page":"4897","DOI":"10.1007\/s11042-021-10553-4","volume":"81","author":"C Wang","year":"2022","unstructured":"Wang C, Ren Y, Zhang N, Cui F, Luo S (2022) Speech emotion recognition based on multi-feature and multi-lingual fusion. Multimed Tools Appl 81(4):4897\u20134907","journal-title":"Multimed Tools Appl"},{"key":"17944_CR201","doi-asserted-by":"publisher","unstructured":"Zhang D, Zhang W, Li S, Zhu Q, Zhou G (2020) Modeling both intraand inter-modal influence for real-time emotion detection in conversations. In: Proceedings of the 28th ACM international conference on multimedia. MM \u201920, Association for Computing Machinery, New York, USA, pp 503\u2013511. https:\/\/doi.org\/10.1145\/3394171","DOI":"10.1145\/3394171"},{"key":"17944_CR202","doi-asserted-by":"crossref","unstructured":"Hu J, Liu Y, Zhao J, Jin Q (2021) Mmgcn: multimodal fusion via deep graph convolution network for emotion recognition in conversation. arXiv:2107.06779","DOI":"10.18653\/v1\/2021.acl-long.440"},{"key":"17944_CR203","doi-asserted-by":"crossref","unstructured":"Li Z, Tang F, Zhao M, Zhu Y (2022) EmoCaps: Emotion capsule based model for conversational emotion recognition. In: Findings of the association for computational linguistics: ACL 2022, Association for Computational Linguistics, Dublin, Ireland, pp 1610\u20131618. https:\/\/aclanthology.org\/2022.findings-acl.126","DOI":"10.18653\/v1\/2022.findings-acl.126"},{"key":"17944_CR204","doi-asserted-by":"publisher","DOI":"10.1109\/TAFFC.2020.3002657","author":"P Barros","year":"2020","unstructured":"Barros P, Barakova E, Wermter S (2020) Adapting the interplay between personalized and generalized affect recognition based on an unsupervised neural framework. IEEE Trans Affect Comput. https:\/\/doi.org\/10.1109\/TAFFC.2020.3002657","journal-title":"IEEE Trans Affect Comput"},{"key":"17944_CR205","doi-asserted-by":"publisher","unstructured":"Ju X, Zhang D, Li J, Zhou G (2020) Transformer-based label set generation for multi-modal multi-label emotion detection. In: Proceedings of the 28th ACM international conference on multimedia. MM \u201920, Association for Computing Machinery, New York, USA, pp 512\u2013520. https:\/\/doi.org\/10.1145\/3394171.3413577","DOI":"10.1145\/3394171.3413577"},{"key":"17944_CR206","doi-asserted-by":"publisher","first-page":"3438","DOI":"10.1609\/aaai.v34i04.5747","volume":"34","author":"D Chen","year":"2020","unstructured":"Chen D, Lin Y, Li W, Li P, Zhou J, Sun X (2020) Measuring and relieving the over-smoothing problem for graph neural networks from the topological view. Proceedings of the AAAI conference on artificial intelligence 34:3438\u20133445","journal-title":"Proceedings of the AAAI conference on artificial intelligence"},{"key":"17944_CR207","doi-asserted-by":"crossref","unstructured":"Li Q, Han Z, Wu X-M (2018) Deeper insights into graph convolutional networks for semi-supervised learning. In: Thirty-second AAAI conference on artificial intelligence","DOI":"10.1609\/aaai.v32i1.11604"},{"key":"17944_CR208","doi-asserted-by":"publisher","unstructured":"Gideon J, McInnis M, Mower Provost E (2019) Improving cross-corpus speech emotion recognition with adversarial discriminative domain generalization (addog). IEEE Trans Affect Comput 1\u20131. https:\/\/doi.org\/10.1109\/TAFFC.2019.2916092","DOI":"10.1109\/TAFFC.2019.2916092"},{"key":"17944_CR209","doi-asserted-by":"publisher","first-page":"2047","DOI":"10.1109\/TASLP.2020.3006331","volume":"28","author":"H Luo","year":"2020","unstructured":"Luo H, Han J (2020) Nonnegative matrix factorization based transfer subspace learning for cross-corpus speech emotion recognition. IEEE\/ACM Trans Audio Speech Lang Process 28:2047\u20132060. https:\/\/doi.org\/10.1109\/TASLP.2020.3006331","journal-title":"IEEE\/ACM Trans Audio Speech Lang Process"},{"key":"17944_CR210","doi-asserted-by":"publisher","first-page":"137","DOI":"10.1016\/j.neunet.2017.09.001","volume":"96","author":"GI Parisi","year":"2017","unstructured":"Parisi GI, Tani J, Weber C, Wermter S (2017) Lifelong learning of human actions with deep neural network self-organization. Neural Netw 96:137\u2013149","journal-title":"Neural Netw"}],"container-title":["Multimedia Tools and Applications"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-023-17944-9.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11042-023-17944-9\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-023-17944-9.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,7,9]],"date-time":"2024-07-09T06:20:28Z","timestamp":1720506028000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11042-023-17944-9"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,1,22]]},"references-count":211,"journal-issue":{"issue":"25","published-online":{"date-parts":[[2024,7]]}},"alternative-id":["17944"],"URL":"https:\/\/doi.org\/10.1007\/s11042-023-17944-9","relation":{"has-preprint":[{"id-type":"doi","id":"10.36227\/techrxiv.15184302.v1","asserted-by":"object"}]},"ISSN":["1573-7721"],"issn-type":[{"value":"1573-7721","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024,1,22]]},"assertion":[{"value":"30 November 2022","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"9 October 2023","order":2,"name":"revised","label":"Revised","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"17 December 2023","order":3,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"22 January 2024","order":4,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"Not applicable","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Ethics approval"}},{"value":"Not applicable","order":3,"name":"Ethics","group":{"name":"EthicsHeading","label":"Consent to participate"}},{"value":"Not applicable","order":4,"name":"Ethics","group":{"name":"EthicsHeading","label":"Consent for publication"}},{"value":"The authors declare that they have no competing interests.","order":5,"name":"Ethics","group":{"name":"EthicsHeading","label":"Competing interests"}}]}}