{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,30]],"date-time":"2026-06-30T19:23:39Z","timestamp":1782847419567,"version":"3.54.5"},"publisher-location":"Cham","reference-count":118,"publisher":"Springer Nature Switzerland","isbn-type":[{"value":"9783031915802","type":"print"},{"value":"9783031915819","type":"electronic"}],"license":[{"start":{"date-parts":[[2025,1,1]],"date-time":"2025-01-01T00:00:00Z","timestamp":1735689600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2025,1,1]],"date-time":"2025-01-01T00:00:00Z","timestamp":1735689600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025]]},"DOI":"10.1007\/978-3-031-91581-9_3","type":"book-chapter","created":{"date-parts":[[2025,5,27]],"date-time":"2025-05-27T15:23:28Z","timestamp":1748359408000},"page":"31-45","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":31,"title":["7th ABAW Competition: Multi-task Learning and\u00a0Compound Expression Recognition"],"prefix":"10.1007","author":[{"given":"Dimitrios","family":"Kollias","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Stefanos","family":"Zafeiriou","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Irene","family":"Kotsia","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Abhinav","family":"Dhall","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Shreya","family":"Ghosh","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Chunchang","family":"Shao","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Guanyu","family":"Hu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2025,5,12]]},"reference":[{"key":"3_CR1","doi-asserted-by":"crossref","unstructured":"Antoniadis, P., Pikoulis, I., Filntisis, P.P., Maragos, P.: An audiovisual and contextual approach for categorical and continuous emotion recognition in-the-wild. arXiv preprint arXiv:2107.03465 (2021)","DOI":"10.1109\/ICCVW54120.2021.00407"},{"key":"3_CR2","unstructured":"Cabacas-Maso, J., Ortega-Beltr\u00e1n, E., Benito-Altamirano, I., Ventura, C.: Enhancing facial expression recognition through dual-direction attention mixed feature networks: application to 7th ABAW challenge. arXiv preprint arXiv:2407.12390 (2024)"},{"key":"3_CR3","doi-asserted-by":"crossref","unstructured":"Chang, W.Y., Hsu, S.H., Chien, J.H.: FATAUVA-Net : an integrated deep learning framework for facial attribute recognition, action unit (au) detection, and valence-arousal estimation. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition Workshop (2017)","DOI":"10.1109\/CVPRW.2017.246"},{"key":"3_CR4","unstructured":"Chang, Y., Wu, Y., Miao, X., Wang, J., Wang, S.: Multi-task learning for emotion descriptors estimation at the fourth ABAW challenge. arXiv preprint arXiv:2207.09716 (2022)"},{"key":"3_CR5","doi-asserted-by":"crossref","unstructured":"Chen, S., Jin, Q., Zhao, J., Wang, S.: Multimodal multi-task learning for dimensional and continuous emotion recognition. In: Proceedings of the 7th Annual Workshop on Audio\/Visual Emotion Challenge, pp. 19\u201326. ACM (2017)","DOI":"10.1145\/3133944.3133949"},{"key":"3_CR6","unstructured":"Deng, D.: Multiple emotion descriptors estimation at the abaw3 challenge. arXiv preprint arXiv:2203.12845 (2022)"},{"key":"3_CR7","unstructured":"Deng, D., Chen, Z., Shi, B.E.: FAU, facial expressions, valence and arousal: a multi-task solution. arXiv preprint arXiv:2002.03557 (2020)"},{"key":"3_CR8","doi-asserted-by":"crossref","unstructured":"Deng, D., Chen, Z., Shi, B.E.: Multitask emotion recognition with incomplete labels. In: 2020 15th IEEE International Conference on Automatic Face and Gesture Recognition (FG 2020), pp. 592\u2013599. IEEE (2020)","DOI":"10.1109\/FG47880.2020.00131"},{"key":"3_CR9","unstructured":"Deng, D., Wu, L., Shi, B.E.: Towards better uncertainty: iterative training of efficient networks for multitask emotion recognition. arXiv preprint arXiv:2108.04228 (2021)"},{"key":"3_CR10","doi-asserted-by":"crossref","unstructured":"Deng, J., Guo, J., Ververas, E., Kotsia, I., Zafeiriou, S.: RetinaFace: single-shot multi-level face localisation in the wild. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 5203\u20135212 (2020)","DOI":"10.1109\/CVPR42600.2020.00525"},{"key":"3_CR11","doi-asserted-by":"crossref","unstructured":"Do, N.T., Nguyen-Quynh, T.T., Kim, S.H.: Affective expression analysis in-the-wild using multi-task temporal statistical deep learning model. In: 2020 15th IEEE International Conference on Automatic Face and Gesture Recognition (FG 2020), pp. 624\u2013628. IEEE (2020)","DOI":"10.1109\/FG47880.2020.00093"},{"key":"3_CR12","unstructured":"Dresvyanskiy, D., Markitantov, M., Yu, J., Li, P., Kaya, H., Karpov, A.: Sun team\u2019s contribution to ABAW 2024 competition: audio-visual valence-arousal estimation and expression recognition. arXiv preprint arXiv:2403.12609 (2024)"},{"key":"3_CR13","unstructured":"Dresvyanskiy, D., Ryumina, E., Kaya, H., Markitantov, M., Karpov, A., Minker, W.: An audio-video deep and transfer learning framework for multimodal emotion recognition in the wild. arXiv preprint arXiv:2010.03692 (2020)"},{"key":"3_CR14","unstructured":"Gera, D., Balasubramanian, S.: Affect expression behaviour analysis in the wild using spatio-channel attention and complementary context information. arXiv preprint arXiv:2009.14440 (2020)"},{"key":"3_CR15","unstructured":"Gera, D., Balasubramanian, S.: Affect expression behaviour analysis in the wild using consensual collaborative training. arXiv preprint arXiv:2107.05736 (2021)"},{"key":"3_CR16","unstructured":"Gera, D., Kumar, B.N.S., Kumar, B.V.R., Balasubramanian, S.: SS-MFAR: semi-supervised multi-task facial affect recognition. arXiv preprint arXiv:2207.09012 (2022)"},{"key":"3_CR17","unstructured":"Gera, D., Kumar, B.N.S., Kumar, B.V.R., Balasubramanian, S.: ABAW: facial expression recognition in the wild. arXiv preprint arXiv:2303.09785 (2023)"},{"key":"3_CR18","unstructured":"Haider, I., Tran, M.T., Kim, S.H., Yang, H.J., Lee, G.S.: An ensemble approach for multiple emotion descriptors estimation using multi-task learning. arXiv preprint arXiv:2207.10878 (2022)"},{"key":"3_CR19","doi-asserted-by":"crossref","unstructured":"Hallmen, T., Deuser, F., Oswald, N., Andr\u00e9, E.: Unimodal multi-task fusion for emotional mimicry prediciton. arXiv preprint arXiv:2403.11879 (2024)","DOI":"10.1109\/CVPRW63382.2024.00468"},{"key":"3_CR20","unstructured":"Han, S., Meng, Z., Khan, A.S., Tong, Y.: Incremental boosting convolutional neural network for facial action unit recognition. In: Advances in Neural Information Processing Systems, pp. 109\u2013117 (2016)"},{"key":"3_CR21","unstructured":"Hoai, D.L., et al.: An attention-based method for action unit detection at the 3rd ABAW competition. arXiv preprint arXiv:2203.12428 (2022)"},{"key":"3_CR22","doi-asserted-by":"crossref","unstructured":"Hu, G., Papadopoulou, E., Kollias, D., Tzouveli, P., Wei, J., Yang, X.: Bridging the gap: protocol towards fair and consistent affect analysis. arXiv preprint arXiv:2405.06841 (2024)","DOI":"10.1109\/FG59268.2024.10582033"},{"key":"3_CR23","unstructured":"Jeong, J.Y., Hong, Y.G., Kim, D., Jung, Y., Jeong, J.W.: Facial expression recognition based on multi-head cross attention network. arXiv preprint arXiv:2203.13235 (2022)"},{"key":"3_CR24","unstructured":"Jeong, J.Y., Hong, Y.G., Oh, J., Hong, S., Jeong, J.W., Jung, Y.: Learning from synthetic data: facial expression classification based on ensemble of multi-task networks. arXiv preprint arXiv:2207.10025 (2022)"},{"key":"3_CR25","unstructured":"Ji, X., Ding, Y., Li, L., Chen, Y., Fan, C.: Multi-label relation modeling in facial action units detection. arXiv preprint arXiv:2002.01105 (2020)"},{"key":"3_CR26","unstructured":"Jiang, W., Wu, Y., Qiao, F., Meng, L., Deng, Y., Liu, C.: Facial action unit recognition with multi-models ensembling. arXiv preprint arXiv:2203.13046 (2022)"},{"key":"3_CR27","doi-asserted-by":"crossref","unstructured":"Jin, Y., Zheng, T., Gao, C., Xu, G.: A multi-modal and multi-task learning method for action unit and expression recognition. arXiv preprint arXiv:2107.04187 (2021)","DOI":"10.1109\/ICCVW54120.2021.00401"},{"key":"3_CR28","doi-asserted-by":"crossref","unstructured":"Karas, V., Tellamekala, M.K., Mallol-Ragolta, A., Valstar, M., Schuller, B.W.: Continuous-time audiovisual fusion with recurrence vs. attention for in-the-wild affect recognition. arXiv preprint arXiv:2203.13285 (2022)","DOI":"10.1109\/CVPRW56347.2022.00266"},{"key":"3_CR29","doi-asserted-by":"crossref","unstructured":"Kim, J.H., Kim, N., Hong, M., Won, C.: CCA-transformer: cascaded cross-attention based transformer for facial analysis in multi-modal data (2024)","DOI":"10.20944\/preprints202403.1629.v1"},{"key":"3_CR30","unstructured":"Kim, J.H., Kim, N., Won, C.S.: Facial expression recognition with swin transformer. arXiv preprint arXiv:2203.13472 (2022)"},{"key":"3_CR31","unstructured":"Kim, J.H., Kim, N., Won, C.S.: Multi-modal facial expression recognition with transformer-based fusion networks and dynamic sampling. arXiv preprint arXiv:2303.08419 (2023)"},{"key":"3_CR32","doi-asserted-by":"crossref","unstructured":"Kollias, D.: ABAW: valence-arousal estimation, expression recognition, action unit detection & multi-task learning challenges. arXiv preprint arXiv:2202.10659 (2022)","DOI":"10.1109\/CVPRW56347.2022.00259"},{"key":"3_CR33","doi-asserted-by":"crossref","unstructured":"Kollias, D.: Multi-label compound expression recognition: C-expr database & network. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 5589\u20135598 (2023)","DOI":"10.1109\/CVPR52729.2023.00541"},{"key":"3_CR34","doi-asserted-by":"crossref","unstructured":"Kollias, D., Cheng, S., Ververas, E., Kotsia, I., Zafeiriou, S.: Deep neural network augmentation: generating faces for affect analysis. Int. J. Comput. Vis. 1\u201330 (2020)","DOI":"10.1007\/s11263-020-01304-3"},{"key":"3_CR35","doi-asserted-by":"crossref","unstructured":"Kollias, D., Nicolaou, M.A., Kotsia, I., Zhao, G., Zafeiriou, S.: Recognition of affect in the wild using deep neural networks. In: 2017 IEEE Conference on Computer Vision and Pattern Recognition Workshops (CVPRW), pp. 1972\u20131979. IEEE (2017)","DOI":"10.1109\/CVPRW.2017.247"},{"key":"3_CR36","unstructured":"Kollias, D., Psaroudakis, A., Arsenos, A., Theofilou, P.: FaceRNET: a facial expression intensity estimation network. arXiv preprint arXiv:2303.00180 (2023)"},{"key":"3_CR37","doi-asserted-by":"crossref","unstructured":"Kollias, D., Schulc, A., Hajiyev, E., Zafeiriou, S.: Analysing affective behavior in the first abaw 2020 competition. In: 2020 15th IEEE International Conference on Automatic Face and Gesture Recognition (FG 2020)(FG), pp. 794\u2013800. IEEE Computer Society (2020)","DOI":"10.1109\/FG47880.2020.00126"},{"key":"3_CR38","unstructured":"Kollias, D., Sharmanska, V., Zafeiriou, S.: Face behavior a la carte: expressions, affect and action units in a single network. arXiv preprint arXiv:1910.11111 (2019)"},{"key":"3_CR39","unstructured":"Kollias, D., Sharmanska, V., Zafeiriou, S.: Distribution matching for heterogeneous multi-task learning: a large-scale face study. arXiv preprint arXiv:2105.03790 (2021)"},{"key":"3_CR40","doi-asserted-by":"crossref","unstructured":"Kollias, D., Sharmanska, V., Zafeiriou, S.: Distribution matching for multi-task learning of classification tasks: a large-scale study on faces & beyond. arXiv preprint arXiv:2401.01219 (2024)","DOI":"10.1609\/aaai.v38i3.28061"},{"key":"3_CR41","doi-asserted-by":"crossref","unstructured":"Kollias, D., Tzirakis, P., Baird, A., Cowen, A., Zafeiriou, S.: ABAW: valence-arousal estimation, expression recognition, action unit detection & emotional reaction intensity estimation challenges. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 5888\u20135897 (2023)","DOI":"10.1109\/CVPRW59228.2023.00626"},{"key":"3_CR42","doi-asserted-by":"crossref","unstructured":"Kollias, D., Tzirakis, P., Cowen, A., Zafeiriou, S., Shao, C., Hu, G.: The 6th affective behavior analysis in-the-wild (ABAW) competition. arXiv preprint arXiv:2402.19344 (2024)","DOI":"10.1109\/CVPRW63382.2024.00461"},{"key":"3_CR43","unstructured":"Kollias, D., et al.: Deep affect prediction in-the-wild: aff-wild database and challenge, deep architectures, and beyond. Int. J. Comput. Vis. 1\u201323 (2019)"},{"key":"3_CR44","unstructured":"Kollias, D., Zafeiriou, S.: Expression, affect, action unit recognition: aff-wild2, multi-task learning and arcface. arXiv preprint arXiv:1910.04855 (2019)"},{"key":"3_CR45","unstructured":"Kollias, D., Zafeiriou, S.: Affect analysis in-the-wild: valence-arousal, expressions, action units and a unified framework. arXiv preprint arXiv:2103.15792 (2021)"},{"key":"3_CR46","doi-asserted-by":"crossref","unstructured":"Kollias, D., Zafeiriou, S.: Analysing affective behavior in the second ABAW2 competition. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision, pp. 3652\u20133660 (2021)","DOI":"10.1109\/ICCVW54120.2021.00408"},{"key":"3_CR47","doi-asserted-by":"crossref","unstructured":"Kuhnke, F., Rumberg, L., Ostermann, J.: Two-stream aural-visual affect analysis in the wild. arXiv preprint arXiv:2002.03399 (2020)","DOI":"10.1109\/FG47880.2020.00056"},{"key":"3_CR48","doi-asserted-by":"crossref","unstructured":"Lee, H., Lim, H., Lim, S.: BYEL: bootstrap on your emotion latent. arXiv preprint arXiv:2207.10003 (2022)","DOI":"10.1007\/978-3-031-25075-0_9"},{"key":"3_CR49","doi-asserted-by":"crossref","unstructured":"Lei, J., et al.: Mid-level representation enhancement and graph embedded uncertainty suppressing for facial expression recognition. arXiv preprint arXiv:2207.13235 (2022)","DOI":"10.1007\/978-3-031-25075-0_7"},{"key":"3_CR50","unstructured":"Li, I., et\u00a0al.: Technical report for valence-arousal estimation on affwild2 dataset. arXiv preprint arXiv:2105.01502 (2021)"},{"key":"3_CR51","unstructured":"Li, S., et al.: Facial affect analysis: learning from synthetic data & multi-task learning challenges. arXiv preprint arXiv:2207.09748 (2022)"},{"key":"3_CR52","unstructured":"Li, S., et al.: Temporal label hierachical network for compound emotion recognition. arXiv preprint arXiv:2407.12973 (2024)"},{"key":"3_CR53","unstructured":"Li, X., Du, W., Yang, H.: Affective behavior analysis using task-adaptive and au-assisted graph network. arXiv preprint arXiv:2407.11663 (2024)"},{"key":"3_CR54","doi-asserted-by":"crossref","unstructured":"Li, Y., Sun, H., Liu, Z., Han, H.: Affective behaviour analysis using pretrained model with facial priori. arXiv preprint arXiv:2207.11679 (2022)","DOI":"10.1007\/978-3-031-25075-0_2"},{"key":"3_CR55","doi-asserted-by":"crossref","unstructured":"Lin, L., Papabathini, S., Wang, X., Hu, S.: Robust light-weight facial affective behavior recognition with clip. arXiv preprint arXiv:2403.09915 (2024)","DOI":"10.1109\/MIPR62202.2024.00103"},{"key":"3_CR56","unstructured":"Liu, C., Zhang, W., Qiu, F., Li, L., Yu, X.: Affective behaviour analysis via progressive learning. arXiv preprint arXiv:2407.16945 (2024)"},{"key":"3_CR57","unstructured":"Liu, H., Zeng, J., Shan, S., Chen, X.: Emotion recognition for in-the-wild videos. arXiv preprint arXiv:2002.05447 (2020)"},{"key":"3_CR58","unstructured":"Liu, X., et al.: Compound expression recognition via multi model ensemble for the abaw7 challenge. arXiv preprint arXiv:2407.12257 (2024)"},{"key":"3_CR59","unstructured":"Mao, S., Fan, X., Peng, X.: Spatial and temporal networks for facial expression recognition in the wild videos. arXiv preprint arXiv:2107.05160 (2021)"},{"key":"3_CR60","unstructured":"Meng, L., et\u00a0al.: Multi-modal emotion estimation for in-the-wild videos. arXiv preprint arXiv:2203.13032 (2022)"},{"key":"3_CR61","doi-asserted-by":"crossref","unstructured":"Min, S., Yang, J., Lim, S., Lee, J., Lee, S., Lim, S.: Emotion recognition using transformers with masked learning. arXiv preprint arXiv:2403.13731 (2024)","DOI":"10.1109\/CVPRW63382.2024.00489"},{"key":"3_CR62","doi-asserted-by":"crossref","unstructured":"Mutlu, O.C., Honarmand, M., Surabhi, S., Wall, D.P.: TempT: temporal consistency for test-time adaptation. arXiv preprint arXiv:2303.10536 (2023)","DOI":"10.1109\/CVPRW59228.2023.00629"},{"key":"3_CR63","unstructured":"Nguyen, D.K., Ho, N.H., Pant, S., Yang, H.J.: A transformer-based approach to video frame-level prediction in affective behaviour analysis in-the-wild. arXiv preprint arXiv:2303.09293 (2023)"},{"key":"3_CR64","unstructured":"Nguyen, D.K., Pant, S., Ho, N.H., Lee, G.S., Kim, S.H., Yang, H.J.: Multi-task cross attention network in facial behavior analysis. arXiv preprint arXiv:2207.10293 (2022)"},{"key":"3_CR65","doi-asserted-by":"crossref","unstructured":"Nguyen, H.H., Huynh, V.T., Kim, S.H.: An ensemble approach for facial expression analysis in video. arXiv preprint arXiv:2203.12891 (2022)","DOI":"10.1109\/CVPRW56347.2022.00281"},{"key":"3_CR66","doi-asserted-by":"crossref","unstructured":"Nguyen-Xuan, B., Nguyen-Hoang, T., Tai-Do, N.: Emotic masked autoencoder with attention fusion for facial expression recognition. arXiv preprint arXiv:2403.13039 (2024)","DOI":"10.1109\/CVPRW63382.2024.00481"},{"key":"3_CR67","doi-asserted-by":"crossref","unstructured":"Oh, G., Jeong, E., Lim, S.: Causal affect prediction model using a facial image sequence. arXiv preprint arXiv:2107.03886 (2021)","DOI":"10.1109\/ICCVW54120.2021.00395"},{"key":"3_CR68","doi-asserted-by":"crossref","unstructured":"Pahl, J., Rieger, I., Seuss, D.: Multi-label class balancing algorithm for action unit detection. arXiv preprint arXiv:2002.03238 (2020)","DOI":"10.1109\/FG47880.2020.00101"},{"key":"3_CR69","unstructured":"Phan, K.N., Nguyen, H.H., Huynh, V.T., Kim, S.H.: Expression classification using concatenation of deep neural network for the 3rd ABAW3 competition. arXiv preprint arXiv:2203.12899 (2022)"},{"key":"3_CR70","doi-asserted-by":"crossref","unstructured":"Praveen, R.G., Alam, J.: Recursive cross-modal attention for multimodal fusion in dimensional emotion recognition. arXiv preprint arXiv:2403.13659 (2024)","DOI":"10.1109\/CVPRW63382.2024.00483"},{"key":"3_CR71","doi-asserted-by":"crossref","unstructured":"Psaroudakis, A., Kollias, D.: Mixaugment & mixup: augmentation methods for facial expression recognition. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 2367\u20132375 (2022)","DOI":"10.1109\/CVPRW56347.2022.00264"},{"key":"3_CR72","unstructured":"Rajasekar, G.P., et al.: A joint cross-attention model for audio-visual fusion in dimensional emotion recognition. arXiv preprint arXiv:2203.14779 (2022)"},{"key":"3_CR73","unstructured":"Richet, N., et\u00a0al.: Text-and feature-based models for compound multimodal emotion recognition in the wild. arXiv preprint arXiv:2407.12927 (2024)"},{"key":"3_CR74","doi-asserted-by":"crossref","unstructured":"Ryumina, E., Markitantov, M., Ryumin, D., Kaya, H., Karpov, A.: Audio-visual compound expression recognition method based on late modality fusion and rule-based decision. arXiv preprint arXiv:2403.12687 (2024)","DOI":"10.1109\/CVPRW63382.2024.00478"},{"key":"3_CR75","unstructured":"Saito, J., Mi, X., Uchida, A., Youoku, S., Yamamoto, T., Murase, K.: Action units recognition using improved pairwise deep architecture. arXiv preprint arXiv:2107.03143 (2021)"},{"key":"3_CR76","unstructured":"Savchenko, A.V.: Frame-level prediction of facial expressions, valence, arousal and action units for mobile devices. arXiv preprint arXiv:2203.13436 (2022)"},{"key":"3_CR77","unstructured":"Savchenko, A.V.: HSE-NN team at the 4th ABAW competition: multi-task emotion recognition and learning from synthetic images. arXiv preprint arXiv:2207.09508 (2022)"},{"key":"3_CR78","unstructured":"Savchenko, A.V.: EmotiEffNet facial features in Uni-task emotion recognition in video at ABAW-5 competition. arXiv preprint arXiv:2303.09162 (2023)"},{"key":"3_CR79","unstructured":"Savchenko, A.V.: Hsemotion team at the 6th ABAW competition: facial expressions, valence-arousal and emotion intensity prediction. arXiv preprint arXiv:2403.11590 (2024)"},{"key":"3_CR80","unstructured":"Savchenko, A.V.: Hsemotion team at the 7th ABAW challenge: multi-task learning and compound facial expression recognition. arXiv preprint arXiv:2407.13184 (2024)"},{"key":"3_CR81","unstructured":"Shen, K., et al.: Facial affect recognition based on multi architecture encoder and feature fusion for the ABAW7 challenge. arXiv preprint arXiv:2407.12258 (2024)"},{"key":"3_CR82","unstructured":"Shu, T., Wang, X., Wang, R., Chen, C., Zhang, Y., Sun, X.: Mutilmodal feature extraction and attention-based fusion for emotion estimation in videos. arXiv preprint arXiv:2303.10421 (2023)"},{"key":"3_CR83","doi-asserted-by":"crossref","unstructured":"Sun, H., Lian, Z., Liu, B., Tao, J., Sun, L., Cai, C.: Two-aspect information fusion model for abaw4 multi-task challenge. arXiv preprint arXiv:2207.11389 (2022)","DOI":"10.1007\/978-3-031-25075-0_13"},{"key":"3_CR84","unstructured":"Tallec, G., Yvinec, E., Dapogny, A., Bailly, K.: Multi-label transformer for action unit detection. arXiv preprint arXiv:2203.12531 (2022)"},{"key":"3_CR85","doi-asserted-by":"crossref","unstructured":"Vu, M.T., Beurton-Aimar, M.: Multitask multi-database emotion recognition. arXiv preprint arXiv:2107.04127 (2021)","DOI":"10.1109\/ICCVW54120.2021.00406"},{"key":"3_CR86","unstructured":"Vu, T., Huynh, V.T., Kim, S.H.: Vision transformer for action units detection. arXiv preprint arXiv:2303.09917 (2023)"},{"key":"3_CR87","unstructured":"Waligora, P., et al.: Joint multimodal transformer for dimensional emotional recognition in the wild. arXiv preprint arXiv:2403.10488 (2024)"},{"key":"3_CR88","unstructured":"Wang, J., Huang, J., Cai, B., Cao, Y., Yun, X., Wang, S.: Zero-shot compound expression recognition with visual language model at the 6th ABAW challenge. arXiv preprint arXiv:2403.11450 (2024)"},{"key":"3_CR89","unstructured":"Wang, L., Li, H., Liu, C.: Hybrid CNN-transformer model for facial affect recognition in the ABAW4 challenge. arXiv preprint arXiv:2207.10201 (2022)"},{"key":"3_CR90","doi-asserted-by":"crossref","unstructured":"Wang, L., Wang, S.: A multi-task mean teacher for semi-supervised facial affective behavior analysis. arXiv preprint arXiv:2107.04225 (2021)","DOI":"10.1109\/ICCVW54120.2021.00402"},{"key":"3_CR91","unstructured":"Wang, L., Wang, S., Qi, J.: Multi-modal multi-label facial action unit detection with transformer. arXiv preprint arXiv:2203.13301 (2022)"},{"key":"3_CR92","unstructured":"Wang, S., Chang, Y., Wang, J.: Facial action unit recognition based on transfer learning. arXiv preprint arXiv:2203.14694 (2022)"},{"key":"3_CR93","unstructured":"Wang, S., et al.: Facial affective behavior analysis method for 5th ABAW competition. arXiv preprint arXiv:2303.09145 (2023)"},{"key":"3_CR94","unstructured":"Wang, Z., et\u00a0al.: Spatio-temporal au relational graph representation learning for facial action units detection. arXiv preprint arXiv:2303.10644 (2023)"},{"key":"3_CR95","unstructured":"Wen, Z., et al.: Multimodal fusion with pre-trained model features in affective behaviour analysis in-the-wild. arXiv preprint arXiv:2403.15044 (2024)"},{"key":"3_CR96","unstructured":"Xie, H.X., Li, I., Lo, L., Shuai, H.H., Cheng, W.H., et\u00a0al.: Technical report for valence-arousal estimation in ABAW2 challenge. arXiv preprint arXiv:2107.03891 (2021)"},{"key":"3_CR97","doi-asserted-by":"crossref","unstructured":"Xue, F., Sun, Y., Yang, Y.: Exploring expression-related self-supervised learning for affective behaviour analysis. arXiv preprint arXiv:2303.10511 (2023)","DOI":"10.1109\/CVPRW59228.2023.00604"},{"key":"3_CR98","doi-asserted-by":"crossref","unstructured":"Xue, F., Tan, Z., Zhu, Y., Ma, Z., Guo, G.: Coarse-to-fine cascaded networks with smooth predicting for video facial expression recognition. arXiv preprint arXiv:2203.13052 (2022)","DOI":"10.1109\/CVPRW56347.2022.00269"},{"key":"3_CR99","unstructured":"Yin, Y., Tran, M., Chang, D., Wang, X., Soleymani, M.: Multi-modal facial action unit detection with large pre-trained models for the 5th competition on affective behavior analysis in-the-wild. arXiv preprint arXiv:2303.10590 (2023)"},{"key":"3_CR100","unstructured":"Youoku, S., et al.: A multi-term and multi-task analyzing framework for affective analysis in-the-wild. arXiv preprint arXiv:2009.13885 (2020)"},{"key":"3_CR101","unstructured":"Yu, J., Cai, Z., He, P., Xie, G., Ling, Q.: Multi-model ensemble learning method for human expression recognition. arXiv preprint arXiv:2203.14466 (2022)"},{"key":"3_CR102","doi-asserted-by":"crossref","unstructured":"Yu, J., et al.: Exploring large-scale unlabeled faces to enhance facial expression recognition. arXiv preprint arXiv:2303.08617 (2023)","DOI":"10.1109\/CVPRW59228.2023.00616"},{"key":"3_CR103","doi-asserted-by":"crossref","unstructured":"Yu, J., Wei, Z., Cai, Z.: Exploring facial expression recognition through semi-supervised pretraining and temporal modeling. arXiv preprint arXiv:2403.11942 (2024)","DOI":"10.1109\/CVPRW63382.2024.00492"},{"key":"3_CR104","doi-asserted-by":"crossref","unstructured":"Yu, J., et al.: AUD-TGN: advancing action unit detection with temporal convolution and GPT-2 in wild audiovisual contexts. arXiv preprint arXiv:2403.13678 (2024)","DOI":"10.1109\/CVPRW63382.2024.00484"},{"key":"3_CR105","unstructured":"Yu, J., et al.: Multimodal fusion method with spatiotemporal sequences and relationship learning for valence-arousal estimation. arXiv preprint arXiv:2403.12425 (2024)"},{"key":"3_CR106","doi-asserted-by":"crossref","unstructured":"Zafeiriou, S., Kollias, D., Nicolaou, M.A., Papaioannou, A., Zhao, G., Kotsia, I.: Aff-wild: valence and arousal \u2018in-the-wild\u2019 challenge. In: 2017 IEEE Conference on Computer Vision and Pattern Recognition Workshops (CVPRW), pp. 1980\u20131987. IEEE (2017)","DOI":"10.1109\/CVPRW.2017.248"},{"key":"3_CR107","doi-asserted-by":"crossref","unstructured":"Zhang, S., An, R., Ding, Y., Guan, C.: Continuous emotion recognition using visual-audio-linguistic information: a technical report for ABAW3. arXiv preprint arXiv:2203.13031 (2022)","DOI":"10.1109\/CVPRW56347.2022.00265"},{"key":"3_CR108","unstructured":"Zhang, S., Ding, Y., Wei, Z., Guan, C.: Audio-visual attentive fusion for continuous emotion recognition. arXiv preprint arXiv:2107.01175 (2021)"},{"key":"3_CR109","doi-asserted-by":"crossref","unstructured":"Zhang, S., Zhao, Z., Guan, C.: Multimodal continuous emotion recognition: a technical report for ABAW5. arXiv preprint arXiv:2303.10335 (2023)","DOI":"10.1109\/CVPRW59228.2023.00611"},{"key":"3_CR110","unstructured":"Zhang, T., et al.: Emotion recognition based on multi-task learning framework in the abaw4 challenge. arXiv preprint arXiv:2207.09373 (2022)"},{"key":"3_CR111","doi-asserted-by":"crossref","unstructured":"Zhang, W., Guo, Z., Chen, K., Li, L., Zhang, Z., Ding, Y.: Prior aided streaming network for multi-task affective recognitionat the 2nd ABAW2 competition. arXiv preprint arXiv:2107.03708 (2021)","DOI":"10.1109\/ICCVW54120.2021.00394"},{"key":"3_CR112","unstructured":"Zhang, W., et al.: Affective behaviour analysis via integrating multi-modal knowledge. arXiv preprint arXiv:2403.10825 (2024)"},{"key":"3_CR113","doi-asserted-by":"crossref","unstructured":"Zhang, W., et al.: Transformer-based multimodal information fusion for facial expression analysis. arXiv preprint arXiv:2203.12367 (2022)","DOI":"10.1109\/CVPRW56347.2022.00271"},{"key":"3_CR114","doi-asserted-by":"crossref","unstructured":"Zhang, Y.H., Huang, R., Zeng, J., Shan, S., Chen, X.: $$m^{3}$$ t: multi-modal continuous valence-arousal estimation in the wild. arXiv preprint arXiv:2002.02957 (2020)","DOI":"10.1109\/FG47880.2020.00098"},{"key":"3_CR115","doi-asserted-by":"crossref","unstructured":"Zhang, Z., An, L., Cui, Z., Dong, T., et\u00a0al.: Facial affect recognition based on transformer encoder and audiovisual fusion for the ABAW5 challenge. arXiv preprint arXiv:2303.09158 (2023)","DOI":"10.1109\/CVPRW59228.2023.00607"},{"key":"3_CR116","unstructured":"Zhou, W., Lu, J., Ling, C., Wang, W., Liu, S.: Boosting continuous emotion recognition with self-pretraining using masked autoencoders, temporal convolutional networks, and transformers. arXiv preprint arXiv:2403.11440 (2024)"},{"key":"3_CR117","unstructured":"Zhou, W., Lu, J., Xiong, Z., Wang, W.: Continuous emotion recognition based on TCN and transformer. arXiv preprint arXiv:2303.08356 (2023)"},{"key":"3_CR118","unstructured":"Zou, P., Wang, R., Wen, K., Peng, Y., Sun, X.: Spatial-temporal transformer for affective behavior analysis. arXiv preprint arXiv:2303.10561 (2023)"}],"container-title":["Lecture Notes in Computer Science","Computer Vision \u2013 ECCV 2024 Workshops"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-031-91581-9_3","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,5,27]],"date-time":"2025-05-27T15:24:22Z","timestamp":1748359462000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-3-031-91581-9_3"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025]]},"ISBN":["9783031915802","9783031915819"],"references-count":118,"URL":"https:\/\/doi.org\/10.1007\/978-3-031-91581-9_3","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025]]},"assertion":[{"value":"12 May 2025","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"ECCV","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"European Conference on Computer Vision","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Milan","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Italy","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2024","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"29 September 2024","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"4 October 2024","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"18","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"eccv2024","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/eccv2024.ecva.net\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}