{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,20]],"date-time":"2026-07-20T12:50:56Z","timestamp":1784551856506,"version":"3.55.0"},"publisher-location":"New York, NY, USA","reference-count":58,"publisher":"ACM","funder":[{"name":"Amazon UK LTD","award":["AIRNAW project"],"award-info":[{"award-number":["AIRNAW project"]}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2025,10,27]]},"DOI":"10.1145\/3746027.3755340","type":"proceedings-article","created":{"date-parts":[[2025,10,25]],"date-time":"2025-10-25T06:54:15Z","timestamp":1761375255000},"page":"5667-5676","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":4,"title":["Grounding Emotion Recognition with Visual Prototypes: VEGA - Revisiting CLIP in MERC"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0009-0006-1911-6283","authenticated-orcid":false,"given":"Guanyu","family":"Hu","sequence":"first","affiliation":[{"name":"Xi'an Jiaotong University, Xi'an, United Kingdom and Queen Mary, University of London, London, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-8188-3751","authenticated-orcid":false,"given":"Dimitrios","family":"Kollias","sequence":"additional","affiliation":[{"name":"Center for Multimodal AI, Digital Environment Research Institute, Queen Mary University of London, London, United Kingdom"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-5117-4914","authenticated-orcid":false,"given":"Xinyu","family":"Yang","sequence":"additional","affiliation":[{"name":"Xi'an Jiaotong University, xian, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"320","published-online":{"date-parts":[[2025,10,27]]},"reference":[{"key":"e_1_3_2_1_1_1","doi-asserted-by":"publisher","DOI":"10.1146\/annurev.psych.59.103006.093639"},{"key":"e_1_3_2_1_2_1","volume-title":"IEMOCAP: Interactive emotional dyadic motion capture database. Language resources and evaluation","author":"Busso Carlos","year":"2008","unstructured":"Carlos Busso, Murtaza Bulut, Chi-Chun Lee, Abe Kazemzadeh, Emily Mower, Samuel Kim, Jeannette N Chang, Sungbok Lee, and Shrikanth S Narayanan. 2008. IEMOCAP: Interactive emotional dyadic motion capture database. Language resources and evaluation, Vol. 42 (2008), 335-359."},{"key":"e_1_3_2_1_3_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01036"},{"key":"e_1_3_2_1_4_1","doi-asserted-by":"publisher","DOI":"10.1016\/j.knosys.2024.111954"},{"key":"e_1_3_2_1_5_1","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2024.3405406"},{"key":"e_1_3_2_1_6_1","doi-asserted-by":"publisher","DOI":"10.1080\/026999300378824"},{"key":"e_1_3_2_1_7_1","doi-asserted-by":"publisher","DOI":"10.1080\/02699939208411068"},{"key":"e_1_3_2_1_8_1","volume-title":"The Nature of Emotion: Fundamental Questions, Paul Ekman and Richard J","author":"Ekman Paul","unstructured":"Paul Ekman. 1994. An Argument for Basic Emotions. In The Nature of Emotion: Fundamental Questions, Paul Ekman and Richard J. Davidson (Eds.). Oxford University Press, New York, 56-58."},{"key":"e_1_3_2_1_9_1","volume-title":"Cognitive Methods in Social Psychology","author":"Fazio Russell H.","unstructured":"Russell H. Fazio. 2001. On the automatic activation of associated evaluations: An overview. In Cognitive Methods in Social Psychology, Karl Christoph Klauer, Andreas Voss, and Christoph Stahl (Eds.). Guilford Press, New York, 117-141."},{"key":"e_1_3_2_1_10_1","doi-asserted-by":"publisher","DOI":"10.1037\/0096-3445.113.3.464"},{"key":"e_1_3_2_1_11_1","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/D18-1280"},{"key":"e_1_3_2_1_12_1","first-page":"1158","article-title":"DialogueGCN: A graph convolutional neural network for emotion recognition in conversation","volume":"29","author":"Hu Cheng","year":"2021","unstructured":"Cheng Hu, Hong Mao, Rui Zhang, and Jie Zhang. 2021b. DialogueGCN: A graph convolutional neural network for emotion recognition in conversation. IEEE\/ACM Transactions on Audio, Speech, and Language Processing, Vol. 29 (2021), 1158-1170.","journal-title":"IEEE\/ACM Transactions on Audio, Speech, and Language Processing"},{"key":"e_1_3_2_1_13_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP43922.2022.9747397"},{"key":"e_1_3_2_1_14_1","volume-title":"Rethinking affect analysis: A protocol for ensuring fairness and consistency","author":"Hu Guanyu","year":"2025","unstructured":"Guanyu Hu, Dimitrios Kollias, Eleni Papadopoulou, Paraskevi Tzouveli, Jie Wei, and Xinyu Yang. 2025. Rethinking affect analysis: A protocol for ensuring fairness and consistency. IEEE Transactions on Biometrics, Behavior, and Identity Science (2025)."},{"key":"e_1_3_2_1_15_1","doi-asserted-by":"publisher","DOI":"10.1109\/FG59268.2024.10582033"},{"key":"e_1_3_2_1_16_1","volume-title":"Robust Facial Reactions Generation: An Emotion-Aware Framework with Modality Compensation. In 2024 IEEE International Joint Conference on Biometrics (IJCB). IEEE, 1-10","author":"Hu Guanyu","year":"2024","unstructured":"Guanyu Hu, Jie Wei, Siyang Song, Dimitrios Kollias, Xinyu Yang, Zhonglin Sun, and Odysseus Kaloidas. 2024b. Robust Facial Reactions Generation: An Emotion-Aware Framework with Modality Compensation. In 2024 IEEE International Joint Conference on Biometrics (IJCB). IEEE, 1-10."},{"key":"e_1_3_2_1_17_1","volume-title":"MMGCN: Multimodal fusion via deep graph convolution network for emotion recognition in conversation. arXiv preprint arXiv:2107.06779","author":"Hu Jingwen","year":"2021","unstructured":"Jingwen Hu, Yuchen Liu, Jinming Zhao, and Qin Jin. 2021a. MMGCN: Multimodal fusion via deep graph convolution network for emotion recognition in conversation. arXiv preprint arXiv:2107.06779 (2021)."},{"key":"e_1_3_2_1_18_1","doi-asserted-by":"publisher","DOI":"10.1145\/3664647.3681599"},{"key":"e_1_3_2_1_19_1","volume-title":"Atin Vikram Singh, and Ashutosh Modi","author":"Joshi Abhinav","year":"2022","unstructured":"Abhinav Joshi, Ashwani Bhat, Ayush Jain, Atin Vikram Singh, and Ashutosh Modi. 2022. COGMEN: COntextualized GNN based multimodal emotion recognitioN. arXiv preprint arXiv:2205.02455 (2022)."},{"key":"e_1_3_2_1_20_1","volume-title":"European Conference on Computer Vision. Springer, 1-16","author":"Kollias Dimitrios","year":"2024","unstructured":"Dimitrios Kollias, Andreas Psaroudakis, Anastasios Arsenos, Paraskevi Theofilou, Chunchang Shao, Guanyu Hu, and Ioannis Patras. 2024a. Mma-mrnnet: Harnessing multiple models of affect and dynamic masked rnn for precise facial expression intensity estimation. In European Conference on Computer Vision. Springer, 1-16."},{"key":"e_1_3_2_1_21_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPRW63382.2024.00461"},{"key":"e_1_3_2_1_22_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPRW67362.2025.00554"},{"key":"e_1_3_2_1_23_1","volume-title":"European Conference on Computer Vision. Springer, 31-45","author":"Kollias Dimitrios","year":"2024","unstructured":"Dimitrios Kollias, Stefanos Zafeiriou, Irene Kotsia, Abhinav Dhall, Shreya Ghosh, Chunchang Shao, and Guanyu Hu. 2024c. 7th abaw competition: Multi-task learning and compound expression recognition. In European Conference on Computer Vision. Springer, 31-45."},{"key":"e_1_3_2_1_24_1","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2023.3260635"},{"key":"e_1_3_2_1_25_1","volume-title":"Tracing intricate cues in dialogue: Joint graph structure and sentiment dynamics for multimodal emotion recognition. arXiv preprint arXiv:2407.21536","author":"Li Jiang","year":"2024","unstructured":"Jiang Li, Xiaoping Wang, and Zhigang Zeng. 2024. Tracing intricate cues in dialogue: Joint graph structure and sentiment dynamics for multimodal emotion recognition. arXiv preprint arXiv:2407.21536 (2024)."},{"key":"e_1_3_2_1_26_1","first-page":"102653","article-title":"Semi-supervised emotion recognition in textual conversation via a context-augmented auxiliary training task","volume":"58","author":"Li Yao","year":"2021","unstructured":"Yao Li, Xiaohan Mao, Bin Li, Fei Wu, and Wei Zhang. 2021. Semi-supervised emotion recognition in textual conversation via a context-augmented auxiliary training task. Information Processing & Management, Vol. 58, 5 (2021), 102653.","journal-title":"Information Processing & Management"},{"key":"e_1_3_2_1_27_1","volume-title":"Multimodal Emotion Recognition with Vision-Language Prompting and Modality Dropout. arXiv preprint arXiv:2409.07078","author":"Lin Xiaoyi","year":"2023","unstructured":"Xiaoyi Lin, Qingsong Fan, Xin Zhang, and Jianbo Yin. 2023. Multimodal Emotion Recognition with Vision-Language Prompting and Modality Dropout. arXiv preprint arXiv:2409.07078 (2023)."},{"key":"e_1_3_2_1_28_1","volume-title":"A transformer-based model with self-distillation for multimodal emotion recognition in conversations","author":"Ma Hui","year":"2023","unstructured":"Hui Ma, Jian Wang, Hongfei Lin, Bo Zhang, Yijia Zhang, and Bo Xu. 2023a. A transformer-based model with self-distillation for multimodal emotion recognition in conversations. IEEE Transactions on Multimedia (2023)."},{"key":"e_1_3_2_1_29_1","volume-title":"A transformer-based model with self-distillation for multimodal emotion recognition in conversations","author":"Ma Hui","year":"2023","unstructured":"Hui Ma, Jian Wang, Hongfei Lin, Bo Zhang, Yijia Zhang, and Bo Xu. 2023b. A transformer-based model with self-distillation for multimodal emotion recognition in conversations. IEEE Transactions on Multimedia (2023)."},{"key":"e_1_3_2_1_30_1","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v33i01.33016818"},{"key":"e_1_3_2_1_31_1","volume-title":"Dialoguetrm: Exploring the intra-and inter-modal emotional behaviors in the conversation. arXiv preprint arXiv:2010.07637","author":"Mao Yuzhao","year":"2020","unstructured":"Yuzhao Mao, Qi Sun, Guang Liu, Xiaojie Wang, Weiguo Gao, Xuan Li, and Jianping Shen. 2020. Dialoguetrm: Exploring the intra-and inter-modal emotional behaviors in the conversation. arXiv preprint arXiv:2010.07637 (2020)."},{"key":"e_1_3_2_1_32_1","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2024.3434495"},{"key":"e_1_3_2_1_33_1","volume-title":"Deep Emotion Recognition in Textual Conversations: A Survey. arXiv preprint arXiv:2211.09172","author":"Pereira Patr\u00edcia","year":"2022","unstructured":"Patr\u00edcia Pereira, Helena Moniz, and Joao Paulo Carvalho. 2022. Deep Emotion Recognition in Textual Conversations: A Survey. arXiv preprint arXiv:2211.09172 (2022)."},{"key":"e_1_3_2_1_34_1","volume-title":"Meld: A multimodal multi-party dataset for emotion recognition in conversations. arXiv preprint arXiv:1810.02508","author":"Poria Soujanya","year":"2018","unstructured":"Soujanya Poria, Devamanyu Hazarika, Navonil Majumder, Gautam Naik, Erik Cambria, and Rada Mihalcea. 2018. Meld: A multimodal multi-party dataset for emotion recognition in conversations. arXiv preprint arXiv:1810.02508 (2018)."},{"key":"e_1_3_2_1_35_1","volume-title":"Emotion recognition in conversation: Research challenges, datasets, and recent advances","author":"Poria Soujanya","year":"2019","unstructured":"Soujanya Poria, Navonil Majumder, Rada Mihalcea, and Eduard Hovy. 2019. Emotion recognition in conversation: Research challenges, datasets, and recent advances. IEEE access, Vol. 7 (2019), 100943-100953."},{"key":"e_1_3_2_1_36_1","doi-asserted-by":"publisher","DOI":"10.1145\/3689092.3689401"},{"key":"e_1_3_2_1_37_1","volume-title":"International Conference on Machine Learning. PMLR, 8748-8763","author":"Radford Alec","year":"2021","unstructured":"Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pam Mishkin, Jack Clark, et al., 2021. Learning transferable visual models from natural language supervision. In International Conference on Machine Learning. PMLR, 8748-8763."},{"key":"e_1_3_2_1_38_1","doi-asserted-by":"publisher","DOI":"10.1037\/0022-3514.52.6.1061"},{"key":"e_1_3_2_1_39_1","doi-asserted-by":"publisher","DOI":"10.1016\/j.neucom.2024.127550"},{"key":"e_1_3_2_1_40_1","doi-asserted-by":"publisher","DOI":"10.1016\/j.ins.2024.121393"},{"key":"e_1_3_2_1_41_1","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.acl-long.824"},{"key":"e_1_3_2_1_42_1","doi-asserted-by":"publisher","DOI":"10.1016\/j.inffus.2024.102590"},{"key":"e_1_3_2_1_43_1","doi-asserted-by":"publisher","DOI":"10.1016\/j.knosys.2021.107598"},{"key":"e_1_3_2_1_44_1","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v38i17.29876"},{"key":"e_1_3_2_1_45_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP49357.2023.10094596"},{"key":"e_1_3_2_1_46_1","first-page":"1988","article-title":"Audio-Visual Domain Adaptation Feature Fusion for Speech Emotion Recognition","author":"Wei Jie","year":"2022","unstructured":"Jie Wei, Guanyu Hu, Xinyu Yang, Anh Tuan Luu, and Yizhuo Dong. 2022. Audio-Visual Domain Adaptation Feature Fusion for Speech Emotion Recognition.. In INTERSPEECH. 1988-1992.","journal-title":"INTERSPEECH."},{"key":"e_1_3_2_1_47_1","doi-asserted-by":"publisher","DOI":"10.1016\/j.eswa.2023.121419"},{"key":"e_1_3_2_1_48_1","first-page":"6267","article-title":"Self-adaptive context and modal-interaction modeling for multimodal emotion recognition. In Findings of the association for computational linguistics","volume":"2023","author":"Yang Haozhe","year":"2023","unstructured":"Haozhe Yang, Xianqiang Gao, Jianlong Wu, Tian Gan, Ning Ding, Feijun Jiang, and Liqiang Nie. 2023. Self-adaptive context and modal-interaction modeling for multimodal emotion recognition. In Findings of the association for computational linguistics: ACL 2023. 6267-6281.","journal-title":"ACL"},{"key":"e_1_3_2_1_49_1","first-page":"112","article-title":"Multimodal speech emotion recognition using audio and text. In 2018 IEEE spoken language technology workshop (SLT)","author":"Yoon Seunghyun","year":"2018","unstructured":"Seunghyun Yoon, Seokhyun Byun, and Kyomin Jung. 2018. Multimodal speech emotion recognition using audio and text. In 2018 IEEE spoken language technology workshop (SLT). IEEE, 112-118.","journal-title":"IEEE"},{"key":"e_1_3_2_1_50_1","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v32i1.12021"},{"key":"e_1_3_2_1_51_1","doi-asserted-by":"publisher","DOI":"10.1016\/j.bspc.2023.105052"},{"key":"e_1_3_2_1_52_1","doi-asserted-by":"publisher","DOI":"10.1109\/TAFFC.2024.3354382"},{"key":"e_1_3_2_1_53_1","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.acl-long.732"},{"key":"e_1_3_2_1_54_1","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.acl-long.732"},{"key":"e_1_3_2_1_55_1","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2023-413"},{"key":"e_1_3_2_1_56_1","volume-title":"Prompting visual-language models for dynamic facial expression recognition. arXiv preprint arXiv:2308.13382","author":"Zhao Zengqun","year":"2023","unstructured":"Zengqun Zhao and Ioannis Patras. 2023. Prompting visual-language models for dynamic facial expression recognition. arXiv preprint arXiv:2308.13382 (2023)."},{"key":"e_1_3_2_1_57_1","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.acl-long.861"},{"key":"e_1_3_2_1_58_1","doi-asserted-by":"publisher","DOI":"10.1016\/j.knosys.2022.109978"}],"event":{"name":"MM '25: The 33rd ACM International Conference on Multimedia","location":"Dublin Ireland","acronym":"MM '25","sponsor":["SIGMM ACM Special Interest Group on Multimedia"]},"container-title":["Proceedings of the 33rd ACM International Conference on Multimedia"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3746027.3755340","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,12,10]],"date-time":"2025-12-10T04:01:30Z","timestamp":1765339290000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3746027.3755340"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,10,27]]},"references-count":58,"alternative-id":["10.1145\/3746027.3755340","10.1145\/3746027"],"URL":"https:\/\/doi.org\/10.1145\/3746027.3755340","relation":{},"subject":[],"published":{"date-parts":[[2025,10,27]]},"assertion":[{"value":"2025-10-27","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}