{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,2]],"date-time":"2026-06-02T16:38:33Z","timestamp":1780418313130,"version":"3.54.1"},"publisher-location":"New York, NY, USA","reference-count":64,"publisher":"ACM","license":[{"start":{"date-parts":[[2024,10,28]],"date-time":"2024-10-28T00:00:00Z","timestamp":1730073600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.acm.org\/publications\/policies\/copyright_policy#Background"}],"funder":[{"name":"Frontier Cross Innovation Team Project of Southwest Jiaotong University under Grant","award":["YH1500112432297"],"award-info":[{"award-number":["YH1500112432297"]}]},{"name":"Natural Science Foundation of Sichuan under Grant","award":["2022NSFSC0911"],"award-info":[{"award-number":["2022NSFSC0911"]}]},{"name":"National Natural Science Foundation of China Grant","award":["62106204"],"award-info":[{"award-number":["62106204"]}]},{"DOI":"10.13039\/https:\/\/doi.org\/10.13039\/501100012226","name":"Fundamental Research Funds for the Central Universities","doi-asserted-by":"publisher","award":["2682024ZTPY055"],"award-info":[{"award-number":["2682024ZTPY055"]}],"id":[{"id":"10.13039\/https:\/\/doi.org\/10.13039\/501100012226","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2024,10,28]]},"DOI":"10.1145\/3664647.3680703","type":"proceedings-article","created":{"date-parts":[[2024,10,26]],"date-time":"2024-10-26T06:59:41Z","timestamp":1729925981000},"page":"5810-5819","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":4,"title":["Sentiment-oriented Sarcasm Integration for Video Sentiment Analysis Enhancement with Sarcasm Assistance"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0009-0002-8162-3201","authenticated-orcid":false,"given":"Junlin","family":"Fang","sequence":"first","affiliation":[{"name":"School of Computing and Artificial Intelligence, Southwest Jiaotong University, Chengdu, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-5612-7818","authenticated-orcid":false,"given":"Wenya","family":"Wang","sequence":"additional","affiliation":[{"name":"School of Computer Science and Engineering, Nanyang Technological University, Singapore, Singapore"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-0329-7458","authenticated-orcid":false,"given":"Guosheng","family":"Lin","sequence":"additional","affiliation":[{"name":"School of Computer Science and Engineering, Nanyang Technological University, Singapore, Singapore"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-1640-0992","authenticated-orcid":false,"given":"Fengmao","family":"Lv","sequence":"additional","affiliation":[{"name":"School of Computing and Artificial Intelligence, Southwest Jiaotong University, Chengdu, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"320","published-online":{"date-parts":[[2024,10,28]]},"reference":[{"key":"e_1_3_2_1_1_1","volume-title":"Yao Chong Lim, and Louis-Philippe Morency","author":"Baltrusaitis Tadas","year":"2018","unstructured":"Tadas Baltrusaitis, Amir Zadeh, Yao Chong Lim, and Louis-Philippe Morency. 2018. OpenFace 2.0: Facial Behavior Analysis Toolkit. In FG. 59--66."},{"key":"e_1_3_2_1_2_1","doi-asserted-by":"crossref","unstructured":"Santiago Castro Devamanyu Hazarika Ver\u00f3nica P\u00e9rez-Rosas Roger Zimmermann Rada Mihalcea and Soujanya Poria. 2019. Towards Multimodal Sarcasm Detection (An _Obviously_ Perfect Paper). In ACL Anna Korhonen David R. Traum and Llu\u00eds M\u00e0rquez (Eds.). 4619--4629.","DOI":"10.18653\/v1\/P19-1455"},{"key":"e_1_3_2_1_3_1","volume-title":"SpeechPrompt v2: Prompt Tuning for Speech Classification Tasks. CoRR","author":"Chang Kai-Wei","year":"2023","unstructured":"Kai-Wei Chang, Yu-Kai Wang, Hua Shen, Iu-thing Kang, Wei-Cheng Tseng, Shang-Wen Li, and Hung-yi Lee. 2023. SpeechPrompt v2: Prompt Tuning for Speech Classification Tasks. CoRR, Vol. abs\/2303.00733 (2023)."},{"key":"e_1_3_2_1_4_1","doi-asserted-by":"crossref","unstructured":"Dushyant Singh Chauhan Dhanush S. R Asif Ekbal and Pushpak Bhattacharyya. 2020. Sentiment and Emotion help Sarcasm? A Multi-task Learning Framework for Multi-Modal Sarcasm Sentiment and Emotion Analysis. In ACL Dan Jurafsky Joyce Chai Natalie Schluter and Joel R. Tetreault (Eds.). 4351--4360.","DOI":"10.18653\/v1\/2020.acl-main.401"},{"key":"e_1_3_2_1_5_1","doi-asserted-by":"crossref","unstructured":"Chengxin Chen and Pengyuan Zhang. 2022. Integrating Cross-modal Interactions via Latent Representation Shift for Multi-modal Humor Detection. In MM. 23--28.","DOI":"10.1145\/3551876.3554805"},{"key":"e_1_3_2_1_6_1","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2022.3197420"},{"key":"e_1_3_2_1_7_1","doi-asserted-by":"crossref","unstructured":"Gilles Degottex John Kane Thomas Drugman Tuomo Raitio and Stefan Scherer. 2014. COVAREP - A collaborative voice analysis repository for speech technologies. In ICASSP. 960--964.","DOI":"10.1109\/ICASSP.2014.6853739"},{"key":"e_1_3_2_1_8_1","volume-title":"Detection of Glottal Closure Instants From Speech Signals: A Quantitative Review","author":"Drugman Thomas","year":"2012","unstructured":"Thomas Drugman, Mark R. P. Thomas, J\u00f3n Gu\u00f0nason, Patrick A. Naylor, and Thierry Dutoit. 2012. Detection of Glottal Closure Instants From Speech Signals: A Quantitative Review. IEEE Trans. Speech Audio Process. (2012), 994--1006."},{"key":"e_1_3_2_1_9_1","doi-asserted-by":"crossref","unstructured":"Bjarke Felbo Alan Mislove Anders S\u00f8gaard Iyad Rahwan and Sune Lehmann. 2017. Using millions of emoji occurrences to learn any-domain representations for detecting sentiment emotion and sarcasm. In EMNLP. 1615--1625.","DOI":"10.18653\/v1\/D17-1169"},{"key":"e_1_3_2_1_10_1","doi-asserted-by":"crossref","unstructured":"Quan Gan Shangfei Wang Longfei Hao and Qiang Ji. 2017. A Multimodal Deep Regression Bayesian Network for Affective Video Content Analyses. In ICCV. 5123--5132.","DOI":"10.1109\/ICCV.2017.547"},{"key":"e_1_3_2_1_11_1","doi-asserted-by":"crossref","unstructured":"Md. Kamrul Hasan Sangwu Lee Wasifur Rahman Amir Zadeh Rada Mihalcea Louis-Philippe Morency and Ehsan Hoque. 2021. Humor Knowledge Enriched Transformer for Understanding Multimodal Humor. In AAAI. 12972--12980.","DOI":"10.1609\/aaai.v35i14.17534"},{"key":"e_1_3_2_1_12_1","doi-asserted-by":"crossref","unstructured":"Devamanyu Hazarika Roger Zimmermann and Soujanya Poria. 2020. MISA: Modality-Invariant and -Specific Representations for Multimodal Sentiment Analysis. In ACM MM Chang Wen Chen Rita Cucchiara Xian-Sheng Hua Guo-Jun Qi Elisa Ricci Zhengyou Zhang and Roger Zimmermann (Eds.). 1122--1131.","DOI":"10.1145\/3394171.3413678"},{"key":"e_1_3_2_1_13_1","volume-title":"Hwee Tou Ng, and Daniel Dahlmeier.","author":"He Ruidan","year":"2019","unstructured":"Ruidan He, Wee Sun Lee, Hwee Tou Ng, and Daniel Dahlmeier. 2019. An Interactive Multi-Task Learning Network for End-to-End Aspect-Based Sentiment Analysis. In ACL. 504--515."},{"key":"e_1_3_2_1_14_1","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2013.2245653"},{"key":"e_1_3_2_1_15_1","volume-title":"ChatGPT: Jack of all trades, master of none. CoRR","author":"Kocon Jan","year":"2023","unstructured":"Jan Kocon, Igor Cichecki, Oliwier Kaszyca, Mateusz Kochanek, Dominika Szydlo, Joanna Baran, Julita Bielaniewicz, Marcin Gruza, Arkadiusz Janz, Kamil Kanclerz, Anna Kocon, Bartlomiej Koptyra, Wiktoria Mieleszczenko-Kowszewicz, Piotr Milkowski, Marcin Oleksy, Maciej Piasecki, Lukasz Radlinski, Konrad Wojtasik, Stanislaw Wozniak, and Przemyslaw Kazienko. 2023. ChatGPT: Jack of all trades, master of none. CoRR, Vol. abs\/2302.10724 (2023)."},{"key":"e_1_3_2_1_16_1","volume-title":"ALBERT: A Lite BERT for Self-supervised Learning of Language Representations. In ICLR.","author":"Lan Zhenzhong","year":"2020","unstructured":"Zhenzhong Lan, Mingda Chen, Sebastian Goodman, Kevin Gimpel, Piyush Sharma, and Radu Soricut. 2020. ALBERT: A Lite BERT for Self-supervised Learning of Language Representations. In ICLR."},{"key":"e_1_3_2_1_17_1","volume-title":"Video-Based Sentiment Analysis with hvnLBP-TOP Feature and bi-LSTM","author":"Li Haoran","unstructured":"Haoran Li and Hua Xu. 2019. Video-Based Sentiment Analysis with hvnLBP-TOP Feature and bi-LSTM. In AAAI. AAAI Press, 9963--9964."},{"key":"e_1_3_2_1_18_1","unstructured":"Yong Li Yuanzhi Wang and Zhen Cui. 2023. Decoupled Multimodal Distilling for Emotion Recognition. In CVPR. 6631--6640."},{"key":"e_1_3_2_1_19_1","volume-title":"AMOA: Global Acoustic Feature Enhanced Modal-Order-Aware Network for Multimodal Sentiment Analysis. In COLING. International Committee on Computational Linguistics, 7136--7146.","author":"Li Ziming","year":"2022","unstructured":"Ziming Li, Yan Zhou, Weibo Zhang, Yaxin Liu, Chuanpeng Yang, Zheng Lian, and Songlin Hu. 2022. AMOA: Global Acoustic Feature Enhanced Modal-Order-Aware Network for Multimodal Sentiment Analysis. In COLING. International Committee on Computational Linguistics, 7136--7146."},{"key":"e_1_3_2_1_20_1","doi-asserted-by":"crossref","unstructured":"Bin Liang Chenwei Lou Xiang Li Lin Gui Min Yang and Ruifeng Xu. 2021. Multi-Modal Sarcasm Detection with Interactive In-Modal and Cross-Modal Graphs. In MM. 4707--4715.","DOI":"10.1145\/3474085.3475190"},{"key":"e_1_3_2_1_21_1","doi-asserted-by":"crossref","unstructured":"Bin Liang Chenwei Lou Xiang Li Min Yang Lin Gui Yulan He Wenjie Pei and Ruifeng Xu. 2022. Multi-Modal Sarcasm Detection via Cross-Modal Graph Convolutional Network. In ACL. 1767--1777.","DOI":"10.18653\/v1\/2022.acl-long.124"},{"key":"e_1_3_2_1_22_1","doi-asserted-by":"crossref","unstructured":"Paul Pu Liang Ziyin Liu Amir Zadeh and Louis-Philippe Morency. 2018. Multimodal Language Analysis with Recurrent Multistage Fusion. In EMNLP Ellen Riloff David Chiang Julia Hockenmaier and Jun'ichi Tsujii (Eds.). 150--161.","DOI":"10.18653\/v1\/D18-1014"},{"key":"e_1_3_2_1_23_1","doi-asserted-by":"crossref","unstructured":"Tao Liang Guosheng Lin Lei Feng Yan Zhang and Fengmao Lv. 2021. Attention is not Enough: Mitigating the Distribution Discrepancy in Asynchronous Multimodal Sequence Fusion. In ICCV. 8128--8136.","DOI":"10.1109\/ICCV48922.2021.00804"},{"key":"e_1_3_2_1_24_1","unstructured":"Zijie Lin Bin Liang Yunfei Long Yixue Dang Min Yang Min Zhang and Ruifeng Xu. 2022. Modeling Intra- and Inter-Modal Relations: Hierarchical Graph Contrastive Learning for Multimodal Sentiment Analysis. In COLING. 7124--7135."},{"key":"e_1_3_2_1_25_1","doi-asserted-by":"crossref","unstructured":"Hui Liu Wenya Wang and Haoliang Li. 2022. Towards Multi-Modal Sarcasm Detection via Hierarchical Congruity Modeling with Knowledge Enhancement. In EMNLP. 4995--5006.","DOI":"10.18653\/v1\/2022.emnlp-main.333"},{"key":"e_1_3_2_1_26_1","volume-title":"What Does Your Smile Mean? Jointly Detecting Multi-Modal Sarcasm and Sentiment Using Quantum Probability","author":"Liu Yaochen","unstructured":"Yaochen Liu, Yazhou Zhang, Qiuchi Li, Benyou Wang, and Dawei Song. 2021. What Does Your Smile Mean? Jointly Detecting Multi-Modal Sarcasm and Sentiment Using Quantum Probability. In Findings of EMNLP. Association for Computational Linguistics, 871--880."},{"key":"e_1_3_2_1_27_1","volume-title":"Paul Pu Liang, Amir Zadeh, and Louis-Philippe Morency.","author":"Liu Zhun","year":"2018","unstructured":"Zhun Liu, Ying Shen, Varun Bharadhwaj Lakshminarasimhan, Paul Pu Liang, Amir Zadeh, and Louis-Philippe Morency. 2018. Efficient Low-rank Multimodal Fusion With Modality-Specific Factors. In ACL. 2247--2256."},{"key":"e_1_3_2_1_28_1","doi-asserted-by":"crossref","unstructured":"Fengmao Lv Xiang Chen Yanyong Huang Lixin Duan and Guosheng Lin. 2021. Progressive Modality Reinforcement for Human Multimodal Emotion Recognition From Unaligned Multimodal Sequences. In CVPR. 2554--2562.","DOI":"10.1109\/CVPR46437.2021.00258"},{"key":"e_1_3_2_1_29_1","doi-asserted-by":"crossref","unstructured":"Sijie Mai Ya Sun and Haifeng Hu. 2022. Curriculum Learning Meets Weakly Supervised Multimodal Correlation Learning. In EMNLP Yoav Goldberg Zornitsa Kozareva and Yue Zhang (Eds.). 3191--3203.","DOI":"10.18653\/v1\/2022.emnlp-main.209"},{"key":"e_1_3_2_1_30_1","volume-title":"Robust-MSA: Understanding the Impact of Modality Noise on Multimodal Sentiment Analysis","author":"Mao Huisheng","unstructured":"Huisheng Mao, Baozheng Zhang, Hua Xu, Ziqi Yuan, and Yihe Liu. 2023. Robust-MSA: Understanding the Impact of Modality Noise on Multimodal Sentiment Analysis. In AAAI. AAAI Press, 16458--16460."},{"key":"e_1_3_2_1_32_1","unstructured":"Hongliang Pan Zheng Lin Peng Fu Yatao Qi and Weiping Wang. 2020. Modeling Intra and Inter-modality Incongruity for Multi-Modal Sarcasm Detection. In Findings of EMNLP. 1383--1392."},{"key":"e_1_3_2_1_33_1","volume-title":"Patel","author":"Pramanick Shraman","year":"2022","unstructured":"Shraman Pramanick, Aniket Roy, and Vishal M. Patel. 2022. Multimodal Learning using Optimal Transport for Sarcasm and Humor Detection. In WACV. 546--556."},{"key":"e_1_3_2_1_34_1","volume-title":"Chengfeng Mao, Louis-Philippe Morency, and Mohammed E. Hoque.","author":"Rahman Wasifur","year":"2020","unstructured":"Wasifur Rahman, Md. Kamrul Hasan, Sangwu Lee, AmirAli Bagher Zadeh, Chengfeng Mao, Louis-Philippe Morency, and Mohammed E. Hoque. 2020. Integrating Multimodal Information in Large Pretrained Transformers. In ACL. 2359--2369."},{"key":"e_1_3_2_1_35_1","doi-asserted-by":"crossref","unstructured":"Hiranmayi Ranganathan Shayok Chakraborty and Sethuraman Panchanathan. 2016. Multimodal emotion recognition using deep learning architectures. In WACV. 1--9.","DOI":"10.1109\/WACV.2016.7477679"},{"key":"e_1_3_2_1_36_1","volume-title":"A Multimodal Corpus for Emotion Recognition in Sarcasm","author":"Ray Anupama","unstructured":"Anupama Ray, Shubham Mishra, Apoorva Nunna, and Pushpak Bhattacharyya. 2022. A Multimodal Corpus for Emotion Recognition in Sarcasm. In LREC. European Language Resources Association, 6992--7003."},{"key":"e_1_3_2_1_37_1","volume-title":"Nathan Gilbert, and Ruihong Huang.","author":"Riloff Ellen","year":"2013","unstructured":"Ellen Riloff, Ashequl Qadir, Prafulla Surve, Lalindra De Silva, Nathan Gilbert, and Ruihong Huang. 2013. Sarcasm as Contrast between a Positive Sentiment and Negative Situation. In EMNLP. 704--714."},{"key":"e_1_3_2_1_38_1","doi-asserted-by":"crossref","unstructured":"Rossano Schifanella Paloma de Juan Joel R. Tetreault and Liangliang Cao. 2016. Detecting Sarcasm in Multimodal Social Platforms. In MM. 1136--1145.","DOI":"10.1145\/2964284.2964321"},{"key":"e_1_3_2_1_39_1","doi-asserted-by":"crossref","unstructured":"Shiv Shankar. 2022. Multimodal fusion via cortical network inspired losses. In ACL. 1167--1178.","DOI":"10.18653\/v1\/2022.acl-long.83"},{"key":"e_1_3_2_1_40_1","unstructured":"Karen Simonyan and Andrew Zisserman. 2015. Very Deep Convolutional Networks for Large-Scale Image Recognition. In ICLR."},{"key":"e_1_3_2_1_41_1","volume-title":"Siu Cheung Hui, and Jian Su.","author":"Tay Yi","year":"2018","unstructured":"Yi Tay, Anh Tuan Luu, Siu Cheung Hui, and Jian Su. 2018. Reasoning with Sarcasm by Reading In-Between. In ACL. 1010--1020."},{"key":"e_1_3_2_1_42_1","doi-asserted-by":"crossref","unstructured":"Dung Nguyen Tien Kien Nguyen Sridha Sridharan David Dean and Clinton Fookes. 2018. Deep spatio-temporal feature fusion with compact bilinear pooling for multimodal emotion recognition. Comput. Vis. Image Underst. (2018) 33--42.","DOI":"10.1016\/j.cviu.2018.06.005"},{"key":"e_1_3_2_1_43_1","volume-title":"Sridha Sridharan, Afsane Ghasemi, David Dean, and Clinton Fookes.","author":"Tien Dung Nguyen","year":"2017","unstructured":"Dung Nguyen Tien, Kien Nguyen Thanh, Sridha Sridharan, Afsane Ghasemi, David Dean, and Clinton Fookes. 2017. Deep Spatio-Temporal Features for Multimodal Emotion Recognition. In WACV. 1215--1223."},{"key":"e_1_3_2_1_44_1","volume-title":"J. Zico Kolter, Louis-Philippe Morency, and Ruslan Salakhutdinov.","author":"Hubert Tsai Yao-Hung","year":"2019","unstructured":"Yao-Hung Hubert Tsai, Shaojie Bai, Paul Pu Liang, J. Zico Kolter, Louis-Philippe Morency, and Ruslan Salakhutdinov. 2019. Multimodal Transformer for Unaligned Multimodal Language Sequences. In ACL, Anna Korhonen, David R. Traum, and Llu\u00eds M\u00e0rquez (Eds.). 6558--6569."},{"key":"e_1_3_2_1_45_1","volume-title":"Amir Zadeh, Louis-Philippe Morency, and Ruslan Salakhutdinov.","author":"Hubert Tsai Yao-Hung","year":"2019","unstructured":"Yao-Hung Hubert Tsai, Paul Pu Liang, Amir Zadeh, Louis-Philippe Morency, and Ruslan Salakhutdinov. 2019. Learning Factorized Multimodal Representations. In ICLR."},{"key":"e_1_3_2_1_46_1","volume-title":"J. Zico Kolter, Louis-Philippe Morency, and Ruslan Salakhutdinov.","author":"Hubert Tsai Yao-Hung","year":"2019","unstructured":"Yao-Hung Hubert Tsai, Shaojie Bai, Paul Pu Liang, J. Zico Kolter, Louis-Philippe Morency, and Ruslan Salakhutdinov. 2019. Multimodal Transformer for Unaligned Multimodal Language Sequences. In ACL."},{"key":"e_1_3_2_1_47_1","unstructured":"Ashish Vaswani Noam Shazeer Niki Parmar Jakob Uszkoreit Llion Jones Aidan N. Gomez Lukasz Kaiser and Illia Polosukhin. 2017. Attention is All you Need. In NIPS Isabelle Guyon Ulrike von Luxburg Samy Bengio Hanna M. Wallach Rob Fergus S. V. N. Vishwanathan and Roman Garnett (Eds.). 5998--6008."},{"key":"e_1_3_2_1_48_1","doi-asserted-by":"publisher","DOI":"10.1016\/j.patcog.2022.109259"},{"key":"e_1_3_2_1_49_1","first-page":"289","article-title":"TEDT","volume":"15","author":"Wang Fan","year":"2023","unstructured":"Fan Wang, Shengwei Tian, Long Yu, Jing Liu, Junwen Wang, Kun Li, and Yongtao Wang. 2023. TEDT: Transformer-Based Encoding-Decoding Translation Network for Multimodal Sentiment Analysis. Cogn. Comput., Vol. 15, 1 (2023), 289--303.","journal-title":"Transformer-Based Encoding-Decoding Translation Network for Multimodal Sentiment Analysis. Cogn. Comput."},{"key":"e_1_3_2_1_50_1","doi-asserted-by":"crossref","unstructured":"Zilong Wang Zhaohong Wan and Xiaojun Wan. 2020. TransModality: An End2End Fusion Method with Transformer for Multimodal Sentiment Analysis. In WWW. ACM \/ IW3C2 2514--2520.","DOI":"10.1145\/3366423.3380000"},{"key":"e_1_3_2_1_51_1","doi-asserted-by":"publisher","DOI":"10.1016\/j.knosys.2021.107676"},{"key":"e_1_3_2_1_52_1","doi-asserted-by":"crossref","unstructured":"Liqiang Xiao Honglun Zhang and Wenqing Chen. 2018. Gated Multi-Task Network for Text Classification. In NAACL. 726--731.","DOI":"10.18653\/v1\/N18-2114"},{"key":"e_1_3_2_1_53_1","doi-asserted-by":"crossref","unstructured":"Bo Xu Tingting Li Junzhe Zheng Mehdi Naseriparsa Zhehuan Zhao Hongfei Lin and Feng Xia. 2022. MET-Meme: A Multimodal Meme Dataset Rich in Metaphors. In SIGIR. 2887--2899.","DOI":"10.1145\/3477495.3532019"},{"key":"e_1_3_2_1_54_1","doi-asserted-by":"crossref","unstructured":"Haojie Xu Weifeng Liu Jiangwei Liu Mingzheng Li Yu Feng Yasi Peng Yunwei Shi Xiao Sun and Meng Wang. 2022. Hybrid Multimodal Fusion for Humor Detection. In MM. 15--21.","DOI":"10.1145\/3551876.3554802"},{"key":"e_1_3_2_1_55_1","doi-asserted-by":"crossref","unstructured":"Nan Xu Zhixiong Zeng and Wenji Mao. 2020. Reasoning with Multimodal Sarcastic Tweets via Modeling Cross-Modality Contrast and Semantic Association. In ACL. 3777--3786.","DOI":"10.18653\/v1\/2020.acl-main.349"},{"key":"e_1_3_2_1_56_1","unstructured":"Wenmeng Yu Hua Xu Ziqi Yuan and Jiele Wu. 2021. Learning Modality-Specific Representations with Self-Supervised Multi-Task Learning for Multimodal Sentiment Analysis. In AAAI."},{"key":"e_1_3_2_1_57_1","doi-asserted-by":"crossref","unstructured":"Amir Zadeh Minghai Chen Soujanya Poria Erik Cambria and Louis-Philippe Morency. 2017. Tensor Fusion Network for Multimodal Sentiment Analysis. In EMNLP Martha Palmer Rebecca Hwa and Sebastian Riedel (Eds.). 1103--1114.","DOI":"10.18653\/v1\/D17-1115"},{"key":"e_1_3_2_1_58_1","volume-title":"Soujanya Poria, Erik Cambria, and Louis-Philippe Morency.","author":"Zadeh Amir","year":"2018","unstructured":"Amir Zadeh, Paul Pu Liang, Soujanya Poria, Erik Cambria, and Louis-Philippe Morency. 2018. Multimodal Language Analysis in the Wild: Carnegie Mellon University-MOSEI Dataset and Interpretable Dynamic Fusion Graph. In ACL. Association for Computational Linguistics, 2236--2246."},{"key":"e_1_3_2_1_59_1","volume-title":"Multimodal Sentiment Intensity Analysis in Videos: Facial Gestures and Verbal Messages","author":"Zadeh Amir","year":"2016","unstructured":"Amir Zadeh, Rowan Zellers, Eli Pincus, and Louis-Philippe Morency. 2016. Multimodal Sentiment Intensity Analysis in Videos: Facial Gestures and Verbal Messages. IEEE Intell. Syst. (2016), 82--88."},{"key":"e_1_3_2_1_60_1","volume-title":"Levinson","author":"Zeng Zhihong","year":"2005","unstructured":"Zhihong Zeng, Jilin Tu, Brian Pianfetti, Ming Liu, Tong Zhang, ZhenQiu Zhang, Thomas S. Huang, and Stephen E. Levinson. 2005. Audio-Visual Affect Recognition through Multi-Stream Fused HMM for HCI. In CVPR. 967--972."},{"key":"e_1_3_2_1_61_1","doi-asserted-by":"crossref","unstructured":"Dongyu Zhang Minghao Zhang Heting Zhang Liang Yang and Hongfei Lin. 2021. MultiMET: A Multimodal Dataset for Metaphor Understanding. In ACL. 3214--3225.","DOI":"10.18653\/v1\/2021.acl-long.249"},{"key":"e_1_3_2_1_62_1","volume-title":"CAMEL: Capturing Metaphorical Alignment with Context Disentangling for Multimodal Emotion Recognition. In AAAI. 9341--9349.","author":"Zhang Linhao","year":"2024","unstructured":"Linhao Zhang, Li Jin, Guangluan Xu, Xiaoyu Li, Cai Xu, Kaiwen Wei, Nayu Liu, and Haonan Liu. 2024. CAMEL: Capturing Metaphorical Alignment with Context Disentangling for Multimodal Emotion Recognition. In AAAI. 9341--9349."},{"key":"e_1_3_2_1_63_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-88480-2_66"},{"key":"e_1_3_2_1_64_1","doi-asserted-by":"crossref","unstructured":"Zheng Zhang Jeffrey M. Girard Yue Wu Xing Zhang Peng Liu Umur A. Ciftci Shaun J. Canavan Michael Reale Andrew Horowitz Huiyuan Yang Jeffrey F. Cohn Qiang Ji and Lijun Yin. 2016. Multimodal Spontaneous Emotion Corpus for Human Behavior Analysis. In CVPR. 3438--3446.","DOI":"10.1109\/CVPR.2016.374"},{"key":"e_1_3_2_1_65_1","doi-asserted-by":"publisher","DOI":"10.1007\/s11063-021-10713-5"}],"event":{"name":"MM '24: The 32nd ACM International Conference on Multimedia","location":"Melbourne VIC Australia","acronym":"MM '24","sponsor":["SIGMM ACM Special Interest Group on Multimedia"]},"container-title":["Proceedings of the 32nd ACM International Conference on Multimedia"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3664647.3680703","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3664647.3680703","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,19]],"date-time":"2025-06-19T00:06:23Z","timestamp":1750291583000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3664647.3680703"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,10,28]]},"references-count":64,"alternative-id":["10.1145\/3664647.3680703","10.1145\/3664647"],"URL":"https:\/\/doi.org\/10.1145\/3664647.3680703","relation":{},"subject":[],"published":{"date-parts":[[2024,10,28]]},"assertion":[{"value":"2024-10-28","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}