{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,22]],"date-time":"2026-04-22T19:24:55Z","timestamp":1776885895674,"version":"3.51.2"},"publisher-location":"New York, NY, USA","reference-count":54,"publisher":"ACM","funder":[{"name":"OpenAI Researcher Access Program","award":["0000006384"],"award-info":[{"award-number":["0000006384"]}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2025,11,10]]},"DOI":"10.1145\/3746252.3760864","type":"proceedings-article","created":{"date-parts":[[2025,11,8]],"date-time":"2025-11-08T01:03:42Z","timestamp":1762563822000},"page":"5340-5345","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":4,"title":["Can Large Vision-Language Models Understand Multimodal Sarcasm?"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0009-0003-5492-8015","authenticated-orcid":false,"given":"Xinyu","family":"Wang","sequence":"first","affiliation":[{"name":"The University of Texas at Dallas, Richardson, USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0007-1441-3163","authenticated-orcid":false,"given":"Yue","family":"Zhang","sequence":"additional","affiliation":[{"name":"The University of Texas at Dallas, Richardson, USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-9827-5835","authenticated-orcid":false,"given":"Liqiang","family":"Jing","sequence":"additional","affiliation":[{"name":"The University of Texas at Dallas, Richardson, USA"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2025,11,10]]},"reference":[{"key":"e_1_3_2_1_1_1","doi-asserted-by":"crossref","unstructured":"Silvio Amir Byron C. Wallace Hao Lyu and Paula Carvalho M\u00e1rio J. Silva. 2016. Modelling Context with User Embeddings for Sarcasm Detection in Social Media. arXiv:1607.00976 [cs.CL]","DOI":"10.18653\/v1\/K16-1017"},{"key":"e_1_3_2_1_2_1","volume-title":"Qwen-VL: A Frontier Large Vision-Language Model with Versatile Abilities. CoRR","author":"Bai Jinze","year":"2023","unstructured":"Jinze Bai, Shuai Bai, Shusheng Yang, Shijie Wang, Sinan Tan, Peng Wang, Junyang Lin, Chang Zhou, and Jingren Zhou. 2023. Qwen-VL: A Frontier Large Vision-Language Model with Versatile Abilities. CoRR, Vol. abs\/2308.12966 (2023). arXiv:2308.12966"},{"key":"e_1_3_2_1_3_1","volume-title":"Proceedings of the Workshop on Intrinsic and Extrinsic Evaluation Measures for Machine Translation and\/or Summarization@ACL. Association for Computational Linguistics, 65-72","author":"Banerjee Satanjeev","year":"2005","unstructured":"Satanjeev Banerjee and Alon Lavie. 2005. METEOR: An Automatic Metric for MT Evaluation with Improved Correlation with Human Judgments. In Proceedings of the Workshop on Intrinsic and Extrinsic Evaluation Measures for Machine Translation and\/or Summarization@ACL. Association for Computational Linguistics, 65-72."},{"key":"e_1_3_2_1_4_1","doi-asserted-by":"publisher","DOI":"10.1109\/ACCESS.2016.2594194"},{"key":"e_1_3_2_1_5_1","doi-asserted-by":"publisher","DOI":"10.1109\/ACCESS.2016.2594194"},{"key":"e_1_3_2_1_6_1","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/P19-1239"},{"key":"e_1_3_2_1_7_1","first-page":"9663","article-title":"CofiPara: A Coarse-to-fine Paradigm for Multimodal Sarcasm Target Identification with Large Multimodal Models","author":"Chen Zixin","year":"2024","unstructured":"Zixin Chen, Hongzhan Lin, Ziyang Luo, Mingfei Cheng, Jing Ma, and Guang Chen. 2024. CofiPara: A Coarse-to-fine Paradigm for Multimodal Sarcasm Target Identification with Large Multimodal Models. In ACL. Association for Computational Linguistics, 9663-9687.","journal-title":"ACL. Association for Computational Linguistics"},{"key":"e_1_3_2_1_8_1","volume-title":"Junqi Zhao, Weisheng Wang, Boyang Li, Pascale Fung, and Steven C. H. Hoi.","author":"Dai Wenliang","year":"2023","unstructured":"Wenliang Dai, Junnan Li, Dongxu Li, Anthony Meng Huat Tiong, Junqi Zhao, Weisheng Wang, Boyang Li, Pascale Fung, and Steven C. H. Hoi. 2023. InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning. In NeurIPS."},{"key":"e_1_3_2_1_9_1","volume-title":"How Long Did You Marinate in It? Multimodal Sarcasm Explanation","author":"Desai Poorav","unstructured":"Poorav Desai, Tanmoy Chakraborty, and Md. Shad Akhtar. 2022. Nice Perfume. How Long Did You Marinate in It? Multimodal Sarcasm Explanation. In AAAI. AAAI Press, 10563-10571."},{"key":"e_1_3_2_1_10_1","doi-asserted-by":"publisher","unstructured":"Daijun Ding Hu Huang Bowen Zhang Cheng Peng Yangyang Li Xianghua Fu and Liwen Jing. 2022. Multi-Modal Sarcasm Detection with Prompt-Tuning. doi:10.1109\/ACAIT56212.2022.10137937","DOI":"10.1109\/ACAIT56212.2022.10137937"},{"key":"e_1_3_2_1_11_1","volume-title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models. CoRR","author":"Fu Chaoyou","year":"2023","unstructured":"Chaoyou Fu, Peixian Chen, Yunhang Shen, Yulei Qin, Mengdan Zhang, Xu Lin, Zhenyu Qiu, Wei Lin, Jinrui Yang, Xiawu Zheng, Ke Li, Xing Sun, and Rongrong Ji. 2023. MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models. CoRR, Vol. abs\/2306.13394 (2023). arXiv:2306.13394"},{"key":"e_1_3_2_1_12_1","first-page":"1440","article-title":"Fast R-CNN","author":"Girshick Ross B.","year":"2015","unstructured":"Ross B. Girshick. 2015. Fast R-CNN. In ICCV. IEEE Computer Society, 1440-1448.","journal-title":"ICCV. IEEE Computer Society"},{"key":"e_1_3_2_1_13_1","volume-title":"FAITHSCORE: Evaluating Hallucinations in Large Vision-Language Models. CoRR","author":"Jing Liqiang","year":"2023","unstructured":"Liqiang Jing, Ruosen Li, Yunmo Chen, Mengzhao Jia, and Xinya Du. 2023a. FAITHSCORE: Evaluating Hallucinations in Large Vision-Language Models. CoRR, Vol. abs\/2311.01477 (2023). arXiv:2311.01477"},{"key":"e_1_3_2_1_14_1","doi-asserted-by":"publisher","DOI":"10.1007\/S11633-022-1372-X"},{"key":"e_1_3_2_1_15_1","doi-asserted-by":"publisher","DOI":"10.1145\/3603374"},{"key":"e_1_3_2_1_16_1","first-page":"11349","article-title":"Multi-source Semantic Graph-based Multimodal Sarcasm Explanation Generation","author":"Jing Liqiang","year":"2023","unstructured":"Liqiang Jing, Xuemeng Song, Kun Ouyang, Mengzhao Jia, and Liqiang Nie. 2023c. Multi-source Semantic Graph-based Multimodal Sarcasm Explanation Generation. In ACL. Association for Computational Linguistics, 11349-11361.","journal-title":"ACL. Association for Computational Linguistics"},{"key":"e_1_3_2_1_17_1","first-page":"1006","article-title":"Are Word Embedding-based Features Useful for Sarcasm Detection?","author":"Joshi Aditya","year":"2016","unstructured":"Aditya Joshi, Vaibhav Tripathi, Kevin Patel, Pushpak Bhattacharyya, and Mark Carman. 2016. Are Word Embedding-based Features Useful for Sarcasm Detection?. In EMNLP. Association for Computational Linguistics, 1006-1011.","journal-title":"EMNLP. Association for Computational Linguistics"},{"key":"e_1_3_2_1_18_1","volume-title":"Wayne Xin Zhao, and Ji-Rong Wen","author":"Li Yifan","year":"2023","unstructured":"Yifan Li, Yifan Du, Kun Zhou, Jinpeng Wang, Wayne Xin Zhao, and Ji-Rong Wen. 2023. Evaluating Object Hallucination in Large Vision-Language Models. In EMNLP. Association for Computational Linguistics, 292-305."},{"key":"e_1_3_2_1_19_1","volume-title":"ROUGE: A Package for Automatic Evaluation of Summaries. In Text Summarization Branches Out","author":"Lin Chin-Yew","year":"2004","unstructured":"Chin-Yew Lin. 2004. ROUGE: A Package for Automatic Evaluation of Summaries. In Text Summarization Branches Out. Association for Computational Linguistics, 74-81."},{"key":"e_1_3_2_1_20_1","doi-asserted-by":"publisher","DOI":"10.1145\/3539618.3591633"},{"key":"e_1_3_2_1_21_1","volume-title":"GOAT-Bench: Safety Insights to Large Multimodal Models through Meme-Based Social Abuse. CoRR","author":"Lin Hongzhan","year":"2024","unstructured":"Hongzhan Lin, Ziyang Luo, Bo Wang, Ruichao Yang, and Jing Ma. 2024. GOAT-Bench: Safety Insights to Large Multimodal Models through Meme-Based Social Abuse. CoRR, Vol. abs\/2401.01523 (2024)."},{"key":"e_1_3_2_1_22_1","unstructured":"Haotian Liu Chunyuan Li Qingyang Wu and Yong Jae Lee. 2023. Visual Instruction Tuning. In NeurIPS."},{"key":"e_1_3_2_1_23_1","doi-asserted-by":"publisher","DOI":"10.48550\/ARXIV.2504.21226"},{"key":"e_1_3_2_1_24_1","volume-title":"FakeNewsGPT4: Advancing Multimodal Fake News Detection through Knowledge-Augmented LVLMs. CoRR","author":"Liu Xuannan","year":"1988","unstructured":"Xuannan Liu, Peipei Li, Huaibo Huang, Zekun Li, Xing Cui, Jiahao Liang, Lixiong Qin, Weihong Deng, and Zhaofeng He. 2024. FakeNewsGPT4: Advancing Multimodal Fake News Detection through Knowledge-Augmented LVLMs. CoRR, Vol. abs\/2403.01988 (2024). arXiv:2403.01988"},{"key":"e_1_3_2_1_25_1","unstructured":"Jiaying Lu Jinmeng Rao Kezhen Chen Xiaoyuan Guo Yawen Zhang Baochen Sun Carl Yang and Jie Yang. 2023. Evaluation and Enhancement of Semantic Grounding in Large Vision-Language Models. arXiv:2309.04041 [cs.CV]"},{"key":"e_1_3_2_1_26_1","unstructured":"OpenAI. 2023. GPT-4 Technical Report. CoRR Vol. abs\/2303.08774 (2023). arXiv:2303.08774"},{"key":"e_1_3_2_1_27_1","doi-asserted-by":"publisher","DOI":"10.48550\/ARXIV.2402.03658"},{"key":"e_1_3_2_1_28_1","first-page":"311","article-title":"Bleu: a Method for Automatic Evaluation of Machine Translation","author":"Papineni Kishore","year":"2002","unstructured":"Kishore Papineni, Salim Roukos, Todd Ward, and Wei-Jing Zhu. 2002. Bleu: a Method for Automatic Evaluation of Machine Translation. In ACL. ACL, 311-318.","journal-title":"ACL. ACL"},{"key":"e_1_3_2_1_29_1","volume-title":"Mutual-Enhanced Incongruity Learning Network for Multi-Modal Sarcasm Detection","author":"Qiao Yang","unstructured":"Yang Qiao, Liqiang Jing, Xuemeng Song, Xiaolin Chen, Lei Zhu, and Liqiang Nie. 2023. Mutual-Enhanced Incongruity Learning Network for Multi-Modal Sarcasm Detection. In AAAI. AAAI Press, 9507-9515."},{"key":"e_1_3_2_1_30_1","first-page":"1136","volume-title":"Detecting Sarcasm in Multimodal Social Platforms. In MM","author":"Schifanella Rossano","year":"2016","unstructured":"Rossano Schifanella, Paloma de Juan, Joel R. Tetreault, and Liangliang Cao. 2016. Detecting Sarcasm in Multimodal Social Platforms. In MM 2016. ACM, 1136-1145."},{"key":"e_1_3_2_1_31_1","volume-title":"ICLR","author":"Shukor Mustafa","year":"2024","unstructured":"Mustafa Shukor, Alexandre Ram\u00e9, Corentin Dancette, and Matthieu Cord. 2024. Beyond task performance: evaluating and reducing the flaws of large multimodal models with in-context-learning. In ICLR 2024. OpenReview.net."},{"key":"e_1_3_2_1_32_1","doi-asserted-by":"publisher","DOI":"10.1145\/3477495.3532076"},{"key":"e_1_3_2_1_33_1","volume-title":"An Open Multilingual Graph of General Knowledge","author":"Speer Robyn","unstructured":"Robyn Speer, Joshua Chin, and Catherine Havasi. 2017. ConceptNet 5.5: An Open Multilingual Graph of General Knowledge. In AAAI. AAAI Press, 4444-4451."},{"key":"e_1_3_2_1_34_1","doi-asserted-by":"publisher","DOI":"10.1109\/TKDE.2023.3270940"},{"key":"e_1_3_2_1_35_1","doi-asserted-by":"publisher","DOI":"10.1145\/3581783.3612051"},{"key":"e_1_3_2_1_36_1","doi-asserted-by":"publisher","DOI":"10.1145\/3503161.3548211"},{"key":"e_1_3_2_1_37_1","first-page":"1732","article-title":"Leveraging Generative Large Language Models with Visual Instruction and Demonstration Retrieval for Multimodal Sarcasm Detection","author":"Tang Binghao","year":"2024","unstructured":"Binghao Tang, Boda Lin, Haolong Yan, and Si Li. 2024. Leveraging Generative Large Language Models with Visual Instruction and Demonstration Retrieval for Multimodal Sarcasm Detection. In NAACL. Association for Computational Linguistics, 1732-1742.","journal-title":"NAACL. Association for Computational Linguistics"},{"key":"e_1_3_2_1_38_1","volume-title":"Rainbow Noise: Stress-Testing Multimodal Harmful-Meme Detectors on LGBTQ Content. arXiv preprint arXiv:2507.19551","author":"Tong Ran","year":"2025","unstructured":"Ran Tong, Songtao Wei, Jiaqi Liu, and Lanruo Wang. 2025. Rainbow Noise: Stress-Testing Multimodal Harmful-Meme Detectors on LGBTQ Content. arXiv preprint arXiv:2507.19551 (2025)."},{"key":"e_1_3_2_1_39_1","volume-title":"LLaMA: Open and Efficient Foundation Language Models. CoRR","author":"Touvron Hugo","year":"2023","unstructured":"Hugo Touvron, Thibaut Lavril, Gautier Izacard, Xavier Martinet, Marie-Anne Lachaux, Timoth\u00e9e Lacroix, Baptiste Rozi\u00e8re, Naman Goyal, Eric Hambro, Faisal Azhar, Aur\u00e9lien Rodriguez, Armand Joulin, Edouard Grave, and Guillaume Lample. 2023. LLaMA: Open and Efficient Foundation Language Models. CoRR, Vol. abs\/2302.13971 (2023). arXiv:2302.13971"},{"key":"e_1_3_2_1_40_1","volume-title":"WisdoM: Improving Multimodal Sentiment Analysis by Fusing Contextual World Knowledge. CoRR","author":"Wang Wenbin","year":"2024","unstructured":"Wenbin Wang, Liang Ding, Li Shen, Yong Luo, Han Hu, and Dacheng Tao. 2024. WisdoM: Improving Multimodal Sentiment Analysis by Fusing Contextual World Knowledge. CoRR, Vol. abs\/2401.06659 (2024). arXiv:2401.06659"},{"key":"e_1_3_2_1_41_1","first-page":"2540","article-title":"DIP","author":"Wen Changsong","year":"2023","unstructured":"Changsong Wen, Guoli Jia, and Jufeng Yang. 2023. DIP: Dual Incongruity Perceiving Network for Sarcasm Detection. In CVPR. 2540-2550.","journal-title":"Dual Incongruity Perceiving Network for Sarcasm Detection. In CVPR."},{"key":"e_1_3_2_1_42_1","doi-asserted-by":"publisher","DOI":"10.1109\/MMUL.2021.3069097"},{"key":"e_1_3_2_1_43_1","volume-title":"LVLM-eHub: A Comprehensive Evaluation Benchmark for Large Vision-Language Models. CoRR","author":"Xu Peng","year":"2023","unstructured":"Peng Xu, Wenqi Shao, Kaipeng Zhang, Peng Gao, Shuo Liu, Meng Lei, Fanqing Meng, Siyuan Huang, Yu Qiao, and Ping Luo. 2023. LVLM-eHub: A Comprehensive Evaluation Benchmark for Large Vision-Language Models. CoRR, Vol. abs\/2306.09265 (2023). arXiv:2306.09265"},{"key":"e_1_3_2_1_44_1","volume-title":"LEMMA: Towards LVLM-Enhanced Multimodal Misinformation Detection with External Knowledge Augmentation. CoRR","author":"Xuan Keyang","year":"2024","unstructured":"Keyang Xuan, Li Yi, Fan Yang, Ruochen Wu, Yi R. Fung, and Heng Ji. 2024. LEMMA: Towards LVLM-Enhanced Multimodal Misinformation Detection with External Knowledge Augmentation. CoRR, Vol. abs\/2402.11943 (2024). arXiv:2402.11943"},{"key":"e_1_3_2_1_45_1","volume-title":"MM-InstructEval: Zero-Shot Evaluation of (Multimodal) Large Language Models on Multimodal Reasoning Tasks. CoRR","author":"Yang Xiaocui","year":"2024","unstructured":"Xiaocui Yang, Wenfang Wu, Shi Feng, Ming Wang, Daling Wang, Yang Li, Qi Sun, Yifei Zhang, Xiaoming Fu, and Soujanya Poria. 2024. MM-InstructEval: Zero-Shot Evaluation of (Multimodal) Large Language Models on Multimodal Reasoning Tasks. CoRR, Vol. abs\/2405.07229 (2024). arXiv:2405.07229"},{"key":"e_1_3_2_1_46_1","doi-asserted-by":"publisher","DOI":"10.1016\/j.inffus.2023.101921"},{"key":"e_1_3_2_1_47_1","doi-asserted-by":"publisher","DOI":"10.1609\/AAAI.V39I24.34792"},{"key":"e_1_3_2_1_48_1","doi-asserted-by":"publisher","DOI":"10.48550\/ARXIV.2506.22385"},{"key":"e_1_3_2_1_49_1","volume-title":"Fine-grained and explainable factuality evaluation for multimodal summarization. arXiv preprint arXiv:2402.11414","author":"Zhang Yue","year":"2024","unstructured":"Yue Zhang, Jingxuan Zuo, and Liqiang Jing. 2024b. Fine-grained and explainable factuality evaluation for multimodal summarization. arXiv preprint arXiv:2402.11414 (2024)."},{"key":"e_1_3_2_1_50_1","article-title":"Multimodal Chain-of-Thought Reasoning in Language","volume":"2024","author":"Zhang Zhuosheng","year":"2024","unstructured":"Zhuosheng Zhang, Aston Zhang, Mu Li, Hai Zhao, George Karypis, and Alex Smola. 2024a. Multimodal Chain-of-Thought Reasoning in Language Models. Trans. Mach. Learn. Res., Vol. 2024 (2024).","journal-title":"Models. Trans. Mach. Learn. Res."},{"key":"e_1_3_2_1_51_1","volume-title":"NeurIPS","author":"Zheng Ge","year":"2023","unstructured":"Ge Zheng, Bin Yang, Jiajin Tang, Hong-Yu Zhou, and Sibei Yang. 2023. DDCoT: Duty-Distinct Chain-of-Thought Prompting for Multimodal Reasoning in Language Models. In NeurIPS 2023."},{"key":"e_1_3_2_1_52_1","volume-title":"Analyzing and Mitigating Object Hallucination in Large Vision-Language Models. In ICLR","author":"Zhou Yiyang","year":"2024","unstructured":"Yiyang Zhou, Chenhang Cui, Jaehong Yoon, Linjun Zhang, Zhun Deng, Chelsea Finn, Mohit Bansal, and Huaxiu Yao. 2024a. Analyzing and Mitigating Object Hallucination in Large Vision-Language Models. In ICLR 2024. OpenReview.net."},{"key":"e_1_3_2_1_53_1","first-page":"15890","volume-title":"ACL","author":"Zhou Yucheng","year":"2024","unstructured":"Yucheng Zhou, Xiang Li, Qianning Wang, and Jianbing Shen. 2024b. Visual In-Context Learning for Large Vision-Language Models. In Findings of the Association for Computational Linguistics, ACL 2024. Association for Computational Linguistics, 15890-15902."},{"key":"e_1_3_2_1_54_1","unstructured":"Deyao Zhu Jun Chen Xiaoqian Shen Xiang Li and Mohamed Elhoseiny. 2024. MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models. In ICLR. OpenReview.net."}],"event":{"name":"CIKM '25: The 34th ACM International Conference on Information and Knowledge Management","location":"Seoul Republic of Korea","acronym":"CIKM '25","sponsor":["SIGIR ACM Special Interest Group on Information Retrieval","SIGWEB ACM Special Interest Group on Hypertext, Hypermedia, and Web"]},"container-title":["Proceedings of the 34th ACM International Conference on Information and Knowledge Management"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3746252.3760864","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,12,12]],"date-time":"2025-12-12T01:19:00Z","timestamp":1765502340000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3746252.3760864"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,11,10]]},"references-count":54,"alternative-id":["10.1145\/3746252.3760864","10.1145\/3746252"],"URL":"https:\/\/doi.org\/10.1145\/3746252.3760864","relation":{},"subject":[],"published":{"date-parts":[[2025,11,10]]},"assertion":[{"value":"2025-11-10","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}