{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,2]],"date-time":"2026-06-02T16:30:11Z","timestamp":1780417811296,"version":"3.54.1"},"publisher-location":"New York, NY, USA","reference-count":46,"publisher":"ACM","license":[{"start":{"date-parts":[[2025,4,22]],"date-time":"2025-04-22T00:00:00Z","timestamp":1745280000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.acm.org\/publications\/policies\/copyright_policy#Background"}],"funder":[{"name":"Engineering Research Center of Sustainable Urban Intelligent Transportation, Ministry of Education"},{"name":"Frontier Cross Innovation Team Project of Southwest Jiaotong University","award":["YH1500112432297"],"award-info":[{"award-number":["YH1500112432297"]}]},{"DOI":"10.13039\/https:\/\/doi.org\/10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62106204, 62176221"],"award-info":[{"award-number":["62106204, 62176221"]}],"id":[{"id":"10.13039\/https:\/\/doi.org\/10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/https:\/\/doi.org\/10.13039\/501100018542","name":"Natural Science Foundation of Sichuan Province","doi-asserted-by":"publisher","award":["2025YFHZ0124"],"award-info":[{"award-number":["2025YFHZ0124"]}],"id":[{"id":"10.13039\/https:\/\/doi.org\/10.13039\/501100018542","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2025,4,22]]},"DOI":"10.1145\/3696410.3714570","type":"proceedings-article","created":{"date-parts":[[2025,4,22]],"date-time":"2025-04-22T22:57:28Z","timestamp":1745362648000},"page":"614-624","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":1,"title":["MSTI-Plus: Introducing Non-Sarcasm Reference Materials to Enhance Multimodal Sarcasm Target Identification"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0000-0003-1640-0992","authenticated-orcid":false,"given":"Fengmao","family":"Lv","sequence":"first","affiliation":[{"name":"Southwest Jiaotong University, Chengdu, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0008-5923-4828","authenticated-orcid":false,"given":"Mengting","family":"Xiong","sequence":"additional","affiliation":[{"name":"Southwest Jiaotong University, Chengdu, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0002-8162-3201","authenticated-orcid":false,"given":"Junlin","family":"Fang","sequence":"additional","affiliation":[{"name":"Southwest Jiaotong University, Chengdu, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0003-7148-353X","authenticated-orcid":false,"given":"Lingli","family":"Zhang","sequence":"additional","affiliation":[{"name":"Southwest Jiaotong University, Chengdu, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-9648-0982","authenticated-orcid":false,"given":"Tianze","family":"Luo","sequence":"additional","affiliation":[{"name":"Nanyang Technological University, Singapore, Singapore"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-8035-5255","authenticated-orcid":false,"given":"Weichao","family":"Liang","sequence":"additional","affiliation":[{"name":"Southwest Jiaotong University, Chengdu, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-7780-104X","authenticated-orcid":false,"given":"Tianrui","family":"Li","sequence":"additional","affiliation":[{"name":"Southwest Jiaotong University, Chengdu, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"320","published-online":{"date-parts":[[2025,4,22]]},"reference":[{"key":"e_1_3_2_1_1_1","doi-asserted-by":"crossref","unstructured":"Nastaran Babanejad Heidar Davoudi Aijun An and Manos Papagelis. 2020. Affective and Contextual Embedding for Sarcasm Detection. In COLING. International Committee on Computational Linguistics 225--243.","DOI":"10.18653\/v1\/2020.coling-main.20"},{"key":"e_1_3_2_1_2_1","volume-title":"Multi-Modal Sarcasm Detection in Twitter with Hierarchical Fusion Model","author":"Cai Yitao","unstructured":"Yitao Cai, Huiyu Cai, and Xiaojun Wan. 2019. Multi-Modal Sarcasm Detection in Twitter with Hierarchical Fusion Model. In ACL. Association for Computational Linguistics, 2506--2515."},{"key":"e_1_3_2_1_3_1","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2023.3345146"},{"key":"e_1_3_2_1_4_1","volume-title":"How Long Did You Marinate in It? Multimodal Sarcasm Explanation","author":"Desai Poorav","unstructured":"Poorav Desai, Tanmoy Chakraborty, and Md. Shad Akhtar. 2022. Nice Perfume. How Long Did You Marinate in It? Multimodal Sarcasm Explanation. In AAAI. AAAI Press, 10563--10571."},{"key":"e_1_3_2_1_5_1","volume-title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","author":"Devlin Jacob","year":"2019","unstructured":"Jacob Devlin, Ming-Wei Chang, Kenton Lee, and Kristina Toutanova. 2019. BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. In NAACL. Association for Computational Linguistics, 4171--4186."},{"key":"e_1_3_2_1_6_1","unstructured":"Alexey Dosovitskiy Lucas Beyer Alexander Kolesnikov Dirk Weissenborn Xiaohua Zhai Thomas Unterthiner Mostafa Dehghani Matthias Minderer Georg Heigold Sylvain Gelly Jakob Uszkoreit and Neil Houlsby. 2021. An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale. In ICLR. OpenReview.net."},{"key":"e_1_3_2_1_7_1","volume-title":"DocMSU: A Comprehensive Benchmark for Document-Level Multimodal Sarcasm Understanding","author":"Du Hang","unstructured":"Hang Du, Guoshun Nan, Sicheng Zhang, Binzhu Xie, Junrui Xu, Hehe Fan, Qimei Cui, Xiaofeng Tao, and Xudong Jiang. 2024. DocMSU: A Comprehensive Benchmark for Document-Level Multimodal Sarcasm Understanding. In AAAI. AAAI Press, 17933--17941."},{"key":"e_1_3_2_1_8_1","volume-title":"Using millions of emoji occurrences to learn any-domain representations for detecting sentiment, emotion and sarcasm","author":"Felbo Bjarke","unstructured":"Bjarke Felbo, Alan Mislove, Anders S\u00f8gaard, Iyad Rahwan, and Sune Lehmann. 2017. Using millions of emoji occurrences to learn any-domain representations for detecting sentiment, emotion and sarcasm. In EMNLP. Association for Computational Linguistics, 1615--1625."},{"key":"e_1_3_2_1_9_1","doi-asserted-by":"publisher","DOI":"10.4324\/9781410616685"},{"key":"e_1_3_2_1_10_1","volume-title":"Identifying Sarcasm in Twitter: A Closer Look","author":"Gonz\u00e1lez-Ib\u00e1\u00f1ez Roberto I.","unstructured":"Roberto I. Gonz\u00e1lez-Ib\u00e1\u00f1ez, Smaranda Muresan, and Nina Wacholder. 2011. Identifying Sarcasm in Twitter: A Closer Look. In ACL. Association for Computer Linguistics, 581--586."},{"key":"e_1_3_2_1_11_1","doi-asserted-by":"publisher","DOI":"10.1016\/j.neunet.2005.06.042"},{"key":"e_1_3_2_1_12_1","volume-title":"Deep Residual Learning for Image Recognition","author":"He Kaiming","unstructured":"Kaiming He, Xiangyu Zhang, Shaoqing Ren, and Jian Sun. 2016. Deep Residual Learning for Image Recognition. In CVPR. IEEE Computer Society, 770--778."},{"key":"e_1_3_2_1_13_1","unstructured":"Shizhou Huang Bo Xu Changqun Li Jiabo Ye and Xin Lin. 2024. MNER-MI: A Multi-image Dataset for Multimodal Named Entity Recognition in Social Media. In LREC\/COLING. ELRA and ICCL 11452--11462."},{"key":"e_1_3_2_1_14_1","volume-title":"Debiasing Multimodal Sarcasm Detection with Contrastive Learning","author":"Jia Mengzhao","year":"1835","unstructured":"Mengzhao Jia, Can Xie, and Liqiang Jing. 2024. Debiasing Multimodal Sarcasm Detection with Contrastive Learning. In AAAI. AAAI Press, 18354--18362."},{"key":"e_1_3_2_1_15_1","volume-title":"Carman","author":"Joshi Aditya","year":"2018","unstructured":"Aditya Joshi, Pranav Goel, Pushpak Bhattacharyya, and Mark J. Carman. 2018. Sarcasm Target Identification: Dataset and An Introductory Approach. In LREC. European Language Resources Association (ELRA)."},{"key":"e_1_3_2_1_16_1","volume-title":"Harnessing Context Incongruity for Sarcasm Detection","author":"Joshi Aditya","unstructured":"Aditya Joshi, Vinita Sharma, and Pushpak Bhattacharyya. 2015. Harnessing Context Incongruity for Sarcasm Detection. In ACL. Association for Computer Linguistics, 757--762."},{"key":"e_1_3_2_1_17_1","volume-title":"Conditional Augmentation for Aspect Term Extraction via Masked Sequence-to-Sequence Generation","author":"Li Kun","unstructured":"Kun Li, Chengbo Chen, Xiaojun Quan, Qing Ling, and Yan Song. 2020. Conditional Augmentation for Aspect Term Extraction via Masked Sequence-to-Sequence Generation. In ACL. Association for Computational Linguistics, 7056--7066."},{"key":"e_1_3_2_1_18_1","doi-asserted-by":"crossref","unstructured":"Xin Li Lidong Bing Piji Li Wai Lam and Zhimou Yang. 2018. Aspect Term Extraction with History Attention and Selective Transformation. In IJCAI. ijcai.org 4194--4200.","DOI":"10.24963\/ijcai.2018\/583"},{"key":"e_1_3_2_1_19_1","volume-title":"Multi-Modal Sarcasm Detection via Cross-Modal Graph Convolutional Network","author":"Liang Bin","unstructured":"Bin Liang, Chenwei Lou, Xiang Li, Min Yang, Lin Gui, Yulan He, Wenjie Pei, and Ruifeng Xu. 2022. Multi-Modal Sarcasm Detection via Cross-Modal Graph Convolutional Network. In ACL. Association for Computational Linguistics, 1767--1777."},{"key":"e_1_3_2_1_20_1","volume-title":"CofiPara: A Coarse-to-fine Paradigm for Multimodal Sarcasm Target Identification with Large Multimodal Models","author":"Lin Hongzhan","unstructured":"Hongzhan Lin, Zixin Chen, Ziyang Luo, Mingfei Cheng, Jing Ma, and Guang Chen. 2024. CofiPara: A Coarse-to-fine Paradigm for Multimodal Sarcasm Target Identification with Large Multimodal Models. In ACL. Association for Computational Linguistics, 9663--9687."},{"key":"e_1_3_2_1_21_1","volume-title":"Mining Text Data","author":"Liu Bing","unstructured":"Bing Liu and Lei Zhang. 2012. A Survey of Opinion Mining and Sentiment Analysis. In Mining Text Data. Springer, 415--463."},{"key":"e_1_3_2_1_22_1","volume-title":"Towards Multi-Modal Sarcasm Detection via Hierarchical Congruity Modeling with Knowledge Enhancement","author":"Liu Hui","unstructured":"Hui Liu, Wenya Wang, and Haoliang Li. 2022. Towards Multi-Modal Sarcasm Detection via Hierarchical Congruity Modeling with Knowledge Enhancement. In EMNLP. Association for Computational Linguistics, 4995--5006."},{"key":"e_1_3_2_1_23_1","volume-title":"Visual Attention Model for Name Tagging in Multimodal Social Media","author":"Lu Di","year":"1990","unstructured":"Di Lu, Leonardo Neves, Vitor Carvalho, Ning Zhang, and Heng Ji. 2018. Visual Attention Model for Name Tagging in Multimodal Social Media. In ACL. Association for Computational Linguistics, 1990--1999."},{"key":"e_1_3_2_1_24_1","volume-title":"Exploring Sequence-to-Sequence Learning in Aspect Term Extraction","author":"Ma Dehong","unstructured":"Dehong Ma, Sujian Li, Fangzhao Wu, Xing Xie, and Houfeng Wang. 2019. Exploring Sequence-to-Sequence Learning in Aspect Term Extraction. In ACL. Association for Computational Linguistics, 3538--3547."},{"key":"e_1_3_2_1_25_1","volume-title":"A Joint Training Dual-MRC Framework for Aspect Based Sentiment Analysis","author":"Mao Yue","unstructured":"Yue Mao, Yi Shen, Chao Yu, and Longjun Cai. 2021. A Joint Training Dual-MRC Framework for Aspect Based Sentiment Analysis. In AAAI. AAAI Press, 13543--13551."},{"key":"e_1_3_2_1_26_1","volume-title":"Interrater reliability: the kappa statistic. Biochemia medica 22, 3","author":"McHugh Mary L","year":"2012","unstructured":"Mary L McHugh. 2012. Interrater reliability: the kappa statistic. Biochemia medica 22, 3 (2012), 276--282."},{"key":"e_1_3_2_1_27_1","volume-title":"Snippext: Semi-supervised Opinion Mining with Augmented Data. InWWW. ACM\/ IW3C2, 617--628.","author":"Miao Zhengjie","year":"2020","unstructured":"Zhengjie Miao, Yuliang Li, Xiaolan Wang, and Wang-Chiew Tan. 2020. Snippext: Semi-supervised Opinion Mining with Augmented Data. InWWW. ACM\/ IW3C2, 617--628."},{"key":"e_1_3_2_1_28_1","volume-title":"EMNLP","author":"Pan Hongliang","unstructured":"Hongliang Pan, Zheng Lin, Peng Fu, Yatao Qi, and Weiping Wang. 2020. Modeling Intra and Inter-modality Incongruity for Multi-Modal Sarcasm Detection. In EMNLP, Vol. EMNLP 2020. Association for Computational Linguistics, 1383--1392."},{"key":"e_1_3_2_1_29_1","doi-asserted-by":"publisher","DOI":"10.1016\/j.ipm.2021.102599"},{"key":"e_1_3_2_1_30_1","volume-title":"A deep-learning framework to detect sarcasm targets","author":"Patro Jasabanta","unstructured":"Jasabanta Patro, Srijan Bansal, and Animesh Mukherjee. 2019. A deep-learning framework to detect sarcasm targets. In EMNLP. Association for Computational Linguistics, 6335--6341."},{"key":"e_1_3_2_1_31_1","volume-title":"SemEval-2014 Task 4: Aspect Based Sentiment Analysis","author":"Pontiki Maria","unstructured":"Maria Pontiki, Dimitris Galanis, John Pavlopoulos, Harris Papageorgiou, Ion Androutsopoulos, and Suresh Manandhar. 2014. SemEval-2014 Task 4: Aspect Based Sentiment Analysis. In COLING. The Association for Computer Linguistics, 27--35."},{"key":"e_1_3_2_1_32_1","volume-title":"Towards a Reliable Multi-modal Sarcasm Detection System","author":"Qin Libo","unstructured":"Libo Qin, Shijue Huang, Qiguang Chen, Chenran Cai, Yudi Zhang, Bin Liang, Wanxiang Che, and Ruifeng Xu. 2023. MMSD2.0: Towards a Reliable Multi-modal Sarcasm Detection System. In ACL. Association for Computational Linguistics, 10834--10845."},{"key":"e_1_3_2_1_33_1","volume-title":"ICML","volume":"139","author":"Radford Alec","year":"2021","unstructured":"Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, Gretchen Krueger, and Ilya Sutskever. 2021. Learning Transferable Visual Models From Natural Language Supervision. In ICML, Vol. 139. PMLR, 8748--8763."},{"key":"e_1_3_2_1_34_1","volume-title":"Natural language processing using very large corpora","author":"Ramshaw Lance A","unstructured":"Lance A Ramshaw and Mitchell P Marcus. 1999. Text chunking using transformation-based learning. In Natural language processing using very large corpora. Springer, 157--176."},{"key":"e_1_3_2_1_35_1","volume-title":"Nathan Gilbert, and Ruihong Huang.","author":"Riloff Ellen","year":"2013","unstructured":"Ellen Riloff, Ashequl Qadir, Prafulla Surve, Lalindra De Silva, Nathan Gilbert, and Ruihong Huang. 2013. Sarcasm as Contrast between a Positive Sentiment and Negative Situation. In EMNLP. Association for Computer Linguistics, 704--714."},{"key":"e_1_3_2_1_36_1","volume-title":"Siu Cheung Hui, and Jian Su.","author":"Tay Yi","year":"2018","unstructured":"Yi Tay, Anh Tuan Luu, Siu Cheung Hui, and Jian Su. 2018. Reasoning with Sarcasm by Reading In-Between. In ACL. Association for Computer Linguistics, 1010--1020."},{"key":"e_1_3_2_1_37_1","volume-title":"Dynamic Routing Transformer Network for Multimodal Sarcasm Detection","author":"Tian Yuan","unstructured":"Yuan Tian, Nan Xu, Ruike Zhang, and Wenji Mao. 2023. Dynamic Routing Transformer Network for Multimodal Sarcasm Detection. In ACL. Association for Computational Linguistics, 2468--2480."},{"key":"e_1_3_2_1_38_1","volume-title":"Multimodal Sarcasm Target Identification in Tweets","author":"Wang Jiquan","unstructured":"Jiquan Wang, Lin Sun, Yi Liu, Meizhi Shao, and Zengwei Zheng. 2022. Multimodal Sarcasm Target Identification in Tweets. In ACL. Association for Computational Linguistics, 8164--8175."},{"key":"e_1_3_2_1_39_1","volume-title":"DIP: Dual Incongruity Perceiving Network for Sarcasm Detection","author":"Wen Changsong","year":"2023","unstructured":"Changsong Wen, Guoli Jia, and Jufeng Yang. 2023. DIP: Dual Incongruity Perceiving Network for Sarcasm Detection. In CVPR. IEEE, 2540--2550."},{"key":"e_1_3_2_1_40_1","doi-asserted-by":"crossref","unstructured":"Tao Xiong Peiran Zhang Hongbo Zhu and Yihui Yang. 2019. Sarcasm Detection with Self-matching Networks and Low-rank Bilinear Pooling. In WWW. ACM 2115--2124.","DOI":"10.1145\/3308558.3313735"},{"key":"e_1_3_2_1_41_1","volume-title":"Reasoning with Multimodal Sarcastic Tweets via Modeling Cross-Modality Contrast and Semantic Association","author":"Xu Nan","unstructured":"Nan Xu, Zhixiong Zeng, and Wenji Mao. 2020. Reasoning with Multimodal Sarcastic Tweets via Modeling Cross-Modality Contrast and Semantic Association. In ACL. Association for Computational Linguistics, 3777--3786."},{"key":"e_1_3_2_1_42_1","volume-title":"Improving Multimodal Named Entity Recognition via Entity Span Detection with Unified Multimodal Transformer","author":"Yu Jianfei","unstructured":"Jianfei Yu, Jing Jiang, Li Yang, and Rui Xia. 2020. Improving Multimodal Named Entity Recognition via Entity Span Detection with Unified Multimodal Transformer. In ACL. Association for Computational Linguistics, 3342--3352."},{"key":"e_1_3_2_1_43_1","volume-title":"Grounded Multimodal Named Entity Recognition on Social Media","author":"Yu Jianfei","unstructured":"Jianfei Yu, Ziyan Li, Jieming Wang, and Rui Xia. 2023. Grounded Multimodal Named Entity Recognition on Social Media. In ACL. Association for Computational Linguistics, 9141--9154."},{"key":"e_1_3_2_1_44_1","volume-title":"Tweet Sarcasm Detection Using Deep Neural Network","author":"Zhang Meishan","unstructured":"Meishan Zhang, Yue Zhang, and Guohong Fu. 2016. Tweet Sarcasm Detection Using Deep Neural Network. In COLING. Association for Computer Linguistics, 2449--2460."},{"key":"e_1_3_2_1_45_1","volume-title":"VinVL: Revisiting Visual Representations in Vision-Language Models","author":"Zhang Pengchuan","unstructured":"Pengchuan Zhang, Xiujun Li, Xiaowei Hu, Jianwei Yang, Lei Zhang, Lijuan Wang, Yejin Choi, and Jianfeng Gao. 2021. VinVL: Revisiting Visual Representations in Vision-Language Models. In CVPR. IEEE, 5579--5588."},{"key":"e_1_3_2_1_46_1","volume-title":"Adaptive Coattention Network for Named Entity Recognition in Tweets","author":"Zhang Qi","unstructured":"Qi Zhang, Jinlan Fu, Xiaoyu Liu, and Xuanjing Huang. 2018. Adaptive Coattention Network for Named Entity Recognition in Tweets. In AAAI. AAAI Press, 5674--5681."}],"event":{"name":"WWW '25: The ACM Web Conference 2025","location":"Sydney NSW Australia","acronym":"WWW '25","sponsor":["SIGWEB ACM Special Interest Group on Hypertext, Hypermedia, and Web"]},"container-title":["Proceedings of the ACM on Web Conference 2025"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3696410.3714570","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3696410.3714570","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,19]],"date-time":"2025-06-19T01:18:33Z","timestamp":1750295913000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3696410.3714570"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,4,22]]},"references-count":46,"alternative-id":["10.1145\/3696410.3714570","10.1145\/3696410"],"URL":"https:\/\/doi.org\/10.1145\/3696410.3714570","relation":{},"subject":[],"published":{"date-parts":[[2025,4,22]]},"assertion":[{"value":"2025-04-22","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}