{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,9,3]],"date-time":"2025-09-03T11:01:15Z","timestamp":1756897275621,"version":"3.41.0"},"publisher-location":"New York, NY, USA","reference-count":58,"publisher":"ACM","license":[{"start":{"date-parts":[[2024,10,21]],"date-time":"2024-10-21T00:00:00Z","timestamp":1729468800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.acm.org\/publications\/policies\/copyright_policy#Background"}],"funder":[{"DOI":"10.13039\/https:\/\/doi.org\/10.13039\/501100012226","name":"Fundamental Research Funds for the Central Universities","doi-asserted-by":"publisher","award":["2682024ZTPY055"],"award-info":[{"award-number":["2682024ZTPY055"]}],"id":[{"id":"10.13039\/https:\/\/doi.org\/10.13039\/501100012226","id-type":"DOI","asserted-by":"publisher"}]},{"name":"Youth Fund Project of Humanities and Social Science Research of Ministry of Education","award":["21YJCZH045"],"award-info":[{"award-number":["21YJCZH045"]}]},{"name":"National Natural Science Foundation of China Grant","award":["62106204"],"award-info":[{"award-number":["62106204"]}]},{"name":"Ministry of Education, Singapore, under its Academic Research Fund Tier 1","award":["023618-00001, RG99\/23"],"award-info":[{"award-number":["023618-00001, RG99\/23"]}]},{"name":"Natural Science Foundation Project of Sichuan Province","award":["2024NSFSC0504"],"award-info":[{"award-number":["2024NSFSC0504"]}]},{"name":"Natural Science Foundation of Sichuan under Grant","award":["2022NSFSC0911"],"award-info":[{"award-number":["2022NSFSC0911"]}]},{"name":"Frontier Cross Innovation Team Project of Southwest Jiaotong University under Grant","award":["YH1500112432297"],"award-info":[{"award-number":["YH1500112432297"]}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2024,10,21]]},"DOI":"10.1145\/3627673.3679524","type":"proceedings-article","created":{"date-parts":[[2024,10,20]],"date-time":"2024-10-20T19:34:21Z","timestamp":1729452861000},"page":"591-601","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":1,"title":["Progressive Multimodal Pivot Learning: Towards Semantic Discordance Understanding as Humans"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0009-0002-8162-3201","authenticated-orcid":false,"given":"Junlin","family":"Fang","sequence":"first","affiliation":[{"name":"School of Computing and Artificial Intelligence, Southwest Jiaotong University, Chengdu, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-5612-7818","authenticated-orcid":false,"given":"Wenya","family":"Wang","sequence":"additional","affiliation":[{"name":"School of Computer Science and Engineering, Nanyang Technological University, Singapore, Singapore"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-9648-0982","authenticated-orcid":false,"given":"Tianze","family":"Luo","sequence":"additional","affiliation":[{"name":"School of Computer Science and Engineering, Nanyang Technological University, Singapore, Singapore"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-9322-2777","authenticated-orcid":false,"given":"Yanyong","family":"Huang","sequence":"additional","affiliation":[{"name":"Joint Laboratory of Data Science and Business Intelligence, Southwestern University of Finance and Economics, Chengdu, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-1640-0992","authenticated-orcid":false,"given":"Fengmao","family":"Lv","sequence":"additional","affiliation":[{"name":"School of Computing and Artificial Intelligence, Southwest Jiaotong University, Chengdu, China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2024,10,21]]},"reference":[{"volume-title":"Multimodal Categorization of Crisis Events in Social Media","author":"Abavisani Mahdi","key":"e_1_3_2_1_1_1","unstructured":"Mahdi Abavisani, Liwei Wu, Shengli Hu, Joel R. Tetreault, and Alejandro Jaimes. 2020. Multimodal Categorization of Crisis Events in Social Media. In CVPR. Computer Vision Foundation \/ IEEE, 14667--14677."},{"volume-title":"CrisisMMD: Multimodal Twitter Datasets from Natural Disasters","author":"Alam Firoj","key":"e_1_3_2_1_2_1","unstructured":"Firoj Alam, Ferda Ofli, and Muhammad Imran. 2018. CrisisMMD: Multimodal Twitter Datasets from Natural Disasters. In ICWSM. AAAI Press, 465--473."},{"key":"e_1_3_2_1_3_1","volume-title":"Luis Espinosa Anke, and Leonardo Neves","author":"Barbieri Francesco","year":"2020","unstructured":"Francesco Barbieri, Jos\u00e9 Camacho-Collados, Luis Espinosa Anke, and Leonardo Neves. 2020. TweetEval: Unified Benchmark and Comparative Evaluation for Tweet Classification. In Findings of EMNLP. Association for Computational Linguistics, 1644--1650."},{"key":"e_1_3_2_1_4_1","doi-asserted-by":"publisher","DOI":"10.1016\/j.ipm.2022.103193"},{"key":"e_1_3_2_1_5_1","doi-asserted-by":"crossref","unstructured":"Feiyu Chen Zhengxiao Sun Deqiang Ouyang Xueliang Liu and Jie Shao. 2021. Learning What and When to Drop: Adaptive Multimodal and Contextual Dynamics for Emotion Recognition in Conversation. In MM. ACM 1064--1073.","DOI":"10.1145\/3474085.3475661"},{"key":"e_1_3_2_1_6_1","doi-asserted-by":"crossref","unstructured":"Yixuan Chen Dongsheng Li Peng Zhang Jie Sui Qin Lv Tun Lu and Li Shang. 2022. Cross-modal Ambiguity Learning for Multimodal Fake News Detection. In WWW. ACM 2897--2905.","DOI":"10.1145\/3485447.3511968"},{"volume-title":"Causal Intervention and Counterfactual Reasoning for Multi-modal Fake News Detection","author":"Chen Ziwei","key":"e_1_3_2_1_7_1","unstructured":"Ziwei Chen, Linmei Hu, Weixin Li, Yingxia Shao, and Liqiang Nie. 2023. Causal Intervention and Counterfactual Reasoning for Multi-modal Fake News Detection. In ACL. Association for Computational Linguistics, 627--638."},{"key":"e_1_3_2_1_8_1","volume-title":"KyungHyun Cho, and Yoshua Bengio.","author":"Chung Junyoung","year":"2014","unstructured":"Junyoung Chung, cCaglar G\u00fclccehre, KyungHyun Cho, and Yoshua Bengio. 2014. Empirical Evaluation of Gated Recurrent Neural Networks on Sequence Modeling. CoRR, Vol. abs\/1412.3555 (2014)."},{"volume-title":"Proceedings of ACL Workshop BlackboxNLP. Association for Computational Linguistics, 276--286","author":"Clark Kevin","key":"e_1_3_2_1_9_1","unstructured":"Kevin Clark, Urvashi Khandelwal, Omer Levy, and Christopher D. Manning. 2019. What Does BERT Look at? An Analysis of BERT's Attention. In Proceedings of ACL Workshop BlackboxNLP. Association for Computational Linguistics, 276--286."},{"key":"e_1_3_2_1_10_1","volume-title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","author":"Devlin Jacob","year":"2019","unstructured":"Jacob Devlin, Ming-Wei Chang, Kenton Lee, and Kristina Toutanova. 2019. BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. In NAACL. Association for Computational Linguistics, 4171--4186."},{"key":"e_1_3_2_1_11_1","unstructured":"Alexey Dosovitskiy Lucas Beyer Alexander Kolesnikov Dirk Weissenborn Xiaohua Zhai Thomas Unterthiner Mostafa Dehghani Matthias Minderer Georg Heigold Sylvain Gelly Jakob Uszkoreit and Neil Houlsby. 2021. An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale. In ICLR. OpenReview.net."},{"key":"e_1_3_2_1_12_1","volume-title":"Daylen Yang, Anna Rohrbach, Trevor Darrell, and Marcus Rohrbach.","author":"Fukui Akira","year":"2016","unstructured":"Akira Fukui, Dong Huk Park, Daylen Yang, Anna Rohrbach, Trevor Darrell, and Marcus Rohrbach. 2016. Multimodal Compact Bilinear Pooling for Visual Question Answering and Visual Grounding. In EMNLP. The Association for Computational Linguistics, 457--468."},{"volume-title":"Image and Text fusion for UPMC Food-101 using BERT and CNNs","author":"Gallo Ignazio","key":"e_1_3_2_1_13_1","unstructured":"Ignazio Gallo, Gianmarco Ria, Nicola Landro, and Riccardo La Grassa. 2020. Image and Text fusion for UPMC Food-101 using BERT and CNNs. In IVCNZ. IEEE, 1--6."},{"key":"e_1_3_2_1_14_1","doi-asserted-by":"crossref","unstructured":"Jian Huang Yanli Ji Yang Yang and Heng Tao Shen. 2023. Cross-modality Representation Interactive Learning for Multimodal Sentiment Analysis. In MM. ACM 426--434.","DOI":"10.1145\/3581783.3612295"},{"key":"e_1_3_2_1_15_1","volume-title":"Pixel-BERT: Aligning Image Pixels with Text by Deep Multi-Modal Transformers. CoRR","author":"Huang Zhicheng","year":"2020","unstructured":"Zhicheng Huang, Zhaoyang Zeng, Bei Liu, Dongmei Fu, and Jianlong Fu. 2020. Pixel-BERT: Aligning Image Pixels with Text by Deep Multi-Modal Transformers. CoRR, Vol. abs\/2004.00849 (2020). showeprint[arXiv]2004.00849 https:\/\/arxiv.org\/abs\/2004.00849"},{"volume-title":"What Does BERT Learn about the Structure of Language?","author":"Jawahar Ganesh","key":"e_1_3_2_1_16_1","unstructured":"Ganesh Jawahar, Benoit Sagot, and Djam\u00e9 Seddah. 2019. What Does BERT Learn about the Structure of Language?. In ACL. Association for Computational Linguistics, 3651--3657."},{"key":"e_1_3_2_1_17_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19827-4_41"},{"key":"e_1_3_2_1_18_1","volume-title":"Nazanin Rahnavard, Ajmal Mian, and Mubarak Shah.","author":"Karim Nazmul","year":"2022","unstructured":"Nazmul Karim, Mamshad Nayeem Rizve, Nazanin Rahnavard, Ajmal Mian, and Mubarak Shah. 2022. UNICON: Combating Label Noise Through Uniform Selection and Contrastive Learning. In CVPR. IEEE, 9666--9676."},{"key":"e_1_3_2_1_19_1","unstructured":"Douwe Kiela Suvrat Bhooshan Hamed Firooz and Davide Testuggine. 2019. Supervised Multimodal Bitransformers for Classifying Images and Text. In ViGIL."},{"key":"e_1_3_2_1_20_1","volume-title":"ICML (Proceedings of Machine Learning Research","volume":"5594","author":"Kim Wonjae","year":"2021","unstructured":"Wonjae Kim, Bokyung Son, and Ildoo Kim. 2021. ViLT: Vision-and-Language Transformer Without Convolution or Region Supervision. In ICML (Proceedings of Machine Learning Research, Vol. 139). PMLR, 5583--5594."},{"volume-title":"The Power of Scale for Parameter-Efficient Prompt Tuning","author":"Lester Brian","key":"e_1_3_2_1_21_1","unstructured":"Brian Lester, Rami Al-Rfou, and Noah Constant. 2021. The Power of Scale for Parameter-Efficient Prompt Tuning. In EMNLP. Association for Computational Linguistics, 3045--3059."},{"key":"e_1_3_2_1_22_1","volume-title":"BART: Denoising Sequence-to-Sequence Pre-training for Natural Language Generation, Translation, and Comprehension","author":"Lewis Mike","year":"2020","unstructured":"Mike Lewis, Yinhan Liu, Naman Goyal, Marjan Ghazvininejad, Abdelrahman Mohamed, Omer Levy, Veselin Stoyanov, and Luke Zettlemoyer. 2020. BART: Denoising Sequence-to-Sequence Pre-training for Natural Language Generation, Translation, and Comprehension. In ACL. Association for Computational Linguistics, 7871--7880."},{"key":"e_1_3_2_1_23_1","unstructured":"Junnan Li Ramprasaath R. Selvaraju Akhilesh Gotmare Shafiq R. Joty Caiming Xiong and Steven Chu-Hong Hoi. 2021. Align before Fuse: Vision and Language Representation Learning with Momentum Distillation. In NeurIPS. 9694--9705."},{"key":"e_1_3_2_1_24_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01830"},{"volume-title":"Selective-Supervised Contrastive Learning with Noisy Labels","author":"Li Shikun","key":"e_1_3_2_1_25_1","unstructured":"Shikun Li, Xiaobo Xia, Shiming Ge, and Tongliang Liu. 2022. Selective-Supervised Contrastive Learning with Noisy Labels. In CVPR. IEEE, 316--325."},{"volume-title":"Efficient Multimodal Fusion via Interactive Prompting","author":"Li Yaowei","key":"e_1_3_2_1_26_1","unstructured":"Yaowei Li, Ruijie Quan, Linchao Zhu, and Yi Yang. 2023. Efficient Multimodal Fusion via Interactive Prompting. In CVPR. IEEE, 2604--2613."},{"volume-title":"Decoupled Multimodal Distilling for Emotion Recognition","author":"Li Yong","key":"e_1_3_2_1_27_1","unstructured":"Yong Li, Yuanzhi Wang, and Zhen Cui. 2023. Decoupled Multimodal Distilling for Emotion Recognition. In CVPR. IEEE, 6631--6640."},{"key":"e_1_3_2_1_28_1","doi-asserted-by":"crossref","unstructured":"Zhangming Li Shengsheng Qian Jie Cao Quan Fang and Changsheng Xu. 2022. Adaptive Transformer-Based Conditioned Variational Autoencoder for Incomplete Social Event Classification. In MM. ACM 1698--1707.","DOI":"10.1145\/3503161.3548128"},{"key":"e_1_3_2_1_29_1","doi-asserted-by":"crossref","unstructured":"Bin Liang Chenwei Lou Xiang Li Min Yang Lin Gui Yulan He Wenjie Pei and Ruifeng Xu. 2022. Multi-Modal Sarcasm Detection via Cross-Modal Graph Convolutional Network. In ACL. 1767--1777.","DOI":"10.18653\/v1\/2022.acl-long.124"},{"volume-title":"Modular and Parameter-Efficient Multimodal Fusion with Prompting","author":"Liang Sheng","key":"e_1_3_2_1_30_1","unstructured":"Sheng Liang, Mengjie Zhao, and Hinrich Sch\u00fctze. 2022. Modular and Parameter-Efficient Multimodal Fusion with Prompting. In Findings of ACL. Association for Computational Linguistics, 2976--2985."},{"volume-title":"Expanding Large Pre-trained Unimodal Models with Multimodal Information Injection for Image-Text Multimodal Classification","author":"Liang Tao","key":"e_1_3_2_1_31_1","unstructured":"Tao Liang, Guosheng Lin, Mingyang Wan, Tianrui Li, Guojun Ma, and Fengmao Lv. 2022. Expanding Large Pre-trained Unimodal Models with Multimodal Information Injection for Image-Text Multimodal Classification. In CVPR. IEEE, 15471--15480."},{"volume-title":"Graph Matching with Bi-level Noisy Correspondence","author":"Lin Yijie","key":"e_1_3_2_1_32_1","unstructured":"Yijie Lin, Mouxing Yang, Jun Yu, Peng Hu, Changqing Zhang, and Xi Peng. 2023. Graph Matching with Bi-level Noisy Correspondence. In ICCV. IEEE, 23305--23314."},{"key":"e_1_3_2_1_33_1","unstructured":"Haotian Liu Chunyuan Li Qingyang Wu and Yong Jae Lee. 2023. Visual Instruction Tuning. In NeurIPS."},{"key":"e_1_3_2_1_34_1","doi-asserted-by":"crossref","unstructured":"Hui Liu Wenya Wang and Haoliang Li. 2022. Towards Multi-Modal Sarcasm Detection via Hierarchical Congruity Modeling with Knowledge Enhancement. In EMNLP. 4995--5006.","DOI":"10.18653\/v1\/2022.emnlp-main.333"},{"key":"e_1_3_2_1_35_1","volume-title":"ICML (Proceedings of Machine Learning Research","volume":"14172","author":"Liu Sheng","year":"2022","unstructured":"Sheng Liu, Zhihui Zhu, Qing Qu, and Chong You. 2022. Robust Training under Label Noise by Over-parameterization. In ICML (Proceedings of Machine Learning Research, Vol. 162). PMLR, 14153--14172."},{"key":"e_1_3_2_1_36_1","volume-title":"Visual Attention Model for Name Tagging in Multimodal Social Media","author":"Lu Di","year":"1990","unstructured":"Di Lu, Leonardo Neves, Vitor Carvalho, Ning Zhang, and Heng Ji. 2018. Visual Attention Model for Name Tagging in Multimodal Social Media. In ACL. Association for Computational Linguistics, 1990--1999."},{"key":"e_1_3_2_1_37_1","unstructured":"Jiasen Lu Dhruv Batra Devi Parikh and Stefan Lee. 2019. ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks. In NeurIPS. 13--23."},{"key":"e_1_3_2_1_38_1","unstructured":"Arsha Nagrani Shan Yang Anurag Arnab Aren Jansen Cordelia Schmid and Chen Sun. 2021. Attention Bottlenecks for Multimodal Fusion. In NeurIPS. 14200--14213."},{"key":"e_1_3_2_1_40_1","volume-title":"Gonz\u00e1lez","author":"Arevalo Ovalle John Edison","year":"2017","unstructured":"John Edison Arevalo Ovalle, Thamar Solorio, Manuel Montes-y-G\u00f3mez, and Fabio A. Gonz\u00e1lez. 2017. Gated Multimodal Units for Information Fusion. In ICLR. OpenReview.net."},{"key":"e_1_3_2_1_41_1","unstructured":"Hongliang Pan Zheng Lin Peng Fu Yatao Qi and Weiping Wang. 2020. Modeling Intra and Inter-modality Incongruity for Multi-Modal Sarcasm Detection. In Findings of EMNLP. 1383--1392."},{"key":"e_1_3_2_1_42_1","volume-title":"Patel","author":"Pramanick Shraman","year":"2022","unstructured":"Shraman Pramanick, Aniket Roy, and Vishal M. Patel. 2022. Multimodal Learning using Optimal Transport for Sarcasm and Humor Detection. In WACV. IEEE, 546--556."},{"key":"e_1_3_2_1_43_1","volume-title":"FLAVA: A Foundational Language And Vision Alignment Model","author":"Singh Amanpreet","year":"2022","unstructured":"Amanpreet Singh, Ronghang Hu, Vedanuj Goswami, Guillaume Couairon, Wojciech Galuba, Marcus Rohrbach, and Douwe Kiela. 2022. FLAVA: A Foundational Language And Vision Alignment Model. In CVPR. IEEE, 15617--15629."},{"key":"e_1_3_2_1_44_1","unstructured":"Iustin Sirbu Tiberiu Sosea Cornelia Caragea Doina Caragea and Traian Rebedea. 2022. Multimodal Semi-supervised Learning for Disaster Tweet Classification. In COLING. International Committee on Computational Linguistics 2711--2723."},{"key":"e_1_3_2_1_45_1","unstructured":"Weijie Su Xizhou Zhu Yue Cao Bin Li Lewei Lu Furu Wei and Jifeng Dai. 2020. VL-BERT: Pre-training of Generic Visual-Linguistic Representations. In ICLR. OpenReview.net."},{"volume-title":"RpBERT: A Text-image Relation Propagation-based BERT Model for Multimodal NER","author":"Sun Lin","key":"e_1_3_2_1_46_1","unstructured":"Lin Sun, Jiquan Wang, Kai Zhang, Yindu Su, and Fangsheng Weng. 2021. RpBERT: A Text-image Relation Propagation-based BERT Model for Multimodal NER. In AAAI. AAAI Press, 13860--13868."},{"key":"e_1_3_2_1_47_1","volume-title":"Inconsistency Matters: A Knowledge-guided Dual-inconsistency Network for Multi-modal Rumor Detection","author":"Sun Mengzhu","year":"2021","unstructured":"Mengzhu Sun, Xi Zhang, Jianqiang Ma, and Yazheng Liu. 2021. Inconsistency Matters: A Knowledge-guided Dual-inconsistency Network for Multi-modal Rumor Detection. In Findings of EMNLP. Association for Computational Linguistics, 1412--1423."},{"key":"e_1_3_2_1_48_1","unstructured":"Siwei Wang Xinwang Liu Suyuan Liu Jiaqi Jin Wenxuan Tu Xinzhong Zhu and En Zhu. 2022. Align then Fusion: Generalized Large-scale Multi-view Clustering with Anchor Matching Correspondences. In NeurIPS."},{"key":"e_1_3_2_1_49_1","volume-title":"CogVLM: Visual Expert for Pretrained Language Models. CoRR","author":"Wang Weihan","year":"2023","unstructured":"Weihan Wang, Qingsong Lv, Wenmeng Yu, Wenyi Hong, Ji Qi, Yan Wang, Junhui Ji, Zhuoyi Yang, Lei Zhao, Xixuan Song, Jiazheng Xu, Bin Xu, Juanzi Li, Yuxiao Dong, Ming Ding, and Jie Tang. 2023. CogVLM: Visual Expert for Pretrained Language Models. CoRR, Vol. abs\/2311.03079 (2023)."},{"volume-title":"Combine Early and Late Fusion Together: A Hybrid Fusion Framework for Image-Text Matching","author":"Wang Yifan","key":"e_1_3_2_1_50_1","unstructured":"Yifan Wang, Xing Xu, Wei Yu, Ruicong Xu, Zuo Cao, and Heng Tao Shen. 2021. Combine Early and Late Fusion Together: A Hybrid Fusion Framework for Image-Text Matching. In ICME. IEEE, 1--6."},{"key":"e_1_3_2_1_51_1","doi-asserted-by":"crossref","unstructured":"Junfei Wu Qiang Liu Weizhi Xu and Shu Wu. 2022. Bias Mitigation for Evidence-aware Fake News Detection by Causal Intervention. In SIGIR. ACM 2308--2313.","DOI":"10.1145\/3477495.3531850"},{"volume-title":"Grounded Image Text Matching with Mismatched Relation Reasoning","author":"Wu Yu","key":"e_1_3_2_1_52_1","unstructured":"Yu Wu, Yana Wei, Haozhe Wang, Yongfei Liu, Sibei Yang, and Xuming He. 2023. Grounded Image Text Matching with Mismatched Relation Reasoning. In ICCV. IEEE, 2964--2975."},{"volume-title":"Multi-Tensor Fusion Network with Hybrid Attention for Multimodal Sentiment Analysis","author":"Xue Haiwei","key":"e_1_3_2_1_53_1","unstructured":"Haiwei Xue, Xueming Yan, Shengyi Jiang, and Helang Lai. 2020. Multi-Tensor Fusion Network with Hybrid Attention for Multimodal Sentiment Analysis. In ICMLC. IEEE, 169--174."},{"volume-title":"Learning with Twin Noisy Labels for Visible-Infrared Person Re-Identification","author":"Yang Mouxing","key":"e_1_3_2_1_54_1","unstructured":"Mouxing Yang, Zhenyu Huang, Peng Hu, Taihao Li, Jiancheng Lv, and Xi Peng. 2022. Learning with Twin Noisy Labels for Visible-Infrared Person Re-Identification. In CVPR. IEEE, 14288--14297."},{"key":"e_1_3_2_1_55_1","doi-asserted-by":"crossref","unstructured":"Jianfei Yu and Jing Jiang. 2019. Adapting BERT for Target-Oriented Multimodal Sentiment Classification. In IJCAI. ijcai.org 5408--5414.","DOI":"10.24963\/ijcai.2019\/751"},{"volume-title":"Learning Modality-Specific Representations with Self-Supervised Multi-Task Learning for Multimodal Sentiment Analysis","author":"Yu Wenmeng","key":"e_1_3_2_1_56_1","unstructured":"Wenmeng Yu, Hua Xu, Ziqi Yuan, and Jiele Wu. 2021. Learning Modality-Specific Representations with Self-Supervised Multi-Task Learning for Multimodal Sentiment Analysis. In AAAI. AAAI Press, 10790--10797."},{"key":"e_1_3_2_1_57_1","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2023.3267882"},{"volume-title":"Adaptive Co-attention Network for Named Entity Recognition in Tweets","author":"Zhang Qi","key":"e_1_3_2_1_58_1","unstructured":"Qi Zhang, Jinlan Fu, Xiaoyu Liu, and Xuanjing Huang. 2018. Adaptive Co-attention Network for Named Entity Recognition in Tweets. In AAAI. AAAI Press, 5674--5681."},{"key":"e_1_3_2_1_59_1","doi-asserted-by":"crossref","unstructured":"Yongchun Zhu Qiang Sheng Juan Cao Shuokai Li Danding Wang and Fuzhen Zhuang. 2022. Generalizing to the Future: Mitigating Entity Bias in Fake News Detection. In SIGIR. ACM 2120--2125.","DOI":"10.1145\/3477495.3531816"}],"event":{"name":"CIKM '24: The 33rd ACM International Conference on Information and Knowledge Management","sponsor":["SIGIR ACM Special Interest Group on Information Retrieval"],"location":"Boise ID USA","acronym":"CIKM '24"},"container-title":["Proceedings of the 33rd ACM International Conference on Information and Knowledge Management"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3627673.3679524","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3627673.3679524","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,19]],"date-time":"2025-06-19T00:03:29Z","timestamp":1750291409000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3627673.3679524"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,10,21]]},"references-count":58,"alternative-id":["10.1145\/3627673.3679524","10.1145\/3627673"],"URL":"https:\/\/doi.org\/10.1145\/3627673.3679524","relation":{},"subject":[],"published":{"date-parts":[[2024,10,21]]},"assertion":[{"value":"2024-10-21","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}