{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,16]],"date-time":"2026-06-16T04:48:05Z","timestamp":1781585285568,"version":"3.54.5"},"publisher-location":"New York, NY, USA","reference-count":65,"publisher":"ACM","funder":[{"DOI":"10.13039\/501100012226","name":"Fundamental Research Funds for the Central Universities","doi-asserted-by":"publisher","award":["JZ2024HGTB0261"],"award-info":[{"award-number":["JZ2024HGTB0261"]}],"id":[{"id":"10.13039\/501100012226","id-type":"DOI","asserted-by":"publisher"}]},{"name":"NSFC","award":["62302140"],"award-info":[{"award-number":["62302140"]}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2025,10,27]]},"DOI":"10.1145\/3746027.3754951","type":"proceedings-article","created":{"date-parts":[[2025,10,25]],"date-time":"2025-10-25T05:56:43Z","timestamp":1761371803000},"page":"11308-11317","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":1,"title":["Beyond Artificial Misalignment: Detecting and Grounding Semantic-Coordinated Multimodal Manipulations"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0009-0000-0334-1669","authenticated-orcid":false,"given":"Jinjie","family":"Shen","sequence":"first","affiliation":[{"name":"Hefei University of Technology, Hefei, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-6596-8117","authenticated-orcid":false,"given":"Yaxiong","family":"Wang","sequence":"additional","affiliation":[{"name":"Hefei University of Technology, Hefei, Anhui, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-7546-9052","authenticated-orcid":false,"given":"Lechao","family":"Cheng","sequence":"additional","affiliation":[{"name":"Hefei University of Technology, Hefei, Anhui, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-2179-8301","authenticated-orcid":false,"given":"Nan","family":"Pu","sequence":"additional","affiliation":[{"name":"University of Trento, Trento, Trentino, Italy"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-8202-0544","authenticated-orcid":false,"given":"Zhun","family":"Zhong","sequence":"additional","affiliation":[{"name":"Hefei University of Technology, Hefei, Anhui, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"320","published-online":{"date-parts":[[2025,10,27]]},"reference":[{"key":"e_1_3_2_1_1_1","doi-asserted-by":"publisher","DOI":"10.48550\/ARXIV.2502.13923"},{"key":"e_1_3_2_1_2_1","first-page":"12466","article-title":"Good News, Everyone! Context driven entity-aware captioning for news images","author":"Biten Ali Furkan","year":"2019","unstructured":"Ali Furkan Biten, Lluis Gomez, Mar\u00e7al Rusi\u00f1ol, and Dimosthenis Karatzas. 2019. Good News, Everyone! Context driven entity-aware captioning for news images. In CVPR. 12466-12475.","journal-title":"CVPR."},{"key":"e_1_3_2_1_3_1","doi-asserted-by":"publisher","DOI":"10.1016\/j.imavis.2023.104771"},{"key":"e_1_3_2_1_4_1","first-page":"2003","article-title":"SimSwap","author":"Chen Renwang","year":"2020","unstructured":"Renwang Chen, Xuanhong Chen, Bingbing Ni, and Yanhao Ge. 2020. SimSwap: An Efficient Framework For High Fidelity Face Swapping. In ACM MM. 2003-2011.","journal-title":"An Efficient Framework For High Fidelity Face Swapping. In ACM MM."},{"key":"e_1_3_2_1_5_1","first-page":"345","article-title":"Unveiling the Impact of Image Transformations on Deepfake Detection","author":"Cocchi Federico","year":"2023","unstructured":"Federico Cocchi, Lorenzo Baraldi, Samuele Poppi, and Marcella Cornia. 2023. Unveiling the Impact of Image Transformations on Deepfake Detection: An Experimental Analysis. In ICIAP. 345-356.","journal-title":"An Experimental Analysis. In ICIAP."},{"key":"e_1_3_2_1_6_1","unstructured":"Alexey Dosovitskiy Lucas Beyer Alexander Kolesnikov Dirk Weissenborn Xiaohua Zhai Thomas Unterthiner Mostafa Dehghani Matthias Minderer Georg Heigold Sylvain Gelly Jakob Uszkoreit and Neil Houlsby. 2021. An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale. In ICLR."},{"key":"e_1_3_2_1_7_1","unstructured":"Tarik Dzanic Karan Shah and Freddie Witherden. 2020. Fourier spectrum discrepancies in deep network generated images. In NeurIPS."},{"key":"e_1_3_2_1_8_1","volume-title":"How Facebook Failed to Stop Misinformation in India. The New York Times (October","author":"Frenkel Sheera","year":"2021","unstructured":"Sheera Frenkel and Cecilia Kang. 2021. How Facebook Failed to Stop Misinformation in India. The New York Times (October 2021)."},{"key":"e_1_3_2_1_9_1","first-page":"3404","article-title":"Information Bottleneck Disentanglement for Identity Swapping","author":"Gao Gege","year":"2021","unstructured":"Gege Gao, Huaibo Huang, Chaoyou Fu, Zhaoyang Li, and Ran He. 2021. Information Bottleneck Disentanglement for Identity Swapping. In CVPR. 3404-3413.","journal-title":"CVPR."},{"key":"e_1_3_2_1_10_1","unstructured":"Google. 2024. Google Search API. https:\/\/developers.google.com\/custom-search\/v1\/overview."},{"key":"e_1_3_2_1_11_1","doi-asserted-by":"publisher","DOI":"10.48550\/ARXIV.2505.07062"},{"key":"e_1_3_2_1_12_1","volume-title":"A 'Deepfake' President Trump Mocked Facebook and Mark Zuckerberg in a Video That Went Viral. The Washington Post (June","author":"Harwell Drew","year":"2019","unstructured":"Drew Harwell. 2019. A 'Deepfake' President Trump Mocked Facebook and Mark Zuckerberg in a Video That Went Viral. The Washington Post (June 2019)."},{"key":"e_1_3_2_1_13_1","first-page":"6316","article-title":"Adversarial Text to Continuous Image Generation","author":"Haydarov Kilichbek","year":"2024","unstructured":"Kilichbek Haydarov, Aashiq Muhamed, Xiaoqian Shen, Jovana Lazarevic, Ivan Skorokhodov, Chamuditha Jayanga Galappaththige, and Mohamed Elhoseiny. 2024. Adversarial Text to Continuous Image Generation. In CVPR. 6316-6326.","journal-title":"CVPR."},{"key":"e_1_3_2_1_14_1","first-page":"9726","article-title":"Momentum Contrast for Unsupervised Visual Representation Learning","author":"He Kaiming","year":"2020","unstructured":"Kaiming He, Haoqi Fan, Yuxin Wu, Saining Xie, and Ross B. Girshick. 2020. Momentum Contrast for Unsupervised Visual Representation Learning. In CVPR. 9726-9735.","journal-title":"CVPR."},{"key":"e_1_3_2_1_15_1","first-page":"770","article-title":"Deep Residual Learning for Image Recognition","author":"He Kaiming","year":"2016","unstructured":"Kaiming He, Xiangyu Zhang, Shaoqing Ren, and Jian Sun. 2016. Deep Residual Learning for Image Recognition. In CVPR. 770-778.","journal-title":"CVPR."},{"key":"e_1_3_2_1_16_1","first-page":"16436","article-title":"MiRAGeNews","author":"Huang Runsheng","year":"2024","unstructured":"Runsheng Huang, Liam Dugan, Yue Yang, and Chris Callison-Burch. 2024. MiRAGeNews: Multimodal Realistic AI-Generated News Detection. In EMNLP. 16436-16448.","journal-title":"Multimodal Realistic AI-Generated News Detection. In EMNLP."},{"key":"e_1_3_2_1_17_1","first-page":"6458","article-title":"Frequency-aware Discriminative Feature Learning Supervised by Single-Center Loss for Face Forgery Detection","author":"Zhang Yongdong","year":"2021","unstructured":"JiamingLi, HongtaoXie, JiahongLi, ZhongyuanWang, and Yongdong Zhang. 2021. Frequency-aware Discriminative Feature Learning Supervised by Single-Center Loss for Face Forgery Detection. In CVPR. 6458-6467.","journal-title":"CVPR."},{"key":"e_1_3_2_1_18_1","first-page":"2889","article-title":"DeeperForensics-1.0","author":"Jiang Liming","year":"2020","unstructured":"Liming Jiang, Ren Li, Wayne Wu, Chen Qian, and Chen Change Loy. 2020a. DeeperForensics-1.0: A Large-Scale Dataset for Real-World Face Forgery Detection. In CVPR. 2889-2898.","journal-title":"A Large-Scale Dataset for Real-World Face Forgery Detection. In CVPR."},{"key":"e_1_3_2_1_19_1","first-page":"2889","article-title":"DeeperForensics-1.0","author":"Jiang Liming","year":"2020","unstructured":"Liming Jiang, Ren Li, Wayne Wu, Chen Qian, and Chen Change Loy. 2020b. DeeperForensics-1.0: A Large-Scale Dataset for Real-World Face Forgery Detection. In CVPR. 2889-2898.","journal-title":"A Large-Scale Dataset for Real-World Face Forgery Detection. In CVPR."},{"key":"e_1_3_2_1_20_1","doi-asserted-by":"publisher","DOI":"10.1145\/3626772.3657823"},{"key":"e_1_3_2_1_21_1","doi-asserted-by":"publisher","unstructured":"Aishwarya Kamath Johan Ferret Shreya Pathak Nino Vieillard Ramona Merhej Sarah Perrin Tatiana Matejovicova Alexandre Ram\u00e9 Morgane Rivi\u00e8re Louis Rouillard Thomas Mesnard Geoffrey Cideron Jean-Bastien Grill Sabela Ramos Edouard Yvinec Michelle Casbon Etienne Pot Ivo Penchev Ga\u00ebl Liu Francesco Visin Kathleen Kenealy Lucas Beyer Xiaohai Zhai Anton Tsitsulin R\u00f3bert Busa-Fekete Alex Feng Noveen Sachdeva Benjamin Coleman Yi Gao Basil Mustafa Iain Barr Emilio Parisotto David Tian Matan Eyal Colin Cherry Jan-Thorsten Peter Danila Sinopalnikov Surya Bhupatiraju Rishabh Agarwal Mehran Kazemi Dan Malkin Ravin Kumar David Vilar Idan Brusilovsky Jiaming Luo Andreas Steiner Abe Friesen Abhanshu Sharma Abheesht Sharma Adi Mayrav Gilady Adrian Goedeckemeyer Alaa Saade Alexander Kolesnikov Alexei Bendebury Alvin Abdagic Amit Vadi Andr\u00e1s Gy\u00f6rgy Andr\u00e9 Susano Pinto Anil Das Ankur Bapna Antoine Miech Antoine Yang Antonia Paterson Ashish Shenoy Ayan Chakrabarti Bilal Piot Bo Wu Bobak Shahriari Bryce Petrini Charlie Chen Charline Le Lan Christopher A. Choquette-Choo CJ Carey Cormac Brick Daniel Deutsch Danielle Eisenbud Dee Cattle Derek Cheng Dimitris Paparas Divyashree Shivakumar Sreepathihalli Doug Reid Dustin Tran Dustin Zelle Eric Noland Erwin Huizenga Eugene Kharitonov Frederick Liu Gagik Amirkhanyan Glenn Cameron Hadi Hashemi Hanna Klimczak-Plucinska Harman Singh Harsh Mehta Harshal Tushar Lehri Hussein Hazimeh Ian Ballantyne Idan Szpektor and Ivan Nardini. 2025. Gemma 3 Technical Report. CoRR Vol. abs\/2503.19786 (2025). doi:10.48550\/ARXIV.2503.19786 arXiv:2503.19786","DOI":"10.48550\/ARXIV.2503.19786"},{"key":"e_1_3_2_1_22_1","unstructured":"Wonjae Kim Bokyung Son and Ildoo Kim. 2021. ViLT: Vision-and-Language Transformer Without Convolution or Region Supervision. In ICML."},{"key":"e_1_3_2_1_23_1","first-page":"19730","article-title":"BLIP-2","author":"Li Junnan","year":"2023","unstructured":"Junnan Li, Dongxu Li, Silvio Savarese, and Steven C. H. Hoi. 2023. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models. In ICML. 19730-19742.","journal-title":"In ICML."},{"key":"e_1_3_2_1_24_1","first-page":"5060","article-title":"DSFD","author":"Li Jian","year":"2019","unstructured":"Jian Li, Yabiao Wang, Changan Wang, Ying Tai, Jianjun Qian, Jian Yang, Chengjie Wang, Jilin Li, and Feiyue Huang. 2019. DSFD: Dual Shot Face Detector. In CVPR. 5060-5069.","journal-title":"Dual Shot Face Detector. In CVPR."},{"key":"e_1_3_2_1_25_1","first-page":"5001","article-title":"Face X-ray for More General Face Forgery Detection","author":"Li Lingzhi","year":"2020","unstructured":"Lingzhi Li, Jianmin Bao, Ting Zhang, Hao Yang, Dong Chen, Fang Wen, and Baining Guo. 2020a. Face X-ray for More General Face Forgery Detection. In CVPR. 5001-6010.","journal-title":"CVPR."},{"key":"e_1_3_2_1_26_1","first-page":"3207","article-title":"Celeb-DF","author":"Li Yuezun","year":"2020","unstructured":"Yuezun Li, Xin Yang, Pu Sun, Honggang Qi, and Siwei Lyu. 2020b. Celeb-DF: A Large-scale Challenging Dataset for DeepFake Forensics. In CVPR. 3207-3216.","journal-title":"A Large-scale Challenging Dataset for DeepFake Forensics. In CVPR."},{"key":"e_1_3_2_1_27_1","first-page":"24142","article-title":"Generative Image Dynamics","author":"Li Zhengqi","year":"2024","unstructured":"Zhengqi Li, Richard Tucker, Noah Snavely, and Aleksander Holynski. 2024. Generative Image Dynamics. In CVPR. 24142-24153.","journal-title":"CVPR."},{"key":"e_1_3_2_1_28_1","first-page":"6761","article-title":"Visual News","author":"Liu Fuxiao","year":"2021","unstructured":"Fuxiao Liu, Yinghan Wang, Tianlu Wang, and Vicente Ordonez. 2021. Visual News: Benchmark and Challenges in News Image Captioning. In EMNLP. 6761-6771.","journal-title":"Benchmark and Challenges in News Image Captioning. In EMNLP."},{"key":"e_1_3_2_1_29_1","first-page":"10154","article-title":"FKA-Owl: Advancing Multimodal Fake News Detection through Knowledge-Augmented LVLMs","author":"Liu Xuannan","year":"2024","unstructured":"Xuannan Liu, Peipei Li, Huaibo Huang, Zekun Li, Xing Cui, Jiahao Liang, Lixiong Qin, Weihong Deng, and Zhaofeng He. 2024. FKA-Owl: Advancing Multimodal Fake News Detection through Knowledge-Augmented LVLMs. In ACM MM. 10154-10163.","journal-title":"ACM MM."},{"key":"e_1_3_2_1_30_1","first-page":"16167","article-title":"COCO","author":"Liu Xiaoming","year":"2023","unstructured":"Xiaoming Liu, Zhaohan Zhang, Yichen Wang, Hang Pu, Yu Lan, and Chao Shen. 2023. COCO: Coherence-Enhanced Machine-Generated Text Detection Under Low Resource With Contrastive Learning. In EMNLP. 16167-16188.","journal-title":"In EMNLP."},{"key":"e_1_3_2_1_31_1","first-page":"448","article-title":"Detecting Images Generated by Deep Diffusion Models using their Local Intrinsic Dimensionality","author":"Lorenz Peter","year":"2023","unstructured":"Peter Lorenz, Ricard L. Durall1, and Janis Keuper. 2023. Detecting Images Generated by Deep Diffusion Models using their Local Intrinsic Dimensionality. In ICCV. 448-459.","journal-title":"ICCV."},{"key":"e_1_3_2_1_32_1","unstructured":"Zeyu Lu Di Huang Lei Bai Jingjing Qu Chengyue Wu Xihui Liu and Wanli Ouyang. 2023. Seeing is not always believing: benchmarking human and model perception of AI-generated images. In NeurIPS."},{"key":"e_1_3_2_1_33_1","first-page":"6801","article-title":"NewsCLIPpings: Automatic Generation of Out-of-Context Multimodal Media","author":"Luo Grace","year":"2021","unstructured":"Grace Luo, Trevor Darrell, and Anna Rohrbach. 2021. NewsCLIPpings: Automatic Generation of Out-of-Context Multimodal Media. In EMNLP. 6801-6817.","journal-title":"EMNLP."},{"key":"e_1_3_2_1_34_1","first-page":"24950","article-title":"DetectGPT: Zero-Shot Machine-Generated Text Detection using Probability Curvature","author":"Mitchell Eric","year":"2023","unstructured":"Eric Mitchell, Yoonho Lee, Alexander Khazatsky, Christopher D. Manning, and Chelsea Finn. 2023. DetectGPT: Zero-Shot Machine-Generated Text Detection using Probability Curvature. In ICML. 24950-24962.","journal-title":"ICML."},{"key":"e_1_3_2_1_35_1","first-page":"1","article-title":"Unmasking The Artist","author":"Nguyen Minh-Quang","year":"2023","unstructured":"Minh-Quang Nguyen, Khanh-Duy Ho, Hoang-Minh Nguyen, Canh-Minh Tu, Minh-Triet Tran, and Trong-Le Do. 2023. Unmasking The Artist: Discriminating Human-Drawn And AI-Generated Human Face Art Through Facial Feature Analysis. 1-6.","journal-title":"Discriminating Human-Drawn And AI-Generated Human Face Art Through Facial Feature Analysis."},{"key":"e_1_3_2_1_36_1","first-page":"24480","article-title":"Towards Universal Fake Image Detectors that Generalize Across Generative Models","author":"Ojha Utkarsh","year":"2023","unstructured":"Utkarsh Ojha, Yuheng Li, and Yong Jae Lee. 2023. Towards Universal Fake Image Detectors that Generalize Across Generative Models. In CVPR. 24480-24489.","journal-title":"CVPR."},{"key":"e_1_3_2_1_37_1","first-page":"2085","article-title":"StyleCLIP: Text-Driven Manipulation of StyleGAN Imagery","author":"Patashnik Or","year":"2021","unstructured":"Or Patashnik, Zongze Wu, Eli Shechtman, Daniel Cohen-Or, and Dani Lischinski. 2021. StyleCLIP: Text-Driven Manipulation of StyleGAN Imagery. In ICCV. 2085-2094.","journal-title":"ICCV."},{"key":"e_1_3_2_1_38_1","first-page":"13052","article-title":"SNIFFER","author":"Qi Peng","year":"2024","unstructured":"Peng Qi, Zehong Yan, Wynne Hsu, and Mong Li Lee. 2024. SNIFFER: Multimodal Large Language Model for Explainable Out-of-Context Misinformation Detection. In CVPR. 13052-13062.","journal-title":"In CVPR."},{"key":"e_1_3_2_1_39_1","first-page":"153","article-title":"Hierarchical multi-modal contextual attention network for fake news detection","author":"Qian Shengsheng","year":"2021","unstructured":"Shengsheng Qian, Jinguang Wang, Jun Hu, Quan Fang, and Changsheng Xu., 2021. Hierarchical multi-modal contextual attention network for fake news detection.. In SIGIR. 153-162.","journal-title":"SIGIR."},{"key":"e_1_3_2_1_40_1","first-page":"86","article-title":"Detecting and re- covering sequential deepfake manipulation","author":"Qian Yuyang","year":"2022","unstructured":"Yuyang Qian, Guojun Yin, Lu Sheng, Zixuan Chen, and Jing Shao. 2022. Detecting and re- covering sequential deepfake manipulation.. In ECCV. 86-103.","journal-title":"ECCV."},{"key":"e_1_3_2_1_41_1","first-page":"8748","article-title":"Learning Transferable Visual Models From Natural Language Supervision","author":"Radford Alec","year":"2021","unstructured":"Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Sandhini Agarwal Gabriel Goh, Girish Sastry, Amanda Askell, Pamela Mishkin, Gretchen Krueger Jack Clark, and Ilya Sutskever. 2021. Learning Transferable Visual Models From Natural Language Supervision. In ICML. 8748-8763.","journal-title":"ICML."},{"key":"e_1_3_2_1_42_1","unstructured":"Meta AI Research. 2025. Llama 3.2 Model. https:\/\/llama.meta.com\/llama3.2."},{"key":"e_1_3_2_1_43_1","first-page":"658","article-title":"Generalized Intersection Over Union: A Metric and a Loss for Bounding Box Regression","author":"Rezatofighi Hamid","year":"2019","unstructured":"Hamid Rezatofighi, Nathan Tsoi, JunYoung Gwak, Amir Sadeghian, Ian D. Reid, and Silvio Savarese. 2019. Generalized Intersection Over Union: A Metric and a Loss for Bounding Box Regression. In CVPR. 658-666.","journal-title":"CVPR."},{"key":"e_1_3_2_1_44_1","volume-title":"How Facebook and YouTube Spread False 'Plandemic' Video. The New York Times (May","author":"Satariano Adam","year":"2020","unstructured":"Adam Satariano and Davey Alba. 2020. How Facebook and YouTube Spread False 'Plandemic' Video. The New York Times (May 2020)."},{"key":"e_1_3_2_1_45_1","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v34i07.6873"},{"key":"e_1_3_2_1_46_1","doi-asserted-by":"crossref","unstructured":"Rui Shao Tianxing Wu and Ziwei Liu. 2022. Detecting and re- covering sequential deepfake manipulation.. In ECCV.","DOI":"10.1007\/978-3-031-19778-9_41"},{"key":"e_1_3_2_1_47_1","first-page":"6904","article-title":"Detecting and Grounding Multi-Modal Media Manipulation","author":"Shao Rui","year":"2023","unstructured":"Rui Shao, Tianxing Wu, and Ziwei Liu. 2023. Detecting and Grounding Multi-Modal Media Manipulation. In CVPR. 6904-6913.","journal-title":"CVPR."},{"key":"e_1_3_2_1_48_1","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2024.3367749"},{"key":"e_1_3_2_1_49_1","first-page":"22","article-title":"Fake News Detection on Social Media: A Data Mining Perspective","author":"Shu Kai","year":"2017","unstructured":"Kai Shu, Amy Sliva, Suhang Wang, Jiliang Tang, and Huan Liu. 2017. Fake News Detection on Social Media: A Data Mining Perspective.. In KDD. 22-36.","journal-title":"KDD."},{"key":"e_1_3_2_1_50_1","first-page":"4067","article-title":"Deep Image Fingerprint","author":"Sinitsa Sergey","year":"2024","unstructured":"Sergey Sinitsa and Ohad Fried. 2024. Deep Image Fingerprint: Towards Low Budget Synthetic Image Detection and Model Lineage Analysis. In WACV. 4067-4076.","journal-title":"In WACV."},{"key":"e_1_3_2_1_51_1","doi-asserted-by":"publisher","unstructured":"Hugo Touvron Louis Martin Kevin Stone Peter Albert Amjad Almahairi Yasmine Babaei Nikolay Bashlykov Soumya Batra Prajjwal Bhargava Shruti Bhosale Dan Bikel Lukas Blecher Cristian Canton-Ferrer Moya Chen Guillem Cucurull David Esiobu Jude Fernandes Jeremy Fu Wenyin Fu Brian Fuller Cynthia Gao Vedanuj Goswami Naman Goyal Anthony Hartshorn Saghar Hosseini Rui Hou Hakan Inan Marcin Kardas Viktor Kerkez Madian Khabsa Isabel Kloumann Artem Korenev Punit Singh Koura Marie-Anne Lachaux Thibaut Lavril Jenya Lee Diana Liskovich Yinghai Lu Yuning Mao Xavier Martinet Todor Mihaylov Pushkar Mishra Igor Molybog Yixin Nie Andrew Poulton Jeremy Reizenstein Rashi Rungta Kalyan Saladi Alan Schelten Ruan Silva Eric Michael Smith Ranjan Subramanian Xiaoqing Ellen Tan Binh Tang Ross Taylor Adina Williams Jian Xiang Kuan Puxin Xu Zheng Yan Iliyan Zarov Yuchen Zhang Angela Fan Melanie Kambadur Sharan Narang Aur\u00e9lien Rodriguez Robert Stojnic Sergey Edunov and Thomas Scialom. 2023. Llama 2: Open Foundation and Fine-Tuned Chat Models. CoRR Vol. abs\/2307.09288 (2023). doi:10.48550\/ARXIV.2307.09288 arXiv:2307.09288","DOI":"10.48550\/ARXIV.2307.09288"},{"key":"e_1_3_2_1_52_1","first-page":"5998","article-title":"Attention is All you Need","author":"Vaswani Ashish","year":"2017","unstructured":"Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N. Gomez, Lukasz Kaiser, and Illia Polosukhin. 2017. Attention is All you Need. In NeurIPS. 5998-6008.","journal-title":"NeurIPS."},{"key":"e_1_3_2_1_53_1","doi-asserted-by":"publisher","DOI":"10.48550\/ARXIV.2409.12191"},{"key":"e_1_3_2_1_54_1","first-page":"11379","article-title":"High-Fidelity GAN Inversion for Image Attribute Editing","author":"Wang Tengfei","year":"2022","unstructured":"Tengfei Wang, Yong Zhang, Yanbo Fan, Jue Wang, and Qifeng Chen. 2022. High-Fidelity GAN Inversion for Image Attribute Editing. In CVPR. 11379-11388.","journal-title":"CVPR."},{"key":"e_1_3_2_1_55_1","first-page":"422","article-title":"Liar, Liar Pants on Fire","author":"Wang William Yang","year":"2017","unstructured":"William Yang Wang. 2017. Liar, Liar Pants on Fire : A New Benchmark Dataset for Fake News Detection. In ACL. 422-426.","journal-title":"A New Benchmark Dataset for Fake News Detection. In ACL."},{"key":"e_1_3_2_1_56_1","doi-asserted-by":"publisher","DOI":"10.1145\/3726302.3729902"},{"key":"e_1_3_2_1_57_1","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2020.3024822"},{"key":"e_1_3_2_1_58_1","doi-asserted-by":"publisher","DOI":"10.24963\/IJCAI.2019\/526"},{"key":"e_1_3_2_1_59_1","first-page":"22445","article-title":"DIRE for Diffusion-Generated Image Detection","author":"Wang Zhendong","year":"2023","unstructured":"Zhendong Wang, Jianmin Bao, Wengang Zhou, Weilun Wang, Hezhen Hu, Hong Chen, and Houqiang Li. 2023. DIRE for Diffusion-Generated Image Detection. In ICCV. 22445-22455.","journal-title":"ICCV."},{"key":"e_1_3_2_1_60_1","doi-asserted-by":"publisher","DOI":"10.48550\/ARXIV.2412.15115"},{"key":"e_1_3_2_1_61_1","first-page":"2092","article-title":"Robust Multi-bit Natural Language Watermarking through Invariant Features","author":"Yoo KiYoon","year":"2023","unstructured":"KiYoon Yoo, Wonhyuk Ahn, Jiho Jang, and Nojun Kwak. 2023. Robust Multi-bit Natural Language Watermarking through Invariant Features. In ACL. 2092-2115.","journal-title":"ACL."},{"key":"e_1_3_2_1_62_1","first-page":"25669","article-title":"Scaling Up to Excellence","author":"Yu Fanghua","year":"2024","unstructured":"Fanghua Yu, Jinjin Gu, Zheyuan Li, Jinfan Hu, Xiangtao Kong, Xintao Wang, Jingwen He, Yu Qiao, and Chao Dong. 2024. Scaling Up to Excellence: Practicing Model Scaling for Photo-Realistic Image Restoration In the Wild. In CVPR. 25669-25680.","journal-title":"In CVPR."},{"key":"e_1_3_2_1_63_1","volume-title":"ASAP: Advancing Semantic Alignment Promotes Multi-Modal Manipulation Detecting and Grounding. In IEEE\/CVF Conference on Computer Vision and Pattern Recognition, CVPR 2025","author":"Zhang Zhenxing","year":"2025","unstructured":"Zhenxing Zhang, Yaxiong Wang, Lechao Cheng, Zhun Zhong, Dan Guo, and Meng Wang. 2025. ASAP: Advancing Semantic Alignment Promotes Multi-Modal Manipulation Detecting and Grounding. In IEEE\/CVF Conference on Computer Vision and Pattern Recognition, CVPR 2025, Nashville, TN, USA, June 11-15, 2025. Computer Vision Foundation \/ IEEE, 4005-4014. https:\/\/openaccess.thecvf.com\/content\/CVPR2025\/html\/Zhang_ASAP_Advancing_Semantic_Alignment_Promotes_Multi-Modal_Manipulation_Detecting_and_Grounding_CVPR_2025_paper.html"},{"key":"e_1_3_2_1_64_1","first-page":"5044","article-title":"Distillation-Resistant Watermarking for Model Protection in NLP","author":"Zhao Xuandong","year":"2022","unstructured":"Xuandong Zhao, Lei Li, and Yu-Xiang Wang. 2022. Distillation-Resistant Watermarking for Model Protection in NLP. In EMNLP. 5044-5055.","journal-title":"EMNLP."},{"key":"e_1_3_2_1_65_1","first-page":"5778","article-title":"Face Forensics in the Wild","author":"Zhou Tianfei","year":"2021","unstructured":"Tianfei Zhou, Wenguan Wang, Zhiyuan Liang, and Jianbing Shen. 2021. Face Forensics in the Wild. In CVPR. 5778-5788.","journal-title":"CVPR."}],"event":{"name":"MM '25: The 33rd ACM International Conference on Multimedia","location":"Dublin Ireland","acronym":"MM '25","sponsor":["SIGMM ACM Special Interest Group on Multimedia"]},"container-title":["Proceedings of the 33rd ACM International Conference on Multimedia"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3746027.3754951","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,12,10]],"date-time":"2025-12-10T04:06:42Z","timestamp":1765339602000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3746027.3754951"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,10,27]]},"references-count":65,"alternative-id":["10.1145\/3746027.3754951","10.1145\/3746027"],"URL":"https:\/\/doi.org\/10.1145\/3746027.3754951","relation":{},"subject":[],"published":{"date-parts":[[2025,10,27]]},"assertion":[{"value":"2025-10-27","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}