{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,25]],"date-time":"2026-06-25T02:37:05Z","timestamp":1782355025049,"version":"3.54.5"},"reference-count":110,"publisher":"IEEE","license":[{"start":{"date-parts":[[2025,10,19]],"date-time":"2025-10-19T00:00:00Z","timestamp":1760832000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2025,10,19]],"date-time":"2025-10-19T00:00:00Z","timestamp":1760832000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/501100014219","name":"National Science Fund for Distinguished Young Scholars","doi-asserted-by":"publisher","award":["62025603"],"award-info":[{"award-number":["62025603"]}],"id":[{"id":"10.13039\/501100014219","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["U21B2037,U22B2051,U23A20383,U21A20472,62176222,62176223,62176226,62072386,62072387,62072389,62002305,62272401"],"award-info":[{"award-number":["U21B2037,U22B2051,U23A20383,U21A20472,62176222,62176223,62176226,62072386,62072387,62072389,62002305,62272401"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100003392","name":"Natural Science Foundation of Fujian Province of China","doi-asserted-by":"publisher","award":["2021J06003,2022J06001"],"award-info":[{"award-number":["2021J06003,2022J06001"]}],"id":[{"id":"10.13039\/501100003392","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025,10,19]]},"DOI":"10.1109\/iccv51701.2025.01742","type":"proceedings-article","created":{"date-parts":[[2026,4,29]],"date-time":"2026-04-29T19:45:49Z","timestamp":1777491949000},"page":"18746-18758","source":"Crossref","is-referenced-by-count":3,"title":["Aigi-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models"],"prefix":"10.1109","author":[{"given":"Ziyin","family":"Zhou","sequence":"first","affiliation":[{"name":"Xiamen University,Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yunpeng","family":"Luo","sequence":"additional","affiliation":[{"name":"Tencent YouTu Lab"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yuanchen","family":"Wu","sequence":"additional","affiliation":[{"name":"Tencent YouTu Lab"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Ke","family":"Sun","sequence":"additional","affiliation":[{"name":"Xiamen University,Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jiayi","family":"Ji","sequence":"additional","affiliation":[{"name":"Xiamen University,Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Ke","family":"Yan","sequence":"additional","affiliation":[{"name":"Tencent YouTu Lab"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Shouhong","family":"Ding","sequence":"additional","affiliation":[{"name":"Tencent YouTu Lab"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xiaoshuai","family":"Sun","sequence":"additional","affiliation":[{"name":"Xiamen University,Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yunsheng","family":"Wu","sequence":"additional","affiliation":[{"name":"Tencent YouTu Lab"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Rongrong","family":"Ji","sequence":"additional","affiliation":[{"name":"Xiamen University,Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","article-title":"Gpt-4 technical report","author":"Achiam","year":"2023","journal-title":"arXiv preprint arXiv"},{"key":"ref2","volume-title":"AI@Meta. Llama 3 model card","year":"2024"},{"key":"ref3","first-page":"65","article-title":"Meteor: An automatic metric for mt evaluation with improved correlation with human judgments","volume-title":"Proceedings of the acl workshop on intrinsic and extrinsic evaluation measures for machine translation and\/or summarization","author":"Banerjee","year":"2005"},{"key":"ref4","article-title":"Black-Forest-Labs","volume-title":"Flux","year":"2024"},{"key":"ref5","article-title":"Antifakeprompt: Prompt-tuned vision-language models are fake image detectors","author":"Chang","year":"2023","journal-title":"arXiv preprint arXiv"},{"key":"ref6","article-title":"Drct: Diffusion reconstruction contrastive training towards universal detection of diffusion generated images","volume-title":"Fortyfirst International Conference on Machine Learning","author":"Chen"},{"key":"ref7","first-page":"7621","article-title":"DRCT: Diffusion reconstruction contrastive training towards universal detection of diffusion generated images","volume-title":"Proceedings of the 41st International Conference on Machine Learning","author":"Chen","year":"2024"},{"key":"ref8","article-title":"Mllm-as-a-judge: Assessing multimodal llm-as-a-judge with vision-language benchmark","volume-title":"Fortyfirst International Conference on Machine Learning","author":"Chen","year":"2024"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-73411-3_5"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.52202\/075280-0410"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.52202\/079017-3218"},{"key":"ref12","article-title":"Januspro: Unified multimodal understanding and generation with data and model scaling","author":"Chen","year":"2025","journal-title":"arXiv preprint arXiv"},{"key":"ref13","article-title":"X^{2} dfd: A framework for e X plainable and e X tendable deepfake detection","author":"Chen","year":"2024","journal-title":"arXiv preprint arXiv"},{"key":"ref14","article-title":"Diffusionface: Towards a comprehensive dataset for diffusion-based face forgery analysis","author":"Chen","year":"2024","journal-title":"arXiv preprint arXiv"},{"key":"ref15","article-title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","author":"Chen","year":"2024","journal-title":"arXiv preprint arXiv"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1007\/s11432-024-4231-5"},{"key":"ref17","article-title":"Chatbot arena: An open platform for evaluating 11 ms by human preference","volume-title":"Forty-first International Conference on Machine Learning","author":"Chiang","year":"2024"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/CVPRW63382.2024.00439"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.52202\/075280-2142"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.52202\/075280-2142"},{"key":"ref21","first-page":"8780","article-title":"Diffusion models beat gans on image synthesis","volume":"34","author":"Dhariwal","year":"2021","journal-title":"Advances in neural information processing systems"},{"key":"ref22","article-title":"Scaling rectified flow transformers for high-resolution image synthesis","volume-title":"Forty-first International Conference on Machine Learning","author":"Esser","year":"2024"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-73411-3_12"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-73411-3_12"},{"key":"ref25","first-page":"3247","article-title":"Leveraging frequency analysis for deep fake image recognition","volume-title":"International conference on machine learning","author":"Frank","year":"2020"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1109\/TIFS.2012.2190402"},{"key":"ref27","article-title":"Commonsense-t2i challenge: Can text-toimage generation models understand commonsense?","author":"Fu","year":"2024","journal-title":"arXiv preprint arXiv"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.5555\/2969033.2969125"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52734.2025.00019"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52734.2025.01467"},{"key":"ref31","article-title":"Wildfake: A large-scale challenging dataset for ai-generated images detection","author":"Hong","year":"2024","journal-title":"arXiv preprint arXiv"},{"key":"ref32","article-title":"Lora: Low-rank adaptation of large language models","author":"Hu","year":"2021","journal-title":"arXiv preprint arXiv"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52734.2025.02685"},{"key":"ref34","article-title":"Ffaa: Multimodal large language model based explainable open-world face forgery analysis assistant","author":"Huang","year":"2024","journal-title":"arXiv preprint arXiv"},{"key":"ref35","article-title":"Gpt-4o system card","author":"Hurst","year":"2024","journal-title":"arXiv preprint arXiv"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1109\/CVPRW63382.2024.00436"},{"key":"ref37","article-title":"Mistral 7b","volume":"abs\/2310.06825","author":"Qiaochu Jiang","year":"2023","journal-title":"ArXiv"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1109\/ICIP46576.2022.9897820"},{"key":"ref39","article-title":"How to distinguish ai-generated images from authentic photographs","author":"Kamali","year":"2024","journal-title":"arXiv preprint arXiv"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1145\/3706598.3713962"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51701.2025.01760"},{"key":"ref42","article-title":"Progressive growing of gans for improved quality, stability, and variation","author":"Karras","year":"2017","journal-title":"arXiv preprint arXiv"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00453"},{"key":"ref44","article-title":"Bi-lora: A vision-language approach for synthetic image detection","author":"Keita","year":"2024","journal-title":"arXiv preprint arXiv"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00371"},{"key":"ref46","first-page":"394","article-title":"Leveraging representations from intermediate encoder-blocks for synthetic image detection","volume-title":"European Conference on Computer Vision","author":"Koutlis","year":"2024"},{"key":"ref47","article-title":"Truthlens: Explainable deepfake detection for face manipulated and fully synthetic data","author":"Kundu","year":"2025","journal-title":"arXiv preprint arXiv"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1145\/3600006.3613165"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.02045"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51701.2025.01850"},{"key":"ref51","article-title":"Forgerygpt: Multimodal large language model for explainable image forgery detection and localization","author":"Li","year":"2024","journal-title":"arXiv preprint arXiv"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1145\/3690624.3709392"},{"key":"ref53","article-title":"Fakebench: Uncover the achilles\u2019 heels of fake images with large multimodal models","author":"Li","year":"2024","journal-title":"arXiv preprint arXiv"},{"key":"ref54","article-title":"A large-scale interpretable multimodality benchmark for facial image forgery localization","author":"Lian","year":"2024","journal-title":"arXiv preprint arXiv"},{"key":"ref55","first-page":"74","article-title":"Rouge: A package for automatic evaluation of summaries","author":"Lin","year":"2004","journal-title":"Text summarization branches out"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-10602-1_48"},{"key":"ref57","article-title":"Deepseek-v3 technical report","author":"Liu","year":"2024","journal-title":"arXiv preprint arXiv"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19781-9_6"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52733.2024.01024"},{"key":"ref60","volume-title":"Llava-next: Improved reasoning, ocr, and world knowledge","author":"Liu","year":"2024"},{"key":"ref61","article-title":"Visual instruction tuning","author":"Liu","year":"2024","journal-title":"Advances in neural information processing systems, 36"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.01024"},{"key":"ref63","first-page":"17006","article-title":"Lare\\^{} 2 : Latent reconstruction error based method for diffusion-generated image detection","volume-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","author":"Luo","year":"2024"},{"key":"ref64","article-title":"Phybench: A physical commonsense benchmark for evaluating text-to-image models","author":"Meng","year":"2024","journal-title":"arXiv preprint arXiv"},{"key":"ref65","article-title":"Mistral-AI","volume-title":"Pixtral large","year":"2024"},{"key":"ref66","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.02345"},{"key":"ref67","doi-asserted-by":"publisher","DOI":"10.3115\/1073083.1073135"},{"key":"ref68","article-title":"Mllmenhanced face forgery detection: A vision-language fusion solution","author":"Peng","year":"2025","journal-title":"arXiv preprint arXiv"},{"key":"ref69","article-title":"Explainable tampered text detection via multimodal large models","author":"Qu","year":"2024","journal-title":"arXiv preprint arXiv"},{"key":"ref70","first-page":"8748","article-title":"Learning transferable visual models from natural language supervision","volume-title":"International conference on machine learning","author":"Radford","year":"2021"},{"key":"ref71","article-title":"Direct preference optimization: Your language model is secretly a reward model","author":"Rafailov","year":"2024","journal-title":"Advances in Neural Information Processing Systems"},{"key":"ref72","doi-asserted-by":"publisher","DOI":"10.5220\/0012422000003660"},{"key":"ref73","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01042"},{"key":"ref74","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.02658"},{"key":"ref75","article-title":"De-fake: Detection and attribution of fake images generated by text-toimage diffusion models","author":"Sha","year":"2022","journal-title":"arXiv preprint arXiv"},{"key":"ref76","article-title":"On learning multi-modal forgery representation for diffusion generated video detection","volume-title":"Proceeding of Thirty-eighth Conference on Neural Information Processing Systems, Vancouver, Canada","author":"Song","year":"2024"},{"key":"ref77","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v35i3.16367"},{"key":"ref78","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19781-9_7"},{"key":"ref79","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v36i2.20130"},{"key":"ref80","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-024-02160-1"},{"key":"ref81","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52734.2025.01823"},{"key":"ref82","article-title":"Autoregressive model beats diffusion: Llama for scalable image generation","author":"Sun","year":"2024","journal-title":"arXiv preprint arXiv"},{"key":"ref83","article-title":"Forgerysleuth: Empowering multimodal large language models for image manipulation detection","author":"Sun","year":"2024","journal-title":"arXiv preprint arXiv"},{"key":"ref84","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01165"},{"key":"ref85","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.02657"},{"key":"ref86","article-title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction","author":"Tian","journal-title":"2024. 7"},{"key":"ref87","article-title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction","author":"Tian","year":"2024","journal-title":"arXiv preprint arXiv"},{"key":"ref88","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7299087"},{"key":"ref89","article-title":"Qwen2-vl: Enhancing vision-language model\u2019s perception of the world at any resolution","author":"Wang","year":"2024","journal-title":"arXiv preprint arXiv"},{"key":"ref90","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00872"},{"key":"ref91","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00872"},{"key":"ref92","article-title":"Cogvlm: Visual expert for pretrained language models","author":"Wang","year":"2023","journal-title":"arXiv preprint arXiv"},{"key":"ref93","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.02051"},{"key":"ref94","article-title":"Spot the fake: Large multimodal model-based synthetic image detection with artifact explanation","author":"Wen","year":"2025","journal-title":"arXiv preprint arXiv"},{"key":"ref95","article-title":"Janus: Decoupling visual encoding for unified multimodal understanding and generation","author":"Wu","year":"2024","journal-title":"arXiv preprint arXiv"},{"key":"ref96","article-title":"Q-bench: A benchmark for general-purpose foundation models on low-level vision","author":"Wu","year":"2023","journal-title":"arXiv preprint arXiv"},{"key":"ref97","article-title":"Generalizable synthetic image detection via language-guided contrastive learning","author":"Wu","year":"2023","journal-title":"arXiv preprint"},{"key":"ref98","article-title":"Show-o: One single transformer to unify multimodal understanding and generation","author":"Xie","year":"2024","journal-title":"arXiv preprint arXiv"},{"key":"ref99","article-title":"Fakeshield: Explainable image forgery detection and localization via multi-modal large language models","author":"Xu","year":"2024","journal-title":"arXiv preprint arXiv"},{"key":"ref100","article-title":"A sanity check for ai-generated image detection","author":"Yan","year":"2024","journal-title":"arXiv preprint arXiv"},{"key":"ref101","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52734.2025.00365"},{"key":"ref102","article-title":"Loki: A comprehensive synthetic data detection benchmark using large multimodal models","author":"Ye","year":"2024","journal-title":"arXiv preprint arXiv"},{"key":"ref103","article-title":"Unlocking the capabilities of large vision-language models for generalizable and explainable deepfake detection","author":"Yu","year":"2025","journal-title":"arXiv preprint arXiv"},{"key":"ref104","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-73223-2_22"},{"key":"ref105","article-title":"Why are visually-grounded language models bad at image classification?","author":"Zhang","year":"2024","journal-title":"arXiv preprint arXiv"},{"key":"ref106","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-73223-2_22"},{"key":"ref107","doi-asserted-by":"publisher","DOI":"10.52202\/075280-2020"},{"key":"ref108","article-title":"Rich and poor texture contrast: A simple yet effective approach for ai-generated image detection","author":"Zhong","year":"2023","journal-title":"arXiv preprint arXiv"},{"key":"ref109","first-page":"1","article-title":"Patchcraft: Exploring texture patch for efficient ai-generated image detection","author":"Zhong","year":"2024","journal-title":"arXiv preprint arXiv"},{"key":"ref110","article-title":"Genimage: A million-scale benchmark for detecting ai-generated image, 2023","author":"Zhu","journal-title":"2, 3"}],"event":{"name":"2025 IEEE\/CVF International Conference on Computer Vision (ICCV)","location":"Honolulu, HI, USA","start":{"date-parts":[[2025,10,19]]},"end":{"date-parts":[[2025,10,25]]}},"container-title":["2025 IEEE\/CVF International Conference on Computer Vision (ICCV)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/11443115\/11443287\/11445461.pdf?arnumber=11445461","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,4,30]],"date-time":"2026-04-30T06:14:55Z","timestamp":1777529695000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11445461\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,10,19]]},"references-count":110,"URL":"https:\/\/doi.org\/10.1109\/iccv51701.2025.01742","relation":{},"subject":[],"published":{"date-parts":[[2025,10,19]]}}}