{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,23]],"date-time":"2026-04-23T07:59:59Z","timestamp":1776931199658,"version":"3.51.2"},"publisher-location":"New York, NY, USA","reference-count":38,"publisher":"ACM","content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2025,12,9]]},"DOI":"10.1145\/3743093.3770933","type":"proceedings-article","created":{"date-parts":[[2025,12,6]],"date-time":"2025-12-06T08:06:16Z","timestamp":1765008376000},"page":"1-8","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":0,"title":["Mitigating Hallucinations in Large Vision-Language Models via Dual Contrastive Decoding"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0009-0007-1635-3440","authenticated-orcid":false,"given":"Jiulong","family":"Wu","sequence":"first","affiliation":[{"name":"Soochow University, Suzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0006-6718-4942","authenticated-orcid":false,"given":"Yucheng","family":"Shen","sequence":"additional","affiliation":[{"name":"Soochow University, Suzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0006-4773-4521","authenticated-orcid":false,"given":"Haixin","family":"Sun","sequence":"additional","affiliation":[{"name":"Soochow University, Suzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-6628-0370","authenticated-orcid":false,"given":"Min","family":"Cao","sequence":"additional","affiliation":[{"name":"Soochow University, suzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2025,12,6]]},"reference":[{"key":"e_1_3_3_1_2_2","unstructured":"Josh Achiam Steven Adler Sandhini Agarwal Lama Ahmad Ilge Akkaya Florencia\u00a0Leoni Aleman Diogo Almeida Janko Altenschmidt Sam Altman Shyamal Anadkat et\u00a0al. 2023. Gpt-4 technical report. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2303.08774 (2023)."},{"key":"e_1_3_3_1_3_2","unstructured":"Jinze Bai Shuai Bai Yunfei Chu Zeyu Cui Kai Dang Xiaodong Deng Yang Fan Wenbin Ge Yu Han Fei Huang et\u00a0al. 2023. Qwen technical report. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2309.16609 (2023)."},{"key":"e_1_3_3_1_4_2","unstructured":"Hangbo Bao Wenhui Wang Li Dong Qiang Liu Owais\u00a0Khan Mohammed Kriti Aggarwal Subhojit Som Songhao Piao and Furu Wei. 2022. Vlmo: Unified vision-language pre-training with mixture-of-modality-experts. Advances in neural information processing systems 35 (2022) 32897\u201332912."},{"key":"e_1_3_3_1_5_2","unstructured":"Wenliang Dai Junnan Li Dongxu Li Anthony Tiong Junqi Zhao Weisheng Wang Boyang Li Pascale\u00a0N Fung and Steven Hoi. 2023. Instructblip: Towards general-purpose vision-language models with instruction tuning. Advances in neural information processing systems 36 (2023) 49250\u201349267."},{"key":"e_1_3_3_1_6_2","unstructured":"Yifan Du Zikang Liu Junyi Li and Wayne\u00a0Xin Zhao. 2022. A survey of vision-language pre-trained models. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2202.10936 (2022)."},{"key":"e_1_3_3_1_7_2","unstructured":"Peng Gao Jiaming Han Renrui Zhang Ziyi Lin Shijie Geng Aojun Zhou Wei Zhang Pan Lu Conghui He Xiangyu Yue et\u00a0al. 2023. Llama-adapter v2: Parameter-efficient visual instruction model. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2304.15010 (2023)."},{"key":"e_1_3_3_1_8_2","unstructured":"Yudong Han Liqiang Nie Jianhua Yin Jianlong Wu and Yan Yan. 2022. Visual perturbation-aware collaborative learning for overcoming the language prior problem. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2207.11850 (2022)."},{"key":"e_1_3_3_1_9_2","unstructured":"Hongyu Hu Jiyuan Zhang Minyi Zhao and Zhenbang Sun. 2023. Ciem: Contrastive instruction evaluation method for better instruction tuning. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2309.02301 (2023)."},{"key":"e_1_3_3_1_10_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00686"},{"key":"e_1_3_3_1_11_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.02553"},{"key":"e_1_3_3_1_12_2","unstructured":"Liqiang Jing Ruosen Li Yunmo Chen and Xinya Du. 2023. Faithscore: Fine-grained evaluations of hallucinations in large vision-language models. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2311.01477 (2023)."},{"key":"e_1_3_3_1_13_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.01316"},{"key":"e_1_3_3_1_14_2","first-page":"19730","volume-title":"International conference on machine learning","author":"Li Junnan","year":"2023","unstructured":"Junnan Li, Dongxu Li, Silvio Savarese, and Steven Hoi. 2023. Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models. In International conference on machine learning. PMLR, 19730\u201319742."},{"key":"e_1_3_3_1_15_2","first-page":"12888","volume-title":"International conference on machine learning","author":"Li Junnan","year":"2022","unstructured":"Junnan Li, Dongxu Li, Caiming Xiong, and Steven Hoi. 2022. Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation. In International conference on machine learning. PMLR, 12888\u201312900."},{"key":"e_1_3_3_1_16_2","unstructured":"Yifan Li Yifan Du Kun Zhou Jinpeng Wang Wayne\u00a0Xin Zhao and Ji-Rong Wen. 2023. Evaluating object hallucination in large vision-language models. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2305.10355 (2023)."},{"key":"e_1_3_3_1_17_2","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-10602-1_48"},{"key":"e_1_3_3_1_18_2","unstructured":"Fuxiao Liu Kevin Lin Linjie Li Jianfeng Wang Yaser Yacoob and Lijuan Wang. 2023. Mitigating hallucination in large multi-modal models via robust instruction tuning. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2306.14565 (2023)."},{"key":"e_1_3_3_1_19_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.02484"},{"key":"e_1_3_3_1_20_2","unstructured":"Haotian Liu Chunyuan Li Qingyang Wu and Yong\u00a0Jae Lee. 2023. Visual instruction tuning. Advances in neural information processing systems 36 (2023) 34892\u201334916."},{"key":"e_1_3_3_1_21_2","unstructured":"Hanchao Liu Wenyuan Xue Yifei Chen Dapeng Chen Xiutian Zhao Ke Wang Liping Hou Rongjun Li and Wei Peng. 2024. A survey on hallucination in large vision-language models. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2402.00253 (2024)."},{"key":"e_1_3_3_1_22_2","unstructured":"Haoyu Lu Wen Liu Bo Zhang Bingxuan Wang Kai Dong Bo Liu Jingxiang Sun Tongzheng Ren Zhuoshu Li Hao Yang et\u00a0al. 2024. Deepseek-vl: towards real-world vision-language understanding. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2403.05525 (2024)."},{"key":"e_1_3_3_1_23_2","first-page":"8748","volume-title":"International conference on machine learning","author":"Radford Alec","year":"2021","unstructured":"Alec Radford, Jong\u00a0Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, et\u00a0al. 2021. Learning transferable visual models from natural language supervision. In International conference on machine learning. PmLR, 8748\u20138763."},{"key":"e_1_3_3_1_24_2","doi-asserted-by":"publisher","DOI":"10.1007\/978-981-99-6207-5_4"},{"key":"e_1_3_3_1_25_2","unstructured":"Pritam Sarkar Sayna Ebrahimi Ali Etemad Ahmad Beirami Sercan\u00a0\u00d6 Ar\u0131k and Tomas Pfister. 2024. Mitigating Object Hallucination in MLLMs via Data-augmented Phrase-level Alignment. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2405.18654 (2024)."},{"key":"e_1_3_3_1_26_2","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-20074-8_9"},{"key":"e_1_3_3_1_27_2","unstructured":"SM Tonmoy SM Zaman Vinija Jain Anku Rani Vipula Rawte Aman Chadha and Amitava Das. 2024. A comprehensive survey of hallucination mitigation techniques in large language models. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2401.01313 6 (2024)."},{"key":"e_1_3_3_1_28_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01838"},{"key":"e_1_3_3_1_29_2","unstructured":"Wenhai Wang Zhe Chen Xiaokang Chen Jiannan Wu Xizhou Zhu Gang Zeng Ping Luo Tong Lu Jie Zhou Yu Qiao et\u00a0al. 2023. Visionllm: Large language model is also an open-ended decoder for vision-centric tasks. Advances in Neural Information Processing Systems 36 (2023) 61501\u201361513."},{"key":"e_1_3_3_1_30_2","doi-asserted-by":"crossref","unstructured":"Xintong Wang Jingheng Pan Liang Ding and Chris Biemann. 2024. Mitigating hallucinations in large vision-language models with instruction contrastive decoding. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2403.18715 (2024).","DOI":"10.18653\/v1\/2024.findings-acl.937"},{"key":"e_1_3_3_1_31_2","unstructured":"Jiulong Wu Zhengliang Shi Shuaiqiang Wang Jizhou Huang Dawei Yin Lingyong Yan Min Cao and Min Zhang. 2025. Mitigating Hallucinations in Large Vision-Language Models via Entity-Centric Multimodal Preference Optimization. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2506.04039 (2025)."},{"key":"e_1_3_3_1_32_2","doi-asserted-by":"crossref","unstructured":"Hong Yan Lijun Liu Xupeng Feng and Qingsong Huang. 2023. Overcoming language priors with self-contrastive learning for visual question answering. Multimedia Tools and Applications 82 11 (2023) 16343\u201316358.","DOI":"10.1007\/s11042-022-14167-2"},{"key":"e_1_3_3_1_33_2","unstructured":"Yuan Yao Tianyu Yu Ao Zhang Chongyi Wang Junbo Cui Hongji Zhu Tianchi Cai Haoyu Li Weilin Zhao Zhihui He et\u00a0al. 2024. Minicpm-v: A gpt-4v level mllm on your phone. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2408.01800 (2024)."},{"key":"e_1_3_3_1_34_2","doi-asserted-by":"crossref","unstructured":"Shukang Yin Chaoyou Fu Sirui Zhao Ke Li Xing Sun Tong Xu and Enhong Chen. 2024. A survey on multimodal large language models. National Science Review 11 12 (2024) nwae403.","DOI":"10.1093\/nsr\/nwae403"},{"key":"e_1_3_3_1_35_2","doi-asserted-by":"crossref","unstructured":"Shukang Yin Chaoyou Fu Sirui Zhao Tong Xu Hao Wang Dianbo Sui Yunhang Shen Ke Li Xing Sun and Enhong Chen. 2024. Woodpecker: Hallucination correction for multimodal large language models. Science China Information Sciences 67 12 (2024) 220105.","DOI":"10.1007\/s11432-024-4251-x"},{"key":"e_1_3_3_1_36_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.01310"},{"key":"e_1_3_3_1_37_2","unstructured":"Lianmin Zheng Wei-Lin Chiang Ying Sheng Siyuan Zhuang Zhanghao Wu Yonghao Zhuang Zi Lin Zhuohan Li Dacheng Li Eric Xing et\u00a0al. 2023. Judging llm-as-a-judge with mt-bench and chatbot arena. Advances in neural information processing systems 36 (2023) 46595\u201346623."},{"key":"e_1_3_3_1_38_2","unstructured":"Deyao Zhu Jun Chen Xiaoqian Shen Xiang Li and Mohamed Elhoseiny. 2023. Minigpt-4: Enhancing vision-language understanding with advanced large language models. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2304.10592 (2023)."},{"key":"e_1_3_3_1_39_2","doi-asserted-by":"crossref","unstructured":"Xi Zhu Zhendong Mao Chunxiao Liu Peng Zhang Bin Wang and Yongdong Zhang. 2020. Overcoming language priors with self-supervised learning for visual question answering. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2012.11528 (2020).","DOI":"10.24963\/ijcai.2020\/151"}],"event":{"name":"MMAsia '25: ACM Multimedia Asia","location":"Kuala Lumpur Malaysia","acronym":"MMAsia '25","sponsor":["SIGMM ACM Special Interest Group on Multimedia"]},"container-title":["Proceedings of the 7th ACM International Conference on Multimedia in Asia"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3743093.3770933","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,12,6]],"date-time":"2025-12-06T08:09:39Z","timestamp":1765008579000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3743093.3770933"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,12,6]]},"references-count":38,"alternative-id":["10.1145\/3743093.3770933","10.1145\/3743093"],"URL":"https:\/\/doi.org\/10.1145\/3743093.3770933","relation":{},"subject":[],"published":{"date-parts":[[2025,12,6]]},"assertion":[{"value":"2025-12-06","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}