{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,13]],"date-time":"2026-04-13T14:29:50Z","timestamp":1776090590996,"version":"3.50.1"},"publisher-location":"New York, NY, USA","reference-count":69,"publisher":"ACM","funder":[{"name":"National Key R&D Program of China","award":["No.2023YFB4502804"],"award-info":[{"award-number":["No.2023YFB4502804"]}]},{"name":"the National Science Fund for Distinguished Young Scholars","award":["No.62025603"],"award-info":[{"award-number":["No.62025603"]}]},{"name":"the National Natural Science Foundation of China","award":["No. U22B2051, No. U21B2037 , No. 62302411"],"award-info":[{"award-number":["No. U22B2051, No. U21B2037 , No. 62302411"]}]},{"DOI":"10.13039\/501100002858","name":"China Postdoctoral Science Foundation","doi-asserted-by":"publisher","award":["No. 2023M732948"],"award-info":[{"award-number":["No. 2023M732948"]}],"id":[{"id":"10.13039\/501100002858","id-type":"DOI","asserted-by":"publisher"}]},{"name":"the Zhongguancun Academy, Beijing, China","award":["No. 20240103"],"award-info":[{"award-number":["No. 20240103"]}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2025,10,27]]},"DOI":"10.1145\/3746027.3754993","type":"proceedings-article","created":{"date-parts":[[2025,10,25]],"date-time":"2025-10-25T07:38:54Z","timestamp":1761377934000},"page":"3143-3152","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":1,"title":["MIHBench: Benchmarking and Mitigating Multi-Image Hallucinations in Multimodal Large Language Models"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0009-0001-3717-1255","authenticated-orcid":false,"given":"Jiale","family":"Li","sequence":"first","affiliation":[{"name":"Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University, Xiamen, Fujian, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0009-8633-758X","authenticated-orcid":false,"given":"Mingrui","family":"Wu","sequence":"additional","affiliation":[{"name":"Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University, Xiamen, Fujian, China and Zhongguancun Academy, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0008-8610-8739","authenticated-orcid":false,"given":"Zixiang","family":"Jin","sequence":"additional","affiliation":[{"name":"Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University, Xiamen, Fujian, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0008-4163-9392","authenticated-orcid":false,"given":"Hao","family":"Chen","sequence":"additional","affiliation":[{"name":"Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University, Xiamen, Fujian, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-9956-6308","authenticated-orcid":false,"given":"Jiayi","family":"Ji","sequence":"additional","affiliation":[{"name":"Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University, Xiamen, Fujian, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3912-9306","authenticated-orcid":false,"given":"Xiaoshuai","family":"Sun","sequence":"additional","affiliation":[{"name":"Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University, Xiamen, Fujian, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-7645-9606","authenticated-orcid":false,"given":"Liujuan","family":"Cao","sequence":"additional","affiliation":[{"name":"Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University, Xiamen, Fujian, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-9163-2932","authenticated-orcid":false,"given":"Rongrong","family":"Ji","sequence":"additional","affiliation":[{"name":"Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University, Xiamen, Fujian, China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2025,10,27]]},"reference":[{"key":"e_1_3_2_1_1_1","unstructured":"Wenbin An Feng Tian Sicong Leng Jiahao Nie Haonan Lin QianYing Wang Ping Chen Xiaoqin Zhang and Shijian Lu. 2025. Mitigating Object Hallucinations in Large Vision-Language Models with Assembly of Global and Local Attention. arXiv:2406.12718 [cs.CV] https:\/\/arxiv.org\/abs\/2406.12718"},{"key":"e_1_3_2_1_2_1","volume-title":"Gabriel Ilharco, Mitchell Wortsman, and Ludwig Schmidt.","author":"Awadalla Anas","year":"2023","unstructured":"Anas Awadalla, Irena Gao, Josh Gardner, Jack Hessel, Yusuf Hanafy, Wanrong Zhu, Kalyani Marathe, Yonatan Bitton, Samir Gadre, Shiori Sagawa, Jenia Jitsev, Simon Kornblith, Pang Wei Koh, Gabriel Ilharco, Mitchell Wortsman, and Ludwig Schmidt. 2023. OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models. arXiv:2308.01390 [cs.CV] https:\/\/arxiv.org\/abs\/2308.01390"},{"key":"e_1_3_2_1_3_1","unstructured":"Jinze Bai Shuai Bai Yunfei Chu Zeyu Cui Kai Dang Xiaodong Deng Yang Fan Wenbin Ge Yu Han Fei Huang Binyuan Hui Luo Ji Mei Li Junyang Lin Runji Lin Dayiheng Liu Gao Liu Chengqiang Lu Keming Lu Jianxin Ma Rui Men Xingzhang Ren Xuancheng Ren Chuanqi Tan Sinan Tan Jianhong Tu Peng Wang Shijie Wang Wei Wang Shengguang Wu Benfeng Xu Jin Xu An Yang Hao Yang Jian Yang Shusheng Yang Yang Yao Bowen Yu Hongyi Yuan Zheng Yuan Jianwei Zhang Xingxuan Zhang Yichang Zhang Zhenru Zhang Chang Zhou Jingren Zhou Xiaohuan Zhou and Tianhang Zhu. 2023. Qwen Technical Report. arXiv:2309.16609 [cs.CL] https:\/\/arxiv.org\/abs\/2309.16609"},{"key":"e_1_3_2_1_4_1","unstructured":"Shuai Bai Keqin Chen Xuejing Liu Jialin Wang Wenbin Ge Sibo Song Kai Dang Peng Wang Shijie Wang Jun Tang Humen Zhong Yuanzhi Zhu Mingkun Yang Zhaohai Li Jianqiang Wan Pengfei Wang Wei Ding Zheren Fu Yiheng Xu Jiabo Ye Xi Zhang Tianbao Xie Zesen Cheng Hang Zhang Zhibo Yang Haiyang Xu and Junyang Lin. 2025a. Qwen2.5-VL Technical Report. arXiv:2502.13923 [cs.CV] https:\/\/arxiv.org\/abs\/2502.13923"},{"key":"e_1_3_2_1_5_1","unstructured":"Zechen Bai Pichao Wang Tianjun Xiao Tong He Zongbo Han Zheng Zhang and Mike Zheng Shou. 2025b. Hallucination of Multimodal Large Language Models: A Survey. arXiv:2404.18930 [cs.CV] https:\/\/arxiv.org\/abs\/2404.18930"},{"key":"e_1_3_2_1_6_1","volume-title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic. arXiv:2306.15195 [cs.CV] https:\/\/arxiv.org\/abs\/2306.15195","author":"Chen Keqin","year":"2023","unstructured":"Keqin Chen, Zhao Zhang, Weili Zeng, Richong Zhang, Feng Zhu, and Rui Zhao. 2023. Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic. arXiv:2306.15195 [cs.CV] https:\/\/arxiv.org\/abs\/2306.15195"},{"key":"e_1_3_2_1_7_1","unstructured":"Xuweiyi Chen Ziqiao Ma Xuejun Zhang Sihan Xu Shengyi Qian Jianing Yang David F. Fouhey and Joyce Chai. 2024a. Multi-Object Hallucination in Vision-Language Models. arXiv:2407.06192 [cs.CV] https:\/\/arxiv.org\/abs\/2407.06192"},{"key":"e_1_3_2_1_8_1","unstructured":"Xiang Chen Chenxi Wang Yida Xue Ningyu Zhang Xiaoyan Yang Qiang Li Yue Shen Lei Liang Jinjie Gu and Huajun Chen. 2024b. Unified Hallucination Detection for Multimodal Large Language Models. arXiv:2402.03190 [cs.CL] https:\/\/arxiv.org\/abs\/2402.03190"},{"key":"e_1_3_2_1_9_1","unstructured":"Zhe Chen Weiyun Wang Yue Cao Yangzhou Liu Zhangwei Gao Erfei Cui Jinguo Zhu Shenglong Ye Hao Tian Zhaoyang Liu Lixin Gu Xuehui Wang Qingyun Li Yimin Ren Zixuan Chen Jiapeng Luo Jiahao Wang Tan Jiang Bo Wang Conghui He Botian Shi Xingcheng Zhang Han Lv Yi Wang Wenqi Shao Pei Chu Zhongying Tu Tong He Zhiyong Wu Huipeng Deng Jiaye Ge Kai Chen Kaipeng Zhang Limin Wang Min Dou Lewei Lu Xizhou Zhu Tong Lu Dahua Lin Yu Qiao Jifeng Dai and Wenhai Wang. 2025. Expanding Performance Boundaries of Open-Source Multimodal Models with Model Data and Test-Time Scaling. arXiv:2412.05271 [cs.CV] https:\/\/arxiv.org\/abs\/2412.05271"},{"key":"e_1_3_2_1_10_1","volume-title":"Junqi Zhao, Weisheng Wang, Boyang Li, Pascale Fung, and Steven Hoi.","author":"Dai Wenliang","year":"2023","unstructured":"Wenliang Dai, Junnan Li, Dongxu Li, Anthony Meng Huat Tiong, Junqi Zhao, Weisheng Wang, Boyang Li, Pascale Fung, and Steven Hoi. 2023. InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning. arXiv:2305.06500 [cs.CV] https:\/\/arxiv.org\/abs\/2305.06500"},{"key":"e_1_3_2_1_11_1","unstructured":"Xiaoyi Dong Pan Zhang Yuhang Zang Yuhang Cao Bin Wang Linke Ouyang Xilin Wei Songyang Zhang Haodong Duan Maosong Cao Wenwei Zhang Yining Li Hang Yan Yang Gao Xinyue Zhang Wei Li Jingwen Li Kai Chen Conghui He Xingcheng Zhang Yu Qiao Dahua Lin and Jiaqi Wang. 2024. InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model. arXiv:2401.16420 [cs.CV] https:\/\/arxiv.org\/abs\/2401.16420"},{"key":"e_1_3_2_1_12_1","unstructured":"Team GLM: Aohan Zeng Bin Xu Bowen Wang Chenhui Zhang Da Yin Dan Zhang Diego Rojas Guanyu Feng Hanlin Zhao Hanyu Lai Hao Yu Hongning Wang Jiadai Sun Jiajie Zhang Jiale Cheng Jiayi Gui Jie Tang Jing Zhang Jingyu Sun Juanzi Li Lei Zhao Lindong Wu Lucen Zhong Mingdao Liu Minlie Huang Peng Zhang Qinkai Zheng Rui Lu Shuaiqi Duan Shudan Zhang Shulin Cao Shuxun Yang Weng Lam Tam Wenyi Zhao Xiao Liu Xiao Xia Xiaohan Zhang Xiaotao Gu Xin Lv Xinghan Liu Xinyi Liu Xinyue Yang Xixuan Song Xunkai Zhang Yifan An Yifan Xu Yilin Niu Yuantao Yang Yueyan Li Yushi Bai Yuxiao Dong Zehan Qi Zhaoyu Wang Zhen Yang Zhengxiao Du Zhenyu Hou and Zihan Wang. 2024. ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools. arXiv:2406.12793 [cs.CL] https:\/\/arxiv.org\/abs\/2406.12793"},{"key":"e_1_3_2_1_13_1","doi-asserted-by":"publisher","DOI":"10.1016\/j.patcog.2025.111478"},{"key":"e_1_3_2_1_14_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52734.2025.01669"},{"key":"e_1_3_2_1_15_1","doi-asserted-by":"publisher","DOI":"10.1109\/TGRS.2023.3336952"},{"key":"e_1_3_2_1_16_1","doi-asserted-by":"crossref","unstructured":"Tianrui Guan Fuxiao Liu Xiyang Wu Ruiqi Xian Zongxia Li Xiaoyu Liu Xijun Wang Lichang Chen Furong Huang Yaser Yacoob Dinesh Manocha and Tianyi Zhou. 2024. HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models. arXiv:2310.14566 [cs.CV] https:\/\/arxiv.org\/abs\/2310.14566","DOI":"10.1109\/CVPR52733.2024.01363"},{"key":"e_1_3_2_1_17_1","volume-title":"Kaihuo Zhang, Chongyi Wang, Yuan Yao, Chenyang Zhao, Jie Zhou, Jie Cai, Zhongwu Zhai, Ning Ding, Chao Jia, Guoyang Zeng, Dahai Li, Zhiyuan Liu, and Maosong Sun.","author":"Hu Shengding","year":"2024","unstructured":"Shengding Hu, Yuge Tu, Xu Han, Chaoqun He, Ganqu Cui, Xiang Long, Zhi Zheng, Yewei Fang, Yuxiang Huang, Weilin Zhao, Xinrong Zhang, Zheng Leng Thai, Kaihuo Zhang, Chongyi Wang, Yuan Yao, Chenyang Zhao, Jie Zhou, Jie Cai, Zhongwu Zhai, Ning Ding, Chao Jia, Guoyang Zeng, Dahai Li, Zhiyuan Liu, and Maosong Sun. 2024. MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies. arXiv:2404.06395 [cs.CL] https:\/\/arxiv.org\/abs\/2404.06395"},{"key":"e_1_3_2_1_18_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.01274"},{"key":"e_1_3_2_1_19_1","volume-title":"MANTIS: Interleaved Multi-Image Instruction Tuning. arXiv:2405.01483 [cs.CV] https:\/\/arxiv.org\/abs\/2405.01483","author":"Jiang Dongfu","year":"2024","unstructured":"Dongfu Jiang, Xuan He, Huaye Zeng, Cong Wei, Max Ku, Qian Liu, and Wenhu Chen. 2024. MANTIS: Interleaved Multi-Image Instruction Tuning. arXiv:2405.01483 [cs.CV] https:\/\/arxiv.org\/abs\/2405.01483"},{"key":"e_1_3_2_1_20_1","unstructured":"Seil Kang Jinyeong Kim Junhyeok Kim and Seong Jae Hwang. 2025. See What You Are Told: Visual Attention Sink in Large Multimodal Models. arXiv:2503.03321 [cs.CV] https:\/\/arxiv.org\/abs\/2503.03321"},{"key":"e_1_3_2_1_21_1","volume-title":"OBELISC: An Open Web-Scale Filtered Dataset of Interleaved Image-Text Documents. (Jun","author":"Lauren\u00e7on Hugo","year":"2023","unstructured":"Hugo Lauren\u00e7on, Lucile Saulnier, L\u00e9o Tronchon, Stas Bekman, Amanpreet Singh, Anton Lozhkov, Thomas Wang, Siddharth Karamcheti, Alexander M. Rush, Douwe Kiela, Matthieu Cord, and Victor Sanh. 2023. OBELISC: An Open Web-Scale Filtered Dataset of Interleaved Image-Text Documents. (Jun 2023)."},{"key":"e_1_3_2_1_22_1","unstructured":"Hugo Lauren\u00e7on L\u00e9o Tronchon Matthieu Cord and Victor Sanh. 2024. What matters when building vision-language models? arXiv:2405.02246 [cs.CV] https:\/\/arxiv.org\/abs\/2405.02246"},{"key":"e_1_3_2_1_23_1","volume-title":"Mitigating Object Hallucinations in Large Vision-Language Models through Visual Contrastive Decoding. arXiv preprint arXiv:2311.16922","author":"Leng Sicong","year":"2023","unstructured":"Sicong Leng, Hang Zhang, Guanzheng Chen, Xin Li, Shijian Lu, Chunyan Miao, and Lidong Bing. 2023. Mitigating Object Hallucinations in Large Vision-Language Models through Visual Contrastive Decoding. arXiv preprint arXiv:2311.16922 (2023). https:\/\/arxiv.org\/abs\/2311.16922"},{"key":"e_1_3_2_1_24_1","unstructured":"Chunyuan Li Cliff Wong Sheng Zhang Naoto Usuyama Haotian Liu Jianwei Yang Tristan Naumann Hoifung Poon and Jianfeng Gao. 2023c. LLaVA-Med: Training a Large Language-and-Vision Assistant for Biomedicine in One Day. arXiv:2306.00890 [cs.CV] https:\/\/arxiv.org\/abs\/2306.00890"},{"key":"e_1_3_2_1_25_1","unstructured":"Feng Li Renrui Zhang Hao Zhang Yuanhan Zhang Bo Li Wei Li Zejun Ma and Chunyuan Li. 2024. LLaVA-NeXT-Interleave: Tackling Multi-image Video and 3D in Large Multimodal Models. arXiv:2407.07895 [cs.CV] https:\/\/arxiv.org\/abs\/2407.07895"},{"key":"e_1_3_2_1_26_1","unstructured":"Junnan Li Dongxu Li Silvio Savarese and Steven Hoi. 2023b. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models. arXiv:2301.12597 [cs.CV] https:\/\/arxiv.org\/abs\/2301.12597"},{"key":"e_1_3_2_1_27_1","volume-title":"Evaluating Object Hallucination in Large Vision-Language Models. In The 2023 Conference on Empirical Methods in Natural Language Processing. https:\/\/openreview.net\/forum?id=xozJw0kZXF","author":"Li Yifan","year":"2023","unstructured":"Yifan Li, Yifan Du, Kun Zhou, Jinpeng Wang, Wayne Xin Zhao, and Ji-Rong Wen. 2023a. Evaluating Object Hallucination in Large Vision-Language Models. In The 2023 Conference on Empirical Methods in Natural Language Processing. https:\/\/openreview.net\/forum?id=xozJw0kZXF"},{"key":"e_1_3_2_1_28_1","unstructured":"Tsung-Yi Lin Michael Maire Serge Belongie Lubomir Bourdev Ross Girshick James Hays Pietro Perona Deva Ramanan C. Lawrence Zitnick and Piotr Doll\u00e1r. 2015. Microsoft COCO: Common Objects in Context. arXiv:1405.0312 [cs.CV] https:\/\/arxiv.org\/abs\/1405.0312"},{"key":"e_1_3_2_1_29_1","unstructured":"Haotian Liu Chunyuan Li Yuheng Li and Yong Jae Lee. 2024b. Improved Baselines with Visual Instruction Tuning. arXiv:2310.03744 [cs.CV] https:\/\/arxiv.org\/abs\/2310.03744"},{"key":"e_1_3_2_1_30_1","unstructured":"Haotian Liu Chunyuan Li Qingyang Wu and Yong Jae Lee. 2023. Visual Instruction Tuning. arXiv:2304.08485 [cs.CV] https:\/\/arxiv.org\/abs\/2304.08485"},{"key":"e_1_3_2_1_31_1","unstructured":"Hanchao Liu Wenyuan Xue Yifei Chen Dapeng Chen Xiutian Zhao Ke Wang Liping Hou Rongjun Li and Wei Peng. 2024c. A Survey on Hallucination in Large Vision-Language Models. arXiv:2402.00253 [cs.CV] https:\/\/arxiv.org\/abs\/2402.00253"},{"key":"e_1_3_2_1_32_1","doi-asserted-by":"crossref","unstructured":"Shi Liu Kecheng Zheng and Wei Chen. 2024d. Paying More Attention to Image: A Training-Free Method for Alleviating Hallucination in LVLMs. arXiv:2407.21771 [cs.CV] https:\/\/arxiv.org\/abs\/2407.21771","DOI":"10.1007\/978-3-031-73010-8_8"},{"key":"e_1_3_2_1_33_1","volume-title":"MMDU: A Multi-Turn Multi-Image Dialog Understanding Benchmark and Instruction-Tuning Dataset for LVLMs. arXiv:2406.11833 [cs.CV] https:\/\/arxiv.org\/abs\/2406.11833","author":"Liu Ziyu","year":"2024","unstructured":"Ziyu Liu, Tao Chu, Yuhang Zang, Xilin Wei, Xiaoyi Dong, Pan Zhang, Zijian Liang, Yuanjun Xiong, Yu Qiao, Dahua Lin, and Jiaqi Wang. 2024a. MMDU: A Multi-Turn Multi-Image Dialog Understanding Benchmark and Instruction-Tuning Dataset for LVLMs. arXiv:2406.11833 [cs.CV] https:\/\/arxiv.org\/abs\/2406.11833"},{"key":"e_1_3_2_1_34_1","unstructured":"Haoyu Lu Wen Liu Bo Zhang Bingxuan Wang Kai Dong Bo Liu Jingxiang Sun Tongzheng Ren Zhuoshu Li Hao Yang Yaofeng Sun Chengqi Deng Hanwei Xu Zhenda Xie and Chong Ruan. 2024. DeepSeek-VL: Towards Real-World Vision-Language Understanding. arXiv:2403.05525 [cs.AI] https:\/\/arxiv.org\/abs\/2403.05525"},{"key":"e_1_3_2_1_35_1","volume-title":"MMIU: Multimodal Multi-image Understanding for Evaluating Large Vision-Language Models. arXiv preprint arXiv:2408.02718","author":"Meng Fanqing","year":"2024","unstructured":"Fanqing Meng, Jin Wang, Chuanhao Li, Quanfeng Lu, Hao Tian, Jiaqi Liao, Xizhou Zhu, Jifeng Dai, Yu Qiao, Ping Luo, et al., 2024. MMIU: Multimodal Multi-image Understanding for Evaluating Large Vision-Language Models. arXiv preprint arXiv:2408.02718 (2024)."},{"key":"e_1_3_2_1_36_1","unstructured":"Zhiliang Peng Wenhui Wang Li Dong Yaru Hao Shaohan Huang Shuming Ma and Furu Wei. 2023. Kosmos-2: Grounding Multimodal Large Language Models to the World. arXiv:2306.14824 [cs.CL] https:\/\/arxiv.org\/abs\/2306.14824"},{"key":"e_1_3_2_1_37_1","unstructured":"Han Qiu Jiaxing Huang Peng Gao Qin Qi Xiaoqin Zhang Ling Shao and Shijian Lu. 2024. LongHalQA: Long-Context Hallucination Evaluation for MultiModal Large Language Models. arXiv:2410.09962 [cs.CV] https:\/\/arxiv.org\/abs\/2410.09962"},{"key":"e_1_3_2_1_38_1","unstructured":"Qwen: An Yang Baosong Yang Beichen Zhang Binyuan Hui Bo Zheng Bowen Yu Chengyuan Li Dayiheng Liu Fei Huang Haoran Wei Huan Lin Jian Yang Jianhong Tu Jianwei Zhang Jianxin Yang Jiaxi Yang Jingren Zhou Junyang Lin Kai Dang Keming Lu Keqin Bao Kexin Yang Le Yu Mei Li Mingfeng Xue Pei Zhang Qin Zhu Rui Men Runji Lin Tianhao Li Tianyi Tang Tingyu Xia Xingzhang Ren Xuancheng Ren Yang Fan Yang Su Yichang Zhang Yu Wan Yuqiong Liu Zeyu Cui Zhenru Zhang and Zihan Qiu. 2025. Qwen2.5 Technical Report. arXiv:2412.15115 [cs.CL] https:\/\/arxiv.org\/abs\/2412.15115"},{"key":"e_1_3_2_1_39_1","volume-title":"Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, Gretchen Krueger, and Ilya Sutskever.","author":"Radford Alec","year":"2021","unstructured":"Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, Gretchen Krueger, and Ilya Sutskever. 2021. Learning Transferable Visual Models From Natural Language Supervision. arXiv:2103.00020 [cs.CV] https:\/\/arxiv.org\/abs\/2103.00020"},{"key":"e_1_3_2_1_40_1","doi-asserted-by":"crossref","unstructured":"Jeremy Reizenstein Roman Shapovalov Philipp Henzler Luca Sbordone Patrick Labatut and David Novotny. 2021. Common Objects in 3D: Large-Scale Learning and Evaluation of Real-life 3D Category Reconstruction. arXiv:2109.00512 [cs.CV] https:\/\/arxiv.org\/abs\/2109.00512","DOI":"10.1109\/ICCV48922.2021.01072"},{"key":"e_1_3_2_1_41_1","unstructured":"Tianhe Ren Shilong Liu Ailing Zeng Jing Lin Kunchang Li He Cao Jiayu Chen Xinyu Huang Yukang Chen Feng Yan Zhaoyang Zeng Hao Zhang Feng Li Jie Yang Hongyang Li Qing Jiang and Lei Zhang. 2024. Grounded SAM: Assembling Open-World Models for Diverse Visual Tasks. arXiv:2401.14159 [cs.CV] https:\/\/arxiv.org\/abs\/2401.14159"},{"key":"e_1_3_2_1_42_1","volume-title":"Kaylee Burns, Trevor Darrell, and Kate Saenko.","author":"Rohrbach Anna","year":"2019","unstructured":"Anna Rohrbach, Lisa Anne Hendricks, Kaylee Burns, Trevor Darrell, and Kate Saenko. 2019. Object Hallucination in Image Captioning. arXiv:1809.02156 [cs.CL] https:\/\/arxiv.org\/abs\/1809.02156"},{"key":"e_1_3_2_1_43_1","volume-title":"Fei Yu, Xiang Wan, and Benyou Wang.","author":"Song Dingjie","year":"2024","unstructured":"Dingjie Song, Shunian Chen, Guiming Hardy Chen, Fei Yu, Xiang Wan, and Benyou Wang. 2024. MileBench: Benchmarking MLLMs in Long Context. arXiv:2404.18532 [cs.CL] https:\/\/arxiv.org\/abs\/2404.18532"},{"key":"e_1_3_2_1_44_1","doi-asserted-by":"crossref","unstructured":"Alane Suhr Stephanie Zhou Ally Zhang Iris Zhang Huajun Bai and Yoav Artzi. 2019. A Corpus for Reasoning About Natural Language Grounded in Photographs. arXiv:1811.00491 [cs.CL] https:\/\/arxiv.org\/abs\/1811.00491","DOI":"10.18653\/v1\/P19-1644"},{"key":"e_1_3_2_1_45_1","doi-asserted-by":"crossref","unstructured":"Quan Sun Yufeng Cui Xiaosong Zhang Fan Zhang Qiying Yu Zhengxiong Luo Yueze Wang Yongming Rao Jingjing Liu Tiejun Huang and Xinlong Wang. 2024. Generative Multimodal Models are In-Context Learners. arXiv:2312.13286 [cs.CV] https:\/\/arxiv.org\/abs\/2312.13286","DOI":"10.1109\/CVPR52733.2024.01365"},{"key":"e_1_3_2_1_46_1","unstructured":"Maria Tsimpoukelli Jacob Menick Serkan Cabi S. M. Ali Eslami Oriol Vinyals and Felix Hill. 2021. Multimodal Few-Shot Learning with Frozen Language Models. arXiv:2106.13884 [cs.CV] https:\/\/arxiv.org\/abs\/2106.13884"},{"key":"e_1_3_2_1_47_1","volume-title":"Nan Xu, Wenxuan Zhou, Kai Zhang, et al.","author":"Wang Fei","year":"2024","unstructured":"Fei Wang, Xingyu Fu, James Y Huang, Zekun Li, Qin Liu, Xiaogeng Liu, Mingyu Derek Ma, Nan Xu, Wenxuan Zhou, Kai Zhang, et al., 2024a. MuirBench: A Comprehensive Benchmark for Robust Multi-image Understanding. arXiv preprint arXiv:2406.09411 (2024)."},{"key":"e_1_3_2_1_48_1","doi-asserted-by":"crossref","unstructured":"Xintong Wang Jingheng Pan Liang Ding and Chris Biemann. 2024b. Mitigating Hallucinations in Large Vision-Language Models with Instruction Contrastive Decoding. arXiv:2403.18715 [cs.CV] https:\/\/arxiv.org\/abs\/2403.18715","DOI":"10.18653\/v1\/2024.findings-acl.937"},{"key":"e_1_3_2_1_49_1","doi-asserted-by":"crossref","unstructured":"Xidong Wang Dingjie Song Shunian Chen Chen Zhang and Benyou Wang. 2024c. LongLLaVA: Scaling Multi-modal LLMs to 1000 Images Efficiently via a Hybrid Architecture. arXiv:2409.02889 [cs.CL] https:\/\/arxiv.org\/abs\/2409.02889","DOI":"10.18653\/v1\/2025.findings-emnlp.1168"},{"key":"e_1_3_2_1_50_1","unstructured":"Haoning Wu Hanwei Zhu Zicheng Zhang Erli Zhang Chaofeng Chen Liang Liao Chunyi Li Annan Wang Wenxiu Sun Qiong Yan Xiaohong Liu Guangtao Zhai Shiqi Wang and Weisi Lin. 2024c. Towards Open-ended Visual Quality Comparison. arXiv:2402.16641 [cs.CV] https:\/\/arxiv.org\/abs\/2402.16641"},{"key":"e_1_3_2_1_51_1","unstructured":"Mingrui Wu Xinyue Cai Jiayi Ji Jiale Li Oucheng Huang Gen Luo Hao Fei Guannan Jiang Xiaoshuai Sun and Rongrong Ji. 2025. ControlMLLM: Training-Free Visual Prompt Learning for Multimodal Large Language Models. arXiv:2407.21534 [cs.CV] https:\/\/arxiv.org\/abs\/2407.21534"},{"key":"e_1_3_2_1_52_1","volume-title":"Proceedings of the 41st International Conference on Machine Learning (Proceedings of Machine Learning Research","volume":"53570","author":"Wu Mingrui","year":"2024","unstructured":"Mingrui Wu, Jiayi Ji, Oucheng Huang, Jiale Li, Yuhang Wu, Xiaoshuai Sun, and Rongrong Ji. 2024b. Evaluating and Analyzing Relationship Hallucinations in Large Vision-Language Models. In Proceedings of the 41st International Conference on Machine Learning (Proceedings of Machine Learning Research, Vol. 235), Ruslan Salakhutdinov, Zico Kolter, Katherine Heller, Adrian Weller, Nuria Oliver, Jonathan Scarlett, and Felix Berkenkamp (Eds.). PMLR, 53553-53570. https:\/\/proceedings.mlr.press\/v235\/wu24l.html"},{"key":"e_1_3_2_1_53_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01749"},{"key":"e_1_3_2_1_54_1","unstructured":"Zhiyu Wu Xiaokang Chen Zizheng Pan Xingchao Liu Wen Liu Damai Dai Huazuo Gao Yiyang Ma Chengyue Wu Bingxuan Wang Zhenda Xie Yu Wu Kai Hu Jiawei Wang Yaofeng Sun Yukun Li Yishi Piao Kang Guan Aixin Liu Xin Xie Yuxiang You Kai Dong Xingkai Yu Haowei Zhang Liang Zhao Yisong Wang and Chong Ruan. 2024a. DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding. arXiv:2412.10302 [cs.CV] https:\/\/arxiv.org\/abs\/2412.10302"},{"key":"e_1_3_2_1_55_1","unstructured":"Yun Xing Yiheng Li Ivan Laptev and Shijian Lu. 2024. Mitigating Object Hallucination via Concentric Causal Attention. arXiv:2410.15926 [cs.CV] https:\/\/arxiv.org\/abs\/2410.15926"},{"key":"e_1_3_2_1_56_1","unstructured":"Qinghao Ye Haiyang Xu Jiabo Ye Ming Yan Anwen Hu Haowei Liu Qi Qian Ji Zhang Fei Huang and Jingren Zhou. 2023. mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration. arXiv:2311.04257 [cs.CL] https:\/\/arxiv.org\/abs\/2311.04257"},{"key":"e_1_3_2_1_57_1","doi-asserted-by":"publisher","DOI":"10.1007\/s11432-024-4251-x"},{"key":"e_1_3_2_1_58_1","unstructured":"Qifan Yu Juncheng Li Longhui Wei Liang Pang Wentao Ye Bosheng Qin Siliang Tang Qi Tian and Yueting Zhuang. 2024. HalluciDoctor: Mitigating Hallucinatory Toxicity in Visual Instruction Data. arXiv:2311.13614 [cs.CV] https:\/\/arxiv.org\/abs\/2311.13614"},{"key":"e_1_3_2_1_59_1","volume-title":"MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI. arXiv:2311.16502 [cs.CL] https:\/\/arxiv.org\/abs\/2311.16502","author":"Yue Xiang","year":"2024","unstructured":"Xiang Yue, Yuansheng Ni, Kai Zhang, Tianyu Zheng, Ruoqi Liu, Ge Zhang, Samuel Stevens, Dongfu Jiang, Weiming Ren, Yuxuan Sun, Cong Wei, Botao Yu, Ruibin Yuan, Renliang Sun, Ming Yin, Boyuan Zheng, Zhenzhu Yang, Yibo Liu, Wenhao Huang, Huan Sun, Yu Su, and Wenhu Chen. 2024. MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI. arXiv:2311.16502 [cs.CL] https:\/\/arxiv.org\/abs\/2311.16502"},{"key":"e_1_3_2_1_60_1","unstructured":"Jiacheng Zhang Yang Jiao Shaoxiang Chen Na Zhao Zhiyu Tan Hao Li and Jingjing Chen. 2025a. EventHallusion: Diagnosing Event Hallucinations in Video LLMs. arXiv:2409.16597 [cs.CV] https:\/\/arxiv.org\/abs\/2409.16597"},{"key":"e_1_3_2_1_61_1","unstructured":"Xuying Zhang Yutong Liu Yangguang Li Renrui Zhang Yufei Liu Kai Wang Wanli Ouyang Zhiwei Xiong Peng Gao Qibin Hou and Ming-Ming Cheng. 2025b. TAR3D: Creating High-Quality 3D Assets via Next-Part Prediction. arXiv:2412.16919 [cs.CV] https:\/\/arxiv.org\/abs\/2412.16919"},{"key":"e_1_3_2_1_62_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.01521"},{"key":"e_1_3_2_1_63_1","unstructured":"Xuying Zhang Bowen Yin Zheng Lin Qibin Hou Deng-Ping Fan and Ming-Ming Cheng. 2025c. Referring Camouflaged Object Detection. arXiv:2306.07532 [cs.CV] https:\/\/arxiv.org\/abs\/2306.07532"},{"key":"e_1_3_2_1_64_1","unstructured":"Xuying Zhang Yupeng Zhou Kai Wang Yikai Wang Zhen Li Shaohui Jiao Daquan Zhou Qibin Hou and Ming-Ming Cheng. 2025d. AR-1-to-3: Single Image to Consistent 3D Object Generation via Next-View Prediction. arXiv:2503.12929 [cs.CV] https:\/\/arxiv.org\/abs\/2503.12929"},{"key":"e_1_3_2_1_65_1","unstructured":"Bingchen Zhao Yongshuo Zong Letian Zhang and Timothy Hospedales. 2024. Benchmarking Multi-Image Understanding in Vision and Language Models: Perception Knowledge Reasoning and Multi-Hop Reasoning. arXiv:2406.12742 [cs.CV] https:\/\/arxiv.org\/abs\/2406.12742"},{"key":"e_1_3_2_1_66_1","volume-title":"Reefknot: A Comprehensive Benchmark for Relation Hallucination Evaluation, Analysis and Mitigation in Multimodal Large Language Models. arXiv:2408.09429 [cs.LG] https:\/\/arxiv.org\/abs\/2408.09429","author":"Zheng Kening","year":"2024","unstructured":"Kening Zheng, Junkai Chen, Yibo Yan, Xin Zou, and Xuming Hu. 2024. Reefknot: A Comprehensive Benchmark for Relation Hallucination Evaluation, Analysis and Mitigation in Multimodal Large Language Models. arXiv:2408.09429 [cs.LG] https:\/\/arxiv.org\/abs\/2408.09429"},{"key":"e_1_3_2_1_67_1","unstructured":"Yiyang Zhou Chenhang Cui Jaehong Yoon Linjun Zhang Zhun Deng Chelsea Finn Mohit Bansal and Huaxiu Yao. 2024. Analyzing and Mitigating Object Hallucination in Large Vision-Language Models. arXiv:2310.00754 [cs.LG] https:\/\/arxiv.org\/abs\/2310.00754"},{"key":"e_1_3_2_1_68_1","unstructured":"Deyao Zhu Jun Chen Xiaoqian Shen Xiang Li and Mohamed Elhoseiny. 2023. MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models. arXiv:2304.10592 [cs.CV] https:\/\/arxiv.org\/abs\/2304.10592"},{"key":"e_1_3_2_1_69_1","volume-title":"IBD: Alleviating Hallucinations in Large Vision-Language Models via Image-Biased Decoding. arXiv:2402.18476 [cs.CV] https:\/\/arxiv.org\/abs\/2402.18476","author":"Zhu Lanyun","year":"2024","unstructured":"Lanyun Zhu, Deyi Ji, Tianrun Chen, Peng Xu, Jieping Ye, and Jun Liu. 2024. IBD: Alleviating Hallucinations in Large Vision-Language Models via Image-Biased Decoding. arXiv:2402.18476 [cs.CV] https:\/\/arxiv.org\/abs\/2402.18476"}],"event":{"name":"MM '25: The 33rd ACM International Conference on Multimedia","location":"Dublin Ireland","acronym":"MM '25","sponsor":["SIGMM ACM Special Interest Group on Multimedia"]},"container-title":["Proceedings of the 33rd ACM International Conference on Multimedia"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3746027.3754993","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,12,10]],"date-time":"2025-12-10T04:14:28Z","timestamp":1765340068000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3746027.3754993"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,10,27]]},"references-count":69,"alternative-id":["10.1145\/3746027.3754993","10.1145\/3746027"],"URL":"https:\/\/doi.org\/10.1145\/3746027.3754993","relation":{},"subject":[],"published":{"date-parts":[[2025,10,27]]},"assertion":[{"value":"2025-10-27","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}