{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,15]],"date-time":"2026-06-15T15:57:43Z","timestamp":1781539063223,"version":"3.54.5"},"publisher-location":"New York, NY, USA","reference-count":41,"publisher":"ACM","license":[{"start":{"date-parts":[[2026,6,15]],"date-time":"2026-06-15T00:00:00Z","timestamp":1781481600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/legalcode"}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2026,6,16]]},"DOI":"10.1145\/3805622.3810855","type":"proceedings-article","created":{"date-parts":[[2026,6,15]],"date-time":"2026-06-15T14:42:57Z","timestamp":1781534577000},"page":"2305-2313","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":0,"title":["OpenImplicit: Benchmarking Implicit Reasoning in MLLMs via Open-Ended Evaluation"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0009-0003-1187-1290","authenticated-orcid":false,"given":"Jidong","family":"Li","sequence":"first","affiliation":[{"name":"Shanghai Jiao Tong University, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0000-7292-2184","authenticated-orcid":false,"given":"Xiaofei","family":"Yin","sequence":"additional","affiliation":[{"name":"Ant Security Lab, Ant Group, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-9242-493X","authenticated-orcid":false,"given":"Ya","family":"Guo","sequence":"additional","affiliation":[{"name":"Ant Security Lab, Ant Group, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0007-9422-5233","authenticated-orcid":false,"given":"Shuheng","family":"Zhou","sequence":"additional","affiliation":[{"name":"Ant Security Lab, Ant Group, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-2184-4443","authenticated-orcid":false,"given":"Yi","family":"Tu","sequence":"additional","affiliation":[{"name":"Ant Security Lab, Ant Group, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-4405-1649","authenticated-orcid":false,"given":"Haodong","family":"Zhao","sequence":"additional","affiliation":[{"name":"Shanghai Jiao Tong University, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-1210-8954","authenticated-orcid":false,"given":"Sufeng","family":"Duan","sequence":"additional","affiliation":[{"name":"Shanghai Jiao Tong University, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-5194-1570","authenticated-orcid":false,"given":"Gongshen","family":"Liu","sequence":"additional","affiliation":[{"name":"Shanghai Jiao Tong University, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0008-5784-7225","authenticated-orcid":false,"given":"Huijia","family":"Zhu","sequence":"additional","affiliation":[{"name":"Ant Security Lab, Ant Group, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"320","published-online":{"date-parts":[[2026,6,15]]},"reference":[{"key":"e_1_3_3_2_2_2","doi-asserted-by":"crossref","unstructured":"Jean-Baptiste Alayrac Jeff Donahue Pauline Luc Antoine Miech Iain Barr Yana Hasson Karel Lenc Arthur Mensch Katherine Millican Malcolm Reynolds et\u00a0al. 2022. Flamingo: a visual language model for few-shot learning. Advances in neural information processing systems 35 (2022) 23716\u201323736.","DOI":"10.52202\/068431-1723"},{"key":"e_1_3_3_2_3_2","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2015.279"},{"key":"e_1_3_3_2_4_2","unstructured":"Shuai Bai Yuxuan Cai Ruizhe Chen Keqin Chen Xionghui Chen Zesen Cheng Lianghao Deng Wei Ding Chang Gao Chunjiang Ge et\u00a0al. 2025. Qwen3-VL Technical Report. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2511.21631 (2025)."},{"key":"e_1_3_3_2_5_2","unstructured":"DeepSeek-AI. 2025. DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models."},{"key":"e_1_3_3_2_6_2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2022.semeval-1.74"},{"key":"e_1_3_3_2_7_2","doi-asserted-by":"crossref","unstructured":"Joseph\u00a0L Fleiss. 1971. Measuring nominal scale agreement among many raters. Psychological bulletin 76 5 (1971) 378.","DOI":"10.1037\/h0031619"},{"key":"e_1_3_3_2_8_2","unstructured":"Anisha Gunjal Anthony Wang Elaine Lau Vaskar Nath Yunzhong He Bing Liu and Sean Hendryx. 2025. Rubrics as rewards: Reinforcement learning beyond verifiable domains. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2507.17746 (2025)."},{"key":"e_1_3_3_2_9_2","unstructured":"Daya Guo Dejian Yang Haowei Zhang Junxiao Song Ruoyu Zhang Runxin Xu Qihao Zhu Shirong Ma Peiyi Wang Xiao Bi et\u00a0al. 2025. Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2501.12948 (2025)."},{"key":"e_1_3_3_2_10_2","unstructured":"Qi Jia Haodong Zhao Dun Pei Xiujie Song Shibo Wang Zijian Chen Zicheng Zhang Xiangyang Zhu and Guangtao Zhai. 2026. UniDial-EvalKit: A Unified Toolkit for Evaluating Multi-Faceted Conversational Abilities. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2603.23160 (2026)."},{"key":"e_1_3_3_2_11_2","unstructured":"Douwe Kiela Hamed Firooz Aravind Mohan Vedanuj Goswami Amanpreet Singh Pratik Ringshia and Davide Testuggine. 2020. The hateful memes challenge: Detecting hate speech in multimodal memes. Advances in neural information processing systems 33 (2020) 2611\u20132624."},{"key":"e_1_3_3_2_12_2","unstructured":"Jiaze Li Jingyang Chen Yuxun Qu Shijie Xu Zhenru Lin Junyou Zhu Boshen Xu Wenhui Tan Pei Fu Jianzhong Ju Zhenbo Luo and Jian Luan. 2025. Xiaomi MiMo-VL-Miloco Technical Report. arxiv:https:\/\/arXiv.org\/abs\/2512.17436\u00a0[cs.CV] https:\/\/arxiv.org\/abs\/2512.17436"},{"key":"e_1_3_3_2_13_2","unstructured":"Jidong Li Lingyong Fang Haodong Zhao Sufeng Duan and Gongshen Liu. 2025. Judge Before Answer: Can MLLM Discern the False Premise in Question? arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2510.10965 (2025)."},{"key":"e_1_3_3_2_14_2","first-page":"19730","volume-title":"International conference on machine learning","author":"Li Junnan","year":"2023","unstructured":"Junnan Li, Dongxu Li, Silvio Savarese, and Steven Hoi. 2023. Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models. In International conference on machine learning. PMLR, 19730\u201319742."},{"key":"e_1_3_3_2_15_2","doi-asserted-by":"crossref","unstructured":"Haotian Liu Chunyuan Li Qingyang Wu and Yong\u00a0Jae Lee. 2023. Visual instruction tuning. Advances in neural information processing systems 36 (2023) 34892\u201334916.","DOI":"10.52202\/075280-1516"},{"key":"e_1_3_3_2_16_2","first-page":"216","volume-title":"European conference on computer vision","author":"Liu Yuan","year":"2024","unstructured":"Yuan Liu, Haodong Duan, Yuanhan Zhang, Bo Li, Songyang Zhang, Wangbo Zhao, Yike Yuan, Jiaqi Wang, Conghui He, Ziwei Liu, et\u00a0al. 2024. Mmbench: Is your multi-modal model an all-around player?. In European conference on computer vision. Springer, 216\u2013233."},{"key":"e_1_3_3_2_17_2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2025.acl-long.46"},{"key":"e_1_3_3_2_18_2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2025.acl-long.927"},{"key":"e_1_3_3_2_19_2","volume-title":"Introducing GPT-5-2","year":"2025","unstructured":"OpenAI. 2025. Introducing GPT-5-2. https:\/\/openai.com\/zh-Hans-CN\/index\/introducing-gpt-5-2\/"},{"key":"e_1_3_3_2_20_2","doi-asserted-by":"crossref","unstructured":"Long Ouyang Jeffrey Wu Xu Jiang Diogo Almeida Carroll Wainwright Pamela Mishkin Chong Zhang Sandhini Agarwal Katarina Slama Alex Ray et\u00a0al. 2022. Training language models to follow instructions with human feedback. Advances in neural information processing systems 35 (2022) 27730\u201327744.","DOI":"10.52202\/068431-2011"},{"key":"e_1_3_3_2_21_2","doi-asserted-by":"crossref","unstructured":"Shraman Pramanick Dimitar Dimitrov Rituparna Mukherjee Shivam Sharma Md\u00a0Shad Akhtar Preslav Nakov and Tanmoy Chakraborty. 2021. Detecting harmful memes and their targets. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2110.00413 (2021).","DOI":"10.18653\/v1\/2021.findings-acl.246"},{"key":"e_1_3_3_2_22_2","unstructured":"Aashish\u00a0Anantha Ramakrishnan Aadarsh\u00a0Anantha Ramakrishnan and Dongwon Lee. 2025. IRONIC: Coherence-Aware Reasoning Chains for Multi-Modal Sarcasm Detection. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2505.16258 (2025)."},{"key":"e_1_3_3_2_23_2","unstructured":"John Schulman Filip Wolski Prafulla Dhariwal Alec Radford and Oleg Klimov. 2017. Proximal policy optimization algorithms. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/1707.06347 (2017)."},{"key":"e_1_3_3_2_24_2","unstructured":"Zhihong Shao Peiyi Wang Qihao Zhu Runxin Xu Junxiao Song Xiao Bi Haowei Zhang Mingchuan Zhang YK Li Yang Wu et\u00a0al. 2024. Deepseekmath: Pushing the limits of mathematical reasoning in open language models. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2402.03300 (2024)."},{"key":"e_1_3_3_2_25_2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2025.naacl-long.199"},{"key":"e_1_3_3_2_26_2","unstructured":"5 Team Aohan Zeng Xin Lv Qinkai Zheng Zhenyu Hou Bin Chen Chengxing Xie Cunxiang Wang and Others. 2025. GLM-4.5: Agentic Reasoning and Coding (ARC) Foundation Models. arxiv:https:\/\/arXiv.org\/abs\/2508.06471\u00a0[cs.CL] https:\/\/arxiv.org\/abs\/2508.06471"},{"key":"e_1_3_3_2_27_2","unstructured":"Gemini Team Rohan Anil Sebastian Borgeaud Jean-Baptiste Alayrac Jiahui Yu Radu Soricut Johan Schalkwyk Andrew\u00a0M Dai Anja Hauth Katie Millican et\u00a0al. 2023. Gemini: a family of highly capable multimodal models. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2312.11805 (2023)."},{"key":"e_1_3_3_2_28_2","unstructured":"Kimi Team Angang Du Bohong Yin Bowei Xing Bowen Qu Bowen Wang Cheng Chen Chenlin Zhang Chenzhuang Du Chu Wei et\u00a0al. 2025. Kimi-vl technical report. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2504.07491 (2025)."},{"key":"e_1_3_3_2_29_2","unstructured":"Qwen Team. 2025. Qwen3 Technical Report. arxiv:https:\/\/arXiv.org\/abs\/2505.09388\u00a0[cs.CL] https:\/\/arxiv.org\/abs\/2505.09388"},{"key":"e_1_3_3_2_30_2","unstructured":"V Team Wenyi Hong Wenmeng Yu Xiaotao Gu Guo Wang Guobing Gan Haomiao Tang Jiale Cheng Ji Qi Junhui Ji et\u00a0al. 2025. GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2507.01006 (2025)."},{"key":"e_1_3_3_2_31_2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2025.findings-naacl.220"},{"key":"e_1_3_3_2_32_2","unstructured":"Hugo Touvron Thibaut Lavril Gautier Izacard Xavier Martinet Marie-Anne Lachaux Timoth\u00e9e Lacroix Baptiste Rozi\u00e8re Naman Goyal Eric Hambro Faisal Azhar et\u00a0al. 2023. Llama: Open and efficient foundation language models. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2302.13971 (2023)."},{"key":"e_1_3_3_2_33_2","unstructured":"Weiyun Wang Zhangwei Gao Lixin Gu Hengjun Pu Long Cui Xingguang Wei Zhaoyang Liu Linglin Jing Shenglong Ye Jie Shao et\u00a0al. 2025. Internvl3. 5: Advancing open-source multimodal models in versatility reasoning and efficiency. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2508.18265 (2025)."},{"key":"e_1_3_3_2_34_2","unstructured":"An Yang Bowen Yu Chengyuan Li Dayiheng Liu Fei Huang Haoyan Huang Jiandong Jiang Jianhong Tu Jianwei Zhang Jingren Zhou Junyang Lin Kai Dang Kexin Yang Le Yu Mei Li Minmin Sun Qin Zhu Rui Men Tao He Weijia Xu Wenbiao Yin Wenyuan Yu Xiafei Qiu Xingzhang Ren Xinlong Yang Yong Li Zhiying Xu and Zipeng Zhang. 2025. Qwen2.5-1M Technical Report. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2501.15383 (2025)."},{"key":"e_1_3_3_2_35_2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2025.acl-long.1275"},{"key":"e_1_3_3_2_36_2","doi-asserted-by":"crossref","unstructured":"Yixin Yang Zheng Li Qingxiu Dong Heming Xia and Zhifang Sui. 2024. Can large multimodal models uncover deep semantics behind images? arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2402.11281 (2024).","DOI":"10.18653\/v1\/2024.findings-acl.113"},{"key":"e_1_3_3_2_37_2","unstructured":"Xiaofei Yin Yijie Hong Ya Guo Yi Tu Weiqiang Wang Gongshen Liu et\u00a0al. 2025. InsightVision: A Comprehensive Multi-Level Chinese-based Benchmark for Evaluating Implicit Visual Semantics in Large Vision Language Models. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2502.15812 (2025)."},{"key":"e_1_3_3_2_38_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.00913"},{"key":"e_1_3_3_2_39_2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2025.acl-long.736"},{"key":"e_1_3_3_2_40_2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2025.acl-long.700"},{"key":"e_1_3_3_2_41_2","doi-asserted-by":"crossref","unstructured":"Dongyu Zhang Xingyuan Lu Mulin Zhuang Senqi Yang and Hongjun Chen. 2025. Multimodal metaphor recognition based on chain-of-cognition prompting. Cognitive Systems Research 91 (2025) 101356.","DOI":"10.1016\/j.cogsys.2025.101356"},{"key":"e_1_3_3_2_42_2","doi-asserted-by":"crossref","unstructured":"Dongyu Zhang Shengcheng Yin Jingwei Yu Zhiyao Wu Zhen Li Chengpei Xu Xiaoxia Wang and Feng Xia. 2025. Towards multimodal metaphor understanding: a Chinese dataset and model for metaphor mapping identification. ACM Transactions on Asian and Low-Resource Language Information Processing 24 12 (2025) 1\u201325.","DOI":"10.1145\/3773989"}],"event":{"name":"ICMR '26: International Conference on Multimedia Retrieval","location":"Amsterdam The Netherlands","acronym":"ICMR '26","sponsor":["SIGMM ACM Special Interest Group on Multimedia"]},"container-title":["Proceedings of the 2026 International Conference on Multimedia Retrieval"],"original-title":[],"deposited":{"date-parts":[[2026,6,15]],"date-time":"2026-06-15T15:43:24Z","timestamp":1781538204000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3805622.3810855"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,6,15]]},"references-count":41,"alternative-id":["10.1145\/3805622.3810855","10.1145\/3805622"],"URL":"https:\/\/doi.org\/10.1145\/3805622.3810855","relation":{},"subject":[],"published":{"date-parts":[[2026,6,15]]},"assertion":[{"value":"2026-06-15","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}