{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,15]],"date-time":"2026-06-15T14:56:21Z","timestamp":1781535381129,"version":"3.54.5"},"publisher-location":"New York, NY, USA","reference-count":46,"publisher":"ACM","license":[{"start":{"date-parts":[[2026,6,15]],"date-time":"2026-06-15T00:00:00Z","timestamp":1781481600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/legalcode"}],"funder":[{"name":"National Natural Science Foundation of China","award":["No. 62073054"],"award-info":[{"award-number":["No. 62073054"]}]},{"name":"Hong Kong PhD Fellowship Scheme","award":["No. PF23-87650"],"award-info":[{"award-number":["No. PF23-87650"]}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2026,6,16]]},"DOI":"10.1145\/3805622.3810787","type":"proceedings-article","created":{"date-parts":[[2026,6,15]],"date-time":"2026-06-15T14:42:57Z","timestamp":1781534577000},"page":"2182-2190","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":0,"title":["Benchmarking MLLM-based Web Understanding: Reasoning, Robustness and Safety"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0009-0004-1072-5539","authenticated-orcid":false,"given":"Junliang","family":"Liu","sequence":"first","affiliation":[{"name":"Dalian Maritime University\u200c, Dalian, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-2394-2995","authenticated-orcid":false,"given":"Jingyu","family":"Xiao","sequence":"additional","affiliation":[{"name":"The Chinese University of Hong Kong, Hong Kong, Hong Kong"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-9156-0251","authenticated-orcid":false,"given":"Wenxin","family":"Tang","sequence":"additional","affiliation":[{"name":"Tsinghua University, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0000-9503-2109","authenticated-orcid":false,"given":"Zhixian","family":"Wang","sequence":"additional","affiliation":[{"name":"Nanyang Technological University\u200c, Singapore, Singapore"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0004-6095-7979","authenticated-orcid":false,"given":"Zipeng","family":"Xie","sequence":"additional","affiliation":[{"name":"\u200cXi'an Jiaotong University\u200c, Xi'an, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-9803-8204","authenticated-orcid":false,"given":"Wenxuan","family":"Wang","sequence":"additional","affiliation":[{"name":"Renmin University of China, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0007-9572-9820","authenticated-orcid":false,"given":"Minrun","family":"Zhang","sequence":"additional","affiliation":[{"name":"Wuhan University, Wuhan, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-6882-2711","authenticated-orcid":false,"given":"Shuangheng","family":"Yu","sequence":"additional","affiliation":[{"name":"Dalian Maritime University\u200c, Dalian, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"320","published-online":{"date-parts":[[2026,6,15]]},"reference":[{"key":"e_1_3_3_2_2_2","unstructured":"Mistral AI. 2024. Pixtral-12B. https:\/\/mistral.ai. Release \/ blog announcement."},{"key":"e_1_3_3_2_3_2","unstructured":"Mistral AI. 2025. Pixtral-Large. https:\/\/mistral.ai. Release \/ blog announcement."},{"key":"e_1_3_3_2_4_2","unstructured":"Anthropic. 2025. Claude 4 Sonnet. https:\/\/www.anthropic.com. Model card \/ product page."},{"key":"e_1_3_3_2_5_2","first-page":"10234","volume-title":"Advances in Neural Information Processing Systems","author":"Awal Rabiul","year":"2024","unstructured":"Rabiul Awal, Saba Ahmadi, Le Zhang, and Aishwarya Agrawal. 2024. VisMin: Visual Minimal-Change Understanding. In Advances in Neural Information Processing Systems , Vol.\u00a037. 10234\u201310258."},{"key":"e_1_3_3_2_6_2","unstructured":"Rabiul Awal Mahsa Massoud Zichao Li Aarash Feizi Suyuchen Wang Christopher Pal Aishwarya Agrawal David Vazquez Siva Reddy Juan\u00a0A. Rodriguez Perouz Taslakian Spandana Gella and Sai Rajeswar. 2024. WebMMU: A Benchmark for Multimodal Multilingual Website Understanding and Code Generation. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2406.05018 (2024). https:\/\/arxiv.org\/abs\/2406.05018"},{"key":"e_1_3_3_2_7_2","unstructured":"Ada Chen Yongjiang Wu Junyuan Zhang Jingyu Xiao Shu Yang Jen-tse Huang Kun Wang Wenxuan Wang and Shuai Wang. 2025. A Survey on the Safety and Security Threats of Computer-Using Agents: JARVIS or Ultron? arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2505.10924 (2025)."},{"key":"e_1_3_3_2_8_2","volume-title":"Thirty-fifth Conference on Neural Information Processing Systems (NeurIPS) Datasets and Benchmarks Track","author":"Chen Wenhu","year":"2021","unstructured":"Wenhu Chen, Hanwen Zha, Zhiyu Chen, Xiyou Yan, Yu Su, William Wang, Wen-tau Yih, and Yizhou Zhang. 2021. WebQA: Multihop and Multimodal QA. In Thirty-fifth Conference on Neural Information Processing Systems (NeurIPS) Datasets and Benchmarks Track."},{"key":"e_1_3_3_2_9_2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2021.emnlp-main.343"},{"key":"e_1_3_3_2_10_2","unstructured":"Alibaba Cloud and Qwen Team. 2025. Qwen-VL-Plus. https:\/\/qwenlm.github.io. API variant \/ model card."},{"key":"e_1_3_3_2_11_2","unstructured":"Alibaba Cloud and Qwen Team. 2025. Qwen2.5-VL-32B. https:\/\/github.com\/QwenLM\/Qwen2.5-VL. Repository \/ docs."},{"key":"e_1_3_3_2_12_2","unstructured":"Alibaba Cloud and Qwen Team. 2025. Qwen2.5-VL-72B. https:\/\/github.com\/QwenLM\/Qwen2.5-VL. Repository \/ docs."},{"key":"e_1_3_3_2_13_2","unstructured":"Alibaba Cloud and Qwen Team. 2025. Qwen2.5-VL-7B. https:\/\/github.com\/QwenLM\/Qwen2.5-VL. Repository \/ docs."},{"key":"e_1_3_3_2_14_2","unstructured":"Google DeepMind. 2025. Gemini 2.5 Pro. https:\/\/deepmind.google\/technologies\/gemini\/. Product page; for technical details also cite the Gemini 1.5 technical report."},{"key":"e_1_3_3_2_15_2","volume-title":"International Conference on Learning Representations (ICLR)","author":"Deng Xiang","year":"2024","unstructured":"Xiang Deng, Yu Gu, Boyuan Zheng, Shijie Chen, Sam Stevens, Boshi Wang, Huan Sun, and Yu Su. 2024. Mind2Web: Towards a Generalist Agent for the Web. In International Conference on Learning Representations (ICLR). https:\/\/openreview.net\/forum?id=40QXyfcVn4"},{"key":"e_1_3_3_2_16_2","unstructured":"Aarash Feizi Sai Rajeswar Adriana Romero-Soriano Reihaneh Rabbany Spandana Gella Valentina Zantedeschi and Jo\u00e3o Monteiro. 2025. PairBench: A Systematic Framework for Selecting Reliable Judge VLMs. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2502.15210 (2025)."},{"key":"e_1_3_3_2_17_2","unstructured":"Groq. 2025. Llama4-Scout-17B. https:\/\/groq.com. Release notes \/ model page."},{"key":"e_1_3_3_2_18_2","doi-asserted-by":"publisher","DOI":"10.1145\/3696410.3714889"},{"key":"e_1_3_3_2_19_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.01354"},{"key":"e_1_3_3_2_20_2","unstructured":"JunliangLiu-repo. 2025. Detail Infomation of out WebRSSBench. https:\/\/github.com\/JunliangLiu-repo\/WebRRSBench. Accessed: 2026-02-11."},{"key":"e_1_3_3_2_21_2","unstructured":"Shanghai\u00a0AI Lab. 2025. Intern-S1. https:\/\/github.com\/InternLM. Project \/ model card."},{"key":"e_1_3_3_2_22_2","unstructured":"Hugo Lauren\u00e7on L\u00e9o Tronchon and Victor Sanh. 2024. Unlocking the conversion of Web Screenshots into HTML Code with the WebSight Dataset. arxiv:https:\/\/arXiv.org\/abs\/2403.09029\u00a0[cs.HC]"},{"key":"e_1_3_3_2_23_2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2025.findings-acl.815"},{"key":"e_1_3_3_2_24_2","unstructured":"Junpeng Liu Yifan Song Bill\u00a0Yuchen Lin Wai Lam Graham Neubig Yuanzhi Li and Xiang Yue. 2024. VisualWebBench: How Far Have Multimodal LLMs Evolved in Web Page Understanding and Grounding? arxiv:https:\/\/arXiv.org\/abs\/2404.05955\u00a0[cs.CL]"},{"key":"e_1_3_3_2_25_2","unstructured":"Yuan Liu Haodong Duan Yuanhan Zhang Bo Li Songyang Zhang Wangbo Zhao Yike Yuan Jiaqi Wang Conghui He Ziwei Liu et\u00a0al. 2023. MMBench: Is Your Multi-Modal Model an All-Around Player? arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2307.06281 (2023)."},{"key":"e_1_3_3_2_26_2","unstructured":"Moz. 2025. The Moz Top 500 Most Popular Websites. https:\/\/moz.com\/top500. Accessed: 2025-07-01."},{"key":"e_1_3_3_2_27_2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2025.findings-acl.1158"},{"key":"e_1_3_3_2_28_2","unstructured":"OpenAI. 2025. GPT-5. https:\/\/openai.com. Official model page \/ blog; use the specific release URL if available."},{"key":"e_1_3_3_2_29_2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2025.naacl-long.199"},{"key":"e_1_3_3_2_30_2","doi-asserted-by":"crossref","unstructured":"Wenxin Tang Jingyu Xiao Wenxuan Jiang Xi Xiao Yuhang Wang Xuxin Tang Qing Li Yuehe Ma Junliang Liu Shisong Tang et\u00a0al. 2025. SlideCoder: Layout-aware RAG-enhanced Hierarchical Slide Generation from Design. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2506.07964 (2025).","DOI":"10.18653\/v1\/2025.emnlp-main.458"},{"key":"e_1_3_3_2_31_2","unstructured":"Vercel. 2025. V0 Community. https:\/\/v0.app\/templates. Accessed: 2025-09-25."},{"key":"e_1_3_3_2_32_2","unstructured":"Yuxuan Wan Yi Dong Jingyu Xiao Yintong Huo Wenxuan Wang and Michael\u00a0R Lyu. 2024. MRWeb: An Exploration of Generating Multi-Page Resource-Aware Web Code from UI Designs. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2412.15310 (2024)."},{"key":"e_1_3_3_2_33_2","unstructured":"Yuxuan Wan Tingshuo Liang Jiakai Xu Jingyu Xiao Yintong Huo and Michael\u00a0R Lyu. 2025. Automatically Generating Web Applications from Requirements Via Multi-Agent Test-Driven Development. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2509.25297 (2025)."},{"key":"e_1_3_3_2_34_2","unstructured":"Sihua Wang Yifan Gao Qian Sun Xin Fan Xianjun Liu Song Yang and Jian Tang. 2024. Design2Code: Benchmarking Multimodal Code Generation for Automated Front-End Engineering. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2406.03096 (2024). https:\/\/arxiv.org\/abs\/2406.03096"},{"key":"e_1_3_3_2_35_2","unstructured":"World Wide Web Consortium (W3C). 2018. Web Content Accessibility Guidelines (WCAG) 2.1. https:\/\/www.w3.org\/TR\/WCAG21\/. W3C Recommendation."},{"key":"e_1_3_3_2_36_2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2025.acl-long.508"},{"key":"e_1_3_3_2_37_2","unstructured":"Jingyu Xiao Jiantong Qin Shuoqi Li Man\u00a0Ho Lam Yuxuan Wan Jen tse Huang Yintong Huo and Michael\u00a0R. Lyu. 2026. ComUICoder: Component-based Reusable UI Code Generation for Complex Websites via Semantic Segmentation and Element-wise Feedback. arxiv:https:\/\/arXiv.org\/abs\/2602.19276\u00a0[cs.SE] https:\/\/arxiv.org\/abs\/2602.19276"},{"key":"e_1_3_3_2_38_2","doi-asserted-by":"crossref","unstructured":"Jingyu Xiao Yuxuan Wan Yintong Huo Zixin Wang Xinyi Xu Wenxuan Wang Zhiyao Xu Yuhang Wang and Michael\u00a0R Lyu. 2025. Interaction2Code: Benchmarking MLLM-based Interactive Webpage Code Generation from Interactive Prototyping. 2025 40th IEEE\/ACM International Conference on Automated Software Engineering (ASE) (2025).","DOI":"10.1109\/ASE63991.2025.00028"},{"key":"e_1_3_3_2_39_2","unstructured":"Jingyu Xiao Ming Wang Man\u00a0Ho Lam Yuxuan Wan Junliang Liu Yintong Huo and Michael\u00a0R Lyu. 2025. Designbench: A comprehensive benchmark for mllm-based front-end code generation. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2506.06251 (2025)."},{"key":"e_1_3_3_2_40_2","unstructured":"Jingyu Xiao Zhongyi Zhang Yuxuan Wan Yintong Huo Yang Liu and Michael\u00a0R Lyu. 2025. EfficientUICoder: Efficient MLLM-based UI Code Generation via Input and Output Token Compression. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2509.12159 (2025)."},{"key":"e_1_3_3_2_41_2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2025.naacl-long.188"},{"key":"e_1_3_3_2_42_2","unstructured":"Zhou Xu Bowen Zhou Qi Wang Shuwen Feng and Jingyu Xiao. 2026. Spatio-Temporal Token Pruning for Efficient High-Resolution GUI Agents. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2602.23235 (2026)."},{"key":"e_1_3_3_2_43_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.00913"},{"key":"e_1_3_3_2_44_2","first-page":"112134","volume-title":"Advances in Neural Information Processing Systems (NeurIPS)","author":"Yun Sukmin","year":"2024","unstructured":"Sukmin Yun, Haokun Lin, Rusiru Thushara, Mohammad\u00a0Qazim Bhat, Yongxin Wang, Zutao Jiang, Mingkai Deng, Jinhong Wang, Tianhua Tao, Junbo Li, Haonan Li, Preslav Nakov, Timothy Baldwin, Zhengzhong Liu, Eric\u00a0P. Xing, Xiaodan Liang, and Zhiqiang Shen. 2024. Web2Code: A Large-scale Webpage-to-Code Dataset and Evaluation Framework for Multimodal LLMs. In Advances in Neural Information Processing Systems (NeurIPS) , Vol.\u00a037. Curran Associates, Inc., 112134\u2013112157."},{"key":"e_1_3_3_2_45_2","unstructured":"Chaoyun Zhang Shilin He Jiaxu Qian Bowen Li Liqun Li Si Qin Yu Kang Minghua Ma Guyue Liu Qingwei Lin et\u00a0al. 2024. Large language model-brained gui agents: A survey. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2411.18279 (2024)."},{"key":"e_1_3_3_2_46_2","unstructured":"Bowen Zhou Zhou Xu Wanli Li Jingyu Xiao and Haoqian Wang. 2026. Efficient Long-Horizon GUI Agents via Training-Free KV Cache Compression. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2603.00188 (2026)."},{"key":"e_1_3_3_2_47_2","unstructured":"Qingsong Zou Jingyu Xiao Qing Li Zhi Yan Yuhang Wang Li Xu Wenxuan Wang Kuofeng Gao Ruoyu Li and Yong Jiang. 2025. QueryAttack: Jailbreaking Aligned Large Language Models Using Structured Non-natural Query Language. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2502.09723 (2025)."}],"event":{"name":"ICMR '26: International Conference on Multimedia Retrieval","location":"Amsterdam The Netherlands","acronym":"ICMR '26","sponsor":["SIGMM ACM Special Interest Group on Multimedia"]},"container-title":["Proceedings of the 2026 International Conference on Multimedia Retrieval"],"original-title":[],"deposited":{"date-parts":[[2026,6,15]],"date-time":"2026-06-15T14:51:02Z","timestamp":1781535062000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3805622.3810787"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,6,15]]},"references-count":46,"alternative-id":["10.1145\/3805622.3810787","10.1145\/3805622"],"URL":"https:\/\/doi.org\/10.1145\/3805622.3810787","relation":{},"subject":[],"published":{"date-parts":[[2026,6,15]]},"assertion":[{"value":"2026-06-15","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}