{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,11]],"date-time":"2026-06-11T21:26:57Z","timestamp":1781213217675,"version":"3.54.1"},"publisher-location":"New York, NY, USA","reference-count":53,"publisher":"ACM","funder":[{"name":"Japan Science and Technology Agency &#x28;JST&#x29; and the Agency for Science, Technology and Research &#x28;A&#x2a;STAR&#x29;","award":["R24I6IR133"],"award-info":[{"award-number":["R24I6IR133"]}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2026,4,13]]},"DOI":"10.1145\/3774904.3792793","type":"proceedings-article","created":{"date-parts":[[2026,4,9]],"date-time":"2026-04-09T21:54:39Z","timestamp":1775771679000},"page":"8262-8273","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":1,"title":["LaV-CoT: Language-Aware Visual CoT with Multi-Aspect Reward Optimization for Multilingual Text-Centric VQA"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0009-0005-5651-9033","authenticated-orcid":false,"given":"Jing","family":"Huang","sequence":"first","affiliation":[{"name":"Ant Digital Technologies, Ant Group, Singapore, Singapore"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0004-2433-1389","authenticated-orcid":false,"given":"Zhiya","family":"Tan","sequence":"additional","affiliation":[{"name":"College of Computing and Data Science, Nanyang Technological University, Singapore, Singapore and Ant Digital Technologies, Ant Group, Singapore, Singapore"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0009-5643-0441","authenticated-orcid":false,"given":"Shutao","family":"Gong","sequence":"additional","affiliation":[{"name":"Ant Digital Technologies, Ant Group, Changsha, Hunan, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0005-7872-8610","authenticated-orcid":false,"given":"Fanwei","family":"Zeng","sequence":"additional","affiliation":[{"name":"Ant Digital Technologies, Ant Group, Hangzhou, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-4675-7055","authenticated-orcid":false,"given":"Joey Tianyi","family":"Zhou","sequence":"additional","affiliation":[{"name":"CFAR, Agency for Science, Technology and Research, Singapore, Singapore and IHPC, Agency for Science, Technology and Research, Singapore, Singapore"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-7634-9992","authenticated-orcid":false,"given":"Changtao","family":"Miao","sequence":"additional","affiliation":[{"name":"Ant Group, Hangzhou, Zhejiang, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0002-2154-9679","authenticated-orcid":false,"given":"Huazhe","family":"Tan","sequence":"additional","affiliation":[{"name":"Ant Digital Technologies, Ant Group, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0004-1379-1830","authenticated-orcid":false,"given":"Weibin","family":"Yao","sequence":"additional","affiliation":[{"name":"Ant Digital Technologies, Ant Group, Hangzhou, Singapore"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-8554-6886","authenticated-orcid":false,"given":"Jianshu","family":"Li","sequence":"additional","affiliation":[{"name":"Ant Digital Technologies, Ant Group, Singapore, Singapore"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"320","published-online":{"date-parts":[[2026,4,12]]},"reference":[{"key":"e_1_3_2_1_1_1","doi-asserted-by":"crossref","unstructured":"Jean-Baptiste Alayrac Jeff Donahue Pauline Luc Antoine Miech Iain Barr Yana Hasson Karel Lenc Arthur Mensch Katie Millican Malcolm Reynolds Roman Ring Eliza Rutherford Serkan Cabi Tengda Han Zhitao Gong Sina Samangooei Marianne Monteiro Jacob Menick Sebastian Borgeaud Andrew Brock Aida Nematzadeh Sahand Sharifzadeh Mikolaj Binkowski Ricardo Barreira Oriol Vinyals Andrew Zisserman and Karen Simonyan. 2022. Flamingo: a Visual Language Model for Few-Shot Learning. arXiv:2204.14198 [cs.CV] https:\/\/arxiv.org\/abs\/2204.14198","DOI":"10.52202\/068431-1723"},{"key":"e_1_3_2_1_2_1","unstructured":"Shuai Bai Keqin Chen Xuejing Liu Jialin Wang Wenbin Ge Sibo Song Kai Dang Peng Wang Shijie Wang Jun Tang Humen Zhong Yuanzhi Zhu Mingkun Yang Zhaohai Li Jianqiang Wan Pengfei Wang Wei Ding Zheren Fu Yiheng Xu Jiabo Ye Xi Zhang Tianbao Xie Zesen Cheng Hang Zhang Zhibo Yang Haiyang Xu and Junyang Lin. 2025. Qwen2.5-VL Technical Report. arXiv:2502.13923 [cs.CV] https:\/\/arxiv.org\/abs\/2502.13923"},{"key":"e_1_3_2_1_3_1","unstructured":"Xi Chen Xiao Wang Soravit Changpinyo Anthony J Piergiovanni Piotr Padlewski Daniel Salz Sebastian Goodman Adam Grycner Basil Mustafa Lucas Beyer et al. 2022. PaLI: A Jointly-Scaled Multilingual Language-Image Model. arXiv:2209.06794 [cs.CV] https:\/\/arxiv.org\/abs\/2209.06794"},{"key":"e_1_3_2_1_4_1","unstructured":"Tianzhe Chu Yuexiang Zhai Jihan Yang Shengbang Tong Saining Xie Dale Schuurmans Quoc V. Le Sergey Levine and Yi Ma. 2025. SFT Memorizes RL Generalizes: A Comparative Study of Foundation Model Post-training. arXiv:2501.17161 [cs.AI] https:\/\/arxiv.org\/abs\/2501.17161"},{"key":"e_1_3_2_1_5_1","unstructured":"Karl Cobbe Vineet Kosaraju Mohammad Bavarian Mark Chen Heewoo Jun Lukasz Kaiser Matthias Plappert Jerry Tworek Jacob Hilton Reiichiro Nakano Christopher Hesse and John Schulman. 2021. Training Verifiers to Solve Math Word Problems. arXiv:2110.14168 [cs.LG] https:\/\/arxiv.org\/abs\/2110.14168"},{"key":"e_1_3_2_1_6_1","volume-title":"Gemini: A Family of Highly Capable Multimodal Models. https:\/\/arxiv.org\/abs\/2312.11805","author":"DeepMind Google","year":"2023","unstructured":"Google DeepMind. 2023. Gemini: A Family of Highly Capable Multimodal Models. https:\/\/arxiv.org\/abs\/2312.11805"},{"key":"e_1_3_2_1_7_1","unstructured":"Haodong Duan Xinyu Fang Junming Yang Xiangyu Zhao Yuxuan Qiao Mo Li Amit Agarwal Zhe Chen Lin Chen Yuan Liu Yubo Ma Hailong Sun Yifan Zhang Shiyin Lu Tack Hwa Wong Weiyun Wang Peiheng Zhou Xiaozhe Li Chaoyou Fu Junbo Cui Jixuan Chen Enxin Song Song Mao Shengyuan Ding Tianhao Liang Zicheng Zhang Xiaoyi Dong Yuhang Zang Pan Zhang Jiaqi Wang Dahua Lin and Kai Chen. 2025. VLMEvalKit: An Open-Source Toolkit for Evaluating Large Multi-Modality Models. arXiv:2407.11691 [cs.CV] https:\/\/arxiv.org\/abs\/2407.11691"},{"key":"e_1_3_2_1_8_1","unstructured":"Ling Fu Zhebin Kuang Jiajun Song Mingxin Huang Biao Yang Yuzhe Li Linghao Zhu Qidi Luo Xinyu Wang Hao Lu Zhang Li Guozhi Tang Bin Shan Chunhui Lin Qi Liu Binghong Wu Hao Feng Hao Liu Can Huang Jingqun Tang Wei Chen Lianwen Jin Yuliang Liu and Xiang Bai. 2025. OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning. arXiv:2501.00321 [cs.CV] https:\/\/arxiv.org\/abs\/2501.00321"},{"key":"e_1_3_2_1_9_1","unstructured":"Team GLM: Aohan Zeng Bin Xu Bowen Wang Chenhui Zhang Da Yin Dan Zhang Diego Rojas Guanyu Feng Hanlin Zhao Hanyu Lai Hao Yu Hongning Wang Jiadai Sun Jiajie Zhang Jiale Cheng Jiayi Gui Jie Tang Jing Zhang Jingyu Sun Juanzi Li Lei Zhao Lindong Wu Lucen Zhong Mingdao Liu Minlie Huang Peng Zhang Qinkai Zheng Rui Lu Shuaiqi Duan Shudan Zhang Shulin Cao Shuxun Yang Weng Lam Tam Wenyi Zhao Xiao Liu Xiao Xia Xiaohan Zhang Xiaotao Gu Xin Lv Xinghan Liu Xinyi Liu Xinyue Yang Xixuan Song Xunkai Zhang Yifan An Yifan Xu Yilin Niu Yuantao Yang Yueyan Li Yushi Bai Yuxiao Dong Zehan Qi Zhaoyu Wang Zhen Yang Zhengxiao Du Zhenyu Hou and Zihan Wang. 2024. ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools. arXiv:2406.12793 [cs.CL] https:\/\/arxiv.org\/abs\/2406.12793"},{"key":"e_1_3_2_1_10_1","unstructured":"Edward J. Hu Yelong Shen Phillip Wallis Zeyuan Allen-Zhu Yuanzhi Li Shean Wang Lu Wang and Weizhu Chen. 2021. LoRA: Low-Rank Adaptation of Large Language Models. arXiv:2106.09685 [cs.CL] https:\/\/arxiv.org\/abs\/2106.09685"},{"key":"e_1_3_2_1_11_1","first-page":"6700","volume-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR). IEEE","author":"Drew","unstructured":"Drew A. Hudson and Christopher D. Manning. 2019. GQA: A New Dataset for Real-World Visual Reasoning and Compositional Question Answering. In Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR). IEEE, Long Beach, CA, USA, 6700-6709."},{"key":"e_1_3_2_1_12_1","unstructured":"Aaron Hurst Adam Lerer Adam P Goucher Adam Perelman Aditya Ramesh Aidan Clark AJ Ostrow Akila Welihinda Alan Hayes Alec Radford et al. 2024. Gpt-4o system card. arXiv preprint arXiv:2410.21276 (2024)."},{"key":"e_1_3_2_1_13_1","volume-title":"Visual Genome: Connecting Language and Vision Using Crowdsourced Dense Image Annotations. arXiv:1602.07332 [cs.CV] https:\/\/arxiv.org\/abs\/1602.07332","author":"Krishna Ranjay","year":"2016","unstructured":"Ranjay Krishna, Yuke Zhu, Oliver Groth, Justin Johnson, Kenji Hata, Joshua Kravitz, Stephanie Chen, Yannis Kalantidis, Li-Jia Li, David A. Shamma, Michael S. Bernstein, and Fei-Fei Li. 2016. Visual Genome: Connecting Language and Vision Using Crowdsourced Dense Image Annotations. arXiv:1602.07332 [cs.CV] https:\/\/arxiv.org\/abs\/1602.07332"},{"key":"e_1_3_2_1_14_1","unstructured":"Bo Li Yuanhan Zhang Dong Guo Renrui Zhang Feng Li Hao Zhang Kaichen Zhang Peiyuan Zhang Yanwei Li Ziwei Liu and Chunyuan Li. 2024b. Li2024LLaVAOneVision. arXiv:2408.03326 [cs.CV] https:\/\/arxiv.org\/abs\/2408.03326"},{"key":"e_1_3_2_1_15_1","volume-title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation. arXiv:2201.12086 [cs.CV] https:\/\/arxiv.org\/abs\/2201.12086","author":"Li Junnan","year":"2022","unstructured":"Junnan Li, Dongxu Li, Caiming Xiong, and Steven Hoi. 2022. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation. arXiv:2201.12086 [cs.CV] https:\/\/arxiv.org\/abs\/2201.12086"},{"key":"e_1_3_2_1_16_1","unstructured":"Liunian Harold Li Mark Yatskar Da Yin Cho-Jui Hsieh and Kai-Wei Chang. 2019. VisualBERT: A Simple and Performant Baseline for Vision and Language. arXiv:1908.03557 [cs.CV] https:\/\/arxiv.org\/abs\/1908.03557"},{"key":"e_1_3_2_1_17_1","volume-title":"Tuomas Rintamaki, Matthieu Le, Ilia Karmanov, Lukas Voegtle, Philipp Fischer, De-An Huang, Timo Roman, Tong Lu, Jose M. Alvarez, Bryan Catanzaro, Jan Kautz, Andrew Tao, Guilin Liu, and Zhiding Yu.","author":"Li Zhiqi","year":"2025","unstructured":"Zhiqi Li, Guo Chen, Shilong Liu, Shihao Wang, Vibashan VS, Yishen Ji, Shiyi Lan, Hao Zhang, Yilin Zhao, Subhashree Radhakrishnan, Nadine Chang, Karan Sapra, Amala Sanjay Deshmukh, Tuomas Rintamaki, Matthieu Le, Ilia Karmanov, Lukas Voegtle, Philipp Fischer, De-An Huang, Timo Roman, Tong Lu, Jose M. Alvarez, Bryan Catanzaro, Jan Kautz, Andrew Tao, Guilin Liu, and Zhiding Yu. 2025. Eagle 2: Building Post-Training Data Strategies from Scratch for Frontier Vision-Language Models. arXiv:2501.14818 [cs.CV] https:\/\/arxiv.org\/abs\/2501.14818"},{"key":"e_1_3_2_1_18_1","volume-title":"Monkey: Image Resolution and Text Label Are Important Things for Large Multi-modal Models. arXiv:2311.06607 [cs.CV] https:\/\/arxiv.org\/abs\/2311.06607","author":"Li Zhang","year":"2024","unstructured":"Zhang Li, Biao Yang, Qiang Liu, Zhiyin Ma, Shuo Zhang, Jingxu Yang, Yabo Sun, Yuliang Liu, and Xiang Bai. 2024a. Monkey: Image Resolution and Text Label Are Important Things for Large Multi-modal Models. arXiv:2311.06607 [cs.CV] https:\/\/arxiv.org\/abs\/2311.06607"},{"key":"e_1_3_2_1_19_1","unstructured":"Hunter Lightman Vineet Kosaraju Yura Burda Harri Edwards Bowen Baker Teddy Lee Jan Leike John Schulman Ilya Sutskever and Karl Cobbe. 2023. Let's Verify Step by Step. arXiv:2305.20050 [cs.LG] https:\/\/arxiv.org\/abs\/2305.20050"},{"key":"e_1_3_2_1_20_1","unstructured":"Tsung-Yi Lin Michael Maire Serge Belongie Lubomir Bourdev Ross Girshick James Hays Pietro Perona Deva Ramanan C. Lawrence Zitnick and Piotr Doll\u00e1r. 2015. Microsoft COCO: Common Objects in Context. arXiv:1405.0312 [cs.CV] https:\/\/arxiv.org\/abs\/1405.0312"},{"key":"e_1_3_2_1_21_1","unstructured":"Haotian Liu Chunyuan Li Qingyang Wu and Yong Jae Lee. 2023a. Visual Instruction Tuning. arXiv:2304.08485 [cs.CV] https:\/\/arxiv.org\/abs\/2304.08485"},{"key":"e_1_3_2_1_22_1","unstructured":"Haotian Liu Chunyuan Li Qingyang Wu and Yong Jae Lee. 2023b. Visual Instruction Tuning. arXiv:2304.08485 [cs.CV] https:\/\/arxiv.org\/abs\/2304.08485"},{"key":"e_1_3_2_1_23_1","unstructured":"Ziyu Liu Zeyi Sun Yuhang Zang Xiaoyi Dong Yuhang Cao Haodong Duan Dahua Lin and Jiaqi Wang. 2025a. Visual-RFT: Visual Reinforcement Fine-Tuning. arXiv:2503.01785 [cs.CV] https:\/\/arxiv.org\/abs\/2503.01785"},{"key":"e_1_3_2_1_24_1","volume-title":"Prefix Grouper: Efficient GRPO Training through Shared-Prefix Forward. arXiv:2506.05433 [cs.LG] https:\/\/arxiv.org\/abs\/2506.05433","author":"Liu Zikang","year":"2025","unstructured":"Zikang Liu, Tongtian Yue, Yepeng Tang, Longteng Guo, Junxian Cai, Qingbin Liu, Xi Chen, and Jing Liu. 2025b. Prefix Grouper: Efficient GRPO Training through Shared-Prefix Forward. arXiv:2506.05433 [cs.LG] https:\/\/arxiv.org\/abs\/2506.05433"},{"key":"e_1_3_2_1_25_1","unstructured":"Haoyu Lu Wen Liu Bo Zhang Bingxuan Wang Kai Dong Bo Liu Jingxiang Sun Tongzheng Ren Zhuoshu Li Hao Yang Yaofeng Sun Chengqi Deng Hanwei Xu Zhenda Xie and Chong Ruan. 2024. DeepSeek-VL: Towards Real-World Vision-Language Understanding. arXiv:2403.05525 [cs.AI] https:\/\/arxiv.org\/abs\/2403.05525"},{"key":"e_1_3_2_1_26_1","unstructured":"Haoyu Lu Wen Liu Bo Zhang Bingxuan Wang Kai Dong and Hao Sun. 2023. DeepSeek-R1: A Reinforcement Learning Enhanced Reasoning Model. Technical Report. DeepSeek AI. https:\/\/deepseek.ai\/reports\/DeepSeek-R1-Technical-Report.pdf"},{"key":"e_1_3_2_1_27_1","volume-title":"Jia Qing Tan, Shafiq Joty, and Enamul Hoque.","author":"Masry Ahmed","year":"2022","unstructured":"Ahmed Masry, Do Xuan Long, Jia Qing Tan, Shafiq Joty, and Enamul Hoque. 2022. ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning. arXiv:2203.10244 [cs.CL] https:\/\/arxiv.org\/abs\/2203.10244"},{"key":"e_1_3_2_1_28_1","doi-asserted-by":"crossref","unstructured":"Minesh Mathew Dimosthenis Karatzas and C. V. Jawahar. 2021. DocVQA: A Dataset for VQA on Document Images. arXiv:2007.00398 [cs.CV] https:\/\/arxiv.org\/abs\/2007.00398","DOI":"10.1109\/WACV48630.2021.00225"},{"key":"e_1_3_2_1_29_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICDAR.2019.00156"},{"key":"e_1_3_2_1_30_1","unstructured":"OpenAI: Aaron Jaech Adam Kalai Adam Lerer Adam Richardson Ahmed El-Kishky Aiden Low Alec Helyar Aleksander Madry Alex Beutel Alex Carney Alex Iftimie Alex Karpenko Alex Tachard Passos Alexander Neitz Alexander Prokofiev Alexander Wei Allison Tam Ally Bennett Ananya Kumar Andre Saraiva Andrea Vallone Andrew Duberstein Andrew Kondrich Andrey Mishchenko Andy Applebaum Angela Jiang Ashvin Nair Barret Zoph Behrooz Ghorbani Ben Rossen Benjamin Sokolowsky Boaz Barak Bob McGrew Borys Minaiev Botao Hao Bowen Baker Brandon Houghton Brandon McKinzie Brydon Eastman Camillo Lugaresi Cary Bassin Cary Hudson Chak Ming Li Charles de Bourcy Chelsea Voss Chen Shen Chong Zhang Chris Koch Chris Orsinger Christopher Hesse Claudia Fischer Clive Chan Dan Roberts Daniel Kappler Daniel Levy Daniel Selsam David Dohan David Farhi David Mely David Robinson Dimitris Tsipras Doug Li Dragos Oprica Eben Freeman Eddie Zhang Edmund Wong Elizabeth Proehl Enoch Cheung Eric Mitchell Eric Wallace Erik Ritter Evan Mays Fan Wang Felipe Petroski Such Filippo Raso Florencia Leoni Foivos Tsimpourlas Francis Song Fred von Lohmann Freddie Sulit Geoff Salmon Giambattista Parascandolo Gildas Chabot Grace Zhao Greg Brockman Guillaume Leclerc Hadi Salman Haiming Bao Hao Sheng Hart Andrin Hessam Bagherinezhad Hongyu Ren Hunter Lightman Hyung Won Chung Ian Kivlichan Ian O'Connell Ian Osband Ignasi Clavera Gilaberte Ilge Akkaya Ilya Kostrikov Ilya Sutskever Irina Kofman Jakub Pachocki James Lennon Jason Wei Jean Harb Jerry Twore Jiacheng Feng Jiahui Yu Jiayi Weng Jie Tang Jieqi Yu Joaquin Qui\u00f1onero Candela Joe Palermo Joel Parish Johannes Heidecke John Hallman John Rizzo Jonathan Gordon Jonathan Uesato Jonathan Ward Joost Huizinga Julie Wang Kai Chen Kai Xiao Karan Singhal Karina Nguyen Karl Cobbe Katy Shi Kayla Wood Kendra Rimbach Keren Gu-Lemberg Kevin Liu Kevin Lu Kevin Stone Kevin Yu Lama Ahmad Lauren Yang Leo Liu Leon Maksin Leyton Ho Liam Fedus Lilian Weng Linden Li Lindsay McCallum Lindsey Held Lorenz Kuhn Lukas Kondraciuk Lukasz Kaiser Luke Metz Madelaine Boyd Maja Trebacz Manas Joglekar Mark Chen Marko Tintor Mason Meyer Matt Jones Matt Kaufer Max Schwarzer Meghan Shah Mehmet Yatbaz Melody Y. Guan Mengyuan Xu Mengyuan Yan Mia Glaese Mianna Chen Michael Lampe Michael Malek Michele Wang Michelle Fradin Mike McClay Mikhail Pavlov Miles Wang Mingxuan Wang Mira Murati Mo Bavarian Mostafa Rohaninejad Nat McAleese Neil Chowdhury Neil Chowdhury Nick Ryder Nikolas Tezak Noam Brown Ofir Nachum Oleg Boiko Oleg Murk Olivia Watkins Patrick Chao Paul Ashbourne Pavel Izmailov Peter Zhokhov Rachel Dias Rahul Arora Randall Lin Rapha Gontijo Lopes Raz Gaon Reah Miyara Reimar Leike Renny Hwang Rhythm Garg Robin Brown Roshan James Rui Shu Ryan Cheu Ryan Greene Saachi Jain Sam Altman Sam Toizer Sam Toyer Samuel Miserendino Sandhini Agarwal Santiago Hernandez Sasha Baker Scott McKinney Scottie Yan Shengjia Zhao Shengli Hu Shibani Santurkar Shraman Ray Chaudhuri Shuyuan Zhang Siyuan Fu Spencer Papay Steph Lin Suchir Balaji Suvansh Sanjeev Szymon Sidor Tal Broda Aidan Clark Tao Wang Taylor Gordon Ted Sanders Tejal Patwardhan Thibault Sottiaux Thomas Degry Thomas Dimson Tianhao Zheng Timur Garipov Tom Stasi Trapit Bansal Trevor Creech Troy Peterson Tyna Eloundou Valerie Qi Vineet Kosaraju Vinnie Monaco Vitchyr Pong Vlad Fomenko Weiyi Zheng Wenda Zhou Wes McCabe Wojciech Zaremba Yann Dubois Yinghai Lu Yining Chen Young Cha Yu Bai Yuchen He Yuchen Zhang Yunyun Wang Zheng Shao and Zhuohan Li. 2024. OpenAI o1 System Card. arXiv:2412.16720 [cs.AI] https:\/\/arxiv.org\/abs\/2412.16720"},{"key":"e_1_3_2_1_31_1","unstructured":"Hao Shao Shengju Qian Han Xiao Guanglu Song Zhuofan Zong Letian Wang Yu Liu and Hongsheng Li. 2024a. Visual CoT: Advancing Multi-Modal Language Models with a Comprehensive Dataset and Benchmark for Chain-of-Thought Reasoning. arXiv:2403.16999 [cs.CV] https:\/\/arxiv.org\/abs\/2403.16999"},{"key":"e_1_3_2_1_32_1","unstructured":"Zhihong Shao Peiyi Wang Qihao Zhu Runxin Xu Junxiao Song Xiao Bi Haowei Zhang Mingchuan Zhang Y. K. Li Y. Wu and Daya Guo. 2024b. DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models. arXiv:2402.03300 [cs.CL] https:\/\/arxiv.org\/abs\/2402.03300"},{"key":"e_1_3_2_1_33_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00851"},{"key":"e_1_3_2_1_34_1","volume-title":"Parrot: Multilingual Visual Instruction Tuning. arXiv:2406.02539 [cs.CV] https:\/\/arxiv.org\/abs\/2406.02539","author":"Sun Hai-Long","year":"2025","unstructured":"Hai-Long Sun, Da-Wei Zhou, Yang Li, Shiyin Lu, Chao Yi, Qing-Guo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang, De-Chuan Zhan, and Han-Jia Ye. 2025. Parrot: Multilingual Visual Instruction Tuning. arXiv:2406.02539 [cs.CV] https:\/\/arxiv.org\/abs\/2406.02539"},{"key":"e_1_3_2_1_35_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.01092"},{"key":"e_1_3_2_1_36_1","volume-title":"Hao Feng, Zhen Zhao, Yangfan He, Kuan Lu, Yanjie Wang, Yuliang Liu, Hao Liu, Xiang Bai, and Can Huang.","author":"Tang Jingqun","year":"2025","unstructured":"Jingqun Tang, Qi Liu, Yongjie Ye, Jinghui Lu, Shu Wei, Chunhui Lin, Wanqing Li, Mohamad Fitri Faiz Bin Mahmood, Hao Feng, Zhen Zhao, Yangfan He, Kuan Lu, Yanjie Wang, Yuliang Liu, Hao Liu, Xiang Bai, and Can Huang. 2025. MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering. arXiv:2405.11985 [cs.CV] https:\/\/arxiv.org\/abs\/2405.11985"},{"key":"e_1_3_2_1_37_1","doi-asserted-by":"crossref","unstructured":"David Wan Jaemin Cho Elias Stengel-Eskin and Mohit Bansal. 2024. Contrastive Region Guidance: Improving Grounding in Vision-Language Models without Training. arXiv:2403.02325 [cs.CV] https:\/\/arxiv.org\/abs\/2403.02325","DOI":"10.1007\/978-3-031-72986-7_12"},{"key":"e_1_3_2_1_38_1","unstructured":"Peng Wang Shuai Bai Sinan Tan Shijie Wang Zhihao Fan Jinze Bai Keqin Chen Xuejing Liu Jialin Wang Wenbin Ge Yang Fan Kai Dang Mengfei Du Xuancheng Ren Rui Men Dayiheng Liu Chang Zhou Jingren Zhou and Junyang Lin. 2024a. Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution. arXiv:2409.12191 [cs.CV] https:\/\/arxiv.org\/abs\/2409.12191"},{"key":"e_1_3_2_1_39_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01838"},{"key":"e_1_3_2_1_40_1","unstructured":"Weiyun Wang Zhangwei Gao Lixin Gu Hengjun Pu Long Cui Xingguang Wei Zhaoyang Liu Linglin Jing Shenglong Ye Jie Shao Zhaokai Wang Zhe Chen Hongjie Zhang Ganlin Yang Haomin Wang Qi Wei Jinhui Yin Wenhao Li Erfei Cui Guanzhou Chen Zichen Ding Changyao Tian Zhenyu Wu Jingjing Xie Zehao Li Bowen Yang Yuchen Duan Xuehui Wang Zhi Hou Haoran Hao Tianyi Zhang Songze Li Xiangyu Zhao Haodong Duan Nianchen Deng Bin Fu Yinan He Yi Wang Conghui He Botian Shi Junjun He Yingtong Xiong Han Lv Lijun Wu Wenqi Shao Kaipeng Zhang Huipeng Deng Biqing Qi Jiaye Ge Qipeng Guo Wenwei Zhang Songyang Zhang Maosong Cao Junyao Lin Kexian Tang Jianfei Gao Haian Huang Yuzhe Gu Chengqi Lyu Huanze Tang Rui Wang Haijun Lv Wanli Ouyang Limin Wang Min Dou Xizhou Zhu Tong Lu Dahua Lin Jifeng Dai Weijie Su Bowen Zhou Kai Chen Yu Qiao Wenhai Wang and Gen Luo. 2025. InternVL3.5: Advancing Open-Source Multimodal Models in Versatility Reasoning and Efficiency. arXiv:2508.18265 [cs.CV] https:\/\/arxiv.org\/abs\/2508.18265"},{"key":"e_1_3_2_1_41_1","unstructured":"Weihan Wang Qingsong Lv Wenmeng Yu Wenyi Hong Ji Qi Yan Wang Junhui Ji Zhuoyi Yang Lei Zhao Xixuan Song Jiazheng Xu Bin Xu Juanzi Li Yuxiao Dong Ming Ding and Jie Tang. 2024b. CogVLM: Visual Expert for Pretrained Language Models. arXiv:2311.03079 [cs.CV] https:\/\/arxiv.org\/abs\/2311.03079"},{"key":"e_1_3_2_1_42_1","volume-title":"F. Xia, Quoc Le, and Denny Zhou.","author":"Wei Jason","year":"2022","unstructured":"Jason Wei, Xuezhi Wang, Dale Schuurmans, Maarten Bosma, Ed H. Chi, F. Xia, Quoc Le, and Denny Zhou. 2022. Chain of Thought Prompting Elicits Reasoning in Large Language Models. https:\/\/arxiv.org\/abs\/2201.11903 Accessed: 2025-08-29."},{"key":"e_1_3_2_1_43_1","unstructured":"Jiaer Xia Yuhang Zang Peng Gao Yixuan Li and Kaiyang Zhou. 2025. Visionary-R1: Mitigating Shortcuts in Visual Reasoning with Reinforcement Learning. arXiv:2505.14677 [cs.CV] https:\/\/arxiv.org\/abs\/2505.14677"},{"key":"e_1_3_2_1_44_1","unstructured":"Baojiao Xiong Boheng Chen Chengzhi Wang Daxiong Luo Dongsheng Xu Dongyang Liu Fan Yang Fangyuan Li Fei Teng Feng Wang Fukang Qin Fuquan Peng Guanxin Tan Guozhi Wang Haibo Yu Haohao Gao Heng Liu Hongbo Yang Hongjian Zou Houzheng Shen Hu Meng Huan Li Hui Tan Jiali Chen Jianzhao Chen Jinliang Zhu Kai Wang Lei Wu Liangbing Liu Liuyang Bian Liyan He Long Liu Peiwen Li Penggang Shi Qi Ding Rui Hu Shuai Cao Shuai Ren Shuang Peng Teng Xie Weiji Chen Weilin Xiang Weixin Wu Xi Yin Xiaoxin Chen Xu Chen Yafei Wen Yan Hu Yanzhou Yang Yina Xie Yinghao Chen Yixuan Liao Yu Geng Yuanjiang Ouyang Yuanzhuo Yang Yuehua He Yushuai Peng Zhaoxiong Wang Zheng Wang Zhibo Zhou and Ziyang Wu. 2025. BlueLM-2.5-3B Technical Report. arXiv:2507.05934 [cs.AI] https:\/\/arxiv.org\/abs\/2507.05934"},{"key":"e_1_3_2_1_45_1","unstructured":"Guowei Xu Peng Jin Ziang Wu Hao Li Yibing Song Lichao Sun and Li Yuan. 2025. LLaVA-CoT: Let Vision Language Models Reason Step-by-Step. arXiv:2411.10440 [cs.CV] https:\/\/arxiv.org\/abs\/2411.10440"},{"key":"e_1_3_2_1_46_1","doi-asserted-by":"crossref","unstructured":"Zhengyuan Yang Zhe Gan Jianfeng Wang Xiaowei Hu Faisal Ahmed Zicheng Liu Yumao Lu and Lijuan Wang. 2022. UniTAB: Unifying Text and Box Outputs for Grounded Vision-Language Modeling. arXiv:2111.12085 [cs.CV] https:\/\/arxiv.org\/abs\/2111.12085","DOI":"10.1007\/978-3-031-20059-5_30"},{"key":"e_1_3_2_1_47_1","volume-title":"Goodman","author":"Zelikman Eric","year":"2022","unstructured":"Eric Zelikman, Yuhuai Wu, Jesse Mu, and Noah D. Goodman. 2022. STaR: Bootstrapping Reasoning With Reasoning. arXiv:2203.14465 [cs.LG] https:\/\/arxiv.org\/abs\/2203.14465"},{"key":"e_1_3_2_1_48_1","doi-asserted-by":"publisher","DOI":"10.1145\/3474085.3475606"},{"key":"e_1_3_2_1_49_1","volume-title":"Xiyang Dai, Lijuan Wang, Lu Yuan, Jenq-Neng Hwang, and Jianfeng Gao.","author":"Zhang Haotian","year":"2022","unstructured":"Haotian Zhang, Pengchuan Zhang, Xiaowei Hu, Yen-Chun Chen, Liunian Harold Li, Xiyang Dai, Lijuan Wang, Lu Yuan, Jenq-Neng Hwang, and Jianfeng Gao. 2022. GLIPv2: Unifying Localization and Vision-Language Understanding. arXiv:2206.05836 [cs.CV] https:\/\/arxiv.org\/abs\/2206.05836"},{"key":"e_1_3_2_1_50_1","unstructured":"Zhuosheng Zhang Aston Zhang Mu Li Hai Zhao George Karypis and Alex Smola. 2024. Multimodal Chain-of-Thought Reasoning in Language Models. arXiv:2302.00923 [cs.CL] https:\/\/arxiv.org\/abs\/2302.00923"},{"key":"e_1_3_2_1_51_1","unstructured":"Kesen Zhao Beier Zhu Qianru Sun and Hanwang Zhang. 2025. Unsupervised Visual Chain-of-Thought Reasoning via Preference Optimization. arXiv:2504.18397 [cs.CV] https:\/\/arxiv.org\/abs\/2504.18397"},{"key":"e_1_3_2_1_52_1","unstructured":"Luowei Zhou Hamid Palangi Lei Zhang Houdong Hu Jason J. Corso and Jianfeng Gao. 2019. Unified Vision-Language Pre-Training for Image Captioning and VQA. arXiv:1909.11059 [cs.CV] https:\/\/arxiv.org\/abs\/1909.11059"},{"key":"e_1_3_2_1_53_1","unstructured":"Jinguo Zhu Weiyun Wang Zhe Chen Zhaoyang Liu Shenglong Ye Lixin Gu Hao Tian Yuchen Duan Weijie Su Jie Shao Zhangwei Gao Erfei Cui Xuehui Wang Yue Cao Yangzhou Liu Xingguang Wei Hongjie Zhang Haomin Wang Weiye Xu Hao Li Jiahao Wang Nianchen Deng Songze Li Yinan He Tan Jiang Jiapeng Luo Yi Wang Conghui He Botian Shi Xingcheng Zhang Wenqi Shao Junjun He Yingtong Xiong Wenwen Qu Peng Sun Penglong Jiao Han Lv Lijun Wu Kaipeng Zhang Huipeng Deng Jiaye Ge Kai Chen Limin Wang Min Dou Lewei Lu Xizhou Zhu Tong Lu Dahua Lin Yu Qiao Jifeng Dai and Wenhai Wang. 2025. InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models. arXiv:2504.10479 [cs.CV] https:\/\/arxiv.org\/abs\/2504.10479"}],"event":{"name":"WWW '26: The ACM Web Conference 2026","location":"Dubai United Arab Emirates","sponsor":["SIGWEB ACM Special Interest Group on Hypertext, Hypermedia, and Web"]},"container-title":["Proceedings of the ACM Web Conference 2026"],"original-title":[],"deposited":{"date-parts":[[2026,4,10]],"date-time":"2026-04-10T16:18:16Z","timestamp":1775837896000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3774904.3792793"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,4,12]]},"references-count":53,"alternative-id":["10.1145\/3774904.3792793","10.1145\/3774904"],"URL":"https:\/\/doi.org\/10.1145\/3774904.3792793","relation":{},"subject":[],"published":{"date-parts":[[2026,4,12]]},"assertion":[{"value":"2026-04-12","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}