{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,16]],"date-time":"2026-07-16T03:59:53Z","timestamp":1784174393720,"version":"3.55.0"},"reference-count":64,"publisher":"Springer Science and Business Media LLC","issue":"10","license":[{"start":{"date-parts":[[2025,6,27]],"date-time":"2025-06-27T00:00:00Z","timestamp":1750982400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2025,6,27]],"date-time":"2025-06-27T00:00:00Z","timestamp":1750982400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62376244"],"award-info":[{"award-number":["62376244"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Int J Comput Vis"],"published-print":{"date-parts":[[2025,10]]},"DOI":"10.1007\/s11263-025-02491-7","type":"journal-article","created":{"date-parts":[[2025,6,27]],"date-time":"2025-06-27T13:46:40Z","timestamp":1751032000000},"page":"6794-6812","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":34,"title":["TokenPacker: Efficient Visual Projector for Multimodal LLM"],"prefix":"10.1007","volume":"133","author":[{"ORCID":"https:\/\/orcid.org\/0009-0001-5902-7553","authenticated-orcid":false,"given":"Wentong","family":"Li","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yuqian","family":"Yuan","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jian","family":"Liu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Dongqi","family":"Tang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Song","family":"Wang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jie","family":"Qin","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jianke","family":"Zhu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Lei","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2025,6,27]]},"reference":[{"key":"2491_CR1","unstructured":"Achiam, Josh, Adler, Steven, Agarwal, Sandhini, Ahmad, Lamam, Akkaya, Ilge, Aleman, Florencia\u00a0Leoni, Almeida, Diogo, Altenschmidt, Janko, Altman, Sam, Anadkat, Shyamal, et\u00a0al. (2023). Gpt-4 technical report. arXiv preprint arXiv:2303.08774."},{"key":"2491_CR2","unstructured":"Alayrac, Jean-Baptiste, Donahue, Jeff, Luc, Pauline, Miech, Antoine, Barr, Iain, Hasson, Yana, Lenc, Karel, Mensch, Arthur, Millican, Katherine, Reynolds, Malcolm, et\u00a0al. (2022). Flamingo: a visual language model for few-shot learning. In NeurIPS."},{"key":"2491_CR3","unstructured":"Bai, Jinze, Bai, Shuai, Chu, Yunfei, Cui, Zeyu, Dang, Kai, Deng, Xiaodong, Fan, Yang, Ge, Wenbin,\u00a0Han, Yu, Huang, Fei, Hui, Binyuan, Ji, Luo, Li, Mei, Lin, Junyang, Lin, Runji, Liu, Dayiheng, Liu, Gao, Lu, Chengqiang, Lu, Keming, Ma, Jianxin, Men, Rui, Ren, Xingzhang, Ren, Xuancheng, Tan, Chuanqi, Tan, Sinan, Tu, Jianhong, Wang, Peng, Wang, Shijie, Wang, Wei, Wu, Shengguang, Xu, Benfeng, Xu, Jin,\u00a0Yang, An, Yang, Hao, Yang, Jian, Yang, Shusheng, Yao, Yang, Yu, Bowen, Yuan, Hongyi, Yuan, Zheng, Zhang, Jianwei, Zhang, Xingxuan, Zhang, Yichang, Zhang, Zhenru, Zhou, Chang, Zhou, Jingren, Zhou, Xiaohuan, & Zhu, Tianhang. (2023). Qwen technical report. arXiv preprint arXiv:2309.16609"},{"key":"2491_CR4","unstructured":"Bai, Jinze, Bai, Shuai, Yang, Shusheng, Wang, Shijie, Tan, Sinan, Wang, Peng, Lin, Junyang, Zhou, Chang, & Zhou, Jingren. (2023). Qwen-vl: A frontier large vision-language model with versatile abilities. arXiv:2308.12966."},{"key":"2491_CR5","unstructured":"Bavishi, Rohan, Elsen, Erich, Hawthorne, Curtis, Nye, Maxwell, Odena, Augustus, Somani, Arushi, & Ta\u015f\u0131rlar, Sa\u011fnak. (2023). Introducing our multimodal models."},{"key":"2491_CR6","unstructured":"Bolya, Daniel, Fu, Cheng-Yang, Dai, Xiaoliang, Zhang, Peizhao, Feichtenhofer, Christoph, & Hoffman, Judy. (2023). Your vit but faster: Token merging. In ICLR."},{"key":"2491_CR7","doi-asserted-by":"crossref","unstructured":"Cha, Junbum, Kang, Wooyoung, Mun, Jonghwan, & Roh, Byungseok. (2024). Locality-enhanced projector for multimodal llm: Honeybee. In CVPR.","DOI":"10.1109\/CVPR52733.2024.01311"},{"key":"2491_CR8","unstructured":"Chen, Keqin, Zhang, Zhao, Zeng, Weili, Zhang, Richong, Zhu, Feng, & Zhao, Rui. (2023). Shikra: Unleashing multimodal llm\u2019s referential dialogue magic. arXiv:2306.15195."},{"key":"2491_CR9","unstructured":"Chen, Zhe, Duan, Yuchen, Wang, Wenhai, He, Junjun, Lu, Tong, Dai, Jifeng, &\u00a0Qiao, Yu. (2022). Vision transformer adapter for dense predictions. arXiv preprint arXiv:2205.08534."},{"key":"2491_CR10","doi-asserted-by":"crossref","unstructured":"Chen, Zhe, Wang, Weiyun, Tian, Hao, Ye, Shenglong, Gao, Zhangwei, Cui, Erfei, Tong, Wenwen, Hu, Kongzhi, Luo, Jiapeng, Ma, Zheng, et\u00a0al. (2024). How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites. arXiv preprint arXiv:2404.16821.","DOI":"10.1007\/s11432-024-4231-5"},{"key":"2491_CR11","doi-asserted-by":"crossref","unstructured":"Chen, Zhe, Wu, Jiannan, Wang, Wenhai, Su, Weijie, Chen, Guo, Xing, Sen, Muyan, Zhong, Zhang, Qinglong, Zhu, Xizhou, Lu, Lewei et\u00a0al. (2024). Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks. In CVPR.","DOI":"10.1109\/CVPR52733.2024.02283"},{"key":"2491_CR12","unstructured":"Chu, Xiangxiang, Qiao, Limeng, Lin, Xinyang, Xu, Shuang, Yang, Yang, Hu, Yiming, Wei, Fei, Zhang, Xinyu,\u00a0Zhang, Bo, Wei, Xiaolin, et\u00a0al. (2023). Mobilevlm: A fast, reproducible and strong vision language assistant for mobile devices. arXiv:2312.16886."},{"key":"2491_CR13","unstructured":"Chu, Xiangxiang, Qiao, Limeng, Zhang, Xinyu, Xu, Shuang, Wei, Fei, Yang, Yang, Sun, Xiaofei, Hu, Yiming, Lin, Xinyang,\u00a0Zhang, Bo, et\u00a0al. (2024). Mobilevlm v2: Faster and stronger baseline for vision language model. arXiv preprint arXiv:2402.03766, 2024."},{"key":"2491_CR14","unstructured":"Dai, Wenliang, Li, Junnan, Li, Dongxu, Tiong, Anthony Meng Huat, Zhao, Junqi, Wang, Weisheng, Li, Boyang, Fung, Pascale, & Hoi, Steven. (2023). Towards general-purpose vision-language models with instruction tuning: Instructblip. In NeurIPS."},{"key":"2491_CR15","unstructured":"Dong, Xiaoyi, Zhang, Pan, Zang, Yuhang, Cao, Yuhang, Wang, Bin, Ouyang, Linke, Wei, Xilin, Zhang, Songyang, Duan, Haodong, Cao, Maosong, et\u00a0al. (2024). Internlm-xcomposer2: Mastering free-form text-image composition and comprehension in vision-language large model. arXiv preprint arXiv:2401.16420."},{"key":"2491_CR16","unstructured":"Dong, Xiaoyi, Zhang, Pan, Zang, Yuhang, Cao, Yuhang, Wang, Bin, Ouyang, Linke, Zhang, Songyang, Duan, Haodong, Zhang, Wenwei, Li, Yining, et\u00a0al. (2024). Internlm-xcomposer2-4khd: A pioneering large vision-language model handling resolutions from 336 pixels to 4k hd. arXiv preprint arXiv:2404.06512."},{"key":"2491_CR17","unstructured":"Dong, Xiaoyi, Zhang, Pan, Zang, Yuhang, Cao, Yuhang, Wang, Bin, Ouyang, Linke, Zhang, Songyang, Duan, Haodong, Zhang, Wenwei, Li, Yining, et\u00a0al. (2024). Internlm-xcomposer2-4khd: A pioneering large vision-language model handling resolutions from 336 pixels to 4k hd. arXiv preprint arXiv:2404.06512."},{"key":"2491_CR18","doi-asserted-by":"crossref","unstructured":"Goyal, Yash, Khot, Tejas, Summers-Stay, Douglas, Batra, Dhruv, & Parikh, Devi. (2017). Making the v in vqa matter: Elevating the role of image understanding in visual question answering. In CVPR, pages 6904\u20136913, 2017.","DOI":"10.1109\/CVPR.2017.670"},{"key":"2491_CR19","doi-asserted-by":"crossref","unstructured":"Gurari, Danna, Li, Qing, Stangl, Abigale J, Guo, Anhong, Lin, Chi, Grauman, Kristen, Luo, Jiebo, & Bigham, Jeffrey, P. (2018). Answering visual questions from blind people: Vizwiz grand challenge. In CVPR.","DOI":"10.1109\/CVPR.2018.00380"},{"key":"2491_CR20","doi-asserted-by":"crossref","unstructured":"Hong, Wenyi, Wang, Weihan, Lv, Qingsong, Xu, Jiazheng, Yu, Wenmeng, Ji, Junhui, Wang, Yan, Wang, Zihan, Dong, Yuxiao, Ding, Ming, et\u00a0al. (2023). Cogagent: A visual language model for gui agents. arXiv preprint arXiv:2312.08914.","DOI":"10.1109\/CVPR52733.2024.01354"},{"key":"2491_CR21","unstructured":"Hu, Wenbo, Dou, Zi-Yi, Li, Liunian\u00a0Harold, Kamath, Amita, Peng, Nanyun, & Chang, Kai-Wei. (2024). Matryoshka query transformer for large vision-language models. arXiv preprint arXiv:2405.19315."},{"key":"2491_CR22","doi-asserted-by":"crossref","unstructured":"Hudson,Drew\u00a0A., & Manning, Christopher\u00a0D. (2019). Gqa: A new dataset for real-world visual reasoning and compositional question answering. In CVPR, pages 6700\u20136709.","DOI":"10.1109\/CVPR.2019.00686"},{"key":"2491_CR23","unstructured":"IDEFICS. Introducing idefics: An open reproduction of state-of-the-art visual language model. https:\/\/huggingface.co\/blog\/idefics, (2023)."},{"key":"2491_CR24","unstructured":"Jiang, Albert\u00a0Q., Sablayrolles, Alexandre, Roux, Antoine, Mensch, Arthur, Savary, Blanche, Bamford, Chris, Chaplot, Devendra\u00a0Singh, Casas, Diego de\u00a0las, Hanna, Emma\u00a0Bou, Bressand, Florian, et\u00a0al. (2024). Mixtral of experts. arXiv:2401.04088."},{"key":"2491_CR25","unstructured":"Jiang, Dongsheng, Liu, Yuchen, Liu, Songlin, Zhang, Xiaopeng, Li, Jin, Xiong, Hongkai, &\u00a0Tian, Qi. (2023). From clip to dino: Visual encoders shout in multi-modal large language models."},{"key":"2491_CR26","doi-asserted-by":"crossref","unstructured":"Kirillov, Alexander, Mintun, Eric, Ravi, Nikhila, Mao, Hanzi, Rolland, Chloe, Gustafson, Laura, Xiao, Tete, Whitehead, Spencer, Berg, Alexander\u00a0C., Lo, Wan-Yen, et\u00a0al. (2023). Segment anything. In ICCV.","DOI":"10.1109\/ICCV51070.2023.00371"},{"key":"2491_CR27","unstructured":"Li, Bo, Zhang, Peiyuan, Yang, Jingkang, Zhang, Yuanhan, Pu, Fanyi, & Liu, Ziwei. (2023). Otterhd: A high-resolution multi-modality model. arXiv preprint arXiv:2311.04219."},{"key":"2491_CR28","doi-asserted-by":"crossref","unstructured":"Li, Bohao, Wang, Rui, Wang, Guangzhi, Ge, Yuying, Ge, Yixiao, & Shan, Ying. (2023). Seed-bench: Benchmarking multimodal llms with generative comprehension. arXiv preprint arXiv:2307.16125.","DOI":"10.1109\/CVPR52733.2024.01263"},{"key":"2491_CR29","unstructured":"Li, Junnan, Li, Dongxu, Savarese, Silvio, & Hoi, Steven C.\u00a0H. (2023). Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models. In ICML."},{"key":"2491_CR30","unstructured":"Li, Yanwei, Zhang, Yuechen, Wang, Chengyao, Zhong, Zhisheng, Chen, Yixin, Chu, Ruihang, Liu, Shaoteng, & Jia, Jiaya. (2024). Mini-gemini: Mining the potential of multi-modality vision language models. arXiv preprint arXiv:2403.18814."},{"key":"2491_CR31","doi-asserted-by":"crossref","unstructured":"Li, Yifan, Du, Yifan, Zhou, Kun, Wang, Jinpeng, Zhao, Wayne\u00a0Xin, & Wen, Ji-Rong. (2023). Evaluating object hallucination in large vision-language models. In EMNLP.","DOI":"10.18653\/v1\/2023.emnlp-main.20"},{"key":"2491_CR32","doi-asserted-by":"crossref","unstructured":"Li, Zhang, Yang, Biao, Liu, Qiang, Ma, Zhiyin, Zhang, Shuo, Yang, Jingxu, Sun, Yabo, Liu, Yuliang, & Bai, Xiang. (2024). Monkey: Image resolution and text label are important things for large multi-modal models. In CVPR.","DOI":"10.1109\/CVPR52733.2024.02527"},{"key":"2491_CR33","doi-asserted-by":"crossref","unstructured":"Lin, Bin, Zhu, Bin, Ye, Yang, Ning, Munan, Jin, Peng, &\u00a0Yuan, Li. (2023). Video-llava: Learning united visual representation by alignment before projection. arXiv preprint arXiv:2311.10122.","DOI":"10.18653\/v1\/2024.emnlp-main.342"},{"key":"2491_CR34","doi-asserted-by":"crossref","unstructured":"Lin, Ziyi, Liu, Chris, Zhang, Renrui, Gao, Peng, Qiu, Longtian, Xiao, Han, Qiu, Han, Lin, Chen, Shao, Wenqi, Chen, Keqin, et\u00a0al. (2023). Sphinx: The joint mixing of weights, tasks, and visual embeddings for multi-modal large language models. arXiv preprint arXiv:2311.07575.","DOI":"10.1007\/978-3-031-73033-7_3"},{"key":"2491_CR35","doi-asserted-by":"publisher","first-page":"635","DOI":"10.1162\/tacl_a_00566","volume":"11","author":"Fangyu Liu","year":"2023","unstructured":"Liu, Fangyu, Emerson, Guy, & Collier, Nigel. (2023). Visual spatial reasoning. Transactions of the Association for Computational Linguistics, 11, 635\u2013651.","journal-title":"Transactions of the Association for Computational Linguistics"},{"key":"2491_CR36","doi-asserted-by":"crossref","unstructured":"Liu, Haotian, Li, Chunyuan, Li, Yuheng, & Lee, Yong\u00a0Jae. (2023). Improved baselines with visual instruction tuning. arXiv:2310.03744.","DOI":"10.1109\/CVPR52733.2024.02484"},{"key":"2491_CR37","unstructured":"Liu, Haotian, Li, Chunyuan, Li, Yuheng,\u00a0Li, Bo, Zhang, Yuanhan, Shen, Sheng, & Lee, Yong\u00a0Jae. (2024). Llava-next: Improved reasoning, ocr, and world knowledge."},{"key":"2491_CR38","unstructured":"Liu, Haotian, Li, Chunyuan, Wu, Qingyang, & Lee, Yong\u00a0Jae. (2023). Visual instruction tuning. In NeurIPS."},{"key":"2491_CR39","doi-asserted-by":"crossref","unstructured":"Liu, Yuan, Duan, Haodong, Zhang, Yuanhan,\u00a0Li, Bo, Zhang, Songyang, Zhao, Wangbo, Yuan, Yike, Wang, Jiaqi, He, Conghui, Liu, Ziwei, et\u00a0al. (2023). Mmbench: Is your multi-modal model an all-around player? arXiv:2307.06281, 2023.","DOI":"10.1007\/978-3-031-72658-3_13"},{"key":"2491_CR40","doi-asserted-by":"crossref","unstructured":"Liu, Yuliang, Li, Zhang, Li, Hongliang, Yu, Wenwen, Huang, Mingxin, Peng, Dezhi, Liu, Mingyu, Chen, Mingrui, Li, Chunyuan, Jin, Lianwen, et\u00a0al. (2023). On the hidden mystery of ocr in large multimodal models. arXiv preprint arXiv:2305.07895.","DOI":"10.1007\/s11432-024-4235-6"},{"key":"2491_CR41","doi-asserted-by":"crossref","unstructured":"Liu, Zhuang, Mao, Hanzi, Wu, Chao-Yuan, Feichtenhofer, Christoph, Darrell, Trevor, & Xie, Saining. (2022). A convnet for the 2020s. In CVPR, pages 11976\u201311986.","DOI":"10.1109\/CVPR52688.2022.01167"},{"key":"2491_CR42","unstructured":"Lu, Haoyu, Liu, Wen,\u00a0Zhang, Bo, Wang, Bingxuan, Dong, Kai,\u00a0Liu, Bo, Sun, Jingxiang, Ren, Tongzheng, Li, Zhuoshu, Sun, Yaofeng, et\u00a0al. (2024). Deepseek-vl: towards real-world vision-language understanding. arXiv preprint arXiv:2403.05525."},{"key":"2491_CR43","doi-asserted-by":"crossref","unstructured":"Mathew, Minesh, Karatzas, Dimosthenis, &\u00a0Jawahar, CV. (2021). Docvqa: A dataset for vqa on document images. In WACV, pages 2200\u20132209.","DOI":"10.1109\/WACV48630.2021.00225"},{"key":"2491_CR44","unstructured":"Radford, Alec, Kim, Jong\u00a0Wook, Hallacy, Chris, Ramesh, Aditya, Goh, Gabriel, Agarwal, Sandhini, Sastry, Girish, Askell, Amanda, Mishkin, Pamela, Clark, Jack, et\u00a0al. (2021). Learning transferable visual models from natural language supervision. In ICML."},{"key":"2491_CR45","unstructured":"Reid, Machel, Savinov, Nikolay, Teplyashin, Denis, Lepikhin, Dmitry, Lillicrap, Timothy, Alayrac, Jean-baptiste, Soricut, Radu, Lazaridou, Angeliki, Firat, Orhan, Schrittwieser, Julian, et\u00a0al. (2024). Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context. arXiv preprint arXiv:2403.05530."},{"key":"2491_CR46","unstructured":"Shang, Yuzhang,\u00a0Cai, Mu, Xu, Bingxin, Lee, Yong\u00a0Jae, & Yan, Yan. (2024). Llava-prumerge: Adaptive token reduction for efficient large multimodal models. arXiv preprint arXiv:2403.15388."},{"key":"2491_CR47","doi-asserted-by":"crossref","unstructured":"Shannon, Claude\u00a0E. (1949). Communication in the presence of noise. Proceedings of the Institute of Radio Engineers, 37(1):10\u201321, 1949.","DOI":"10.1109\/JRPROC.1949.232969"},{"key":"2491_CR48","doi-asserted-by":"crossref","unstructured":"Singh, Amanpreet, Natarajan, Vivek , Shah, Meet,\u00a0Jiang, Yu, Chen, Xinlei, Batra, Dhruv, Parikh, Devi, & Rohrbach, Marcus. (2019). Towards vqa models that can read. In CVPR.","DOI":"10.1109\/CVPR.2019.00851"},{"key":"2491_CR49","unstructured":"InternLM Team. Internlm: A multilingual language model with progressively enhanced capabilities. https:\/\/github.com\/InternLM\/InternLM, 2023."},{"key":"2491_CR50","unstructured":"Touvron, Hugo, Lavril, Thibaut, Izacard, Gautier, Martinet, Xavier, Lachaux, Marie-Anne, Lacroix, Timoth\u00e9e, Rozi\u00e8re, Baptiste, Goyal, Naman, Hambro, Eric, Azhar, Faisal, et\u00a0al. (2023). Llama: Open and efficient foundation language models. arXiv preprint arXiv:2302.13971."},{"key":"2491_CR51","unstructured":"Touvron, Hugo, Martin, Louis, Stone, Kevin, Albert, Peter, Almahairi, Amjad, Babaei, Yasmine, Bashlykov, Nikolay, Batra, Soumya, Bhargava, Prajjwal, Bhosale, Shruti, et\u00a0al. (2023). Llama 2: Open foundation and fine-tuned chat models. arXiv preprint arXiv:2307.09288."},{"key":"2491_CR52","unstructured":"Vicuna. Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality. https:\/\/vicuna.lmsys.org\/, (2023)."},{"key":"2491_CR53","unstructured":"Wang, Weihan, Lv, Qingsong, Yu, Wenmeng, Hong, Wenyi,\u00a0Qi, Ji, Wang, Yan, Ji, Junhui, Yang, Zhuoyi, Zhao, Lei, Song, Xixuan, et\u00a0al. (2023). Cogvlm: Visual expert for pretrained language models. arXiv preprint arXiv:2311.03079."},{"key":"2491_CR54","doi-asserted-by":"crossref","unstructured":"Wei, Haoran, Kong, Lingyu, Chen, Jinyue, Zhao, Liang, Ge, Zheng, Yang, Jinrong, Sun, Jianjian, Han, Chunrui, & Zhang, Xiangyu. (2023). Vary: Scaling up the vision vocabulary for large vision-language models. arXiv preprint arXiv:2312.06109.","DOI":"10.1007\/978-3-031-73235-5_23"},{"key":"2491_CR55","unstructured":"Xu, Ruyi, Yao, Yuan, Guo, Zonghao, Cui, Junbo, Ni, Zanlin, Ge, Chunjiang, Chua, Tat-Seng, Liu, Zhiyuan, Sun, Maosong, & Huang. Gao, (2024). Llava-uhd: an lmm perceiving any aspect ratio and high-resolution images. arXiv preprint arXiv:2403.11703."},{"key":"2491_CR56","doi-asserted-by":"crossref","unstructured":"Ye, Jiabo, Hu, Anwen, Xu, Haiyang, Ye, Qinghao, Yan, Ming, Xu, Guohai, Li, Chenliang, Tian, Junfeng,\u00a0Qian, Qi,\u00a0Zhang, Ji, et\u00a0al. (2023). Ureader: Universal ocr-free visually-situated language understanding with multimodal large language model. arXiv preprint arXiv:2310.05126.","DOI":"10.18653\/v1\/2023.findings-emnlp.187"},{"key":"2491_CR57","unstructured":"Ye, Qinghao, Xu, Haiyang, Xu, Guohai, Ye, Jiabo, Yan, Ming, Zhou, Yiyang, Wang, Junyang, Hu, Anwen, Shi, Pengcheng, Shi, Yaya, et\u00a0al. (2023). mplug-owl: Modularization empowers large language models with multimodality. arXiv preprint arXiv:2304.14178."},{"key":"2491_CR58","unstructured":"Yu, Weihao, Yang, Zhengyuan, Li, Linjie, Wang, Jianfeng, Lin, Kevin, Liu, Zicheng, Wang, Xinchao, & Wang, Lijuan. (2024). Evaluating large multimodal models for integrated capabilities: Mm-vet. In ICML."},{"key":"2491_CR59","unstructured":"Yu, Ya-Qi, Liao, Minghui, Wu, Jihao, Liao, Yongxin, Zheng, Xiaoyu, & Zeng, Wei. (2024). Texthawk: Exploring efficient fine-grained perception of multimodal large language models. arXiv preprint arXiv:2404.09204, 2024."},{"key":"2491_CR60","doi-asserted-by":"crossref","unstructured":"Yuan, Yuqian, Li, Wentong, Liu, Jian, Tang, Dongqi, Luo, Xinjie, Qin, Chi, Zhang, Lei, & Zhu, Jianke. (2024). Pixel understanding with visual instruction tuning: Osprey. In CVPR.","DOI":"10.1109\/CVPR52733.2024.02664"},{"key":"2491_CR61","doi-asserted-by":"crossref","unstructured":"Yue, Xiang, Ni, Yuansheng, Zhang, Kai, Zheng, Tianyu, Liu, Ruoqi, Zhang, Ge, Stevens, Samuel, Jiang, Dongfu, Ren, Weiming, Sun, Yuxuan, Wei, Cong, Yu, Botao, Yuan, Ruibin, Sun, Renliang, Yin, Ming, Zheng, Boyuan, Yang, Zhenzhu, Liu, Yibo, Huang, Wenhao, Sun, Huan, Su, Yu, & Chen, Wenhu. (2024). A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi: Mmmu. In CVPR.","DOI":"10.1109\/CVPR52733.2024.00913"},{"key":"2491_CR62","doi-asserted-by":"crossref","unstructured":"Zhang, Duzhen, Yu, Yahan, Li, Chenxing, Dong, Jiahua, Su, Dan, Chu, Chenhui, & Yu, Dong. (2024). Mm-llms: Recent advances in multimodal large language models. arXiv preprint arXiv:2401.13601.","DOI":"10.18653\/v1\/2024.findings-acl.738"},{"key":"2491_CR63","unstructured":"Zheng, Lianmin, Chiang, Wei-Lin, Sheng, Ying, Zhuang, Siyuan, Wu, Zhanghao, Zhuang, Yonghao,\u00a0Lin, Zi, Li, Zhuohan, Li, Dacheng, Xing, Eric, et\u00a0al. (2023). Judging llm-as-a-judge with mt-bench and chatbot arena. In NeurIPS."},{"key":"2491_CR64","unstructured":"Zhu, Deyao, Chen, Jun, Shen, Xiaoqian, Li, Xiang, & Elhoseiny, Mohamed. (2024). Minigpt-4: Enhancing vision-language understanding with advanced large language models. In ICLR."}],"container-title":["International Journal of Computer Vision"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-025-02491-7.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11263-025-02491-7\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-025-02491-7.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,10,10]],"date-time":"2025-10-10T08:52:57Z","timestamp":1760086377000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11263-025-02491-7"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,6,27]]},"references-count":64,"journal-issue":{"issue":"10","published-print":{"date-parts":[[2025,10]]}},"alternative-id":["2491"],"URL":"https:\/\/doi.org\/10.1007\/s11263-025-02491-7","relation":{},"ISSN":["0920-5691","1573-1405"],"issn-type":[{"value":"0920-5691","type":"print"},{"value":"1573-1405","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,6,27]]},"assertion":[{"value":"1 August 2024","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"22 May 2025","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"27 June 2025","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The codes and models of this work are released at .","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Code availability"}}]}}