{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,15]],"date-time":"2026-07-15T18:08:01Z","timestamp":1784138881585,"version":"3.55.0"},"publisher-location":"New York, NY, USA","reference-count":70,"publisher":"ACM","license":[{"start":{"date-parts":[[2026,7,19]],"date-time":"2026-07-19T00:00:00Z","timestamp":1784419200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/legalcode"}],"funder":[{"name":"National Natural Science Foundation of China","award":["62425604"],"award-info":[{"award-number":["62425604"]}]},{"name":"Beijing National Research Center For Information Science And Technology","award":["BNR2026TD03005"],"award-info":[{"award-number":["BNR2026TD03005"]}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2026,7,20]]},"DOI":"10.1145\/3805712.3809757","type":"proceedings-article","created":{"date-parts":[[2026,7,15]],"date-time":"2026-07-15T17:06:26Z","timestamp":1784135186000},"page":"167-178","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":0,"title":["Think with Grounding: Curriculum Reinforced Reasoning with Video Grounding for Long Video Understanding"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0009-0006-7749-7328","authenticated-orcid":false,"given":"Houlun","family":"Chen","sequence":"first","affiliation":[{"name":"DCST, Tsinghua University, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-0351-2939","authenticated-orcid":false,"given":"Xin","family":"Wang","sequence":"additional","affiliation":[{"name":"DCST, BNRist, Tsinghua University, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-2179-8555","authenticated-orcid":false,"given":"Guangyao","family":"Li","sequence":"additional","affiliation":[{"name":"DCST, Tsinghua University, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-9582-7331","authenticated-orcid":false,"given":"Yuwei","family":"Zhou","sequence":"additional","affiliation":[{"name":"DCST, Tsinghua University, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0001-5389-2095","authenticated-orcid":false,"given":"Yihan","family":"Chen","sequence":"additional","affiliation":[{"name":"DCST, Tsinghua University, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-7118-3666","authenticated-orcid":false,"given":"Jia","family":"Jia","sequence":"additional","affiliation":[{"name":"DCST, BNRist, Tsinghua University, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-2236-9290","authenticated-orcid":false,"given":"Wenwu","family":"Zhu","sequence":"additional","affiliation":[{"name":"DCST, BNRist, Tsinghua University, Beijing, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"320","published-online":{"date-parts":[[2026,7,19]]},"reference":[{"key":"e_1_3_2_1_1_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.618"},{"key":"e_1_3_2_1_2_1","unstructured":"Shuai Bai Keqin Chen Xuejing Liu Jialin Wang Wenbin Ge Sibo Song Kai Dang Peng Wang Shijie Wang Jun Tang et al. 2025. Qwen2. 5-vl technical report. arXiv preprint arXiv:2502.13923 (2025)."},{"key":"e_1_3_2_1_3_1","volume-title":"Cg-bench: Clue-grounded question answering benchmark for long video understanding. arXiv preprint arXiv:2412.12075","author":"Chen Guo","year":"2024","unstructured":"Guo Chen, Yicheng Liu, Yifei Huang, Yuping He, Baoqi Pei, Jilan Xu, Yali Wang, Tong Lu, and Limin Wang. 2024a. Cg-bench: Clue-grounded question answering benchmark for long video understanding. arXiv preprint arXiv:2412.12075 (2024)."},{"key":"e_1_3_2_1_4_1","doi-asserted-by":"publisher","DOI":"10.52202\/079017-0614"},{"key":"e_1_3_2_1_5_1","unstructured":"Yukang Chen Wei Huang Baifeng Shi Qinghao Hu Hanrong Ye Ligeng Zhu Zhijian Liu Pavlo Molchanov Jan Kautz Xiaojuan Qi et al. 2025. Scaling rl to long videos. arXiv preprint arXiv:2507.07966 (2025)."},{"key":"e_1_3_2_1_6_1","volume-title":"Longvila: Scaling long-context visual language models for long videos. arXiv preprint arXiv:2408.10188","author":"Chen Yukang","year":"2024","unstructured":"Yukang Chen, Fuzhao Xue, Dacheng Li, Qinghao Hu, Ligeng Zhu, Xiuyu Li, Yunhao Fang, Haotian Tang, Shang Yang, Zhijian Liu, et al., 2024c. Longvila: Scaling long-context visual language models for long videos. arXiv preprint arXiv:2408.10188 (2024)."},{"key":"e_1_3_2_1_7_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52734.2025.01285"},{"key":"e_1_3_2_1_8_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52734.2025.01282"},{"key":"e_1_3_2_1_9_1","doi-asserted-by":"publisher","DOI":"10.1145\/3664647.3685520"},{"key":"e_1_3_2_1_10_1","volume-title":"Video-r1: Reinforcing video reasoning in mllms. arXiv preprint arXiv:2503.21776","author":"Feng Kaituo","year":"2025","unstructured":"Kaituo Feng, Kaixiong Gong, Bohao Li, Zonghao Guo, Yibing Wang, Tianshuo Peng, Junfei Wu, Xiaoying Zhang, Benyou Wang, and Xiangyu Yue. 2025. Video-r1: Reinforcing video reasoning in mllms. arXiv preprint arXiv:2503.21776 (2025)."},{"key":"e_1_3_2_1_11_1","unstructured":"Wei Feng Xin Wang Hong Chen Yu-Wei Zhan Zihan Song Bin Huang Kecheng Zheng and Wenwu Zhu. [n.d.]. Cross-granularity Video LLM for Long Video Understanding. ([n.d.])."},{"key":"e_1_3_2_1_12_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52734.2025.02245"},{"key":"e_1_3_2_1_13_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.563"},{"key":"e_1_3_2_1_14_1","unstructured":"Daya Guo Dejian Yang Haowei Zhang Junxiao Song Ruoyu Zhang Runxin Xu Qihao Zhu Shirong Ma Peiyi Wang Xiao Bi et al. 2025. Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning. arXiv preprint arXiv:2501.12948 (2025)."},{"key":"e_1_3_2_1_15_1","first-page":"3","article-title":"Lora: Low-rank adaptation of large language models","volume":"1","author":"Hu Edward J","year":"2022","unstructured":"Edward J Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, Weizhu Chen, et al., 2022. Lora: Low-rank adaptation of large language models. ICLR, Vol. 1, 2 (2022), 3.","journal-title":"ICLR"},{"key":"e_1_3_2_1_16_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.01353"},{"key":"e_1_3_2_1_17_1","unstructured":"Chao Huang Benfeng Wang Wei Wang Jie Wen Chengliang Liu Li Shen and Xiaochun Cao. 2025. Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought. In Advances in Neural Information Processing Systems (NeurIPS). https:\/\/neurips.cc\/virtual\/2025\/poster\/119777"},{"key":"e_1_3_2_1_18_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52734.2025.01280"},{"key":"e_1_3_2_1_19_1","doi-asserted-by":"publisher","DOI":"10.1145\/3600006.3613165"},{"key":"e_1_3_2_1_20_1","doi-asserted-by":"publisher","DOI":"10.1145\/3532626"},{"key":"e_1_3_2_1_21_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.02095"},{"key":"e_1_3_2_1_22_1","volume-title":"Videochat-r1: Enhancing spatio-temporal perception via reinforcement fine-tuning. arXiv preprint arXiv:2504.06958","author":"Li Xinhao","year":"2025","unstructured":"Xinhao Li, Ziang Yan, Desen Meng, Lu Dong, Xiangyu Zeng, Yinan He, Yali Wang, Yu Qiao, Yi Wang, and Limin Wang. 2025b. Videochat-r1: Enhancing spatio-temporal perception via reinforcement fine-tuning. arXiv preprint arXiv:2504.06958 (2025)."},{"key":"e_1_3_2_1_23_1","unstructured":"Zeqian Li Shangzhe Di Zhonghua Zhai Weilin Huang Yanfeng Wang and Weidi Xie. 2025a. Universal Video Temporal Grounding with Generative Multi-modal Large Language Models. arXiv:2506.18883 [cs.CV] https:\/\/arxiv.org\/abs\/2506.18883"},{"key":"e_1_3_2_1_24_1","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.emnlp-main.342"},{"key":"e_1_3_2_1_25_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52734.2025.00315"},{"key":"e_1_3_2_1_26_1","unstructured":"Mi Luo Zihui Xue Alex Dimakis and Kristen Grauman. 2025. When Thinking Drifts: Evidential Grounding for Robust Video Reasoning. In Advances in Neural Information Processing Systems (NeurIPS). https:\/\/openreview.net\/forum?id=qDm3fpLYDW"},{"key":"e_1_3_2_1_27_1","volume-title":"Video-rag: Visually-aligned retrieval-augmented long video comprehension. arXiv preprint arXiv:2411.13093","author":"Luo Yongdong","year":"2024","unstructured":"Yongdong Luo, Xiawu Zheng, Guilin Li, Shukang Yin, Haojia Lin, Chaoyou Fu, Jinfa Huang, Jiayi Ji, Fei Chao, Jiebo Luo, et al., 2024. Video-rag: Visually-aligned retrieval-augmented long video comprehension. arXiv preprint arXiv:2411.13093 (2024)."},{"key":"e_1_3_2_1_28_1","doi-asserted-by":"publisher","DOI":"10.52202\/079017-0739"},{"key":"e_1_3_2_1_29_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51701.2025.02222"},{"key":"e_1_3_2_1_30_1","unstructured":"Baoqi Pei Yifei Huang Jilan Xu Yuping He Guo Chen Fei Wu Jiangmiao Pang and Yu Qiao. 2025. EgoThinker: Unveiling Egocentric Reasoning with Spatio-Temporal CoT. In Advances in Neural Information Processing Systems (NeurIPS). https:\/\/openreview.net\/forum?id=9Zwl2Ly28N"},{"key":"e_1_3_2_1_31_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51701.2025.02252"},{"key":"e_1_3_2_1_32_1","volume-title":"Vamba: Understanding hour-long videos with hybrid mamba-transformers. arXiv preprint arXiv:2503.11579","author":"Ren Weiming","year":"2025","unstructured":"Weiming Ren, Wentao Ma, Huan Yang, Cong Wei, Ge Zhang, and Wenhu Chen. 2025a. Vamba: Understanding hour-long videos with hybrid mamba-transformers. arXiv preprint arXiv:2503.11579 (2025)."},{"key":"e_1_3_2_1_33_1","volume-title":"Videorag: Retrieval-augmented generation with extreme long-context videos. arXiv preprint arXiv:2502.01549","author":"Ren Xubin","year":"2025","unstructured":"Xubin Ren, Lingrui Xu, Long Xia, Shuaiqiang Wang, Dawei Yin, and Chao Huang. 2025b. Videorag: Retrieval-augmented generation with extreme long-context videos. arXiv preprint arXiv:2502.01549 (2025)."},{"key":"e_1_3_2_1_34_1","volume-title":"Infinity-Video: A Training-Free Approach to Long Video Understanding via Continuous-Time Memory Consolidation. arXiv preprint arXiv:2501.19098","author":"Santos Saul","year":"2025","unstructured":"Saul Santos, Ant\u00f3nio Farinhas, Daniel C McNamee, and Andr\u00e9 FT Martins. 2025. Infinity-Video: A Training-Free Approach to Long Video Understanding via Continuous-Time Memory Consolidation. arXiv preprint arXiv:2501.19098 (2025)."},{"key":"e_1_3_2_1_35_1","volume-title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models. arXiv preprint arXiv:2402.03300","author":"Shao Zhihong","year":"2024","unstructured":"Zhihong Shao, Peiyi Wang, Qihao Zhu, Runxin Xu, Junxiao Song, Xiao Bi, Haowei Zhang, Mingchuan Zhang, YK Li, Yang Wu, et al., 2024. Deepseekmath: Pushing the limits of mathematical reasoning in open language models. arXiv preprint arXiv:2402.03300 (2024)."},{"key":"e_1_3_2_1_36_1","volume-title":"Longvu: Spatiotemporal adaptive compression for long video-language understanding. arXiv preprint arXiv:2410.17434","author":"Shen Xiaoqian","year":"2024","unstructured":"Xiaoqian Shen, Yunyang Xiong, Changsheng Zhao, Lemeng Wu, Jun Chen, Chenchen Zhu, Zechun Liu, Fanyi Xiao, Balakrishnan Varadarajan, Florian Bordes, et al., 2024. Longvu: Spatiotemporal adaptive compression for long video-language understanding. arXiv preprint arXiv:2410.17434 (2024)."},{"key":"e_1_3_2_1_37_1","volume-title":"Long-vita: Scaling large multi-modal models to 1 million tokens with leading short-context accuracy. arXiv preprint arXiv:2502.05177","author":"Shen Yunhang","year":"2025","unstructured":"Yunhang Shen, Chaoyou Fu, Shaoqi Dong, Xiong Wang, Yi-Fan Zhang, Peixian Chen, Mengdan Zhang, Haoyu Cao, Ke Li, Shaohui Lin, et al., 2025. Long-vita: Scaling large multi-modal models to 1 million tokens with leading short-context accuracy. arXiv preprint arXiv:2502.05177 (2025)."},{"key":"e_1_3_2_1_38_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52734.2025.02436"},{"key":"e_1_3_2_1_39_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.01725"},{"key":"e_1_3_2_1_40_1","volume-title":"Forty-second International Conference on Machine Learning.","author":"Song Zihan","year":"2025","unstructured":"Zihan Song, Xin Wang, Zi Qian, Hong Chen, Longtao Huang, Hui Xue, and Wenwu Zhu. 2025. Modularized self-reflected video reasoner for multimodal llm with application to video question answering. In Forty-second International Conference on Machine Learning."},{"key":"e_1_3_2_1_41_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52734.2025.02711"},{"key":"e_1_3_2_1_42_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52734.2025.01769"},{"key":"e_1_3_2_1_43_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51701.2025.01935"},{"key":"e_1_3_2_1_44_1","unstructured":"Weiyun Wang Zhangwei Gao Lixin Gu Hengjun Pu Long Cui Xingguang Wei Zhaoyang Liu Linglin Jing Shenglong Ye Jie Shao et al. 2025a. Internvl3. 5: Advancing open-source multimodal models in versatility reasoning and efficiency. arXiv preprint arXiv:2508.18265 (2025)."},{"key":"e_1_3_2_1_45_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51701.2025.02131"},{"key":"e_1_3_2_1_46_1","volume-title":"Longllava: Scaling multi-modal llms to 1000 images efficiently via a hybrid architecture. arXiv preprint arXiv:2409.02889","author":"Wang Xidong","year":"2024","unstructured":"Xidong Wang, Dingjie Song, Shunian Chen, Chen Zhang, and Benyou Wang. 2024b. Longllava: Scaling multi-modal llms to 1000 images efficiently via a hybrid architecture. arXiv preprint arXiv:2409.02889 (2024)."},{"key":"e_1_3_2_1_47_1","volume-title":"European Conference on Computer Vision. Springer, 58-76","author":"Wang Xiaohan","year":"2024","unstructured":"Xiaohan Wang, Yuhui Zhang, Orr Zohar, and Serena Yeung-Levy. 2024c. Videoagent: Long-form video understanding with large language model as agent. In European Conference on Computer Vision. Springer, 58-76."},{"key":"e_1_3_2_1_48_1","volume-title":"Hawkeye: Training video-text llms for grounding text in videos. arXiv preprint arXiv:2403.10228","author":"Wang Yueqian","year":"2024","unstructured":"Yueqian Wang, Xiaojun Meng, Jianxin Liang, Yuxuan Wang, Qun Liu, and Dongyan Zhao. 2024a. Hawkeye: Training video-text llms for grounding text in videos. arXiv preprint arXiv:2403.10228 (2024)."},{"key":"e_1_3_2_1_49_1","unstructured":"Ye Wang Ziheng Wang Boshen Xu Yang Du Kejun Lin Zihan Xiao Zihao Yue Jianzhong Ju Liang Zhang Dingyi Yang Xiangnan Fang Zewen He Zhenbo Luo Wenxuan Wang Junqi Lin Jian Luan and Qin Jin. 2025d. Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding. In Advances in Neural Information Processing Systems (NeurIPS). https:\/\/neurips.cc\/virtual\/2025\/poster\/116757"},{"key":"e_1_3_2_1_50_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52734.2025.00311"},{"key":"e_1_3_2_1_51_1","volume-title":"Denny Zhou, et al.","author":"Wei Jason","year":"2022","unstructured":"Jason Wei, Xuezhi Wang, Dale Schuurmans, Maarten Bosma, Fei Xia, Ed Chi, Quoc V Le, Denny Zhou, et al., 2022. Chain-of-thought prompting elicits reasoning in large language models. Advances in neural information processing systems, Vol. 35 (2022), 24824-24837."},{"key":"e_1_3_2_1_52_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00192"},{"key":"e_1_3_2_1_53_1","doi-asserted-by":"publisher","DOI":"10.52202\/079017-0907"},{"key":"e_1_3_2_1_54_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52734.2025.01284"},{"key":"e_1_3_2_1_55_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.01254"},{"key":"e_1_3_2_1_56_1","volume-title":"Video-mtr: Reinforced multi-turn reasoning for long video understanding. arXiv preprint arXiv:2508.20478","author":"Xie Yuan","year":"2025","unstructured":"Yuan Xie, Tianshui Chen, Zheng Ge, and Lionel Ni. 2025. Video-mtr: Reinforced multi-turn reasoning for long video understanding. arXiv preprint arXiv:2508.20478 (2025)."},{"key":"e_1_3_2_1_57_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51701.2025.01876"},{"key":"e_1_3_2_1_58_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51701.2025.02251"},{"key":"e_1_3_2_1_59_1","volume-title":"Tree of thoughts: Deliberate problem solving with large language models. Advances in neural information processing systems","author":"Yao Shunyu","year":"2023","unstructured":"Shunyu Yao, Dian Yu, Jeffrey Zhao, Izhak Shafran, Tom Griffiths, Yuan Cao, and Karthik Narasimhan. 2023. Tree of thoughts: Deliberate problem solving with large language models. Advances in neural information processing systems, Vol. 36 (2023), 11809-11822."},{"key":"e_1_3_2_1_60_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52734.2025.00802"},{"key":"e_1_3_2_1_61_1","unstructured":"Yin Song and Chen Wu and Eden Duthie. 2024. aws-prototyping\/long-llava-qwen2-7b. https:\/\/huggingface.co\/aws-prototyping\/long-llava-qwen2-7b"},{"key":"e_1_3_2_1_62_1","volume-title":"Dapo: An open-source llm reinforcement learning system at scale. arXiv preprint arXiv:2503.14476","author":"Yu Qiying","year":"2025","unstructured":"Qiying Yu, Zheng Zhang, Ruofei Zhu, Yufeng Yuan, Xiaochen Zuo, Yu Yue, Weinan Dai, Tiantian Fan, Gaohong Liu, Lingjun Liu, et al., 2025. Dapo: An open-source llm reinforcement learning system at scale. arXiv preprint arXiv:2503.14476 (2025)."},{"key":"e_1_3_2_1_63_1","volume-title":"International Conference on Learning Representations (ICLR). arXiv:2410","author":"Zeng Xiangyu","year":"2025","unstructured":"Xiangyu Zeng, Kunchang Li, Chenting Wang, Xinhao Li, Tianxiang Jiang, Ziang Yan, Songze Li, Yansong Shi, Zhengrong Yue, Yi Wang, Yali Wang, Yu Qiao, and Limin Wang. 2025. TimeSuite: Improving MLLMs for Long Video Understanding via Grounded Tuning. In International Conference on Learning Representations (ICLR). arXiv:2410.19702 [cs.CV] https:\/\/openreview.net\/forum?id=nAVejJURqZ Poster."},{"key":"e_1_3_2_1_64_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51701.2025.02243"},{"key":"e_1_3_2_1_65_1","volume-title":"Long context transfer from language to vision. arXiv preprint arXiv:2406.16852","author":"Zhang Peiyuan","year":"2024","unstructured":"Peiyuan Zhang, Kaichen Zhang, Bo Li, Guangtao Zeng, Jingkang Yang, Yuanhan Zhang, Ziyue Wang, Haoran Tan, Chunyuan Li, and Ziwei Liu. 2024b. Long context transfer from language to vision. arXiv preprint arXiv:2406.16852 (2024)."},{"key":"e_1_3_2_1_66_1","volume-title":"Llava-mini: Efficient image and video large multimodal models with one vision token. arXiv preprint arXiv:2501.03895","author":"Zhang Shaolei","year":"2025","unstructured":"Shaolei Zhang, Qingkai Fang, Zhe Yang, and Yang Feng. 2025a. Llava-mini: Efficient image and video large multimodal models with one vision token. arXiv preprint arXiv:2501.03895 (2025)."},{"key":"e_1_3_2_1_67_1","volume-title":"Video instruction tuning with synthetic data. arXiv preprint arXiv:2410.02713","author":"Zhang Yuanhan","year":"2024","unstructured":"Yuanhan Zhang, Jinming Wu, Wei Li, Bo Li, Zejun Ma, Ziwei Liu, and Chunyuan Li. 2024a. Video instruction tuning with synthetic data. arXiv preprint arXiv:2410.02713 (2024)."},{"key":"e_1_3_2_1_68_1","unstructured":"Yuze Zhao Jintao Huang Jinghan Hu Xingjun Wang Yunlin Mao Daoze Zhang Zeyinzi Jiang Zhikai Wu Baole Ai Ang Wang Wenmeng Zhou and Yingda Chen. 2024. SWIFT:A Scalable lightWeight Infrastructure for Fine-Tuning. arXiv:2408.05517 [cs.CL] https:\/\/arxiv.org\/abs\/2408.05517"},{"key":"e_1_3_2_1_69_1","volume-title":"Deepeyes: Incentivizing'' thinking with images'' via reinforcement learning. arXiv preprint arXiv:2505.14362","author":"Zheng Ziwei","year":"2025","unstructured":"Ziwei Zheng, Michael Yang, Jack Hong, Chenxiao Zhao, Guohai Xu, Le Yang, Chao Shen, and Xing Yu. 2025. Deepeyes: Incentivizing'' thinking with images'' via reinforcement learning. arXiv preprint arXiv:2505.14362 (2025)."},{"key":"e_1_3_2_1_70_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52734.2025.01278"}],"event":{"name":"SIGIR '26: The 49th International ACM SIGIR Conference on Research and Development in Information Retrieval","location":"Melbourne VIC Australia","sponsor":["SIGIR ACM Special Interest Group on Information Retrieval"]},"container-title":["Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval"],"original-title":[],"deposited":{"date-parts":[[2026,7,15]],"date-time":"2026-07-15T17:31:00Z","timestamp":1784136660000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3805712.3809757"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,7,19]]},"references-count":70,"alternative-id":["10.1145\/3805712.3809757","10.1145\/3805712"],"URL":"https:\/\/doi.org\/10.1145\/3805712.3809757","relation":{},"subject":[],"published":{"date-parts":[[2026,7,19]]},"assertion":[{"value":"2026-07-19","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}