{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,28]],"date-time":"2026-04-28T02:21:35Z","timestamp":1777342895196,"version":"3.51.4"},"publisher-location":"New York, NY, USA","reference-count":47,"publisher":"ACM","content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2026,4,13]]},"DOI":"10.1145\/3774904.3792599","type":"proceedings-article","created":{"date-parts":[[2026,4,9]],"date-time":"2026-04-09T21:54:34Z","timestamp":1775771674000},"page":"2349-2360","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":1,"title":["Doc-Researcher: A Unified System for Multimodal Document Parsing and Deep Research"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-5564-0641","authenticated-orcid":false,"given":"Kuicai","family":"Dong","sequence":"first","affiliation":[{"name":"Huawei Technologies Co., Ltd., Shenzhen, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0004-0680-2845","authenticated-orcid":false,"given":"Shurui","family":"Huang","sequence":"additional","affiliation":[{"name":"Huawei Technologies Co., Ltd., Shenzhen, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0009-4774-5732","authenticated-orcid":false,"given":"Fangda","family":"Ye","sequence":"additional","affiliation":[{"name":"Huawei Technologies Co., Ltd., Shenzhen, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-0005-4258","authenticated-orcid":false,"given":"Wei","family":"Han","sequence":"additional","affiliation":[{"name":"Huawei Technologies Co., Ltd., Shenzhen, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0004-1290-7010","authenticated-orcid":false,"given":"Zhi","family":"Zhang","sequence":"additional","affiliation":[{"name":"Huawei Technologies Co., Ltd., Shenzhen, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-6579-3764","authenticated-orcid":false,"given":"Dexun","family":"Li","sequence":"additional","affiliation":[{"name":"Huawei Technologies Co., Ltd., Shenzhen, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-5042-7756","authenticated-orcid":false,"given":"Wenjun","family":"Li","sequence":"additional","affiliation":[{"name":"Huawei Technologies Co., Ltd., Shenzhen, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-3714-1814","authenticated-orcid":false,"given":"Qu","family":"Yang","sequence":"additional","affiliation":[{"name":"Huawei Technologies Co., Ltd., Shenzhen, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-8795-8953","authenticated-orcid":false,"given":"Gang","family":"Wang","sequence":"additional","affiliation":[{"name":"Huawei Technologies Co., Ltd., Shenzhen, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-7053-8269","authenticated-orcid":false,"given":"Yichao","family":"Wang","sequence":"additional","affiliation":[{"name":"Huawei Technologies Co., Ltd., Shenzhen, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-2406-8734","authenticated-orcid":false,"given":"Chen","family":"Zhang","sequence":"additional","affiliation":[{"name":"Huawei Technologies Co., Ltd., Shenzhen, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-9031-9696","authenticated-orcid":false,"given":"Yong","family":"Liu","sequence":"additional","affiliation":[{"name":"Huawei Technologies Co., Ltd., Shenzhen, China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2026,4,12]]},"reference":[{"key":"e_1_3_2_1_1_1","unstructured":"Shuai Bai Keqin Chen Xuejing Liu Jialin Wang Wenbin Ge Sibo Song Kai Dang Peng Wang Shijie Wang Jun Tang Humen Zhong Yuanzhi Zhu Mingkun Yang Zhaohai Li Jianqiang Wan Pengfei Wang Wei Ding Zheren Fu Yiheng Xu Jiabo Ye Xi Zhang Tianbao Xie Zesen Cheng Hang Zhang Zhibo Yang Haiyang Xu and Junyang Lin. 2025. Qwen2.5-VL Technical Report. arXiv:2502.13923"},{"key":"e_1_3_2_1_2_1","doi-asserted-by":"crossref","unstructured":"Jianlv Chen Shitao Xiao Peitian Zhang Kun Luo Defu Lian and Zheng Liu. 2024. BGE M3-Embedding: Multi-Lingual Multi-Functionality Multi-Granularity Text Embeddings Through Self-Knowledge Distillation. arXiv:2402.03216 [cs.CL]","DOI":"10.18653\/v1\/2024.findings-acl.137"},{"key":"e_1_3_2_1_3_1","doi-asserted-by":"crossref","unstructured":"Jaemin Cho Debanjan Mahata Ozan Irsoy Yujie He and Mohit Bansal. 2024. M3DocRAG: Multi-modal Retrieval is What You Need for Multi-page Multi-document Understanding. arXiv:2411.04952","DOI":"10.1109\/ICCVW69036.2025.00649"},{"key":"e_1_3_2_1_4_1","unstructured":"DeepSeek-AI. 2025. DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. arXiv:2501.12948"},{"key":"e_1_3_2_1_5_1","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2025.emnlp-main.1576"},{"key":"e_1_3_2_1_6_1","unstructured":"Kuicai Dong Yujing Chang Shijie Huang Yasheng Wang Ruiming Tang and Yong Liu. 2025b. Benchmarking Retrieval-Augmented Multimomal Generation for Document Question Answering. arXiv:2505.16470"},{"key":"e_1_3_2_1_7_1","volume-title":"Yi Quan Lee, Hao Zhang, Xiangyang Li, Cong Zhang, and Yong Liu.","author":"Dong Kuicai","year":"2024","unstructured":"Kuicai Dong, Derrick Goh Xin Deik, Yi Quan Lee, Hao Zhang, Xiangyang Li, Cong Zhang, and Yong Liu. 2024. MC-indexing: Effective Long Document Retrieval via Multi-view Content-aware Indexing. In Findings of the Association for Computational Linguistics: EMNLP 2024. 2673-2691."},{"key":"e_1_3_2_1_8_1","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.emnlp-main.951"},{"key":"e_1_3_2_1_9_1","unstructured":"Mingxuan Du Benfeng Xu Chiwei Zhu Xiaorui Wang and Zhendong Mao. 2025. DeepResearch Bench: A Comprehensive Benchmark for Deep Research Agents. arXiv:2506.11763"},{"key":"e_1_3_2_1_10_1","volume-title":"ColPali: Efficient Document Retrieval with Vision Language Models. In The Thirteenth International Conference on Learning Representations, ICLR 2025","author":"Faysse Manuel","year":"2025","unstructured":"Manuel Faysse, Hugues Sibille, Tony Wu, Bilel Omrani, Gautier Viaud, C\u00e9line Hudelot, and Pierre Colombo. 2025. ColPali: Efficient Document Retrieval with Vision Language Models. In The Thirteenth International Conference on Learning Representations, ICLR 2025, Singapore, April 24-28, 2025."},{"key":"e_1_3_2_1_11_1","volume-title":"Isabelle Mohr, Andrei Ungureanu, Bo Wang, Sedigheh Eslami, Scott Martens, Maximilian Werk, Nan Wang, and Han Xiao.","author":"G\u00fcnther Michael","year":"2025","unstructured":"Michael G\u00fcnther, Saba Sturua, Mohammad Kalim Akram, Isabelle Mohr, Andrei Ungureanu, Bo Wang, Sedigheh Eslami, Scott Martens, Maximilian Werk, Nan Wang, and Han Xiao. 2025. jina-embeddings-v4: Universal Embeddings for Multimodal Multilingual Retrieval. arXiv:2506.18902"},{"key":"e_1_3_2_1_12_1","unstructured":"Siwei Han Peng Xia Ruiyi Zhang Tong Sun Yun Li Hongtu Zhu and Huaxiu Yao. 2025. MDocAgent: A Multi-Modal Multi-Agent Framework for Document Understanding. arXiv:2503.13964"},{"key":"e_1_3_2_1_13_1","unstructured":"Yuxuan Huang Yihang Chen Haozheng Zhang Kang Li Huichi Zhou Meng Fang Linyi Yang Xiaoguang Li Lifeng Shang Songcen Xu Jianye Hao Kun Shao and Jun Wang. 2025. Deep Research Agents: A Systematic Examination And Roadmap. arXiv:2506.18096"},{"key":"e_1_3_2_1_14_1","volume-title":"Second Conference on Language Modeling.","author":"Jin Bowen","year":"2025","unstructured":"Bowen Jin, Hansi Zeng, Zhenrui Yue, Jinsung Yoon, Sercan O Arik, Dong Wang, Hamed Zamani, and Jiawei Han. 2025. Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning. In Second Conference on Language Modeling."},{"key":"e_1_3_2_1_15_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.01789"},{"key":"e_1_3_2_1_16_1","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.findings-emnlp.904"},{"key":"e_1_3_2_1_17_1","unstructured":"Kuan Li Zhongwang Zhang Huifeng Yin Rui Ye Yida Zhao Liwen Zhang Litu Ou Dingchu Zhang Xixi Wu Jialong Wu Xinyu Wang Zile Qiao Zhen Zhang Yong Jiang Pengjun Xie Fei Huang and Jingren Zhou. 2025 e. WebSailor-V2: Bridging the Chasm to Proprietary Agents via Synthetic Data and Scalable Reinforcement Learning. arXiv:2509.13305"},{"key":"e_1_3_2_1_18_1","unstructured":"Xiaoxi Li Guanting Dong Jiajie Jin Yuyao Zhang Yujia Zhou Yutao Zhu Peitian Zhang and Zhicheng Dou. 2025a. Search-o1: Agentic Search-Enhanced Large Reasoning Models. arXiv:2501.05366"},{"key":"e_1_3_2_1_19_1","volume-title":"WebThinker: Empowering Large Reasoning Models with Deep Research Capability. arXiv preprint arXiv: 2504.21776","author":"Li Xiaoxi","year":"2025","unstructured":"Xiaoxi Li, Jiajie Jin, Guanting Dong, Hongjin Qian, Yutao Zhu, Yongkang Wu, Ji-Rong Wen, and Zhicheng Dou. 2025c. WebThinker: Empowering Large Reasoning Models with Deep Research Capability. arXiv preprint arXiv: 2504.21776 (2025)."},{"key":"e_1_3_2_1_20_1","unstructured":"Zijian Li Xin Guan Bo Zhang Shen Huang Houquan Zhou Shaopeng Lai Ming Yan Yong Jiang Pengjun Xie Fei Huang Jun Zhang and Jingren Zhou. 2025b. WebWeaver: Structuring Web-Scale Evidence with Dynamic Outlines for Open-Ended Deep Research. arXiv:2509.13312"},{"key":"e_1_3_2_1_21_1","unstructured":"Zhang Li Yuliang Liu Qiang Liu Zhiyin Ma Ziyang Zhang Shuo Zhang Zidun Guo Jiarui Zhang Xinyu Wang and Xiang Bai. 2025d. MonkeyOCR: Document Parsing with a Structure-Recognition-Relation Triplet Paradigm. arXiv:2506.05218"},{"key":"e_1_3_2_1_22_1","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.emnlp-main.373"},{"key":"e_1_3_2_1_23_1","volume-title":"MMLONGBENCH-DOC: Benchmarking Long-context Document Understanding with Visualizations. In Annual Conference on Neural Information Processing Systems 2024","author":"Ma Yubo","year":"2024","unstructured":"Yubo Ma, Yuhang Zang, Liangyu Chen, Meiqi Chen, Yizhu Jiao, Xinze Li, Xinyuan Lu, Ziyu Liu, Yan Ma, Xiaoyi Dong, Pan Zhang, Liangming Pan, Yu-Gang Jiang, Jiaqi Wang, Yixin Cao, and Aixin Sun. 2024b. MMLONGBENCH-DOC: Benchmarking Long-context Document Understanding with Visualizations. In Annual Conference on Neural Information Processing Systems 2024, NeurIPS 2024."},{"key":"e_1_3_2_1_24_1","unstructured":"Quentin Mac\u00e9 Ant\u00f3nio Loison and Manuel Faysse. 2025. ViDoRe Benchmark V2: Raising the Bar for Visual Retrieval. arXiv:2505.17166"},{"key":"e_1_3_2_1_25_1","first-page":"2582","volume-title":"InfographicVQA. In IEEE\/CVF Winter Conference on Applications of Computer Vision, WACV","author":"Mathew Minesh","year":"2022","unstructured":"Minesh Mathew, Viraj Bagal, Rub\u00e8n Tito, Dimosthenis Karatzas, Ernest Valveny, and C. V. Jawahar. 2022. InfographicVQA. In IEEE\/CVF Winter Conference on Applications of Computer Vision, WACV 2022. 2582-2591."},{"key":"e_1_3_2_1_26_1","first-page":"2199","volume-title":"DocVQA: A Dataset for VQA on Document Images. In IEEE Winter Conference on Applications of Computer Vision, WACV","author":"Mathew Minesh","year":"2021","unstructured":"Minesh Mathew, Dimosthenis Karatzas, and C. V. Jawahar. 2021. DocVQA: A Dataset for VQA on Document Images. In IEEE Winter Conference on Applications of Computer Vision, WACV 2021. 2199-2208."},{"key":"e_1_3_2_1_27_1","unstructured":"Jake Poznanski Jon Borchardt Jason Dunkelberger Regan Huff Daniel Lin Aman Rangapur Christopher Wilhelm Kyle Lo and Luca Soldaini. 2025. olmOCR: Unlocking Trillions of Tokens in PDFs with Vision Language Models. arXiv:2502.18443"},{"key":"e_1_3_2_1_28_1","volume-title":"Alphalora: Assigning lora experts based on layer training quality.","author":"Qing Peijun","year":"2024","unstructured":"Peijun Qing, Chongyang Gao, Yefan Zhou, Xingjian Diao, Yaoqing Yang, and Soroush Vosoughi. 2024. Alphalora: Assigning lora experts based on layer training quality. (2024)."},{"key":"e_1_3_2_1_29_1","first-page":"109","volume-title":"Proceedings of The Third Text REtrieval Conference, TREC","author":"Robertson Stephen E.","year":"1994","unstructured":"Stephen E. Robertson, Steve Walker, Susan Jones, Micheline Hancock-Beaulieu, and Mike Gatford. 1994. Okapi at TREC-3. In Proceedings of The Third Text REtrieval Conference, TREC 1994. 109-126."},{"key":"e_1_3_2_1_30_1","unstructured":"Wenxuan Shen Mingjia Wang Yaochen Wang Dongping Chen Junjie Yang Yao Wan and Weiwei Lin. 2025. Are We on the Right Way for Assessing Document Retrieval-Augmented Generation? arXiv:2508.03644"},{"key":"e_1_3_2_1_31_1","volume-title":"Agentic Retrieval-Augmented Generation: A Survey on Agentic RAG. arXiv preprint arXiv: 2501.09136","author":"Singh Aditi","year":"2025","unstructured":"Aditi Singh, Abul Ehtesham, Saket Kumar, and Tala Talaei Khoei. 2025. Agentic Retrieval-Augmented Generation: A Survey on Agentic RAG. arXiv preprint arXiv: 2501.09136 (2025)."},{"key":"e_1_3_2_1_32_1","volume-title":"An Overview of the Tesseract OCR Engine. In ICDAR '07: Proceedings of the Ninth International Conference on Document Analysis and Recognition. IEEE Computer Society, 629-633","author":"Smith Ray","year":"2007","unstructured":"Ray Smith. 2007. An Overview of the Tesseract OCR Engine. In ICDAR '07: Proceedings of the Ninth International Conference on Document Analysis and Recognition. IEEE Computer Society, 629-633."},{"key":"e_1_3_2_1_33_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52734.2025.02312"},{"key":"e_1_3_2_1_34_1","volume-title":"Automatic document processing: a survey. Pattern recognition","author":"Tang Yuan Y","year":"1996","unstructured":"Yuan Y Tang, Seong-Whan Lee, and Ching Y Suen. 1996. Automatic document processing: a survey. Pattern recognition (1996), 1931-1952."},{"key":"e_1_3_2_1_35_1","unstructured":"InternVL Team. 2025a. InternVL3.5: Advancing Open-Source Multimodal Models in Versatility Reasoning and Efficiency. arXiv:2508.18265"},{"key":"e_1_3_2_1_36_1","unstructured":"Qwen Team. 2025b. Qwen3 Technical Report. arXiv:2505.09388"},{"key":"e_1_3_2_1_37_1","doi-asserted-by":"crossref","unstructured":"Rub\u00e8n Tito Dimosthenis Karatzas and Ernest Valveny. 2023. Hierarchical multimodal transformers for Multi-Page DocVQA. arXiv:2212.05935","DOI":"10.2139\/ssrn.4466918"},{"key":"e_1_3_2_1_38_1","unstructured":"DeepResearch Team Tongyi. 2025. Tongyi-DeepResearch."},{"key":"e_1_3_2_1_39_1","unstructured":"Bin Wang Zhuangcheng Gu Guang Liang Chao Xu Bo Zhang Botian Shi and Conghui He. 2024a. UniMERNet: A Universal Network for Real-World Mathematical Expression Recognition. arXiv:2404.15254"},{"key":"e_1_3_2_1_40_1","unstructured":"Bin Wang Chao Xu Xiaomeng Zhao Linke Ouyang Fan Wu Zhiyuan Zhao Rui Xu Kaiwen Liu Yuan Qu Fukai Shang Bo Zhang Liqun Wei Zhihao Sui Wei Li Botian Shi Yu Qiao Dahua Lin and Conghui He. 2024b. MinerU: An Open-Source Solution for Precise Document Content Extraction. arXiv:2409.18839"},{"key":"e_1_3_2_1_41_1","unstructured":"Liang Wang Nan Yang Xiaolong Huang Binxing Jiao Linjun Yang Daxin Jiang Rangan Majumder and Furu Wei. 2022. Text Embeddings by Weakly-Supervised Contrastive Pre-training. arXiv:2212.03533"},{"key":"e_1_3_2_1_42_1","doi-asserted-by":"crossref","unstructured":"Qiuchen Wang Ruixue Ding Zehui Chen Weiqi Wu Shihang Wang Pengjun Xie and Feng Zhao. 2025. ViDoRAG: Visual Document Retrieval-Augmented Generation via Dynamic Iterative Reasoning Agents. arXiv:2502.18017","DOI":"10.18653\/v1\/2025.emnlp-main.464"},{"key":"e_1_3_2_1_43_1","unstructured":"Renjun Xu and Jingwen Peng. 2025. A Comprehensive Survey of Deep Research: Systems Methodologies and Applications. arXiv:2506.12594"},{"key":"e_1_3_2_1_44_1","volume-title":"Gammae: Gamma embeddings for logical queries on knowledge graphs.","author":"Yang Dong","year":"2022","unstructured":"Dong Yang, Peijun Qing, Yang Li, Haonan Lu, and Xiaodong Lin. 2022. Gammae: Gamma embeddings for logical queries on knowledge graphs. (2022)."},{"key":"e_1_3_2_1_45_1","unstructured":"Jiabo Ye Anwen Hu Haiyang Xu Qinghao Ye Ming Yan Yuhao Dan Chenlin Zhao Guohai Xu Chenliang Li Junfeng Tian et al. 2023. mplug-docowl: Modularized multimodal large language model for document understanding. arXiv preprint arXiv:2307.02499 (2023)."},{"key":"e_1_3_2_1_46_1","unstructured":"Yanzhao Zhang Mingxin Li Dingkun Long Xin Zhang Huan Lin Baosong Yang Pengjun Xie An Yang Dayiheng Liu Junyang Lin Fei Huang and Jingren Zhou. 2025. Qwen3 Embedding: Advancing Text Embedding and Reranking Through Foundation Models. arXiv:2506.05176"},{"key":"e_1_3_2_1_47_1","volume-title":"DOCBENCH: A Benchmark for Evaluating LLM-based Document Reading Systems. arXiv:2407","author":"Zou Anni","year":"2024","unstructured":"Anni Zou, Wenhao Yu, Hongming Zhang, Kaixin Ma, Deng Cai, Zhuosheng Zhang, Hai Zhao, and Dong Yu. 2024. DOCBENCH: A Benchmark for Evaluating LLM-based Document Reading Systems. arXiv:2407"}],"event":{"name":"WWW '26: The ACM Web Conference 2026","location":"Dubai United Arab Emirates","sponsor":["SIGWEB ACM Special Interest Group on Hypertext, Hypermedia, and Web"]},"container-title":["Proceedings of the ACM Web Conference 2026"],"original-title":[],"deposited":{"date-parts":[[2026,4,10]],"date-time":"2026-04-10T16:31:44Z","timestamp":1775838704000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3774904.3792599"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,4,12]]},"references-count":47,"alternative-id":["10.1145\/3774904.3792599","10.1145\/3774904"],"URL":"https:\/\/doi.org\/10.1145\/3774904.3792599","relation":{},"subject":[],"published":{"date-parts":[[2026,4,12]]},"assertion":[{"value":"2026-04-12","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}