{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,14]],"date-time":"2026-07-14T15:57:51Z","timestamp":1784044671424,"version":"3.55.0"},"reference-count":54,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","license":[{"start":{"date-parts":[[2025,1,1]],"date-time":"2025-01-01T00:00:00Z","timestamp":1735689600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2025,1,1]],"date-time":"2025-01-01T00:00:00Z","timestamp":1735689600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2025,1,1]],"date-time":"2025-01-01T00:00:00Z","timestamp":1735689600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/100031931","name":"Shanghai Artificial Intelligence Laboratory","doi-asserted-by":"publisher","id":[{"id":"10.13039\/100031931","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100012166","name":"National Key Research and Development Program","doi-asserted-by":"publisher","award":["2022ZD0160104"],"award-info":[{"award-number":["2022ZD0160104"]}],"id":[{"id":"10.13039\/501100012166","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100003399","name":"Science and Technology Commission of Shanghai Municipality","doi-asserted-by":"publisher","award":["22DZ1100102"],"award-info":[{"award-number":["22DZ1100102"]}],"id":[{"id":"10.13039\/501100003399","id-type":"DOI","asserted-by":"publisher"}]},{"name":"Shanghai Rising Star Program","award":["23QD1401000"],"award-info":[{"award-number":["23QD1401000"]}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. on Image Process."],"published-print":{"date-parts":[[2025]]},"DOI":"10.1109\/tip.2025.3607618","type":"journal-article","created":{"date-parts":[[2025,10,13]],"date-time":"2025-10-13T17:43:05Z","timestamp":1760377385000},"page":"7436-7447","source":"Crossref","is-referenced-by-count":13,"title":["ChartX and ChartVLM: A Versatile Benchmark and Foundation Model for Complicated Chart Reasoning"],"prefix":"10.1109","volume":"34","author":[{"given":"Renqiu","family":"Xia","sequence":"first","affiliation":[{"name":"School of Artificial Intelligence, Shanghai Jiao Tong University, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-6272-2792","authenticated-orcid":false,"given":"Hancheng","family":"Ye","sequence":"additional","affiliation":[{"name":"Shanghai Artificial Intelligence Laboratory, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0006-6644-0211","authenticated-orcid":false,"given":"Xiangchao","family":"Yan","sequence":"additional","affiliation":[{"name":"Shanghai Artificial Intelligence Laboratory, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Qi","family":"Liu","sequence":"additional","affiliation":[{"name":"School of Artificial Intelligence, Shanghai Jiao Tong University, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Hongbin","family":"Zhou","sequence":"additional","affiliation":[{"name":"Shanghai Artificial Intelligence Laboratory, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zijun","family":"Chen","sequence":"additional","affiliation":[{"name":"School of Artificial Intelligence, Shanghai Jiao Tong University, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3677-7252","authenticated-orcid":false,"given":"Botian","family":"Shi","sequence":"additional","affiliation":[{"name":"Shanghai Artificial Intelligence Laboratory, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-9639-7679","authenticated-orcid":false,"given":"Junchi","family":"Yan","sequence":"additional","affiliation":[{"name":"School of Artificial Intelligence, Shanghai Jiao Tong University, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-8052-782X","authenticated-orcid":false,"given":"Bo","family":"Zhang","sequence":"additional","affiliation":[{"name":"Shanghai Artificial Intelligence Laboratory, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","article-title":"Qwen-VL: A versatile vision-language model for understanding, localization, text reading, and beyond","author":"Bai","year":"2023","journal-title":"arXiv:2308.12966"},{"key":"ref2","volume-title":"GPT-4v(ision) System Card","year":"2023"},{"key":"ref3","article-title":"GPT-4 technical report","volume-title":"arXiv:2303.08774","author":"Achiam","year":"2023"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1007\/s11432-024-4231-5"},{"key":"ref5","volume-title":"The Claude 3 Model Family: Opus, Sonnet, Haiku","year":"2024"},{"key":"ref6","article-title":"DocGenome: An open large-scale scientific document benchmark for training and testing multi-modal large language models","author":"Xia","year":"2024","journal-title":"arXiv:2406.11633"},{"key":"ref7","article-title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","author":"Team","year":"2024","journal-title":"arXiv:2403.05530"},{"key":"ref8","article-title":"SPHINX: The joint mixing of weights, tasks, and visual embeddings for multi-modal large language models","author":"Lin","year":"2023","journal-title":"arXiv:2311.07575"},{"key":"ref9","article-title":"CogVLM: Visual expert for pretrained language models","author":"Wang","year":"2023","journal-title":"arXiv:2311.03079"},{"key":"ref10","article-title":"Improved baselines with visual instruction tuning","author":"Liu","year":"2023","journal-title":"arXiv:2310.03744"},{"key":"ref11","article-title":"Instruct2Act: Mapping multi-modality instructions to robotic actions with large language model","author":"Huang","year":"2023","journal-title":"arXiv:2305.11176"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1038\/s41586-023-06747-5"},{"key":"ref13","article-title":"LeanDojo: Theorem proving with retrieval-augmented language models","author":"Yang","year":"2023","journal-title":"arXiv:2306.15626"},{"key":"ref14","article-title":"Draft, sketch, and prove: Guiding formal theorem provers with informal proofs","author":"Jiang","year":"2022","journal-title":"arXiv:2210.12283"},{"key":"ref15","article-title":"The dawn of LMMs: Preliminary explorations with GPT-4V(ision)","author":"Yang","year":"2023","journal-title":"arXiv:2309.17421"},{"key":"ref16","article-title":"Sparks of artificial general intelligence: Early experiments with GPT-4","author":"Bubeck","year":"2023","journal-title":"arXiv:2303.12712"},{"key":"ref17","article-title":"Image over text: Transforming formula recognition evaluation with character detection matching","author":"Wang","year":"2024","journal-title":"arXiv:2409.03643"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2022.findings-acl.177"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2020.inlg-1.20"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/WACV45572.2020.9093523"},{"key":"ref21","article-title":"StructChart: On the schema, metric, and augmentation for visual chart understanding","author":"Xia","year":"2023","journal-title":"arXiv:2309.11268"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2022.emnlp-main.811"},{"key":"ref23","article-title":"ChartLlama: A multimodal LLM for chart understanding and generation","author":"Han","year":"2023","journal-title":"arXiv:2311.16483"},{"key":"ref24","article-title":"ChartBench: A benchmark for complex visual reasoning in charts","author":"Xu","year":"2023","journal-title":"arXiv:2312.15915"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.naacl-long.70"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.findings-acl.463"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/WACV48630.2021.00196"},{"key":"ref28","first-page":"6202","article-title":"LineEX: Data extraction from scientific line charts","volume-title":"Proc. IEEE\/CVF Winter Conf. Appl. Comput. Vis. (WACV)","author":"Shivasankaran"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1109\/IRI51335.2021.00050"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.findings-acl.41"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.findings-acl.660"},{"key":"ref32","first-page":"27730","article-title":"Training language models to follow instructions with human feedback","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Ouyang"},{"key":"ref33","first-page":"1877","article-title":"Language models are few-shot learners","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Brown"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v38i16.29779"},{"key":"ref35","article-title":"ChartGPT: Leveraging LLMs to generate charts from abstract natural language","author":"Tian","year":"2023","journal-title":"arXiv:2311.01920"},{"key":"ref36","article-title":"TableGPT: Towards unifying tables, nature language and commands into one GPT","author":"Zha","year":"2023","journal-title":"arXiv:2307.08674"},{"key":"ref37","first-page":"18893","article-title":"Pix2Struct: Screenshot parsing as pretraining for visual language understanding","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Lee"},{"key":"ref38","article-title":"MatCha: Enhancing visual language pretraining with math reasoning and chart derendering","author":"Liu","year":"2022","journal-title":"arXiv:2212.09662"},{"key":"ref39","article-title":"Analysing mathematical reasoning abilities of neural models","author":"Saxton","year":"2019","journal-title":"arXiv:1904.01557"},{"key":"ref40","article-title":"MPLUG-owl: Modularization empowers large language models with multimodality","author":"Ye","year":"2023","journal-title":"arXiv:2304.14178"},{"key":"ref41","first-page":"53366","article-title":"NExT-GPT: Any-to-any multimodal LLM","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Wu"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.findings-acl.828"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2025.findings-acl.978"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00592"},{"key":"ref45","article-title":"LoRA: Low-rank adaptation of large language models","author":"Hu","year":"2021","journal-title":"arXiv:2106.09685"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2022.acl-long.277"},{"key":"ref47","article-title":"CogAgent: A visual language model for GUI agents","author":"Hong","year":"2023","journal-title":"arXiv:2312.08914"},{"key":"ref48","article-title":"Monkey: Image resolution and text label are important things for large multi-modal models","author":"Li","year":"2023","journal-title":"arXiv:2311.06607"},{"key":"ref49","article-title":"MPLUG-DocOwl2: High-resolution compressing for OCR-free multi-page document understanding","author":"Hu","year":"2024","journal-title":"arXiv:2409.03420"},{"key":"ref50","article-title":"Qwen2-VL: Enhancing vision-language model\u2019s perception of the world at any resolution","author":"Wang","year":"2024","journal-title":"arXiv:2409.12191"},{"key":"ref51","article-title":"Qwen2.5-VL technical report","volume-title":"arXiv:2502.13923","author":"Bai","year":"2025"},{"key":"ref52","volume-title":"O3-Mini","year":"2025"},{"key":"ref53","article-title":"TinyChart: Efficient chart understanding with visual token merging and program-of-thoughts learning","author":"Zhang","year":"2024","journal-title":"arXiv:2404.16635"},{"key":"ref54","first-page":"74","article-title":"An awkward disparity between BLEU\/RIBES scores and human judgements in machine translation","volume-title":"Proc. 2nd Workshop Asian Transl.","author":"Tan"}],"container-title":["IEEE Transactions on Image Processing"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/83\/10795784\/11202357.pdf?arnumber=11202357","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,11,19]],"date-time":"2025-11-19T18:48:12Z","timestamp":1763578092000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11202357\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025]]},"references-count":54,"URL":"https:\/\/doi.org\/10.1109\/tip.2025.3607618","relation":{},"ISSN":["1057-7149","1941-0042"],"issn-type":[{"value":"1057-7149","type":"print"},{"value":"1941-0042","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025]]}}}