{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,6]],"date-time":"2026-05-06T06:19:37Z","timestamp":1778048377782,"version":"3.51.4"},"reference-count":71,"publisher":"IEEE","license":[{"start":{"date-parts":[[2026,3,6]],"date-time":"2026-03-06T00:00:00Z","timestamp":1772755200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,3,6]],"date-time":"2026-03-06T00:00:00Z","timestamp":1772755200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2026,3,6]]},"DOI":"10.1109\/wacv61042.2026.00786","type":"proceedings-article","created":{"date-parts":[[2026,5,5]],"date-time":"2026-05-05T19:59:32Z","timestamp":1778011172000},"page":"8146-8156","source":"Crossref","is-referenced-by-count":0,"title":["START: Spatial and Textual Learning for Chart Understanding"],"prefix":"10.1109","author":[{"given":"Zhuoming","family":"Liu","sequence":"first","affiliation":[{"name":"University of Wisconsin-Madison"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xiaofeng","family":"Gao","sequence":"additional","affiliation":[{"name":"Amazon AGI"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Feiyang","family":"Niu","sequence":"additional","affiliation":[{"name":"Amazon AGI"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Qiaozi","family":"Gao","sequence":"additional","affiliation":[{"name":"Amazon AGI"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Liu","family":"Liu","sequence":"additional","affiliation":[{"name":"MIT"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Robinson","family":"Piramuthu","sequence":"additional","affiliation":[{"name":"Amazon AGI"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref1","article-title":"Qwen2. 5-vl technical report","author":"Bai","year":"2025"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/WACV45572.2020.9093269"},{"key":"ref3","article-title":"Breaking the sft plateau: Multimodal structured reinforcement learning for chart-to-code generation","author":"Chen","year":"2025"},{"key":"ref4","article-title":"Chart-r1: Chain-of-thought supervision and reinforcement for advanced chart reasoner","author":"Chen","year":"2025"},{"key":"ref5","article-title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","author":"Chen","year":"2024"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-71249-9_9"},{"key":"ref7","article-title":"Video-r1: Reinforcing video reasoning in mllms","author":"Feng","year":"2025"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.563"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1038\/s41586-025-09422-z"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/ijcnn64981.2025.11227777"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.90"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2025.findings-emnlp.172"},{"key":"ref13","volume-title":"Mathruler","year":"2025"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1162\/neco.1997.9.8.1735"},{"key":"ref15","article-title":"Vision-r1: Incentivizing reasoning capability in multimodal large language models","author":"Huang","year":"2025"},{"key":"ref16","article-title":"Livecodebench: Holistic and contamination free evaluation of large language models for code","author":"Jain","year":"2024"},{"key":"ref17","article-title":"Chartreasoner: Code-driven modality bridging for long-chain reasoning in chart question answering","author":"Jia","year":"2025"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00592"},{"key":"ref19","article-title":"Figureqa: An annotated figure dataset for visual reasoning","author":"Kahou","year":"2017"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00180"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2022.acl-long.277"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.83"},{"key":"ref23","article-title":"Llava-onevision: Easy visual task transfer","author":"Li","year":"2024"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.acl-long.775"},{"key":"ref25","article-title":"Videochat-r1: Enhancing spatio-temporal perception via reinforcement fine-tuning","author":"Li","year":"2025"},{"key":"ref26","article-title":"Let\u2019s verify step by step","author":"Lightman","year":"2023"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.1405.0312"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1007\/3-540-27806-0_1008"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.02484"},{"key":"ref30","author":"Liu","year":"2024","journal-title":"LLaVA-NeXT: Improved reasoning, ocr, and world knowledge"},{"key":"ref31","article-title":"Visual instruction tuning","volume":"36","author":"Liu","year":"2024","journal-title":"Advances in neural information processing systems"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-72970-6_3"},{"key":"ref33","article-title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts","volume-title":"The Twelfth International Conference on Learning Representations","author":"Lu"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1109\/WACV48630.2021.00196"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2022.findings-acl.177"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.emnlp-main.906"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.findings-acl.619"},{"key":"ref38","article-title":"Chartgemma: Visual instruction-tuning for chart reasoning in the wild","author":"Masry","year":"2024"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2025.findings-acl.978"},{"key":"ref40","article-title":"Bigcharts-r1: Enhanced chart reasoning with visual reinforcement finetuning","author":"Masry","year":"2025"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.findings-acl.463"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1109\/WACV45572.2020.9093523"},{"key":"ref43","year":"2024","journal-title":"Large language model"},{"key":"ref44","volume-title":"Codeforces","author":"Penedo","year":"2025"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1111\/cgf.13193"},{"key":"ref46","article-title":"Sam 2: Segment anything in images and videos","volume-title":"The Thirteenth International Conference on Learning Representations","author":"Ravi"},{"key":"ref47","first-page":"1046","article-title":"Languagerefer: Spatial-language model for 3d visual grounding","volume-title":"Conference on Robot Learning","author":"Roh"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.21236\/ADA164453"},{"key":"ref49","article-title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","author":"Shao","year":"2024"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00851"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00869"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2020.emnlp-main.264"},{"key":"ref53","article-title":"Chartmaster: Advancing chart-to-code generation with real-world charts and chart similarity reinforcement learning","author":"Tan","year":"2025"},{"key":"ref54","author":"Veeraboina","year":"2023","journal-title":"Aime problem set 1983-2024"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-032-04627-7_30"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-73254-6_9"},{"key":"ref57","article-title":"Time-r1: Post-training large vision language model for temporal video grounding","author":"Wang","year":"2025"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.52202\/079017-3609"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2025.findings-naacl.164"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.01243"},{"key":"ref61","doi-asserted-by":"publisher","DOI":"10.1109\/tip.2025.3607618"},{"key":"ref62","article-title":"Chartmoe: Mixture of diversely aligned expert connector for chart understanding","volume-title":"The Thirteenth International Conference on Learning Representations","author":"Xu"},{"key":"ref63","article-title":"Chartmimic: Evaluating lmm\u2019s cross-modal reasoning capability via chart-to-code generation","volume-title":"The Thirteenth International Conference on Learning Representations","author":"Yang"},{"key":"ref64","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51701.2025.00229"},{"key":"ref65","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51701.2025.00255"},{"key":"ref66","article-title":"mPLUG-Owl3: Towards long image-sequence understanding in multi-modal large language models","author":"Ye","year":"2024"},{"key":"ref67","doi-asserted-by":"publisher","DOI":"10.1162\/tacl_a_00166"},{"key":"ref68","article-title":"Silvr: A simple language-based video reasoning framework","author":"Zhang","year":"2025"},{"key":"ref69","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.emnlp-main.112"},{"key":"ref70","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-73242-3_10"},{"key":"ref71","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v32i1.12342"}],"event":{"name":"2026 IEEE\/CVF Winter Conference on Applications of Computer Vision (WACV)","location":"Tucson, AZ, USA","start":{"date-parts":[[2026,3,6]]},"end":{"date-parts":[[2026,3,10]]}},"container-title":["2026 IEEE\/CVF Winter Conference on Applications of Computer Vision (WACV)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/11491838\/11491925\/11492432.pdf?arnumber=11492432","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,5,6]],"date-time":"2026-05-06T05:56:36Z","timestamp":1778046996000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11492432\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,3,6]]},"references-count":71,"URL":"https:\/\/doi.org\/10.1109\/wacv61042.2026.00786","relation":{},"subject":[],"published":{"date-parts":[[2026,3,6]]}}}