{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,14]],"date-time":"2026-05-14T23:09:47Z","timestamp":1778800187681,"version":"3.51.4"},"reference-count":64,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,5,1]],"date-time":"2026-05-01T00:00:00Z","timestamp":1777593600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,5,1]],"date-time":"2026-05-01T00:00:00Z","timestamp":1777593600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,5,1]],"date-time":"2026-05-01T00:00:00Z","timestamp":1777593600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,5,1]],"date-time":"2026-05-01T00:00:00Z","timestamp":1777593600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,5,1]],"date-time":"2026-05-01T00:00:00Z","timestamp":1777593600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,5,1]],"date-time":"2026-05-01T00:00:00Z","timestamp":1777593600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,5,1]],"date-time":"2026-05-01T00:00:00Z","timestamp":1777593600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/501100017596","name":"Natural Science Basic Research Program of Shaanxi Province","doi-asserted-by":"publisher","award":["2023-JC-YB-593"],"award-info":[{"award-number":["2023-JC-YB-593"]}],"id":[{"id":"10.13039\/501100017596","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100012226","name":"Fundamental Research Funds for the Central Universities","doi-asserted-by":"publisher","award":["xhj032021013-02"],"award-info":[{"award-number":["xhj032021013-02"]}],"id":[{"id":"10.13039\/501100012226","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100012166","name":"National Key Research and Development Program of China","doi-asserted-by":"publisher","award":["2022YFC3303600"],"award-info":[{"award-number":["2022YFC3303600"]}],"id":[{"id":"10.13039\/501100012166","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100011291","name":"National Key Laboratory of Science and Technology on Communications","doi-asserted-by":"publisher","award":["6142101210201"],"award-info":[{"award-number":["6142101210201"]}],"id":[{"id":"10.13039\/501100011291","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100012270","name":"Shaanxi Key Science and Technology Innovation Team Project","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100012270","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100031935","name":"Xi'an Jiaotong University","doi-asserted-by":"publisher","id":[{"id":"10.13039\/100031935","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62250066"],"award-info":[{"award-number":["62250066"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["61721002"],"award-info":[{"award-number":["61721002"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62137002"],"award-info":[{"award-number":["62137002"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62192781"],"award-info":[{"award-number":["62192781"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62293553"],"award-info":[{"award-number":["62293553"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["61937001"],"award-info":[{"award-number":["61937001"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62106190"],"award-info":[{"award-number":["62106190"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Computer Vision and Image Understanding"],"published-print":{"date-parts":[[2026,5]]},"DOI":"10.1016\/j.cviu.2026.104745","type":"journal-article","created":{"date-parts":[[2026,4,17]],"date-time":"2026-04-17T16:34:51Z","timestamp":1776443691000},"page":"104745","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":1,"special_numbering":"C","title":["GoT-CQA: Graph-of-Thought guided compositional reasoning for chart question answering"],"prefix":"10.1016","volume":"268","author":[{"given":"Lingling","family":"Zhang","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0002-8128-3534","authenticated-orcid":false,"given":"Muye","family":"Huang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Qianying","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3193-3658","authenticated-orcid":false,"given":"Yaxian","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-9377-9062","authenticated-orcid":false,"given":"Wenjun","family":"Wu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0001-8850-4128","authenticated-orcid":false,"given":"Ziqi","family":"He","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-6004-0675","authenticated-orcid":false,"given":"Jun","family":"Liu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"78","reference":[{"key":"10.1016\/j.cviu.2026.104745_b1","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2024.110930","article-title":"Kyrtos: A methodology for automatic deep analysis of graphic charts with curves in technical documents","volume":"157","author":"Alexiou","year":"2025","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.cviu.2026.104745_b2","doi-asserted-by":"crossref","unstructured":"Anderson,\u00a0P., He,\u00a0X., Buehler,\u00a0C., Teney,\u00a0D., Johnson,\u00a0M., Gould,\u00a0S., Zhang,\u00a0L., 2018. Bottom-up and top-down attention for image captioning and visual question answering. In: CVPR. pp. 6077\u20136086.","DOI":"10.1109\/CVPR.2018.00636"},{"key":"10.1016\/j.cviu.2026.104745_b3","doi-asserted-by":"crossref","unstructured":"Andreas,\u00a0J., Rohrbach,\u00a0M., Darrell,\u00a0T., Klein,\u00a0D., 2016. Neural module networks. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. pp. 39\u201348.","DOI":"10.1109\/CVPR.2016.12"},{"key":"10.1016\/j.cviu.2026.104745_b4","series-title":"Qwen2.5-VL technical report","author":"Bai","year":"2025"},{"key":"10.1016\/j.cviu.2026.104745_b5","first-page":"1877","article-title":"Language models are few-shot learners","volume":"33","author":"Brown","year":"2020","journal-title":"NeurIPS"},{"key":"10.1016\/j.cviu.2026.104745_b6","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2024.111129","article-title":"Enhancing robust VQA via contrastive and self-supervised learning","volume":"159","author":"Cao","year":"2025","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.cviu.2026.104745_b7","doi-asserted-by":"crossref","unstructured":"Chaudhry,\u00a0R., Shekhar,\u00a0S., Gupta,\u00a0U., Maneriker,\u00a0P., Bansal,\u00a0P., Joshi,\u00a0A., 2020. Leaf-qa: Locate, encode & attend for figure question answering. In: WACV. pp. 3512\u20133521.","DOI":"10.1109\/WACV45572.2020.9093269"},{"key":"10.1016\/j.cviu.2026.104745_b8","series-title":"Figure captioning with reasoning and sequence-level training","author":"Chen","year":"2019"},{"key":"10.1016\/j.cviu.2026.104745_b9","doi-asserted-by":"crossref","unstructured":"Cheng,\u00a0Z.-Q., Dai,\u00a0Q., Hauptmann,\u00a0A.G., 2023. Chartreader: A unified framework for chart derendering and comprehension without heuristic rules. In: ICCV. pp. 22202\u201322213.","DOI":"10.1109\/ICCV51070.2023.02029"},{"key":"10.1016\/j.cviu.2026.104745_b10","series-title":"Proceedings of the 33rd ACM International Conference on Information and Knowledge Management, CIKM 2024, Boise, ID, USA, October 21-25, 2024","first-page":"3709","article-title":"MSG-chart: Multimodal scene graph for ChartQA","author":"Dai","year":"2024"},{"key":"10.1016\/j.cviu.2026.104745_b11","doi-asserted-by":"crossref","unstructured":"Demir,\u00a0S., Carberry,\u00a0S., McCoy,\u00a0K.F., 2008. Generating textual summaries of bar charts. In: INLG. pp. 7\u201315.","DOI":"10.3115\/1708322.1708327"},{"key":"10.1016\/j.cviu.2026.104745_b12","series-title":"Bert: Pre-training of deep bidirectional transformers for language understanding","author":"Devlin","year":"2018"},{"key":"10.1016\/j.cviu.2026.104745_b13","first-page":"6616","article-title":"Large-scale adversarial training for vision-and-language representation learning","volume":"33","author":"Gan","year":"2020","journal-title":"NeurIPS"},{"key":"10.1016\/j.cviu.2026.104745_b14","doi-asserted-by":"crossref","unstructured":"Gao,\u00a0J., Zhou,\u00a0Y., Barner,\u00a0K.E., 2012. View: Visual information extraction widget for improving chart images accessibility. In: ICIP. pp. 2865\u20132868.","DOI":"10.1109\/ICIP.2012.6467497"},{"key":"10.1016\/j.cviu.2026.104745_b15","series-title":"The llama 3 herd of models","author":"Grattafiori","year":"2024"},{"key":"10.1016\/j.cviu.2026.104745_b16","series-title":"Visual programming: Compositional visual reasoning without training","author":"Gupta","year":"2022"},{"key":"10.1016\/j.cviu.2026.104745_b17","doi-asserted-by":"crossref","unstructured":"He,\u00a0K., Zhang,\u00a0X., Ren,\u00a0S., Sun,\u00a0J., 2016. Deep residual learning for image recognition. In: CVPR. pp. 770\u2013778.","DOI":"10.1109\/CVPR.2016.90"},{"key":"10.1016\/j.cviu.2026.104745_b18","doi-asserted-by":"crossref","unstructured":"Herzig,\u00a0J., Nowak,\u00a0P.K., M\u00fcller,\u00a0T., Piccinno,\u00a0F., Eisenschlos,\u00a0J., 2020. TaPas: Weakly Supervised Table Parsing via Pre-training. In: Jurafsky,\u00a0D., Chai,\u00a0J., Schluter,\u00a0N., Tetreault,\u00a0J. (Eds.), ACL.","DOI":"10.18653\/v1\/2020.acl-main.398"},{"issue":"8","key":"10.1016\/j.cviu.2026.104745_b19","doi-asserted-by":"crossref","first-page":"1735","DOI":"10.1162\/neco.1997.9.8.1735","article-title":"Long short-term memory","volume":"9","author":"Hochreiter","year":"1997","journal-title":"Neural Comput."},{"key":"10.1016\/j.cviu.2026.104745_b20","series-title":"SciCap: Generating captions for scientific figures","author":"Hsu","year":"2021"},{"key":"10.1016\/j.cviu.2026.104745_b21","doi-asserted-by":"crossref","unstructured":"Huang,\u00a0C.-Y., Hsu,\u00a0T.-Y., Rossi,\u00a0R., Nenkova,\u00a0A., Kim,\u00a0S., Chan,\u00a0G.Y.-Y., Koh,\u00a0E., Giles,\u00a0C.L., Huang,\u00a0T.-H., 2023. Summaries as captions: Generating figure captions for scientific documents with automated text summarization. In: INLG. pp. 80\u201392.","DOI":"10.18653\/v1\/2023.inlg-main.6"},{"key":"10.1016\/j.cviu.2026.104745_b22","series-title":"GQA: A new dataset for real-world visual reasoning and compositional question answering","author":"Hudson","year":"2019"},{"key":"10.1016\/j.cviu.2026.104745_b23","doi-asserted-by":"crossref","unstructured":"Hudson,\u00a0D.A., Manning,\u00a0C.D., 2019b. Gqa: A new dataset for real-world visual reasoning and compositional question answering. In: CVPR. pp. 6700\u20136709.","DOI":"10.1109\/CVPR.2019.00686"},{"key":"10.1016\/j.cviu.2026.104745_b24","doi-asserted-by":"crossref","unstructured":"Jing,\u00a0C., Jia,\u00a0Y., Wu,\u00a0Y., Liu,\u00a0X., Wu,\u00a0Q., 2022. Maintaining Reasoning Consistency in Compositional Visual Question Answering. In: CVPR. pp. 5099\u20135108.","DOI":"10.1109\/CVPR52688.2022.00504"},{"key":"10.1016\/j.cviu.2026.104745_b25","doi-asserted-by":"crossref","unstructured":"Jung,\u00a0D., Kim,\u00a0W., Song,\u00a0H., Hwang,\u00a0J.-i., Lee,\u00a0B., Kim,\u00a0B., Seo,\u00a0J., 2017. Chartsense: Interactive data extraction from chart images. In: CHI. pp. 6706\u20136717.","DOI":"10.1145\/3025453.3025957"},{"key":"10.1016\/j.cviu.2026.104745_b26","doi-asserted-by":"crossref","unstructured":"Kafle,\u00a0K., Price,\u00a0B., Cohen,\u00a0S., Kanan,\u00a0C., 2018. Dvqa: Understanding data visualizations via question answering. In: CVPR. pp. 5648\u20135656.","DOI":"10.1109\/CVPR.2018.00592"},{"key":"10.1016\/j.cviu.2026.104745_b27","doi-asserted-by":"crossref","unstructured":"Kafle,\u00a0K., Shrestha,\u00a0R., Cohen,\u00a0S., Price,\u00a0B., Kanan,\u00a0C., 2020. Answering questions about data visualizations using efficient bimodal fusion. In: WACV. pp. 1498\u20131507.","DOI":"10.1109\/WACV45572.2020.9093494"},{"key":"10.1016\/j.cviu.2026.104745_b28","unstructured":"Kahou,\u00a0S.E., Michalski,\u00a0V., Atkinson,\u00a0A., K\u00e1d\u00e1r,\u00a0\u00c1., Trischler,\u00a0A., Bengio,\u00a0Y., 2017. Figureqa: An annotated figure dataset for visual reasoning. In: ICLR."},{"key":"10.1016\/j.cviu.2026.104745_b29","series-title":"Chart-to-text: A large-scale benchmark for chart summarization","author":"Kanthara","year":"2022"},{"key":"10.1016\/j.cviu.2026.104745_b30","doi-asserted-by":"crossref","unstructured":"Kato,\u00a0H., Nakazawa,\u00a0M., Yang,\u00a0H.-K., Chen,\u00a0M., Stenger,\u00a0B., 2022. Parsing line chart images using linear programming. In: WACV. pp. 2109\u20132118.","DOI":"10.1109\/WACV51458.2022.00261"},{"key":"10.1016\/j.cviu.2026.104745_b31","doi-asserted-by":"crossref","unstructured":"Kim,\u00a0G., Hong,\u00a0T., Yim,\u00a0M., Nam,\u00a0J., Park,\u00a0J., Yim,\u00a0J., Hwang,\u00a0W., Yun,\u00a0S., Han,\u00a0D., Park,\u00a0S., 2022. Ocr-free document understanding transformer. In: ECCV. pp. 498\u2013517.","DOI":"10.1007\/978-3-031-19815-1_29"},{"key":"10.1016\/j.cviu.2026.104745_b32","unstructured":"Lee,\u00a0K., Joshi,\u00a0M., Turc,\u00a0I.R., Hu,\u00a0H., Liu,\u00a0F., Eisenschlos,\u00a0J.M., Khandelwal,\u00a0U., Shaw,\u00a0P., Chang,\u00a0M.-W., Toutanova,\u00a0K., 2023. Pix2struct: Screenshot parsing as pretraining for visual language understanding. In: ICML. pp. 18893\u201318912."},{"key":"10.1016\/j.cviu.2026.104745_b33","doi-asserted-by":"crossref","unstructured":"Levy,\u00a0M., Ben-Ari,\u00a0R., Lischinski,\u00a0D., 2022. Classification-regression for chart comprehension. In: ECCV. pp. 469\u2013484.","DOI":"10.1007\/978-3-031-20059-5_27"},{"key":"10.1016\/j.cviu.2026.104745_b34","article-title":"Joint answering and explanation for visual commonsense reasoning","author":"Li","year":"2023","journal-title":"TIP"},{"key":"10.1016\/j.cviu.2026.104745_b35","first-page":"3367","article-title":"Weakly-Supervised 3D spatial reasoning for text-based visual question answering","volume":"32","author":"Li","year":"2023","journal-title":"TIP"},{"key":"10.1016\/j.cviu.2026.104745_b36","doi-asserted-by":"crossref","unstructured":"Li,\u00a0X., Yin,\u00a0X., Li,\u00a0C., Zhang,\u00a0P., Hu,\u00a0X., Zhang,\u00a0L., Wang,\u00a0L., Hu,\u00a0H., Dong,\u00a0L., Wei,\u00a0F., et al., 2020. Oscar: Object-semantics aligned pre-training for vision-language tasks. In: ECCV. pp. 121\u2013137.","DOI":"10.1007\/978-3-030-58577-8_8"},{"key":"10.1016\/j.cviu.2026.104745_b37","doi-asserted-by":"crossref","unstructured":"Liu,\u00a0Y., Gu,\u00a0J., Goyal,\u00a0N., Li,\u00a0X., Edunov,\u00a0S., Ghazvininejad,\u00a0M., Lewis,\u00a0M., Zettlemoyer,\u00a0L., 2020. Multilingual denoising pre-training for neural machine translation. In: ACL. pp. 726\u2013742.","DOI":"10.1162\/tacl_a_00343"},{"key":"10.1016\/j.cviu.2026.104745_b38","series-title":"Data extraction from charts via single deep neural network","author":"Liu","year":"2019"},{"key":"10.1016\/j.cviu.2026.104745_b39","doi-asserted-by":"crossref","unstructured":"Liu,\u00a0F., Piccinno,\u00a0F., Krichene,\u00a0S., Pang,\u00a0C., Lee,\u00a0K., Joshi,\u00a0M., Altun,\u00a0Y., Collier,\u00a0N., Eisenschlos,\u00a0J., 2023. MatCha: Enhancing visual language pretraining with math reasoning and chart derendering. In: ACL. pp. 12756\u201312770.","DOI":"10.18653\/v1\/2023.acl-long.714"},{"key":"10.1016\/j.cviu.2026.104745_b40","article-title":"Vilbert: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks","volume":"32","author":"Lu","year":"2019","journal-title":"NeurIPS"},{"key":"10.1016\/j.cviu.2026.104745_b41","article-title":"Hierarchical question-image co-attention for visual question answering","volume":"29","author":"Lu","year":"2016","journal-title":"NeurIPS"},{"key":"10.1016\/j.cviu.2026.104745_b42","doi-asserted-by":"crossref","unstructured":"Luo,\u00a0J., Li,\u00a0Z., Wang,\u00a0J., Lin,\u00a0C.-Y., 2021. Chartocr: Data extraction from charts images via a deep hybrid framework. In: WACV. pp. 1917\u20131925.","DOI":"10.1109\/WACV48630.2021.00196"},{"key":"10.1016\/j.cviu.2026.104745_b43","first-page":"7378","article-title":"Weakly supervised learning for textbook question answering","volume":"31","author":"Ma","year":"2022","journal-title":"TIP"},{"key":"10.1016\/j.cviu.2026.104745_b44","unstructured":"Masry,\u00a0A., Hoque,\u00a0E., 2021. Integrating image data extraction and table parsing methods for chart question answering. In: CVPR. pp. 1\u20135."},{"key":"10.1016\/j.cviu.2026.104745_b45","doi-asserted-by":"crossref","unstructured":"Masry,\u00a0A., Kavehzadeh,\u00a0P., Do,\u00a0X.L., Hoque,\u00a0E., Joty,\u00a0S., 2023. UniChart: A universal vision-language pretrained model for chart comprehension and reasoning. In: EMNLP. pp. 14662\u201314684.","DOI":"10.18653\/v1\/2023.emnlp-main.906"},{"key":"10.1016\/j.cviu.2026.104745_b46","doi-asserted-by":"crossref","unstructured":"Masry,\u00a0A., Long,\u00a0D.X., Tan,\u00a0J.Q., Joty,\u00a0S., Hoque,\u00a0E., 2022. Chartqa: A benchmark for question answering about charts with visual and logical reasoning. In: Findings of ACL. pp. 2263\u20132279.","DOI":"10.18653\/v1\/2022.findings-acl.177"},{"key":"10.1016\/j.cviu.2026.104745_b47","doi-asserted-by":"crossref","unstructured":"Methani,\u00a0N., Ganguly,\u00a0P., Khapra,\u00a0M.M., Kumar,\u00a0P., 2020. Plotqa: Reasoning over scientific plots. In: WACV. pp. 1527\u20131536.","DOI":"10.1109\/WACV45572.2020.9093523"},{"issue":"3","key":"10.1016\/j.cviu.2026.104745_b48","first-page":"431","article-title":"Describing complex charts in natural language: A caption generation system","volume":"24","author":"Mittal","year":"1998","journal-title":"Comput. Linguist."},{"key":"10.1016\/j.cviu.2026.104745_b49","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2022.108898","article-title":"Explanation vs. attention: A two-player game to obtain attention for VQA and visual dialog","volume":"132","author":"Patro","year":"2022","journal-title":"Pattern Recognit."},{"issue":"1","key":"10.1016\/j.cviu.2026.104745_b50","doi-asserted-by":"crossref","first-page":"318","DOI":"10.1109\/TPAMI.2020.3004830","article-title":"Mra-net: Improving vqa via multi-modal relation attention network","volume":"44","author":"Peng","year":"2020","journal-title":"TPAMI"},{"key":"10.1016\/j.cviu.2026.104745_b51","doi-asserted-by":"crossref","unstructured":"Qian,\u00a0X., Koh,\u00a0E., Du,\u00a0F., Kim,\u00a0S., Chan,\u00a0J., Rossi,\u00a0R.A., Malik,\u00a0S., Lee,\u00a0T.Y., 2021. Generating accurate caption units for figure captioning. In: WWW. pp. 2792\u20132804.","DOI":"10.1145\/3442381.3449923"},{"key":"10.1016\/j.cviu.2026.104745_b52","doi-asserted-by":"crossref","unstructured":"Rane,\u00a0C., Subramanya,\u00a0S.M., Endluri,\u00a0D.S., Wu,\u00a0J., Giles,\u00a0C.L., 2021. Chartreader: Automatic parsing of bar-plots. In: IRI. pp. 318\u2013325.","DOI":"10.1109\/IRI51335.2021.00050"},{"key":"10.1016\/j.cviu.2026.104745_b53","doi-asserted-by":"crossref","unstructured":"Singh,\u00a0H., Shekhar,\u00a0S., 2020. STL-CQA: Structure-based transformers with localization and encoding for chart question answering. In: EMNLP. pp. 3275\u20133284.","DOI":"10.18653\/v1\/2020.emnlp-main.264"},{"key":"10.1016\/j.cviu.2026.104745_b54","series-title":"Gemma 3 technical report","author":"Team","year":"2025"},{"key":"10.1016\/j.cviu.2026.104745_b55","article-title":"Attention is all you need","volume":"30","author":"Vaswani","year":"2017","journal-title":"NeurIPS"},{"key":"10.1016\/j.cviu.2026.104745_b56","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2024.110368","article-title":"Coordinating explicit and implicit knowledge for knowledge-based VQA","volume":"151","author":"Wang","year":"2024","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.cviu.2026.104745_b57","first-page":"4812","article-title":"DisAVR: Disentangled adaptive visual reasoning network for diagram question answering","volume":"32","author":"Wang","year":"2023","journal-title":"TIP"},{"issue":"12","key":"10.1016\/j.cviu.2026.104745_b58","doi-asserted-by":"crossref","first-page":"8914","DOI":"10.1109\/TKDE.2024.3432767","article-title":"One subgraph for all: Efficient reasoning on opening subgraphs for inductive knowledge graph completion","volume":"36","author":"Xie","year":"2024","journal-title":"IEEE Trans. Knowl. Data Eng."},{"key":"10.1016\/j.cviu.2026.104745_b59","doi-asserted-by":"crossref","unstructured":"Yu,\u00a0D., Fu,\u00a0J., Mei,\u00a0T., Rui,\u00a0Y., 2017. Multi-level attention networks for visual question answering. In: CVPR. pp. 4709\u20134717.","DOI":"10.1109\/CVPR.2017.446"},{"key":"10.1016\/j.cviu.2026.104745_b60","first-page":"5936","article-title":"Video question answering with prior knowledge and object-sensitive learning","volume":"31","author":"Zeng","year":"2022","journal-title":"TIP"},{"key":"10.1016\/j.cviu.2026.104745_b61","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2023.109337","article-title":"Beyond OCR + VQA: Towards end-to-end reading and reasoning for robust and accurate textvqa","volume":"138","author":"Zeng","year":"2023","journal-title":"Pattern Recognit."},{"issue":"2","key":"10.1016\/j.cviu.2026.104745_b62","doi-asserted-by":"crossref","DOI":"10.1016\/j.ipm.2023.103585","article-title":"Number-enhanced representation with hierarchical recursive tree decoding for math word problem solving","volume":"61","author":"Zhang","year":"2024","journal-title":"Inf. Process. Manage."},{"key":"10.1016\/j.cviu.2026.104745_b63","doi-asserted-by":"crossref","unstructured":"Zhou,\u00a0M., Fung,\u00a0Y., Chen,\u00a0L., Thomas,\u00a0C., Ji,\u00a0H., Chang,\u00a0S.-F., 2023. Enhanced chart understanding via visual language pre-training on plot table pairs. In: Findings of ACL. pp. 1314\u20131326.","DOI":"10.18653\/v1\/2023.findings-acl.85"},{"key":"10.1016\/j.cviu.2026.104745_b64","series-title":"AutoChart: A dataset for chart-to-text generation task","author":"Zhu","year":"2021"}],"container-title":["Computer Vision and Image Understanding"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S1077314226001128?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S1077314226001128?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,5,14]],"date-time":"2026-05-14T22:33:50Z","timestamp":1778798030000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S1077314226001128"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,5]]},"references-count":64,"alternative-id":["S1077314226001128"],"URL":"https:\/\/doi.org\/10.1016\/j.cviu.2026.104745","relation":{},"ISSN":["1077-3142"],"issn-type":[{"value":"1077-3142","type":"print"}],"subject":[],"published":{"date-parts":[[2026,5]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"GoT-CQA: Graph-of-Thought guided compositional reasoning for chart question answering","name":"articletitle","label":"Article Title"},{"value":"Computer Vision and Image Understanding","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.cviu.2026.104745","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Elsevier Inc. All rights are reserved, including those for text and data mining, AI training, and similar technologies.","name":"copyright","label":"Copyright"}],"article-number":"104745"}}