{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,15]],"date-time":"2026-05-15T13:22:07Z","timestamp":1778851327236,"version":"3.51.4"},"reference-count":52,"publisher":"Springer Science and Business Media LLC","issue":"5","license":[{"start":{"date-parts":[[2023,11,30]],"date-time":"2023-11-30T00:00:00Z","timestamp":1701302400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2023,11,30]],"date-time":"2023-11-30T00:00:00Z","timestamp":1701302400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"funder":[{"DOI":"10.13039\/501100012166","name":"National Key Research and Development Program of China","doi-asserted-by":"publisher","award":["2022YFC3303603"],"award-info":[{"award-number":["2022YFC3303603"]}],"id":[{"id":"10.13039\/501100012166","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100012166","name":"National Key Research and Development Program of China","doi-asserted-by":"publisher","award":["2021YFB1715600"],"award-info":[{"award-number":["2021YFB1715600"]}],"id":[{"id":"10.13039\/501100012166","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62137002"],"award-info":[{"award-number":["62137002"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["U22B2019"],"award-info":[{"award-number":["U22B2019"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62272372"],"award-info":[{"award-number":["62272372"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62293553"],"award-info":[{"award-number":["62293553"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62250066"],"award-info":[{"award-number":["62250066"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["621737002"],"award-info":[{"award-number":["621737002"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"name":"Innovative Research Group of the National Natural Science Founda- tion of China","award":["61721002"],"award-info":[{"award-number":["61721002"]}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Int J Comput Vis"],"published-print":{"date-parts":[[2024,5]]},"DOI":"10.1007\/s11263-023-01954-z","type":"journal-article","created":{"date-parts":[[2023,11,30]],"date-time":"2023-11-30T02:01:33Z","timestamp":1701309693000},"page":"1578-1591","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":12,"title":["Diagram Perception Networks for Textbook Question Answering via Joint Optimization"],"prefix":"10.1007","volume":"132","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-7432-3238","authenticated-orcid":false,"given":"Jie","family":"Ma","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jun","family":"Liu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Qi","family":"Chai","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Pinghui","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jing","family":"Tao","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2023,11,30]]},"reference":[{"key":"1954_CR1","doi-asserted-by":"crossref","unstructured":"Anderson, P., Wu, Q., Teney, D., et\u00a0al. (2018). Vision-and-language navigation: Interpreting visually-grounded navigation instructions in real environments. In CVPR, pp 3674\u20133683.","DOI":"10.1109\/CVPR.2018.00387"},{"key":"1954_CR2","doi-asserted-by":"crossref","unstructured":"Antol, S., Agrawal, A., Lu, J., et\u00a0al. (2015). Vqa: Visual question answering. In ICCV, pp 2425\u20132433.","DOI":"10.1109\/ICCV.2015.279"},{"key":"1954_CR3","unstructured":"Ba, J. L., Kiros, J. R., & Hinton, G. E. (2016). Layer normalization. arXiv preprint arXiv:1607.06450"},{"key":"1954_CR4","doi-asserted-by":"crossref","unstructured":"Caesar, H., Uijlings, J., & Ferrari, V. (2016). Region-based semantic segmentation with end-to-end training. In ECCV, pp 381\u2013397.","DOI":"10.1007\/978-3-319-46448-0_23"},{"key":"1954_CR5","doi-asserted-by":"crossref","unstructured":"Chen, Y., Li, L., Yu, L., et\u00a0al. (2020). UNITER: universal image-text representation learning. In A. Vedaldi, H. Bischof, T. Brox et\u00a0al (eds) ECCV, pp 104\u2013120.","DOI":"10.1007\/978-3-030-58577-8_7"},{"key":"1954_CR6","unstructured":"Clark, P., Cowhey, I., Etzioni, O., et\u00a0al. (2018). Think you have solved question answering? try arc, the ai2 reasoning challenge. arXiv preprint arXiv:1803.05457"},{"issue":"4","key":"1954_CR7","doi-asserted-by":"publisher","first-page":"39","DOI":"10.1609\/aimag.v41i4.5304","volume":"41","author":"P Clark","year":"2020","unstructured":"Clark, P., Etzioni, O., Khot, T., et al. (2020). From \u2018f\u2019to \u2018a\u2019on the ny regents science exams: An overview of the aristo project. AI Magazine, 41(4), 39\u201353.","journal-title":"AI Magazine"},{"key":"1954_CR8","unstructured":"Devlin, J., Chang, M. W., Lee, K., et\u00a0al. (2019). Bert: Pre-training of deep bidirectional transformers for language understanding. In NAACL, pp 4171\u20134186."},{"key":"1954_CR9","doi-asserted-by":"crossref","unstructured":"Fan, L., Huang, W., Gan, C., et\u00a0al. (2018). End-to-end learning of motion representation for video understanding. In CVPR, pp 6016\u20136025.","DOI":"10.1109\/CVPR.2018.00630"},{"key":"1954_CR10","doi-asserted-by":"crossref","unstructured":"G\u00f3mez-P\u00e9rez, J. M., & Ortega, R. (2020). Isaaq-mastering textbook questions with pre-trained transformers and bottom-up and top-down attention. In EMNLP, pp 5469\u20135479.","DOI":"10.18653\/v1\/2020.emnlp-main.441"},{"key":"1954_CR11","unstructured":"Hamilton, W. L., Ying, R., & Leskovec, J. (2017). Inductive representation learning on large graphs. In NeurIPS, pp 1025\u20131035."},{"key":"1954_CR12","doi-asserted-by":"crossref","unstructured":"Haurilet, M., Al-Halah, Z., & Stiefelhagen, R. (2018). Moqa - a multi-modal question answering architecture. In ECCVW, pp 106\u2013113.","DOI":"10.1007\/978-3-030-11018-5_9"},{"key":"1954_CR13","doi-asserted-by":"crossref","unstructured":"He, J., Fu, X., Long, Z., et\u00a0al. (2021). Textbook question answering with multi-type question learning and contextualized diagram representation. In ICANN, pp 86\u201398.","DOI":"10.1007\/978-3-030-86380-7_8"},{"key":"1954_CR14","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., et\u00a0al. (2016). Deep residual learning for image recognition. In CVPR, pp 770\u2013778.","DOI":"10.1109\/CVPR.2016.90"},{"key":"1954_CR15","doi-asserted-by":"crossref","unstructured":"Kembhavi, A., Salvato, M., Kolve, E., et\u00a0al. (2016). a diagram is worth a dozen images. In ECCV, pp 235\u2013251.","DOI":"10.1007\/978-3-319-46493-0_15"},{"key":"1954_CR16","doi-asserted-by":"crossref","unstructured":"Kembhavi, A., Seo, M., Schwenk, D., et\u00a0al. (2017). Are you smarter than a sixth grader? textbook question answering for multimodal machine comprehension. In CVPR, pp 4999\u20135007.","DOI":"10.1109\/CVPR.2017.571"},{"key":"1954_CR17","doi-asserted-by":"crossref","unstructured":"Kim, D., Yoo, Y., Kim, J. S., et\u00a0al. (2018). Dynamic graph generation network: Generating relational knowledge from diagrams. In CVPR, pp 4167\u20134175.","DOI":"10.1109\/CVPR.2018.00438"},{"key":"1954_CR18","doi-asserted-by":"crossref","unstructured":"Kim, D., Kim, S., & Kwak, N. (2019). Textbook question answering with multi-modal context graph understanding and self-supervised open-set comprehension. In ACL, pp 3568\u20133584.","DOI":"10.18653\/v1\/P19-1347"},{"key":"1954_CR19","doi-asserted-by":"crossref","unstructured":"Krishnamurthy, J., Tafjord, O., & Kembhavi, A. (2016). Semantic parsing to probabilistic programs for situated question answering. In EMNLP, pp 160\u2013170.","DOI":"10.18653\/v1\/D16-1016"},{"key":"1954_CR20","doi-asserted-by":"crossref","unstructured":"Lai, G., Xie, Q., Liu, H., et\u00a0al. (2017). Race: Large-scale reading comprehension dataset from examinations. In EMNLP, pp 785\u2013794.","DOI":"10.18653\/v1\/D17-1082"},{"issue":"11","key":"1954_CR21","doi-asserted-by":"publisher","first-page":"3027","DOI":"10.1007\/s11263-021-01514-3","volume":"129","author":"TM Le","year":"2021","unstructured":"Le, T. M., Le, V., Venkatesh, S., et al. (2021). Hierarchical conditional relation networks for multimodal video question answering. IJCV, 129(11), 3027\u20133050.","journal-title":"IJCV"},{"key":"1954_CR22","doi-asserted-by":"crossref","unstructured":"Lei, J., Li, L., Zhou, L., et\u00a0al. (2021). Less is more: Clipbert for video-and-language learning via sparse sampling. In CVPR, pp 7331\u20137341.","DOI":"10.1109\/CVPR46437.2021.00725"},{"key":"1954_CR23","doi-asserted-by":"crossref","unstructured":"Li, J., Su, H., Zhu, J., et\u00a0al. (2018a). Textbook question answering under instructor guidance with memory networks. In CVPR, pp 3655\u20133663.","DOI":"10.1109\/CVPR.2018.00385"},{"key":"1954_CR24","doi-asserted-by":"crossref","unstructured":"Li, J., Su, H., Zhu, J., et\u00a0al. (2018b). Essay-anchor attentive multi-modal bilinear pooling for textbook question answering. In ICME, pp 1\u20136.","DOI":"10.1109\/ICME.2018.8486468"},{"key":"1954_CR25","doi-asserted-by":"crossref","unstructured":"Li, L., Gan, Z., Cheng, Y., et\u00a0al. (2019). Relation-aware graph attention network for visual question answering. In ICCV, pp 10,312\u201310,321.","DOI":"10.1109\/ICCV.2019.01041"},{"key":"1954_CR26","doi-asserted-by":"crossref","unstructured":"Liu, C., Zhu, F., Chang, X., et\u00a0al. (2021). Vision-language navigation with random environmental mixup. In ICCV, pp 1644\u20131654.","DOI":"10.1109\/ICCV48922.2021.00167"},{"key":"1954_CR27","unstructured":"Liu, Y., Ott, M., Goyal, N., et\u00a0al. (2019). Roberta: a robustly optimized bert pretraining approach. CoRR arXiv:abs\/1907.11692"},{"key":"1954_CR28","unstructured":"Loshchilov, I., & Hutter, F. (2019). Decoupled weight decay regularization. In ICLR."},{"key":"1954_CR29","unstructured":"Lu, P., Mishra, S., Xia, T., et\u00a0al. (2022). Learn to explain: Multimodal reasoning via thought chains for science question answering. In NeurIPS, pp 2507\u20132521."},{"key":"1954_CR30","first-page":"7378","volume":"31","author":"J Ma","year":"2022","unstructured":"Ma, J., Chai, Q., Huang, J., et al. (2022). Weakly supervised learning for textbook question answering. IEEE TIP, 31, 7378\u20137388.","journal-title":"IEEE TIP"},{"key":"1954_CR31","doi-asserted-by":"crossref","unstructured":"Ma, J., Liu, J., Li, J., et\u00a0al. (2023a). Xtqa: Span-level explanations of the textbook question answering. IEEE TNNLS.","DOI":"10.1109\/TNNLS.2023.3294991"},{"issue":"1","key":"1954_CR32","first-page":"15","volume":"34","author":"J Ma","year":"2023","unstructured":"Ma, J., Liu, J., Wang, Y., et al. (2023). Relation-aware fine-grained reasoning network for textbook question answering. IEEE TNNLS, 34(1), 15\u201327.","journal-title":"IEEE TNNLS"},{"key":"1954_CR33","doi-asserted-by":"crossref","unstructured":"Methani, N., Ganguly, P., Khapra, M. M., et\u00a0al. (2020). Plotqa: Reasoning over scientific plots. In WACV, pp 1527\u20131536.","DOI":"10.1109\/WACV45572.2020.9093523"},{"key":"1954_CR34","doi-asserted-by":"crossref","unstructured":"Mihaylov, T., Clark, P., Khot, T., et\u00a0al. (2018). Can a suit of armor conduct electricity? a new dataset for open book question answering. In EMNLP, pp 2381\u20132391.","DOI":"10.18653\/v1\/D18-1260"},{"key":"1954_CR35","doi-asserted-by":"crossref","unstructured":"Redmon, J., Divvala, S., Girshick, R., et\u00a0al. (2016). You only look once: Unified, real-time object detection. In CVPR, pp 779\u2013788.","DOI":"10.1109\/CVPR.2016.91"},{"key":"1954_CR36","doi-asserted-by":"crossref","unstructured":"Schlichtkrull, M., Kipf, T. N., Bloem, P., et\u00a0al. (2018). Modeling relational data with graph convolutional networks. In ESWC, pp 593\u2013607.","DOI":"10.1007\/978-3-319-93417-4_38"},{"key":"1954_CR37","doi-asserted-by":"crossref","unstructured":"Seo, P. H., Sharma, P., Levinboim, T., et\u00a0al. (2020). Reinforcing an image caption generator using off-line human feedback. In AAAI, pp 2693\u20132700.","DOI":"10.1609\/aaai.v34i03.5655"},{"key":"1954_CR38","doi-asserted-by":"publisher","first-page":"1586","DOI":"10.1007\/s11263-019-01206-z","volume":"127","author":"N Sharif","year":"2019","unstructured":"Sharif, N., White, L., Bennamoun, M., et al. (2019). Lceval: Learned composite metric for caption evaluation. International Journal of Computer Vision, 127, 1586\u20131610.","journal-title":"International Journal of Computer Vision"},{"key":"1954_CR39","unstructured":"Taylor, R., Kardas, M., Cucurull, G., et\u00a0al. (2022). Galactica: A large language model for science. arXiv preprint arXiv:2211.09085"},{"key":"1954_CR40","doi-asserted-by":"publisher","first-page":"38","DOI":"10.1007\/s11263-018-1096-0","volume":"127","author":"T Tommasi","year":"2019","unstructured":"Tommasi, T., Mallya, A., Plummer, B., et al. (2019). Combining multiple cues for visual madlibs question answering. IJCV, 127, 38\u201360.","journal-title":"IJCV"},{"key":"1954_CR41","unstructured":"Touvron, H., Cord, M., Douze, M., et\u00a0al. (2021). Training data-efficient image transformers & distillation through attention. In ICML, pp 10,347\u201310,357."},{"key":"1954_CR42","unstructured":"Vaswani, A., Shazeer, N., Parmar, N., et\u00a0al. (2017). Attention is all you need. In NeurIPS, pp 5998\u20136008."},{"key":"1954_CR43","unstructured":"Velickovic, P., Cucurull, G., Casanova, A., et\u00a0al. (2018). Graph attention networks. In International Conference on Learning Representations (ICLR)."},{"key":"1954_CR44","doi-asserted-by":"crossref","unstructured":"Vinyals, O., Toshev, A., Bengio, S., et\u00a0al. (2015). Show and tell: a neural image caption generator. In CVPR, pp 3156\u20133164.","DOI":"10.1109\/CVPR.2015.7298935"},{"issue":"3","key":"1954_CR45","doi-asserted-by":"publisher","first-page":"607","DOI":"10.1007\/s11263-022-01721-6","volume":"131","author":"H Wang","year":"2023","unstructured":"Wang, H., Wang, W., Liang, W., et al. (2023). Active perception for visual-language navigation. International Journal of Computer Vision, 131(3), 607\u2013625.","journal-title":"International Journal of Computer Vision"},{"key":"1954_CR46","first-page":"109,441","volume":"139","author":"Y Wang","year":"2023","unstructured":"Wang, Y., Liu, J., Ma, J., et al. (2023). Dynamic dual graph networks for textbook question answering. PR, 139, 109,441.","journal-title":"PR"},{"issue":"7","key":"1954_CR47","first-page":"3214","volume":"33","author":"Y Wang","year":"2023","unstructured":"Wang, Y., Wei, B., Liu, J., et al. (2023). Spatial-semantic collaborative graph network for textbook question answering. IEEE TCVST, 33(7), 3214\u20133228.","journal-title":"IEEE TCVST"},{"key":"1954_CR48","unstructured":"Wenfeng, S., Xinyu, Z., Yuting, G., et\u00a0al. (2023). Automatic generation of 3d scene animation based on dynamic knowledge graphs and contextual encoding. IJCV pp 1\u201329."},{"key":"1954_CR49","first-page":"109,588","volume":"140","author":"F Xu","year":"2023","unstructured":"Xu, F., Lin, Q., Liu, J., et al. (2023). Moca: Incorporating domain pretraining and cross attention for textbook question answering. PR, 140, 109,588.","journal-title":"PR"},{"key":"1954_CR50","doi-asserted-by":"crossref","unstructured":"Yu, Z., Yu, J., Fan, J., et\u00a0al. (2017). Multi-modal factorized bilinear pooling with co-attention learning for visual question answering. In: ICCV, pp 1839\u20131848.","DOI":"10.1109\/ICCV.2017.202"},{"key":"1954_CR51","doi-asserted-by":"crossref","unstructured":"Yuan, Z., Peng, X., Wu, X., et\u00a0al. (2021). Hierarchical multi-task learning for diagram question answering with multi-modal transformer. In: ACM MM, pp 1313\u20131321.","DOI":"10.1145\/3474085.3475255"},{"key":"1954_CR52","doi-asserted-by":"crossref","unstructured":"Zhang, H., Kyaw, Z., Chang, S. F., et\u00a0al. (2017). Visual translation embedding network for visual relation detection. In: CVPR, pp 5532\u20135540.","DOI":"10.1109\/CVPR.2017.331"}],"container-title":["International Journal of Computer Vision"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-023-01954-z.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11263-023-01954-z\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-023-01954-z.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,5,7]],"date-time":"2024-05-07T08:11:07Z","timestamp":1715069467000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11263-023-01954-z"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023,11,30]]},"references-count":52,"journal-issue":{"issue":"5","published-print":{"date-parts":[[2024,5]]}},"alternative-id":["1954"],"URL":"https:\/\/doi.org\/10.1007\/s11263-023-01954-z","relation":{},"ISSN":["0920-5691","1573-1405"],"issn-type":[{"value":"0920-5691","type":"print"},{"value":"1573-1405","type":"electronic"}],"subject":[],"published":{"date-parts":[[2023,11,30]]},"assertion":[{"value":"21 February 2023","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"1 November 2023","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"30 November 2023","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}