{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,20]],"date-time":"2026-06-20T07:50:39Z","timestamp":1781941839912,"version":"3.54.5"},"reference-count":31,"publisher":"Springer Science and Business Media LLC","issue":"2","license":[{"start":{"date-parts":[[2025,10,13]],"date-time":"2025-10-13T00:00:00Z","timestamp":1760313600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2025,10,13]],"date-time":"2025-10-13T00:00:00Z","timestamp":1760313600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["IJDAR"],"published-print":{"date-parts":[[2026,6]]},"DOI":"10.1007\/s10032-025-00560-8","type":"journal-article","created":{"date-parts":[[2025,10,13]],"date-time":"2025-10-13T15:01:46Z","timestamp":1760367706000},"page":"397-411","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["HW-MLVQA: a novel handwritten multilingual dataset for visual question answering and evaluation"],"prefix":"10.1007","volume":"29","author":[{"given":"Aniket","family":"Pal","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Ajoy","family":"Mondal","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"C. V.","family":"Jawahar","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2025,10,13]]},"reference":[{"key":"560_CR1","doi-asserted-by":"publisher","unstructured":"Antol, S., Agrawal, A., Lu, J., Mitchell, M., Batra, D., Zitnick, C.L., Parikh, D.: Vqa: Visual question answering. In: 2015 IEEE International Conference on Computer Vision (ICCV), pp. 2425\u20132433 (2015). https:\/\/doi.org\/10.1109\/ICCV.2015.279","DOI":"10.1109\/ICCV.2015.279"},{"key":"560_CR2","doi-asserted-by":"crossref","unstructured":"Goyal, Y., Khot, T., Summers-Stay, D., Batra, D., Parikh, D.: Making the v in vqa matter: Elevating the role of image understanding in visual question answering. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (2017)","DOI":"10.1109\/CVPR.2017.670"},{"key":"560_CR3","doi-asserted-by":"crossref","unstructured":"Changpinyo, S., Xue, L., Yarom, M., Thapliyal, A.V., Szpektor, I., Amelot, J., Chen, X., Soricut, R.: Maxm: Towards multilingual visual question answering (2023) arXiv:2209.05401 [cs.CL]","DOI":"10.18653\/v1\/2023.findings-emnlp.176"},{"key":"560_CR4","doi-asserted-by":"publisher","unstructured":"Pfeiffer, J., Geigle, G., Kamath, A., Steitz, J.-M.O., Roth, S., Vuli\u0107, I., Gurevych, I.: xGQA: Cross-lingual visual question answering. In: Muresan, S., Nakov, P., Villavicencio, A. (eds.) Findings of the Association for Computational Linguistics: ACL 2022, pp. 2497\u20132511. Association for Computational Linguistics, Dublin, Ireland (2022). https:\/\/doi.org\/10.18653\/v1\/2022.findings-acl.196","DOI":"10.18653\/v1\/2022.findings-acl.196"},{"key":"560_CR5","doi-asserted-by":"publisher","unstructured":"Luu-Thuy\u00a0Nguyen, N., Nguyen, N.H., T.D.\u00a0Vo, D., Tran, K.Q., Nguyen, K.V.: Evjvqa challenge: Multilingual visual question answering. Journal of Computer Science and Cybernetics, 237\u2013258 (2023) https:\/\/doi.org\/10.15625\/1813-9663\/18157","DOI":"10.15625\/1813-9663\/18157"},{"key":"560_CR6","doi-asserted-by":"crossref","unstructured":"Gupta, D., Lenka, P., Ekbal, A., Bhattacharyya, P.: A unified framework for multilingual and code-mixed visual question answering. In: Wong, K.-F., Knight, K., Wu, H. (eds.) Proceedings of the 1st Conference of the Asia-Pacific Chapter of the Association for Computational Linguistics and the 10th International Joint Conference on Natural Language Processing, pp. 900\u2013913. Association for Computational Linguistics, Suzhou, China (2020)","DOI":"10.18653\/v1\/2020.aacl-main.90"},{"issue":"3","key":"560_CR7","doi-asserted-by":"publisher","first-page":"235","DOI":"10.1007\/s10032-021-00383-3","volume":"24","author":"M Mathew","year":"2021","unstructured":"Mathew, M., Gomez, L., Karatzas, D., Jawahar, C.V.: Asking questions on handwritten document collections. IJDAR 24(3), 235\u2013249 (2021)","journal-title":"IJDAR"},{"key":"560_CR8","doi-asserted-by":"publisher","unstructured":"Mathew, M., Karatzas, D., Jawahar, C.V.: Docvqa: A dataset for vqa on document images. In: 2021 IEEE Winter Conference on Applications of Computer Vision (WACV), pp. 2199\u20132208 (2021). https:\/\/doi.org\/10.1109\/WACV48630.2021.00225","DOI":"10.1109\/WACV48630.2021.00225"},{"key":"560_CR9","doi-asserted-by":"publisher","unstructured":"Landeghem, J.V., Powalski, R., Tito, R., Jurkiewicz, D., Blaschko, M., Borchmann, \u00c5., Coustaty, M., Moens, S., Pietruszka, M., Ackaert, B., Stanis\u00c5\u0106awek, T., J\u00c3\u015fziak, P., Valveny, E.: Document understanding dataset and evaluation (dude). In: 2023 IEEE\/CVF International Conference on Computer Vision (ICCV), pp. 19471\u201319483 (2023). https:\/\/doi.org\/10.1109\/ICCV51070.2023.01789","DOI":"10.1109\/ICCV51070.2023.01789"},{"key":"560_CR10","doi-asserted-by":"publisher","first-page":"426","DOI":"10.1007\/978-3-031-70552-6_26","volume-title":"Document Analysis and Recognition - ICDAR 2024","author":"A Mondal","year":"2024","unstructured":"Mondal, A., Mahadevan, V., Manmatha, R., Jawahar, C.V.: Icdar 2024 competition on recognition and vqa on handwritten documents. In: Barney Smith, E.H., Liwicki, M., Peng, L. (eds.) Document Analysis and Recognition - ICDAR 2024, pp. 426\u2013442. Springer, Cham (2024)"},{"key":"560_CR11","doi-asserted-by":"publisher","unstructured":"Liu, Y., Li, Z., Huang, M., Yang, B., Yu, W., Li, C., Yin, X.-C., Liu, C.-L., Jin, L., Bai, X.: Ocrbench: on the hidden mystery of ocr in large multimodal models. Science China Information Sciences 67(12) (2024) https:\/\/doi.org\/10.1007\/s11432-024-4235-6","DOI":"10.1007\/s11432-024-4235-6"},{"key":"560_CR12","unstructured":"Fu, L., Yang, B., Kuang, Z., Song, J., Li, Y., Zhu, L., Luo, Q., Wang, X., Lu, H., Huang, M., Li, Z., Tang, G., Shan, B., Lin, C., Liu, Q., Wu, B., Feng, H., Liu, H., Huang, C., Tang, J., Chen, W., Jin, L., Liu, Y., Bai, X.: OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning (2024). arXiv:2501.00321"},{"key":"560_CR13","doi-asserted-by":"publisher","unstructured":"Yue, X., Ni, Y., Zheng, T., Zhang, K., Liu, R., Zhang, G., Stevens, S., Jiang, D., Ren, W., Sun, Y., Wei, C., Yu, B., Yuan, R., Sun, R., Yin, M., Zheng, B., Yang, Z., Liu, Y., Huang, W., Sun, H., Su, Y., Chen, W.: MMMU: A Massive Multi-Discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI . In: 2024 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 9556\u20139567. IEEE Computer Society, Los Alamitos, CA, USA (2024). https:\/\/doi.org\/10.1109\/CVPR52733.2024.00913","DOI":"10.1109\/CVPR52733.2024.00913"},{"key":"560_CR14","unstructured":"The Llama 3 Herd of Models (2024). arXiv:2407.21783"},{"key":"560_CR15","doi-asserted-by":"publisher","unstructured":"Devlin, J., Chang, M.-W., Lee, K., Toutanova, K.: BERT: Pre-training of deep bidirectional transformers for language understanding, 4171\u20134186 (2019) https:\/\/doi.org\/10.18653\/v1\/N19-1423","DOI":"10.18653\/v1\/N19-1423"},{"key":"560_CR16","unstructured":"Wang, P., Bai, S., Tan, S., Wang, S., Fan, Z., Bai, J., Chen, K., Liu, X., Wang, J., Ge, W., Fan, Y., Dang, K., Du, M., Ren, X., Men, R., Liu, D., Zhou, C., Zhou, J., Lin, J.: Qwen2-vl: Enhancing vision-language model\u2019s perception of the world at any resolution. arXiv preprint arXiv:2409.12191 (2024)"},{"key":"560_CR17","doi-asserted-by":"publisher","unstructured":"Lewis, P., Oguz, B., Rinott, R., Riedel, S., Schwenk, H.: MLQA: Evaluating cross-lingual extractive question answering. In: Jurafsky, D., Chai, J., Schluter, N., Tetreault, J. (eds.) Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics, pp. 7315\u20137330. Association for Computational Linguistics, Online (2020). https:\/\/doi.org\/10.18653\/v1\/2020.acl-main.653 . https:\/\/aclanthology.org\/2020.acl-main.653","DOI":"10.18653\/v1\/2020.acl-main.653"},{"key":"560_CR18","doi-asserted-by":"publisher","unstructured":"Clark, J.H., Choi, E., Collins, M., Garrette, D., Kwiatkowski, T., Nikolaev, V., Palomaki, J.: TyDi QA: A benchmark for information-seeking question answering in typologically diverse languages. Transactions of the Association for Computational Linguistics 8, 454\u2013470 (2020) https:\/\/doi.org\/10.1162\/tacl_a_00317","DOI":"10.1162\/tacl_a_00317"},{"key":"560_CR19","doi-asserted-by":"publisher","unstructured":"Singh, A., Natarajan, V., Shah, M., Jiang, Y., Chen, X., Batra, D., Parikh, D., Rohrbach, M.: TextVQA: Towards VQA Models That Can Read . In: 2019 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 8309\u20138318. IEEE Computer Society, Los Alamitos, CA, USA (2019). https:\/\/doi.org\/10.1109\/CVPR.2019.00851","DOI":"10.1109\/CVPR.2019.00851"},{"issue":"1","key":"560_CR20","doi-asserted-by":"publisher","first-page":"39","DOI":"10.1007\/s100320200071","volume":"5","author":"U-V Marti","year":"2002","unstructured":"Marti, U.-V., Bunke, H.: The iam-database: an english sentence database for offline handwriting recognition. Int. J. Doc. Anal. Recogn. 5(1), 39\u201346 (2002). https:\/\/doi.org\/10.1007\/s100320200071","journal-title":"Int. J. Doc. Anal. Recogn."},{"key":"560_CR21","doi-asserted-by":"crossref","unstructured":"Lee, A.W., Chung, J., Lee, M.: GNHK: a dataset for english handwriting in the wild. In: International Conference on Document Analysis and Recognition, pp. 399\u2013412 (2021)","DOI":"10.1007\/978-3-030-86337-1_27"},{"key":"560_CR22","doi-asserted-by":"crossref","unstructured":"Mondal, A., Tulsyan, K., Jawahar, C.: Bridging the gap in resource for offline english handwritten text recognition. In: International Conference on Document Analysis and Recognition, pp. 413\u2013428 (2024)","DOI":"10.1007\/978-3-031-70536-6_25"},{"key":"560_CR23","doi-asserted-by":"crossref","unstructured":"Grosicki, E., El-Abed, H.: Icdar 2011-french handwriting recognition competition. In: 2011 International Conference on Document Analysis and Recognition, pp. 1459\u20131463 (2011)","DOI":"10.1109\/ICDAR.2011.290"},{"key":"560_CR24","doi-asserted-by":"publisher","unstructured":"Liu, C.-L., Yin, F., Wang, D.-H., Wang, Q.-F.: Casia online and offline chinese handwriting databases. In: 2011 International Conference on Document Analysis and Recognition, pp. 37\u201341 (2011). https:\/\/doi.org\/10.1109\/ICDAR.2011.17","DOI":"10.1109\/ICDAR.2011.17"},{"key":"560_CR25","doi-asserted-by":"publisher","unstructured":"Zhu, Y., Groth, O., Bernstein, M., Fei-Fei, L.: Visual7W: Grounded Question Answering in Images . In: 2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pp. 4995\u20135004. IEEE Computer Society, Los Alamitos, CA, USA (2016). https:\/\/doi.org\/10.1109\/CVPR.2016.540","DOI":"10.1109\/CVPR.2016.540"},{"key":"560_CR26","doi-asserted-by":"publisher","unstructured":"Hudson, D.A., Manning, C.D.: GQA: A New Dataset for Real-World Visual Reasoning and Compositional Question Answering . In: 2019 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 6693\u20136702. IEEE Computer Society, Los Alamitos, CA, USA (2019). https:\/\/doi.org\/10.1109\/CVPR.2019.00686","DOI":"10.1109\/CVPR.2019.00686"},{"key":"560_CR27","doi-asserted-by":"crossref","unstructured":"Das, A., Agrawal, H., Zitnick, C.L., Parikh, D., Batra, D.: Human Attention in Visual Question Answering: Do Humans and Deep Networks Look at the Same Regions? In: Conference on Empirical Methods in Natural Language Processing (EMNLP) (2016)","DOI":"10.18653\/v1\/D16-1092"},{"key":"560_CR28","doi-asserted-by":"publisher","unstructured":"Johnson, J., Hariharan, B., Maaten, L., Fei-Fei, L., Zitnick, C.L., Girshick, R.: CLEVR: A Diagnostic Dataset for Compositional Language and Elementary Visual Reasoning . In: 2017 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pp. 1988\u20131997. IEEE Computer Society, Los Alamitos, CA, USA (2017). https:\/\/doi.org\/10.1109\/CVPR.2017.215","DOI":"10.1109\/CVPR.2017.215"},{"key":"560_CR29","doi-asserted-by":"publisher","unstructured":"Kazemzadeh, S., Ordonez, V., Matten, M., Berg, T.: ReferItGame: Referring to objects in photographs of natural scenes. In: Moschitti, A., Pang, B., Daelemans, W. (eds.) Proceedings of the 2014 Conference on Empirical Methods in Natural Language Processing (EMNLP), pp. 787\u2013798. Association for Computational Linguistics, Doha, Qatar (2014). https:\/\/doi.org\/10.3115\/v1\/D14-1086 . https:\/\/aclanthology.org\/D14-1086\/","DOI":"10.3115\/v1\/D14-1086"},{"key":"560_CR30","doi-asserted-by":"crossref","unstructured":"Kuznetsova, A., Rom, H., Alldrin, N., Uijlings, J., Krasin, I., Pont-Tuset, J., Kamali, S., Popov, S., Malloci, M., Kolesnikov, A., Duerig, T., Ferrari, V.: The open images dataset v4: Unified image classification, object detection, and visual relationship detection at scale. IJCV (2020)","DOI":"10.1007\/s11263-020-01316-z"},{"key":"560_CR31","doi-asserted-by":"crossref","unstructured":"Rajpurkar, P., Zhang, J., Lopyrev, K., Liang, P.: Squad: 100,000+ questions for machine comprehension of text. In: Proceedings of the 2016 Conference on Empirical Methods in Natural Language Processing (2016)","DOI":"10.18653\/v1\/D16-1264"}],"container-title":["International Journal on Document Analysis and Recognition (IJDAR)"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10032-025-00560-8.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s10032-025-00560-8","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10032-025-00560-8.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,6,20]],"date-time":"2026-06-20T07:08:46Z","timestamp":1781939326000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s10032-025-00560-8"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,10,13]]},"references-count":31,"journal-issue":{"issue":"2","published-print":{"date-parts":[[2026,6]]}},"alternative-id":["560"],"URL":"https:\/\/doi.org\/10.1007\/s10032-025-00560-8","relation":{},"ISSN":["1433-2833","1433-2825"],"issn-type":[{"value":"1433-2833","type":"print"},{"value":"1433-2825","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,10,13]]},"assertion":[{"value":"8 February 2025","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"6 October 2025","order":2,"name":"revised","label":"Revised","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"6 October 2025","order":3,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"13 October 2025","order":4,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors declare no competing interests.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Competing interests"}}]}}