{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,20]],"date-time":"2026-06-20T04:52:44Z","timestamp":1781931164815,"version":"3.54.5"},"reference-count":77,"publisher":"Association for Natural Language Processing","issue":"2","content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["Journal of Natural Language Processing"],"published-print":{"date-parts":[[2026]]},"DOI":"10.5715\/jnlp.33.760","type":"journal-article","created":{"date-parts":[[2026,6,14]],"date-time":"2026-06-14T22:11:45Z","timestamp":1781475105000},"page":"760-808","source":"Crossref","is-referenced-by-count":0,"title":["Analyzing the Multilingual Ability of Vision-Language Models to Generate Explanations for Artworks","\u5927\u898f\u6a21\u8996\u899a\u8a00\u8a9e\u30e2\u30c7\u30eb\u306b\u304a\u3051\u308b\u82b8\u8853\u4f5c\u54c1\u306e\u591a\u8a00\u8a9e\u8aac\u660e\u751f\u6210\u80fd\u529b\u306e\u8a55\u4fa1"],"prefix":"10.5715","volume":"33","author":[{"given":"Shintaro","family":"Ozaki","sequence":"first","affiliation":[{"name":"Nara Institute of Science and Technology (NAIST)"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Kazuki","family":"Hayashi","sequence":"additional","affiliation":[{"name":"Nara Institute of Science and Technology (NAIST)"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yusuke","family":"Sakai","sequence":"additional","affiliation":[{"name":"Nara Institute of Science and Technology (NAIST)"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Hidetaka","family":"Kamigaito","sequence":"additional","affiliation":[{"name":"Nara Institute of Science and Technology (NAIST)"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Katsuhiko","family":"Hayashi","sequence":"additional","affiliation":[{"name":"Nara Institute of Science and Technology (NAIST)"},{"name":"The University of Tokyo"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Taro","family":"Watanabe","sequence":"additional","affiliation":[{"name":"Nara Institute of Science and Technology (NAIST)"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"3685","reference":[{"key":"1","unstructured":"Alam, N., Kanjula, K. R., Guthikonda, S., Chung, T., Vegesna, B. K. S., Das, A., Susevski, A., Chan, R. S.-Y., Uddin, S. M. I., Islam, S. B., Santhosh, R., A, S., Sharma, D., Liu, C. C., Chaturvedi, I., Winata, G. I., Ashvanth.S, Mukherjee, S., and Aji, A. F. (2025). \u201cBehind Maya: Building a Multilingual Vision Language Model.\u201d In <i>CVPR 2025 Workshop Vision Language Models For All<\/i>."},{"key":"2","doi-asserted-by":"crossref","unstructured":"Antol, S., Agrawal, A., Lu, J., Mitchell, M., Batra, D., Zitnick, C. L., and Parikh, D. (2015). \u201cVQA: Visual Question Answering.\u201d In <i>Proceedings of the IEEE International Conference on Computer Vision<\/i>, pp. 2425\u20132433.","DOI":"10.1109\/ICCV.2015.279"},{"key":"3","unstructured":"Bai, J., Bai, S., Chu, Y., Cui, Z., Dang, K., Deng, X., Fan, Y., Ge, W., Han, Y., Huang, F., Hui, B., Ji, L., Li, M., Lin, J., Lin, R., Liu, D., Liu, G., Lu, C., Lu, K., Ma, J., Men, R., Ren, X., Ren, X., Tan, C., Tan, S., Tu, J., Wang, P., Wang, S., Wang, W., Wu, S., Xu, B., Xu, J., Yang, A., Yang, H., Yang, J., Yang, S., Yao, Y., Yu, B., Yuan, H., Yuan, Z., Zhang, J., Zhang, X., Zhang, Y., Zhang, Z., Zhou, C., Zhou, J., Zhou, X., and Zhu, T. (2023a). \u201cQwen Technical Report.\u201d <i>arXiv preprint arXiv:2309.16609<\/i>."},{"key":"4","unstructured":"Bai, J., Bai, S., Yang, S., Wang, S., Tan, S., Wang, P., Lin, J., Zhou, C., and Zhou, J. (2023b). \u201cQwen-vl: A Versatile Vision-language Model for Understanding, Localization.\u201d <i>Text Reading, and Beyond<\/i>, <b>2<\/b>, p. 1."},{"key":"5","doi-asserted-by":"crossref","unstructured":"Bird, S., and Loper, E. (2004). \u201cNLTK: The Natural Language Toolkit.\u201d In <i>Proceedings of the ACL Interactive Poster and Demonstration Sessions<\/i>, pp. 214\u2013217, Barcelona, Spain. Association for Computational Linguistics.","DOI":"10.3115\/1219044.1219075"},{"key":"6","doi-asserted-by":"crossref","unstructured":"Changpinyo, S., Sharma, P., Ding, N., and Soricut, R. (2021). \u201cConceptual 12M: Pushing Web-Scale Image-Text Pre-Training to Recognize Long-Tail Visual Concepts.\u201d In <i>Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR)<\/i>, pp. 3558\u20133568.","DOI":"10.1109\/CVPR46437.2021.00356"},{"key":"7","doi-asserted-by":"crossref","unstructured":"Changpinyo, S., Xue, L., Yarom, M., Thapliyal, A., Szpektor, I., Amelot, J., Chen, X., and Soricut, R. (2023). \u201cMaXM: Towards Multilingual Visual Question Answering.\u201d In Bouamor, H., Pino, J., and Bali, K. (Eds.), <i>Findings of the Association for Computational Linguistics: EMNLP 2023<\/i>, pp. 2667\u20132682, Singapore. Association for Computational Linguistics.","DOI":"10.18653\/v1\/2023.findings-emnlp.176"},{"key":"8","unstructured":"Chen, X., Wang, X., Changpinyo, S., Piergiovanni, A., Padlewski, P., Salz, D., Goodman, S., Grycner, A., Mustafa, B., Beyer, L., Kolesnikov, A., Puigcerver, J., Ding, N., Rong, K., Akbari, H., Mishra, G., Xue, L., Thapliyal, A. V., Bradbury, J., Kuo, W., Seyedhosseini, M., Jia, C., Ayan, B. K., Ruiz, C. R., Steiner, A. P., Angelova, A., Zhai, X., Houlsby, N., and Soricut, R. (2023). \u201cPaLI: A Jointly-Scaled Multilingual Language-Image Model.\u201d In <i>the 11th International Conference on Learning Representations<\/i>."},{"key":"9","doi-asserted-by":"crossref","unstructured":"Cohen, I., Gottesman, D., Geva, M., and Giryes, R. (2025). \u201cPerformance Gap in Entity Knowledge Extraction Across Modalities in Vision Language Models.\u201d In Che, W., Nabende, J., Shutova, E., and Pilehvar, M. T. (Eds.), <i>Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)<\/i>, pp. 29095\u201329108, Vienna, Austria. Association for Computational Linguistics.","DOI":"10.18653\/v1\/2025.acl-long.1411"},{"key":"10","doi-asserted-by":"crossref","unstructured":"Crowston, K. (2012). \u201cAmazon Mechanical Turk: A Research Tool for Organizations and Information Systems Scholars.\u201d In <i>Shaping the Future of ICT Research. Methods and Approaches: IFIP WG 8.2, Working Conference, Tampa, FL, USA, December 13-14, 2012. Proceedings<\/i>, pp. 210\u2013221. Springer.","DOI":"10.1007\/978-3-642-35142-6_14"},{"key":"11","unstructured":"Dong, X., Zhang, P., Zang, Y., Cao, Y., Wang, B., Ouyang, L., Wei, X., Zhang, S., Duan, H., Cao, M., Zhang, W., Li, Y., Yan, H., Gao, Y., Zhang, X., Li, W., Li, J., Chen, K., He, C., Zhang, X., Qiao, Y., Lin, D., and Wang, J. (2024). \u201cInternlm-xcomposer2: Mastering Free-form Text-image Composition and Comprehension in Vision-language Large Model.\u201d <i>arXiv preprint arXiv:2401.16420<\/i>."},{"key":"12","unstructured":"Dosovitskiy, A., Beyer, L., Kolesnikov, A., Weissenborn, D., Zhai, X., Unterthiner, T., Dehghani, M., Minderer, M., Heigold, G., Gelly, S., Uszkoreit, J., and Houlsby, N. (2021). \u201cAn Image is Worth 16x16 Words: Transformers for Image Recognition at Scale.\u201d <i>International Conference on Learning Representations<\/i>."},{"key":"13","unstructured":"Fu, S., Tyler, B., Guillory, D., and Darrell, T. (2025). \u201cHidden in Plain Sight: VLMs Overlook Their Visual Representations.\u201d In <i>2nd Conference on Language Modeling<\/i>."},{"key":"14","doi-asserted-by":"crossref","unstructured":"Gadre, S. Y., Ilharco, G., Fang, A., Hayase, J., Smyrnis, G., Nguyen, T., Marten, R., Wortsman, M., Ghosh, D., Zhang, J., Orgad, E., Entezari, R., Daras, G., Pratt, S., Ramanujan, V., Bitton, Y., Marathe, K., Mussmann, S., Vencu, R., Cherti, M., Krishna, R., Koh, P. W., Saukh, O., Ratner, A., Song, S., Hajishirzi, H., Farhadi, A., Beaumont, R., Oh, S., Dimakis, A., Jitsev, J., Carmon, Y., Shankar, V., and Schmidt, L. (2023). \u201cDataComp: In Search of the Next Generation of Multimodal Datasets.\u201d <i>arXiv preprint arXiv:2304.14108<\/i>.","DOI":"10.52202\/075280-1179"},{"key":"15","unstructured":"Gemini Team Google (2023). \u201cGemini: A Family of Highly Capable Multimodal Models.\u201d <i>arXiv preprint arXiv:2312.11805<\/i>."},{"key":"16","doi-asserted-by":"crossref","unstructured":"Goyal, Y., Khot, T., Summers-Stay, D., Batra, D., and Parikh, D. (2017). \u201cMaking the v in Vqa Matter: Elevating the Role of Image Understanding In Visual Question Answering.\u201d In <i>Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition<\/i>, pp. 6904\u20136913.","DOI":"10.1109\/CVPR.2017.670"},{"key":"17","unstructured":"Grattafiori, A., Dubey, A., Jauhri, A., Pandey, A., Kadian, A., Al-Dahle, A., Letman, A., Mathur, A., Schelten, A., Yang, A., Fan, A., et al. (2024). \u201cThe Llama 3 Herd of Models.\u201d <i>arXiv preprint arXiv:2407.21783<\/i>."},{"key":"18","doi-asserted-by":"crossref","unstructured":"Gurari, D., Li, Q., Stangl, A. J., Guo, A., Lin, C., Grauman, K., Luo, J., and Bigham, J. P. (2018). \u201cVizwiz Grand Challenge: Answering Visual Questions from Blind People.\u201d In <i>Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition<\/i>, pp. 3608\u20133617.","DOI":"10.1109\/CVPR.2018.00380"},{"key":"19","unstructured":"Hambardzumyan, S., Tuli, A., Ghukasyan, L., Rahman, F., Topchyan, H., Isayan, D., McQuade, M., Harutyunyan, M., Hakobyan, T., Stranic, I., and Buniatyan, D. (2022). \u201cDeep Lake: A Lakehouse for Deep Learning.\u201d <i>arXiv preprint arXiv:2209.10785<\/i>."},{"key":"20","unstructured":"Haotian, L., Chunyuan, L., Yuheng, L., and Jae, L. Y. (2023). \u201cImproved Baselines with Visual Instruction Tuning.\u201d <i>arXiv preprint arXiv:2310.03744<\/i>."},{"key":"21","doi-asserted-by":"crossref","unstructured":"Hayashi, K., Sakai, Y., Kamigaito, H., Hayashi, K., and Watanabe, T. (2024). \u201cTowards Artwork Explanation in Large-scale Vision Language Models.\u201d In Ku, L.-W., Martins, A., and Srikumar, V. (Eds.), <i>Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 2: Short Papers)<\/i>, pp. 705\u2013729, Bangkok, Thailand. Association for Computational Linguistics.","DOI":"10.18653\/v1\/2024.acl-short.65"},{"key":"22","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., and Sun, J. (2016). \u201cDeep Residual Learning for Image Recognition.\u201d In <i>Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition<\/i>, pp. 770\u2013778.","DOI":"10.1109\/CVPR.2016.90"},{"key":"23","unstructured":"Honnibal, M., Montani, I., Van Landeghem, S., and Boyd, A. (2020). \u201cspaCy: Industrial-strength Natural Language Processing in Python.\u201d. Zenodo."},{"key":"24","unstructured":"Hu, E. J., Shen, Y., Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., Wang, L., and Chen, W. (2022). \u201cLoRA: Low-Rank Adaptation of Large Language Models.\u201d In <i>International Conference on Learning Representations<\/i>."},{"key":"25","doi-asserted-by":"crossref","unstructured":"Hudson, D. A., and Manning, C. D. (2019). \u201cGQA: A New Dataset for Real-world Visual Reasoning and Compositional Question Answering.\u201d In <i>Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition<\/i>, pp. 6700\u20136709.","DOI":"10.1109\/CVPR.2019.00686"},{"key":"26","unstructured":"Hurst, A., Lerer, A., Goucher, A. P., Perelman, A., Ramesh, A., Clark, A., Ostrow, A., Welihinda, A., Hayes, A., Radford, A., et al. (2024). \u201cGPT-4o System Card.\u201d <i>arXiv preprint arXiv:2410.21276<\/i>."},{"key":"27","unstructured":"Jaech, A., Kalai, A., Lerer, A., Richardson, A., El-Kishky, A., Low, A., Helyar, A., Madry, A., Beutel, A., Carney, A., et al. (2024). \u201cOpenAI o1 System Card.\u201d <i>arXiv preprint arXiv:2412.16720<\/i>."},{"key":"28","doi-asserted-by":"crossref","unstructured":"Kafle, K., Price, B., Cohen, S., and Kanan, C. (2018). \u201cDvqa: Understanding Data Visualizations via Question Answering.\u201d In <i>Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition<\/i>, pp. 5648\u20135656.","DOI":"10.1109\/CVPR.2018.00592"},{"key":"29","doi-asserted-by":"crossref","unstructured":"Kim, G., Hong, T., Yim, M., Nam, J., Park, J., Yim, J., Hwang, W., Yun, S., Han, D., and Park, S. (2022). \u201cOcr-free Document Understanding Transformer.\u201d In <i>European Conference on Computer Vision<\/i>, pp. 498\u2013517. Springer.","DOI":"10.1007\/978-3-031-19815-1_29"},{"key":"30","unstructured":"Kim, Y., Yim, M., and Song, K. Y. (2024). \u201cTablevqa-bench: A Visual Question Answering Benchmark on Multiple Table Domains.\u201d <i>arXiv preprint arXiv:2404.19205<\/i>."},{"key":"31","doi-asserted-by":"crossref","unstructured":"Krishna, R., Zhu, Y., Groth, O., Johnson, J., Hata, K., Kravitz, J., Chen, S., Kalantidis, Y., Li, L.-J., Shamma, D. A., Bernstein, M. S., and Li, F.-F. (2016). \u201cVisual Genome: Connecting Language and Vision using Crowdsourced Dense Image Annotations.\u201d <i>arXiv preprint arXiv:1602.07332<\/i>.","DOI":"10.1007\/s11263-016-0981-7"},{"key":"32","unstructured":"Krizhevsky, A., Sutskever, I., and Hinton, G. E. (2012). \u201cImagenet Classification with Deep Convolutional Neural Networks.\u201d <i>Advances in Neural Information Processing Systems<\/i>, <b>25<\/b>, pp. 1097\u20131105."},{"key":"33","unstructured":"Li, J., Li, D., Savarese, S., and Hoi, S. (2023). \u201cBlip-2: Bootstrapping Language-image Pre-training with Frozen Image Encoders and Large Language Models.\u201d In <i>International Conference on Machine Learning<\/i>, pp. 19730\u201319742. PMLR."},{"key":"34","unstructured":"Li, J., Li, D., Xiong, C., and Hoi, S. (2022). \u201cBLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation.\u201d In Chaudhuri, K., Jegelka, S., Song, L., Szepesvari, C., Niu, G., and Sabato, S. (Eds.), <i>Proceedings of the 39th International Conference on Machine Learning<\/i>, Vol. 162 of <i>Proceedings of Machine Learning Research<\/i>, pp. 12888\u201312900. PMLR."},{"key":"35","unstructured":"Lian, W., Wang, G., Goodson, B., Pentland, E., Cook, A., Vong, C., and \u201cTeknium\u201d (2023). \u201cSlimOrca: An Open Dataset of GPT-4 Augmented FLAN Reasoning Tracesand with Verification.\u201d HuggingFace."},{"key":"36","unstructured":"Lim, H., Shin, D., Song, S., Won, I., Kim, M., Yuk, J., Jang, H., and Lim, K. (2025). \u201cVLR-Bench: Multilingual Benchmark Dataset for Vision-Language Retrieval Augmented Generation.\u201d In Rambow, O., Wanner, L., Apidianaki, M., Al-Khalifa, H., Eugenio, B. D., and Schockaert, S. (Eds.), <i>Proceedings of the 31st International Conference on Computational Linguistics<\/i>, pp. 6150\u20136168, Abu Dhabi, UAE. Association for Computational Linguistics."},{"key":"37","doi-asserted-by":"crossref","unstructured":"Lin, C., Jinsong, L., Xiaoyi, D., Pan, Z., Conghui, H., Jiaqi, W., Feng, Z., and Dahua, L. (2025). \u201cShareGPT4v: Improving Large Multi-modal Models with Better Captions.\u201d In <i>European Conference on Computer Vision<\/i>, pp. 370\u2013387. Springer.","DOI":"10.1007\/978-3-031-72643-9_22"},{"key":"38","unstructured":"Lin, C.-Y. (2004). \u201cROUGE: A Package for Automatic Evaluation of Summaries.\u201d In <i>Text Summarization Branches Out<\/i>, pp. 74\u201381, Barcelona, Spain. Association for Computational Linguistics."},{"key":"39","unstructured":"Lin, F. (2025). \u201cVision Language Models: A Survey of 26K Papers.\u201d <i>arXiv preprint arXiv:2510.09586<\/i>."},{"key":"40","doi-asserted-by":"crossref","unstructured":"Liu, F., Xiang, T., Hospedales, T. M., Yang, W., and Sun, C. (2018). \u201ciVQA: Inverse Visual Question Answering.\u201d In <i>Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition<\/i>, pp. 8611\u20138619.","DOI":"10.1109\/CVPR.2018.00898"},{"key":"41","unstructured":"Liu, H., Li, C., Li, Y., Li, B., Zhang, Y., Shen, S., and Lee, Y. J. (2024). \u201cLLaVA-NeXT: Improved Reasoning, OCR, and World Knowledge.\u201d https:\/\/llava-vl.github.io\/blog\/2024-01-30-llava-next\/."},{"key":"42","doi-asserted-by":"crossref","unstructured":"Liu, H., Li, C., Wu, Q., and Lee, Y. J. (2023). \u201cVisual Instruction Tuning.\u201d <i>NeurIPS<\/i>, pp. 12336\u201312348.","DOI":"10.52202\/075280-1516"},{"key":"43","doi-asserted-by":"crossref","unstructured":"Lu, P., Mishra, S., Xia, T., Qiu, L., Chang, K.-W., Zhu, S.-C., Tafjord, O., Clark, P., and Kalyan, A. (2022). \u201cLearn to Explain: Multimodal Reasoning via thought Chains for Science Question Answering.\u201d <i>Advances in Neural Information Processing Systems<\/i>, <b>35<\/b>, pp. 2507\u20132521.","DOI":"10.52202\/068431-0182"},{"key":"44","unstructured":"Lu, P., Qiu, L., Chen, J., Xia, T., Zhao, Y., Zhang, W., Yu, Z., Liang, X., and Zhu, S.-C. (2021). \u201cIconqa: A New Benchmark for Abstract Diagram Understanding and Visual Language Reasoning.\u201d <i>arXiv preprint arXiv:2110.13214<\/i>."},{"key":"45","doi-asserted-by":"crossref","unstructured":"Marino, K., Rastegari, M., Farhadi, A., and Mottaghi, R. (2019). \u201cOK-VQA: A Visual Question Answering Benchmark Requiring External Knowledge.\u201d In <i>Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition<\/i>, pp. 3195\u20133204.","DOI":"10.1109\/CVPR.2019.00331"},{"key":"46","doi-asserted-by":"crossref","unstructured":"Mishra, A., Shekhar, S., Singh, A. K., and Chakraborty, A. (2019). \u201cOCR-VQA: Visual Question Answering by Reading Text in Images.\u201d In <i>2019 International Conference on Document Analysis and Recognition (ICDAR)<\/i>, pp. 947\u2013952. IEEE.","DOI":"10.1109\/ICDAR.2019.00156"},{"key":"47","doi-asserted-by":"crossref","unstructured":"Mohamed, Y., Abdelfattah, M., Alhuwaider, S., Li, F., Zhang, X., Church, K., and Elhoseiny, M. (2022). \u201cArtELingo: A Million Emotion Annotations of WikiArt with Emphasis on Diversity over Language and Culture.\u201d In Goldberg, Y., Kozareva, Z., and Zhang, Y. (Eds.), <i>Proceedings of the 2022 Conference on Empirical Methods in Natural Language Processing<\/i>, pp. 8770\u20138785, Abu Dhabi, United Arab Emirates. Association for Computational Linguistics.","DOI":"10.18653\/v1\/2022.emnlp-main.600"},{"key":"48","doi-asserted-by":"crossref","unstructured":"Mohamed, Y., Li, R., Ahmad, I. S., Haydarov, K., Torr, P., Church, K., and Elhoseiny, M. (2024). \u201cNo Culture Left Behind: ArtELingo-28, a Benchmark of WikiArt with Captions in 28 Languages.\u201d In Al-Onaizan, Y., Bansal, M., and Chen, Y.-N. (Eds.), <i>Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing<\/i>, pp. 20939\u201320962, Miami, Florida, USA. Association for Computational Linguistics.","DOI":"10.18653\/v1\/2024.emnlp-main.1165"},{"key":"49","unstructured":"Nguyen, N. L.-T., Nguyen, N. H., Vo, D. T., Tran, K. Q., and Van Nguyen, K. (2023). \u201cEVJVQA Challenge: Multilingual Visual Question Answering.\u201d <i>arXiv preprint arXiv:2302.11752<\/i>."},{"key":"50","doi-asserted-by":"crossref","unstructured":"Nguyen, T., Wallingford, M., Santy, S., Ma, W.-C., Oh, S., Schmidt, L., Koh, P. W. W., and Krishna, R. (2024). \u201cMultilingual Diversity Improves Vision-language Representations.\u201d <i>Advances in Neural Information Processing Systems<\/i>, <b>37<\/b>, pp. 91430\u201391459.","DOI":"10.52202\/079017-2902"},{"key":"51","doi-asserted-by":"crossref","unstructured":"Nyandwi, J. d. D., Song, Y., Khanuja, S., and Neubig, G. (2025). \u201cGrounding Multilingual Multimodal LLMs With Cultural Knowledge.\u201d <i>arXiv preprint arXiv:2508.07414<\/i>.","DOI":"10.18653\/v1\/2025.emnlp-main.1232"},{"key":"52","doi-asserted-by":"crossref","unstructured":"Oleksii, S., Ronghang, H., Marcus, R., and Amanpreet, S. (2020). \u201cTextCaps: A Dataset for Image Captioningwith Reading Comprehension.\u201d <i>European Conference on Computer Vision, LNCS<\/i>, <b>2347<\/b>, pp. 742\u2013758.","DOI":"10.1007\/978-3-030-58536-5_44"},{"key":"53","unstructured":"\u5c3e\u5d0e\u614e\u592a\u90ce\uff0c\u6797\u548c\u6a39\uff0c\u5742\u4e95\u512a\u4ecb\uff0c\u4e0a\u57a3\u5916\u82f1\u525b\uff0c\u6797\u514b\u5f66\uff0c\u6e21\u8fba\u592a\u90ce (2024). \u5927\u898f\u6a21\u8996\u899a\u8a00\u8a9e\u30e2\u30c7\u30eb\u306b\u3088\u308b\u82b8\u8853\u4f5c\u54c1\u306e\u591a\u8a00\u8a9e\u8aac\u660e\u751f\u6210. \u60c5\u5831\u51e6\u7406\u5b66\u4f1a\u7814\u7a76\u5831\u544a\uff0c\u81ea\u7136\u8a00\u8a9e\u51e6\u7406\u7814\u7a76\u4f1a (NL), <b>2024-NL-262<\/b> (28), pp. 1\u201318. [S. Ozaki et al. (2024). Daikibo Shikaku Gengo Moderu ni yoru Geijutsu Sakuhin no Tagengo Setsumei Seisei. Information Processing Society of Japan, Special Interest Group on Natural Language Processing (IPSJ SIG-NL), Technical Report, 2024-NL-262(28), pp. 1\u201318.]."},{"key":"54","doi-asserted-by":"crossref","unstructured":"Ozaki, S., Hayashi, K., Sakai, Y., Kamigaito, H., Hayashi, K., and Watanabe, T. (2025). \u201cTowards Cross-Lingual Explanation of Artwork in Large-scale Vision Language Models.\u201d In Chiruzzo, L., Ritter, A., and Wang, L. (Eds.), <i>Findings of the Association for Computational Linguistics: NAACL 2025<\/i>, pp. 3773\u20133809, Albuquerque, New Mexico. Association for Computational Linguistics.","DOI":"10.18653\/v1\/2025.findings-naacl.209"},{"key":"55","doi-asserted-by":"crossref","unstructured":"Papineni, K., Roukos, S., Ward, T., and Zhu, W.-J. (2002). \u201cBleu: A Method for Automatic Evaluation of Machine Translation.\u201d In <i>Proceedings of the 40th Annual Meeting of the Association for Computational Linguistics<\/i>, pp. 311\u2013318.","DOI":"10.3115\/1073083.1073135"},{"key":"56","unstructured":"Peng, Z., Wang, W., Dong, L., Hao, Y., Huang, S., Ma, S., and Wei, F. (2023). \u201cKosmos-2: Grounding Multimodal Large Language Models to the World.\u201d <i>arXiv preprint arXiv:2306.14824<\/i>."},{"key":"57","doi-asserted-by":"crossref","unstructured":"Pfeiffer, J., Geigle, G., Kamath, A., Steitz, J.-M. O., Roth, S., Vuli\u0107, I., and Gurevych, I. (2022). \u201cxGQA: Cross-Lingual Visual Question Answering.\u201d In Muresan, S., Nakov, P., and Villavicencio, A. (Eds.), <i>Findings of the Association for Computational Linguistics: ACL 2022<\/i>, pp. 2497\u20132511, Dublin, Ireland. Association for Computational Linguistics.","DOI":"10.18653\/v1\/2022.findings-acl.196"},{"key":"58","doi-asserted-by":"crossref","unstructured":"Sakai, Y., Kamigaito, H., and Watanabe, T. (2024a). \u201cmCSQA: Multilingual Commonsense Reasoning Dataset with Unified Creation Strategy by Language Models and Humans.\u201d In Ku, L.-W., Martins, A., and Srikumar, V. (Eds.), <i>Findings of the Association for Computational Linguistics: ACL 2024<\/i>, pp. 14182\u201314214, Bangkok, Thailand. Association for Computational Linguistics.","DOI":"10.18653\/v1\/2024.findings-acl.844"},{"key":"59","doi-asserted-by":"crossref","unstructured":"Sakai, Y., Nohejl, A., Hang, J., Kamigaito, H., and Watanabe, T. (2024b). \u201cToward the Evaluation of Large Language Models Considering Score Variance across Instruction Templates.\u201d In Belinkov, Y., Kim, N., Jumelet, J., Mohebbi, H., Mueller, A., and Chen, H. (Eds.), <i>Proceedings of the 7th BlackboxNLP Workshop: Analyzing and Interpreting Neural Networks for NLP<\/i>, pp. 499\u2013529, Miami, Florida, US. Association for Computational Linguistics.","DOI":"10.18653\/v1\/2024.blackboxnlp-1.31"},{"key":"60","doi-asserted-by":"crossref","unstructured":"Schuhmann, C., Beaumont, R., Vencu, R., Gordon, C., Wightman, R., Cherti, M., Coombes, T., Katta, A., Mullis, C., Wortsman, M., Schramowski, P., Kundurthy, S., Crowson, K., Schmidt, L., Kaczmarczyk, R., and Jitsev, J. (2022). \u201cLAION-5B: An Open Large-scale Dataset for Training Next Generation Image-text Models.\u201d <i>arXiv preprint arXiv:2210.08402<\/i>.","DOI":"10.52202\/068431-1833"},{"key":"61","doi-asserted-by":"crossref","unstructured":"Schwenk, D., Khandelwal, A., Clark, C., Marino, K., and Mottaghi, R. (2022). \u201cA-OKVQA: A Benchmark for Visual Question Answering using World Knowledge.\u201d In <i>European Conference on Computer Vision<\/i>, pp. 146\u2013162. Springer.","DOI":"10.1007\/978-3-031-20074-8_9"},{"key":"62","doi-asserted-by":"crossref","unstructured":"Tao, L., Zhang, H., Jing, H., Liu, Y., Yan, D., Wei, G., and Xue, X. (2025). \u201cAdvancements in Vision\u2013language Models for Remote Sensing: Datasets, Capabilities, and Enhancement Techniques.\u201d <i>Remote Sensing<\/i>, <b>17<\/b> (1), p. 162.","DOI":"10.3390\/rs17010162"},{"key":"63","unstructured":"Touvron, H., Martin, L., Stone, K., Albert, P., Almahairi, A., Babaei, Y., Bashlykov, N., Batra, S., Bhargava, P., Bhosale, S., et al. (2023). \u201cLlama 2: Open Foundation and Fine-tuned Chat Models.\u201d <i>arXiv preprint arXiv:2307.09288<\/i>."},{"key":"64","unstructured":"Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A. N., Kaiser, \u0141., and Polosukhin, I. (2017). \u201cAttention Is All You Need.\u201d <i>Advances in Neural Information Processing Systems<\/i>, <b>30<\/b>, pp. 5998\u20136008."},{"key":"65","unstructured":"Vicente, O., Girish, K., and Tamara, B. (2011). \u201cIm2Text: Describing Images Using 1 Million Captioned Photographs.\u201d In Shawe-Taylor, J., Zemel, R., Bartlett, P., Pereira, F., and Weinberger, K. (Eds.), <i>Advances in Neural Information Processing Systems<\/i>, Vol. 24, pp. 1143\u20131151."},{"key":"66","doi-asserted-by":"crossref","unstructured":"Wang, D., Raman, N., Sibue, M., Ma, Z., Babkin, P., Kaur, S., Pei, Y., Nourbakhsh, A., and Liu, X. (2024). \u201cDocLLM: A Layout-Aware Generative Language Model for Multimodal Document Understanding.\u201d In Ku, L.-W., Martins, A., and Srikumar, V. (Eds.), <i>Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)<\/i>, pp. 8529\u20138548, Bangkok, Thailand. Association for Computational Linguistics.","DOI":"10.18653\/v1\/2024.acl-long.463"},{"key":"67","doi-asserted-by":"crossref","unstructured":"Wolf, T., Debut, L., Sanh, V., Chaumond, J., Delangue, C., Moi, A., Cistac, P., Rault, T., Louf, R., Funtowicz, M., Davison, J., Shleifer, S., von Platen, P., Ma, C., Jernite, Y., Plu, J., Xu, C., Le Scao, T., Gugger, S., Drame, M., Lhoest, Q., and Rush, A. (2020). \u201cTransformers: State-of-the-Art Natural Language Processing.\u201d In Liu, Q., and Schlangen, D. (Eds.), <i>Proceedings of the 2020 Conference on Empirical Methods in Natural Language Processing: System Demonstrations<\/i>, pp. 38\u201345, Online. Association for Computational Linguistics.","DOI":"10.18653\/v1\/2020.emnlp-demos.6"},{"key":"68","doi-asserted-by":"crossref","unstructured":"Wu, J., Shi, Z., Wang, S., Huang, J., Yin, D., Yan, L., Cao, M., and Zhang, M. (2025). \u201cMitigating Hallucinations in Large Vision-Language Models via Entity-Centric Multimodal Preference Optimization.\u201d In Christodoulopoulos, C., Chakraborty, T., Rose, C., and Peng, V. (Eds.), <i>Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing<\/i>, pp. 19456\u201319472, Suzhou, China. Association for Computational Linguistics.","DOI":"10.18653\/v1\/2025.emnlp-main.982"},{"key":"69","unstructured":"Xinlei, C., Hao, F., Tsung-Yi, L., Ramakrishna, V., Saurabh, G., Piotr, D., and Lawrence, Z. C. (2015). \u201cMicrosoft Coco Captions: Data Collection and Evaluation Server.\u201d <i>arXiv preprint arXiv:1504.00325<\/i>."},{"key":"70","doi-asserted-by":"crossref","unstructured":"Ye, Q., Xu, H., Ye, J., Yan, M., Hu, A., Liu, H., Qian, Q., Zhang, J., and Huang, F. (2024). \u201cmplug-owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration.\u201d In <i>Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition<\/i>, pp. 13040\u201313051.","DOI":"10.1109\/CVPR52733.2024.01239"},{"key":"71","doi-asserted-by":"crossref","unstructured":"Ye, Z., Li, Q., Feng, X., Qin, L., Huang, Y., Li, B., Jiang, K., Xiang, Y., Zhang, Z., Lu, Y., Tang, D., Tu, D., and Qin, B. (2025). \u201cCLAIM: Mitigating Multilingual Object Hallucination in Large Vision-Language Models with Cross-Lingual Attention Intervention.\u201d In Che, W., Nabende, J., Shutova, E., and Pilehvar, M. T. (Eds.), <i>Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)<\/i>, pp. 13080\u201313094, Vienna, Austria. Association for Computational Linguistics.","DOI":"10.18653\/v1\/2025.acl-long.640"},{"key":"72","doi-asserted-by":"crossref","unstructured":"Yin, S., Fu, C., Zhao, S., Xu, T., Wang, H., Sui, D., Shen, Y., Li, K., Sun, X., and Chen, E. (2024). \u201cWoodpecker: Hallucination Correction for Multimodal Large Language Models.\u201d <i>Science China Information Sciences<\/i>, <b>67<\/b> (12), p. 220105.","DOI":"10.1007\/s11432-024-4251-x"},{"key":"73","unstructured":"Yue, X., Song, Y., Asai, A., Kim, S., de Dieu Nyandwi, J., Khanuja, S., Kantharuban, A., Sutawika, L., Ramamoorthy, S., and Neubig, G. (2024). \u201cPangea: A Fully Open Multilingual Multimodal Llm for 39 Languages.\u201d In <i>The 13th International Conference on Learning Representations<\/i>."},{"key":"74","doi-asserted-by":"crossref","unstructured":"Zarrie\u00df, S., and Schlangen, D. (2018). \u201cDecoding Strategies for Neural Referring Expression Generation.\u201d <i>t<\/i>, pp. 503\u2013512.","DOI":"10.18653\/v1\/W18-6563"},{"key":"75","doi-asserted-by":"crossref","unstructured":"Zhang, J., Huang, J., Jin, S., and Lu, S. (2024). \u201cVision-language Models for Vision Tasks: A Survey.\u201d <i>IEEE Transactions on Pattern Analysis and Machine Intelligence<\/i>, <b>46<\/b> (8), pp. 5625\u20135644.","DOI":"10.1109\/TPAMI.2024.3369699"},{"key":"76","unstructured":"Zhang, T., Kishore, V., Wu, F., Weinberger, K. Q., and Artzi, Y. (2020). \u201cBERTScore: Evaluating Text Generation with BERT.\u201d In <i>International Conference on Learning Representations<\/i>."},{"key":"77","unstructured":"Zitkovich, B., Yu, T., Xu, S., Xu, P., Xiao, T., Xia, F., Wu, J., Wohlhart, P., Welker, S., Wahid, A., Vuong, Q., Vanhoucke, V., Tran, H., Soricut, R., Singh, A., Singh, J., Sermanet, P., Sanketi, P. R., Salazar, G., Ryoo, M. S., Reymann, K., Rao, K., Pertsch, K., Mordatch, I., Michalewski, H., Lu, Y., Levine, S., Lee, L., Lee, T.-W. E., Leal, I., Kuang, Y., Kalashnikov, D., Julian, R., Joshi, N. J., Irpan, A., Ichter, B., Hsu, J., Herzog, A., Hausman, K., Gopalakrishnan, K., Fu, C., Florence, P., Finn, C., Dubey, K. A., Driess, D., Ding, T., Choromanski, K. M., Chen, X., Chebotar, Y., Carbajal, J., Brown, N., Brohan, A., Arenas, M. G., and Han, K. (2023). \u201cRT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control.\u201d In Tan, J., Toussaint, M., and Darvish, K. (Eds.), <i>Proceedings of The 7th Conference on Robot Learning<\/i>, Vol. 229 of <i>Proceedings of Machine Learning Research<\/i>, pp. 2165\u20132183. PMLR."}],"container-title":["Journal of Natural Language Processing"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/www.jstage.jst.go.jp\/article\/jnlp\/33\/2\/33_760\/_pdf","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,6,20]],"date-time":"2026-06-20T04:45:13Z","timestamp":1781930713000},"score":1,"resource":{"primary":{"URL":"https:\/\/www.jstage.jst.go.jp\/article\/jnlp\/33\/2\/33_760\/_article\/-char\/ja\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026]]},"references-count":77,"journal-issue":{"issue":"2","published-print":{"date-parts":[[2026]]}},"URL":"https:\/\/doi.org\/10.5715\/jnlp.33.760","relation":{},"ISSN":["1340-7619","2185-8314"],"issn-type":[{"value":"1340-7619","type":"print"},{"value":"2185-8314","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026]]}}}