{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,7]],"date-time":"2026-05-07T15:31:04Z","timestamp":1778167864021,"version":"3.51.4"},"publisher-location":"Cham","reference-count":55,"publisher":"Springer Nature Switzerland","isbn-type":[{"value":"9783032060778","type":"print"},{"value":"9783032060785","type":"electronic"}],"license":[{"start":{"date-parts":[[2025,9,30]],"date-time":"2025-09-30T00:00:00Z","timestamp":1759190400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2025,9,30]],"date-time":"2025-09-30T00:00:00Z","timestamp":1759190400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2026]]},"DOI":"10.1007\/978-3-032-06078-5_27","type":"book-chapter","created":{"date-parts":[[2025,9,29]],"date-time":"2025-09-29T18:50:41Z","timestamp":1759171841000},"page":"473-491","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":3,"title":["ChitroJera: A Regionally Relevant Visual Question Answering Dataset for Bangla"],"prefix":"10.1007","author":[{"given":"Deeparghya Dutta","family":"Barua","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Md Sakib Ul Rahman","family":"Sourove","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Md","family":"Fahim","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Fabiha","family":"Haider","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Fariha Tanjim","family":"Shifat","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Md Tasmim","family":"Rahman Adib","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Anam Borhan","family":"Uddin","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Md Farhan","family":"Ishmam","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Md Farhad","family":"Alam","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2025,9,30]]},"reference":[{"key":"27_CR1","unstructured":"Abdin, M., et al.: Phi-3 technical report: a highly capable language model locally on your phone. arXiv preprint arXiv:2404.14219 (2024)"},{"key":"27_CR2","unstructured":"Alam, S., Ishmam, M.F., Alvee, N.H., Siddique, M.S., Hossain, M.A., Kamal, A.R.M.: Bnsentmix: a diverse Bengali-English code-mixed dataset for sentiment analysis. arXiv preprint arXiv:2408.08964 (2024)"},{"key":"27_CR3","first-page":"3907","volume-title":"Findings Of Naacl 2024","author":"M Ali","year":"2024","unstructured":"Ali, M., et al.: Tokenizer choice for LLM training: negligible or crucial? In: Duh, K., Gomez, H., Bethard, S. (eds.) Findings Of Naacl 2024, pp. 3907\u20133924. Association for Computational Linguistics, Mexico City, Mexico (2024)"},{"key":"27_CR4","doi-asserted-by":"crossref","unstructured":"Antol, S., et al.: VQA: visual question answering. In: In the IEEE International Conference on Computer Vision (ICCV), pp. 2425\u20132433 (2015)","DOI":"10.1109\/ICCV.2015.279"},{"key":"27_CR5","unstructured":"Bai, S., Chen, K., Liu, X., Wang, J., Ge, W., et\u00a0al.: Qwen2.5-vl technical report. arXiv preprint arXiv:2502.13923 (2025)"},{"key":"27_CR6","unstructured":"Bao, H., Dong, L., Piao, S., Wei, F.: Beit: BERT pre-training of image transformers. arXiv (2021)"},{"key":"27_CR7","unstructured":"Beyer, L., Steiner, A., Pinto, A.S., Kolesnikov, A., Wang, X., et\u00a0al.: Paligemma: a versatile 3B VLM for transfer (2024)"},{"key":"27_CR8","doi-asserted-by":"crossref","unstructured":"Bhattacharjee, A., et al.: BanglaBERT: language model pretraining and benchmarks for low-resource language understanding evaluation in Bangla. arXiv (2021)","DOI":"10.18653\/v1\/2022.findings-naacl.98"},{"key":"27_CR9","doi-asserted-by":"crossref","unstructured":"Chen, G., et al.: mCLIP: multilingual CLIP via cross-lingual transfer. In: Rogers, A., Boyd-Graber, J., Okazaki, N. (eds.) In the 61st ACL (2023)","DOI":"10.18653\/v1\/2023.acl-long.728"},{"key":"27_CR10","unstructured":"Chen, Z., et\u00a0al.: Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling (2025)"},{"key":"27_CR11","doi-asserted-by":"crossref","unstructured":"Conneau, A., et al.: Unsupervised cross-lingual representation learning at scale. arXiv (2019)","DOI":"10.18653\/v1\/2020.acl-main.747"},{"key":"27_CR12","unstructured":"Dai, W., et al.: Instructblip: towards general-purpose vision-language models with instruction tuning. NIPS \u201923 (2023)"},{"key":"27_CR13","unstructured":"Devlin, J., Chang, M.W., Lee, K., Toutanova, K.: BERT: pre-training of deep bidirectional transformers for language understanding. In: In NAACL (2019)"},{"key":"27_CR14","unstructured":"Dosovitskiy, A., et\u00a0al.: An image is worth 16x16 words: transformers for image recognition at scale. arXiv (2020)"},{"key":"27_CR15","doi-asserted-by":"crossref","unstructured":"Dou, Z.Y., et\u00a0al.: An empirical study of training end-to-end vision-and-language transformers. In: In CVPR, pp. 18166\u201318176 (2022)","DOI":"10.1109\/CVPR52688.2022.01763"},{"key":"27_CR16","doi-asserted-by":"crossref","unstructured":"Fahim, M., et al.: Banglatlit: a benchmark dataset for back-transliteration of Romanized Bangla. In: Findings of the Association for Computational Linguistics: EMNLP 2024, pp. 14656\u201314672 (2024)","DOI":"10.18653\/v1\/2024.findings-emnlp.859"},{"key":"27_CR17","doi-asserted-by":"crossref","unstructured":"Faruk, A.M., Faraby, H.A., Azad, M.M., Fedous, M.R., Morol, M.K.: Image to Bengali caption generation using deep CNN and bidirectional gated recurrent unit. In: ICCIT (2020)","DOI":"10.1109\/ICCIT51783.2020.9392697"},{"key":"27_CR18","doi-asserted-by":"publisher","first-page":"107268","DOI":"10.1016\/j.infsof.2023.107268","volume":"162","author":"Y Gong","year":"2023","unstructured":"Gong, Y., Liu, G., Xue, Y., Li, R., Meng, L.: A survey on dataset quality in machine learning. Inf. Softw. Technol. 162, 107268 (2023)","journal-title":"Inf. Softw. Technol."},{"key":"27_CR19","doi-asserted-by":"crossref","unstructured":"Gurari, D., et al.: Vizwiz grand challenge: answering visual questions from blind people. In: 2018 CVPR, pp. 3608\u20133617 (2018)","DOI":"10.1109\/CVPR.2018.00380"},{"key":"27_CR20","doi-asserted-by":"crossref","unstructured":"Haider, F., et al.: Banth: a multi-label hate speech detection dataset for transliterated Bangla. arXiv preprint arXiv:2410.13281 (2024)","DOI":"10.18653\/v1\/2025.findings-naacl.403"},{"key":"27_CR21","doi-asserted-by":"crossref","unstructured":"He, K., Fan, H., Wu, Y., Xie, S., Girshick, R.: Momentum contrast for unsupervised visual representation learning. In: In the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 9729\u20139738 (2020)","DOI":"10.1109\/CVPR42600.2020.00975"},{"key":"27_CR22","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., Sun, J.: Deep residual learning for image recognition. In: CVPR (2016)","DOI":"10.1109\/CVPR.2016.90"},{"key":"27_CR23","unstructured":"He, P., Gao, J., Chen, W.: Debertav3: improving deberta using electra-style pre-training with gradient-disentangled embedding sharing. arXiv (2021)"},{"key":"27_CR24","doi-asserted-by":"crossref","unstructured":"Hendricks, L.A., Mellor, J., Schneider, Alayrac, J., Nematzadeh, A.: Decoupling the role of data, attention, and losses in multimodal transformers. TACL (2021)","DOI":"10.1162\/tacl_a_00385"},{"key":"27_CR25","doi-asserted-by":"crossref","unstructured":"Ishmam, M.F., Shovon, M.S.H., Mridha, M., Dey, N.: From image to language: a critical analysis of visual question answering (VQA) approaches, challenges, and opportunities. Inf. Fusion, 102270 (2024)","DOI":"10.1016\/j.inffus.2024.102270"},{"key":"27_CR26","doi-asserted-by":"crossref","unstructured":"Islam, S., et al.: Note: towards devising an efficient VQA in the Bengali language (2022)","DOI":"10.1145\/3530190.3534837"},{"key":"27_CR27","doi-asserted-by":"crossref","unstructured":"Johnson, J., Hariharan, B., van\u00a0der Maaten, L., Fei-Fei, L., Lawrence\u00a0Zitnick, C., Girshick, R.: Clevr: a diagnostic dataset for compositional language and elementary visual reasoning. In: CVPR (2017)","DOI":"10.1109\/CVPR.2017.215"},{"key":"27_CR28","unstructured":"Khan, M.F., Shifath, S.S.U.R., Islam, M.S.: BAN-cap: a multi-purpose English-Bangla image descriptions dataset. In: LREC (2022)"},{"key":"27_CR29","unstructured":"Kim, W., Son, B., Kim, I.: Vilt: vision-and-language transformer without convolution or region supervision. In: ICML. PMLR (2021)"},{"key":"27_CR30","unstructured":"Li, B., et al.: LLaVA-onevision: easy visual task transfer. TMLR (2025)"},{"key":"27_CR31","unstructured":"Li, J., Li, D., Savarese, S., Hoi, S.: Blip-2: bootstrapping language-image pre-training with frozen image encoders and large language models. In: ICML (2023)"},{"key":"27_CR32","unstructured":"Li, J., Li, D., Xiong, C., Hoi, S.: Blip: bootstrapping language-image pre-training for unified vision-language understanding and generation. In: International Conference on Machine Learning, pp. 12888\u201312900. PMLR (2022)"},{"key":"27_CR33","unstructured":"Li, L.H., Yatskar, M., Yin, D.: Visualbert: a simple and performant baseline for vision and language. arXiv (2019)"},{"key":"27_CR34","doi-asserted-by":"crossref","unstructured":"Li, P., Liu, G., He, J., Zhao, Z., Zhong, S.: Masked vision and language pre-training with unimodal and multimodal contrastive losses for medical visual question answering. In: International Conference on Medical Image Computing and Computer-Assisted Intervention, pp. 374\u2013383. Springer (2023)","DOI":"10.1007\/978-3-031-43907-0_36"},{"key":"27_CR35","unstructured":"Libovick\u1ef3, J., Rosa, R., Fraser, A.: How language-neutral is multilingual BERT? arXiv preprint arXiv:1911.03310 (2019)"},{"key":"27_CR36","first-page":"102611","volume":"143","author":"Z Lin","year":"2023","unstructured":"Lin, Z., et al.: Medical visual question answering: a survey. AI Med. 143, 102611 (2023)","journal-title":"AI Med."},{"key":"27_CR37","doi-asserted-by":"crossref","unstructured":"Liu, H., Li, C., Li, Y., Lee, Y.J.: Improved baselines with visual instruction tuning. In: CVPR (2024)","DOI":"10.1109\/CVPR52733.2024.02484"},{"key":"27_CR38","doi-asserted-by":"crossref","unstructured":"Liu, Z., Mao, H., Wu, C.Y., Feichtenhofer, C., Darrell, T., Xie, S.: A convnet for the 2020s. In: CVPR (2022)","DOI":"10.1109\/CVPR52688.2022.01167"},{"key":"27_CR39","doi-asserted-by":"crossref","unstructured":"Ma\u00f1as, O., Krojer, B., Agrawal, A.: Improving automatic VQA evaluation using large language models. In: The AAAI, vol.\u00a05 (2024)","DOI":"10.1609\/aaai.v38i5.28212"},{"key":"27_CR40","doi-asserted-by":"crossref","unstructured":"Marino, K., Rastegari, M., Farhadi, A., Mottaghi, R.: Ok-VQA: a visual question answering benchmark requiring external knowledge. In: The CVPR, pp. 3190\u20133199 (2019)","DOI":"10.1109\/CVPR.2019.00331"},{"key":"27_CR41","doi-asserted-by":"crossref","unstructured":"Quionero-Candela, J., Sugiyama, M., Schwaighofer, A., Lawrence, N.: Dataset shift in machine learning (2009)","DOI":"10.7551\/mitpress\/9780262170055.001.0001"},{"key":"27_CR42","unstructured":"Radford, A., et\u00a0al.: Learning transferable visual models from natural language supervision. In: ICML. PMLR"},{"key":"27_CR43","doi-asserted-by":"crossref","unstructured":"Rafi, M., Islam, S., Labib, S.H.I., Hasan, S.S., Shah, F., Ahmed, S.: A deep learning-based Bengali visual question answering system (2022)","DOI":"10.1109\/ICCIT57492.2022.10055205"},{"key":"27_CR44","doi-asserted-by":"crossref","unstructured":"Rahman, M., Mohammed, N., Mansoor, N., Momen, S.: Chittron: an automatic Bangla image captioning system. In: The ICICT Procedia Computer Science (2019)","DOI":"10.1016\/j.procs.2019.06.100"},{"key":"27_CR45","unstructured":"Romero, D., Lyu, C., Wibowo, H.A., Aji, A.F., et al.: CVQA: culturally-diverse multilingual visual question answering benchmark (2024)"},{"key":"27_CR46","doi-asserted-by":"crossref","unstructured":"Schwenk, D., Khandelwal, A., Clark, C., Marino, K., Mottaghi, R.: A-okvqa: a benchmark for visual question answering using world knowledge (2022)","DOI":"10.1007\/978-3-031-20074-8_9"},{"key":"27_CR47","doi-asserted-by":"crossref","unstructured":"Sermanet, P., Ichter, T.D.B., Cao, Y.: Robovqa: multimodal long-horizon reasoning for robotics (2023)","DOI":"10.1109\/ICRA57147.2024.10610216"},{"key":"27_CR48","doi-asserted-by":"crossref","unstructured":"Shah, F., Humaira, M., Jim, M., Ami, A., Paul, S.: Bornon: Bengali image captioning with transformer-based deep learning approach. SN Comput. Sci. 3 (2022)","DOI":"10.1007\/s42979-021-00975-0"},{"key":"27_CR49","doi-asserted-by":"crossref","unstructured":"Tan, H., Bansal, M.: Lxmert: learning cross-modality encoder representations from transformers. arXiv preprint arXiv:1908.07490 (2019)","DOI":"10.18653\/v1\/D19-1514"},{"key":"27_CR50","unstructured":"Tan, M., Le, Q.: Efficientnet: rethinking model scaling for convolutional neural networks. In: ICML. PMLR (2019)"},{"key":"27_CR51","unstructured":"Touvron, H., Cord, M., Douze, M., Massa, F., Sablayrolles, A., J\u00e9gou, H.: Training data-efficient image transformers & distillation through attention. In: International Conference on Machine Learnin, pp. 10347\u201310357. PMLR (2021)"},{"key":"27_CR52","unstructured":"Vaswani, A., et al.: Attention is all you need. Adv. Neural Inf. Process. Syst. 30 (2017)"},{"key":"27_CR53","unstructured":"Yue, X., Song, Y., Asai, A., Kim, S., et\u00a0al.: Pangea: a fully open multilingual multimodal LLM for 39 languages. In: ICLR (2025)"},{"key":"27_CR54","unstructured":"Zhang, T., Kishore, V., Wu, F., Weinberger, K.Q., Artzi, Y.: Bertscore: evaluating text generation with BERT. arXiv preprint arXiv:1904.09675 (2019)"},{"key":"27_CR55","unstructured":"Zhuang, L., Wayne, L., Ya, S., Jun, Z.: A robustly optimized BERT pre-training approach with post-training. In: CNCCL (2021)"}],"container-title":["Lecture Notes in Computer Science","Machine Learning and Knowledge Discovery in Databases. Research Track"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-032-06078-5_27","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,9,29]],"date-time":"2025-09-29T18:50:55Z","timestamp":1759171855000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-3-032-06078-5_27"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,9,30]]},"ISBN":["9783032060778","9783032060785"],"references-count":55,"URL":"https:\/\/doi.org\/10.1007\/978-3-032-06078-5_27","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,9,30]]},"assertion":[{"value":"30 September 2025","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"ECML PKDD","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Joint European Conference on Machine Learning and Knowledge Discovery in Databases","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Porto","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Portugal","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2025","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"15 September 2025","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"19 September 2025","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"ecml2025","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/ecmlpkdd.org\/2025\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}