{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,15]],"date-time":"2026-07-15T19:13:52Z","timestamp":1784142832243,"version":"3.55.0"},"publisher-location":"Singapore","reference-count":23,"publisher":"Springer Nature Singapore","isbn-type":[{"value":"9789819549597","type":"print"},{"value":"9789819549603","type":"electronic"}],"license":[{"start":{"date-parts":[[2025,11,27]],"date-time":"2025-11-27T00:00:00Z","timestamp":1764201600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2025,11,27]],"date-time":"2025-11-27T00:00:00Z","timestamp":1764201600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2026]]},"DOI":"10.1007\/978-981-95-4960-3_25","type":"book-chapter","created":{"date-parts":[[2025,11,26]],"date-time":"2025-11-26T04:58:36Z","timestamp":1764133116000},"page":"308-319","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":1,"title":["ViPPS: Building a\u00a0Multimodal Dataset for\u00a0Physics Problem Solving in\u00a0Vietnamese"],"prefix":"10.1007","author":[{"given":"Quynh T. N.","family":"Vo","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xinh T.","family":"Le","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Thao H. M.","family":"Tran","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-0467-6254","authenticated-orcid":false,"given":"Tho T.","family":"Quan","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2025,11,27]]},"reference":[{"key":"25_CR1","unstructured":"Amini, A., et al.: MathQA: towards interpretable math word problem solving with operation-based formalisms. In: Proceedings of NAACL-HLT, pp. 2357\u20132367 (2019)"},{"key":"25_CR2","doi-asserted-by":"publisher","unstructured":"Anand, A., et al.: MM-PhyQA: multimodal physics question-answering with multi-image cot prompting. arXiv preprint arXiv:2404.08704 (2024). https:\/\/doi.org\/10.48550\/arXiv.2404.08704","DOI":"10.48550\/arXiv.2404.08704"},{"key":"25_CR3","unstructured":"Chen, J., et\u00a0al.: BLIP-2: bootstrapping language-image pre-training with frozen image encoders and large language models. In: ICML (2023)"},{"key":"25_CR4","doi-asserted-by":"publisher","unstructured":"Dao, X.Q., et al.: VNHSGE: Vietnamese high school graduation examination dataset for large language models. arXiv preprint arXiv:2305.12199 (2023).https:\/\/doi.org\/10.48550\/arXiv.2305.12199","DOI":"10.48550\/arXiv.2305.12199"},{"key":"25_CR5","doi-asserted-by":"crossref","unstructured":"Johnson, J., Hariharan, B., van\u00a0der Maaten, L., Fei-Fei, L., Zitnick, C., Girshick, R.: CLEVR: a diagnostic dataset for compositional language and elementary visual reasoning. In: Proceedings of CVPR, pp. 2901\u20132910 (2017)","DOI":"10.1109\/CVPR.2017.215"},{"key":"25_CR6","unstructured":"Joshi, R., Kumar, A.: Multimodal learning in AI: toward holistic reasoning. AI Mag. (2023)"},{"key":"25_CR7","unstructured":"Kembhavi, A., Salvato, M., Kolve, E., Seo, M., Hajishirzi, H., Farhadi, A.: Diagram understanding in geometry questions. In: Proceedings of AAAI, pp. 2831\u20132839 (2016)"},{"key":"25_CR8","doi-asserted-by":"crossref","unstructured":"Kembhavi, A., Seo, M., Schwenk, D., Choi, J., Farhadi, A., Hajishirzi, H.: Are you smarter than a sixth grader? Textbook question answering for multimodal machine comprehension. In: Proceedings of CVPR, pp. 4999\u20135007 (2017)","DOI":"10.1109\/CVPR.2017.571"},{"key":"25_CR9","unstructured":"Le, A.T., Tran, M.T.: KTVIC: a dataset for Vietnamese image captioning. arXiv preprint arXiv:2304.09987 (2023)"},{"key":"25_CR10","unstructured":"Liu, H., Li, C., Li, Y.J., et\u00a0al.: Visual instruction tuning. In: NeurIPS (2024)"},{"key":"25_CR11","unstructured":"Lu, P., et al.: MathVista: evaluating mathematical reasoning in visual contexts. arXiv preprint arXiv:2309.09979 (2023)"},{"key":"25_CR12","unstructured":"Lu, P., et al.: Learn to explain: multimodal reasoning via thought chains for science question answering. In: Advances in Neural Information Processing Systems, vol.\u00a035, pp. 2507\u20132521 (2022)"},{"key":"25_CR13","doi-asserted-by":"publisher","unstructured":"Meshram, P.S., Karthikeyan, S., Bhavya, Bhat, S.: ElectroVizQA: how well do multi-modal LLMs perform in electronics visual question answering? arXiv preprint arXiv:2412.00102 (2024). https:\/\/doi.org\/10.48550\/arXiv.2412.00102","DOI":"10.48550\/arXiv.2412.00102"},{"key":"25_CR14","doi-asserted-by":"publisher","DOI":"10.1016\/j.inffus.2023.101868","volume":"94","author":"NH Nguyen","year":"2023","unstructured":"Nguyen, N.H., Vo, D.T.D., Nguyen, K.V., Nguyen, N.L.T.: OpenViVQA: task, dataset, and multimodal fusion models for visual question answering in Vietnamese. Inf. Fusion 94, 101868 (2023). https:\/\/doi.org\/10.1016\/j.inffus.2023.101868","journal-title":"Inf. Fusion"},{"key":"25_CR15","doi-asserted-by":"publisher","unstructured":"Nguyen, Q.V., et al.: ViTextVQA: a large-scale visual question answering dataset for evaluating Vietnamese text comprehension in images. arXiv preprint arXiv:2404.10652, April 2024. https:\/\/doi.org\/10.48550\/arXiv.2404.10652","DOI":"10.48550\/arXiv.2404.10652"},{"key":"25_CR16","unstructured":"Nguyen, V.H., Pham, V.K., Le, M.T.: ViCLEVR: a Vietnamese dataset for compositional visual reasoning. arXiv preprint arXiv:2306.12045 (2023)"},{"key":"25_CR17","unstructured":"OpenAI: GPT-4 technical report. arXiv preprint arXiv:2303.08774 (2023). https:\/\/arxiv.org\/abs\/2303.08774"},{"key":"25_CR18","unstructured":"Pham, V.K., Nguyen, H., Le, M.T.: ViMRHP: multimodal review helpfulness prediction in Vietnamese. arXiv preprint arXiv:2305.14233 (2023)"},{"key":"25_CR19","unstructured":"Susnjak, T.: ChatGPT: the end of online exam integrity? arXiv preprint arXiv:2212.09292 (2022)"},{"key":"25_CR20","unstructured":"Team, G.G.: Gemini 2.5: pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities. arXiv preprint arXiv:2507.06261 (2025). https:\/\/arXiv.org\/abs\/2507.06261"},{"key":"25_CR21","unstructured":"Tran, T.H., Nguyen, V.K., Le, M.T.: ViMACSA: a multimodal dataset for Vietnamese sentiment analysis. arXiv preprint arXiv:2305.09123 (2023)"},{"key":"25_CR22","doi-asserted-by":"publisher","unstructured":"Tuong, V., Vo, A., Tau, Q., Dm, D., Kim, D.: ViExam: are vision language models better than humans on Vietnamese multimodal exam questions? arXiv preprint arXiv:2508.13680 (2025). https:\/\/doi.org\/10.48550\/arXiv.2508.13680","DOI":"10.48550\/arXiv.2508.13680"},{"key":"25_CR23","volume":"4","author":"J Zhou","year":"2023","unstructured":"Zhou, J., Guo, Y.: Large language models in education: opportunities and challenges. Comput. Educ. Artif. Intell. 4, 100123 (2023)","journal-title":"Comput. Educ. Artif. Intell."}],"container-title":["Lecture Notes in Computer Science","Multi-disciplinary Trends in Artificial Intelligence"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-981-95-4960-3_25","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,11,26]],"date-time":"2025-11-26T23:02:59Z","timestamp":1764198179000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-981-95-4960-3_25"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,11,27]]},"ISBN":["9789819549597","9789819549603"],"references-count":23,"URL":"https:\/\/doi.org\/10.1007\/978-981-95-4960-3_25","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,11,27]]},"assertion":[{"value":"27 November 2025","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"MIWAI","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"International Conference on Multi-disciplinary Trends in Artificial Intelligence","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Ho Chi Minh City","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Vietnam","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2025","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"3 December 2025","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"5 December 2025","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"18","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"miwai2025","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/miwai25.miwai.org","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}