{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,27]],"date-time":"2026-04-27T07:55:23Z","timestamp":1777276523225,"version":"3.51.4"},"reference-count":64,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2025,12,1]],"date-time":"2025-12-01T00:00:00Z","timestamp":1764547200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2025,12,1]],"date-time":"2025-12-01T00:00:00Z","timestamp":1764547200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2025,11,25]],"date-time":"2025-11-25T00:00:00Z","timestamp":1764028800000},"content-version":"vor","delay-in-days":0,"URL":"http:\/\/creativecommons.org\/licenses\/by-nc-nd\/4.0\/"}],"funder":[{"DOI":"10.13039\/501100002920","name":"University Grants Committee Research Grants Council","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100002920","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100004762","name":"The Education University of Hong Kong","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100004762","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Computers and Education: Artificial Intelligence"],"published-print":{"date-parts":[[2025,12]]},"DOI":"10.1016\/j.caeai.2025.100510","type":"journal-article","created":{"date-parts":[[2025,11,26]],"date-time":"2025-11-26T16:18:17Z","timestamp":1764173897000},"page":"100510","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"C","title":["Level-specific feedback generation for scene descriptions via fine-tuning multimodal large language models"],"prefix":"10.1016","volume":"9","author":[{"given":"Zhiwei","family":"Xie","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Tse-Tin","family":"Chan","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-9449-0420","authenticated-orcid":false,"given":"Philip L.H.","family":"Yu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"78","reference":[{"key":"10.1016\/j.caeai.2025.100510_bib1","series-title":"Proceedings of the IEEE International Conference on Computer Vision","first-page":"2425","article-title":"VQA: Visual question answering","author":"Antol","year":"2015"},{"issue":"3","key":"10.1016\/j.caeai.2025.100510_bib2","article-title":"Automated essay scoring with e-rater\u00ae V. 2","volume":"4","author":"Attali","year":"2006","journal-title":"The Journal of Technology, Learning, and Assessment"},{"key":"10.1016\/j.caeai.2025.100510_bib3","unstructured":"Bai, J., Bai, S., Chu, Y., Cui, Z., Dang, K., Deng, X., \u2026 Zhu, T. (2023). Qwen technical report. ArXiv, abs\/2309.16609."},{"key":"10.1016\/j.caeai.2025.100510_bib4","unstructured":"Bai, S., Chen, K., Liu, X., Wang, J., Ge, W., Song, S., \u2026 Lin, J. (2025). Qwen2. 5-VL technical report. ArXiv, abs\/2502.12923."},{"issue":"1","key":"10.1016\/j.caeai.2025.100510_bib74","first-page":"7","article-title":"Assessment and classroom learning. Assessment in Education: Principles,","volume":"5","author":"Black","year":"1998","journal-title":"Policy & Practice"},{"issue":"1","key":"10.1016\/j.caeai.2025.100510_bib6","doi-asserted-by":"crossref","first-page":"150","DOI":"10.1080\/13562517.2020.1782372","article-title":"Teacher feedback literacy and its interplay with student feedback literacy","volume":"28","author":"Carless","year":"2023","journal-title":"Teaching in Higher Education"},{"key":"10.1016\/j.caeai.2025.100510_bib7","article-title":"Improved baselines with momentum contrastive learning","author":"Chen","year":"2020","journal-title":"ArXiv"},{"key":"10.1016\/j.caeai.2025.100510_bib8","unstructured":"Chen, M., Tworek, J., Jun, H., Yuan, Q., Pinto, H.P.D.O., Kaplan, J., \u2026 Zaremba, W. (2021). Evaluating large language models trained on code. ArXiv, abs\/2107.03374."},{"key":"10.1016\/j.caeai.2025.100510_bib9","series-title":"Proceedings of the International Conference on Learning Representations 2021","article-title":"An image is worth 16x16 words: Transformers for image recognition at scale","author":"Dosovitskiy","year":"2021"},{"issue":"30","key":"10.1016\/j.caeai.2025.100510_bib11","doi-asserted-by":"crossref","DOI":"10.1073\/pnas.2305016120","article-title":"ChatGPT outperforms crowd workers for text-annotation tasks","volume":"120","author":"Gilardi","year":"2023","journal-title":"Proceedings of the National Academy of Sciences"},{"key":"10.1016\/j.caeai.2025.100510_bib12","unstructured":"Google. (2023). Gemini: A family of highly capable multimodal models. ArXiv, abs\/2312.11805."},{"issue":"1","key":"10.1016\/j.caeai.2025.100510_bib13","first-page":"6","article-title":"Putting scaffolding to work: The contribution of scaffolding in articulating ESL education","volume":"20","author":"Hammond","year":"2005","journal-title":"Prospect"},{"issue":"1","key":"10.1016\/j.caeai.2025.100510_bib14","doi-asserted-by":"crossref","first-page":"81","DOI":"10.3102\/003465430298487","article-title":"The power of feedback","volume":"77","author":"Hattie","year":"2007","journal-title":"Review of Educational Research"},{"key":"10.1016\/j.caeai.2025.100510_bib15","article-title":"Generating feedback-ladders for logical errors in programming using large language models","volume":"abs\/2405.00302","author":"Heickal","year":"2024","journal-title":"ArXiv"},{"key":"10.1016\/j.caeai.2025.100510_bib16","article-title":"Gaussian error linear units (GELUs)","author":"Hendrycks","year":"2016","journal-title":"ArXiv"},{"key":"10.1016\/j.caeai.2025.100510_bib17","article-title":"Image captioning: Transforming objects into words","volume":"Article No.: 999, 11137-11147","author":"Herdade","year":"2019","journal-title":"In Proceedings of the 33rd Neural Information Processing Systems"},{"key":"10.1016\/j.caeai.2025.100510_bib20","article-title":"LoRA: Low-rank adaptation of large language models","author":"Hu","year":"2022","journal-title":"In Proceeedings of International Conference on Learning Representations 2022"},{"issue":"7","key":"10.1016\/j.caeai.2025.100510_bib21","doi-asserted-by":"crossref","first-page":"1632","DOI":"10.1080\/09588221.2022.2095406","article-title":"Facilitating authentic contextual EFL speaking and conversation with smart mechanisms and investigating its influence on learning achievements","volume":"37","author":"Hwang","year":"2024","journal-title":"Computer Assisted Language Learning"},{"issue":"2","key":"10.1016\/j.caeai.2025.100510_bib23","doi-asserted-by":"crossref","first-page":"83","DOI":"10.1017\/S0261444806003399","article-title":"Feedback on second language students' writing","volume":"39","author":"Hyland","year":"2006","journal-title":"Language Teaching"},{"key":"10.1016\/j.caeai.2025.100510_bib25","doi-asserted-by":"crossref","DOI":"10.1016\/j.system.2024.103332","article-title":"Automated writing evaluation use in second language classrooms: A research synthesis","volume":"123","author":"Karatay","year":"2024","journal-title":"System"},{"issue":"6","key":"10.1016\/j.caeai.2025.100510_bib26","doi-asserted-by":"crossref","first-page":"704","DOI":"10.1080\/10494820.2012.745424","article-title":"Expanding \u201cwithin context\u201d to \u201cacross contexts\u201d learning: A case study of informal and formal activities","volume":"22","author":"Kim","year":"2014","journal-title":"Interactive Learning Environments"},{"key":"10.1016\/j.caeai.2025.100510_bib27","first-page":"1","article-title":"Realizing visual question answering for education: GPT-4V as a multimodal AI","author":"Lee","year":"2025","journal-title":"TechTrends"},{"key":"10.1016\/j.caeai.2025.100510_bib28","first-page":"9459","article-title":"Retrieval-augmented generation for knowledge-intensive NLP tasks","volume":"33","author":"Lewis","year":"2020","journal-title":"Advances in Neural Information Processing Systems"},{"key":"10.1016\/j.caeai.2025.100510_bib29","series-title":"International conference on machine learning","first-page":"19730","article-title":"BLIP-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","author":"Li","year":"2023"},{"key":"10.1016\/j.caeai.2025.100510_bib30","first-page":"28541","article-title":"Llava-med: Training a large language-and-vision assistant for biomedicine in one day","volume":"36","author":"Li","year":"2023","journal-title":"Advances in Neural Information Processing Systems"},{"key":"10.1016\/j.caeai.2025.100510_bib31","article-title":"LlaVA-OneVision: Easy visual task transfer","author":"Li","year":"2024","journal-title":"ArXiv, abs\/2408.03326"},{"key":"10.1016\/j.caeai.2025.100510_bib33","series-title":"Proceedings of the Computer Vision\u2013ECCV 2014: 13th European Conference, Zurich, Switzerland, September 6-12, 2014, Part v 13","first-page":"740","article-title":"Microsoft coco: Common objects in context","author":"Lin","year":"2014"},{"key":"10.1016\/j.caeai.2025.100510_bib34","series-title":"Proceedings of the European Conference on Computer Vision","first-page":"126","article-title":"LLAVA-Plus: Learning to use tools for creating multimodal agents","author":"Liu","year":"2024"},{"key":"10.1016\/j.caeai.2025.100510_bib35","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"26296","article-title":"Improved baselines with visual instruction tuning","author":"Liu","year":"2024"},{"key":"10.1016\/j.caeai.2025.100510_bib36","first-page":"34892","article-title":"Visual instruction tuning","volume":"36","author":"Liu","year":"2023","journal-title":"Advances in Neural Information Processing Systems"},{"key":"10.1016\/j.caeai.2025.100510_bib37","article-title":"A survey on hallucination in large vision-language models","author":"Liu","year":"2024","journal-title":"ArXiv, abs\/2402.00253"},{"key":"10.1016\/j.caeai.2025.100510_bib38","series-title":"Proceedings of the 2024 IEEE Conference on Artificial Intelligence (CAI)","first-page":"1258","article-title":"Scaffolding language learning via multi-modal tutoring systems with pedagogical instructions","author":"Liu","year":"2024"},{"key":"10.1016\/j.caeai.2025.100510_bib39","series-title":"Proceedings of the International Conference on Machine Learning","first-page":"22631","article-title":"The flan collection: Designing data and methods for effective instruction tuning","author":"Longpre","year":"2023"},{"issue":"7","key":"10.1016\/j.caeai.2025.100510_bib40","doi-asserted-by":"crossref","first-page":"4490","DOI":"10.1080\/10494820.2021.1972321","article-title":"English learning enhanced by collaborative contextual drama in an authentic context","volume":"31","author":"Manabe","year":"2023","journal-title":"Interactive Learning Environments"},{"issue":"2","key":"10.1016\/j.caeai.2025.100510_bib41","doi-asserted-by":"crossref","first-page":"199","DOI":"10.1080\/03075070600572090","article-title":"Formative assessment and self-regulated learning: A model and seven principles of good feedback practice","volume":"31","author":"Nicol","year":"2006","journal-title":"Studies in Higher Education"},{"issue":"1","key":"10.1016\/j.caeai.2025.100510_bib42","doi-asserted-by":"crossref","first-page":"102","DOI":"10.1080\/02602938.2013.795518","article-title":"Rethinking feedback practices in higher education: A peer review perspective","volume":"39","author":"Nicol","year":"2014","journal-title":"Assessment & Evaluation in Higher Education"},{"key":"10.1016\/j.caeai.2025.100510_bib43","unstructured":"OpenAI. (2023). GPT-4 technical report. ArXiv, abs\/2303.08774. https:\/\/cdn.openai.com\/papers\/gpt-4.pdf."},{"key":"10.1016\/j.caeai.2025.100510_bib44","article-title":"GPT-4o system card","year":"2024","journal-title":"ArXiv, abs\/2410.21276"},{"key":"10.1016\/j.caeai.2025.100510_bib45","first-page":"27730","article-title":"Training language models to follow instructions with human feedback","volume":"35","author":"Ouyang","year":"2022","journal-title":"Advances in Neural Information Processing Systems"},{"key":"10.1016\/j.caeai.2025.100510_bib53","article-title":"Qwen2 technical report","author":"Qwen Team","year":"2024","journal-title":"ArXiv, abs\/2412.15115"},{"key":"10.1016\/j.caeai.2025.100510_bib46","series-title":"Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing","article-title":"Sentence-BERT: Sentence embeddings using siamese BERT-networks","author":"Reimers","year":"2019"},{"issue":"2","key":"10.1016\/j.caeai.2025.100510_bib47","first-page":"44","article-title":"Authentic use of technology to improve EFL communication and motivation through international language exchange video chat","volume":"19","author":"Sevy-Biloon","year":"2019","journal-title":"Teaching English with Technology"},{"issue":"1","key":"10.1016\/j.caeai.2025.100510_bib48","doi-asserted-by":"crossref","first-page":"153","DOI":"10.3102\/0034654307313795","article-title":"Focus on formative feedback","volume":"78","author":"Shute","year":"2008","journal-title":"Review of Educational Research"},{"issue":"2","key":"10.1016\/j.caeai.2025.100510_bib49","doi-asserted-by":"crossref","first-page":"858","DOI":"10.1111\/bjet.13037","article-title":"Affordances of a mobile learner\u2010generated tool for pupils' English as a second language vocabulary learning: An ecological perspective","volume":"52","author":"Song","year":"2021","journal-title":"British Journal of Educational Technology"},{"issue":"1","key":"10.1016\/j.caeai.2025.100510_bib50","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1186\/s41239-022-00368-0","article-title":"Impact of combining human and analytics feedback on students' engagement with, and performance in, reflective writing tasks","volume":"20","author":"Suraworachet","year":"2023","journal-title":"International Journal of Educational Technology in Higher Education"},{"issue":"2","key":"10.1016\/j.caeai.2025.100510_bib51","doi-asserted-by":"crossref","first-page":"257","DOI":"10.1207\/s15516709cog1202_4","article-title":"Cognitive load during problem solving: Effects on learning","volume":"12","author":"Sweller","year":"1988","journal-title":"Cognitive Science"},{"key":"10.1016\/j.caeai.2025.100510_bib75","series-title":"How to Differentiate Instruction in Mixed-Ability Classrooms","author":"Tomlinson","year":"2001"},{"key":"10.1016\/j.caeai.2025.100510_bib55","series-title":"Mind in Society: Development of Higher Psychological Processes","author":"Vygotsky","year":"1978"},{"key":"10.1016\/j.caeai.2025.100510_bib56","article-title":"Qwen2-VL: Enhancing vision-language model\u2019s perception of the world at any resolution","author":"Wang","year":"2024","journal-title":"ArXiv, abs\/2409.12191"},{"key":"10.1016\/j.caeai.2025.100510_bib57","article-title":"A comprehensive review of multimodal large language models: Performance and challenges across different tasks","author":"Wang","year":"2024","journal-title":"ArXiv, abs\/2408.01319"},{"issue":"1","key":"10.1016\/j.caeai.2025.100510_bib58","doi-asserted-by":"crossref","first-page":"87","DOI":"10.1177\/0735633119830764","article-title":"Automated writing evaluation and feedback: Multiple metrics of efficacy","volume":"58","author":"Wilson","year":"2020","journal-title":"Journal of Educational Computing Research"},{"issue":"2","key":"10.1016\/j.caeai.2025.100510_bib59","doi-asserted-by":"crossref","first-page":"89","DOI":"10.1111\/j.1469-7610.1976.tb00381.x","article-title":"The role of tutoring in problem solving","volume":"17","author":"Wood","year":"1976","journal-title":"Journal of Child Psychology and Psychiatry"},{"key":"10.1016\/j.caeai.2025.100510_bib60","series-title":"Proceedings of the2023 IEEE international conference on big data (BigData)","first-page":"2247","article-title":"Multimodal large language models: A survey","author":"Wu","year":"2023"},{"issue":"4","key":"10.1016\/j.caeai.2025.100510_bib61","doi-asserted-by":"crossref","first-page":"357","DOI":"10.1007\/s40299-021-00577-7","article-title":"Understanding AWE feedback and English writing of learners with different proficiency levels in an EFL classroom: A sociocultural perspective","volume":"31","author":"Xu","year":"2022","journal-title":"The Asia-Pacific Education Researcher"},{"issue":"12","key":"10.1016\/j.caeai.2025.100510_bib62","doi-asserted-by":"crossref","first-page":"nwae403","DOI":"10.1093\/nsr\/nwae403","article-title":"A survey on multimodal large language models","volume":"11","author":"Yin","year":"2024","journal-title":"National Science Review"},{"key":"10.1016\/j.caeai.2025.100510_bib63","doi-asserted-by":"crossref","first-page":"67","DOI":"10.1162\/tacl_a_00166","article-title":"From image descriptions to visual denotations: New similarity metrics for semantic inference over event descriptions","volume":"2","author":"Young","year":"2014","journal-title":"Transactions of the Association for Computational Linguistics"},{"key":"10.1016\/j.caeai.2025.100510_bib64","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"6720","article-title":"From recognition to cognition: Visual commonsense reasoning","author":"Zellers","year":"2019"},{"issue":"4","key":"10.1016\/j.caeai.2025.100510_bib65","doi-asserted-by":"crossref","first-page":"875","DOI":"10.1177\/07356331221127300","article-title":"The effectiveness of automated writing evaluation on writing quality: A meta-analysis","volume":"61","author":"Zhai","year":"2023","journal-title":"Journal of Educational Computing Research"},{"issue":"3","key":"10.1016\/j.caeai.2025.100510_bib66","doi-asserted-by":"crossref","first-page":"697","DOI":"10.1177\/0735633118757731","article-title":"Collaborative drama-based EFL learning in familiar contexts","volume":"57","author":"Zhang","year":"2019","journal-title":"Journal of Educational Computing Research"},{"issue":"3","key":"10.1016\/j.caeai.2025.100510_bib67","doi-asserted-by":"crossref","DOI":"10.1142\/S0129065724500096","article-title":"Automated quality evaluation of large-scale benchmark datasets for vision-language tasks","volume":"34","author":"Zhao","year":"2024","journal-title":"International Journal of Neural Systems"},{"issue":"6","key":"10.1016\/j.caeai.2025.100510_bib69","doi-asserted-by":"crossref","first-page":"7031","DOI":"10.1007\/s10639-022-11473-y","article-title":"AI-assisted automated scoring of picture-cued writing tasks for language assessment","volume":"28","author":"Zhao","year":"2023","journal-title":"Education and Information Technologies"},{"key":"10.1016\/j.caeai.2025.100510_bib68","doi-asserted-by":"crossref","DOI":"10.1016\/j.compedu.2024.105106","article-title":"Facilitating self-directed language learning in real-life scene description tasks with automated evaluation","volume":"219","author":"Zhao","year":"2024","journal-title":"Computers and Education"},{"key":"10.1016\/j.caeai.2025.100510_bib70","series-title":"Proceedings of the International Conference on Learning Representations 2024","article-title":"MiniGPT-4: Enhancing vision-language understanding with advanced large language models","author":"Zhu","year":"2024"},{"key":"10.1016\/j.caeai.2025.100510_bib71","article-title":"Enhancing language learning through generative AI feedback on picture-cued writing tasks","volume":"9","author":"Zhuang","year":"2025","journal-title":"Computers and Education: Artificial Intelligence"}],"container-title":["Computers and Education: Artificial Intelligence"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S2666920X2500150X?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S2666920X2500150X?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,4,27]],"date-time":"2026-04-27T07:11:32Z","timestamp":1777273892000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S2666920X2500150X"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,12]]},"references-count":64,"alternative-id":["S2666920X2500150X"],"URL":"https:\/\/doi.org\/10.1016\/j.caeai.2025.100510","relation":{},"ISSN":["2666-920X"],"issn-type":[{"value":"2666-920X","type":"print"}],"subject":[],"published":{"date-parts":[[2025,12]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"Level-specific feedback generation for scene descriptions via fine-tuning multimodal large language models","name":"articletitle","label":"Article Title"},{"value":"Computers and Education: Artificial Intelligence","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.caeai.2025.100510","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2025 The Authors. Published by Elsevier Ltd.","name":"copyright","label":"Copyright"}],"article-number":"100510"}}