{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,8,4]],"date-time":"2026-08-04T08:52:34Z","timestamp":1785833554873,"version":"3.56.0"},"reference-count":22,"publisher":"MDPI AG","issue":"10","license":[{"start":{"date-parts":[[2025,10,10]],"date-time":"2025-10-10T00:00:00Z","timestamp":1760054400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/"}],"funder":[{"name":"General Scientific Research Project of Zhejiang Provincial Department of Education: Practice and Reflection on the Construction of Research Teams in Higher Vocational Colleges","award":["Y202457001"],"award-info":[{"award-number":["Y202457001"]}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["Information"],"abstract":"<jats:p>Conventional teacher assessment is labor-intensive and subjective. Prior LLM-based systems improve scale but rely on post hoc rationales and lack built-in trust controls. We propose an explainable-by-design framework that couples (i) Dual-Lens Hierarchical Attention\u2014a global lens aligned to curriculum standards and a local lens aligned to subject-specific rubrics\u2014with (ii) a Trust-Gated Inference module that combines Monte-Carlo-dropout calibration and adversarial debiasing, and (iii) an On-the-Spot Explanation generator that shares the same fused representation and predicted score used for decision making. Thus, explanations are decision-consistent and curriculum-anchored rather than retrofitted. On TeacherEval-2023, EdNet-Math, and MM-TBA, our model attains an Inter-Rater Consistency of 82.4%, Explanation Credibility of 0.78, Fairness Gap of 1.8%, and Expected Calibration Error of 0.032. Faithfulness is verified via attention-to-rubric alignment (78%) and counterfactual deletion tests, while trust gating reduces confidently wrong outputs and triggers reject-and-refer when uncertainty is high. The system retains 99.6% accuracy under cross-domain transfer and degrades only 4.1% with 15% ASR noise, reducing human review workload by 41%. This establishes a reproducible path to trustworthy and pedagogy-aligned LLMs for high-stakes educational evaluation.<\/jats:p>","DOI":"10.3390\/info16100882","type":"journal-article","created":{"date-parts":[[2025,10,10]],"date-time":"2025-10-10T14:50:16Z","timestamp":1760107816000},"page":"882","update-policy":"https:\/\/doi.org\/10.3390\/mdpi_crossmark_policy","source":"Crossref","is-referenced-by-count":2,"title":["Towards Trustworthy and Explainable-by-Design Large Language Models for Automated Teacher Assessment"],"prefix":"10.3390","volume":"16","author":[{"given":"Yuan","family":"Li","sequence":"first","affiliation":[{"name":"Lishui Vocational and Technical College, Lishui 323000, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Hang","family":"Yang","sequence":"additional","affiliation":[{"name":"National Engineering Research Centre for Marine Aquaculture, Zhejiang Ocean University, Zhoushan 316004, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0008-9625-9426","authenticated-orcid":false,"given":"Quanrong","family":"Fang","sequence":"additional","affiliation":[{"name":"School of Computer Science and Technology, Wuhan University, Wuhan 430072, China"},{"name":"College of Computer Science and Technology, Zhejiang University, Hangzhou 310027, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"1968","published-online":{"date-parts":[[2025,10,10]]},"reference":[{"key":"ref_1","first-page":"1","article-title":"Artificial Intelligence in Education: Opportunities, Challenges, and Ethical Concerns","volume":"8","author":"Chelghoum","year":"2025","journal-title":"J. Stud. Lang. Cult. Soc. (JSLCS)"},{"key":"ref_2","doi-asserted-by":"crossref","unstructured":"Se\u00dfler, K., F\u00fcrstenberg, M., B\u00fchler, B., and Kasneci, E. (2025, January 3\u20137). Can AI grade your essays? A comparative analysis of large language models and teacher ratings in multidimensional essay scoring. Proceedings of the 15th International Learning Analytics and Knowledge Conference, Dublin, Ireland.","DOI":"10.1145\/3706468.3706527"},{"key":"ref_3","unstructured":"Hutson, J. (2025). Scaffolded Integration: Aligning AI Literacy with Authentic Assessment through a Revised Taxonomy in Education. FAR J. Educ. Sociol., 2."},{"key":"ref_4","first-page":"328","article-title":"Human Centric Explainable AI for Personalized Educational Chatbots","volume":"Volume 1","author":"Manohara","year":"2024","journal-title":"Proceedings of the 2024 10th International Conference on Advanced Computing and Communication Systems (ICACCS)"},{"key":"ref_5","doi-asserted-by":"crossref","first-page":"1097","DOI":"10.1162\/coli_a_00524","article-title":"Bias and fairness in large language models: A survey","volume":"50","author":"Gallegos","year":"2024","journal-title":"Comput. Linguist."},{"key":"ref_6","doi-asserted-by":"crossref","unstructured":"Gao, R., Ni, Q., and Hu, B. (2024, January 28\u201330). Fairness of large language models in education. Proceedings of the 2024 International Conference on Intelligent Education and Computer Technology, Guilin, China.","DOI":"10.1145\/3687311.3687404"},{"key":"ref_7","unstructured":"Wang, P., Li, L., Chen, L., Cai, Z., Zhu, D., Lin, B., Cao, Y., Liu, Q., Liu, T., and Sui, Z. (2023). Large language models are not fair evaluators. arXiv."},{"key":"ref_8","first-page":"43080","article-title":"LACIE: Listener-aware finetuning for calibration in large language models","volume":"37","author":"Hase","year":"2024","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"ref_9","doi-asserted-by":"crossref","first-page":"60","DOI":"10.1038\/s41539-024-00273-3","article-title":"Evaluating large language models in analysing classroom dialogue","volume":"9","author":"Long","year":"2024","journal-title":"npj Sci. Learn."},{"key":"ref_10","doi-asserted-by":"crossref","first-page":"79","DOI":"10.1038\/s41539-024-00291-1","article-title":"Evaluating large language models for criterion-based grading from agreement to consistency","volume":"9","author":"Zhang","year":"2024","journal-title":"npj Sci. Learn."},{"key":"ref_11","doi-asserted-by":"crossref","unstructured":"Jia, L., Sun, H., Jiang, J., and Yang, X. (2025). High-Quality Classroom Dialogue Automatic Analysis System. Appl. Sci., 15.","DOI":"10.3390\/app15031613"},{"key":"ref_12","doi-asserted-by":"crossref","unstructured":"Yuan, S. (2024, January 20\u201322). Design of a multimodal data mining system for school teaching quality analysis. Proceedings of the 2024 2nd International Conference on Information Education and Artificial Intelligence, Kaifeng, Chin.","DOI":"10.1145\/3724504.3724600"},{"key":"ref_13","doi-asserted-by":"crossref","first-page":"1115","DOI":"10.1038\/s41597-025-05426-6","article-title":"A Multi-Modal Dataset for Teacher Behavior Analysis in Offline Classrooms","volume":"12","author":"Huang","year":"2025","journal-title":"Sci. Data"},{"key":"ref_14","doi-asserted-by":"crossref","first-page":"644","DOI":"10.1038\/s41597-025-04987-w","article-title":"A Video Dataset for Classroom Group Engagement Recognition","volume":"12","author":"Lu","year":"2025","journal-title":"Sci. Data"},{"key":"ref_15","first-page":"10827","article-title":"On convergence of adam for stochastic optimization under relaxed assumptions","volume":"37","author":"Hong","year":"2024","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"ref_16","unstructured":"Mantios, J. (2025, October 02). Teaching Assistant Evaluation Dataset. Kaggle. Available online: https:\/\/www.kaggle.com\/datasets\/johnmantios\/teaching-assistant-evaluation-dataset."},{"key":"ref_17","doi-asserted-by":"crossref","unstructured":"Choi, Y., Lee, Y., Shin, D., Cho, J., Park, S., Lee, S., Baek, J., Bae, C., Kim, B., and Heo, J. (2019). EdNet: A large-scale hierarchical dataset in education. arXiv.","DOI":"10.1007\/978-3-030-52240-7_13"},{"key":"ref_18","unstructured":"Wang, X., Li, Y., and Zhang, Z. (2025, October 02). MM-TBA. Figshare. Available online: https:\/\/figshare.com\/articles\/dataset\/MM-TBA\/28942505."},{"key":"ref_19","unstructured":"Nexdata Technology Inc. (2025, October 02). 55 Hours\u2014British Children Speech Data by Microphone. Nexdata. Available online: https:\/\/www.nexdata.ai\/datasets\/speechrecog\/62."},{"key":"ref_20","first-page":"311","article-title":"Bidirectional encoders to state-of-the-art: A review of BERT and its transformative impact on natural language processing. \u0418\u043d\u0444o\u0440\u043ca\u0442\u0438\u043aa. \u042d\u043ao\u043do\u043c\u0438\u043aa. \u0423\u043f\u0440a\u0432\u043b\u0435\u043d\u0438\u0435\/Informatics","volume":"3","author":"Gupta","year":"2024","journal-title":"Econ. Manag."},{"key":"ref_21","doi-asserted-by":"crossref","unstructured":"Wu, W., Li, W., Xiao, X., Liu, J., and Li, S. (2024). Instructeval: Instruction-tuned text evaluator from human preference. Findings of the Association for Computational Linguistics ACL, Association for Computational Linguistics.","DOI":"10.18653\/v1\/2024.findings-acl.799"},{"key":"ref_22","doi-asserted-by":"crossref","unstructured":"Gallifant, J., Fiske, A., Levites Strekalova, Y.A., Osorio-Valencia, J.S., Parke, R., Mwavu, R., Martinez, N., Gichoya, J.W., Ghassemi, M., and Demner-Fushman, D. (2024). Peer review of GPT-4 technical report and systems card. PLoS Digit. Health, 3.","DOI":"10.1371\/journal.pdig.0000417"}],"container-title":["Information"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/www.mdpi.com\/2078-2489\/16\/10\/882\/pdf","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,10,15]],"date-time":"2025-10-15T14:15:04Z","timestamp":1760537704000},"score":1,"resource":{"primary":{"URL":"https:\/\/www.mdpi.com\/2078-2489\/16\/10\/882"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,10,10]]},"references-count":22,"journal-issue":{"issue":"10","published-online":{"date-parts":[[2025,10]]}},"alternative-id":["info16100882"],"URL":"https:\/\/doi.org\/10.3390\/info16100882","relation":{},"ISSN":["2078-2489"],"issn-type":[{"value":"2078-2489","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,10,10]]}}}