{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,24]],"date-time":"2026-06-24T15:57:50Z","timestamp":1782316670354,"version":"3.54.5"},"publisher-location":"Cham","reference-count":35,"publisher":"Springer Nature Switzerland","isbn-type":[{"value":"9783032297549","type":"print"},{"value":"9783032297556","type":"electronic"}],"license":[{"start":{"date-parts":[[2026,6,25]],"date-time":"2026-06-25T00:00:00Z","timestamp":1782345600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2026,6,25]],"date-time":"2026-06-25T00:00:00Z","timestamp":1782345600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2027]]},"DOI":"10.1007\/978-3-032-29755-6_18","type":"book-chapter","created":{"date-parts":[[2026,6,24]],"date-time":"2026-06-24T15:38:34Z","timestamp":1782315514000},"page":"262-276","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["Can We Trust AI\u2019s Self-assessment? Evaluating and\u00a0Improving LLM Confidence Calibration in\u00a0Educational Dialogue Coding"],"prefix":"10.1007","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-6024-677X","authenticated-orcid":false,"given":"Hongming","family":"Li","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-2651-2867","authenticated-orcid":false,"given":"Huan","family":"Kuang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-7373-4959","authenticated-orcid":false,"given":"Anthony F.","family":"Botelho","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2026,6,25]]},"reference":[{"key":"18_CR1","doi-asserted-by":"crossref","unstructured":"Borchers, C., Yang, K., Lin, J., Rummel, N., Koedinger, K.R., Aleven, V.: Combining dialog acts and skill modeling: what chat interactions enhance learning rates during AI-supported peer tutoring? In: Proceedings of the 17th International Conference on Educational Data Mining, pp. 117\u2013130 (2024)","DOI":"10.35542\/osf.io\/3tmhy"},{"key":"18_CR2","first-page":"1877","volume":"33","author":"T Brown","year":"2020","unstructured":"Brown, T., et al.: Language models are few-shot learners. Adv. Neural. Inf. Process. Syst. 33, 1877\u20131901 (2020)","journal-title":"Adv. Neural. Inf. Process. Syst."},{"key":"18_CR3","unstructured":"Chew, R., Bollenbacher, J., Wenger, M., Speer, J., Kim, A.: LLM-assisted content analysis: using large language models to support deductive coding. arXiv preprint arXiv:2306.14924 (2023)"},{"issue":"1","key":"18_CR4","doi-asserted-by":"publisher","first-page":"37","DOI":"10.1177\/001316446002000104","volume":"20","author":"J Cohen","year":"1960","unstructured":"Cohen, J.: A coefficient of agreement for nominal scales. Educ. Psychol. Measur. 20(1), 37\u201346 (1960)","journal-title":"Educ. Psychol. Measur."},{"key":"18_CR5","doi-asserted-by":"crossref","unstructured":"Dai, S.C., Xiong, A., Ku, L.W.: LLM-in-the-loop: leveraging large language model for thematic analysis. arXiv preprint arXiv:2310.15100 (2023)","DOI":"10.18653\/v1\/2023.findings-emnlp.669"},{"issue":"1\u20132","key":"18_CR6","first-page":"12","volume":"32","author":"MH DeGroot","year":"1983","unstructured":"DeGroot, M.H., Fienberg, S.E.: The comparison and evaluation of forecasters. J. Roy. Stat. Soc.: Ser. D (The Statistician) 32(1\u20132), 12\u201322 (1983)","journal-title":"J. Roy. Stat. Soc.: Ser. D (The Statistician)"},{"key":"18_CR7","doi-asserted-by":"crossref","unstructured":"Geng, J., Cai, F., Wang, Y., Koeppl, H., Nakov, P., Gurevych, I.: A survey of confidence estimation and calibration in large language models. In: Proceedings of the 2024 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies (Volume 1: Long Papers), pp. 6577\u20136595 (2024)","DOI":"10.18653\/v1\/2024.naacl-long.366"},{"key":"18_CR8","unstructured":"Guo, C., Pleiss, G., Sun, Y., Weinberger, K.Q.: On calibration of modern neural networks. In: International Conference on Machine Learning, pp. 1321\u20131330. PMLR (2017)"},{"key":"18_CR9","unstructured":"Hendrycks, D., Gimpel, K.: A baseline for detecting misclassified and out-of distribution examples in neural networks. arXiv preprint arXiv:1610.02136 (2016)"},{"key":"18_CR10","doi-asserted-by":"publisher","first-page":"11785","DOI":"10.52202\/068431-0856","volume":"35","author":"E Jones","year":"2022","unstructured":"Jones, E., Steinhardt, J.: Capturing failures of large language models via human cognitive biases. Adv. Neural. Inf. Process. Syst. 35, 11785\u201311799 (2022)","journal-title":"Adv. Neural. Inf. Process. Syst."},{"key":"18_CR11","unstructured":"Kapoor, S., Narayanan, A.: Leakage and the reproducibility crisis in ml-based science (2022). https:\/\/arxiv.org\/abs\/2207.07048"},{"key":"18_CR12","doi-asserted-by":"publisher","DOI":"10.1016\/j.lindif.2023.102274","volume":"103","author":"E Kasneci","year":"2023","unstructured":"Kasneci, E., et al.: ChatGPT for good? On opportunities and challenges of large language models for education. Learn. Individ. Differ. 103, 102274 (2023)","journal-title":"Learn. Individ. Differ."},{"key":"18_CR13","doi-asserted-by":"publisher","first-page":"41451","DOI":"10.52202\/075280-1797","volume":"36","author":"K Li","year":"2023","unstructured":"Li, K., Patel, O., Vi\u00e9gas, F., Pfister, H., Wattenberg, M.: Inference-time intervention: eliciting truthful answers from a language model. Adv. Neural. Inf. Process. Syst. 36, 41451\u201341530 (2023)","journal-title":"Adv. Neural. Inf. Process. Syst."},{"issue":"9","key":"18_CR14","first-page":"1","volume":"55","author":"P Liu","year":"2023","unstructured":"Liu, P., Yuan, W., Fu, J., Jiang, Z., Hayashi, H., Neubig, G.: Pre-train, prompt, and predict: a systematic survey of prompting methods in natural language processing. ACM Comput. Surv. 55(9), 1\u201335 (2023)","journal-title":"ACM Comput. Surv."},{"issue":"1","key":"18_CR15","doi-asserted-by":"publisher","first-page":"169","DOI":"10.18608\/jla.2025.8575","volume":"12","author":"X Liu","year":"2025","unstructured":"Liu, X., et al.: Qualitative coding with GPT-4: where it works better. J. Learn. Anal. 12(1), 169\u2013185 (2025)","journal-title":"J. Learn. Anal."},{"key":"18_CR16","unstructured":"Lubars, B., Tan, C.: Ask not what AI can do, but what AI should do: Towards a framework of task delegability. In: Advances in Neural Information Processing Systems, vol. 32 (2019)"},{"issue":"9","key":"18_CR17","doi-asserted-by":"publisher","first-page":"1315","DOI":"10.1097\/JTO.0b013e3181ec173d","volume":"5","author":"JN Mandrekar","year":"2010","unstructured":"Mandrekar, J.N.: Receiver operating characteristic curve in diagnostic test assessment. J. Thorac. Oncol. 5(9), 1315\u20131316 (2010)","journal-title":"J. Thorac. Oncol."},{"key":"18_CR18","first-page":"15682","volume":"34","author":"M Minderer","year":"2021","unstructured":"Minderer, M., et al.: Revisiting the calibration of modern neural networks. Adv. Neural. Inf. Process. Syst. 34, 15682\u201315694 (2021)","journal-title":"Adv. Neural. Inf. Process. Syst."},{"key":"18_CR19","doi-asserted-by":"publisher","unstructured":"Mithun, P., Noriega-Atala, E., Merchant, N., Skidmore, E.: A gateway for egalitarian access to LLM based resources. In: Cristea, A.I., Walker, E., Lu, Y., Santos, O.C., Isotani, S. (eds.) AIED 2025. CCIS, vol. 2590, pp. 137\u2013146. Springer, Cham (2025). https:\/\/doi.org\/10.1007\/978-3-031-99261-2_13","DOI":"10.1007\/978-3-031-99261-2_13"},{"issue":"3","key":"18_CR20","doi-asserted-by":"publisher","first-page":"91","DOI":"10.1007\/s13347-024-00774-4","volume":"37","author":"H Naeem","year":"2024","unstructured":"Naeem, H., Hauser, J.: Should we discourage AI extension? Epistemic responsibility and AI. Philos. Technol. 37(3), 91 (2024)","journal-title":"Philos. Technol."},{"key":"18_CR21","doi-asserted-by":"crossref","unstructured":"Naeini, M.P., Cooper, G., Hauskrecht, M.: Obtaining well calibrated probabilities using Bayesian binning. In: Proceedings of the AAAI Conference on Artificial Intelligence, vol. 29 (2015)","DOI":"10.1609\/aaai.v29i1.9602"},{"key":"18_CR22","unstructured":"National Academies of Sciences and Medicine and Policy and Global Affairs and Board on Research Data and Division on Engineering and Physical Sciences and Committee on Applied and Theoretical Statistics and Board on Mathematical Sciences and others: Reproducibility and replicability in science. National Academies Press (2019)"},{"issue":"3","key":"18_CR23","doi-asserted-by":"publisher","first-page":"263","DOI":"10.1177\/1477878518805308","volume":"16","author":"JR Reidenberg","year":"2018","unstructured":"Reidenberg, J.R., Schaub, F.: Achieving big data privacy in education. Theory Res. Educ. 16(3), 263\u2013279 (2018)","journal-title":"Theory Res. Educ."},{"key":"18_CR24","unstructured":"Ren, J., Zhao, Y., Vu, T., Liu, P.J., Lakshminarayanan, B.: Self-evaluation improves selective generation in large language models. In: Proceedings on. pp. 49\u201364. PMLR (2023)"},{"key":"18_CR25","doi-asserted-by":"publisher","first-page":"160940692412311","DOI":"10.1177\/16094069241231168","volume":"23","author":"RH Tai","year":"2024","unstructured":"Tai, R.H., et al.: An examination of the use of large language models to aid analysis of textual data. Int. J. Qualit. Meth. 23, 16094069241231168 (2024)","journal-title":"Int. J. Qualit. Meth."},{"key":"18_CR26","doi-asserted-by":"crossref","unstructured":"Tian, K., et al.: Just ask for calibration: strategies for eliciting calibrated confidence scores from language models fine-tuned with human feedback. arXiv preprint arXiv:2305.14975 (2023)","DOI":"10.18653\/v1\/2023.emnlp-main.330"},{"key":"18_CR27","unstructured":"Turner, A.M., et al.: Steering language models with activation engineering. arXiv preprint arXiv:2308.10248 (2023)"},{"issue":"4157","key":"18_CR28","doi-asserted-by":"publisher","first-page":"1124","DOI":"10.1126\/science.185.4157.1124","volume":"185","author":"A Tversky","year":"1974","unstructured":"Tversky, A., Kahneman, D.: Judgment under uncertainty: heuristics and biases: biases in judgments reveal some heuristics of thinking under uncertainty. Science 185(4157), 1124\u20131131 (1974)","journal-title":"Science"},{"key":"18_CR29","doi-asserted-by":"crossref","unstructured":"Venugopalan, D., Yan, Z., Borchers, C., Lin, J., Aleven, V.: Combining large language models with tutoring system intelligence: a case study in caregiver homework support. In: Proceedings of the 15th Int\u2019l Learning Analytics and Knowledge Conference, pp. 373\u2013383 (2025)","DOI":"10.1145\/3706468.3706516"},{"key":"18_CR30","doi-asserted-by":"publisher","first-page":"24824","DOI":"10.52202\/068431-1800","volume":"35","author":"J Wei","year":"2022","unstructured":"Wei, J., et al.: Chain-of-thought prompting elicits reasoning in large language models. Adv. Neural. Inf. Process. Syst. 35, 24824\u201324837 (2022)","journal-title":"Adv. Neural. Inf. Process. Syst."},{"key":"18_CR31","unstructured":"Wolf, T., et al.: Transformers: state-of-the-art natural language processing. In: Proceedings of the 2020 Conference on Empirical Methods in Natural Language Processing: System Demonstrations, pp. 38\u201345 (2020)"},{"key":"18_CR32","unstructured":"Yang, D., Tsai, Y.H.H., Yamada, M.: On verbalized confidence scores for LLMs. arXiv preprint arXiv:2412.14737 (2024)"},{"issue":"1","key":"18_CR33","first-page":"25","volume":"18","author":"AF Zambrano","year":"2026","unstructured":"Zambrano, A.F., et al.: Data plus theory equals codebook: leveraging LLMs for human-AI codebook development. J. Educ. Data Min. 18(1), 25\u201365 (2026)","journal-title":"J. Educ. Data Min."},{"issue":"1","key":"18_CR34","doi-asserted-by":"publisher","first-page":"237","DOI":"10.1162\/coli_a_00502","volume":"50","author":"C Ziems","year":"2024","unstructured":"Ziems, C., Held, W., Shaikh, O., Chen, J., Zhang, Z., Yang, D.: Can large language models transform computational social science? Comput. Linguist. 50(1), 237\u2013291 (2024)","journal-title":"Comput. Linguist."},{"key":"18_CR35","unstructured":"Zou, A., et al.: Representation engineering: a top-down approach to AI transparency. arXiv preprint arXiv:2310.01405 (2023)"}],"container-title":["Lecture Notes in Computer Science","Artificial Intelligence in Education"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-032-29755-6_18","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,6,24]],"date-time":"2026-06-24T15:39:02Z","timestamp":1782315542000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-3-032-29755-6_18"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,6,25]]},"ISBN":["9783032297549","9783032297556"],"references-count":35,"URL":"https:\/\/doi.org\/10.1007\/978-3-032-29755-6_18","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026,6,25]]},"assertion":[{"value":"25 June 2026","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"AIED","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"International Conference on Artificial Intelligence in Education","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Seoul","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Korea (Republic of)","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2026","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"29 June 2026","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"3 July 2026","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"27","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"aied2026","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/www.aied-conference.org\/2026","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}