{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,8,7]],"date-time":"2026-08-07T13:35:16Z","timestamp":1786109716752,"version":"3.56.0"},"reference-count":172,"publisher":"Frontiers Media SA","license":[{"start":{"date-parts":[[2025,1,8]],"date-time":"2025-01-08T00:00:00Z","timestamp":1736294400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/"}],"funder":[{"DOI":"10.13039\/100018693","name":"HORIZON EUROPE Framework Programme","doi-asserted-by":"publisher","id":[{"id":"10.13039\/100018693","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["frontiersin.org"],"crossmark-restriction":true},"short-container-title":["Front. Artif. Intell."],"abstract":"<jats:p>The impressive performance of modern Large Language Models (LLMs) across a wide range of tasks, along with their often non-trivial errors, has garnered unprecedented attention regarding the potential of AI and its impact on everyday life. While considerable effort has been and continues to be dedicated to overcoming the limitations of current models, the potentials and risks of human-LLM collaboration remain largely underexplored. In this perspective, we argue that enhancing the focus on human-LLM interaction should be a primary target for future LLM research. Specifically, we will briefly examine some of the biases that may hinder effective collaboration between humans and machines, explore potential solutions, and discuss two broader goals\u2014mutual understanding and complementary team performance\u2014that, in our view, future research should address to enhance effective human-LLM reasoning and decision-making.<\/jats:p>","DOI":"10.3389\/frai.2024.1464690","type":"journal-article","created":{"date-parts":[[2025,1,8]],"date-time":"2025-01-08T06:27:01Z","timestamp":1736317621000},"update-policy":"https:\/\/doi.org\/10.3389\/crossmark-policy","source":"Crossref","is-referenced-by-count":20,"title":["Fostering effective hybrid human-LLM reasoning and decision making"],"prefix":"10.3389","volume":"7","author":[{"given":"Andrea","family":"Passerini","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Aryo","family":"Gema","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Pasquale","family":"Minervini","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Burcu","family":"Sayin","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Katya","family":"Tentori","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"1965","published-online":{"date-parts":[[2025,1,8]]},"reference":[{"key":"B1","doi-asserted-by":"publisher","first-page":"18","DOI":"10.1109\/MC.2020.2996587","article-title":"A research agenda for hybrid intelligence: augmenting human intellect with collaborative, adaptive, responsible, and explainable artificial intelligence","volume":"53","author":"Akata","year":"2020","journal-title":"Computer"},{"key":"B2","doi-asserted-by":"crossref","first-page":"14","DOI":"10.1109\/5254.796083","article-title":"Mixed-initiative interaction","volume":"14","author":"Allen","year":"1999","journal-title":"IEEE Intell. Syst. Their Appl"},{"key":"B3","doi-asserted-by":"publisher","first-page":"413","DOI":"10.1016\/j.artint.2008.11.006","article-title":"Using arguments for making and explaining decisions","volume":"173","author":"Amgoud","year":"2009","journal-title":"Artif. Intell"},{"key":"B4","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2407.06057","article-title":"Variational best-of-N alignment","author":"Amini","year":"2024","journal-title":"CoRR, abs\/2407.06057"},{"key":"B5","doi-asserted-by":"crossref","DOI":"10.1561\/9781638281597","volume-title":"Conformal Prediction: A Gentle Introduction","author":"Angelopoulos","year":"2023"},{"key":"B6","doi-asserted-by":"publisher","first-page":"356","DOI":"10.1177\/0963721413489988","article-title":"The consequences of the hindsight bias in medical decision making","volume":"22","author":"Arkes","year":"2013","journal-title":"Curr. Direct. Psychol. Sci"},{"key":"B7","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2312.07592","article-title":"Evaluating chatGPT as a question answering system: a comprehensive analysis and comparison with existing models","author":"Bahak","year":"2023","journal-title":"arXiv, abs\/2312.07592"},{"key":"B8","author":"Banerjee","year":"2024","journal-title":"Learning to Guide Human Decision Makers With Vision-Language Models"},{"key":"B9","first-page":"675","article-title":"\u201cA multitask, multilingual, multimodal evaluation of ChatGPT on reasoning, hallucination, and interactivity,\u201d","author":"Bang","year":"2023","journal-title":"Proceedings of the 13th International Joint Conference on Natural Language Processing and the 3rd Conference of the Asia-Pacific Chapter of the Association for Computational Linguistics (Volume 1: Long Papers)"},{"key":"B10","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2006.14779","article-title":"Does the whole exceed its parts? the effect of ai explanations on complementary team performance","author":"Bansal","year":"2021","journal-title":"arXiv, abs\/2006.14779"},{"key":"B11","doi-asserted-by":"crossref","first-page":"1386","DOI":"10.1109\/SMC.2015.246","article-title":"\u201cDesigning for mixed-initiative interactions between human and autonomous systems in complex environments,\u201d","volume-title":"2015 IEEE International Conference on Systems, Man, and Cybernetics","author":"Barnes","year":"2015"},{"key":"B12","doi-asserted-by":"crossref","DOI":"10.1017\/9781009263672","volume-title":"Thinking and Deciding, 5th Edn","author":"Baron","year":"2023"},{"key":"B13","doi-asserted-by":"crossref","first-page":"610","DOI":"10.1145\/3442188.3445922","article-title":"\u201cOn the dangers of stochastic parrots: can language models be too big?\u201d","volume-title":"Proceedings of the 2021 ACM Conference on Fairness, Accountability, and Transparency, FAccT '21","author":"Bender","year":"2021"},{"key":"B14","doi-asserted-by":"crossref","first-page":"5185","DOI":"10.18653\/v1\/2020.acl-main.463","article-title":"\u201cClimbing towards NLU: on meaning, form, and understanding in the age of data,\u201d","author":"Bender","year":"2020","journal-title":"Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics"},{"key":"B15","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2402.01769","article-title":"Redefining \u201challucination\u201d in LLMS: towards a psychology-informed framework for mitigating misinformation","author":"Berberette","year":"2024","journal-title":"arXiv, abs\/2402.01769"},{"key":"B16","first-page":"78","article-title":"\u201cHow cognitive biases affect XAI-assisted decision-making: a systematic review,\u201d","volume-title":"Proceedings of the 2022 AAAI\/ACM Conference on AI, Ethics, and Society, AIES '22","author":"Bertrand","year":"2022"},{"key":"B17","doi-asserted-by":"publisher","first-page":"222","DOI":"10.1016\/j.jet.2016.01.011","article-title":"Informational herding with model misspecification","volume":"163","author":"Bohren","year":"2016","journal-title":"J. Econ. Theor"},{"key":"B18","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1080\/20445911.2023.2181734","article-title":"No easy fix for belief bias during syllogistic reasoning?","volume":"35","author":"Boissin","year":"2023","journal-title":"J. Cogn. Psychol"},{"key":"B19","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2303.12712","article-title":"Sparks of artificial general intelligence: early experiments with GPT-4","author":"Bubeck","year":"2023","journal-title":"arXiv, abs\/2303.12712"},{"key":"B20","doi-asserted-by":"publisher","first-page":"3449287","DOI":"10.1145\/3449287","article-title":"To trust or to think: cognitive forcing functions can reduce overreliance on AI in AI-assisted decision-making","volume":"5","author":"Bu\u00e7inca","year":"2021","journal-title":"Proc. ACM Hum. Comput. Interact"},{"key":"B21","author":"Burns","year":"2023","journal-title":"Discovering Latent Knowledge in Language Models Without Supervision"},{"key":"B22","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2402.07350","article-title":"Antagonistic AI","author":"Cai","year":"2024","journal-title":"ArXiv, abs\/2402.07350"},{"key":"B23","author":"Camburu","year":"2019","journal-title":"Can I Trust the Explainer? Verifying Post-hoc Explanatory Methods"},{"key":"B24","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2206.12390","article-title":"A test for evaluating performance in human-computer systems","author":"Campero","year":"2022","journal-title":"arXiv, abs\/2206.12390"},{"key":"B25","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2307.03109","article-title":"A survey on evaluation of large language models","author":"Chang","year":"2023","journal-title":"arXiv, abs\/2307.03109"},{"key":"B26","doi-asserted-by":"publisher","first-page":"e147","DOI":"10.1017\/s0140525x22002023","article-title":"The I-frame and the S-frame: how focusing on individual-level solutions has led behavioral public policy astray","volume":"46","author":"Chater","year":"2023","journal-title":"Behav. Brain Sci"},{"key":"B27","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2308.16175","article-title":"Quantifying uncertainty in answers from any language model via intrinsic and extrinsic confidence assessment","author":"Chen","year":"2023","journal-title":"arXiv preprint arXiv:2308.16175"},{"key":"B28","first-page":"951","article-title":"\u201cControllable mixed-initiative dialogue generation through prompting,\u201d","author":"Chen","year":"","journal-title":"Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics (Volume 2: Short Papers)"},{"key":"B29","first-page":"8506","article-title":"\u201cLarge language models meet Harry Potter: a dataset for aligning dialogue agents with characters,\u201d","author":"Chen","year":"","journal-title":"Findings of the Association for Computational Linguistics: EMNLP 2023"},{"key":"B30","article-title":"\u201cFrom yes-men to truth-tellers: addressing sycophancy in large language models with pinpoint tuning,\u201d","author":"Chen","year":"2024","journal-title":"Forty-first International Conference on Machine Learning"},{"key":"B31","doi-asserted-by":"crossref","first-page":"2454","DOI":"10.1145\/3630106.3659048","article-title":"\u201c(A)I am not a lawyer, but...: engaging legal experts towards responsible LLM policies for legal advice,\u201d","volume-title":"Proceedings of the 2024 ACM Conference on Fairness, Accountability, and Transparency, FAccT '24","author":"Cheong","year":"2024"},{"key":"B32","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2403.04132","article-title":"Chatbot arena: an open platform for evaluating LLMs by human preference","author":"Chiang","year":"2024","journal-title":"CoRR, abs\/2403.04132"},{"key":"B33","doi-asserted-by":"publisher","first-page":"56764","DOI":"10.2196\/56764","article-title":"Large language models and user trust: consequence of self-referential learning loop and the deskilling of health care professionals","volume":"26","author":"Choudhury","year":"2024","journal-title":"J. Med. Internet Res"},{"key":"B34","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2309.03883","article-title":"DoLa: decoding by contrasting layers improves factuality in large language models","author":"Chuang","year":"2023","journal-title":"CoRR, abs\/2309.03883"},{"key":"B35","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2403.03883","article-title":"SaulLM-7B: a pioneering large language model for law","author":"Colombo","year":"2024","journal-title":"CoRR, abs\/2403.03883"},{"key":"B36","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2401.13744","article-title":"Conformal prediction sets improve human decision making","author":"Cresswell","year":"2024","journal-title":"arXiv, 2401.13744"},{"key":"B37","article-title":"\u201cAutomation bias in intelligent time critical decision support systems,\u201d","author":"Cummings","year":"2012","journal-title":"Collection of Technical Papers\u2014AIAA 1st Intelligent Systems Technical Conference"},{"key":"B38","doi-asserted-by":"publisher","first-page":"637","DOI":"10.1007\/s12599-019-00595-2","article-title":"Hybrid intelligence","volume":"61","author":"Dellermann","year":"2019","journal-title":"Bus. Inform. Syst. Eng"},{"key":"B39","first-page":"11781","article-title":"\u201cReward-augmented decoding: efficient controlled text generation with a unidirectional reward model,\u201d","volume-title":"EMNLP","author":"Deng","year":"2023"},{"key":"B40","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2309.11495","article-title":"Chain-of-verification reduces hallucination in large language models","author":"Dhuliawala","year":"2023","journal-title":"CoRR, abs\/2309.11495"},{"key":"B41","doi-asserted-by":"publisher","first-page":"114","DOI":"10.1037\/xge0000033","article-title":"Algorithm aversion: people erroneously avoid algorithms after seeing them ERR","volume":"144","author":"Dietvorst","year":"2014","journal-title":"J. Exp. Psychol"},{"key":"B42","doi-asserted-by":"crossref","first-page":"1639","DOI":"10.1145\/3531146.3533221","article-title":"\u201cHuman-algorithm collaboration: achieving complementarity and avoiding unfairness,\u201d","volume-title":"Proceedings of the 2022 ACM Conference on Fairness, Accountability, and Transparency, FAccT '22","author":"Donahue","year":"2022"},{"key":"B43","doi-asserted-by":"publisher","first-page":"110","DOI":"10.1145\/3596490","article-title":"Shortcut learning of large language models in natural language understanding","volume":"67","author":"Du","year":"2023","journal-title":"Commun. ACM"},{"key":"B44","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2402.17385","article-title":"Determinants of LLM-assisted decision-making","author":"Eigner","year":"2024","journal-title":"arXiv, abs\/2402.17385"},{"key":"B45","volume-title":"White Paper on Artificial Intelligence: a European Approach to Excellence and Trust. White Paper COM(2020) 65 Final","year":"2020"},{"key":"B46","year":"2021","journal-title":"Proposal for a Regulation Laying Down Harmonised Rules on Artificial Intelligence (Artificial Intelligence Act)"},{"key":"B47","doi-asserted-by":"crossref","first-page":"295","DOI":"10.3758\/BF03196976","article-title":"On the conflict between logic and belief in syllogistic reasoning","volume":"11","author":"Evans","year":"1983","journal-title":"Mem. Cogn"},{"key":"B48","year":"2024","journal-title":"Theory Is All You Need: AI, Human Cognition, and Decision Making"},{"key":"B49","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2405.02079","article-title":"Argumentative large language models for explainable and contestable decision-making","author":"Freedman","year":"2024","journal-title":"arXiv, 2405.02079"},{"key":"B50","doi-asserted-by":"crossref","first-page":"6465","DOI":"10.18653\/v1\/2023.emnlp-main.398","article-title":"\u201cEnabling large language models to generate text with citations,\u201d","author":"Gao","year":"2023","journal-title":"Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing"},{"key":"B51","article-title":"\u201cSelective classification for deep neural networks,\u201d","author":"Geifman","year":"2017","journal-title":"Advances in Neural Information Processing Systems, Vol. 30"},{"key":"B52","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2410.18860","article-title":"DeCoRe: decoding by contrasting retrieval heads to mitigate hallucinations","author":"Gema","year":"2024","journal-title":"arXiv preprint arXiv:2410.18860"},{"key":"B53","unstructured":"Directive on Automated Decision-Making\n          \n          2019"},{"key":"B54","doi-asserted-by":"publisher","first-page":"eaay7120","DOI":"10.1126\/scirobotics.aay7120","article-title":"XAI\u2013explainable artificial intelligence","volume":"4","author":"Gunning","year":"2019","journal-title":"Sci. Robot"},{"key":"B55","first-page":"1321","article-title":"\u201cOn calibration of modern neural networks,\u201d","volume-title":"International Conference on Machine Learning","author":"Guo","year":"2017"},{"key":"B56","doi-asserted-by":"publisher","author":"Gupta","year":"2023","DOI":"10.48550\/arXiv.2312.16549"},{"key":"B57","doi-asserted-by":"publisher","first-page":"4301478","DOI":"10.2139\/ssrn.4301478","article-title":"Hybrid intelligence: a paradigm for more responsible practice","volume":"2022","author":"Guszcza","year":"2022","journal-title":"SSRN Electr. J"},{"key":"B58","doi-asserted-by":"crossref","first-page":"13477","DOI":"10.18653\/v1\/2024.acl-long.728","article-title":"\u201cUsing natural language explanations to improve robustness of in-context learning,\u201d","author":"He","year":"2024","journal-title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)"},{"key":"B59","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2404.00029","article-title":"Complementarity in human-ai collaboration: concept, sources, and evidence","author":"Hemmer","year":"2024","journal-title":"arXiv, abs\/2404.00029"},{"key":"B60","article-title":"\u201cHuman-AI complementarity in hybrid intelligence systems: a structured literature review,\u201d","volume-title":"Pacific Asia Conference on Information Systems","author":"Hemmer","year":"2021"},{"key":"B61","volume-title":"Measuring Massive Multitask Language Understanding","author":"Hendrycks","year":"2021"},{"key":"B62","doi-asserted-by":"crossref","first-page":"291","DOI":"10.4324\/9781003154730-21","article-title":"\u201cOverconfidence,\u201d","volume-title":"Cognitive Illusions: A Handbook on Fallacies and Biases in Thinking, Judgement and Memory, 3 Edn","author":"Hoffrage","year":"2022"},{"key":"B63","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1016\/0010-0285(92)90002-J","article-title":"Order effects in belief updating: the belief-adjustment model","volume":"24","author":"Hogarth","year":"1992","journal-title":"Cogn. Psychol"},{"key":"B64","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2307.02185","article-title":"Citation: a key to building responsible and accountable large language models","author":"Huang","year":"2023","journal-title":"arXiv preprint arXiv:2307.02185"},{"key":"B65","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2311.05232","article-title":"A survey on hallucination in large language models: principles, taxonomy, challenges, and open questions","author":"Huang","year":"2023","journal-title":"arXiv, abs\/2311.05232"},{"key":"B66","article-title":"\u201cHow does conversation length impact user's satisfaction? a case study of length-controlled conversations with LLM-powered chatbots,\u201d","author":"Huang","year":"2024","journal-title":"Extended Abstracts of the CHI Conference on Human Factors in Computing Systems, CHI EA '24"},{"key":"B67","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2312.06674","article-title":"Llama guard: LLM-based input-output safeguard for human-ai conversations","author":"Inan","year":"2023","journal-title":"arXiv preprint arXiv:2312.06674"},{"key":"B68","doi-asserted-by":"publisher","DOI":"10.1007\/s00330-023-10213-1","article-title":"ChatGPT makes medicine easy to swallow: an exploratory case study on simplified radiology reports","author":"Jeblick","year":"2022","journal-title":"arXiv, abs\/2212.14882"},{"key":"B69","doi-asserted-by":"publisher","first-page":"248","DOI":"10.1145\/3571730","article-title":"Survey of hallucination in natural language generation","volume":"55","author":"Ji","year":"","journal-title":"ACM Comput. Surv"},{"key":"B70","first-page":"1827","article-title":"\u201cTowards mitigating LLM hallucination via self reflection,\u201d","volume-title":"EMNLP (Findings)","author":"Ji","year":""},{"key":"B71","author":"Jiao","year":"2023","journal-title":"Is ChatGPT a Good Translator? Yes With GPT-4 as the Engine"},{"key":"B72","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2402.14409","article-title":"Tug-of-war between knowledge: exploring and resolving knowledge conflicts in retrieval-augmented language models","author":"Jin","year":"2024","journal-title":"arXiv preprint arXiv:2402.14409"},{"key":"B73","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2411.02478","article-title":"Imagining and building wise machines: the centrality of AI metacognition","author":"Johnson","year":"2024","journal-title":"arXiv, 2411.02478"},{"key":"B74","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2207.05221","article-title":"Language models (mostly) know what they know","author":"Kadavath","year":"2022","journal-title":"arXiv preprint arXiv:2207.05221"},{"key":"B75","doi-asserted-by":"publisher","first-page":"94","DOI":"10.1016\/j.ijhcs.2015.07.001","article-title":"Benefits of visualization in the mammography problem","volume":"83","author":"Khan","year":"2015","journal-title":"Int. J. Hum. Comput. Stud"},{"key":"B76","doi-asserted-by":"publisher","first-page":"67","DOI":"10.1109\/MIS.2017.4531230","article-title":"Why expertise matters: a response to the challenges","volume":"32","author":"Klein","year":"2017","journal-title":"IEEE Intell. Syst"},{"key":"B77","author":"Kosinski","year":"2024","journal-title":"Evaluating Large Language Models in Theory of Mind Tasks"},{"key":"B78","article-title":"\u201cSemantic uncertainty: linguistic invariances for uncertainty estimation in natural language generation,\u201d","author":"Kuhn","year":"2023","journal-title":"The Eleventh International Conference on Learning Representations, ICLR 2023, Kigali, Rwanda, May 1\u20135, 2023"},{"key":"B79","unstructured":"Lawrence\n              C.\n            \n          \n          Human-centric AI: A Road Map to Human-AI Collaboration\n          \n          2024"},{"key":"B80","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2206.04624","article-title":"Factuality enhanced language models for open-ended text generation","author":"Lee","year":"2022","journal-title":"CoRR, abs\/2206.04624"},{"key":"B81","doi-asserted-by":"publisher","DOI":"10.5964\/bioling.14391","article-title":"Evaluating the language abilities of large language models vs. humans: three caveats","author":"Leivada","year":"2024","journal-title":"Biolinguistics"},{"key":"B82","volume-title":"Distributional Semantics. Studies in Natural Language Processing","author":"Lenci","year":"2023"},{"key":"B83","doi-asserted-by":"publisher","first-page":"9459","DOI":"10.48550\/arXiv.2005.11401","article-title":"Retrieval-augmented generation for knowledge-intensive NLP tasks","volume":"33","author":"Lewis","year":"2020","journal-title":"Adv. Neural Inform. Process. Syst"},{"key":"B84","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2306.03341","article-title":"Inference-time intervention: eliciting truthful answers from a language model","author":"Li","year":"","journal-title":"arXiv, abs\/2306.03341"},{"key":"B85","doi-asserted-by":"crossref","first-page":"6354","DOI":"10.18653\/v1\/2023.emnlp-main.392","article-title":"\u201cMoT: Memory-of-thought enables ChatGPT to self-improve,\u201d","author":"Li","year":"2023","journal-title":"Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing"},{"key":"B86","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2307.00360","article-title":"BatGPT: a bidirectional autoregessive talker from generative pre-trained transformer","author":"Li","year":"","journal-title":"arXiv, 2307.00360"},{"key":"B87","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2211.09110","article-title":"Holistic evaluation of language models","author":"Liang","year":"2022","journal-title":"CoRR, abs\/2211.09110"},{"key":"B88","doi-asserted-by":"crossref","unstructured":"Liao\n              Q. V.\n            \n            \n              Wortman Vaughan\n              J.\n            \n          \n          AI Transparency in the Age of LLMs: A Human-Centered Research Roadmap\n          \n          2024","DOI":"10.1162\/99608f92.8036d03b"},{"key":"B89","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2205.14334","article-title":"Teaching models to express their uncertainty in words","author":"Lin","year":"","journal-title":"arXiv preprint arXiv:2205.14334"},{"key":"B90","first-page":"3214","article-title":"\u201cTruthfulQA: measuring how models mimic human falsehoods,\u201d","author":"Lin","year":"","journal-title":"Proceedings of the 60th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)"},{"key":"B91","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2305.19187","article-title":"Generating with confidence: uncertainty quantification for black-box large language models","author":"Lin","year":"2023","journal-title":"arXiv preprint arXiv:2305.19187"},{"key":"B92","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2306.00946","article-title":"Exposing attention glitches with flip-flop language modeling","author":"Liu","year":"","journal-title":"arXiv, 2306.00946"},{"key":"B93","doi-asserted-by":"publisher","first-page":"157","DOI":"10.1162\/tacl_a_00638","article-title":"Lost in the middle: how language models use long contexts","volume":"12","author":"Liu","year":"2024","journal-title":"Trans. Assoc. Comput. Linguist"},{"key":"B94","doi-asserted-by":"publisher","first-page":"100017","DOI":"10.1016\/j.metrad.2023.100017","article-title":"Summary of chatGPT-related research and perspective towards the future of large language models","volume":"1","author":"Liu","year":"","journal-title":"Meta-Radiology"},{"key":"B95","doi-asserted-by":"publisher","first-page":"102301","DOI":"10.1016\/j.inffus.2024.102301","article-title":"Explainable artificial intelligence (XAI) 2.0: a manifesto of open challenges and interdisciplinary research directions","volume":"106","author":"Longo","year":"2024","journal-title":"Inform. Fus"},{"key":"B96","first-page":"6863","article-title":"\u201cInference-time policy adapters (IPA): tailoring extreme-scale LMS without fine-tuning,\u201d","volume-title":"EMNLP","author":"Lu","year":"2023"},{"key":"B97","first-page":"780","article-title":"\u201cNeurologic a*esque decoding: Constrained text generation with lookahead heuristics,\u201d","volume-title":"NAACL-HLT","author":"Lu","year":"2022"},{"key":"B98","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2403.16812","article-title":"Towards human-AI deliberation: Design and evaluation of LLM-empowered deliberative AI for AI-assisted decision-making","author":"Ma","year":"2024","journal-title":"arXiv, 2403.16812"},{"key":"B99","first-page":"6150","article-title":"\u201cPredict responsibly: improving fairness and accuracy by learning to defer,\u201d","volume-title":"Proceedings of the 32nd International Conference on Neural Information Processing Systems, NIPS'18","author":"Madras","year":"2018"},{"key":"B100","doi-asserted-by":"publisher","first-page":"517","DOI":"10.1016\/j.tics.2024.01.011","article-title":"Dissociating language and thought in large language models","volume":"28","author":"Mahowald","year":"2024","journal-title":"Trends Cogn. Sci"},{"key":"B101","doi-asserted-by":"crossref","first-page":"9004","DOI":"10.18653\/v1\/2023.emnlp-main.557","article-title":"\u201cSelfCheckGPT: zero-resource black-box hallucination detection for generative large language models,\u201d","author":"Manakul","year":"2023","journal-title":"Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing"},{"key":"B102","first-page":"4102","article-title":"\u201cDo prompt positions really matter?\u201d","author":"Mao","year":"2024","journal-title":"Findings of the Association for Computational Linguistics: NAACL 2024"},{"key":"B103","doi-asserted-by":"publisher","first-page":"941","DOI":"10.3758\/MC.38.7.941","article-title":"Broadening the study of inductive reasoning: confirmation judgments with uncertain evidence","volume":"38","author":"Mastropasqua","year":"2010","journal-title":"Mem. Cogn"},{"key":"B104","first-page":"1906","article-title":"\u201cOn faithfulness and factuality in abstractive summarization,\u201d","author":"Maynez","year":"2020","journal-title":"ACL"},{"key":"B105","doi-asserted-by":"publisher","first-page":"1456098","DOI":"10.3389\/fcomp.2024.1456098","article-title":"Users do not trust recommendations from a large language model more than AI-sourced snippets","volume":"6","author":"McGrath","year":"2024","journal-title":"Front. Comput. Sci"},{"key":"B106","doi-asserted-by":"publisher","first-page":"857","DOI":"10.1162\/tacl_a_00494","article-title":"Reducing conversational agents' overconfidence through linguistic calibration","volume":"10","author":"Mielke","year":"2022","journal-title":"Trans. Assoc. Comput. Linguist"},{"key":"B107","doi-asserted-by":"crossref","first-page":"429","DOI":"10.1093\/oxfordhb\/9780198795872.013.19","article-title":"\u201cIncident-based methods for studying expertise,\u201d","volume-title":"The Oxford Handbook of Expertise","author":"Militello","year":"2019"},{"key":"B108","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1016\/j.artint.2018.07.007","article-title":"Explanation in artificial intelligence: insights from the social sciences","volume":"267","author":"Miller","year":"2018","journal-title":"Artif. Intell"},{"key":"B109","doi-asserted-by":"crossref","first-page":"12076","DOI":"10.18653\/v1\/2023.emnlp-main.741","article-title":"\u201cFActScore: fine-grained atomic evaluation of factual precision in long form text generation,\u201d","author":"Min","year":"2023","journal-title":"Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing"},{"key":"B110","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2401.06855","article-title":"Fine-grained hallucination detection and editing for language models","author":"Mishra","year":"2024","journal-title":"arXiv, abs\/2401.06855"},{"key":"B111","volume-title":"Relative Representations Enable Zero-Shot Latent Space Communication","author":"Moschella","year":"2023"},{"key":"B112","doi-asserted-by":"crossref","first-page":"175","DOI":"10.1037\/1089-2680.2.2.175","article-title":"Confirmation bias: a ubiquitous phenomenon in many guises","volume":"2","author":"Nickerson","year":"1998","journal-title":"Rev. Gen. Psychol"},{"key":"B113","author":"Panickssery","year":"2024","journal-title":"Steering Llama 2 via Contrastive Activation Addition"},{"key":"B114","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2308.14752","article-title":"AI deception: a survey of examples, risks, and potential solutions","author":"Park","year":"2023","journal-title":"arXiv, abs\/2308.14752"},{"key":"B115","first-page":"75","volume-title":"Expertise and Tacit Knowledge in Medicine. Tacit Knowledge in Professional Practice","author":"Patel","year":"1999"},{"key":"B116","first-page":"2523","article-title":"\u201cKILT: a benchmark for knowledge intensive language tasks,\u201d","author":"Petroni","year":"2021","journal-title":"NAACL-HLT"},{"key":"B117","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2308.11483","article-title":"Large language models sensitivity to the order of options in multiple-choice questions","author":"Pezeshkpour","year":"2023","journal-title":"CoRR, abs\/2308.11483"},{"key":"B118","doi-asserted-by":"crossref","first-page":"515","DOI":"10.1017\/S0140525X00076512","article-title":"Does the chimpanzee have a theory of mind?","volume":"1","author":"Premack","year":"1978","journal-title":"Behav. Brain Sci"},{"key":"B119","first-page":"1","article-title":"\u201cChatGPT vs. human-authored text: insights into controllable text summarization and sentence style transfer,\u201d","author":"Pu","year":"2023","journal-title":"Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics (Volume 4: Student Research Workshop)"},{"key":"B120","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2306.10193","article-title":"Conformal language modeling","author":"Quach","year":"2024","journal-title":"arXiv, abs\/2306.10193"},{"key":"B121","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2311.09410","article-title":"When large language models contradict humans? large language models' sycophantic behaviour","author":"Ranaldi","year":"2023","journal-title":"arXiv, abs\/2311.09410"},{"key":"B122","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2309.05922","article-title":"A survey of hallucination in large foundation models","author":"Rawte","year":"2023","journal-title":"CoRR, abs\/2309.05922"},{"key":"B123","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2310.10501","article-title":"NeMo guardrails: a toolkit for controllable and safe LLM applications with programmable rails","author":"Rebedea","year":"2023","journal-title":"arXiv preprint arXiv:2310.10501"},{"key":"B124","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2406.03827","article-title":"Chaos with keywords: exposing large language models sycophancy to misleading keywords and evaluating defense strategies","author":"Rrv","year":"2024","journal-title":"arXiv, abs\/2406.03827"},{"key":"B125","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2404.18416","article-title":"Capabilities of gemini models in medicine","author":"Saab","year":"2024","journal-title":"arXiv preprint arXiv:2404.18416"},{"key":"B126","doi-asserted-by":"crossref","first-page":"218","DOI":"10.18653\/v1\/2024.clinicalnlp-1.19","article-title":"\u201cCan LLMs correct physicians, yet? Investigating effective interaction methods in the medical domain,\u201d","volume-title":"Proceedings of the 6th Clinical Natural Language Processing Workshop","author":"Sayin","year":"2024"},{"key":"B127","doi-asserted-by":"publisher","first-page":"366","DOI":"10.3233\/FAIA230100","article-title":"Value-based hybrid intelligence","volume":"368","author":"Sayin","year":"2023","journal-title":"Front. Artif. Intell. Appl"},{"key":"B128","author":"Schuurmans","year":"2023","journal-title":"Memory Augmented Large Language Models Are Computationally Universal"},{"key":"B129","author":"Sharma","year":"2024","journal-title":"Why Would You Suggest That? Human Trust in Language Model Responses"},{"key":"B130","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2310.13548","article-title":"Towards understanding sycophancy in language models","author":"Sharma","year":"2023","journal-title":"arXiv, abs\/2310.13548"},{"key":"B131","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2309.15025","article-title":"Large language model alignment: a survey","author":"Shen","year":"2023","journal-title":"arXiv, 2309.15025"},{"key":"B132","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2305.14739","article-title":"Trusting your evidence: hallucinate less with context-aware decoding","author":"Shi","year":"2023","journal-title":"arXiv, abs\/2305.14739"},{"key":"B133","first-page":"3784","article-title":"\u201cRetrieval augmentation reduces hallucination in conversation,\u201d","author":"Shuster","year":"2021","journal-title":"Findings of the Association for Computational Linguistics: EMNLP 2021"},{"key":"B134","doi-asserted-by":"publisher","first-page":"1882","DOI":"10.1038\/s41562-024-01882-z","article-title":"Testing theory of mind in large language models and humans","volume":"24","author":"Strachan","year":"2024","journal-title":"Nat. Hum. Behav"},{"key":"B135","article-title":"\u201cImproving expert predictions with conformal prediction,\u201d","volume-title":"Proceedings of the 40th International Conference on Machine Learning, ICML'23","author":"Straitouri","year":"2023"},{"key":"B136","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2403.06448","article-title":"Unsupervised real-time hallucination detection based on the internal states of large language models","author":"Su","year":"2024","journal-title":"arXiv, abs\/2403.06448"},{"key":"B137","author":"Sun","year":"2024","journal-title":"A Survey of Reasoning With Foundation Models"},{"key":"B138","doi-asserted-by":"publisher","first-page":"1279","DOI":"10.1126\/science.1192788","article-title":"How to grow a mind: atatistics, structure, and abstraction","volume":"331","author":"Tenenbaum","year":"2011","journal-title":"Science"},{"key":"B139","doi-asserted-by":"publisher","first-page":"758","DOI":"10.1111\/cogs.12259","article-title":"Judging the probability of hypotheses versus the impact of evidence: which form of inductive inference is more accurate and time-consistent?","volume":"40","author":"Tentori","year":"2016","journal-title":"Cogn. Sci"},{"key":"B140","doi-asserted-by":"crossref","first-page":"239","DOI":"10.1145\/3306618.3314293","article-title":"\u201cExplanatory interactive machine learning,\u201d","volume-title":"Proceedings of the 2019 AAAI\/ACM Conference on AI, Ethics, and Society, AIES '19","author":"Teso","year":"2019"},{"key":"B141","doi-asserted-by":"publisher","first-page":"eadq2852","DOI":"10.1126\/science.adq2852","article-title":"AI can help humans find common ground in democratic deliberation","volume":"386","author":"Tessler","year":"2024","journal-title":"Science"},{"key":"B142","doi-asserted-by":"publisher","first-page":"401","DOI":"10.1007\/s10602-008-9056-2","article-title":"Nudge: improving decisions about health, wealth, and happiness","volume":"35","author":"Thaler","year":"2009","journal-title":"J. Cogn. Psychol"},{"key":"B143","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.1910.08684","article-title":"Sticking to the facts: confident decoding for faithful data-to-text generation","author":"Tian","year":"2019","journal-title":"CoRR, abs\/1910.08684"},{"key":"B144","doi-asserted-by":"crossref","first-page":"1124","DOI":"10.1126\/science.185.4157.1124","article-title":"Judgment under uncertainty: heuristics and biases","volume":"185","author":"Tversky","year":"1974","journal-title":"Science"},{"key":"B145","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2401.16638","article-title":"Breaking free transformer models: task-specific context attribution promises improved generalizability without fine-tuning pre-trained LLMs","author":"Tytarenko","year":"2024","journal-title":"arXiv, abs\/2401.16638"},{"key":"B146","first-page":"5956","article-title":"\u201cMutual information alleviates hallucinations in abstractive summarization,\u201d","author":"van der Poel","year":"2022","journal-title":"EMNLP"},{"key":"B147","doi-asserted-by":"crossref","first-page":"389","DOI":"10.18653\/v1\/2023.conll-1.25","article-title":"\u201cTheory of mind in large language models: Examining performance of 11 state-of-the-art models vs. children aged 7\u201310 on advanced tests,\u201d","author":"van Duijn","year":"2023","journal-title":"Proceedings of the 27th Conference on Computational Natural Language Learning (CoNLL)"},{"key":"B148","doi-asserted-by":"crossref","first-page":"221","DOI":"10.18653\/v1\/2022.repl4nlp-1.23","article-title":"\u201cTowards improving selective prediction ability of NLP systems,\u201d","author":"Varshney","year":"2022","journal-title":"Proceedings of the 7th Workshop on Representation Learning for NLP"},{"key":"B149","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2401.06766","article-title":"Mind your format: towards consistent evaluation of in-context learning improvements","author":"Voronov","year":"2024","journal-title":"CoRR, abs\/2401.06766"},{"key":"B150","first-page":"2856","article-title":"\u201cFaithfulness-aware decoding strategies for abstractive summarization,\u201d","author":"Wan","year":"2023","journal-title":"EACL"},{"key":"B151","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2401.08329","article-title":"Understanding user experience in large language model interactions","author":"Wang","year":"2024","journal-title":"arXiv, abs\/2401.08329"},{"key":"B152","first-page":"5546","article-title":"\u201cSCOTT: self-consistent chain-of-thought distillation,\u201d","author":"Wang","year":"","journal-title":"ACL (1)"},{"key":"B153","article-title":"\u201cSelf-consistency improves chain of thought reasoning in language models,\u201d","volume-title":"The Eleventh International Conference on Learning Representations, ICLR 2023, Kigali, Rwanda, May 1\u20135, 2023","author":"Wang","year":""},{"key":"B154","author":"Wang","year":"","journal-title":"Aligning Large Language Models With Human: A Survey"},{"key":"B155","doi-asserted-by":"publisher","author":"Watson","year":"2024","DOI":"10.48550\/arXiv.2404.12535"},{"key":"B156","doi-asserted-by":"publisher","DOI":"10.3389\/fdata.2023.1224976","article-title":"Universal skepticism of chatgpt: a review of early literature on chat generative pre-trained transformer","author":"Watters","year":"2023","journal-title":"Front. Big Data"},{"key":"B157","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2308.03958","article-title":"Simple synthetic data reduces sycophancy in large language models","author":"Wei","year":"2023","journal-title":"arXiv, abs\/2308.03958"},{"key":"B158","article-title":"\u201cLearning to complement humans,\u201d","volume-title":"Proceedings of the Twenty-Ninth International Joint Conference on Artificial Intelligence, IJCAI'20","author":"Wilder","year":"2021"},{"key":"B159","first-page":"33469","article-title":"\u201cPIXIU: a comprehensive benchmark, instruction dataset and large language model for finance,\u201d","author":"Xie","year":"2023","journal-title":"Advances in Neural Information Processing Systems, Volume 36"},{"key":"B160","first-page":"1040","article-title":"\u201cThe art of abstention: selective prediction and error regularization for natural language processing,\u201d","author":"Xin","year":"2021","journal-title":"Proceedings of the 59th Annual Meeting of the Association for Computational Linguistics and the 11th International Joint Conference on Natural Language Processing (Volume 1: Long Papers)"},{"key":"B161","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2402.13178","article-title":"Benchmarking retrieval-augmented generation for medicine","author":"Xiong","year":"2024","journal-title":"arXiv preprint arXiv:2402.13178"},{"key":"B162","article-title":"\u201cCan LLMs express their uncertainty? an empirical evaluation of confidence elicitation in LLMs,\u201d","author":"Xiong","year":"2024","journal-title":"The Twelfth International Conference on Learning Representations"},{"key":"B163","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2403.08319","article-title":"Knowledge conflicts for LLMs: a survey","author":"Xu","year":"","journal-title":"arXiv preprint arXiv:2403.08319"},{"key":"B164","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2401.11817","article-title":"Hallucination is inevitable: an innate limitation of large language models","author":"Xu","year":"","journal-title":"arXiv"},{"key":"B165","doi-asserted-by":"publisher","first-page":"3649506","DOI":"10.1145\/3649506","article-title":"Harnessing the power of LLMs in practice: a survey on chatGPT and beyond","volume":"18","author":"Yang","year":"2024","journal-title":"ACM Trans. Knowl. Discov. Data"},{"key":"B166","doi-asserted-by":"publisher","first-page":"AIoa2300068","DOI":"10.1056\/AIoa2300068","article-title":"Almanac\u2013retrieval-augmented language models for clinical medicine","volume":"1","author":"Zakka","year":"2024","journal-title":"NEJM AI"},{"key":"B167","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2309.01219","article-title":"Siren's song in the AI ocean: a survey on hallucination in large language models","author":"Zhang","year":"2023","journal-title":"CoRR, abs\/2309.01219"},{"key":"B168","doi-asserted-by":"publisher","first-page":"3639372","DOI":"10.1145\/3639372","article-title":"Explainability for large language models: a survey","volume":"15","author":"Zhao","year":"","journal-title":"ACM Trans. Intell. Syst. Technol"},{"key":"B169","doi-asserted-by":"crossref","first-page":"5823","DOI":"10.18653\/v1\/2023.acl-long.320","article-title":"\u201cVerify-and-edit: a knowledge-enhanced chain-of-thought framework,\u201d","author":"Zhao","year":"2023","journal-title":"Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)"},{"key":"B170","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2410.15999","article-title":"Steering knowledge selection behaviours in LLMs via sae-based representation engineering","author":"Zhao","year":"","journal-title":"arXiv preprint arXiv:2410.15999"},{"key":"B171","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2403.14221","article-title":"Improving the robustness of large language models via consistency alignment","author":"Zhao","year":"","journal-title":"arXiv, abs\/2403.14221"},{"key":"B172","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2309.17249","article-title":"Batch calibration: rethinking calibration for in-context learning and prompt engineering","author":"Zhou","year":"2024","journal-title":"arXiv, abs\/2309.17249"}],"container-title":["Frontiers in Artificial Intelligence"],"original-title":[],"link":[{"URL":"https:\/\/www.frontiersin.org\/articles\/10.3389\/frai.2024.1464690\/full","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,1,8]],"date-time":"2025-01-08T06:27:48Z","timestamp":1736317668000},"score":1,"resource":{"primary":{"URL":"https:\/\/www.frontiersin.org\/articles\/10.3389\/frai.2024.1464690\/full"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,1,8]]},"references-count":172,"alternative-id":["10.3389\/frai.2024.1464690"],"URL":"https:\/\/doi.org\/10.3389\/frai.2024.1464690","relation":{},"ISSN":["2624-8212"],"issn-type":[{"value":"2624-8212","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,1,8]]},"article-number":"1464690"}}