{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,8,19]],"date-time":"2026-08-19T20:16:52Z","timestamp":1787170612660,"version":"3.56.0"},"reference-count":29,"publisher":"Springer Science and Business Media LLC","issue":"1","license":[{"start":{"date-parts":[[2024,10,21]],"date-time":"2024-10-21T00:00:00Z","timestamp":1729468800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0"},{"start":{"date-parts":[[2024,10,21]],"date-time":"2024-10-21T00:00:00Z","timestamp":1729468800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0"}],"funder":[{"DOI":"10.13039\/100000001","name":"National Science Foundation","doi-asserted-by":"publisher","award":["2139757"],"award-info":[{"award-number":["2139757"]}],"id":[{"id":"10.13039\/100000001","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100000001","name":"National Science Foundation","doi-asserted-by":"publisher","award":["2139757"],"award-info":[{"award-number":["2139757"]}],"id":[{"id":"10.13039\/100000001","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100000049","name":"U.S. Department of Health & Human Services | NIH | National Institute on Aging","doi-asserted-by":"publisher","award":["P30AG073104"],"award-info":[{"award-number":["P30AG073104"]}],"id":[{"id":"10.13039\/100000049","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["npj Digit. Med."],"abstract":"<jats:title>Abstract<\/jats:title>\n                  <jats:p>Increasing interest in applying large language models (LLMs) to medicine is due in part to their impressive performance on medical exam questions. However, these exams do not capture the complexity of real patient\u2013doctor interactions because of factors like patient compliance, experience, and cognitive bias. We hypothesized that LLMs would produce less accurate responses when faced with clinically biased questions as compared to unbiased ones. To test this, we developed the BiasMedQA dataset, which consists of 1273 USMLE questions modified to replicate common clinically relevant cognitive biases. We assessed six LLMs on BiasMedQA and found that GPT-4 stood out for its resilience to bias, in contrast to Llama 2 70B-chat and PMC Llama 13B, which showed large drops in performance. Additionally, we introduced three bias mitigation strategies, which improved but did not fully restore accuracy. Our findings highlight the need to improve LLMs\u2019 robustness to cognitive biases, in order to achieve more reliable applications of LLMs in healthcare.<\/jats:p>","DOI":"10.1038\/s41746-024-01283-6","type":"journal-article","created":{"date-parts":[[2024,10,21]],"date-time":"2024-10-21T11:02:50Z","timestamp":1729508570000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":65,"title":["Evaluation and mitigation of cognitive biases in medical language models"],"prefix":"10.1038","volume":"7","author":[{"given":"Samuel","family":"Schmidgall","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Carl","family":"Harris","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Ime","family":"Essien","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Daniel","family":"Olshvang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Tawsifur","family":"Rahman","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Ji Woong","family":"Kim","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Rojin","family":"Ziaei","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jason","family":"Eshraghian","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Peter","family":"Abadir","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Rama","family":"Chellappa","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2024,10,21]]},"reference":[{"key":"1283_CR1","first-page":"39","volume":"39","author":"C Andel","year":"2012","unstructured":"Andel, C., Davidow, S. L., Hollander, M. & Moreno, D. A. The economics of health care quality and medical errors. J. Health Care Financ. 39, 39 (2012).","journal-title":"J. Health Care Financ."},{"key":"1283_CR2","first-page":"78","volume":"6","author":"MEH Hammond","year":"2021","unstructured":"Hammond, M. E. H., Stehlik, J., Drakos, S. G. & Kfoury, A. G. Bias in medicine: lessons learned and mitigation strategies. Basic Transl. Sci. 6, 78\u201385 (2021).","journal-title":"Basic Transl. Sci."},{"key":"1283_CR3","unstructured":"Zhang, J. et al. The potential and pitfalls of using a large language model such as ChatGPT or GPT-4 as a clinical assistant. Preprint at https:\/\/arxiv.org\/abs\/2307.08152 (2023)."},{"key":"1283_CR4","doi-asserted-by":"publisher","first-page":"479","DOI":"10.1002\/art.42737","volume":"76","author":"C Ye","year":"2023","unstructured":"Ye, C., Zweck, E., Ma, Z., Smith, J. & Katz, S. Doctor Versus Artificial Intelligence: Patient and Physician Evaluation of Large Language Model Responses to Rheumatology Patient Questions in a Cross\u2010Sectional Study. Arthritis Rheumatol. 76, 479\u2013484 (2023).","journal-title":"Arthritis Rheumatol."},{"key":"1283_CR5","unstructured":"Nori, H. et al. Can generalist foundation models outcompete special-purpose tuning? Case study in medicine. Preprint at https:\/\/arxiv.org\/abs\/2311.16452 (2023)."},{"key":"1283_CR6","unstructured":"Organization, W. H. et al. Health Workforce Requirements for Universal Health Coverage and the Sustainable Development Goals (World Health Organization, 2016)."},{"key":"1283_CR7","first-page":"5","volume":"15","author":"M Karabacak","year":"2023","unstructured":"Karabacak, M. & Margetis, K. Embracing large language models for medical applications: opportunities and challenges. Cureus 15, 5 (2023).","journal-title":"Cureus"},{"key":"1283_CR8","doi-asserted-by":"publisher","DOI":"10.1038\/s41746-023-00939-z","volume":"6","author":"JA Omiye","year":"2023","unstructured":"Omiye, J. A., Lester, J. C., Spichak, S., Rotemberg, V. & Daneshjou, R. Large language models propagate race-based medicine. NPJ Digit. Med. 6, 195 (2023).","journal-title":"NPJ Digit. Med."},{"key":"1283_CR9","doi-asserted-by":"publisher","first-page":"e12","DOI":"10.1016\/S2589-7500(23)00225-X","volume":"6","author":"T Zack","year":"2024","unstructured":"Zack, T. et al. Assessing the potential of GPT-4 to perpetuate racial and gender biases in health care: a model evaluation study. Lancet Digit. Health 6, e12\u2013e22 (2024).","journal-title":"Lancet Digit. Health"},{"key":"1283_CR10","doi-asserted-by":"publisher","first-page":"6421","DOI":"10.3390\/app11146421","volume":"11","author":"D Jin","year":"2021","unstructured":"Jin, D. et al. What disease does this patient have? A large-scale open domain question answering dataset from medical exams. Appl. Sci. 11, 6421 (2021).","journal-title":"Appl. Sci."},{"key":"1283_CR11","unstructured":"Chen, Z. et al. Meditron-70b: scaling medical pretraining for large language models. Preprint at https:\/\/arxiv.org\/abs\/2311.16079 (2023)."},{"key":"1283_CR12","doi-asserted-by":"publisher","first-page":"40","DOI":"10.7861\/fhj.2020-0233","volume":"8","author":"DP Gopal","year":"2021","unstructured":"Gopal, D. P., Chetty, U., O\u2019Donnell, P., Gajria, C. & Blackadder-Weinstein, J. Implicit bias in healthcare: clinical practice, research and decision making. Future Healthc. J. 8, 40 (2021).","journal-title":"Future Healthc. J."},{"key":"1283_CR13","unstructured":"Ziaei, R. & Schmidgall, S. Language models are susceptible to incorrect patient self-diagnosis in medical applications. In Deep Generative Models for Health Workshop NeurIPS 2023 (2023)."},{"key":"1283_CR14","unstructured":"OpenAI et al. Gpt-4 technical report. Preprint at https:\/\/arxiv.org\/abs\/2303.08774 (2023)."},{"key":"1283_CR15","unstructured":"Jiang, A. Q. et al. Mixtral of experts. Preprint at https:\/\/arxiv.org\/abs\/2401.04088 (2024)."},{"key":"1283_CR16","first-page":"430","volume":"4","author":"P Barham","year":"2022","unstructured":"Barham, P. et al. Pathways: asynchronous distributed dataflow for ML. Proc. Mach. Learn. Syst. 4, 430\u2013449 (2022).","journal-title":"Proc. Mach. Learn. Syst."},{"key":"1283_CR17","unstructured":"Touvron, H. et al. Llama: open and efficient foundation language models. Preprint at https:\/\/arxiv.org\/abs\/2302.13971 (2023)."},{"key":"1283_CR18","doi-asserted-by":"publisher","first-page":"1833","DOI":"10.1093\/jamia\/ocae045","volume":"31","author":"C Wu","year":"2024","unstructured":"Wu, C. et al. PMC-LLaMA: toward building open-source language models for medicine. J Am Med Inform Assoc. 31, 1833\u20131843 (2024).","journal-title":"J Am Med Inform Assoc."},{"key":"1283_CR19","doi-asserted-by":"publisher","first-page":"1930","DOI":"10.1038\/s41591-023-02448-8","volume":"29","author":"AJ Thirunavukarasu","year":"2023","unstructured":"Thirunavukarasu, A. J. et al. Large language models in medicine. Nat. Med. 29, 1930\u20131940 (2023).","journal-title":"Nat. Med."},{"key":"1283_CR20","doi-asserted-by":"publisher","first-page":"100943","DOI":"10.1016\/j.patter.2024.100943","volume":"5","author":"V Li\u00e9vin","year":"2022","unstructured":"Li\u00e9vin, V., Hother, C. E., Winther, O. & Motzfeldt, A. G. Can large language models reason about medical questions? Patterns 5, 100943 (2022).","journal-title":"Patterns"},{"key":"1283_CR21","unstructured":"Barnard, F., Van Sittert, M. & Rambhatla, S. Self-diagnosis and large language models: A new front for medical misinformation. Preprint at https:\/\/arxiv.org\/abs\/2307.04910 (2023)."},{"key":"1283_CR22","doi-asserted-by":"publisher","first-page":"104512","DOI":"10.1016\/j.ebiom.2023.104512","volume":"90","author":"S Harrer","year":"2023","unstructured":"Harrer, S. Attention is not all you need: the complicated case of ethically using large language models in healthcare and medicine. EBioMedicine 90, 104512 (2023).","journal-title":"EBioMedicine"},{"key":"1283_CR23","doi-asserted-by":"publisher","DOI":"10.1038\/s41746-023-00913-9","volume":"6","author":"MD Abr\u00e0moff","year":"2023","unstructured":"Abr\u00e0moff, M. D. et al. Considerations for addressing bias in artificial intelligence for health equity. NPJ Digit. Med. 6, 170 (2023).","journal-title":"NPJ Digit. Med."},{"key":"1283_CR24","doi-asserted-by":"publisher","DOI":"10.1038\/s41746-023-00858-z","volume":"6","author":"M Mittermaier","year":"2023","unstructured":"Mittermaier, M., Raza, M. M. & Kvedar, J. C. Bias in ai-based models for medical applications: challenges and mitigation strategies. NPJ Digit. Med. 6, 113 (2023).","journal-title":"NPJ Digit. Med."},{"key":"1283_CR25","unstructured":"Singhal, K. et al. Towards expert-level medical question answering with large language models. Preprint at https:\/\/arxiv.org\/abs\/2305.09617 (2023)."},{"key":"1283_CR26","doi-asserted-by":"publisher","first-page":"172","DOI":"10.1038\/s41586-023-06291-2","volume":"620","author":"K Singhal","year":"2023","unstructured":"Singhal, K. et al. Large language models encode clinical knowledge. Nature 620, 172\u2013180 (2023).","journal-title":"Nature"},{"key":"1283_CR27","first-page":"1877","volume":"33","author":"T Brown","year":"2020","unstructured":"Brown, T. et al. Language models are few-shot learners. Adv. Neural Inf. Process. Syst. 33, 1877\u20131901 (2020).","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"1283_CR28","unstructured":"Christiano, P. F. et al. Deep reinforcement learning from human preferences. Adv. Neural Inf. Process. Syst. 30, (2017)."},{"key":"1283_CR29","unstructured":"Thoppilan, R. et al. Lamda: language models for dialog applications. Preprint at https:\/\/arxiv.org\/abs\/2201.08239 (2022)."}],"container-title":["npj Digital Medicine"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/www.nature.com\/articles\/s41746-024-01283-6.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/www.nature.com\/articles\/s41746-024-01283-6","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/www.nature.com\/articles\/s41746-024-01283-6.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,10,23]],"date-time":"2024-10-23T02:08:36Z","timestamp":1729649316000},"score":1,"resource":{"primary":{"URL":"https:\/\/www.nature.com\/articles\/s41746-024-01283-6"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,10,21]]},"references-count":29,"journal-issue":{"issue":"1","published-online":{"date-parts":[[2024,12]]}},"alternative-id":["1283"],"URL":"https:\/\/doi.org\/10.1038\/s41746-024-01283-6","relation":{},"ISSN":["2398-6352"],"issn-type":[{"value":"2398-6352","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024,10,21]]},"assertion":[{"value":"15 May 2024","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"2 October 2024","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"21 October 2024","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"The authors declare no competing interests.","order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Competing interests"}}],"article-number":"295"}}