{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,3,4]],"date-time":"2026-03-04T21:39:44Z","timestamp":1772660384693,"version":"3.50.1"},"reference-count":57,"publisher":"Springer Science and Business Media LLC","issue":"5","license":[{"start":{"date-parts":[[2025,4,23]],"date-time":"2025-04-23T00:00:00Z","timestamp":1745366400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2025,4,23]],"date-time":"2025-04-23T00:00:00Z","timestamp":1745366400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Nat Comput Sci"],"DOI":"10.1038\/s43588-025-00789-7","type":"journal-article","created":{"date-parts":[[2025,4,23]],"date-time":"2025-04-23T09:02:09Z","timestamp":1745398929000},"page":"388-396","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":6,"title":["Evaluating and mitigating bias in AI-based medical text generation"],"prefix":"10.1038","volume":"5","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-6633-0796","authenticated-orcid":false,"given":"Xiuying","family":"Chen","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Tairan","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-6739-6236","authenticated-orcid":false,"given":"Juexiao","family":"Zhou","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zirui","family":"Song","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-7108-3574","authenticated-orcid":false,"given":"Xin","family":"Gao","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-3574-5665","authenticated-orcid":false,"given":"Xiangliang","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2025,4,23]]},"reference":[{"key":"789_CR1","doi-asserted-by":"crossref","unstructured":"Jiang, F. et al. Artificial intelligence in healthcare: past, present and future. Stroke Vasc. Neurol. 2, 230\u2013243 (2017).","DOI":"10.1136\/svn-2017-000101"},{"key":"789_CR2","unstructured":"Rajpurkar, P. et al. CheXNet: radiologist-level pneumonia detection on chest x-rays with deep learning. Preprint at https:\/\/arxiv.org\/abs\/1711.05225 (2017)."},{"key":"789_CR3","doi-asserted-by":"publisher","DOI":"10.1038\/s41598-022-17753-4","volume":"12","author":"M Lin","year":"2022","unstructured":"Lin, M. et al. Automated diagnosing primary open-angle glaucoma from fundus image by simulating human\u2019s grading with deep learning. Sci. Rep. 12, 14080 (2022).","journal-title":"Sci. Rep."},{"key":"789_CR4","doi-asserted-by":"crossref","unstructured":"Rimmer, A. Radiologist shortage leaves patient care at risk, warns royal college. Br. Med. J. 359, j4683 (2017).","DOI":"10.1136\/bmj.j4683"},{"key":"789_CR5","doi-asserted-by":"publisher","first-page":"4","DOI":"10.1038\/s42004-024-01394-x","volume":"8","author":"X Chen","year":"2025","unstructured":"Chen, X. et al. Unveiling the power of language models in chemical research question answering. Commun. Chem. 8, 4 (2025).","journal-title":"Commun. Chem."},{"key":"789_CR6","doi-asserted-by":"publisher","first-page":"915","DOI":"10.1126\/science.adp6034","volume":"386","author":"T Wang","year":"2024","unstructured":"Wang, T. et al. Nature of metal\u2013support interaction for metal catalysts on oxide supports. Science 386, 915\u2013920 (2024).","journal-title":"Science"},{"key":"789_CR7","doi-asserted-by":"publisher","first-page":"447","DOI":"10.1126\/science.aax2342","volume":"366","author":"Z Obermeyer","year":"2019","unstructured":"Obermeyer, Z., Powers, B., Vogeli, C. & Mullainathan, S. Dissecting racial bias in an algorithm used to manage the health of populations. Science 366, 447\u2013453 (2019).","journal-title":"Science"},{"key":"789_CR8","doi-asserted-by":"crossref","unstructured":"Seyyed-Kalantari, L., Liu, G., McDermott, M., Chen, I. Y. & Ghassemi, M. CheXclusion: fairness gaps in deep chest X-ray classifiers. In Biocomputing 2021: Proc. Pacific Symposium Vol. 26, 232\u2013243 (World Scientific, 2020).","DOI":"10.1142\/9789811232701_0022"},{"key":"789_CR9","unstructured":"Zong, Y., Yang, Y. & Hospedales, T. MEDFAIR: benchmarking fairness for medical imaging. In Eleventh International Conference on Learning Representations (ICLR, 2022)."},{"key":"789_CR10","doi-asserted-by":"publisher","DOI":"10.1038\/s41467-023-41974-4","volume":"14","author":"M Lin","year":"2023","unstructured":"Lin, M. et al. Improving model fairness in image-based computer-aided diagnosis. Nat. Commun. 14, 6261 (2023).","journal-title":"Nat. Commun."},{"key":"789_CR11","doi-asserted-by":"publisher","first-page":"12592","DOI":"10.1073\/pnas.1919012117","volume":"117","author":"AJ Larrazabal","year":"2020","unstructured":"Larrazabal, A. J., Nieto, N., Peterson, V., Milone, D. H. & Ferrante, E. Gender imbalance in medical imaging datasets produces biased classifiers for computer-aided diagnosis. Proc. Natl Acad. Sci. USA 117, 12592\u201312594 (2020).","journal-title":"Proc. Natl Acad. Sci. USA"},{"key":"789_CR12","unstructured":"Zhou, Y. et al. RadFusion: benchmarking performance and fairness for multimodal pulmonary embolism detection from CT and EHR. Preprint at https:\/\/arxiv.org\/abs\/2111.11665 (2021)."},{"key":"789_CR13","doi-asserted-by":"crossref","unstructured":"Kinyanjui, N. M. et al. Fairness of classifiers across skin tones in dermatology. In International Conference on Medical Image Computing and Computer-Assisted Intervention Vol. 12266, 320\u2013329 (MICCAI, 2020).","DOI":"10.1007\/978-3-030-59725-2_31"},{"key":"789_CR14","first-page":"370","volume":"2023","author":"M Lin","year":"2023","unstructured":"Lin, M. et al. Evaluate underdiagnosis and overdiagnosis bias of deep learning model on primary open-angle glaucoma diagnosis in under-served populations. AMIA Jt Summits Transl. Sci. Proc. 2023, 370\u2013377 (2023).","journal-title":"AMIA Jt Summits Transl. Sci. Proc."},{"key":"789_CR15","doi-asserted-by":"publisher","first-page":"617","DOI":"10.2471\/BLT.08.051078","volume":"86","author":"SI Saarni","year":"2008","unstructured":"Saarni, S. I. et al. Ethical analysis to improve decision-making on health technologies. Bull. World Health Org. 86, 617\u2013623 (2008).","journal-title":"Bull. World Health Org."},{"key":"789_CR16","doi-asserted-by":"publisher","first-page":"205","DOI":"10.1136\/medethics-2019-105586","volume":"46","author":"T Grote","year":"2020","unstructured":"Grote, T. & Berens, P. On the ethics of algorithmic decision-making in healthcare. J. Med. Ethics 46, 205\u2013211 (2020).","journal-title":"J. Med. Ethics"},{"key":"789_CR17","unstructured":"Zhang, H. et al. Improving the fairness of chest X-ray classifiers. Proc. Mach. Learn. Res. 174, 204\u2013233 (2022)."},{"key":"789_CR18","first-page":"728","volume":"33","author":"P Lahoti","year":"2020","unstructured":"Lahoti, P. et al. Fairness without demographics through adversarially reweighted learning. Adv. Neural Inf. Process. Syst. 33, 728\u2013740 (2020).","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"789_CR19","doi-asserted-by":"crossref","unstructured":"Narasimhan, H., Cotter, A., Gupta, M. & Wang, S. Pairwise fairness for ranking and regression. In Proceedings of the AAAI Conference on Artificial Intelligence Vol. 34, 5248\u20135255 (AAAI Press, 2020).","DOI":"10.1609\/aaai.v34i04.5970"},{"key":"789_CR20","doi-asserted-by":"crossref","unstructured":"Yang, Y., Zhang, H., Gichoya, J. W., Katabi, D. & Ghassemi, M. The limits of fair medical imaging AI in real-world generalization. Nat. Med. 30, 2838\u20132848 (2024).","DOI":"10.1038\/s41591-024-03113-4"},{"key":"789_CR21","doi-asserted-by":"publisher","first-page":"btad557","DOI":"10.1093\/bioinformatics\/btad557","volume":"39","author":"Q Chen","year":"2023","unstructured":"Chen, Q. et al. An extensive benchmark study on biomedical text generation and mining with ChatGPT. Bioinformatics 39, btad557 (2023).","journal-title":"Bioinformatics"},{"key":"789_CR22","doi-asserted-by":"crossref","unstructured":"Li, J., Dada, A., Puladi, B., Kleesiek, J. & Egger, J. ChatGPT in healthcare: a taxonomy and systematic review. Comput. Methods Programs Biomed. 245, 108013 (2024).","DOI":"10.1016\/j.cmpb.2024.108013"},{"key":"789_CR23","doi-asserted-by":"publisher","first-page":"bbad493","DOI":"10.1093\/bib\/bbad493","volume":"25","author":"S Tian","year":"2024","unstructured":"Tian, S. et al. Opportunities and challenges for ChatGPT and large language models in biomedicine and health. Brief. Bioinform. 25, bbad493 (2024).","journal-title":"Brief. Bioinform."},{"key":"789_CR24","doi-asserted-by":"crossref","unstructured":"Tanida, T., M\u00fcller, P., Kaissis, G. & Rueckert, D. Interactive and explainable region-guided radiology report generation. In Proc. IEEE\/CVF Conference on Computer Vision and Pattern Recognition 7433\u20137442 (IEEE, 2023).","DOI":"10.1109\/CVPR52729.2023.00718"},{"key":"789_CR25","doi-asserted-by":"crossref","unstructured":"Van Veen, D. et al. RadAdapt: radiology report summarization via lightweight domain adaptation of large language models. In The 22nd Workshop on Biomedical Natural Language Processing and BioNLP Shared Tasks (eds Demner-Fushman, D. et al.) 449\u2013460 (Association for Computational Linguistics, 2023).","DOI":"10.18653\/v1\/2023.bionlp-1.42"},{"key":"789_CR26","doi-asserted-by":"publisher","first-page":"e48163","DOI":"10.2196\/48163","volume":"9","author":"M Karabacak","year":"2023","unstructured":"Karabacak, M., Ozkara, B. B., Margetis, K., Wintermark, M. & Bisdas, S. The advent of generative language models in medical education. JMIR Med. Educ. 9, e48163 (2023).","journal-title":"JMIR Med. Educ."},{"key":"789_CR27","doi-asserted-by":"publisher","first-page":"49","DOI":"10.1038\/s41591-022-02160-z","volume":"29","author":"V Subbiah","year":"2023","unstructured":"Subbiah, V. The next generation of evidence-based medicine. Nat. Med. 29, 49\u201358 (2023).","journal-title":"Nat. Med."},{"key":"789_CR28","unstructured":"Weidinger, L. et al. Ethical and social risks of harm from language models. Preprint at https:\/\/arxiv.org\/abs\/2112.04359 (2021)."},{"key":"789_CR29","doi-asserted-by":"publisher","first-page":"619","DOI":"10.1001\/jamainternmed.2016.0400","volume":"176","author":"AS Miner","year":"2016","unstructured":"Miner, A. S. et al. Smartphone-based conversational agents and responses to questions about mental health, interpersonal violence, and physical health. JAMA Intern. Med. 176, 619\u2013625 (2016).","journal-title":"JAMA Intern. Med."},{"key":"789_CR30","doi-asserted-by":"publisher","first-page":"e11510","DOI":"10.2196\/11510","volume":"20","author":"TW Bickmore","year":"2018","unstructured":"Bickmore, T. W. et al. Patient and consumer safety risks when using conversational assistants for medical information: an observational study of Siri, Alexa, and Google Assistant. J. Med. Internet Res. 20, e11510 (2018).","journal-title":"J. Med. Internet Res."},{"key":"789_CR31","doi-asserted-by":"crossref","unstructured":"Sloan, P., Clatworthy, P., Simpson, E. & Mirmehdi, M. Automated radiology report generation: a review of recent advances. IEEE Rev. Biomed. Eng. 4225\u20134232 (2024).","DOI":"10.1109\/RBME.2024.3408456"},{"key":"789_CR32","doi-asserted-by":"publisher","DOI":"10.1186\/s12938-023-01113-y","volume":"22","author":"T Pang","year":"2023","unstructured":"Pang, T., Li, P. & Zhao, L. A survey on automatic generation of medical imaging reports based on deep learning. Biomed. Eng. Online 22, 48 (2023).","journal-title":"Biomed. Eng. Online"},{"key":"789_CR33","unstructured":"Zhang, T., Kishore, V., Wu, F., Weinberger, K. Q. & Artzi, Y. BERTScore: evaluating text generation with BERT. In International Conference on Learning Representations (ICLR, 2020)."},{"key":"789_CR34","unstructured":"Celikyilmaz, A., Clark, E. & Gao, J. Evaluation of text generation: a survey. Preprint at https:\/\/arxiv.org\/abs\/2006.14799 (2020)."},{"key":"789_CR35","doi-asserted-by":"crossref","unstructured":"Fu, J., Ng, S.-K., Jiang, Z. & Liu, P. GPTScore: evaluate as you desire. In Proc. 2024 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies Vol. 1, 6556\u20136576 (2024).","DOI":"10.18653\/v1\/2024.naacl-long.365"},{"key":"789_CR36","unstructured":"Lin, C.-Y. ROUGE: a package for automatic evaluation of summaries. In Text Summarization Branches Out 74\u201381 (Association for Computational Linguistics, 2004)."},{"key":"789_CR37","doi-asserted-by":"crossref","unstructured":"Chen, X. et al. Flexible and adaptable summarization via expertise separation. In Proc. 47th International ACM SIGIR Conference on Research and Development in Information Retrieval 2018\u20132027 (Association for Computing Machinery, 2024).","DOI":"10.1145\/3626772.3657789"},{"key":"789_CR38","doi-asserted-by":"crossref","unstructured":"Liu, Y. et al. Revisiting the gold standard: grounding summarization evaluation with robust human evaluation. Proc. 61st Annual Meeting of the Association for Computational Linguistics Vol. 1 (eds Rogers, A. et al.) 4140\u20134170 (Association for Computational Linguistics, 2023).","DOI":"10.18653\/v1\/2023.acl-long.228"},{"key":"789_CR39","doi-asserted-by":"crossref","unstructured":"Scialom, T. et al. QuestEval: summarization asks for fact-based evaluation. In Proc. 2021 Conference on Empirical Methods in Natural Language Processing (eds Moens, M.-F. et al.) 6594\u20136604 (Association for Computational Linguistics, 2021).","DOI":"10.18653\/v1\/2021.emnlp-main.529"},{"key":"789_CR40","unstructured":"Chen, X. et al. Rethinking scientific summarization evaluation: grounding explainable metrics on facet-aware benchmark. Preprint at https:\/\/arxiv.org\/abs\/2402.14359 (2024)."},{"key":"789_CR41","doi-asserted-by":"crossref","unstructured":"Irvin, J. et al. CheXpert: a large chest radiograph dataset with uncertainty labels and expert comparison. Proc. Thirty-Third AAAI Conference on Artificial Intelligence and Thirty-First Innovative Applications of Artificial Intelligence Conference and Ninth AAAI Symposium on Educational Advances in Artificial Intelligence 590\u2013597 (AAAI Press, 2019).","DOI":"10.1609\/aaai.v33i01.3301590"},{"key":"789_CR42","unstructured":"Wang, X. et al. CXPMRG-Bench: pre-training and benchmarking for X-ray medical report generation on CheXpert Plus dataset. Preprint at https:\/\/arxiv.org\/abs\/2410.00379 (2024)."},{"key":"789_CR43","unstructured":"Endo, M., Krishnan, R., Krishna, V., Ng, A. Y. & Rajpurkar, P. Retrieval-based chest x-ray report generation using a pre-trained contrastive language-image model. Proc. Mach. Learn. Res. 158, 209\u2013219 (2021)."},{"key":"789_CR44","unstructured":"Boag, W. et al. Baselines for chest x-ray report generation. Proc. Mach. Learn. Res. 116, 126\u2013140 (2020)."},{"key":"789_CR45","doi-asserted-by":"crossref","unstructured":"Chen, Z., Song, Y., Chang, T.-H. & Wan, X. Generating radiology reports via memory-driven transformer. In Proc. 2020 Conference on Empirical Methods in Natural Language Processing (EMNLP) (eds Jurafsky, D. et al.) 1439\u20131449 (2020).","DOI":"10.18653\/v1\/2020.emnlp-main.112"},{"key":"789_CR46","doi-asserted-by":"crossref","unstructured":"Lewis, M. et al. BART: denoising sequence-to-sequence pre-training for natural language generation, translation, and comprehension. In Proc. 58th Annual Meeting of the Association for Computational Linguistics 7871\u20137880 (Association for Computational Linguistics, 2020).","DOI":"10.18653\/v1\/2020.acl-main.703"},{"key":"789_CR47","unstructured":"Touvron, H. et al. Llama 2: open foundation and fine-tuned chat models. Preprint at https:\/\/arxiv.org\/abs\/2307.09288 (2023)."},{"key":"789_CR48","doi-asserted-by":"crossref","unstructured":"Johnson, A. E. et al. MIMIC-CXR-JPG, a large publicly available database of labeled chest radiographs. Preprint at https:\/\/arxiv.org\/abs\/1901.07042 (2019).","DOI":"10.1038\/s41597-019-0322-0"},{"key":"789_CR49","doi-asserted-by":"crossref","unstructured":"Cohan, A. et al. A discourse-aware attention model for abstractive summarization of long documents. In Proc. 2018 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies Vol. 2 (eds Walker, M. et al.) 615\u2013621 (2018).","DOI":"10.18653\/v1\/N18-2097"},{"key":"789_CR50","unstructured":"Johnson, A. et al. MIMIC-IV. PhysioNet https:\/\/physionet.org\/content\/mimiciv\/1.0\/ 49\u201355 (2020)."},{"key":"789_CR51","doi-asserted-by":"publisher","first-page":"759","DOI":"10.1097\/CCM.0b013e3181c8fd58","volume":"38","author":"FB Mayr","year":"2010","unstructured":"Mayr, F. B. et al. Do hospitals provide lower quality of care to black patients for pneumonia? Crit. Care Med. 38, 759\u2013765 (2010).","journal-title":"Crit. Care Med."},{"key":"789_CR52","unstructured":"Wolf, T. et al. Transformers: State-of-the-art natural language processing. In Proc. 2020 Conference on Empirical Methods in Natural Language Processing: System Demonstrations (eds Liu, Q. & Schlangen, D.) 38\u201345 (Association for Computational Linguistics, 2020)."},{"key":"789_CR53","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S. & Sun, J. Deep residual learning for image recognition. In Proc. IEEE Conference on Computer Vision and Pattern Recognition 770\u2013778 (IEEE, 2016).","DOI":"10.1109\/CVPR.2016.90"},{"key":"789_CR54","doi-asserted-by":"crossref","unstructured":"Deng, J. et al. ImageNet: a large-scale hierarchical image database. In 2009 IEEE Conference on Computer Vision and Pattern Recognition 248\u2013255 (IEEE, 2009).","DOI":"10.1109\/CVPR.2009.5206848"},{"key":"789_CR55","unstructured":"Kingma, D. P. and Ba, J. Adam: a method for stochastic optimization. Preprint at https:\/\/arxiv.org\/abs\/1412.6980 (2014)."},{"key":"789_CR56","doi-asserted-by":"publisher","unstructured":"Chen, X. support data.zip. Figshare https:\/\/doi.org\/10.6084\/m9.figshare.28516889.v1 (2025).","DOI":"10.6084\/m9.figshare.28516889.v1"},{"key":"789_CR57","doi-asserted-by":"publisher","unstructured":"Chen, X. Code for GenFair. Figshare https:\/\/doi.org\/10.6084\/m9.figshare.28516898.v1 (2025).","DOI":"10.6084\/m9.figshare.28516898.v1"}],"container-title":["Nature Computational Science"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/www.nature.com\/articles\/s43588-025-00789-7.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/www.nature.com\/articles\/s43588-025-00789-7","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/www.nature.com\/articles\/s43588-025-00789-7.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,5,27]],"date-time":"2025-05-27T22:03:27Z","timestamp":1748383407000},"score":1,"resource":{"primary":{"URL":"https:\/\/www.nature.com\/articles\/s43588-025-00789-7"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,4,23]]},"references-count":57,"journal-issue":{"issue":"5","published-online":{"date-parts":[[2025,5]]}},"alternative-id":["789"],"URL":"https:\/\/doi.org\/10.1038\/s43588-025-00789-7","relation":{},"ISSN":["2662-8457"],"issn-type":[{"value":"2662-8457","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,4,23]]},"assertion":[{"value":"17 August 2024","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"12 March 2025","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"23 April 2025","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"The authors declare no competing interests.","order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Competing interests"}}]}}