{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,13]],"date-time":"2026-07-13T16:14:08Z","timestamp":1783959248377,"version":"3.55.0"},"reference-count":54,"publisher":"Frontiers Media SA","license":[{"start":{"date-parts":[[2025,8,11]],"date-time":"2025-08-11T00:00:00Z","timestamp":1754870400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/"}],"content-domain":{"domain":["frontiersin.org"],"crossmark-restriction":true},"short-container-title":["Front. Artif. Intell."],"abstract":"<jats:p>Large Language Models (LLMs) have significantly advanced sentiment analysis, yet their inherent uncertainty and variability pose critical challenges to achieving reliable and consistent outcomes. This paper systematically explores the Model Variability Problem (MVP) in LLM-based sentiment analysis, characterized by inconsistent sentiment classification, polarization, and uncertainty arising from stochastic inference mechanisms, prompt sensitivity, and biases in training data. We present illustrative examples and two case studies to highlight its impact and analyze the core causes of MVP, discussing a dozen fundamental reasons for model variability. We pay especial atenttion to explainabily, with an analysis of its importance in LLMs from the MVP perspective. In addition, we investigate key challenges and mitigation strategies, paying particular attention to the role of temperature as a driver of output randomness and highlighting the crucial role of explainability in improving transparency and user trust. By providing a structured perspective on stability, reproducibility, and trustworthiness, this study helps develop more reliable, explainable, and robust sentiment analysis models, facilitating their deployment in high-risk domains such as finance, healthcare and policy making, among others.<\/jats:p>","DOI":"10.3389\/frai.2025.1609097","type":"journal-article","created":{"date-parts":[[2025,8,11]],"date-time":"2025-08-11T05:23:47Z","timestamp":1754889827000},"update-policy":"https:\/\/doi.org\/10.3389\/crossmark-policy","source":"Crossref","is-referenced-by-count":38,"title":["An overview of model uncertainty and variability in LLM-based sentiment analysis: challenges, mitigation strategies, and the role of explainability"],"prefix":"10.3389","volume":"8","author":[{"given":"David","family":"Herrera-Poyatos","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Carlos","family":"Pel\u00e1ez-Gonz\u00e1lez","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Cristina","family":"Zuheros","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Andr\u00e9s","family":"Herrera-Poyatos","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Virilo","family":"Tejedor","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Francisco","family":"Herrera","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Rosana","family":"Montes","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"1965","published-online":{"date-parts":[[2025,8,11]]},"reference":[{"key":"B1","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv:2309.07755","article-title":"Generative AI text classification using ensemble LLM approaches","author":"Abburi","year":"2023","journal-title":"arXiv"},{"key":"B2","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1057\/s41599-024-04044-8","article-title":"Trust in AI: progress, challenges, and future directions","volume":"11","author":"Afroogh","year":"2024","journal-title":"Humanit. Soc. Sci. Commun"},{"key":"B3","doi-asserted-by":"publisher","author":"Agrawal","year":"2024","DOI":"10.48550\/arXiv.2410.04571"},{"key":"B4","doi-asserted-by":"publisher","first-page":"101805","DOI":"10.1016\/j.inffus.2023.101805","article-title":"Explainable Artificial Intelligence (XAI): what we know and what is left to attain trustworthy artificial intelligence","volume":"99","author":"Ali","year":"2023","journal-title":"Inf. Fusion"},{"key":"B5","unstructured":"Circuit tracing: revealing computational graphs in language models\n          \n          \n            \n              Ameisen\n              E.\n            \n            \n              Lindsey\n              J.\n            \n            \n              Pearce\n              A.\n            \n            \n              Gurnee\n              W.\n            \n            \n              Turner\n              N. L.\n            \n            \n              Chen\n              B.\n            \n          \n          Transform. Circuits Thread\n          \n          2025"},{"key":"B6","unstructured":"Amodei\n              D.\n            \n          \n          The Urgency of Interpretability\n          \n          2025"},{"key":"B7","doi-asserted-by":"publisher","first-page":"82","DOI":"10.1016\/j.inffus.2019.12.012","article-title":"Explainable Artificial Intelligence (XAI): concepts, taxonomies, opportunities and challenges toward responsible AI","volume":"58","author":"Arrieta","year":"2020","journal-title":"Inf. Fusion"},{"key":"B8","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv:2408.04667","article-title":"LLM stability: a detailed analysis with some surprises","author":"Atil","year":"2024","journal-title":"arXiv"},{"key":"B9","doi-asserted-by":"publisher","first-page":"47","DOI":"10.1007\/s10676-024-09778-2","article-title":"Beyond transparency and explainability: on the need for adequate and contextualized user guidelines for LLM use","volume":"26","author":"Barman","year":"2024","journal-title":"Ethics Inf. Technol"},{"key":"B10","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv:2410.20199","article-title":"Rethinking the uncertainty: a critical review and analysis in the era of large language models","author":"Beigi","year":"2024","journal-title":"arXiv"},{"key":"B11","first-page":"4302","article-title":"\u201cDeep reinforcement earning from human preferences,\u201d","volume-title":"Proceedings of the 31st International Conference on Neural Information Processing Systems, NIPS'17","author":"Christiano","year":"2017"},{"key":"B12","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2502.17026","article-title":"Understanding the uncertainty of LLM explanations: a perspective based on reasoning topology","author":"Da","year":"2025","journal-title":"arXiv"},{"key":"B13","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/3613905.3650786","article-title":"\u201cA taxonomy for human-llm interaction modes: an initial exploration,\u201d","author":"Gao","year":"2024"},{"key":"B14","first-page":"3322","article-title":"\u201cHow does gpt-2 predict acronyms? extracting and understanding a circuit via mechanistic interpretability,\u201d","volume-title":"Proceedings of The 27th International Conference on Artificial Intelligence and Statistics Vol. 238 of Proceedings of Machine Learning Research","author":"Garc\u00eda-Carrasco","year":"2024"},{"key":"B15","doi-asserted-by":"publisher","first-page":"16772","DOI":"10.1609\/aaai.v39i16.33843","article-title":"Extracting interpretable task-specific circuits from large language models for faster inference","volume":"39","author":"Garc\u00eda-Carrasco","year":"2025","journal-title":"Pro. AAAI Conf. Artif. Intell"},{"key":"B16","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv:2306.08543","article-title":"MiniLLM: knowledge distillation of large language models","author":"Gu","year":"","journal-title":"arXiv"},{"key":"B17","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2410.17215","article-title":"MiniPLM: knowledge distillation for pre-training language models","author":"Gu","year":"","journal-title":"arXiv"},{"key":"B18","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2407.04173","article-title":"Quantifying prediction consistency under model multiplicity in tabular LLMs","author":"Hamman","year":"2024","journal-title":"arXiv"},{"key":"B19","doi-asserted-by":"publisher","first-page":"103133","DOI":"10.1016\/j.inffus.2025.103133","article-title":"Reflections and attentiveness on eXplainable Artificial Intelligence (XAI): the journey ahead from criticisms to human-AI interaction","volume":"123","author":"Herrera","year":"2025","journal-title":"Inf. Fusion"},{"key":"B20","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2403.15587","article-title":"Large language model-based sentiment analysis with crowd decision making using prompt design strategies: models, analysis and challenges","author":"Herrera-Poyatos","year":"2025","journal-title":"arXiv"},{"key":"B21","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2502.09369","article-title":"Language agents as digital representatives in collective decision-making","author":"Jarrett","year":"2025","journal-title":"arXiv"},{"key":"B22","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2502.17814","article-title":"An overview of large language models for statisticians","author":"Ji","year":"2025","journal-title":"arXiv"},{"key":"B23","doi-asserted-by":"publisher","first-page":"3","DOI":"10.1007\/s40547-024-00143-4","article-title":"Sentiment analysis in the age of generative AI","volume":"11","author":"Krugmann","year":"2024","journal-title":"Cust. Needs Solut"},{"key":"B24","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2501.17630","article-title":"Uncertainty quantification and decomposition for LLM-based recommendation","author":"Kweon","year":"2025","journal-title":"arXiv"},{"key":"B25","doi-asserted-by":"publisher","DOI":"10.2139\/ssrn.4780192","article-title":"Uncertainty in sentiment analysis with LLMs using QCM (quantiles of correlation matrices) - distance","author":"Lefort","year":"2024","journal-title":"SSRN Electron. J"},{"key":"B26","author":"Lindsey","year":"2025","journal-title":"On the Biology of a Large Language Model"},{"key":"B27","doi-asserted-by":"publisher","first-page":"90","DOI":"10.1016\/j.obhdp.2018.12.005","article-title":"Algorithm appreciation: people prefer algorithmic to human judgment","volume":"151","author":"Logg","year":"2019","journal-title":"Organ. Behav. Hum. Decis. Process"},{"key":"B28","doi-asserted-by":"publisher","first-page":"102301","DOI":"10.1016\/j.inffus.2024.102301","article-title":"Explainable Artificial Intelligence (XAI) 2.0: a manifesto of open challenges and interdisciplinary research directions","volume":"106","author":"Longo","year":"2024","journal-title":"Inf. Fusion"},{"key":"B29","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.findings-emnlp.241","article-title":"Exploring the sensitivity of LLMs' decision-making capabilities: insights from prompt variation and hyperparameters","author":"Loya","year":"2023","journal-title":"arXiv"},{"key":"B30","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2401.12874","article-title":"From understanding to utilization: a survey on explainability for large language models","author":"Luo","year":"2024","journal-title":"arXiv"},{"key":"B31","doi-asserted-by":"publisher","first-page":"160","DOI":"10.3390\/bdcc8110160","article-title":"Explainable Pre-trained language models for sentiment analysis in low-resourced languages","volume":"8","author":"Mabokela","year":"2024","journal-title":"Big Data Cogn. Comput"},{"key":"B32","doi-asserted-by":"publisher","first-page":"1","DOI":"10.48550\/arXiv.1810.01075","article-title":"Implicit self-regularization in deep neural networks: evidence from random matrix theory and implications for learning","volume":"22","author":"Martin","year":"2021","journal-title":"J. Mach. Learn. Res"},{"key":"B33","doi-asserted-by":"publisher","first-page":"4122","DOI":"10.1038\/s41467-021-24025-8","article-title":"Predicting trends in the quality of state-of-the-art neural networks without access to training or testing data","volume":"12","author":"Martin","year":"2021","journal-title":"Nat. Commun"},{"key":"B34","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2407.21054","article-title":"Sentiment reasoning for healthcare","author":"Nguyen","year":"2024","journal-title":"arXiv"},{"key":"B35","article-title":"\u201cTraining language models to follow instructions with human feedback,\u201d","volume-title":"Proceedings of the 36th International Conference on Neural Information Processing Systems, NIPS '22","author":"Ouyang","year":"2022"},{"key":"B36","doi-asserted-by":"publisher","first-page":"230","DOI":"10.1518\/001872097778543886","article-title":"Humans and automation: use, misuse, disuse, abuse","volume":"39","author":"Parasuraman","year":"1997","journal-title":"Hum. Factors"},{"key":"B37","doi-asserted-by":"publisher","first-page":"1464690","DOI":"10.3389\/frai.2024.1464690","article-title":"Fostering effective hybrid human-LLM reasoning and decision making","volume":"7","author":"Passerini","year":"2025","journal-title":"Front. Artif. Intell"},{"key":"B38","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2407.02646","article-title":"A practical review of mechanistic interpretability for transformer-based language models","author":"Rai","year":"2025","journal-title":"arXiv"},{"key":"B39","doi-asserted-by":"publisher","DOI":"10.31219\/osf.io\/65v2y","article-title":"ChatGPT as a voting application in direct democracy","author":"Reveilhac","year":"2024","journal-title":"Swiss Polit. Sci. Rev"},{"key":"B40","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2412.05563","article-title":"A survey on uncertainty quantification of large language models: taxonomy, open research challenges, and future directions","author":"Shorinwa","year":"2024","journal-title":"arXiv"},{"key":"B41","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2401.14109","article-title":"Compactifai: extreme compression of large language models using quantum-inspired tensor networks","author":"Tomut","year":"2024","journal-title":"arXiv"},{"key":"B42","doi-asserted-by":"publisher","first-page":"e0313092","DOI":"10.1371\/journal.pone.0313092","article-title":"The advantages of lexicon-based sentiment analysis in an age of machine learning","volume":"20","author":"van der Veen","year":"2025","journal-title":"PLoS ONE"},{"key":"B43","doi-asserted-by":"publisher","first-page":"5731","DOI":"10.1007\/s10462-022-10144-1","article-title":"A survey on sentiment analysis methods, applications, and challenges","volume":"55","author":"Wankhade","year":"2022","journal-title":"Artif. Intell. Rev"},{"key":"B44","doi-asserted-by":"publisher","first-page":"1225791","DOI":"10.3389\/frai.2023.1225791","article-title":"Explaining pretrained language models' understanding of linguistic structures using construction grammar","volume":"6","author":"Weissweiler","year":"2023","journal-title":"Front. Artif. Intell"},{"key":"B45","author":"Xie","year":"2025"},{"key":"B46","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2411.14654","article-title":"Comparative analysis of pooling mechanisms in LLMs: a sentiment analysis perspective","author":"Xing","year":"2024","journal-title":"arXiv"},{"key":"B47","first-page":"302","author":"Yam","year":"2024"},{"key":"B48","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2406.08068","article-title":"Large language models meet text-centric multimodal sentiment analysis: a survey","author":"Yang","year":"2024","journal-title":"arXiv"},{"key":"B49","doi-asserted-by":"publisher","first-page":"1696","DOI":"10.1609\/aies.v7i1.31758","article-title":"LLM voting: human choices and AI collective decision-making","volume":"7","author":"Yang","year":"2024","journal-title":"Proc. AAAI\/ACM Conf. AI Ethics Soc"},{"key":"B50","doi-asserted-by":"publisher","first-page":"15356","DOI":"10.13140\/RG.2.2.19298.71360","article-title":"Benchmarking LLMs via uncertainty quantification","volume":"37","author":"Ye","year":"2024","journal-title":"Adv. Neural Inf. Process. Syst"},{"key":"B51","doi-asserted-by":"publisher","first-page":"3881","DOI":"10.18653\/v1\/2024.findings-naacl.246","article-title":"\u201cSentiment analysis in the era of large language models: a reality check,\u201d","author":"Zhang","year":"2024","journal-title":"Findings of the Association for Computational Linguistics: NAACL 2024"},{"key":"B52","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/3639372","article-title":"Explainability for large language models: a survey","volume":"15","author":"Zhao","year":"2024","journal-title":"ACM Trans. Intell. Syst. Technol"},{"key":"B53","author":"Ziegler","year":"2020","journal-title":"Fine-Tuning Language Models from Human Preferences"},{"key":"B54","doi-asserted-by":"publisher","first-page":"22","DOI":"10.1016\/j.inffus.2020.10.019.2020.10.019","article-title":"Sentiment analysis based multi-person multi-criteria decision making methodology using natural language processing and deep learning for smarter decision aid. Case study of restaurant choice using TripAdvisor reviews","volume":"68","author":"Zuheros","year":"2021","journal-title":"Inf. Fusion"}],"container-title":["Frontiers in Artificial Intelligence"],"original-title":[],"link":[{"URL":"https:\/\/www.frontiersin.org\/articles\/10.3389\/frai.2025.1609097\/full","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,8,11]],"date-time":"2025-08-11T05:23:51Z","timestamp":1754889831000},"score":1,"resource":{"primary":{"URL":"https:\/\/www.frontiersin.org\/articles\/10.3389\/frai.2025.1609097\/full"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,8,11]]},"references-count":54,"alternative-id":["10.3389\/frai.2025.1609097"],"URL":"https:\/\/doi.org\/10.3389\/frai.2025.1609097","relation":{},"ISSN":["2624-8212"],"issn-type":[{"value":"2624-8212","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,8,11]]},"article-number":"1609097"}}