{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,21]],"date-time":"2026-07-21T17:07:13Z","timestamp":1784653633628,"version":"3.55.0"},"publisher-location":"New York, NY, USA","reference-count":52,"publisher":"ACM","license":[{"start":{"date-parts":[[2026,4,12]],"date-time":"2026-04-12T00:00:00Z","timestamp":1775952000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/legalcode"}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2026,4,12]]},"DOI":"10.1145\/3793655.3793732","type":"proceedings-article","created":{"date-parts":[[2026,7,21]],"date-time":"2026-07-21T16:04:46Z","timestamp":1784649886000},"page":"172-183","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":0,"title":["Stalled, Biased, and Confused: Uncovering Reasoning Failures in LLMs for Cloud-Based Root Cause Analysis"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0000-0003-0844-8910","authenticated-orcid":false,"given":"Evelien","family":"Riddell","sequence":"first","affiliation":[{"name":"University of Waterloo, Waterloo, Ontario, Canada"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0007-3261-5412","authenticated-orcid":false,"given":"James","family":"Riddell","sequence":"additional","affiliation":[{"name":"University of Waterloo, Waterloo, Ontario, Canada"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0009-6143-9862","authenticated-orcid":false,"given":"Gengyi","family":"Sun","sequence":"additional","affiliation":[{"name":"University of Waterloo, Waterloo, Ontario, Canada"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-4947-7136","authenticated-orcid":false,"given":"Micha\u0142","family":"Antkiewicz","sequence":"additional","affiliation":[{"name":"University of Waterloo, Waterloo, Ontario, Canada"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-1642-1101","authenticated-orcid":false,"given":"Krzysztof","family":"Czarnecki","sequence":"additional","affiliation":[{"name":"University of Waterloo, Waterloo, Ontario, Canada"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"320","published-online":{"date-parts":[[2026,7,21]]},"reference":[{"key":"e_1_3_3_1_2_2","doi-asserted-by":"publisher","DOI":"10.1109\/ICSE48619.2023.00149"},{"key":"e_1_3_3_1_3_2","volume-title":"LangGraph","author":"AI LangChain","year":"2024","unstructured":"LangChain AI. 2024. LangGraph. https:\/\/langchain-ai.github.io\/langgraph\/ Accessed: 2025-11-05."},{"key":"e_1_3_3_1_4_2","unstructured":"Meta AI. 2024. Llama 3.2. https:\/\/github.com\/meta-llama\/llama-models\/blob\/main\/models\/llama3_2\/MODEL_CARD.md. Accessed 2025-11-04."},{"key":"e_1_3_3_1_5_2","unstructured":"Meta AI. 2024. Llama 3.3. https:\/\/github.com\/meta-llama\/llama-models\/blob\/main\/models\/llama3_3\/MODEL_CARD.md. Accessed 2025-11-04."},{"key":"e_1_3_3_1_6_2","doi-asserted-by":"publisher","DOI":"10.1145\/3627703.3629553"},{"key":"e_1_3_3_1_7_2","unstructured":"CloudWise OpenSource. 2022. GAIA: Generic AIOps Atlas. https:\/\/github.com\/CloudWise-OpenSource\/GAIA-DataSet. Accessed 2025-06-03."},{"key":"e_1_3_3_1_8_2","unstructured":"Cohere. 2024. Command R+. https:\/\/docs.cohere.com\/v2\/docs\/command-r-plus. Accessed 2025-11-04."},{"key":"e_1_3_3_1_9_2","doi-asserted-by":"publisher","DOI":"10.4135\/9781452230153"},{"key":"e_1_3_3_1_10_2","unstructured":"DeepSeek-AI. 2025. DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. arxiv:https:\/\/arXiv.org\/abs\/2501.12948\u00a0[cs.CL]"},{"key":"e_1_3_3_1_11_2","doi-asserted-by":"publisher","DOI":"10.1145\/3663529.3663861"},{"key":"e_1_3_3_1_12_2","volume-title":"The Eleventh International Conference on Learning Representations (ICLR)","author":"Golovneva Olga","year":"2023","unstructured":"Olga Golovneva, Moya\u00a0Peng Chen, Spencer Poff, Martin Corredor, Luke Zettlemoyer, Maryam Fazel-Zarandi, and Asli Celikyilmaz. 2023. ROSCOE: A Suite of Metrics for Scoring Step-by-Step Reasoning. In The Eleventh International Conference on Learning Representations (ICLR). https:\/\/openreview.net\/forum?id=xYlJRpzZtsY"},{"key":"e_1_3_3_1_13_2","unstructured":"Jiawei Gu Xuhui Jiang Zhichao Shi Hexiang Tan Xuehao Zhai Chengjin Xu Wei Li Yinghan Shen Shengjie Ma Honghao Liu Saizhuo Wang Kun Zhang Yuanzhuo Wang Wen Gao Lionel Ni and Jian Guo. 2025. A Survey on LLM-as-a-Judge. arxiv:https:\/\/arXiv.org\/abs\/2411.15594\u00a0[cs.CL]"},{"key":"e_1_3_3_1_14_2","doi-asserted-by":"publisher","unstructured":"Yongqi Han Qingfeng Du Ying Huang Pengsheng Li Xiaonan Shi Jiaqi Wu Pei Fang Fulong Tian and Cheng He. 2024. Holistic Root Cause Analysis for Failures in Cloud-Native Systems Through Observability Data. IEEE Transactions on Services Computing 17 6 (2024) 3789\u20133802. 10.1109\/TSC.2024.3478759","DOI":"10.1109\/TSC.2024.3478759"},{"key":"e_1_3_3_1_15_2","doi-asserted-by":"publisher","DOI":"10.1145\/3691620.3695475"},{"key":"e_1_3_3_1_16_2","doi-asserted-by":"publisher","DOI":"10.1109\/ICWS.2017.13"},{"key":"e_1_3_3_1_17_2","doi-asserted-by":"publisher","DOI":"10.1109\/ICSE48619.2023.00150"},{"key":"e_1_3_3_1_18_2","doi-asserted-by":"publisher","DOI":"10.1109\/ICSE55347.2025.00234"},{"key":"e_1_3_3_1_19_2","doi-asserted-by":"publisher","DOI":"10.1109\/ICDM.2008.17"},{"key":"e_1_3_3_1_20_2","volume-title":"Conference on Language Modeling (COLM)","author":"Mondorf Philipp","year":"2024","unstructured":"Philipp Mondorf and Barbara Plank. 2024. Beyond Accuracy: Evaluating the Reasoning Behavior of Large Language Models - A Survey. In Conference on Language Modeling (COLM). https:\/\/openreview.net\/forum?id=Lmjgl2n11u"},{"key":"e_1_3_3_1_21_2","unstructured":"OpenAI. 2025. Introducing GPT-5. https:\/\/openai.com\/index\/introducing-gpt-5\/. Accessed 2025-11-04."},{"key":"e_1_3_3_1_22_2","doi-asserted-by":"publisher","DOI":"10.1145\/3701716.3715225"},{"key":"e_1_3_3_1_23_2","unstructured":"Google\u00a0Cloud Platform. 2020. Online Boutique. https:\/\/github.com\/GoogleCloudPlatform\/microservices-demo. Accessed 2025-06-03."},{"key":"e_1_3_3_1_24_2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.emnlp-main.622"},{"key":"e_1_3_3_1_25_2","doi-asserted-by":"publisher","unstructured":"Friedrich Pukelsheim. 1994. The Three Sigma Rule. The American Statistician 48 2 (1994) 88\u201391. 10.1080\/00031305.1994.10476030","DOI":"10.1080\/00031305.1994.10476030"},{"key":"e_1_3_3_1_26_2","doi-asserted-by":"publisher","DOI":"10.1109\/COINS65080.2025.11125748"},{"key":"e_1_3_3_1_27_2","unstructured":"Evelien Riddell. 2026. Grounded or Guessing? An Empirical Evaluation of LLM Reasoning in Agentic Workflows for Root Cause Analysis in Cloud-based Systems. Master\u2019s thesis. University of Waterloo. https:\/\/hdl.handle.net\/10012\/22841"},{"key":"e_1_3_3_1_28_2","unstructured":"Evelien Riddell. 2026. Online Repository and Supplementary Material. https:\/\/github.com\/boerste\/rca-llm-reasoning"},{"key":"e_1_3_3_1_29_2","doi-asserted-by":"publisher","DOI":"10.1145\/3663529.3663841"},{"key":"e_1_3_3_1_30_2","doi-asserted-by":"publisher","unstructured":"Jacopo Soldani and Antonio Brogi. 2022. Anomaly Detection and Failure Root Cause Analysis in (Micro) Service-Based Cloud Applications: A Survey. ACM Comput. Surv. 55 3 Article 59 (Feb. 2022) 39\u00a0pages. 10.1145\/3501297","DOI":"10.1145\/3501297"},{"key":"e_1_3_3_1_31_2","volume-title":"Distributed Systems Observability","author":"Sridharan Cindy","year":"2018","unstructured":"Cindy Sridharan. 2018. Distributed Systems Observability. O\u2019Reilly Media, Inc."},{"key":"e_1_3_3_1_32_2","doi-asserted-by":"publisher","unstructured":"Yicheng Sui Yuzhe Zhang Jianjun Sun Ting Xu Shenglin Zhang Zhengdan Li Yongqian Sun Fangrui Guo Junyu Shen Yuzhi Zhang Dan Pei Xiao Yang and Li Yu. 2023. LogKG: Log Failure Diagnosis Through Knowledge Graph. IEEE Transactions on Services Computing 16 5 (2023) 3493\u20133507. 10.1109\/TSC.2023.3293890","DOI":"10.1109\/TSC.2023.3293890"},{"key":"e_1_3_3_1_33_2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.acl-long.147"},{"key":"e_1_3_3_1_34_2","unstructured":"Tingting Wang and Guilin Qi. 2024. A Comprehensive Survey on Root Cause Analysis in (Micro) Services: Methodologies Challenges and Trends. arxiv:https:\/\/arXiv.org\/abs\/2408.00803\u00a0[cs.SE]"},{"key":"e_1_3_3_1_35_2","doi-asserted-by":"publisher","DOI":"10.1145\/3691620.3695485"},{"key":"e_1_3_3_1_36_2","doi-asserted-by":"publisher","DOI":"10.1145\/3627673.3680016"},{"key":"e_1_3_3_1_37_2","doi-asserted-by":"publisher","DOI":"10.52202\/068431-1800"},{"key":"e_1_3_3_1_38_2","doi-asserted-by":"publisher","unstructured":"Frank Wilcoxon. 1945. Individual comparisons by ranking methods. Biometrics Bulletin 1 6 (1945) 80\u201383. 10.2307\/3001968","DOI":"10.2307\/3001968"},{"key":"e_1_3_3_1_39_2","unstructured":"Xue Wu and Kostas Tsioutsiouliklis. 2024. Thinking with Knowledge Graphs: Enhancing LLM Reasoning Through Structured Data. arxiv:https:\/\/arXiv.org\/abs\/2412.10654\u00a0[cs.CL]"},{"key":"e_1_3_3_1_40_2","unstructured":"Shuaiyu Xie Jian Wang Hanbin He Zhihao Wang Yuqi Zhao Neng Zhang and Bing Li. 2025. TVDiag: A Task-oriented and View-invariant Failure Diagnosis Framework with Multimodal Data. arxiv:https:\/\/arXiv.org\/abs\/2407.19711\u00a0[cs.SE]"},{"key":"e_1_3_3_1_41_2","volume-title":"The Thirteenth International Conference on Learning Representations (ICLR)","author":"Xu Junjielong","year":"2025","unstructured":"Junjielong Xu, Qinan Zhang, Zhiqing Zhong, Shilin He, Chaoyun Zhang, Qingwei Lin, Dan Pei, Pinjia He, Dongmei Zhang, and Qi Zhang. 2025. OpenRCA: Can Large Language Models Locate the Root Cause of Software Failures?. In The Thirteenth International Conference on Learning Representations (ICLR). https:\/\/openreview.net\/forum?id=M4qNIzQYpd"},{"key":"e_1_3_3_1_42_2","unstructured":"An Yang Anfeng Li Baosong Yang Beichen Zhang Binyuan Hui Bo Zheng Bowen Yu Chang Gao Chengen Huang Chenxu Lv Chujie Zheng Dayiheng Liu Fan Zhou Fei Huang Feng Hu Hao Ge Haoran Wei Huan Lin Jialong Tang Jian Yang Jianhong Tu Jianwei Zhang Jianxin Yang Jiaxi Yang Jing Zhou Jingren Zhou Junyang Lin Kai Dang Keqin Bao Kexin Yang Le Yu Lianghao Deng Mei Li Mingfeng Xue Mingze Li Pei Zhang Peng Wang Qin Zhu Rui Men Ruize Gao Shixuan Liu Shuang Luo Tianhao Li Tianyi Tang Wenbiao Yin Xingzhang Ren Xinyu Wang Xinyu Zhang Xuancheng Ren Yang Fan Yang Su Yichang Zhang Yinger Zhang Yu Wan Yuqiong Liu Zekun Wang Zeyu Cui Zhenru Zhang Zhipeng Zhou and Zihan Qiu. 2025. Qwen3 Technical Report. arxiv:https:\/\/arXiv.org\/abs\/2505.09388\u00a0[cs.CL]"},{"key":"e_1_3_3_1_43_2","volume-title":"The Eleventh International Conference on Learning Representations (ICLR)","author":"Yao Shunyu","year":"2023","unstructured":"Shunyu Yao, Jeffrey Zhao, Dian Yu, Nan Du, Izhak Shafran, Karthik\u00a0R Narasimhan, and Yuan Cao. 2023. ReAct: Synergizing Reasoning and Acting in Language Models. In The Eleventh International Conference on Learning Representations (ICLR). https:\/\/openreview.net\/forum?id=WE_vluYUL-X"},{"key":"e_1_3_3_1_44_2","volume-title":"International Conference on Learning Representations (ICLR)","author":"Ye Jiayi","year":"2025","unstructured":"Jiayi Ye, Yanbo Wang, Yue Huang, Dongping Chen, Qihui Zhang, Nuno Moniz, Tian Gao, Werner Geyer, Chao Huang, Pin-Yu Chen, Nitesh\u00a0V Chawla, and Xiangliang Zhang. 2025. Justice or Prejudice? Quantifying Biases in LLM-as-a-Judge. In International Conference on Learning Representations (ICLR). https:\/\/openreview.net\/forum?id=3GTtZFiajM"},{"key":"e_1_3_3_1_45_2","doi-asserted-by":"publisher","DOI":"10.1145\/3611643.3616249"},{"key":"e_1_3_3_1_46_2","doi-asserted-by":"publisher","unstructured":"Shenglin Zhang Pengxiang Jin Zihan Lin Yongqian Sun Bicheng Zhang Sibo Xia Zhengdan Li Zhenyu Zhong Minghua Ma Wa Jin Dai Zhang and Dan Zhu Zhenyu andlas\u00a0Pei. 2023. Robust Failure Diagnosis of Microservice System Through Multimodal Data. IEEE Transactions on Services Computing 16 6 (2023) 3851\u20133864. 10.1109\/TSC.2023.3290018","DOI":"10.1109\/TSC.2023.3290018"},{"key":"e_1_3_3_1_47_2","doi-asserted-by":"publisher","unstructured":"Shenglin Zhang Sibo Xia Wenzhao Fan Binpeng Shi Xiao Xiong Zhenyu Zhong Minghua Ma Yongqian Sun and Dan Pei. 2025. Failure Diagnosis in Microservice Systems: A Comprehensive Survey and Analysis. ACM Trans. Softw. Eng. Methodol. 35 1 Article 2 (Dec. 2025) 55\u00a0pages. 10.1145\/3715005","DOI":"10.1145\/3715005"},{"key":"e_1_3_3_1_48_2","volume-title":"International Conference on Learning Representations (ICLR)","author":"Zhang* Tianyi","year":"2020","unstructured":"Tianyi Zhang*, Varsha Kishore*, Felix Wu*, Kilian\u00a0Q. Weinberger, and Yoav Artzi. 2020. BERTScore: Evaluating Text Generation with BERT. In International Conference on Learning Representations (ICLR). https:\/\/openreview.net\/forum?id=SkeHuCVFDr"},{"key":"e_1_3_3_1_49_2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.findings-emnlp.232"},{"key":"e_1_3_3_1_50_2","doi-asserted-by":"publisher","DOI":"10.1145\/3663529.3663846"},{"key":"e_1_3_3_1_51_2","doi-asserted-by":"publisher","unstructured":"Xiao Zhang Qi Wang Mingyi Li Yuan Yuan Mengbai Xiao Fuzhen Zhuang and Dongxiao Yu. 2025. TAMO:Fine-Grained Root Cause Analysis via Tool-Assisted LLM Agent With Multi-Modality Observation Data in Cloud-Native Systems. IEEE Transactions on Services Computing 18 6 (2025) 4221\u20134233. 10.1109\/TSC.2025.3629066","DOI":"10.1109\/TSC.2025.3629066"},{"key":"e_1_3_3_1_52_2","doi-asserted-by":"publisher","DOI":"10.1145\/3589334.3645442"},{"key":"e_1_3_3_1_53_2","doi-asserted-by":"publisher","DOI":"10.52202\/075280-2020"}],"event":{"name":"FORGE '26: IEEE\/ACM Third International Conference on AI Foundation Models and Software Engineering","location":"Rio de Janeiro , Brazil","acronym":"FORGE '26","sponsor":["SIGSOFT ACM Special Interest Group on Software Engineering"]},"container-title":["Proceedings of the 2026 IEEE\/ACM Third International Conference on AI Foundation Models and Software Engineering"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3793655.3793732","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,7,21]],"date-time":"2026-07-21T16:49:36Z","timestamp":1784652576000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3793655.3793732"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,4,12]]},"references-count":52,"alternative-id":["10.1145\/3793655.3793732","10.1145\/3793655"],"URL":"https:\/\/doi.org\/10.1145\/3793655.3793732","relation":{},"subject":[],"published":{"date-parts":[[2026,4,12]]},"assertion":[{"value":"2026-07-21","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}