{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,29]],"date-time":"2026-07-29T16:00:30Z","timestamp":1785340830131,"version":"3.55.0"},"publisher-location":"New York, NY, USA","reference-count":57,"publisher":"ACM","license":[{"start":{"date-parts":[[2026,4,12]],"date-time":"2026-04-12T00:00:00Z","timestamp":1775952000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/legalcode"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62272219"],"award-info":[{"award-number":["62272219"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"name":"Cooperation Fund of Huawei Cooperation Project","award":["TC20230202021-2024-12"],"award-info":[{"award-number":["TC20230202021-2024-12"]}]},{"name":"Postgraduate Research & Practice Innovation Program of Jiangsu Province","award":["KYCX25_0314"],"award-info":[{"award-number":["KYCX25_0314"]}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2026,4,12]]},"DOI":"10.1145\/3794763.3794798","type":"proceedings-article","created":{"date-parts":[[2026,7,29]],"date-time":"2026-07-29T15:18:58Z","timestamp":1785338338000},"page":"49-60","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":0,"title":["Self-Improving Code Generation via Semantic Entropy and Behavioral Consensus"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0009-0000-0644-3775","authenticated-orcid":false,"given":"Huan","family":"Zhang","sequence":"first","affiliation":[{"name":"State Key Laboratory for Novel Software Technology, Nanjing University, Nanjing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-6128-7293","authenticated-orcid":false,"given":"Wei","family":"Cheng","sequence":"additional","affiliation":[{"name":"State Key Laboratory for Novel Software Technology, Nanjing University, Nanjing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3635-6335","authenticated-orcid":false,"given":"Wei","family":"Hu","sequence":"additional","affiliation":[{"name":"State Key Laboratory for Novel Software Technology, National Institute of Healthcare Data Science, Nanjing University, Nanjing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"320","published-online":{"date-parts":[[2026,7,29]]},"reference":[{"key":"e_1_3_3_2_2_2","unstructured":"Wasi\u00a0Uddin Ahmad Aleksander Ficek Mehrzad Samadi Jocelyn Huang Vahid Noroozi Somshubra Majumdar and Boris Ginsburg. 2025. OpenCodeInstruct: A Large-scale Instruction Tuning Dataset for Code LLMs. CoRR 2504.04030 (2025) 1\u201322."},{"key":"e_1_3_3_2_3_2","unstructured":"Jacob Austin Augustus Odena Maxwell\u00a0I. Nye Maarten Bosma Henryk Michalewski David Dohan Ellen Jiang Carrie\u00a0J. Cai Michael Terry Quoc\u00a0V. Le and Charles Sutton. 2021. Program Synthesis with Large Language Models. CoRR 2108.07732 (2021) 1\u201334."},{"key":"e_1_3_3_2_4_2","doi-asserted-by":"crossref","unstructured":"Earl\u00a0T. Barr Mark Harman Phil McMinn Muzammil Shahbaz and Shin Yoo. 2015. The Oracle Problem in Software Testing: A Survey. IEEE Trans. Softw. Eng. 41 (2015) 507\u2013525.","DOI":"10.1109\/TSE.2014.2372785"},{"key":"e_1_3_3_2_5_2","volume-title":"ICLR","author":"Chen Bei","year":"2023","unstructured":"Bei Chen, Fengji Zhang, Anh Nguyen, Daoguang Zan, Zeqi Lin, Jian-Guang Lou, and Weizhu Chen. 2023. CodeT: Code Generation with Generated Tests. In ICLR. OpenReview.net, Kigali, Rwanda, 19\u00a0pages."},{"key":"e_1_3_3_2_6_2","unstructured":"Mark Chen Jerry Tworek Heewoo Jun Qiming Yuan Henrique\u00a0Pond\u00e9 de Oliveira\u00a0Pinto Jared Kaplan Harrison Edwards Yuri Burda Nicholas Joseph Greg Brockman Alex Ray Raul Puri Gretchen Krueger Michael Petrov Heidy Khlaaf Girish Sastry Pamela Mishkin Brooke Chan Scott Gray Nick Ryder Mikhail Pavlov Alethea Power Lukasz Kaiser Mohammad Bavarian Clemens Winter Philippe Tillet Felipe\u00a0Petroski Such Dave Cummings Matthias Plappert Fotios Chantzis Elizabeth Barnes Ariel Herbert-Voss William\u00a0Hebgen Guss Alex Nichol Alex Paino Nikolas Tezak Jie Tang Igor Babuschkin Suchir Balaji Shantanu Jain William Saunders Christopher Hesse Andrew\u00a0N. Carr Jan Leike Joshua Achiam Vedant Misra Evan Morikawa Alec Radford Matthew Knight Miles Brundage Mira Murati Katie Mayer Peter Welinder Bob McGrew Dario Amodei Sam McCandlish Ilya Sutskever and Wojciech Zaremba. 2021. Evaluating Large Language Models Trained on Code. CoRR 2107.03374 (2021) 1\u201335."},{"key":"e_1_3_3_2_7_2","volume-title":"ICLR","author":"Chen Xinyun","year":"2024","unstructured":"Xinyun Chen, Maxwell Lin, Nathanael Sch\u00e4rli, and Denny Zhou. 2024. Teaching Large Language Models to Self-Debug. In ICLR. OpenReview.net, Vienna, Austria, 78\u00a0pages."},{"key":"e_1_3_3_2_8_2","doi-asserted-by":"crossref","unstructured":"Xiancai Chen Zhengwei Tao Kechi Zhang Changzhi Zhou Wanli Gu Yuanpeng He Mengdi Zhang Xunliang Cai Haiyan Zhao and Zhi Jin. 2025. Revisit Self-Debugging with Self-Generated Tests for Code Generation. CoRR 2501.12793 (2025) 1\u201320.","DOI":"10.18653\/v1\/2025.acl-long.881"},{"key":"e_1_3_3_2_9_2","doi-asserted-by":"publisher","DOI":"10.1145\/3510003.3510141"},{"key":"e_1_3_3_2_10_2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.acl-long.251"},{"key":"e_1_3_3_2_11_2","doi-asserted-by":"publisher","DOI":"10.1145\/2025113.2025179"},{"key":"e_1_3_3_2_12_2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2025.findings-naacl.5"},{"key":"e_1_3_3_2_13_2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.naacl-long.366"},{"key":"e_1_3_3_2_14_2","unstructured":"Daya Guo Qihao Zhu Dejian Yang Zhenda Xie Kai Dong Wentao Zhang Guanting Chen Xiao Bi Y. Wu Y.\u00a0K. Li Fuli Luo Yingfei Xiong and Wenfeng Liang. 2024. DeepSeek-Coder: When the Large Language Model Meets Programming - The Rise of Code Intelligence. CoRR 2401.14196 (2024) 1\u201323."},{"key":"e_1_3_3_2_15_2","unstructured":"Zhongmou He Yee\u00a0Man Choi Kexun Zhang Jiabao Ji Junting Zhou Dejia Xu Ivan Bercovich Aidan Zhang and Lei Li. 2025. HardTests: Synthesizing High-Quality Test Cases for LLM Coding. CoRR 2505.24098 (2025) 1\u201337."},{"key":"e_1_3_3_2_16_2","volume-title":"NeurIPS","author":"Hendrycks Dan","year":"2021","unstructured":"Dan Hendrycks, Steven Basart, Saurav Kadavath, Mantas Mazeika, Akul Arora, Ethan Guo, Collin Burns, Samir Puranik, Horace He, Dawn Song, and Jacob Steinhardt. 2021. Measuring Coding Challenge Competence With APPS. In NeurIPS. Curran Associates Inc., Virtual, 11\u00a0pages."},{"key":"e_1_3_3_2_17_2","doi-asserted-by":"publisher","DOI":"10.1109\/ICSE55347.2025.00098"},{"key":"e_1_3_3_2_18_2","volume-title":"ICLR","author":"Hu Edward\u00a0J","year":"2022","unstructured":"Edward\u00a0J Hu, yelong shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen. 2022. LoRA: Low-Rank Adaptation of Large Language Models. In ICLR. OpenReview.net, Virtual, 26\u00a0pages."},{"key":"e_1_3_3_2_19_2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.emnlp-main.67"},{"key":"e_1_3_3_2_20_2","doi-asserted-by":"crossref","unstructured":"Yuheng Huang Jiayang Song Zhijie Wang Shengming Zhao Huaming Chen Felix Juefei-Xu and Lei Ma. 2025. Look Before You Leap: An Exploratory Study of Uncertainty Analysis for Large Language Models. TSE 51 2 (2025) 413\u2013429.","DOI":"10.1109\/TSE.2024.3519464"},{"key":"e_1_3_3_2_21_2","unstructured":"Binyuan Hui Jian Yang Zeyu Cui Jiaxi Yang Dayiheng Liu Lei Zhang Tianyu Liu Jiajun Zhang Bowen Yu Keming Lu Kai Dang Yang Fan Yichang Zhang An Yang Rui Men Fei Huang Bo Zheng Yibo Miao Shanghaoran Quan Yunlong Feng Xingzhang Ren Xuancheng Ren Jingren Zhou and Junyang Lin. 2024. Qwen2.5-Coder Technical Report. CoRR 2409.12186 (2024) 1\u201332."},{"key":"e_1_3_3_2_22_2","volume-title":"ICLR","author":"Jain Naman","year":"2025","unstructured":"Naman Jain, King Han, Alex Gu, Wen-Ding Li, Fanjia Yan, Tianjun Zhang, Sida Wang, Armando Solar-Lezama, Koushik Sen, and Ion Stoica. 2025. LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code. In ICLR. OpenReview.net, Singapore, 46\u00a0pages."},{"key":"e_1_3_3_2_23_2","doi-asserted-by":"crossref","unstructured":"Xue Jiang Yihong Dong Lecheng Wang Zheng Fang Qiwei Shang Ge Li Zhi Jin and Wenpin Jiao. 2024. Self-Planning Code Generation with Large Language Models. ACM Trans. Softw. Eng. Methodol. 33 (2024) 30\u00a0pages.","DOI":"10.1145\/3672456"},{"key":"e_1_3_3_2_24_2","doi-asserted-by":"publisher","DOI":"10.1145\/3691620.3695513"},{"key":"e_1_3_3_2_25_2","volume-title":"ICLR","author":"Jiao Fangkai","year":"2025","unstructured":"Fangkai Jiao, Geyang Guo, Xingxing Zhang, Nancy\u00a0F. Chen, Shafiq Joty, and Furu Wei. 2025. Preference Optimization for Reasoning with Pseudo Feedback. In ICLR. OpenReview.net, Singapore, 28\u00a0pages."},{"key":"e_1_3_3_2_26_2","volume-title":"ICLR","author":"Kuhn Lorenz","year":"2023","unstructured":"Lorenz Kuhn, Yarin Gal, and Sebastian Farquhar. 2023. Semantic Uncertainty: Linguistic Invariances for Uncertainty Estimation in Natural Language Generation. In ICLR. OpenReview.net, Kigali, Rwanda, 23\u00a0pages."},{"key":"e_1_3_3_2_27_2","doi-asserted-by":"publisher","DOI":"10.1145\/3600006.3613165"},{"key":"e_1_3_3_2_28_2","doi-asserted-by":"publisher","DOI":"10.52202\/068431-1549"},{"key":"e_1_3_3_2_29_2","doi-asserted-by":"crossref","unstructured":"Jia Li Ge Li Yongmin Li and Zhi Jin. 2025. Structured Chain-of-Thought Prompting for Code Generation. ACM Trans. Softw. Eng. Methodol. 34 (2025) 23\u00a0pages.","DOI":"10.1145\/3690635"},{"key":"e_1_3_3_2_30_2","unstructured":"Kefan Li and Yuan Yuan. 2024. Large Language Models as Test Case Generators: Performance Evaluation and Enhancement. CoRR 2404.13340 (2024) 1\u201320."},{"key":"e_1_3_3_2_31_2","unstructured":"Rongao Li Jie Fu Bo-Wen Zhang Tao Huang Zhihong Sun Chen Lyu Guang Liu Zhi Jin and Ge Li. 2023. TACO: Topics in Algorithmic COde generation dataset. CoRR 2312.14852 (2023) 1\u201310."},{"key":"e_1_3_3_2_32_2","doi-asserted-by":"crossref","unstructured":"Yujia Li David Choi Junyoung Chung Nate Kushman Julian Schrittwieser R\u00e9mi Leblond Tom Eccles James Keeling Felix Gimeno Agustin\u00a0Dal Lago Thomas Hubert Peter Choy Cyprien de Masson\u00a0d\u2019Autume Igor Babuschkin Xinyun Chen Po-Sen Huang Johannes Welbl Sven Gowal Alexey Cherepanov James Molloy Daniel\u00a0J. Mankowitz Esme\u00a0Sutherland Robson Pushmeet Kohli Nando de Freitas Koray Kavukcuoglu and Oriol Vinyals. 2022. Competition-Level Code Generation with AlphaCode. Science 378 (2022) 1092\u20131097.","DOI":"10.1126\/science.abq1158"},{"key":"e_1_3_3_2_33_2","doi-asserted-by":"publisher","DOI":"10.52202\/075280-0943"},{"key":"e_1_3_3_2_34_2","unstructured":"Jiate Liu Yiqin Zhu Kaiwen Xiao QIANG FU Xiao Han Yang Wei and Deheng Ye. 2023. RLTF: Reinforcement Learning from Unit Test Feedback. Trans. Mach. Learn. Res. 11 (2023) 15\u00a0pages."},{"key":"e_1_3_3_2_35_2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2025.acl-long.20"},{"key":"e_1_3_3_2_36_2","doi-asserted-by":"publisher","DOI":"10.1145\/3510454.3516829"},{"key":"e_1_3_3_2_37_2","volume-title":"ICLR","author":"Luo Ziyang","year":"2024","unstructured":"Ziyang Luo, Can Xu, Pu Zhao, Qingfeng Sun, Xiubo Geng, Wenxiang Hu, Chongyang Tao, Jing Ma, Qingwei Lin, and Daxin Jiang. 2024. WizardCoder: Empowering Code Large Language Models with Evol-Instruct. In ICLR. OpenReview.net, Vienna, Austria, 21\u00a0pages."},{"key":"e_1_3_3_2_38_2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2025.acl-long.343"},{"key":"e_1_3_3_2_39_2","volume-title":"ICLR","author":"Muennighoff Niklas","year":"2024","unstructured":"Niklas Muennighoff, Qian Liu, Armel\u00a0Randy Zebaze, Qinkai Zheng, Binyuan Hui, Terry\u00a0Yue Zhuo, Swayam Singh, Xiangru Tang, Leandro\u00a0Von Werra, and Shayne Longpre. 2024. OctoPack: Instruction Tuning Code Large Language Models. In ICLR. OpenReview.net, Vienna, Austria, 60\u00a0pages."},{"key":"e_1_3_3_2_40_2","unstructured":"OpenAI. 2023. GPT-4 Technical Report. CoRR 2303.08774 (2023) 1\u2013100."},{"key":"e_1_3_3_2_41_2","unstructured":"OpenAI. 2024. GPT-4o System Card. CoRR 2410.21276 (2024) 1\u201333."},{"key":"e_1_3_3_2_42_2","doi-asserted-by":"publisher","DOI":"10.1145\/1297846.1297902"},{"key":"e_1_3_3_2_43_2","unstructured":"Archiki Prasad Elias Stengel-Eskin Justin Chih-Yao Chen Zaid Khan and Mohit Bansal. 2025. Learning to Generate Unit Tests for Automated Debugging. CoRR 2502.01619 (2025) 1\u201319."},{"key":"e_1_3_3_2_44_2","doi-asserted-by":"publisher","DOI":"10.52202\/075280-2338"},{"key":"e_1_3_3_2_45_2","unstructured":"Baptiste Rozi\u00e8re Jonas Gehring Fabian Gloeckle Sten Sootla Itai Gat Xiaoqing\u00a0Ellen Tan Yossi Adi Jingyu Liu Romain Sauvestre Tal Remez J\u00e9r\u00e9my Rapin Artyom Kozhevnikov Ivan Evtimov Joanna Bitton Manish Bhatt Cristian\u00a0Canton Ferrer Aaron Grattafiori Wenhan Xiong Alexandre D\u00e9fossez Jade Copet Faisal Azhar Hugo Touvron Louis Martin Nicolas Usunier Thomas Scialom and Gabriel Synnaeve. 2023. Code Llama: Open Foundation Models for Code. CoRR 2308.12950 (2023) 1\u201348."},{"key":"e_1_3_3_2_46_2","unstructured":"Parshin Shojaee Aneesh Jain Sindhu Tipirneni and Chandan\u00a0K. Reddy. 2023. Execution-based Code Generation using Deep Reinforcement Learning. Trans. Mach. Learn. Res. 2023 (2023) 1\u201326."},{"key":"e_1_3_3_2_47_2","volume-title":"ICLR","author":"Wang Evan\u00a0Z.","year":"2025","unstructured":"Evan\u00a0Z. Wang, Federico Cassano, Catherine Wu, Yunfeng Bai, William Song, Vaskar Nath, Ziwen Han, Sean\u00a0M. Hendryx, Summer Yue, and Hugh Zhang. 2025. Planning in Natural Language Improves LLM Search for Code Generation. In ICLR. OpenReview.net, Singapore, 52\u00a0pages."},{"key":"e_1_3_3_2_48_2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2025.findings-naacl.197"},{"key":"e_1_3_3_2_49_2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.acl-long.259"},{"key":"e_1_3_3_2_50_2","doi-asserted-by":"publisher","DOI":"10.52202\/079017-2008"},{"key":"e_1_3_3_2_51_2","first-page":"52632","volume-title":"ICML","author":"Wei Yuxiang","year":"2024","unstructured":"Yuxiang Wei, Zhe Wang, Jiawei Liu, Yifeng Ding, and Lingming Zhang. 2024. Magicoder: Empowering Code Generation with OSS-Instruct. In ICML. JMLR.org, Vienna, Austria, 52632\u201352657."},{"key":"e_1_3_3_2_52_2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2025.findings-acl.365"},{"key":"e_1_3_3_2_53_2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.acl-long.280"},{"key":"e_1_3_3_2_54_2","doi-asserted-by":"crossref","unstructured":"Zhiqiang Yuan Mingwei Liu Shiji Ding Kaixin Wang Yixuan Chen Xin Peng and Yiling Lou. 2024. Evaluating and Improving ChatGPT for Unit Test Generation. Proc. ACM Softw. Eng. 1 FSE (2024) 1703\u20131726.","DOI":"10.1145\/3660783"},{"key":"e_1_3_3_2_55_2","unstructured":"Dylan Zhang Shizhe Diao Xueyan Zou and Hao Peng. 2024. PLUM: Improving Code LMs with Execution-Guided On-Policy Preference Learning Driven By Synthetic Test Cases. CoRR 2406.06887 (2024) 1\u201324."},{"key":"e_1_3_3_2_56_2","doi-asserted-by":"publisher","DOI":"10.1145\/3691620.3695506"},{"key":"e_1_3_3_2_57_2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2025.acl-long.771"},{"key":"e_1_3_3_2_58_2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2025.findings-acl.498"}],"event":{"name":"ICPC '26: 34th IEEE\/ACM International Conference on Program Comprehension","location":"Rio de Janeiro , Brazil","acronym":"ICPC '26","sponsor":["SIGSOFT ACM Special Interest Group on Software Engineering"]},"container-title":["Proceedings of the 2026 34th IEEE\/ACM International Conference on Program Comprehension"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3794763.3794798","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,7,29]],"date-time":"2026-07-29T15:20:01Z","timestamp":1785338401000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3794763.3794798"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,4,12]]},"references-count":57,"alternative-id":["10.1145\/3794763.3794798","10.1145\/3794763"],"URL":"https:\/\/doi.org\/10.1145\/3794763.3794798","relation":{},"subject":[],"published":{"date-parts":[[2026,4,12]]},"assertion":[{"value":"2026-07-29","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}