{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,10]],"date-time":"2026-04-10T17:06:50Z","timestamp":1775840810016,"version":"3.50.1"},"publisher-location":"New York, NY, USA","reference-count":84,"publisher":"ACM","content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2026,4,13]]},"DOI":"10.1145\/3774904.3792551","type":"proceedings-article","created":{"date-parts":[[2026,4,9]],"date-time":"2026-04-09T21:54:39Z","timestamp":1775771679000},"page":"4184-4195","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":0,"title":["AgentPRM: Process Reward Models for LLM Agents via Step-Wise Promise and Progress"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0000-0001-8299-8449","authenticated-orcid":false,"given":"Zhiheng","family":"Xi","sequence":"first","affiliation":[{"name":"Fudan University, Shanghai, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0002-7470-4193","authenticated-orcid":false,"given":"Chenyang","family":"Liao","sequence":"additional","affiliation":[{"name":"Fudan University, Shanghai, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0001-0577-406X","authenticated-orcid":false,"given":"Guanyu","family":"Li","sequence":"additional","affiliation":[{"name":"Fudan University, Shanghai, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0008-1526-104X","authenticated-orcid":false,"given":"Zhihao","family":"Zhang","sequence":"additional","affiliation":[{"name":"Fudan University, Shanghai, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0006-3492-6663","authenticated-orcid":false,"given":"Wenxiang","family":"Chen","sequence":"additional","affiliation":[{"name":"Fudan University, Shanghai, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0005-9137-7886","authenticated-orcid":false,"given":"Binghai","family":"Wang","sequence":"additional","affiliation":[{"name":"Fudan University, Shanghai, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0003-4720-6524","authenticated-orcid":false,"given":"Senjie","family":"Jin","sequence":"additional","affiliation":[{"name":"Fudan University, Shanghai, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0008-8665-3999","authenticated-orcid":false,"given":"Yuhao","family":"Zhou","sequence":"additional","affiliation":[{"name":"Fudan University, Shanghai, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-3597-0176","authenticated-orcid":false,"given":"Jian","family":"Guan","sequence":"additional","affiliation":[{"name":"Ant Group, Hangzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-6079-7697","authenticated-orcid":false,"given":"Wei","family":"Wu","sequence":"additional","affiliation":[{"name":"Ant Group, Hangzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-9957-6661","authenticated-orcid":false,"given":"Tao","family":"Ji","sequence":"additional","affiliation":[{"name":"Fudan University, Shanghai, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-0059-0210","authenticated-orcid":false,"given":"Tao","family":"Gui","sequence":"additional","affiliation":[{"name":"Fudan University, Shanghai, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-0947-4942","authenticated-orcid":false,"given":"Qi","family":"Zhang","sequence":"additional","affiliation":[{"name":"Fudan University, Shanghai, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-9197-9426","authenticated-orcid":false,"given":"Xuanjing","family":"Huang","sequence":"additional","affiliation":[{"name":"Fudan University, Shanghai, China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2026,4,12]]},"reference":[{"key":"e_1_3_2_1_1_1","unstructured":"Renat Aksitov Sobhan Miryoosefi Zonglin Li Daliang Li Sheila Babayan Kavya Kopparapu Zachary Fisher Ruiqi Guo Sushant Prakash Pranesh Srinivasan Manzil Zaheer Felix Yu and Sanjiv Kumar. 2023. ReST meets ReAct: Self-Improvement for Multi-Step Reasoning LLM Agent. arXiv:2312.10003 [cs.CL] https:\/\/arxiv.org\/abs\/2312.10003"},{"key":"e_1_3_2_1_2_1","doi-asserted-by":"publisher","DOI":"10.48550\/ARXIV.2408.16737"},{"key":"e_1_3_2_1_3_1","doi-asserted-by":"crossref","unstructured":"EN Barron and H Ishii. 1989. The Bellman equation for minimizing the maximum cost. 1067-1090 pages.","DOI":"10.1016\/0362-546X(89)90096-5"},{"key":"e_1_3_2_1_4_1","doi-asserted-by":"publisher","unstructured":"Baian Chen Chang Shu Ehsan Shareghi Nigel Collier Karthik Narasimhan and Shunyu Yao. 2023. FireAct: Toward Language Agent Fine-tuning. arXiv:2310.05915 doi:10.48550\/ARXIV.2310.05915","DOI":"10.48550\/ARXIV.2310.05915"},{"key":"e_1_3_2_1_5_1","unstructured":"Guoxin Chen Minpeng Liao Chengxi Li and Kai Fan. 2024a. AlphaMath Almost Zero: Process Supervision without Process. http:\/\/papers.nips.cc\/paper_files\/paper\/2024\/hash\/30dfe47a3ccbee68cffa0c19ccb1bc00-Abstract-Conference.html"},{"key":"e_1_3_2_1_6_1","doi-asserted-by":"crossref","unstructured":"Wenxiang Chen Wei He Zhiheng Xi Honglin Guo Boyang Hong Jiazheng Zhang Rui Zheng Nijun Li Tao Gui Yun Li Qi Zhang and Xuanjing Huang. 2025b. Better Process Supervision with Bi-directional Rewarding Signals. arXiv:2503.04618 [cs.CL] https:\/\/arxiv.org\/abs\/2503.04618","DOI":"10.18653\/v1\/2025.findings-acl.747"},{"key":"e_1_3_2_1_7_1","unstructured":"Zhenfang Chen Delin Chen Rui Sun Wenjun Liu and Chuang Gan. 2025a. Inference-Time Scaling of Autonomous Agents from Automatic Reward Modeling And Planning. https:\/\/github.com\/heaplax\/ARMAP"},{"key":"e_1_3_2_1_8_1","doi-asserted-by":"publisher","unstructured":"Zehui Chen Kuikun Liu Qiuchen Wang Wenwei Zhang Jiangning Liu Dahua Lin Kai Chen and Feng Zhao. 2024b. Agent-FLAN: Designing Data and Methods of Effective Agent Tuning for Large Language Models. 9354-9366 pages. doi:10.18653\/V1\/2024.FINDINGS-ACL.557","DOI":"10.18653\/V1\/2024.FINDINGS-ACL.557"},{"key":"e_1_3_2_1_9_1","volume-title":"Thien Huu Nguyen, and Yoshua Bengio","author":"Chevalier-Boisvert Maxime","year":"2019","unstructured":"Maxime Chevalier-Boisvert, Dzmitry Bahdanau, Salem Lahlou, Lucas Willems, Chitwan Saharia, Thien Huu Nguyen, and Yoshua Bengio. 2019. BabyAI: A Platform to Study the Sample Efficiency of Grounded Language Learning. https:\/\/openreview.net\/forum?id=rJeXCo0cYX"},{"key":"e_1_3_2_1_10_1","unstructured":"Karl Cobbe Vineet Kosaraju Mohammad Bavarian Mark Chen Heewoo Jun Lukasz Kaiser Matthias Plappert Jerry Tworek Jacob Hilton Reiichiro Nakano Christopher Hesse and John Schulman. 2021. Training Verifiers to Solve Math Word Problems. arXiv:2110.14168 https:\/\/arxiv.org\/abs\/2110.14168"},{"key":"e_1_3_2_1_11_1","unstructured":"Sumanth Dathathri Andrea Madotto Janice Lan Jane Hung Eric Frank Piero Molino Jason Yosinski and Rosanne Liu. 2020. Plug and Play Language Models: A Simple Approach to Controlled Text Generation. arXiv:1912.02164 [cs.CL] https:\/\/arxiv.org\/abs\/1912.02164"},{"key":"e_1_3_2_1_12_1","unstructured":"DeepSeek-AI. 2025. DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. arXiv:2501.12948 [cs.CL] https:\/\/arxiv.org\/abs\/2501.12948"},{"key":"e_1_3_2_1_13_1","unstructured":"Xiang Deng Yu Gu Boyuan Zheng Shijie Chen Samuel Stevens Boshi Wang Huan Sun and Yu Su. 2023. Mind2Web: Towards a Generalist Agent for the Web. arXiv:2306.06070 [cs.CL] https:\/\/arxiv.org\/abs\/2306.06070"},{"key":"e_1_3_2_1_14_1","doi-asserted-by":"crossref","unstructured":"Yiwen Ding Zhiheng Xi Wei He Zhuoyuan Li Yitao Zhai Xiaowei Shi Xunliang Cai Tao Gui Qi Zhang and Xuanjing Huang. 2025. Mitigating Tail Narrowing in LLM Self-Improvement via Socratic-Guided Sampling. arXiv:2411.00750 [cs.CL] https:\/\/arxiv.org\/abs\/2411.00750","DOI":"10.18653\/v1\/2025.naacl-long.533"},{"key":"e_1_3_2_1_15_1","doi-asserted-by":"publisher","DOI":"10.18653\/V1\/2023.EMNLP-MAIN.507"},{"key":"e_1_3_2_1_16_1","volume-title":"Hausknecht and Peter Stone","author":"Matthew","year":"2015","unstructured":"Matthew J. Hausknecht and Peter Stone. 2015. Deep Recurrent Q-Learning for Partially Observable MDPs. 29-37 pages. http:\/\/www.aaai.org\/ocs\/index.php\/FSS\/FSS15\/paper\/view\/11673"},{"key":"e_1_3_2_1_17_1","doi-asserted-by":"crossref","unstructured":"Zhiwei He Tian Liang Wenxiang Jiao Zhuosheng Zhang Yujiu Yang Rui Wang Zhaopeng Tu Shuming Shi and Xing Wang. 2024. Exploring Human-Like Translation Strategy with Large Language Models. 229-246 pages.","DOI":"10.1162\/tacl_a_00642"},{"key":"e_1_3_2_1_18_1","unstructured":"Lanxiang Hu Qiyu Li Anze Xie Nan Jiang Ion Stoica Haojian Jin and Hao Zhang. 2025. GameArena: Evaluating LLM Reasoning through Live Computer Games. arXiv:2412.06394 [cs.AI] https:\/\/arxiv.org\/abs\/2412.06394"},{"key":"e_1_3_2_1_19_1","volume-title":"CTRL: A Conditional Transformer Language Model for Controllable Generation. arXiv:1909.05858 [cs.CL] https:\/\/arxiv.org\/abs\/1909.05858","author":"Keskar Nitish Shirish","year":"2019","unstructured":"Nitish Shirish Keskar, Bryan McCann, Lav R. Varshney, Caiming Xiong, and Richard Socher. 2019. CTRL: A Conditional Transformer Language Model for Controllable Generation. arXiv:1909.05858 [cs.CL] https:\/\/arxiv.org\/abs\/1909.05858"},{"key":"e_1_3_2_1_20_1","volume-title":"Po-Yu Huang","author":"Koh Jing Yu","year":"2024","unstructured":"Jing Yu Koh, Robert Lo, Lawrence Jang, Vikram Duvvur, Ming Chong Lim, Po-Yu Huang, Graham Neubig, Shuyan Zhou, Ruslan Salakhutdinov, and Daniel Fried. 2024a. VisualWebArena: Evaluating Multimodal Agents on Realistic Visual Web Tasks. arXiv:2401.13649 [cs.LG] https:\/\/arxiv.org\/abs\/2401.13649"},{"key":"e_1_3_2_1_21_1","doi-asserted-by":"publisher","unstructured":"Jing Yu Koh Stephen McAleer Daniel Fried and Ruslan Salakhutdinov. 2024b. Tree Search for Language Model Agents. arXiv:2407.01476 doi:10.48550\/ARXIV.2407.01476","DOI":"10.48550\/ARXIV.2407.01476"},{"key":"e_1_3_2_1_22_1","doi-asserted-by":"publisher","DOI":"10.1145\/3649449"},{"key":"e_1_3_2_1_23_1","doi-asserted-by":"publisher","unstructured":"Wendi Li and Yixuan Li. 2024. Process Reward Model with Q-Value Rankings. arXiv:2410.11287 doi:10.48550\/ARXIV.2410.11287","DOI":"10.48550\/ARXIV.2410.11287"},{"key":"e_1_3_2_1_24_1","unstructured":"Hunter Lightman Vineet Kosaraju Yuri Burda Harrison Edwards Bowen Baker Teddy Lee Jan Leike John Schulman Ilya Sutskever and Karl Cobbe. 2024. Let's Verify Step by Step. https:\/\/openreview.net\/forum?id=v8L0pN6EOi"},{"key":"e_1_3_2_1_25_1","unstructured":"Zongyu Lin Yao Tang Da Yin Stuart X. Yao Ziniu Hu Yizhou Sun and Kai-Wei Chang. 2024. Q* Agent: Optimizing Language Agents with Q-Guided Exploration. https:\/\/openreview.net\/forum?id=rxUz2DaulF"},{"key":"e_1_3_2_1_26_1","doi-asserted-by":"publisher","unstructured":"Chris Yuhao Liu Liang Zeng Jiacai Liu Rui Yan Jujie He Chaojie Wang Shuicheng Yan Yang Liu and Yahui Zhou. 2024b. Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs. arXiv:2410.18451 doi:10.48550\/ARXIV.2410.18451","DOI":"10.48550\/ARXIV.2410.18451"},{"key":"e_1_3_2_1_27_1","unstructured":"Xiao Liu Hao Yu Hanchen Zhang Yifan Xu Xuanyu Lei Hanyu Lai Yu Gu Hangliang Ding Kaiwen Men Kejuan Yang Shudan Zhang Xiang Deng Aohan Zeng Zhengxiao Du Chenhui Zhang Sheng Shen Tianjun Zhang Yu Su Huan Sun Minlie Huang Yuxiao Dong and Jie Tang. 2024a. AgentBench: Evaluating LLMs as Agents. https:\/\/openreview.net\/forum?id=zAdUB0aCTQ"},{"key":"e_1_3_2_1_28_1","doi-asserted-by":"publisher","DOI":"10.48550\/ARXIV.2308.05960"},{"key":"e_1_3_2_1_29_1","doi-asserted-by":"publisher","unstructured":"Liangchen Luo Yinxiao Liu Rosanne Liu Samrat Phatale Harsh Lara Yunxuan Li Lei Shu Yun Zhu Lei Meng Jiao Sun and Abhinav Rastogi. 2024. Improve Mathematical Reasoning in Language Models by Automated Process Supervision. arXiv:2406.06592 doi:10.48550\/ARXIV.2406.06592","DOI":"10.48550\/ARXIV.2406.06592"},{"key":"e_1_3_2_1_30_1","unstructured":"Bingchen Miao Yang Wu Minghe Gao Qifan Yu Wendong Bu Wenqiao Zhang Yunfei Li Siliang Tang Tat-Seng Chua and Juncheng Li. 2025. Boosting Virtual Agent Learning and Reasoning: A Step-wise Multi-dimensional and Generalist Reward Model with Benchmark. arXiv:2503.18665 [cs.CV] https:\/\/arxiv.org\/abs\/2503.18665"},{"key":"e_1_3_2_1_31_1","unstructured":"Yasmin Moslem Rejwanul Haque John D. Kelleher and Andy Way. 2023. Adaptive Machine Translation with Large Language Models. arXiv:2301.13294 [cs.CL] https:\/\/arxiv.org\/abs\/2301.13294"},{"key":"e_1_3_2_1_32_1","unstructured":"OpenAI. 2024a. Hello GPT-4o. https:\/\/openai.com\/index\/hello-gpt-4o\/"},{"key":"e_1_3_2_1_33_1","unstructured":"OpenAI. 2024b. Introducing OpenAI o1-preview. https:\/\/openai.com\/index\/introducing-openai-o1-preview\/"},{"key":"e_1_3_2_1_34_1","unstructured":"Long Ouyang Jeffrey Wu Xu Jiang Diogo Almeida Carroll L. Wainwright Pamela Mishkin Chong Zhang Sandhini Agarwal Katarina Slama Alex Ray John Schulman Jacob Hilton Fraser Kelton Luke Miller Maddie Simens Amanda Askell Peter Welinder Paul F. Christiano Jan Leike and Ryan Lowe. 2022. Training language models to follow instructions with human feedback. http:\/\/papers.nips.cc\/paper_files\/paper\/2022\/hash\/b1efde53be364a73914f58805a001731-Abstract-Conference.html"},{"key":"e_1_3_2_1_35_1","volume-title":"Orak: A Foundational Benchmark for Training and Evaluating LLM Agents on Diverse Video Games. arXiv:2506.03610 [cs.AI] https:\/\/arxiv.org\/abs\/2506.03610","author":"Park Dongmin","year":"2025","unstructured":"Dongmin Park, Minkyu Kim, Beongjun Choi, Junhyuck Kim, Keon Lee, Jonghyun Lee, Inkyu Park, Byeong-Uk Lee, Jaeyoung Hwang, Jaewoo Ahn, Ameya S. Mahabaleshwarkar, Bilal Kartal, Pritam Biswas, Yoshi Suhara, Kangwook Lee, and Jaewoong Cho. 2025. Orak: A Foundational Benchmark for Training and Evaluating LLM Agents on Diverse Video Games. arXiv:2506.03610 [cs.AI] https:\/\/arxiv.org\/abs\/2506.03610"},{"key":"e_1_3_2_1_36_1","doi-asserted-by":"publisher","unstructured":"Archiki Prasad Alexander Koller Mareike Hartmann Peter Clark Ashish Sabharwal Mohit Bansal and Tushar Khot. 2024. ADaPT: As-Needed Decomposition and Planning with Language Models. 4226-4252 pages. doi:10.18653\/V1\/2024.FINDINGS-NAACL.264","DOI":"10.18653\/V1\/2024.FINDINGS-NAACL.264"},{"key":"e_1_3_2_1_37_1","unstructured":"QwenTeam. 2024. Qwen2.5: A Party of Foundation Models. https:\/\/qwenlm.github.io\/blog\/qwen2.5\/"},{"key":"e_1_3_2_1_38_1","unstructured":"Rafael Rafailov Archit Sharma Eric Mitchell Christopher D. Manning Stefano Ermon and Chelsea Finn. 2023. Direct Preference Optimization: Your Language Model is Secretly a Reward Model. http:\/\/papers.nips.cc\/paper_files\/paper\/2023\/hash\/a85b405ed65c6477a4fe8302b5e06ce7-Abstract-Conference.html"},{"key":"e_1_3_2_1_39_1","unstructured":"John Schulman Philipp Moritz Sergey Levine Michael I. Jordan and Pieter Abbeel. 2016. High-Dimensional Continuous Control Using Generalized Advantage Estimation. http:\/\/arxiv.org\/abs\/1506.02438"},{"key":"e_1_3_2_1_40_1","doi-asserted-by":"publisher","DOI":"10.48550\/ARXIV.2410.08146"},{"key":"e_1_3_2_1_41_1","unstructured":"Noah Shinn Federico Cassano Ashwin Gopinath Karthik Narasimhan and Shunyu Yao. 2023. Reflexion: language agents with verbal reinforcement learning. http:\/\/papers.nips.cc\/paper_files\/paper\/2023\/hash\/1b44b878bb782e6954cd888628510e90-Abstract-Conference.html"},{"key":"e_1_3_2_1_42_1","doi-asserted-by":"publisher","unstructured":"Charlie Snell Jaehoon Lee Kelvin Xu and Aviral Kumar. 2024. Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters. arXiv:2408.03314 doi:10.48550\/ARXIV.2408.03314","DOI":"10.48550\/ARXIV.2408.03314"},{"key":"e_1_3_2_1_43_1","unstructured":"Yifan Song Da Yin Xiang Yue Jie Huang Sujian Li and Bill Yuchen Lin. 2024. Trial and Error: Exploration-Based Trajectory Optimization for LLM Agents. arXiv:2403.02502 [cs.CL] https:\/\/arxiv.org\/abs\/2403.02502"},{"key":"e_1_3_2_1_44_1","doi-asserted-by":"crossref","unstructured":"Richard S Sutton. 1988. Learning to predict by the methods of temporal differences. 9-44 pages.","DOI":"10.1023\/A:1022633531479"},{"key":"e_1_3_2_1_45_1","unstructured":"Richard S Sutton and Andrew G Barto. 2018. Reinforcement learning: An introduction."},{"key":"e_1_3_2_1_46_1","unstructured":"Richard S Sutton David McAllester Satinder Singh and Yishay Mansour. 1999. Policy gradient methods for reinforcement learning with function approximation."},{"key":"e_1_3_2_1_47_1","doi-asserted-by":"crossref","unstructured":"Liyan Tang Zhaoyi Sun Betina Idnay Jordan G Nestor Ali Soroush Pierre A Elias Ziyang Xu Ying Ding Greg Durrett Justin F Rousseau et al. 2023. Evaluating large language models on medical evidence summarization. 158 pages.","DOI":"10.1101\/2023.04.22.23288967"},{"key":"e_1_3_2_1_48_1","unstructured":"Zhengwei Tao Ting-En Lin Xiancai Chen Hangyu Li Yuchuan Wu Yongbin Li Zhi Jin Fei Huang Dacheng Tao and Jingren Zhou. 2024. A Survey on Self-Evolution of Large Language Models. arXiv:2404.14387 [cs.CL] https:\/\/arxiv.org\/abs\/2404.14387"},{"key":"e_1_3_2_1_49_1","doi-asserted-by":"publisher","DOI":"10.48550\/ARXIV.2312.11805"},{"key":"e_1_3_2_1_50_1","doi-asserted-by":"publisher","unstructured":"Llama Team. 2023b. Llama 2: Open Foundation and Fine-Tuned Chat Models. arXiv:2307.09288 doi:10.48550\/ARXIV.2307.09288","DOI":"10.48550\/ARXIV.2307.09288"},{"key":"e_1_3_2_1_51_1","doi-asserted-by":"publisher","unstructured":"Llama Team. 2024. The Llama 3 Herd of Models. arXiv:2407.21783 doi:10.48550\/ARXIV.2407.21783","DOI":"10.48550\/ARXIV.2407.21783"},{"key":"e_1_3_2_1_52_1","doi-asserted-by":"publisher","unstructured":"Luong Trung Xinbo Zhang Zhanming Jie Peng Sun Xiaoran Jin and Hang Li. 2024. ReFT: Reasoning with Reinforced Fine-Tuning. 7601-7614 pages. doi:10.18653\/v1\/2024.acl-long.410","DOI":"10.18653\/v1\/2024.acl-long.410"},{"key":"e_1_3_2_1_53_1","doi-asserted-by":"publisher","unstructured":"Jonathan Uesato Nate Kushman Ramana Kumar H. Francis Song Noah Y. Siegel Lisa Wang Antonia Creswell Geoffrey Irving and Irina Higgins. 2022. Solving math word problems with process- and outcome-based feedback. arXiv:2211.14275 doi:10.48550\/ARXIV.2211.14275","DOI":"10.48550\/ARXIV.2211.14275"},{"key":"e_1_3_2_1_54_1","volume-title":"Louis Blankemeier, Jean-Benoit Delbrouck, Asad Aali, Christian Bluethgen, Anuj Pareek, Malgorzata Polacin, Eduardo Pontes Reis, Anna Seehofnerov\u00e1, et al.","author":"Veen Dave Van","year":"2024","unstructured":"Dave Van Veen, Cara Van Uden, Louis Blankemeier, Jean-Benoit Delbrouck, Asad Aali, Christian Bluethgen, Anuj Pareek, Malgorzata Polacin, Eduardo Pontes Reis, Anna Seehofnerov\u00e1, et al., 2024. Adapted large language models can outperform medical experts in clinical text summarization. 1134-1142 pages."},{"key":"e_1_3_2_1_55_1","doi-asserted-by":"publisher","unstructured":"Binghai Wang Rui Zheng Lu Chen Yan Liu Shihan Dou Caishuang Huang Wei Shen Senjie Jin Enyu Zhou Chenyu Shi Songyang Gao Nuo Xu Yuhao Zhou Xiaoran Fan Zhiheng Xi Jun Zhao Xiao Wang Tao Ji Hang Yan Lixing Shen Zhan Chen Tao Gui Qi Zhang Xipeng Qiu Xuanjing Huang Zuxuan Wu and Yu-Gang Jiang. 2024c. Secrets of RLHF in Large Language Models Part II: Reward Modeling. arXiv:2401.06080 doi:10.48550\/ARXIV.2401.06080","DOI":"10.48550\/ARXIV.2401.06080"},{"key":"e_1_3_2_1_56_1","volume-title":"Digital Player: Evaluating Large Language Models based Human-like Agent in Games. arXiv:2502.20807 [cs.LG] https:\/\/arxiv.org\/abs\/2502.20807","author":"Wang Jiawei","year":"2025","unstructured":"Jiawei Wang, Kai Wang, Shaojie Lin, Runze Wu, Bihan Xu, Lingeng Jiang, Shiwei Zhao, Renyu Zhu, Haoyu Liu, Zhipeng Hu, Zhong Fan, Le Li, Tangjie Lyu, and Changjie Fan. 2025b. Digital Player: Evaluating Large Language Models based Human-like Agent in Games. arXiv:2502.20807 [cs.LG] https:\/\/arxiv.org\/abs\/2502.20807"},{"key":"e_1_3_2_1_57_1","doi-asserted-by":"crossref","unstructured":"Longyue Wang Chenyang Lyu Tianbo Ji Zhirui Zhang Dian Yu Shuming Shi and Zhaopeng Tu. 2023. Document-Level Machine Translation with Large Language Models. arXiv:2304.02210 [cs.CL] https:\/\/arxiv.org\/abs\/2304.02210","DOI":"10.18653\/v1\/2023.emnlp-main.1036"},{"key":"e_1_3_2_1_58_1","doi-asserted-by":"publisher","DOI":"10.1007\/S11704-024-40231-1"},{"key":"e_1_3_2_1_59_1","doi-asserted-by":"publisher","unstructured":"Peiyi Wang Lei Li Zhihong Shao Runxin Xu Damai Dai Yifei Li Deli Chen Yu Wu and Zhifang Sui. 2024a. Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations. 9426-9439 pages. doi:10.18653\/V1\/2024.ACL-LONG.510","DOI":"10.18653\/V1\/2024.ACL-LONG.510"},{"key":"e_1_3_2_1_60_1","unstructured":"Weiyun Wang Zhangwei Gao Lianjie Chen Zhe Chen Jinguo Zhu Xiangyu Zhao Yangzhou Liu Yue Cao Shenglong Ye Xizhou Zhu Lewei Lu Haodong Duan Yu Qiao Jifeng Dai and Wenhai Wang. 2025a. VisualPRM: An Effective Process Reward Model for Multimodal Reasoning. arXiv:2503.10291 [cs.CV] https:\/\/arxiv.org\/abs\/2503.10291"},{"key":"e_1_3_2_1_61_1","doi-asserted-by":"crossref","unstructured":"Yu Wang Nan Yang Liang Wang and Furu Wei. 2025c. Examining False Positives under Inference Scaling for Mathematical Reasoning. arXiv:2502.06217 [cs.CL]","DOI":"10.18653\/v1\/2025.emnlp-main.632"},{"key":"e_1_3_2_1_62_1","doi-asserted-by":"publisher","unstructured":"Zhiheng Xi Wenxiang Chen Xin Guo Wei He Yiwen Ding Boyang Hong Ming Zhang Junzhe Wang Senjie Jin Enyu Zhou Rui Zheng Xiaoran Fan Xiao Wang Limao Xiong Yuhao Zhou Weiran Wang Changhao Jiang Yicheng Zou Xiangyang Liu Zhangyue Yin Shihan Dou Rongxiang Weng Wensen Cheng Qi Zhang Wenjuan Qin Yongyan Zheng Xipeng Qiu Xuanjing Huang and Tao Gui. 2023. The Rise and Potential of Large Language Model Based Agents: A Survey. arXiv:2309.07864 doi:10.48550\/ARXIV.2309.07864","DOI":"10.48550\/ARXIV.2309.07864"},{"key":"e_1_3_2_1_63_1","unstructured":"Zhiheng Xi Wenxiang Chen Boyang Hong Senjie Jin Rui Zheng Wei He Yiwen Ding Shichun Liu Xin Guo Junzhe Wang Honglin Guo Wei Shen Xiaoran Fan Yuhao Zhou Shihan Dou Xiao Wang Xinbo Zhang Peng Sun Tao Gui Qi Zhang and Xuanjing Huang. 2024a. Training Large Language Models for Reasoning through Reverse Curriculum Reinforcement Learning. arXiv:2402.05808 [cs.AI] https:\/\/arxiv.org\/abs\/2402.05808"},{"key":"e_1_3_2_1_64_1","doi-asserted-by":"publisher","unstructured":"Zhiheng Xi Yiwen Ding Wenxiang Chen Boyang Hong Honglin Guo Junzhe Wang Dingwen Yang Chenyang Liao Xin Guo Wei He Songyang Gao Lu Chen Rui Zheng Yicheng Zou Tao Gui Qi Zhang Xipeng Qiu Xuanjing Huang Zuxuan Wu and Yu-Gang Jiang. 2024b. AgentGym: Evolving Large Language Model-based Agents across Diverse Environments. arXiv:2406.04151 doi:10.48550\/ARXIV.2406.04151","DOI":"10.48550\/ARXIV.2406.04151"},{"key":"e_1_3_2_1_65_1","unstructured":"Yu Xia Jingru Fan Weize Chen Siyu Yan Xin Cong Zhong Zhang Yaxi Lu Yankai Lin Zhiyuan Liu and Maosong Sun. 2025. AgentRM: Enhancing Agent Generalization with Reward Modeling. arXiv:2502.18407 [cs.CL] https:\/\/arxiv.org\/abs\/2502.18407"},{"key":"e_1_3_2_1_66_1","doi-asserted-by":"crossref","unstructured":"Weimin Xiong Yifan Song Xiutian Zhao Wenhao Wu Xun Wang Ke Wang Cheng Li Wei Peng and Sujian Li. 2024. Watch Every Step! LLM Agent Learning via Iterative Step-Level Process Refinement. arXiv:2406.11176 [cs.CL] https:\/\/arxiv.org\/abs\/2406.11176","DOI":"10.18653\/v1\/2024.emnlp-main.93"},{"key":"e_1_3_2_1_67_1","volume-title":"Amr Sharaf, and Hany Hassan Awadalla.","author":"Xu Haoran","year":"2024","unstructured":"Haoran Xu, Young Jin Kim, Amr Sharaf, and Hany Hassan Awadalla. 2024. A Paradigm Shift in Machine Translation: Boosting Translation Performance of Large Language Models. arXiv:2309.11674 [cs.CL] https:\/\/arxiv.org\/abs\/2309.11674"},{"key":"e_1_3_2_1_68_1","unstructured":"Nancy Xu Sam Masling Michael Du Giovanni Campagna Larry Heck James Landay and Monica S Lam. 2021. Grounding Open-Domain Instructions to Automate Web Support Tasks. arXiv:2103.16057 [cs.CL] https:\/\/arxiv.org\/abs\/2103.16057"},{"key":"e_1_3_2_1_69_1","doi-asserted-by":"publisher","unstructured":"Hui Yang Sifu Yue and Yunzhong He. 2023. Auto-GPT for Online Decision Making: Benchmarks and Additional Opinions. arXiv:2306.02224 doi:10.48550\/ARXIV.2306.02224","DOI":"10.48550\/ARXIV.2306.02224"},{"key":"e_1_3_2_1_70_1","unstructured":"Zonghan Yang Peng Li Ming Yan Ji Zhang Fei Huang and Yang Liu. 2024. ReAct Meets ActRe: When Language Agents Enjoy Training Data Autonomy. arXiv:2403.14589 [cs.AI] https:\/\/arxiv.org\/abs\/2403.14589"},{"key":"e_1_3_2_1_71_1","unstructured":"Shunyu Yao Howard Chen John Yang and Karthik Narasimhan. 2022. WebShop: Towards Scalable Real-World Web Interaction with Grounded Language Agents. http:\/\/papers.nips.cc\/paper_files\/paper\/2022\/hash\/82ad13ec01f9fe44c01cb91814fd7b8c-Abstract-Conference.html"},{"key":"e_1_3_2_1_72_1","unstructured":"Shunyu Yao Jeffrey Zhao Dian Yu Nan Du Izhak Shafran Karthik R. Narasimhan and Yuan Cao. 2023. ReAct: Synergizing Reasoning and Acting in Language Models. https:\/\/openreview.net\/forum?id=WE_vluYUL-X"},{"key":"e_1_3_2_1_73_1","doi-asserted-by":"publisher","unstructured":"Fei Yu Anningzhe Gao and Benyou Wang. 2024. OVM Outcome-supervised Value Models for Planning in Mathematical Reasoning. 858-875 pages. doi:10.18653\/V1\/2024.FINDINGS-NAACL.55","DOI":"10.18653\/V1\/2024.FINDINGS-NAACL.55"},{"key":"e_1_3_2_1_74_1","unstructured":"Zheng Yuan Hongyi Yuan Chengpeng Li Guanting Dong Keming Lu Chuanqi Tan Chang Zhou and Jingren Zhou. 2023. Scaling Relationship on Learning Mathematical Reasoning with Large Language Models. arXiv:2308.01825 [cs.CL] https:\/\/arxiv.org\/abs\/2308.01825"},{"key":"e_1_3_2_1_75_1","unstructured":"Eric Zelikman Yuhuai Wu Jesse Mu and Noah Goodman. 2022. STaR: Bootstrapping Reasoning With Reasoning. https:\/\/openreview.net\/forum?id=_3ELRdg2sgI"},{"key":"e_1_3_2_1_76_1","doi-asserted-by":"publisher","unstructured":"Aohan Zeng Mingdao Liu Rui Lu Bowen Wang Xiao Liu Yuxiao Dong and Jie Tang. 2024. AgentTuning: Enabling Generalized Agent Abilities for LLMs. 3053-3077 pages. doi:10.18653\/V1\/2024.FINDINGS-ACL.181","DOI":"10.18653\/V1\/2024.FINDINGS-ACL.181"},{"key":"e_1_3_2_1_77_1","doi-asserted-by":"publisher","unstructured":"Yuanzhao Zhai Tingkai Yang Kele Xu Dawei Feng Cheng Yang Bo Ding and Huaimin Wang. 2024. Enhancing Decision-Making for LLM Agents via Step-Level Q-Value Models. arXiv:2409.09345 doi:10.48550\/ARXIV.2409.09345","DOI":"10.48550\/ARXIV.2409.09345"},{"key":"e_1_3_2_1_78_1","unstructured":"Biao Zhang Barry Haddow and Alexandra Birch. 2023a. Prompting Large Language Model for Machine Translation: A Case Study. 41092-41110 pages. https:\/\/proceedings.mlr.press\/v202\/zhang23m.html"},{"key":"e_1_3_2_1_79_1","doi-asserted-by":"publisher","unstructured":"Dan Zhang Sining Zhoubian Yisong Yue Yuxiao Dong and Jie Tang. 2024b. ReST-MCTS*: LLM Self-Training via Process Reward Guided Tree Search. arXiv:2406.03816 doi:10.48550\/ARXIV.2406.03816","DOI":"10.48550\/ARXIV.2406.03816"},{"key":"e_1_3_2_1_80_1","doi-asserted-by":"publisher","unstructured":"Hanqing Zhang Haolin Song Shaoyu Li Ming Zhou and Dawei Song. 2023b. A Survey of Controllable Text Generation Using Transformer-based Pre-trained Language Models. 37 pages. doi:10.1145\/3617680","DOI":"10.1145\/3617680"},{"key":"e_1_3_2_1_81_1","volume-title":"Hashimoto","author":"Zhang Tianyi","year":"2024","unstructured":"Tianyi Zhang, Faisal Ladhak, Esin Durmus, Percy Liang, Kathleen McKeown, and Tatsunori B. Hashimoto. 2024a. Benchmarking Large Language Models for News Summarization. 39-57 pages."},{"key":"e_1_3_2_1_82_1","unstructured":"Yang Zhang Hanlei Jin Dan Meng Jun Wang and Jinghua Tan. 2025a. A Comprehensive Survey on Process-Oriented Automatic Text Summarization with Exploration of LLM-Based Methods. arXiv:2403.02901 [cs.AI] https:\/\/arxiv.org\/abs\/2403.02901"},{"key":"e_1_3_2_1_83_1","unstructured":"Yimeng Zhang Tian Wang Jiri Gesi Ziyi Wang Yuxuan Lu Jiacheng Lin Sinong Zhan Vianne Gao Ruochen Jiao Junze Liu Kun Qian Yuxin Tang Ran Xue Houyu Zhang Qingjun Cui Yufan Guo and Dakuo Wang. 2025b. Shop-R1: Rewarding LLMs to Simulate Human Behavior in Online Shopping via Reinforcement Learning. arXiv:2507.17842 [cs.CL] https:\/\/arxiv.org\/abs\/2507.17842"},{"key":"e_1_3_2_1_84_1","unstructured":"Shuyan Zhou Frank F. Xu Hao Zhu Xuhui Zhou Robert Lo Abishek Sridhar Xianyi Cheng Tianyue Ou Yonatan Bisk Daniel Fried Uri Alon and Graham Neubig. 2024. WebArena: A Realistic Web Environment for Building Autonomous Agents. https:\/\/openreview.net\/forum?id=oKn9c6ytLx"}],"event":{"name":"WWW '26: The ACM Web Conference 2026","location":"Dubai United Arab Emirates","sponsor":["SIGWEB ACM Special Interest Group on Hypertext, Hypermedia, and Web"]},"container-title":["Proceedings of the ACM Web Conference 2026"],"original-title":[],"deposited":{"date-parts":[[2026,4,10]],"date-time":"2026-04-10T16:18:33Z","timestamp":1775837913000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3774904.3792551"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,4,12]]},"references-count":84,"alternative-id":["10.1145\/3774904.3792551","10.1145\/3774904"],"URL":"https:\/\/doi.org\/10.1145\/3774904.3792551","relation":{},"subject":[],"published":{"date-parts":[[2026,4,12]]},"assertion":[{"value":"2026-04-12","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}