{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,1,30]],"date-time":"2026-01-30T19:18:46Z","timestamp":1769800726857,"version":"3.49.0"},"reference-count":38,"publisher":"IEEE","license":[{"start":{"date-parts":[[2025,11,27]],"date-time":"2025-11-27T00:00:00Z","timestamp":1764201600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2025,11,27]],"date-time":"2025-11-27T00:00:00Z","timestamp":1764201600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025,11,27]]},"DOI":"10.1109\/acompa69200.2025.00009","type":"proceedings-article","created":{"date-parts":[[2026,1,29]],"date-time":"2026-01-29T21:19:49Z","timestamp":1769721589000},"page":"7-14","source":"Crossref","is-referenced-by-count":0,"title":["Reward Design for Reinforcement Learning in the Development of Large Language Models"],"prefix":"10.1109","author":[{"given":"Thanh Thi","family":"Nguyen","sequence":"first","affiliation":[{"name":"Monash University,AiLECS Lab,Melbourne,Australia"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Campbell","family":"Wilson","sequence":"additional","affiliation":[{"name":"Monash University,AiLECS Lab,Melbourne,Australia"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Janis","family":"Dalins","sequence":"additional","affiliation":[{"name":"Monash University,AiLECS Lab,Australia"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.13140\/RG.2.2.18893.74727"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1126\/science.aar6404"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/TCYB.2020.2977374"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/tnnls.2024.3497992"},{"key":"ref5","first-page":"5671","article-title":"Large language model as a policy teacher for training reinforcement learning agents","volume-title":"International Joint Conference on Artificial Intelligence (IJCAI)","author":"Zhou"},{"key":"ref6","article-title":"Text2Reward: Reward shaping with language models for reinforcement learning","volume-title":"International Conference on Learning Representations (ICLR)","author":"Xie"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1145\/3626772.3657767"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-73113-6_1"},{"key":"ref9","article-title":"Unleashing the power of pre-trained language models for offline reinforcement learning","volume-title":"International Conference on Learning Representations (ICLR)","author":"Shi"},{"key":"ref10","article-title":"Training language models to self-correct via reinforcement learning","author":"Kumar","year":"2024","journal-title":"arXiv preprint arXiv:2409.12917"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.48550\/ARXIV.1706.03762"},{"key":"ref12","article-title":"Llama 2: Open foundation and fine-tuned chat models","author":"Touvron","year":"2023","journal-title":"arXiv preprint:2307.09288"},{"key":"ref13","article-title":"Gemma 2: Improving open language models at a practical size","author":"Riviere","year":"2024","journal-title":"arXiv preprint arXiv:2408.00118"},{"key":"ref14","article-title":"Mistral 7B","author":"Jiang","year":"2023","journal-title":"arXiv preprint arXiv:2310.06825"},{"key":"ref15","article-title":"Deepseek-R1: Incentivizing reasoning capability in LLMs via reinforcement learning","author":"Guo","year":"2025","journal-title":"arXiv preprint arXiv:2501.12948"},{"key":"ref16","article-title":"Proximal policy optimization algorithms","author":"Schulman","year":"2017","journal-title":"arXiv preprint arXiv:1707.06347"},{"key":"ref17","article-title":"DeepSeekMath: Pushing the limits of mathematical reasoning in open language models","author":"Shao","year":"2024","journal-title":"arXiv preprint arXiv:2402.03300"},{"key":"ref18","article-title":"Introducing ChatGPT","year":"2022","journal-title":"OpenAI"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.emnlp-demo.28"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.findings-acl.338"},{"key":"ref21","first-page":"21 314","article-title":"CodeRL: Mastering code generation through pretrained models and deep reinforcement learning","volume-title":"Annual Conference on Neural Information Processing Systems (NeurIPS)","volume":"35","author":"Le"},{"key":"ref22","article-title":"ReMax: A simple, effective, and efficient reinforcement learning method for aligning large language models","volume-title":"International Conference on Machine Learning","author":"Li"},{"key":"ref23","first-page":"8634","article-title":"Reflexion: Language agents with verbal reinforcement learning","volume-title":"Annual Conference on Neural Information Processing Systems (NeurIPS)","volume":"36","author":"Shinn"},{"key":"ref24","article-title":"Language model self-improvement by reinforcement learning contemplation","volume-title":"International Conference on Learning Representations (ICLR)","author":"Pang"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01044"},{"key":"ref26","article-title":"Training large language models for reasoning through reverse curriculum reinforcement learning","volume-title":"International Conference on Machine Learning","author":"Xi"},{"key":"ref27","first-page":"78 227","article-title":"Large language models are semi-parametric reinforcement learning agents","volume-title":"Annual Conference on Neural Information Processing Systems (NeurIPS)","volume":"36","author":"Zhang"},{"key":"ref28","first-page":"3676","article-title":"Grounding large language models in interactive environments with online reinforcement learning","volume-title":"International Conference on Machine Learning. PMLR","author":"Carta"},{"key":"ref29","article-title":"Fine-tuning large vision-language models as decision-making agents via reinforcement learning","volume-title":"Annual Conference on Neural Information Processing Systems (NeurIPS)","author":"Zhai"},{"key":"ref30","first-page":"9722","article-title":"ULTRAFEEDBACK: Boosting language models with scaled ai feedback","volume-title":"International Conference on Machine Learning. PMLR","author":"Cui"},{"key":"ref31","first-page":"53728","article-title":"Direct preference optimization: your language model is secretly a reward model","volume-title":"Annual Conference on Neural Information Processing Systems (NeurIPS)","author":"Rafailov"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.acl-long.510"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.findings-naacl.55"},{"key":"ref34","article-title":"DeepSeek-V3 technical report","volume-title":"arXiv preprint arXiv:2412.19437","author":"Liu","year":"2024"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2023.3292075"},{"key":"ref36","article-title":"The Llama 3 herd of models","author":"Dubey","year":"2024","journal-title":"arXiv preprint arXiv:2407.21783"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.14428\/esann\/2024.ES2024-222"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1145\/3735633"}],"event":{"name":"2025 19th International Conference on Advanced Computing and Analytics (ACOMPA)","location":"Ho Chi Minh City, Vietnam","start":{"date-parts":[[2025,11,27]]},"end":{"date-parts":[[2025,11,29]]}},"container-title":["2025 19th International Conference on Advanced Computing and Analytics (ACOMPA)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/11360088\/11360116\/11360190.pdf?arnumber=11360190","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,1,30]],"date-time":"2026-01-30T06:57:49Z","timestamp":1769756269000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11360190\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,11,27]]},"references-count":38,"URL":"https:\/\/doi.org\/10.1109\/acompa69200.2025.00009","relation":{},"subject":[],"published":{"date-parts":[[2025,11,27]]}}}