{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,22]],"date-time":"2026-06-22T20:49:25Z","timestamp":1782161365215,"version":"3.54.5"},"reference-count":34,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","license":[{"start":{"date-parts":[[2026,1,1]],"date-time":"2026-01-01T00:00:00Z","timestamp":1767225600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/legalcode"}],"funder":[{"DOI":"10.13039\/100015547","name":"Vietnam National University, Hanoi","doi-asserted-by":"publisher","award":["QG.23.73"],"award-info":[{"award-number":["QG.23.73"]}],"id":[{"id":"10.13039\/100015547","id-type":"DOI","asserted-by":"publisher"}]},{"name":"Intelligent Integration Co., Ltd. (INT2), Vietnam"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Access"],"published-print":{"date-parts":[[2026]]},"DOI":"10.1109\/access.2026.3701952","type":"journal-article","created":{"date-parts":[[2026,6,9]],"date-time":"2026-06-09T19:53:51Z","timestamp":1781034831000},"page":"89301-89322","source":"Crossref","is-referenced-by-count":0,"title":["Reinforcement Learning With Verifier Guidance and Penalty Shaping for Vietnamese Summarization Using Small Language Models"],"prefix":"10.1109","volume":"14","author":[{"ORCID":"https:\/\/orcid.org\/0009-0001-9501-4514","authenticated-orcid":false,"given":"Thi Thu Phuong","family":"Tran","sequence":"first","affiliation":[{"name":"Hanoi Metropolitan University, Nghia Do, Hanoi, Vietnam"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0000-3936-2250","authenticated-orcid":false,"given":"Trinh Hoang","family":"Vu","sequence":"additional","affiliation":[{"name":"VNU University of Engineering and Technology, Vietnam National University, Cau Giay, Hanoi, Vietnam"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0004-0912-6328","authenticated-orcid":false,"given":"Van Vinh","family":"Nguyen","sequence":"additional","affiliation":[{"name":"VNU University of Engineering and Technology, Vietnam National University, Cau Giay, Hanoi, Vietnam"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0006-2033-7788","authenticated-orcid":false,"given":"Phuong Thai","family":"Nguyen","sequence":"additional","affiliation":[{"name":"VNU University of Engineering and Technology, Vietnam National University, Cau Giay, Hanoi, Vietnam"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1162\/tacl_a_00373"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2022.emnlp-main.131"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2020.acl-main.173"},{"key":"ref4","first-page":"1","article-title":"A deep reinforced model for abstractive summarization","volume-title":"Proc. ICLR","author":"Paulus"},{"key":"ref5","first-page":"1","article-title":"Learning to summarize from human feedback","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Stiennon"},{"key":"ref6","article-title":"Scalable agent alignment via reward modeling: A research direction","author":"Leike","year":"2018","journal-title":"arXiv:1811.07871"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.52202\/075280-2338"},{"key":"ref8","article-title":"Concrete problems in AI safety","author":"Amodei","year":"2016","journal-title":"arXiv:1606.06565"},{"key":"ref9","first-page":"74","article-title":"ROUGE: A package for automatic evaluation of summaries","volume-title":"Proc. ACL Workshop","author":"Lin"},{"key":"ref10","first-page":"1","article-title":"BERTScore: Evaluating text generation with BERT","volume-title":"Proc. ICLR","author":"Zhang"},{"key":"ref11","volume-title":"MultiEvalSumViet2","author":"Trans","year":"2026"},{"key":"ref12","article-title":"Proximal policy optimization algorithms","author":"Schulman","year":"2017","journal-title":"arXiv:1707.06347"},{"key":"ref13","article-title":"DeepSeekMath: Pushing the limits of mathematical reasoning in open language models","author":"Shao","year":"2024","journal-title":"arXiv:2402.03300"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2020.findings-emnlp.360"},{"key":"ref15","article-title":"A comprehensive survey of reward models: Taxonomy, applications, challenges, and future","author":"Zhong","year":"2025","journal-title":"arXiv:2504.12328"},{"key":"ref16","first-page":"278","article-title":"Policy invariance under reward transformations: Theory and application to reward shaping","volume-title":"Proc. 16th Int. Conf. Mach. Learn.","author":"Ng"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2021.gem-1.10"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2020.emnlp-main.750"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2020.acl-main.450"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2021.emnlp-main.529"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1162\/tacl_a_00453"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2022.naacl-srw.18"},{"key":"ref23","article-title":"LoRA: Low-rank adaptation of large language models","author":"Hu","year":"2021","journal-title":"arXiv:2106.09685"},{"key":"ref24","first-page":"1","article-title":"Teaching machines to read and comprehend","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Hermann"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/D18-1206"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.emnlp-main.153"},{"key":"ref27","volume-title":"VnExpress","year":"2025"},{"key":"ref28","volume-title":"Vietnamese Summarization VR\/VRP Resources","author":"Trans","year":"2026"},{"key":"ref29","volume-title":"Llama-3.2-1B","year":"2024"},{"key":"ref30","volume-title":"Qwen3-0.6B","year":"2025"},{"key":"ref31","volume-title":"Qwen3-8B","year":"2025"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2020.findings-emnlp.92"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.52202\/068431-2011"},{"key":"ref34","volume-title":"Gemini Apps","year":"2026"}],"container-title":["IEEE Access"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/6287639\/11323511\/11556074.pdf?arnumber=11556074","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,6,22]],"date-time":"2026-06-22T19:57:42Z","timestamp":1782158262000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11556074\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026]]},"references-count":34,"URL":"https:\/\/doi.org\/10.1109\/access.2026.3701952","relation":{},"ISSN":["2169-3536"],"issn-type":[{"value":"2169-3536","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026]]}}}