{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,17]],"date-time":"2026-06-17T15:48:21Z","timestamp":1781711301365,"version":"3.54.5"},"reference-count":169,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","license":[{"start":{"date-parts":[[2026,1,1]],"date-time":"2026-01-01T00:00:00Z","timestamp":1767225600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2026,1,1]],"date-time":"2026-01-01T00:00:00Z","timestamp":1767225600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,1,1]],"date-time":"2026-01-01T00:00:00Z","timestamp":1767225600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/501100012166","name":"National Key Research and Development Program of China","doi-asserted-by":"publisher","award":["2023YFC3304605"],"award-info":[{"award-number":["2023YFC3304605"]}],"id":[{"id":"10.13039\/501100012166","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Cogn. Commun. Netw."],"published-print":{"date-parts":[[2026]]},"DOI":"10.1109\/tccn.2026.3683896","type":"journal-article","created":{"date-parts":[[2026,4,29]],"date-time":"2026-04-29T19:52:17Z","timestamp":1777492337000},"page":"7522-7544","source":"Crossref","is-referenced-by-count":1,"title":["Advanced Deep Reinforcement Learning for Agentic AI and Their Applications in Wireless Network"],"prefix":"10.1109","volume":"12","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-4035-8520","authenticated-orcid":false,"given":"Jie","family":"Zheng","sequence":"first","affiliation":[{"name":"State-Province Joint Engineering and Research Center of Advanced Networking and Intelligent Information Services, College of Computer Science, Northwest University, Xi&#x2019;an, Shaanxi, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-7442-7416","authenticated-orcid":false,"given":"Dusit","family":"Niyato","sequence":"additional","affiliation":[{"name":"College of Computing and Data Science, Nanyang Technological University, Nanyang, Singapore"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-6859-3645","authenticated-orcid":false,"given":"Ruichen","family":"Zhang","sequence":"additional","affiliation":[{"name":"College of Computing and Data Science, Nanyang Technological University, Nanyang, Singapore"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-1252-8761","authenticated-orcid":false,"given":"Jiacheng","family":"Wang","sequence":"additional","affiliation":[{"name":"College of Computing and Data Science, Nanyang Technological University, Nanyang, Singapore"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-1414-0621","authenticated-orcid":false,"given":"Jiangtian","family":"Nie","sequence":"additional","affiliation":[{"name":"Department of Computing Science, University of Aberdeen, Aberdeen, U.K."}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-8220-6525","authenticated-orcid":false,"given":"Hongyang","family":"Du","sequence":"additional","affiliation":[{"name":"the Department of Electrical and Electronic Engineering, University of Hong Kong, Hong Kong, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-8218-3490","authenticated-orcid":false,"given":"Jiawen","family":"Kang","sequence":"additional","affiliation":[{"name":"School of Automation, Guangdong University of Technology, Guangzhou, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-0236-6482","authenticated-orcid":false,"given":"Haijun","family":"Zhang","sequence":"additional","affiliation":[{"name":"Institute of Artificial Intelligence, University of Science and Technology Beijing, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-1807-7220","authenticated-orcid":false,"given":"Abbas","family":"Jamalipour","sequence":"additional","affiliation":[{"name":"School of Electrical and Computer Engineering, The University of Sydney, Sydney, Australia"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-7711-8072","authenticated-orcid":false,"given":"Dong In","family":"Kim","sequence":"additional","affiliation":[{"name":"Department of Electrical and Computer Engineering, Sungkyunkwan University, Suwon, South Korea"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/MNET.003.2200641"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/COMST.2019.2916583"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2024.3497992"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/COMST.2024.3465447"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/MCOM.001.2500005"},{"key":"ref6","article-title":"The landscape of agentic reinforcement learning for LLMs: A survey","author":"Zhang","year":"2025","journal-title":"arXiv:2509.02547"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/MCOM.001.2500073"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.32604\/cmes.2023.030649"},{"key":"ref9","article-title":"DeepSeek-r1: Incentivizing reasoning capability in LLMs via reinforcement learning","author":"Guo","year":"2025","journal-title":"arXiv:2501.12948"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/TMC.2025.3582864"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1007\/BF00992698"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1038\/nature14236"},{"key":"ref13","article-title":"On-line Q-learning using connectionist systems","volume-title":"Dept. of Engineering, University of Cambridge","author":"Rummery","year":"1994"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1007\/BF00992696"},{"key":"ref15","article-title":"Stabilizing policy gradients for sample-efficient reinforcement learning in LLM reasoning","author":"Melo","year":"2025","journal-title":"arXiv:2510.00819"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.52202\/075280-2338"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51701.2025.00181"},{"key":"ref18","first-page":"1","article-title":"Proximal policy optimization algorithms","volume-title":"Proc. 34th Int. Conf. Mach. Learn.","author":"Schulman"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.32657\/10356\/90191"},{"key":"ref20","first-page":"1861","article-title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Haarnoja"},{"key":"ref21","first-page":"3682","article-title":"Hierarchical deep reinforcement learning: Integrating temporal abstraction and intrinsic motivation","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"29","author":"Kulkarni"},{"key":"ref22","volume-title":"Reinforcement Learning: An Introduction","author":"Sutton","year":"2018"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1002\/SERIES1345"},{"issue":"5","key":"ref24","first-page":"14","article-title":"Deep learning in mobile and wireless networking: A survey","volume":"28","author":"Zhang","year":"2021","journal-title":"IEEE Wireless Commun."},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1109\/TCOMM.2024.3381712"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1109\/COMST.2021.3063822"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/JIOT.2020.3025365"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1109\/JSAC.2019.2904329"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1109\/TVT.2024.3359426"},{"key":"ref30","first-page":"4299","article-title":"Deep reinforcement learning from human preferences","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"30","author":"Christiano"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.52202\/068431-2011"},{"key":"ref32","article-title":"Constitutional AI: Harmlessness from AI feedback","author":"Bai","year":"2022","journal-title":"arXiv:2212.08073"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2022.acl-long.26"},{"key":"ref34","article-title":"Reward-aware preference optimization: A unified mathematical framework for model alignment","author":"Sun","year":"2025","journal-title":"arXiv:2502.00203"},{"key":"ref35","article-title":"Hybrid group relative policy optimization: A multi-sample approach to enhancing policy optimization","author":"Sane","year":"2025","journal-title":"arXiv:2502.01652"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.emnlp-main.626"},{"key":"ref37","first-page":"1","article-title":"React: Synergizing reasoning and acting in language models","volume-title":"Proc. 11th Int. Conf. Learn. Represent.","author":"Yao"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1109\/JSAC.2019.2933973"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1109\/TGCN.2024.3358230"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1109\/TWC.2024.3372694"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1109\/MWC.015.2300595"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1109\/COMST.2023.3323344"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1109\/ICC51166.2024.10622465"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1109\/MVT.2024.3524745"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1016\/j.vehcom.2025.100882"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1109\/LNET.2024.3503289"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.1109\/TIFS.2024.3423428"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1109\/JIOT.2024.3434713"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1109\/TAES.2024.3447636"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1109\/JIOT.2024.3392358"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1109\/WCNC57260.2024.10570857"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1109\/WCNC61545.2025.10978365"},{"key":"ref53","article-title":"Adaptive layer splitting for wireless LLM inference in edge computing: A model-based reinforcement learning approach","author":"Chen","year":"2024","journal-title":"arXiv:2406.02616"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1109\/EuCNC\/6GSummit63408.2025.11037178"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1109\/TSC.2024.3350050"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1109\/MNET.2025.3550959"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.1109\/TCOMM.2024.3409530"},{"key":"ref58","article-title":"RLVR-world: Training world models with reinforcement learning","author":"Wu","year":"2025","journal-title":"arXiv:2505.13934"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.1109\/TMC.2025.3547148"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.52202\/075280-0482"},{"key":"ref61","first-page":"55898","article-title":"Bootstrapping language models with DPO implicit rewards","volume-title":"Proc. Int. Conf. Represent. Learn.","author":"Chen"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2025.acl-long.1146"},{"key":"ref63","first-page":"1","article-title":"Towards federated RLHF with aggregated client preference for LLMs","volume-title":"Proc. 13th Int. Conf. Learn. Represent.","author":"Wu"},{"key":"ref64","first-page":"16484","article-title":"Taming overconfidence in LLMs: Reward calibration in RLHF","volume-title":"Proc. Int. Conf. Represent. Learn.","author":"Leng"},{"key":"ref65","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v39i24.34738"},{"key":"ref66","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.acl-long.56"},{"key":"ref67","first-page":"48842","article-title":"Language model self-improvement by reinforcement learning contemplation","volume-title":"Proc. Int. Conf. Represent. Learn.","author":"Pang"},{"key":"ref68","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.acl-long.427"},{"key":"ref69","doi-asserted-by":"publisher","DOI":"10.52202\/079017-0170"},{"key":"ref70","first-page":"54523","article-title":"Training language models to self-correct via reinforcement learning","volume-title":"Proc. Int. Conf. Represent. Learn.","author":"Kumar"},{"key":"ref71","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2025.acl-long.604"},{"key":"ref72","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2025.acl-long.1105"},{"key":"ref73","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2025.acl-long.747"},{"key":"ref74","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v40i38.40487"},{"key":"ref75","first-page":"11733","article-title":"Improving multi-agent reasoning via debate and cooperation","volume-title":"Proc. 41st Int. Conf. Mach. Learn.","author":"Du"},{"key":"ref76","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2025.acl-long.1395"},{"key":"ref77","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.acl-long.449"},{"key":"ref78","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.acl-long.231"},{"key":"ref79","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.02503"},{"key":"ref80","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.00609"},{"key":"ref81","doi-asserted-by":"publisher","DOI":"10.1109\/MCOMSTD.2025.3572604"},{"issue":"11","key":"ref82","first-page":"2550","article-title":"Communication-efficient distributed reinforcement learning for wireless networks","volume":"38","author":"Kim","year":"2020","journal-title":"IEEE J. Sel. Areas Commun."},{"key":"ref83","doi-asserted-by":"publisher","DOI":"10.1109\/COMST.2025.3564333"},{"key":"ref84","doi-asserted-by":"publisher","DOI":"10.1109\/mnet.2025.3605319"},{"key":"ref85","doi-asserted-by":"publisher","DOI":"10.1109\/MNET.2024.3510936"},{"key":"ref86","doi-asserted-by":"publisher","DOI":"10.1109\/JIOT.2025.3535623"},{"issue":"9","key":"ref87","first-page":"2511","article-title":"Applications of machine learning in wireless communications","volume":"40","author":"Chandler","year":"2019","journal-title":"IEEE J. Sel. Areas Commun."},{"key":"ref88","doi-asserted-by":"publisher","DOI":"10.1109\/TMC.2024.3396860"},{"issue":"1","key":"ref89","first-page":"259","article-title":"Proximal policy optimization for up\/downlink time slots allocation in 5\/6G dynamic TDD networks","volume":"19","author":"T. N. T. H","year":"2025","journal-title":"KSII Trans. Internet & Inf. Syst."},{"issue":"268","key":"ref90","first-page":"1","article-title":"Stable-baselines3: Reliable reinforcement learning implementations","volume":"22","author":"Raffin","year":"2021","journal-title":"J. Mach. Learn. Res."},{"issue":"3","key":"ref91","first-page":"1772","article-title":"Learning-based resource allocation for 6G: A tutorial on deep reinforcement learning","volume":"25","author":"Moon","year":"2023","journal-title":"IEEE Commun. Surveys Tuts."},{"key":"ref92","doi-asserted-by":"publisher","DOI":"10.1109\/TCE.2025.3594708"},{"key":"ref93","doi-asserted-by":"publisher","DOI":"10.3390\/electronics14040747"},{"key":"ref94","doi-asserted-by":"publisher","DOI":"10.1109\/OJCOMS.2025.3590760"},{"key":"ref95","article-title":"Human-in-the-loop: Real-time preference optimization","author":"Wang","year":"2025","journal-title":"arXiv:2506.02225"},{"key":"ref96","doi-asserted-by":"publisher","DOI":"10.1109\/JIOT.2025.3618644"},{"key":"ref97","doi-asserted-by":"publisher","DOI":"10.1109\/OJCOMS.2025.3534626"},{"key":"ref98","doi-asserted-by":"publisher","DOI":"10.1109\/JSAC.2025.3643844"},{"key":"ref99","doi-asserted-by":"publisher","DOI":"10.1109\/TWC.2025.3646155"},{"key":"ref100","article-title":"Reasoning language models for root cause analysis in 5G wireless networks","author":"Sana","year":"2025","journal-title":"arXiv:2507.21974"},{"issue":"12","key":"ref101","first-page":"10428","article-title":"Reinforcement learning for 6G: Fundamentals, applications, and challenges","volume":"10","author":"Zhou","year":"2023","journal-title":"IEEE Internet Things J."},{"key":"ref102","doi-asserted-by":"publisher","DOI":"10.1109\/COMST.2025.3614494"},{"issue":"6","key":"ref103","first-page":"182","article-title":"LLM-driven QoE optimization for video streaming: A data-centric perspective","volume":"37","author":"Zhang","year":"2023","journal-title":"IEEE Netw."},{"key":"ref104","doi-asserted-by":"publisher","DOI":"10.1007\/s10994-021-05961-4"},{"key":"ref105","article-title":"Large language model-enhanced reinforcement learning for low-altitude economy networking","author":"Cai","year":"2025","journal-title":"arXiv:2505.21045"},{"key":"ref106","article-title":"Wireless large AI model: Shaping the AI-native future of 6G and beyond","author":"Zhu","year":"2025","journal-title":"arXiv:2504.14653"},{"key":"ref107","doi-asserted-by":"publisher","DOI":"10.1109\/TCCN.2025.3528892"},{"key":"ref108","article-title":"Empowering intelligent low-altitude economy with large AI model deployment","author":"Lyu","year":"2025","journal-title":"arXiv:2505.22343"},{"key":"ref109","article-title":"Embodied AI-enhanced vehicular networks: An integrated large language models and reinforcement learning method","author":"Zhang","year":"2025","journal-title":"arXiv:2501.01141"},{"key":"ref110","doi-asserted-by":"publisher","DOI":"10.1109\/MNET.2024.3520983"},{"key":"ref111","doi-asserted-by":"publisher","DOI":"10.1109\/WCNC61545.2025.10978505"},{"key":"ref112","doi-asserted-by":"publisher","DOI":"10.1109\/MWC.001.2400384"},{"key":"ref113","doi-asserted-by":"publisher","DOI":"10.1109\/NetSoft60951.2024.10588921"},{"key":"ref114","doi-asserted-by":"publisher","DOI":"10.1109\/TCCN.2024.3482354"},{"key":"ref115","article-title":"LLM-empowered state representation for reinforcement learning","author":"Wang","year":"2024","journal-title":"arXiv:2407.13237"},{"key":"ref116","article-title":"Large language models for wireless communications: From adaptation to autonomy","author":"Liang","year":"2025","journal-title":"arXiv:2507.21524"},{"key":"ref117","doi-asserted-by":"publisher","DOI":"10.1109\/TCE.2024.3524612"},{"key":"ref118","first-page":"1381","article-title":"Self-adaptive wireless communication: Leveraging ML and agentic AI in smart telecommunication networks","volume":"31","author":"Sheelam","year":"2025","journal-title":"Metall. Mater. Eng."},{"issue":"1","key":"ref119","first-page":"3035","article-title":"AI-driven spectrum management: Using machine learning and agentic intelligence for dynamic wireless optimization","volume":"2","author":"Sheelam","year":"2024","journal-title":"Eur. Adv. J. for Emerg. Technol. (EAJET)"},{"issue":"1","key":"ref120","first-page":"221","article-title":"Agentic ai for autonomous network orchestration: A new frontier in telecommunications","volume":"46","author":"Komaragiri","year":"2025","journal-title":"eksplorium-buletin pusat teknologi bahan galian nuklir"},{"key":"ref121","article-title":"LAMeTA: Intent-aware agentic network optimization via a large AI model-empowered two-stage approach","author":"Liu","year":"2025","journal-title":"arXiv:2505.12247"},{"key":"ref122","doi-asserted-by":"publisher","DOI":"10.1109\/TCOMM.2024.3469542"},{"key":"ref123","article-title":"Edge general intelligence through world models and agentic AI: Fundamentals, solutions, and challenges","author":"Zhao","year":"2025","journal-title":"arXiv:2508.09561"},{"key":"ref124","article-title":"Secure multi-LLM agentic AI and agentification for edge general intelligence by zero-trust: A survey","author":"Liu","year":"2025","journal-title":"arXiv:2508.19870"},{"key":"ref125","article-title":"Agentic graph neural networks for wireless communications and networking towards edge general intelligence: A survey","author":"Lu","year":"2025","journal-title":"arXiv:2508.08620"},{"key":"ref126","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2025.acl-long.131"},{"key":"ref127","doi-asserted-by":"publisher","DOI":"10.1109\/MCOM.001.2500293"},{"key":"ref128","article-title":"EdgeAgentX: A novel framework for agentic AI at the edge in military communication networks","author":"Ray","year":"2025","journal-title":"arXiv:2505.18457"},{"key":"ref129","doi-asserted-by":"publisher","DOI":"10.1109\/JSAC.2024.3459073"},{"key":"ref130","doi-asserted-by":"publisher","DOI":"10.1109\/JPROC.2025.3526887"},{"key":"ref131","article-title":"Agentic AI empowered multi-UAV trajectory optimization in low-altitude economy networks","author":"Jiang","year":"2025","journal-title":"arXiv:2508.16379"},{"key":"ref132","article-title":"UAVs meet agentic AI: A multidomain survey of autonomous aerial intelligence and agentic UAVs","author":"Sapkota","year":"2025","journal-title":"arXiv:2506.08045"},{"key":"ref133","article-title":"Agentic satellite-augmented low-altitude economy and terrestrial networks: A survey on generative approaches","author":"Gao","year":"2025","journal-title":"arXiv:2507.14633"},{"key":"ref134","article-title":"AGORAN: An agentic open marketplace for 6G RAN automation","author":"Chatzistefanidis","year":"2025","journal-title":"arXiv:2508.09159"},{"key":"ref135","article-title":"Agentic DDQN-based scheduling for licensed and unlicensed band allocation in sidelink networks","author":"Chou","year":"2025","journal-title":"arXiv:2509.06775"},{"key":"ref136","article-title":"Vision-aided ISAC in low-altitude economy networks via de-diffused visual priors","author":"Gao","year":"2025","journal-title":"arXiv:2507.01574"},{"key":"ref137","doi-asserted-by":"publisher","DOI":"10.1109\/TCOMM.2023.3281880"},{"key":"ref138","doi-asserted-by":"publisher","DOI":"10.1016\/j.dcan.2023.06.003"},{"key":"ref139","doi-asserted-by":"publisher","DOI":"10.1109\/TCCN.2025.3594035"},{"key":"ref140","doi-asserted-by":"publisher","DOI":"10.1109\/TVT.2025.3577682"},{"key":"ref141","doi-asserted-by":"publisher","DOI":"10.1109\/TASE.2025.3558945"},{"key":"ref142","doi-asserted-by":"publisher","DOI":"10.1109\/ACCESS.2024.3427124"},{"key":"ref143","doi-asserted-by":"publisher","DOI":"10.1145\/3776745"},{"key":"ref144","article-title":"From agentification to self-evolving agentic AI for wireless networks: Concepts, approaches, and future research directions","author":"Zhao","year":"2025","journal-title":"arXiv:2510.05596"},{"key":"ref145","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v39i28.35378"},{"issue":"274","key":"ref146","first-page":"1","article-title":"CleanRL: High-quality single-file implementations of deep reinforcement learning algorithms","volume":"23","author":"Huang","year":"2021","journal-title":"J. Mach. Learn. Res."},{"key":"ref147","article-title":"Acme: A research framework for distributed reinforcement learning","author":"Hoffman","year":"2020","journal-title":"arXiv:2006.00979"},{"issue":"267","key":"ref148","first-page":"1","article-title":"Tianshou: A highly modularized deep reinforcement learning library","volume":"23","author":"Weng","year":"2021","journal-title":"J. Mach. Learn. Res."},{"issue":"77","key":"ref149","first-page":"1","article-title":"ChainerRL: A deep reinforcement learning library","volume":"22","author":"Fujita","year":"2021","journal-title":"J. Mach. Learn. Res."},{"key":"ref150","article-title":"OpenRLHF: An easy-to-use, scalable and high-performance RLHF framework","author":"Hu","year":"2025","journal-title":"arXiv:2405.11143"},{"key":"ref151","volume-title":"TRL: Transformer Reinforcement Learning","author":"von Werra et al","year":"2020"},{"key":"ref152","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.emnlp-main.530"},{"key":"ref153","doi-asserted-by":"publisher","DOI":"10.1145\/3689031.3696075"},{"key":"ref154","volume-title":"Slime: A LLM Post-Training Framework for RL Scaling","year":"2025"},{"key":"ref155","first-page":"3053","article-title":"RLlib: Abstractions for distributed reinforcement learning","volume-title":"Proc. 35th Int. Conf. Mach. Learn.","author":"Liang"},{"issue":"315","key":"ref156","first-page":"1","article-title":"MARLlib: A scalable and efficient multi-agent reinforcement learning library","volume":"24","author":"Hu","year":"2023","journal-title":"J. Mach. Learn. Res."},{"key":"ref157","volume-title":"Marti: A Framework for Multi-Agent LLM Systems Reinforced Training and Inference","author":"Zhang et al","year":"2025"},{"key":"ref158","doi-asserted-by":"publisher","DOI":"10.1109\/TKDE.2026.3658366"},{"key":"ref159","first-page":"1","article-title":"AReaL: A large-scale asynchronous reinforcement learning system for language reasoning","volume-title":"Proc. 3rd Workshop Efficient Syst. Found. Models","author":"Wei"},{"key":"ref160","volume-title":"SkyRL-v0: Train Real-World Long-Horizon Agents via Reinforcement Learning","author":"Cao","year":"2025"},{"key":"ref161","volume-title":"EasyR1: An Efficient, Scalable, Multi-Modality RL Training Framework","author":"Zheng","year":"2025"},{"key":"ref162","article-title":"AWorld: Orchestrating the training recipe for agentic AI","author":"Yu","year":"2025","journal-title":"arXiv:2508.20404"},{"key":"ref163","article-title":"Agent lightning: Train ANY AI agents with reinforcement learning","author":"Luo","year":"2025","journal-title":"arXiv:2508.03680"},{"key":"ref164","article-title":"AgentFly: Extensible and scalable reinforcement learning for LM agents","author":"Wang","year":"2025","journal-title":"arXiv:2507.14897"},{"key":"ref165","doi-asserted-by":"publisher","DOI":"10.1109\/TNSM.2023.3300962"},{"key":"ref166","doi-asserted-by":"publisher","DOI":"10.1109\/TMC.2019.2928811"},{"key":"ref167","doi-asserted-by":"publisher","DOI":"10.1109\/VTC2020-Fall49728.2020.9348485"},{"key":"ref168","doi-asserted-by":"publisher","DOI":"10.1109\/LWC.2022.3202904"},{"key":"ref169","first-page":"1394","article-title":"The emergence of adversarial communication in multi-agent reinforcement learning","volume-title":"Proc. Conf. Robot Learn.","author":"Blumenkamp"}],"container-title":["IEEE Transactions on Cognitive Communications and Networking"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/6687307\/11304002\/11481142.pdf?arnumber=11481142","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,5,22]],"date-time":"2026-05-22T19:37:16Z","timestamp":1779478636000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11481142\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026]]},"references-count":169,"URL":"https:\/\/doi.org\/10.1109\/tccn.2026.3683896","relation":{},"ISSN":["2332-7731","2372-2045"],"issn-type":[{"value":"2332-7731","type":"electronic"},{"value":"2372-2045","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026]]}}}