{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,22]],"date-time":"2026-07-22T16:46:09Z","timestamp":1784738769053,"version":"3.55.0"},"reference-count":234,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","license":[{"start":{"date-parts":[[2026,1,1]],"date-time":"2026-01-01T00:00:00Z","timestamp":1767225600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/legalcode"}],"funder":[{"DOI":"10.13039\/501100006013","name":"United Arab Emirates University","doi-asserted-by":"publisher","award":["G00005769"],"award-info":[{"award-number":["G00005769"]}],"id":[{"id":"10.13039\/501100006013","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100009975","name":"Khalifa University of Science and Technology","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100009975","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Access"],"published-print":{"date-parts":[[2026]]},"DOI":"10.1109\/access.2026.3698694","type":"journal-article","created":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T19:36:04Z","timestamp":1780342564000},"page":"84237-84285","source":"Crossref","is-referenced-by-count":14,"title":["From LLM Reasoning to Autonomous AI Agents: A Comprehensive Review"],"prefix":"10.1109","volume":"14","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-0632-3172","authenticated-orcid":false,"given":"Mohamed Amine","family":"Ferrag","sequence":"first","affiliation":[{"name":"Department of Computer and Network Engineering, United Arab Emirates University, Al Ain, United Arab Emirates"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-9002-5935","authenticated-orcid":false,"given":"Norbert","family":"Tihanyi","sequence":"additional","affiliation":[{"name":"Technology Innovation Institute, Abu Dhabi, United Arab Emirates"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-8941-8080","authenticated-orcid":false,"given":"M\u00e9rouane","family":"Debbah","sequence":"additional","affiliation":[{"name":"Research Institute for Digital Future, Khalifa University, Abu Dhabi, United Arab Emirates"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","article-title":"OpenAI o1 system card","author":"Jaech","year":"2024","journal-title":"arXiv:2412.16720"},{"key":"ref2","article-title":"Qwen2.5-omni technical report","volume-title":"arXiv:2503.20215","author":"Xu","year":"2025"},{"key":"ref3","article-title":"DeepSeek-r1: Incentivizing reasoning capability in LLMs via reinforcement learning","author":"Guo","year":"2025","journal-title":"arXiv:2501.12948"},{"key":"ref4","article-title":"The llama 3 herd of models","author":"Grattafiori","year":"2024","journal-title":"arXiv:2407.21783"},{"key":"ref5","article-title":"Understanding the planning of LLM agents: A survey","author":"Huang","year":"2024","journal-title":"arXiv:2402.02716"},{"key":"ref6","article-title":"A survey on LLM-as-a-judge","author":"Gu","year":"2024","journal-title":"arXiv:2411.15594"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1145\/3733799.3762964"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2025.emnlp-main.464"},{"key":"ref9","article-title":"Benchmarking multimodal retrieval augmented generation with dynamic VQA dataset and self-adaptive planning agent","author":"Li","year":"2024","journal-title":"arXiv:2411.02937"},{"key":"ref10","article-title":"RAG-KG-IL: A multi-agent hybrid framework for reducing hallucinations and enhancing LLM reasoning through RAG and incremental knowledge graph learning integration","author":"Qing Yu","year":"2025","journal-title":"arXiv:2503.13514"},{"key":"ref11","article-title":"BioRAGent: A retrieval-augmented generation system for showcasing generative query expansion and domain-specific search for scientific Q&A","author":"Ateia","year":"2024","journal-title":"arXiv:2412.12358"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/GCCE65946.2025.11275306"},{"key":"ref13","article-title":"RAG-gym: Optimizing reasoning and search agents with process supervision","author":"Xiong","year":"2025","journal-title":"arXiv:2502.13957"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1016\/j.icte.2025.09.003"},{"key":"ref15","article-title":"GPT-4 technical report","volume-title":"arXiv:2303.08774","author":"Achiam","year":"2023"},{"key":"ref16","article-title":"Gemini: A family of highly capable multimodal models","author":"Team","year":"2023","journal-title":"arXiv:2312.11805"},{"key":"ref17","article-title":"Llama 2: Open foundation and fine-tuned chat models","author":"Touvron","year":"2023","journal-title":"arXiv:2307.09288"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2025.findings-emnlp.320"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.emnlp-main.840"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2025.findings-emnlp.303"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2025.naacl-long.342"},{"key":"ref22","article-title":"Agentic AI for scientific discovery: A survey of progress, challenges, and future directions","author":"Gridach","year":"2025","journal-title":"arXiv:2503.08979"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.52202\/079017-2522"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.findings-acl.557"},{"key":"ref25","article-title":"Agent hospital: A simulacrum of hospital with evolvable medical agents","author":"Li","year":"2024","journal-title":"arXiv:2405.02957"},{"key":"ref26","article-title":"Agent AI: Surveying the horizons of multimodal interaction","author":"Durante","year":"2024","journal-title":"arXiv:2401.03568"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2025.findings-naacl.205"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.acl-long.371"},{"key":"ref29","article-title":"Polaris: A safety-focused LLM constellation architecture for healthcare","author":"Mukherjee","year":"2024","journal-title":"arXiv:2403.13313"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.findings-emnlp.79"},{"issue":"1","key":"ref31","first-page":"1","article-title":"The application of large language models in primary healthcare services and the challenges","volume":"28","author":"Yan","year":"2025","journal-title":"Chin. Gen. Pract."},{"key":"ref32","article-title":"AIPatient: Simulating patients with EHRS and LLM powered agentic workflow","author":"Yu","year":"2024","journal-title":"arXiv:2409.18924"},{"key":"ref33","article-title":"AgentClinic: A multimodal agent benchmark to evaluate AI in simulated clinical environments","author":"Schmidgall","year":"2024","journal-title":"arXiv:2405. 07960"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2025.findings-acl.539"},{"key":"ref35","article-title":"From prompt injections to protocol exploits: Threats in LLM-powered AI agents workflows","author":"Ferrag","year":"2025","journal-title":"arXiv:2506.23260"},{"key":"ref36","first-page":"50208","article-title":"Executable code actions elicit better LLM agents","volume-title":"Proc. 41st Int. Conf. Mach. Learn.","author":"Wang"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.52202\/075280-0377"},{"key":"ref38","article-title":"REACT: Synergizing reasoning and acting in language models","volume-title":"Proc. Int. Conf. Learn. Represent. (ICLR)","author":"Yao"},{"key":"ref39","article-title":"Language agent tree search unifies reasoning acting and planning in language models","author":"Zhou","year":"2023","journal-title":"arXiv:2310.04406"},{"key":"ref40","article-title":"Learn-by-interact: A data-centric framework for self-adaptive agents in realistic environments","author":"Su","year":"2025","journal-title":"arXiv:2501.10893"},{"key":"ref41","article-title":"AgentGen: Enhancing planning abilities for large language model based agent via environment and task generation","author":"Hu","year":"2024","journal-title":"arXiv:2408.00764"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.findings-acl.181"},{"key":"ref43","article-title":"Reinforced self-training (ReST) for language modeling","author":"Gulcehre","year":"2023","journal-title":"arXiv:2308.08998"},{"key":"ref44","article-title":"ReST meets ReAct: Self-improvement for multi-step reasoning LLM agent","author":"Aksitov","year":"2023","journal-title":"arXiv:2312.10003"},{"key":"ref45","article-title":"Large language model based multi-agents: A survey of progress and challenges","author":"Guo","year":"2024","journal-title":"arXiv:2402.01680"},{"key":"ref46","article-title":"Synthetic data generation & multi-step RL for reasoning & tool use","author":"Goldie","year":"2025","journal-title":"arXiv:2504.04736"},{"key":"ref47","article-title":"MetaGPT: Meta programming for multi-agent collaborative framework","author":"Hong","year":"2023","journal-title":"arXiv:2308.00352"},{"key":"ref48","article-title":"Communicative agents for software development","author":"Qian","year":"2023","journal-title":"arXiv:2307.07924"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA57147.2024.10610855"},{"key":"ref50","article-title":"Building cooperative embodied agents modularly with large language models","author":"Zhang","year":"2023","journal-title":"arXiv:2307.02485"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1145\/3586183.3606763"},{"key":"ref52","article-title":"Simulating public administration crisis: A novel generative agent-based simulation system to lower technology barriers in social science research","author":"Xiao","year":"2023","journal-title":"arXiv:2311.06957"},{"key":"ref53","article-title":"Avalon\u2019s game of thoughts: Battle against deception through recursive contemplation","author":"Wang","year":"2023","journal-title":"arXiv:2310.01320"},{"key":"ref54","article-title":"Agents in software engineering: Survey, landscape, and vision","author":"Wang","year":"2024","journal-title":"arXiv:2409.09030"},{"key":"ref55","article-title":"From LLMs to LLM-based agents for software engineering: A survey of current, challenges and future","author":"Jin","year":"2024","journal-title":"arXiv:2408.02479"},{"key":"ref56","article-title":"Agentic retrieval-augmented generation: A survey on agentic rag","author":"Singh","year":"2025","journal-title":"arXiv:2501.09136"},{"key":"ref57","article-title":"Survey on evaluation of LLM-based agents","author":"Yehudai","year":"2025","journal-title":"arXiv:2503.16416"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.1007\/s11432-025-4665-8"},{"key":"ref59","article-title":"Beyond self-talk: A communication-centric survey of LLM-based multi-agent systems","author":"Yan","year":"2025","journal-title":"arXiv:2502.14321"},{"key":"ref60","article-title":"A survey on large language model-based social agents in game-theoretic scenarios","author":"Feng","year":"2024","journal-title":"arXiv:2412.03920"},{"key":"ref61","article-title":"Large language model-brained GUI agents: A survey","author":"Zhang","year":"2024","journal-title":"arXiv:2411.18279"},{"key":"ref62","article-title":"Personal LLM agents: Insights and survey about the capability, efficiency and security","author":"Li","year":"2024","journal-title":"arXiv:2401.05459"},{"key":"ref63","doi-asserted-by":"publisher","DOI":"10.1039\/D4SC03921A"},{"key":"ref64","article-title":"EnigmaEval: A benchmark of long multimodal reasoning challenges","author":"Wang","year":"2025","journal-title":"arXiv:2502.08859"},{"key":"ref65","article-title":"Measuring massive multitask language understanding","author":"Hendrycks","year":"2020","journal-title":"arXiv:2009.03300"},{"key":"ref66","article-title":"ComplexFuncBench: Exploring multi-step and constrained function calling under long-context scenario","author":"Zhong","year":"2025","journal-title":"arXiv:2501.10132"},{"key":"ref67","doi-asserted-by":"publisher","DOI":"10.70777\/si.v2i1.13973"},{"key":"ref68","volume-title":"Facts & Grounding: A New Benchmark for Evaluating the Factuality of Large Language Models","year":"2023"},{"key":"ref69","article-title":"ProcessBench: Identifying process errors in mathematical reasoning","author":"Zheng","year":"2024","journal-title":"arXiv:2412.06559"},{"key":"ref70","article-title":"OmniDocBench: Benchmarking diverse PDF document parsing with comprehensive annotations","author":"Ouyang","year":"2024","journal-title":"arXiv:2412.07626"},{"key":"ref71","article-title":"Agent-as-a-judge: Evaluate agents with agents","author":"Zhuge","year":"2024","journal-title":"arXiv:2410.10934"},{"key":"ref72","article-title":"JudgeBench: A benchmark for evaluating LLM-based judges","author":"Tan","year":"2024","journal-title":"arXiv:2410.12784"},{"key":"ref73","volume-title":"Introducing Simpleqa","year":"2024"},{"key":"ref74","volume-title":"Fine Tasks","year":"2024"},{"key":"ref75","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2025.naacl-long.243"},{"key":"ref76","volume-title":"Dabstep","year":"2025"},{"key":"ref77","volume-title":"BFCL V2 Live","author":"Mao","year":"2024"},{"key":"ref78","article-title":"SWE-lancer: Can frontier LLMs earn $1 million from real world freelance software engineering?","author":"Miserendino","year":"2025","journal-title":"arXiv:2502.12115"},{"key":"ref79","article-title":"CRAG\u2014Comprehensive RAG benchmark","author":"Yang","year":"2024","journal-title":"arXiv:2406.04744"},{"key":"ref80","article-title":"OCCULT: Evaluating large language models for offensive cyber operation capabilities","author":"Kouremetis","year":"2025","journal-title":"arXiv:2502.15797"},{"key":"ref81","doi-asserted-by":"publisher","DOI":"10.1109\/BigData62323.2024.10825051"},{"key":"ref82","doi-asserted-by":"publisher","DOI":"10.1109\/CSR61664.2024.10679494"},{"key":"ref83","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2025.acl-long.1285"},{"key":"ref84","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2025.acl-long.421"},{"key":"ref85","first-page":"9025","article-title":"GAIA: A benchmark for general AI assistants","volume-title":"Proc. 12th Int. Conf. Learn. Representations","author":"Mialon"},{"key":"ref86","article-title":"CASTLE: Benchmarking dataset for static code analyzers and LLMs towards CWE detection","author":"Dubniczky","year":"2025","journal-title":"arXiv:2503.09433"},{"key":"ref87","article-title":"SPIN-bench: How well do LLMs plan strategically and reason socially?","author":"Yao","journal-title":"arXiv:2503.12349"},{"key":"ref88","article-title":"A benchmark for tool-agent-user interaction in real-world domains","author":"Yao","year":"2024","journal-title":"arXiv:2406.12045"},{"key":"ref89","article-title":"DROP: A reading comprehension benchmark requiring discrete reasoning over paragraphs","author":"Dua","year":"2019","journal-title":"arXiv:1903.00161"},{"key":"ref90","article-title":"Measuring mathematical problem solving with the math dataset","author":"Hendrycks","year":"2021","journal-title":"arXiv:2103.03874"},{"key":"ref91","article-title":"Evaluating large language models trained on code","author":"Chen","year":"2021","journal-title":"arXiv:2107.03374"},{"key":"ref92","article-title":"Language models are multilingual chain-of-thought reasoners","author":"Shi","year":"2022","journal-title":"arXiv:2210.03057"},{"key":"ref93","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2025.findings-emnlp.368"},{"key":"ref94","article-title":"MIRAI: Evaluating LLM agents for event forecasting","author":"Ye","year":"2024","journal-title":"arXiv:2407.01231"},{"key":"ref95","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.acl-long.850"},{"key":"ref96","article-title":"VisualAgentBench: Towards large multimodal models as visual foundation agents","author":"Liu","year":"2024","journal-title":"arXiv:2408.06327"},{"key":"ref97","article-title":"ScienceAgentBench: Toward rigorous assessment of language agents for data-driven scientific discovery","author":"Chen","year":"2024","journal-title":"arXiv:2410.05080"},{"key":"ref98","article-title":"Agent-SafetyBench: Evaluating the safety of LLM agents","author":"Zhang","year":"2024","journal-title":"arXiv:2412.14470"},{"key":"ref99","article-title":"DiscoveryBench: Towards data-driven discovery with large language models","author":"Majumder","year":"2024","journal-title":"arXiv:2407.01725"},{"key":"ref100","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.findings-emnlp.815"},{"key":"ref101","article-title":"Medchain: Bridging the gap between LLM agents and clinical practice through interactive sequential benchmarking","author":"Liu","year":"2024","journal-title":"arXiv:2412.01605"},{"key":"ref102","article-title":"TeamCraft: A benchmark for multi-modal multi-agent systems in minecraft","author":"Long","year":"2024","journal-title":"arXiv:2412.05255"},{"key":"ref103","article-title":"AgentHarm: A benchmark for measuring harmfulness of LLM agents","author":"Andriushchenko","year":"2024","journal-title":"arXiv:2410.09024"},{"key":"ref104","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2025.acl-long.116"},{"key":"ref105","article-title":"GPQA: A graduate-level Google-proof Q&A benchmark","volume-title":"Proc. 1st Conf. Lang. Model.","author":"Rein"},{"key":"ref106","article-title":"MedAgentsBench: Benchmarking thinking models and agent frameworks for complex medical reasoning","author":"Tang","year":"2025","journal-title":"arXiv:2503.07459"},{"key":"ref107","article-title":"EmbodiedEval: Evaluate multimodal LLMs as embodied agents","author":"Cheng","year":"2025","journal-title":"arXiv:2501.11858"},{"key":"ref108","doi-asserted-by":"publisher","DOI":"10.52202\/079017-0607"},{"key":"ref109","article-title":"SciReplicate-bench: Benchmarking LLMs in agent-driven algorithmic reproduction from research papers","author":"Xiang","year":"2025","journal-title":"arXiv:2504.00255"},{"key":"ref110","article-title":"EconEvals: Benchmarks and litmus tests for LLM agents in unknown environments","author":"Fish","year":"2025","journal-title":"arXiv:2503.18825"},{"key":"ref111","article-title":"VeriLA: A human-centered evaluation framework for interpretable verification of LLM agent failures","author":"Sung","year":"2025","journal-title":"arXiv:2503.12651"},{"key":"ref112","article-title":"Who\u2019s the MVP? A game-theoretic evaluation benchmark for modular attribution in LLM agents","author":"Yang","year":"2025","journal-title":"arXiv:2502.00510"},{"key":"ref113","article-title":"AgentOrca: A dual-system framework to evaluate language agents on operational routine and constraint adherence","author":"Li","year":"2025","journal-title":"arXiv:2503.08669"},{"key":"ref114","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2025.findings-acl.1036"},{"key":"ref115","article-title":"RefactorBench: Evaluating stateful reasoning in language agents through code","author":"Gautam","year":"2025","journal-title":"arXiv:2503.07832"},{"key":"ref116","article-title":"BEARCUBS: A benchmark for computer-using web agents","author":"Song","year":"2025","journal-title":"arXiv:2503.07919"},{"key":"ref117","article-title":"Robotouille: An asynchronous planning benchmark for LLM agents","author":"Gonzalez-Pumariega","year":"2025","journal-title":"arXiv:2502.05227"},{"key":"ref118","article-title":"DSGBench: A diverse strategic game benchmark for evaluating LLM-based agents in complex decision-making environments","author":"Tang","year":"2025","journal-title":"arXiv:2503.06047"},{"key":"ref119","article-title":"TheoremExplainAgent: Towards multimodal explanations for LLM theorem understanding","author":"Ku","year":"2025","journal-title":"arXiv:2502.19400"},{"key":"ref120","doi-asserted-by":"publisher","DOI":"10.1109\/TASLPRO.2025.3626926"},{"key":"ref121","article-title":"MLGym: A new framework and benchmark for advancing ai research agents","author":"Nathani","year":"2025","journal-title":"arXiv:2502.14499"},{"key":"ref122","article-title":"DataSciBench: An LLM agent benchmark for data science","author":"Zhang","year":"2025","journal-title":"arXiv:2502.13897"},{"key":"ref123","article-title":"EmbodiedBench: Comprehensive benchmarking multi-modal large language models for vision-driven embodied agents","author":"Yang","year":"2025","journal-title":"arXiv:2502.09560"},{"key":"ref124","volume-title":"BrowseComp: A Simple Yet Challenging Benchmark for Browsing Agents","author":"Wei","year":"2025"},{"key":"ref125","article-title":"Vending-bench: A benchmark for long-term coherence of autonomous agents","author":"Backlund","year":"2025","journal-title":"arXiv:2502.15840"},{"key":"ref126","article-title":"MLE-bench: Evaluating machine learning agents on machine learning engineering","author":"Chan","year":"2025","journal-title":"arXiv:2410.07095"},{"key":"ref127","article-title":"SWE-PolyBench: A multi-language benchmark for repository level evaluation of coding agents","author":"Rashid","year":"2025","journal-title":"arXiv:2504. 08703"},{"key":"ref128","article-title":"Multi-SWE-bench: A multilingual benchmark for issue resolving","author":"Zan","year":"2025","journal-title":"arXiv:2504.02605"},{"key":"ref129","article-title":"Beyond the imitation game: Quantifying and extrapolating the capabilities of language models","author":"Srivastava","year":"2022","journal-title":"arXiv:2206.04615"},{"key":"ref130","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.findings-acl.824"},{"key":"ref131","volume-title":"Langchain Agents Tutorial","year":"2025"},{"key":"ref132","volume-title":"Building a Basic Agent","year":"2025"},{"key":"ref133","volume-title":"Crewai","year":"2025"},{"key":"ref134","volume-title":"Swarm","year":"2024"},{"key":"ref135","article-title":"The dawn of GUI agent: A preliminary case study with claude 3.5 computer use","author":"Hu","year":"2024","journal-title":"arXiv:2411.10323"},{"key":"ref136","article-title":"Agentic reasoning: Reasoning LLMs with tools for the deep research","author":"Wu","year":"2025","journal-title":"arXiv:2502.04644"},{"key":"ref137","article-title":"OctoTools: An agentic framework with extensible tools for complex reasoning","author":"Lu","year":"2025","journal-title":"arXiv:2502.11271"},{"key":"ref138","volume-title":"Agents SDK","year":"2025"},{"key":"ref139","article-title":"StarWhisper telescope: Agent-based observation assistant system to approach AI astrophysicist","author":"Wang","year":"2024","journal-title":"arXiv:2412. 06412"},{"key":"ref140","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.findings-emnlp.192"},{"key":"ref141","article-title":"GeneAgent: Self-verification language agent for gene set knowledge discovery using domain databases","author":"Wang","year":"2024","journal-title":"arXiv:2405.16205"},{"key":"ref142","doi-asserted-by":"publisher","DOI":"10.1038\/s44387-025-00003-z"},{"key":"ref143","article-title":"SurveyX: Academic survey automation via large language models","author":"Liang","year":"2025","journal-title":"arXiv:2502.14776"},{"key":"ref144","article-title":"Chain of ideas: Revolutionizing research via novel idea development with LLM agents","author":"Li","year":"2024","journal-title":"arXiv:2410.13185"},{"key":"ref145","article-title":"AgentInstruct: Toward generative teaching with agentic flows","author":"Mitra","year":"2024","journal-title":"arXiv:2407.03502"},{"key":"ref146","article-title":"ChemAgent: Self-updating library in large language models improves chemical reasoning","author":"Tang","year":"2025","journal-title":"arXiv:2501.06590"},{"key":"ref147","doi-asserted-by":"publisher","DOI":"10.1145\/3701716.3717527"},{"key":"ref148","article-title":"A survey on the memory mechanism of large language model based agents","author":"Zhang","year":"2024","journal-title":"arXiv:2404.13501"},{"key":"ref149","article-title":"Retrieval-augmented generation for AI-generated content: A survey","author":"Zhao","year":"2024","journal-title":"arXiv:2402.19473"},{"key":"ref150","doi-asserted-by":"publisher","DOI":"10.1016\/j.jss.2024.112278"},{"key":"ref151","volume-title":"How to Design an Agent for Production","year":"2025"},{"key":"ref152","article-title":"OS-genesis: Automating GUI agent trajectory construction via reverse task synthesis","author":"Sun","year":"2024","journal-title":"arXiv:2412.19723"},{"key":"ref153","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2025.findings-acl.740"},{"key":"ref154","article-title":"Zodiac: A cardiologist-level LLM framework for multi-agent diagnostics","author":"Zhou","year":"2024","journal-title":"arXiv:2410.02026"},{"key":"ref155","article-title":"MedAgent-pro: Towards multi-modal evidence-based medical diagnosis via reasoning agentic workflow","author":"Wang","year":"2025","journal-title":"arXiv:2503.18968"},{"key":"ref156","doi-asserted-by":"publisher","DOI":"10.1145\/3706598.3714014"},{"key":"ref157","article-title":"M\u00b3builder: A multi-agent system for automated machine learning in medical imaging","author":"Feng","year":"2025","journal-title":"arXiv:2502.20301"},{"key":"ref158","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2025.acl-long.677"},{"key":"ref159","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51701.2025.02175"},{"key":"ref160","doi-asserted-by":"publisher","DOI":"10.26615\/978-954-452-106-6-001"},{"key":"ref161","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2025.acl-long.1024"},{"key":"ref162","article-title":"AutoCBT: An autonomous multi-agent framework for cognitive behavioral therapy in psychological counseling","author":"Xu","year":"2025","journal-title":"arXiv:2501.09426"},{"key":"ref163","article-title":"Psyche: A multi-faceted patient simulation framework for evaluation of psychiatric assessment conversational agents","author":"Lee","year":"2025","journal-title":"arXiv:2501.01594"},{"key":"ref164","article-title":"PsyDraw: A multi-agent multimodal system for mental health screening in left-behind children","author":"Zhang","year":"2024","journal-title":"arXiv:2412.14769"},{"key":"ref165","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2025.acl-long.846"},{"key":"ref166","article-title":"Script-based dialog policy planning for LLM-powered conversational agents: A basic architecture for an","author":"Wasenm\u00fcller","year":"2024","journal-title":"arXiv:2412.15242"},{"key":"ref167","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2025.emnlp-main.603"},{"key":"ref168","article-title":"PatentAgent: Intelligent agent for automated pharmaceutical patent analysis","author":"Wang","year":"2024","journal-title":"arXiv:2410.21312"},{"key":"ref169","article-title":"DrugAgent: Explainable drug repurposing agent with large language model-based reasoning","author":"Inoue","year":"2024","journal-title":"arXiv:2408.13378"},{"key":"ref170","article-title":"MAP: Evaluation and multi-agent enhancement of large language models for inpatient pathways","author":"Chen","year":"2025","journal-title":"arXiv:2503.13205"},{"key":"ref171","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2025.findings-acl.729"},{"key":"ref172","article-title":"BioKGBench: A knowledge graph checking benchmark of AI agent for biomedical science","author":"Lin","year":"2024","journal-title":"arXiv:2407.00466"},{"key":"ref173","article-title":"AgentRxiv: Towards collaborative autonomous research","author":"Schmidgall","year":"2025","journal-title":"arXiv:2503.18102"},{"key":"ref174","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2025.findings-acl.1016"},{"key":"ref175","article-title":"Towards an AI co-scientist","author":"Gottweis","year":"2025","journal-title":"arXiv:2502.18864"},{"key":"ref176","article-title":"The Ann Arbor architecture for agent-oriented programming","author":"Dong","year":"2025","journal-title":"arXiv:2502.09903"},{"key":"ref177","article-title":"R2E-gym: Procedural environments and hybrid verifiers for scaling open-weights SWE agents","author":"Jain","year":"2025","journal-title":"arXiv:2504.07164"},{"key":"ref178","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2025.findings-acl.642"},{"key":"ref179","article-title":"Verbal process supervision elicits better coding agents","author":"Chen","year":"2025","journal-title":"arXiv:2503.18494"},{"key":"ref180","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2025.acl-long.973"},{"key":"ref181","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2025.acl-long.426"},{"key":"ref182","article-title":"GateLens: A reasoning-enhanced LLM agent for automotive software release analytics","author":"Gholamzadeh Khoee","year":"2025","journal-title":"arXiv:2503"},{"key":"ref183","article-title":"An LLM-based agent for reliable Docker environment configuration","author":"Hu","year":"2025","journal-title":"arXiv:2502.13681"},{"key":"ref184","doi-asserted-by":"publisher","DOI":"10.1145\/3706599.3719729"},{"key":"ref185","article-title":"Training software engineering agents and verifiers with SWE-gym","author":"Pan","year":"2024","journal-title":"arXiv:2412.21139"},{"key":"ref186","article-title":"Multi-agent collaboration for multilingual code instruction tuning","author":"Yang","year":"2025","journal-title":"arXiv:2502.07487"},{"key":"ref187","article-title":"SyncMind: Measuring agent out-of-sync recovery in collaborative software engineering","author":"Guo","year":"2025","journal-title":"arXiv:2502.06994"},{"key":"ref188","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2025.findings-naacl.285"},{"key":"ref189","article-title":"Enhancing the efficiency and accuracy of underlying asset reviews in structured finance: The application of multi-agent framework","author":"Wan","year":"2024","journal-title":"arXiv:2405.04294"},{"key":"ref190","article-title":"TwinMarket: A scalable behavioral and socialsimulation for financial markets","author":"Yang","year":"2025","journal-title":"arXiv:2502.01506"},{"key":"ref191","doi-asserted-by":"publisher","DOI":"10.52202\/079017-4354"},{"key":"ref192","article-title":"Strategic collusion of LLM agents: Market division in multi-commodity competitions","author":"Lin","year":"2024","journal-title":"arXiv:2410.00031"},{"key":"ref193","doi-asserted-by":"publisher","DOI":"10.1145\/3677052.3698686"},{"key":"ref194","doi-asserted-by":"publisher","DOI":"10.1145\/3677052.3698645"},{"key":"ref195","article-title":"FinSphere: A conversational stock analysis agent equipped with quantitative tools based on real-time database","author":"Han","year":"2025","journal-title":"arXiv:2501.12399"},{"key":"ref196","doi-asserted-by":"publisher","DOI":"10.1109\/ICDMW69685.2025.00105"},{"key":"ref197","article-title":"Agentic AI systems applied to tasks in financial services: Modeling and model risk management crews","author":"Okpala","year":"2025","journal-title":"arXiv:2502.05439"},{"key":"ref198","article-title":"Cite before you speak: Enhancing context-response grounding in e-commerce conversational LLM-agents","author":"Zeng","year":"2025","journal-title":"arXiv:2503.04830"},{"key":"ref199","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2025.emnlp-industry.191"},{"key":"ref200","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2025.findings-naacl.420"},{"key":"ref201","article-title":"MACM: Utilizing a multi-agent system for condition mining in solving complex mathematical problems","author":"Lei","year":"2024","journal-title":"arXiv:2404.04735"},{"key":"ref202","article-title":"MathLearner: A large language model agent framework for learning to solve mathematical problems","author":"Xie","year":"2024","journal-title":"arXiv:2408.01779"},{"key":"ref203","article-title":"Expanding search space with diverse prompting agents: An efficient sampling approach for LLM mathematical reasoning","author":"Lee","year":"2024","journal-title":"arXiv:2410.09780"},{"key":"ref204","article-title":"Flow-DPO: Improving LLM mathematical reasoning through online multi-agent learning","author":"Deng","year":"2024","journal-title":"arXiv:2410.22304"},{"key":"ref205","article-title":"Automating mathematical proof generation using large language model agents and knowledge graphs","author":"Li","year":"2025","journal-title":"arXiv:2503.11657"},{"key":"ref206","article-title":"MA-LoT: Multi-agent lean-based long chain-of-thought reasoning enhances formal theorem proving","author":"Wang","year":"2025","journal-title":"arXiv:2503.03205"},{"key":"ref207","article-title":"MathVC: An LLM-simulated multi-character virtual classroom for mathematics education","author":"Yue","year":"2024","journal-title":"arXiv:2404.06711"},{"key":"ref208","article-title":"LLM knows geometry better than algebra: Numerical understanding of LLM-based agents in a trading arena","author":"Ma","year":"2025","journal-title":"arXiv:2502.17967"},{"key":"ref209","article-title":"MineAgent: Towards remote-sensing mineral exploration with multimodal large language models","author":"Yu","year":"2024","journal-title":"arXiv:2412.17339"},{"key":"ref210","doi-asserted-by":"publisher","DOI":"10.1080\/17538947.2025.2458688"},{"key":"ref211","article-title":"FilmAgent: A multi-agent framework for end-to-end film automation in virtual 3D spaces","author":"Xu","year":"2025","journal-title":"arXiv:2501.12909"},{"key":"ref212","article-title":"AesopAgent: Agent-driven evolutionary system on story-to-video production","author":"Wang","year":"2024","journal-title":"arXiv:2403.07952"},{"key":"ref213","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.acl-long.88"},{"key":"ref214","article-title":"What should I wear to a party in a Greek taverna? Evaluation for conversational agents in the fashion domain","author":"Maronikolakis","year":"2024","journal-title":"arXiv:2408.08907"},{"key":"ref215","article-title":"ComposerX: Multi-agent symbolic music composition with LLMs","author":"Deng","year":"2024","journal-title":"arXiv:2404.18081"},{"key":"ref216","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.emnlp-demo.21"},{"key":"ref217","article-title":"LLM-based multi-agent poetry generation in non-cooperative environments","author":"Zhang","year":"2024","journal-title":"arXiv:2409.03659"},{"key":"ref218","doi-asserted-by":"publisher","DOI":"10.1109\/O-COCOSDA64382.2024.10800588"},{"key":"ref219","volume-title":"Introduction to MCP","year":"2025"},{"key":"ref220","volume-title":"BEEAI Now Has Multiple Agents, and a Standardized Way for Them to Talk","year":"2025"},{"key":"ref221","volume-title":"A2A: A New Era of Agent Interoperability","year":"2025"},{"key":"ref222","doi-asserted-by":"publisher","DOI":"10.1145\/3796519"},{"key":"ref223","article-title":"NaturalReasoning: Reasoning in the wild with 2.8M challenging questions","author":"Yuan","year":"2025","journal-title":"arXiv:2502.13124"},{"key":"ref224","volume-title":"FINEWEB2: A Sparkling Update With 1000s of Languages","author":"Penedo","year":"2024"},{"key":"ref225","volume-title":"MAGPIE Ultra V0.1","year":"2024"},{"key":"ref226","volume-title":"Implement Human-in-the-Loop Confirmation With Amazon Bedrock Agents","author":"Perrot","year":"2025"},{"key":"ref227","article-title":"Talk structurally, act hierarchically: A collaborative framework for LLM multi-agent systems","author":"Wang","year":"2025","journal-title":"arXiv:2502.11098"},{"key":"ref228","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.findings-naacl.112"},{"key":"ref229","article-title":"Think, prune, train, improve: Scaling reasoning without scaling models","author":"Costello","year":"2025","journal-title":"arXiv:2504.18116"},{"key":"ref230","article-title":"Towards system 2 reasoning in LLMs: Learning how to think with meta chain-of-though","author":"Xiang","year":"2025","journal-title":"arXiv:2501.04682"},{"key":"ref231","article-title":"Why do multiagent systems fail?","volume-title":"Proc. ICLR Workshop Building Trust Lang. Models Appl.","author":"Pan"},{"key":"ref232","article-title":"ResearchBench: Benchmarking LLMs in scientific discovery via inspiration-based task decomposition","author":"Liu","year":"2025","journal-title":"arXiv:2503.21248"},{"key":"ref233","article-title":"Chain-of-tools: Utilizing massive unseen tools in the cot reasoning of frozen language models","author":"Wu","year":"2025","journal-title":"arXiv:2503.16779"},{"key":"ref234","article-title":"Learning to reason with search for LLMs via reinforcement learning","author":"Chen","year":"2025","journal-title":"arXiv:2503.19470"}],"container-title":["IEEE Access"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/6287639\/11323511\/11540994.pdf?arnumber=11540994","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,6,9]],"date-time":"2026-06-09T05:30:13Z","timestamp":1780983013000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11540994\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026]]},"references-count":234,"URL":"https:\/\/doi.org\/10.1109\/access.2026.3698694","relation":{},"ISSN":["2169-3536"],"issn-type":[{"value":"2169-3536","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026]]}}}