{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,5]],"date-time":"2026-06-05T06:00:43Z","timestamp":1780639243605,"version":"3.54.1"},"reference-count":38,"publisher":"IEEE","license":[{"start":{"date-parts":[[2026,4,20]],"date-time":"2026-04-20T00:00:00Z","timestamp":1776643200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,4,20]],"date-time":"2026-04-20T00:00:00Z","timestamp":1776643200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2026,4,20]]},"DOI":"10.23919\/date69613.2026.11539693","type":"proceedings-article","created":{"date-parts":[[2026,6,4]],"date-time":"2026-06-04T19:53:10Z","timestamp":1780602790000},"page":"1-7","source":"Crossref","is-referenced-by-count":0,"title":["ACES: A Chiplet Architecture with Resource Partition and Dynamic Scheduling for Agentic LLMs"],"prefix":"10.23919","author":[{"given":"Hongou","family":"Li","sequence":"first","affiliation":[{"name":"Peking University,School of Integrated Circuits,Beijing,China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Mingxuan","family":"Li","sequence":"additional","affiliation":[{"name":"Peking University,School of Integrated Circuits,Beijing,China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zhantong","family":"Zhu","sequence":"additional","affiliation":[{"name":"Peking University,School of Integrated Circuits,Beijing,China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Tianyu","family":"Jia","sequence":"additional","affiliation":[{"name":"Peking University,School of Integrated Circuits,Beijing,China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","article-title":"System Architecture for Agentic Large Language Models","volume-title":"technical report no. eecs-2025-5","author":"Zhang","year":"2025"},{"key":"ref2","article-title":"Gemini Deep Research \u2014 your personal research assistant","year":"2025"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.acl-long.623"},{"key":"ref4","article-title":"GeForce RTX 5090 Graphics Card","year":"2025"},{"key":"ref5","article-title":"Kairos: Low-latency Multi-Agent Serving with Shared LLMs and Excessive Loads in the Public Cloud","author":"Chen","year":"2025"},{"key":"ref6","article-title":"NVIDIA GH200 Superchip Accelerates Inference by 2x in Multiturn Interactions with LLaMA Models","year":"2024"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/HCS61935.2024.10665178"},{"key":"ref8","first-page":"193","article-title":"Distserve: Disaggregating prefill and decoding for goodput-optimized large language model serving","volume-title":"18th USENIX Symposium on Operating Systems Design and Implementation (OSDI 24)","author":"Zhong"},{"key":"ref9","article-title":"LangChain","author":"Chase","year":"2022"},{"key":"ref10","article-title":"LlamaIndex","author":"Liu","year":"2022"},{"key":"ref11","article-title":"ReAct: Synergizing Reasoning and Acting in Language Models","volume-title":"International Conference on Learning Representations (ICLR)","author":"Yao"},{"key":"ref12","article-title":"Reflexion: language agents with verbal reinforcement learning","volume-title":"Proceedings of the 37th International Conference on Neural Information Processing Systems, NIPS \u201923","author":"Shinn"},{"key":"ref13","article-title":"Language agent tree search unifies reasoning, acting, and planning in language models","volume-title":"Proceedings of the 41st International Conference on Machine Learning","author":"Zhou"},{"key":"ref14","article-title":"Enjoy AI Assistance Anywhere with Copilot for PC, Mac, Mobile, and More","year":"2025"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/ISLPED65674.2025.11261756"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.52202\/079017-0040"},{"key":"ref17","article-title":"Efficient streaming language models with attention sinks","author":"Xiao","year":"2023"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1145\/3600006.3613165"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/ISCA59077.2024.00019"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/OJSSCS.2024.3506694"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/ISSCC49657.2024.10454441"},{"key":"ref22","article-title":"DGX B200: The Foundation for Your AI Factory","year":"2025"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/TCPMT.2022.3207195"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA61900.2025.00124"},{"key":"ref25","article-title":"Search-r1: Training llms to reason and leverage search engines with reinforcement learning","author":"Jin","year":"2025"},{"key":"ref26","article-title":"Qwen2.5: A party of foundation models","author":"Team","year":"2024"},{"key":"ref27","article-title":"NVIDIA CEO Jensen Huang Promotes AI in Washington, DC and China: NVIDIA to resume H20 sales to China, announces new, fully compliant GPU for China","year":"2025"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1162\/TACL.a.19"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1145\/3721145.3725776"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1109\/ISCA52012.2021.00010"},{"key":"ref31","article-title":"Hecaton: Training Large Language Models with Scalable Chiplet Systems","author":"Huang","year":"2024"},{"key":"ref32","first-page":"521","article-title":"Orca: A Distributed Serving System for Transformer-Based Generative Models","volume-title":"16th USENIX Symposium on Operating Systems Design and Implementation (OSDI 22)","author":"Yu"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1109\/ISPASS57527.2023.00035"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1109\/ISPASS64960.2025.00026"},{"key":"ref35","article-title":"NVIDIA H100 Tensor Core GPU","year":"2024"},{"key":"ref36","article-title":"Introducing Meta Llama 3: The most capable openly available LLM to date","year":"2025"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1145\/3695053.3731101"},{"key":"ref38","article-title":"Revisiting SLO and Goodput Metrics in LLM Serving","author":"Wang","year":"2024"}],"event":{"name":"2026 Design, Automation &amp; Test in Europe Conference (DATE)","location":"Verona, Italy","start":{"date-parts":[[2026,4,20]]},"end":{"date-parts":[[2026,4,22]]}},"container-title":["2026 Design, Automation &amp;amp; Test in Europe Conference (DATE)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/11539023\/11539024\/11539693.pdf?arnumber=11539693","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,6,5]],"date-time":"2026-06-05T05:08:36Z","timestamp":1780636116000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11539693\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,4,20]]},"references-count":38,"URL":"https:\/\/doi.org\/10.23919\/date69613.2026.11539693","relation":{},"subject":[],"published":{"date-parts":[[2026,4,20]]}}}