{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,8,5]],"date-time":"2026-08-05T06:46:34Z","timestamp":1785912394232,"version":"3.56.0"},"reference-count":59,"publisher":"IEEE","license":[{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"name":"National Natural Science Foundation of China","award":["62502305"],"award-info":[{"award-number":["62502305"]}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2026,6]]},"DOI":"10.1109\/isca66397.2026.00074","type":"proceedings-article","created":{"date-parts":[[2026,8,4]],"date-time":"2026-08-04T19:17:59Z","timestamp":1785871079000},"page":"921-935","source":"Crossref","is-referenced-by-count":0,"title":["Accelerating MoE with Dynamic In-Switch Computing on Multi-GPUs"],"prefix":"10.1109","author":[{"given":"Qijun","family":"Zhang","sequence":"first","affiliation":[{"name":"Hong Kong University of Science and Technology"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Chen","family":"Zhang","sequence":"additional","affiliation":[{"name":"Shanghai Jiao Tong University"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zhuoshan","family":"Zhou","sequence":"additional","affiliation":[{"name":"Shanghai Jiao Tong University"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Haibo","family":"Wang","sequence":"additional","affiliation":[{"name":"Huawei Technologies Co. Ltd."}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zhe","family":"Zhou","sequence":"additional","affiliation":[{"name":"Huawei Technologies Co. Ltd."}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zhipeng","family":"Tu","sequence":"additional","affiliation":[{"name":"Huawei Technologies Co. Ltd."}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Guangyu","family":"Sun","sequence":"additional","affiliation":[{"name":"Peking University"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zhiyao","family":"Xie","sequence":"additional","affiliation":[{"name":"Hong Kong University of Science and Technology"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yijia","family":"Diao","sequence":"additional","affiliation":[{"name":"Shanghai Jiao Tong University"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zhigang","family":"Ji","sequence":"additional","affiliation":[{"name":"Shanghai Jiao Tong University"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jingwen","family":"Leng","sequence":"additional","affiliation":[{"name":"Shanghai Jiao Tong University"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Guanghui","family":"He","sequence":"additional","affiliation":[{"name":"Shanghai Jiao Tong University"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Minyi","family":"Guo","sequence":"additional","affiliation":[{"name":"Shanghai Jiao Tong University"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","volume-title":"Flux: Fine-grained computation-communication overlapping gpu kernel library","year":"2025"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1145\/3620666.3651379"},{"key":"ref3","article-title":"P4com: In-network computation with programmable switches","author":"Chen","year":"2021","journal-title":"arXiv preprint"},{"key":"ref4","article-title":"Programmable switch as a parallel computing device","author":"Chen","year":"2018","journal-title":"arXiv preprint"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1145\/3458817.3476178"},{"key":"ref6","article-title":"Deepseek-v3 technical report","author":"Liu","year":"2024","journal-title":"arXiv preprint"},{"key":"ref7","article-title":"An image is worth 16\u00d716 words: Transformers for image recognition at scale","author":"Dosovitskiy","year":"2020","journal-title":"arXiv preprint"},{"key":"ref8","article-title":"In-network aggregation for shared machine learning clusters","volume-title":"Proceedings of Machine Learning and Systems (MLSys)","author":"Gebara","year":"2021"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/COMHPC.2016.006"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1145\/3503221.3508418"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1145\/3695053.3731105"},{"key":"ref12","first-page":"269","article-title":"Tutel: Adaptive mixture-of-experts at scale","volume-title":"Proceedings of Machine Learning and Systems","volume":"5","author":"Hwang","year":"2023"},{"key":"ref13","article-title":"Nvswitch and dgx-2","author":"Ishii","year":"2018","journal-title":"Hot Chips"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1109\/HCS55958.2022.9895480"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1145\/3503222.3507778"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1109\/ISPASS.2013.6557149"},{"key":"ref17","article-title":"Scaling laws for neural language models","author":"Kaplan","year":"2020","journal-title":"arXiv preprint"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/ISCA45697.2020.00047"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/ISCA45697.2020.00085"},{"key":"ref20","article-title":"Gshard: Scaling giant models with conditional computation and automatic sharding","author":"Lepikhin","year":"2020","journal-title":"arXiv preprint"},{"key":"ref21","article-title":"The case for network accelerated query processing","author":"Lerner","year":"2019","journal-title":"CIDR"},{"key":"ref22","first-page":"945","article-title":"Accelerating distributed \\{MoE\\} training and inference with lina","volume-title":"2023 USENIX Annual Technical Conference (USENIX ATC 23)","author":"Li","year":"2023"},{"key":"ref23","doi-asserted-by":"crossref","first-page":"279","DOI":"10.1145\/3307650.3322259","article-title":"Accelerating distributed reinforcement learning with in-switch computing","volume-title":"Proceedings of the 46th International Symposium on Computer Architecture","author":"Li","year":"2019"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1145\/3582016.3582037"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00986"},{"key":"ref26","first-page":"881","article-title":"Rammer: Enabling holistic deep learning compiler optimizations with \\{rTasks\\}","volume-title":"14th USENIX Symposium on Operating Systems Design and Implementation (OSDI 20)","author":"Ma","year":"2020"},{"key":"ref27","volume-title":"The llama 4 herd: The beginning of a new era of natively multimodal ai innovation","year":"2025"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA56546.2023.10070949"},{"key":"ref29","article-title":"Hetumoe: An efficient trillion-scale mixture-of-expert distributed training system","author":"Nie","year":"2022","journal-title":"arXiv preprint"},{"key":"ref30","volume-title":"Doubling all2all performance with nvidia collective communication library 2.12","year":"2022"},{"key":"ref31","volume-title":"Nvidia h100 tensor core gpu","year":"2022"},{"key":"ref32","volume-title":"Nvidia h200 tensor core gpu","year":"2023"},{"key":"ref33","volume-title":"One giant superchip for llms, recommenders, and gnns: Introducing nvidia gh200 nv132","year":"2023"},{"key":"ref34","volume-title":"Introduction to nvidia dgx h100\/h200 systems","year":"2024"},{"key":"ref35","volume-title":"Nvidia blackwell architecture technical brief","year":"2024"},{"key":"ref36","volume-title":"Nvidia gb200 nv172","year":"2024"},{"key":"ref37","volume-title":"Improving network performance of hpc systems using nvidia magnum io nvshmem and gpudirect async","year":"2025"},{"key":"ref38","volume-title":"The nvidia quantum infiniband platform","year":"2025"},{"key":"ref39","volume-title":"Inside the nvidia rubin platform: Six new chips, one ai supercomputer","year":"2026"},{"key":"ref40","volume-title":"Gpt-oss","year":"2025"},{"key":"ref41","volume-title":"Introducing gpt-5","year":"2025"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1145\/3620665.3640410"},{"key":"ref43","first-page":"18332","article-title":"Deepspeed-moe: Advancing mixtureof-experts inference and training to power next-generation ai scale","volume-title":"International conference on machine learning","author":"Rajbhandari","year":"2022"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1145\/3394486.3406703"},{"key":"ref45","first-page":"785","article-title":"Scaling distributed machine learning with \\{In-Network\\} aggregation","volume-title":"18th USENIX Symposium on Networked Systems Design and Implementation (NSDI 21)","author":"Sapio","year":"2021"},{"key":"ref46","first-page":"arXiv-2205","article-title":"Se-moe: A scalable and efficient mixtureof-experts distributed training and inference system","author":"Shen","year":"2022","journal-title":"arXiv e-prints"},{"key":"ref47","article-title":"Unveiling super experts in mixture-of-experts large language models","author":"Su","year":"2025","journal-title":"arXiv preprint"},{"key":"ref48","volume-title":"Design compiler\u00ae rtl synthesis","year":"2021"},{"key":"ref49","article-title":"Pangu ultra moe: How to train your big moe on ascend npus","author":"Tang","year":"2025","journal-title":"arXiv preprint"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1145\/3318464.3389698"},{"key":"ref51","volume-title":"Tsmc 16nm and 12nm process technologies","year":"2017"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.48550\/ARXIV.1706.03762"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.1145\/3710848.3710868"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1145\/3567955.3567959"},{"key":"ref55","article-title":"Qwen3 technical report","author":"Yang","year":"2025","journal-title":"arXiv preprint"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA68181.2026.11408460"},{"key":"ref57","article-title":"Comet: Fine-grained computation-communication overlapping for mixture-of-experts","author":"Zhang","year":"2025","journal-title":"arXiv preprint"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.1145\/3695053.3731412"},{"key":"ref59","volume-title":"Deepep: an efficient expert-parallel communication library","author":"Zhao","year":"2025"}],"event":{"name":"2026 ACM\/IEEE 53rd Annual International Symposium on Computer Architecture (ISCA)","location":"Raleigh, NC, USA","start":{"date-parts":[[2026,6,27]]},"end":{"date-parts":[[2026,7,1]]}},"container-title":["2026 ACM\/IEEE 53rd Annual International Symposium on Computer Architecture (ISCA)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/11617393\/11617394\/11617878.pdf?arnumber=11617878","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,8,5]],"date-time":"2026-08-05T06:00:14Z","timestamp":1785909614000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11617878\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,6]]},"references-count":59,"URL":"https:\/\/doi.org\/10.1109\/isca66397.2026.00074","relation":{},"subject":[],"published":{"date-parts":[[2026,6]]}}}