{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,8,5]],"date-time":"2026-08-05T06:45:23Z","timestamp":1785912323537,"version":"3.56.0"},"reference-count":69,"publisher":"IEEE","license":[{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2026,6]]},"DOI":"10.1109\/isca66397.2026.00172","type":"proceedings-article","created":{"date-parts":[[2026,8,4]],"date-time":"2026-08-04T19:17:14Z","timestamp":1785871034000},"page":"2459-2474","source":"Crossref","is-referenced-by-count":0,"title":["MoE-Hub: Taming Software Complexity for Seamless MoE Overlap with Hardware-Accelerated Communication on Multi-GPU Systems"],"prefix":"10.1109","author":[{"given":"Zhuoshan","family":"Zhou","sequence":"first","affiliation":[{"name":"Shanghai Jiao Tong University"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Chen","family":"Zhang","sequence":"additional","affiliation":[{"name":"Shanghai Jiao Tong University"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Shuyi","family":"Zhang","sequence":"additional","affiliation":[{"name":"Shanghai Jiao Tong University"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Qijun","family":"Zhang","sequence":"additional","affiliation":[{"name":"Shanghai Jiao Tong University"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Haibo","family":"Wang","sequence":"additional","affiliation":[{"name":"Huawei Technologies Co. Ltd."}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zhe","family":"Zhou","sequence":"additional","affiliation":[{"name":"Huawei Technologies Co. Ltd."}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zhipeng","family":"Tu","sequence":"additional","affiliation":[{"name":"Huawei Technologies Co. Ltd."}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Guangyu","family":"Sun","sequence":"additional","affiliation":[{"name":"Peking University"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yijia","family":"Diao","sequence":"additional","affiliation":[{"name":"Shanghai Jiao Tong University"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zhigang","family":"Ji","sequence":"additional","affiliation":[{"name":"Shanghai Jiao Tong University"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jingwen","family":"Leng","sequence":"additional","affiliation":[{"name":"Shanghai Jiao Tong University"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Guanghui","family":"He","sequence":"additional","affiliation":[{"name":"Shanghai Jiao Tong University"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Minyi","family":"Guo","sequence":"additional","affiliation":[{"name":"Shanghai Jiao Tong University"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","volume-title":"Phi-3 technical report: A highly capable language model locally on your phone","author":"Abdin","year":"2024"},{"key":"ref2","article-title":"Flashdmoe: Fast distributed moe in a single kernel","author":"Aimuyo","year":"2025","journal-title":"arXiv preprint arXiv"},{"key":"ref3","volume-title":"Moe training best practices on amd gpus.","year":"2025"},{"issue":"2","key":"ref4","first-page":"3","article-title":"Qwen-vl: A frontier large vision-language model with versatile abilities","volume":"1","author":"Bai","year":"2023","journal-title":"arXiv preprint arXiv"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1145\/3721146.3721940"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1145\/3620666.3651379"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/SC41404.2022.00055"},{"key":"ref8","volume-title":"Mirage persistent kernel: A compiler and runtime for mega-kernelizing tensor programs","author":"Cheng","year":"2025"},{"key":"ref9","volume-title":"Deepseekmoe: Towards ultimate expert specialization in mixture-of-experts language models","author":"Dai","year":"2024"},{"key":"ref10","volume-title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model","author":"DeepSeek-AI","year":"2024"},{"key":"ref11","volume-title":"Deepseek-v3 technical report","author":"DeepSeek-AI","year":"2025"},{"key":"ref12","first-page":"5547","article-title":"GLaM: Efficient scaling of language models with mixture-of-experts","volume-title":"Proceedings of the 39th International Conference on Machine Learning, ser. Proceedings of Machine Learning Research, K. Chaudhuri","volume":"162","author":"Du","year":"2022"},{"issue":"120","key":"ref13","first-page":"1","article-title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity","volume":"23","author":"Fedus","year":"2022","journal-title":"Journal of Machine Learning Research"},{"key":"ref14","first-page":"288","article-title":"Megablocks: Efficient sparse training with mixture-of-experts","volume-title":"Proceedings of Machine Learning and Systems","volume":"5","author":"Gale","year":"2023"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1145\/3620665.3640423"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1145\/3503221.3508418"},{"key":"ref17","volume-title":"Efficient and adaptable overlapping for computation and communication via signaling and reordering","author":"Hong","year":"2025"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.52202\/079017-2670"},{"key":"ref19","first-page":"269","article-title":"Tutel: Adaptive mixture-of-experts at scale","volume-title":"Proceedings of Machine Learning and Systems","volume":"5","author":"Hwang","year":"2023"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/ISCA59077.2024.00078"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1145\/3503222.3507778"},{"key":"ref22","volume-title":"Mixtral of experts","author":"Jiang","year":"2024"},{"key":"ref23","first-page":"74","article-title":"Lancet: Accelerating mixture-of-experts training via whole graph computationcommunication overlapping","volume-title":"Proceedings of Machine Learning and Systems","volume":"6","author":"Jiang","year":"2024"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.52202\/079017-1663"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1109\/ISPASS.2013.6557149"},{"key":"ref26","volume-title":"Megascale-moe: Largescale communication-efficient training of mixture-of-experts models in production","author":"Jin","year":"2025"},{"key":"ref27","article-title":"Scaling laws for neural language models","author":"Kaplan","year":"2020","journal-title":"arXiv preprint arXiv"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1109\/MICRO50266.2020.00086"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1109\/ISCA45697.2020.00047"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1145\/3600006.3613165"},{"key":"ref31","article-title":"Gshard: Scaling giant models with conditional computation and automatic sharding","author":"Lepikhin","year":"2020","journal-title":"arXiv preprint arXiv"},{"key":"ref32","first-page":"945","article-title":"Accelerating distributed MoE training and inference with lina","volume-title":"2023 USENIX Annual Technical Conference (USENIX ATC 23)","author":"Li"},{"key":"ref33","volume-title":"Infinite-llm: Efficient 1lm service for long context with distattention and distributed kvcache","author":"Lin","year":"2024"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1145\/3603269.3604869"},{"key":"ref35","volume-title":"Moba: Mixture of block attention for long-context llms","author":"Lu","year":"2025"},{"issue":"7","key":"ref36","first-page":"2025","volume":"4","author":"Meta","year":"2025","journal-title":"The llama 4 herd: The beginning of a new era of natively multimodal ai innovation"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA56546.2023.10070949"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1109\/ISCA52012.2021.00020"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1145\/3588964"},{"key":"ref40","volume-title":"Peer-to-peer & unified virtual addressing.","year":"2011"},{"key":"ref41","volume-title":"Doubling all2all performance with nvidia collective communication library 2.12","year":"2022"},{"key":"ref42","volume-title":"Applying mixture of experts in llm architectures.","year":"2024"},{"key":"ref43","volume-title":"Cuda templates for linear algebra subroutines.","year":"2024"},{"key":"ref44","volume-title":"Introduction to nvidia dgx h100\/h200 systems.","year":"2024"},{"key":"ref45","volume-title":"New llm: Snowflake arctic model for sql and code generation.","year":"2024"},{"key":"ref46","volume-title":"Mixture of experts powers the most intelligent frontier ai models, runs 10x faster to deliver 1\/10 the token cost on nvidia blackwell nvl72.","year":"2025"},{"key":"ref47","volume-title":"Nvidia openshmem library (nvshmem) documentation.","year":"2025"},{"key":"ref48","volume-title":"Transformer engine.","year":"2025"},{"key":"ref49","volume-title":"Gpt-oss.","year":"2025"},{"key":"ref50","volume-title":"Introducing gpt-5.","year":"2025"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1145\/3620665.3640410"},{"key":"ref52","first-page":"18332","article-title":"Deepspeed-moe: Advancing mixtureof-experts inference and training to power next-generation ai scale","volume-title":"International conference on machine learning","author":"Rajbhandari","year":"2022"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.1145\/3394486.3406703"},{"key":"ref54","volume-title":"Introducing dbrx: A new state-of-the-art open llm","year":"2024"},{"key":"ref55","first-page":"8583","article-title":"Scaling vision with sparse mixture of experts","volume":"34","author":"Riquelme","year":"2021","journal-title":"Advances in Neural Information Processing Systems"},{"key":"ref56","article-title":"The sparsely-gated mixture-of-experts layer","volume":"2","author":"Shazeer","year":"2017","journal-title":"Outrageously large neural networks"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.1109\/INFOCOM53939.2023.10228874"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.1145\/3627703.3650083"},{"key":"ref59","article-title":"Megatron-lm: Training multi-billion parameter language models using model parallelism","author":"Shoeybi","year":"2019","journal-title":"arXiv preprint arXiv"},{"key":"ref60","volume-title":"Pangu ultra moe: How to train your big moe on ascend npus","author":"Tang","year":"2025"},{"key":"ref61","doi-asserted-by":"publisher","DOI":"10.1145\/3710848.3710868"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.1145\/3567955.3567959"},{"key":"ref63","doi-asserted-by":"publisher","DOI":"10.1109\/CLUSTER52292.2023.00015"},{"key":"ref64","volume-title":"Xattention: Block sparse attention with antidiagonal scoring","author":"Xu","year":"2025"},{"key":"ref65","doi-asserted-by":"publisher","DOI":"10.1109\/TSC.2024.3399654"},{"key":"ref66","first-page":"961","article-title":"SmartMoE: Efficiently training Sparsely-Activated models through combining offline and online parallelization","volume-title":"2023 USENIX Annual Technical Conference (USENIX ATC 23)","author":"Zhai"},{"key":"ref67","article-title":"Comet: Fine-grained computation-communication overlapping for mixture-of-experts","volume-title":"Proceedings of Machine Learning and Systems","volume":"7","author":"Zhang","year":"2025"},{"key":"ref68","doi-asserted-by":"publisher","DOI":"10.1109\/TPDS.2024.3385639"},{"key":"ref69","volume-title":"Deepep: an efficient expert-parallel communication library","author":"Zhao","year":"2025"}],"event":{"name":"2026 ACM\/IEEE 53rd Annual International Symposium on Computer Architecture (ISCA)","location":"Raleigh, NC, USA","start":{"date-parts":[[2026,6,27]]},"end":{"date-parts":[[2026,7,1]]}},"container-title":["2026 ACM\/IEEE 53rd Annual International Symposium on Computer Architecture (ISCA)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/11617393\/11617394\/11617884.pdf?arnumber=11617884","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,8,5]],"date-time":"2026-08-05T05:53:14Z","timestamp":1785909194000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11617884\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,6]]},"references-count":69,"URL":"https:\/\/doi.org\/10.1109\/isca66397.2026.00172","relation":{},"subject":[],"published":{"date-parts":[[2026,6]]}}}