{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,27]],"date-time":"2026-05-27T06:05:38Z","timestamp":1779861938605,"version":"3.53.1"},"reference-count":31,"publisher":"IEEE","license":[{"start":{"date-parts":[[2026,4,26]],"date-time":"2026-04-26T00:00:00Z","timestamp":1777161600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,4,26]],"date-time":"2026-04-26T00:00:00Z","timestamp":1777161600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/100006224","name":"Argonne National Laboratory","doi-asserted-by":"publisher","id":[{"id":"10.13039\/100006224","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100006192","name":"Advanced Scientific Computing Research","doi-asserted-by":"publisher","id":[{"id":"10.13039\/100006192","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100000001","name":"National Science Foundation","doi-asserted-by":"publisher","id":[{"id":"10.13039\/100000001","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100007921","name":"University of Pittsburgh","doi-asserted-by":"publisher","id":[{"id":"10.13039\/100007921","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2026,4,26]]},"DOI":"10.1109\/ispass69572.2026.00015","type":"proceedings-article","created":{"date-parts":[[2026,5,26]],"date-time":"2026-05-26T19:39:19Z","timestamp":1779824359000},"page":"39-50","source":"Crossref","is-referenced-by-count":0,"title":["The xPU-athalon: Quantifying the Competition of AI Acceleration"],"prefix":"10.1109","author":[{"given":"Alicia","family":"Golden","sequence":"first","affiliation":[{"name":"Harvard University,Cambridge,MA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Carole-Jean","family":"Wu","sequence":"additional","affiliation":[{"name":"FAIR at Meta,Cambridge,MA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Gu-Yeon","family":"Wei","sequence":"additional","affiliation":[{"name":"Harvard University,Cambridge,MA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"David","family":"Brooks","sequence":"additional","affiliation":[{"name":"Harvard University,Cambridge,MA"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1145\/3470496.3527405"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/ISCA45697.2020.00023"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/hpca68181.2026.11408490"},{"key":"ref4","article-title":"Amazon ec2 dl1 instances","year":"2024"},{"key":"ref5","article-title":"Amd instinct mi300x accelerator datasheet","year":"2023"},{"key":"ref6","article-title":"Ai hardware benchmarking & performance analysis","year":"2025","journal-title":"Online Resource"},{"key":"ref7","article-title":"Transformer flops","author":"Casson","year":"2023"},{"key":"ref8","article-title":"Pipeline parallelism","year":"2025"},{"key":"ref9","article-title":"A comprehensive performance study of large language models on novel ai accelerators","author":"Emani","year":"2023"},{"key":"ref10","article-title":"A 4d hybrid algorithm to scale parallel training to thousands of gpus","author":"S. S","year":"2024"},{"key":"ref11","article-title":"System architecture for TPU VMs","year":"2025","journal-title":"Online Documentation"},{"key":"ref12","first-page":"2025","article-title":"Tpu v5e","journal-title":"Online Documentation"},{"key":"ref13","article-title":"Why sambanova\u2019s sn401 chip is the best for inference","author":"Gottscho","year":"2024"},{"key":"ref14","article-title":"The llama 3 herd of models","author":"Grattafiori"},{"key":"ref15","article-title":"Gaudi architecture overview","year":"2024","journal-title":"Online Documentation"},{"key":"ref16","article-title":"Mastering llm techniques: Inference optimization","author":"hashank Verma","year":"2023"},{"key":"ref17","article-title":"Machine learning systems: Principles and practices of engineering artificially intelligent systems","author":"Janapa Reddi","year":"2025"},{"key":"ref18","article-title":"Mlperf inference benchmark","author":"Janapa Reddi","year":"2020"},{"key":"ref19","article-title":"Sambanova sn401 rdu for trillion parameter ai models","author":"Kennedy","year":"2024","journal-title":"serveTheHome"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1145\/3600006.3613165"},{"key":"ref21","article-title":"Hot chips 2024 symposium (hc2024). wafer-scale ai: Enabling unprecedented ai compute performance","author":"Lie"},{"key":"ref22","article-title":"Inside the lpu: Deconstructing groq\u2019s speed","author":"Ling","year":"2025"},{"key":"ref23","article-title":"Efficient largescale language model training on gpu clusters using megatronlm","volume-title":"Proceedings of the International Conference for High Performance Computing, Networking, Storage, and Analysis (SC \u201821)","author":"Narayanan"},{"key":"ref24","article-title":"Nvidia nccl repo"},{"key":"ref25","article-title":"Nvidia a100 tensor core gpu datasheet","year":"2020"},{"key":"ref26","article-title":"Nvidia h100 tensor core gpu datasheet","year":"2022"},{"key":"ref27","article-title":"Amd and openai announce strategic partnership to deploy 6 gigawatts of amd gpus","year":"2025","journal-title":"OpenAI"},{"key":"ref28","article-title":"Groq inference tokenomics: Speed but at what cost?","author":"Patel","year":"2024","journal-title":"SemiAnalysis Newsletter"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1109\/micro61859.2024.00100"},{"key":"ref30","article-title":"Intelligence per watt: Measuring intelligence efficiency of local ai","author":"Saad-Falcon","year":"2025"},{"key":"ref31","article-title":"Sambarack sn401-16 hardware system data sheet","year":"2025"}],"event":{"name":"2026 IEEE International Symposium on Performance Analysis of Systems and Software (ISPASS)","location":"Seoul, Korea, Republic of","start":{"date-parts":[[2026,4,26]]},"end":{"date-parts":[[2026,4,28]]}},"container-title":["2026 IEEE International Symposium on Performance Analysis of Systems and Software (ISPASS)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/11527204\/11527232\/11527242.pdf?arnumber=11527242","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,5,27]],"date-time":"2026-05-27T05:39:05Z","timestamp":1779860345000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11527242\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,4,26]]},"references-count":31,"URL":"https:\/\/doi.org\/10.1109\/ispass69572.2026.00015","relation":{},"subject":[],"published":{"date-parts":[[2026,4,26]]}}}