{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,3,11]],"date-time":"2026-03-11T21:22:20Z","timestamp":1773264140628,"version":"3.50.1"},"reference-count":34,"publisher":"IEEE","license":[{"start":{"date-parts":[[2026,1,19]],"date-time":"2026-01-19T00:00:00Z","timestamp":1768780800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,1,19]],"date-time":"2026-01-19T00:00:00Z","timestamp":1768780800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/501100013105","name":"Shanghai Rising-Star Program","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100013105","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2026,1,19]]},"DOI":"10.1109\/asp-dac66049.2026.11420624","type":"proceedings-article","created":{"date-parts":[[2026,3,10]],"date-time":"2026-03-10T19:51:15Z","timestamp":1773172275000},"page":"568-574","source":"Crossref","is-referenced-by-count":0,"title":["SpAct-NDP: Efficient LLM Inference via Sparse Activation on NDP-GPU Heterogeneous Architecture"],"prefix":"10.1109","author":[{"given":"Jiaming","family":"Xu","sequence":"first","affiliation":[{"name":"Shanghai Jiao Tong University"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Tongxin","family":"Xie","sequence":"additional","affiliation":[{"name":"Tsinghua University"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yongkang","family":"Zhou","sequence":"additional","affiliation":[{"name":"Shanghai Jiao Tong University"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jinhao","family":"Li","sequence":"additional","affiliation":[{"name":"Shanghai Jiao Tong University"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yaoxiu","family":"Lian","sequence":"additional","affiliation":[{"name":"Shanghai Jiao Tong University"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zhenhua","family":"Zhu","sequence":"additional","affiliation":[{"name":"Tsinghua University"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yu","family":"Wang","sequence":"additional","affiliation":[{"name":"Tsinghua University"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Guohao","family":"Dai","sequence":"additional","affiliation":[{"name":"Shanghai Jiao Tong University"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref1","article-title":"Openchat: Advancing open-source language models with mixed-quality data","author":"Wang","year":"2023","journal-title":"arXiv preprint arXiv:2309.11235"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/ISCA59077.2024.00019"},{"key":"ref3","first-page":"193","article-title":"{DistServe}: Disaggregating prefill and decoding for goodput-optimized large language model serving","volume-title":"18th USENIX Symposium on Operating Systems Design and Implementation (OSDI 24)","author":"Zhong"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/MICRO56248.2022.00050"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1145\/3694715.3695964"},{"key":"ref6","first-page":"148","article-title":"Flashdecoding++: Faster large language model inference with asynchronization, flat gemm optimization, and heuristics","volume-title":"Proceedings of Machine Learning and Systems","volume":"6","author":"Hong"},{"key":"ref7","article-title":"Flashattention-2: Faster attention with better parallelism and work partitioning","author":"Dao","year":"2023","journal-title":"arXiv preprint arXiv:2307.08691"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1145\/3600006.3613165"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1145\/3676536.3676796"},{"key":"ref10","first-page":"10323","article-title":"Sparsegpt: Massive language models can be accurately pruned in one-shot","volume-title":"International Conference on Machine Learning","author":"Frantar"},{"key":"ref11","article-title":"Large language model inference acceleration: A comprehensive hardware perspective","author":"Li","year":"2024","journal-title":"arXiv preprint arXiv:2410.04466"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1145\/3695053.3730996"},{"key":"ref13","first-page":"22137","article-title":"Deja vu: Contextual sparsity for efficient 11 ms at inference time","volume-title":"International Conference on Machine Learning","author":"Liu"},{"key":"ref14","article-title":"Moa: Mixture of sparse attention for automatic large language model compression","author":"Fu","year":"2024"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/TCAD.2024.3518413"},{"key":"ref16","article-title":"Relu strikes back: Exploiting activation sparsity in large language models","author":"Mirzadeh","year":"2023","journal-title":"arXiv preprint arXiv:2310.04564"},{"key":"ref17","first-page":"315","article-title":"Deep sparse rectifier neural networks","volume-title":"Proceedings of the fourteenth international conference on artificial intelligence and statistics","author":"Glorot"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1016\/j.neunet.2017.12.012"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.acl-long.678"},{"key":"ref20","article-title":"Powerinfer-2: Fast large language model inference on a smartphone","author":"Xue","year":"2024","journal-title":"arXiv preprint arXiv:2406.06282"},{"key":"ref21","article-title":"Nvidia nsight compute","journal-title":"NVIDIA"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1038\/s44335-024-00004-2"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/ISSCC42614.2022.9731711"},{"key":"ref24","article-title":"Attention is all you need","author":"Vaswani","year":"2023"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1109\/ISCA52012.2021.00013"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1145\/3620666.3651380"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1145\/3620666.3651352"},{"key":"ref28","article-title":"Blockwise parallel decoding for deep autoregressive models","volume":"31","author":"Stern","year":"2018","journal-title":"Advances in Neural Information Processing Systems"},{"key":"ref29","article-title":"Eagle: Speculative sampling requires rethinking feature uncertainty","author":"Li","year":"2024","journal-title":"arXiv preprint arXiv:2401.15077"},{"key":"ref30","article-title":"Turbo sparse: Achieving 11 m sota performance with minimal activated parameters","author":"Song","year":"2024"},{"key":"ref31","article-title":"Sparse large language models with relu activation","author":"Team","year":"2023"},{"key":"ref32","article-title":"Opt: Open pre-trained transformer language models","author":"Zhang","year":"2022","journal-title":"arXiv preprint arXiv:2205.01068"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1109\/hpca61900.2025.00129"},{"key":"ref34","article-title":"Samsung Advanced Institute of Technology. Pimsimulator"}],"event":{"name":"2026 31st Asia and South Pacific Design Automation Conference (ASP-DAC)","location":"Lantau, Hong Kong","start":{"date-parts":[[2026,1,19]]},"end":{"date-parts":[[2026,1,22]]}},"container-title":["2026 31st Asia and South Pacific Design Automation Conference (ASP-DAC)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/11420221\/11420229\/11420624.pdf?arnumber=11420624","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,3,11]],"date-time":"2026-03-11T05:21:49Z","timestamp":1773206509000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11420624\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,1,19]]},"references-count":34,"URL":"https:\/\/doi.org\/10.1109\/asp-dac66049.2026.11420624","relation":{},"subject":[],"published":{"date-parts":[[2026,1,19]]}}}