{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,8,10]],"date-time":"2026-08-10T19:45:46Z","timestamp":1786391146265,"version":"build-2736575974"},"publisher-location":"New York, NY, USA","reference-count":31,"publisher":"ACM","license":[{"start":{"date-parts":[[2026,8,5]],"date-time":"2026-08-05T00:00:00Z","timestamp":1785888000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/legalcode"}],"funder":[{"name":"Ministry of Education of China","award":["JYB2025XDXM120"],"award-info":[{"award-number":["JYB2025XDXM120"]}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2026,8,5]]},"DOI":"10.1145\/3816440.3818602","type":"proceedings-article","created":{"date-parts":[[2026,8,10]],"date-time":"2026-08-10T19:23:31Z","timestamp":1786389811000},"page":"1-7","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":0,"title":["H3-Attn:\n                    <u>Att<\/u>\n                    entio\n                    <u>n<\/u>\n                    -Efficient 3D DRAM PNM Processor with\n                    <u>H<\/u>\n                    ybrid\n                    <u>H<\/u>\n                    ead Parallelism and\n                    <u>H<\/u>\n                    ierarchical SFU"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-6640-1275","authenticated-orcid":false,"given":"Yaolei","family":"Li","sequence":"first","affiliation":[{"name":"Tsinghua University, Beijing, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0007-0757-9595","authenticated-orcid":false,"given":"Wenbin","family":"Jia","sequence":"additional","affiliation":[{"name":"Tsinghua University, Beijing, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0002-3321-5983","authenticated-orcid":false,"given":"Zhanchen","family":"Zhao","sequence":"additional","affiliation":[{"name":"Tsinghua SIGS, Shenzhen, Guangdong, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-4892-2309","authenticated-orcid":false,"given":"Yongpan","family":"Liu","sequence":"additional","affiliation":[{"name":"Tsinghua University, Beijing, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"320","published-online":{"date-parts":[[2026,8,10]]},"reference":[{"key":"e_1_3_2_1_1_1","unstructured":"[n. d.]. [Online]. Available: https:\/\/huggingface.co\/deepseek-ai\/DeepSeek-V2\/blob\/main\/modeling_deepseek.py."},{"key":"e_1_3_2_1_2_1","volume-title":"Yury Zemlyanskiy, Federico Lebr\u00f3n, and Sumit Sanghai.","author":"Ainslie Joshua","year":"2023","unstructured":"Joshua Ainslie, James Lee-Thorp, Michiel De Jong, Yury Zemlyanskiy, Federico Lebr\u00f3n, and Sumit Sanghai. 2023. Gqa: Training generalized multi-query transformer models from multi-head checkpoints. arXiv preprint arXiv:2305.13245 (2023)."},{"key":"e_1_3_2_1_3_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCAD66269.2025.11240867"},{"key":"e_1_3_2_1_4_1","volume-title":"Proceedings of the 61st ACM\/IEEE Design Automation Conference (DAC). 1\u20136.","author":"Chen Zhaohui","year":"2024","unstructured":"Zhaohui Chen, Ling Liang, Qi Liu, Zhirui Li, Fahong Zhang, Yanheng Lu, and Zhen Gu. 2024. A High-Throughput Private Inference Engine Based on 3D Stacked Memory. In Proceedings of the 61st ACM\/IEEE Design Automation Conference (DAC). 1\u20136."},{"key":"e_1_3_2_1_5_1","unstructured":"Tri Dao. 2023. FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning. arXiv:2307.08691 [cs.LG] https:\/\/arxiv.org\/abs\/2307.08691"},{"key":"e_1_3_2_1_6_1","volume-title":"Advances in Neural Information Processing Systems","volume":"35","author":"Dao Tri","year":"2022","unstructured":"Tri Dao, Dan Fu, Stefano Ermon, Atri Rudra, and Christopher R\u00e9. 2022. FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness. In Advances in Neural Information Processing Systems, Vol. 35. Curran Associates, Inc., 16344\u201316359. https:\/\/proceedings.neurips.cc\/paper_files\/paper\/2022\/file\/67d57c32e20fd0a7a302cb81d36e40d5-Paper-Conference.pdf"},{"key":"e_1_3_2_1_7_1","volume-title":"Gptq: Accurate post-training quantization for generative pre-trained transformers. arXiv preprint arXiv:2210.17323","author":"Frantar Elias","year":"2022","unstructured":"Elias Frantar, Saleh Ashkboos, Torsten Hoefler, and Dan Alistarh. 2022. Gptq: Accurate post-training quantization for generative pre-trained transformers. arXiv preprint arXiv:2210.17323 (2022)."},{"key":"e_1_3_2_1_8_1","volume-title":"2020 IEEE International Electron Devices Meeting (IEDM). IEEE, 6\u20136.","author":"Fujun Bai","year":"2020","unstructured":"Bai Fujun, Jiang Xiping, Wang Song, Yu Bing, Tan Jie, Zuo Fengguo, Wang Chunjuan, Wang Fan, Long Xiaodong, Yu Guoqing, et al. 2020. A stacked embedded DRAM array for LPDDR4\/4X using hybrid bonding 3D integration with 34GB\/s\/1Gb 0.88 pJ\/b logic-to-memory interface. In 2020 IEEE International Electron Devices Meeting (IEDM). IEEE, 6\u20136."},{"key":"e_1_3_2_1_9_1","volume-title":"2025 62nd ACM\/IEEE Design Automation Conference (DAC). IEEE, 1\u20137.","author":"Han Sanghyeok","year":"2025","unstructured":"Sanghyeok Han, Byungkuk Yoon, Gyeonghwan Park, Choungki Song, Dongkyun Kim, and Jae-Joon Kim. 2025. Near-Memory LLM Inference Processor based on 3D DRAM-to-logic Hybrid Bonding. In 2025 62nd ACM\/IEEE Design Automation Conference (DAC). IEEE, 1\u20137."},{"key":"e_1_3_2_1_10_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCAD66269.2025.11240805"},{"key":"e_1_3_2_1_11_1","doi-asserted-by":"publisher","DOI":"10.1145\/3620666.3651380"},{"key":"e_1_3_2_1_12_1","volume-title":"The Thirty-ninth Annual Conference on Neural Information Processing Systems. https:\/\/arxiv.org\/abs\/2505","author":"Huang Zongle","year":"2025","unstructured":"Zongle Huang, Lei Zhu, ZongYuan Zhan, Ting Hu, Weikai Mao, Xianzhi Yu, Yongpan Liu, and Tianyu Zhang. 2025. MoESD: Unveil Speculative Decoding's Potential for Accelerating Sparse MoE. In The Thirty-ninth Annual Conference on Neural Information Processing Systems. https:\/\/arxiv.org\/abs\/2505.19645"},{"key":"e_1_3_2_1_13_1","unstructured":"JEDEC Solid State Technology Association. 2023. Low Power Double Data Rate (LPDDR) 5\/5X. Technical Report JESD209-5C. JEDEC Solid State Technology Association."},{"key":"e_1_3_2_1_14_1","doi-asserted-by":"publisher","DOI":"10.1109\/DATE.2009.5090700"},{"key":"e_1_3_2_1_15_1","doi-asserted-by":"publisher","DOI":"10.1145\/3695053.3731008"},{"key":"e_1_3_2_1_16_1","first-page":"87","article-title":"Awq: Activation-aware weight quantization for on-device llm compression and acceleration","volume":"6","author":"Lin Ji","year":"2024","unstructured":"Ji Lin, Jiaming Tang, Haotian Tang, Shang Yang, Wei-Ming Chen, Wei-Chen Wang, Guangxuan Xiao, Xingyu Dang, Chuang Gan, and Song Han. 2024. Awq: Activation-aware weight quantization for on-device llm compression and acceleration. Proceedings of Machine Learning and Systems 6 (2024), 87\u2013100.","journal-title":"Proceedings of Machine Learning and Systems"},{"key":"e_1_3_2_1_17_1","unstructured":"Aixin Liu Bei Feng Bin Wang Bingxuan Wang Bo Liu Chenggang Zhao Chengqi Dengr Chong Ruan Damai Dai et al. 2024. Deepseek-v2: A strong economical and efficient mixture-of-experts language model. arXiv preprint arXiv:2405.04434 (2024)."},{"key":"e_1_3_2_1_18_1","unstructured":"Aixin Liu Bei Feng Bing Xue Bingxuan Wang Bochao Wu Chengda Lu Chenggang Zhao Chengqi Deng Chenyu Zhang Chong Ruan et al. 2024. Deepseek-v3 technical report. arXiv preprint arXiv:2412.19437 (2024)."},{"key":"e_1_3_2_1_19_1","unstructured":"Maxim Milakov and Natalia Gimelshein. 2018. Online normalizer calculation for softmax. arXiv:1805.02867 [cs.PF] https:\/\/arxiv.org\/abs\/1805.02867"},{"key":"e_1_3_2_1_20_1","doi-asserted-by":"publisher","DOI":"10.1109\/ISSCC42614.2022.9731694"},{"key":"e_1_3_2_1_21_1","volume-title":"Proceedings of the 29th ACM International Conference on Architectural Support for Programming Languages and Operating Systems","volume":"2","author":"Park Jaehyun","year":"2024","unstructured":"Jaehyun Park, Jaewan Choi, Kwanhee Kyung, Michael Jaemin Kim, Yongsuk Kwon, Nam Sung Kim, and Jung Ho Ahn. 2024. Attacc! unleashing the power of pim for batched transformer-based generative model inference. In Proceedings of the 29th ACM International Conference on Architectural Support for Programming Languages and Operating Systems, Volume 2. 103\u2013119."},{"key":"e_1_3_2_1_22_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCAD66269.2025.11240872"},{"key":"e_1_3_2_1_23_1","doi-asserted-by":"publisher","DOI":"10.1109\/DAC56929.2023.10247855"},{"key":"e_1_3_2_1_24_1","volume-title":"Fast Transformer Decoding: One Write-Head is All You Need. CoRR abs\/1911.02150","author":"Shazeer Noam","year":"2019","unstructured":"Noam Shazeer. 2019. Fast Transformer Decoding: One Write-Head is All You Need. CoRR abs\/1911.02150 (2019). arXiv:1911.02150 http:\/\/arxiv.org\/abs\/1911.02150"},{"key":"e_1_3_2_1_25_1","doi-asserted-by":"publisher","DOI":"10.1016\/j.vlsi.2017.02.002"},{"key":"e_1_3_2_1_26_1","volume-title":"Attention is all you need. Advances in neural information processing systems 30","author":"Vaswani Ashish","year":"2017","unstructured":"Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N Gomez, \u0141ukasz Kaiser, and Illia Polosukhin. 2017. Attention is all you need. Advances in neural information processing systems 30 (2017)."},{"key":"e_1_3_2_1_27_1","doi-asserted-by":"publisher","DOI":"10.1109\/TVLSI.2025.3566468"},{"key":"e_1_3_2_1_28_1","volume-title":"2023 IEEE Symposium on VLSI Technology and Circuits (VLSI Technology and Circuits). IEEE, 1\u20132.","author":"Wang Song","year":"2023","unstructured":"Song Wang, Bing Yu, Wenwu Xiao, Fujun Bai, Xiaodong Long, Liang Bai, Xuerong Jia, Fengguo Zuo, Jie Tan, Yixin Guo, et al. 2023. A 135 GBps\/Gbit 0.66 pJ\/bit stacked embedded DRAM with multilayer arrays by fine pitch hybrid bonding and mini-TSV. In 2023 IEEE Symposium on VLSI Technology and Circuits (VLSI Technology and Circuits). IEEE, 1\u20132."},{"key":"e_1_3_2_1_29_1","volume-title":"Exploiting Similarity Opportunities of Emerging Vision AI Models on Hybrid Bonding Architecture. In 2024 ACM\/IEEE 51st Annual International Symposium on Computer Architecture (ISCA). IEEE, 396\u2013409","author":"Yue Zhiheng","year":"2024","unstructured":"Zhiheng Yue, Huizheng Wang, Jiahao Fang, Jinyi Deng, Guangyang Lu, Fengbin Tu, Ruiqi Guo, Yuxuan Li, Yubin Qin, Yang Wang, et al. 2024. Exploiting Similarity Opportunities of Emerging Vision AI Models on Hybrid Bonding Architecture. In 2024 ACM\/IEEE 51st Annual International Symposium on Computer Architecture (ISCA). IEEE, 396\u2013409."},{"key":"e_1_3_2_1_30_1","doi-asserted-by":"publisher","DOI":"10.1145\/3725843.3756087"},{"key":"e_1_3_2_1_31_1","doi-asserted-by":"publisher","DOI":"10.1109\/DAC63849.2025.11132883"}],"event":{"name":"ISLPED '26: ACM\/IEEE International Symposium on Low Power Electronics and Design","location":"Evanston IL USA","acronym":"ISLPED '26","sponsor":["SIGDA ACM Special Interest Group on Design Automation"]},"container-title":["Proceedings of the ACM\/IEEE International Symposium on Low Power Electronics and Design"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3816440.3818602","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,8,10]],"date-time":"2026-08-10T19:25:40Z","timestamp":1786389940000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3816440.3818602"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,8,5]]},"references-count":31,"alternative-id":["10.1145\/3816440.3818602","10.1145\/3816440"],"URL":"https:\/\/doi.org\/10.1145\/3816440.3818602","relation":{},"subject":[],"published":{"date-parts":[[2026,8,5]]},"assertion":[{"value":"2026-08-10","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}