{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,19]],"date-time":"2026-06-19T02:42:19Z","timestamp":1781836939537,"version":"3.54.5"},"reference-count":34,"publisher":"IEEE","license":[{"start":{"date-parts":[[2025,6,22]],"date-time":"2025-06-22T00:00:00Z","timestamp":1750550400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2025,6,22]],"date-time":"2025-06-22T00:00:00Z","timestamp":1750550400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/100018058","name":"SK Hynix","doi-asserted-by":"publisher","id":[{"id":"10.13039\/100018058","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100002551","name":"Seoul National University","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100002551","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100003836","name":"IC Design Education Center","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100003836","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025,6,22]]},"DOI":"10.1109\/dac63849.2025.11132870","type":"proceedings-article","created":{"date-parts":[[2025,9,15]],"date-time":"2025-09-15T17:35:41Z","timestamp":1757957741000},"page":"1-7","source":"Crossref","is-referenced-by-count":3,"title":["Near-Memory LLM Inference Processor based on 3D DRAM-to-logic Hybrid Bonding"],"prefix":"10.1109","author":[{"given":"Sanghyeok","family":"Han","sequence":"first","affiliation":[{"name":"Seoul National University"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Byungkuk","family":"Yoon","sequence":"additional","affiliation":[{"name":"Seoul National University"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Gyeonghwan","family":"Park","sequence":"additional","affiliation":[{"name":"Seoul National University"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Choungki","family":"Song","sequence":"additional","affiliation":[{"name":"SK Hynix DRAM Development"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Dongkyun","family":"Kim","sequence":"additional","affiliation":[{"name":"SK Hynix DRAM Development"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jae-Joon","family":"Kim","sequence":"additional","affiliation":[{"name":"Seoul National University"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","article-title":"Language models are few-shot learners","author":"Brown","year":"2020","journal-title":"NeurIPS"},{"key":"ref2","article-title":"Llama: Open and efficient foundation language models","author":"Touvron","year":"2023","journal-title":"arXiv preprint"},{"key":"ref3","article-title":"Opt: Open pre-trained transformer language models","author":"Zhang","year":"2022","journal-title":"arXiv preprint"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1145\/3637364"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/DAC56929.2023.10247987"},{"key":"ref6","article-title":"Prompting large language model for machine translation: a case study","author":"Zhang","year":"2023","journal-title":"ICML"},{"key":"ref7","article-title":"Visionllm: Large language model is also an open-ended decoder for vision-centric tasks","author":"Wang","year":"2023","journal-title":"NeurIPS"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/DAC56929.2023.10247684"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1145\/3581783.3612665"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/DAC56929.2023.10247761"},{"key":"ref11","article-title":"A 1 ynm 1.25 v8 gb, 16 gb\/s\/pin gddr6-based acceleratorinmemory supporting 1tflops mac operation and various activation functions for deep-learning applications","author":"Lee","year":"2022","journal-title":"ISSCC"},{"key":"ref12","article-title":"25.4 a 20 nm 6 gb function-in-memory dram, based on hbm2 with a 1.2tflops programmable computing unit using bank-level parallelism, for machine learning applications","author":"Kwon","year":"2021","journal-title":"ISSCC"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/DAC56929.2023.10247747"},{"key":"ref14","article-title":"Orca: A distributed serving system for TransformerBased generative models","author":"Yu","year":"2022","journal-title":"OSDI"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1145\/3600006.3613165"},{"key":"ref16","article-title":"Efficiently scaling transformer inference","author":"Pope","year":"2023"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1145\/3620666.3651380"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1145\/3620665.3640422"},{"key":"ref19","article-title":"Impact of process variations on the capacitance and electrical resistance down to 1.44 \u03bcm hybrid bonding interconnects","author":"Ayoub","year":"2020","journal-title":"EPTC"},{"key":"ref20","article-title":"184 qps\/ w64 mb\/ mm23 d logic-to-dram hybrid bonding with process-near-memory engine for recommendation system","author":"Niu","year":"2022","journal-title":"ISSCC"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/ISCA59077.2024.00037"},{"key":"ref22","article-title":"A stacked embedded dram array for lpddr4\/4x using hybrid bonding 3 d integration with 34 gb\/ s\/ 1 gb0.88 pj\/ b logic-to-memory interface","author":"Fujun","year":"2020","journal-title":"IEDM"},{"key":"ref23","article-title":"Dramsim3"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1109\/ISCA52012.2021.00010"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1109\/ISCA59077.2024.00019"},{"key":"ref26","article-title":"Scale-sim: Systolic cnn accelerator simulator","author":"Samajdar","year":"2019","journal-title":"arXiv preprint"},{"key":"ref27","article-title":"Gpipe: Efficient training of giant neural networks using pipeline parallelism","author":"Huang","year":"2019","journal-title":"NeurIPS"},{"key":"ref28","article-title":"Efficient large-scale language model training on gpu clusters using megatron-lm","author":"Narayanan","year":"2021","journal-title":"SC"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1109\/jssc.2022.3193354"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1109\/MM.2021.3058217"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1145\/3140659.3080246"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1016\/j.vlsi.2017.02.002"},{"key":"ref33","article-title":"Palm: Sclaing language modeling with pathways","author":"Chowdhery","year":"2023","journal-title":"Journal of Machien Learning Research"},{"key":"ref34","article-title":"\u2019Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","author":"Team","year":"2024","journal-title":"arXiv preprint"}],"event":{"name":"2025 62nd ACM\/IEEE Design Automation Conference (DAC)","location":"San Francisco, CA, USA","start":{"date-parts":[[2025,6,22]]},"end":{"date-parts":[[2025,6,25]]}},"container-title":["2025 62nd ACM\/IEEE Design Automation Conference (DAC)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/11132383\/11132091\/11132870.pdf?arnumber=11132870","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,9,16]],"date-time":"2025-09-16T05:24:26Z","timestamp":1758000266000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11132870\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,6,22]]},"references-count":34,"URL":"https:\/\/doi.org\/10.1109\/dac63849.2025.11132870","relation":{},"subject":[],"published":{"date-parts":[[2025,6,22]]}}}