{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,11,3]],"date-time":"2025-11-03T10:34:26Z","timestamp":1762166066569,"version":"build-2065373602"},"publisher-location":"Singapore","reference-count":26,"publisher":"Springer Nature Singapore","isbn-type":[{"value":"9789819510207","type":"print"},{"value":"9789819510214","type":"electronic"}],"license":[{"start":{"date-parts":[[2025,11,4]],"date-time":"2025-11-04T00:00:00Z","timestamp":1762214400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2025,11,4]],"date-time":"2025-11-04T00:00:00Z","timestamp":1762214400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2026]]},"DOI":"10.1007\/978-981-95-1021-4_16","type":"book-chapter","created":{"date-parts":[[2025,11,3]],"date-time":"2025-11-03T10:29:23Z","timestamp":1762165763000},"page":"215-230","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["Unifying Two Operators with\u00a0One PIM: Leveraging Hybrid Bonding for\u00a0Efficient LLM Inference"],"prefix":"10.1007","author":[{"given":"Jiaxian","family":"Chen","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yuxuan","family":"Qi","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Kaoyi","family":"Sun","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zhiliang","family":"Lin","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Tianyu","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Chenlin","family":"Ma","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yi","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2025,11,4]]},"reference":[{"key":"16_CR1","unstructured":"CACTI (2025). https:\/\/www.hpl.hp.com\/research\/cacti"},{"key":"16_CR2","unstructured":"GPT-2 (2025). https:\/\/huggingface.co\/openai-community\/gpt2-large"},{"key":"16_CR3","unstructured":"LLM-Viewer (2025). https:\/\/github.com\/hahnyuan\/LLM-Viewer"},{"key":"16_CR4","unstructured":"ShareGPT (2025). https:\/\/sharegpt.com"},{"key":"16_CR5","unstructured":"Stanford Alpaca (2025). https:\/\/github.com\/tatsu-lab\/stanford_alpaca"},{"key":"16_CR6","unstructured":"vLLm (2025). https:\/\/github.com\/vllm-project\/vllm"},{"issue":"11","key":"16_CR7","doi-asserted-by":"publisher","first-page":"3579","DOI":"10.1109\/TCAD.2022.3198320","volume":"41","author":"J Chen","year":"2022","unstructured":"Chen, J., et al.: GCIM: toward efficient processing of graph convolutional networks in 3D-stacked memory. IEEE Trans. Comput.-Aided Des. Integr. Circuits Syst. (TCAD) 41(11), 3579\u20133590 (2022)","journal-title":"IEEE Trans. Comput.-Aided Des. Integr. Circuits Syst. (TCAD)"},{"key":"16_CR8","doi-asserted-by":"crossref","unstructured":"Chen, J., Zhong, Z., Sun, K., Ma, C., Mao, R., Wang, Y.: Lift: exploiting hybrid stacked memory for energy-efficient processing of graph convolutional networks. In: DAC, pp.\u00a01\u20136 (2023)","DOI":"10.1109\/DAC56929.2023.10247871"},{"key":"16_CR9","doi-asserted-by":"crossref","unstructured":"Dong, Y., Zhong, Z., Wang, Y., Ma, C., Wang, T.: Dancer: dynamic compression and quantization architecture for deep graph convolutional network. In: DATE, pp.\u00a01\u20137 (2025)","DOI":"10.23919\/DATE64628.2025.10992790"},{"key":"16_CR10","doi-asserted-by":"crossref","unstructured":"He, Y., et al.: PAPI: Exploiting Dynamic parallelism in large language model decoding with a processing-in-memory-enabled computing system. In: ASLPOS, pp. 766\u2013782 (2025)","DOI":"10.1145\/3676641.3716009"},{"key":"16_CR11","doi-asserted-by":"crossref","unstructured":"Heo, G., et al.: NeuPIMs: NPU-PIM heterogeneous acceleration for batched LLM inferencing. In: ASPLOS, pp. 722\u2013737 (2024)","DOI":"10.1145\/3620666.3651380"},{"issue":"1","key":"16_CR12","doi-asserted-by":"publisher","first-page":"83","DOI":"10.1002\/nav.3800020109","volume":"2","author":"HW Kuhn","year":"1955","unstructured":"Kuhn, H.W.: The Hungarian method for the assignment problem. Nav. Res. Logist. Q. (NRL) 2(1), 83\u201397 (1955)","journal-title":"Nav. Res. Logist. Q. (NRL)"},{"key":"16_CR13","doi-asserted-by":"crossref","unstructured":"Li, C., Zhou, Z., Zheng, S., Zhang, J., Liang, Y., Sun, G.: SpecPIM: accelerating speculative inference on PIM-enabled system via architecture-dataflow co-exploration. In: ASLPOS, pp. 950\u2013965 (2024)","DOI":"10.1145\/3620666.3651352"},{"issue":"2","key":"16_CR14","doi-asserted-by":"publisher","first-page":"106","DOI":"10.1109\/LCA.2020.2973991","volume":"19","author":"S Li","year":"2020","unstructured":"Li, S., Yang, Z., Reddy, D., Srivastava, A., Jacob, B.: DRAMsim3: a cycle-accurate, thermal-capable DRAM simulator. IEEE Comput. Archit. Lett. (CAL) 19(2), 106\u2013109 (2020)","journal-title":"IEEE Comput. Archit. Lett. (CAL)"},{"key":"16_CR15","doi-asserted-by":"crossref","unstructured":"Ma, C., Wang, Y., Chen, F., Liao, J., Wang, Y., Mao, R.: Rapper: a parameter-aware repair-in-memory accelerator for blockchain storage platform. In: HPCA, pp. 468\u2013482 (2024)","DOI":"10.1109\/HPCA57654.2024.00042"},{"key":"16_CR16","unstructured":"Ouyang, L., et al.: Training language models to follow instructions with human feedback. In: NIPS, vol.\u00a035, pp. 27730\u201327744 (2022)"},{"key":"16_CR17","doi-asserted-by":"crossref","unstructured":"Park, J., et al.: AttAcc! unleashing the power of PIM for batched transformer-based generative model inference. In: ASPLOS, pp. 103\u2013119 (2024)","DOI":"10.1145\/3620665.3640422"},{"key":"16_CR18","doi-asserted-by":"crossref","unstructured":"Seo, M., et al.: IANUS: integrated accelerator based on NPU-PIM unified memory system. In: ASLPOS, pp. 545\u2013560 (2024)","DOI":"10.1145\/3620666.3651324"},{"key":"16_CR19","doi-asserted-by":"crossref","unstructured":"Song, L., Chen, F., Zhuo, Y., Qian, X., Li, H., Chen, Y.: AccPar: tensor partitioning for heterogeneous deep learning accelerators. In: HPCA, pp. 342\u2013355 (2020)","DOI":"10.1109\/HPCA47549.2020.00036"},{"key":"16_CR20","doi-asserted-by":"crossref","unstructured":"Song, L., Mao, J., Zhuo, Y., Qian, X., Li, H., Chen, Y.: HyPar: towards hybrid parallelism for deep learning accelerator array. In: HPCA, pp. 56\u201368 (2019)","DOI":"10.1109\/HPCA.2019.00027"},{"key":"16_CR21","doi-asserted-by":"crossref","unstructured":"Tian, B., Chen, Q., Gao, M.: ABNDP: co-optimizing data access and load balance in near-data processing. In: ASPLOS, pp. 3\u201317 (2023)","DOI":"10.1145\/3582016.3582026"},{"key":"16_CR22","doi-asserted-by":"crossref","unstructured":"Xie, T., et al.: UniNDP: a unified compilation and simulation tool for near DRAM processing architectures. In: HPCA (2025)","DOI":"10.1109\/HPCA61900.2025.00054"},{"issue":"1","key":"16_CR23","first-page":"1","volume":"68","author":"A Xu","year":"2025","unstructured":"Xu, A., Deng, C., Zhu, J., Wang, Y., Wei, S., Liu, L.: Software-defined process-near-memory architecture using 3D hybrid bonding integration. Sci. China Inf. Sci. (SCIS) 68(1), 1\u201313 (2025)","journal-title":"Sci. China Inf. Sci. (SCIS)"},{"key":"16_CR24","doi-asserted-by":"crossref","unstructured":"Yang, F., Li, Y., Niu, Z., Wang, G., Liu, X.: ExtendLife: weights mapping framework to improve RRAM lifetime for accelerating CNN. In: APPT, pp. 40\u201353 (2023)","DOI":"10.1007\/978-981-99-7872-4_3"},{"key":"16_CR25","doi-asserted-by":"crossref","unstructured":"Yue, Z., et al.: Exploiting similarity opportunities of emerging vision AI models on hybrid bonding architecture. In: ISCA, pp. 396\u2013409 (2024)","DOI":"10.1109\/ISCA59077.2024.00037"},{"key":"16_CR26","doi-asserted-by":"crossref","unstructured":"Yun, S., et al.: Duplex: a device for large language models with mixture of experts, grouped query attention, and continuous batching. In: MICRO, pp. 1429\u20131443 (2024)","DOI":"10.1109\/MICRO61859.2024.00105"}],"container-title":["Lecture Notes in Computer Science","Advanced Parallel Processing Technologies"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-981-95-1021-4_16","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,11,3]],"date-time":"2025-11-03T10:29:33Z","timestamp":1762165773000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-981-95-1021-4_16"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,11,4]]},"ISBN":["9789819510207","9789819510214"],"references-count":26,"URL":"https:\/\/doi.org\/10.1007\/978-981-95-1021-4_16","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,11,4]]},"assertion":[{"value":"4 November 2025","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"APPT","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"International Symposium on Advanced Parallel Processing Technologies","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Athens","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Greece","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2025","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"13 July 2025","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"16 July 2025","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"16","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"appt2025","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/www.appt-conference.com\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}