{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,3,5]],"date-time":"2026-03-05T07:14:00Z","timestamp":1772694840695,"version":"3.50.1"},"reference-count":55,"publisher":"IEEE","license":[{"start":{"date-parts":[[2026,1,31]],"date-time":"2026-01-31T00:00:00Z","timestamp":1769817600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,1,31]],"date-time":"2026-01-31T00:00:00Z","timestamp":1769817600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["92373103,62204271,62334014"],"award-info":[{"award-number":["92373103,62204271,62334014"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2026,1,31]]},"DOI":"10.1109\/hpca68181.2026.11408473","type":"proceedings-article","created":{"date-parts":[[2026,3,4]],"date-time":"2026-03-04T20:47:22Z","timestamp":1772657242000},"page":"1-14","source":"Crossref","is-referenced-by-count":0,"title":["LRM-GPU: Alleviating Synchronization Overhead for Multi-Chiplet GPU Architecture"],"prefix":"10.1109","author":[{"given":"Baiqing","family":"Zhong","sequence":"first","affiliation":[{"name":"School of Microelectronics Science and Technology, Sun Yat-Sen University,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zhirong","family":"Ye","sequence":"additional","affiliation":[{"name":"School of Microelectronics Science and Technology, Sun Yat-Sen University,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xiaojie","family":"Li","sequence":"additional","affiliation":[{"name":"School of Microelectronics Science and Technology, Sun Yat-Sen University,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Peilin","family":"Wang","sequence":"additional","affiliation":[{"name":"School of Microelectronics Science and Technology, Sun Yat-Sen University,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Haiqiu","family":"Huang","sequence":"additional","affiliation":[{"name":"School of Microelectronics Science and Technology, Sun Yat-Sen University,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zhaolin","family":"Li","sequence":"additional","affiliation":[{"name":"Tsinghua University,Department of Computer Science and Technology,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zhiyi","family":"Yu","sequence":"additional","affiliation":[{"name":"School of Microelectronics Science and Technology, Sun Yat-Sen University,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Mingyu","family":"Wang","sequence":"additional","affiliation":[{"name":"School of Microelectronics Science and Technology, Sun Yat-Sen University,China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/MICRO.2016.7783729"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1145\/3140659.3080231"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA.2019.00063"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/IISWC.2013.6704684"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/IISWC.2009.5306797"},{"key":"ref6","article-title":"cudnn: Efficient Primitives for Deep Learning","author":"Chetlur","year":"2014","journal-title":"arXiv preprint"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/MICRO50266.2020.00083"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/MICRO61859.2024.00058"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/TPDS.2022.3218508"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA53966.2022.00056"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1145\/3669940.3707238"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/MICRO.2016.7783714"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA.2018.00040"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1109\/ISCA59077.2024.00065"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1145\/3484505"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA.2014.6835930"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1145\/2485922.2485940"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1145\/2541940.2541981"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/ISPASS.2013.6557149"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1145\/2451116.2451118"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1145\/3466752.3480063"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/MM.2016.53"},{"key":"ref23","article-title":"Life After Dennard and How I Learned to Love the Picojoule","author":"Keckler","year":"2011","journal-title":"Keynote at MICRO"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1109\/ISCA45697.2020.00047"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1145\/2889488"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.435"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1145\/103727.103729"},{"key":"ref28","volume-title":"NVIDIA CUB Library","author":"Merrill","year":"2020"},{"key":"ref29","doi-asserted-by":"crossref","first-page":"123","DOI":"10.1145\/3123939.3124534","article-title":"Beyond the socket: NUMA-aware GPUs","volume-title":"Proceedings of the 50th Annual IEEE\/ACM International Symposium on Microarchitecture","author":"Milic","year":"2017"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1109\/JPROC.1998.658762"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1109\/IISWC.2014.6983052"},{"key":"ref32","volume-title":"llm.c"},{"key":"ref33","volume-title":"Simple-vgg16-cu"},{"key":"ref34","volume-title":"Nvidias Next Generation CUDA Compute-Architecture: Kepler gk110","year":"2012"},{"key":"ref35","volume-title":"TOP500 Shows Growing Momentum for Accelerators.","year":"2015"},{"key":"ref36","volume-title":"NVIDIA Tesla P100 Architecture","year":"2016"},{"key":"ref37","volume-title":"NVIDIA Tesla V100 Architecture","year":"2017"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1145\/2786763.2694350"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA.2019.00042"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1109\/JSSC.2013.2279053"},{"key":"ref41","doi-asserted-by":"crossref","first-page":"457","DOI":"10.1145\/2540708.2540747","article-title":"Heterogeneous System Coherence for Integrated CPU-GPU Systems","volume-title":"Proceedings of the 46th Annual IEEE\/ACM International Symposium on Microarchitecture","author":"Power","year":"2013"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1109\/MICRO56248.2022.00036"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA47549.2020.00054"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1109\/LCA.2025.3553766"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1145\/3352460.3358302"},{"key":"ref46","article-title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","author":"Simonyan","year":"2014","journal-title":"arXiv preprint"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.1145\/2830772.2830821"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1109\/IISWC.2017.8167781"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA.2013.6522351"},{"key":"ref50","article-title":"HPC Application Support for GPU Computing","author":"Snell","year":"2017","journal-title":"Intersect365 Research"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1145\/3297858.3304055"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1145\/3579371.3589078"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.1145\/3673038.3673075"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1109\/MICRO61859.2024.00056"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA61900.2025.00125"}],"event":{"name":"2026 IEEE International Symposium on High Performance Computer Architecture (HPCA)","location":"Sydney, Australia","start":{"date-parts":[[2026,1,31]]},"end":{"date-parts":[[2026,2,4]]}},"container-title":["2026 IEEE International Symposium on High Performance Computer Architecture (HPCA)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/11408404\/11408433\/11408473.pdf?arnumber=11408473","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,3,5]],"date-time":"2026-03-05T06:35:11Z","timestamp":1772692511000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11408473\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,1,31]]},"references-count":55,"URL":"https:\/\/doi.org\/10.1109\/hpca68181.2026.11408473","relation":{},"subject":[],"published":{"date-parts":[[2026,1,31]]}}}