{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,3,5]],"date-time":"2026-03-05T07:22:12Z","timestamp":1772695332703,"version":"3.50.1"},"reference-count":63,"publisher":"IEEE","license":[{"start":{"date-parts":[[2026,1,31]],"date-time":"2026-01-31T00:00:00Z","timestamp":1769817600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,1,31]],"date-time":"2026-01-31T00:00:00Z","timestamp":1769817600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/501100012166","name":"National Key Research and Development Program of China","doi-asserted-by":"publisher","award":["2024YFB4505204"],"award-info":[{"award-number":["2024YFB4505204"]}],"id":[{"id":"10.13039\/501100012166","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62372322,62432015"],"award-info":[{"award-number":["62372322,62432015"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2026,1,31]]},"DOI":"10.1109\/hpca68181.2026.11408561","type":"proceedings-article","created":{"date-parts":[[2026,3,4]],"date-time":"2026-03-04T20:47:22Z","timestamp":1772657242000},"page":"1-14","source":"Crossref","is-referenced-by-count":0,"title":["\u00b5Share: Non-Intrusive Kernel Co-Locating on NVIDIA GPUs"],"prefix":"10.1109","author":[{"given":"Wenhao","family":"Huang","sequence":"first","affiliation":[{"name":"Tianjin University"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zhaolin","family":"Duan","sequence":"additional","affiliation":[{"name":"Tianjin University"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Laiping","family":"Zhao","sequence":"additional","affiliation":[{"name":"Tianjin University"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yuhao","family":"Zhang","sequence":"additional","affiliation":[{"name":"Tianjin University"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yanjie","family":"Wang","sequence":"additional","affiliation":[{"name":"Tianjin University"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yiming","family":"Li","sequence":"additional","affiliation":[{"name":"Tianjin University"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yihan","family":"Wang","sequence":"additional","affiliation":[{"name":"Tianjin University"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yichi","family":"Chen","sequence":"additional","affiliation":[{"name":"Tianjin University"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zhihang","family":"Tang","sequence":"additional","affiliation":[{"name":"Tianjin University"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Kang","family":"Chen","sequence":"additional","affiliation":[{"name":"Tsinghua University"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Deze","family":"Zeng","sequence":"additional","affiliation":[{"name":"China University of Geosciences"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Wenxin","family":"Li","sequence":"additional","affiliation":[{"name":"Tianjin University"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Keqiu","family":"Li","sequence":"additional","affiliation":[{"name":"Tianjin University"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref1","year":"2020","journal-title":"Setting the number of compute units"},{"key":"ref2","first-page":"499","article-title":"PipeSwitch: Fast pipelined context switching for deep learning applications","volume-title":"14th USENIX Symposium on Operating Systems Design and Implementation (OSDI 20). USENIX Association","author":"Bai","year":"2020"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/RTAS61025.2024.00031"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1145\/3620678.3624660"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1145\/3093337.3037700"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1145\/2872362.2872368"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.5555\/3291168.3291211"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1145\/3689031.3696074"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1145\/3581784.3607060"},{"key":"ref10","first-page":"199","article-title":"Serving heterogeneous machine learning models on Multi-GPU servers with Spatio-Temporal sharing","volume-title":"2022 USENIX Annual Technical Conference (USENIX ATC 22).","author":"Choi"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA47549.2020.00027"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/ICDE.2009.65"},{"key":"ref13","year":"1993","journal-title":"Linux and UNIX Man Pages"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1109\/HPEC58863.2023.10363545"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1145\/3190508.3190541"},{"key":"ref16","year":"2024","journal-title":"The GNU C Library (glibc)"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1145\/3605573.3605638"},{"key":"ref18","first-page":"3129","article-title":"A HardwareSoftware co-design for efficient Intra-Enclave isolation","volume-title":"31st USENIX Security Symposium (USENIX Security 22).","author":"Gu"},{"key":"ref19","article-title":"Serving dnns like clockwork: performance predictability from the bottom up","volume-title":"Proceedings of the 14th USENIX Conference on Operating Systems Design and Implementation, ser. OSDI\u201920. USA: USENIX Association","author":"Gujarati"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/ISCA52012.2021.00060"},{"key":"ref21","first-page":"539","article-title":"Microsecond-scale preemption for concurrent GPU-accelerated DNN inferences","volume-title":"16th USENIX Symposium on Operating Systems Design and Implementation (OSDI 22).","author":"Han"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/tst.2013.6449404"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA51647.2021.00047"},{"key":"ref24","year":"2012","journal-title":"Inline PTX Assembly in CUDA"},{"key":"ref25","year":"2024","journal-title":"intel rdt: Intel Cache Allocation Technology"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-69577-3_22"},{"key":"ref27","year":"2005","journal-title":"Set Environment Variables"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1109\/DLS49591.2019.00007"},{"key":"ref29","first-page":"881","article-title":"Rammer: Enabling holistic deep learning compiler optimizations with rTasks","volume-title":"14th USENIX Symposium on Operating Systems Design and Implementation (OSDI 20). USENIX Association","author":"Ma","year":"2020"},{"key":"ref30","year":"2020","journal-title":"NVIDIA Multi-Instance GPU"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1145\/3579371.3589045"},{"key":"ref32","year":"2013","journal-title":"NVIDIA Multi-Process Service"},{"key":"ref33","year":"2024","journal-title":"NVIDIA Nsight Compute"},{"key":"ref34","year":"2024","journal-title":"System Management Interface SMI"},{"key":"ref35","year":"2024","journal-title":"NVIDIA Nsight Systems"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1145\/2451116.2451160"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1145\/3620665.3640410"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1145\/3180270.3180271"},{"key":"ref39","year":"2017","journal-title":"Pytorch Models And Pre-trained Weights"},{"key":"ref40","year":"2024","journal-title":"Pytorch"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1145\/3669940.3707264"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1109\/ISCA45697.2020.00045"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1109\/MICRO.2012.16"},{"issue":"3","key":"ref44","doi-asserted-by":"crossref","first-page":"441","DOI":"10.1016\/S0888-613X(98)10019-1","article-title":"Towards qualitative approaches to multi-stage decision making","volume":"19","author":"Sabbadin","year":"1998","journal-title":"International Journal of Approximate Reasoning"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1109\/TCAD.2022.3218614"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1145\/3627703.3629578"},{"issue":"7.2","key":"ref47","article-title":"Parboil: A revised benchmark suite for scientific and commercial throughput computing","volume":"127","author":"Stratton","year":"2012","journal-title":"Center for Reliable and High-Performance Computing"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1109\/CLUSTER.2019.8891047"},{"key":"ref49","year":"2024","journal-title":"Tensorflow Serving Models"},{"key":"ref50","year":"2024","journal-title":"NVIDIA TensorRT"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1145\/2247684.2247693"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1145\/2247684.2247693"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA.2016.7446078"},{"key":"ref54","first-page":"533","article-title":"AntMan: Dynamic scaling on GPU clusters for deep learning","volume-title":"14th USENIX Symposium on Operating Systems Design and Implementation (OSDI 20). USENIX Association","author":"Xiao","year":"2020"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1145\/3503222.3507709"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA51647.2021.00048"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.1109\/TPDS.2018.2848621"},{"key":"ref58","first-page":"217","article-title":"PilotFish: Harvesting free cycles of cloud gaming with deep learning training","volume-title":"2022 USENIX Annual Technical Conference (USENIX ATC 22).","author":"Zhang"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.1109\/TC.2021.3064352"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1145\/3710848.3710863"},{"key":"ref61","doi-asserted-by":"publisher","DOI":"10.1109\/TC.2022.3214088"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA53966.2022.00064"},{"key":"ref63","doi-asserted-by":"publisher","DOI":"10.1109\/ICCD53106.2021.00054"}],"event":{"name":"2026 IEEE International Symposium on High Performance Computer Architecture (HPCA)","location":"Sydney, Australia","start":{"date-parts":[[2026,1,31]]},"end":{"date-parts":[[2026,2,4]]}},"container-title":["2026 IEEE International Symposium on High Performance Computer Architecture (HPCA)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/11408404\/11408433\/11408561.pdf?arnumber=11408561","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,3,5]],"date-time":"2026-03-05T06:51:16Z","timestamp":1772693476000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11408561\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,1,31]]},"references-count":63,"URL":"https:\/\/doi.org\/10.1109\/hpca68181.2026.11408561","relation":{},"subject":[],"published":{"date-parts":[[2026,1,31]]}}}