{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,2,24]],"date-time":"2026-02-24T08:47:29Z","timestamp":1771922849056,"version":"3.50.1"},"reference-count":80,"publisher":"IEEE","license":[{"start":{"date-parts":[[2026,1,31]],"date-time":"2026-01-31T00:00:00Z","timestamp":1769817600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,1,31]],"date-time":"2026-01-31T00:00:00Z","timestamp":1769817600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2026,1,31]]},"DOI":"10.1109\/cgo68049.2026.11395207","type":"proceedings-article","created":{"date-parts":[[2026,2,23]],"date-time":"2026-02-23T20:46:32Z","timestamp":1771879592000},"page":"493-506","source":"Crossref","is-referenced-by-count":0,"title":["Proton: Towards Multi-level, Adaptive Profiling for Triton"],"prefix":"10.1109","author":[{"given":"Keren","family":"Zhou","sequence":"first","affiliation":[{"name":"George Mason University,Department of Computer Science,Fairfax,VA,USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Tianle","family":"Zhong","sequence":"additional","affiliation":[{"name":"University of Virginia,Charlottesville,VA,USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Hao","family":"Wu","sequence":"additional","affiliation":[{"name":"George Mason University,Department of Computer Science,Fairfax,VA,USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jihyeong","family":"Lee","sequence":"additional","affiliation":[{"name":"George Mason University,Department of Computer Science,Fairfax,VA,USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yue","family":"Guan","sequence":"additional","affiliation":[{"name":"University of California,San Diego, La Jolla,CA,USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yufei","family":"Ding","sequence":"additional","affiliation":[{"name":"University of California,San Diego, La Jolla,CA,USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Corbin","family":"Robeck","sequence":"additional","affiliation":[{"name":"Meta,Menlo Park,CA,USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yuanwei","family":"Fang","sequence":"additional","affiliation":[{"name":"Meta,Menlo Park,CA,USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jeff","family":"Niu","sequence":"additional","affiliation":[{"name":"OpenAI,San Francisco,CA,USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Philippe","family":"Tillet","sequence":"additional","affiliation":[{"name":"OpenAI,San Francisco,CA,USA"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.48550\/ARXIV.1706.03762"},{"key":"ref2","first-page":"1877","article-title":"Language models are few-shot learners","volume":"33","author":"Brown","year":"2020","journal-title":"Advances in neural information processing systems"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00453"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00371"},{"key":"ref5","article-title":"Robust speech recognition via large-scale weak supervision","volume-title":"OpenAI technical report","author":"Radford","year":"2022"},{"issue":"3","key":"ref6","first-page":"1136","article-title":"Current designs of robotic arm grippers: A comprehensive systematic review","volume":"23","author":"Hernandez","year":"2023","journal-title":"Sensors"},{"issue":"4","key":"ref7","first-page":"1821","article-title":"Indoor positioning systems of mobile robots: A review","volume":"23","author":"Huang","year":"2023","journal-title":"Sensors"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1145\/3178876.3186183"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/IPDPSW.2018.00091"},{"key":"ref10","volume-title":"AMD CDNA\u2122 3 Architecture White Paper","author":"Corporation","year":"2024"},{"key":"ref11","article-title":"Nvidia h100 tensor core gpu architecture","author":"Corporation","year":"2022"},{"key":"ref12","volume-title":"NVIDIA Blackwell Architecture Technical Brief","year":"2024"},{"key":"ref13","volume-title":"CUDA C++ Programming Guide","year":"2023"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1145\/3315508.3329973"},{"key":"ref15","article-title":"Cutile: A compiler-assisted tiled programming abstraction for gpus","author":"Jiang","year":"2023"},{"key":"ref16","article-title":"Tilelang: Language-level support for optimizing tiled computation","year":"2023"},{"key":"ref17","article-title":"Thunderkittens: A domain-specific language for large-scale ai on gpus","author":"Chen","year":"2024"},{"key":"ref18","volume-title":"JAX Pallas GPU Programming Interface","author":"Team","year":"2024"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1145\/3620665.3640366"},{"key":"ref20","first-page":"16 344","article-title":"Flashattention: Fast and memory-efficient exact attention with io-awareness","volume":"35","author":"Dao","year":"2022","journal-title":"Advances in neural information processing systems"},{"key":"ref21","article-title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer","author":"Shazeer","year":"2017"},{"key":"ref22","article-title":"Infinitehip: Extending language model context up to 3 million tokens on a single gpu","author":"Lee","year":"2025"},{"key":"ref23","article-title":"Liger kernel: Efficient triton kernels for llm training","author":"Hsu","year":"2024"},{"key":"ref24","volume-title":"NVIDIA Nsight Systems","year":"2025"},{"key":"ref25","volume-title":"NVIDIA Nsight Compute","year":"2023"},{"key":"ref26","volume-title":"Metrics \u2014 NVIDIA NIM LLMs Benchmarking","year":"2024"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1145\/3578244.3583736"},{"key":"ref28","first-page":"265","article-title":"{TensorFlow}: a system for {Large-Scale} machine learning","volume-title":"12th USENIX symposium on operating systems design and implementation (OSDI 16)","author":"Abadi"},{"key":"ref29","article-title":"JAX: Composable transformations of python+numpy programs","author":"Bradbury","year":"2018"},{"key":"ref30","first-page":"578","article-title":"TVM: An Automated End-to-End Optimizing Compiler for Deep Learning","volume-title":"13th USENIX Symposium on Operating Systems Design and Implementation (OSDI)","author":"Chen"},{"key":"ref31","article-title":"Open neural network exchange (onnx)","year":"2019"},{"key":"ref32","article-title":"Iree: Intermediate representation execution environment","year":"2023"},{"key":"ref33","article-title":"Mosaic: A gpu dsl for modular ai acceleration","author":"Patel","year":"2023"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1109\/CGO51591.2021.9370308"},{"issue":"6","key":"ref35","first-page":"685","article-title":"Hpctoolkit: tools for performance analysis of optimized parallel programs","volume-title":"Concurr. Comput. : Pract. Exper","volume":"22","author":"Adhianto","year":"2010"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1109\/CGO51591.2021.9370339"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1145\/3524059.3532388"},{"key":"ref38","volume-title":"Using rocprofv3","year":"2025"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1145\/3456669.3456678"},{"key":"ref40","article-title":"Nvidia dlprof: Deep learning profiler","author":"Corporation","year":"2021"},{"key":"ref41","article-title":"Jax profiler","author":"Team","year":"2024"},{"key":"ref42","volume-title":"PyTorch Profiler","author":"Team","year":"2024"},{"key":"ref43","volume-title":"Use Amazon SageMaker Profiler to Monitor and Debug Training Jobs","year":"2024"},{"key":"ref44","article-title":"Rl-scope: Cross-stack profiling for deep reinforcement learning workloads","author":"Gleeson","year":"2021"},{"key":"ref45","article-title":"Hotline profiler: Automatic annotation and a multi-scale timeline for visualizing time-use in dnn training","volume-title":"Proceedings of the 2023 ACM Symposium on User Interface Software and Technology (UIST)","author":"Snider"},{"key":"ref46","doi-asserted-by":"crossref","DOI":"10.1145\/3379337.3415890","article-title":"Skyline: Interactive in-editor computational performance profiling for deep neural network training","volume-title":"Proceedings of the 33rd Annual ACM Symposium on User Interface Software and Technology (UIST)","author":"Yu"},{"key":"ref47","article-title":"Cupti: Cuda profiling tools interface"},{"key":"ref48","article-title":"Roc-tracer: Rocm tracing library","year":"2025"},{"key":"ref49","volume-title":"oneAPI Level Zero Specification, oneAPI Project","year":"2025"},{"key":"ref50","article-title":"Perfetto: A production-grade open-source suite for system profiling, app tracing, and trace analysis","year":"2025"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1145\/3295500.3356219"},{"key":"ref52","article-title":"FlameGraph","author":"Gregg"},{"key":"ref53","volume-title":"libunwind: a portable and efficient C API for unwinding stacks, GNU Project \/ NONGNU","author":"Project","year":"2025"},{"key":"ref54","volume-title":"PyFrame_GetCode (Python C API)","author":"Foundation","year":"2025"},{"key":"ref55","article-title":"Deep dive on the hopper tma unit for fp8 gemms","author":"Team","year":"2024","journal-title":"PyTorch Developer Blog"},{"key":"ref56","article-title":"Persistent kernels for iterative memory-bound gpu applications","volume-title":"Proceedings of a relevant conference","author":"Chen"},{"key":"ref57","article-title":"Enabling advanced gpu features in pytorch \u2013 warp specialization","author":"Team","journal-title":"PyTorch Developer Blog"},{"key":"ref58","volume-title":"cuBLAS Library, Release 13.0"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.1145\/1498765.1498785"},{"key":"ref60","article-title":"Sglang: Efficient execution of structured language model programs","author":"Zheng","year":"2023"},{"key":"ref61","doi-asserted-by":"crossref","DOI":"10.1145\/3600006.3613165","article-title":"Efficient memory management for large language model serving with pagedattention","author":"Kwon","year":"2023"},{"key":"ref62","article-title":"NVTX: Nvidia tools extension library","year":"2025"},{"key":"ref63","article-title":"vllm benchmarks: Datasets","year":"2025"},{"key":"ref64","article-title":"Unsloth","author":"AI","year":"2025"},{"key":"ref65","article-title":"The llama 3 herd of models","author":"Grattafiori","year":"2024"},{"key":"ref66","article-title":"Introducing llama 3.1: Our most capable models to date","author":"AI","year":"2024"},{"key":"ref67","article-title":"Llama 3.3 70B Instruct model card","author":"AI","year":"2024"},{"key":"ref68","article-title":"Gemma 3 technical report","author":"Kamath","year":"2025"},{"key":"ref69","article-title":"Mistral 7b","author":"Jiang","year":"2023"},{"key":"ref70","article-title":"Phi-3 technical report: A highly capable language model locally on your phone","author":"Abdin","year":"2024"},{"key":"ref71","article-title":"Smollm2: When smol goes big \u2014 data-centric training of a small language model","author":"Allal","year":"2025"},{"key":"ref72","article-title":"Smollm2-1.7b-instruct model card","year":"2025"},{"key":"ref73","article-title":"Tinyllama: An open-source small language model","author":"Zhang","year":"2024"},{"key":"ref74","article-title":"Zephyr: Direct distillation of lm alignment","author":"Tunstall","year":"2023"},{"key":"ref75","article-title":"Zephyr-7b model card","year":"2023"},{"key":"ref76","article-title":"Qwen3 technical report","author":"Yang","year":"2025"},{"key":"ref77","article-title":"gpt-oss-120b & gpt-oss-20b model card","author":"Agarwal","year":"2025"},{"key":"ref78","article-title":"How to accurately time cuda kernels in pytorch","volume-title":"Blog post on the Speechmatics website","author":"Atkins","year":"2023"},{"key":"ref79","article-title":"Textual \u2014 rapid application development framework for python"},{"key":"ref80","article-title":"Proton: Towards multi-level, adaptive profiling for triton (artifact)","volume-title":"artifact available on Zenodo","author":"Zhou","year":"2025"}],"event":{"name":"2026 IEEE\/ACM International Symposium on Code Generation and Optimization (CGO)","location":"Sydney, Australia","start":{"date-parts":[[2026,1,31]]},"end":{"date-parts":[[2026,2,4]]}},"container-title":["2026 IEEE\/ACM International Symposium on Code Generation and Optimization (CGO)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/11395173\/11394837\/11395207.pdf?arnumber=11395207","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,2,24]],"date-time":"2026-02-24T07:42:17Z","timestamp":1771918937000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11395207\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,1,31]]},"references-count":80,"URL":"https:\/\/doi.org\/10.1109\/cgo68049.2026.11395207","relation":{},"subject":[],"published":{"date-parts":[[2026,1,31]]}}}