{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,11,28]],"date-time":"2025-11-28T17:16:13Z","timestamp":1764350173936},"reference-count":35,"publisher":"IEEE","content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2012,12]]},"DOI":"10.1109\/hipc.2012.6507475","type":"proceedings-article","created":{"date-parts":[[2013,5,3]],"date-time":"2013-05-03T20:41:28Z","timestamp":1367613688000},"page":"1-10","source":"Crossref","is-referenced-by-count":7,"title":["GMProf: A low-overhead, fine-grained profiling approach for GPU programs"],"prefix":"10.1109","author":[{"given":"Mai","family":"Zheng","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Vignesh T.","family":"Ravi","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Wenjing","family":"Ma","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Feng","family":"Qin","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Gagan","family":"Agrawal","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"19","doi-asserted-by":"publisher","DOI":"10.1145\/781131.781159"},{"key":"35","doi-asserted-by":"publisher","DOI":"10.1145\/268998.266637"},{"key":"17","doi-asserted-by":"publisher","DOI":"10.1145\/1854273.1854348"},{"key":"18","doi-asserted-by":"crossref","DOI":"10.1145\/782814.782836","article-title":"Estimating cache misses and locality using stack distances","author":"cascaval","year":"2003","journal-title":"ICS"},{"key":"33","doi-asserted-by":"publisher","DOI":"10.1109\/HiPC.2012.6507475"},{"key":"15","doi-asserted-by":"crossref","DOI":"10.1145\/1345206.1345210","article-title":"Automatic data movement and computation mapping for multi-level parallel architectures with explicitly managed memories","author":"baskaran","year":"2008","journal-title":"PPoPP"},{"year":"0","key":"34"},{"key":"16","doi-asserted-by":"publisher","DOI":"10.1145\/1151074.1151085"},{"key":"13","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-19861-8_15"},{"key":"14","article-title":"Automated dynamic analysis of cuda programs","author":"boyer","year":"2008","journal-title":"Proc of 3rd Workshop on Software Tools for MultiCore Systems"},{"key":"11","doi-asserted-by":"publisher","DOI":"10.1145\/1250734.1250746"},{"key":"12","article-title":"Memory locality exploitation strategies for FFT on the CUDA architecture","author":"gutierrez","year":"2008","journal-title":"VECPAR"},{"key":"21","doi-asserted-by":"publisher","DOI":"10.1145\/781147.781148"},{"key":"20","article-title":"Enhancing LTP-driven cache management using reuse distance information","author":"liu","year":"2009","journal-title":"The Journal of Instruction-Level Parallelism"},{"key":"22","doi-asserted-by":"publisher","DOI":"10.1145\/1869459.1869481"},{"key":"23","doi-asserted-by":"publisher","DOI":"10.1145\/337449.337483"},{"journal-title":"Ephemeral instrumentation for lightweight program profiling","year":"2000","author":"traub","key":"24"},{"key":"25","doi-asserted-by":"publisher","DOI":"10.1145\/378993.379236"},{"key":"26","article-title":"Approximating the calling context tree via sampling","author":"arnold","year":"2001","journal-title":"Research Report RC 21789 (98099) IBM"},{"key":"27","doi-asserted-by":"crossref","DOI":"10.1145\/1504176.1504194","article-title":"OpenMP to GPGPU: A compiler framework for automatic translation and optimization","author":"lee","year":"2009","journal-title":"PPoPP"},{"key":"28","doi-asserted-by":"publisher","DOI":"10.1145\/1512475.1512485"},{"key":"29","doi-asserted-by":"publisher","DOI":"10.1145\/781131.781142"},{"year":"0","key":"3"},{"key":"2","doi-asserted-by":"publisher","DOI":"10.1109\/JPROC.2008.917757"},{"year":"0","key":"10"},{"year":"0","key":"1"},{"key":"30","doi-asserted-by":"publisher","DOI":"10.1145\/1810085.1810125"},{"year":"0","key":"7"},{"year":"0","key":"6"},{"journal-title":"Compilers Principles Tech-niques and Tools","year":"1986","author":"aho","key":"32"},{"key":"5","doi-asserted-by":"publisher","DOI":"10.1145\/1810085.1810105"},{"key":"31","doi-asserted-by":"publisher","DOI":"10.1145\/1950365.1950408"},{"journal-title":"OpenCL The Open Standdard for Heterogeneous Parallel Program","year":"2008","key":"4"},{"key":"9","doi-asserted-by":"publisher","DOI":"10.1177\/1094342006064482"},{"year":"0","key":"8"}],"event":{"name":"2012 19th International Conference on High Performance Computing (HiPC)","start":{"date-parts":[[2012,12,18]]},"location":"Pune, India","end":{"date-parts":[[2012,12,22]]}},"container-title":["2012 19th International Conference on High Performance Computing"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/6504607\/6507469\/06507475.pdf?arnumber=6507475","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,5,10]],"date-time":"2024-05-10T04:13:59Z","timestamp":1715314439000},"score":1,"resource":{"primary":{"URL":"http:\/\/ieeexplore.ieee.org\/document\/6507475\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2012,12]]},"references-count":35,"URL":"https:\/\/doi.org\/10.1109\/hipc.2012.6507475","relation":{},"subject":[],"published":{"date-parts":[[2012,12]]}}}