{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2024,10,22]],"date-time":"2024-10-22T19:20:22Z","timestamp":1729624822511,"version":"3.28.0"},"reference-count":41,"publisher":"IEEE","content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2015,2]]},"DOI":"10.1109\/cgo.2015.7054205","type":"proceedings-article","created":{"date-parts":[[2015,3,10]],"date-time":"2015-03-10T21:47:12Z","timestamp":1426024032000},"page":"257-268","source":"Crossref","is-referenced-by-count":11,"title":["Locality-centric thread scheduling for bulk-synchronous programming models on CPU architectures"],"prefix":"10.1109","author":[{"given":"Hee-Seok","family":"Kim","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Izzat El","family":"Hajj","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"John","family":"Stratton","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Steven","family":"Lumetta","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Wen-Mei","family":"Hwu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1145\/1854273.1854336"},{"key":"ref38","article-title":"Parboil: A revised benchmark suite for scientific and commercial throughput computing","author":"stratton","year":"2012","journal-title":"IMPACT Technical Report"},{"article-title":"Intel OpenCL Implicit Vectorization Module","year":"2011","author":"rotem","key":"ref33"},{"key":"ref32","first-page":"7","article-title":"Code Generation in the Polyhedral Model Is Easier Than You Think","author":"prism","year":"2004","journal-title":"Proceedings of the 13th International Conference on Parallel Architectures and Compilation Techniques"},{"key":"ref31","first-page":"298","article-title":"Intel Threading Building Blocks","volume":"23","author":"pheatt","year":"2008","journal-title":"J Comput Sci Coll"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1145\/233561.233564"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1145\/1772954.1772971"},{"key":"ref36","doi-asserted-by":"crossref","first-page":"16","DOI":"10.1007\/978-3-540-89740-8_2","article-title":"MCUDA: An efficient implementation of CUDA kernels for multi-core CPUs","author":"stratton","year":"2008","journal-title":"Languages and Compilers for Parallel Computing"},{"key":"ref35","first-page":"38","article-title":"Performance Traps in OpenCL for CPUs","author":"shen","year":"0"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1109\/PACT.2013.6618834"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1145\/1854273.1854318"},{"article-title":"Predicate Vectors If You Must","year":"0","author":"timnat","key":"ref40"},{"article-title":"Dynamic loop vectorization for executing OpenCL kernels on CPUs","year":"2014","author":"el hajj","key":"ref11"},{"key":"ref12","first-page":"269","article-title":"Perfmon2: a flexible performance monitoring interface for Linux","author":"eranian","year":"2006","journal-title":"Proc of the 2006 Ottawa Linux Symposium"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1145\/1854273.1854302"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1145\/1075382.1075385"},{"article-title":"pocl: A performance-portable OpenCL implementation","year":"2014","author":"j\u00e4skel\u00e4inen","key":"ref15"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1145\/2568058.2568064"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/CGO.2011.5764682"},{"key":"ref18","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1007\/978-3-642-28652-0_1","article-title":"Improving Performance of OpenCL on CPUs","author":"karrenberg","year":"2012","journal-title":"Proceedings of the 21st International Conference on Compiler Construction"},{"article-title":"Optimizing Compilers for Modern Architectures: A Dependence-based Approach","year":"2002","author":"kennedy","key":"ref19"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1145\/2503210.2503268"},{"key":"ref4","first-page":"27:1","article-title":"A Scalable, Numerically Stable, High-performance Tridiagonal Solver Using GPUs","author":"chang","year":"2012","journal-title":"Proceedings of the International Conference on High Performance Computing Networking Storage and Analysis"},{"key":"ref27","first-page":"1","article-title":"Convergence and scalarization for data-parallel architectures","author":"lee","year":"0"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1145\/1375581.1375595"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/MASCOTS.2010.43"},{"key":"ref29","doi-asserted-by":"crossref","first-page":"138","DOI":"10.1145\/223982.225965","article-title":"A comparison of full and partial predicated execution support for ILP processors","author":"mahlke","year":"1995","journal-title":"Computer Architecture 1995 Proceedings 22nd Annual International Symposium on"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/IISWC.2009.5306797"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/PACT.2011.63"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-14122-5_8"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/ISPASS.2009.4919648"},{"key":"ref9","doi-asserted-by":"crossref","first-page":"46","DOI":"10.1109\/99.660313","volume":"5","author":"dagum","year":"1998","journal-title":"Computational Science & Engineering IEEE"},{"key":"ref1","article-title":"Opencl for programming shared memory multicore cpus","author":"ali","year":"2012","journal-title":"Proceedings of the 5th MultiG Workshop"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1145\/2259016.2259020"},{"key":"ref22","article-title":"Multi-tier Dynamic Vectorization for Translating GPU Optimizations into CPU Performance","author":"kim","year":"2014","journal-title":"IMPACT Technical Report"},{"article-title":"The OpenCL Specification","year":"2008","author":"munshi","key":"ref21"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1145\/2491956.2462187"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1145\/1806596.1806606"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1145\/2304576.2304623"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1109\/IPDPSW.2013.141"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1145\/1854273.1854301"}],"event":{"name":"2015 IEEE\/ACM International Symposium on Code Generation and Optimization (CGO)","start":{"date-parts":[[2015,2,7]]},"location":"San Francisco, CA, USA","end":{"date-parts":[[2015,2,11]]}},"container-title":["2015 IEEE\/ACM International Symposium on Code Generation and Optimization (CGO)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/7041249\/7054173\/07054205.pdf?arnumber=7054205","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2019,8,21]],"date-time":"2019-08-21T21:07:55Z","timestamp":1566421675000},"score":1,"resource":{"primary":{"URL":"http:\/\/ieeexplore.ieee.org\/document\/7054205\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2015,2]]},"references-count":41,"URL":"https:\/\/doi.org\/10.1109\/cgo.2015.7054205","relation":{},"subject":[],"published":{"date-parts":[[2015,2]]}}}