{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,11,18]],"date-time":"2025-11-18T11:48:39Z","timestamp":1763466519991,"version":"3.28.0"},"reference-count":43,"publisher":"IEEE","content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2016,10]]},"DOI":"10.1109\/micro.2016.7783715","type":"proceedings-article","created":{"date-parts":[[2016,12,19]],"date-time":"2016-12-19T22:11:05Z","timestamp":1482185465000},"page":"1-13","source":"Crossref","is-referenced-by-count":7,"title":["Efficient kernel synthesis for performance portable programming"],"prefix":"10.1109","author":[{"given":"Li-Wen","family":"Chang","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Izzat El","family":"Hajj","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Christopher","family":"Rodrigues","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Juan","family":"Gomez-Luna","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Wen-mei","family":"Hwu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1145\/1356052.1356053"},{"key":"ref38","article-title":"CHiLL: A framework for composing high-level loop transformations","author":"chen","year":"2008","journal-title":"Tech Rep"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1145\/2858788.2688537"},{"key":"ref32","doi-asserted-by":"crossref","first-page":"769","DOI":"10.1109\/SC.2014.68","article-title":"Efficient sparse matrix-vector multiplication on GPUs using the CSR storage format","author":"greathouse","year":"2014","journal-title":"Proceedings of the International Conference for High Performance Computing Networking Storage and Analysis"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1145\/1735688.1735702"},{"key":"ref30","article-title":"Efficient sparse matrix-vector multiplication on CUDA","author":"bell","year":"2008","journal-title":"NVIDIA Technical Report NVR-2008-004 NVIDIA Corporation"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1109\/MICRO.2014.23"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1109\/SC.Companion.2012.97"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1109\/MM.2011.67"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1145\/2784731.2784754"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/InPar.2012.6339597"},{"key":"ref40","article-title":"CUB:kernel-level software reuse and library design","author":"merrill","year":"2013","journal-title":"GPU Technology Conference Presentation S"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1145\/2499370.2462176"},{"key":"ref12","article-title":"NESL: A nested data-parallel language.(version3.1)","author":"blelloch","year":"1995","journal-title":"Tech Rep DTIC Document"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/SC.2006.55"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1145\/1542476.1542481"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1145\/1941553.1941590"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1109\/MICRO.2016.7783716"},{"journal-title":"Nvidia","article-title":"CUDA C best practices guide v. 7.0","year":"2015","key":"ref17"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1145\/2872362.2872373"},{"year":"0","key":"ref19","article-title":"The Matrix Market"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1109\/ICPP.2015.30"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1007\/s10766-014-0320-y"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1145\/2442516.2442539"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-28652-0_1"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/MICRO.2014.20"},{"key":"ref29","first-page":"1","article-title":"Performance upper bound analysis and optimization of sgemm on Fermi and Kepler GPUs","author":"lai","year":"2013","journal-title":"Proceedings of the 2013 IEEE\/ACM International Symposium on Code Generation and Optimization"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/CGO.2015.7054205"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1016\/S0167-8191(00)00087-9"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/TPDS.2010.107"},{"key":"ref2","doi-asserted-by":"crossref","first-page":"205","DOI":"10.1145\/1854273.1854302","article-title":"Twin Peaks: A software platform for heterogeneous computing on general-purpose and graphics processors","author":"gummaraju","year":"2010","journal-title":"Proceedings of the 19th International Conference on Parallel Architectures and Compilation Techniques (PACT)"},{"key":"ref9","doi-asserted-by":"crossref","first-page":"21","DOI":"10.1177\/1094342004041291","article-title":"Spiral: A generator for platform-adapted libraries of signal processing alogorithms","volume":"18","author":"p\u00fc","year":"2004","journal-title":"International Journal of High Performance Computing Applications"},{"article-title":"Intel OpenCL implicit vectorization module","year":"2011","author":"rotem","key":"ref1"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/CGO.2004.1281665"},{"year":"0","key":"ref22","article-title":"Intel Math Kernel Library"},{"key":"ref21","first-page":"359","article-title":"Thrust: A productivity-oriented library for CUDA","author":"bell","year":"2011","journal-title":"GPU Computing Gems Jade Edition"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1145\/1868294.1868314"},{"journal-title":"Nvidia","article-title":"CUDA CUSPARSE Library","year":"2015","key":"ref24"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1145\/2584665"},{"journal-title":"Nvidia","article-title":"CUBLAS Library User Guide. NVIDIA, v7.0 ed","year":"2015","key":"ref23"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1145\/1375527.1375559"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1145\/2451116.2451162"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1109\/IISWC.2009.5306797"}],"event":{"name":"2016 49th Annual IEEE\/ACM International Symposium on Microarchitecture (MICRO)","start":{"date-parts":[[2016,10,15]]},"location":"Taipei, Taiwan","end":{"date-parts":[[2016,10,19]]}},"container-title":["2016 49th Annual IEEE\/ACM International Symposium on Microarchitecture (MICRO)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/7777315\/7783693\/07783715.pdf?arnumber=7783715","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2019,9,16]],"date-time":"2019-09-16T18:51:33Z","timestamp":1568659893000},"score":1,"resource":{"primary":{"URL":"http:\/\/ieeexplore.ieee.org\/document\/7783715\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2016,10]]},"references-count":43,"URL":"https:\/\/doi.org\/10.1109\/micro.2016.7783715","relation":{},"subject":[],"published":{"date-parts":[[2016,10]]}}}