{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,11,18]],"date-time":"2025-11-18T12:14:46Z","timestamp":1763468086639,"version":"3.28.0"},"reference-count":48,"publisher":"IEEE","content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2012,6]]},"DOI":"10.1109\/isca.2012.6237038","type":"proceedings-article","created":{"date-parts":[[2012,7,21]],"date-time":"2012-07-21T00:59:02Z","timestamp":1342832342000},"page":"440-451","source":"Crossref","is-referenced-by-count":33,"title":["Can traditional programming bridge the Ninja performance gap for parallel computing applications?"],"prefix":"10.1109","author":[{"given":"Nadathur","family":"Satish","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Changkyu","family":"Kim","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jatin","family":"Chhugani","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Hideki","family":"Saito","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Rakesh","family":"Krishnaiyer","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Mikhail","family":"Smelyanskiy","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Milind","family":"Girkar","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Pradeep","family":"Dubey","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"19","article-title":"Monte carlo evaluation of sensitivities in computational finance","author":"giles","year":"2007","journal-title":"Oxford University Computing Laboratory Technical Report"},{"key":"35","doi-asserted-by":"publisher","DOI":"10.1145\/1454115.1454119"},{"key":"17","doi-asserted-by":"publisher","DOI":"10.1145\/996841.996853"},{"journal-title":"CUDA C Best Practices Guide 3 2","year":"2010","key":"36"},{"key":"18","doi-asserted-by":"publisher","DOI":"10.1109\/MS.2010.134"},{"key":"33","doi-asserted-by":"publisher","DOI":"10.1109\/SC.2010.2"},{"key":"15","doi-asserted-by":"publisher","DOI":"10.1145\/54852.378484"},{"key":"34","doi-asserted-by":"publisher","DOI":"10.1109\/CGO.2006.25"},{"key":"16","article-title":"A platform 2015 workload model: Recognition, miniming and synthesis moves computers to the era of tera","author":"dubey","year":"2005","journal-title":"Intel"},{"key":"39","doi-asserted-by":"publisher","DOI":"10.1145\/1345206.1345220"},{"key":"13","article-title":"The end of denial architecture and the rise of throughput computing","author":"dally","year":"2010","journal-title":"Keynote Speech at Desgin Automation Conference"},{"journal-title":"Auto-tuning Stencil Codes for Cache-based Multicore Platforms","year":"2009","author":"datta","key":"14"},{"journal-title":"Oracle TimesTen In-Memory Database Technical FAQ","year":"2007","key":"37"},{"key":"11","doi-asserted-by":"publisher","DOI":"10.1109\/JPROC.2008.917729"},{"key":"38","article-title":"Black-Scholes option pricing","author":"podlozhnyuk","year":"2007","journal-title":"Nvidia"},{"key":"12","doi-asserted-by":"publisher","DOI":"10.14778\/1454159.1454171"},{"key":"21","doi-asserted-by":"crossref","first-page":"143","DOI":"10.1145\/1345206.1345229","article-title":"A portable runtime interface for multi-level memory hierarchies","author":"houston","year":"2008","journal-title":"PPoPP"},{"key":"20","first-page":"521","article-title":"'N-body' problems in statistical learning","author":"gray","year":"2000","journal-title":"NIPS"},{"key":"43","doi-asserted-by":"publisher","DOI":"10.1109\/TVCG.2009.164"},{"key":"42","article-title":"Lecture2go.uni-hamburg.de\/konferenzen\/-\/k\/10940 ISC10 keynote","author":"skaugen","year":"0","journal-title":"HPC Technology-Scale-Up and Scale-Out"},{"key":"41","doi-asserted-by":"publisher","DOI":"10.1109\/MM.2009.9"},{"key":"40","doi-asserted-by":"publisher","DOI":"10.1145\/1807167.1807207"},{"key":"48","doi-asserted-by":"publisher","DOI":"10.1145\/1806596.1806640"},{"key":"45","doi-asserted-by":"crossref","first-page":"762","DOI":"10.1016\/j.jpdc.2009.04.002","article-title":"Optimization of a lattice Boltzmann computation on state-of-the-art multicore platforms","volume":"69","author":"williams","year":"2009","journal-title":"J Parallel Distrib Comput"},{"key":"44","doi-asserted-by":"crossref","DOI":"10.1007\/978-3-540-27982-2","author":"sukop","year":"2006","journal-title":"Lattice Boltzmann Modeling An Introduction for Geoscientists and Engineers"},{"key":"47","doi-asserted-by":"publisher","DOI":"10.1145\/1806596.1806606"},{"key":"46","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA.2010.5416628"},{"journal-title":"A Quick Easy and Reliable Way to Improve Threaded Performance","year":"2010","key":"22"},{"journal-title":"Intel Advanced Vector Extensions Programming Reference","year":"2011","key":"23"},{"journal-title":"Optimization Notice","year":"2012","key":"24"},{"key":"25","doi-asserted-by":"publisher","DOI":"10.1109\/TPDS.2010.70"},{"key":"26","doi-asserted-by":"publisher","DOI":"10.1109\/NSSMIC.2006.354221"},{"key":"27","doi-asserted-by":"publisher","DOI":"10.1145\/1806596.1806605"},{"key":"28","doi-asserted-by":"publisher","DOI":"10.1145\/1807167.1807206"},{"key":"29","article-title":"Closing the ninja performance gap through traditional programming and compiler technology","author":"kim","year":"2011","journal-title":"MRL Tech Report Intel Labs"},{"key":"3","article-title":"The landscape of parallel computing research: A view from berkeley","author":"asanovic","year":"2006","journal-title":"Technical Report UCB\/EECS-183"},{"key":"2","doi-asserted-by":"publisher","DOI":"10.1109\/ICPP.2009.71"},{"journal-title":"Parallel Programming in OpenMP","year":"2010","author":"chandra","key":"10"},{"key":"1","doi-asserted-by":"publisher","DOI":"10.1017\/CBO9780511535246"},{"key":"30","doi-asserted-by":"publisher","DOI":"10.1145\/1815961.1816021"},{"key":"7","article-title":"Can CPUs match GPUs on performance with productivity?: Experiences with optimizing aFLOP-intensive application on CPUs and GPU","author":"bordawekar","year":"2010","journal-title":"IBM Research Report RC"},{"key":"6","doi-asserted-by":"publisher","DOI":"10.1145\/1810479.1810519"},{"key":"32","doi-asserted-by":"publisher","DOI":"10.1109\/2.917539"},{"key":"5","doi-asserted-by":"publisher","DOI":"10.1086\/260062"},{"key":"31","doi-asserted-by":"publisher","DOI":"10.1109\/MS.2011.2"},{"key":"4","doi-asserted-by":"publisher","DOI":"10.1145\/1454115.1454128"},{"journal-title":"Reinventing DRAM with the Hybrid Memory Cube","year":"2010","author":"casper","key":"9"},{"key":"8","doi-asserted-by":"publisher","DOI":"10.1111\/1467-9965.00028"}],"event":{"name":"2012 ACM\/IEEE 39th International Symposium on Computer Architecture (ISCA)","start":{"date-parts":[[2012,6,9]]},"location":"Portland, OR, USA","end":{"date-parts":[[2012,6,13]]}},"container-title":["2012 39th Annual International Symposium on Computer Architecture (ISCA)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx5\/6230820\/6236993\/06237038.pdf?arnumber=6237038","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2020,7,11]],"date-time":"2020-07-11T08:20:19Z","timestamp":1594455619000},"score":1,"resource":{"primary":{"URL":"http:\/\/ieeexplore.ieee.org\/document\/6237038\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2012,6]]},"references-count":48,"URL":"https:\/\/doi.org\/10.1109\/isca.2012.6237038","relation":{},"subject":[],"published":{"date-parts":[[2012,6]]}}}