{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2024,10,22]],"date-time":"2024-10-22T17:46:46Z","timestamp":1729619206932,"version":"3.28.0"},"reference-count":41,"publisher":"IEEE","content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2014,9]]},"DOI":"10.1109\/patmos.2014.6951895","type":"proceedings-article","created":{"date-parts":[[2014,11,25]],"date-time":"2014-11-25T22:43:28Z","timestamp":1416955408000},"page":"1-8","source":"Crossref","is-referenced-by-count":4,"title":["Efficient Dense and Sparse Matrix Multiplication on GP-SIMD"],"prefix":"10.1109","author":[{"given":"Amir","family":"Morad","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Leonid","family":"Yavits","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Ran","family":"Ginosar","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"19","doi-asserted-by":"publisher","DOI":"10.1109\/TVLSI.2010.2049867"},{"journal-title":"Automatic Perfonnance Tuning of Sparse Matrix Kernels","year":"2003","author":"vuduc","key":"35"},{"key":"17","doi-asserted-by":"publisher","DOI":"10.1109\/FCCM.2007.56"},{"key":"36","first-page":"97","article-title":"Scan primitives for GPU computing","volume":"2007","author":"sengupta","year":"2007","journal-title":"Graphics Hardware"},{"key":"18","doi-asserted-by":"publisher","DOI":"10.1109\/IEDM.2003.1269421"},{"key":"33","doi-asserted-by":"publisher","DOI":"10.1109\/HPEC.2013.6670336"},{"key":"15","doi-asserted-by":"publisher","DOI":"10.1201\/b10376"},{"key":"34","article-title":"A scalable sparse matrix-vector multiplication kernel for energyefficient sparse-BLAS on FPGAs","author":"dorrance","year":"0","journal-title":"2014 ACM\/SIGDA International Symposium on Field-programmable Gate Arrays"},{"key":"16","doi-asserted-by":"publisher","DOI":"10.1109\/5.48831"},{"key":"39","doi-asserted-by":"publisher","DOI":"10.1145\/2049662.2049663"},{"key":"13","doi-asserted-by":"publisher","DOI":"10.1016\/0167-8191(92)90007-T"},{"key":"14","doi-asserted-by":"publisher","DOI":"10.1145\/882262.882364"},{"key":"37","doi-asserted-by":"publisher","DOI":"10.1147\/rd.416.0711"},{"journal-title":"Vector Models for Data-Parallel Computing","year":"1990","author":"blelloch","key":"11"},{"key":"38","doi-asserted-by":"publisher","DOI":"10.1016\/j.parco.2008.12.006"},{"key":"12","article-title":"AP-DIMM: Associative computing with STT-MRAM","author":"qing","year":"2013","journal-title":"ISCA"},{"key":"21","article-title":"Computer architecture with associative processor replacing last level cache and SlMD accelerator","author":"yavits","year":"2014","journal-title":"IEEE Transactions on Computers"},{"key":"20","doi-asserted-by":"crossref","first-page":"205","DOI":"10.1002\/cta.796","article-title":"Design space exploration for sparse matrix-matrix multiplication on FPGAs","volume":"41","author":"colin yu","year":"2013","journal-title":"International Journal of Circuit Theory and Applications"},{"journal-title":"PSPARSLIB A Portable Library of Distributed Memory Sparse Iterative Solvers","year":"1995","author":"saad","key":"41"},{"key":"40","doi-asserted-by":"publisher","DOI":"10.1145\/2464996.2465013"},{"key":"22","doi-asserted-by":"publisher","DOI":"10.1109\/TPDS.2014.2370055"},{"key":"23","article-title":"The effect of communication and synchronization on Amdahl's law in multicore systems","author":"yavits","year":"2013","journal-title":"Parallel Computing Journal"},{"key":"24","doi-asserted-by":"publisher","DOI":"10.1145\/1046192.1046202"},{"journal-title":"Optimizing Sparse Matrix-Vector Multiplication on GPUs Using Compile-time and Run-time Strategies","year":"2008","author":"baskaran","key":"25"},{"key":"26","doi-asserted-by":"publisher","DOI":"10.1109\/MM.2006.41"},{"key":"27","doi-asserted-by":"publisher","DOI":"10.1016\/0167-8191(93)90004-5"},{"key":"28","doi-asserted-by":"publisher","DOI":"10.1145\/1654059.1654078"},{"key":"29","volume":"20","author":"bell","year":"2008","journal-title":"Efficient Sparse Matrix-Vector Multiplication on CUDA"},{"journal-title":"ARM\ufffd NEON? General-purpose SIMD Engine","year":"0","key":"3"},{"journal-title":"GP-SIMD Processing-in-Memory","year":"2014","author":"morad","key":"2"},{"journal-title":"Perfonnance Evaluation of Sparse Matrix Multiplication Kernels on Intel Xeon Phi","year":"2013","author":"saule","key":"10"},{"journal-title":"The Intel\ufffd Xeon Phi? Coprocessor","year":"0","key":"1"},{"key":"30","doi-asserted-by":"publisher","DOI":"10.1109\/12.956091"},{"key":"7","doi-asserted-by":"publisher","DOI":"10.1109\/ICDAR.2005.251"},{"key":"6","doi-asserted-by":"publisher","DOI":"10.1016\/S0010-4655(01)00164-3"},{"key":"32","doi-asserted-by":"publisher","DOI":"10.1016\/0743-7315(85)90033-4"},{"key":"5","first-page":"270","article-title":"The coherent processor: An associative processor architecture and applications","author":"stonnon","year":"1991","journal-title":"Compcon Digest of Papers"},{"key":"31","doi-asserted-by":"publisher","DOI":"10.1109\/71.963416"},{"key":"4","doi-asserted-by":"crossref","first-page":"30","DOI":"10.1145\/331532.331562","article-title":"Lmproving perfonnance of sparse matrix-vector multiplication","author":"pinar","year":"1999","journal-title":"Proceedings of the 1999 ACM\/IEEE Conference on Supercomputing (CDROM)"},{"journal-title":"Optimizing the Perfonnance of Sparse Matrix-vector MUltiplication","year":"2000","author":"im","key":"9"},{"key":"8","doi-asserted-by":"crossref","first-page":"13","DOI":"10.1145\/268806.268810","article-title":"The simplescalar tool set","volume":"25","author":"burger","year":"1997","journal-title":"ACM SIGARCH Computer Architecture News"}],"event":{"name":"2014 24th International Workshop on Power and Timing Modeling, Optimization and Simulation (PATMOS)","start":{"date-parts":[[2014,9,29]]},"location":"Palma de Mallorca, Spain","end":{"date-parts":[[2014,10,1]]}},"container-title":["2014 24th International Workshop on Power and Timing Modeling, Optimization and Simulation (PATMOS)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/6942524\/6951857\/06951895.pdf?arnumber=6951895","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2017,6,23]],"date-time":"2017-06-23T00:55:45Z","timestamp":1498179345000},"score":1,"resource":{"primary":{"URL":"http:\/\/ieeexplore.ieee.org\/document\/6951895\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2014,9]]},"references-count":41,"URL":"https:\/\/doi.org\/10.1109\/patmos.2014.6951895","relation":{},"subject":[],"published":{"date-parts":[[2014,9]]}}}