{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,21]],"date-time":"2026-04-21T12:33:31Z","timestamp":1776774811994,"version":"3.51.2"},"reference-count":75,"publisher":"Springer Science and Business Media LLC","issue":"3","license":[{"start":{"date-parts":[[2016,1,22]],"date-time":"2016-01-22T00:00:00Z","timestamp":1453420800000},"content-version":"tdm","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["J Supercomput"],"published-print":{"date-parts":[[2016,3]]},"DOI":"10.1007\/s11227-015-1613-7","type":"journal-article","created":{"date-parts":[[2016,1,22]],"date-time":"2016-01-22T15:47:21Z","timestamp":1453477641000},"page":"804-844","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":22,"title":["A high-performance matrix\u2013matrix multiplication methodology for CPU and GPU architectures"],"prefix":"10.1007","volume":"72","author":[{"given":"Vasilios","family":"Kelefouras","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"A.","family":"Kritikakou","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Iosif","family":"Mporas","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Vasilios","family":"Kolonias","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2016,1,22]]},"reference":[{"issue":"7","key":"1613_CR1","doi-asserted-by":"crossref","first-page":"2644","DOI":"10.1007\/s11227-015-1409-9","volume":"71","author":"VI Kelefouras","year":"2015","unstructured":"Kelefouras VI, Kritikakou A, Papadima E, Goutis CE (2015) A methodology for speeding up matrix vector multiplication for single\/multi-core architectures. J Supercomput 71(7):2644\u20132667","journal-title":"J Supercomput"},{"issue":"1","key":"1613_CR2","first-page":"21","volume":"4","author":"SS Pinter","year":"1996","unstructured":"Pinter SS (1996) Register allocation with instruction scheduling: a new approach. J Prog Lang 4(1): 21\u201338","journal-title":"J Prog Lang"},{"issue":"3","key":"1613_CR3","first-page":"14:1","volume":"10","author":"G Shobaki","year":"2008","unstructured":"Shobaki G, Shawabkeh M, Rmaileh NEA (2008) Preallocation instruction scheduling with register pressure minimization using a combinatorial optimization approach. ACM Trans Archit Code Optim 10(3):14:1\u201314:31. doi: 10.1145\/2512432","journal-title":"ACM Trans Archit Code Optim"},{"key":"1613_CR4","doi-asserted-by":"crossref","first-page":"345","DOI":"10.1145\/197405.197406","volume":"26","author":"DF Bacon","year":"1994","unstructured":"Bacon DF, Graham SL, Oliver, Sharp J (1994) Compiler transformations for high-performance computing. ACM Comput Surv 26:345\u2013420","journal-title":"ACM Comput Surv"},{"key":"1613_CR5","unstructured":"Granston E, Holler A (2001) Automatic recommendation of compiler options. In: Proceedings of the workshop on feedback-directed and dynamic optimization (FDDO\u201901)"},{"key":"1613_CR6","doi-asserted-by":"crossref","unstructured":"Triantafyllis S, Vachharajani M, Vachharajani N, August DI (2003) Compiler optimization-space exploration. In: Proceedings of the international symposium on code generation and optimization: feedback-directed and runtime optimization (CGO\u201903). IEEE Computer Society, Washington, DC, pp 204\u2013215. http:\/\/dl.acm.org\/citation.cfm?id=776261.776284 . Accessed 15 Jan 2015","DOI":"10.1109\/CGO.2003.1191546"},{"key":"1613_CR7","first-page":"2002","volume":"23","author":"KD Cooper","year":"2001","unstructured":"Cooper KD, Subramanian D, Torczon L (2001) Adaptive optimizing compilers for the 21st century. J Supercomput 23:2002","journal-title":"J Supercomput"},{"key":"1613_CR8","doi-asserted-by":"crossref","unstructured":"Kisuki T, Knijnenburg PMW, O\u2019Boyle MFP, Bodin F, Wijshoff HAG (1999) A feasibility study in iterative compilation. In: Proceedings of the second international symposium on high performance computing (ISHPC\u201999). Springer, London, pp 121\u2013132. http:\/\/dl.acm.org\/citation.cfm?id=646347.690219 . Accessed 15 Jan 2015","DOI":"10.1007\/BFb0094916"},{"issue":"1","key":"1613_CR9","doi-asserted-by":"crossref","first-page":"1:1","DOI":"10.1145\/1509864.1509865","volume":"6","author":"PA Kulkarni","year":"2009","unstructured":"Kulkarni PA, Whalley DB, Tyson GS, Davidson JW (2009) Practical exhaustive optimization phase order exploration and evaluation. ACM Trans Archit Code Optim 6(1):1:1\u20131:36. doi: 10.1145\/1509864.1509865","journal-title":"ACM Trans Archit Code Optim"},{"issue":"6","key":"1613_CR10","doi-asserted-by":"crossref","first-page":"171","DOI":"10.1145\/996893.996863","volume":"39","author":"P Kulkarni","year":"2004","unstructured":"Kulkarni P, Hines S, Hiser J, Whalley D, Davidson J, Jones D (2004) Fast searches for effective optimization phase sequences. SIGPLAN Not 39(6):171\u2013182. doi: 10.1145\/996893.996863","journal-title":"SIGPLAN Not"},{"key":"1613_CR11","doi-asserted-by":"crossref","unstructured":"Park E, Kulkarni S, Cavazos J (2011) An evaluation of different modeling techniques for iterative compilation. In: Proceedings of the 14th international conference on compilers, architectures and synthesis for embedded systems (CASES\u201911). ACM, New York, pp 65\u201374. doi: 10.1145\/2038698.2038711","DOI":"10.1145\/2038698.2038711"},{"key":"1613_CR12","doi-asserted-by":"crossref","unstructured":"Monsifrot A, Bodin F, Quiniou R (2002) A machine learning approach to automatic production of compiler heuristics. In: Proceedings of the 10th international conference on artificial intelligence: methodology, systems, and applications (AIMSA\u201902). Springer, London, pp 41\u201350. http:\/\/dl.acm.org\/citation.cfm?id=646053.677574 . Accessed 15 Jan 2015","DOI":"10.1007\/3-540-46148-5_5"},{"issue":"5","key":"1613_CR13","doi-asserted-by":"crossref","first-page":"77","DOI":"10.1145\/780822.781141","volume":"38","author":"M Stephenson","year":"2003","unstructured":"Stephenson M, Amarasinghe S, Martin M, O\u2019Reilly U-M (2003) Meta optimization: improving compiler heuristics with machine learning. SIGPLAN Not 38(5):77\u201390. doi: 10.1145\/780822.781141","journal-title":"SIGPLAN Not"},{"issue":"4","key":"1613_CR14","doi-asserted-by":"crossref","first-page":"46:1","DOI":"10.1145\/2400682.2400705","volume":"9","author":"M Tartara","year":"2013","unstructured":"Tartara M, Crespi Reghizzi S (2013) Continuous learning of compiler heuristics. ACM Trans Archit Code Optim 9(4):46:1\u201346:25. doi: 10.1145\/2400682.2400705","journal-title":"ACM Trans Archit Code Optim"},{"key":"1613_CR15","doi-asserted-by":"crossref","unstructured":"Agakov F, Bonilla E, Cavazos J, Franke B, Fursin G, O\u2019Boyle MFP, Thomson J, Toussaint M, Williams CKI (2006) Using machine learning to focus iterative optimization. In: Proceedings of the international symposium on code generation and optimization (CGO\u201906). IEEE Computer Society, Washington, DC, pp 295\u2013305. doi: 10.1109\/CGO.2006.37","DOI":"10.1109\/CGO.2006.37"},{"issue":"2","key":"1613_CR16","doi-asserted-by":"crossref","first-page":"101","DOI":"10.1002\/spe.626","volume":"35","author":"RC Whaley","year":"2005","unstructured":"Whaley RC (2005) Minimizing development and maintenance costs in supporting persistently optimized BLAS. Softw Pract Exp 35(2):101\u2013121","journal-title":"Softw Pract Exp"},{"key":"1613_CR17","unstructured":"Openblas (2012) An optimized blas library. http:\/\/xianyi.github.com\/OpenBLAS\/ . Accessed 15 Jan 2015"},{"key":"1613_CR18","unstructured":"Guennebaud G, Jacob B et\u00a0al (2010) Eigen v3. http:\/\/eigen.tuxfamily.org . Accessed 15 Jan 2015"},{"key":"1613_CR19","unstructured":"Intel (2012) Intel mkl. http:\/\/software.intel.com\/en-us\/intel-mkl . Accessed 15 Jan 2015"},{"key":"1613_CR20","doi-asserted-by":"crossref","unstructured":"Bilmes J, Asanovi\u0107 K, Chin C, Demmel J (1997) Optimizing matrix multiply using PHiPAC: a portable, high-performance, ANSI C coding methodology. In: Proceedings of the international conference on supercomputing, ACM SIGARC, Vienna","DOI":"10.1145\/263580.263662"},{"issue":"3","key":"1613_CR21","doi-asserted-by":"crossref","first-page":"12:1","DOI":"10.1145\/1356052.1356053","volume":"34","author":"K Goto","year":"2008","unstructured":"Goto K, van de Geijn RA (2008) Anatomy of high-performance matrix multiplication. ACM Trans Math Softw 34(3):12:1\u201312:25. doi: 10.1145\/1356052.1356053","journal-title":"ACM Trans Math Softw"},{"key":"1613_CR22","unstructured":"Van Zee FG, Van De Geijn RA (2015) BLIS: a framework for rapidly instantiating BLAS functionality. ACM Trans Math Softw 41(3):14-1\u201314-33"},{"key":"1613_CR23","doi-asserted-by":"crossref","unstructured":"Smith TM, van\u00a0de Geijn RA, Smelyanskiy M, Hammond JR, Zee FGV (2014) Anatomy of high-performance many-threaded matrix multiplication. In: 2014 IEEE 28th international parallel and distributed processing symposium, Phoenix, pp 1049\u20131059. doi: 10.1109\/IPDPS.2014.110","DOI":"10.1109\/IPDPS.2014.110"},{"key":"1613_CR24","doi-asserted-by":"crossref","unstructured":"Yotov K, Li X, Ren G, Garzaran M, Padua D, Pingali K, Stodghill P (2005) Is search really necessary to generate high-performance blas? Proc IEEE 93(2):358\u2013386. (Special issue on \u201cProgram generation, optimization, and adaptation\u201d)","DOI":"10.1109\/JPROC.2004.840444"},{"key":"1613_CR25","doi-asserted-by":"crossref","unstructured":"Volkov V, Demmel JW (2008) Benchmarking gpus to tune dense linear algebra. In: Proceedings of the 2008 ACM\/IEEE conference on supercomputing (SC\u201908). IEEE Press, Piscataway, pp 31:1\u201331:11. http:\/\/dl.acm.org\/citation.cfm?id=1413370.1413402 . Accessed 15 Jan 2015","DOI":"10.1109\/SC.2008.5214359"},{"issue":"4","key":"1613_CR26","doi-asserted-by":"crossref","first-page":"511515","DOI":"10.1177\/1094342010385729","volume":"24","author":"R Nath","year":"2010","unstructured":"Nath R, Tomov S, Dongarra J (2010) An improved Magma Gemm for Fermi graphics processing units. Int J High Perform Comput Appl 24(4):511515. doi: 10.1177\/1094342010385729","journal-title":"Int J High Perform Comput Appl"},{"key":"1613_CR27","doi-asserted-by":"crossref","unstructured":"Kelefouras VI, Kritikakou A, Goutis C (2014) A matrix\u2013matrix multiplication methodology for single\/multi-core architectures using SIMD, supercomputing. Springer, New York. doi: 10.1007\/s11227-014-1098-9","DOI":"10.1007\/s11227-014-1098-9"},{"issue":"6","key":"1613_CR28","doi-asserted-by":"crossref","first-page":"89","DOI":"10.1145\/1273442.1250746","volume":"42","author":"N Nethercote","year":"2007","unstructured":"Nethercote N, Seward J (2007) Valgrind: a framework for heavyweight dynamic binary instrumentation. SIGPLAN Not 42(6):89\u2013100. doi: 10.1145\/1273442.1250746","journal-title":"SIGPLAN Not"},{"issue":"2","key":"1613_CR29","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1145\/2024716.2024718","volume":"39","author":"N Binkert","year":"2011","unstructured":"Binkert N, Beckmann B, Black G, Reinhardt SK, Saidi A, Basu A, Hestness J, Hower DR, Krishna T, Sardashti S, Sen R, Sewell K, Shoaib M, Vaish N, Hill MD, Wood DA (2011) The gem5 simulator. SIGARCH Comput Archit News 39(2):1\u20137. doi: 10.1145\/2024716.2024718","journal-title":"SIGARCH Comput Archit News"},{"key":"1613_CR30","doi-asserted-by":"crossref","first-page":"59","DOI":"10.1109\/2.982917","volume":"35","author":"T Austin","year":"2002","unstructured":"Austin T, Larson E, Ernst D (2002) Simplescalar: an infrastructure for computer system modeling. Computer 35:59\u201367. doi: 10.1109\/2.982917","journal-title":"Computer"},{"issue":"11","key":"1613_CR31","doi-asserted-by":"crossref","first-page":"1783","DOI":"10.1016\/0167-8191(95)00032-9","volume":"21","author":"SM Bhandarkar","year":"1995","unstructured":"Bhandarkar SM, Arabnia HR (1995) The REFINE multiprocessor\u2014theoretical properties and algorithms. Parallel Comput 21(11):1783\u20131805","journal-title":"Parallel Comput"},{"key":"1613_CR32","unstructured":"Arabnia HR, Smith JW (1993) A reconfigurable interconnection network for imaging operations and its implementation using a multi-stage switching box, pp 349\u2013357"},{"issue":"1","key":"1613_CR33","doi-asserted-by":"crossref","first-page":"43","DOI":"10.1023\/A:1022804606389","volume":"25","author":"MA Wani","year":"2003","unstructured":"Wani MA, Arabnia HR (2003) Parallel edge-region-based segmentation algorithm targeted at reconfigurable MultiRing network. J Supercomput 25(1):43\u201362","journal-title":"J Supercomput"},{"issue":"2","key":"1613_CR34","doi-asserted-by":"crossref","first-page":"188","DOI":"10.1016\/0743-7315(90)90028-N","volume":"10","author":"HR Arabnia","year":"1990","unstructured":"Arabnia HR (1990) A parallel algorithm for the arbitrary rotation of digitized images using process-and-data-decomposition approach. J Parallel Distrib Comput 10(2):188\u2013192","journal-title":"J Parallel Distrib Comput"},{"issue":"1","key":"1613_CR35","doi-asserted-by":"crossref","first-page":"3","DOI":"10.1111\/j.1467-8659.1989.tb00448.x","volume":"8","author":"HR Arabnia","year":"1989","unstructured":"Arabnia HR, Oliver MA (1989) A transputer network for fast operations on digitised images. Comput Graph Forum 8(1):3\u201311","journal-title":"Comput Graph Forum"},{"issue":"1","key":"1613_CR36","doi-asserted-by":"crossref","first-page":"107","DOI":"10.1006\/jpdc.1995.1011","volume":"24","author":"SM Bhandarkar","year":"1995","unstructured":"Bhandarkar SM, Arabnia HR (1995) The Hough transform on a reconfigurable multi-ring network. J Parallel Distrib Comput 24(1):107\u2013114","journal-title":"J Parallel Distrib Comput"},{"issue":"5","key":"1613_CR37","doi-asserted-by":"crossref","first-page":"425","DOI":"10.1093\/comjnl\/30.5.425","volume":"30","author":"HR Arabnia","year":"1987","unstructured":"Arabnia HR, Oliver MA (1987) A transputer network for the arbitrary rotation of digitised images. Comput J 30(5):425\u2013432","journal-title":"Comput J"},{"issue":"3","key":"1613_CR38","doi-asserted-by":"crossref","first-page":"243","DOI":"10.1007\/BF00130109","volume":"10","author":"HR Arabnia","year":"1996","unstructured":"Arabnia HR, Bhandarkar SM (1996) Parallel stereocorrelation on a reconfigurable multi-ring network. J Supercomput 10(3):243\u2013269","journal-title":"J Supercomput"},{"issue":"1","key":"1613_CR39","doi-asserted-by":"crossref","first-page":"3","DOI":"10.1111\/j.1467-8659.1987.tb00340.x","volume":"6","author":"HR Arabnia","year":"1987","unstructured":"Arabnia HR, Oliver MA (1987) Arbitrary rotation of raster images with SIMD machine architectures. Comput Graph Forum 6(1):3\u201311","journal-title":"Comput Graph Forum"},{"issue":"02","key":"1613_CR40","doi-asserted-by":"crossref","first-page":"201","DOI":"10.1142\/S0218001495000110","volume":"9","author":"SM Bhandarkar","year":"1995","unstructured":"Bhandarkar SM, Arabnia HR, Smith JW (1995) A reconfigurable architecture for image processing and computer vision. Int J Pattern Recognit Artif Intell 9(02):201\u2013229","journal-title":"Int J Pattern Recognit Artif Intell"},{"key":"1613_CR41","doi-asserted-by":"crossref","unstructured":"Arabnia H (1995) A distributed stereocorrelation algorithm. In: Proceedings of fourth international conference on computer communications and networks. IEEE, pp 479\u2013482","DOI":"10.1109\/ICCCN.1995.540163"},{"issue":"1\u20132","key":"1613_CR42","doi-asserted-by":"crossref","first-page":"3","DOI":"10.1016\/S0167-8191(00)00087-9","volume":"27","author":"RC Whaley","year":"2001","unstructured":"Whaley RC, Petitet A, Dongarra JJ (2001) Automated empirical optimization of software and the ATLAS project. Parallel Comput 27(1\u20132):3\u201335","journal-title":"Parallel Comput"},{"key":"1613_CR43","doi-asserted-by":"crossref","unstructured":"Whaley RC, Dongarra J (1999) Automatically tuned linear algebra software. In: Ninth SIAM conference on parallel processing for scientific computing, CD-ROM proceedings","DOI":"10.1109\/SC.1998.10004"},{"key":"1613_CR44","unstructured":"Whaley RC, Dongarra JJ (1998) Automatically tuned linear algebra software. In: Proceedings of the 1998 ACM\/IEEE conference on supercomputing, supercomputing\u201998. IEEE Computer Society, Washington, DC, pp 1\u201327. http:\/\/dl.acm.org\/citation.cfm?id=509058.509096 . Accessed 15 Jan 2015"},{"key":"1613_CR45","doi-asserted-by":"crossref","unstructured":"Whaley RC, Dongarra J (1997) Automatically tuned linear algebra software. Tech. Rep. UT-CS-97-366, University of Tennessee","DOI":"10.1109\/SC.1998.10004"},{"key":"1613_CR46","doi-asserted-by":"crossref","first-page":"386","DOI":"10.1137\/0613026","volume":"13","author":"P Bj\u00f8rstad","year":"1992","unstructured":"Bj\u00f8rstad P, Manne F, S\u00f8revik T, Vajtersic M (1992) Efficient matrix multiplication on simd computers. SIAM J Matrix Anal Appl 13:386\u2013401","journal-title":"SIAM J Matrix Anal Appl"},{"key":"1613_CR47","unstructured":"Geijn RAVD, Watts J (1997) Summa: scalable universal matrix multiplication algorithm. Tech. rep"},{"key":"1613_CR48","doi-asserted-by":"crossref","unstructured":"Chatterjee S, Lebeck AR, Patnala PK, Thottethodi M (1999) Recursive array layouts and fast parallel matrix multiplication. In: Proceedings of eleventh annual ACM symposium on parallel algorithms and architectures, pp 222\u2013231","DOI":"10.1145\/305619.305645"},{"key":"1613_CR49","doi-asserted-by":"crossref","first-page":"2001","DOI":"10.1109\/69.908985","volume":"13","author":"B Moon","year":"2001","unstructured":"Moon B, Jagadish HV, Faloutsos C, Saltz JH (2001) Analysis of the clustering properties of the Hilbert space-filling curve. IEEE Trans Knowl Data Eng 13:2001","journal-title":"IEEE Trans Knowl Data Eng"},{"key":"1613_CR50","doi-asserted-by":"crossref","unstructured":"Thottethodi M, Chatterjee S, Lebeck AR (1998) Tuning strassen\u2019s matrix multiplication for memory efficiency. In: Proceedings of SC98 (CD-ROM)","DOI":"10.1109\/SC.1998.10045"},{"issue":"5","key":"1613_CR51","doi-asserted-by":"crossref","first-page":"832","DOI":"10.1109\/JPROC.2008.917732","volume":"96","author":"M Kulkarni","year":"2008","unstructured":"Kulkarni M, Pingali K (2008) An experimental study of self-optimizing dense linear algebra software. Proc IEEE 96(5):832\u2013848","journal-title":"Proc IEEE"},{"key":"1613_CR52","doi-asserted-by":"crossref","unstructured":"Garcia E, Venetis IE, Khan R, Gao GR (2010) Optimized dense matrix multiplication on a many-core architecture. In: Proceedings of the 16th international Euro-Par conference on parallel processing: part II (Euro-Par\u201910). Springer, Berlin, pp 316\u2013327. http:\/\/dl.acm.org\/citation.cfm?id=1885276.1885308 . Accessed 15 Jan 2015","DOI":"10.1007\/978-3-642-15291-7_29"},{"key":"1613_CR53","doi-asserted-by":"crossref","unstructured":"Choi J (1998) A new parallel matrix multiplication algorithm on distributed-memory concurrent computers. Concurr Pract Exp 10(8):655\u2013670. http:\/\/dblp.uni-trier.de\/db\/journals\/concurrency\/concurrency10.html . Accessed 15 Jan 2015","DOI":"10.1002\/(SICI)1096-9128(199807)10:8<655::AID-CPE369>3.0.CO;2-O"},{"issue":"3","key":"1613_CR54","doi-asserted-by":"crossref","first-page":"138","DOI":"10.1016\/j.parco.2008.12.010","volume":"35","author":"J Kurzak","year":"2009","unstructured":"Kurzak J, Alvaro W, Dongarra J (2009) Optimizing matrix multiplication for a short-vector simd architecture\u2014cell processor. Parallel Comput 35(3):138\u2013150. doi: 10.1016\/j.parco.2008.12.010","journal-title":"Parallel Comput"},{"issue":"8","key":"1613_CR55","doi-asserted-by":"crossref","first-page":"771","DOI":"10.1002\/cpe.791","volume":"16","author":"F Desprez","year":"2004","unstructured":"Desprez F, Suter F (2004) Impact of mixed-parallelism on parallel implementations of the strassen and winograd matrix multiplication algorithms: research articles. Concurr Comput Pract Exp 16(8):771\u2013797. doi: 10.1002\/cpe.v16:8","journal-title":"Concurr Comput Pract Exp"},{"issue":"4","key":"1613_CR56","doi-asserted-by":"crossref","first-page":"48","DOI":"10.1002\/scj.10551","volume":"36","author":"M Hattori","year":"2005","unstructured":"Hattori M, Ito N, Chen W, Wada K (2005) Parallel matrix-multiplication algorithm for distributed parallel computers. Syst Comput Jpn 36(4):48\u201359. doi: 10.1002\/scj.v36:4","journal-title":"Syst Comput Jpn"},{"key":"1613_CR57","doi-asserted-by":"crossref","unstructured":"Hunold S, Rauber T, R\u00fcnger G (2004) Multilevel hierarchical matrix multiplication on clusters. In: Proceedings of the 18th annual international conference on supercomputing (ICS\u201904). ACM, New York, pp 136\u2013145. doi: 10.1145\/1006209.1006230","DOI":"10.1145\/1006209.1006230"},{"key":"1613_CR58","doi-asserted-by":"crossref","unstructured":"Krishnan M, Nieplocha J (2006) Memory efficient parallel matrix multiplication operation for irregular problems. In: Proceedings of the 3rd conference on computing frontiers (CF\u201906). ACM, New York, pp 229\u2013240. doi: 10.1145\/1128022.1128054","DOI":"10.1145\/1128022.1128054"},{"key":"1613_CR59","doi-asserted-by":"crossref","unstructured":"Hunold S, Rauber T (2005) Automatic tuning of pdgemm towards optimal performance. In: Proceedings of the 11th international Euro-Par conference on parallel processing (Euro-Par\u201905). Springer, Berlin, pp 837\u2013846. doi: 10.1007\/11549468_91","DOI":"10.1007\/11549468_91"},{"key":"1613_CR60","unstructured":"Desprez F, Suter F (2002) Impact of mixed-parallelism on parallel implementations of Strassen and Winograd matrix multiplication algorithms. Rapport de recherche RR-4482, INRIA. http:\/\/hal.inria.fr\/inria-00072106 . Accessed 15 Jan 2015"},{"key":"1613_CR61","unstructured":"Tsilikas G, Fleury M (2004) Matrix multiplication performance on commodity shared-memory multiprocessors. In: Proceedings of the international conference on parallel computing in electrical engineering (PARELEC\u201904). IEEE Computer Society, Washington, DC, pp 13\u201318. doi: 10.1109\/PARELEC.2004.43"},{"key":"1613_CR62","doi-asserted-by":"crossref","unstructured":"R\u00fcnger G, Schwind M (2010) Fast recursive matrix multiplication for multi-core architectures. Procedia Comput Sci 1(1):67\u201376. [International conference on computational science 2010 (ICCS\u201910)]","DOI":"10.1016\/j.procs.2010.04.009"},{"key":"1613_CR63","doi-asserted-by":"crossref","unstructured":"Krishnan M, Nieplocha J (2004) Srumma: a matrix multiplication algorithm suitable for clusters and scalable shared memory systems. Parallel Distrib Process Symp Int 1:70b. doi: 10.1109\/IPDPS.2004.1303000 . Accessed 15 Jan 2015","DOI":"10.1109\/IPDPS.2004.1303000"},{"issue":"3","key":"1613_CR64","doi-asserted-by":"crossref","first-page":"354","DOI":"10.1007\/BF02165411","volume":"14","author":"V Strassen","year":"1969","unstructured":"Strassen V (1969) Gaussian elimination is not optimal. Numer Math 14(3):354\u2013356","journal-title":"Numer Math"},{"issue":"8","key":"1613_CR65","doi-asserted-by":"crossref","first-page":"207","DOI":"10.1145\/209937.209958","volume":"30","author":"RD Blumofe","year":"1995","unstructured":"Blumofe RD, Joerg CF, Kuszmaul BC, Leiserson CE, Randall KH, Zhou Y (1995) Cilk: an efficient multithreaded runtime system. SIGPLAN Not 30(8):207\u2013216. doi: 10.1145\/209937.209958","journal-title":"SIGPLAN Not"},{"key":"1613_CR66","doi-asserted-by":"crossref","unstructured":"Michaud P (2011) Replacement policies for shared caches on symmetric multicores: a programmer-centric point of view, In: Proceedings of the 6th international conference on high performance and embedded architectures and compilers (HiPEAC\u201911). ACM, New York, pp 187\u2013196. doi: 10.1145\/1944862.1944890","DOI":"10.1145\/1944862.1944890"},{"key":"1613_CR67","doi-asserted-by":"crossref","unstructured":"Nikolopoulos DS (2003) Code and data transformations for improving shared cache performance on smt processors. In: ISHPC, pp 54\u201369","DOI":"10.1007\/978-3-540-39707-6_5"},{"key":"1613_CR68","doi-asserted-by":"crossref","unstructured":"Kurzak J, Tomov S, Dongarra J (2012) Autotuning gemm kernels for the fermi gpu. 23(11):2045\u20132057. http:\/\/dblp.uni-trier.de\/db\/journals\/tpds\/tpds23.html . Accessed 15 Jan 2015","DOI":"10.1109\/TPDS.2011.311"},{"key":"1613_CR69","doi-asserted-by":"crossref","unstructured":"Jiang C, Snir M (2005) Automatic tuning matrix multiplication performance on graphics hardware. In: Proceesings of the 14th international conference on parallel architecture and compilation techniques (PACT), pp 185\u2013196","DOI":"10.1109\/PACT.2005.10"},{"key":"1613_CR70","doi-asserted-by":"crossref","unstructured":"Li J, Ranka S, Sahni S (2011) Strassen\u2019s matrix multiplication on gpus. In: Proceedings of the 2011 IEEE 17th international conference on parallel and distributed systems (ICPADS\u201911). IEEE Computer Society, Washington, DC, pp 157\u2013164. doi: 10.1109\/ICPADS.2011.130","DOI":"10.1109\/ICPADS.2011.130"},{"key":"1613_CR71","unstructured":"Cecilia JM, Garc\u00eda JM, Ujaldon M (2009) The GPU on the matrix\u2013matrix multiply: performance study and contributions. In: Chapman BM, Desprez F, Joubert GR, Lichnewsky A, Peters FJ, Priol T (eds) PARCO, vol.\u00a019 of advances in parallel computing. IOS Press, pp 331\u2013340. http:\/\/dblp.uni-trier.de\/db\/conf\/parco\/parco2009.html . Accessed 15 Jan 2015"},{"key":"1613_CR72","unstructured":"Cecilia JM, Garc\u00eda JM, Ujaldon M (2009) The GPU on the matrix-matrix multiply: performance study and contributions. In: Parallel computing: from multicores and GPU\u2019s to petascale, proceedings of the conference ParCo 2009, 1\u20134 September 2009, Lyon, France. pp 331\u2013340. doi: 10.3233\/978-1-60750-530-3-331 . http:\/\/dblp.uni-trier.de\/rec\/bib\/conf\/parco\/CeciliaGU09 . Accessed 15 Jan 2015"},{"key":"1613_CR73","doi-asserted-by":"crossref","unstructured":"Athil T, Christian R, Reddy YB (2014) Cuda memory techniques for matrix multiplication on quadro 4000. In: Proceedings of the 2014 11th international conference on information technology: new generations (ITNG\u201914). IEEE Computer Society, Washington, DC, pp 419\u2013425. doi: 10.1109\/ITNG.2014.24","DOI":"10.1109\/ITNG.2014.24"},{"key":"1613_CR74","unstructured":"Djinevski L, Arsenovski S, Ristov S, Gusev M (2013) Performance drawbacks for matrix multiplication using set associative cache in GPU devices. In: 36th international convention on information and communication technology electronics and microelectronics (MIPRO). IEEE, p 193198"},{"key":"1613_CR75","doi-asserted-by":"crossref","unstructured":"Matsumoto K, Nakasato N, Sakai T, Yahagi H, Sedukhin SG (2011) Multi-level optimization of matrix multiplication for GPU-equipped systems. Procedia Comput Sci 4(0):342\u2013351. doi: 10.1016\/j.procs.2011.04.036 . http:\/\/www.sciencedirect.com\/science\/article\/pii\/S1877050911000949 . (Proceedings of the international conference on computational science, ICCS\u201911)","DOI":"10.1016\/j.procs.2011.04.036"}],"container-title":["The Journal of Supercomputing"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s11227-015-1613-7.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/article\/10.1007\/s11227-015-1613-7\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s11227-015-1613-7","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2019,9,3]],"date-time":"2019-09-03T19:03:48Z","timestamp":1567537428000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/s11227-015-1613-7"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2016,1,22]]},"references-count":75,"journal-issue":{"issue":"3","published-print":{"date-parts":[[2016,3]]}},"alternative-id":["1613"],"URL":"https:\/\/doi.org\/10.1007\/s11227-015-1613-7","relation":{},"ISSN":["0920-8542","1573-0484"],"issn-type":[{"value":"0920-8542","type":"print"},{"value":"1573-0484","type":"electronic"}],"subject":[],"published":{"date-parts":[[2016,1,22]]}}}