{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,11,1]],"date-time":"2025-11-01T05:29:55Z","timestamp":1761974995004,"version":"build-2065373602"},"reference-count":29,"publisher":"Springer Science and Business Media LLC","issue":"3","license":[{"start":{"date-parts":[[2013,5,23]],"date-time":"2013-05-23T00:00:00Z","timestamp":1369267200000},"content-version":"tdm","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["Int J Parallel Prog"],"published-print":{"date-parts":[[2014,6]]},"DOI":"10.1007\/s10766-013-0249-6","type":"journal-article","created":{"date-parts":[[2013,5,22]],"date-time":"2013-05-22T06:59:44Z","timestamp":1369205984000},"page":"408-434","source":"Crossref","is-referenced-by-count":6,"title":["Empirical Installation of Linear Algebra Shared-Memory Subroutines for Auto-Tuning"],"prefix":"10.1007","volume":"42","author":[{"given":"Jes\u00fas","family":"C\u00e1mara","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Javier","family":"Cuenca","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Domingo","family":"Gim\u00e9nez","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Luis Pedro","family":"Garc\u00eda","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Antonio M.","family":"Vidal","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2013,5,23]]},"reference":[{"key":"249_CR1","unstructured":"Agullo, E., Demmel, J., Dongarra, J., Hadri, B., Kurzak, J., Langou, J., Ltaief, H., Luszczek, P., Tomov, S.: Numerical linear algebra on emerging architectures: the PLASMA and MAGMA projects. J. Phys. Conf. Ser. 180(1), 1\u20135 (2009)"},{"issue":"1","key":"249_CR2","doi-asserted-by":"crossref","first-page":"75","DOI":"10.1504\/IJHPCN.2004.007567","volume":"1\/2\/3","author":"P Alberti","year":"2004","unstructured":"Alberti, P., Alonso, P., Vidal, A.M., Cuenca, J., Gim\u00e9nez, D.: Designing polylibraries to speed up linear algebra computations. Int. J. High Perform. Comput. Netw. 1\/2\/3(1), 75\u201384 (2004)","journal-title":"Int. J. High Perform. Comput. Netw."},{"key":"249_CR3","unstructured":"Anderson, E., Bai, Z., Bischof, C., Demmel, J., Dongarra, J.J., Du Croz, J., Grenbaum, A., Hammarling, S., McKenney, A., Ostrouchov, S., D. Sorensen, S.: LAPACK User\u2019s Guide. Society for Industrial and Applied Mathematics, Philadelphia (1995)"},{"key":"249_CR4","doi-asserted-by":"crossref","unstructured":"Bernab\u00e9, G., Cuenca, J., Gim\u00e9nez, D.: Optimization techniques for 3D-FWT on systems with manycore GPUs and multicore CPUs. In: ICCS (2013)","DOI":"10.1016\/j.procs.2013.05.195"},{"issue":"1","key":"249_CR5","doi-asserted-by":"crossref","first-page":"38","DOI":"10.1016\/j.parco.2008.10.002","volume":"35","author":"A Buttari","year":"2009","unstructured":"Buttari, A., Langou, J., Kurzak, J., Dongarra, J.: A class of parallel tiled linear algebra algorithms for multicore architectures. Parallel Comput. 35(1), 38\u201353 (2009)","journal-title":"Parallel Comput."},{"key":"249_CR6","doi-asserted-by":"crossref","unstructured":"C\u00e1mara, J., Cuenca, J., Gim\u00e9nez, D., Vidal. A.M.: Empirical autotuning of two-level parallel linear algebra routines on large cc-NUMA systems. In: ISPA (2012)","DOI":"10.1109\/ISPA.2012.127"},{"issue":"1","key":"249_CR7","first-page":"57","volume":"6","author":"E Caron","year":"2005","unstructured":"Caron, E., Desprez, F., Suter, F.: Parallel extension of a dynamic performance forecasting tool. Scalable Comput. Pract. Exp. 6(1), 57\u201369 (2005)","journal-title":"Scalable Comput. Pract. Exp."},{"key":"249_CR8","doi-asserted-by":"crossref","first-page":"1723","DOI":"10.1016\/j.parco.2003.05.014","volume":"29","author":"Z Chen","year":"2003","unstructured":"Chen, Z., Dongarra, J., Luszczek, P., Roche, K.: Self adapting software for numerical linear algebra and LAPACK for clusters. Parallel Comput. 29, 1723\u20131743 (2003)","journal-title":"Parallel Comput."},{"issue":"2","key":"249_CR9","doi-asserted-by":"crossref","first-page":"187","DOI":"10.1016\/j.parco.2003.11.002","volume":"30","author":"J Cuenca","year":"2004","unstructured":"Cuenca, J., Gim\u00e9nez, D., Gonz\u00e1lez, J.: Achitecture of an automatic tuned linear algebra library. Parallel Comput. 30(2), 187\u2013220 (2004)","journal-title":"Parallel Comput."},{"key":"249_CR10","doi-asserted-by":"crossref","unstructured":"Cuenca, J., Garc\u00eda, L.P., Gim\u00e9nez, D.: Improving linear algebra computation on NUMA platforms through auto-tuned nested parallelism. In: Proceedings of the 2012 EUROMICRO Conference on Parallel, Distributed and Network Processing (2012)","DOI":"10.1109\/PDP.2012.12"},{"key":"249_CR11","doi-asserted-by":"crossref","unstructured":"Frigo, M.: FFTW: An adaptive software architecture for the FFT. In: Proceedings of the ICASSP Conference, vol. 3, p. 1381 (1998)","DOI":"10.1109\/ICASSP.1998.681704"},{"key":"249_CR12","unstructured":"Golub, G., Van Loan, C.F.: Matrix Computations, 3rd edn. The John Hopkins University Press, Baltimore (1996)"},{"issue":"1","key":"249_CR13","doi-asserted-by":"crossref","first-page":"135","DOI":"10.1177\/1094342004041296","volume":"18","author":"E-J Im","year":"2004","unstructured":"Im, E.-J., Yelick, K., Vuduc, R.: Sparsity: optimization framework for sparse matrix kernels. Int. J. High Perform. Comput. Appl. (IJHPCA) 18(1), 135\u2013158 (2004)","journal-title":"Int. J. High Perform. Comput. Appl. (IJHPCA)"},{"key":"249_CR14","unstructured":"Intel MKL web page.: http:\/\/software.intel.com\/en-us\/intel-mkl\/"},{"key":"249_CR15","doi-asserted-by":"crossref","unstructured":"Jerez, S., Mont\u00e1vez, J.-P., Gim\u00e9nez, D.: Optimizing the execution of a parallel meteorology simulation code. In: Proceedings of the 23rd IEEE International Parallel and Distributed Processing Symposium. IEEE (2009)","DOI":"10.1109\/IPDPS.2009.5161154"},{"key":"249_CR16","first-page":"146","volume":"2858","author":"T Katagiri","year":"2003","unstructured":"Katagiri, T., Kise, K., Honda, H., Yuba, T.: Fiber: a generalized framework for auto-tuning software. Springer LNCS 2858, 146\u2013159 (2003)","journal-title":"Springer LNCS"},{"issue":"3","key":"249_CR17","doi-asserted-by":"crossref","first-page":"231","DOI":"10.1016\/j.parco.2005.10.002","volume":"32","author":"T Katagiri","year":"2006","unstructured":"Katagiri, T., Kise, K., Honda, H., Yuba, T.: ABCLib-DRSSED: a parallel eigensolver with an auto-tuning facility. Parallel Comput. 32(3), 231\u2013250 (2006)","journal-title":"Parallel Comput."},{"issue":"11","key":"249_CR18","doi-asserted-by":"crossref","first-page":"2045","DOI":"10.1109\/TPDS.2011.311","volume":"23","author":"J Kurzak","year":"2012","unstructured":"Kurzak, J., Tomov, S., Dongarra, J.: Autotuning gemm kernels for the FERMI GPU. IEEE Trans. Parallel Distrib. Syst. 23(11), 2045\u20132057 (2012)","journal-title":"IEEE Trans. Parallel Distrib. Syst."},{"key":"249_CR19","doi-asserted-by":"crossref","unstructured":"Lastovetsky, A.L., Reddy, R., Higgins, R.: Building the functional performance model of a processor. In: SAC, pp. 746\u2013753 (2006)","DOI":"10.1145\/1141277.1141450"},{"issue":"5","key":"249_CR20","doi-asserted-by":"crossref","first-page":"345","DOI":"10.1002\/(SICI)1096-9128(199705)9:5<345::AID-CPE258>3.0.CO;2-7","volume":"9","author":"J Li","year":"1997","unstructured":"Li, J., Skjellum, A., Falgout, R.D.: A poly-algorithm for parallel dense matrix multiplication on two-dimensional process grid topologies. Concurrency Pract. Exp. 9(5), 345\u2013389 (1997)","journal-title":"Concurrency Pract. Exp."},{"key":"249_CR21","doi-asserted-by":"crossref","unstructured":"Naono, K., Teranishi, K., Cavazos, J., Suda, R., (eds.): Software Automatic Tuning. From Concepts to State-of-the-Art Results. Springer, Berlin (2010)","DOI":"10.1007\/978-1-4419-6935-4"},{"issue":"4","key":"249_CR22","first-page":"511","volume":"24","author":"R Nath","year":"2010","unstructured":"Nath, R., Tomov, S., Dongarra, J.: An improved MAGMA gemm for FERMI graphics processing units. IJHPCA 24(4), 511\u2013515 (2010)","journal-title":"IJHPCA"},{"issue":"4","key":"249_CR23","first-page":"359","volume":"15","author":"A Petitet","year":"2001","unstructured":"Petitet, A., Blackford, L.S., Dongarra, J., Ellis, B., Fagg, G.E., Roche, K., Vadhiyar, S.S.: Numerical libraries and the grid. IJHPCA 15(4), 359\u2013374 (2001)","journal-title":"IJHPCA"},{"key":"249_CR24","unstructured":"PLASMA.: http:\/\/icl.cs.utk.edu\/plasma\/"},{"issue":"1","key":"249_CR25","first-page":"21","volume":"18","author":"M P\u00fcschel","year":"2004","unstructured":"P\u00fcschel, M., Moura, J.M.F., Singer, B., Xiong, J., Johnson, J.R., Padua, D.A., Veloso, M.M., Johnson, R.W.: Spiral: a generator for platform-adapted libraries of signal processing algorithms. IJHPCA 18(1), 21\u201345 (2004)","journal-title":"IJHPCA"},{"key":"249_CR26","doi-asserted-by":"crossref","unstructured":"Seshagiri, L., Wu, M.-S., Sosonkina, M., Zhang, Z., Gordon, M.S., Schmidt, M.W.: Enhancing adaptive middleware for quantum chemistry applications with a database framework. In: IPDPS Workshops, pp. 1\u20138 (2010)","DOI":"10.1109\/IPDPSW.2010.5470760"},{"key":"249_CR27","doi-asserted-by":"crossref","unstructured":"Tanaka, T., Katagiri, T., Yuba, T.: d-Spline based incremental parameter estimation in automatic performance tuning. In: PARA, pp. 986\u2013995 (2006)","DOI":"10.1007\/978-3-540-75755-9_116"},{"key":"249_CR28","doi-asserted-by":"crossref","unstructured":"Vuduc, R., Demmel, J., Bilmes, J.: Statistical models for automatic performance tuning. In: International Conference on Computational Science (1), pp. 117\u2013126 (2001)","DOI":"10.1007\/3-540-45545-0_21"},{"issue":"1\u20132","key":"249_CR29","doi-asserted-by":"crossref","first-page":"3","DOI":"10.1016\/S0167-8191(00)00087-9","volume":"27","author":"RC Whaley","year":"2001","unstructured":"Whaley, R.C., Petitet, A., Dongarra, J.: Automated empirical optimizations of software and the ATLAS project. Parallel Comput. 27(1\u20132), 3\u201335 (2001)","journal-title":"Parallel Comput."}],"container-title":["International Journal of Parallel Programming"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s10766-013-0249-6.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/article\/10.1007\/s10766-013-0249-6\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s10766-013-0249-6","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,4,30]],"date-time":"2025-04-30T10:54:59Z","timestamp":1746010499000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/s10766-013-0249-6"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2013,5,23]]},"references-count":29,"journal-issue":{"issue":"3","published-print":{"date-parts":[[2014,6]]}},"alternative-id":["249"],"URL":"https:\/\/doi.org\/10.1007\/s10766-013-0249-6","relation":{},"ISSN":["0885-7458","1573-7640"],"issn-type":[{"type":"print","value":"0885-7458"},{"type":"electronic","value":"1573-7640"}],"subject":[],"published":{"date-parts":[[2013,5,23]]}}}