{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,21]],"date-time":"2026-06-21T12:57:01Z","timestamp":1782046621362,"version":"3.54.5"},"reference-count":37,"publisher":"Springer Science and Business Media LLC","issue":"3","license":[{"start":{"date-parts":[[2016,6,14]],"date-time":"2016-06-14T00:00:00Z","timestamp":1465862400000},"content-version":"tdm","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2016,6,14]],"date-time":"2016-06-14T00:00:00Z","timestamp":1465862400000},"content-version":"vor","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"funder":[{"DOI":"10.13039\/100000105","name":"Office of Cyberinfrastructure","doi-asserted-by":"publisher","award":["1339822"],"award-info":[{"award-number":["1339822"]}],"id":[{"id":"10.13039\/100000105","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100000105","name":"Office of Cyberinfrastructure","doi-asserted-by":"publisher","award":["1527706"],"award-info":[{"award-number":["1527706"]}],"id":[{"id":"10.13039\/100000105","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Int J Parallel Prog"],"published-print":{"date-parts":[[2017,6]]},"DOI":"10.1007\/s10766-016-0441-6","type":"journal-article","created":{"date-parts":[[2016,6,14]],"date-time":"2016-06-14T15:45:11Z","timestamp":1465919111000},"page":"612-633","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":27,"title":["Porting the PLASMA Numerical Library to the OpenMP Standard"],"prefix":"10.1007","volume":"45","author":[{"given":"Asim","family":"YarKhan","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jakub","family":"Kurzak","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Piotr","family":"Luszczek","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jack","family":"Dongarra","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2016,6,14]]},"reference":[{"key":"441_CR1","doi-asserted-by":"crossref","unstructured":"Agullo, E., Bouwmeester, H., Dongarra, J., Kurzak, J., Langou, J., Rosenberg, L.: Towards an efficient tile matrix inversion of symmetric positive definite matrices on multicore architectures. In: High Performance Computing for Computational Science\u2014VECPAR 2010, pp. 129\u2013138. Springer (2011)","DOI":"10.1007\/978-3-642-19328-6_14"},{"key":"441_CR2","doi-asserted-by":"crossref","unstructured":"Agullo, E., Demmel, J., Dongarra, J., Hadri, B., Kurzak, J., Langou, J., Ltaief, H., Luszczek, P., Tomov, S.: Numerical linear algebra on emerging architectures: the PLASMA and MAGMA projects. In: Journal of Physics: Conference Series, vol. 180, p. 012037. IOP Publishing (2009)","DOI":"10.1088\/1742-6596\/180\/1\/012037"},{"key":"441_CR3","doi-asserted-by":"crossref","unstructured":"Agullo, E., Hadri, B., Ltaief, H., Dongarrra, J.: Comparative study of one-sided factorizations with multiple software packages on multi-core hardware. In: SC \u201909: Proceedings of the Conference on High Performance Computing Networking, Storage and Analysis, pp. 1\u201312. New York (2009)","DOI":"10.1145\/1654059.1654080"},{"key":"441_CR4","doi-asserted-by":"crossref","unstructured":"Amdahl, G.M.: Validity of the single-processor approach to achieving large scale computing capabilities. In: AFIPS Conference Proceedings, vol. 30, pp. 483\u2013485, Atlantic City, N.J., APR 18\u201320 1967. AFIPS Press, Reston (1967)","DOI":"10.1145\/1465482.1465560"},{"key":"441_CR5","unstructured":"Anderson, E., Dongarra, J.: Implementation guide for LAPACK. Technical Report UT-CS-90-101, University of Tennessee, Computer Science Department, LAPACK Working Note 18 (1990)"},{"key":"441_CR6","doi-asserted-by":"publisher","DOI":"10.1137\/1.9780898719604","volume-title":"LAPACK Users\u2019 Guide","author":"E Anderson","year":"1999","unstructured":"Anderson, E., Bai, Z., Bischof, C., Blackford, S., Demmel, J., Dongarra, J., Du Croz, J., Greenbaum, A., Hammerling, S., McKenney, A., et al.: LAPACK Users\u2019 Guide, vol. 9. SIAM, Philadelphia (1999)"},{"issue":"2","key":"441_CR7","doi-asserted-by":"publisher","first-page":"187","DOI":"10.1002\/cpe.1631","volume":"23","author":"C Augonnet","year":"2011","unstructured":"Augonnet, C., Thibault, S., Namyst, R., Wacrenier, P.-A.: StarPU: a unified platform for task scheduling on heterogeneous multicore architectures. Concurr. Comput.: Pract. Exp. 23(2), 187\u2013198 (2011)","journal-title":"Concurr. Comput.: Pract. Exp."},{"issue":"18","key":"441_CR8","doi-asserted-by":"publisher","first-page":"2438","DOI":"10.1002\/cpe.1463","volume":"21","author":"RM Badia","year":"2009","unstructured":"Badia, R.M., Herrero, J.R., Labarta, J., P\u00e9rez, J.M., Quintana-Ort\u00ed, E.S., Quintana-Ort\u00ed, G.: Parallelizing dense and banded linear algebra libraries using SMPSs. Concurr. Comput.: Pract. Exp. 21(18), 2438\u20132456 (2009)","journal-title":"Concurr. Comput.: Pract. Exp."},{"issue":"6","key":"441_CR9","doi-asserted-by":"publisher","first-page":"36","DOI":"10.1109\/MCSE.2013.98","volume":"15","author":"G Bosilca","year":"2013","unstructured":"Bosilca, G., Bouteiller, A., Danalis, A., Faverge, M., H\u00e9rault, T., Dongarra, J.J.: PaRSEC: exploiting heterogeneity to enhance scalability. Comput. Sci. Eng. 15(6), 36\u201345 (2013)","journal-title":"Comput. Sci. Eng."},{"key":"441_CR10","unstructured":"Bouwmeester, H.: Tiled algorithms for matrix computations on multicore architectures. arXiv preprint \n                    arXiv:1303.3182\n                    \n                   (2013)"},{"issue":"1","key":"441_CR11","doi-asserted-by":"publisher","first-page":"38","DOI":"10.1016\/j.parco.2008.10.002","volume":"35","author":"A Buttari","year":"2009","unstructured":"Buttari, A., Langou, J., Kurzak, J., Dongarra, J.: A class of parallel tiled linear algebra algorithms for multicore architectures. Parallel Comput. 35(1), 38\u201353 (2009)","journal-title":"Parallel Comput."},{"key":"441_CR12","doi-asserted-by":"crossref","unstructured":"Castaldo, A.M., Whaley, R.: Clint: acaling lapack panel operations using parallel cache assignment. In: ACM Sigplan Notices, vol. 45, pp. 223\u2013232. ACM (2010)","DOI":"10.1145\/1837853.1693484"},{"key":"441_CR13","doi-asserted-by":"crossref","unstructured":"Castaldo, A.M., Whaley, R.: Clint: scaling LAPACK panel operations using parallel cache assignment. In: Proceedings of the 15th ACM SIGPLAN Symposium on Principles and Practice of Parallel Programming, pp. 223\u2013232 (2010)","DOI":"10.1145\/1837853.1693484"},{"issue":"5","key":"441_CR14","doi-asserted-by":"publisher","first-page":"1292","DOI":"10.1002\/cpe.3306","volume":"27","author":"S Donfack","year":"2015","unstructured":"Donfack, S., Dongarra, J., Faverge, M., Gates, M., Kurzak, J., Luszczek, P., Yamazaki, I.: A survey of recent developments in parallel implementations of Gaussian elimination. Concurr. Comput.: Pract. Exp. 27(5), 1292\u20131309 (2015)","journal-title":"Concurr. Comput.: Pract. Exp."},{"key":"441_CR15","unstructured":"Dongarra, J., Kurzak, J., Luszczek, P., Yamazaki, I.: PULSAR Users\u2019 Guide: Parallel Ultra-Light Systolic Array Runtime. Technical Report UT-EECS-14-733, EECS Department, University of Tennessee (2014)"},{"issue":"7","key":"441_CR16","doi-asserted-by":"publisher","first-page":"1408","DOI":"10.1002\/cpe.3110","volume":"26","author":"J Dongarra","year":"2014","unstructured":"Dongarra, J., Faverge, M., Ltaief, H., Luszczek, P.: Achieving numerical accuracy and high performance using recursive tile LU factorization with partial pivoting. Concurr. Comput.: Pract. Exp. 26(7), 1408\u20131431 (2014)","journal-title":"Concurr. Comput.: Pract. Exp."},{"issue":"1","key":"441_CR17","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/77626.79170","volume":"16","author":"JJ Dongarra","year":"1990","unstructured":"Dongarra, J.J., Du Croz, J., Hammarling, S., Duff, I.S.: A set of level 3 basic linear algebra subprograms. ACM Trans. Math. Softw. (TOMS) 16(1), 1\u201317 (1990)","journal-title":"ACM Trans. Math. Softw. (TOMS)"},{"issue":"02","key":"441_CR18","doi-asserted-by":"publisher","first-page":"173","DOI":"10.1142\/S0129626411000151","volume":"21","author":"A Duran","year":"2011","unstructured":"Duran, A., Ayguad\u00e9, E., Badia, R.M., Labarta, J., Martinell, L., Martorell, X., Planas, J.: OMPSS: a proposal for programming heterogeneous multi-core architectures. Parallel Process. Lett. 21(02), 173\u2013193 (2011)","journal-title":"Parallel Process. Lett."},{"key":"441_CR19","doi-asserted-by":"crossref","unstructured":"Gao, G.R., Sterling, T., Stevens, R., Hereld, M., Weirong Z.: Parallex: a study of a new parallel computation model. In: Parallel and Distributed Processing Symposium, 2007. IPDPS 2007. IEEE International, pp. 1\u20136. IEEE (2007)","DOI":"10.1109\/IPDPS.2007.370484"},{"issue":"5","key":"441_CR20","doi-asserted-by":"publisher","first-page":"532","DOI":"10.1145\/42411.42415","volume":"31","author":"JL Gustafson","year":"1988","unstructured":"Gustafson, J.L.: Reevaluating Amdahl\u2019s Law. Commun. ACM 31(5), 532\u2013533 (1988)","journal-title":"Commun. ACM"},{"issue":"3","key":"441_CR21","doi-asserted-by":"publisher","first-page":"17","DOI":"10.1145\/2168773.2168775","volume":"38","author":"F Gustavson","year":"2012","unstructured":"Gustavson, F., Karlsson, L., K\u00e5gstr\u00f6m, B.: Parallel and cache-efficient in-place matrix storage format conversion. ACM Trans. Math. Softw. (TOMS) 38(3), 17 (2012)","journal-title":"ACM Trans. Math. Softw. (TOMS)"},{"issue":"6","key":"441_CR22","doi-asserted-by":"publisher","first-page":"737","DOI":"10.1147\/rd.416.0737","volume":"41","author":"FG Gustavson","year":"1997","unstructured":"Gustavson, F.G.: Recursion leads to automatic variable blocking for dense linear-algebra algorithms. IBM J. Res. Dev. 41(6), 737\u2013755 (1997)","journal-title":"IBM J. Res. Dev."},{"key":"441_CR23","doi-asserted-by":"crossref","unstructured":"Haidar, A., Kurzak, J., Luszczek, P.: An improved parallel singular value algorithm and its implementation for multicore hardware. In: Proceedings of the International Conference on High Performance Computing, Networking, Storage and Analysis, pp. 90. ACM (2013)","DOI":"10.1145\/2503210.2503292"},{"issue":"3","key":"441_CR24","doi-asserted-by":"publisher","first-page":"305","DOI":"10.1002\/cpe.1829","volume":"24","author":"A Haidar","year":"2012","unstructured":"Haidar, A., Ltaief, H., YarKhan, A., Dongarra, J.: Analysis of dynamically scheduled tile algorithms for dense linear algebra on multicore architectures. Concurr. Comput.: Pract. Exp. 24(3), 305\u2013321 (2012)","journal-title":"Concurr. Comput.: Pract. Exp."},{"key":"441_CR25","unstructured":"Kaiser, H., Brodowicz, M., Sterling, T.: Parallex an advanced parallel execution model for scaling-impaired applications. In: International Conference on Parallel Processing Workshops, 2009. ICPPW\u201909, pp. 394\u2013401. IEEE (2009)"},{"key":"441_CR26","doi-asserted-by":"crossref","unstructured":"Kale, L.V., Krishnan, S.: CHARM++: a portable concurrent object oriented system based on C++. In: Proceedings of the Eighth Annual Conference on Object-Oriented Programming Systems, Languages, and Applications, vol. 28, pp. 91\u2013108. ACM (1993)","DOI":"10.1145\/167962.165874"},{"issue":"9","key":"441_CR27","doi-asserted-by":"publisher","first-page":"1175","DOI":"10.1109\/TPDS.2007.70813","volume":"19","author":"J Kurzak","year":"2008","unstructured":"Kurzak, J., Buttari, A., Dongarra, J.: Solving systems of linear equations on the Cell processor using Cholesky factorization. IEEE Trans. Parallel Distrib. Syst. 19(9), 1175\u20131186 (2008)","journal-title":"IEEE Trans. Parallel Distrib. Syst."},{"issue":"1","key":"441_CR28","doi-asserted-by":"publisher","first-page":"15","DOI":"10.1002\/cpe.1467","volume":"22","author":"J Kurzak","year":"2010","unstructured":"Kurzak, J., Ltaief, H., Dongarra, J., Badia, R.M.: Scheduling dense linear algebra operations on multicore processors. Concurr. Comput.: Pract. Exp. 22(1), 15\u201344 (2010)","journal-title":"Concurr. Comput.: Pract. Exp."},{"key":"441_CR29","unstructured":"OpenMP Architecture Review Board: OpenMP Application Program Interface, version 4.5 edition (2015)"},{"issue":"5","key":"441_CR30","doi-asserted-by":"publisher","first-page":"593","DOI":"10.1147\/rd.515.0593","volume":"51","author":"JM P\u00e9rez","year":"2007","unstructured":"P\u00e9rez, J.M., Bellens, P., Badia, R.M., Labarta, J.: CellSs: making it easier to program the Cell Broadband Engine processor. IBM J. Res. Dev. 51(5), 593\u2013604 (2007)","journal-title":"IBM J. Res. Dev."},{"key":"441_CR31","doi-asserted-by":"crossref","unstructured":"Pichon, G., Haidar, A., Faverge, M., Kurzak, J.: Divide and conquer symmetric tridiagonal eigensolver for multicore architectures. In: Proceedings of the International Parallel and Distributed Processing Symposium, pp. 51\u201360. IEEE (2015)","DOI":"10.1109\/IPDPS.2015.51"},{"issue":"5","key":"441_CR32","doi-asserted-by":"publisher","first-page":"1762","DOI":"10.1137\/S1064827598345679","volume":"22","author":"ES Quintana","year":"2001","unstructured":"Quintana, E.S., Quintana, G., Sun, X., van de Geijn, R.: A note on parallel matrix inversion. SIAM J. Sci. Comput. 22(5), 1762\u20131771 (2001)","journal-title":"SIAM J. Sci. Comput."},{"issue":"3","key":"441_CR33","doi-asserted-by":"publisher","first-page":"14","DOI":"10.1145\/1527286.1527288","volume":"36","author":"G Quintana-Ort\u00ed","year":"2009","unstructured":"Quintana-Ort\u00ed, G., Quintana-Ort\u00ed, E.S., Geijn, R.A., Van Zee, F.G., Chan, E.: Programming matrix algorithms-by-blocks for thread-level parallelism. ACM Trans. Math. Softw. (TOMS) 36(3), 14 (2009)","journal-title":"ACM Trans. Math. Softw. (TOMS)"},{"issue":"6","key":"441_CR34","doi-asserted-by":"publisher","first-page":"C617","DOI":"10.1137\/140989716","volume":"37","author":"M Tillenius","year":"2015","unstructured":"Tillenius, M.: Superglue: a shared memory framework using data versioning for dependency-aware task-based parallelization. SIAM J. Sci. Comput. 37(6), C617\u2013C642 (2015)","journal-title":"SIAM J. Sci. Comput."},{"issue":"9","key":"441_CR35","doi-asserted-by":"publisher","first-page":"633","DOI":"10.1016\/j.parco.2011.05.005","volume":"37","author":"M Wilde","year":"2011","unstructured":"Wilde, M., Hategan, M., Wozniak, J.M., Clifford, B., Katz, D.S., Foster, I.: Swift: a language for distributed parallel scripting. Parallel Comput. 37(9), 633\u2013652 (2011)","journal-title":"Parallel Comput."},{"key":"441_CR36","unstructured":"YarKhan, A.: Dynamic Task Execution on Shared and Distributed Memory Architectures. PhD thesis, University of Tennessee (2012)"},{"key":"441_CR37","unstructured":"Zhao, Y., Hategan, M., Clifford, B., Foster, I., Von Laszewski, G., Nefedova, V., Raicu, I., Stef-Praun, T., Wilde, M.: Swift: fast, reliable, loosely coupled parallel computation. In: Services, 2007 IEEE Congress on, pp. 199\u2013206. IEEE (2007)"}],"container-title":["International Journal of Parallel Programming"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s10766-016-0441-6.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/article\/10.1007\/s10766-016-0441-6\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s10766-016-0441-6","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s10766-016-0441-6.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2020,5,17]],"date-time":"2020-05-17T10:32:10Z","timestamp":1589711530000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/s10766-016-0441-6"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2016,6,14]]},"references-count":37,"journal-issue":{"issue":"3","published-print":{"date-parts":[[2017,6]]}},"alternative-id":["441"],"URL":"https:\/\/doi.org\/10.1007\/s10766-016-0441-6","relation":{},"ISSN":["0885-7458","1573-7640"],"issn-type":[{"value":"0885-7458","type":"print"},{"value":"1573-7640","type":"electronic"}],"subject":[],"published":{"date-parts":[[2016,6,14]]},"assertion":[{"value":"4 January 2016","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"31 May 2016","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"14 June 2016","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}