{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2022,4,2]],"date-time":"2022-04-02T11:12:48Z","timestamp":1648897968790},"reference-count":26,"publisher":"Springer Science and Business Media LLC","issue":"1","license":[{"start":{"date-parts":[[2013,11,23]],"date-time":"2013-11-23T00:00:00Z","timestamp":1385164800000},"content-version":"tdm","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["J Supercomput"],"published-print":{"date-parts":[[2014,4]]},"DOI":"10.1007\/s11227-013-1043-3","type":"journal-article","created":{"date-parts":[[2013,11,22]],"date-time":"2013-11-22T20:25:56Z","timestamp":1385151956000},"page":"365-413","source":"Crossref","is-referenced-by-count":2,"title":["From tile algorithm to stripe algorithm: a CUBLAS-based parallel implementation on GPUs of Gauss method for the resolution of extremely large dense linear systems stored on an array of solid state devices"],"prefix":"10.1007","volume":"68","author":[{"given":"Manuel","family":"Carcenac","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2013,11,23]]},"reference":[{"key":"1043_CR1","doi-asserted-by":"crossref","unstructured":"Agullo E, Augonnet C, Dongarra J, Faverge M, Langou J, Ltaief H, Tomov S (2011) LU factorization for accelerator-based systems. AICCSA\u2019 11 conference, pp 217\u2013224","DOI":"10.1109\/AICCSA.2011.6126599"},{"issue":"1","key":"1043_CR2","doi-asserted-by":"crossref","first-page":"1382","DOI":"10.1109\/71.250119","volume":"4","author":"M Angelaccio","year":"1993","unstructured":"Angelaccio M, Colajanni M (1993) Unifying and optimizing parallel linear algebra algorithms. IEEE Trans Parallel Distrib Syst 4(1):1382\u20131397","journal-title":"IEEE Trans Parallel Distrib Syst"},{"key":"1043_CR3","unstructured":"BLAS\u2014basic linear algebra subprograms. www.netlib.org\/blas"},{"key":"1043_CR4","doi-asserted-by":"crossref","first-page":"38","DOI":"10.1016\/j.parco.2008.10.002","volume":"35","author":"A Buttari","year":"2009","unstructured":"Buttari A, Langou J, Kurzak J, Dongarra J (2009) A class of parallel tiled linear algebra algorithms for multicore architectures. Parallel Comput 35:38\u201353","journal-title":"Parallel Comput"},{"key":"1043_CR5","unstructured":"Carter L, Ferrante J, Flynn Hummel S, Alpern B, Gatlin KS (1996) Hierarchical tiling: a methodology for high performance. Technical Report, UCSD CS96-508"},{"key":"1043_CR6","doi-asserted-by":"crossref","unstructured":"Cosnard M, Tourancheau B, Villard G (1987) Gaussian elimination on message passing architecture. In: Proceedings of 1st International Conference on Supercomputing. Athens. Lecture Notes in Computer Science, vol 297, pp 611\u2013628","DOI":"10.1007\/3-540-18991-2_36"},{"key":"1043_CR7","unstructured":"CUBLAS\u2014implementation of BLAS on top of the NVIDIA CUDA runtime. http:\/\/docs.nvidia.com\/cuda\/cublas\/index.html"},{"key":"1043_CR8","unstructured":"CULA tools, GPU Accelerated Linear Algebra. http:\/\/www.culatools.com"},{"key":"1043_CR9","unstructured":"Dongarra J, Faverge M, Ltaief H, Luszcsek P (2011) Achieving numerical accuracy and high performance using recursive tile LU factorization. Technical Report, University of Tennessee Computer Science ICL-UT-11-08 (also Lawn 259)"},{"key":"1043_CR10","doi-asserted-by":"crossref","unstructured":"Evans F, Skiena S, Varshney A (1996) Optimizing triangle strips for fast rendering. IEEE Vis 96:319\u2013326","DOI":"10.1109\/VISUAL.1996.568125"},{"key":"1043_CR11","doi-asserted-by":"crossref","unstructured":"Hadri B, Ltaief H, Agullo E, Dongarra J (2010) Tile QR factorization with parallel panel processing for multicore architectures. In: IEEE international symposium on parallel and distributed processing, pp 1\u201310","DOI":"10.1109\/IPDPS.2010.5470443"},{"key":"1043_CR12","unstructured":"Haidar A, Ltaief H, YarKhan A, Dongarra J (2011) Analysis of dynamically scheduled tile algorithms for dense linear algebra on multicore architectures. Technical Report, University of Tennessee Computer Science UT-CS-11-666 (also Lawn 243)"},{"key":"1043_CR13","doi-asserted-by":"crossref","unstructured":"Humphrey JR, Price DK, Spagnoli KE, Paolini AL, Kelmelis EJ (2010) CULA: hybrid GPU accelerated linear algebra routines. SPIE Conference Series 7705","DOI":"10.1117\/12.850538"},{"key":"1043_CR14","doi-asserted-by":"crossref","first-page":"1134","DOI":"10.1016\/j.jpdc.2011.10.014","volume":"72","author":"FD Igual","year":"2012","unstructured":"Igual FD, Chan E, Quintana-Ort\u00ed ES, Quintana-Ort\u00ed G, Van de Geijn RA, Van Zee FG (2012) The FLAME approach: from dense linear algebra algorithms to high-performance multi-accelerator implementations. J Parallel Distrib Comput 72:1134\u20131143","journal-title":"J Parallel Distrib Comput"},{"key":"1043_CR15","doi-asserted-by":"crossref","first-page":"15","DOI":"10.1002\/cpe.1467","volume":"22","author":"J Kurzak","year":"2010","unstructured":"Kurzak J, Ltaief H, Dongarra J, Badia RM (2010) Scheduling dense linear algebra operations on multicore processors. Concurrency and Computation: Practice and Experience 22:15\u201344","journal-title":"Concurrency and Computation: Practice and Experience"},{"key":"1043_CR16","unstructured":"LAPACK\u2014derivation of a block algorithm for LU factorization. http:\/\/www.netlib.org\/utk\/papers\/siam-review93\/node13.html"},{"key":"1043_CR17","unstructured":"LAPACK\u2014linear algebra PACKage. http:\/\/www.netlib.org\/lapack"},{"key":"1043_CR18","unstructured":"MAGMA\u2014matrix algebra on GPU and multicore architectures. http:\/\/icl.cs.utk.edu\/graphics\/posters\/files\/SC11-MAGMA.pdf"},{"issue":"2","key":"1043_CR19","doi-asserted-by":"crossref","first-page":"431","DOI":"10.1137\/0111030","volume":"11","author":"D Marquardt","year":"1963","unstructured":"Marquardt D (1963) An algorithm for least-squares estimation of nonlinear parameters. SIAM J Appl Math 11(2):431\u2013441","journal-title":"SIAM J Appl Math"},{"key":"1043_CR20","unstructured":"PLASMA\u2014parallel linear algebra software for multicore architectures. http:\/\/www.netlib.org\/plasma"},{"key":"1043_CR21","unstructured":"ScaLAPACK\u2014scalable linear algebra PACKage. http:\/\/www.netlib.org\/scalapack"},{"key":"1043_CR22","doi-asserted-by":"crossref","first-page":"335","DOI":"10.1137\/0611023","volume":"11","author":"LN Trefethen","year":"1990","unstructured":"Trefethen LN, Schreiber RS (1990) Average-case stability of Gaussian elimination. SIAM J Matrix Anal Appl 11:335\u2013360","journal-title":"SIAM J Matrix Anal Appl"},{"key":"1043_CR23","doi-asserted-by":"crossref","first-page":"232","DOI":"10.1016\/j.parco.2009.12.005","volume":"36","author":"S Tomov","year":"2010","unstructured":"Tomov S, Dongarra J, Baboulin M (2010) Towards dense linear algebra for hybrid GPU accelerated manycore systems. Parallel Comput 36:232\u2013240","journal-title":"Parallel Comput"},{"key":"1043_CR24","doi-asserted-by":"crossref","unstructured":"Tomov S, Nath R, Ltaief H, Dongarra J (2010) Dense linear algebra solvers for multicore with GPU accelerators. In: IEEE international symposium on parallel and distributed processing, pp 1\u20138","DOI":"10.1109\/IPDPSW.2010.5470941"},{"key":"1043_CR25","doi-asserted-by":"crossref","unstructured":"Volkov V, Demmel JW (2008) Benchmarking GPUs to tune dense linear algebra. In: ACM\/IEEE conference on supercomputing SC \u201908","DOI":"10.1109\/SC.2008.5214359"},{"key":"1043_CR26","doi-asserted-by":"crossref","unstructured":"Zhenjie D, Yan C (2009) An optimization load balancing algorithm design in massive storage system. In: ESIAT 2009 conference, vol 3, pp 310\u2013313","DOI":"10.1109\/ESIAT.2009.479"}],"container-title":["The Journal of Supercomputing"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s11227-013-1043-3.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/article\/10.1007\/s11227-013-1043-3\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s11227-013-1043-3","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2019,8,4]],"date-time":"2019-08-04T00:22:02Z","timestamp":1564878122000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/s11227-013-1043-3"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2013,11,23]]},"references-count":26,"journal-issue":{"issue":"1","published-print":{"date-parts":[[2014,4]]}},"alternative-id":["1043"],"URL":"https:\/\/doi.org\/10.1007\/s11227-013-1043-3","relation":{},"ISSN":["0920-8542","1573-0484"],"issn-type":[{"value":"0920-8542","type":"print"},{"value":"1573-0484","type":"electronic"}],"subject":[],"published":{"date-parts":[[2013,11,23]]}}}