{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,2]],"date-time":"2026-07-02T23:48:37Z","timestamp":1783036117898,"version":"3.54.6"},"reference-count":28,"publisher":"IEEE","content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2018,9]]},"DOI":"10.1109\/hpec.2018.8547576","type":"proceedings-article","created":{"date-parts":[[2018,12,8]],"date-time":"2018-12-08T00:50:56Z","timestamp":1544230256000},"page":"1-7","source":"Crossref","is-referenced-by-count":2,"title":["Optimizing GPU Kernels for Irregular Batch Workloads: A Case Study for Cholesky Factorization"],"prefix":"10.1109","author":[{"given":"Ahmad","family":"Abdelfattah","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Azzam","family":"Haidar","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Stanimire","family":"Tomov","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jack","family":"Dongarra","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1007\/s006070050015"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1016\/j.parco.2009.12.005"},{"key":"ref12","doi-asserted-by":"crossref","first-page":"42","DOI":"10.1145\/3038228.3038237","article-title":"High-performance Cholesky Factorization for GPU-only Execution","author":"haidar","year":"2017","journal-title":"General Purpose GPU"},{"key":"ref13","article-title":"Magmadnn high-performance data analytics for manycore gpus and cpus","author":"ng","year":"2017","journal-title":"magma-DNN 2017 Summer Research Experiences for Undergraduate (REU)"},{"key":"ref14","first-page":"21","article-title":"Performance, Design, and Autotuning of Batched GEMM for GPUs","author":"abdelfattah","year":"2016","journal-title":"High Performance Computing-31st International Conference ISC High Performance 2016"},{"key":"ref15","first-page":"31","article-title":"A framework for batched and GPU-resident factorization algorithms applied to block householder transformations","volume":"9137","author":"haidar","year":"2015","journal-title":"High Performance Computing"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1109\/ICPP.2014.52"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/HPCC.2014.30"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1145\/2688500.2688534"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1177\/1094342014567546"},{"key":"ref28","year":"0","journal-title":"NVIDIA CUDA Basic Linear Algebra Subroutines (CuBLAS) Library"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/TPDS.2015.2481890"},{"key":"ref27","year":"1999","journal-title":"Installation guide for LAPACK Technical Report 41 LAPACK Working Note"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/BigData.2015.7363811"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/HiPC.2016.031"},{"key":"ref5","first-page":"108","article-title":"High-Performance Tensor Contractions for GPUs","author":"abdelfattah","year":"2016","journal-title":"International Conference on Computational Science 2016 ICCS 2016"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1016\/j.parco.2016.06.004"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1145\/3065870"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/CLUSTER.2013.6702656"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1145\/3026937.3026940"},{"key":"ref1","first-page":"813","author":"villa","year":"2013","journal-title":"Power\/Performance Trade-Offs of Small Batched LU Based Solvers on GPUs"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1002\/cpe.748"},{"key":"ref22","article-title":"Batched QR and SVD algorithms on GPUs with applications in hierarchical matrix compression","author":"boukaram","year":"2017","journal-title":"Parallel Computing"},{"key":"ref21","doi-asserted-by":"crossref","first-page":"659","DOI":"10.1007\/978-3-319-43659-3_48","article-title":"High-Performance Matrix-Matrix Multiplications of Very Small Matrices","author":"masliah","year":"2016","journal-title":"Euro-Par 2016 Parallel Processing - 22nd International Conference on Parallel and Distributed Computing"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1145\/3126908.3126941"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1016\/j.jocs.2018.01.007"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1109\/IPDPS.2018.00102"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1145\/3079079.3079103"}],"event":{"name":"2018 IEEE High Performance Extreme Computing Conference (HPEC)","location":"Waltham, MA","start":{"date-parts":[[2018,9,25]]},"end":{"date-parts":[[2018,9,27]]}},"container-title":["2018 IEEE High Performance extreme Computing Conference (HPEC)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/8534508\/8547513\/08547576.pdf?arnumber=8547576","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2020,8,24]],"date-time":"2020-08-24T02:30:00Z","timestamp":1598236200000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/8547576\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2018,9]]},"references-count":28,"URL":"https:\/\/doi.org\/10.1109\/hpec.2018.8547576","relation":{},"subject":[],"published":{"date-parts":[[2018,9]]}}}