{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,3,21]],"date-time":"2026-03-21T17:02:22Z","timestamp":1774112542346,"version":"3.50.1"},"publisher-location":"New York, NY, USA","reference-count":65,"publisher":"ACM","funder":[{"DOI":"10.13039\/100000001","name":"NSF (National Science Foundation)","doi-asserted-by":"publisher","award":["NS-2346520"],"award-info":[{"award-number":["NS-2346520"]}],"id":[{"id":"10.13039\/100000001","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100000001","name":"NSF (National Science Foundation)","doi-asserted-by":"publisher","award":["PHY-2028125"],"award-info":[{"award-number":["PHY-2028125"]}],"id":[{"id":"10.13039\/100000001","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100000001","name":"NSF (National Science Foundation)","doi-asserted-by":"publisher","award":["RISE- 2425761"],"award-info":[{"award-number":["RISE- 2425761"]}],"id":[{"id":"10.13039\/100000001","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100000001","name":"NSF (National Science Foundation)","doi-asserted-by":"publisher","award":["DMS-2325184"],"award-info":[{"award-number":["DMS-2325184"]}],"id":[{"id":"10.13039\/100000001","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100000001","name":"NSF (National Science Foundation)","doi-asserted-by":"publisher","award":["OAC-2103804"],"award-info":[{"award-number":["OAC-2103804"]}],"id":[{"id":"10.13039\/100000001","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100006502","name":"Defense Sciences Office, DARPA","doi-asserted-by":"publisher","award":["HR00112490488"],"award-info":[{"award-number":["HR00112490488"]}],"id":[{"id":"10.13039\/100006502","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100000015","name":"DOE U.S. Department of Energy","doi-asserted-by":"publisher","award":["DE-NA0003965"],"award-info":[{"award-number":["DE-NA0003965"]}],"id":[{"id":"10.13039\/100000015","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100000181","name":"Air Force Office of Scientific Research","doi-asserted-by":"publisher","award":["FA8750-19-2-100"],"award-info":[{"award-number":["FA8750-19-2-100"]}],"id":[{"id":"10.13039\/100000181","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2025,9,8]]},"DOI":"10.1145\/3754598.3754667","type":"proceedings-article","created":{"date-parts":[[2025,12,20]],"date-time":"2025-12-20T08:34:32Z","timestamp":1766219672000},"page":"500-510","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":1,"title":["Performant Unified GPU Kernels for Portable Singular Value Computation Across Hardware and Precision"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0000-0003-4661-1483","authenticated-orcid":false,"given":"Evelyne","family":"Ringoot","sequence":"first","affiliation":[{"name":"Massachusetts Institute of Technology, Cambridge, USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-9911-6094","authenticated-orcid":false,"given":"Rabab","family":"Alomairy","sequence":"additional","affiliation":[{"name":"Massachusetts Institute of Technology, Cambridge, USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-9033-165X","authenticated-orcid":false,"given":"Valentin","family":"Churavy","sequence":"additional","affiliation":[{"name":"University of Mainz, Mainz, Germany and University of Augsburg, Augsburg, Germany"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-7676-3133","authenticated-orcid":false,"given":"Alan","family":"Edelman","sequence":"additional","affiliation":[{"name":"Massachusetts Institute of Technology, Cambridge, USA"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2025,12,20]]},"reference":[{"key":"e_1_3_3_1_2_2","doi-asserted-by":"crossref","unstructured":"Ahmad Abdelfattah Natalie Beams Robert Carson Pieter Ghysels Tzanio Kolev Thomas Stitt Arturo Vargas Stanimire Tomov and Jack Dongarra. 2024. MAGMA: Enabling Exascale Performance with Accelerated BLAS and LAPACK for Diverse GPU Architectures. The International Journal of High Performance Computing Applications 38 5 (2024) 468\u2013490.","DOI":"10.1177\/10943420241261960"},{"key":"e_1_3_3_1_3_2","doi-asserted-by":"publisher","DOI":"10.1109\/ICMCSI64620.2025.10883176"},{"key":"e_1_3_3_1_4_2","unstructured":"Rabab Alomairy Mark Gates Sebastien Cayrols and Dalal Sukkari. 2022. Communication Avoiding { LU} with Tournament Pivoting in { SLATE} { SWAN} No. 18. https:\/\/icl.utk.edu\/files\/publications\/2022\/icl-utk-1533-2022.pdf"},{"key":"e_1_3_3_1_5_2","doi-asserted-by":"crossref","unstructured":"Rabab Alomairy Hatem Ltaief Mustafa Abduljabbar and David Keyes. 2020. Abstraction layer for standardizing APIs of task-based engines. IEEE Transactions on Parallel and Distributed Systems 31 11 (2020) 2482\u20132495.","DOI":"10.1109\/TPDS.2020.2992923"},{"key":"e_1_3_3_1_6_2","doi-asserted-by":"publisher","DOI":"10.5281\/zenodo.15049222"},{"key":"e_1_3_3_1_7_2","doi-asserted-by":"publisher","DOI":"10.1109\/HPEC62836.2024.10938467"},{"key":"e_1_3_3_1_8_2","doi-asserted-by":"publisher","DOI":"10.1145\/3529538.3530005"},{"key":"e_1_3_3_1_9_2","doi-asserted-by":"publisher","DOI":"10.5555\/323215"},{"key":"e_1_3_3_1_10_2","volume-title":"Metal Performance Shaders","year":"2025","unstructured":"Apple. 2025. Metal Performance Shaders. Apple. https:\/\/developer.apple.com\/documentation\/metalperformanceshaders"},{"key":"e_1_3_3_1_11_2","volume-title":"Embedding julia","author":"Arslan Alex","year":"2023","unstructured":"Alex Arslan, Stefan Karpinski, Kristoffer Carlsson, and all. 2023. Embedding julia. Julia language. Retrieved July 28, 2025 from https:\/\/docs.julialang.org\/en\/v1\/manual\/embedding\/"},{"key":"e_1_3_3_1_12_2","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-03869-3_80"},{"key":"e_1_3_3_1_13_2","doi-asserted-by":"publisher","DOI":"10.1145\/2145816.2145822"},{"key":"e_1_3_3_1_14_2","doi-asserted-by":"publisher","DOI":"10.5281\/zenodo.14615352"},{"key":"e_1_3_3_1_15_2","doi-asserted-by":"crossref","unstructured":"Tim Besard Valentin Churavy Alan Edelman and Bjorn De\u00a0Sutter. 2019. Rapid Software Prototyping for Heterogeneous and Distributed Platforms. Advances in Engineering Software 132 (2019) 29\u201346.","DOI":"10.1016\/j.advengsoft.2019.02.002"},{"key":"e_1_3_3_1_16_2","doi-asserted-by":"publisher","unstructured":"Tim Besard Christophe Foket and Bjorn De\u00a0Sutter. 2019. Effective Extensible Programming: Unleashing Julia on GPUs. IEEE Transactions on Parallel and Distributed Systems 30 4 (2019) 827\u2013841. 10.1109\/TPDS.2018.2872064","DOI":"10.1109\/TPDS.2018.2872064"},{"key":"e_1_3_3_1_17_2","doi-asserted-by":"publisher","DOI":"10.5281\/zenodo.14615291"},{"key":"e_1_3_3_1_18_2","doi-asserted-by":"publisher","unstructured":"Jeff Bezanson Jiahao Chen Benjamin Chung Stefan Karpinski Viral\u00a0B. Shah Jan Vitek and Lionel Zoubritzky. 2018. Julia: dynamism and performance reconciled by design. Proc. ACM Program. Lang. 2 OOPSLA Article 120 (Oct. 2018) 23\u00a0pages. 10.1145\/3276490","DOI":"10.1145\/3276490"},{"key":"e_1_3_3_1_19_2","doi-asserted-by":"publisher","DOI":"10.5555\/265932"},{"key":"e_1_3_3_1_20_2","volume-title":"rocSOLVER","author":"Bloor Cory","year":"2025","unstructured":"Cory Bloor, Juan Zuniga-Anaya, Troy Alderso, and all. 2025. rocSOLVER. AMD. https:\/\/github.com\/ROCm\/rocSOLVER"},{"key":"e_1_3_3_1_21_2","doi-asserted-by":"crossref","first-page":"1432","DOI":"10.1109\/IPDPS.2011.299","volume-title":"2011 IEEE International Symposium on Parallel and Distributed Processing Workshops and Phd Forum","author":"Bosilca George","year":"2011","unstructured":"George Bosilca, Aurelien Bouteiller, Anthony Danalis, Mathieu Faverge, Azzam Haidar, Thomas Herault, Jakub Kurzak, Julien Langou, Pierre Lemarinier, Hatem Ltaief, et\u00a0al. 2011. Flexible Development of Dense Linear Algebra Algorithms on Massively Parallel Architectures with DPLASMA. In 2011 IEEE International Symposium on Parallel and Distributed Processing Workshops and Phd Forum. IEEE, 1432\u20131441."},{"key":"e_1_3_3_1_22_2","doi-asserted-by":"publisher","DOI":"10.1109\/IPDPS.2011.299"},{"key":"e_1_3_3_1_23_2","unstructured":"William Brandon. 2024. Matmul3. https:\/\/github.com\/accelerated-computing-class\/lab6\/blob\/main\/matmul_3.cu"},{"key":"e_1_3_3_1_24_2","doi-asserted-by":"publisher","unstructured":"Alfredo Buttari Julien Langou Jakub Kurzak and Jack Dongarra. 2009. A class of parallel tiled linear algebra algorithms for multicore architectures. Parallel Comput. 35 1 (2009) 38\u201353. 10.1016\/j.parco.2008.10.002","DOI":"10.1016\/j.parco.2008.10.002"},{"key":"e_1_3_3_1_25_2","first-page":"414","volume-title":"2022 IEEE International Parallel and Distributed Processing Symposium (IPDPS)","author":"Cao Qinglei","year":"2022","unstructured":"Qinglei Cao, Rabab Alomairy, Yu Pei, George Bosilca, Hatem Ltaief, David Keyes, and Jack Dongarra. 2022. A Framework to Exploit Data Sparsity in Tile Low-Rank Cholesky Factorization. In 2022 IEEE International Parallel and Distributed Processing Symposium (IPDPS). IEEE, 414\u2013424."},{"key":"e_1_3_3_1_26_2","doi-asserted-by":"crossref","unstructured":"Vicki Carrica Maxwell Onyango Rabab Alomairy Evelyne Ringoot James Schloss and Alan Edelman. 2025. Toward Portable GPU Performance: Julia Recursive Implementation of TRMM and TRSM. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2504.13821 (2025) 10.","DOI":"10.1007\/978-3-031-97196-9_13"},{"key":"e_1_3_3_1_27_2","unstructured":"Jiahao Chen. 2024. Randommatrices.jl. https:\/\/github.com\/JuliaMath\/RandomMatrices.jl."},{"key":"e_1_3_3_1_28_2","doi-asserted-by":"publisher","DOI":"10.1145\/3274250.3274261"},{"key":"e_1_3_3_1_29_2","unstructured":"Valentin Churavy. 2019. Transparent distributed programming in Julia. Master\u2019s thesis. Massachusetts Institute of Technology."},{"key":"e_1_3_3_1_30_2","unstructured":"Valentin Churavy. 2023. KernelAbstractions.jl. https:\/\/github.com\/JuliaGPU\/KernelAbstractions.jl."},{"key":"e_1_3_3_1_31_2","doi-asserted-by":"publisher","unstructured":"Michael\u00a0P. Connolly and Nicholas\u00a0J. Higham. 2023. Probabilistic Rounding Error Analysis of Householder QR Factorization. SIAM J. Matrix Anal. Appl. 44 3 (2023) 1146\u20131163. 10.1137\/22M1514817 arXiv:10.1137\/22M1514817","DOI":"10.1137\/22M1514817"},{"key":"e_1_3_3_1_32_2","unstructured":"Joshua\u00a0H Davis Pranav Sivaraman Isaac Minn Konstantinos Parasyris Harshitha Menon Giorgis Georgakoudis and Abhinav Bhatele. 2024. An Evaluative Comparison of Performance Portability across GPU Programming Models. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2402.08950 (2024) 12."},{"key":"e_1_3_3_1_33_2","doi-asserted-by":"publisher","DOI":"10.1109\/P3HPC49587.2019.00006"},{"key":"e_1_3_3_1_34_2","doi-asserted-by":"publisher","DOI":"10.1109\/CACSD.1989.69824"},{"key":"e_1_3_3_1_35_2","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-06548-91"},{"key":"e_1_3_3_1_36_2","doi-asserted-by":"publisher","unstructured":"Jack Dongarra Mark Gates Azzam Haidar Jakub Kurzak Piotr Luszczek Stanimire Tomov and Ichitaro Yamazaki. 2018. The Singular Value Decomposition: Anatomy of Optimizing an Algorithm for Extreme Scale. SIAM Rev. 60 4 (2018) 808\u2013865. 10.1137\/17M1117732 arXiv:10.1137\/17M1117732","DOI":"10.1137\/17M1117732"},{"key":"e_1_3_3_1_37_2","doi-asserted-by":"publisher","unstructured":"Jack Dongarra Mark Gates Azzam Haidar Jakub Kurzak Piotr Luszczek Panruo Wu Ichitaro Yamazaki Asim Yarkhan Maksims Abalenkovs Negin Bagherpour Sven Hammarling Jakub \u0160\u00edstek David Stevens Mawussi Zounon and Samuel\u00a0D. Relton. 2019. PLASMA: Parallel Linear Algebra Software for Multicore Using OpenMP. ACM Trans. Math. Softw. 45 2 Article 16 (May 2019) 35\u00a0pages. 10.1145\/3264491","DOI":"10.1145\/3264491"},{"key":"e_1_3_3_1_38_2","doi-asserted-by":"publisher","DOI":"10.1109\/P3HPC54578.2021.00009"},{"key":"e_1_3_3_1_39_2","doi-asserted-by":"crossref","unstructured":"Mathieu Faverge Nathalie Furmento Abdou Guermouche Gwenol\u00e9 Lucas Raymond Namyst Samuel Thibault and Pierre-andr\u00e9 Wacrenier. 2023. Programming Heterogeneous Architectures Uing Hierarchical Tasks. Concurrency and Computation: Practice and Experience 35 25 (2023) e7811.","DOI":"10.1002\/cpe.7811"},{"key":"e_1_3_3_1_40_2","doi-asserted-by":"crossref","unstructured":"Mark Gates Ahmad Abdelfattah Kadir Akbudak Mohammed Al\u00a0Farhan Rabab Alomairy Daniel Bielich Treece Burgess S\u00e9bastien Cayrols Neil Lindquist Dalal Sukkari et\u00a0al. 2025. Evolution of the SLATE Linear Algebra Library. The International Journal of High Performance Computing Applications 39 1 (2025) 3\u201317.","DOI":"10.1177\/10943420241286531"},{"key":"e_1_3_3_1_41_2","volume-title":"SLATE Users\u2019 Guide, SWAN No. 10","author":"Gates Mark","year":"2020","unstructured":"Mark Gates, Ali Charara, Jakub Kurzak, Asim YarKhan, Mohammed Al\u00a0Farhan, Dalal Sukkari, and Jack Dongarra. 2020. SLATE Users\u2019 Guide, SWAN No. 10. Technical Report ICL-UT-19-01. Innovative Computing Laboratory, University of Tennessee. revision 07-2020."},{"key":"e_1_3_3_1_42_2","doi-asserted-by":"publisher","unstructured":"Mark Gates Stanimire Tomov and Jack Dongarra. 2018. Accelerating the SVD two stage bidiagonal reduction and divide and conquer using GPUs. Parallel Comput. 74 (2018) 3\u201318. 10.1016\/j.parco.2017.10.004Parallel Matrix Algorithms and Applications (PMAA\u201916).","DOI":"10.1016\/j.parco.2017.10.004"},{"key":"e_1_3_3_1_43_2","doi-asserted-by":"publisher","DOI":"10.1109\/IPDPSW59300.2023.00068"},{"key":"e_1_3_3_1_44_2","doi-asserted-by":"publisher","DOI":"10.1145\/2063384.2063394"},{"key":"e_1_3_3_1_45_2","doi-asserted-by":"publisher","DOI":"10.1109\/IPDPS.2012.13"},{"key":"e_1_3_3_1_46_2","doi-asserted-by":"publisher","unstructured":"Behnam Hashemi and Yuji Nakatsukasa. 2022. Least-Squares Spectral Methods for ODE Eigenvalue Problems. SIAM Journal on Scientific Computing 44 5 (2022) A3244\u2013A3264. 10.1137\/21M1445934 arXiv:10.1137\/21M1445934","DOI":"10.1137\/21M1445934"},{"key":"e_1_3_3_1_47_2","doi-asserted-by":"publisher","unstructured":"Francisco\u00a0D. Igual Ernie Chan Enrique\u00a0S. Quintana-Ort\u00ed Gregorio Quintana-Ort\u00ed Robert A. van\u00a0de Geijn and Field\u00a0G. Van\u00a0Zee. 2012. The FLAME Approach: From Dense Linear Algebra Algorithms to High-Performance Multi-Accelerator Implementations. J. Parallel and Distrib. Comput. 72 9 (2012) 1134\u20131143. 10.1016\/j.jpdc.2011.10.014","DOI":"10.1016\/j.jpdc.2011.10.014"},{"key":"e_1_3_3_1_48_2","doi-asserted-by":"publisher","DOI":"10.1145\/2791321.2791345"},{"key":"e_1_3_3_1_49_2","unstructured":"Christoph Klein. 2025. NVIDIA CUDALibrarySamples Issues: eigenvalue solver xsyevd has limit on matrix siz. Retrieved April 30 2025 from https:\/\/github.com\/NVIDIA\/CUDALibrarySamples\/issues\/246"},{"key":"e_1_3_3_1_50_2","unstructured":"Zhiteng Li Mingyuan Xia Jingyuan Zhang Zheng Hui Linghe Kong Yulun Zhang and Xiaokang Yang. 2025. AdaSVD: Adaptive Singular Value Decomposition for Large Language Models. arxiv:https:\/\/arXiv.org\/abs\/2502.01403\u00a0[cs.CV] https:\/\/arxiv.org\/abs\/2502.01403"},{"key":"e_1_3_3_1_51_2","doi-asserted-by":"crossref","first-page":"91","DOI":"10.1007\/978-3-031-69577-3_7","volume-title":"Euro-Par 2024: Parallel Processing","author":"Lurati Milo","year":"2024","unstructured":"Milo Lurati, Stijn Heldens, Alessio Sclocco, and Ben van Werkhoven. 2024. Bringing Auto-Tuning to\u00a0HIP: Analysis of\u00a0Tuning Impact and\u00a0Difficulty on\u00a0AMD and\u00a0Nvidia GPUs. In Euro-Par 2024: Parallel Processing, Jesus Carretero, Sameer Shende, Javier Garcia-Blas, Ivona Brandic, Katzalin Olcoz, and Martin Schreiber (Eds.). Springer Nature Switzerland, Cham, 91\u2013106."},{"key":"e_1_3_3_1_52_2","doi-asserted-by":"publisher","DOI":"10.1109\/SCW63240.2024.00157"},{"key":"e_1_3_3_1_53_2","doi-asserted-by":"publisher","unstructured":"Matthew Martineau Simon McIntosh-Smith and Wayne Gaudin. 2017. Assessing the performance portability of modern parallel programming models using TeaLeaf. Concurrency and Computation: Practice and Experience 29 15 (2017) e4117. 10.1002\/cpe.4117 arXiv:https:\/\/onlinelibrary.wiley.com\/doi\/pdf\/10.1002\/cpe.4117e4117 cpe.4117.","DOI":"10.1002\/cpe.4117"},{"key":"e_1_3_3_1_54_2","doi-asserted-by":"publisher","unstructured":"JAROS\u0141AW\u00a0ADAM MISZCZAK. 2011. SINGULAR VALUE DECOMPOSITION AND MATRIX REORDERINGS IN QUANTUM INFORMATION THEORY. International Journal of Modern Physics C 22 09 (2011) 897\u2013918. 10.1142\/S0129183111016683","DOI":"10.1142\/S0129183111016683"},{"key":"e_1_3_3_1_55_2","volume-title":"cuSOLVER","year":"2025","unstructured":"NVIDIA. 2025. cuSOLVER. NVIDIA. https:\/\/developer.nvidia.com\/cusolver"},{"key":"e_1_3_3_1_56_2","doi-asserted-by":"publisher","DOI":"10.5281\/zenodo.10040461"},{"key":"e_1_3_3_1_57_2","unstructured":"Tim\u00a0Besard Simeon\u00a0Danisch. 2023. GPUArrays.jl. https:\/\/github.com\/JuliaGPU\/GPUArrays.jl."},{"key":"e_1_3_3_1_58_2","doi-asserted-by":"crossref","unstructured":"John\u00a0E Stone David Gohara and Guochun Shi. 2010. OpenCL: A parallel programming standard for heterogeneous computing systems. Computing in science & engineering 12 3 (2010) 66.","DOI":"10.1109\/MCSE.2010.69"},{"key":"e_1_3_3_1_59_2","unstructured":"Qi Sun Edoardo Cetin and Yujin Tang. 2025. Transformer-Squared: Self-adaptive LLMs. 19. arxiv:https:\/\/arXiv.org\/abs\/2501.06252\u00a0[cs.LG] https:\/\/arxiv.org\/abs\/2501.06252"},{"key":"e_1_3_3_1_60_2","doi-asserted-by":"publisher","unstructured":"Christian\u00a0R. Trott Damien Lebrun-Grandi\u00e9 Daniel Arndt Jan Ciesko Vinh Dang Nathan Ellingwood Rahulkumar Gayatri Evan Harvey Daisy\u00a0S. Hollman Dan Ibanez Nevin Liber Jonathan Madsen Jeff Miles David Poliakoff Amy Powell Sivasankaran Rajamanickam Mikael Simberg Dan Sunderland Bruno Turcksin and Jeremiah Wilke. 2022. Kokkos 3: Programming Model Extensions for the Exascale Era. IEEE Transactions on Parallel and Distributed Systems 33 4 (2022) 805\u2013817. 10.1109\/TPDS.2021.3097283","DOI":"10.1109\/TPDS.2021.3097283"},{"key":"e_1_3_3_1_61_2","doi-asserted-by":"publisher","unstructured":"Utkarsh Utkarsh Valentin Churavy Yingbo Ma Tim Besard Prakitr Srisuma Tim Gymnich Adam\u00a0R. Gerlach Alan Edelman George Barbastathis Richard\u00a0D. Braatz and Christopher Rackauckas. 2024. Automated translation and accelerated solving of differential equations on multiple GPU platforms. Computer Methods in Applied Mechanics and Engineering 419 (2024) 116591. 10.1016\/j.cma.2023.116591","DOI":"10.1016\/j.cma.2023.116591"},{"key":"e_1_3_3_1_62_2","doi-asserted-by":"publisher","unstructured":"Field\u00a0G. Van\u00a0Zee and Robert A. van\u00a0de Geijn. 2015. BLIS: A Framework for Rapidly Instantiating BLAS Functionality. ACM Trans. Math. Softw. 41 3 (06 2015) 31. 10.1145\/2764454","DOI":"10.1145\/2764454"},{"key":"e_1_3_3_1_63_2","unstructured":"Qinsi Wang Jinghan Ke Masayoshi Tomizuka Yiran Chen Kurt Keutzer and Chenfeng Xu. 2025. Dobi-SVD: Differentiable SVD for LLM Compression and Some New Perspectives. arxiv:https:\/\/arXiv.org\/abs\/2502.02723\u00a0[cs.LG] https:\/\/arxiv.org\/abs\/2502.02723"},{"key":"e_1_3_3_1_64_2","doi-asserted-by":"publisher","DOI":"10.1109\/SC41404.2022.00087"},{"key":"e_1_3_3_1_65_2","first-page":"2","volume-title":"2024 IEEE High Performance Extreme Computing Conference (HPEC)","author":"Xuan Sophie","year":"2024","unstructured":"Sophie Xuan, Evelyne Ringoot, Rabab Alomairy, Felipe Tome, Julian Samaroo, and Alan Edelman. 2024. Synthesizing Numerical Linear Algebra using Julia. In 2024 IEEE High Performance Extreme Computing Conference (HPEC). IEEE, 2."},{"key":"e_1_3_3_1_66_2","doi-asserted-by":"publisher","unstructured":"Jisheng Zhao Colleen Bertoni Jeffrey Young Kevin Harms Vivek Sarkar and Brice Videau. 2023. HIPLZ: Enabling performance portability for exascale systems. Concurrency and Computation: Practice and Experience 35 25 (2023) e7866. 10.1002\/cpe.7866 arXiv:https:\/\/onlinelibrary.wiley.com\/doi\/pdf\/10.1002\/cpe.7866","DOI":"10.1002\/cpe.7866"}],"event":{"name":"ICPP '25: 54th International Conference on Parallel Processing","location":"San Diego CA USA","acronym":"ICPP '25"},"container-title":["Proceedings of the 54th International Conference on Parallel Processing"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3754598.3754667","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,12,20]],"date-time":"2025-12-20T08:38:41Z","timestamp":1766219921000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3754598.3754667"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,9,8]]},"references-count":65,"alternative-id":["10.1145\/3754598.3754667","10.1145\/3754598"],"URL":"https:\/\/doi.org\/10.1145\/3754598.3754667","relation":{},"subject":[],"published":{"date-parts":[[2025,9,8]]},"assertion":[{"value":"2025-12-20","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}