{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,11,12]],"date-time":"2025-11-12T09:10:29Z","timestamp":1762938629130,"version":"3.45.0"},"reference-count":22,"publisher":"Wiley","issue":"25-26","license":[{"start":{"date-parts":[[2025,9,30]],"date-time":"2025-09-30T00:00:00Z","timestamp":1759190400000},"content-version":"vor","delay-in-days":0,"URL":"http:\/\/creativecommons.org\/licenses\/by\/4.0\/"}],"content-domain":{"domain":["onlinelibrary.wiley.com"],"crossmark-restriction":true},"short-container-title":["Concurrency and Computation"],"published-print":{"date-parts":[[2025,11,30]]},"abstract":"<jats:title>ABSTRACT<\/jats:title>\n                  <jats:p>\n                    The paper focuses on the improvement of the existing\n                    <jats:italic>nsparse<\/jats:italic>\n                    Nagasaka et al. algorithm and its extension to the multi\u2010GPU setting for the application of real engineering problems. In this work, we propose a distributed multi\u2010GPU framework for\n                    <jats:italic>SpGEMM<\/jats:italic>\n                    that is designed specifically for the\n                    <jats:italic>nsparse<\/jats:italic>\n                    like algorithms. The results show \u223c2 times speed\u2010up for\n                    <jats:italic>nsparse<\/jats:italic>\n                    and close to ideal scalability of the multi\u2010GPU extension with the number of GPUs. Finally, we test the proposed algorithm in the AMG setting by computing the double\n                    <jats:italic>SpGEMM<\/jats:italic>\n                    product.\n                  <\/jats:p>","DOI":"10.1002\/cpe.70313","type":"journal-article","created":{"date-parts":[[2025,9,30]],"date-time":"2025-09-30T07:30:03Z","timestamp":1759217403000},"update-policy":"https:\/\/doi.org\/10.1002\/crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["Multi\n                    <scp>GPU<\/scp>\n                    Sparse Matrix by Sparse Matrix Multiplication"],"prefix":"10.1002","volume":"37","author":[{"ORCID":"https:\/\/orcid.org\/0009-0006-2503-9843","authenticated-orcid":false,"given":"Artem","family":"Mavliutov","sequence":"first","affiliation":[{"name":"University of Padova  Padova Italy"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Giovanni","family":"Isotton","sequence":"additional","affiliation":[{"name":"M3E S.R.L.  Padova Italy"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Carlo","family":"Janna","sequence":"additional","affiliation":[{"name":"University of Padova  Padova Italy"},{"name":"M3E S.R.L.  Padova Italy"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Alessandro","family":"Celestini","sequence":"additional","affiliation":[{"name":"Institute for Applied Computing, CNR  Rome Italy"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Massimo","family":"Bernaschi","sequence":"additional","affiliation":[{"name":"Institute for Applied Computing, CNR  Rome Italy"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"311","published-online":{"date-parts":[[2025,9,30]]},"reference":[{"key":"e_1_2_9_2_1","unstructured":"S.Balay S.Abhyankar M. F.Adams et al. \u201cPETSc Web Page \u201d2022 https:\/\/petsc.org\/."},{"key":"e_1_2_9_3_1","doi-asserted-by":"publisher","DOI":"10.1007\/3-540-47789-6_66"},{"key":"e_1_2_9_4_1","doi-asserted-by":"publisher","DOI":"10.1016\/S0168-9274(01)00115-5"},{"key":"e_1_2_9_5_1","doi-asserted-by":"publisher","DOI":"10.1137\/21m1398586"},{"key":"e_1_2_9_6_1","doi-asserted-by":"publisher","DOI":"10.1137\/19M1255409"},{"key":"e_1_2_9_7_1","doi-asserted-by":"publisher","DOI":"10.1016\/j.cma.2022.114632"},{"key":"e_1_2_9_8_1","doi-asserted-by":"publisher","DOI":"10.1137\/19M1261250"},{"key":"e_1_2_9_9_1","doi-asserted-by":"publisher","DOI":"10.1109\/IJCNN52387.2021.9533408"},{"key":"e_1_2_9_10_1","first-page":"362","volume-title":"Proceedings of the 25th ACM SIGPLAN Symposium on Principles and Practice of Parallel Programming","author":"Mathias P.","year":"2020"},{"key":"e_1_2_9_11_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICPP.2017.19"},{"volume-title":"The API Reference Guide for cuSPARSE, the CUDA Sparse Matrix Library. (v9.1 ed.)","year":"2019","author":"NVIDIA","key":"e_1_2_9_12_1"},{"key":"e_1_2_9_13_1","doi-asserted-by":"publisher","DOI":"10.1109\/TPDS.2021.3094091"},{"key":"e_1_2_9_14_1","doi-asserted-by":"publisher","DOI":"10.1145\/3571157"},{"key":"e_1_2_9_15_1","doi-asserted-by":"publisher","DOI":"10.1137\/140980260"},{"key":"e_1_2_9_16_1","doi-asserted-by":"publisher","DOI":"10.1016\/j.jpdc.2015.06.010"},{"key":"e_1_2_9_17_1","unstructured":"NVIDIA \u201cCub \u201d2025 https:\/\/nvidia.github.io\/cccl\/cub\/."},{"key":"e_1_2_9_18_1","unstructured":"NVIDIA \u201cThrust: The c++ Parallel Algorithms Library \u201d2025 https:\/\/nvidia.github.io\/cccl\/thrust\/."},{"key":"e_1_2_9_19_1","unstructured":"D.MerrillandM.Garland \u201cSingle\u2010Pass Parallel Prefix Scan With Decoupled Lookback \u201d2016 https:\/\/api.semanticscholar.org\/CorpusID:51919482."},{"key":"e_1_2_9_20_1","unstructured":"A.Chang \u201cApplication of Sparse Matrix Methods in Electric Power System Analysis \u201d1968."},{"key":"e_1_2_9_21_1","doi-asserted-by":"publisher","DOI":"10.17815\/jlsrf\u20108\u2010186"},{"key":"e_1_2_9_22_1","doi-asserted-by":"publisher","DOI":"10.1145\/2049662.2049663"},{"key":"e_1_2_9_23_1","unstructured":"M3E \u201cThe m3e Matrix Collection \u201d2023 https:\/\/www.m3eweb.it\/matrixcollection\/."}],"container-title":["Concurrency and Computation: Practice and Experience"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/onlinelibrary.wiley.com\/doi\/pdf\/10.1002\/cpe.70313","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,11,12]],"date-time":"2025-11-12T09:05:42Z","timestamp":1762938342000},"score":1,"resource":{"primary":{"URL":"https:\/\/onlinelibrary.wiley.com\/doi\/10.1002\/cpe.70313"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,9,30]]},"references-count":22,"journal-issue":{"issue":"25-26","published-print":{"date-parts":[[2025,11,30]]}},"alternative-id":["10.1002\/cpe.70313"],"URL":"https:\/\/doi.org\/10.1002\/cpe.70313","archive":["Portico"],"relation":{},"ISSN":["1532-0626","1532-0634"],"issn-type":[{"type":"print","value":"1532-0626"},{"type":"electronic","value":"1532-0634"}],"subject":[],"published":{"date-parts":[[2025,9,30]]},"assertion":[{"value":"2025-04-18","order":0,"name":"received","label":"Received","group":{"name":"publication_history","label":"Publication History"}},{"value":"2025-09-11","order":2,"name":"accepted","label":"Accepted","group":{"name":"publication_history","label":"Publication History"}},{"value":"2025-09-30","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}],"article-number":"e70313"}}