{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,2]],"date-time":"2026-07-02T04:31:30Z","timestamp":1782966690195,"version":"3.54.5"},"publisher-location":"Cham","reference-count":21,"publisher":"Springer Nature Switzerland","isbn-type":[{"value":"9783031998560","type":"print"},{"value":"9783031998577","type":"electronic"}],"license":[{"start":{"date-parts":[[2025,8,23]],"date-time":"2025-08-23T00:00:00Z","timestamp":1755907200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2025,8,23]],"date-time":"2025-08-23T00:00:00Z","timestamp":1755907200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2026]]},"DOI":"10.1007\/978-3-031-99857-7_3","type":"book-chapter","created":{"date-parts":[[2025,8,22]],"date-time":"2025-08-22T05:16:45Z","timestamp":1755839805000},"page":"33-47","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":3,"title":["ARM SVE Unleashed: Performance and\u00a0Insights Across HPC Applications on\u00a0Nvidia Grace"],"prefix":"10.1007","author":[{"ORCID":"https:\/\/orcid.org\/0009-0003-4387-367X","authenticated-orcid":false,"given":"Ruimin","family":"Shi","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0003-6504-7109","authenticated-orcid":false,"given":"Gabin","family":"Schieffer","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-4229-5735","authenticated-orcid":false,"given":"Maya","family":"Gokhale","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-4977-814X","authenticated-orcid":false,"given":"Pei-Hung","family":"Lin","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-2750-4471","authenticated-orcid":false,"given":"Hiren","family":"Patel","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-4158-3583","authenticated-orcid":false,"given":"Ivy","family":"Peng","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2025,8,23]]},"reference":[{"key":"3_CR1","unstructured":"ARM: Arm Neoverse V2 Core Technical Reference Manual (2021)"},{"key":"3_CR2","unstructured":"ARM: Arm\u00ae Architecture Reference Manual, ARM DDI 0487 edn. (2024)"},{"key":"3_CR3","unstructured":"Asanovi\u0107, K., Patterson, D.A.: Instruction sets should be free: the case for RISC-V. University of California, Berkeley, Technical report. UCB\/EECS-2014-146 (2014)"},{"key":"3_CR4","doi-asserted-by":"crossref","unstructured":"Flynn, P., Yi, X., Yan, Y.: Exploring source-to-source compiler transformation of OpenMP SIMD constructs for intel AVX and arm SVE vector architectures. In: Proceedings of PMAM, pp. 11\u201320 (2022)","DOI":"10.1145\/3528425.3529100"},{"key":"3_CR5","doi-asserted-by":"crossref","unstructured":"Gupta, S.R., Papadopoulou, N., Pericas, M.: Accelerating CNN inference on long vector architectures via co-design. In: 2023 IPDPS, pp. 145\u2013155. IEEE (2023)","DOI":"10.1109\/IPDPS54959.2023.00024"},{"issue":"5","key":"3_CR6","doi-asserted-by":"publisher","first-page":"3139","DOI":"10.1109\/TCBB.2023.3264514","volume":"20","author":"R Langarita","year":"2023","unstructured":"Langarita, R., Armejach, A., Ib\u00e1\u00f1ez, P., Alastruey-Bened\u00e9, J., Moret\u00f3, M.: Porting and optimizing BWA-MEM2 using the Fujitsu A64FX processor. IEEE\/ACM Trans. Comput. Biol. Bioinf. 20(5), 3139\u20133153 (2023)","journal-title":"IEEE\/ACM Trans. Comput. Biol. Bioinf."},{"key":"3_CR7","doi-asserted-by":"crossref","unstructured":"Lee, J.K., Jamieson, M., Brown, N., Jesus, R.: Test-driving RISC-V vector hardware for HPC. In: ISC, pp. 419\u2013432. Springer, Cham (2023)","DOI":"10.1007\/978-3-031-40843-4_31"},{"key":"3_CR8","doi-asserted-by":"crossref","unstructured":"Miksits, S., Shi, R., Gokhale, M., Wahlgren, J., Schieffer, G., Peng, I.: Multi-level memory-centric profiling on arm processors with arm SPE. In: SC24-W, pp. 996\u20131005. IEEE (2024)","DOI":"10.1109\/SCW63240.2024.00139"},{"key":"3_CR9","doi-asserted-by":"crossref","unstructured":"Noor, M.A., Kent, K., Konno, K., Maier, D.: SIMD support to improve eclipse openj9 performance on the aarch64 platform. In: Proceedings of the 19th ACM International Conference on Computing Frontiers, pp. 49\u201357 (2022)","DOI":"10.1145\/3528416.3530233"},{"key":"3_CR10","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"98","DOI":"10.1007\/978-3-030-57675-2_7","volume-title":"Euro-Par 2020: Parallel Processing","author":"A Poenaru","year":"2020","unstructured":"Poenaru, A., McIntosh-Smith, S.: Evaluating the effectiveness of a vector-length-agnostic instruction set. In: Malawski, M., Rzadca, K. (eds.) Euro-Par 2020. LNCS, vol. 12247, pp. 98\u2013114. Springer, Cham (2020). https:\/\/doi.org\/10.1007\/978-3-030-57675-2_7"},{"key":"3_CR11","doi-asserted-by":"crossref","unstructured":"Rossi, F., Cococcioni, M., Saponara, S.: Llama-2 acceleration using the arm scalable vector extension. In: International Conference on Applications in Electronics Pervading Industry, Environment and Society (2024)","DOI":"10.1007\/978-3-031-84100-2_31"},{"issue":"2","key":"3_CR12","doi-asserted-by":"publisher","first-page":"26","DOI":"10.1109\/MM.2021.3136882","volume":"42","author":"M Sato","year":"2021","unstructured":"Sato, M., Kodama, Y., Tsuji, M., Odajima, T.: Co-design and system for the supercomputer Fugaku. IEEE Micro 42(2), 26\u201334 (2021)","journal-title":"IEEE Micro"},{"key":"3_CR13","doi-asserted-by":"crossref","unstructured":"Sato, M., Tsuji, M.: OpenACC execution models for manycore processor with ARM SVE. In: Proceedings of the HPC Asia 2023 Workshops, pp. 73\u201377 (2023)","DOI":"10.1145\/3581576.3581617"},{"key":"3_CR14","doi-asserted-by":"crossref","unstructured":"Schieffer, G., Wahlgren, J., Ren, J., Faj, J., Peng, I.: Harnessing integrated CPU-GPU system memory for HPC: a first look into grace hopper. In: Proceedings of the 53rd International Conference on Parallel Processing, pp. 199\u2013209 (2024)","DOI":"10.1145\/3673038.3673110"},{"issue":"2","key":"3_CR15","doi-asserted-by":"publisher","first-page":"26","DOI":"10.1109\/MM.2017.35","volume":"37","author":"N Stephens","year":"2017","unstructured":"Stephens, N., et al.: The arm scalable vector extension. IEEE Micro 37(2), 26\u201339 (2017)","journal-title":"IEEE Micro"},{"key":"3_CR16","doi-asserted-by":"crossref","unstructured":"Takahashi, K., Mori, T., Takizawa, H.: Prototype of a batched quantum circuit simulator for the vector engine. In: SC23-W, pp. 1499\u20131505. ACM (2023)","DOI":"10.1145\/3624062.3624226"},{"key":"3_CR17","doi-asserted-by":"crossref","unstructured":"Wei, Y., Deng, L., Sun, S., Li, S., Shen, L.: DGEMM optimization oriented to arm SVE instruction set architecture. In: IEEE ICPADS, pp. 514\u2013521. IEEE (2023)","DOI":"10.1109\/ICPADS56603.2022.00073"},{"issue":"4","key":"3_CR18","doi-asserted-by":"publisher","first-page":"65","DOI":"10.1145\/1498765.1498785","volume":"52","author":"S Williams","year":"2009","unstructured":"Williams, S., Waterman, A., et al.: Roofline: an insightful visual performance model for multicore architectures. Commun. ACM 52(4), 65\u201376 (2009)","journal-title":"Commun. ACM"},{"key":"3_CR19","doi-asserted-by":"crossref","unstructured":"Wu, D., et al.: Autogemm: pushing the limits of irregular matrix multiplication on arm architectures. In: SC24, pp. 1\u201315. IEEE (2024)","DOI":"10.1109\/SC41406.2024.00027"},{"key":"3_CR20","doi-asserted-by":"crossref","unstructured":"Yamada, F., Kawakami, K., Kurihara, K., Matsuda, K., Tabaru, T.: Optimization of NumPy transcendental functions for arm SVE. In: HPC Asia 2023 Workshops (2023)","DOI":"10.1145\/3581576.3581609"},{"issue":"10","key":"3_CR21","doi-asserted-by":"publisher","first-page":"7003","DOI":"10.1007\/s11227-019-02911-9","volume":"75","author":"D Yokoyama","year":"2019","unstructured":"Yokoyama, D., Schulze, B., Borges, F., Mc Evoy, G.: The survey on ARM processors for HPC. J. Supercomput. 75(10), 7003\u20137036 (2019). https:\/\/doi.org\/10.1007\/s11227-019-02911-9","journal-title":"J. Supercomput."}],"container-title":["Lecture Notes in Computer Science","Euro-Par 2025: Parallel Processing"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-031-99857-7_3","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,9,9]],"date-time":"2025-09-09T19:08:49Z","timestamp":1757444929000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-3-031-99857-7_3"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,8,23]]},"ISBN":["9783031998560","9783031998577"],"references-count":21,"URL":"https:\/\/doi.org\/10.1007\/978-3-031-99857-7_3","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,8,23]]},"assertion":[{"value":"23 August 2025","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"The authors have no competing interests to declare that are relevant to the content of this article.","order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Disclosure of Interests"}},{"value":"Euro-Par","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"European Conference on Parallel Processing","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Dresden","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Germany","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2025","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"25 April 2025","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"29 April 2025","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"31","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"europar2025","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/2025.euro-par.org\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}