{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,6,19]],"date-time":"2025-06-19T05:06:38Z","timestamp":1750309598005,"version":"3.41.0"},"publisher-location":"New York, NY, USA","reference-count":19,"publisher":"ACM","license":[{"start":{"date-parts":[[2025,3,1]],"date-time":"2025-03-01T00:00:00Z","timestamp":1740787200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/"}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2025,3]]},"DOI":"10.1145\/3725798.3725802","type":"proceedings-article","created":{"date-parts":[[2025,5,13]],"date-time":"2025-05-13T10:40:50Z","timestamp":1747132850000},"page":"21-27","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":0,"title":["ACTA: Automatic Configuration of the Tensor Memory Accelerator for High-End GPUs"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-2243-0744","authenticated-orcid":false,"given":"Nicol\u00e1s","family":"Meseguer","sequence":"first","affiliation":[{"name":"Universidad de Murcia, Murcia, Spain"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3532-6521","authenticated-orcid":false,"given":"Yifan","family":"Sun","sequence":"additional","affiliation":[{"name":"William &amp; Mary, Williamsburg, Virginia, USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-5305-4307","authenticated-orcid":false,"given":"Michael","family":"Pellauer","sequence":"additional","affiliation":[{"name":"NVIDIA, Boston, USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3550-720X","authenticated-orcid":false,"given":"Jos\u00e9 L.","family":"Abell\u00e1n","sequence":"additional","affiliation":[{"name":"Universidad de Murcia, Murcia, Spain"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-0935-4078","authenticated-orcid":false,"given":"Manuel E.","family":"Acacio","sequence":"additional","affiliation":[{"name":"Universidad de Murcia, Murcia, Spain"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2025,5,13]]},"reference":[{"key":"e_1_3_3_2_2_2","doi-asserted-by":"publisher","DOI":"10.1145\/2555243.2555258"},{"key":"e_1_3_3_2_3_2","doi-asserted-by":"publisher","unstructured":"Yu-Hsin Chen Tushar Krishna Joel\u00a0S. Emer and Vivienne Sze. 2017. Eyeriss: An Energy-Efficient Reconfigurable Accelerator for Deep Convolutional Neural Networks. IEEE Journal of Solid-State Circuits 52 1 (2017) 127\u2013138. 10.1109\/JSSC.2016.2616357","DOI":"10.1109\/JSSC.2016.2616357"},{"key":"e_1_3_3_2_4_2","doi-asserted-by":"publisher","unstructured":"Jack Choquette. 2023. NVIDIA Hopper H100 GPU: Scaling Performance. IEEE Micro 43 3 (May 2023) 9\u201317. 10.1109\/MM.2023.3256796","DOI":"10.1109\/MM.2023.3256796"},{"key":"e_1_3_3_2_5_2","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA57654.2024.00086"},{"key":"e_1_3_3_2_6_2","doi-asserted-by":"publisher","DOI":"10.1109\/HPCA.2018.00040"},{"key":"e_1_3_3_2_7_2","doi-asserted-by":"publisher","unstructured":"Hajar Falahati Masoud Peyro Hossein Amini Mehran Taghian Mohammad Sadrosadati Pejman Lotfi-Kamran and Hamid Sarbazi-Azad. 2021. Data-Aware Compression of Neural Networks. IEEE Computer Architecture Letters 20 2 (2021) 94\u201397. 10.1109\/LCA.2021.3096191","DOI":"10.1109\/LCA.2021.3096191"},{"key":"e_1_3_3_2_8_2","doi-asserted-by":"publisher","unstructured":"Pieter Hijma Stijn Heldens Alessio Sclocco Ben van Werkhoven and Henri\u00a0E. Bal. 2023. Optimization Techniques for GPU Programming. ACM Comput. Surv. 55 11 Article 239 (March 2023) 81\u00a0pages. 10.1145\/3570638","DOI":"10.1145\/3570638"},{"key":"e_1_3_3_2_9_2","unstructured":"Intel. 2024. Why Data Center GPUs Are Essential to Innovation. https:\/\/www.intel.com\/content\/www\/us\/en\/products\/docs\/discrete-gpus\/data-center-gpu\/what-is-data-center-gpu.html. [Online; accessed 13-December-2024]."},{"key":"e_1_3_3_2_10_2","doi-asserted-by":"publisher","unstructured":"Shoaib Kamil Alvin Cheung Shachar Itzhaky and Armando Solar-Lezama. 2016. Verified lifting of stencil computations. SIGPLAN Not. 51 6 (June 2016) 711\u2013726. 10.1145\/2980983.2908117","DOI":"10.1145\/2980983.2908117"},{"key":"e_1_3_3_2_11_2","doi-asserted-by":"publisher","DOI":"10.1145\/2628071.2628107"},{"key":"e_1_3_3_2_12_2","doi-asserted-by":"publisher","unstructured":"John D.\u00a0C. Little. 2011. Little\u2019s Law as Viewed on Its 50th Anniversary. Operations Research 59 3 (May 2011) 536\u2013549. 10.1287\/opre.1110.0940","DOI":"10.1287\/opre.1110.0940"},{"key":"e_1_3_3_2_13_2","unstructured":"Weile Luo Ruibo Fan Zeyu Li Dayou Du Qiang Wang and Xiaowen Chu. 2024. Benchmarking and Dissecting the Nvidia Hopper GPU Architecture. arxiv:https:\/\/arXiv.org\/abs\/2402.13499\u00a0[cs.AR] https:\/\/arxiv.org\/abs\/2402.13499"},{"key":"e_1_3_3_2_14_2","doi-asserted-by":"publisher","DOI":"10.1109\/IMCSIT.2010.5680039"},{"key":"e_1_3_3_2_15_2","doi-asserted-by":"publisher","DOI":"10.1145\/3613424.3623782"},{"key":"e_1_3_3_2_16_2","doi-asserted-by":"publisher","unstructured":"Negin Nematollahi Mohammad Sadrosadati Hajar Falahati Marzieh Barkhordar and Hamid Sarbazi-Azad. 2018. Neda: Supporting Direct Inter-Core Neighbor Data Exchange in GPUs. IEEE Computer Architecture Letters PP (10 2018) 1\u20131. 10.1109\/LCA.2018.2873679","DOI":"10.1109\/LCA.2018.2873679"},{"key":"e_1_3_3_2_17_2","unstructured":"NVIDA. 2024. NVIDIA Tensor Cores. Unprecedented Acceleration for Generative AI. https:\/\/www.nvidia.com\/en-us\/data-center\/tensor-cores\/. [Online; accessed 13-December-2024]."},{"key":"e_1_3_3_2_18_2","doi-asserted-by":"publisher","DOI":"10.1145\/3297858.3304025"},{"key":"e_1_3_3_2_19_2","doi-asserted-by":"publisher","unstructured":"M.\u00a0W. Riley J.\u00a0D. Warnock and D.\u00a0F. Wendel. 2007. Cell Broadband Engine processor: Design and implementation. IBM Journal of Research and Development 51 5 (2007) 545\u2013557. 10.1147\/rd.515.0545","DOI":"10.1147\/rd.515.0545"},{"key":"e_1_3_3_2_20_2","doi-asserted-by":"publisher","DOI":"10.1145\/3307650.3322230"}],"event":{"name":"GPGPU 2025: 17th Workshop on General Purpose Processing Using GPU","acronym":"GPGPU 2025","location":"Las Vegas NV USA"},"container-title":["Proceedings of the 17th Workshop on General Purpose Processing Using GPU"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3725798.3725802","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3725798.3725802","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,19]],"date-time":"2025-06-19T01:57:04Z","timestamp":1750298224000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3725798.3725802"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,3]]},"references-count":19,"alternative-id":["10.1145\/3725798.3725802","10.1145\/3725798"],"URL":"https:\/\/doi.org\/10.1145\/3725798.3725802","relation":{},"subject":[],"published":{"date-parts":[[2025,3]]},"assertion":[{"value":"2025-05-13","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}