{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,6,18]],"date-time":"2025-06-18T04:19:34Z","timestamp":1750220374274,"version":"3.41.0"},"publisher-location":"New York, NY, USA","reference-count":53,"publisher":"ACM","license":[{"start":{"date-parts":[[2021,4,7]],"date-time":"2021-04-07T00:00:00Z","timestamp":1617753600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.acm.org\/publications\/policies\/copyright_policy#Background"}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2021,4,16]]},"DOI":"10.1145\/3453933.3454014","type":"proceedings-article","created":{"date-parts":[[2021,4,8]],"date-time":"2021-04-08T05:33:57Z","timestamp":1617860037000},"page":"57-70","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":1,"title":["Automatically exploiting the memory hierarchy of GPUs through just-in-time compilation"],"prefix":"10.1145","author":[{"given":"Michail","family":"Papadimitriou","sequence":"first","affiliation":[{"name":"University of Manchester, UK"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Juan","family":"Fumero","sequence":"additional","affiliation":[{"name":"University of Manchester, UK"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Athanasios","family":"Stratikopoulos","sequence":"additional","affiliation":[{"name":"University of Manchester, UK"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Christos","family":"Kotselidis","sequence":"additional","affiliation":[{"name":"University of Manchester, UK"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2021,4,7]]},"reference":[{"unstructured":"2014. Loop optimizations in Hotspot Server VM Compiler (C2). https:\/\/wiki.openjdk.java.net\/pages\/viewpage.action?pageId=20415918  2014. Loop optimizations in Hotspot Server VM Compiler (C2). https:\/\/wiki.openjdk.java.net\/pages\/viewpage.action?pageId=20415918","key":"e_1_3_2_1_1_1"},{"doi-asserted-by":"publisher","key":"e_1_3_2_1_2_1","DOI":"10.1145\/3183586.3183607"},{"unstructured":"AMD. Accessed in 2020. Aparapi project. https:\/\/aparapi.github.io\/  AMD. Accessed in 2020. Aparapi project. https:\/\/aparapi.github.io\/","key":"e_1_3_2_1_3_1"},{"doi-asserted-by":"publisher","key":"e_1_3_2_1_4_1","DOI":"10.1109\/CGO.2019.8661197"},{"doi-asserted-by":"publisher","key":"e_1_3_2_1_5_1","DOI":"10.1145\/1375527.1375562"},{"doi-asserted-by":"publisher","key":"e_1_3_2_1_6_1","DOI":"10.1016\/B978-0-12-385963-1.00026-5"},{"volume-title":"Compiler Construction (CC)","author":"Benabderrahmane Mohamed-Walid","unstructured":"Mohamed-Walid Benabderrahmane , Louis-No\u00ebl Pouchet , Albert Cohen , and C\\'edric Bastoul. 2010. The Polyhedral Model Is More Widely Applicable Than You Think . In Compiler Construction (CC) . Springer Berlin Heidelberg . Mohamed-Walid Benabderrahmane, Louis-No\u00ebl Pouchet, Albert Cohen, and C\\'edric Bastoul. 2010. The Polyhedral Model Is More Widely Applicable Than You Think. In Compiler Construction (CC). Springer Berlin Heidelberg.","key":"e_1_3_2_1_7_1"},{"key":"e_1_3_2_1_8_1","volume-title":"Technical Report OSU-CISRC-10\/07-TR70.","author":"Bondhugula Uday","year":"2007","unstructured":"Uday Bondhugula , J. Ramanujam , and P. Sadayappan . 2007 . PLuTo: A Practical and Fully Automatic Polyhedral Parallelizer and Locality Optimizer . Technical Report OSU-CISRC-10\/07-TR70. Uday Bondhugula, J. Ramanujam, and P. Sadayappan. 2007. PLuTo: A Practical and Fully Automatic Polyhedral Parallelizer and Locality Optimizer. Technical Report OSU-CISRC-10\/07-TR70."},{"key":"e_1_3_2_1_9_1","volume-title":"Apache Flink: Stream and Batch Processing in a Single Engine","author":"Carbone P.","year":"2015","unstructured":"P. Carbone , Asterios Katsifodimos , Stephan Ewen , V. Markl , Seif Haridi , and Kostas Tzoumas . 2015 . Apache Flink: Stream and Batch Processing in a Single Engine . IEEE Data Eng. Bull . 38 (2015), 28?38. P. Carbone, Asterios Katsifodimos, Stephan Ewen, V. Markl, Seif Haridi, and Kostas Tzoumas. 2015. Apache Flink: Stream and Batch Processing in a Single Engine. IEEE Data Eng. Bull. 38 (2015), 28?38."},{"doi-asserted-by":"publisher","key":"e_1_3_2_1_10_1","DOI":"10.1145\/2287076.2287109"},{"key":"e_1_3_2_1_11_1","volume-title":"TVM: End-to-End Optimization Stack for Deep Learning. ArXiv abs\/1802.04799","author":"Chen Tianqi","year":"2018","unstructured":"Tianqi Chen , Thierry Moreau , Ziheng Jiang , Haichen Shen , Eddie Q. Yan , Leyuan Wang , Yuwei Hu , Luis Ceze , Carlos Guestrin , and Arvind Krishnamurthy . 2018 . TVM: End-to-End Optimization Stack for Deep Learning. ArXiv abs\/1802.04799 (2018). Tianqi Chen, Thierry Moreau, Ziheng Jiang, Haichen Shen, Eddie Q. Yan, Leyuan Wang, Yuwei Hu, Luis Ceze, Carlos Guestrin, and Arvind Krishnamurthy. 2018. TVM: End-to-End Optimization Stack for Deep Learning. ArXiv abs\/1802.04799 (2018)."},{"doi-asserted-by":"publisher","key":"e_1_3_2_1_12_1","DOI":"10.1145\/3237009.3237016"},{"doi-asserted-by":"publisher","key":"e_1_3_2_1_13_1","DOI":"10.1145\/202529.202534"},{"doi-asserted-by":"publisher","key":"e_1_3_2_1_14_1","DOI":"10.1109\/CGO.2019.8661187"},{"doi-asserted-by":"publisher","key":"e_1_3_2_1_15_1","DOI":"10.1145\/1327452.1327492"},{"key":"e_1_3_2_1_16_1","volume":"201","author":"Di P.","unstructured":"P. Di , D. Ye , Y. Su , Y. Sui , and J. Xue. 201 2. Automatic Parallelization of Tiled Loop Nests with Enhanced Fine-Grained Parallelism on GPUs. In 41st International Conference on Parallel Processing (ICPP). P. Di, D. Ye, Y. Su, Y. Sui, and J. Xue. 2012. Automatic Parallelization of Tiled Loop Nests with Enhanced Fine-Grained Parallelism on GPUs. In 41st International Conference on Parallel Processing (ICPP).","journal-title":"J. Xue."},{"doi-asserted-by":"publisher","key":"e_1_3_2_1_17_1","DOI":"10.1145\/2254064.2254066"},{"key":"e_1_3_2_1_18_1","volume-title":"Graal IR: An Extensible Declarative Intermediate Representation. In Asia-Pacific Programming Languages and Compilers (APPLC).","author":"Duboscq G.","year":"2013","unstructured":"G. Duboscq , L. Stadler , T. W\u00fcrthinger , D. Simon , C. Wimmer , and H. M\u00f6ssenb\u00f6ck . 2013 . Graal IR: An Extensible Declarative Intermediate Representation. In Asia-Pacific Programming Languages and Compilers (APPLC). G. Duboscq, L. Stadler, T. W\u00fcrthinger, D. Simon, C. Wimmer, and H. M\u00f6ssenb\u00f6ck. 2013. Graal IR: An Extensible Declarative Intermediate Representation. In Asia-Pacific Programming Languages and Compilers (APPLC)."},{"doi-asserted-by":"publisher","key":"e_1_3_2_1_19_1","DOI":"10.1155\/2014\/623841"},{"doi-asserted-by":"publisher","key":"e_1_3_2_1_20_1","DOI":"10.1145\/3281287.3281292"},{"doi-asserted-by":"publisher","key":"e_1_3_2_1_21_1","DOI":"10.1145\/3313808.3313819"},{"doi-asserted-by":"publisher","key":"e_1_3_2_1_22_1","DOI":"10.1145\/3050748.3050761"},{"doi-asserted-by":"publisher","key":"e_1_3_2_1_23_1","DOI":"10.1145\/2807426.2807428"},{"doi-asserted-by":"publisher","key":"e_1_3_2_1_24_1","DOI":"10.1145\/2458523.2458526"},{"unstructured":"Bastian Hagedorn Johannes Lenfers Thomas Koehler Sergei Gorlatch and Michel Steuwer. 2020. A Language for Describing Optimization Strategies. arxiv:2002.02268 [cs.PL]  Bastian Hagedorn Johannes Lenfers Thomas Koehler Sergei Gorlatch and Michel Steuwer. 2020. A Language for Describing Optimization Strategies. arxiv:2002.02268 [cs.PL]","key":"e_1_3_2_1_25_1"},{"doi-asserted-by":"publisher","key":"e_1_3_2_1_26_1","DOI":"10.1145\/3168824"},{"volume-title":"International Conference on Parallel Architecture and Compilation (PACT).","author":"Ishizaki K.","unstructured":"K. Ishizaki , A. Hayashi , G. Koblents , and V. Sarkar . 2015. Compiling and Optimizing Java 8 Programs for GPU Execution . In International Conference on Parallel Architecture and Compilation (PACT). K. Ishizaki, A. Hayashi, G. Koblents, and V. Sarkar. 2015. Compiling and Optimizing Java 8 Programs for GPU Execution. In International Conference on Parallel Architecture and Compilation (PACT).","key":"e_1_3_2_1_27_1"},{"volume-title":"Proceedings of the IEEE\/ACM International Symposium on Code Generation and Optimization (CGO).","author":"Kim Jinsung","unstructured":"Jinsung Kim , Aravind Sukumaran-Rajam , Vineeth Thumma , Sriram Krishnamoorthy , Ajay Panyala , Louis-No\u00ebl Pouchet , Atanas Rountev , and P. Sadayappan . 2019. A Code Generator for High-Performance Tensor Contractions on GPUs . In Proceedings of the IEEE\/ACM International Symposium on Code Generation and Optimization (CGO). Jinsung Kim, Aravind Sukumaran-Rajam, Vineeth Thumma, Sriram Krishnamoorthy, Ajay Panyala, Louis-No\u00ebl Pouchet, Atanas Rountev, and P. Sadayappan. 2019. A Code Generator for High-Performance Tensor Contractions on GPUs. In Proceedings of the IEEE\/ACM International Symposium on Code Generation and Optimization (CGO).","key":"e_1_3_2_1_28_1"},{"doi-asserted-by":"publisher","key":"e_1_3_2_1_29_1","DOI":"10.1145\/3192366.3192379"},{"doi-asserted-by":"crossref","unstructured":"Athanasios Konstantinidis Paul H. J. Kelly J. Ramanujam and P. Sadayappan. 2014. Parametric GPU Code Generation for Affine Loop Programs. In Languages and Compilers for Parallel Computing (LCPC).  Athanasios Konstantinidis Paul H. J. Kelly J. Ramanujam and P. Sadayappan. 2014. Parametric GPU Code Generation for Affine Loop Programs. In Languages and Compilers for Parallel Computing (LCPC).","key":"e_1_3_2_1_30_1","DOI":"10.1007\/978-3-319-09967-5_8"},{"doi-asserted-by":"publisher","key":"e_1_3_2_1_31_1","DOI":"10.1145\/3050748.3050764"},{"key":"e_1_3_2_1_32_1","series-title":"Lecture Notes in Computer Science","volume-title":"Algorithms for Memory Hierarchies - Advanced Lectures","author":"Kowarschik Markus","unstructured":"Markus Kowarschik and Christian Wei\u00df . 2003. An Overview of Cache Optimization Techniques and Cache-Aware Numerical Algorithms . In Algorithms for Memory Hierarchies - Advanced Lectures , volume 2625 of Lecture Notes in Computer Science . Springer . Markus Kowarschik and Christian Wei\u00df. 2003. An Overview of Cache Optimization Techniques and Cache-Aware Numerical Algorithms. In Algorithms for Memory Hierarchies - Advanced Lectures, volume 2625 of Lecture Notes in Computer Science. Springer."},{"doi-asserted-by":"publisher","key":"e_1_3_2_1_33_1","DOI":"10.1145\/3237009.3237013"},{"doi-asserted-by":"publisher","key":"e_1_3_2_1_34_1","DOI":"10.1109\/HOTCHIPS.2009.7478342"},{"doi-asserted-by":"publisher","key":"e_1_3_2_1_35_1","DOI":"10.1109\/FCCM.2019.00051"},{"doi-asserted-by":"publisher","key":"e_1_3_2_1_36_1","DOI":"10.22152\/programming-journal.org\/2021\/5\/8"},{"doi-asserted-by":"publisher","key":"e_1_3_2_1_37_1","DOI":"10.1145\/2499370.2462176"},{"doi-asserted-by":"publisher","key":"e_1_3_2_1_38_1","DOI":"10.1145\/2884045.2884046"},{"key":"e_1_3_2_1_39_1","volume-title":"Mary Hall, Chun Chen, and Jacqueline Chame.","author":"Rudy Gabe","year":"2011","unstructured":"Gabe Rudy , Malik Murtaza Khan , Mary Hall, Chun Chen, and Jacqueline Chame. 2011 . A Programming Language Interface to Describe Transformations and Code Generation. In Languages and Compilers for Parallel Computing (LCPC) . Gabe Rudy, Malik Murtaza Khan, Mary Hall, Chun Chen, and Jacqueline Chame. 2011. A Programming Language Interface to Describe Transformations and Code Generation. In Languages and Compilers for Parallel Computing (LCPC)."},{"doi-asserted-by":"publisher","key":"e_1_3_2_1_40_1","DOI":"10.1109\/HPEC.2015.7322440"},{"doi-asserted-by":"publisher","key":"e_1_3_2_1_41_1","DOI":"10.1007\/s10766-018-0597-3"},{"doi-asserted-by":"publisher","key":"e_1_3_2_1_42_1","DOI":"10.1145\/2764907"},{"doi-asserted-by":"publisher","key":"e_1_3_2_1_43_1","DOI":"10.1145\/2544137.2544157"},{"doi-asserted-by":"publisher","key":"e_1_3_2_1_44_1","DOI":"10.1109\/IPDPS.2011.269"},{"doi-asserted-by":"publisher","key":"e_1_3_2_1_45_1","DOI":"10.1145\/2968455.2968521"},{"doi-asserted-by":"publisher","key":"e_1_3_2_1_46_1","DOI":"10.1109\/CGO.2017.7863730"},{"doi-asserted-by":"publisher","key":"e_1_3_2_1_47_1","DOI":"10.1145\/2584665"},{"doi-asserted-by":"publisher","key":"e_1_3_2_1_48_1","DOI":"10.1002\/cpe.3648"},{"doi-asserted-by":"publisher","key":"e_1_3_2_1_49_1","DOI":"10.1145\/2400682.2400713"},{"doi-asserted-by":"publisher","key":"e_1_3_2_1_50_1","DOI":"10.1145\/2400682.2400689"},{"doi-asserted-by":"publisher","key":"e_1_3_2_1_51_1","DOI":"10.1109\/ISPASS.2010.5452013"},{"doi-asserted-by":"publisher","key":"e_1_3_2_1_52_1","DOI":"10.1145\/1806596.1806606"},{"key":"e_1_3_2_1_53_1","volume-title":"Proceedings of the 2nd USENIX Conference on Hot Topics in Cloud Computing","author":"Zaharia Matei","year":"2010","unstructured":"Matei Zaharia , Mosharaf Chowdhury , Michael J. Franklin , Scott Shenker , and Ion Stoica . 2010 . Spark: Cluster Computing with Working Sets . In Proceedings of the 2nd USENIX Conference on Hot Topics in Cloud Computing ( Boston, MA) (HotCloud'10). USENIX Association, USA, 10. Matei Zaharia, Mosharaf Chowdhury, Michael J. Franklin, Scott Shenker, and Ion Stoica. 2010. Spark: Cluster Computing with Working Sets. In Proceedings of the 2nd USENIX Conference on Hot Topics in Cloud Computing (Boston, MA) (HotCloud'10). USENIX Association, USA, 10."}],"event":{"sponsor":["SIGPLAN ACM Special Interest Group on Programming Languages","SIGOPS ACM Special Interest Group on Operating Systems"],"acronym":"VEE '21","name":"VEE '21: 17th ACM SIGPLAN\/SIGOPS International Conference on Virtual Execution Environments","location":"Virtual USA"},"container-title":["Proceedings of the 17th ACM SIGPLAN\/SIGOPS International Conference on Virtual Execution Environments"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3453933.3454014","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3453933.3454014","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,17]],"date-time":"2025-06-17T20:17:42Z","timestamp":1750191462000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3453933.3454014"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2021,4,7]]},"references-count":53,"alternative-id":["10.1145\/3453933.3454014","10.1145\/3453933"],"URL":"https:\/\/doi.org\/10.1145\/3453933.3454014","relation":{},"subject":[],"published":{"date-parts":[[2021,4,7]]},"assertion":[{"value":"2021-04-07","order":2,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}