{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,2,21]],"date-time":"2025-02-21T07:19:04Z","timestamp":1740122344801,"version":"3.37.3"},"reference-count":30,"publisher":"Springer Science and Business Media LLC","issue":"3","license":[{"start":{"date-parts":[[2020,4,22]],"date-time":"2020-04-22T00:00:00Z","timestamp":1587513600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2020,4,22]],"date-time":"2020-04-22T00:00:00Z","timestamp":1587513600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"}],"funder":[{"DOI":"10.13039\/501100003725","name":"National Research Foundation of Korea","doi-asserted-by":"publisher","award":["2016M3C4A7952587","21A20151113068","2018R1C1B5085640"],"award-info":[{"award-number":["2016M3C4A7952587","21A20151113068","2018R1C1B5085640"]}],"id":[{"id":"10.13039\/501100003725","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100003725","name":"National Research Foundation of Korea","doi-asserted-by":"crossref","award":["21A20151113068","2017R1A2B4004513"],"award-info":[{"award-number":["21A20151113068","2017R1A2B4004513"]}],"id":[{"id":"10.13039\/501100003725","id-type":"DOI","asserted-by":"crossref"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Cluster Comput"],"published-print":{"date-parts":[[2020,9]]},"DOI":"10.1007\/s10586-020-03105-2","type":"journal-article","created":{"date-parts":[[2020,4,22]],"date-time":"2020-04-22T15:04:07Z","timestamp":1587567847000},"page":"2261-2272","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":1,"title":["Towards predicting GPGPU performance for concurrent workloads in Multi-GPGPU environment"],"prefix":"10.1007","volume":"23","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-2295-3385","authenticated-orcid":false,"given":"Sunggon","family":"Kim","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Dongwhan","family":"Kim","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-4512-0121","authenticated-orcid":false,"given":"Yongseok","family":"Son","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Hyeonsang","family":"Eom","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2020,4,22]]},"reference":[{"key":"3105_CR1","doi-asserted-by":"crossref","unstructured":"Adriaens, J.T., Compton, K., Kim, N.S., Schulte, M.J.: The case for gpgpu spatial multitasking. In: 2012 IEEE 18th International Symposium on High Performance Computer Architecture (HPCA), pp. 1\u201312. IEEE (2012)","DOI":"10.1109\/HPCA.2012.6168946"},{"key":"3105_CR2","doi-asserted-by":"crossref","unstructured":"Becchi, M., Sajjapongse, K., Graves, I., Procter, A., Ravi, V., Chakradhar, S.: A virtual memory based runtime to support multi-tenancy in clusters with gpus. In: Proceedings of the 21st International Symposium on High-Performance Parallel and Distributed Computing, pp. 97\u2013108. ACM (2012)","DOI":"10.1145\/2287076.2287090"},{"key":"3105_CR3","doi-asserted-by":"crossref","unstructured":"Belviranli, M.E., Khorasani, F., Bhuyan, L.N., Gupta, R.: Cumas: data transfer aware multi-application scheduling for shared gpus. In: Proceedings of the 2016 International Conference on Supercomputing, p. 31. ACM (2016)","DOI":"10.1145\/2925426.2926271"},{"key":"3105_CR4","volume-title":"Gpu Performance Analysis and Optimisation","author":"T Bradley","year":"2012","unstructured":"Bradley, T.: Gpu Performance Analysis and Optimisation. NVIDIA Corporation, Santa Clara (2012)"},{"key":"3105_CR5","unstructured":"Che, S., Boyer, M., Meng, J., Tarjan, D., Sheaffer, J.W., Lee, S.H., Skadron, K.: Rodinia: A benchmark suite for heterogeneous computing. In: IEEE International Symposium on Workload Characterization, 2009. IISWC 2009, pp. 44\u201354. IEEE (2009)"},{"issue":"5","key":"3105_CR6","doi-asserted-by":"publisher","first-page":"1525","DOI":"10.1007\/s00500-017-2887-x","volume":"22","author":"S Cuomo","year":"2018","unstructured":"Cuomo, S., Galletti, A., Marcellino, L., Navarra, G., Toraldo, G.: On gpu-cuda as preprocessing of fuzzy-rough data reduction by means of singular value decomposition. Soft Comput. 22(5), 1525\u20131532 (2018)","journal-title":"Soft Comput."},{"issue":"1","key":"3105_CR7","doi-asserted-by":"publisher","first-page":"46","DOI":"10.1109\/99.660313","volume":"5","author":"L Dagum","year":"1998","unstructured":"Dagum, L., Menon, R.: Openmp: an industry standard api for shared-memory programming. IEEE Comput. Sci. Eng. 5(1), 46\u201355 (1998)","journal-title":"IEEE Comput. Sci. Eng."},{"key":"3105_CR8","doi-asserted-by":"crossref","unstructured":"Dimitrov, M., Mantor, M., Zhou, H.: Understanding software approaches for gpgpu reliability. In: Proceedings of 2nd Workshop on General Purpose Processing on Graphics Processing Units, pp. 94\u2013104. ACM (2009)","DOI":"10.1145\/1513895.1513907"},{"key":"3105_CR9","doi-asserted-by":"crossref","unstructured":"Elliott, G.A., Ward, B.C., Anderson, J.H.: Gpusync: a framework for real-time gpu management. In: 2013 IEEE 34th Real-Time Systems Symposium, pp. 33\u201344. IEEE (2013)","DOI":"10.1109\/RTSS.2013.12"},{"key":"3105_CR10","doi-asserted-by":"crossref","unstructured":"Gharaibeh, A., Ripeanu, M.: Size matters: Space\/time tradeoffs to improve gpgpu applications performance. In: 2010 International Conference for High Performance Computing, Networking, Storage and Analysis (SC), pp. 1\u201312. IEEE (2010)","DOI":"10.1109\/SC.2010.51"},{"key":"3105_CR11","doi-asserted-by":"crossref","unstructured":"Giunta, G., Montella, R., Agrillo, G., Coviello, G.: A gpgpu transparent virtualization component for high performance computing clouds. In: European Conference on Parallel Processing, pp. 379\u2013391. Springer (2010)","DOI":"10.1007\/978-3-642-15277-1_37"},{"issue":"1","key":"3105_CR12","doi-asserted-by":"publisher","first-page":"78","DOI":"10.1109\/TPDS.2010.62","volume":"22","author":"TD Han","year":"2011","unstructured":"Han, T.D., Abdelrahman, T.S.: hicuda: high-level gpgpu programming. IEEE Trans. Parallel Distrib. Syst. 22(1), 78\u201390 (2011)","journal-title":"IEEE Trans. Parallel Distrib. Syst."},{"key":"3105_CR13","unstructured":"Huang, S., Xiao, S., Feng, W.c.: On the energy efficiency of graphics processing units for scientific computing. In: IEEE International Symposium on Parallel & Distributed Processing, 2009. IPDPS 2009, pp. 1\u20138. IEEE (2009)"},{"key":"3105_CR14","doi-asserted-by":"crossref","unstructured":"Jablin, T.B., Jablin, J.A., Prabhu, P., Liu, F., August, D.I.: Dynamically managed data for cpu-gpu architectures. In: Proceedings of the Tenth International Symposium on Code Generation and Optimization, pp. 165\u2013174. ACM (2012)","DOI":"10.1145\/2259016.2259038"},{"key":"3105_CR15","unstructured":"Landaverde, R., Zhang, T., Coskun, A.K., Herbordt, M.: An investigation of unified memory access performance in cuda. In: High Performance Extreme Computing Conference (HPEC), 2014 IEEE, pp. 1\u20136. IEEE (2014)"},{"key":"3105_CR16","doi-asserted-by":"crossref","unstructured":"Lee, S.Y., Wu, C.J.: Performance characterization, prediction, and optimization for heterogeneous systems with multi-level memory interference. In: 2017 IEEE International Symposium on Workload Characterization (IISWC), pp. 43\u201353. IEEE (2017)","DOI":"10.1109\/IISWC.2017.8167755"},{"issue":"18","key":"3105_CR17","first-page":"8","volume":"120","author":"C Nvidia","year":"2011","unstructured":"Nvidia, C.: Nvidia cuda c programming guide. Nvidia Corp. 120(18), 8 (2011)","journal-title":"Nvidia Corp."},{"issue":"5","key":"3105_CR18","doi-asserted-by":"publisher","first-page":"879","DOI":"10.1109\/JPROC.2008.917757","volume":"96","author":"JD Owens","year":"2008","unstructured":"Owens, J.D., Houston, M., Luebke, D., Green, S., Stone, J.E., Phillips, J.C.: Gpu computing. Proc. IEEE 96(5), 879\u2013899 (2008)","journal-title":"Proc. IEEE"},{"key":"3105_CR19","doi-asserted-by":"crossref","unstructured":"Pai, S., Thazhuthaveetil, M.J., Govindarajan, R.: Improving gpgpu concurrency with elastic kernels. In: ACM SIGPLAN Notices, vol.\u00a048, pp. 407\u2013418. ACM (2013)","DOI":"10.1145\/2499368.2451160"},{"key":"3105_CR20","doi-asserted-by":"crossref","unstructured":"Sajjapongse, K., Wang, X., Becchi, M.: A preemption-based runtime to efficiently schedule multi-process applications on heterogeneous clusters with gpus. In: Proceedings of the 22nd International Symposium on High-Performance Parallel and Distributed Computing, pp. 179\u2013190. ACM (2013)","DOI":"10.1145\/2462902.2462911"},{"key":"3105_CR21","doi-asserted-by":"crossref","unstructured":"Spafford, K., Meredith, J., Vetter, J., Chen, J., Grout, R., Sankaran, R.: Accelerating s3d: a gpgpu case study. In: European Conference on Parallel Processing, pp. 122\u2013131. Springer (2009)","DOI":"10.1007\/978-3-642-14122-5_16"},{"key":"3105_CR22","doi-asserted-by":"crossref","unstructured":"Spafford, K., Meredith, J.S., Vetter, J.S.: Quantifying numa and contention effects in multi-gpu systems. In: Proceedings of the Fourth Workshop on General Purpose Processing on Graphics Processing Units, p.\u00a011. ACM (2011)","DOI":"10.1145\/1964179.1964194"},{"issue":"3","key":"3105_CR23","doi-asserted-by":"publisher","first-page":"66","DOI":"10.1109\/MCSE.2010.69","volume":"12","author":"JE Stone","year":"2010","unstructured":"Stone, J.E., Gohara, D., Shi, G.: Opencl: a parallel programming standard for heterogeneous computing systems. Comput. Sci. Eng. 12(3), 66\u201373 (2010)","journal-title":"Comput. Sci. Eng."},{"key":"3105_CR24","doi-asserted-by":"crossref","unstructured":"Tallent, N.R., Gawande, N.A., Siegel, C., Vishnu, A., Hoisie, A.: Evaluating on-node gpu interconnects for deep learning workloads. In: International Workshop on Performance Modeling, Benchmarking and Simulation of High Performance Computer Systems, pp. 3\u201321. Springer (2017)","DOI":"10.1007\/978-3-319-72971-8_1"},{"key":"3105_CR25","doi-asserted-by":"crossref","unstructured":"Tanasic, I., Gelado, I., Cabezas, J., Ramirez, A., Navarro, N., Valero, M.: Enabling preemptive multiprogramming on gpus. In: 2014 ACM\/IEEE 41st International Symposium on Computer Architecture (ISCA), pp. 193\u2013204. IEEE (2014)","DOI":"10.1109\/ISCA.2014.6853208"},{"issue":"2","key":"3105_CR26","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/2459316.2459320","volume":"10","author":"C Wang","year":"2013","unstructured":"Wang, C., Li, X., Zhang, J., Zhou, X., Nie, X.: Mp-tomasulo: a dependency-aware automatic parallel execution engine for sequential programs. ACM Trans. Architect. Code Optim. (TACO) 10(2), 1\u201326 (2013)","journal-title":"ACM Trans. Architect. Code Optim. (TACO)"},{"issue":"1","key":"3105_CR27","doi-asserted-by":"publisher","first-page":"533","DOI":"10.1145\/2637364.2592002","volume":"42","author":"K Wang","year":"2014","unstructured":"Wang, K., Ding, X., Lee, R., Kato, S., Zhang, X.: Gdm: device memory management for gpgpu computing. ACM SIGMETRICS Perform. Eval. Rev. 42(1), 533\u2013545 (2014)","journal-title":"ACM SIGMETRICS Perform. Eval. Rev."},{"key":"3105_CR28","doi-asserted-by":"crossref","unstructured":"Wang, T., Oral, S., Wang, Y., Settlemyer, B., Atchley, S., Yu, W.: Burstmem: a high-performance burst buffer system for scientific applications. In: 2014 IEEE International Conference on Big Data (Big Data), pp. 71\u201379. IEEE (2014)","DOI":"10.1109\/BigData.2014.7004215"},{"key":"3105_CR29","unstructured":"Wende, F., Steinke, T., Cordes, F.: Multi-threaded kernel offloading to gpgpu using hyper-q on kepler architecture. Zuse Institute Berlin Report, pp. 1\u201317 (2014)"},{"key":"3105_CR30","doi-asserted-by":"crossref","unstructured":"Zhou, X., Skjellum, A., Curry, M.L.: Poster: evaluating asynchrony in gibraltar raid. In: 2012 SC Companion: High-Performance Computing, Networking, Storage and Analysis (SCC), pp. 1498\u20131498. IEEE (2012)","DOI":"10.1109\/SC.Companion.2012.285"}],"container-title":["Cluster Computing"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10586-020-03105-2.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s10586-020-03105-2\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10586-020-03105-2.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2021,4,22]],"date-time":"2021-04-22T00:19:11Z","timestamp":1619050751000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s10586-020-03105-2"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2020,4,22]]},"references-count":30,"journal-issue":{"issue":"3","published-print":{"date-parts":[[2020,9]]}},"alternative-id":["3105"],"URL":"https:\/\/doi.org\/10.1007\/s10586-020-03105-2","relation":{},"ISSN":["1386-7857","1573-7543"],"issn-type":[{"type":"print","value":"1386-7857"},{"type":"electronic","value":"1573-7543"}],"subject":[],"published":{"date-parts":[[2020,4,22]]},"assertion":[{"value":"29 November 2019","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"28 January 2020","order":2,"name":"revised","label":"Revised","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"2 April 2020","order":3,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"22 April 2020","order":4,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}