{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,21]],"date-time":"2026-05-21T11:42:39Z","timestamp":1779363759158,"version":"3.53.0"},"publisher-location":"Cham","reference-count":10,"publisher":"Springer International Publishing","isbn-type":[{"value":"9783030618636","type":"print"},{"value":"9783030618643","type":"electronic"}],"license":[{"start":{"date-parts":[[2020,1,1]],"date-time":"2020-01-01T00:00:00Z","timestamp":1577836800000},"content-version":"tdm","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2020,1,1]],"date-time":"2020-01-01T00:00:00Z","timestamp":1577836800000},"content-version":"vor","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2020]]},"DOI":"10.1007\/978-3-030-61864-3_35","type":"book-chapter","created":{"date-parts":[[2020,10,17]],"date-time":"2020-10-17T03:32:49Z","timestamp":1602905569000},"page":"411-418","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":6,"title":["Efficient Non-fused Winograd on GPUs"],"prefix":"10.1007","author":[{"given":"Hui","family":"Wei","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Enjie","family":"Liu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Youbing","family":"Zhao","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Hongqing","family":"Yu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2020,10,18]]},"reference":[{"key":"35_CR1","doi-asserted-by":"crossref","unstructured":"Lavin, A., Gray, S.: Fast algorithms for convolutional neural networks. In: Proceedings of the CVPR 2016, pp. 4013\u20134021 (2016)","DOI":"10.1109\/CVPR.2016.435"},{"key":"35_CR2","doi-asserted-by":"crossref","unstructured":"Xygkis, A., Soudris, D., Papadopoulos, L., Yous, S., Moloney, D.: Efficient winograd-based convolution kernel implementation on edge devices. In: 55th DAC, pp. 1\u20136 (2018)","DOI":"10.1145\/3195970.3196041"},{"key":"35_CR3","doi-asserted-by":"publisher","first-page":"70461","DOI":"10.1109\/ACCESS.2019.2918851","volume":"7","author":"M Jord\u00e0","year":"2019","unstructured":"Jord\u00e0, M., Valero-Lara, P., Pe\u00f1a, A.J.: Performance evaluation of cuDNN convolution algorithms on NVIDIA Volta GPUs. IEEE Access 7, 70461\u201370473 (2019)","journal-title":"IEEE Access"},{"key":"35_CR4","doi-asserted-by":"crossref","unstructured":"Xiao, Q., Liang, Y., Lu, L., Yan, S., Tai, Y.W.: Exploring heterogeneous algorithms for accelerating deep convolutional neural networks on FPGAs. In: Proceedings of the 54th Annual Design Automation Conference, p. 62. ACM (2017)","DOI":"10.1145\/3061639.3062244"},{"key":"35_CR5","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"21","DOI":"10.1007\/978-3-319-41321-1_2","volume-title":"High Performance Computing","author":"A Abdelfattah","year":"2016","unstructured":"Abdelfattah, A., Haidar, A., Tomov, S., Dongarra, J.: Performance, design, and autotuning of batched GEMM for GPUs. In: Kunkel, J.M., Balaji, P., Dongarra, J. (eds.) ISC High Performance 2016. LNCS, vol. 9697, pp. 21\u201338. Springer, Cham (2016). \nhttps:\/\/doi.org\/10.1007\/978-3-319-41321-1_2"},{"key":"35_CR6","doi-asserted-by":"crossref","unstructured":"Tan, G., Li, L., Triechle, S., Phillips, E., Bao, Y., Sun, N.: Fast implementation of DGEMM on Fermi GPU. In: HiPC, Networking, Storage and Analysis, pp. 1\u201311 (2011)","DOI":"10.1145\/2063384.2063431"},{"issue":"7","key":"35_CR7","first-page":"986","volume":"69","author":"L Jia","year":"2020","unstructured":"Jia, L., Liang, Y., Li, X., Lu, L., Yan, S.: Enabling efficient fast convolution algorithms on GPUs via MegaKernels. IEEE Trans. Comput. 69(7), 986\u2013997 (2020)","journal-title":"IEEE Trans. Comput."},{"key":"35_CR8","doi-asserted-by":"crossref","unstructured":"Yan, D., Wang, W., Chu, X.: Optimizing batched winograd convolution on GPUs. In: PPoPP, Main Conference (2020)","DOI":"10.1145\/3332466.3374520"},{"key":"35_CR9","doi-asserted-by":"crossref","unstructured":"Michael, B., Sean, T., Alex, A.: Singe: leveraging warp specialization for high performance on GPUs. In: ACM SIGPLAN Notices, pp. 119\u2013130 (2014)","DOI":"10.1145\/2692916.2555258"},{"key":"35_CR10","doi-asserted-by":"crossref","unstructured":"Bauer, M., et al.: CudaDMA: optimizing GPU memory bandwidth via warp specialization. In: HiPC, Networking Storage and Analysis (2011)","DOI":"10.1145\/2063384.2063400"}],"container-title":["Lecture Notes in Computer Science","Advances in Computer Graphics"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-030-61864-3_35","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2020,10,17]],"date-time":"2020-10-17T03:40:45Z","timestamp":1602906045000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/978-3-030-61864-3_35"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2020]]},"ISBN":["9783030618636","9783030618643"],"references-count":10,"URL":"https:\/\/doi.org\/10.1007\/978-3-030-61864-3_35","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2020]]},"assertion":[{"value":"18 October 2020","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"CGI","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Computer Graphics International Conference","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Geneva","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Switzerland","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2020","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"20 October 2020","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"23 October 2020","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"37","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"cgi2020","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"http:\/\/www.cgs-network.org\/cgi20\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}