{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,2,10]],"date-time":"2026-02-10T16:11:43Z","timestamp":1770739903812,"version":"3.49.0"},"reference-count":39,"publisher":"Tsinghua University Press","issue":"2","content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["Big Data Min. Anal."],"published-print":{"date-parts":[[2026,4]]},"DOI":"10.26599\/bdma.2025.9020065","type":"journal-article","created":{"date-parts":[[2026,2,6]],"date-time":"2026-02-06T20:52:42Z","timestamp":1770411162000},"page":"632-652","source":"Crossref","is-referenced-by-count":0,"title":["Leveraging Large-Scale Data for Efficient Low-Bit CUTLASS GEMM Optimization via Neural Networks"],"prefix":"10.26599","volume":"9","author":[{"given":"Hong","family":"Guo","sequence":"first","affiliation":[{"name":"Hasso Plattner Institute for Digital Engineering gGmbH, University of Potsdam,Potsdam,Germany,14482"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Nianhui","family":"Guo","sequence":"additional","affiliation":[{"name":"Hasso Plattner Institute for Digital Engineering gGmbH, University of Potsdam,Potsdam,Germany,14482"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Christoph","family":"Meinel","sequence":"additional","affiliation":[{"name":"Hasso Plattner Institute for Digital Engineering gGmbH, University of Potsdam,Potsdam,Germany,14482"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Haojin","family":"Yang","sequence":"additional","affiliation":[{"name":"Hasso Plattner Institute for Digital Engineering gGmbH, University of Potsdam,Potsdam,Germany,14482"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"11138","reference":[{"key":"ref1","first-page":"159","article-title":"Language models are few-shot learners","volume-title":"Proc. 34th Int. Conf. Neural Information Processing Systems","author":"Brown","year":"2020"},{"key":"ref2","article-title":"DeepSeek-V3 technical report","year":"2024","journal-title":"arXiv preprint"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01042"},{"key":"ref4","first-page":"2694","article-title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction","volume-title":"Proc. 38th Int. Conf. Neural Information Processing Systems","author":"Tian","year":"2024"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1016\/j.heliyon.2018.e00938"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1007\/s00371-024-03343-0"},{"key":"ref7","article-title":"GPTQ: Accurate post-training quantization for generative pre-trained transformers","author":"Frantar","year":"2022","journal-title":"arXiv preprint"},{"key":"ref8","article-title":"Towards optimization-friendly binary neural network","volume-title":"Trans. Mach. Learn. Res.","author":"Guo","year":"2025"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/EMC2-NIPS53020.2019.00016"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-72751-1_19"},{"key":"ref11","article-title":"The era of 1-bit LLMs: All large language models are in 1.58 bits","author":"Ma","year":"2024","journal-title":"arXiv preprint"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/ICCD58817.2023.00077"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1145\/3372419"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1145\/3293883.3295734"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1093\/comjnl\/bxae110"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v39i21.34461"},{"key":"ref17","article-title":"ALCOP: Automatic load-compute pipelining in deep learning compiler for AI-GPUs","volume-title":"Proc. 6th Conf. Machine Learning and Systems","author":"Huang","year":"2023"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-01970-8_89"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/ICPADS.2010.64"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/TPDS.2011.311"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/IPDPSW.2018.00165"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-662-58485-9_8"},{"key":"ref23","article-title":"Automatic kernel generation for Volta tensor cores","author":"Bhaskaracharya","year":"2020","journal-title":"arXiv preprint"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1145\/3545008.3545031"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1145\/3295500.3356169"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1109\/TPDS.2020.3045828"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1145\/3658617.3697668"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1007\/BF02551274"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1016\/0893-6080(91)90009-T"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.5555\/3291168.3291211"},{"key":"ref31","first-page":"3393","article-title":"Learning to optimize tensor programs","volume-title":"Proc. 32nd Int. Conf. Neural Information Processing Systems","author":"Chen","year":"2018"},{"key":"ref32","article-title":"Deep learning inference in Facebook data centers: Characterization, performance optimizations and hardware implications","author":"Park","year":"2018","journal-title":"arXiv preprint"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1145\/3434402"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1145\/3671151.3671166"},{"key":"ref35","volume-title":"NVIDIA AMPERE GA102 GPU architecture","year":"2025"},{"key":"ref36","article-title":"Rectifier nonlinearities improve neural network acoustic models","volume-title":"Proc. 30th Int. Conf. Machine Learning (ICML)","author":"Maas","year":"2013"},{"key":"ref37","article-title":"Adam: A method for stochastic optimization","volume-title":"Proc. 3rd Int. Conf. Learning Representations","author":"Kingma","year":"2015"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1007\/s10479-005-5724-z"},{"key":"ref39","volume-title":"Bitorch engine: Streamlining AI with open-source low-bit quantization","author":"Yang","year":"2024"}],"container-title":["Big Data Mining and Analytics"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/8254253\/11373433\/11373500.pdf?arnumber=11373500","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,2,9]],"date-time":"2026-02-09T21:10:20Z","timestamp":1770671420000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11373500\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,4]]},"references-count":39,"journal-issue":{"issue":"2"},"URL":"https:\/\/doi.org\/10.26599\/bdma.2025.9020065","relation":{},"ISSN":["2096-0654","2097-406X"],"issn-type":[{"value":"2096-0654","type":"print"},{"value":"2097-406X","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026,4]]}}}