{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,3,7]],"date-time":"2026-03-07T17:59:25Z","timestamp":1772906365628,"version":"3.50.1"},"reference-count":90,"publisher":"IEEE","license":[{"start":{"date-parts":[[2023,12,15]],"date-time":"2023-12-15T00:00:00Z","timestamp":1702598400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2023,12,15]],"date-time":"2023-12-15T00:00:00Z","timestamp":1702598400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2023,12,15]]},"DOI":"10.1109\/bigdata59044.2023.10386872","type":"proceedings-article","created":{"date-parts":[[2024,1,22]],"date-time":"2024-01-22T13:28:47Z","timestamp":1705930127000},"page":"6-16","source":"Crossref","is-referenced-by-count":1,"title":["Solving Tensor Low Cycle Rank Approximation"],"prefix":"10.1109","author":[{"given":"Yichuan","family":"Deng","sequence":"first","affiliation":[{"name":"The University of Washington,Department of Computer Science,Seattle,WA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yeqi","family":"Gao","sequence":"additional","affiliation":[{"name":"The University of Washington,Department of Computer Science,Seattle,WA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zhao","family":"Song","sequence":"additional","affiliation":[{"name":"Adobe Research Adobe,San Jose,CA"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref1","article-title":"Opt: Open pre-trained transformer language models","author":"Zhang","year":"2022","journal-title":"arXiv preprint arXiv:2205.01068"},{"key":"ref2","article-title":"Palm: Scaling language modeling with pathways","author":"Chowdhery","year":"2022","journal-title":"arXiv preprint arXiv:2204.02311"},{"key":"ref3","first-page":"1877","article-title":"Language models are few-shot learners","volume":"33","author":"Brown","year":"2020","journal-title":"Advances in neural information processing systems"},{"key":"ref4","article-title":"Attention is all you need","volume":"30","author":"Vaswani","year":"2017","journal-title":"Advances in neural information processing systems"},{"key":"ref5","article-title":"Bert: Pre-training of deep bidirectional transformers for language understanding","author":"Devlin","year":"2018","journal-title":"arXiv preprint arXiv:1810.04805"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1613\/jair.1.12007"},{"issue":"1","key":"ref7","first-page":"4839","article-title":"Beyond english-centric multilingual machine translation","volume":"22","author":"Fan","year":"2021","journal-title":"The Journal of Machine Learning Research"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1162\/tacl_a_00343"},{"key":"ref9","article-title":"Huggingface\u2019s transformers: State-of-the-art natural language processing","author":"Wolf","year":"2019","journal-title":"arXiv preprint arXiv:1910.03771"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/N19-5004"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1007\/s11431-020-1647-3"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1145\/3560815"},{"key":"ref13","article-title":"What learning algorithm is in-context learning? investigations with linear models","author":"Aky\u00fcrek","year":"2022","journal-title":"arXiv preprint arXiv:2211.15661"},{"key":"ref14","article-title":"What can transformers learn in-context? a case study of simple function classes","author":"Garg","year":"2022","journal-title":"arXiv preprint arXiv:2208.01066"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.emnlp-main.1029"},{"issue":"5","key":"ref16","first-page":"444","article-title":"A model and an hypothesis for language structure","volume-title":"Proceedings of the American philosophical society","volume":"104","author":"Yngve","year":"1960"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1093\/oxfordhb\/9780199573691.001.0001"},{"key":"ref18","article-title":"Proceedings of the 2019 conference of the north american chapter of the association for computational linguistics: Human language technologies, volume 1 (long and short papers)","volume-title":"Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, Volume 1 (Long and Short Papers)","author":"Burstein"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.1989.266522"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.3115\/1073445.1073478"},{"key":"ref21","article-title":"A maximum entropy model for part-of-speech tagging","volume-title":"Conference on empirical methods in natural language processing","author":"Ratnaparkhi"},{"key":"ref22","first-page":"1031","article-title":"Tree-bank grammars","volume-title":"Proceedings of the National Conference on Artificial Intelligence","author":"Charniak"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.3115\/1075096.1075150"},{"key":"ref24","first-page":"404","article-title":"Improved inference for unlexicalized parsing","volume-title":"Human Language Technologies 2007: The Conference of the North American Chapter of the Association for Computational Linguistics; Proceedings of the Main Conference","author":"Petrov"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.3115\/980451.980963"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.3115\/981863.981887"},{"key":"ref27","volume-title":"Foundations of statistical natural language processing","author":"Manning","year":"1999"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1121\/1.2017061"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.21236\/ADA273556"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1137\/1.9781611975482.172"},{"key":"ref31","article-title":"Convergence of two-layer regression with nonlinear units","author":"Deng","year":"2023","journal-title":"arXiv preprint arXiv:2308.08358"},{"key":"ref32","article-title":"Zero-th order algorithm for softmax attention optimization","author":"Deng","year":"2023","journal-title":"arXiv preprint arXiv:2307.08352"},{"key":"ref33","article-title":"Attention scheme inspired softmax regression","author":"Deng","year":"2023","journal-title":"arXiv preprint arXiv:2304.10411"},{"key":"ref34","article-title":"Superiority of softmax: Unveiling the performance edge over linear attention","author":"Deng","year":"2023","journal-title":"arXiv preprint arXiv:2310.11685"},{"key":"ref35","article-title":"An iterative algorithm for rescaled hyperbolic functions regression","author":"Gao","year":"2023","journal-title":"arXiv preprint arXiv:2305.00660"},{"key":"ref36","article-title":"Solving attention kernel regression problem via pre-conditioner","author":"Song","year":"2023","journal-title":"arXiv preprint arXiv:2308.14304"},{"key":"ref37","article-title":"Approximating how single head attention learns","author":"Snell","year":"2021","journal-title":"arXiv preprint arXiv:2103.07601"},{"key":"ref38","first-page":"15383","article-title":"Why are adaptive methods good for attention models?","volume":"33","author":"Zhang","year":"2020","journal-title":"Advances in Neural Information Processing Systems"},{"key":"ref39","article-title":"An over-parameterized exponential regression","author":"Gao","year":"2023","journal-title":"arXiv preprint arXiv:2303.16504"},{"key":"ref40","article-title":"Solving regularized exp, cosh and sinh regression problems","author":"Li","year":"2023","journal-title":"arXiv preprint, 2303.15725"},{"key":"ref41","article-title":"How do transformers learn topic structure: Towards a mechanistic understanding","author":"Li","year":"2023","journal-title":"arXiv preprint arXiv:2303.04245"},{"key":"ref42","article-title":"How to capture higher-order correlations? generalizing matrix softmax attention to kronecker computation","author":"Alman","year":"2023","journal-title":"arXiv preprint arXiv:2310.04064"},{"key":"ref43","article-title":"Randomized and deterministic attention sparsification algorithms for over-parameterized feature dimension","author":"Deng","year":"2023","journal-title":"arxiv preprint: arxiv 2304.03426"},{"key":"ref44","article-title":"Fast quantum algorithm for attention computation","author":"Gao","year":"2023","journal-title":"arXiv preprint arXiv:2307.08045"},{"key":"ref45","article-title":"In-context learning for attention scheme: from single softmax regression to multiple softmax regression via a tensor trick","author":"Gao","year":"2023","journal-title":"arXiv preprint arXiv:2307.02419"},{"key":"ref46","article-title":"Hyperattention: Long-context attention in near-linear time","author":"Han","year":"2023","journal-title":"arXiv preprint arXiv:2310.05869"},{"key":"ref47","article-title":"Polysketchformer: Fast transformers via sketches for polynomial kernels","author":"Kacham","year":"2023","journal-title":"arXiv preprint arXiv:2310.01655"},{"key":"ref48","first-page":"22137","article-title":"Deja vu: Contextual sparsity for efficient llms at inference time","volume-title":"International Conference on Machine Learning","author":"Liu"},{"key":"ref49","article-title":"H_2 o: Heavy-hitter oracle for efficient generative inference of large language models","author":"Zhang","year":"2023","journal-title":"arXiv preprint arXiv:2306.14048"},{"key":"ref50","article-title":"Kdeformer: Accelerating transformers via kernel density estimation","author":"Zandieh","year":"2023","journal-title":"arXiv preprint arXiv:2302.02451"},{"key":"ref51","article-title":"Fast attention requires bounded entries","author":"Alman","year":"2023","journal-title":"arXiv preprint arXiv:2302.13214"},{"key":"ref52","article-title":"Algorithms and hardness for dynamic attention maintenance in large language models","author":"Brand","year":"2023","journal-title":"arXiv preprint arXiv:2304.02207"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.1145\/3313276.3316303"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1137\/1.9781611975994.16"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1109\/FOCS.2019.00036"},{"key":"ref56","article-title":"A watermark for large language models","author":"Kirchenbauer","year":"2023","journal-title":"arXiv preprint arXiv:2301.10226"},{"key":"ref57","article-title":"Unmasking transformers: A theoretical approach to data recovery via attention weights","author":"Deng","year":"2023","journal-title":"arXiv preprint arXiv:2310.12462"},{"key":"ref58","article-title":"Gradientcoin: A peer-to-peer decentralized large language models","author":"Gao","year":"2023","journal-title":"arXiv preprint arXiv:2308.10502"},{"key":"ref59","article-title":"Differentially private attention computation","author":"Gao","year":"2023","journal-title":"arXiv preprint arXiv:2305.04701"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1145\/2488608.2488620"},{"key":"ref61","doi-asserted-by":"publisher","DOI":"10.1109\/FOCS.2013.21"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.1145\/2591796.2591819"},{"key":"ref63","doi-asserted-by":"publisher","DOI":"10.1145\/3055399.3055431"},{"key":"ref64","doi-asserted-by":"publisher","DOI":"10.1145\/2897518.2897639"},{"key":"ref65","article-title":"Efficient alternating minimization with applications to weighted low rank approximation","author":"Song","year":"2023","journal-title":"arXiv preprint arXiv:2306.04169"},{"key":"ref66","article-title":"Average case column subset selection for entrywise l\u2081norm loss","volume":"32","author":"Song","year":"2019","journal-title":"Advances in Neural Information Processing Systems"},{"key":"ref67","article-title":"Towards a zero-one law for column subset selection","volume":"32","author":"Song","year":"2019","journal-title":"Advances in Neural Information Processing Systems"},{"key":"ref68","first-page":"1299","article-title":"Sketching for kronecker product regression and p-splines","volume-title":"International Conference on Artificial Intelligence and Statistics","author":"Diao"},{"key":"ref69","article-title":"Optimal sketching for kronecker product regression and low rank approximation","volume":"32","author":"Diao","year":"2019","journal-title":"Advances in neural information processing systems"},{"key":"ref70","first-page":"9812","article-title":"Fast sketching of polynomial kernels of polynomial degree","volume-title":"International Conference on Machine Learning","author":"Song"},{"key":"ref71","article-title":"Dynamic tensor product regression","author":"Reddy","year":"2022","journal-title":"NeurIPS"},{"key":"ref72","article-title":"Near-linear time and fixed-parameter tractable algorithms for tensor decompositions","author":"Mahankali","year":"2022","journal-title":"arXiv preprint arXiv:2207.07417"},{"key":"ref73","doi-asserted-by":"publisher","DOI":"10.1145\/3357713.3384284"},{"key":"ref74","article-title":"Faster robust tensor power method for arbitrary order","author":"Deng","year":"2023","journal-title":"arXiv preprint arXiv:2306.00406"},{"key":"ref75","doi-asserted-by":"publisher","DOI":"10.1137\/1.9781611977912.129"},{"key":"ref76","article-title":"Training (over-parametrized) neural networks in near-linear time","author":"Brand","year":"2021","journal-title":"ITCS"},{"key":"ref77","article-title":"Training multi-layer over-parametrized neural network in subquadratic time","author":"Song","year":"2021","journal-title":"arXiv preprint arXiv:2112.07628"},{"key":"ref78","article-title":"Speeding up optimizations via data structures: Faster search, sample and maintenance","volume-title":"Master\u2019s thesis, Carnegie Mellon University","author":"Zhang","year":"2022"},{"key":"ref79","doi-asserted-by":"publisher","DOI":"10.1109\/ICDE.2016.7498295"},{"key":"ref80","doi-asserted-by":"publisher","DOI":"10.1145\/2897518.2897646"},{"key":"ref81","article-title":"Faster algorithm for structured john ellipsoid computation","author":"Song","year":"2022","journal-title":"arXiv preprint arXiv:2211.14407"},{"key":"ref82","article-title":"Discrepancy minimization in input-sparsity time","author":"Deng","year":"2022","journal-title":"arXiv preprint arXiv:2210.12468"},{"key":"ref83","first-page":"849","article-title":"A near-optimal algorithm for approximating the john ellipsoid","volume-title":"Conference on Learning Theory","author":"Cohen"},{"key":"ref84","doi-asserted-by":"publisher","DOI":"10.1145\/2493252.2493254"},{"key":"ref85","doi-asserted-by":"publisher","DOI":"10.1145\/2487575.2487591"},{"key":"ref86","article-title":"Subspace embeddings for the polynomial kernel","volume":"27","author":"Avron","year":"2014","journal-title":"Advances in neural information processing systems"},{"key":"ref87","doi-asserted-by":"publisher","DOI":"10.1016\/S0747-7171(10)80003-3"},{"key":"ref88","doi-asserted-by":"publisher","DOI":"10.1145\/235809.235813"},{"key":"ref89","doi-asserted-by":"publisher","DOI":"10.1109\/FOCS.2006.37"},{"key":"ref90","doi-asserted-by":"publisher","DOI":"10.1561\/0400000060"}],"event":{"name":"2023 IEEE International Conference on Big Data (BigData)","location":"Sorrento, Italy","start":{"date-parts":[[2023,12,15]]},"end":{"date-parts":[[2023,12,18]]}},"container-title":["2023 IEEE International Conference on Big Data (BigData)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/10385234\/10386078\/10386872.pdf?arnumber=10386872","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,1,23]],"date-time":"2024-01-23T12:29:24Z","timestamp":1706012964000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/10386872\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023,12,15]]},"references-count":90,"URL":"https:\/\/doi.org\/10.1109\/bigdata59044.2023.10386872","relation":{},"subject":[],"published":{"date-parts":[[2023,12,15]]}}}