{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,10]],"date-time":"2026-07-10T13:26:21Z","timestamp":1783689981400,"version":"3.55.0"},"reference-count":46,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,4,1]],"date-time":"2026-04-01T00:00:00Z","timestamp":1775001600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,4,1]],"date-time":"2026-04-01T00:00:00Z","timestamp":1775001600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,4,1]],"date-time":"2026-04-01T00:00:00Z","timestamp":1775001600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,4,1]],"date-time":"2026-04-01T00:00:00Z","timestamp":1775001600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,4,1]],"date-time":"2026-04-01T00:00:00Z","timestamp":1775001600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,4,1]],"date-time":"2026-04-01T00:00:00Z","timestamp":1775001600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,4,1]],"date-time":"2026-04-01T00:00:00Z","timestamp":1775001600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/501100018624","name":"Science and Technology Bureau of Quanzhou","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100018624","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100003392","name":"Fujian Provincial Natural Science Foundation","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100003392","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Knowledge-Based Systems"],"published-print":{"date-parts":[[2026,4]]},"DOI":"10.1016\/j.knosys.2026.115629","type":"journal-article","created":{"date-parts":[[2026,2,27]],"date-time":"2026-02-27T15:55:54Z","timestamp":1772207754000},"page":"115629","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":1,"special_numbering":"C","title":["Accelerating grokking through spectral analysis: A multi-method approach to enhancing abstract rule learning in neural networks"],"prefix":"10.1016","volume":"339","author":[{"ORCID":"https:\/\/orcid.org\/0009-0003-8200-9534","authenticated-orcid":false,"given":"Zhigao","family":"Huang","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0006-6494-6999","authenticated-orcid":false,"given":"Shiyan","family":"Zheng","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0002-2042-1235","authenticated-orcid":false,"given":"Miao","family":"Pan","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0002-8784-3555","authenticated-orcid":false,"given":"Quanfa","family":"Li","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.knosys.2026.115629_bib0001","unstructured":"A. Power, Y. Burda, H. Edwards, I. Babuschkin, V. Misra, Grokking: generalization beyond overfitting on small algorithmic datasets, (2022) arXiv: 2201.02177."},{"key":"10.1016\/j.knosys.2026.115629_bib0002","unstructured":"Z. Liu, O. Kitouni, N. Nishant, A. Edelman, D. A. Roberts, M. Austern, M. Albrecht, Towards understanding grokking: an effective theory of representation learning, (2022) arXiv: 2205.10343."},{"key":"10.1016\/j.knosys.2026.115629_bib0003","unstructured":"V.R. Thilak, A.S. Liu, S. Kambhampati, U. Bhatt, A. Farhadi, D. Kiela, The slingshot mechanism: training dynamics of grokking, (2022) arXiv: 2206.04817."},{"key":"10.1016\/j.knosys.2026.115629_bib0004","first-page":"39503","article-title":"Grokking modular addition","volume":"202","author":"Yang","year":"2023","journal-title":"Proc. 40th Int. Conf. Mach. Learn."},{"key":"10.1016\/j.knosys.2026.115629_bib0005","unstructured":"P. Kumar, T. Goldstein, J. Ba, Grokking as the transition from lazy to rich training dynamics, (2023) arXiv: 2310.06110."},{"key":"10.1016\/j.knosys.2026.115629_bib0006","unstructured":"A. Gromov, Grokking modular arithmetic, (2023) arXiv: 2301.02679."},{"key":"10.1016\/j.knosys.2026.115629_bib0007","unstructured":"N. Nanda, L. Chan, T. Lieberum, J. Steinhardt, S.R. Bowman, T. Chen, Progress measures for grokking via mechanistic interpretability, (2023) arXiv: 2301.05217."},{"key":"10.1016\/j.knosys.2026.115629_bib0008","doi-asserted-by":"crossref","DOI":"10.18653\/v1\/2023.acl-short.38","article-title":"Grokking of hierarchical structure in transformer language models","author":"Murty","year":"2023","journal-title":"Proc. 61st Annual Meet. Assoc. Comput. Linguist."},{"key":"10.1016\/j.knosys.2026.115629_bib0009","unstructured":"Z. Liu, P. Deepak, M. Austern, D.A. Roberts, From symmetries to grokking: an unfolding story of representations in training dynamics, (2023) arXiv: 2310.00074."},{"key":"10.1016\/j.knosys.2026.115629_bib0010","unstructured":"N. Elhage, T. Henighan, A. Askell, C. Olsson, N. DasSarma, D. Jones, S. McCandlish, D. Amodei, P. Welinder, J. Kaplan, et al., SOLU: Spectral normalization for overcoming the optimizer\u2019s curse, (2022) arXiv: 2203.14343."},{"key":"10.1016\/j.knosys.2026.115629_bib0011","first-page":"17987","article-title":"An empirical analysis of compute-optimal large language model training","volume":"36","author":"Mehta","year":"2023","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.knosys.2026.115629_bib0012","unstructured":"C. Olsson, N. Elhage, N. Nanda, N. Joseph, T. Henighan, B. Mann, A. Askell, Y. Bai, A. Chen, T. Conerly, et al., In-context learning and induction heads, (2022) arXiv: 2209.11895."},{"key":"10.1016\/j.knosys.2026.115629_bib0013","unstructured":"J. Wei, Y. Tay, R. Bommasani, C. Raffel, B. Zoph, S. Borgeaud, D. Yogatama, M. Bosma, D. Zhou, D. Metzler, et al., Emergent abilities of large language models, (2022) arXiv: 2206.07682."},{"key":"10.1016\/j.knosys.2026.115629_bib0014","article-title":"Omnigrok: grokking beyond algorithmic data","author":"Liu","year":"2023","journal-title":"Int. Conf. Learn. Represent."},{"key":"10.1016\/j.knosys.2026.115629_bib0015","unstructured":"Y. Bahri, E. Dyer, J. Kaplan, J. Lee, U. Sharma, Explaining neural scaling laws, (2021) arXiv: 2102.06701."},{"key":"10.1016\/j.knosys.2026.115629_bib0016","article-title":"Overparameterization improves robustness to adversarial examples in learning poset functions","author":"Mahan","year":"2023","journal-title":"Int. Conf. Learn. Represent."},{"key":"10.1016\/j.knosys.2026.115629_bib0017","unstructured":"I. Balazevic, Z. Mao, B. Roziere, M.-A. Lachaux, G. Lample, F. Charton, Neural spectral regularization for abstract rule learning, (2023) arXiv: 2310.05344."},{"issue":"5","key":"10.1016\/j.knosys.2026.115629_bib0018","doi-asserted-by":"crossref","first-page":"1746","DOI":"10.4208\/cicp.OA-2020-0085","article-title":"Frequency principle: fourier analysis sheds light on deep neural networks","volume":"28","author":"Xu","year":"2020","journal-title":"Commun. Comput. Phys."},{"key":"10.1016\/j.knosys.2026.115629_bib0019","article-title":"Pruning neural networks at initialization: why are we missing the mark?","author":"Frankle","year":"2022","journal-title":"Int. Conf. Learn. Represent."},{"key":"10.1016\/j.knosys.2026.115629_bib0020","unstructured":"B. Zoph, I. Bello, S. Kumar, N. Du, Y. Huang, J. Dean, N. Shazeer, W. Fedus, ST-MoE: designing effective sparse expert models, (2022) arXiv: 2202.08906."},{"key":"10.1016\/j.knosys.2026.115629_bib0021","first-page":"5301","article-title":"On the spectral bias of neural networks","author":"Rahaman","year":"2019","journal-title":"Int. Conf. Mach. Learn."},{"key":"10.1016\/j.knosys.2026.115629_bib0022","first-page":"3646","article-title":"Neural tangent frequency decomposition and the spectral bias of neural networks","author":"Wang","year":"2023","journal-title":"Int. Conf. Artif. Intell. Stat."},{"issue":"1","key":"10.1016\/j.knosys.2026.115629_bib0023","first-page":"1","article-title":"Frequency domain analysis helps explain deep learning capability","volume":"14","author":"Fu","year":"2024","journal-title":"Sci. Rep."},{"key":"10.1016\/j.knosys.2026.115629_bib0024","article-title":"Frequency-domain neural architecture optimization for sinusoidal functions","author":"Vaze","year":"2023","journal-title":"IEEE Trans. Neural Netw. Learn. Syst."},{"key":"10.1016\/j.knosys.2026.115629_bib0025","first-page":"20266","article-title":"Transformers learning in frequency domain","volume":"36","author":"Doshi","year":"2023","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.knosys.2026.115629_bib0026","unstructured":"Z. Tian, R. Zhao, D. Wang, F. Li, J.B. Tenenbaum, C. Gan, SCAN: Spectral clustering accelerates neural networks for data-efficient learning, (2023) arXiv: 2306.10136."},{"key":"10.1016\/j.knosys.2026.115629_bib0027","unstructured":"A. Liu, E. Tosch, K. O\u2019Connor, V.J. Reddi, Representation engineering: a top-down approach to AI transparency, (2023) arXiv: 2310.01405."},{"key":"10.1016\/j.knosys.2026.115629_bib0028","first-page":"11682","article-title":"Transformers learn through gradual rank expansion","volume":"36","author":"Wang","year":"2023","journal-title":"Adv. Neural Inf. Process. Syst."},{"issue":"47","key":"10.1016\/j.knosys.2026.115629_bib0029","doi-asserted-by":"crossref","DOI":"10.1073\/pnas.2206625119","article-title":"Acquisition of chess knowledge in alphazero","volume":"119","author":"McGrath","year":"2022","journal-title":"Proc. Natl. Acad. Sci."},{"key":"10.1016\/j.knosys.2026.115629_bib0030","unstructured":"S. Kadavath, T. Conerly, A. Askell, T. Henighan, D. Drain, E. Perez, N.J. Schiefer, Z. Chen, J. Tworek, J. Hoffmann, et al., Language models show human-like content effects on reasoning, (2022) arXiv: 2207.07051."},{"issue":"4","key":"10.1016\/j.knosys.2026.115629_bib0031","first-page":"743","article-title":"Transformer feed-forward layers are key-value memories","volume":"49","author":"McCoy","year":"2023","journal-title":"Comput. Linguist."},{"key":"10.1016\/j.knosys.2026.115629_bib0032","first-page":"48351","article-title":"The role of frequency bias in neural networks trained on small data: an empirical investigation","volume":"36","author":"Park","year":"2023","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.knosys.2026.115629_bib0033","first-page":"20399","article-title":"Learning in high dimensions with asymmetric concentration","author":"Song","year":"2022","journal-title":"Int. Conf. Mach. Learn."},{"key":"10.1016\/j.knosys.2026.115629_bib0034","first-page":"9353","article-title":"A mechanistic perspective on curriculum learning","volume":"195","author":"Lubana","year":"2023","journal-title":"Annual Conf. Learn. Theory"},{"issue":"12","key":"10.1016\/j.knosys.2026.115629_bib0035","first-page":"14763","article-title":"Understanding the effects of dataset difficulty on curriculum learning","volume":"45","author":"Lyle","year":"2023","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.knosys.2026.115629_bib0036","article-title":"Learning to recombine and resample data for compositional generalization","author":"Akyurek","year":"2022","journal-title":"Int. Conf. Learn. Represent."},{"key":"10.1016\/j.knosys.2026.115629_bib0037","first-page":"38546","article-title":"Exploring length generalization in large language models","volume":"35","author":"Anil","year":"2022","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.knosys.2026.115629_bib0038","article-title":"Improving transformer optimization through better initialization","author":"Huang","year":"2020","journal-title":"Int. Conf. Mach. Learn."},{"key":"10.1016\/j.knosys.2026.115629_bib0039","first-page":"20154","article-title":"Learned token pruning for transformers","volume":"34","author":"Kim","year":"2021","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.knosys.2026.115629_bib0040","first-page":"20133","article-title":"Tensor programs v: tuning large neural networks via zero-shot hyperparameter transfer","volume":"34","author":"Yang","year":"2021","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.knosys.2026.115629_bib0041","article-title":"An explanation of in-context learning as implicit bayesian inference","author":"Xie","year":"2022","journal-title":"Int. Conf. Learn. Represent."},{"key":"10.1016\/j.knosys.2026.115629_bib0042","first-page":"2315","article-title":"On the surprising behavior of distance metrics in high dimensional space","author":"Radhakrishnan","year":"2020","journal-title":"Int. Conf. Artif. Intell. Stat."},{"key":"10.1016\/j.knosys.2026.115629_bib0043","article-title":"Deep sets","volume":"30","author":"Zaheer","year":"2017","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.knosys.2026.115629_bib0044","unstructured":"P.W. Battaglia, J.B. Hamrick, V. Bapst, A. Sanchez-Gonzalez, V. Zambaldi, M. Malinowski, A. Tacchetti, D. Raposo, A. Santoro, R. Faulkner, et al., Relational inductive biases, deep learning, and graph networks, (2018) arXiv: 1806.01261."},{"key":"10.1016\/j.knosys.2026.115629_bib0045","article-title":"Making neural programming architectures generalize via recursion","author":"Ontanon","year":"2021","journal-title":"Proc. Int. Conf. Learn. Represent."},{"key":"10.1016\/j.knosys.2026.115629_bib0046","article-title":"Sequence-to-sequence learning with neural module networks","author":"Kim","year":"2021","journal-title":"Proc. 59th Annual Meet. Assoc. Comput. Linguist."}],"container-title":["Knowledge-Based Systems"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0950705126003692?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0950705126003692?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,5,1]],"date-time":"2026-05-01T00:16:50Z","timestamp":1777594610000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0950705126003692"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,4]]},"references-count":46,"alternative-id":["S0950705126003692"],"URL":"https:\/\/doi.org\/10.1016\/j.knosys.2026.115629","relation":{},"ISSN":["0950-7051"],"issn-type":[{"value":"0950-7051","type":"print"}],"subject":[],"published":{"date-parts":[[2026,4]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"Accelerating grokking through spectral analysis: A multi-method approach to enhancing abstract rule learning in neural networks","name":"articletitle","label":"Article Title"},{"value":"Knowledge-Based Systems","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.knosys.2026.115629","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Elsevier B.V. All rights are reserved, including those for text and data mining, AI training, and similar technologies.","name":"copyright","label":"Copyright"}],"article-number":"115629"}}