{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,8]],"date-time":"2026-06-08T20:05:40Z","timestamp":1780949140993,"version":"3.54.1"},"reference-count":112,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"7","license":[{"start":{"date-parts":[[2026,7,1]],"date-time":"2026-07-01T00:00:00Z","timestamp":1782864000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2026,7,1]],"date-time":"2026-07-01T00:00:00Z","timestamp":1782864000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,7,1]],"date-time":"2026-07-01T00:00:00Z","timestamp":1782864000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"name":"National Key Research and Development Program of China","award":["2022ZD0160403"],"award-info":[{"award-number":["2022ZD0160403"]}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62441235"],"award-info":[{"award-number":["62441235"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62176178"],"award-info":[{"award-number":["62176178"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Pattern Anal. Mach. Intell."],"published-print":{"date-parts":[[2026,7]]},"DOI":"10.1109\/tpami.2026.3670952","type":"journal-article","created":{"date-parts":[[2026,3,6]],"date-time":"2026-03-06T21:00:33Z","timestamp":1772830833000},"page":"8297-8314","source":"Crossref","is-referenced-by-count":0,"title":["Parameter-Efficient Fine-Tuning for Continual Learning: A Neural Tangent Kernel Perspective"],"prefix":"10.1109","volume":"48","author":[{"ORCID":"https:\/\/orcid.org\/0009-0009-0163-4105","authenticated-orcid":false,"given":"Jingren","family":"Liu","sequence":"first","affiliation":[{"name":"School of Electrical and Information Engineering, Tianjin Key Laboratory of Brain-Inspired Intelligence Technology, Tianjin University, Tianjin, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-2197-3739","authenticated-orcid":false,"given":"Zhong","family":"Ji","sequence":"additional","affiliation":[{"name":"School of Electrical and Information Engineering, Tianjin Key Laboratory of Brain-Inspired Intelligence Technology, Tianjin University, Tianjin, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-0294-2099","authenticated-orcid":false,"given":"YunLong","family":"Yu","sequence":"additional","affiliation":[{"name":"College of Information Science and Electronic Engineering, Zhejiang University, Hangzhou, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-5160-6841","authenticated-orcid":false,"given":"Jiale","family":"Cao","sequence":"additional","affiliation":[{"name":"School of Electrical and Information Engineering, Tianjin Key Laboratory of Brain-Inspired Intelligence Technology, Tianjin University, Tianjin, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-6670-3727","authenticated-orcid":false,"given":"Yanwei","family":"Pang","sequence":"additional","affiliation":[{"name":"School of Electrical and Information Engineering, Tianjin Key Laboratory of Brain-Inspired Intelligence Technology, Tianjin University, Tianjin, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-4361-956X","authenticated-orcid":false,"given":"Jungong","family":"Han","sequence":"additional","affiliation":[{"name":"Department of Computer Science, University of Sheffield, Sheffield, U.K."}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-2924-946X","authenticated-orcid":false,"given":"Xuelong","family":"Li","sequence":"additional","affiliation":[{"name":"Institute of Artificial Intelligence (TeleAI) of China Telecom, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","article-title":"The impact of reinitialization on generalization in convolutional neural networks","author":"Alabdulmohsin","year":"2021"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.52202\/068431-1620"},{"key":"ref3","first-page":"463","article-title":"Rademacher and Gaussian complexities: Risk bounds and structural results","volume":"3","author":"Bartlett","year":"2002","journal-title":"J. Mach. Learn. Res."},{"key":"ref4","article-title":"Generalisation guarantees for continual learning with orthogonal gradient descent","author":"Mehdi","year":"2020"},{"key":"ref5","article-title":"IMEX-reg: Implicit-explicit regularization in the function space for continual learning","author":"Bhat","year":"2024","journal-title":"Trans. Mach. Learn. Res."},{"key":"ref6","first-page":"1024","article-title":"Spectrum dependent learning curves in Kernel regression and wide neural networks","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Bordelon","year":"2020"},{"key":"ref7","first-page":"1877","article-title":"Language models are few-shot learners","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"33","author":"Brown","year":"2020"},{"key":"ref8","first-page":"15920","article-title":"Dark experience for general continual learning: A strong, simple baseline","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"33","author":"Buzzega"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1038\/s41467-021-23103-1"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00951"},{"key":"ref11","first-page":"279","article-title":"Generalization errors and learning curves for regression with multi-task Gaussian processes","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"22","author":"Chai"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00041"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00950"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.52202\/075280-0781"},{"key":"ref15","first-page":"2937","article-title":"On lazy training in differentiable programming","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"32","author":"Chizat"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00020"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/CVPRW50498.2020.00359"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2021.3057446"},{"key":"ref19","article-title":"On the optimization and generalization of multi-head attention","author":"Deora","year":"2024","journal-title":"Trans. Mach. Learn. Res."},{"key":"ref20","first-page":"1072","article-title":"A theoretical analysis of catastrophic forgetting through the NTK overlap matrix","volume-title":"Proc. Int. Conf. Artif. Intell. Statist.","author":"Doan","year":"2021"},{"key":"ref21","first-page":"1","article-title":"Sharpness-aware minimization for efficiently improving generalization","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Foret"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.01055"},{"key":"ref23","first-page":"10744","article-title":"DDGR: Continual learning with deep diffusion-based generative replay","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Gao","year":"2023"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-73013-9_6"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.02689"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1007\/BF01937276"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.01577"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01553"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1109\/IGARSS.2018.8519248"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.01501"},{"key":"ref31","first-page":"2790","article-title":"Parameter-efficient transfer learning for NLP","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Houlsby","year":"2019"},{"key":"ref32","first-page":"1","article-title":"LoRA: Low-rank adaptation of large language models","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Hu"},{"key":"ref33","first-page":"1","article-title":"OVOR: OnePrompt with virtual outlier regularization for rehearsal-free class-incremental learning","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Huang"},{"key":"ref34","article-title":"An open access repository of images on plant health to enable the development of mobile disease diagnostics","author":"Hughes","year":"2015"},{"key":"ref35","first-page":"20617","article-title":"Position: The platonic representation hypothesis","volume-title":"Proc. Int. Conf. Mach. Learn","author":"Huh"},{"key":"ref36","first-page":"8571","article-title":"Neural tangent Kernel: Convergence and generalization in neural networks","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Jacot","year":"2018"},{"key":"ref37","first-page":"4904","article-title":"Scaling up visual and vision-language representation learning with noisy text supervision","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Jia","year":"2021"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19827-4_41"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.01088"},{"key":"ref40","first-page":"1","article-title":"Learning curves for continual learning in neural networks: Self-knowledge transfer and forgetting","volume-title":"Proc. Int. Conf. Learn. Representations, 2021","author":"Karakida"},{"key":"ref41","first-page":"5275","article-title":"Puzzle mix: Exploiting saliency and local statistics for optimal mixup","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Kim","year":"2020"},{"key":"ref42","article-title":"Learning multiple layers of features from tiny images","author":"Krizhevsky","year":"2009"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v38i12.29231"},{"key":"ref44","first-page":"1","article-title":"Deep neural networks as Gaussian processes","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Lee"},{"key":"ref45","first-page":"15156","article-title":"Finite versus infinite neural networks: An empirical study","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"33","author":"Lee"},{"key":"ref46","first-page":"8572","article-title":"Wide neural networks of any depth evolve as linear models under gradient descent","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Lee","year":"2019"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2023.3262853"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v38i12.29259"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2023.3271626"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2021.acllong.353"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.02231"},{"key":"ref52","first-page":"21078","article-title":"Theory on forgetting and generalization of continual learning","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Lin","year":"2023"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.52202\/068431-0142"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19827-4_29"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.52202\/079017-0253"},{"key":"ref56","first-page":"10600","article-title":"Generalization bounds for gradient methods via discrete and continuous prior","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"35","author":"Luo"},{"key":"ref57","first-page":"1","article-title":"Elastic feature consolidation for cold start exemplar-free incremental learning","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Magistri"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2021.acl-long.47"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2022.3213473"},{"key":"ref60","article-title":"Representation learning with contrastive predictive coding","author":"Oord","year":"2018"},{"key":"ref61","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2012.6248092"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19806-9_22"},{"key":"ref63","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00149"},{"key":"ref64","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2023.3324203"},{"key":"ref65","doi-asserted-by":"publisher","DOI":"10.1145\/3083187.3083212"},{"key":"ref66","first-page":"1","article-title":"Prompt gradient projection for continual learning","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Qiao"},{"key":"ref67","first-page":"1","article-title":"LFPT5: A unified framework for lifelong few-shot language learning based on prompt tuning of t5","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Qin"},{"key":"ref68","first-page":"8748","article-title":"Learning transferable visual models from natural language supervision","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Radford","year":"2021"},{"key":"ref69","first-page":"17284","article-title":"Formalizing the generalization-forgetting trade-off in continual learning","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"34","author":"Raghavan","year":"2021"},{"key":"ref70","first-page":"1","article-title":"The effectiveness of random forgetting for robust generalization","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Ramkumar"},{"key":"ref71","first-page":"1","article-title":"Progressive prompts: Continual learning for language models","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Razdaibiedina"},{"key":"ref72","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.587"},{"key":"ref73","first-page":"1","article-title":"ImageNet-21K pretraining for the masses","volume-title":"Proc. Adv. Neural Inf. Process. Syst. Track Datasets Benchmarks","volume":"1","author":"Ridnik"},{"key":"ref74","first-page":"18871","article-title":"Continual learning via sequential function-space variational inference","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Rudner","year":"2022"},{"key":"ref75","first-page":"1","article-title":"Divide and not forget: Ensemble of selectively trained experts in continual learning","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Rype\u015b\u0107"},{"key":"ref76","first-page":"11909","article-title":"Coda-prompt: Continual decomposed attention-based prompting for rehearsal-free continual learning","volume-title":"Proc. IEEE\/CVF Conf. Comput. Vis. Pattern Recognit.","author":"Seale","year":"2023"},{"key":"ref77","first-page":"2951","article-title":"Practical Bayesian optimization of machine learning algorithms","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"25","author":"Snoek"},{"key":"ref78","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00164"},{"key":"ref79","first-page":"9446","article-title":"Deep image prior","volume-title":"Proc. IEEE\/CVF Conf. Comput. Vis. Pattern Recognit.","author":"Ulyanov","year":"2018"},{"key":"ref80","article-title":"Limitations of the NTK for understanding generalization in deep learning","author":"Vyas","year":"2022"},{"key":"ref81","first-page":"15752","article-title":"Parameter-efficient tuning of large-scale multimodal foundation model","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"36","author":"Wang"},{"key":"ref82","doi-asserted-by":"publisher","DOI":"10.52202\/075280-3022"},{"key":"ref83","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2024.3367329"},{"key":"ref84","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.findings-emnlp.715"},{"key":"ref85","doi-asserted-by":"publisher","DOI":"10.52202\/068431-0411"},{"key":"ref86","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2023.3317874"},{"key":"ref87","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19809-0_36"},{"key":"ref88","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00024"},{"key":"ref89","first-page":"23549","article-title":"More than a toy: Random matrix models predict how real-world neural representations generalize","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Wei"},{"key":"ref90","article-title":"TKIL: Tangent kernel approach for class balanced incremental learning","author":"Xiang","year":"2022"},{"key":"ref91","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-026-02864-6"},{"key":"ref92","doi-asserted-by":"publisher","DOI":"10.1016\/j.cag.2024.01.012"},{"key":"ref93","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2021.3095064"},{"key":"ref94","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.02234"},{"key":"ref95","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2022.3175849"},{"key":"ref96","doi-asserted-by":"publisher","DOI":"10.1109\/ICCVW60793.2023.00359"},{"key":"ref97","article-title":"Tensor programs ii: Neural tangent kernel for any architecture","author":"Yang","year":"2020"},{"key":"ref98","first-page":"11762","article-title":"Tensor programs IIB: Architectural universality of neural tangent kernel training dynamics","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Yang","year":"2021"},{"key":"ref99","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.naacl-long.51"},{"key":"ref100","first-page":"4243","article-title":"Is parameter collision hindering continual learning in LLMs?","volume-title":"Proc. 31st Int. Conf. Comput. Linguistics, 2025","author":"Yang"},{"key":"ref101","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2022.acl-short.1"},{"key":"ref102","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v38i7.28523"},{"key":"ref103","article-title":"A large-scale study of representation learning with the visual task adaptation benchmark","author":"Zhai","year":"2019"},{"key":"ref104","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.01227"},{"key":"ref105","doi-asserted-by":"publisher","DOI":"10.1007\/978-1-4899-7502-7_79-1"},{"key":"ref106","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58580-8_41"},{"key":"ref107","doi-asserted-by":"publisher","DOI":"10.1145\/3539618.3591652"},{"key":"ref108","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.acl-long.625"},{"key":"ref109","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.02223"},{"key":"ref110","first-page":"1","article-title":"iBOT: Image BERTpre-training with online tokenizer","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Zhou"},{"key":"ref111","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-022-01653-1"},{"key":"ref112","first-page":"1","article-title":"Non-vacuous generalization bounds at the ImageNetscale: A PAC-Bayesian compression approach","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Zhou"}],"container-title":["IEEE Transactions on Pattern Analysis and Machine Intelligence"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/34\/11552636\/11423907.pdf?arnumber=11423907","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,6,8]],"date-time":"2026-06-08T19:52:28Z","timestamp":1780948348000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11423907\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,7]]},"references-count":112,"journal-issue":{"issue":"7"},"URL":"https:\/\/doi.org\/10.1109\/tpami.2026.3670952","relation":{},"ISSN":["0162-8828","2160-9292","1939-3539"],"issn-type":[{"value":"0162-8828","type":"print"},{"value":"2160-9292","type":"electronic"},{"value":"1939-3539","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026,7]]}}}