{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,8,29]],"date-time":"2026-08-29T05:03:01Z","timestamp":1787979781396,"version":"build-2784847793"},"reference-count":281,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"3","license":[{"start":{"date-parts":[[2025,3,1]],"date-time":"2025-03-01T00:00:00Z","timestamp":1740787200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2025,3,1]],"date-time":"2025-03-01T00:00:00Z","timestamp":1740787200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2025,3,1]],"date-time":"2025-03-01T00:00:00Z","timestamp":1740787200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Pattern Anal. Mach. Intell."],"published-print":{"date-parts":[[2025,3]]},"DOI":"10.1109\/tpami.2024.3498346","type":"journal-article","created":{"date-parts":[[2024,11,14]],"date-time":"2024-11-14T13:37:23Z","timestamp":1731591443000},"page":"1464-1483","source":"Crossref","is-referenced-by-count":70,"title":["A Comprehensive Survey of Forgetting in Deep Learning Beyond Continual Learning"],"prefix":"10.1109","volume":"47","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-2780-9446","authenticated-orcid":false,"given":"Zhenyi","family":"Wang","sequence":"first","affiliation":[{"name":"Department of Computer Science, University of Maryland, College Park, MD, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-5419-5286","authenticated-orcid":false,"given":"Enneng","family":"Yang","sequence":"additional","affiliation":[{"name":"Northeastern University, Shenyang, Liaoning, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-5659-3464","authenticated-orcid":false,"given":"Li","family":"Shen","sequence":"additional","affiliation":[{"name":"Sun Yat-sen University, Guangzhou, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Heng","family":"Huang","sequence":"additional","affiliation":[{"name":"Department of Computer Science, University of Maryland, College Park, MD, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1016\/S0079-7421(08)60536-8"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1016\/j.neunet.2019.01.012"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1038\/s42256-022-00568-3"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2021.3057446"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1016\/j.neucom.2021.10.021"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2022.3213473"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2024.3429383"},{"key":"ref8","article-title":"How to reuse and compose knowledge for a lifetime of tasks: A survey on continual learning and functional composition","author":"Mendez","year":"2023","journal-title":"Trans. Mach. Learn. Res."},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2024.3367329"},{"key":"ref10","article-title":"Making AI forget you: Data deletion in machine learning","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Ginart"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/SP.2017.41"},{"key":"ref12","first-page":"31269","article-title":"Improving the model consistency of decentralized federated learning","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Shi"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/SP.2015.35"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.01151"},{"key":"ref15","first-page":"6467","article-title":"Gradient episodic memory for continual learning","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Lopez-Paz"},{"key":"ref16","article-title":"Efficient lifelong learning with A-GEM","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Chaudhry"},{"key":"ref17","article-title":"Dark experience for general continual learning: A strong, simple baseline","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Buzzega"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00020"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01931"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.587"},{"key":"ref21","first-page":"11816","article-title":"Gradient based sample selection for online continual learning","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Aljundi"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00812"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01252-6_33"},{"key":"ref24","first-page":"11849","article-title":"Online continual learning with maximal interfered retrieval","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Aljundi"},{"key":"ref25","first-page":"5966","article-title":"Memory replay GANs: Learning to generate images from new categories without forgetting","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Chenshen"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00672"},{"key":"ref27","article-title":"FearNet: Brain-inspired model for incremental learning","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Kemker"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1109\/ICCVW60793.2023.00367"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00924"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1038\/s41467-020-17866-2"},{"key":"ref31","first-page":"14817","article-title":"BiRT: Bio-inspired replay in vision transformers for continual learning","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Jeeveswaran"},{"key":"ref32","article-title":"Memory replay with data compression for continual learning","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Wang"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01094"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.01226"},{"key":"ref35","first-page":"34391","article-title":"Remember the past: Distilling datasets into addressable memories for neural networks","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Deng"},{"key":"ref36","article-title":"An efficient dataset condensation plugin and its application to continual learning","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Yang"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01045"},{"key":"ref38","article-title":"Progressive neural networks","author":"Rusu","year":"2016"},{"key":"ref39","article-title":"PathNet: Evolution channels gradient descent in super neural networks","author":"Fernando","year":"2017"},{"key":"ref40","article-title":"Lifelong learning with dynamically expandable networks","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Yoon"},{"key":"ref41","first-page":"4555","article-title":"Overcoming catastrophic forgetting with hard attention to the task","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Serr\u00e1"},{"key":"ref42","article-title":"Deep rewiring: Training very sparse deep networks","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Bellec"},{"key":"ref43","article-title":"SparCL: Sparse continual learning on the edge","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Wang"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01225-0_5"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00810"},{"key":"ref46","first-page":"13647","article-title":"Compacting, picking and growing for unforgetting continual learning","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Hung"},{"key":"ref47","first-page":"3925","article-title":"Learn to grow: A continual structure learning framework for overcoming catastrophic forgetting","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Li"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00303"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1073\/pnas.1611835114"},{"key":"ref50","first-page":"3987","article-title":"Continual learning through synaptic intelligence","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Zenke"},{"key":"ref51","article-title":"Continual learning with hypernetworks","author":"von Oswald","year":"2019"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01219-9_9"},{"key":"ref53","article-title":"Uncertainty-based continual learning with adaptive regularization","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Ahn"},{"key":"ref54","article-title":"Distilling the knowledge in a neural network","author":"Hinton","year":"2015"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2017.2773081"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00528"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00357"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00040"},{"key":"ref59","article-title":"Orthogonal gradient descent for continual learning","author":"Farajtabar","year":"2020"},{"key":"ref60","first-page":"1072","article-title":"A theoretical analysis of catastrophic forgetting through the NTK overlap matrix","volume-title":"Proc. Int. Conf. Artif. Intell. Statist.","author":"Doan"},{"key":"ref61","article-title":"Continual learning in low-rank orthogonal subspaces","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Chaudhry"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.1038\/s42256-019-0080-x"},{"key":"ref63","article-title":"Gradient projection memory for continual learning","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Saha"},{"key":"ref64","first-page":"18710","article-title":"Flattening sharpness for dynamic gradient projection memory benefits continual learning","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Deng"},{"key":"ref65","article-title":"TRGP: Trust region gradient projection for continual learning","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Lin"},{"key":"ref66","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00518"},{"key":"ref67","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v37i8.26157"},{"key":"ref68","article-title":"Variational continual learning","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Nguyen"},{"key":"ref69","first-page":"4652","article-title":"Overcoming catastrophic forgetting by incremental moment matching","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Lee"},{"key":"ref70","article-title":"Continual learning with adaptive weights (CLAW)","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Adel"},{"key":"ref71","article-title":"Continual learning with Bayesian neural networks for non-stationary data","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Kurle"},{"key":"ref72","first-page":"14135","article-title":"Posterior meta-replay for continual learning","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Henning"},{"key":"ref73","first-page":"28067","article-title":"Natural continual learning: Success is a journey, not (just) a destination","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Kao"},{"key":"ref74","article-title":"Continual deep learning by functional regularisation of memorable past","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Pan"},{"key":"ref75","article-title":"Functional regularisation for continual learning with Gaussian processes","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Titsias"},{"key":"ref76","first-page":"5290","article-title":"Variational auto-regressive Gaussian processes for continual learning","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Kapoor"},{"key":"ref77","first-page":"18871","article-title":"Continual learning via sequential function-space variational inference","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Rudner"},{"key":"ref78","first-page":"5850","article-title":"Bayesian structural adaptation for continual learning","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Kumar"},{"key":"ref79","first-page":"100","article-title":"Continual learning using a Bayesian nonparametric dictionary of weight factors","volume-title":"Proc. 24th Int. Conf. Artif. Intell. Statist.","author":"Mehta"},{"key":"ref80","article-title":"Continual learning with tiny episodic memories","volume-title":"Proc. Workshop Multi-Task Lifelong Reinforcement Learn.","author":"Chaudhry"},{"key":"ref81","first-page":"29193","article-title":"Gradient-based editing of memory examples for online task-free continual learning","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Jin"},{"key":"ref82","first-page":"22985","article-title":"Improving task-free continual learning by distributionally robust memory evolution","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Wang"},{"key":"ref83","article-title":"A neural Dirichlet process mixture model for task-free continual learning","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Lee"},{"key":"ref84","first-page":"865","article-title":"VariGrow: Variational architecture growing for task-agnostic continual learning based on Bayesian novelty","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Ardywibowo"},{"key":"ref85","article-title":"Task-free continual learning via online discrepancy distance learning","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Ye"},{"key":"ref86","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v35i11.17159"},{"key":"ref87","first-page":"8109","article-title":"Online continual learning through mutual information maximization","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Guo"},{"key":"ref88","first-page":"53892","article-title":"Mitigating catastrophic forgetting in online continual learning by modeling previous task interrelations via Pareto optimization","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Wu"},{"key":"ref89","article-title":"Online coreset selection for rehearsal-based continual learning","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Yoon"},{"key":"ref90","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00729"},{"key":"ref91","article-title":"La-MAML: Look-ahead meta learning for continual learning","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Gupta"},{"key":"ref92","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58604-1_43"},{"key":"ref93","first-page":"4535","article-title":"Progress and compress: A scalable framework for continual learning","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Schwarz"},{"key":"ref94","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01258-8_15"},{"key":"ref95","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58536-5_31"},{"key":"ref96","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00046"},{"key":"ref97","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00088"},{"key":"ref98","article-title":"Online continual learning from imbalanced data","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Chrysakis"},{"key":"ref99","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58601-0_25"},{"key":"ref100","article-title":"Information-theoretic online memory selection for continual learning","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Sun"},{"key":"ref101","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00067"},{"key":"ref102","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.01322"},{"key":"ref103","article-title":"Online bias correction for task-free continual learning","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Chrysakis"},{"key":"ref104","doi-asserted-by":"publisher","DOI":"10.1145\/3534678.3539297"},{"key":"ref105","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00534"},{"key":"ref106","doi-asserted-by":"publisher","DOI":"10.1109\/IJCNN52387.2021.9534361"},{"key":"ref107","article-title":"Continual learning on a diet: Learning from sparsely labeled streams under constrained computation","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Zhang"},{"key":"ref108","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2022.3175849"},{"key":"ref109","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.01220"},{"key":"ref110","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00673"},{"key":"ref111","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00885"},{"key":"ref112","article-title":"Neural collapse inspired feature-classifier alignment for few-shot class-incremental learning","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Yang"},{"key":"ref113","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2022.3200865"},{"key":"ref114","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01377"},{"key":"ref115","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v35i3.16334"},{"key":"ref116","article-title":"Warping the space: Weight space rotation for class-incremental few-shot learning","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Kim"},{"key":"ref117","first-page":"7645","article-title":"Continual unsupervised representation learning","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Rao"},{"key":"ref118","article-title":"Representational continuity for unsupervised continual learning","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Madaan"},{"key":"ref119","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00938"},{"key":"ref120","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01621"},{"key":"ref121","article-title":"mixup: Beyond empirical risk minimization","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Zhang"},{"key":"ref122","first-page":"3519","article-title":"Similarity of neural network representations revisited","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Kornblith"},{"key":"ref123","first-page":"II-991","article-title":"A PAC-Bayesian bound for lifelong learning","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Pentina"},{"key":"ref124","article-title":"Learning curves for continual learning in neural networks: Self-knowledge transfer and forgetting","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Karakida"},{"key":"ref125","article-title":"A theoretical study on solving continual learning","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Kim"},{"key":"ref126","first-page":"9440","article-title":"Continual learning in linear classification on separable data","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Evron"},{"key":"ref127","article-title":"The ideal continual learner: An agent that never forgets","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Peng"},{"key":"ref128","first-page":"61021","article-title":"A statistical theory of regularization-based continual learning","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Zhao"},{"key":"ref129","article-title":"Stochastic convex optimization","volume-title":"Proc. Annu. Conf. Learn. Theory","author":"Shalev-Shwartz"},{"key":"ref130","article-title":"PaLM: Scaling language modeling with pathways","author":"Chowdhery","year":"2022"},{"key":"ref131","article-title":"LLaMA: Open and efficient foundation language models","author":"Touvron","year":"2023"},{"key":"ref132","article-title":"Measuring forgetting of memorized training examples","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Jagielski"},{"key":"ref133","article-title":"Mixout: Effective regularization to finetune large-scale pretrained language models","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Lee"},{"key":"ref134","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/P18-1031"},{"key":"ref135","doi-asserted-by":"publisher","DOI":"10.1016\/j.csl.2005.05.005"},{"key":"ref136","article-title":"Revisiting few-sample BERT fine-tuning","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Zhang"},{"key":"ref137","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.acl-short.108"},{"key":"ref138","article-title":"How should pre-trained language models be fine-tuned towards adversarial robustness?","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Dong"},{"key":"ref139","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2020.emnlp-main.634"},{"key":"ref140","article-title":"Dissecting learning and forgetting in language model finetuning","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Zhang"},{"key":"ref141","article-title":"Understanding catastrophic forgetting in language models via implicit inference","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Kotha"},{"key":"ref142","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00780"},{"key":"ref143","first-page":"62581","article-title":"Model tailor: Mitigating catastrophic forgetting in multi-modal large language models","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Zhu"},{"key":"ref144","first-page":"60766","article-title":"Learning and forgetting unsafe examples in large language models","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Zhao"},{"key":"ref145","article-title":"How well does self-supervised pre-training perform with streaming data?","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Hu"},{"key":"ref146","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19809-0_40"},{"key":"ref147","doi-asserted-by":"publisher","DOI":"10.1109\/ICME52920.2022.9859995"},{"key":"ref148","doi-asserted-by":"publisher","DOI":"10.1109\/SP46215.2023.10179300"},{"key":"ref149","article-title":"Quantifying memorization across neural language models","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Carlini"},{"key":"ref150","article-title":"Achieving forgetting prevention and knowledge transfer in continual learning","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Ke"},{"key":"ref151","article-title":"Pretrained language model in continual learning: A comparative study","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Wu"},{"key":"ref152","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2022.emnlp-main.410"},{"key":"ref153","doi-asserted-by":"publisher","DOI":"10.48550\/ARXIV.1706.03762"},{"key":"ref154","article-title":"An image is worth 16 x 16 words: Transformers for image recognition at scale","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Dosovitskiy"},{"key":"ref155","first-page":"60","article-title":"Continual learning with foundation models: An empirical study of latent replay","volume-title":"Proc. Conf. Lifelong Learn. Agents","author":"Ostapenko"},{"key":"ref156","article-title":"An empirical investigation of the role of pre-training in lifelong learning","author":"Mehta","year":"2021"},{"key":"ref157","article-title":"Effect of scale on catastrophic forgetting in neural networks","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Ramasesh"},{"key":"ref158","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-024-02218-0"},{"key":"ref159","article-title":"Memory efficient continual learning with transformers","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Ermis"},{"key":"ref160","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00024"},{"key":"ref161","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19809-0_36"},{"key":"ref162","article-title":"S-prompts learning with pre-trained transformers: An occam\u2019s razor for domain incremental learning","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Wang"},{"key":"ref163","article-title":"Progressive prompts: Continual learning for language models","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Razdaibiedina"},{"key":"ref164","article-title":"Learning to adapt to evolving domains","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Liu"},{"key":"ref165","article-title":"Adapting to continuously shifting domains","author":"Bobu","year":"2018"},{"key":"ref166","first-page":"11172","article-title":"Lifelong domain adaptation via consolidated internal distribution","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Rostami"},{"key":"ref167","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19830-4_8"},{"key":"ref168","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v35i3.16370"},{"key":"ref169","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00442"},{"key":"ref170","doi-asserted-by":"publisher","DOI":"10.1109\/CVPRW56347.2022.00418"},{"key":"ref171","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00885"},{"key":"ref172","article-title":"CoSDA: Continual source-free domain adaptation","author":"Feng","year":"2023"},{"key":"ref173","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-43148-7_2"},{"key":"ref174","article-title":"Tent: Fully test-time adaptation by entropy minimization","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Wang"},{"key":"ref175","first-page":"16888","article-title":"Efficient test-time model adaptation without forgetting","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Niu"},{"key":"ref176","first-page":"27253","article-title":"Note: Robust continual test-time adaptation against temporal correlation","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Gong"},{"key":"ref177","article-title":"Towards stable test-time adaptation in dynamic wild world","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Niu"},{"key":"ref178","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-024-02181-w"},{"key":"ref179","article-title":"MECTA: Memory-economic continual test-time model adaptation","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Hong"},{"key":"ref180","article-title":"MEMO: Test time robustness via adaptation and augmentation","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Zhang"},{"key":"ref181","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00706"},{"key":"ref182","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00744"},{"key":"ref183","article-title":"AUTO: Adaptive outlier optimization for online test-time OOD detection","author":"Yang","year":"2023"},{"key":"ref184","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v37i6.25922"},{"key":"ref185","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01147"},{"key":"ref186","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19827-4_26"},{"key":"ref187","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00349"},{"key":"ref188","first-page":"1","article-title":"On catastrophic forgetting and mode collapse in generative adversarial networks","volume-title":"Proc. Int. Joint Conf. Neural Netw.","author":"Thanh-Tung"},{"key":"ref189","article-title":"Generative adversarial network training is a continual learning problem","author":"Liang","year":"2018"},{"key":"ref190","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00361"},{"key":"ref191","doi-asserted-by":"publisher","DOI":"10.1109\/WACV51458.2022.00368"},{"key":"ref192","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v36i6.20556"},{"key":"ref193","article-title":"Momentum adversarial distillation: Handling large distribution shifts in data-free knowledge distillation","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Do"},{"key":"ref194","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00752"},{"key":"ref195","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00285"},{"key":"ref196","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00228"},{"key":"ref197","doi-asserted-by":"publisher","DOI":"10.1016\/j.neucom.2020.02.115"},{"key":"ref198","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2021.3096457"},{"key":"ref199","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-20050-2_31"},{"key":"ref200","doi-asserted-by":"publisher","DOI":"10.1613\/jair.1.13673"},{"key":"ref201","article-title":"Transient non-stationarity and generalisation in deep reinforcement learning","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Igl"},{"key":"ref202","first-page":"1120","article-title":"Model-free generative replay for lifelong reinforcement learning: Application to starcraft-2","volume-title":"Proc. 1st Conf. Lifelong Learn. Agents","author":"Daniels"},{"key":"ref203","article-title":"Building a subspace of policies for scalable continual learning","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Gaya"},{"key":"ref204","first-page":"1126","article-title":"Model-agnostic meta-learning for fast adaptation of deep networks","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Finn"},{"key":"ref205","first-page":"12073","article-title":"Federated continual learning with weighted inter-client transfer","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Yoon"},{"key":"ref206","first-page":"5132","article-title":"SCAFFOLD: Stochastic controlled averaging for federated learning","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Karimireddy"},{"key":"ref207","article-title":"Overcoming forgetting in federated learning on non-IID data","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst. Workshop","author":"Shoham"},{"key":"ref208","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00990"},{"key":"ref209","article-title":"Acceleration of federated learning with alleviated forgetting in local training","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Xu"},{"key":"ref210","first-page":"38461","article-title":"Preservation of the global knowledge by not-true distillation in federated learning","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Lee"},{"key":"ref211","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00361"},{"key":"ref212","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00982"},{"key":"ref213","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00992"},{"key":"ref214","article-title":"Better generative replay for continual federated learning","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Qi"},{"key":"ref215","doi-asserted-by":"publisher","DOI":"10.24963\/ijcai.2022\/303"},{"key":"ref216","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2019-2841"},{"key":"ref217","doi-asserted-by":"publisher","DOI":"10.24963\/ijcai.2021\/137"},{"key":"ref218","first-page":"16828","article-title":"The primacy bias in deep reinforcement learning","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Nikishin"},{"key":"ref219","first-page":"4006","article-title":"SIGUA: Forgetting may make learning with noisy labels more robust","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Han"},{"key":"ref220","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v34i04.5850"},{"key":"ref221","article-title":"The importance of forgetting","volume":"571","author":"Gravitz","year":"2019","journal-title":"Nature"},{"key":"ref222","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00245"},{"key":"ref223","article-title":"Fortuitous forgetting in connectionist networks","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Zhou"},{"key":"ref224","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00922"},{"key":"ref225","first-page":"1874","article-title":"Skin deep unlearning: Artefact and instrument debiasing in the context of melanoma classification","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Bevan"},{"key":"ref226","first-page":"9091","article-title":"Near-optimal task selection for meta-learning with mutual information and online variational Bayesian unlearning","volume-title":"Proc. Int. Conf. Artif. Intell. Statist.","author":"Chen"},{"key":"ref227","first-page":"22379","article-title":"AFEC: Active forgetting of negative transfer in continual learning","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Wang"},{"key":"ref228","doi-asserted-by":"publisher","DOI":"10.1109\/SP40001.2021.00019"},{"key":"ref229","article-title":"A survey of machine unlearning","author":"Nguyen","year":"2022"},{"key":"ref230","doi-asserted-by":"publisher","DOI":"10.1016\/j.clsr.2013.03.010"},{"key":"ref231","first-page":"10355","article-title":"DeltaGrad: Rapid retraining of machine learning models","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Wu"},{"key":"ref232","first-page":"18075","article-title":"Remember what you want to forget: Algorithms for machine unlearning","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Sekhari"},{"key":"ref233","first-page":"4126","article-title":"Machine unlearning via algorithmic stability","volume-title":"Proc. Conf. Learn. Theory","author":"Ullah"},{"key":"ref234","doi-asserted-by":"publisher","DOI":"10.24963\/ijcai.2022\/556"},{"key":"ref235","first-page":"3832","article-title":"Certified data removal from machine learning models","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Guo"},{"key":"ref236","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00932"},{"key":"ref237","article-title":"Variational Bayesian unlearning","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Nguyen"},{"key":"ref238","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01017"},{"key":"ref239","doi-asserted-by":"publisher","DOI":"10.1007\/11681878_14"},{"key":"ref240","doi-asserted-by":"publisher","DOI":"10.1145\/3319535.3363226"},{"key":"ref241","doi-asserted-by":"publisher","DOI":"10.1109\/TDSC.2022.3194884"},{"key":"ref242","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v36i8.20846"},{"key":"ref243","doi-asserted-by":"publisher","DOI":"10.1109\/INFOCOM48880.2022.9796974"},{"key":"ref244","article-title":"A unified and general framework for continual learning","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Wang"},{"key":"ref245","article-title":"Denoising diffusion probabilistic models","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Ho"},{"key":"ref246","article-title":"Photorealistic text-to-image diffusion models with deep language understanding","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Saharia"},{"key":"ref247","article-title":"Forget-me-not: Learning to forget in text-to-image diffusion models","author":"Zhang","year":"2023"},{"key":"ref248","article-title":"Selective amnesia: A continual learning approach to forgetting in deep generative models","author":"Heng","year":"2023"},{"key":"ref249","first-page":"2994","article-title":"Continual learning with deep generative replay","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Shin"},{"key":"ref250","article-title":"Learning to learn without forgetting by maximizing transfer and minimizing interference","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Riemer"},{"key":"ref251","first-page":"3478","article-title":"RMM: Reinforced memory management for class-incremental learning","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Liu"},{"key":"ref252","article-title":"LAMOL: Language modeling for lifelong language learning","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Sun"},{"key":"ref253","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58517-4_41"},{"key":"ref254","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00581"},{"key":"ref255","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00908"},{"key":"ref256","article-title":"Dataset condensation with gradient matching","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Zhao"},{"key":"ref257","article-title":"Supermasks in superposition","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Wortsman"},{"key":"ref258","first-page":"17492","article-title":"Parameter-level soft-masking for continual learning","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Konishi"},{"key":"ref259","first-page":"10734","article-title":"Forget-free continual learning with winning subnetworks","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Kang"},{"key":"ref260","article-title":"The lottery ticket hypothesis: Finding sparse, trainable neural networks","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Frankle"},{"key":"ref261","first-page":"8157","article-title":"NISPA: Neuro-inspired stability-plasticity adaptation for continual learning in sparse networks","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Gurbuz"},{"key":"ref262","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.753"},{"key":"ref263","article-title":"A model or 603 exemplars: Towards memory-efficient class-incremental learning","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Zhou"},{"key":"ref264","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01141"},{"key":"ref265","article-title":"BatchEnsemble: An alternative approach to efficient ensemble and lifelong learning","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Wen"},{"key":"ref266","article-title":"Continual learning with node-importance based adaptive group sparse regularization","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Jung"},{"key":"ref267","article-title":"Prompt gradient projection for continual learning","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Qiao"},{"key":"ref268","article-title":"Hebbian learning based orthogonal projection for continual learning of spiking neural networks","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Xiao"},{"key":"ref269","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v36i6.20634"},{"key":"ref270","article-title":"Subspace regularizers for few-shot class incremental learning","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Aky\u00fcrek"},{"key":"ref271","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00459"},{"key":"ref272","first-page":"5276","article-title":"Incremental few-shot learning with attention attractor networks","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Ren"},{"key":"ref273","first-page":"10852","article-title":"Xtarnet: Learning to extract task-adaptive representation for incremental few-shot learning","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Yoon"},{"key":"ref274","first-page":"6747","article-title":"Overcoming catastrophic forgetting in incremental few-shot learning by finding flat minima","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Shi"},{"key":"ref275","first-page":"1920","article-title":"Online meta-learning","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Finn"},{"key":"ref276","first-page":"9119","article-title":"Reconciling meta-learning and continual learning with online mixtures of tasks","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Jerfel"},{"key":"ref277","first-page":"11909","article-title":"Addressing catastrophic forgetting in few-shot problems","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Yap"},{"key":"ref278","first-page":"24556","article-title":"Variational continual Bayesian meta-learning","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Zhang"},{"key":"ref279","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00782"},{"key":"ref280","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00882"},{"key":"ref281","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-20044-1_13"}],"container-title":["IEEE Transactions on Pattern Analysis and Machine Intelligence"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/34\/10873290\/10752992.pdf?arnumber=10752992","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,2,6]],"date-time":"2025-02-06T01:04:39Z","timestamp":1738803879000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/10752992\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,3]]},"references-count":281,"journal-issue":{"issue":"3"},"URL":"https:\/\/doi.org\/10.1109\/tpami.2024.3498346","relation":{},"ISSN":["0162-8828","2160-9292","1939-3539"],"issn-type":[{"value":"0162-8828","type":"print"},{"value":"2160-9292","type":"electronic"},{"value":"1939-3539","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,3]]}}}