Appearance
Catastrophic Forgetting
Catastrophic Forgetting (灾难性遗忘) 是神经网络在学习新任务时,对先前已学习任务的性能急剧下降的现象。这一现象由 McCloskey & Cohen 于 1989 年首次系统描述,是实现 Continual Learning (持续学习 / 终身学习) 的核心障碍。
核心概念
灾难性遗忘的本质
神经网络的参数在训练新任务时会覆盖旧任务学到的有效权重配置。这种“用进废退”的特性源于深度网络的过参数化:同一组参数通常参与多个任务的表示,新任务的优化会打乱这些共享表示。
Stability-Plasticity Dilemma (稳定性-可塑性困境)
| 维度 | 含义 | 对立面 |
|---|---|---|
| Stability (稳定性) | 保持已学习的旧知识 | 参数不变化 → 无法学习新任务 |
| Plasticity (可塑性) | 快速学习新知识的能力 | 参数随意变化 → 遗忘旧任务 |
理想的持续学习系统需要同时具备高稳定性和高可塑性,但两者在资源有限的情况下存在本质矛盾。
主要解决方案
1. 正则化方法 (Regularization-based)
在学习新任务时约束重要权重的变化:
- EWC (Elastic Weight Consolidation):通过 Fisher 信息矩阵识别对旧任务重要的权重,在新任务优化时给这些权重加上大的惩罚项
- Synaptic Intelligence (SI):在线计算权重重要性,无需计算 Fisher 矩阵,更适合大规模模型
- Memory Aware Synapses (MAS):基于输出变化而非损失函数梯度估计权重重要性
2. 回放方法 (Replay-based)
存储并重播旧任务的样本,与新任务一起训练:
- Experience Replay: 简单的缓冲区循环,随机抽取旧样本与新样本混合训练
- iCaRL: 精选具有代表性的旧类别样本,结合最近类均值 (NCM) 分类器
- Generative Replay: 使用生成模型(如 GAN、VAE)合成旧任务样本,无需存储原始数据
3. 架构方法 (Architecture-based)
通过模型结构设计隔离不同任务的参数:
- Progressive Neural Networks: 每个新任务增加一列新网络,旧网络完全冻结,通过横向连接利用旧知识
- PathNet: 使用进化算法为每个任务选择一条独立的参数路径
- Adapter / LoRA: 为每个任务添加小型适配器模块,基座模型参数保持不变
4. 梯度方法 (Gradient-based)
约束梯度方向不损害旧任务:
- GEM (Gradient Episodic Memory): 存储旧任务的梯度,确保新任务梯度与旧任务梯度的夹角不大于 90°
- A-GEM: GEM 的高效近似版本,降低计算开销
关键论文
| 论文 | 作者 | 年份 | 核心贡献 |
|---|---|---|---|
| "Overcoming catastrophic forgetting in neural networks" | Kirkpatrick et al. | 2017 (PNAS) | 提出 EWC,贝叶斯视角保护重要权重 |
| "Progressive Neural Networks" | Rusu et al. | 2016 | 横向连接新列网络,冻结旧网络参数 |
| "Learning without Forgetting" | Li & Hoiem | 2017 (ECCV) | 蒸馏方法保持旧任务输出不变 |
| "iCaRL" | Rebuffi et al. | 2017 (CVPR) | 范例回放 + 最近类均值分类器 |
| "Gradient Episodic Memory" | Lopez-Paz & Ranzato | 2017 | 约束梯度方向不增加旧任务损失 |
重要框架与工具
- Avalanche: 持续学习研究框架,集成多种基线方法与评估指标
- ContinualAI: 持续学习社区与资源聚合平台
- PyCIL: 类增量学习工具包
与相关概念的关系
- Catastrophic Forgetting vs Transfer Learning: 正迁移帮助新任务学习,但负迁移/遗忘是副作用
- Multi-Task Learning vs Continual Learning: MTL 同时优化所有任务,CL 顺序学习;MTL 是 CL 的性能上界
- Meta-Learning vs CL: 元学习可学习快速适应新任务而不遗忘
- Neuroscience: EWC 灵感来自哺乳动物大脑中的突触巩固机制
实际应用与挑战
- 个性化 LLM: 在用户特定数据上微调时保持通用能力
- 推荐系统: 新用户/新物品的增量学习不影响旧用户体验
- 自动驾驶: 新场景适应时保持已有场景的驾驶能力
- 核心挑战: 存储和计算开销随任务数量增长,难以扩展到成千上万个任务
Sources
- Kirkpatrick et al., "Overcoming catastrophic forgetting in neural networks" (PNAS 2017)
- De Lange et al., "A Continual Learning Survey: Defying Forgetting in Classification Tasks" (TPAMI 2019)
- Rusu et al., "Progressive Neural Networks" (arXiv 2016)
- Rebuffi et al., "iCaRL: Incremental Classifier and Representation Learning" (CVPR 2017)
- Avalanche: https://github.com/ContinualAI/avalanche