SuperMemo-2间隔重复法:如何在不遗忘的情况下继续训练语言模型
当大型语言模型在新数据上继续训练时,它可能会丢失已经获得的知识。每个尝试在狭窄领域微调神经网络的人都会遇到这种现象:经过几步优化后,模型可能会“忘记”通用知识。缓解这个问题的经典方法是replay,即将旧样本混入训练集。但通常这种replay过于粗糙:旧数据和新数据只是按固定比例混合。所有旧样本被视为同等重要,尽管实际上有些知识会迅速流失,而另一些则能保持很久。
arXiv(2608.17530)上近期工作的作者提出将持续预训练重新构想为自适应重复规划的任务。模型不是一次性决定混入多少历史数据,而是在每个时刻选择哪些样本应重新进入训练。这使其能够响应记忆中的真实缺口,而不是遵循静态计划。

从卡片到模型参数
这个想法借鉴自认知科学,更确切地说,来自SuperMemo-2(SM-2)算法,该算法几十年来一直用于规划记忆卡片时的间隔重复。SM-2提示何时需要展示卡片,以便知识得到巩固而不消失。在新方法Spaced Repetition Training(SRT)中,这一原理被迁移到神经网络训练中。
SRT为每个训练样本维护自己的重复状态。为了了解模型对样本的记忆程度,使用perplexity——衡量模型预测数据的置信度。如果perplexity急剧上升,说明样本开始被遗忘,它就会被赋予高优先级以重新纳入训练。这种方法可以自动将“旧”样本(用于保持知识)和“新”样本(尚未巩固)都带回训练中。
重要的是,SRT不修改模型架构、损失函数或优化器。所有改动仅涉及数据采样策略。也就是说,该方法可以应用于现有训练流程之上,而无需大幅改造pipeline。
实验显示了什么
该方法在时间分割的Wikipedia和代码语料上进行了验证——即自然分为多个时期的数据。结果明显优于朴素微调和均匀replay。SRT在旧知识上恢复了5到37个百分点的准确率,而这些知识在朴素训练中被抹去了。同时,新数据上的性能没有下降,在某些情况下甚至有所提升。
尤其有趣的是在大模型上的表现:SRT在广泛基准上保持了均衡的性能,而朴素微调和普通replay则导致显著退化。这表明随着模型规模增大、数据和训练步骤增多,重复规划变得更加重要。

超越语言
有趣的是,这一原理不仅适用于文本。视觉和表格数据的实验表明:只要能量化recall信号——即判断模型是否在遗忘某个样本——重复规划就适用。实际上,这是一种不依赖模态的持续学习通用机制。
这项工作的主要结论是:放弃平均化replay,转而采用个性化重复计划,能在stability-plasticity平衡上带来显著收益。模型继续学习新内容,同时“复习材料”恰好发生在它开始遗忘的时候。这种方法看起来是迈向更有意义的大型语言模型微调的自然一步。



