当“被遗忘”的内容卷土重来
大型语言模型的遗忘机制通常看起来效果显著:在执行删除不需要的信息的程序后,模型不再输出涉及被禁止主题的文本。但这种清理很少是持久的。如果在清理之后,用一小部分正是那些被遗忘的数据进行常规的微调,知识几乎不费吹灰之力就能恢复。基于TOFU数据集的实验表明,仅用二十个被遗忘的样本进行继续训练,就能显著恢复所有已知遗忘方法在目标集上的指标。问题不在于具体技术的质量,而在于优化过程的特性:遗忘程序之后会形成一种特殊的损失几何结构,重复训练很容易通过它开辟出一条回归之路。

边际断崖:知识回归的统一场景
科学家们分析了十四种事后遗忘方法——基于梯度的、基于偏好的和基于蒸馏的——的行为,并发现了一种奇怪的规律。对于每种方法和模型规模,都可以在单个词元级别上测量回答的边际,即模型偏好一个词元而非另一个词元的余量。结果表明,遗忘之后,这个边际几乎总是收敛到一个狭窄的条带中,该条带略高于由保留(retain)数据集设定的水平。这种现象出现在42种可能的方法-模型规模组合中的41种中,因此得名“边际断崖”——类比于地质断崖,其后空无一物。

断崖为何出现
从数学上可以证明,当与retain集的联系将被遗忘内容的诊断性logits保持在某个阈值以上时,断崖就会出现。这足以让优化停止:词元饱和方法的原始损失函数达到一个驻点,尽管遗忘尚未得到保证。对42个实验单元中的34个进行的验证证实,正是损失的饱和造成了那种“虚假的成功”,使得知识的回归变得轻而易举。
Margin Calibration:如何修复断崖
论文作者提出了一种名为Margin Calibration(MC)的插件式修正方法。这不是一种独立的遗忘方法,而是一个附加模块,可以叠加在任何现有方法之上。MC不依赖饱和损失,而是添加了一个非饱和的边际合页损失:它将特定词元的逐词元边际与在retain数据上获得的参考回答的边际进行比较。此外,在与原始训练分布无关的指令语料库上应用了一个KL探针。通过这种混合压力,能够在原始损失“卡在”驻点的地方恢复遗忘侧的信号强度。
理论部分增加了可信度:如果来自不同组件的梯度在主导性上对齐,那么MC的驻点集位于与断崖相交的一侧。这使得可以估计攻击者提升边际的预算上限:如果攻击者试图重复训练,他们将不得不面对严重的阻力,而不是沿着抛光过的斜坡滑过。
结果:战胜攻击与代价问题
MC的有效性在三个基准上进行了测试:使用三种Llama-3模型规模和三种遗忘级别的TOFU、Llama-2-7B-hf上的MUSE-News以及一个独立的Phi-3.5面板。在不针对具体案例调整配置的情况下,该插件式修正方法赢得了所有14次forget聚合器的配对比较,并填满了重复训练测试的所有可用单元。数字不言自明:攻击后面板平均ROUGE-L指标从0.41下降到0.18——即使试图“重新训练”模型,它也几乎不再复现被遗忘的文本。此外,MC在14个案例中的13个中降低了原始成员推断AUC(用于判断数据是否属于训练集的指标)。

然而,也有另一面。在所有实验中,都观察到模型在retain侧的效用下降:该插件使遗忘更深入,但模型在处理与保留知识相关的任务时表现也更差。这种权衡必须纳入应用场景的考量:对于retain数据性能至关重要的任务,将需要调整阈值或采用更轻的正则化。
无需retain参考的生产级方案
上述MC方案依赖于从在retain数据上训练的“参考”回答中获得的参考边际。但在实践中,通常无法访问原始训练分布。针对这种情况,提供了一种单独的部署变体:它可以在不使用retain训练参考的情况下实现相同的改进,用先验设定的阈值或来自通用指令语料库的对照边际来替代。这使得该方法适用于实际产品,在这些产品中,用于遗忘的数据已从系统中删除,恢复参考是不可能的或受隐私政策禁止的。
结论
这项研究的主要实践结论是:如果不考虑优化几何结构,语言模型的遗忘就不能被认为是可靠的。“边际断崖”解释了为什么许多在纸面上看起来很漂亮的方法甚至经不起微弱的重复训练攻击,并指明了未来工作的方向。Margin Calibration是首批有针对性地对抗这一现象的插件之一,虽然它目前还不能无副作用地解决问题,但它设定了一个正确的框架:与其想着“一次遗忘,永远遗忘”,不如考虑创建这样一个损失景观,在其中被遗忘内容的回归变得无利可图且能量消耗高昂。



