自蒸馏恢复LLM丢失的性能:如何通过对齐隐藏空间对抗遗忘与压缩

7 九月 202629 视图

作者提出的SDFT方法帮助模型在微调、量化或剪枝导致的性能退化后恢复能力。通过CKA度量,研究人员证实性能恢复与学生和教师内部流形对齐相关。

自蒸馏恢复LLM丢失的性能:如何通过对齐隐藏空间对抗遗忘与压缩

大型语言模型很少以原始形态与用户见面。在部署之前,它需要经过对话场景的微调、压缩、量化,并舍弃部分权重。这些步骤中的每一步都能带来实际效益,但几乎总会留下痕迹:模型可能开始推理能力下降、遗忘罕见事实或失去风格感。问题在于,是否有可能在不使用海量数据集进行完整重训练的情况下,恢复这些能力。

为什么微调和压缩后质量会受损

灾难性遗忘通常伴随着监督微调(SFT)。模型为了适应新的回答格式而被调整,权重的更新会无意中覆盖部分旧知识。量化和剪枝的作用方式则不同:它们节省内存并加速推理,但会用近似计算取代精确计算,并关闭部分连接。结果不仅是模型的行为发生变形,其内部的知识表征也随之改变。

外部症状可能各不相同——从事实准确性下降到回答千篇一律。但根本原因是共同的:模型“思考”所依赖的隐藏空间结构,不再与原始版本的结构相匹配。

用自蒸馏代替重新训练

在论文 arXiv:2604.15794 中,研究人员提出了自蒸馏微调(SDFT)框架。其核心思想是利用模型自身作为恢复的来源。受损版本充当学生,而其“健康”版本——即压缩前或 SFT 前保存的版本——则充当教师。在微调阶段,学生调整自己的回答和内部状态,以接近教师。

这不是传统意义上从大模型向小模型的知识迁移。在这里,教师和学生实际上是同一架构在不同生命阶段的体现。因此,这个过程被称为自蒸馏:模型并未学习任何全新的东西,而是找回自己失去的内部一致性。

隐藏流形对齐揭示了什么

作者认为,LLM 的生成能力从根本上依赖于隐藏层所形成的高维流形。模型的质量并非由单个神经元决定,而是取决于该空间中激活的排布方式。可以将其想象成点云:一个训练良好的模型,其点云具有独特的结构,而压缩或遗忘则会破坏这种结构。

为了衡量恢复程度,该研究采用了中心核对齐(CKA)——一种衡量教师与学生内部表征相似度的指标。CKA 的便利之处在于它对正交变换和缩放具有不变性。它不会苛求均匀的旋转或坐标拉伸,而能精准捕捉激活配置的变化。

实验表明,性能恢复与 CKA 对齐度的提升之间存在很强的相关性。学生的流形越接近教师的流形,模型恢复丢失技能的效果就越好。这证实了:自蒸馏并非偶然生效,而是因为它对齐了隐藏空间的几何结构。

实际结论

通过蒸馏来恢复模型这一想法本身并不新鲜。该方法的新颖之处在于解释了其生效的原因,并提供了一种验证该解释的手段。CKA 可以成为一种诊断工具:如果量化或剪枝后对齐度急剧下降,则表明模型需要“修复”。而 SDFT 则能在不回到完整训练周期的情况下完成这种修复。

该研究将实用的性能恢复框架与表征的几何理论相结合。这让我们更清晰地认识到 LLM 在压缩过程中内部发生了什么,以及为什么自蒸馏能够恢复已失去的能力。

常问问题

自蒸馏恢复LLM丢失的性能:如何通过对齐隐藏空间对抗遗忘与压缩