为什么要检查检查点,而不只是它们的回答
在准备将开源模型部署上线时,了解谁以及如何修改了它非常重要。除了常规的微调之外,还有一种**消融(abliteration)**技术——它能精准地从激活中清除对有害请求的拒绝信号。模型在外观上仍与原始版本相似,但实际上其内部“刹车”已失效。通过生成结果来发现这种干预很困难:运行时防护措施会运行测试提示并评估回答,而不是检查工件本身。如果有害场景未包含在测试集中,这种修改就不会被注意到。因此,对权重的诚实审计应在推理之前进行,而非推理过程中。
两条检查轴线:激活间隙与权重痕迹
一项在密码学与安全领域发表的研究描述了一种廉价的双信号审计方法,它无需调整阈值,也不依赖外部行为测试。可疑的检查点会与一个经过认证的参考(attested reference)在两条轴线上进行比较:
- 参考锚定的激活拒绝间隙(Reference-anchored activation refusal-gap) — 候选模型与参考模型之间,与拒绝相关的激活之间的间隙。如果消融抹去了拒绝模式,该间隙的表现会不同于诚实的微调。
- 权重恢复能量(Weight-recovery energy) — 恢复权重所需的能量:即需要多大的参数变化才能将候选模型恢复到基础版本。这个信号甚至能捕捉到那些在激活上几乎不体现的干预。
这两个信号呈负相关,因此它们组合的z统计量比每条轴线单独使用更具信息量。第一条轴线负责特异性:它显示拒绝机制本身是否被触及。第二条轴线负责完整性:它防止修改被隐藏在不易察觉的权重调整中。

该方法在实践中可靠性如何
该审计在一个包含273个检查点的注册表上进行了验证,覆盖了不同的开源架构。在样本内,组合的z信号几乎无误地将57个公开的消融案例与37个常规的微调、合并及指令调整案例区分开来:AUROC为0.95。单独使用这些信号时,效果明显较差——分别为0.84和0.90。更有趣的是,根据约登指数校准的阈值可以迁移到新的、未曾见过的模型家族。在那里,平衡准确率为0.89,误报率为0.11。在57个消融案例中,该方法仅漏掉了4个——作为初步过滤器,这是一个不错的结果。
弱点:当两条轴线都被欺骗时
没有任何基于双信号的审计能覆盖所有攻击场景。作者诚实地列出了两类失败情况。
第一类——伪造的参考。 如果攻击者控制了参考点,他们可以挑选一个基准,使得基础版本到候选版本的差异在构造上即为零。这样甚至不需要训练模型:两条轴线都会显示正常。
第二类——针对阈值的白盒攻击。 如果权重所有者对模型有完全访问权限,他们可以专门微调检查点,使其落在决策边界之外,但同时在防护措施看来仍不安全,并保持连贯性。
正因如此,作者称该方法为有效的**分诊(triage)**工具,而非针对干预的防御手段。它能够快速筛除明显干净和明显可疑的检查点,但不能作为唯一的安全屏障。

结论:用于第一道过滤的工具
双信号检查的优点在于,它仅需要一个受信任的参考和两次廉价的测量,并且结果易于针对特定注册表进行校准。主要限制在于对经过认证的基准的依赖,以及易受针对性白盒攻击的弱点。此外,统计数据目前仅基于一个注册表收集,因此在差异很大的架构上,准确性可能会发生变化。尽管如此,对于开源权重生态系统来说,这是一个实用的步骤:过去必须在表面的生成测试和完整的逆向工程之间做出选择,而现在出现了一个中间选项,可以用作第一道过滤器。



