JUMP:微调扩散语言模型中的单遍私有数据审计

6 九月 202618 视图

新的JUMP方法可判断特定记录是否被用于扩散语言模型的微调:它掩蔽基础模型中置信度较低的位置,并通过一次前向传播将重建结果与目标模型进行比较。在MIMIR数据集上,AUROC准确率在LLaDA-8B-Base上提升至0.902,在Dream-v0-Base-7B上提升至0.942——且仅需三次模型运行,而SAMA需要32次。

JUMP:微调扩散语言模型中的单遍私有数据审计

公开模型隐私审计

公开权重很方便,但它们也带来了隐藏的风险。公司可以获取一个开放权重模型,并在内部数据(如通信记录、医疗数据或公司文档)上进行微调。用户通常不知道哪些具体记录进入了训练集,而对监管机构和客户来说,这是一个原则性问题。成员推断测试(membership inference)正是回答这个问题的:能否通过模型的行为判断出某段特定文本是否被用于适配训练。

这项任务的难点在于,我们通常只有微调后的检查点以及微调前的公开模型版本。通过比较两个检查点对同一文本片段的反应,可以尝试将微调的效果与模型的整体行为区分开来。

扩散语言模型的特点

经典的LLM从左到右逐个token地生成文本。离散扩散语言模型(dLLM)则不同:它们能够同时恢复多个被掩码的位置。模型不是进行序列预测,而是接收带有任意掩码集合的文本,并在一次前向传播中输出所有“空缺”位置的概率。

这种能力使dLLM在隐私审计中特别有吸引力。如果需要检查模型是否记住了某段特定内容,可以隐藏部分token并观察其反应。但问题在于:应该掩码哪些位置,以及如何解读模型的回答。

为什么简单的掩码平均化行不通

第一直觉是尝试大量不同的随机掩码并平均重建误差。这正是旧方法SAMA的做法:模型在数十个随机变体上运行,然后对信号进行平均。

这种方法有两个缺点。首先,随机掩码常常覆盖“无趣”的位置,这些位置即使没有微调,模型的预测也相同——有用的信号被淹没在噪声中。其次,每次运行都消耗资源:单个样本需要数十次模型前向传播,在大型数据集规模下会变成昂贵的操作。我们需要一种有意义地选择掩码的方法,而不是随机猜测。

置信度指示掩码位置

这篇新预印本论文的作者提出了JUMP(联合不确定性引导掩码探测)方法。其核心思想是利用参考模型——即微调前的检查点——作为“谎言检测器”。

首先,在原始文本上运行参考模型,找出其置信度最低的位置。假设这些位置在微调过程中变化最大:如果这些点上流动着特定信息,模型必然学会了它。然后,将这些低置信度位置全部一起掩码,目标模型通过一次查询重建它们。

接下来,比较目标模型与参考模型重建结果之间的差距。为了排除随机偏差,采用截断处理:只有超过某个阈值的差异才被纳入聚合。这种“截断”差距能更好地区分真实信号与噪声,而对信息丰富位置的联合掩码则节省了计算量。

结果:更少的推理次数——更高的准确率

作者在覆盖六个文本领域的MIMIR基准上进行了验证。实验对象是两款开放权重扩散模型:LLaDA-8B-Base和Dream-v0-Base-7B。

各领域平均来看,LLaDA的ROC-AUC指标从0.819提升到0.902,Dream则从0.851提升到0.942。这是归因准确率的显著提升。同时,JUMP每个样本仅需三次模型推理,而SAMA需要32次。换句话说,该方法不仅更准确,推理次数还少了一个数量级。

实际意义

所提出的方法表明,审计微调后的扩散模型无需盲目枚举掩码。只需询问参考模型哪里置信度不足,并将检查精确地引导到这些区域。这提供了一种工具,可用于开放权重模型的更新发布,以及验证个人数据合规要求。

该工作目前仍为预印本状态——共22页,当前版本v2发布于2026年8月18日。不过,问题本身的设定和强劲的结果让人期待该方法会有后续发展:适配其他类型的扩散架构,或增强对更激进微调场景的鲁棒性。

常问问题

JUMP:微调扩散语言模型中的单遍私有数据审计