DSPA 在生成过程中根据偏好调整语言模型的回答

26 九月 202613 视图

该方法将查询特征与 SAE 方向关联,并将其应用于令牌的激活表示,而无需重新训练基础模型。在 Gemma-2 和 Qwen3 上的测试表明,MT-Bench 的表现有所提升;在偏好数据量较少时,DSPA 用于对齐所需的计算量最多比 RAHF-SCIT 流程少 4.47 倍。

DSPA 在生成过程中根据偏好调整语言模型的回答

什么是 DSPA

DSPA(Dynamic SAE Steering for Preference Alignment,偏好对齐的动态 SAE 引导)是一种在推理阶段进行偏好对齐的方法。它不会更新基础模型的权重,而是利用偏好数据来引导生成。

该方法需要 preference triples。DSPA 根据这些数据构建一张地图,将提示特征与生成控制特征关联起来。

DSPA 如何改变生成过程

在解码过程中,该方法只修改当前 token 激活的潜变量,不会触及其他潜变量。

主要步骤:

  1. DSPA 获取 preference triples。
  2. 构建提示特征与控制特征之间的 conditional-difference map。
  3. 在解码过程中修改当前 token 激活的潜变量。

实验结果

在 Gemma-2-2B/9B 和 Qwen3-8B 上,该方法提升了 MT-Bench 上的结果。在 AlpacaEval 上,DSPA 展现出竞争力,并在多项选择任务中保持了准确率。

在偏好数据有限的情况下,该方法仍然稳定,并可与两阶段流程 RAHF-SCIT 相抗衡。DSPA 用于对齐所需的 FLOPs 最多减少了 4.47×。

该论文已被 EMNLP 2026 Main Conference 接收。结果仅适用于所述模型和任务。

该方法使用哪些信号

对已修改 SAE 特征的审计表明,偏好方向主要与话语和风格信号相关。

论文还提出了一套理论,对 conditional-difference map 的估计作进一步阐释。该理论描述了 top-k 消融在什么条件下具有合理性。

何时考虑使用 DSPA

对于需要在不更新基础模型权重的情况下对齐偏好的任务,可以考虑使用该方法。该方法需要 preference triples。

实际评估时,可将任务与 MT-Bench、AlpacaEval 和多项选择任务上的结果进行对照。与 RAHF-SCIT 比较时,还应单独考虑对齐阶段的 FLOPs。

常问问题

DSPA 在生成过程中根据偏好调整语言模型的回答