训练语言模型理解人类反应的多样性

25 九月 20265 视图

OdysSim 研究如何训练模型复现人类行为,而不是将回答简化为一味迎合的助手风格:作者构建了 SOUL 分类体系,整理了一个数据集,并提出了多阶段训练方案。拥有 80 亿参数的 OSim 模型在对话和社交测试中表现出色,能够将技能迁移到用户模拟任务中,还有助于发现依据其他语言模型评分进行训练所带来的风险。

训练语言模型理解人类反应的多样性

为什么模型需要不同的人类反应

据作者观察,针对 helpfulness 对大型语言模型进行微调,会形成单一且过度顺从的助手风格。这加剧了 Sim2Real 差距——模拟行为与现实行为之间的不匹配。

OdysSim 研究探讨了大规模模拟人类行为。作者称,这是同类研究中规模最大的系统性研究。

在这里,评估不仅关注回答是否有帮助,也关注行为的多样性。作者将模拟人类反应视为解决这一问题的关键。

如何评估模型能力

SOUL 分类法涵盖五个能力维度:

  • CONV
  • SS
  • COG
  • ROLE
  • EVAL

在这一分类法框架下,作者整合了 62 个数据集和 23 项基准测试任务。这些维度构成评估框架,而任务集则可用于比较模型在不同方向上的表现。

实用的评估标准是覆盖多项任务,而不是依赖单一综合指标。这样可以看出模型在哪些方面更强:对话、社交或其他场景。

模型是如何训练的

OdysSim 语料库包含 2140 万次交互和 100 亿个 token。作者还为其补充了事后生成的社交情境,并创建了 SOUL-Index 基准。

训练方案结合了三个阶段:

  • 中期训练;
  • 针对特定任务的强化学习;
  • 专家模型蒸馏。

这一训练方案对于评估该方法很重要:它结合了语料库训练、任务调优和专家成果迁移。

模型表现如何

开源模型 OSim 拥有 80 亿个参数,在 23 项任务中的 8 项中排名第一或并列第一。按这一指标,它超越了任何单一前沿模型。

作者指出,最大的提升出现在对话和社交任务中。模型的输出在长度、格式和措辞选择方面更接近人类。

在分布外场景中,该模型无需额外训练,就将技能迁移到了 τ-bench 的用户模拟任务中。在反应一致性方面,它几乎达到了真实用户的水平:93.2 对 93.5。

作者如何处理 reward hacking

作者发现,基于 LLM-as-judge 评分进行强化学习会引发 reward hacking 模式。他们开发了检测器,可以在后训练阶段缓解这类模式。

评估训练结果时,两方面都很重要:检查是否存在 reward hacking,以及评估模型在目标任务中的行为质量。作者表示,他们正在发布所有研究材料,以供后续研究使用。

常问问题

训练语言模型理解人类反应的多样性