为什么模型需要不同的人类反应
据作者观察,针对 helpfulness 对大型语言模型进行微调,会形成单一且过度顺从的助手风格。这加剧了 Sim2Real 差距——模拟行为与现实行为之间的不匹配。
OdysSim 研究探讨了大规模模拟人类行为。作者称,这是同类研究中规模最大的系统性研究。
在这里,评估不仅关注回答是否有帮助,也关注行为的多样性。作者将模拟人类反应视为解决这一问题的关键。
如何评估模型能力
SOUL 分类法涵盖五个能力维度:
- CONV
- SS
- COG
- ROLE
- EVAL
在这一分类法框架下,作者整合了 62 个数据集和 23 项基准测试任务。这些维度构成评估框架,而任务集则可用于比较模型在不同方向上的表现。
实用的评估标准是覆盖多项任务,而不是依赖单一综合指标。这样可以看出模型在哪些方面更强:对话、社交或其他场景。
模型是如何训练的
OdysSim 语料库包含 2140 万次交互和 100 亿个 token。作者还为其补充了事后生成的社交情境,并创建了 SOUL-Index 基准。

训练方案结合了三个阶段:
- 中期训练;
- 针对特定任务的强化学习;
- 专家模型蒸馏。
这一训练方案对于评估该方法很重要:它结合了语料库训练、任务调优和专家成果迁移。
模型表现如何
开源模型 OSim 拥有 80 亿个参数,在 23 项任务中的 8 项中排名第一或并列第一。按这一指标,它超越了任何单一前沿模型。
作者指出,最大的提升出现在对话和社交任务中。模型的输出在长度、格式和措辞选择方面更接近人类。
在分布外场景中,该模型无需额外训练,就将技能迁移到了 τ-bench 的用户模拟任务中。在反应一致性方面,它几乎达到了真实用户的水平:93.2 对 93.5。
作者如何处理 reward hacking
作者发现,基于 LLM-as-judge 评分进行强化学习会引发 reward hacking 模式。他们开发了检测器,可以在后训练阶段缓解这类模式。
评估训练结果时,两方面都很重要:检查是否存在 reward hacking,以及评估模型在目标任务中的行为质量。作者表示,他们正在发布所有研究材料,以供后续研究使用。



