模型回答中的“我确信”标注并非一种测量,而是另一个需要单独验证的断言。当这类评估被嵌入智能体的逻辑中时,就应当了解它们究竟有多可信。
为什么对置信度产生了疑问
智能体系统越来越多地采用这样的设计:下一步行动的选择会参考模型的自我评估——如果它声称高置信度,就执行动作;如果置信度低,就引入人类或其他工具。这种方案只有在一种条件下才成立:在行动时刻,所声称的置信度应当大致符合实际的命中频率。
Bhushan Kashinath Joshi 的研究(arXiv:2608.24691,2026年8月25日提交)检验的正是这一假设——而且是在一个失误会立刻显现、无法归咎于运气不佳的环境中进行的。
试验场:隐藏国王的国际象棋
经典国际象棋并不适合这种检验:那里一切公开,“置信度”不可避免地会与棋力混在一起。因此采用了带有隐藏信息的变体,其中国王身份可以秘密地、多次地从一枚棋子转移到另一枚棋子。玩家不知道主要目标当前在哪里,只能凭猜测行动。
方法的关键细节:每一步都单独询问智能体关于对方哪枚棋子秘密承载国王身份的概率分布。这一询问独立于行动本身——以免混淆“我走向哪里”和“我相信什么”。真实位置在棋局结束后被还原,并与所声称的数字进行比对。

六十二次中的一次正确
主要结果看起来像是一场事故。在两个独立的对局系列中,在声称对隐藏棋子位置的置信度不低于0.5时做出的吃子,62次中只有1次是正确的。换算成百分比,所声称的“多半是”概率,实际命中率约为百分之一点五——这是数量级的差距,而非几个百分点的差距。
与此同时,校准缺陷几乎完全集中在这些事件上:初始系列中为99.3%,重复系列中为98.7%。换言之,问题并非均匀地涂抹在整个对局中——它集中在模型特别大声宣称自己正确的时刻,而且恰恰是在冒险行动取决于它的时刻。
其他配置中的相同模式
作者并未局限于一个模型。检验还覆盖了另外四种配置,包括另一家提供商。这一图景以较弱的形式重复出现,并呈现出前后一致的顺序——但这里需要谨慎:只有点估计仍具可比性,而在这样的样本量下,大多数两两差异在统计上无法区分。
作者本人将此描述为发现的覆盖范围(scope),而非证明模型的能力水平能预测其校准度。也就是说,这既不是“模型越聪明,自我评估越好”,也不是相反的说法——只是这一现象比某一个具体系统更为普遍。

推理预算对指标的推动比看起来更大
另一个令人不快的议题是:在排行榜上外部评分不变的情况下,比较同一个模型。变化的只有推理预算(deliberation budget),即模型花多少“思考时间”。而这个变化对校准指标的推动,几乎与不同模型之间的巨大差距相当。
实际结论简单却令人不适:在为风险评估类任务选择系统时,不能以排行榜上的排名为依据。在同一个模型内部,由设置引起的离散程度,与我们习惯认为的一个模型对另一个模型的重大优势相当。
传统指标可能显示相反的结果
还有一个结果打击了惯常的测量方式。在某个单独的位置(seat)上,标准评估轴——走法的合法性、成本、延迟、完成对局的比例——可能与模型信念的质量完全背离。在所有传统指标上同时胜出的配置,却表现出所有受测者中最差的信念质量。
这里很容易在解读上出错:问题不在于准确和廉价本身有害。问题在于,我们通常认为完备的那套指标,根本没有测量我们感兴趣的那个属性——它测的是别的东西。
为什么“按结果”评估什么也抓不到
最令人不快的结果是掩盖。具有所述模式的模型仍然可能赢下那盘它构建了错误信念的对局。结果是好的,而内部的世界图景却是错误的。
由此可知,仅按结果检验(outcome-only)原则上无法发现这类故障:胜利关闭了问题,弱点留在系统中直到下一次——只不过是在一个可能不会出现正确结果的任务中。

在实践中该如何应对
从结果中直接得出的几条实用结论。
- 向模型询问其对关键未知项的自身概率分布——并将其与所选行动分开存储。不将这两者分离,就无法评估校准度。
- 在自己的数据上将所声称的置信度与实际命中频率进行比较,而不是相信模型卡片上的数字。在隐藏棋子的对局中,差距极其巨大,没有任何东西能保证在应用任务中它会更小。
- 将系统把决策移交给人类的阈值与总体准确率分开检验。失误恰恰聚集在高声称置信度的区域。
- 在任何比较中都固定推理预算。否则你测量的是设置,而不是模型。
- 不要把胜利或成功结果当作系统内部信念正确性的证明。
这一发现的总要义不在于模型“很糟”。而在于置信度和正确性是两个不同的指标,前者目前还不能替代后者。只要智能体架构围绕自我评估构建,这一差异就必须被明确地测量。



