MoE架构中的隐藏指标揭示LLM的虚假回答

29 八月 202619 视图

InnerExpert的新方法利用MoE模型中专家路由和分歧的特点,按token识别虚构片段。该方法无需人工标注即可训练,在五个数据集上,单次前向传播在答案级别达到最高0.91的准确率,在token级别达到0.76。

MoE架构中的隐藏指标揭示LLM的虚假回答

为什么LLM的虚假自信不仅仅是Bug

现代语言模型已经学会了流畅且令人信服地表达思想。但在这种说服力的背后,往往隐藏着专家们所称的幻觉:模型输出听起来合理、但实际上完全虚构的内容。对用户来说,这看起来像是一段平稳、自信的文本——而这正是问题危险的原因。

大多数常见的幻觉检测器工作方式都很粗糙。它们对整个回答或单个句子进行整体评估,给出类似“这里似乎有错误”的结论。但要弄清楚模型究竟在哪个位置“编造了事实”,需要更精细的检查——在单个token的层面上。只有逐token检测才能定位虚假片段,并精准干预生成过程,而不影响其余文本。

MoE模型意外提供了线索

Mixture-of-Experts(MoE)这类架构中,有一个有趣的原理:一次前向传播只激活稀疏的“专家”子集,而不是整个网络。选择调用哪些专家由路由机制完成。而正是在这个时刻,会产生一些稠密架构中根本不存在的内部信号:

  • 路由器的熵——模型对该调用哪个专家有多“不确定”;
  • 专家之间的分歧——它们的中间结果差异有多大;
  • 专家的使用模式——哪些专家更常被激活。

过去,这些信号几乎没有被用于检测幻觉。研究人员若昂·丰塞卡、罗德里戈·罗德里格斯和保罗·罗马诺在arXiv:2608.17687的文章中表明,这很可惜:隐藏的指标能够揭示模型开始编造的时刻。该工作于2026年8月18日提交至arXiv。

InnerExpert:一个深入模型内部的检测器

作者提出的InnerExpert方法结合了两类数据:MoE特有的路由层信号和标准的Transformer内部表示。所有这些被汇总为每个token的紧凑特征向量。然后,一个轻量级分类器处理这些向量,判断该token是否为幻觉。

关键特性是自动学习。训练检测器的标签由LLM-as-a-judge流水线生成,即一个语言模型评估另一个模型的输出。无需任何人工标注。这意味着检测器可以快速适配新版本的生成模型,只需重新运行一遍流水线即可。

测试结果

实验覆盖了五个数据集和两种不同的MoE架构。在测试中,InnerExpert稳定地超越了现有的检测器。最佳结果在整体回答层面达到0.91 AUROC,在单个token层面达到0.76 AUROC。而且只需一次前向传播即可完成——无需运行额外的验证模型或重复生成。

高水平的answer-level结果有助于粗粒度过滤。但真正有价值的指标是token-level:它能够精确定位文本中的虚假片段,例如重写它们或向用户高亮显示。这不再是“某处有错误”,而是回答中的具体位置。

为什么这很重要

幻觉仍然是LLM在医学、法学、金融和其他对错误敏感的领域落地的主要障碍之一。能够窥探模型的内部信号并提前发现它的“犹豫”——这是迈向透明生成的又一个实际步骤。隐藏的指标并不能完全解决问题,但提供了一个已经可用的实用工具。

另外有趣的是,幻觉诊断源于架构本身的特性。MoE模型是为了速度和效率而创建的,而它们的内部结构意外地被证明对质量控制很有用。未来的研究无疑会走得更深——探索专家内部和路由机制中更细微的信号。

常问问题

MoE架构中的隐藏指标揭示LLM的虚假回答