注意力图的曲率揭示导致 LLM 产生幻觉的上下文故障

1 十月 202614 视图

这篇文章提出了一种单步不实回答检测器,依据注意力图中的信息流拓扑结构和 Forman–Ricci 曲率。作者表明,在自回归生成过程中,令牌之间的上下文传递异常会体现在连接结构中,从而能够在多个模型和基准测试中识别幻觉。

注意力图的曲率揭示导致 LLM 产生幻觉的上下文故障

将上下文故障作为分析对象

LLM 中的幻觉与因果生成过程中 token 之间的上下文交换受损有关。arXiv:2609.21096 于 2026 年 9 月 17 日发表,该研究探讨了这种联系。作者为 Amir Jalilifard、Anderson Rocha、Eric Wong、Marcos Medeiros Raimundo。

该研究分析注意力图内部信息流的拓扑模式,目标是区分产生幻觉的回答和未产生幻觉的回答。

方法的关键要素:

  • 分析对象是注意力图,而非生成好的回答文本。
  • 特征是 token 之间信息流的拓扑结构。
  • 任务是区分产生幻觉的回答和未产生幻觉的回答。

结论:上下文交换受损会在注意力图中留下可测量的结构性痕迹。

Forman-Ricci 曲率与信息瓶颈

该研究的关键测量指标是 Forman-Ricci 曲率。它能够识别出指向注意力图中信息瓶颈的结构模式。

该方法考虑注意力头信息流的半局部和全局特征。这些特征与产生幻觉的回答有关。

纳入计算的内容:

  • 注意力头信息流的半局部特征。
  • 注意力头信息流的全局特征。
  • 这些特征与产生幻觉的回答之间的关联。

实践标准:对整体信息流进行评估,包括半局部和全局特征,才能体现其价值。

产生幻觉的回答的三种标志

产生幻觉的回答具有典型的注意力运行模式。这些模式在 Transformer 的最后一层表现得最为明显。

模式信息流的表现最明显的位置
过度依赖自注意力token 只关注自身,而非交换上下文Transformer 的最后一层
分散地提取上下文从较早的 token 中收集信息,但缺乏焦点Transformer 的最后一层
信息过度压缩上下文流失去细节Transformer 的最后一层

结论:三种不同的注意力模式最终都指向同一点——上下文交换受损。

单次检查与基线方法的比较

该方法在多个 LLM 和广泛采用的基准测试上进行了评估。单次检查方法在两个幻觉检测基准测试中均稳定优于现有基线方法。

基线方法依赖注意力特征或多个回答。在不同 LLM 架构上,该方法也展现出具有竞争力的结果。

方法依据评估结果
基于 Forman-Ricci 曲率的方法注意力图的拓扑特征在两个基准测试中优于基线方法;在不同 LLM 架构上结果具有竞争力
基于注意力的基线方法注意力特征在两个基准测试中表现不及该方法
基于多个回答的基线方法多个回答在两个基准测试中表现不及该方法

实践标准:单次检查无需多个回答,并且适用于不同的 LLM 架构。

常问问题

注意力图的曲率揭示导致 LLM 产生幻觉的上下文故障