借助 LLM 评判 XAI 解释:基于与人类判断一致性的验证

27 九月 202641 视图

本文介绍了 XAI-Arena,这是一套从多个标准比较 AI 解释的系统,同时考虑不同模型和用户的关注点。LLM 的评分与人类判断显著一致(Spearman ρ = 0.693),表明解释的比较分析有望实现规模化。

借助 LLM 评判 XAI 解释:基于与人类判断一致性的验证

研究解决什么问题

作者检验大型语言模型能否成为一种可复现、可扩展的 XAI 解释比较评估方法。

论文《XAI-Arena:LLM 能否评估 XAI 解释的质量?》以 arXiv:2609.09428 的编号发表于 arXiv。论文于 2026 年 9 月 8 日提交。

作者为 Yanfei Hu Fleischhauer、Alona Zharova、Nadja Klein 和 Stefan Feuerriegel。他们提出了 XAI-Arena,这是一种采用 LLM-as-a-judge 模式对解释进行多维评估的方法。

该方法的核心任务是根据不同利益相关方的关注点比较解释质量。实践中的重点是:不仅评估解释的一项特性,还要评估多个质量维度。

评估考虑哪些标准

评估涵盖八个维度:

  • 感知简洁性;
  • 清晰度;
  • 任务适配性;
  • 信任校准;
  • 可操作性;
  • 透明度;
  • 忠实度;
  • 整体可解释性。

这组标准有助于从不同角度考察解释。选择评估方案时,重要的是考虑这些维度中哪些适用于比较任务。

LLM 评估与人工评估的一致程度如何

作者检验了 LLM 评估与人工评估的一致性。结果显示二者存在显著正相关:Spearman’s rho = .693,p < .001。

这一结果表明评估具有一致性,但并非完全相同。因此,可以将 LLM 视为比较评估的基础,而不是人类评估的完全等同替代品。

这种方法适用于哪些比较

作者在不同数据集、机器学习模型和利益相关方画像下比较了 XAI 方法。这项检验涵盖了多个评估情境,而非一组固定条件。

作者得出结论:基于 LLM 的评估能够揭示 XAI 解释质量的系统性差异,并为比较提供可扩展、可复现的基础。实践中的选择标准是:是否需要考虑不同利益相关方,并从多个维度对解释进行比较。

常问问题

借助 LLM 评判 XAI 解释:基于与人类判断一致性的验证