Судейство XAI-объяснений с помощью LLM: проверка на согласии с людьми

27 сентября 202640 просмотров

В статье представлен XAI-Arena — система, которая сравнивает объяснения ИИ по нескольким критериям, учитывая разные модели и интересы пользователей. Оценки LLM заметно согласуются с человеческими суждениями (ρ Спирмена = 0,693), что указывает на возможность масштабировать сравнительный анализ объяснений.

Судейство XAI-объяснений с помощью LLM: проверка на согласии с людьми

Какую задачу решает исследование

Авторы проверяют, могут ли большие языковые модели стать воспроизводимым и масштабируемым способом сравнительной оценки XAI-объяснений.

Статья «XAI-Arena: Can LLMs Assess the Quality of XAI Explanations?» опубликована на arXiv как arXiv:2609.09428. Её подали 8 сентября 2026 года.

Авторы — Yanfei Hu Fleischhauer, Alona Zharova, Nadja Klein и Stefan Feuerriegel. Они представили XAI-Arena — подход формата LLM-as-a-judge для многомерной оценки объяснений.

Ключевая задача подхода — сравнивать качество объяснений с учётом интересов разных заинтересованных сторон. Практический ориентир: оценивать не только одно свойство объяснения, но и несколько измерений качества.

Какие критерии учитывает оценка

Оценка охватывает восемь измерений:

  • perceived simplicity — воспринимаемая простота;
  • clarity — ясность;
  • task adequacy — соответствие задаче;
  • trust calibration — калибровка доверия;
  • actionability — применимость для действий;
  • transparency — прозрачность;
  • faithfulness — верность;
  • overall interpretability — общая интерпретируемость.

Набор критериев позволяет рассматривать объяснение с разных сторон. При выборе схемы оценки важно учитывать, какие из этих измерений соответствуют задаче сравнения.

Насколько оценки LLM согласуются с оценками людей

Авторы проверили оценки LLM на соответствие человеческим оценкам. Проверка показала сильную положительную связь: Spearman’s rho = .693, p < .001.

Результат указывает на согласованность оценок, но не на их полное совпадение. Поэтому LLM можно рассматривать как основу для сравнительной оценки, а не как тождественную замену человеческим оценкам.

Для каких сравнений подходит подход

Авторы сравнивали методы XAI на разных наборах данных, моделях машинного обучения и персонах заинтересованных сторон. Такая проверка охватывает несколько контекстов оценки, а не один фиксированный набор условий.

Авторы заключают, что оценки на основе LLM выявляют систематические различия в качестве XAI-объяснений и дают масштабируемую, воспроизводимую основу для сравнения. Практический критерий выбора — необходимость сопоставлять объяснения по нескольким измерениям и с учётом разных заинтересованных сторон.

Часто задаваемые вопросы

Похожие материалы

Все материалы
XAI-Arena: как LLM оценивают качество объяснений ИИ