Какую задачу решает исследование
Авторы проверяют, могут ли большие языковые модели стать воспроизводимым и масштабируемым способом сравнительной оценки XAI-объяснений.
Статья «XAI-Arena: Can LLMs Assess the Quality of XAI Explanations?» опубликована на arXiv как arXiv:2609.09428. Её подали 8 сентября 2026 года.
Авторы — Yanfei Hu Fleischhauer, Alona Zharova, Nadja Klein и Stefan Feuerriegel. Они представили XAI-Arena — подход формата LLM-as-a-judge для многомерной оценки объяснений.

Ключевая задача подхода — сравнивать качество объяснений с учётом интересов разных заинтересованных сторон. Практический ориентир: оценивать не только одно свойство объяснения, но и несколько измерений качества.
Какие критерии учитывает оценка
Оценка охватывает восемь измерений:
- perceived simplicity — воспринимаемая простота;
- clarity — ясность;
- task adequacy — соответствие задаче;
- trust calibration — калибровка доверия;
- actionability — применимость для действий;
- transparency — прозрачность;
- faithfulness — верность;
- overall interpretability — общая интерпретируемость.
Набор критериев позволяет рассматривать объяснение с разных сторон. При выборе схемы оценки важно учитывать, какие из этих измерений соответствуют задаче сравнения.
Насколько оценки LLM согласуются с оценками людей
Авторы проверили оценки LLM на соответствие человеческим оценкам. Проверка показала сильную положительную связь: Spearman’s rho = .693, p < .001.
Результат указывает на согласованность оценок, но не на их полное совпадение. Поэтому LLM можно рассматривать как основу для сравнительной оценки, а не как тождественную замену человеческим оценкам.
Для каких сравнений подходит подход
Авторы сравнивали методы XAI на разных наборах данных, моделях машинного обучения и персонах заинтересованных сторон. Такая проверка охватывает несколько контекстов оценки, а не один фиксированный набор условий.
Авторы заключают, что оценки на основе LLM выявляют систематические различия в качестве XAI-объяснений и дают масштабируемую, воспроизводимую основу для сравнения. Практический критерий выбора — необходимость сопоставлять объяснения по нескольким измерениям и с учётом разных заинтересованных сторон.



