Évaluer les explications XAI à l’aide de LLM : vérifier leur concordance avec les évaluations humaines

27 septembre 202641 vues

L’article présente XAI-Arena, un système qui compare les explications de l’IA selon plusieurs critères, en tenant compte de différents modèles et des intérêts des utilisateurs. Les évaluations des LLM concordent fortement avec les jugements humains (ρ de Spearman = 0,693), ce qui indique qu’il est possible de faire évoluer l’analyse comparative des explications.

Évaluer les explications XAI à l’aide de LLM : vérifier leur concordance avec les évaluations humaines

Quel problème la recherche cherche-t-elle à résoudre

Les auteurs vérifient si les grands modèles de langage peuvent constituer un moyen reproductible et évolutif d’évaluer comparativement les explications XAI.

L’article « XAI-Arena: Can LLMs Assess the Quality of XAI Explanations? » a été publié sur arXiv sous la référence arXiv:2609.09428. Il a été soumis le 8 septembre 2026.

Les auteurs sont Yanfei Hu Fleischhauer, Alona Zharova, Nadja Klein et Stefan Feuerriegel. Ils ont présenté XAI-Arena, une approche de type LLM-as-a-judge pour l’évaluation multidimensionnelle des explications.

L’objectif principal de cette approche est de comparer la qualité des explications en tenant compte des intérêts de différentes parties prenantes. En pratique, il s’agit d’évaluer non pas une seule propriété de l’explication, mais plusieurs dimensions de sa qualité.

Quels critères l’évaluation prend-elle en compte

L’évaluation couvre huit dimensions :

  • simplicité perçue ;
  • clarté ;
  • adéquation à la tâche ;
  • calibration de la confiance ;
  • caractère exploitable ;
  • transparence ;
  • fidélité ;
  • interprétabilité globale.

Cet ensemble de critères permet d’examiner l’explication sous différents angles. Pour choisir un cadre d’évaluation, il est important de tenir compte des dimensions pertinentes pour la comparaison envisagée.

Dans quelle mesure les évaluations des LLM concordent-elles avec celles des humains

Les auteurs ont vérifié si les évaluations des LLM concordaient avec celles des humains. La vérification a montré une forte corrélation positive : Spearman’s rho = .693, p < .001.

Ce résultat indique une concordance des évaluations, mais pas une correspondance parfaite. Les LLM peuvent donc servir de base à une évaluation comparative, sans pour autant remplacer à l’identique les évaluations humaines.

À quelles comparaisons cette approche convient-elle

Les auteurs ont comparé des méthodes XAI sur différents jeux de données, modèles d’apprentissage automatique et profils de parties prenantes. Cette vérification couvre plusieurs contextes d’évaluation, et non un seul ensemble de conditions fixes.

Les auteurs concluent que les évaluations fondées sur les LLM mettent en évidence des différences systématiques de qualité entre les explications XAI et offrent une base évolutive et reproductible pour les comparer. Le critère pratique à prendre en compte est la nécessité de comparer les explications selon plusieurs dimensions et en tenant compte de différentes parties prenantes.

Foire aux questions

Matériaux connexes

Tous matériaux