Evaluación de explicaciones XAI mediante LLM: comprobación de la concordancia con evaluadores humanos

27 septiembre 202641 vistas

El artículo presenta XAI-Arena, un sistema que compara explicaciones de IA según varios criterios, teniendo en cuenta distintos modelos e intereses de los usuarios. Las evaluaciones de los LLM concuerdan notablemente con los juicios humanos (ρ de Spearman = 0,693), lo que apunta a la posibilidad de ampliar el análisis comparativo de las explicaciones.

Evaluación de explicaciones XAI mediante LLM: comprobación de la concordancia con evaluadores humanos

Qué problema aborda el estudio

Los autores evalúan si los modelos de lenguaje de gran tamaño pueden convertirse en un método reproducible y escalable para la evaluación comparativa de explicaciones XAI.

El artículo «XAI-Arena: Can LLMs Assess the Quality of XAI Explanations?» se publicó en arXiv como arXiv:2609.09428. Se envió el 8 de septiembre de 2026.

Los autores son Yanfei Hu Fleischhauer, Alona Zharova, Nadja Klein y Stefan Feuerriegel. Presentaron XAI-Arena, un enfoque del tipo LLM-as-a-judge para la evaluación multidimensional de explicaciones.

El objetivo principal del enfoque es comparar la calidad de las explicaciones teniendo en cuenta los intereses de distintas partes interesadas. Como orientación práctica, se propone evaluar no solo una propiedad de la explicación, sino varias dimensiones de calidad.

Qué criterios tiene en cuenta la evaluación

La evaluación abarca ocho dimensiones:

  • simplicidad percibida — simplicidad percibida;
  • claridad — claridad;
  • adecuación a la tarea — adecuación a la tarea;
  • calibración de la confianza — calibración de la confianza;
  • utilidad para la acción — utilidad para la acción;
  • transparencia — transparencia;
  • fidelidad — fidelidad;
  • interpretabilidad general — interpretabilidad general.

El conjunto de criterios permite considerar la explicación desde distintas perspectivas. Al elegir un esquema de evaluación, es importante tener en cuenta cuáles de estas dimensiones se ajustan al objetivo de la comparación.

En qué medida coinciden las evaluaciones de los LLM con las de las personas

Los autores comprobaron si las evaluaciones de los LLM coincidían con las evaluaciones humanas. La comprobación mostró una fuerte asociación positiva: rho de Spearman = .693, p < .001.

El resultado apunta a una concordancia entre las evaluaciones, pero no a una coincidencia total. Por ello, los LLM pueden considerarse una base para la evaluación comparativa, pero no un sustituto idéntico de las evaluaciones humanas.

Para qué comparaciones es adecuado el enfoque

Los autores compararon métodos XAI en distintos conjuntos de datos, modelos de aprendizaje automático y perfiles de partes interesadas. Esta comprobación abarca varios contextos de evaluación, en lugar de un único conjunto fijo de condiciones.

Los autores concluyen que las evaluaciones basadas en LLM detectan diferencias sistemáticas en la calidad de las explicaciones XAI y proporcionan una base escalable y reproducible para la comparación. El criterio práctico para elegir el enfoque es la necesidad de comparar explicaciones según varias dimensiones y teniendo en cuenta a distintas partes interesadas.

Preguntas frecuentes

Material similar

Todos los materiales
Evaluación de explicaciones XAI mediante LLM: comprobación de la concordancia con evaluadores humanos