Qué problema aborda el estudio
Los autores evalúan si los modelos de lenguaje de gran tamaño pueden convertirse en un método reproducible y escalable para la evaluación comparativa de explicaciones XAI.
El artículo «XAI-Arena: Can LLMs Assess the Quality of XAI Explanations?» se publicó en arXiv como arXiv:2609.09428. Se envió el 8 de septiembre de 2026.
Los autores son Yanfei Hu Fleischhauer, Alona Zharova, Nadja Klein y Stefan Feuerriegel. Presentaron XAI-Arena, un enfoque del tipo LLM-as-a-judge para la evaluación multidimensional de explicaciones.

El objetivo principal del enfoque es comparar la calidad de las explicaciones teniendo en cuenta los intereses de distintas partes interesadas. Como orientación práctica, se propone evaluar no solo una propiedad de la explicación, sino varias dimensiones de calidad.
Qué criterios tiene en cuenta la evaluación
La evaluación abarca ocho dimensiones:
- simplicidad percibida — simplicidad percibida;
- claridad — claridad;
- adecuación a la tarea — adecuación a la tarea;
- calibración de la confianza — calibración de la confianza;
- utilidad para la acción — utilidad para la acción;
- transparencia — transparencia;
- fidelidad — fidelidad;
- interpretabilidad general — interpretabilidad general.
El conjunto de criterios permite considerar la explicación desde distintas perspectivas. Al elegir un esquema de evaluación, es importante tener en cuenta cuáles de estas dimensiones se ajustan al objetivo de la comparación.
En qué medida coinciden las evaluaciones de los LLM con las de las personas
Los autores comprobaron si las evaluaciones de los LLM coincidían con las evaluaciones humanas. La comprobación mostró una fuerte asociación positiva: rho de Spearman = .693, p < .001.
El resultado apunta a una concordancia entre las evaluaciones, pero no a una coincidencia total. Por ello, los LLM pueden considerarse una base para la evaluación comparativa, pero no un sustituto idéntico de las evaluaciones humanas.
Para qué comparaciones es adecuado el enfoque
Los autores compararon métodos XAI en distintos conjuntos de datos, modelos de aprendizaje automático y perfiles de partes interesadas. Esta comprobación abarca varios contextos de evaluación, en lugar de un único conjunto fijo de condiciones.
Los autores concluyen que las evaluaciones basadas en LLM detectan diferencias sistemáticas en la calidad de las explicaciones XAI y proporcionan una base escalable y reproducible para la comparación. El criterio práctico para elegir el enfoque es la necesidad de comparar explicaciones según varias dimensiones y teniendo en cuenta a distintas partes interesadas.



