Que problema a investigação procura resolver
Os autores verificam se os grandes modelos de linguagem podem tornar-se uma forma reproduzível e escalável de avaliar comparativamente as explicações XAI.
O artigo «XAI-Arena: Can LLMs Assess the Quality of XAI Explanations?» foi publicado no arXiv como arXiv:2609.09428. Foi submetido a 8 de setembro de 2026.
Os autores são Yanfei Hu Fleischhauer, Alona Zharova, Nadja Klein e Stefan Feuerriegel. Apresentaram o XAI-Arena — uma abordagem no formato LLM como avaliador para a avaliação multidimensional de explicações.

O principal objetivo da abordagem é comparar a qualidade das explicações tendo em conta os interesses de diferentes partes interessadas. O objetivo prático é avaliar não apenas uma propriedade da explicação, mas várias dimensões da qualidade.
Que critérios são considerados na avaliação
A avaliação abrange oito dimensões:
- simplicidade percebida;
- clareza;
- adequação à tarefa;
- calibração da confiança;
- aplicabilidade prática;
- transparência;
- fidelidade;
- interpretabilidade geral.
O conjunto de critérios permite analisar uma explicação de diferentes perspetivas. Ao escolher um esquema de avaliação, é importante ter em conta quais destas dimensões são relevantes para a tarefa de comparação.
Em que medida as avaliações dos LLM correspondem às avaliações humanas
Os autores verificaram a correspondência entre as avaliações dos LLM e as avaliações humanas. A análise revelou uma forte correlação positiva: rho de Spearman = .693, p < .001.
O resultado indica que as avaliações são concordantes, mas não totalmente coincidentes. Por isso, os LLM podem ser considerados uma base para a avaliação comparativa, mas não um substituto equivalente das avaliações humanas.
Para que comparações é adequada a abordagem
Os autores compararam métodos XAI em diferentes conjuntos de dados, modelos de aprendizagem automática e perfis de partes interessadas. Esta análise abrange vários contextos de avaliação, e não apenas um conjunto fixo de condições.
Os autores concluem que as avaliações baseadas em LLM identificam diferenças sistemáticas na qualidade das explicações XAI e oferecem uma base escalável e reproduzível para a comparação. O critério prático de escolha é a necessidade de comparar explicações em várias dimensões e tendo em conta diferentes partes interessadas.



