Avaliação de explicações XAI com LLMs: validação da concordância com humanos

27 setembro 202641 visualizações

O artigo apresenta o XAI-Arena — um sistema que compara explicações de IA segundo vários critérios, tendo em conta diferentes modelos e interesses dos utilizadores. As avaliações feitas por LLMs apresentam uma concordância considerável com os julgamentos humanos (ρ de Spearman = 0,693), indicando a possibilidade de escalar a análise comparativa de explicações.

Avaliação de explicações XAI com LLMs: validação da concordância com humanos

Que problema a investigação procura resolver

Os autores verificam se os grandes modelos de linguagem podem tornar-se uma forma reproduzível e escalável de avaliar comparativamente as explicações XAI.

O artigo «XAI-Arena: Can LLMs Assess the Quality of XAI Explanations?» foi publicado no arXiv como arXiv:2609.09428. Foi submetido a 8 de setembro de 2026.

Os autores são Yanfei Hu Fleischhauer, Alona Zharova, Nadja Klein e Stefan Feuerriegel. Apresentaram o XAI-Arena — uma abordagem no formato LLM como avaliador para a avaliação multidimensional de explicações.

O principal objetivo da abordagem é comparar a qualidade das explicações tendo em conta os interesses de diferentes partes interessadas. O objetivo prático é avaliar não apenas uma propriedade da explicação, mas várias dimensões da qualidade.

Que critérios são considerados na avaliação

A avaliação abrange oito dimensões:

  • simplicidade percebida;
  • clareza;
  • adequação à tarefa;
  • calibração da confiança;
  • aplicabilidade prática;
  • transparência;
  • fidelidade;
  • interpretabilidade geral.

O conjunto de critérios permite analisar uma explicação de diferentes perspetivas. Ao escolher um esquema de avaliação, é importante ter em conta quais destas dimensões são relevantes para a tarefa de comparação.

Em que medida as avaliações dos LLM correspondem às avaliações humanas

Os autores verificaram a correspondência entre as avaliações dos LLM e as avaliações humanas. A análise revelou uma forte correlação positiva: rho de Spearman = .693, p < .001.

O resultado indica que as avaliações são concordantes, mas não totalmente coincidentes. Por isso, os LLM podem ser considerados uma base para a avaliação comparativa, mas não um substituto equivalente das avaliações humanas.

Para que comparações é adequada a abordagem

Os autores compararam métodos XAI em diferentes conjuntos de dados, modelos de aprendizagem automática e perfis de partes interessadas. Esta análise abrange vários contextos de avaliação, e não apenas um conjunto fixo de condições.

Os autores concluem que as avaliações baseadas em LLM identificam diferenças sistemáticas na qualidade das explicações XAI e oferecem uma base escalável e reproduzível para a comparação. O critério prático de escolha é a necessidade de comparar explicações em várias dimensões e tendo em conta diferentes partes interessadas.

Perguntas mais frequentes

Materiais semelhantes

Todos os materiais
Avaliação de explicações XAI com LLMs: validação da concordância com humanos