A curvatura dos grafos de atenção revela falhas de contexto que levam a alucinações em LLMs

1 outubro 202614 visualizações

O artigo propõe um detetor de respostas não fiáveis numa única etapa, baseado na topologia dos fluxos de informação em grafos de atenção e na curvatura de Forman–Ricci. Os autores mostram que as falhas na transmissão do contexto entre tokens durante a geração autorregressiva se refletem na estrutura das ligações e permitem distinguir alucinações em vários modelos e benchmarks.

A curvatura dos grafos de atenção revela falhas de contexto que levam a alucinações em LLMs

A falha de contexto como objeto de análise

As alucinações em LLMs estão relacionadas com uma troca de contexto perturbada entre tokens durante a geração causal. Esta relação é estudada no artigo arXiv:2609.21096, publicado a 17 de setembro de 2026. Os autores são Amir Jalilifard, Anderson Rocha, Eric Wong e Marcos Medeiros Raimundo.

O artigo analisa padrões topológicos dos fluxos de informação no interior dos grafos de atenção. O objetivo é distinguir respostas alucinadas de respostas não alucinadas.

Elementos-chave da abordagem:

  • O objeto de análise é o grafo de atenção, não o texto final da resposta.
  • O indicador é a topologia dos fluxos de informação entre tokens.
  • A tarefa é separar respostas alucinadas de respostas não alucinadas.

Conclusão: a perturbação da troca de contexto deixa um vestígio estrutural mensurável no grafo de atenção.

Curvatura Forman-Ricci e gargalos de informação

A principal métrica do artigo é a curvatura Forman-Ricci. Ela identifica padrões estruturais que apontam para gargalos de informação nos grafos de atenção.

O método considera características semilocais e globais do fluxo de informação das cabeças de atenção. Estas características estão relacionadas com respostas alucinadas.

O que é considerado no cálculo:

  • Características semilocais do fluxo das cabeças de atenção.
  • Características globais do fluxo das cabeças de atenção.
  • Relação destas características com respostas alucinadas.

Critério prático: o valor está em avaliar o fluxo como um todo, incluindo características semilocais e globais.

Três sinais de uma resposta alucinada

As respostas alucinadas distinguem-se por modos de funcionamento característicos da atenção. Manifestam-se sobretudo na última camada do transformador.

PadrãoAspeto do fluxo de informaçãoOnde é mais evidente
Dependência excessiva da autoatençãoOs tokens ficam presos a si próprios em vez de trocarem contextoÚltima camada do transformador
Extração dispersa de contextoA informação dos tokens anteriores é reunida sem focoÚltima camada do transformador
Compressão excessiva da informaçãoO fluxo de contexto perde detalhesÚltima camada do transformador

Conclusão: três modos distintos de atenção convergem no mesmo problema — uma troca de contexto perturbada.

Verificação de passagem única em comparação com abordagens de referência

O método foi avaliado em vários LLMs e benchmarks amplamente utilizados. A abordagem de passagem única supera de forma consistente as abordagens de referência existentes em dois benchmarks de deteção de alucinações.

As abordagens de referência baseiam-se em indicadores de atenção ou em várias respostas. Em diferentes arquiteturas de LLM, o método apresenta resultados competitivos.

AbordagemBaseResultado da avaliação
Método baseado na curvatura Forman-RicciIndicadores topológicos dos grafos de atençãoSupera as abordagens de referência em dois benchmarks; resultados competitivos em diferentes arquiteturas de LLM
Abordagens de referência baseadas na atençãoIndicadores de atençãoSuperadas em dois benchmarks
Abordagens de referência baseadas em várias respostasVárias respostasSuperadas em dois benchmarks

Critério prático: a verificação de passagem única não exige várias respostas e pode ser aplicada a diferentes arquiteturas de LLM.

Perguntas mais frequentes

A curvatura dos grafos de atenção revela falhas de contexto que levam a alucinações em LLMs