La curvatura de los grafos de atención revela fallos de contexto que provocan alucinaciones en los LLM

1 octubre 202614 vistas

El artículo propone un detector en un solo paso de respuestas no fiables, basado en la topología de los flujos de información en los grafos de atención y en la curvatura de Forman-Ricci. Los autores muestran que las interrupciones en la transmisión del contexto entre tokens durante la generación autorregresiva se reflejan en la estructura de las conexiones y permiten distinguir las alucinaciones en varios modelos y benchmarks.

La curvatura de los grafos de atención revela fallos de contexto que provocan alucinaciones en los LLM

El fallo de contexto como objeto de análisis

Las alucinaciones en los LLM están relacionadas con un intercambio de contexto deficiente entre tokens durante la generación causal. Este vínculo se estudia en el trabajo arXiv:2609.21096, publicado el 17 de septiembre de 2026. Sus autores son Amir Jalilifard, Anderson Rocha, Eric Wong y Marcos Medeiros Raimundo.

El trabajo analiza patrones topológicos de los flujos de información dentro de los grafos de atención. El objetivo es distinguir las respuestas con alucinaciones de las que no las tienen.

Elementos clave del enfoque:

  • El objeto de análisis es el grafo de atención, no el texto final de la respuesta.
  • El indicador es la topología de los flujos de información entre tokens.
  • La tarea consiste en separar las respuestas con alucinaciones de las que no las tienen.

Conclusión: el intercambio de contexto deficiente deja una huella estructural medible en el grafo de atención.

Curvatura de Forman-Ricci y cuellos de botella de información

La medida clave del trabajo es la curvatura de Forman-Ricci. Esta detecta patrones estructurales que indican cuellos de botella de información en los grafos de atención.

El método tiene en cuenta las características semilocales y globales del flujo de información de las cabezas de atención. Estas características están relacionadas con las respuestas con alucinaciones.

Qué se incluye en el cálculo:

  • Características semilocales del flujo de las cabezas de atención.
  • Características globales del flujo de las cabezas de atención.
  • Relación de estas características con las respuestas con alucinaciones.

Criterio práctico: el valor reside en evaluar el flujo en su conjunto, incluidas sus características semilocales y globales.

Tres señales de una respuesta alucinada

Las respuestas con alucinaciones se distinguen por modos de funcionamiento característicos de la atención. Se manifiestan con mayor intensidad en la última capa del transformador.

PatrónAspecto del flujo de informaciónDónde se aprecia con mayor intensidad
Dependencia excesiva de la autoatenciónLos tokens se repliegan sobre sí mismos en lugar de intercambiar contextoÚltima capa del transformador
Recuperación dispersa del contextoLa información de los tokens anteriores se recopila sin un foco definidoÚltima capa del transformador
Compresión excesiva de la informaciónEl flujo de contexto pierde detallesÚltima capa del transformador

Conclusión: tres modos distintos de atención convergen en un mismo problema: un intercambio de contexto deficiente.

Comprobación de una sola pasada frente a los enfoques de referencia

El método se evaluó en varios LLM y con benchmarks de uso extendido. El enfoque de una sola pasada supera sistemáticamente a los enfoques de referencia existentes en dos benchmarks de detección de alucinaciones.

Los enfoques de referencia se basan en indicadores de atención o en varias respuestas. En distintas arquitecturas de LLM, el método muestra resultados competitivos.

EnfoqueBaseResultado de la evaluación
Método basado en la curvatura de Forman-RicciIndicadores topológicos de los grafos de atenciónSupera a los enfoques de referencia en dos benchmarks; resultados competitivos en distintas arquitecturas de LLM
Enfoques de referencia basados en la atenciónIndicadores de atenciónSuperados en dos benchmarks
Enfoques de referencia basados en varias respuestasVarias respuestasSuperados en dos benchmarks

Criterio práctico: la comprobación de una sola pasada no requiere varias respuestas y puede aplicarse a distintas arquitecturas de LLM.

Preguntas frecuentes

Material similar

Todos los materiales
La curvatura de los grafos de atención revela fallos de contexto que provocan alucinaciones en los LLM