Кривизна графов внимания выявляет сбои контекста, ведущие к галлюцинациям LLM

1 октября 202614 просмотров

Статья предлагает одношаговый детектор недостоверных ответов, опирающийся на топологию информационных потоков в графах внимания и кривизну Формана — Риччи. Авторы показывают, что нарушения передачи контекста между токенами при авторегрессионной генерации проявляются в структуре связей и позволяют различать галлюцинации на нескольких моделях и бенчмарках.

Кривизна графов внимания выявляет сбои контекста, ведущие к галлюцинациям LLM

Сбой контекста как предмет анализа

Галлюцинации в LLM связаны с нарушенным обменом контекстом между токенами при каузальной генерации. Эту связь исследует работа arXiv:2609.21096, вышедшая 17 сентября 2026 года. Авторы — Amir Jalilifard, Anderson Rocha, Eric Wong, Marcos Medeiros Raimundo.

Работа анализирует топологические паттерны информационных потоков внутри графов внимания. Цель — различить галлюцинированные и не галлюцинированные ответы.

Ключевые элементы подхода:

  • Объект анализа — граф внимания, а не готовый текст ответа.
  • Признак — топология информационных потоков между токенами.
  • Задача — разделение галлюцинированных и не галлюцинированных ответов.

Вывод: нарушение обмена контекстом оставляет измеримый структурный след в графе внимания.

Кривизна Forman-Ricci и информационные узкие места

Ключевой измеритель в работе — кривизна Forman-Ricci. Она выявляет структурные паттерны, указывающие на информационные узкие места в графах внимания.

Метод учитывает полу-локальные и глобальные характеристики информационного потока голов внимания. Эти характеристики связаны с галлюцинированными ответами.

Что попадает в расчёт:

  • Полу-локальные характеристики потока голов внимания.
  • Глобальные характеристики потока голов внимания.
  • Связь этих характеристик с галлюцинированными ответами.

Практический критерий: ценность даёт оценка потока целиком, включая полу-локальные и глобальные характеристики.

Три подписи галлюцинирующего ответа

Галлюцинированные ответы отличаются характерными режимами работы внимания. Сильнее всего они проявляются в последнем слое трансформера.

ПаттернКак выглядит информационный потокГде заметен сильнее всего
Чрезмерная опора на self-attentionТокены замыкаются на себе вместо обмена контекстомПоследний слой трансформера
Рассеянное извлечение контекстаИнформация из более ранних токенов собирается без фокусаПоследний слой трансформера
Чрезмерное сжатие информацииПоток контекста теряет деталиПоследний слой трансформера

Вывод: три разных режима внимания сходятся к одному — нарушенному обмену контекстом.

Однопроходная проверка против базовых подходов

Метод оценили на нескольких LLM и общепринятых бенчмарках. Однопроходный подход стабильно превосходит существующие базовые подходы на двух бенчмарках обнаружения галлюцинаций.

Базовые подходы опираются на признаки внимания или на несколько ответов. На разных архитектурах LLM метод показывает конкурентные результаты.

ПодходОсноваРезультат в оценке
Метод на кривизне Forman-RicciТопологические признаки графов вниманияПревосходит базовые подходы на двух бенчмарках; конкурентные результаты на разных архитектурах LLM
Базовые подходы на вниманииПризнаки вниманияПревзойдены на двух бенчмарках
Базовые подходы на нескольких ответахНесколько ответовПревзойдены на двух бенчмарках

Практический критерий: однопроходная проверка не требует нескольких ответов и применима к разным архитектурам LLM.

Часто задаваемые вопросы

Похожие материалы

Все материалы
Кривизна графов внимания для детекции галлюцинаций LLM