Почему ложная уверенность LLM — это не просто баг
Современные языковые модели научились излагать мысли гладко и убедительно. Но за этой убедительностью часто скрывается то, что эксперты называют галлюцинациями: модель выдаёт правдоподобно звучащий, но полностью вымышленный контент. Для пользователя это выглядит как ровный, уверенный текст — и именно поэтому проблема опасна.
Большинство привычных детекторов галлюцинаций работают грубо. Они оценивают весь ответ целиком или отдельные предложения, сообщая что-то вроде «здесь, кажется, есть ошибка». Но чтобы понять, в каком именно месте модель «выдумала факт», нужна более тонкая проверка — на уровне отдельных токенов. Только пос-токенная детекция позволяет локализовать ложный фрагмент и прицельно вмешаться в генерацию, не трогая остальной текст.

MoE-модели случайно дают ключ к разгадке
В архитектурах типа Mixture-of-Experts (MoE) работает любопытный принцип: за один прямой проход активируется лишь разреженное подмножество «экспертов», а не вся сеть. Выбор, кого позвать, делает механизм маршрутизации. И именно в этот момент возникают внутренние сигналы, которых просто нет у плотных архитектур:
- энтропия маршрутизатора — насколько модель «не уверена», к какому эксперту обратиться;
- разногласия экспертов — насколько сильно расходятся их промежуточные результаты;
- паттерны использования экспертов — какие специалисты чаще включаются в работу.
Раньше эти сигналы почти не использовались для поиска галлюцинаций. Исследователи Жуан Фонсека, Родриго Родригес и Паоло Романо в статье arXiv:2608.17687 показали, что зря: скрытые индикаторы способны выдавать моменты, когда модель начинает сочинять. Работа была представлена на arXiv 18 августа 2026 года.

InnerExpert: детектор, который смотрит внутрь модели
Предложенный авторами метод InnerExpert объединяет два типа данных: MoE-специфичные сигналы уровня маршрутизации и стандартные внутренние представления трансформера. Всё это собирается в компактные векторы признаков для каждого токена. Затем лёгкий классификатор обрабатывает эти векторы и определяет, является ли токен галлюцинацией.
Ключевая особенность — автоматическое обучение. Метки для тренировки детектора создаёт конвейер LLM-as-a-judge, когда одна языковая модель оценивает выход другой. Никакой ручной разметки не требуется. Это значит, что детектор можно быстро адаптировать под новые версии генеративных моделей, просто перегнав конвейер заново.

Что показали тесты
Эксперименты охватили пять датасетов и две разные MoE-архитектуры. В тестах InnerExpert стабильно обходил существующие детекторы. Лучшие результаты достигли 0.91 AUROC на уровне целого ответа и 0.76 AUROC на уровне отдельных токенов. Причём для этого достаточно одного прямого прохода — не нужно запускать дополнительные проверочные модели или повторные генерации.
Высокий answer-level результат полезен для грубой фильтрации. Но по-настоящему ценный показатель — token-level: он позволяет точечно находить ложные куски текста и, например, переписывать их или подсвечивать пользователю. Это уже не «где-то ошибка», а конкретное место в ответе.
Почему это важно
Галлюцинации остаются одним из главных барьеров для внедрения LLM в медицине, юриспруденции, финансах и других чувствительных к ошибкам сферах. Возможность заглянуть во внутренние сигналы модели и заранее увидеть её «сомнения» — ещё один практический шаг к прозрачной генерации. Скрытые индикаторы не избавляют от проблемы полностью, но дают рабочий инструмент, который уже доступен.
Отдельно интересно, что диагностика галлюцинаций родилась из особенностей самой архитектуры. MoE-модели создавали ради скорости и эффективности, а их внутреннее устройство неожиданно оказалось полезным для контроля качества. Дальнейшие исследования наверняка пойдут ещё глубже — к более тонким сигналам внутри экспертов и механизмов маршрутизации.



