Чем опасна опора на трассировку
В моделях на архитектуре смеси экспертов (MoE) каждый токен проходит через небольшое подмножество «специалистов». После обработки остаётся формальный след — какие эксперты были вызваны и с какими весами. Такую трассу удобно использовать как объяснение, но она похожа на запись телефонных звонков без содержания разговора: видно, кто кому звонил, но не видно, о чём договаривались.
Недавний препринт (Chen et al., arXiv:2608.17638) показывает, что интерпретация по трассе упускает важный слой информации. Авторы предлагают читать не только видимый маршрут, но и внутреннее состояние рассуждений модели. Ключевая идея — двухуровневое считывание: сначала компактное семантическое пространство, затем дешёвый прокси, восстановленный из обычной статистики маршрутизации.

Двухуровневый читатель состояния
J64: 64 оси вместо полного словаря
Первый уровень строится из пространства J, размер которого сопоставим со словарём модели. Это пространство дистиллируется в компактную семантическую рамку J64 — всего 64 оси. Получается не произвольная тематическая проекция, а набор инвариантов, обученных на собственных состояниях рассуждений модели.
Главная польза J64 в том, что он видит состояния, которых нет в видимой трассе. Два одинаковых следа маршрутизации могут скрывать разные внутренние процессы, и J64 помогает их различить. Кроме того, он разделяет две разные нагрузки: сколько усилий модель вкладывает в рассуждение и насколько сложным для неё является сам пример.
Проверка на удержанных данных показывает, что прирост площади под ROC-кривой составляет 0,096–0,135 по сравнению с базовым подходом, который читает тот же роллаут как заполненность токенов и использует ту же агрегацию. То есть улучшение даёт именно способ считывания состояния, а не изменение самой модели или формата данных.

R64: та же картина по дешёвой статистике
У J64 есть практический недостаток: он требует доступа к внутренним представлениям модели. Чтобы сделать подход применимым в продакшене, авторы реконструируют J64 из нативной статистики экспертной маршрутизации. Этот прокси называется R64 и не создаёт значительных накладных расходов во время инференса.
Медианная поосевая корреляция между R64 и J64 на трёх моделях и двух семействах архитектур достигает 0,69–0,86. На модели gpt-oss-20b R64 сохраняет 95–100% предиктивного выигрыша исходного J64. Иными словами, для многих задач не обязательно вычислять полное семантическое пространство: достаточно снять статистику с уже существующего механизма маршрутизации.
Два временных разрешения для тест-тайм решений
Считывание состояния работает не только как постфактум-объяснение, но и как инструмент принятия решений. Авторы рассматривают два сценария: анализ завершённых кандидатов и управление генерацией в реальном времени.
Выбор из готовых вариантов
Когда модель уже сгенерировала несколько вариантов ответа, J64 и R64 улучшают выбор одной ветви среди кандидатов. Отдельно проверено взвешенное голосование: если вместо простого большинства использовать веса от R64, результат оказывается лучше обычного majority voting в семи из восьми настроек. Это значит, что скрытое состояние можно использовать как более точный сигнал для агрегации ответов.
Остановка и повторная выборка во время генерации
Второй сценарий — генерация, где решение нужно принимать по мере появления токенов. Скользящие окна считывания подаются в кумулятивную политику «стоп и пересэмплируй»: в определённый момент модель останавливает текущую ветку и начинает генерировать заново. Рабочая точка этой политики фиксируется только на обучающих вопросах, поэтому на тесте метод не подстраивается под известные ответы.
J64 даёт прирост точности на 1,1–5,9 пункта относительно контрольного эксперимента, в котором использовались перемешанные сиблинги. R64, построенный только на маршрутизации, сохраняет 0,9–3,2 пункта из этого выигрыша. Даже дешёвый прокси оказывается достаточно полезным для управления генерацией.

Можно ли менять рассуждения через роутер
Последняя часть работы выходит за рамки пассивной интерпретации. Исследователи редактируют роутер так, чтобы затронуть механизм, соответствующий J64. После этого поведение модели меняется предсказуемым образом — таким, который следует из интерпретации J64. Диагностируемое «застревание» модели при этом сдвигается от численного угадывания к точному символьному выполнению.
Это важный сигнал: оси J64 фиксируют не просто корреляцию, а причинную роль в рассуждениях. Если редактирование роутера даёт ожидаемые изменения, значит, считываемое состояние действительно участвует в принятии решений, а не является побочным артефактом.
Трассировка MoE остаётся удобным, но слишком грубым интерфейсом к модели. Двухуровневое считывание — сначала экономная семантическая проекция, затем прокси на основе маршрутизации — позволяет увидеть то, что происходит до и помимо видимых вызовов экспертов. Такие внутренние «приборные панели» могут стать следующим стандартным инструментом для отладки и управления большими моделями.



