Когнитивные стратегии без подсказок: адаптивный метод улучшает рассуждения LLM через внутренние состояния

10 сентября 20263 просмотров

Новый подход LRS во время генерации аккуратно корректирует скрытые представления модели, ориентируясь на сигналы качества промежуточных шагов. Благодаря этому рассуждающие языковые модели сами находят и исправляют свои ошибки, а эксперименты показывают стабильный прирост точности на нескольких бенчмарках.

Когнитивные стратегии без подсказок: адаптивный метод улучшает рассуждения LLM через внутренние состояния

О чём эта статья

Когда большая языковая модель решает сложную логическую или математическую задачу, процесс генерации — это не просто последовательный вывод токенов. Каждый шаг опирается на внутреннее состояние, в котором модель удерживает условие, промежуточные результаты и связи между ними. Сильные рассуждающие LLM используют это пространство эффективно, но даже у них случаются сбои. Часто проблема связана не с нехваткой знаний, а с тем, что нужные когнитивные механизмы — самопроверка, переформулирование задачи, возврат к предыдущим выводам — не включаются вовремя.

Новое исследование, первая версия которого появилась на arXiv в мае 2026 года, а финальная — в августе, было принято на конференцию EMNLP 2026. Авторы представили фреймворк Latent Reward Steering (LRS). Это адаптивный метод времени вывода: он не меняет текст запроса и не добавляет к нему инструкций, а воздействует на внутренние представления модели. По сути, система учится «чинить» ход рассуждения в тот момент, когда видит, что он пошёл не туда.

Почему поведенческих подсказок недостаточно

Самый распространённый способ улучшить рассуждения LLM — явно попросить её вести себя определённым образом: «разбей задачу на шаги», «проверь себя», «сначала подумай, потом отвечай». Такие приёмы управляют поведением на внешнем, текстовом уровне. Они предполагают, что существует универсальный сценарий, который одинаково полезен для всех ошибок. Но на практике сбои бывают совершенно разными: модель может неверно понять условие, потерять важную деталь, выбрать неподходящий метод или ошибиться в вычислениях на последнем шаге.

При этом разные модели — и даже одна модель в разных попытках — ошибаются по-разному. Заранее заданная подсказка не учитывает ни тип задачи, ни текущее состояние рассуждения, ни особенности конкретной LLM. В одних случаях она помогает, в других оказывается бесполезной, а иногда и вредной, потому что заставляет модель механически следовать шаблону вместо того, чтобы адаптироваться к реальному ходу мысли.

Как LRS исправляет ход рассуждения

Вместо того чтобы давать модели текстовые рекомендации, LRS работает на уровне скрытых состояний, которые модель порождает во время рассуждения. Эти состояния несут в себе не только содержание шагов, но и тонкие признаки того, насколько уверенно модель движется к ответу. Чтобы сделать такие признаки доступными для управления, используется разреженный автоэнкодер.

SAE раскладывает плотные активации модели на небольшое число интерпретируемых компонент. Часть этих компонент соответствует полезным когнитивным поведениям, таким как промежуточная проверка или пересмотр вывода. Именно на них и направленно воздействие LRS. Такой подход позволяет влиять на «мышление» модели точнее, чем это возможно с помощью словесных инструкций.

Обучение латентной модели вознаграждения

Чтобы отличать удачные внутренние состояния от неудачных, авторы обучают отдельную модель вознаграждения. Она принимает на вход не финальный ответ, а промежуточные латентные состояния и оценивает, насколько они приближают модель к правильному результату. В качестве обучающих данных используются полные трассы рассуждений, размеченные по правильности ответа. Так модель вознаграждения учится заранее предсказывать, приведёт ли текущий участок пути к успеху.

Коррекция по градиенту вознаграждения

Когда во время генерации LRS обнаруживает состояние, которое выглядит малоперспективным, он вычисляет градиент сигнала вознаграждения по компонентам этого состояния. Градиент указывает направление, в котором нужно сдвинуть латентное состояние, чтобы увеличить вероятность правильного продолжения. Ключевая особенность LRS в том, что это направление не задано заранее и не выводится из фиксированных «правил хорошего рассуждения». Оно вычисляется на лету для каждого конкретного состояния, поэтому метод подстраивается под модель, задачу и специфику текущей ошибки.

Гейт вознаграждения и уверенности

Вмешиваться на каждом шаге было бы слишком рискованно: постоянное внешнее воздействие может нарушить естественную генерацию. Поэтому LRS использует гейт вознаграждения и уверенности. Он пропускает коррекцию только для тех состояний, которые сигнал вознаграждения помечает как хрупкие. Если текущее состояние оценивается как уверенное, вмешательства не происходит. Такой избирательный подход снижает побочные эффекты и сохраняет естественность рассуждений, когда модель и так справляется.

Что показали эксперименты

Авторы проверили LRS на нескольких рассуждающих LLM, использованных в качестве основы, и на наборе стандартных бенчмарков. Метод сравнивался с различными базовыми подходами, и в большинстве конфигураций LRS давал устойчивое улучшение точности. Важно, что положительный эффект не оказался единичным случаем: он воспроизводился при смене как модели, так и типа задач.

Пост-хок анализ результатов показал, что улучшения не сводятся к простому «удлинению» ответов или смене стиля генерации. Исследователи обнаружили: LRS неявно способствует тем когнитивным поведениям, которые обычно пытаются вызвать текстовыми промптами. Модель чаще возвращается к ошибочным промежуточным выводам, аккуратнее анализирует условия и демонстрирует более последовательный ход рассуждения. То есть метод действительно работает через внутренние состояния, а не через внешние шаблоны.

Почему это важно

LRS интересен не только конкретными результатами, но и сменой самого принципа управления рассуждениями. Вместо поиска идеальной формулировки подсказки исследователи предлагают научиться аккуратно «поправлять» модель в пространстве её собственных представлений. Такой подход потенциально универсальнее: он не требует заранее описывать все возможные когнитивные сценарии и сам находит, какой аспект мышления нуждается в коррекции в данный момент.

Пока LRS — исследовательский фреймворк, а не готовый продукт. Авторы открыли код, чтобы другие команды могли воспроизвести эксперименты и адаптировать метод под свои задачи. Но направление уже понятно: управление рассуждениями LLM постепенно переходит с уровня слов на уровень скрытых механизмов, которые определяют, как именно модель думает, а не просто что она говорит.

Часто задаваемые вопросы

Похожие материалы

Все материалы
Когнитивные стратегии LLM: метод LRS для рассуждений