SocraticPO: как «учитель» направляет рассуждения LLM в RL вместо простого бинарного вознаграждения

13 сентября 20260 просмотров

Исследователи представили фреймворк, который встраивает сократические текстовые подсказки прямо в роллауты обучения с подкреплением: сначала модель отвечает сама, а при ошибке получает от учителя короткую диагностику и указания. Научная работа показывает, что такой подход сокращает склонность к срезам пути и превосходит стандартные RL-методы на бенчмарках SciKnowEval уровня бакалавриата.

SocraticPO: как «учитель» направляет рассуждения LLM в RL вместо простого бинарного вознаграждения

Обучение больших языковых моделей с подкреплением часто выглядит грубовато: система получает лишь «плюс» или «минус» за весь ответ и сама догадывается, что именно пошло не так. Метод SocraticPO, описанный в препринте arXiv:2606.09887 командой под руководством Zirui Liu, пытается исправить это. Вместо того чтобы просто сообщать модели об ошибке, «учитель» в естественной форме подсказывает направление рассуждений — а сама модель по-прежнему учится в рамках стандартного RL.

Почему бинарных наград недостаточно

В типичном RL-цикле языковая модель генерирует цепочку рассуждений, а затем получает скалярную outcome-награду: например, за совпадение с правильным ответом. Такая оценка задаёт вектор оптимизации, но не объясняет, на каком шаге решение пошло по неверному пути.

Из-за этого модель часто ищет короткий путь: она запоминает паттерны, которые выглядят правдоподобно, но не выдерживают проверки на новых задачах. Итог — хрупкие политики, которые отлично работают на знакомых типах примеров и ломаются при малейшем изменении формулировки. Бинарный сигнал слишком беден, чтобы научить рассуждать.

Как устроен SocraticPO

Ключевая идея — добавить в роллаут естественно-языковое руководство в сократическом стиле. Процесс выглядит так:

  1. Студент отвечает самостоятельно. Модель пробует решить задачу без внешней помощи.
  2. Учитель проверяет рассуждение. Если ответ верный, роллаут завершается обычным образом.
  3. При ошибке учитель диагностирует попытку. Он не выдаёт готовое решение, а коротко указывает на проблему или задаёт наводящий вопрос в духе сократического диалога.
  4. Студент продолжает с расширенным контекстом. Модель видит собственную исходную цепочку и указание учителя, после чего пытается дойти до правильного ответа.

Такой подход принципиально отличается от простого давания подсказок до ответа: вмешательство происходит только после того, как модель уже продемонстрировала своё «наивное» рассуждение. Значит, учитель может опираться на реальную ошибку ученика, а не на абстрактное «вот как надо».

Зачем «затухающая» награда

Если исправленный с помощью учителя ответ награждать так же щедро, как и полностью самостоятельный, у модели появится соблазн специально ошибаться, чтобы всегда получать подсказку. Это превратило бы учителя в бесплатный источник правильных ответов.

SocraticPO обходит эту проблему хитро: верные ответы, полученные уже после вмешательства, приносят уменьшенную награду. Модель может воспользоваться подсказкой, но не получает за это полное вознаграждение. Такой механизм снижает зависимость от внешней помощи и заставляет использовать руководство учителя для обучения, а не как лазейку.

Совместимость с существующими методами

Одно из важных преимуществ SocraticPO — минимальное вмешательство в сам алгоритм обучения. Фреймворк меняет только процесс генерации роллаутов, а стандартный objective — максимизация ожидаемой награды — остаётся нетронутым. Благодаря этому метод можно подключать к уже существующим policy-gradient подходам, например к Reinforce++.

Ещё один плюс — учителю не нужен доступ к внутренностям модели. Поскольку руководство передаётся только через текст, роль учителя может выполнять более сильная модель, которая работает как «чёрный ящик». Не требуется выравнивать распределения токенов или использовать логиты модели-ученика.

Результаты экспериментов

Авторы проверили SocraticPO на научных задачах уровня бакалавриата из набора SciKnowEval. Здесь метод обошёл сильные RL-базлайны и подходы, основанные на self-distillation, когда модель обучается на своих же исправленных ответах.

Абляции показывают, что совместно работают два обязательных компонента. Сама по себе таргетированная текстовая подсказка заметно улучшает результаты, а затухание награды добавляет важный предохранитель от переобучения на «помощника». Если убрать что-то одно, эффективность падает.

Что это значит на практике

SocraticPO интересен тем, что делает обратную связь в RL более похожей на естественный процесс обучения. Модель не просто штрафуется за неверный ответ — ей показывают направление, в котором стоит думать.

При этом такая «человечность» не требует полностью переписывать обвязку RL: достаточно заменить процесс роллаутов и оставить остальную инфраструктуру. Возможность использовать сильных чёрных ящиков в роли учителя особенно полезна по мере роста разрыва между доступными открытыми и закрытыми моделями.

Остаётся вопрос, как поведёт себя фреймворк на более сложных многошаговых задачах, где требуется несколько раундов диалога. Но уже сейчас идея добавлять в RL не оценку, а содержательное объяснение ошибки выглядит естественным следующим шагом к более устойчивым рассуждающим моделям.

Часто задаваемые вопросы

Похожие материалы

Все материалы
SocraticPO — как учитель направляет рассуждения LLM в RL