Обучение больших языковых моделей с подкреплением часто выглядит грубовато: система получает лишь «плюс» или «минус» за весь ответ и сама догадывается, что именно пошло не так. Метод SocraticPO, описанный в препринте arXiv:2606.09887 командой под руководством Zirui Liu, пытается исправить это. Вместо того чтобы просто сообщать модели об ошибке, «учитель» в естественной форме подсказывает направление рассуждений — а сама модель по-прежнему учится в рамках стандартного RL.
Почему бинарных наград недостаточно
В типичном RL-цикле языковая модель генерирует цепочку рассуждений, а затем получает скалярную outcome-награду: например, за совпадение с правильным ответом. Такая оценка задаёт вектор оптимизации, но не объясняет, на каком шаге решение пошло по неверному пути.
Из-за этого модель часто ищет короткий путь: она запоминает паттерны, которые выглядят правдоподобно, но не выдерживают проверки на новых задачах. Итог — хрупкие политики, которые отлично работают на знакомых типах примеров и ломаются при малейшем изменении формулировки. Бинарный сигнал слишком беден, чтобы научить рассуждать.
Как устроен SocraticPO

Ключевая идея — добавить в роллаут естественно-языковое руководство в сократическом стиле. Процесс выглядит так:
- Студент отвечает самостоятельно. Модель пробует решить задачу без внешней помощи.
- Учитель проверяет рассуждение. Если ответ верный, роллаут завершается обычным образом.
- При ошибке учитель диагностирует попытку. Он не выдаёт готовое решение, а коротко указывает на проблему или задаёт наводящий вопрос в духе сократического диалога.
- Студент продолжает с расширенным контекстом. Модель видит собственную исходную цепочку и указание учителя, после чего пытается дойти до правильного ответа.
Такой подход принципиально отличается от простого давания подсказок до ответа: вмешательство происходит только после того, как модель уже продемонстрировала своё «наивное» рассуждение. Значит, учитель может опираться на реальную ошибку ученика, а не на абстрактное «вот как надо».
Зачем «затухающая» награда
Если исправленный с помощью учителя ответ награждать так же щедро, как и полностью самостоятельный, у модели появится соблазн специально ошибаться, чтобы всегда получать подсказку. Это превратило бы учителя в бесплатный источник правильных ответов.
SocraticPO обходит эту проблему хитро: верные ответы, полученные уже после вмешательства, приносят уменьшенную награду. Модель может воспользоваться подсказкой, но не получает за это полное вознаграждение. Такой механизм снижает зависимость от внешней помощи и заставляет использовать руководство учителя для обучения, а не как лазейку.
Совместимость с существующими методами
Одно из важных преимуществ SocraticPO — минимальное вмешательство в сам алгоритм обучения. Фреймворк меняет только процесс генерации роллаутов, а стандартный objective — максимизация ожидаемой награды — остаётся нетронутым. Благодаря этому метод можно подключать к уже существующим policy-gradient подходам, например к Reinforce++.
Ещё один плюс — учителю не нужен доступ к внутренностям модели. Поскольку руководство передаётся только через текст, роль учителя может выполнять более сильная модель, которая работает как «чёрный ящик». Не требуется выравнивать распределения токенов или использовать логиты модели-ученика.
Результаты экспериментов
Авторы проверили SocraticPO на научных задачах уровня бакалавриата из набора SciKnowEval. Здесь метод обошёл сильные RL-базлайны и подходы, основанные на self-distillation, когда модель обучается на своих же исправленных ответах.

Абляции показывают, что совместно работают два обязательных компонента. Сама по себе таргетированная текстовая подсказка заметно улучшает результаты, а затухание награды добавляет важный предохранитель от переобучения на «помощника». Если убрать что-то одно, эффективность падает.
Что это значит на практике
SocraticPO интересен тем, что делает обратную связь в RL более похожей на естественный процесс обучения. Модель не просто штрафуется за неверный ответ — ей показывают направление, в котором стоит думать.
При этом такая «человечность» не требует полностью переписывать обвязку RL: достаточно заменить процесс роллаутов и оставить остальную инфраструктуру. Возможность использовать сильных чёрных ящиков в роли учителя особенно полезна по мере роста разрыва между доступными открытыми и закрытыми моделями.
Остаётся вопрос, как поведёт себя фреймворк на более сложных многошаговых задачах, где требуется несколько раундов диалога. Но уже сейчас идея добавлять в RL не оценку, а содержательное объяснение ошибки выглядит естественным следующим шагом к более устойчивым рассуждающим моделям.



