Современные языковые модели всё чаще «доучивают» на задачах, где ответ можно автоматически проверить: математика, программирование, логика. Этот подход называют RLVR — обучение с подкреплением на верифицируемых наградах. Среди алгоритмов для такой настройки особенно выделяется GRPO: он прост, не требует отдельной модели-критика и хорошо масштабируется. Однако недавний препринт (arXiv:2605.12969) предлагает взглянуть на GRPO с контрастивной стороны и показывает, что его целевая функция далека от идеала. Авторы — Фэн Чжан и соавторы — не просто критикуют существующий подход, но и предлагают альтернативу под названием ConSPO.
Почему GRPO стал де-факто стандартом RLVR
Классические методы вроде PPO сначала обучают критик, чтобы оценить преимущество каждого действия. В RLVR такая критика часто избыточна: у нас уже есть проверяемый результат, который делит ответы на правильные и неправильные. GRPO использует это напрямую. На один промпт модель генерирует несколько вариантов ответа — роллаутов, затем каждый роллаут получает балл от верификатора, а преимущество вычисляется как относительная позиция внутри этой группы. Такая схема снижает вычислительные расходы и упрощает пост-обучение, поэтому её охотно применяют на практике.
Но, как показывают авторы, у GRPO есть и скрытая сторона. Если посмотреть на математику алгоритма, то oн фактически обучает модель разделять «хорошие» и «плохие» ответы: максимизируется ожидаемый разрыв между баллами проверенных положительных и отрицательных роллаутов. Это классическая дискриминативная задача. Именно с этой высоты становится видно, почему текущая цель GRPO неидеальна.

Два ограничения GRPO, которые мешают обучению
В контрастивной переформулировке GRPO исследователи выделяют два системных ограничения, зашитых в целевую функцию.
Суррогатные скоринги рассогласованы с правдоподобием
Модель генерирует ответы, опираясь на вероятность последовательности токенов. Но GRPO при обновлении политики оптимизирует не эти вероятности напрямую, а суррогатную функцию на основе clipped ratios — ограниченных отношений новой и старой политики. Фактически в качестве «очков» для положительных и отрицательных примеров используются не истинные лог-вероятности последовательностей, а другие величины. Возникает рассогласование: цель, которую оптимизирует алгоритм, не совпадает с тем, что действительно определяет генерацию. Это может приводить к нестабильности или неоптимальному использованию данных.
Кредит не зависит от текущей сложности разделения
Второе ограничение касается того, как GRPO распределяет обновления между роллаутами. Алгоритм не обращает внимания на то, насколько сильно положительные и отрицательные примеры различаются по баллам в данный момент. Если один «негатив» находится совсем рядом с положительным примером, а другой — далеко, GRPO воспринимает их практически одинаково. Такое нечувствительное к баллам назначение кредита означает, что модель не делает акцент на самых запутанных, ещё плохо разделённых парах. В результате обучение может буквально «топтаться» на лёгких примерах, игнорируя настоящие сложности.

ConSPO: контрастивная целевая функция для политики
Чтобы устранить оба ограничения, авторы предлагают метод ConSPO — контрастивную оптимизацию политики на уровне последовательностей. Название говорит само за себя: GRPO переосмысливается как контрастивное обучение, но с рядом важных исправлений.
Во-первых, ConSPO возвращается к нормальным скорингам: вместо суррогатных величин используются лог-вероятности последовательностей, нормализованные по длине. Это лучше согласуется с процессом генерации и убирает проблему likelihood-misaligned оценок.
Во-вторых, алгоритм явно противопоставляет проверенные положительные роллауты отрицательным «дистракторам» внутри одной и той же группы. Обновление политики при этом управляется групповой функцией, похожей на InfoNCE — стандартный приём из контрастивного обучения. Такая функция автоматически усиливает градиент для тех пар, где положительный ответ ещё недостаточно отделён от отрицательного, а высокоскоринговые негативы получают больше внимания. Тем самым решается проблема нечувствительного распределения кредита.
В-третьих, в ConSPO применяется curriculum-scheduled margin. Отступ, который должен разделять положительные и отрицательные примеры, постепенно ужесточается по мере обучения. Это не даёт модели остановиться на достигнутом: сначала она разбирается с лёгкими различиями, а затем вынуждена доводить разделение до всё более тонких границ.

Итоги и перспективы
Авторы проверили ConSPO в различных условиях и на сложных бенчмарках рассуждений. Результаты показывают, что новый метод стабильно превосходит сильные базовые подходы. Это важный сигнал для сообщества: привычная цель GRPO может быть улучшена, если подойти к RLVR как к задаче контрастивного обучения, а не просто как к оптимизации относительных преимуществ.
Конечно, один препринт не закрывает тему. Но предложенный взгляд даёт свежий инструмент для анализа: вместо того чтобы воспринимать GRPO как данность, исследователи теперь могут декомпозировать его на понятные контрастивные компоненты и улучшать каждый по отдельности. Для практиков это означает, что в арсенале пост-обучения появляется ещё один сильный метод, особенно ценный на задачах, где верификатор даёт чёткий бинарный сигнал.



