Проблема: почему RL упирается в метки
Обучение с подкреплением (RL) сегодня считается одним из самых перспективных способов улучшать рассуждения языковых и визуально-языковых моделей. Логика простая: модель пробует разные стратегии, получает награду за правильные действия и постепенно учится рассуждать лучше. Но есть подвох — чтобы награда была осмысленной, обычно нужны точные сигналы извне: проверяемые ответы, эталонные решения, размеченные цепочки рассуждений. Всё это дорого готовить, а для многих задач таких данных становится всё меньше.
Частично проблему решает подход self-rewarding, когда модель сама оценивает собственные ответы и на этой основе корректирует поведение. Однако здесь возникает замкнутый круг: если модель уже имеет смещения или привыкла отвечать субоптимально, она будет усиливать эти же ошибки. Обучение на собственной обратной связи быстро приводит к однообразию: ответы становятся похожими друг на друга, разнообразие падает, а в худшем случае наступает коллапс — модель зацикливается на узком наборе шаблонов и перестаёт развиваться.
Как устроен Co-RL
Авторы препринта arXiv:2608.17253 предлагают фреймворк Co-RL, который разрывает этот порочный круг. Вместо одной модели, которая учится на своих же оценках, Co-RL одновременно обучает несколько полностью развязанных моделей — они не делят общие параметры и не подсматривают друг у друга веса. Каждая модель получает награды не от себя, а от других участников когорты (peers). По сути, модели рассуждают, критикуют и оценивают друг друга, и именно на основе этих «внешних» оценок строится обучение.
Такой обмен обратной связью принципиально меняет динамику. Ошибки разных моделей редко совпадают полностью — у каждой свои слабые места, свои паттерны мышления и свои предубеждения. Поэтому когда одна модель оценивает ответ другой, вероятность того, что она «подтвердит» чужую системную ошибку, значительно ниже. Это позволяет избежать самоусиливающихся петель обратной связи, из-за которых ломается self-rewarding подход.
Разнообразие как главный ингредиент
Ключевая идея Co-RL в том, что успех напрямую зависит от разнообразия когорты. Если все модели будут одинаковыми, они просто будут соглашаться друг с другом и никакого преимущества не получится. Поэтому авторы предлагают три уровня гетерогенности:
- Разные семейства моделей — например, комбинировать архитектуры разных производителей, чтобы они не наследовали общие ошибки.
- Разные размеры — крупные и компактные модели по-разному видят задачу, и их оценки взаимно дополняют друг друга.
- Перефразированные обучающие выборки — одни и те же примеры подаются в разной формулировке, что снижает корреляцию ошибок, вызванных одинаковой постановкой задачи.
Такая пестрота когорты снижает скоррелированные ошибки, которые опасны тем, что они накапливаются от итерации к итерации. Заодно сохраняется поведенческое разнообразие — модели не схлопываются к единому стилю рассуждений, а продолжают исследовать разные подходы.

Что показали эксперименты
Авторы проверили Co-RL на текстовых и мультимодальных задачах, сравнивая его с базовыми моделями и label-free подходами без доступа к ground-truth-меткам. На семи текстовых бенчмарках для LLM средний прирост составил 3,0–8,6%, а на четырёх мультимодальных бенчмарках для VLM — 2,3–7,2%. При этом Co-RL не просто обходит аналогичные методы без меток, но в ряде случаев сравнивается с супервизорным обучением или даже превосходит его — хотя размеченные данные ему вообще не требуются.
Это важный сигнал для индустрии: возможно, будущее не за бесконечным сбором дорогих аннотаций, а за правильно организованным взаимодействием моделей. Чем больше агентов участвуют в оценке друг друга и чем сильнее они отличаются, тем более устойчивым и качественным становится обучение.

Практические выводы
Co-RL выглядит убедительным шагом в сторону по-настоящему самообучающихся систем. Он не требует разметки, не выгорает на собственной обратной связи и при этом сохраняет высокое качество рассуждений. Разработчики отмечают, что код фреймворка доступен для сообщества — значит, подход можно воспроизвести и адаптировать под свои задачи уже сегодня.
Конечно, остаются вопросы: например, как оптимально подбирать состав когорты под конкретную задачу и не слишком ли дорого обучать сразу несколько моделей. Но сама идея — обучать модели не в одиночку, а в коллективе, где каждый оценивает других, — открывает интересное направление для исследований. Возможно, именно такие механизмы приближают нас к системам, которые учатся рассуждать так же естественно, как люди перенимают опыт друг у друга.



