Co-RL: мультиагентное обучение без меток, где модели рассуждают, оценивая друг друга

1 сентября 20269 просмотров

Исследователи предложили подход Co-RL, в котором когорта независимых моделей обучается на оценках друг друга, обходясь без дорогой разметки. Метод улучшает качество рассуждений и устойчивость обучения на текстовых и мультимодальных задачах, а в ряде случаев достигает уровня supervised-подходов.

Co-RL: мультиагентное обучение без меток, где модели рассуждают, оценивая друг друга

Проблема: почему RL упирается в метки

Обучение с подкреплением (RL) сегодня считается одним из самых перспективных способов улучшать рассуждения языковых и визуально-языковых моделей. Логика простая: модель пробует разные стратегии, получает награду за правильные действия и постепенно учится рассуждать лучше. Но есть подвох — чтобы награда была осмысленной, обычно нужны точные сигналы извне: проверяемые ответы, эталонные решения, размеченные цепочки рассуждений. Всё это дорого готовить, а для многих задач таких данных становится всё меньше.

Частично проблему решает подход self-rewarding, когда модель сама оценивает собственные ответы и на этой основе корректирует поведение. Однако здесь возникает замкнутый круг: если модель уже имеет смещения или привыкла отвечать субоптимально, она будет усиливать эти же ошибки. Обучение на собственной обратной связи быстро приводит к однообразию: ответы становятся похожими друг на друга, разнообразие падает, а в худшем случае наступает коллапс — модель зацикливается на узком наборе шаблонов и перестаёт развиваться.

Как устроен Co-RL

Авторы препринта arXiv:2608.17253 предлагают фреймворк Co-RL, который разрывает этот порочный круг. Вместо одной модели, которая учится на своих же оценках, Co-RL одновременно обучает несколько полностью развязанных моделей — они не делят общие параметры и не подсматривают друг у друга веса. Каждая модель получает награды не от себя, а от других участников когорты (peers). По сути, модели рассуждают, критикуют и оценивают друг друга, и именно на основе этих «внешних» оценок строится обучение.

Такой обмен обратной связью принципиально меняет динамику. Ошибки разных моделей редко совпадают полностью — у каждой свои слабые места, свои паттерны мышления и свои предубеждения. Поэтому когда одна модель оценивает ответ другой, вероятность того, что она «подтвердит» чужую системную ошибку, значительно ниже. Это позволяет избежать самоусиливающихся петель обратной связи, из-за которых ломается self-rewarding подход.

Разнообразие как главный ингредиент

Ключевая идея Co-RL в том, что успех напрямую зависит от разнообразия когорты. Если все модели будут одинаковыми, они просто будут соглашаться друг с другом и никакого преимущества не получится. Поэтому авторы предлагают три уровня гетерогенности:

  • Разные семейства моделей — например, комбинировать архитектуры разных производителей, чтобы они не наследовали общие ошибки.
  • Разные размеры — крупные и компактные модели по-разному видят задачу, и их оценки взаимно дополняют друг друга.
  • Перефразированные обучающие выборки — одни и те же примеры подаются в разной формулировке, что снижает корреляцию ошибок, вызванных одинаковой постановкой задачи.

Такая пестрота когорты снижает скоррелированные ошибки, которые опасны тем, что они накапливаются от итерации к итерации. Заодно сохраняется поведенческое разнообразие — модели не схлопываются к единому стилю рассуждений, а продолжают исследовать разные подходы.

Что показали эксперименты

Авторы проверили Co-RL на текстовых и мультимодальных задачах, сравнивая его с базовыми моделями и label-free подходами без доступа к ground-truth-меткам. На семи текстовых бенчмарках для LLM средний прирост составил 3,0–8,6%, а на четырёх мультимодальных бенчмарках для VLM2,3–7,2%. При этом Co-RL не просто обходит аналогичные методы без меток, но в ряде случаев сравнивается с супервизорным обучением или даже превосходит его — хотя размеченные данные ему вообще не требуются.

Это важный сигнал для индустрии: возможно, будущее не за бесконечным сбором дорогих аннотаций, а за правильно организованным взаимодействием моделей. Чем больше агентов участвуют в оценке друг друга и чем сильнее они отличаются, тем более устойчивым и качественным становится обучение.

Практические выводы

Co-RL выглядит убедительным шагом в сторону по-настоящему самообучающихся систем. Он не требует разметки, не выгорает на собственной обратной связи и при этом сохраняет высокое качество рассуждений. Разработчики отмечают, что код фреймворка доступен для сообщества — значит, подход можно воспроизвести и адаптировать под свои задачи уже сегодня.

Конечно, остаются вопросы: например, как оптимально подбирать состав когорты под конкретную задачу и не слишком ли дорого обучать сразу несколько моделей. Но сама идея — обучать модели не в одиночку, а в коллективе, где каждый оценивает других, — открывает интересное направление для исследований. Возможно, именно такие механизмы приближают нас к системам, которые учатся рассуждать так же естественно, как люди перенимают опыт друг у друга.

Часто задаваемые вопросы

Похожие материалы

Все материалы
Co-RL: мультиагентное обучение моделей без разметки