Co-RL : apprentissage multi-agents sans étiquettes, où les modèles raisonnent en s'évaluant mutuellement

1 septembre 20269 vues

Des chercheurs ont proposé l'approche Co-RL, dans laquelle une cohorte de modèles indépendants est entraînée sur les évaluations des uns des autres, sans recourir à un étiquetage coûteux. La méthode améliore la qualité du raisonnement et la robustesse de l'entraînement sur des tâches textuelles et multimodales, et atteint dans certains cas le niveau des approches supervisées.

Co-RL : apprentissage multi-agents sans étiquettes, où les modèles raisonnent en s'évaluant mutuellement

Pourquoi le RL bute sur les étiquettes

L'apprentissage par renforcement (RL) est aujourd'hui considéré comme l'une des approches les plus prometteuses pour améliorer le raisonnement des modèles linguistiques et vision-langage. La logique est simple : le modèle essaie différentes stratégies, reçoit une récompense pour les bonnes actions et apprend progressivement à mieux raisonner. Mais il y a un piège — pour que la récompense soit pertinente, il faut généralement des signaux externes précis : des réponses vérifiables, des solutions de référence, des chaînes de raisonnement annotées. Tout cela est coûteux à préparer, et pour de nombreuses tâches, ces données se font de plus en plus rares.

L'approche self-rewarding résout partiellement le problème, lorsque le modèle évalue lui-même ses propres réponses et ajuste son comportement en conséquence. Cependant, un cercle vicieux apparaît ici : si le modèle a déjà des biais ou a pris l'habitude de répondre de manière sous-optimale, il renforcera ces mêmes erreurs. L'apprentissage sur sa propre rétroaction mène rapidement à l'uniformité : les réponses deviennent similaires les unes aux autres, la diversité diminue et, dans le pire des cas, un effondrement se produit — le modèle se fige sur un ensemble restreint de schémas et cesse de progresser.

Comment fonctionne Co-RL

Les auteurs de la prépublication arXiv:2608.17253 proposent le framework Co-RL, qui brise ce cercle vicieux. Au lieu d'un seul modèle qui apprend sur ses propres évaluations, Co-RL entraîne simultanément plusieurs modèles entièrement indépendants — ils ne partagent pas de paramètres communs et ne consultent pas les poids des uns et des autres. Chaque modèle reçoit des récompenses non pas de lui-même, mais des autres participants de la cohorte (peers). En substance, les modèles raisonnent, critiquent et s'évaluent mutuellement, et c'est précisément sur la base de ces évaluations « externes » que l'apprentissage est construit.

Cet échange de rétroaction change fondamentalement la dynamique. Les erreurs des différents modèles coïncident rarement entièrement — chacun a ses propres points faibles, ses propres schémas de pensée et ses propres préjugés. Par conséquent, lorsqu'un modèle évalue la réponse d'un autre, la probabilité qu'il « confirme » l'erreur systématique de l'autre est considérablement réduite. Cela permet d'éviter les boucles de rétroaction auto-renforçantes qui brisent l'approche self-rewarding.

La diversité comme ingrédient clé

L'idée centrale de Co-RL est que le succès dépend directement de la diversité de la cohorte. Si tous les modèles sont identiques, ils se contenteront d'être d'accord entre eux et aucun avantage n'en résultera. C'est pourquoi les auteurs proposent trois niveaux d'hétérogénéité :

  • Différentes familles de modèles — par exemple, combiner des architectures de différents fournisseurs afin qu'elles n'héritent pas d'erreurs communes.
  • Différentes tailles — les grands et les compacts modèles perçoivent la tâche différemment, et leurs évaluations se complètent mutuellement.
  • Échantillons d'entraînement reformulés — les mêmes exemples sont présentés avec des formulations différentes, ce qui réduit la corrélation des erreurs causées par un même énoncé de tâche.

Cette hétérogénéité de la cohorte réduit les erreurs corrélées, qui sont dangereuses car elles s'accumulent d'itération en itération. En parallèle, la diversité comportementale est préservée — les modèles ne se replient pas sur un style de raisonnement unique, mais continuent d'explorer différentes approches.

Ce que les expériences ont montré

Les auteurs ont testé Co-RL sur des tâches textuelles et multimodales, en le comparant à des modèles de base et à des approches sans étiquettes (label-free) sans accès aux annotations de vérité terrain (ground-truth). Sur sept benchmarks textuels pour LLM, le gain moyen était de 3,0 à 8,6 %, et sur quatre benchmarks multimodaux pour VLM — de 2,3 à 7,2 %. De plus, Co-RL ne se contente pas de surpasser les méthodes similaires sans étiquettes, mais dans certains cas, il se compare à l'apprentissage supervisé ou le dépasse même — bien qu'il n'ait pas du tout besoin de données annotées.

C'est un signal important pour l'industrie : peut-être que l'avenir ne réside pas dans la collecte infinie d'annotations coûteuses, mais dans une interaction correctement organisée entre les modèles. Plus les agents participent à l'évaluation mutuelle et plus ils sont différents, plus l'apprentissage devient robuste et de qualité.

Conclusions pratiques

Co-RL apparaît comme une avancée convaincante vers des systèmes véritablement auto-apprenants. Il ne nécessite pas d'annotation, ne s'épuise pas sur sa propre rétroaction et maintient une haute qualité de raisonnement. Les développeurs notent que le code du framework est disponible pour la communauté — l'approche peut donc être reproduite et adaptée à vos propres tâches dès aujourd'hui.

Bien sûr, des questions subsistent : par exemple, comment sélectionner de manière optimale la composition de la cohorte pour une tâche spécifique, et n'est-il pas trop coûteux d'entraîner plusieurs modèles à la fois. Mais l'idée elle-même — entraîner les modèles non pas individuellement, mais en collectif, où chacun évalue les autres — ouvre une direction de recherche intéressante. Peut-être que ce sont précisément ces mécanismes qui nous rapprochent de systèmes capables d'apprendre à raisonner aussi naturellement que les humains transmettent leur expérience.

Foire aux questions

Co-RL : apprentissage multi-agents sans étiquettes, où les modèles raisonnent en s'évaluant mutuellement