Comment réutiliser des générations de qualité pour entraîner GRPO

25 septembre 202615 vues

L’article présente un mécanisme qui sélectionne certaines générations pour le réentraînement en fonction de leur avantage et écarte les données trop anciennes, en les remplaçant par des exemples récents. Sur trois tailles de Qwen3-Base, la méthode a surpassé GRPO et la relecture classique lors de tests de mathématiques, tout en améliorant l’équilibre entre précision et consommation de jetons.

Comment réutiliser des générations de qualité pour entraîner GRPO

Ce qui est exactement réutilisé

Dans le GRPO classique, chaque rollout participe à une mise à jour des gradients, puis est abandonné. La méthode présentée dans l’article modifie ce cycle : elle conserve certains rollouts et les réintroduit dans l’entraînement.

Le buffer stocke des générations individuelles, et non des groupes entiers. Le replay les priorise en fonction de la valeur de leur advantage : les rollouts ayant les valeurs les plus élevées sont réutilisés.

Critère pratique : il s’agit de réutiliser des rollouts individuels, et non des groupes.

Comment fonctionne le replay

Chaque batch est constitué en deux étapes :

  1. On y inclut des rollouts on-policy récents.
  2. On leur ajoute des rollouts sélectionnés séparément dans le buffer.

La sélection des éléments de replay tient compte de la valeur de l’advantage de chaque rollout. Les informations disponibles ne précisent pas la proportion du replay dans le batch.

La principale différence de la méthode est que les rollouts récents restent dans le batch, tandis que le buffer vient les compléter avec des générations sélectionnées.

Comment limiter l’obsolescence

Les auteurs signalent un problème lié au replay naïf : les policies LLM évoluent rapidement à chaque gradient step. Les rollouts sauvegardés peuvent devenir obsolètes et déstabiliser l’entraînement.

La méthode supprime du buffer tout rollout datant de plus de tau_max training steps. Cela fixe une durée de conservation maximale, sans pour autant supprimer le principe même de réutilisation.

Le critère de contrôle porte ici sur l’âge de chaque rollout en training steps, et non sur son appartenance à un groupe.

Résultats de l’évaluation

La méthode a été évaluée sur trois tailles de Qwen3-Base et cinq benchmarks mathématiques. Elle a surpassé GRPO et les baselines de replay naïf.

  • Pour chaque taille, le gain moyen sur les cinq benchmarks était positif.
  • Pour la taille 4B, le gain a atteint +1.66 pp.
  • Selon AES, une métrique qui évalue conjointement l’accuracy et l’efficacité en tokens, la méthode est la seule à afficher un écart positif par rapport à GRPO pour chaque taille.

Le critère pratique de sélection dépend de l’évaluation visée : les résultats couvrent l’accuracy, l’efficacité en tokens et la comparaison avec deux baselines.

Foire aux questions

Matériaux connexes

Tous matériaux
Comment réutiliser des générations de qualité pour entraîner GRPO