Ce qui est exactement réutilisé
Dans le GRPO classique, chaque rollout participe à une mise à jour des gradients, puis est abandonné. La méthode présentée dans l’article modifie ce cycle : elle conserve certains rollouts et les réintroduit dans l’entraînement.
Le buffer stocke des générations individuelles, et non des groupes entiers. Le replay les priorise en fonction de la valeur de leur advantage : les rollouts ayant les valeurs les plus élevées sont réutilisés.

Critère pratique : il s’agit de réutiliser des rollouts individuels, et non des groupes.
Comment fonctionne le replay
Chaque batch est constitué en deux étapes :
- On y inclut des rollouts on-policy récents.
- On leur ajoute des rollouts sélectionnés séparément dans le buffer.
La sélection des éléments de replay tient compte de la valeur de l’advantage de chaque rollout. Les informations disponibles ne précisent pas la proportion du replay dans le batch.
La principale différence de la méthode est que les rollouts récents restent dans le batch, tandis que le buffer vient les compléter avec des générations sélectionnées.
Comment limiter l’obsolescence
Les auteurs signalent un problème lié au replay naïf : les policies LLM évoluent rapidement à chaque gradient step. Les rollouts sauvegardés peuvent devenir obsolètes et déstabiliser l’entraînement.
La méthode supprime du buffer tout rollout datant de plus de tau_max training steps. Cela fixe une durée de conservation maximale, sans pour autant supprimer le principe même de réutilisation.
Le critère de contrôle porte ici sur l’âge de chaque rollout en training steps, et non sur son appartenance à un groupe.
Résultats de l’évaluation
La méthode a été évaluée sur trois tailles de Qwen3-Base et cinq benchmarks mathématiques. Elle a surpassé GRPO et les baselines de replay naïf.
- Pour chaque taille, le gain moyen sur les cinq benchmarks était positif.
- Pour la taille 4B, le gain a atteint +1.66 pp.
- Selon AES, une métrique qui évalue conjointement l’accuracy et l’efficacité en tokens, la méthode est la seule à afficher un écart positif par rapport à GRPO pour chaque taille.
Le critère pratique de sélection dépend de l’évaluation visée : les résultats couvrent l’accuracy, l’efficacité en tokens et la comparaison avec deux baselines.



