Cómo reutilizar generaciones valiosas en el entrenamiento de GRPO

25 septiembre 202615 vistas

El artículo presenta un mecanismo que selecciona generaciones individuales para el reentrenamiento según la magnitud de la ventaja y descarta los datos demasiado antiguos, complementándolos con ejemplos recientes. En tres escalas de Qwen3-Base, el método superó a GRPO y a la reproducción convencional en pruebas matemáticas, y también mejoró el equilibrio entre precisión y consumo de tokens.

Cómo reutilizar generaciones valiosas en el entrenamiento de GRPO

Qué se reutiliza exactamente

En GRPO estándar, cada rollout participa en una actualización de gradiente y después se descarta. El método del artículo cambia este ciclo: conserva rollouts individuales y devuelve algunos seleccionados al entrenamiento.

El búfer almacena generaciones individuales, no grupos completos. Replay les asigna prioridad según el valor de advantage: los rollouts con valores más altos se reutilizan.

Criterio práctico: se trata de reutilizar rollouts individuales, no grupos.

Cómo funciona replay

Cada batch se forma en dos etapas:

  1. Se incluyen rollouts on-policy recientes.
  2. Se les añaden rollouts seleccionados por separado del búfer.

Al seleccionar los elementos de replay, se tiene en cuenta el valor de advantage de cada rollout. En los datos descritos no se indica el tamaño de la proporción de replay en el batch.

La diferencia clave del método es que los rollouts recientes permanecen en el batch, mientras que el búfer los complementa con generaciones seleccionadas.

Cómo se limita el envejecimiento

Los autores señalan el problema del replay ingenuo: las políticas de LLM cambian rápidamente con cada paso de gradiente. Los rollouts guardados pueden quedar obsoletos y desestabilizar el entrenamiento.

El método elimina del búfer cualquier rollout que tenga más de tau_max pasos de entrenamiento. Esto establece un límite de almacenamiento, pero no anula el hecho de que se reutilizan.

El criterio de control es aquí la antigüedad de cada rollout en pasos de entrenamiento, no su pertenencia a un grupo.

Qué mostró la evaluación

El método se evaluó en tres escalas de Qwen3-Base y cinco benchmarks matemáticos. Superó a GRPO y a los baselines de replay ingenuo.

  • En cada escala, la mejora en el promedio de los cinco benchmarks fue positiva.
  • En la escala 4B, la mejora alcanzó +1.66 pp.
  • Según AES, la métrica de evaluación conjunta de accuracy y eficiencia de tokens, el método fue la única opción que logró superar a GRPO en cada escala.

El criterio práctico de selección depende de la evaluación objetivo: los resultados abarcan accuracy, eficiencia de tokens y la comparación con dos baselines.

Preguntas frecuentes

Material similar

Todos los materiales
Cómo reutilizar generaciones valiosas en el entrenamiento de GRPO