Intervalos de repetición según el método SuperMemo-2: cómo seguir entrenando modelos de lenguaje sin olvidar

28 agosto 202618 vistas

El nuevo marco SRT utiliza el algoritmo SM-2 para planificar qué ejemplos antiguos devolver al entrenamiento y cuándo. Con datos de Wikipedia y código, esto permite recuperar de 5 a 37 puntos porcentuales de precisión en conocimientos antiguos sin pérdida en el aprendizaje de lo nuevo.

Intervalos de repetición según el método SuperMemo-2: cómo seguir entrenando modelos de lenguaje sin olvidar

Repetición espaciada con el método SuperMemo-2: cómo seguir entrenando modelos de lenguaje sin olvidos

Cuando un gran modelo de lenguaje se sigue entrenando con datos nuevos, corre el riesgo de perder los conocimientos ya adquiridos. Este fenómeno lo conoce cualquiera que haya intentado ajustar una red neuronal en un dominio específico: tras varios pasos de optimización, el modelo puede «olvidar» su erudición general. La forma clásica de mitigar el problema es el replay, es decir, mezclar ejemplos antiguos en el conjunto de entrenamiento. Pero normalmente ese replay se implementa de forma demasiado burda: los datos antiguos y nuevos simplemente se mezclan en una proporción fija. Además, todos los ejemplos antiguos se consideran igual de importantes, aunque en la práctica unos conocimientos se erosionan rápido y otros se mantienen durante mucho tiempo.

Los autores de un trabajo reciente en arXiv (2608.17530) proponen replantear el preentrenamiento continuo como una tarea de planificación adaptativa de repeticiones. En lugar de decidir una sola vez cuánta historia mezclar, el modelo debe elegir en cada momento qué ejemplos concretos devolver al entrenamiento. Esto permite reaccionar ante las lagunas reales de memoria, en lugar de seguir un calendario estático.

De las tarjetas a los parámetros del modelo

La idea está tomada de la ciencia cognitiva, más concretamente del algoritmo SuperMemo-2 (SM-2), que se lleva usando décadas para planificar la repetición espaciada en el estudio de tarjetas. SM-2 indica cuándo hay que mostrar una tarjeta para que el conocimiento se consolide y no desaparezca. En el nuevo método, Spaced Repetition Training (SRT), este principio se traslada al entrenamiento de redes neuronales.

SRT mantiene un estado de repetición propio para cada ejemplo de entrenamiento. Para saber hasta qué punto el modelo aún recuerda un ejemplo, se usa la perplexity, una medida de con qué seguridad el modelo predice los datos. Si la perplexity aumenta bruscamente, significa que el ejemplo empieza a olvidarse, y se le asigna una prioridad alta para volver a incluirlo en el entrenamiento. Este enfoque permite devolver automáticamente al entrenamiento tanto los ejemplos «antiguos», necesarios para retener conocimientos, como los «nuevos», que aún no están consolidados.

Es importante que SRT no toca la arquitectura del modelo, la función de pérdida ni el optimizador. Todos los cambios afectan únicamente a la estrategia de muestreo de datos. Es decir, el método se puede aplicar sobre el proceso de entrenamiento existente sin necesidad de rediseñar el pipeline en profundidad.

Qué mostraron los experimentos

El método se probó en corpus de Wikipedia y código separados temporalmente, es decir, en datos que se dividen de forma natural en periodos. Los resultados fueron notablemente mejores que los del ajuste ingenuo y del replay uniforme. SRT recuperó entre 5 y 37 puntos porcentuales de precisión en los conocimientos antiguos que el entrenamiento ingenuo había llegado a borrar. Además, el rendimiento con datos nuevos no empeoró y, en varios casos, incluso mejoró.

Resulta especialmente interesante el comportamiento en modelos grandes: allí SRT mantiene un rendimiento equilibrado en benchmarks amplios, mientras que el ajuste ingenuo y el replay convencional provocan una degradación significativa. Esto sugiere que la planificación de repeticiones cobra aún más importancia a medida que crece la escala del modelo, cuando hay más datos y más pasos de entrenamiento.

Más allá del lenguaje

Curiosamente, el principio no funciona solo con texto. Los experimentos con datos visuales y tabulares mostraron que la planificación de repeticiones es aplicable allí donde se pueda medir una señal de recall, es decir, detectar que el modelo está olvidando un ejemplo concreto. En la práctica, se trata de un mecanismo universal para el continual learning que no está ligado a una modalidad concreta.

La conclusión principal del trabajo es que abandonar el replay promediado en favor de un calendario de repeticiones individualizado aporta una ventaja tangible en el equilibrio stability-plasticity. El modelo sigue aprendiendo cosas nuevas, pero además «repite la materia» justo cuando empieza a olvidarla. Este enfoque parece un paso natural hacia un ajuste más consciente de los grandes modelos de lenguaje.

Preguntas frecuentes

Material similar

Todos los materiales
Intervalos de repetición según el método SuperMemo-2: cómo seguir entrenando modelos de lenguaje sin olvidar