Интервальные повторения по методу SuperMemo-2: как дообучать языковые модели без забывания
Когда большую языковую модель продолжают обучать на новых данных, она рискует растерять уже полученные знания. Это явление знакомо каждому, кто пробовал дообучать нейросеть на узкой области: после нескольких шагов оптимизации модель может «забыть» общую эрудицию. Классический способ смягчить проблему — replay, то есть подмешивание старых примеров в обучающую выборку. Но обычно такой replay устроен слишком грубо: старые и новые данные просто перемешиваются в фиксированной пропорции. При этом все старые примеры считаются одинаково важными, хотя на практике одни знания вымываются быстро, а другие держатся долго.
Авторы недавней работы на arXiv (2608.17530) предлагают переосмыслить continual pre-training как задачу адаптивного планирования повторений. Вместо того чтобы один раз решить, сколько истории подмешивать, модель должна в каждый момент времени выбирать, какие именно примеры вернуть в обучение. Это позволяет реагировать на реальные пробелы в памяти, а не следовать статичному расписанию.

От карточек к параметрам модели
Идея заимствована из когнитивной науки, а точнее — из алгоритма SuperMemo-2 (SM-2), который десятилетиями используют для планирования интервальных повторений при заучивании карточек. SM-2 подсказывает, когда именно нужно показать карточку, чтобы знание закрепилось и не исчезло. В новом методе Spaced Repetition Training (SRT) этот принцип переносится на обучение нейросетей.
SRT ведёт для каждого тренировочного примера собственное состояние повторения. Чтобы понять, насколько хорошо модель ещё помнит пример, используется perplexity — мера того, насколько уверенно модель предсказывает данные. Если perplexity резко растёт, значит, пример начинает забываться, и ему присваивается высокий приоритет для повторного включения в обучение. Такой подход позволяет автоматически возвращать в тренировку и «старые» примеры, нужные для удержания знаний, и «новые», которые ещё не закреплены.
Важно, что SRT не трогает архитектуру модели, функцию потерь или оптимизатор. Все изменения касаются только стратегии сэмплирования данных. То есть метод можно применить поверх существующего процесса обучения без серьёзной переделки пайплайна.
Что показали эксперименты
Метод проверили на временно разделённых корпусах Wikipedia и кода — то есть на данных, которые естественным образом делятся на периоды. Результаты оказались заметно лучше, чем у наивного дообучения и равномерного replay. SRT восстановил от 5 до 37 процентных пунктов точности на старых знаниях, которые наивное обучение успело стереть. При этом производительность на новых данных не ухудшилась, а в ряде случаев даже выросла.
Особенно интересно поведение на крупных моделях: там SRT сохраняет сбалансированную производительность на широких бенчмарках, тогда как наивное дообучение и обычный replay приводят к значительной деградации. Это говорит о том, что планирование повторений становится ещё важнее при росте масштаба модели, когда данных и шагов обучения становится больше.

За пределами языка
Интересно, что принцип работает не только с текстом. Эксперименты с визуальными и табличными данными показали: планирование повторений применимо везде, где можно измерить сигнал recall, то есть понять, что модель забывает конкретный пример. Фактически это универсальный механизм для continual learning, который не привязан к модальности.
Главный вывод из работы — отказ от усреднённого replay в пользу индивидуального графика повторений даёт ощутимый выигрыш в балансе stability-plasticity. Модель продолжает учиться новому, но при этом «повторяет материал» именно тогда, когда начинает его забывать. Такой подход выглядит естественным шагом к более осмысленному дообучению больших языковых моделей.



