Большая языковая модель редко встречается с пользователем в исходном виде. Перед запуском её дообучают под диалоги, ужимают, квантуют, отбрасывают часть весов. Каждый из этих шагов приносит практическую пользу, но почти всегда оставляет след: модель может начать хуже рассуждать, забывать редкие факты или терять чувство стиля. Вопрос в том, можно ли вернуть навыки без полного переобучения на огромных датасетах.
Почему после дообучения и сжатия страдает качество
Катастрофическое забывание обычно сопровождает Supervised Fine-Tuning (SFT). Модель адаптируют под новый формат ответов, и обновление весов непреднамеренно перезаписывает часть старых знаний. Квантизация и прунинг действуют иначе: они экономят память и ускоряют вывод, но заменяют точные вычисления приближёнными и выключают часть связей. В результате деформируется не только поведение модели, но и её внутреннее представление знаний.
Внешние симптомы могут быть разными — от потери фактической точности до однообразных ответов. Однако причина общая: структура скрытого пространства, в котором модель «думает», перестаёт соответствовать той, что была у исходной версии.

Самодистилляция вместо повторного обучения
В работе arXiv:2604.15794 исследователи предложили фреймворк Self-Distillation Fine-Tuning (SDFT). Идея в том, чтобы использовать саму модель как источник восстановления. Повреждённая версия выступает учеником, а её «здоровый» вариант — сохранённый до сжатия или до SFT — учителем. На этапе дообучения студент подстраивает свои ответы и внутренние состояния так, чтобы приблизиться к учителю.
Это не классическая передача знаний от большой модели маленькой. Здесь учитель и ученик — фактически одна и та же архитектура на разных стадиях жизни. Поэтому процесс и называют самодистилляцией: модель не узнаёт ничего принципиально нового, а возвращает себе утраченную внутреннюю согласованность.
Что показывает выравнивание скрытых многообразий
Авторы исходят из того, что генеративные способности LLM фундаментально опираются на высокоразмерное многообразие, которое формируют скрытые слои. Качество модели определяется не отдельными нейронами, а тем, как устроены активации в этом пространстве. Можно представить их как облако точек: у хорошо обученной модели облако имеет характерную структуру, а сжатие или забывание её разрушают.
Чтобы измерить восстановление, в работе применяют Centered Kernel Alignment (CKA) — метрику схожести внутренних представлений учителя и ученика. CKA удобна тем, что инвариантна к ортогональным преобразованиям и масштабированию. Она не придирается к равномерным поворотам или растяжениям координат, а улавливает именно изменение конфигурации активаций.
Эксперименты показали сильную корреляцию между восстановлением производительности и ростом CKA-выравнивания. Чем ближе многообразие студента к многообразию учителя, тем лучше модель возвращает утраченные навыки. Это подтверждает: самодистилляция работает не случайно, а потому что выравнивает геометрическую структуру скрытого пространства.

Практический вывод
Сама по себе идея восстановления модели через дистилляцию не нова. Новизна подхода — в объяснении, почему это срабатывает, и в способе это объяснение проверить. CKA может стать диагностическим инструментом: если после квантования или прунинга выравнивание резко падает, модель нуждается в «ремонте». SDFT, в свою очередь, позволяет этот ремонт выполнить, не возвращаясь к полному циклу обучения.
Работа соединяет практический фреймворк восстановления производительности с геометрической теорией представлений. Это даёт более ясную картину того, что происходит внутри LLM при сжатии и почему самодистилляция способна вернуть утраченные возможности.



