Когда «забытое» возвращается
Механизм разобучения больших языковых моделей обычно выглядит эффектно: после процедуры удаления нежелательной информации модель перестаёт выдавать тексты на запрещённую тему. Но такая чистка редко бывает устойчивой. Если после неё провести обычную тонкую настройку на небольшом фрагменте тех самых данных, знания возвращаются почти без усилий. Эксперименты с датасетом TOFU показывают, что дообучение всего на двадцати забытых примерах способно существенно восстановить метрики на целевом множестве для всех известных методов разобучения. Дело здесь не в качестве конкретной техники, а в свойствах оптимизационного процесса: после процедуры забывания создаётся особая геометрия потерь, через которую повторное обучение легко прокладывает путь назад.

Обрыв маржи: единый сценарий возврата знаний
Учёные проанализировали поведение четырнадцати пост-хок методов разобучения — градиентных, основанных на предпочтениях и на дистилляции — и обнаружили странную закономерность. Для каждого метода и размера модели можно измерить маржу ответа на уровне отдельных токенов, то есть запас, с которым модель предпочитает один токен другому. Оказалось, что после разобучения эта маржа почти всегда сходится в узкую полосу, расположенную чуть выше уровня, заданного сохранённым (retain) набором данных. Феномен встретился в 41 из 42 возможных комбинаций метод-размер модели, за что получил название «обрыв маржи» — по аналогии с геологическим обрывом, за которым ничего нет.

Почему обрыв возникает
Математически удалось показать, что обрыв появляется тогда, когда связи с retain-множеством удерживают диагностические логиты забытого контента выше некоторого порога. Этого достаточно, чтобы оптимизация остановилась: исходная функция потерь токен-насыщающих методов достигает стационарной точки, хотя забывание ещё не гарантировано. Проверка на 34 из 42 ячеек эксперимента подтвердила, что именно насыщение потерь создаёт тот самый «ложный успех», из-за которого возврат знаний становится тривиальным.
Margin Calibration: как чинить обрыв
Авторы работы предлагают плагин-полировку под названием Margin Calibration (MC). Это не самостоятельный метод разобучения, а дополнительный модуль, который навешивается поверх любого существующего подхода. Вместо того чтобы полагаться на насыщающуюся потерю, MC добавляет ненасыщающийся маржинальный hinge: он сравнивает per-token маржу конкретного токена с маржой референсного ответа, полученного на retain-данных. Дополнительно применяется KL-зонд на корпусе инструкций, не связанном с исходным обучающим распределением. За счёт такого гибридного давления удаётся восстановить силу сигнала на стороне забывания именно в тех местах, где исходная потеря «увязла» в стационарной точке.
Теоретическая часть добавляет уверенности: если градиенты от разных компонент выровнены по доминированию, то стационарное множество MC находится на стороне пересечения с обрывом. Это даёт возможность оценить верхнюю границу бюджета атаки на подъём маржи: если атакующий попытается повторить обучение, ему придётся пройти через серьёзное сопротивление, а не проскользнуть по отполированному склону.
Результаты: победа над атаками и цена вопроса
Эффективность MC проверяли на трёх бенчмарках: TOFU с тремя размерами моделей Llama-3 и тремя уровнями забывания, MUSE-News на Llama-2-7B-hf и отдельной панели Phi-3.5. Не меняя конфигурацию под конкретный случай, плагин-полировка выиграла все 14 парных сравнений forget-агрегатов и заполнила все доступные ячейки теста на повторное обучение. Цифры говорят сами за себя: средняя по панели метрика ROUGE-L после атаки упала с 0.41 до 0.18 — то есть модель почти перестала воспроизводить забытые тексты, даже когда её пытались «переучить». В дополнение MC снизила сырую AUC членства (метрику определения, входили ли данные в обучающую выборку) в 13 из 14 случаев.

Однако есть и обратная сторона. Во всех экспериментах фиксировалось снижение полезности модели на retain-стороне: плагин делает разобучение глубже, но при этом модель хуже справляется с задачами, связанными с сохранёнными знаниями. Этот компромисс необходимо закладывать в сценарий применения: для задач, где производительность на retain-данных критична, потребуется тонкая настройка порогов или более лёгкая регуляризация.
Производственный вариант без retain-референса
Описанная выше схема MC опирается на референсные маржи, полученные из обученного на retain-данных «эталонного» ответа. Но на практике часто нет доступа к исходному обучающему распределению. Для таких случаев предусмотрен отдельный вариант развёртывания: он позволяет достичь тех же улучшений без использования retain-обученного референса, заменяя его на априорно заданные пороги или контрольные маржи из общего корпуса инструкций. Это делает метод применимым в реальных продуктах, где данные для разобучения уже удалены из системы и восстановление референса невозможно или запрещено политикой приватности.
Выводы
Главный практический вывод из исследования: разобучение языковых моделей нельзя считать надежным, пока не учтена оптимизационная геометрия. «Обрыв маржи» объясняет, почему многие красивые методы на бумаге не выдерживают даже слабых атак повторного обучения, и показывает направление для дальнейших работ. Margin Calibration — один из первых плагинов, который целенаправленно борется с этим явлением, и пусть он пока не решает проблему без побочных эффектов, он задаёт правильную рамку: вместо «один раз забыл — забыл навсегда» стоит думать о создании такого ландшафта потерь, где возврат забытого оказывается невыгодным и энергетически затратным.



