JUMP: однопроходный аудит приватных данных в дообученных диффузионных языковых моделях

6 сентября 202618 просмотров

Новый метод JUMP определяет, использовались ли конкретные записи при дообучении диффузионной языковой модели: он маскирует позиции с низкой уверенностью базовой модели и сравнивает реконструкцию с целевой моделью за один проход. На наборе MIMIR точность AUROC выросла до 0,902 на LLaDA-8B-Base и до 0,942 на Dream-v0-Base-7B — при трёх прогонах модели вместо 32 у SAMA.

JUMP: однопроходный аудит приватных данных в дообученных диффузионных языковых моделях

Аудит приватности открытых моделей

Публичные веса — это удобно, но они же создают скрытый риск. Компания может взять open-weight модель и дообучить её на внутренней базе: переписках, медицинских данных или корпоративных документах. Пользователь обычно не знает, какие именно записи попали в обучение, а для регуляторов и клиентов это принципиальный вопрос. Проверка на «членство» в тренировочном наборе — membership inference — как раз отвечает на него: можно ли по поведению модели понять, что конкретный текст использовался при адаптации.

Задача усложняется тем, что у нас обычно есть только чекпоинт после дообучения и открытая версия модели до него. Сравнивая реакции двух чекпоинтов на один и тот же фрагмент, можно попытаться отделить эффект дообучения от общего поведения модели.

Особенности диффузионных языковых моделей

Классические LLM генерируют текст токен за токеном, слева направо. Дискретные диффузионные языковые модели (dLLM) устроены иначе: они умеют одновременно восстанавливать несколько замаскированных позиций. Вместо последовательных предсказаний модель принимает на вход текст с произвольным множеством масок и выдаёт вероятности для всех «дырок» за один прямой проход.

Эта способность делает dLLM особенно интересными для аудита приватности. Если нужно проверить, помнит ли модель конкретный отрывок, можно скрыть часть токенов и посмотреть на реакцию. Однако вопрос в том, какие позиции маскировать и как интерпретировать ответ.

Почему простое усреднение масок не работает

Первая интуиция — перебрать много разных случайных масок и усреднить ошибку реконструкции. Именно так работает старый подход SAMA: модель прогоняется на десятках случайных вариантов, а затем сигнал усредняется.

У такого решения есть два недостатка. Во-первых, случайные маски часто захватывают «скучные» позиции, которые модель предсказывает одинаково и без дообучения, — полезный сигнал тонет в шуме. Во-вторых, каждый прогон стоит ресурсов: для одного сэмпла нужно десятки проходов через модель, что в масштабах большого датасета превращается в дорогую операцию. Нужен способ выбирать маски осмысленно, а не наугад.

Уверенность подсказывает, где маскировать

Авторы нового препринта предложили метод JUMP (Joint Uncertainty-Guided Mask Probing). Идея в том, чтобы использовать референс-модель — чекпоинт до дообучения — как «детектор лжи».

Сначала запускается референс-модель на исходном тексте и находятся позиции, в которых она наименее уверена. Предполагается, что именно такие места сильнее всего меняются при дообучении: если в этих точках течёт специфическая информация, модель вынуждена была её выучить. Затем эти низкоуверенные позиции маскируются все вместе, и целевая модель реконструирует их за один запрос.

Дальше сравнивается разрыв между реконструкциями целевой и референсной моделей. Чтобы не учитывать случайные отклонения, применяется обрезание: в агрегацию попадают только те различия, которые выходят за некоторый порог. Такой «обрезанный» разрыв лучше отделяет истинный сигнал от шума, а совместное маскирование информативных позиций экономит вычисления.

Результаты: меньше проходов — выше точность

Свою проверку авторы провели на бенчмарке MIMIR, который охватывает шесть текстовых доменов. В качестве подопытных выступили две open-weight диффузионные модели: LLaDA-8B-Base и Dream-v0-Base-7B.

В среднем по доменам метрика ROC-AUC для LLaDA выросла с 0.819 до 0.902, а для Dream — с 0.851 до 0.942. Это заметный прирост точности атрибуции. При этом JUMP тратит всего три прохода модели на сэмпл, тогда как SAMA требуется 32. Иными словами, метод не только точнее, но и примерно на порядок дешевле по числу инференсов.

Практическое значение

Предложенный подход показывает, что для аудита дообученных диффузионных моделей не нужно перебирать слепые маски. Достаточно спросить референс-модель, где ей не хватает уверенности, и направить проверку точно в эти области. Это даёт инструмент, который может применяться при выпуске обновлений open-weight моделей и для проверки соблюдения требований к персональным данным.

Работа пока в статусе препринта — 22 страницы, текущая версия v2 от 18 августа 2026 года. Впрочем, сама постановка задачи и сильные результаты позволяют ожидать, что у метода появится продолжение: адаптация к другим типам диффузионных архитектур или устойчивость к более агрессивным сценариям дообучения.

Часто задаваемые вопросы

Похожие материалы

Все материалы
JUMP: аудит приватных данных в диффузионных языковых моделях