Двухсигнальная проверка чекпоинтов: находим скрытую аблитерацию и её слабые места

8 сентября 202624 просмотров

Автор предлагает бес-пороговый аудит открытых весовых моделей по паре взаимодополняющих сигналов внутри артефакта. В тестах на 273 чекпоинтах метод достигает AUROC 0.95, но остаётся триажем, а не защитой от умышленного обхода.

Двухсигнальная проверка чекпоинтов: находим скрытую аблитерацию и её слабые места

Зачем проверять чекпоинты, а не только их ответы

При подготовке открытой модели к развёртыванию важно понимать, кто и как её менял. Помимо обычного дообучения существует аблитерация — приём, который точечно вычищает из активаций сигнал отказа от вредных запросов. Модель при этом остаётся внешне похожей на оригинал, но фактически работает без внутреннего «стопа». Обнаружить такое вмешательство по генерациям сложно: рантайм-гарды гоняют тестовые промпты и оценивают ответы, а не сам артефакт. Если вредный сценарий не попал в проверочный набор, модификацию никто не заметит. Поэтому честный аудит весов должен выполняться до инференса, а не во время него.

Две оси проверки: активационный зазор и след в весах

Исследование, представленное в области криптографии и безопасности, описывает дешёвый двухсигнальный аудит, который не требует подбора порогов и не опирается на внешние поведенческие тесты. Подозрительный чекпоинт сравнивается с заверенным референсом (attested reference) по двум осям:

  • Reference-anchored activation refusal-gap — зазор между активациями, связанными с отказом, у кандидата и у референса. Если аблитерация стёрла паттерн отказа, зазор ведёт себя иначе, чем у честной тонкой настройки.
  • Weight-recovery energy — энергия восстановления весов: насколько сильное изменение параметров нужно, чтобы вернуть кандидата к базовой версии. Этот сигнал ловит даже те вмешательства, которые почти не отражаются на активациях.

Сигналы отрицательно коррелируют, поэтому их суммарная z-статистика оказывается информативнее, чем каждая ось по отдельности. Первая ось отвечает за специфичность: она показывает, задет ли именно механизм отказа. Вторая — за полноту: она не даёт спрятать модификацию в малозаметных правках весов.

Насколько метод надёжен на практике

Аудит проверили на реестре из 273 чекпоинтов, охватывающем разные открытые архитектуры. Внутри выборки объединённый z-сигнал почти без ошибок отделял 57 публичных аблитераций от 37 обычных случаев дообучения, слияний и instruction-настроек: AUROC 0.95. По отдельности те же сигналы дают заметно худшие результаты — 0.84 и 0.90. Интереснее, что порог, откалиброванный по критерию Юдена, переносится на новые, не встречавшиеся ранее семейства. Там balanced accuracy составил 0.89 при доле ложных срабатываний 0.11. Из 57 аблитераций метод пропустил только 4 — по меркам первичного фильтра это хороший результат.

Слабые места: когда обманываются обе оси

Никакой аудит по двум сигналам не закрывает все сценарии атаки. Авторы честно перечисляют два типа сбоев.

Первый — поддельный референс. Если злоумышленник контролирует точку отсчёта, он может подобрать эталон так, чтобы разница base-to-candidate оказалась нулевой по построению. Тогда не нужно даже обучать модель: обе оси покажут норму.

Второй — white-box атака на порог. Если у владельца весов есть полный доступ к модели, он способен специально дообучить чекпоинт так, чтобы тот оказался за границей решения, но при этом оставался небезопасным с точки зрения гардов и сохранял связность.

Именно поэтому авторы называют подход эффективным триажем, а не защитой от вмешательства. Он позволяет быстро отсеять заведомо чистые и подозрительные чекпоинты, но не может выступать единственным барьером безопасности.

Вывод: инструмент для первого фильтра

Двухсигнальная проверка хороша тем, что требует лишь доверенного референса и двух дешёвых замеров, а результат легко калибровать под конкретный реестр. Главные ограничения — зависимость от заверенного эталона и уязвимость к целенаправленной white-box атаке. Кроме того, статистика пока собиралась на одном реестре, поэтому на сильно отличающихся архитектурах точность может измениться. Тем не менее, для экосистемы открытых весов это практичный шаг: раньше приходилось выбирать между поверхностными тестами генераций и полным реверс-инжинирингом, а теперь появился промежуточный вариант, который можно использовать как первый фильтр.

Часто задаваемые вопросы

Похожие материалы

Все материалы
Двухсигнальная проверка чекпоинтов: аудит аблитерации