Зачем проверять чекпоинты, а не только их ответы
При подготовке открытой модели к развёртыванию важно понимать, кто и как её менял. Помимо обычного дообучения существует аблитерация — приём, который точечно вычищает из активаций сигнал отказа от вредных запросов. Модель при этом остаётся внешне похожей на оригинал, но фактически работает без внутреннего «стопа». Обнаружить такое вмешательство по генерациям сложно: рантайм-гарды гоняют тестовые промпты и оценивают ответы, а не сам артефакт. Если вредный сценарий не попал в проверочный набор, модификацию никто не заметит. Поэтому честный аудит весов должен выполняться до инференса, а не во время него.
Две оси проверки: активационный зазор и след в весах
Исследование, представленное в области криптографии и безопасности, описывает дешёвый двухсигнальный аудит, который не требует подбора порогов и не опирается на внешние поведенческие тесты. Подозрительный чекпоинт сравнивается с заверенным референсом (attested reference) по двум осям:
- Reference-anchored activation refusal-gap — зазор между активациями, связанными с отказом, у кандидата и у референса. Если аблитерация стёрла паттерн отказа, зазор ведёт себя иначе, чем у честной тонкой настройки.
- Weight-recovery energy — энергия восстановления весов: насколько сильное изменение параметров нужно, чтобы вернуть кандидата к базовой версии. Этот сигнал ловит даже те вмешательства, которые почти не отражаются на активациях.
Сигналы отрицательно коррелируют, поэтому их суммарная z-статистика оказывается информативнее, чем каждая ось по отдельности. Первая ось отвечает за специфичность: она показывает, задет ли именно механизм отказа. Вторая — за полноту: она не даёт спрятать модификацию в малозаметных правках весов.

Насколько метод надёжен на практике
Аудит проверили на реестре из 273 чекпоинтов, охватывающем разные открытые архитектуры. Внутри выборки объединённый z-сигнал почти без ошибок отделял 57 публичных аблитераций от 37 обычных случаев дообучения, слияний и instruction-настроек: AUROC 0.95. По отдельности те же сигналы дают заметно худшие результаты — 0.84 и 0.90. Интереснее, что порог, откалиброванный по критерию Юдена, переносится на новые, не встречавшиеся ранее семейства. Там balanced accuracy составил 0.89 при доле ложных срабатываний 0.11. Из 57 аблитераций метод пропустил только 4 — по меркам первичного фильтра это хороший результат.
Слабые места: когда обманываются обе оси
Никакой аудит по двум сигналам не закрывает все сценарии атаки. Авторы честно перечисляют два типа сбоев.
Первый — поддельный референс. Если злоумышленник контролирует точку отсчёта, он может подобрать эталон так, чтобы разница base-to-candidate оказалась нулевой по построению. Тогда не нужно даже обучать модель: обе оси покажут норму.
Второй — white-box атака на порог. Если у владельца весов есть полный доступ к модели, он способен специально дообучить чекпоинт так, чтобы тот оказался за границей решения, но при этом оставался небезопасным с точки зрения гардов и сохранял связность.
Именно поэтому авторы называют подход эффективным триажем, а не защитой от вмешательства. Он позволяет быстро отсеять заведомо чистые и подозрительные чекпоинты, но не может выступать единственным барьером безопасности.

Вывод: инструмент для первого фильтра
Двухсигнальная проверка хороша тем, что требует лишь доверенного референса и двух дешёвых замеров, а результат легко калибровать под конкретный реестр. Главные ограничения — зависимость от заверенного эталона и уязвимость к целенаправленной white-box атаке. Кроме того, статистика пока собиралась на одном реестре, поэтому на сильно отличающихся архитектурах точность может измениться. Тем не менее, для экосистемы открытых весов это практичный шаг: раньше приходилось выбирать между поверхностными тестами генераций и полным реверс-инжинирингом, а теперь появился промежуточный вариант, который можно использовать как первый фильтр.



