Не учиться лишнему: как разделить устойчивые и ложные признаки при настройке промптов в визуально-языковых моделях

2 сентября 202617 просмотров

Авторы показали, что обычная состязательная настройка промптов заставляет модель цепляться за псевдоустойчивые признаки и терять точность на новых классах. Новый метод ADAPT с промптами-приманками решает эту проблему, отделяя полезные признаки от обобщаемых сокращённых путей.

Не учиться лишнему: как разделить устойчивые и ложные признаки при настройке промптов в визуально-языковых моделях

Модели, которые работают одновременно с изображениями и текстом, научились впечатляюще хорошо: они узнают объекты, отвечают на вопросы по картинкам и переносят знания на новые задачи. Однако за этим успехом часто скрывается неочевидная слабость: модель запоминает не настоящие свойства объекта, а сопутствующие детали, которые служат «ярлыками». Состязательная настройка промптов — один из способов сделать модели устойчивее, но и у него есть ловушка. Разберём, почему модель учится не тому, и как новый подход предлагает разделять полезные и обманчивые признаки.

Почему модель учится не тому

Когда визуально-языковую модель донастраивают на данных с шумом или состязательными примерами, кажется логичным ожидать, что устойчивость будет расти равномерно. На практике происходит наоборот: на уже виденных классах модель показывает отличные результаты, а на новых, невиденных классах при появлении состязательных атак качество стремительно падает. Это явление называют переобучением устойчивого обобщения.

Причина в том, что модель начинает опираться на псевдоустойчивые признаки — наборы случайных закономерностей, которые выживают при атаке, но не отражают суть объекта. Например, модель может запомнить текстуру фона, характерные тени или специфический шум, который был в обучающих примерах. Такие признаки проходят проверку состязательными возмущениями, но на новых данных не работают. Модель переобучается не на содержании, а на shortcut-подсказках — и чем дольше обучение, тем сильнее деградация на невиденных классах.

Как разделить признаки: идея ADAPT

Авторы предложения исходят из необычной философии: вместо того чтобы учить модель только нужным признакам, нужно ещё и явно учить её тому, чему не следует учиться. Так появился метод ADAPT (Adversarial Disentangled Prompt Tuning).

Ключевая идея — использовать два типа промптов одновременно:

  • Целевой промпт — отвечает за то, чтобы модель выделяла устойчивые, обобщаемые признаки.
  • Промпты-приманки — специальный пул дополнительных промптов, которые намеренно «забирают на себя» псевдоустойчивые закономерности.

Во время обучения промпты-приманки конкурируют между собой: каждый из них старается захватить определённый тип случайных ярлыков. А целевой промпт принудительно делается ортогональным к приманкам в пространстве вложений. Так устойчивые признаки отделяются от обманчивых: то, что уже «выучили» приманки, целевой промпт использовать не может.

Механика двойных промптов

На практике это выглядит как разделение труда. Промпты-приманки не нужны для финального предсказания — их задача быть «мусорной корзиной» для наследуемых искажений. Целевой же промпт обучается в условиях ограничения: его вектор не должен совпадать с направлением приманок. Ортогональность в пространстве вложений означает, что признаки, которые использовали приманки, не влияют на решение целевого промпта. В результате модель вынуждена искать более глубокие, причинные закономерности.

Почему разделение работает

Ортогональность — не просто технический приём, а способ дать теоретическую гарантию. Анализ метода показывает: специальная функция потерь ограничивает влияние сдвигов псевдоустойчивых признаков на предсказания для невиденных классов.

Если коротко: даже если приманки соберут много лишней информации, эта информация не сможет «перетечь» в целевой промпт. Следовательно, сдвиги распределения данных, которые происходят при переходе от виденных классов к невиденным, меньше влияют на ошибку модели. Такой подход даёт более предсказуемое поведение на состязательных примерах и не приносит устойчивость одних классов в жертву другим.

Что показали эксперименты

Практические тесты подтверждают: ADAPT заметно улучшает устойчивость целевого промпта на невиденных классах по сравнению с существующими методами состязательной настройки. Модель не просто запоминает защиту от конкретных атак, а формирует более чистые признаки, которые работают на новом материале.

Конечно, полностью избавиться от ложных паттернов пока нельзя — задача разделения причинности и корреляции остаётся одной из самых сложных в машинном обучении. Но подход «учить тому, чему не нужно учиться» даёт практический ориентир: иногда лучший способ научить модель — показать ей, что игнорировать.

Главный вывод для практиков: при настройке визуально-языковых моделей стоит следить не только за ростом точности на обучающих данных, но и за тем, на какие признаки модель опирается. Если добавить в процесс обучения «ловушки» для случайных закономерностей — например, через двойные промпты с ортогональностью — можно получить не только более надёжную, но и более честную модель.

Часто задаваемые вопросы

Похожие материалы

Все материалы
ADAPT: как разделить устойчивые и ложные признаки в VLM