DSPA корректирует ответы языковой модели по предпочтениям во время генерации

26 сентября 202613 просмотров

Метод связывает признаки запроса с SAE-направлениями и применяет их к активным представлениям токенов, не переобучая базовую модель. Испытания на Gemma-2 и Qwen3 показали улучшение результатов на MT-Bench; при небольшом объёме данных о предпочтениях DSPA требует до 4,47 раза меньше вычислений для согласования, чем конвейер RAHF-SCIT.

DSPA корректирует ответы языковой модели по предпочтениям во время генерации

Что такое DSPA

DSPA (Dynamic SAE Steering for Preference Alignment) — метод выравнивания предпочтений на этапе вывода. Он не обновляет веса базовой модели, а использует данные о предпочтениях для управления генерацией.

Для этого методу нужны preference triples. По ним DSPA строит карту, которая связывает признаки промпта с признаками управления генерацией.

Как DSPA меняет генерацию

Во время декодирования метод изменяет только латенты, активные для текущего токена. Остальные латенты он не затрагивает.

Основные этапы:

  1. DSPA получает preference triples.
  2. Строит conditional-difference map между признаками промпта и управления.
  3. Во время декодирования изменяет активные для токена латенты.

Что показали эксперименты

На Gemma-2-2B/9B и Qwen3-8B метод улучшил результаты на MT-Bench. На AlpacaEval DSPA показал конкурентоспособность, а на multiple-choice задачах сохранил точность.

При ограниченных данных о предпочтениях метод оставался устойчивым и мог соперничать с двухэтапным конвейером RAHF-SCIT. Для выравнивания DSPA требовал до 4.47× меньше FLOPs.

Работа принята на EMNLP 2026 Main Conference. Результаты относятся к указанным моделям и задачам.

Какие сигналы использует метод

Аудит изменяемых SAE-признаков показал, что направления предпочтений в основном связаны с дискурсивными и стилистическими сигналами.

В работе также представлена теория, уточняющая оценку conditional-difference map. Она описывает условия, при которых обоснован top-k ablation.

Когда рассматривать DSPA

Метод может быть кандидатом для задач, где нужно выравнивать предпочтения без обновления весов базовой модели. Для его работы нужны preference triples.

Практический критерий — сопоставить задачу с результатами на MT-Bench, AlpacaEval и multiple-choice задачах. При сравнении с RAHF-SCIT отдельно учитывают FLOPs на этапе выравнивания.

Часто задаваемые вопросы

Похожие материалы

Все материалы