Что такое DSPA
DSPA (Dynamic SAE Steering for Preference Alignment) — метод выравнивания предпочтений на этапе вывода. Он не обновляет веса базовой модели, а использует данные о предпочтениях для управления генерацией.
Для этого методу нужны preference triples. По ним DSPA строит карту, которая связывает признаки промпта с признаками управления генерацией.
Как DSPA меняет генерацию
Во время декодирования метод изменяет только латенты, активные для текущего токена. Остальные латенты он не затрагивает.

Основные этапы:
- DSPA получает preference triples.
- Строит conditional-difference map между признаками промпта и управления.
- Во время декодирования изменяет активные для токена латенты.
Что показали эксперименты
На Gemma-2-2B/9B и Qwen3-8B метод улучшил результаты на MT-Bench. На AlpacaEval DSPA показал конкурентоспособность, а на multiple-choice задачах сохранил точность.
При ограниченных данных о предпочтениях метод оставался устойчивым и мог соперничать с двухэтапным конвейером RAHF-SCIT. Для выравнивания DSPA требовал до 4.47× меньше FLOPs.
Работа принята на EMNLP 2026 Main Conference. Результаты относятся к указанным моделям и задачам.
Какие сигналы использует метод
Аудит изменяемых SAE-признаков показал, что направления предпочтений в основном связаны с дискурсивными и стилистическими сигналами.
В работе также представлена теория, уточняющая оценку conditional-difference map. Она описывает условия, при которых обоснован top-k ablation.
Когда рассматривать DSPA
Метод может быть кандидатом для задач, где нужно выравнивать предпочтения без обновления весов базовой модели. Для его работы нужны preference triples.
Практический критерий — сопоставить задачу с результатами на MT-Bench, AlpacaEval и multiple-choice задачах. При сравнении с RAHF-SCIT отдельно учитывают FLOPs на этапе выравнивания.



