DSPA ajusta las respuestas del modelo de lenguaje según las preferencias durante la generación

26 septiembre 202613 vistas

El método vincula las características de la solicitud con las direcciones SAE y las aplica a las representaciones activas de los tokens, sin volver a entrenar el modelo base. Las pruebas con Gemma-2 y Qwen3 mostraron una mejora en los resultados de MT-Bench; con un volumen reducido de datos de preferencias, DSPA requiere hasta 4,47 veces menos cómputo para la alineación que el pipeline RAHF-SCIT.

DSPA ajusta las respuestas del modelo de lenguaje según las preferencias durante la generación

Qué es DSPA

DSPA (Dynamic SAE Steering for Preference Alignment) es un método de alineación de preferencias en tiempo de inferencia. No actualiza los pesos del modelo base, sino que utiliza datos de preferencias para controlar la generación.

Para ello, el método necesita tripletas de preferencias. A partir de ellas, DSPA construye un mapa que relaciona las características del prompt con las características de control de la generación.

Cómo cambia DSPA la generación

Durante la decodificación, el método modifica únicamente las variables latentes activas para el token actual. No afecta a las demás variables latentes.

Etapas principales:

  1. DSPA recibe tripletas de preferencias.
  2. Construye un mapa de diferencias condicionales entre las características del prompt y las de control.
  3. Durante la decodificación, modifica las variables latentes activas para el token.

Qué demostraron los experimentos

En Gemma-2-2B/9B y Qwen3-8B, el método mejoró los resultados en MT-Bench. En AlpacaEval, DSPA mostró un rendimiento competitivo y mantuvo la precisión en tareas de opción múltiple.

Con datos de preferencias limitados, el método siguió siendo robusto y pudo competir con el pipeline de dos etapas RAHF-SCIT. Para la alineación, DSPA necesitó hasta 4.47× menos FLOPs.

El trabajo fue aceptado en la conferencia principal de EMNLP 2026. Los resultados corresponden a los modelos y tareas indicados.

Qué señales utiliza el método

La auditoría de las características SAE modificadas mostró que las direcciones de preferencia están relacionadas principalmente con señales discursivas y estilísticas.

El trabajo también presenta una teoría que precisa la estimación del mapa de diferencias condicionales. Describe las condiciones en las que se justifica la ablación top-k.

Cuándo considerar DSPA

El método puede ser una opción para tareas en las que se necesite alinear preferencias sin actualizar los pesos del modelo base. Para que funcione, se necesitan tripletas de preferencias.

Un criterio práctico consiste en comparar la tarea con los resultados en MT-Bench, AlpacaEval y tareas de opción múltiple. Al compararlo con RAHF-SCIT, también se tienen en cuenta por separado los FLOPs durante la etapa de alineación.

Preguntas frecuentes

Material similar

Todos los materiales
DSPA ajusta las respuestas del modelo de lenguaje según las preferencias durante la generación