DSPA ajusta as respostas do modelo de linguagem de acordo com as preferências durante a geração

26 setembro 202613 visualizações

O método associa as características do prompt às direções SAE e aplica-as às representações ativas dos tokens, sem voltar a treinar o modelo base. Os testes com Gemma-2 e Qwen3 mostraram uma melhoria nos resultados do MT-Bench; com um pequeno volume de dados de preferência, o DSPA requer até 4,47 vezes menos computação para o alinhamento do que o pipeline RAHF-SCIT.

DSPA ajusta as respostas do modelo de linguagem de acordo com as preferências durante a geração

O que é DSPA

DSPA (Dynamic SAE Steering for Preference Alignment) é um método de alinhamento de preferências na fase de inferência. Não atualiza os pesos do modelo de base, mas utiliza dados de preferências para controlar a geração.

Para isso, o método precisa de triplos de preferência. Com base neles, o DSPA constrói um mapa que associa as características do prompt às características de controlo da geração.

Como o DSPA altera a geração

Durante a descodificação, o método modifica apenas os latentes ativos para o token atual. Não afeta os restantes latentes.

Etapas principais:

  1. O DSPA recebe triplos de preferência.
  2. Constrói um mapa de diferença condicional entre as características do prompt e as de controlo.
  3. Durante a descodificação, modifica os latentes ativos para o token.

O que mostraram as experiências

Com Gemma-2-2B/9B e Qwen3-8B, o método melhorou os resultados no MT-Bench. No AlpacaEval, o DSPA demonstrou ser competitivo e, em tarefas de escolha múltipla, manteve a precisão.

Com dados de preferências limitados, o método manteve-se robusto e conseguiu competir com o pipeline de duas etapas RAHF-SCIT. Para o alinhamento, o DSPA necessitou de até 4.47× menos FLOPs.

O trabalho foi aceite na Conferência Principal da EMNLP 2026. Os resultados dizem respeito aos modelos e às tarefas indicados.

Que sinais utiliza o método

Uma auditoria às características SAE modificadas mostrou que as direções de preferência estão sobretudo associadas a sinais discursivos e estilísticos.

O trabalho também apresenta uma teoria que aperfeiçoa a estimativa do mapa de diferença condicional. Esta descreve as condições em que a ablação top-k é justificada.

Quando considerar o DSPA

O método pode ser uma opção para tarefas em que é necessário alinhar preferências sem atualizar os pesos do modelo de base. Para funcionar, precisa de triplos de preferência.

Um critério prático consiste em comparar a tarefa com os resultados no MT-Bench, no AlpacaEval e em tarefas de escolha múltipla. Ao comparar com o RAHF-SCIT, os FLOPs na fase de alinhamento são considerados separadamente.

Perguntas mais frequentes

Materiais semelhantes

Todos os materiais
DSPA ajusta as respostas do modelo de linguagem de acordo com as preferências durante a geração