DSPA ajuste les réponses du modèle de langage en fonction des préférences pendant la génération

26 septembre 202613 vues

La méthode associe les caractéristiques de la requête aux directions SAE et les applique aux représentations actives des tokens, sans réentraîner le modèle de base. Les tests sur Gemma-2 et Qwen3 ont montré une amélioration des résultats sur MT-Bench ; avec peu de données de préférences, DSPA nécessite jusqu’à 4,47 fois moins de calculs pour l’alignement que le pipeline RAHF-SCIT.

DSPA ajuste les réponses du modèle de langage en fonction des préférences pendant la génération

Qu’est-ce que DSPA

DSPA (Dynamic SAE Steering for Preference Alignment) est une méthode d’alignement des préférences au moment de l’inférence. Elle ne met pas à jour les poids du modèle de base, mais utilise des données sur les préférences pour orienter la génération.

Pour cela, la méthode a besoin de triples de préférences. À partir de ceux-ci, DSPA construit une carte qui relie les caractéristiques du prompt aux caractéristiques de pilotage de la génération.

Comment DSPA modifie la génération

Pendant le décodage, la méthode modifie uniquement les variables latentes actives pour le token courant. Elle ne touche pas aux autres variables latentes.

Principales étapes :

  1. DSPA reçoit des triples de préférences.
  2. Il construit une carte des différences conditionnelles entre les caractéristiques du prompt et celles du pilotage.
  3. Pendant le décodage, il modifie les variables latentes actives pour le token.

Résultats des expériences

Sur Gemma-2-2B/9B et Qwen3-8B, la méthode a amélioré les résultats sur MT-Bench. Sur AlpacaEval, DSPA s’est montré compétitif et a conservé sa précision sur les tâches à choix multiple.

Avec des données de préférences limitées, la méthode est restée robuste et a pu rivaliser avec le pipeline en deux étapes RAHF-SCIT. Pour l’alignement, DSPA a nécessité jusqu’à 4.47× moins de FLOPs.

L’article a été accepté à la conférence principale EMNLP 2026. Les résultats concernent les modèles et les tâches indiqués.

Quels signaux la méthode utilise-t-elle ?

L’audit des caractéristiques SAE modifiées a montré que les directions de préférence sont principalement associées à des signaux discursifs et stylistiques.

L’article présente également une théorie qui affine l’estimation de la carte des différences conditionnelles. Elle décrit les conditions dans lesquelles l’ablation top-k est justifiée.

Quand envisager DSPA

La méthode peut être envisagée pour les tâches où il faut aligner les préférences sans mettre à jour les poids du modèle de base. Son fonctionnement nécessite des triples de préférences.

Un critère pratique consiste à comparer la tâche aux résultats obtenus sur MT-Bench, AlpacaEval et les tâches à choix multiple. Lors de la comparaison avec RAHF-SCIT, il faut tenir compte séparément des FLOPs nécessaires à l’étape d’alignement.

Foire aux questions

Matériaux connexes

Tous matériaux
DSPA ajuste les réponses du modèle de langage en fonction des préférences pendant la génération