Apa itu DSPA
DSPA (Dynamic SAE Steering for Preference Alignment) adalah metode penyelarasan preferensi pada tahap inferensi. Metode ini tidak memperbarui bobot model dasar, melainkan menggunakan data preferensi untuk mengarahkan generasi.
Untuk itu, metode ini memerlukan triplet preferensi. Berdasarkan triplet tersebut, DSPA membangun peta yang menghubungkan fitur prompt dengan fitur pengarah generasi.
Bagaimana DSPA mengubah generasi
Selama decoding, metode ini hanya mengubah laten yang aktif untuk token saat ini. Laten lainnya tidak disentuh.

Tahapan utama:
- DSPA menerima triplet preferensi.
- Membangun peta perbedaan kondisional antara fitur prompt dan fitur pengarah.
- Selama decoding, mengubah laten yang aktif untuk token.
Hasil eksperimen
Pada Gemma-2-2B/9B dan Qwen3-8B, metode ini meningkatkan hasil di MT-Bench. Di AlpacaEval, DSPA menunjukkan kinerja yang kompetitif, sementara pada tugas pilihan ganda akurasinya tetap terjaga.
Dengan data preferensi yang terbatas, metode ini tetap tangguh dan mampu bersaing dengan pipeline dua tahap RAHF-SCIT. Untuk penyelarasan, DSPA membutuhkan hingga 4.47× lebih sedikit FLOPs.
Makalah ini diterima di EMNLP 2026 Main Conference. Hasilnya berlaku untuk model dan tugas yang disebutkan.
Sinyal yang digunakan metode ini
Audit terhadap fitur SAE yang diubah menunjukkan bahwa arah preferensi terutama terkait dengan sinyal diskursif dan stilistis.
Makalah ini juga menyajikan teori yang menyempurnakan estimasi peta perbedaan kondisional. Teori tersebut menjelaskan kondisi yang menjadi dasar penggunaan top-k ablation.
Kapan mempertimbangkan DSPA
Metode ini dapat menjadi kandidat untuk tugas yang memerlukan penyelarasan preferensi tanpa memperbarui bobot model dasar. Metode ini memerlukan triplet preferensi.
Kriteria praktisnya adalah mencocokkan tugas dengan hasil di MT-Bench, AlpacaEval, dan tugas pilihan ganda. Saat membandingkannya dengan RAHF-SCIT, FLOPs pada tahap penyelarasan juga perlu dipertimbangkan.



