DSPA menyesuaikan jawaban model bahasa berdasarkan preferensi selama proses generasi.

26 September 202613 tampilan

Metode ini menghubungkan fitur prompt dengan arah SAE dan menerapkannya pada representasi token aktif, tanpa melatih ulang model dasar. Pengujian pada Gemma-2 dan Qwen3 menunjukkan peningkatan hasil di MT-Bench; dengan data preferensi dalam jumlah kecil, DSPA membutuhkan komputasi hingga 4,47 kali lebih sedikit untuk penyelarasan dibandingkan pipeline RAHF-SCIT.

DSPA menyesuaikan jawaban model bahasa berdasarkan preferensi selama proses generasi.

Apa itu DSPA

DSPA (Dynamic SAE Steering for Preference Alignment) adalah metode penyelarasan preferensi pada tahap inferensi. Metode ini tidak memperbarui bobot model dasar, melainkan menggunakan data preferensi untuk mengarahkan generasi.

Untuk itu, metode ini memerlukan triplet preferensi. Berdasarkan triplet tersebut, DSPA membangun peta yang menghubungkan fitur prompt dengan fitur pengarah generasi.

Bagaimana DSPA mengubah generasi

Selama decoding, metode ini hanya mengubah laten yang aktif untuk token saat ini. Laten lainnya tidak disentuh.

Tahapan utama:

  1. DSPA menerima triplet preferensi.
  2. Membangun peta perbedaan kondisional antara fitur prompt dan fitur pengarah.
  3. Selama decoding, mengubah laten yang aktif untuk token.

Hasil eksperimen

Pada Gemma-2-2B/9B dan Qwen3-8B, metode ini meningkatkan hasil di MT-Bench. Di AlpacaEval, DSPA menunjukkan kinerja yang kompetitif, sementara pada tugas pilihan ganda akurasinya tetap terjaga.

Dengan data preferensi yang terbatas, metode ini tetap tangguh dan mampu bersaing dengan pipeline dua tahap RAHF-SCIT. Untuk penyelarasan, DSPA membutuhkan hingga 4.47× lebih sedikit FLOPs.

Makalah ini diterima di EMNLP 2026 Main Conference. Hasilnya berlaku untuk model dan tugas yang disebutkan.

Sinyal yang digunakan metode ini

Audit terhadap fitur SAE yang diubah menunjukkan bahwa arah preferensi terutama terkait dengan sinyal diskursif dan stilistis.

Makalah ini juga menyajikan teori yang menyempurnakan estimasi peta perbedaan kondisional. Teori tersebut menjelaskan kondisi yang menjadi dasar penggunaan top-k ablation.

Kapan mempertimbangkan DSPA

Metode ini dapat menjadi kandidat untuk tugas yang memerlukan penyelarasan preferensi tanpa memperbarui bobot model dasar. Metode ini memerlukan triplet preferensi.

Kriteria praktisnya adalah mencocokkan tugas dengan hasil di MT-Bench, AlpacaEval, dan tugas pilihan ganda. Saat membandingkannya dengan RAHF-SCIT, FLOPs pada tahap penyelarasan juga perlu dipertimbangkan.

Pertanyaan yang sering ditanyakan

Bahan terkait

Semua bahan
DSPA menyesuaikan jawaban model bahasa berdasarkan preferensi selama proses generasi.