ما هو DSPA
DSPA (Dynamic SAE Steering for Preference Alignment) هو أسلوب لمواءمة التفضيلات في مرحلة الاستدلال. لا يحدّث أوزان النموذج الأساسي، بل يستخدم بيانات التفضيلات لتوجيه عملية التوليد.
يتطلب هذا الأسلوب ثلاثيات التفضيل. وبالاستناد إليها، ينشئ DSPA خريطة تربط بين سمات الموجّه وسمات التحكم في التوليد.
كيف يغيّر DSPA عملية التوليد
أثناء فك الترميز، لا يغيّر الأسلوب سوى الكوامن النشطة للرمز الحالي. ولا يمسّ الكوامن الأخرى.

المراحل الرئيسية:
- يتلقى DSPA ثلاثيات التفضيل.
- ينشئ خريطة الفروق الشرطية بين سمات الموجّه وسمات التحكم.
- يغيّر أثناء فك الترميز الكوامن النشطة للرمز.
ما الذي أظهرته التجارب
على Gemma-2-2B/9B وQwen3-8B، حسّن الأسلوب النتائج على MT-Bench. وعلى AlpacaEval، أظهر DSPA قدرة على المنافسة، بينما حافظ على الدقة في مهام الاختيار من متعدد.
مع محدودية بيانات التفضيلات، ظل الأسلوب متينًا وتمكّن من منافسة خط أنابيب RAHF-SCIT ذي المرحلتين. واحتاج DSPA إلى عدد عمليات FLOPs أقل بما يصل إلى 4.47× لتحقيق المواءمة.
قُبل البحث في المؤتمر الرئيسي EMNLP 2026. وتنطبق النتائج على النماذج والمهام المذكورة.
ما الإشارات التي يستخدمها الأسلوب
أظهر تدقيق سمات SAE التي جرى تغييرها أن اتجاهات التفضيل ترتبط في معظمها بإشارات الخطاب والأسلوب.
ويقدّم البحث أيضًا نظرية تحسّن تقدير خريطة الفروق الشرطية. وهي تصف الشروط التي يكون فيها استئصال top-k مبررًا.
متى يجدر النظر في DSPA
قد يكون الأسلوب خيارًا للمهام التي تتطلب مواءمة التفضيلات دون تحديث أوزان النموذج الأساسي. ويتطلب تشغيله ثلاثيات التفضيل.
ومن المعايير العملية مطابقة المهمة مع النتائج على MT-Bench وAlpacaEval ومهام الاختيار من متعدد. وعند المقارنة مع RAHF-SCIT، تُؤخذ عمليات FLOPs في مرحلة المواءمة في الحسبان بشكل منفصل.



