DSPA क्या है
DSPA (Dynamic SAE Steering for Preference Alignment) आउटपुट के चरण में प्राथमिकताओं को संरेखित करने की एक विधि है। यह आधार मॉडल के वज़न अपडेट नहीं करती, बल्कि जनरेशन को नियंत्रित करने के लिए प्राथमिकता संबंधी डेटा का उपयोग करती है।
इसके लिए विधि को preference triples की ज़रूरत होती है। इनके आधार पर DSPA एक ऐसा मानचित्र बनाता है, जो प्रॉम्प्ट की विशेषताओं को जनरेशन नियंत्रण की विशेषताओं से जोड़ता है।
DSPA जनरेशन को कैसे बदलता है
डिकोडिंग के दौरान यह विधि केवल मौजूदा टोकन के लिए सक्रिय लैटेंट्स को बदलती है। बाकी लैटेंट्स को यह नहीं छूती।

मुख्य चरण:
- DSPA को preference triples मिलते हैं।
- यह प्रॉम्प्ट और नियंत्रण की विशेषताओं के बीच conditional-difference map बनाता है।
- डिकोडिंग के दौरान यह टोकन के लिए सक्रिय लैटेंट्स को बदलता है।
प्रयोगों से क्या पता चला
Gemma-2-2B/9B और Qwen3-8B पर इस विधि ने MT-Bench के नतीजों में सुधार किया। AlpacaEval पर DSPA ने प्रतिस्पर्धी प्रदर्शन किया, जबकि multiple-choice कार्यों में सटीकता बनाए रखी।
सीमित प्राथमिकता डेटा के साथ भी यह विधि स्थिर रही और दो-चरणीय RAHF-SCIT पाइपलाइन को टक्कर दे सकी। संरेखण के लिए DSPA को 4.47× तक कम FLOPs की ज़रूरत पड़ी।
यह शोध EMNLP 2026 Main Conference में स्वीकार किया गया है। नतीजे निर्दिष्ट मॉडलों और कार्यों से संबंधित हैं।
यह विधि किन संकेतों का उपयोग करती है
बदले गए SAE फीचर्स के ऑडिट से पता चला कि प्राथमिकता की दिशाएँ मुख्य रूप से विमर्श और शैलीगत संकेतों से जुड़ी हैं।
इस शोध में conditional-difference map के आकलन को स्पष्ट करने वाला एक सिद्धांत भी प्रस्तुत किया गया है। यह उन स्थितियों का वर्णन करता है जिनमें top-k ablation उचित है।
DSPA पर कब विचार करें
यह विधि उन कार्यों के लिए एक विकल्प हो सकती है जिनमें आधार मॉडल के वज़न अपडेट किए बिना प्राथमिकताओं को संरेखित करना हो। इसके काम करने के लिए preference triples की ज़रूरत होती है।
व्यावहारिक कसौटी यह है कि कार्य की तुलना MT-Bench, AlpacaEval और multiple-choice कार्यों के नतीजों से की जाए। RAHF-SCIT से तुलना करते समय संरेखण चरण के FLOPs को अलग से ध्यान में रखा जाता है।



