GRPO पर एक विपरीत दृष्टिकोण: RLVR का वर्तमान उद्देश्य आदर्श क्यों नहीं है और ConSPO इसे कैसे ठीक करता है

13 सितम्बर 20260 बार देखा गया

नए कार्य में GRPO को एक विभाजक क्लासिफायर के रूप में व्याख्यायित किया गया है: नीति सफल और असफल नमूनों के बीच स्कोर अंतर को बढ़ाना सीखती है। यह दृष्टिकोण उद्देश्य फलन में दो खामियों को उजागर करता है, और लेखकों द्वारा प्रस्तावित ConSPO विधि मानकीकृत लॉग-संभावनाओं और InfoNCE-जैसे कंट्रास्टिव लर्निंग के माध्यम से उन्हें दूर करती है, जिससे जटिल तर्क कार्यों में सुधार होता है।

GRPO पर एक विपरीत दृष्टिकोण: RLVR का वर्तमान उद्देश्य आदर्श क्यों नहीं है और ConSPO इसे कैसे ठीक करता है

आधुनिक भाषा मॉडलों को तेजी से उन कार्यों पर "अतिरिक्त प्रशिक्षित" किया जा रहा है जहाँ उत्तर स्वचालित रूप से सत्यापित किए जा सकते हैं: गणित, प्रोग्रामिंग, तर्क। इस दृष्टिकोण को RLVR — सत्यापन योग्य पुरस्कारों पर सुदृढीकरण सीखना कहा जाता है। ऐसे समायोजन के लिए एल्गोरिदम के बीच, GRPO विशेष रूप से प्रमुख है: यह सरल है, किसी अलग आलोचक-मॉडल की आवश्यकता नहीं है, और अच्छी तरह से स्केल करता है। हालाँकि, एक हालिया प्रीप्रिंट (arXiv:2605.12969) GRPO को एक विपरीत (contrastive) दृष्टिकोण से देखने का सुझाव देता है और दिखाता है कि इसका उद्देश्य फलन आदर्श से बहुत दूर है। लेखक — फेंग झांग और सह-लेखक — केवल मौजूदा दृष्टिकोण की आलोचना नहीं करते, बल्कि ConSPO नामक एक विकल्प भी प्रस्तावित करते हैं।

GRPO RLVR का वास्तविक मानक क्यों बन गया

PPO जैसे शास्त्रीय तरीके पहले एक आलोचक को प्रशिक्षित करते हैं ताकि प्रत्येक क्रिया के लाभ का आकलन किया जा सके। RLVR में ऐसी आलोचना अक्सर अनावश्यक होती है: हमारे पास पहले से ही एक सत्यापन योग्य परिणाम होता है जो उत्तरों को सही और गलत में विभाजित करता है। GRPO इसका सीधे उपयोग करता है। एक ही प्रॉम्प्ट पर, मॉडल उत्तरों के कई प्रकार — रोलआउट — उत्पन्न करता है, फिर प्रत्येक रोलआउट को सत्यापनकर्ता से स्कोर मिलता है, और लाभ की गणना उस समूह के भीतर सापेक्ष स्थिति के रूप में की जाती है। यह योजना कम्प्यूटेशनल लागत कम करती है और पोस्ट-ट्रेनिंग को सरल बनाती है, इसलिए इसे व्यवहार में उत्सुकता से लागू किया जाता है।

लेकिन, जैसा कि लेखक दिखाते हैं, GRPO का एक छिपा हुआ पहलू भी है। यदि आप एल्गोरिदम के गणित को देखें, तो यह वास्तव में मॉडल को "अच्छे" और "बुरे" उत्तरों को अलग करने के लिए प्रशिक्षित करता है: सत्यापित सकारात्मक और नकारात्मक रोलआउट के स्कोर के बीच अपेक्षित अंतर को अधिकतम किया जाता है। यह एक शास्त्रीय विभेदक (discriminative) कार्य है। इसी दृष्टिकोण से यह स्पष्ट हो जाता है कि GRPO का वर्तमान लक्ष्य आदर्श क्यों नहीं है।

GRPO की दो सीमाएँ जो सीखने में बाधा डालती हैं

GRPO के विपरीत (contrastive) पुनर्निर्माण में, शोधकर्ता उद्देश्य फलन में निहित दो प्रणालीगत सीमाओं की पहचान करते हैं।

सरोगेट स्कोरिंग संभाव्यता के साथ असंगत है

मॉडल टोकन अनुक्रम की संभावना के आधार पर उत्तर उत्पन्न करता है। लेकिन GRPO, नीति को अद्यतन करते समय, इन संभावनाओं को सीधे अनुकूलित नहीं करता, बल्कि क्लिप्ड अनुपात — नई और पुरानी नीति के सीमित अनुपात — पर आधारित एक सरोगेट फलन को अनुकूलित करता है। वास्तव में, सकारात्मक और नकारात्मक उदाहरणों के लिए "अंक" के रूप में अनुक्रमों की वास्तविक लॉग-संभावनाओं का उपयोग नहीं किया जाता, बल्कि अन्य मात्राओं का। यहाँ एक बेमेल उत्पन्न होता है: एल्गोरिदम जिस लक्ष्य को अनुकूलित करता है, वह उस चीज़ से मेल नहीं खाता जो वास्तव में जनरेशन को निर्धारित करती है। यह अस्थिरता या डेटा के गैर-इष्टतम उपयोग का कारण बन सकता है।

क्रेडिट वर्तमान विभाजन जटिलता पर निर्भर नहीं करता

दूसरी सीमा इस बात से संबंधित है कि GRPO रोलआउट के बीच अद्यतनों को कैसे वितरित करता है। एल्गोरिदम इस बात पर ध्यान नहीं देता कि किसी निश्चित समय पर सकारात्मक और नकारात्मक उदाहरण स्कोर में कितने भिन्न हैं। यदि एक "नकारात्मक" सकारात्मक उदाहरण के बहुत करीब है, और दूसरा बहुत दूर है, तो GRPO उन्हें लगभग समान रूप से मानता है। स्कोर के प्रति यह असंवेदनशील क्रेडिट असाइनमेंट का मतलब है कि मॉडल सबसे भ्रामक, अभी भी खराब ढंग से अलग किए गए जोड़ों पर ध्यान केंद्रित नहीं करता। परिणामस्वरूप, सीखना सचमुच आसान उदाहरणों पर "अटक" सकता है, वास्तविक कठिनाइयों को अनदेखा कर सकता है।

ConSPO: नीति के लिए एक विपरीत (contrastive) उद्देश्य फलन

दोनों सीमाओं को दूर करने के लिए, लेखक ConSPO विधि प्रस्तावित करते हैं — अनुक्रम-स्तर पर विपरीत नीति अनुकूलन। नाम ही अपने आप में बोलता है: GRPO को विपरीत सीखने के रूप में पुनर्व्याख्यायित किया गया है, लेकिन कई महत्वपूर्ण सुधारों के साथ।

सबसे पहले, ConSPO सामान्य स्कोरिंग पर लौट आता है: सरोगेट मात्राओं के बजाय, लंबाई द्वारा सामान्यीकृत अनुक्रमों की लॉग-संभावनाओं का उपयोग किया जाता है। यह जनरेशन प्रक्रिया के साथ बेहतर ढंग से संरेखित होता है और likelihood-misaligned आकलन की समस्या को दूर करता है।

दूसरे, एल्गोरिदम स्पष्ट रूप से एक ही समूह के भीतर सत्यापित सकारात्मक रोलआउट को नकारात्मक "डिस्ट्रैक्टर" के विपरीत रखता है। नीति अद्यतन तब InfoNCE के समान एक समूह फलन द्वारा नियंत्रित होता है — विपरीत सीखने की एक मानक तकनीक। ऐसा फलन स्वचालित रूप से उन जोड़ों के लिए ग्रेडिएंट को बढ़ाता है जहाँ सकारात्मक उत्तर अभी भी नकारात्मक से पर्याप्त रूप से अलग नहीं हुआ है, और उच्च-स्कोरिंग नकारात्मक को अधिक ध्यान मिलता है। इस प्रकार असंवेदनशील क्रेडिट वितरण की समस्या हल हो जाती है।

तीसरे, ConSPO में curriculum-scheduled margin लागू किया जाता है। वह अंतर जो सकारात्मक और नकारात्मक उदाहरणों को अलग करना चाहिए, सीखने के दौरान धीरे-धीरे कड़ा किया जाता है। यह मॉडल को प्राप्त स्तर पर रुकने नहीं देता: पहले यह आसान अंतरों को सुलझाता है, और फिर विभाजन को और अधिक सूक्ष्म सीमाओं तक ले जाने के लिए बाध्य होता है।

निष्कर्ष और संभावनाएँ

लेखकों ने विभिन्न परिस्थितियों और जटिल तर्क बेंचमार्क पर ConSPO का परीक्षण किया। परिणाम दिखाते हैं कि नई विधि मजबूत आधारभूत दृष्टिकोणों से लगातार बेहतर प्रदर्शन करती है। यह समुदाय के लिए एक महत्वपूर्ण संकेत है: GRPO के अभ्यस्त लक्ष्य में सुधार किया जा सकता है यदि RLVR को केवल सापेक्ष लाभों के अनुकूलन के रूप में नहीं, बल्कि विपरीत सीखने के कार्य के रूप में देखा जाए।

बेशक, एक अकेला प्रीप्रिंट विषय को बंद नहीं करता। लेकिन प्रस्तावित दृष्टिकोण विश्लेषण के लिए एक नया उपकरण देता है: GRPO को एक दिए गए तथ्य के रूप में लेने के बजाय, शोधकर्ता अब इसे समझने योग्य विपरीत घटकों में विघटित कर सकते हैं और प्रत्येक को अलग-अलग सुधार सकते हैं। व्यवसायियों के लिए, इसका मतलब है कि पोस्ट-ट्रेनिंग शस्त्रागार में एक और मजबूत विधि जुड़ गई है, जो विशेष रूप से उन कार्यों में मूल्यवान है जहाँ सत्यापनकर्ता एक स्पष्ट बाइनरी संकेत देता है।

अक्सर पूछे जाने वाले प्रश्न

समान सामग्री

सभी सामग्री
GRPO पर एक विपरीत दृष्टिकोण: RLVR का वर्तमान उद्देश्य आदर्श क्यों नहीं है और ConSPO इसे कैसे ठीक करता है