GRPO प्रशिक्षण में मूल्यवान जनरेशनों का पुनः उपयोग कैसे करें

25 सितम्बर 202615 बार देखा गया

लेख में एक ऐसी विधि प्रस्तुत की गई है, जो लाभ की मात्रा के आधार पर दोबारा प्रशिक्षण के लिए चुनिंदा जनरेशन का चयन करती है और बहुत पुराने डेटा को हटाकर उसकी जगह नए उदाहरण शामिल करती है। Qwen3-Base के तीन आकारों पर, इस विधि ने गणितीय बेंचमार्क पर GRPO और सामान्य रीप्ले से बेहतर प्रदर्शन किया, साथ ही सटीकता और टोकन खपत के बीच संतुलन भी सुधारा।

GRPO प्रशिक्षण में मूल्यवान जनरेशनों का पुनः उपयोग कैसे करें

वास्तव में किसका पुनः उपयोग किया जाता है

सामान्य GRPO में हर rollout एक gradient update में भाग लेता है, जिसके बाद उसे छोड़ दिया जाता है। लेख में दी गई विधि इस चक्र को बदलती है: यह अलग-अलग rollout’ों को सहेजती है और चुने गए rollout’ों को प्रशिक्षण में वापस लाती है।

बफ़र पूरी समूहों को नहीं, बल्कि अलग-अलग generations को सहेजता है। Replay उन्हें उनके advantage के परिमाण के आधार पर प्राथमिकता देता है: अधिक मान वाले rollout’ों का पुनः उपयोग किया जाता है।

व्यावहारिक मानदंड: पुनः उपयोग अलग-अलग rollout’ों का होता है, समूहों का नहीं।

Replay कैसे काम करता है

हर batch दो चरणों में बनाया जाता है:

  1. इसमें ताज़ा on-policy rollout’ शामिल किए जाते हैं।
  2. इनके साथ बफ़र से अलग से चुने गए rollout’ जोड़े जाते हैं।

Replay आइटम चुनते समय हर rollout के advantage के परिमाण को ध्यान में रखा जाता है। वर्णित तथ्यों में batch में replay का हिस्सा कितना है, यह निर्दिष्ट नहीं है।

इस विधि का मुख्य अंतर यह है कि ताज़ा rollout’ batch में बने रहते हैं और बफ़र उन्हें चुनी गई generations से पूरक बनाता है।

पुराने पड़ने की समस्या को कैसे सीमित किया जाता है

लेखक naive replay की समस्या बताते हैं: हर gradient step के साथ LLM policies तेज़ी से बदलती हैं। सहेजे गए rollout’ पुराने पड़ सकते हैं और प्रशिक्षण को अस्थिर कर सकते हैं।

यह विधि बफ़र से ऐसे किसी भी rollout को हटा देती है जो tau_max training steps से पुराना हो। इससे सहेजने की अवधि की सीमा तय होती है, लेकिन पुनः उपयोग का तथ्य नहीं बदलता।

यहाँ नियंत्रण का मानदंड training steps में किसी अलग rollout की आयु है, न कि उसका किसी समूह से संबंधित होना।

मूल्यांकन में क्या सामने आया

इस विधि को Qwen3-Base के तीन आकारों और पाँच गणितीय benchmark’ पर परखा गया। इसने GRPO और naive replay baselines से बेहतर प्रदर्शन किया।

  • हर आकार पर पाँचों benchmark के औसत में सुधार सकारात्मक था।
  • 4B आकार पर सुधार +1.66 pp तक पहुँचा।
  • AES के अनुसार, जो accuracy और token efficiency का संयुक्त मूल्यांकन करने वाला metric है, हर आकार पर GRPO से सकारात्मक अंतर दिखाने वाला यह एकमात्र विकल्प था।

विधि चुनने का व्यावहारिक मानदंड लक्ष्य मूल्यांकन पर निर्भर करता है: परिणामों में accuracy, token efficiency और दो baselines के साथ तुलना शामिल है।

अक्सर पूछे जाने वाले प्रश्न

समान सामग्री

सभी सामग्री
GRPO प्रशिक्षण में मूल्यवान जनरेशनों का पुनः उपयोग कैसे करें