अंतराल पुनरावृत्ति SuperMemo-2 विधि द्वारा: भाषा मॉडल को बिना भूलें कैसे और सीखाएं

28 अगस्त 202618 बार देखा गया

नया SRT फ्रेमवर्क SM-2 एल्गोरिदम का उपयोग करता है ताकि यह योजना बना सके कि कौन से पुराने उदाहरणों को प्रशिक्षण में वापस लाना है और कब। विकिपीडिया और कोड के डेटा पर, यह नई चीजें सीखने में कोई नुकसान किए बिना पुराने ज्ञान की सटीकता को 5–37 प्रतिशत अंकों तक बहाल कर सकता है।

अंतराल पुनरावृत्ति SuperMemo-2 विधि द्वारा: भाषा मॉडल को बिना भूलें कैसे और सीखाएं

इंटरवल रिपीटिशन SuperMemo-2 विधि से: भाषा मॉडल को भूलने से बचाकर कैसे आगे प्रशिक्षित करें

जब किसी बड़े भाषा मॉडल को नए डेटा पर आगे प्रशिक्षित किया जाता है, तो उसे पहले से अर्जित ज्ञान खोने का जोखिम होता है। यह घटना उन सभी को परिचित है जिन्होंने किसी संकीर्ण क्षेत्र में न्यूरल नेटवर्क को आगे प्रशिक्षित करने की कोशिश की है: अनुकूलन के कुछ चरणों के बाद, मॉडल अपने सामान्य ज्ञान को "भूल" सकता है। समस्या को कम करने का क्लासिक तरीका replay है, यानी प्रशिक्षण सेट में पुराने उदाहरणों को मिलाना। लेकिन आमतौर पर ऐसा replay बहुत मोटा होता है: पुराने और नए डेटा को केवल एक निश्चित अनुपात में मिलाया जाता है। इसमें सभी पुराने उदाहरणों को समान रूप से महत्वपूर्ण माना जाता है, जबकि व्यवहार में कुछ ज्ञान जल्दी मिट जाता है और कुछ लंबे समय तक टिका रहता है।

arXiv (2608.17530) पर हालिया कार्य के लेखक continual pre-training को अनुकूली पुनरावृत्ति योजना की समस्या के रूप में पुनर्विचार करने का प्रस्ताव रखते हैं। यह तय करने के बजाय कि कितना इतिहास मिलाना है, मॉडल को हर समय चुनना चाहिए कि कौन से उदाहरण प्रशिक्षण में वापस लाए जाएं। यह वास्तविक स्मृति अंतराल पर प्रतिक्रिया करने की अनुमति देता है, न कि एक स्थिर कार्यक्रम का पालन करने की।

कार्ड से मॉडल पैरामीटर तक

यह विचार संज्ञानात्मक विज्ञान से लिया गया है, विशेष रूप से SuperMemo-2 (SM-2) एल्गोरिदम से, जिसका उपयोग दशकों से फ्लैशकार्ड याद करने के लिए इंटरवल रिपीटिशन की योजना बनाने में किया जाता रहा है। SM-2 बताता है कि कार्ड को कब दिखाना है ताकि ज्ञान मजबूत हो और गायब न हो। नई विधि Spaced Repetition Training (SRT) में, यह सिद्धांत न्यूरल नेटवर्क के प्रशिक्षण पर लागू किया जाता है।

SRT प्रत्येक प्रशिक्षण उदाहरण के लिए अपनी स्वयं की पुनरावृत्ति स्थिति बनाए रखता है। यह समझने के लिए कि मॉडल उदाहरण को कितनी अच्छी तरह याद रखता है, perplexity का उपयोग किया जाता है — यह माप कि मॉडल डेटा की कितनी आत्मविश्वास से भविष्यवाणी करता है। यदि perplexity तेजी से बढ़ता है, तो इसका मतलब है कि उदाहरण भूलना शुरू हो रहा है, और इसे प्रशिक्षण में पुनः शामिल करने के लिए उच्च प्राथमिकता दी जाती है। यह दृष्टिकोण स्वचालित रूप से "पुराने" उदाहरणों को प्रशिक्षण में वापस लाने की अनुमति देता है, जो ज्ञान बनाए रखने के लिए आवश्यक हैं, साथ ही "नए" उदाहरणों को भी, जो अभी तक मजबूत नहीं हुए हैं।

महत्वपूर्ण बात यह है कि SRT मॉडल की वास्तुकला, लॉस फ़ंक्शन या ऑप्टिमाइज़र को नहीं छूता है। सभी परिवर्तन केवल डेटा सैंपलिंग रणनीति से संबंधित हैं। यानी, इस विधि को मौजूदा प्रशिक्षण प्रक्रिया के ऊपर बिना पाइपलाइन में बड़े बदलाव किए लागू किया जा सकता है।

प्रयोगों ने क्या दिखाया

इस विधि का परीक्षण समय-विभाजित Wikipedia और कोड कॉर्पोरा पर किया गया — यानी ऐसे डेटा पर जो स्वाभाविक रूप से अवधियों में विभाजित होता है। परिणाम नाइव आगे-प्रशिक्षण और समान replay से काफी बेहतर थे। SRT ने पुराने ज्ञान पर 5 से 37 प्रतिशत अंकों की सटीकता बहाल की, जिसे नाइव प्रशिक्षण मिटा चुका था। साथ ही, नए डेटा पर प्रदर्शन खराब नहीं हुआ, और कई मामलों में तो बढ़ भी गया।

विशेष रूप से दिलचस्प बड़े मॉडलों पर व्यवहार है: वहां SRT व्यापक बेंचमार्क पर संतुलित प्रदर्शन बनाए रखता है, जबकि नाइव आगे-प्रशिक्षण और सामान्य replay महत्वपूर्ण गिरावट का कारण बनते हैं। यह बताता है कि पुनरावृत्ति योजना मॉडल के पैमाने के बढ़ने पर और भी महत्वपूर्ण हो जाती है, जब डेटा और प्रशिक्षण चरण अधिक होते हैं।

भाषा से परे

दिलचस्प बात यह है कि यह सिद्धांत केवल पाठ के साथ ही काम नहीं करता। दृश्य और तालिका डेटा के साथ प्रयोगों से पता चला: पुनरावृत्ति योजना हर जगह लागू होती है जहां recall सिग्नल को मापा जा सकता है, यानी यह समझा जा सकता है कि मॉडल किसी विशेष उदाहरण को भूल रहा है। वास्तव में, यह continual learning के लिए एक सार्वभौमिक तंत्र है जो मोडैलिटी से बंधा नहीं है।

इस कार्य से मुख्य निष्कर्ष — औसत replay को छोड़कर व्यक्तिगत पुनरावृत्ति कार्यक्रम अपनाने से stability-plasticity संतुलन में ठोस लाभ मिलता है। मॉडल नया सीखना जारी रखता है, लेकिन साथ ही "सामग्री दोहराता है" ठीक उसी समय जब वह उसे भूलने लगता है। यह दृष्टिकोण बड़े भाषा मॉडल के अधिक सार्थक आगे-प्रशिक्षण की दिशा में एक स्वाभाविक कदम दिखता है।

अक्सर पूछे जाने वाले प्रश्न

समान सामग्री

सभी सामग्री
अंतराल पुनरावृत्ति SuperMemo-2 विधि द्वारा: भाषा मॉडल को बिना भूलें कैसे और सीखाएं