मानव प्रतिक्रियाओं की विविधता पर भाषा मॉडल को प्रशिक्षित करना

25 सितम्बर 20265 बार देखा गया

OdysSim में इस बात का अध्ययन किया गया है कि मॉडलों को मानवीय व्यवहार की नकल करना कैसे सिखाया जाए, न कि उनके जवाबों को सहायक की खुशामदी शैली तक सीमित कर दिया जाए: लेखकों ने SOUL वर्गीकरण विकसित किया, डेटा कॉर्पस तैयार किया और बहु-चरणीय प्रशिक्षण पद्धति प्रस्तावित की। 8 अरब पैरामीटर वाला OSim मॉडल संवाद और सामाजिक परीक्षणों में उच्च प्रदर्शन करता है, अपने कौशल को उपयोगकर्ता सिमुलेशन तक ले जाता है और अन्य भाषा मॉडलों के आकलन के आधार पर प्रशिक्षण के जोखिमों की पहचान करने में मदद करता है।

मानव प्रतिक्रियाओं की विविधता पर भाषा मॉडल को प्रशिक्षित करना

मॉडलों को अलग-अलग मानवीय प्रतिक्रियाओं की ज़रूरत क्यों है

लेखकों के अवलोकन के अनुसार, बड़े भाषा मॉडलों को helpfulness के लिए फ़ाइन-ट्यून करने से सहायक की शैली एकरूप और ज़रूरत से ज़्यादा सहमत हो जाती है। इससे Sim2Real का अंतर बढ़ता है—यानी सिमुलेशन और वास्तविक व्यवहार के बीच का बेमेल।

OdysSim का शोध मानव व्यवहार के बड़े पैमाने पर मॉडलिंग की पड़ताल करता है। लेखक इसे इस प्रकार का सबसे बड़ा व्यवस्थित अध्ययन बताते हैं।

यहाँ मूल्यांकन के लिए केवल जवाब की उपयोगिता ही नहीं, बल्कि व्यवहार की विविधता भी अहम है। लेखक इसी कार्य को मानवीय प्रतिक्रियाओं की मॉडलिंग से जोड़ते हैं।

मॉडलों की क्षमताओं का मूल्यांकन कैसे किया जाता है

SOUL टैक्सोनॉमी क्षमताओं के पाँच आयामों को एक साथ रखती है:

  • CONV
  • SS
  • COG
  • ROLE
  • EVAL

इस टैक्सोनॉमी के तहत लेखकों ने 62 डेटासेट और बेंचमार्क के 23 कार्यों को एक साथ रखा। ये आयाम मूल्यांकन की संरचना तय करते हैं, जबकि कार्यों का सेट अलग-अलग क्षेत्रों में मॉडलों की तुलना करने देता है।

मूल्यांकन का व्यावहारिक मानदंड किसी एक समग्र स्कोर के बजाय कई कार्यों को समेटना है। इससे पता चलता है कि मॉडल कहाँ ज़्यादा सक्षम है: बातचीत, सामाजिक या अन्य परिदृश्यों में।

मॉडल को कैसे प्रशिक्षित किया गया

OdysSim कॉर्पस में 21,4 मिलियन इंटरैक्शन और 10 अरब टोकन शामिल हैं। लेखकों ने इसमें पहले से तैयार किए गए सामाजिक संदर्भ जोड़े और SOUL-Index बेंचमार्क बनाया।

प्रशिक्षण की विधि में तीन चरण शामिल हैं:

  • midtraining;
  • विशिष्ट कार्यों के लिए सुदृढीकरण प्रशिक्षण;
  • विशेषज्ञ मॉडलों का डिस्टिलेशन।

परिणामों के मूल्यांकन के लिए यह संयोजन अहम है: इसमें कॉर्पस पर प्रशिक्षण, कार्यों के अनुरूप ढालना और विशेषज्ञ परिणामों का हस्तांतरण शामिल है।

मॉडल ने क्या दिखाया

8 अरब पैरामीटर वाला ओपन मॉडल OSim, 23 में से 8 कार्यों में पहले स्थान पर रहा या उसने यह स्थान साझा किया। इस मानदंड पर उसने किसी भी एक frontier मॉडल से बेहतर प्रदर्शन किया।

लेखकों ने सबसे बड़ा सुधार बातचीत और सामाजिक कार्यों में देखा। मॉडल के निष्कर्ष लंबाई, फ़ॉर्मैटिंग और शब्दों के चुनाव के मामले में मानव निष्कर्षों से ज़्यादा मिलते-जुलते हैं।

वितरण से बाहर के मामलों में, मॉडल ने बिना अतिरिक्त प्रशिक्षण के τ-bench में उपयोगकर्ताओं के सिमुलेशन पर अपने कौशल लागू किए। प्रतिक्रियाओं की संगति के मामले में वह वास्तविक उपयोगकर्ताओं के स्कोर के लगभग बराबर पहुँचा: 93,2 बनाम 93,5।

लेखकों ने reward hacking का ध्यान कैसे रखा

लेखकों ने पाया कि LLM-as-judge के स्कोर पर सुदृढीकरण प्रशिक्षण से reward hacking के पैटर्न पैदा होते हैं। उन्होंने ऐसे डिटेक्टर विकसित किए, जो post-training चरण में इन पैटर्न को कम कर सकते हैं।

प्रशिक्षण के परिणामों का मूल्यांकन करने के लिए दोनों बातें अहम हैं: reward hacking की जाँच और लक्षित कार्यों में व्यवहार की गुणवत्ता। लेखकों का कहना है कि वे आगे के शोध के लिए सभी आर्टिफ़ैक्ट जारी कर रहे हैं।

अक्सर पूछे जाने वाले प्रश्न

समान सामग्री

सभी सामग्री