RobustSGPO: एजेंट-आधारित सिस्टम कॉन्फ़िगर करते समय विकल्पों का प्रबंधन

25 सितम्बर 202610 बार देखा गया

यह विधि संपादन के पैरामीटर तय करती है, उसे एक सत्यापन योग्य बदलाव में बदलती है और मौजूदा सर्वोत्तम संस्करण या सहेजी गई स्थितियों से अनुकूलन जारी रखती है। अलग रखे गए कार्यों पर सफलतापूर्वक पूरे किए गए कार्यों का अनुपात 60% से बढ़कर 80% हो गया, जबकि गुणवत्ता का स्कोर 3,77 से 4,14 तक पहुँचा; वैकल्पिक संस्करणों को सहेजने से कार्यों में बदलाव को ध्यान में रखने में मदद मिलती है, लेकिन इसके लिए अतिरिक्त संसाधनों की आवश्यकता होती है।

RobustSGPO: एजेंट-आधारित सिस्टम कॉन्फ़िगर करते समय विकल्पों का प्रबंधन

RobustSGPO वास्तव में किस चीज़ को नियंत्रित करता है

RobustSGPO, निष्पादन से मिलने वाली प्रतिक्रिया का उपयोग करके SGPO—सिमैंटिक ग्रेडिएंट पर आधारित प्रॉम्प्ट अनुकूलन—का विस्तार करता है। SGPO का स्थानीय नियम संपादन का पैमाना और विशिष्ट कार्रवाई तय नहीं करता।

नियंत्रण में संपादन अनुरोध, बनाए गए पैच की जाँच और अगले चरण के लिए शुरुआती बिंदु का चयन शामिल है। इससे विकल्पों की खोज का नियंत्रण, प्रतिक्रिया के संकेत से अलग हो जाता है।

व्यावहारिक कसौटी: यह तरीका ऐसे अनुकूलन के लिए उपयुक्त है जहाँ संपादन की कार्रवाई तय करना और पैच जाँचना महत्वपूर्ण हो, न कि केवल प्रतिक्रिया प्राप्त करना।

विकल्पों की खोज कैसे काम करती है

इस प्रक्रिया में तीन कार्रवाइयाँ शामिल हैं:

  1. अनुरोधित संपादन तय करना।
  2. पैच बनाना और उसकी जाँच करना।
  3. मौजूदा सबसे अच्छे विकल्प या सहेजे गए स्नैपशॉट से खोज जारी रखना।

शुरुआती बिंदुखोज कहाँ से जारी रहती है
मौजूदा सबसे अच्छा विकल्प (incumbent)उस समय के सबसे अच्छे विकल्प से
सहेजे गए स्नैपशॉट (retained snapshots)सहेजे गए संस्करणों से

चयन तय करता है कि खोज किस संस्करण से जारी रहेगी। कसौटी यह है कि मौजूदा सबसे अच्छा संस्करण चाहिए या सहेजे गए वैकल्पिक शुरुआती बिंदु।

संपादन का रिज़ॉल्यूशन कैसे निर्धारित किया जाता है

अध्ययन में आवधिक शेड्यूल $1\to2\to3$ की तुलना एक निश्चित अधिकतम रिज़ॉल्यूशन से की गई। आवधिक शेड्यूल ने परीक्षण स्कोर में निश्चित शेड्यूल से 0,28 अंक बेहतर प्रदर्शन किया।

लेखकों ने रिज़ॉल्यूशन शेड्यूलिंग, संचयी सीमाओं और कार्य परिवारों के बीच स्थानांतरण का मूल्यांकन किया। यह परिणाम इन्हीं मूल्यांकनों से संबंधित है और शेड्यूल का सार्वभौमिक लाभ स्थापित नहीं करता।

तुलना की कसौटी चुने गए शेड्यूल के तहत परीक्षण स्कोर है। प्रस्तुत अध्ययन में रिज़ॉल्यूशन को आवधिक रूप से बदलना बेहतर साबित हुआ।

गुणवत्ता के मूल्यांकन में क्या सामने आया

AgentX brainstorming वर्कफ़्लो में 120 कार्यों पर 95 रन किए गए और उम्मीदवारों के 7 350 प्रयास प्राप्त हुए।

30 अलग रखे गए कार्यों पर completion 60,0% से बढ़कर 80,0% हुआ। 20 मिलियन टोकन के बजट में Test quality 3,77 से बढ़कर 4,14 हुआ।

ये आँकड़े एक विशिष्ट मूल्यांकन के परिणामों का वर्णन करते हैं। प्रणालियों की तुलना करते समय, इन आँकड़ों को दूसरी परिस्थितियों पर लागू करने के बजाय उसके कार्यों और बजट को ध्यान में रखना महत्वपूर्ण है।

विकल्पों को सहेजने की रणनीति कैसे चुनें

विकल्पों को सहेजने से मापी जा सकने वाली अतिरिक्त लागत आती है। वहीं, खोज-स्थान पर नियंत्रण, निष्पादन योग्य संपादनों और वैकल्पिक शुरुआती बिंदुओं के ज़रिए गुणवत्ता बढ़ाता है।

रणनीतिकार्यों में बदलाव के बाद परिणाम
श्रेणियों के अनुसार सहेजनामूल कार्यों पर प्रदर्शन में गिरावट कम करता है
यादृच्छिक रूप से सहेजनालक्ष्य समूह पर बेहतर परिणाम देता है

चयन प्राथमिकता पर निर्भर करता है: मूल कार्यों पर प्रदर्शन बनाए रखना या लक्ष्य समूह पर बेहतर परिणाम पाना। विकल्पों को सहेजने की लागत भी मूल्यांकन का हिस्सा बनी रहती है।

अक्सर पूछे जाने वाले प्रश्न

समान सामग्री

सभी सामग्री
RobustSGPO: एजेंट-आधारित सिस्टम कॉन्फ़िगर करते समय विकल्पों का प्रबंधन