उनके आंतरिक तंत्रों तक पहुँच के बिना AI एजेंटों का मूल्यांकन

28 सितम्बर 202611 बार देखा गया

लेख में सात खतरे की श्रेणियों के आधार पर स्वायत्त प्रणालियों की जाँच की एक विधि का वर्णन है: SAGE-RT जनरेटर इनमें से प्रत्येक के लिए 120 हमले के परिदृश्य बनाता है। CrewAI और AutoGen के परीक्षणों में एजेंटों के व्यवहार में उच्च स्तर की भेद्यता के साथ-साथ नियंत्रण और गोपनीयता के जोखिम भी सामने आए, खासकर मल्टी-एजेंट कॉन्फ़िगरेशन में।

उनके आंतरिक तंत्रों तक पहुँच के बिना AI एजेंटों का मूल्यांकन

ब्लैक-बॉक्स मूल्यांकन का क्या अर्थ है

ब्लैक-बॉक्स दृष्टिकोण एजेंट प्रणाली के दिखाई देने वाले व्यवहार का मूल्यांकन करता है। जाँच के लिए केवल प्रणाली के बुनियादी विवरण चाहिए; विशेषाधिकार प्राप्त पहुँच की आवश्यकता नहीं होती।

यह दृष्टिकोण दिखाई देने वाले व्यवहार को जोखिम श्रेणियों से जोड़ता है। इससे आंतरिक तंत्र तक पहुँच के बिना मूल्यांकन किया जा सकता है।

व्यावहारिक मानदंड: यदि विशेषाधिकार प्राप्त पहुँच उपलब्ध नहीं है, लेकिन प्रणाली का बुनियादी विवरण दिया जा सकता है, तो ब्लैक-बॉक्स जाँच चुनें।

जाँच में क्या शामिल है

यह फ्रेमवर्क जोखिम वर्गीकरण और स्वचालित रेड टीमिंग को जोड़ता है। लेखक सात डोमेन की पहचान करते हैं, जो एजेंटों के व्यवहार को जोखिम श्रेणियों से जोड़ते हैं।

SAGE-RT प्रत्येक डोमेन के लिए 120 प्रतिकूल परिदृश्य बनाता है। मूल्यांकन में मानवीय सत्यापन और LLM जज भी शामिल हैं।

  • वर्गीकरण: जोखिम के सात डोमेन।
  • परिदृश्य: प्रत्येक डोमेन के लिए स्वचालित रेड टीमिंग।
  • परिणामों की जाँच: मानवीय सत्यापन और LLM जज।

चयन का मानदंड: यह तरीका उस कार्य के लिए उपयुक्त है जिसमें लोगों और LLM जजों द्वारा बाद में सत्यापन के साथ परिदृश्यों का स्वचालित निर्माण आवश्यक हो।

जाँच में क्या सामने आया

लेखकों ने एजेंटों के दो आर्किटेक्चर — CrewAI और AutoGen — और चार आधारभूत मॉडल का परीक्षण किया।

मापदंडपरिणाम
औसत गवर्नेंस जोखिम56,25%
मल्टी-एजेंट कॉन्फ़िगरेशन में गोपनीयता जोखिम65%
एजेंट के व्यवहार की कमज़ोरियाँ85% तक

ये मान अलग-अलग मापदंडों का वर्णन करते हैं। इन्हें एक ही समग्र जोखिम मूल्यांकन में नहीं समेटना चाहिए।

व्यावहारिक मानदंड: परिणामों की तुलना करते समय मापदंडों की मूल श्रेणियों और कॉन्फ़िगरेशन के संदर्भ को बनाए रखना महत्वपूर्ण है।

एक-चरणीय मूल्यांकन पर्याप्त क्यों नहीं है

लेखक बताते हैं कि मानक मूल्यांकन एक-चरणीय ही रहते हैं। वे उन कमज़ोरियों का पता नहीं लगाते जो कार्रवाइयों के क्रम में सामने आती हैं।

जोखिम इस बात से जुड़े हैं कि एजेंट कैसे काम करते हैं:

  • अविश्वसनीय इनपुट डेटा पढ़ते हैं;
  • वास्तविक अनुमतियों के साथ टूल इस्तेमाल करते हैं;
  • स्वायत्त रूप से काम करते हैं।

इन कारकों का मेल सुरक्षा की सतह को बढ़ाता है। मूल्यांकन का मानदंड यह है कि केवल किसी एक जवाब को नहीं, बल्कि कई चरणों में एजेंट के व्यवहार को भी जाँचा जाए।

ब्लैक-बॉक्स दृष्टिकोण कब चुनें

यदि एजेंट तक आंतरिक पहुँच उपलब्ध नहीं है, तो जोखिमों के मूल्यांकन के लिए यह दृष्टिकोण उपयुक्त है। प्रणाली का बुनियादी विवरण देना पर्याप्त है।

यह तब भी उपयोगी है जब जाँच में दिखाई देने वाले व्यवहार को जोखिम श्रेणियों से जोड़ना हो। कई चरणों में सामने आने वाली कमज़ोरियों का पता लगाने के लिए एक-चरणीय मूल्यांकन पर्याप्त नहीं है।

व्यावहारिक मानदंड: यदि कार्य में विशेषाधिकार प्राप्त पहुँच के बिना व्यवहार की जाँच करना और कई चरणों में उत्पन्न होने वाले जोखिमों को ध्यान में रखना आवश्यक है, तो यह दृष्टिकोण चुनें।

अक्सर पूछे जाने वाले प्रश्न

समान सामग्री

सभी सामग्री
उनके आंतरिक तंत्रों तक पहुँच के बिना AI एजेंटों का मूल्यांकन