शीर्षक: Aegis: एआई एजेंटों के लिए सुरक्षा कवच — मॉडल के सुझाव एक विश्वसनीय निर्णय स्तर से गुजरते हैं

25 अगस्त 202617 बार देखा गया

नई Aegis प्रणाली एजेंट द्वारा टूल्स को भेजे गए अनुरोधों को रोकती है और वास्तविक निष्पादन से पहले उन्हें बाहरी सत्यापन तंत्र से गुजारती है। विशेष परिदृश्यों के एक कॉर्पस पर किए गए प्रयोगों में, इसने शून्य जोखिम भरे दुष्प्रभाव प्राप्त किए, जबकि सामान्य प्रॉम्प्ट-प्रतिबंध ऐसी गारंटी नहीं दे सके।

शीर्षक: Aegis: एआई एजेंटों के लिए सुरक्षा कवच — मॉडल के सुझाव एक विश्वसनीय निर्णय स्तर से गुजरते हैं

समस्या: पाठ से कार्रवाई तक

आधुनिक एजेंटिक एआई सिस्टम सिर्फ प्रतिक्रिया उत्पन्न करने से अधिक कर सकते हैं - वे बाहरी उपकरणों के साथ संचालन कर सकते हैं: फ़ाइलों को संशोधित करें, संदेश भेज सकते हैं, कार्य शुरू कर सकते हैं और कार्यप्रवाह की स्थिति को बदल सकते हैं। यह सुरक्षा फोकस को भी बदल देता है: जबकि हानिकारक टेक्स्ट मुख्य खतरे के लिए इस्तेमाल किया जाता है, अब यह हानिकारक परिचालन दुष्प्रभाव है। पारंपरिक तत्काल स्तर के उपाय मॉडल व्यवहार को प्रभावित कर सकते हैं, लेकिन वे वास्तविक निष्पादन सीमा नहीं बनाते हैं: मॉडल एक कार्रवाई का प्रस्ताव कर सकता है, और इसे सीधे अतिरिक्त सत्यापन के बिना निष्पादित किया जाएगा।

यहीं है Aegis खेलने में आता है, एजेंट प्रबंधन के लिए मौलिक रूप से अलग दृष्टिकोण प्रदान करता है। मॉडल के "अच्छा व्यवहार" पर भरोसा करने के बजाय, एगिस मॉडल आउटपुट को उन प्रस्तावों के रूप में मानता है जो उपकरण को रद्द करने से पहले विश्वसनीय निर्णय परत से गुजरते हैं।

कैसे Aegis वर्क्स: मॉडल का प्रस्ताव, पर्यावरण Decides

एजिस के प्रमुख सिद्धांत को संक्षेप में संक्षेप में प्रस्तुत किया जा सकता है: मॉडल का प्रस्ताव, विश्वसनीय निष्पादन पर्यावरण का फैसला करता हैयह रनटाइम शासन है - निष्पादन चरण पर नियंत्रण, पीढ़ी चरण पर नहीं।

संरक्षण की तीन परतें

Aegis कई आयामों में मॉडल से प्रत्येक प्रस्ताव का मूल्यांकन करता है:

  • सक्रिय नीतियों का अनुपालन: सिस्टम मौजूदा नीति राज्य के खिलाफ प्रस्तावित कार्रवाई की जांच करता है ताकि निष्क्रिय संचालन को फ़िल्टर किया जा सके।
  • सिद्धान्त सत्यापन: विश्वसनीय सर्वर पक्ष यह पुष्टि करता है कि कार्रवाई वास्तव में एक अधिकृत प्रक्रिया से उत्पन्न होती है और रास्ते में छेड़छाड़ नहीं की गई है।
  • Fail-बंद व्यवहारयदि सिस्टम असम्बद्ध रूप से कार्रवाई की पुष्टि नहीं कर सकता है तो यह इसे निष्पादित करने से इनकार कर देता है - जिसका अर्थ है कि डिफ़ॉल्ट सिद्धांत "सब कुछ हद तक अनुमति नहीं है" है।

सीनेट-शैली रिज़ॉल्यूशन तंत्र विशेष ध्यान देने योग्य है। जब कोई प्रस्ताव विवादित श्रेणी में आता है, तो एक quorum-आधारित प्राधिकरण पथ को एकतरफा निर्णय के बजाय ट्रिगर किया जाता है। इसका मतलब यह है कि कोई भी सिस्टम घटक अपने आप पर निर्णय कर सकता है - एकाधिक प्रतिभागियों से सहमति की आवश्यकता है। यह दृष्टिकोण एक तरफा निर्णयों को समाप्त करता है और जोखिम को कम करता है कि एक एकल भेद्यता या त्रुटि खतरनाक कार्रवाई की ओर जाता है।

प्रायोगिक मूल्यांकन: टेस्ट क्या दिखाया गया है

एगिस की प्रभावशीलता को सत्यापित करने के लिए, लेखकों ने एक पुन: प्रयोज्य सैंडबॉक्स कोरस पर प्रयोगों की एक श्रृंखला चलाई। परीक्षण पांच रन परिवारों, 42 कार्यों, तीन स्थितियों और प्रति परिवार दस दोहराव का इस्तेमाल किया। कुल डेटा मात्रा 6,300 लॉग लाइन थी।

संख्याओं में परिणाम

  • शीघ्र राजनीतिक दृष्टिकोण में, जोखिम भरे रिसाव के साथ 79 लाइनें तुलना पथ के साथ पता लगाया गया था।
  • अंडर एगिस शासन (2,100 लाइनें) नियंत्रित नकली उपकरणों के शून्य अनुप्रयोग और जोखिम भरे दुष्प्रभावों के साथ शून्य शासित समापन दर्ज किया गया था।
  • सभी 1,832 लाइनें एजिस शासन के तहत निष्पादित विश्वसनीय, सिस्टम-अनुमोदित सिद्धता को संरक्षित किया गया।
  • सभी 1,019 लाइनें "सेनेट" के माध्यम से हल करने के लिए कोरम और अंतिम हस्ताक्षरित वोट-काउंट डेटा था।

निष्कर्ष और सीमाएं

अध्ययन लेखक एक महत्वपूर्ण बारीकी पर जोर देते हैं: प्राप्त परिणाम स्वायत्त एजेंटों की सामान्य सुरक्षा साबित नहीं होतीयह एक संकीर्ण प्रणालीगत दावा है - मूल्यांकन सैंडबॉक्स corpus के भीतर, निष्पादन चरण पर कार्रवाई की सीमाओं को नियंत्रित करने से वास्तविक शासित दुष्प्रभावों में बदलने से जोखिम भरे प्रस्तावों को रोका गया।

इसका मतलब है कि एगिस एक सुरक्षा फ्यूज की तरह काम करता है: यह मॉडल को "सफ़ेद द्वारा सुरक्षित" नहीं बनाता है, लेकिन यह मॉडल के इरादे और वास्तविक कार्रवाई के बीच विश्वसनीय बाधा बनाता है। यह दृष्टिकोण उन प्रणालियों में व्यावहारिक उपयोग के लिए आशाजनक दिखता है जहां एजेंट महत्वपूर्ण उपकरणों के साथ काम करते हैं - लेकिन इसे व्यापक और विविध परिदृश्यों पर आगे शोध की आवश्यकता होती है।

अक्सर पूछे जाने वाले प्रश्न

समान सामग्री

सभी सामग्री
एगिस - एआई एजेंटों की समीक्षा के लिए सुरक्षा प्रणाली