HarnessRisk: LLM एजेंट सुरक्षा परीक्षण के लिए हार्नेस जीवनचक्र के सभी चरणों में एक नया दृष्टिकोण

4 सितम्बर 202610 बार देखा गया

शोधकर्ताओं ने एक बेंचमार्क प्रस्तुत किया है जो एजेंटिक रैपर की सुरक्षा का मूल्यांकन छह परिचालन चरणों में करता है। परीक्षण दर्शाते हैं कि खतरों की आत्मविश्वासपूर्ण पहचान के बावजूद हमले अक्सर सफल होते हैं — सफल हमलों का अनुपात 12.6% से 80.9% तक भिन्न होता है।

HarnessRisk: LLM एजेंट सुरक्षा परीक्षण के लिए हार्नेस जीवनचक्र के सभी चरणों में एक नया दृष्टिकोण

«नियंत्रण परत» LLM-एजेंटों के लिए कितनी खतरनाक है

आधुनिक भाषा मॉडल शायद ही कभी अकेले काम करते हैं। अक्सर उन्हें एजेंट हार्नेस के भीतर तैनात किया जाता है — एक मध्यवर्ती परत जो मॉडल को टूल, एक्सटेंशन, दीर्घकालिक मेमोरी, अनुमतियों और बाहरी क्रियाओं तक पहुँच प्रदान करती है। यही परत तय करती है कि मॉडल क्या कर सकता है और क्या नहीं।

समस्या यह है कि मौजूदा सुरक्षा बेंचमार्क आमतौर पर केवल अलग-अलग हमले के परिदृश्यों या सीमित परिचालन स्थितियों की जाँच करते हैं। इससे यह समझना मुश्किल हो जाता है कि हार्नेस के किस चरण में विफलता होती है: कॉन्फ़िगरेशन के दौरान, टूल कॉल के समय, या घटना के बाद पुनर्प्राप्ति में। शोधकर्ताओं ने HarnessRisk प्रस्तावित किया — एक बेंचमार्क जो एजेंट हार्नेस की सुरक्षा को उसके जीवनचक्र के सभी चरणों में समग्र रूप से देखता है।

हार्नेस जीवनचक्र के छह चरण

लेखकों ने हार्नेस सुरक्षा को छह परिचालन चरणों में विभाजित किया:

  • Harness Configuration — पैरामीटर और एक्सेस अधिकारों की सेटिंग;
  • Capability Extension — नई क्षमताओं और एक्सटेंशन का कनेक्शन;
  • Runtime Operation — वास्तविक समय में कार्यों का निष्पादन;
  • State Persistence — स्थिति का सहेजना और पुनर्स्थापन;
  • Action Control — क्रियाओं और टूल पर नियंत्रण;
  • Incident Recovery — विफलताओं पर प्रतिक्रिया और घटनाओं के बाद पुनर्प्राप्ति।

प्रत्येक चरण अपने क्षेत्र की जिम्मेदारी के लिए उत्तरदायी है, और कमजोरियाँ इनमें से किसी में भी प्रकट हो सकती हैं। यही विभाजन यह तुलना करने की अनुमति देता है कि विभिन्न हार्नेस समान परिस्थितियों में हमलों से कैसे निपटते हैं।

HarnessRisk के अंदर: परिदृश्य और मेट्रिक्स

बेंचमार्क में 128 पृथक परिदृश्य शामिल हैं। प्रत्येक परिदृश्य चतुराई से डिज़ाइन किया गया है: मॉडल के सामने एक सुरक्षित उपयोगकर्ता कार्य रखा जाता है, लेकिन कार्यप्रवाह के अविश्वसनीय आर्टिफैक्ट के अंदर एक शत्रुतापूर्ण निर्देश छिपा होता है। मॉडल को आर्टिफैक्ट में निर्मित हमले के आगे झुके बिना वैध लक्ष्य को पूरा करना चाहिए।

प्रत्येक ट्रैजेक्टरी का मूल्यांकन चार मेट्रिक्स पर किया जाता है:

  • Utility — मूल कार्य कितनी अच्छी तरह पूरा हुआ;
  • Attack Success Rate — सफलतापूर्वक किए गए हमलों का अनुपात;
  • Persistence — हमले का प्रभाव कितने समय तक बना रहता है;
  • Detection — सिस्टम जोखिमों को कितनी प्रभावी ढंग से पहचानता है।

यह दृष्टिकोण न केवल यह देखने की अनुमति देता है कि «हैक हुआ या नहीं», बल्कि मॉडल की उपयोगिता के लिए सुरक्षा की कीमत भी दिखाता है।

परीक्षण से क्या पता चला

प्रयोग तीन हार्नेस, छह भाषा मॉडल और मॉडल-हार्नेस के 14 संयोजनों पर किए गए। परिणाम विषम थे: हमलों की सफलता 12.6% से 80.9% तक भिन्न थी, और Utility 75.0% से 97.6% की सीमा में रही। सीधे शब्दों में कहें तो, एक ही मॉडल एक कॉन्फ़िगरेशन में लगभग अभेद्य हो सकता है और दूसरे में स्पष्ट रूप से कमजोर।

तीनों हार्नेस में सबसे कमजोर चरण — Harness Configuration है। हमले अक्सर जटिल एक्सप्लॉइट्स के कारण नहीं, बल्कि इसलिए सफल होते हैं क्योंकि «अनुमत» कार्यप्रवाह के भीतर सुरक्षा को प्रभावित करने वाले पैरामीटर बदले जा सकते हैं। यह एक चिंताजनक संकेत है: यहाँ तक कि एक सही दिखने वाला हार्नेस भी हमलावर को खेल के नियम बदलने की अनुमति दे सकता है।

एक दिलचस्प परिणाम जोखिम पहचान से भी जुड़ा है। कुछ कॉन्फ़िगरेशन 90% से अधिक रन में हमलों का पता लगाते हैं, लेकिन फिर भी सफल हमलों का एक महत्वपूर्ण अनुपात होने देते हैं। यानी मॉडल «समझता» है कि कुछ खतरनाक हो रहा है, लेकिन इस समझ को सुरक्षित व्यवहार में नहीं बदलता। खतरे के बारे में जागरूकता अपने आप में सिस्टम की रक्षा नहीं करती।

निष्कर्ष: सुरक्षा को «औसतन» नहीं मापा जा सकता

HarnessRisk का मुख्य सबक यह है कि एजेंट सिस्टम की सुरक्षा मॉडल और हार्नेस के विशिष्ट संयोजन पर अत्यधिक निर्भर करती है। «मॉडल सुरक्षित है» या «हार्नेस सुरक्षित है» जैसे औसत मूल्यांकन बहुत कम बताते हैं, यदि यह ध्यान में नहीं रखा जाता कि वे किस कॉन्फ़िगरेशन में काम करते हैं।

एजेंटों का मूल्यांकन हार्नेस के कई जिम्मेदारी क्षेत्रों में एक साथ करना आवश्यक है — प्रारंभिक कॉन्फ़िगरेशन से लेकर घटनाओं के बाद पुनर्प्राप्ति तक। और अलग से जाँच करना चाहिए कि मॉडल सामान्य कार्य आर्टिफैक्ट में निर्मित हमले के दौरान कैसा व्यवहार करता है। केवल इस तरह से कमजोर बिंदुओं को देखा जा सकता है जो क्लासिक बेंचमार्क में परदे के पीछे रह जाते हैं।

अक्सर पूछे जाने वाले प्रश्न

समान सामग्री

सभी सामग्री
HarnessRisk: LLM एजेंट सुरक्षा परीक्षण के लिए हार्नेस जीवनचक्र के सभी चरणों में एक नया दृष्टिकोण