InjecMEM: एक ही अनुरोध LLM-एजेंट की दीर्घकालिक मेमोरी का नियंत्रण हथिया सकता है

9 सितम्बर 20266 बार देखा गया

एक नया आक्रमण वर्ग दर्शाता है कि हमलावर के लिए एक संदेश पर्याप्त है ताकि वह एजेंट के भविष्य के उत्तरों को संबंधित विषय पर प्रभावित कर सके, यहां तक कि मेमोरी स्टोरेज तक पहुंच के बिना भी। कार्य के लेखकों का दावा है कि यह विधि मेमोरी में परिवर्तनों के बावजूद प्रभावी बनी रहती है, और वे ऐसी प्रणालियों की सुरक्षा को मजबूत करने की आवश्यकता पर जोर देते हैं।

InjecMEM: एक ही अनुरोध LLM-एजेंट की दीर्घकालिक मेमोरी का नियंत्रण हथिया सकता है

स्मृति: हमलों का नया निशाना

जब हम चैट-बॉट से बात करते हैं, तो वह आमतौर पर केवल वर्तमान संवाद को याद रखता है। हालाँकि, अगली पीढ़ी के एजेंटों को तेजी से दीर्घकालिक स्मृति मिल रही है — एक उपप्रणाली जो उपयोगकर्ता के बारे में तथ्यों, उसकी प्राथमिकताओं और पिछले अनुरोधों को संग्रहीत करती है। इसके बिना वास्तव में उपयोगी सहायक की कल्पना करना कठिन है: संदर्भ के बिना एक नंगा मॉडल जल्दी से बातचीत का सूत्र खो देता है। स्मृति एआई के लिए एक प्रकार का 'कॉर्पोरेट ज्ञानकोष' बन गई है। यही कारण है कि यह हमलावरों के लिए एक आकर्षक लक्ष्य बनती जा रही है।

COLM 2026 सम्मेलन में एक कार्य प्रस्तुत किया गया जिसमें खतरों के एक नए वर्ग — InjecMEM — का वर्णन किया गया है। संक्षेप में कहें तो: हमलावर को एजेंट को एक विशेष रूप से तैयार संदेश केवल एक बार भेजने की आवश्यकता होती है, ताकि उसकी स्मृति पर लंबे समय तक नियंत्रण हासिल किया जा सके। इसके लिए स्टोरेज तक पहुँच, या पढ़ने/लिखने के अधिकारों की आवश्यकता नहीं होती — इंजेक्शन स्वाभाविक रूप से, स्वयं संवाद के माध्यम से होता है।

यह कैसे संभव है? आधुनिक एजेंट अक्सर 'पहले खोजें, फिर उत्तर दें' योजना पर काम करते हैं। एजेंट स्मृति से वह सब कुछ प्राप्त करता है जो उपयोगकर्ता के वर्तमान प्रश्न से मिलता-जुलता है, और पाए गए अंशों के आधार पर उत्तर उत्पन्न करता है। इसलिए, यदि स्मृति में छिपे निर्देशों वाला कोई रिकॉर्ड आ जाता है, तो अगली बार उसी विषय पर पहुँचने पर मॉडल उसी पर भरोसा करेगा। इस तरह एक हानिरहित दिखने वाला अनुरोध एक धीमी गति से फटने वाला बम बन सकता है।

इंजेक्शन कैसे काम करता है

InjecMEM प्रतिमान में दुर्भावनापूर्ण संदेश दो भागों से बना होता है — एंकर और प्रतिकूल कमांड। एंकर में विषयगत संकेत शामिल होते हैं, जिन्हें इस तरह चुना जाता है कि भविष्य की खोज लगभग निश्चित रूप से संक्रमित रिकॉर्ड को सही विषय पर ढूंढ ले। वास्तव में, एंकर रिकॉर्ड को लक्षित प्रश्नों के लिए अधिकतम प्रासंगिक बनाता है — भले ही प्रश्न इंजेक्शन के समय से अलग तरीके से तैयार किया गया हो।

दूसरा घटक — कमांड है। यह टोकन का एक छोटा अनुक्रम है जो तब सक्रिय होता है जब रिकॉर्ड स्मृति से निकाला जाता है। इसका कार्य उत्तर निर्माण को पूर्व-निर्धारित दिशा में ले जाना है। लेकिन हमले को व्यावहारिक बनाने के लिए, कमांड को संदर्भ बदलने पर बिखरना नहीं चाहिए। इसलिए इसे अनिश्चितता को ध्यान में रखते हुए अनुकूलित किया जाता है: ऐसा शब्दांकन चुना जाता है जो लंबे प्रॉम्प्ट में, कई अन्य रिकॉर्ड्स के बीच, और विभिन्न स्थानों पर डालने पर भी प्रभावी रहे।

कमांड कैसे प्रशिक्षित होती है

एक सार्वभौमिक कमांड तैयार करना एक कठिन कार्य है। लेखकों ने ग्रेडिएंट-आधारित समन्वय खोज का उपयोग किया: यह विधि क्रमिक रूप से टोकन बदलती है और मूल्यांकन करती है कि प्रत्येक संस्करण वांछित प्रभाव को कितना बढ़ाता है। प्रशिक्षण कई सिंथेटिक प्रॉम्प्ट टेम्पलेट्स और यादृच्छिक सम्मिलन स्थानों पर होता है, जिससे कमांड केवल एक परिदृश्य में नहीं, बल्कि स्थितियों की एक पूरी श्रृंखला में काम करना सीखती है।

इसके अलावा, लेखकों ने विधि को कई आधार मॉडलों के मामले तक बढ़ाया। कमांड को विभिन्न LLM के लिए संयुक्त रूप से प्रशिक्षित किया गया, जिससे इसकी पोर्टेबिलिटी बढ़ जाती है। हमलावर को पहले से यह जानने की आवश्यकता नहीं है कि एजेंट के पीछे कौन सा मॉडल है — इंजेक्शन संभवतः अन्य आर्किटेक्चर पर भी काम करेगा।

मूल्यांकन ने क्या दिखाया

प्रयोग कई स्मृति प्रणालियों और आधार मॉडलों पर किए गए। InjecMEM ने उच्च विश्वसनीयता प्रदर्शित की: संक्रमित रिकॉर्ड लक्षित विषय पर स्थिर रूप से पाया गया, और एजेंट ने ठीक वही उत्तर दिया जो हमलावर ने निर्धारित किया था। विशेष रूप से महत्वपूर्ण बात यह है कि प्रभाव स्मृति बहाव के दौरान भी बना रहा — जब स्टोरेज में धीरे-धीरे नए, बाहरी रिकॉर्ड जमा होते गए। यानी, एक सफल इंजेक्शन लंबे समय तक एजेंट के व्यवहार को प्रभावित कर सकता है।

साथ ही, हमला आश्चर्यजनक रूप से सटीक निकला। लक्ष्य से संबंधित न होने वाले अनुरोधों पर इसका कोई प्रभाव नहीं पड़ा: यदि उपयोगकर्ता किसी और चीज़ के बारे में पूछता था, तो संक्रमित रिकॉर्ड सक्रिय नहीं होता था और उत्तरों का तर्क बाधित नहीं होता था। एक ओर, यह हमले को सामान्य उपयोगकर्ता के लिए लगभग अदृश्य बना देता है। दूसरी ओर, यह पुष्टि करता है कि दुर्भावनापूर्ण प्रभाव को किसी विशिष्ट विषय पर सटीक रूप से लक्षित किया जा सकता है।

सुरक्षा कैसे करें

कार्य के परिणाम एजेंट सिस्टम के डेवलपर्स के लिए एक गंभीर संकेत हैं। स्मृति को आमतौर पर तथ्यों के एक तटस्थ भंडार के रूप में देखा जाता है, लेकिन यह 'विषाक्तता' से लगभग असुरक्षित है। क्लासिक फ़िल्टर आने वाले संदेशों में स्पष्ट निर्देशों की जाँच करते हैं, जबकि InjecMEM सामान्य पाठ जैसा दिखता है, जिसमें कोई सीधा आदेश नहीं होता। सुरक्षा को पुनर्प्राप्ति पक्ष की ओर स्थानांतरित किया जाना चाहिए: स्मृति से आने वाले उम्मीदवारों को मॉडल के संदर्भ में डालने से पहले अतिरिक्त रूप से मान्य किया जाना चाहिए।

संगठनात्मक उपाय भी उपयोगी होंगे — उदाहरण के लिए, स्मृति को विश्वसनीय और अविश्वसनीय क्षेत्रों में विभाजित करना, नए रिकॉर्ड के प्रभाव को सीमित करना और संदिग्ध तत्वों की नियमित 'सफाई' करना। यह महत्वपूर्ण है कि लेखकों ने हमलों के लिए एक प्रतिलिपि प्रस्तुत करने योग्य ढांचा प्रदान किया है, जिसका अर्थ है कि सुरक्षा शोधकर्ताओं के पास जवाबी उपायों को विकसित करने और परीक्षण करने के लिए एक उपकरण है।

LLM-एजेंटों की स्मृति की कमजोरियाँ — एक नया और अभी तक कम अध्ययन किया गया क्षेत्र है। InjecMEM स्पष्ट रूप से दिखाता है कि एक कम आंकी गई उपप्रणाली कितनी खतरनाक हो सकती है। और हम अपने एजेंटों को जितनी अधिक स्मृति देते हैं, उतना ही अधिक ध्यान हमें इस बात पर देना होगा कि उसमें वास्तव में क्या जाता है।

अक्सर पूछे जाने वाले प्रश्न

समान सामग्री

सभी सामग्री
InjecMEM: एक ही अनुरोध LLM-एजेंट की दीर्घकालिक मेमोरी का नियंत्रण हथिया सकता है