InjecMEM: طلب واحد يمكنه اعتراض التحكم في الذاكرة طويلة المدى لوكيل LLM

9 سبتمبر 20266 الآراء

يكشف نوع جديد من الهجمات أن المهاجم يحتاج إلى رسالة واحدة فقط للتأثير على الردود المستقبلية للوكيل حول الموضوع المطلوب، حتى دون الوصول إلى مخزن الذاكرة. يؤكد مؤلفو الدراسة أن الطريقة تحافظ على فعاليتها عند حدوث تغييرات في الذاكرة، ويشددون على ضرورة تعزيز حماية هذه الأنظمة.

InjecMEM: طلب واحد يمكنه اعتراض التحكم في الذاكرة طويلة المدى لوكيل LLM

الذاكرة كهدف جديد للهجمات

عندما نتواصل مع روبوت الدردشة، فإنه عادةً ما يتذكر فقط المحادثة الحالية. ومع ذلك، فإن الوكلاء من الجيل التالي يحصلون بشكل متزايد على ذاكرة طويلة المدى — وهي نظام فرعي يخزن الحقائق عن المستخدم وتفضيلاته واستفساراته السابقة. بدونها، أصبح من الصعب تخيل مساعد مفيد حقًا: فالنموذج المجرد بدون سياق يفقد خيط المحادثة بسرعة. أصبحت الذاكرة بمثابة «قاعدة المعرفة المؤسسية» للذكاء الاصطناعي. ولهذا السبب تحديدًا تتحول إلى هدف جذاب للمهاجمين.

في مؤتمر COLM 2026، قُدِّم عمل يصف فئة جديدة من التهديدات — InjecMEM. باختصار شديد: يكفي أن يرسل المهاجم للوكيل رسالة مُصاغة خصيصًا مرة واحدة، ليتمكن من السيطرة على ذاكرته لفترة طويلة. ولا يتطلب ذلك الوصول إلى التخزين، ولا حقوق القراءة أو الكتابة — فالحقن يحدث بطريقة طبيعية، عبر الحوار نفسه.

كيف يكون ذلك ممكنًا؟ غالبًا ما يعمل الوكلاء المعاصرون وفق مخطط «ابحث أولاً، ثم أجب». يطلب الوكيل من الذاكرة كل ما يشبه سؤال المستخدم الحالي، ويولّد الإجابة بناءً على الأجزاء التي تم العثور عليها. وبالتالي، إذا دخلت إلى الذاكرة كتابة تحتوي على تعليمات خفية، فعند الرجوع التالي إلى نفس الموضوع، سيعتمد النموذج عليها تحديدًا. هكذا يمكن لطلب واحد يبدو غير ضار أن يتحول إلى قنبلة موقوتة.

كيف يعمل الحقن

تتكون الرسالة الخبيثة في نموذج InjecMEM من جزأين — المرساة والأمر التنافسي. تتضمن المرساة إشارات موضوعية مُختارة بحيث يجد البحث المستقبلي السجل المُصاب بالموضوع المطلوب بشكل شبه مضمون. في الواقع، تجعل المرساة السجل في أقصى درجات الصلة بالأسئلة المستهدفة — حتى لو صِيغ السؤال بشكل مختلف عن وقت الحقن.

المكوّن الثاني هو الأمر. وهو تسلسل قصير من الرموز (tokens) يعمل عند استرجاع السجل من الذاكرة. مهمته توجيه توليد الإجابة إلى مسار محدد مسبقًا. ولكن لكي يكون الهجوم عمليًا، يجب ألا يتفكك الأمر عند تغير السياق. لذلك يتم تحسينه مع مراعاة عدم اليقين: يتم اختيار صياغة تحافظ على تأثيرها سواء في موجه طويل، أو في محيط العديد من السجلات الأخرى، أو في مواضع إدراج مختلفة.

كيف يتم تدريب الأمر

اختيار أمر عالمي هو مهمة غير بسيطة. استخدم المؤلفون البحث الإحداثي التدرجي: طريقة تغيّر الرموز بشكل تسلسلي، مُقيّمةً مدى تعزيز كل بديل للتأثير المطلوب. يتم التدريب على مجموعة من القوالب الاصطناعية للموجهات ومواضع إدراج عشوائية، مما يجعل الأمر يتعلم العمل ليس في سيناريو واحد، بل في نطاق كامل من الظروف.

بالإضافة إلى ذلك، وسّع المؤلفون الطريقة ليشمل عدة نماذج أساسية. تم تدريب الأمر بشكل مشترك لنماذج LLM مختلفة، مما يزيد من قابلية نقله. لا يحتاج المهاجم بالضرورة إلى معرفة مسبقة بالنموذج الذي يقف خلف الوكيل — فمن المرجح أن يعمل الحقن على بنى أخرى أيضًا.

ماذا أظهر التقييم

أُجريت التجارب على عدة أنظمة ذاكرة ونماذج أساسية. أظهر InjecMEM موثوقية عالية: كان السجل المُصاب يُعثر عليه باستمرار حسب الموضوع المستهدف، وكان الوكيل ينتج بالضبط الإجابة التي خطط لها المهاجم. المهم بشكل خاص أن التأثير استمر حتى مع انجراف الذاكرة — عندما تتراكم سجلات جديدة وغريبة تدريجيًا في التخزين. أي أن حقنة ناجحة واحدة يمكن أن تؤثر على سلوك الوكيل لفترة طويلة.

في الوقت نفسه، تبين أن الهجوم دقيق بشكل مدهش. لم يؤثر على الاستفسارات غير المرتبطة بالهدف: إذا سأل المستخدم عن شيء آخر، لم يعمل السجل المُصاب ولم تتعطل منطق الإجابات. من ناحية، يجعل هذا الهجوم شبه غير مرئي للمستخدم العادي. ومن ناحية أخرى، يؤكد أن التأثير الخبيث يمكن استهدافه بدقة لموضوع معين.

كيف تحمي نفسك

نتائج العمل هي إشارة جدية لمطوري الأنظمة الوكيلة. عادةً ما يُنظر إلى الذاكرة على أنها مخزن محايد للحقائق، لكنها عمليًا غير محمية من «التسميم». تفحص المرشحات الكلاسيكية الرسائل الواردة بحثًا عن تعليمات صريحة، بينما يبدو InjecMEM كنص عادي خالٍ من الأوامر المباشرة. يجب أن تنتقل الحماية إلى جانب الاسترجاع: يجب التحقق من المرشحين من الذاكرة بشكل إضافي قبل إدراجهم في سياق النموذج.

قد تكون الإجراءات التنظيمية مفيدة أيضًا — مثل تقسيم الذاكرة إلى مناطق موثوقة وغير موثوقة، والحد من تأثير السجلات الجديدة، و«تنظيف» العناصر المشبوهة بانتظام. من المهم أن المؤلفين وفّروا إطار عمل قابلًا لإعادة الإنتاج للهجمات، مما يعني أن باحثي الأمن يحصلون على أداة لتطوير واختبار التدابير المضادة.

ثغرات ذاكرة وكلاء LLM — مجال شاب وغير مدروس كثيرًا حتى الآن. يُظهر InjecMEM بوضوح مدى خطورة النظام الفرعي المُستهان به. وكلما زادت الذاكرة التي نمنحها لوكلائنا، زاد الاهتمام الذي يجب أن نوليه لما يدخل إليها بالضبط.

الأسئلة المتكررة

المواد ذات الصلة

جميع المواد
InjecMEM: طلب واحد يمكنه اعتراض التحكم في الذاكرة طويلة المدى لوكيل LLM