الرموز ليست متكافئة: RACER يزيل الأبواب الخلفية من النماذج متعددة الوسائط على مستوى الأوزان

19 سبتمبر 202616 الآراء

اقترح الباحثون RACER — طريقة لإصلاح النماذج اللغوية الكبيرة متعددة الوسائط، تبحث عن آثار الباب الخلفي ليس في البيانات المدخلة، بل في التنافر بين التمثيلات عبر الطبقات، بشكل منفصل عن الصور والنصوص. تكفي هذه الطريقة مئة مثال نظيف، ولا تتطلب معرفة المحفّز ولا هدف الهجوم، ولا حتى ما إذا كان النموذج مصابًا أصلًا.

الرموز ليست متكافئة: RACER يزيل الأبواب الخلفية من النماذج متعددة الوسائط على مستوى الأوزان

الباب الخلفي يأتي من خط الأنابيب، لا من المستخدم

تندمج النماذج متعددة الوسائط بشكل متزايد في السيناريوهات التطبيقية: فهي تقرأ لقطات الشاشة، وتحلل صور المنتجات، وتجيب على الأسئلة المتعلقة بمستندات ممسوحة ضوئيًا. ومع هذه السهولة، تنتقل أيضًا ثغرة الغير إلى المنتج. يُجمَّع النموذج من مكونات جاهزة — مُرمِّز بصري، وإسقاط، وجزء لغوي — وفي كل خطوة من خطوات التجميع قد يتسلل إليها مُحفِّز خفي. أحيانًا يكون مخبأً في الصورة، وأحيانًا في النص، وأحيانًا يتطلب الجمع بين الإشارتين معًا.

ثم يبدأ الأمر المزعج. الأدوات التي كانت تتعامل بشكل جيد مع المصنِّفات «المسمومة» تتراجع بشكل ملحوظ مع النماذج متعددة الوسائط: طبقات كثيرة جدًا، ووسائط متباينة جدًا، وهندسة داخلية معقدة جدًا للتمثيلات. أما الحلول المصممة خصيصًا للنماذج اللغوية متعددة الوسائط (MLLM)، فغالبًا ما تعمل عند المدخل — إذ تُصفّي الطلبات المشبوهة قبل أن تصل إلى الشبكة. قد يوقف المرشِّح هجومًا معينًا، لكن العدوى نفسها تبقى في الأوزان. وتجاوز المرشِّح مسألة تتعلق ببراعة المهاجم.

عدم الاتساق الطبقي كبصمة للهجوم

انتبه مؤلفو الورقة arXiv:2608.24354 (Jiali Wei وثمانية مؤلفين آخرين؛ الفئات cs.CR، cs.AI، cs.CL، تاريخ التقديم — أغسطس 2026) إلى أمر يسهل تفويته إذا نظرت فقط إلى المدخل والمخرج. الباب الخلفي يترك أثرًا ليس في طبقة واحدة، بل في المسار: التمثيلات تتغير بشكل غير نمطي أثناء الانتقال من طبقة إلى أخرى. وقد أُطلق على ذلك اسم الشذوذ الطبقي في عدم الاتساق.

التفصيل الجوهري هو أن الشذوذ ليس موزعًا بالتساوي على كامل الشبكة. إنه مرتبط بالوسيطة، والأهم أنه متمركز في منطقة الرموز حيث توجد سمة المُحفِّز. بعبارة أخرى، «يستند» النموذج إلى منطقة ضيقة من التمثيل، وهناك تحديدًا ينشأ انزياح لا يحدث مع البيانات النظيفة.

ومن هنا الاستنتاج العملي: إذا قمنا بمتوسط عدم الاتساق على كامل التمثيل، تتلاشى الإشارة وسط ضوضاء السمات المفيدة. يجب أولًا فصل ما خلطته النموذج بالفعل.

كيف يعمل RACER

الفصل حسب الوسائط

حصل إطار الاستعادة على مستوى النموذج — وليس كإضافة فوق الاستدلال — على اسم RACER (Region-Aware Consistency Repair). المنطق كالتالي: يُفكَّك التمثيل المدمج مرة أخرى إلى منطقتي رموز بصرية ونصية، ويُحسب عدم الاتساق الطبقي لكل منهما على حدة، ثم يُعاد تجميعهما، لكن بأوزان تراعي الوسيطة. يجري العمل في نافذة الطبقات العميقة — حيث تتشكل الانزياحات المستقرة والموجهة.

والنتيجة هي دالة هدف واعية بالمناطق. إنها أكثر حساسية للشذوذات المحلية من مقياس عام على كامل المتجه، ولا تسمح للسمات المفيدة بإخماد إشارة الباب الخلفي.

Min-max بدلًا من الضبط الدقيق البسيط

ثم يُفعَّل المخطط التنافسي. عبر تحسين min-max، يبحث الإطار أولًا عن أسوأ اضطراب — ذلك الذي يعزز عدم الاتساق المكتشف إلى أقصى حد — ثم يضبط النموذج بدقة بحيث لا يكسر هذا الاضطراب أداءه. بعبارة أبسط: يهاجمون أنفسهم لتصليب اتجاهات التمثيل التي يستند إليها السلوك الضار.

الجانب العملي لا يقل أهمية عن الجانب التقني. لا تحتاج الطريقة سوى 100 مثال نظيف. ولا يلزمها معرفة المُحفِّز نفسه، ولا الهدف المستهدف للهجوم، ولا حتى ما إذا كان النموذج المقدم مصابًا أصلًا. وهذا أمر جوهري: فالحماية لا تتحول إلى مهمة «خمّن الهجوم».

ما أظهرته القياسات

شغّل المؤلفون الطريقة على ثلاثة نماذج مفتوحة متعددة الوسائط في 36 تهيئة للباب الخلفي — بمُحفِّزات في الصورة، وفي النص، وفي القناتين معًا. وتمكنوا من خفض متوسط ASR (نسبة الحالات التي ينجح فيها الهجوم فعلًا) إلى 1.1%، وفي 32 تهيئة من أصل 36 انخفض المؤشر إلى الصفر.

النتيجة الثانية لا تقل أهمية، وإن كان يُتحدث عنها أقل: الفائدة على المهام النظيفة تبقى محفوظة. وذلك في النماذج المصابة والنظيفة أصلًا على حد سواء — أي أن الاستعادة لا تحوّل نموذجًا عاملًا إلى نموذج حذر لكنه عديم الفائدة. هذه هي التكلفة النموذجية للطرق العدوانية في التنقية، ويبدو أنها هنا، وفقًا للقياسات، قد أُمكن تجنبها.

ما الذي يغيّره هذا عمليًا

الفرق بين تصفية المدخل واستعادة الأوزان ليس أكاديميًا. المرشِّح يعيش في البنية التحتية المحيطة بالنموذج: يجب صيانته وتحديثه لأنواع الهجمات الجديدة، ومع ذلك يمكن تجاوزه عبر قناة أخرى. أما التعديل على مستوى الأوزان فيزيل السبب لا العَرَض، ولا يضيف زمن تأخير إلى الاستدلال.

وهناك أيضًا سياق أوسع. اعتدنا تقييم أمان النموذج بناءً على إجاباته في الاختبارات، لكن RACER يُظهر أن الإشارة المفيدة مخبأة في التمثيلات الوسيطة — في كيفية تفكير الشبكة، لا في ما تقوله. وإذا توسع هذا النهج إلى ما هو أبعد من المعماريات الثلاث المختبرة، يصبح لدى مزوّدي النماذج اللغوية متعددة الوسائط خطوة نظافة رخيصة نسبيًا: مئة مثال نظيف وقليل من الحسابات قبل نشر الأوزان. والقيود واضحة أيضًا — فالورقة تتناول فئة محددة من الهجمات وتتطلب الوصول إلى داخل النموذج، لذا لا ينطبق المخطط مباشرة على النماذج المغلقة عبر واجهات API.

الأسئلة المتكررة

المواد ذات الصلة

جميع المواد
الرموز ليست متكافئة: RACER يزيل الأبواب الخلفية من النماذج متعددة الوسائط على مستوى الأوزان