GLM-5.3 from Zhipu: behind the flashy CyberGym figure lies an acknowledgment of its own weaknesses

19 أغسطس 202612 الآراء

في آخر تقرير له، نموذج Zhipu GLM-5.3 تحقق أفضل نتيجة على اختبار واحد للسلامة، اثنين آخرين. وتعترف الشركة نفسها بأن أهم نمو يأتي في المناطق التي تكون فيها الفجوة أكبر.

GLM-5.3 from Zhipu: behind the flashy CyberGym figure lies an acknowledgment of its own weaknesses

الإعلان ورقم العنوان

On August 14, Zhipu (also known as Z.ai) unveiled GLM-5.3, a model focused on programming. وفي البيان التقني، قارن على الفور النموذج الجديد بالتطورات الدولية الرائدة. The centerpiece was its result on the CyberGym benchmarks: 84.5% against 83.8% for Anthropic Mythos 5 and 83.6% for OpenAI GPT-5.6 Sol. هذه الميزة تبدو صلبة وكسبت الإعلان بقعة في عنوان الأخبار ولكن إذا حفرت أعمق، اتضح أن هذا الفوز هو المكان الوحيد تقريبا حيث GLM-5.3 يتفوق حقا على منافسيه. المطور نفسه يعترف بهذا على الرغم من ذلك

An important clarification: this is not about comprehensive security, but about finding vulnerabilities in source code. وهذا هو بالضبط النقطة التي كثيرا ما تضيع عندما تعاد صياغة الأخبار، مما يعطي انطباعا كاذبا عن القيادة.

لماذا الإختبار الضيّق لا يجعل نموذجاً قائداً

CyberGym بسيط إلى حد ما: النماذج تعطى رمز المصدر، والنموذج يجب أن يجد ضعفا فيه ويؤكده. وهذه بالتأكيد مهارة مفيدة، ولكنها لا تعكس سوى المرحلة الأولى من كومة إلكترونية حقيقية. Zhipu itself calls CyberGym the narrowest of the three published security metrics. الإختباران الآخران، (إكسبلوت بينش) و(إكسبلوت جيم) أظهرا أنّه مع دورة "المُستَغَل" الكاملة، فإنّ الأمور ليست مُتعفنة جداً لـ(جي إل إم 5.3). وعلاوة على ذلك، فإن الفجوة في نظام سايبر غيم لا تتجاوز 0.7 نقطة مئوية - بالنظر إلى وجود نقطة واحدة (تجاوز الحدود القصوى 1 على 507 1 مهمة) ولم يبلغ عن أي فرق، فمن غير المرجح أن يكون هذا الفرق كبيرا من الناحية الإحصائية. وببساطة، هذه النتيجة لا تثبت التفوق، بل تشير فقط إلى أن النماذج على قدم المساواة تقريبا في مهمة ضيقة واحدة.

Exploit Bench and ExploitGym: the real state of affairs

لنبدأ بـ (إكسبلوت بينش) وهنا يسجل GLM-5.3 نسبة 54.4 في المائة، وهو ضعف ما حققه سلفه (24.4 في المائة). وهذا النمو مثير للإعجاب، ولكنه ينقصه المنافسون: خمس درجات 78.0 في المائة من المسابقات الأنثروبيكية، و5.6 درجة مئوية من الناتج المحلي الإجمالي للشركة. الديناميات على (إفلويت جيم) أكثر وضوحاً وفي غضون ساعتين، يستكمل GLM-5.3 105 مهام؛ في غضون ست ساعات، 130 مهمة. وتحل الأساطير 5 181 و 247 مهمة في نفس الإطار الزمني، على التوالي. الفجوة متعددة (زيبو) نفسه يلاحظ: "الخطوة الثانية على سلسلة "الكشف عن التعرض للاستغلال" وبعبارة أخرى، إذا كان سيبر غيم هو النقطة الوحيدة التي يحمل فيها GLM-5.3 نفسه، فحالما تصبح المهمة أكثر تعقيدا، يفقد النموذج أكثر وأكثر وضوحا.

الترميز: نتائج مختلطة ومقارنات غريبة

بما أن النموذج يوضع كأداة للمطورين فمن المعقول توقع نتائج قوية على نقاط الترميز في الواقع، الأمور مختلطة In the main table, Zhipu comparisons GLM-5.3 with Anthropic Opus 4.8 - and it wins on some tests and loses on others. في مخططات الأداء، نموذج مختلف مدرج في قائمة المنافسين، كلود فيبل 5، وعلى اختبار زيبو الداخلي، وهذا النهج - الذي يقارن نماذج مختلفة في أجزاء مختلفة - يجعل من المستحيل رؤية الصورة الكاملة. علاوة على ذلك، كان تقييم GLM-5.3 يجري داخل وكيل الأنثروبيك، أي Claude Code 2.1.207. هذا يعني أننا لا نرى نتائج عارضة لكن من مزيج "النموذج + البيئة" الذي يؤثر أيضا على القياسات النهائية.

الكهوف المنهجية والاعتراف بضعفها

(زيبو) يصنع ملاحظة فضولية في تقريره: قدراته في مجال الأمن السيبراني "تنمو بسرعة أكبر" وهذا اعتراف صادق بأن خط الأساس للمقارنة ضعيف حاليا، ويبدأ التقدم من نقطة منخفضة. وفي الوقت نفسه، تثير منهجية المقارنة تساؤلات. أجزاء مختلفة من التقرير تستخدم نماذج مختلفة من الأنثروبيك - 4.8، كلود Fable 5، وAthropic Mythos 5. وبالإضافة إلى ذلك، تُطَوَّل الميزانيات الزمنية المخصصة للمتفجرات على أساس الناتج من التحليل الفني؛ معامِلات التحويل تُعطى لكيمي K3 و Qwen3.8 ماكس، لكن ليس للميثيوس 5. وبدون هذه المعامِلات، قد لا تكون النتائج المنافسة قابلة للمقارنة تماماً. رغم ذلك، (زيبو) يخطو الخطوة الصحيحة: "أثقال (جي إل إم 5.3) ستنشر، في حين أن عمل (أنثروبيك) المتشابه يبقى تحت قيود الدخول" This gives independent researchers a chance to verify the claimed numbers.

436 2 ضعف: أعداد تحتاج إلى سياق

ويقدم التقرير أيضا تفاصيل عن العمل المشترك مع أفرقة الأمن الصينية. وقام النموذج بتحليل المشاريع الحقيقية المفتوحة المصدر، ووجد في نهاية المطاف وجود 436 2 ضعفا في 269 مستودعا. وهذه بالفعل نتائج مجزأة ومجزأة خضعت لاستعراض الخبراء. توزيع الشدة يبدو هكذا

  • حاسمة: 107؛
  • عالية: 990؛
  • متوسط: 286 1؛
  • منخفض: 53.

مثير للإعجاب، لكن هناك راية. ويورد الفريق الموجز في البيان نفسه 097 1 استنتاجاً حاسماً وعالياً - وهو بالضبط مبلغ 107 و990. ومع ذلك، يصف نص التقرير هذه الـ 097 1 كـ "ميديوم-هاي" ويبدو أن بعض المنافذ الإخبارية نسخت النسخة الثانية دون ملاحظة التباين. وهذا التناقض يشير إلى أن التقرير قد جمع على عجلة من أمره. والحقيقة الأخرى المثيرة للفضول هي أن أقدم ضعف عثر عليه يعود تاريخه إلى عام 1981، وأن متوسط عمر النتائج هو 26.6 سنة. وبعبارة أخرى، فإن النموذج يبرز في إيجاد قضايا معروفة منذ وقت طويل، ولكن نجاحه في الكشف عن مواطن الضعف الجديدة هو: أقل وضوحاً

الاستنتاجات

The GLM-5.3 announcement is a story of how marketing and reality diverge. ومن ناحية مرجعية ضيقة، خرج النموذج على القمة، ولكن التجارب الأكثر شمولا يعيدنا إلى الأرض: هناك فجوة خطيرة وراء القادة في كل من أمن الفضاء الإلكتروني والترميز. في نفس الوقت، (زيبو) يستحق احترام انفتاحه، فهو ينشر الأوزان والبيانات عن نقاط الضعف في النموذج. هناك تقدم واضح على النسخة السابقة مما يجعل من الممكن النظر للمستقبل بتفاؤل حذر ولكن استدعاء GLM-5.3 قائد أمن بناء على رقم واحد من إدارة واحدة سيكون مبالغة.

الأسئلة المتكررة

المواد ذات الصلة

جميع المواد
استعراض النتائج والضعف