عنوان GLM-5.3 بدون نموذج أساسي جديد: كيف استخرجت Z.ai النمو في البرمجة والأمن السيبراني من التدريب اللاحق

22 أغسطس 202617 الآراء

يعمل التحديث على نفس الأساس السابق 743B، وجميع التحسينات مرتبطة بتدريب لاحق موسّع: المهام المعقدة ذات الأفق الطويل أصبحت أكثر سهولة بشكل ملحوظ، ونتائج معايير السلامة تجاوزت التوقعات. يتبقى حوالي أسبوعين على نشر الأوزان، والنموذج متاح حاليًا عبر API وGLM Coding Plan وZCode.

عنوان GLM-5.3 بدون نموذج أساسي جديد: كيف استخرجت Z.ai النمو في البرمجة والأمن السيبراني من التدريب اللاحق

مقدمة: بدون نموذج أساسي جديد

عندما تظهر نسخة جديدة من نموذج لغة كبيرة، كنت تتوقع عادة أن يكون قد أعيد تدريبه على مجموعة بيانات أكبر. غير أن زياي تتبع نهجاً مختلفاً: فالنظام GLM-5.3 المفرج عنه يُستخدم في نفس النموذج الأساسي الذي يبلغ 743 بليون بارامترات من طراز GLM-5.2. وجميع التحسينات ناتجة عن زيادة التدريب بعد التدريب. ويدار هذا النموذج في بيئات أكثر، وأضيفت أنواع جديدة من البيئات، واستغرق التدريب وقتا أطول من السابق. وهذه، في المقام الأول، تجربة تبين مدى إمكانية تجاوز هيكل قائم بضبط مناسب لمهام محددة.

743 بليون بارامتر هو نموذج كوموسال، وتكلفه ما قبل التدريب ثروة. فبعد التدريب أرخص بكثير، رغم أنه يتطلب معالجة دقيقة للبيانات ولفترة طويلة. This approach matters not only for Z.ai: it hints that the industry has a safety margin. ليس عليك دائما أن تنفق الموارد على التدريب من الصفر - أحيانا الذكاء بعد التدريب يكفي.

الترميز: أكبر قفزة

وفيما يتعلق بمهام البرمجة، يحقق GLM-5.3 تقدما حقيقيا. وفيما يتعلق بالمعيار المرجعي للمعدة ٣-٠، قفزت النتيجة من ٤,٦ إلى ٢٨,٣ - أي تحسن يبلغ حوالي ستة أضعاف. في ديبسو ضد 1، ارتفعت النتيجة من 46.2 إلى 66.9، وفي معرض العميل الأخير من 23.8 إلى 28.5. Also noted is the GDPval-AA v2 test, which involves 44 professions: here GLM-5.3 scores 1769 points.

مقياس (زياى) الداخلي يظهر تحسناً بنسبة 50% على (جي إل إم 5.2) ويحل هذا النموذج 31.4 في المائة من المهام بحوالي 000 50 رمز ناتج لكل مهمة. For context: Claude Opus 4.8 achieves 29.5% but spends 120,000 tokens, while Claude Fable 5 hits 39.5%, albeit with maximum effort. ويلاحظ زياي أن معيارا مرجعيا خاصا أقل عرضة للتلوث - وهو حجة هامة، حيث أن البيانات العامة هي GLM-5.3 لا تزال تفقد إلى GPT-5.6 Sol and Fable 5 بشأن عدد من تقييمات الترميز المعقدة. وإذ يضع في اعتباره أن البائع نفسه يقدم جميع الأرقام، وإن كان ذلك في ظل ظروف موثقة، فإن التحقق المستقل لا يزال متقدما.

3-0 هو اختبار يحتاج النموذج إلى العمل في محطة طرفية، وإدارة الأوامر، ومعالجة الملفات والبيئة. زيادة بستة أضعاف تقريباً تبدو رائعة لكن من الجدير بالملاحظة أن هذه مهمات اصطناعية و خطر التلوث لا يمكن استبعاده وفي الممارسة العملية، يعني ذلك أن النموذج أصبح أكثر فائدة بشكل ملحوظ في الكتابة والشطب المستقلين: فهو يطيل السياق، ويخطط بخطوات أفضل، ويتطلب تدخلاً بشرياً أقل في كثير من الأحيان.

أمن الفضاء الإلكتروني: أثر غير متوقع

قصة أكثر غرابة تظهر في أمن الفضاء الإلكتروني وأضاف مهندسو زياي أمثلة لكشف الضعف إلى بيانات التدريب وتوقعوا أن يتحسن النموذج في التعليل بشأن الحشرات الفردية. ومع ذلك، ومع ضخ التدريب، بدأت القدرات في التراكم، وفي مرحلة ما، بدأ النموذج في وضع خطط متسقة ومتعددة الخطوات لسلاسل الاستغلال الكاملة. وقد حدث ذلك بصورة واضحة - دون برمجة هذه المهارات بشكل صريح.

النتائج مثيرة للإعجاب. On CyberGym, GLM-5.3 scores 84.5% versus 77.2% for GLM-5.2, beating Mythos 5 (83.8%) and GPT-5.6 Sol (83.6%). On Exploit Bench, success rates doubled: from 24.4% to 54.4%. لكن هنا (مايثوس 5) ما زال القائد عند 78.0% وفي معرض استكشاف جيم، يحل النموذج 105 مهام خلال ساعتين و 130 مهمة في ست ساعات. أرقام GLM-5.2 أكثر تواضعا: 29 و 39 مهمة. وتتناول الأساطير 5 181 و 247 مهمة على التوالي.

تفاصيل مثيرة للإهتمام، المهمة الأكثر عمقاً في سلسلة الإستغلال، أكبر ربح لـ (جي إل إم 5.3) على النسخة السابقة وفي الوقت نفسه، فإن الفجوة مع نماذج الحدود المغلقة تتسع، لذلك فمن المبكر جدا الحديث عن التكافؤ الكامل. وتوضح أرقام " اكسبلويت بينش " هذا جيدا: فرغم الزيادة المزدوجة، لا تزال الفجوة التي خلفت " ميثيوس " 5 " كبيرة.

ويثير هذا السلوك الآخذ في الظهور أيضاً شواغل أمنية: إذا كان يمكن للنموذج أن يخطط للهجمات، فإن توزيعه المفتوح يمكن أن يكون خطراً. قد يكون هذا بالضبط سبب عدم نشر الأوزان على الفور

التوافر والتوقعات

وفي الوقت الراهن، فإن الأوزان النموذجية ليست عامة. GLM-5.3 متاحة عن طريق برنامج " Z.ai API " ، وخطة الترميز GLM، و ZCode. وتخطط الشركة لفتح الأوزان بعد أسبوعين تقريبا من إطلاقها - بعد إجراء تقييم أمني وتقوية نموذجية. ونظرا لقدراته في مجال استغلال الضعف، فإن هذا الحذر معقول تماما.

هذا يعني أن النموذج يمكن دمجه الآن عن طريق الخدمات السحابية غير أنه ينبغي للمؤسسات التي لديها شروط إقامة البيانات أو فحص دقيق للبائعين أن تنتظر ظهور الأوزان - ومن ثم سيكون من الممكن نشر النموذج في بنيتها التحتية الخاصة بها والتحكم تماما في استخدامه.

خلاصة القول: GLM-5.3 مثال مذهل على الكيفية التي يمكن بها للتدريب بعد التدريب أن يعزز بشكل كبير نموذجا دون تغيير هيكل القاعدة. ولكن الاستنتاجات النهائية سابقة لأوانها: فهناك حاجة إلى إجراء اختبارات وتحليلات مستقلة للوزن المفتوح. من الممكن جداً أن يصبح هذا النهج اتجاهاً جديداً: إذا رأت شركات أخرى أن التحسينات يمكن أن تتحقق بسرعة وبأسعار رخيصة نسبياً بهذه الطريقة، ستتسارع دورات التحديث النموذجية، وسيتحول التركيز من التدريب المسبق على نطاق واسع إلى التركيز على سيناريوهات محددة.

الأسئلة المتكررة

المواد ذات الصلة

جميع المواد
GLM-5.3: A review of the Z.ai update without a new base-model