घोषणा और शीर्षक संख्या
14 अगस्त को, Zhipu (जिसे Zai के नाम से भी जाना जाता है) ने GLM-5.3 का अनावरण किया, जो प्रोग्रामिंग पर केंद्रित एक मॉडल था। तकनीकी रिलीज में, यह तुरंत अग्रणी अंतरराष्ट्रीय विकास के साथ नए मॉडल की तुलना में है। सेंटरपीस साइबर जिम बेंचमार्क पर इसका परिणाम था: 84.5% बनाम 83.8% एंथ्रोपिक मैथोस 5 और 83.6% के लिए ओपनएआई जीपीटी -5.6 सोल के लिए। यह लाभ ठोस दिखता है और घोषणा को समाचार हेडलाइनों में एक स्थान प्राप्त करता है। लेकिन अगर आप गहरी खुदाई करते हैं, तो यह पता चला कि यह जीत लगभग एकमात्र जगह है जहां GLM-5.3 वास्तव में अपने प्रतियोगियों को बाहर निकाल देता है। डेवलपर स्वयं अनिवार्य रूप से इस बात को स्वीकार करता है A veiled way.
एक महत्वपूर्ण स्पष्टीकरण: यह व्यापक सुरक्षा के बारे में नहीं है, लेकिन स्रोत कोड में कमजोरियों को खोजने के बारे में है। यह निश्चित रूप से वह बिंदु है जो अक्सर तब खो जाता है जब समाचार फिर से शुरू हो जाता है, जिससे नेतृत्व का झूठा प्रभाव पड़ता है।

साइबर जिम: क्यों एक संकीर्ण परीक्षण एक मॉडल को नेता नहीं बनाता है
साइबर जिम काफी सरल है: मॉडल को सोर्स कोड दिया जाता है, और मॉडल को इसमें एक भेद्यता मिलनी चाहिए और इसकी पुष्टि करनी चाहिए। यह निश्चित रूप से एक उपयोगी कौशल है, लेकिन यह केवल एक वास्तविक साइबर हमले के पहले चरण को दर्शाता है। Zhipu खुद साइबर जिम को तीन प्रकाशित सुरक्षा मेट्रिक्स के सबसे संकीर्ण कॉल करता है। अन्य दो परीक्षणों, ExploitBench और ExploitGym, यह दर्शाता है कि पूर्ण "find → शोषण" चक्र के साथ, चीजें जीएलएम-5.3 के लिए इतनी रूसी नहीं हैं। इसके अलावा, साइबर जिम पर अंतर सिर्फ 0.7 प्रतिशत अंक है - एक एकल रन (पास @ 1,507 कार्यों पर 1) दिया गया और कोई भिन्नता की सूचना नहीं दी गई, यह अंतर सांख्यिकीय रूप से महत्वपूर्ण होने की संभावना नहीं है। यह परिणाम श्रेष्ठता को साबित नहीं करता है; यह केवल इंगित करता है कि मॉडल मोटे तौर पर एक विशिष्ट संकीर्ण कार्य में बराबर होते हैं।
ExploitBench and ExploitGym: मामलों की वास्तविक स्थिति
चलो ExploitBench के साथ शुरू करते हैं। यहां GLM-5.3 स्कोर 54.4%, जो इसके पूर्ववर्ती प्राप्त (24.4%) के दोगुना है। विकास प्रभावशाली है, लेकिन यह प्रतियोगियों से कम हो जाता है: एंथ्रोपिक मैथोस 5 स्कोर 78.0%, और OpenAI GPT-5.6 सोल स्कोर 76.5%। ExploitGym पर गतिशीलता और भी अधिक बता रही है। दो घंटे में, GLM-5.3 105 कार्यों को पूरा करता है; छह घंटे में, 130। Mythos 5 क्रमशः उसी टाइमफ्रेम में 181 और 247 कार्यों को हल करता है। अंतर कई है। Zhipu खुद नोट: आगे "vulnerability खोज → शोषण" श्रृंखला के साथ, अधिक से अधिक मॉडल के अंतराल। दूसरे शब्दों में, यदि साइबर जिम एकमात्र ऐसा बिंदु है जहां जीएलएम-5.3 अपना खुद का रखता है, तो जैसे ही कार्य अधिक जटिल हो जाता है, मॉडल अधिक से अधिक ध्यानपूर्वक खो देता है।

कोडिंग: मिश्रित परिणाम और विषम तुलना
चूंकि मॉडल डेवलपर्स के लिए एक उपकरण के रूप में स्थित है, इसलिए कोडिंग बेंचमार्क पर मजबूत परिणामों की उम्मीद करना उचित है। वास्तव में, चीजें मिश्रित होती हैं। मुख्य तालिका में, Zhipu एन्थ्रोपिक ओपस 4.8 के साथ GLM-5.3 की तुलना करता है - और यह कुछ परीक्षणों पर जीतता है और दूसरों पर हार जाता है। प्रदर्शन चार्ट में, एक अलग मॉडल को प्रतिद्वंद्वी के रूप में सूचीबद्ध किया गया है - क्लाउड फेबल 5 - और Zhipu के आंतरिक परीक्षण पर, नए निशान पीछे। यह दृष्टिकोण - विभिन्न वर्गों में विभिन्न मॉडलों के खिलाफ तुलना - पूर्ण तस्वीर देखना असंभव बनाता है। इसके अलावा, GLM-5.3 का मूल्यांकन एंथ्रोपिक एजेंट के अंदर चलाया गया था, अर्थात् क्लाउड कोड 2.1.207। इसका मतलब है कि हम एक स्टैंडअलोन मॉडल के परिणाम नहीं देख रहे हैं, लेकिन एक "मॉडल + पर्यावरण" संयोजन, जो अंतिम मीट्रिक को भी प्रभावित करता है।
मेथोलॉजिकल गुफाएं और अपनी खुद की कमजोरियों को स्वीकार करना
Zhipu अपनी रिपोर्ट में एक उत्सुक टिप्पणी बनाता है: इसकी साइबर सुरक्षा क्षमता "सबसे तेजी से बढ़ रही है, जहां यह सबसे अधिक अंतराल है। यह एक ईमानदार प्रवेश है कि तुलना के लिए बेसलाइन वर्तमान में कमजोर है और प्रगति कम बिंदु से शुरू हो रही है। उसी समय, तुलना पद्धति प्रश्नों को बढ़ाती है। रिपोर्ट के विभिन्न अनुभाग अलग-अलग एंथ्रोपिक मॉडलों का उपयोग करते हैं - एंथ्रोपिक ओपस 4.8, क्लाउड फेबल 5 और एंथ्रोपिक मैथोस 5. एक प्रतिद्वंद्वी का चयन "एक विशिष्ट परीक्षण फिट" एक विकृत छाप बना सकता है। इसके अलावा, ExploitGym के लिए समय बजट को कृत्रिम विश्लेषण से थ्रूपुट के आधार पर सामान्यीकृत किया जाता है; रूपांतरण गुणांक Kimi K3 और Qwen3.8 मैक्स के लिए दिए गए हैं, लेकिन Mythos 5 के लिए नहीं। इन गुणांकों के बिना प्रतियोगी परिणाम पूरी तरह से तुलनीय नहीं हो सकते हैं। फिर भी, Zhipu सही कदम उठा रहा है: GLM-5.3 का वजन प्रकाशित किया जाएगा, जबकि एन्थ्रोपिक का तुलनीय काम प्रतिबंधित पहुंच के तहत रहता है। यह स्वतंत्र शोधकर्ताओं को दावा संख्याओं को सत्यापित करने का मौका देता है।
2,436 vulnerability: संख्या जो संदर्भ की आवश्यकता है
रिपोर्ट में चीनी सुरक्षा टीमों के साथ संयुक्त कार्य का विवरण भी दिया गया है। मॉडल ने वास्तविक ओपन-सोर्स परियोजनाओं का विश्लेषण किया और अंततः 269 भंडारों में 2,436 vulnerability पाया। ये पहले से ही फ़िल्टर्ड और डिडुप्लिकेटेड परिणाम हैं जो विशेषज्ञ समीक्षा से गुजर चुके हैं। गंभीरता वितरण इस तरह दिखता है:
- महत्वपूर्ण: 107;
- उच्च: 990;
- मध्यम: 1,286;
- कम: 53।
प्रभावशाली, लेकिन वहाँ एक nuance है। उसी रिलीज में सारांश पैनल 1,097 "क्रिटिकल एंड हाई" निष्कर्षों को सूचीबद्ध करता है - जो वास्तव में 107 और 990 का योग है। हालांकि, रिपोर्ट पाठ इन 1,097 को "मध्यम-उच्च" के रूप में वर्णित करता है। कुछ समाचार आउटलेटों ने स्पष्ट रूप से विसंगति की बात किए बिना दूसरे संस्करण की प्रतिलिपि बनाई। इस घटना से पता चलता है कि रिपोर्ट को एक साथ जल्दी में रखा गया था। एक और उत्सुक तथ्य: सबसे पुराना भेद्यता 1981 तक वापस आई, और निष्कर्षों की औसत आयु 26.6 वर्ष है। दूसरे शब्दों में, मॉडल लंबे समय से ज्ञात मुद्दों को खोजने में उत्कृष्टता प्राप्त करता है, लेकिन ताजा कमजोरियों का पता लगाने में इसकी सफलता है बहुत कम स्पष्ट।

निष्कर्ष
GLM-5.3 घोषणा कैसे विपणन और वास्तविकता विचलन की एक कहानी है। एक संकीर्ण बेंचमार्क पर, मॉडल शीर्ष पर आया था, लेकिन अधिक व्यापक परीक्षण हमें पृथ्वी पर वापस लाते हैं: साइबर सुरक्षा और कोडिंग दोनों में नेताओं के पीछे एक गंभीर अंतर है। उसी समय, Zhipu अपनी खुलेपन के लिए सम्मान प्रदान करता है: यह मॉडल के कमजोर बिंदुओं के बारे में वजन और डेटा दोनों को प्रकाशित करता है। पिछले संस्करण में स्पष्ट महत्वपूर्ण प्रगति है, जो भविष्य को सतर्क आशावाद के साथ देखना संभव बनाता है। लेकिन जीएलएम-5.3 को एक एकल रन से एक एकल नंबर पर आधारित एक सुरक्षा नेता को कॉल करना एक ओवरस्टेटमेंट होगा।



