أعلنت المختبر الصيني Zhipu (Z.ai) عن GLM-5.3 في 14 أغسطس، ووصفتها بأنها أقوى نموذج مفتوح المصدر للبرمجة، مدعية تحسنًا بنسبة 50% مقارنةً بـ GLM-5.2 في تقييمها الداخلي العملي لكتابة الشيفرة.

الرقم الأبرز

يرتفع Terminal Bench 3.0 من 4.6 إلى 28.3 — قفزة بستة أضعاف على المعيار الذي يقيس ما إذا كان النموذج قادرًا فعليًا على تشغيل shell خلال مهمة طويلة. وقد شكّلت أعمال الوكلاء على الطرفية أوسع فجوة بين النماذج الصينية مفتوحة الأوزان والأنظمة الغربية الرائدة، وتقول Zhipu إنها أغلقت معظمها في إصدار واحد.

بقية النتائج

يرتفع DeepSWE v1.1 إلى 66.9 من 46.2؛ وAgents' Last Exam إلى 28.5 من 23.8؛ وAutomationBench إلى 48.2 من 26.2. وعلى Z.ai Code Bench عند إعداد High، يسجل النموذج دقة تبلغ 31.4% مع استهلاك نحو 50,000 رمز لكل مهمة — وهي كلفة يغفل عنها معظم المزودين، وتستحق أن تُقرأ إلى جانب الدقة.

أعد قراءة الرسم نفسه

تضع مقارنة Zhipu الخاصة GLM-5.3 خلف GPT-5.6 Sol وFable 5 في المعايير الستة التي نشرتها — إذ يسجل Terminal Bench 28.3 مقابل 34.6 و33.7. وعلى DeepSWE يأتي أيضًا أقل قليلًا من Kimi K3 عند 67.5. والادعاء هو "الأقوى مفتوح المصدر"، لكن في أحد معاييره الستة نفسها يبقى هذا موضع نزاع.

لا تشغيلًا جديدًا للتدريب المسبق

تقول Zhipu إن GLM-5.3 يستخدم نموذج الأساس نفسه المستخدم في GLM-5.2، وإن المكاسب جاءت بالكامل من توسيع ما بعد التدريب. وهذا هو الادعاء نفسه الذي قدمته xAI بشأن Grok 4.6 قبل يومين، ويقود إلى النتيجة نفسها: الجزء المكلف من عمر النموذج هو على نحو متزايد ما يحدث بعد انتهاء التدريب المسبق.

ما لا يمكن التحقق منه بعد

كل الأرقام هنا صادرة عن الشركة نفسها، ولم تُنشر الأوزان بعد. وتقول Zhipu إنها ستطرحها بعد نحو أسبوعين، عقب تقييم السلامة والتقوية، مع إتاحة الوصول عبر API بعد ذلك بقليل؛ وما زالت منظمة الشركة على Hugging Face تُدرج GLM-5.2 بوصفها أحدث إصدار لها. وحتى وصول الأوزان، فإن وصف "أقوى نموذج برمجي مفتوح المصدر" يظل ادعاءً بشأن نموذج لا يستطيع تشغيله خارج Zhipu أحد.