فريق Qwen في Alibaba نشر أوزان Qwen3.8-27B في 14 أغسطس، وأتاحها على Hugging Face وModelScope بموجب ترخيص Apache 2.0.

ما هو النموذج

هو نموذج رؤية-لغة كثيف بمعاملات تبلغ 27B — وليس mixture-of-experts — ويغطي النصوص والصور ومقاطع الفيديو متعددة الساعات. وتعتمد بنيته على تصميم هجين عبر 64 طبقة: ست عشرة كتلة من ثلاث طبقات Gated DeltaNet تغذي شبكة، يتبع كل منها كتلة واحدة Gated Attention. ويبلغ السياق الأصلي 262,144 رمزًا، ويمكن توسيعه إلى نحو 1M باستخدام YaRN، كما يمكن إيقاف وضع التفكير.

الادعاء

تقول Qwen إن نموذج 27B يتفوق على Qwen3.7-Plus الأكبر بكثير في البرمجة وأعمال المكاتب. وتعرض بطاقته نتائج SWE-bench Pro 61.7، وTerminal Bench 2.1 73.0، وOSWorld-Verified 84.3، وGPQA Diamond 89.2، وMathVision 94.6 مع code interpreter، وCharXiv 90.2.

اقرأ الترخيص بدقة

Apache 2.0 هنا ترخيص حقيقي: الأوزان قابلة للتنزيل ويمكن استخدامها تجاريًا من دون ترخيص خاص. لكن بيانات التدريب ورمز التدريب ليسا منشورين، لذا فهذا وزن مفتوح open weights وليس مصدرًا مفتوحًا — وهو فارق مهم لكل من يحتاج إلى تدقيق ما تعلّمه النموذج، لا مجرد تشغيله.

واقرأ المؤشرات المعيارية بالطريقة نفسها

كل الأرقام أعلاه أوردتها Alibaba على بطاقة نموذجها نفسها، من دون تحقق مستقل حتى الآن. وغالبًا ما يتقلص الفرق عندما يُخضع طرف ثالث نموذجًا كثيفًا صغيرًا للمقارنة مع شقيق أكبر بكثير، لأن الجهة الموردة تختار كلًا من إطار الاختبار وخط الأساس. وتقول الشركة إن واجهة API الرسمية ستتوفر قريبًا، وإن نسخة مستضافة بسياق 1M ستُطرح على Qwen Cloud.

ما الجديد فعليًا هنا

اسم Qwen 3.8 ليس جديدًا. فقد استُخدم في يوليو مع Qwen3.8-Max المغلق، كما نُشر نموذج mixture-of-experts المفتوح الأوزان الأكبر كثيرًا Qwen3.8-2.4T-A95B قبل يومين. والخبر هنا هو أن الطبقة الصغيرة والكثيفة والقابلة للتشغيل محليًا من هذه العائلة أصبحت متاحة الآن — وهي الطبقة التي يمكن لمعظم الناس فعلًا نشرها.