أطلقت Alibaba Qwen3.8-Max صباح 3 أغسطس بتوقيت بكين، مقدّمةً إياه على أنه مخصص للبرمجة ولما تسميه الشركة العمل المكتبي المهني "Cowork". وتضع التغطية الصينية الرئيسية الإعلان عند 11:00 صباحًا بتوقيت بكين، أو 03:00 UTC.
المواصفات
النموذج من فئة mixture of experts بإجمالي 2.4 تريليون معلمة. وتذكر التغطية باللغة الصينية أن عدد المعلمات المُفعَّلة يبلغ 95 مليارًا لكل طلب — أي نحو أربعة في المئة — بينما تقول الكتابات الإنجليزية إن Alibaba لم تكشفه. ويصل السياق إلى 1 مليون token، موزعة إلى 991K إدخال و131K إخراج. التسعير هو 2.00 دولار لكل مليون token إدخال، و6.00 دولارات للإخراج، و0.25 دولار للمخزَّن مؤقتًا.
الجدول الذي اقتبس منه الجميع
نشرت Alibaba انتصارات على Terminal-Bench 2.1 (86.6)، وPaperBench (93.0)، وGPQA Diamond (92.6)، وOSWorld-Verified (86.1)، إلى جانب سلسلة من عروض الاستقلالية: بناء غير خاضع للإشراف لمدة 16 يومًا أنتج 265 commit و127 pull request و151 issue؛ وإعادة إنتاج ورقة بحثية على مدى 125 ساعة تفوقت على المنهج المنشور بفارق 2.71 نقطة على AIME24؛ وتشغيل في تصميم الشرائح خفّض عدد البوابات من 8,298 إلى 678؛ ومشاركة مباشرة في مسابقة انتهت متقدمة على 458 من أصل 526 فريقًا بشريًا خلال 24 ساعة. وكل واحدة من هذه النتائج صادرة عن الجهة المطوِّرة ولا يمكن التحقق من إعادة إنتاجها بشكل مستقل.
الأسطر التي لم يُقتبس منها
في هندسة البرمجيات الوكالية، يبدو الجدول نفسه كأنه سجل خسائر. SWE-bench Pro: 67.7 مقابل 80.0 لـ Claude Fable 5. وDeepSWE 1.1: 56.6 مقابل 70.0. وFrontierSWE: 73.5 مقابل 88.8. وHumanity's Last Exam: 43.6 مقابل 53.3. وحتى رقم Terminal-Bench الرئيسي يقع دون 88.8 لـ GPT-5.6 Sol. ويجري جزء من المقارنة على NL2Repo-Bench، وهو معيار خاص بـ Alibaba لا يستطيع أحد خارج الشركة إعادة إنتاجه.
"مفتوح" ليس سوى بند في التقويم
تستند حجج السيادة والكلفة المطروحة لهذا النموذج إلى أوزان غير متاحة علنًا. ففي 3 أغسطس لم يكن هناك أي مستودع لـ Qwen3.8 على Hugging Face أصلًا؛ وكانت أحدث العناصر نماذج ASR جرى تحديثها قبل اثني عشر يومًا.
