Alibaba a lancé Qwen3.8-Max dans la matinée du 3 août, heure de Pékin, en le positionnant pour le codage et ce que l’entreprise appelle le travail de bureau professionnel « Cowork ». La couverture chinoise de référence situe l’annonce à 11 h 00 heure de Pékin, soit 03:00 UTC.

La spécification

Le modèle est un mélange d’experts totalisant 2,4 billions de paramètres. La couverture en chinois indique un nombre activé de 95 milliards par requête — soit environ quatre pour cent — tandis que les articles en anglais précisent qu’Alibaba n’a pas communiqué cette donnée. Le contexte monte à 1 million de tokens, répartis entre 991K en entrée et 131K en sortie. La tarification est de 2,00 $ par million de tokens en entrée, 6,00 $ en sortie, 0,25 $ en cache.

Le tableau que tout le monde a cité

Alibaba a publié des victoires sur Terminal-Bench 2.1 (86,6), PaperBench (93,0), GPQA Diamond (92,6) et OSWorld-Verified (86,1), ainsi qu’une série de démonstrations d’autonomie : un développement non supervisé de 16 jours produisant 265 commits, 127 pull requests et 151 issues ; une reproduction d’article de 125 heures battant la méthode publiée de 2,71 points sur AIME24 ; une séquence de conception de puces réduisant le nombre de portes de 8 298 à 678 ; et une participation à une compétition en direct finissant devant 458 équipes humaines sur 526 en moins de 24 heures. Chacun de ces résultats provient du fournisseur et aucun n’est reproductible de manière indépendante.

Les lignes qui n’ont pas été citées

Sur l’ingénierie logicielle agentique, le même tableau ressemble à une feuille de défaites. SWE-bench Pro : 67,7 contre 80,0 pour Claude Fable 5. DeepSWE 1.1 : 56,6 contre 70,0. FrontierSWE : 73,5 contre 88,8. Humanity's Last Exam : 43,6 contre 53,3. Même le score phare de Terminal-Bench reste sous les 88,8 de GPT-5.6 Sol. Une partie de la comparaison repose sur NL2Repo-Bench, le benchmark d’Alibaba lui-même, qu’aucun acteur extérieur à l’entreprise ne peut reproduire.

« Ouvert » est une entrée de calendrier

Les arguments de souveraineté et de coût avancés pour ce modèle reposent sur des poids qui ne sont pas publiquement disponibles. Le 3 août, il n’existait aucun dépôt Qwen3.8 sur Hugging Face ; les éléments les plus récents étaient des modèles ASR mis à jour douze jours plus tôt.