Z.ai a publié les poids de GLM-5.3-Flash sur Hugging Face le 26 août, sous une licence MIT. Le modèle circulait anonymement comme un endpoint furtif avant sa révélation. Trois éléments de la fiche du modèle changent la manière dont cette sortie doit être lue.

« Flash » compte 320 milliards de paramètres

La fiche indique 320 milliards de paramètres au total, avec 18 milliards actifs par jeton. Dans la convention de nommage de tous les autres éditeurs, Flash, Mini, Turbo et Lite désignent un petit modèle. Ici, cela désigne un modèle sparse : une architecture de type mixture-of-experts où seuls 18 milliards des 320 milliards sont mobilisés pour un jeton donné. Le profil de coût d’inférence ressemble à celui d’un modèle de 18 milliards ; l’empreinte mémoire nécessaire pour l’héberger, non. Quiconque lit « Flash » comme « fonctionne sur du matériel modeste » se trompe : il faut une capacité en mémoire pour l’ensemble des 320 milliards afin de le servir tout court.

Ce que le cadrage courant interprète mal

La formule reprise est que le modèle « surpasse GLM-5.2 sur l’ensemble des benchmarks et des charges de travail réelles à un dixième du prix ». Relisez le sujet de cette phrase. La comparaison porte sur GLM-5.2 — la précédente version de Z.ai — et non sur un modèle de pointe d’un autre laboratoire. Une baisse de coût d’un facteur dix par rapport à sa propre génération précédente dit quelque chose de votre pile d’inférence, pas de votre position face à vos concurrents. Cette phrase est répétée comme si elle signifiait que le modèle coûte un dixième du prix des modèles de pointe, ce que la fiche ne revendique nulle part.

Qui a réalisé les évaluations, et dans quelles conditions

Les scores rapportés sont de 84,3 sur Terminal-Bench 2.1, 63,4 sur Deep-SWE et 55,3 sur HLE avec tools sur l’ensemble complet. Les conditions sont divulguées, et elles sont généreuses. Terminal-Bench 2.1 a été exécuté avec une température de 1,0, un max_new_tokens de 65 536 et un délai d’attente de six heures. Deep-SWE a utilisé un délai d’attente de six heures et un contexte de 400K. HLE autorisait une longueur maximale de génération de 163 840 jetons. Il s’agit de chiffres déclarés par l’entreprise, sous des environnements de test choisis par elle, ce qui est une pratique standard et aussi la raison pour laquelle les scores de benchmarks agentiques provenant de différents laboratoires sont rarement comparables entre eux.

Ce que la licence MIT permet

La licence est la partie de cette publication qui ne prête pas à interprétation. MIT n’impose aucune restriction d’usage, aucune politique d’usage acceptable, aucun seuil de revenus au-delà duquel les conditions changent et aucune obligation de publier des dérivés. C’est nettement plus permissif que les licences communautaires associées à la plupart des sorties open-weight d’une échelle comparable. Pour un modèle de 320 milliards de paramètres avec un contexte évalué de 300 000 jetons, cette combinaison — une échelle proche du frontier, des conditions pleinement permissives — est la véritable information, et ce n’est pas ce à quoi le titre sur le prix attire l’attention.