Le laboratoire chinois Zhipu (Z.ai) a annoncé GLM-5.3 le 14 août, le présentant comme le meilleur modèle open source pour la programmation et revendiquant une amélioration de 50% par rapport à GLM-5.2 dans son évaluation interne de codage pratique.

Le chiffre qui ressort

Terminal Bench 3.0 passe de 4,6 à 28,3 — une progression par six sur le benchmark qui mesure la capacité réelle d’un modèle à utiliser un shell sur une tâche longue. Le travail agentique en terminal a constitué l’écart le plus large entre les modèles chinois à poids ouverts et les systèmes de pointe occidentaux, et Zhipu affirme en avoir comblé l’essentiel en une seule version.

Le reste du tableau

DeepSWE v1.1 progresse à 66,9 contre 46,2 ; Agents' Last Exam à 28,5 contre 23,8 ; AutomationBench à 48,2 contre 26,2. Sur Z.ai Code Bench, en réglage High, le modèle affiche une précision de 31,4% tout en consommant environ 50 000 tokens par tâche — un coût que la plupart des fournisseurs omettent, et qu’il vaut la peine de lire en regard de la précision.

Relire le même graphique

La propre comparaison de Zhipu place GLM-5.3 derrière GPT-5.6 Sol et Fable 5 sur les six benchmarks publiés — Terminal Bench à 28,3 contre 34,6 et 33,7. Sur DeepSWE, il reste aussi juste sous Kimi K3 à 67,5. La revendication est celle du « meilleur open source », et sur l’un de ses six benchmarks, même cela est contesté.

Aucune nouvelle phase de pré-entraînement

Zhipu indique que GLM-5.3 utilise le même modèle de base que GLM-5.2 et que les gains proviennent entièrement de la mise à l’échelle de l’après-entraînement. C’est la même affirmation faite par xAI pour Grok 4.6 deux jours plus tôt, et cela pointe vers la même conclusion : la partie la plus coûteuse de la vie d’un modèle est de plus en plus ce qui se passe après la fin du pré-entraînement.

Ce qui reste pour l’instant invérifiable

Tous les chiffres ici sont auto-déclarés, et les poids ne sont pas publiés. Zhipu indique qu’ils suivront dans environ deux semaines, après une évaluation de sécurité et un durcissement, avec un accès API peu après ; l’organisation Hugging Face de l’entreprise affiche toujours GLM-5.2 comme sa dernière sortie. Tant que les poids ne sont pas disponibles, « meilleur modèle open source de codage » est une affirmation concernant un modèle que personne en dehors de Zhipu ne peut exécuter.