Il laboratorio cinese Zhipu (Z.ai) ha annunciato GLM-5.3 il 14 agosto, descrivendolo come il più forte modello open source per la programmazione e rivendicando un miglioramento del 50% rispetto a GLM-5.2 nella propria valutazione interna di coding pratico.

Il dato che spicca

Terminal Bench 3.0 passa da 4,6 a 28,3 — un aumento di sei volte nel benchmark che misura se un modello riesce davvero a operare una shell durante un’attività lunga. Il lavoro agentico da terminale è stato il divario più ampio tra i modelli open-weight cinesi e i sistemi frontier occidentali, e Zhipu sostiene di averne chiuso gran parte in una sola release.

Il resto della scheda

DeepSWE v1.1 sale a 66,9 da 46,2; Agents' Last Exam a 28,5 da 23,8; AutomationBench a 48,2 da 26,2. Su Z.ai Code Bench, con impostazione High, il modello dichiara un’accuratezza del 31,4% spendendo circa 50.000 token per attività — una misura di costo che la maggior parte dei vendor omette, e che vale la pena leggere insieme all’accuratezza.

Riguardate lo stesso grafico

Il confronto della stessa Zhipu colloca GLM-5.3 dietro GPT-5.6 Sol e Fable 5 in tutti e sei i benchmark pubblicati — Terminal Bench 28,3 contro 34,6 e 33,7. Su DeepSWE si ferma anche appena sotto Kimi K3 a 67,5. La rivendicazione è quella di “più forte open source”, e su uno dei suoi sei benchmark la stessa affermazione è contestata.

Nessun nuovo pretraining run

Zhipu afferma che GLM-5.3 utilizza il medesimo base model di GLM-5.2 e che i guadagni derivano interamente dallo scaling del post-training. È la stessa rivendicazione fatta da xAI per Grok 4.6 due giorni prima, e porta alla stessa conclusione: la parte costosa della vita di un modello è sempre più ciò che accade dopo la fine del pretraining.

Ciò che non è ancora verificabile

Tutti i numeri qui sono auto-riportati, e i pesi non sono stati pubblicati. Zhipu afferma che arriveranno tra circa due settimane, dopo la valutazione della sicurezza e il rafforzamento, con accesso API poco dopo; l’organizzazione Hugging Face dell’azienda indica ancora GLM-5.2 come ultima release. Finché i pesi non saranno disponibili, “il più forte modello open source per coding” resta una rivendicazione su un modello che nessuno fuori da Zhipu può eseguire.