中国实验室 Zhipu(Z.ai)于 8月14日发布 GLM-5.3,称其为最强开源编程模型,并宣称其内部实操编码评测成绩较 GLM-5.2 提升了 50%。
最引人注目的数字
Terminal Bench 3.0 从 4.6 提升到 28.3——这一衡量模型能否在长任务中真正操作 shell 的基准实现了六倍跃升。具备智能体能力的终端工作,一直是中国开权重模型与西方前沿系统之间最大的差距,而 Zhipu 声称在一次发布中已弥合其中大部分差距。
其余成绩
DeepSWE v1.1 从 46.2 升至 66.9;Agents' Last Exam 从 23.8 升至 28.5;AutomationBench 从 26.2 升至 48.2。在 Z.ai Code Bench 的 High 设定下,该模型报告准确率为 31.4%,而每个任务大约消耗 50,000 个 token——这是多数厂商会省略的成本数字,值得与准确率一并看待。
再看一遍同一张图表
Zhipu 自己的对比显示,GLM-5.3 在其公布的全部六项基准上都落后于 GPT-5.6 Sol 和 Fable 5——Terminal Bench 上 28.3 对 34.6 和 33.7。在 DeepSWE 上,它也仅略低于 Kimi K3 的 67.5。该公司宣称它是“最强开源”模型,但在其自己公布的六项基准中的一项上,这一说法也存在争议。
没有新的预训练
Zhipu 表示,GLM-5.3 使用与 GLM-5.2 相同的基础模型,所有提升完全来自后训练规模扩大。这与 xAI 两天前对 Grok 4.6 的说法一致,也指向同一个结论:模型生命周期中越来越昂贵的部分,正在从预训练结束之后开始。
目前尚无法验证的内容
这里的每一个数字都来自自报,且权重尚未公开。Zhipu 说,权重将在大约 两周后发布,前提是先完成安全评估和加固;随后不久会开放 API;该公司的 Hugging Face 组织页面目前仍将 GLM-5.2 列为最新发布。直到权重落地之前,“最强开源编程模型”只是一个外部无法运行、只能听其自述的模型声明。
