Z.ai 于 8 月 26 日在 Hugging Face 发布了 GLM-5.3-Flash 的权重,采用 MIT 许可证。在公开之前,这款模型曾以匿名 stealth endpoint 的形式流传。模型卡中的三个细节,改变了外界对这次发布的解读。
“Flash” 竟有 3200 亿参数
模型卡给出的数据是 总参数 3200 亿,每个 token 激活参数 180 亿。按照其他厂商的命名惯例,Flash、Mini、Turbo 和 Lite 通常都指小模型。而这里的含义是稀疏模型:一种 mixture-of-experts 设计,在任意给定的 token 上,3200 亿参数中只有 180 亿参与运算。推理成本曲线看起来像 180 亿参数模型,但托管所需的内存占用并不是如此。若有人把“Flash”理解成“可在普通硬件上运行”,那就完全误读了——要提供服务,内存里必须能容纳全部 3200 亿参数。
常见表述忽略了什么
被广泛引用的说法是,这款模型“在各项基准和真实工作负载上都优于 GLM-5.2,且 价格低十分之一。”关键要看这句话的比较对象。这里比较的是 GLM-5.2——Z.ai 自己的上一代发布——而不是任何其他实验室的前沿模型。与自家前一代相比,价格降低 10 倍,说明的是推理栈的改进,而不是相对于竞争对手的地位。如今人们反复转述时,仿佛这意味着它的价格只有前沿模型的十分之一,但模型卡并没有在任何地方这样宣称。
评测由谁完成,以及在什么条件下完成
公布的分数分别是 Terminal-Bench 2.1 的 84.3、Deep-SWE 的 63.4,以及在全量工具集上 HLE 的 55.3。这些条件都有披露,而且相当宽松。Terminal-Bench 2.1 在 temperature 1.0、max_new_tokens 为 65,536、以及 6 小时时限下运行。Deep-SWE 使用了 6 小时时限和 40 万 token 上下文。HLE 允许的最大生成长度为 163,840 token。这些都是在自选测试框架下自行报告的数据,这很常见,也正是不同实验室的智能体基准分数很少能直接横向比较的原因。
MIT 许可证意味着什么
这次发布中,许可证部分是最明确无误的。MIT 不附带用途限制、可接受使用政策,也没有超过某一营收门槛后条款变化的要求,更没有必须公开衍生作品的义务。与大多数同等规模的开源权重模型所附带的社区许可证相比,这在实质上要宽松得多。对于一款总参数 3200 亿、评测上下文达到 30 万 token 的模型来说,这种组合——接近前沿规模、且条款完全宽松——才是真正的新闻,而不是价格标题所强调的重点。
