Meta 于 9 月 2 日通过 Muse Code 和 Meta Model API 发布了 Muse Spark 1.3。几个小时内,这款模型就被拿来与前沿水平对比,而根据 Meta 自己的发布文章,这一得分属于一个目前 Meta 之外任何人都无法运行的配置。
这句话推翻了排行榜
Meta 的文章表述得很直白:Muse Spark 1.3 “今天开始在 Muse Code 和 Meta Model API 中推出”,并且 “此前可用的推理模式今天已可使用,最大推理模式将在我们完成额外安全测试后不久推出。” 最高推理设置并不是文档更新滞后,也不是分阶段的地区上线。它明确受制于尚未完成的安全工作,而这款模型的其他部分已对外开放。
为何这一区别会改变排名
推理模式选择是现代模型基准排名中最重要的单一杠杆,也是成本上的最大杠杆。由最高推理模式得出的分数,与由下一档模式得出的分数,并不是同一产品的两个测量值;它们衡量的是两个不同价位,只有其中一个今天可以买到。将 Muse Spark 1.3 与竞争对手放在较高分数上比较的表格,实际上是在拿一个已发布的竞争者与一个尚未发布的配置作对比。
常见说法错在哪里
这次发布被写成了“Meta 推出了前沿级模型”。但 Meta वास्तव上发布的是处于已可用推理档位的模型,以及稍后发布最高档位的承诺。这个差别并非吹毛求疵:这次发布之所以被视为具有竞争力,全部理由都依赖于那个并未实际推出的部分所对应的数字。第二点需要纠正的是:这是一场 API 和产品发布,而不是开放权重发布,无论围绕 Meta 开源立场的相关报道暗示了什么。
这反映了什么趋势
在发布更强配置供进一步安全测试的同时公布其评估结果,正成为多家实验室中一种可辨识的发布模式。这样做可以让排行榜反映上限,而实际出货的产品则停留在更低位置,也把责任推给读者,让他们注意哪个数字对应他们实际上能调用的内容。Meta 在文章中自己披露了这种拆分,而外界围绕它的汇总报道并没有保留这一点。
