Anthropic 于 9 月 1 日发布了 Claude Fable 5.1 和 Mythos 5.1,外界广泛传播的数字是“便宜约 25%”。但公告中的定价表给出的信息更为具体:每百万输入 token 10 美元、每百万输出 token 50 美元,两者都与 Fable 5 保持不变。真正变化的是 缓存读取,价格下调 75%,降至每百万 0.25 美元。
常见解读错在哪里
只体现在缓存读取上的折扣,只会出现在确实复用了缓存前缀的工作负载中。一次性调用如果没有命中缓存,成本与上周完全相同。面向 agentic 工作负载所引用的 “最高约 45%” 数字是最佳情况,而非典型情况;之所以最佳,正是因为长时间运行的 agent 会反复重新读取同一上下文。这不是智力价格下降,而是重复劳动变便宜了。
两个名字,一个模型
报道中被简化的第二点是,Fable 5.1 和 Mythos 5.1 本质上是同一个底层模型,只是安全防护级别不同,其中 Mythos 仅向美国实体和受信任访问项目开放。在 Terminal-Bench 4.0 上,这两者分别拿到 55.8% 和 60.9%,而 Mythos 5 为 42.0%,Opus 5 为 52.3%,GPT-5.6 Sol 为 37.3%。若正确解读,二者之间 5.1 个百分点的差距根本不是能力差异——而是同一组权重在更少拒答情况下的表现。这是少数几个公开给安全层定价的数据之一。
那个没人引用误差范围的基准
旗舰结果是 Terminal-Bench-Science 0.1,其中 Fable 5.1 达到 52.6%,对比 Fable 5 的 24.7%、Opus 5 的 29.0% 和 GPT-5.6 Sol 的 22.4%。Anthropic 在旁边标注的误差范围是 每个模型 ±3.5 到 4.5 个百分点。其他结果包括:GDPval-AA v2 为 1853(Fable 5:1723)、OSWorld 2.0 的部分分数为 77.9%、严格分数为 41.7%、Humanity's Last Exam 在无工具情况下为 60.9%,AutomationBench 为 31.4%。
更少干预,以及更窄的网络安全规则
Anthropic 表示,生物安全防护现在在良性请求上的触发频率 降低 85%,网络安全防护每个会话的干预次数则 减少约 60%。政策边界也随之调整:Fable 5.1 可以用于发现漏洞,但不能用于开发相应的利用程序。
