Anthropic 于 6 月 30 日发布 Claude Sonnet 5,称其为公司迄今打造的最具 agentic 能力的中端模型,并从上线首日开始将其设为 Claude.ai 上 Free 和 Pro 用户的默认模型。公司表示,这款模型可以进行规划,使用浏览器和终端等工具,并自主执行多步骤任务——这类工作直到最近仍主要由更大型的 Opus 级系统承担。
以 Sonnet 的价格提供 Opus 级能力
基准测试成绩支撑了这一说法。Sonnet 5 在 SWE-bench Pro 上得分 63.2%,而旗舰产品 Opus 4.8 为 69.2%;在 OSWorld-Verified 电脑使用测试中得分 81.2%,Opus 为 83.4%。在 Terminal-Bench 2.1 上,它得分 80.4%,领先于 Opus 4.8 的 74.6%,在 BrowseComp agentic 搜索基准上则达到 84.7%。这一趋势很一致:在各项 agentic 任务中,Sonnet 5 的表现都与一款成本高得多的模型相差不多。
定价也反映了这种差距。Anthropic 将截至 8 月 31 日的试行价格定为 每百万输入 token 2 美元、每百万输出 token 10 美元,之后将上调至 3 美元和 15 美元。即便在多项测试中已接近 Opus 级能力,Sonnet 5 的价格仍明显低于 Opus 级别。
并不平稳的第一周
这次上线并非毫无摩擦。开发者报告称,Sonnet 5 的 tokenizer 对于同样的文本生成的 token 数量是其前代的 1.0 到 1.35 倍,这意味着实际每项任务成本可能高于按单个 token 标示的价格。Anthropic 还移除了 temperature 及其他采样参数,这导致一些在代码中硬编码这些参数的现有集成失效。
公司承认,其此前对 BrowseComp 基准的测量方式存在错误,并改用 1000 万 token 预算方法重新发布了图表。公司还部署了一个新的安全分类器,旨在针对一种特定的 jailbreak 技术;Anthropic 表示,该方法被阻止的概率超过 99%,但代价是对合法的安全编码查询产生更多误判,其中一些现在会被转交至 Opus 4.8。
Anthropic 为何押注中端层级
Anthropic 的战略在于,让足够能干的 agent 变得足够便宜,从而能够规模化运行。通过将 Opus 级别的自主能力下放到 Sonnet 价格带,公司瞄准的是那些希望在生产环境中部署 agent、但又不愿承担旗舰型号成本的开发者。早期围绕 tokenizer 和 API 的投诉也表明,对于那些在上线首日就把模型接入实时系统的数千个团队来说,快速推进往往伴随着取舍。