Anthropic 于周五发布 Claude Opus 5,其核心卖点几乎就是一笔算术题。该模型在一项重要编程基准上的表现与公司自家的前沿系统 Claude Fable 5 相差不到 0.5%,而且 每项任务成本减半,定价也与前代完全一致。输入价格保持在每百万 token 5 美元,输出为 25 美元,与 Opus 4.8 相同;Fable 5 的标价则分别为 10 美元和 50 美元。Opus 5 成为 Claude Max 的默认模型,也是 Claude Pro 可用的最强选项。
基准测试表明了什么
在 Anthropic 的软件工程评测 Frontier-Bench v0.1 上,Opus 5 在所有其他模型中居首,并且以更低的每项任务成本 得分超过 Opus 4.8 的两倍。在 CursorBench 3.2 的最高投入设置下,它以仅为 Fable 5 峰值得分 0.5% 的差距,达到每项任务成本减半的表现,并在 high、xhigh 和 max 投入设置下,以性能/美元比击败所有其他模型。



在代码之外,这一模式也依然成立:
- ARC-AGI 3,要求解决新问题:Opus 5 的得分是次优模型的 3 倍。
- Zapier AutomationBench,衡量模型能否端到端完成一项业务任务:在相同每项任务成本下,完成率约为次优模型的 1.5 倍——而且即便在其 最低投入设置下,Opus 5 完成的任务数也超过任何其他模型。
- OSWorld 2.0,一项计算机使用基准:它以仅为 略高于三分之一的成本击败 Fable 5 的最佳结果,并在任何给定价格点上领先所有模型。



Anthropic 还声称,它在 AA Coding Agent Index、GDPval-AA v2、HLE、AutomationBench 和 DeepSearchQA 上也获得最佳且最具成本效率的结果。它公开承认的唯一落后之处是网络安全,在这一领域,Mythos 5——通过 Project Glasswing 提供的仅限受邀访问模型——仍然领先。



标题图表下的细则
Frontier-Bench 投入曲线下方的脚注值得一读。那些数字来自在 mini-SWE-agent 框架和 GKE 后端上进行的一次 内部运行,评分方式为 每项任务五次尝试的平均奖励。而且,只要安全分类器在该次运行中拒绝了请求——无论是在 Opus 5 还是 Fable 5 上——都用 Opus 4.8 作为回退模型替代,因此图中的曲线并不严格属于单一模型结果。
完整成绩单——包括它输掉的地方
Anthropic 自己的对比表是这次发布中最有用的单一材料,因为在这里 Opus 5 停止了胜利。它在 14 个项目中领先 9 个——但 Fable 5 仍拿下不带工具版 Humanity's Last Exam、FrontierCode 编程拆分和法律基准;OpenAI 的 GPT-5.6 Sol 在一项代理式编程评测中直接夺魁;而 Anthropic 仅限受邀访问的 Mythos 5 则保住了健康领域。以下每个数字都来自 Anthropic 自身,并且均为各模型在最佳投入设置下的结果:

有两点从这张表里一眼可见,而正文对此一笔带过。 在 DeepSWE v1.1 这项编程基准中,GPT-5.6 Sol 的 72.7% 超过了所有 Claude 模型,包括 Opus 5。而且 Opus 5 的标题式胜利在各类别中并不均衡:它在 ARC-AGI-3 上以 30.2% 对 7.8% 的成绩把全场甩开不止一倍,在 AutomationBench 上以 26.0% 对 18.1% 的成绩领先 9 个百分点,但在编程分项中,整个阵列都只相差大约一个百分点。
Anthropic 说其他模型都没完成的三项任务
Anthropic 论证中更强的一部分不是分数,而是持续性。来自其评测和早期接入测试中的三个例子:
- 给它一张机器零件的草图,并要求把它重建为一个 3D FreeCAD 模型——而且无法直接查看这张草图——Opus 5 编写了 自己的计算机视觉流水线,从原始像素中提取几何信息,然后重建了完整零件。它这样做了不止一次。Anthropic 表示,在相同设置下,没有任何竞争模型在五次尝试中解决这一任务。
- 面对一个流行 开源包管理器中的真实漏洞,它找到了根因,并修复了社区自己的补丁遗漏的一个边缘情况。另一个竞争模型只修复了表面症状,然后报告漏洞已解决。
- 一家交易公司的工程师用它在 单次会话中为一家新交易所构建市场数据馈送——这是此前模型即便在获得详尽方案的情况下也完全无法完成的工作。由于找不到可用于验证的实时数据流,模型 自行搭建了测试框架,以检查其代码是否正确解析了该交易所的数据。
早期客户实际衡量了什么
Anthropic 发布了 22 条来自早期接入客户的证言,其中相当多都带有硬数字:
- Box 首席技术官 Ben Kus:Opus 5 在整体上比 Opus 4.8 高出 8%,在数据分析上提升 11%,在尽职调查上提升 17%。
- Lovable 联合创始人 Fabian Hedin:在公司最难的代理式编程任务上,比 Opus 4.7 提升 22%,而且“更稳定,运行之间的波动小得多”。
- Zapier 首席执行官 Wade Foster:Opus 5 在 AutomationBench 上夺冠,“而且没有比此前的 Claude 模型消耗更多 token。”在一条此前模型完全失败的客户流失预防工作流上,它 达到了 100%。
- 一家法律 AI 团队报告称,在较低推理级别下质量相当,同时生成的 token 比 Opus 4.8 在最高推理下 少 26%。一家金融评测负责人测得准确率高出 9 个百分点,同时回合数和工具调用数减少了 三分之一,耗时减少 60%。一项交易基准记录到其有史以来最佳的 Opus 结果,所用推理 token 约为此前的 七分之一,延迟不足 Opus 4.8 的一半。
- Cognition 首席执行官 Scott Wu 说,在 Devin 中它“以半价接近 Fable 级别表现”,尤其擅长调试和根因分析。Vercel 首席技术官 Madhav Jha 称其为“自 4.5 以来 Opus 家族最大的飞跃”。
一份报告预示了代理式编程的发展方向:一支前端基准团队称,该模型会在浏览器中以 桌面和手机宽度 打开自己的页面,发现一个被隐藏在移动端折叠线以下的产品和一个屏幕外的结账按钮,并在交回工作前把两者都修复了。
化学、蛋白质和风洞
Opus 5 在 Anthropic 的 所有内部生命科学评测中都优于 Opus 4.8,这些评测涵盖结构生物学、有机化学和生物信息学。最大的提升出现在有机化学任务上,诸如根据光谱数据推断分子结构,提升 10.2 个百分点;在蛋白质相关任务上,诸如预测序列变化如何影响功能,提升 7.7 个百分点。Anthropic 还展示了更强的视觉输出,包括该模型构建的一个交互式风洞模拟,用于可视化空气流过气动——以及故意非气动——物体时的流动。
Anthropic 审核过的最对齐模型
在公司的自动化行为审计中,Opus 5 的 总体不对齐行为得分为 2.3,是其近期模型中最低的。Anthropic 表示,它对 Claude's Constitution 的遵循程度优于 Opus 4.8、Sonnet 5 或 Fable 5,表现出最低的欺骗行为率,最不容易被诱导滥用,也是迄今在避免带有难以逆转副作用的鲁莽行动方面最安全的模型。
擅长发现漏洞,但在利用漏洞方面受限
Anthropic 表示,Opus 5 并未推动高风险双重用途能力的前沿,而且在与私营部门和政府合作伙伴共同进行的评测中,它在生物研究和进攻性网络安全两方面仍落后于 Mythos 5。与 Opus 4.8 一样,公司称其 有意没有用网络安全任务训练 Opus 5——而该模型仍然在这些方面有所提升,只是作为其整体能力增强的副产品。如今,它在 发现 软件漏洞方面已接近 Mythos 5。
它保留的差距在这条链路的后半段。在 OSS-Fuzz 上,这是一项评估模型能否发现漏洞并在缺少大量人工指导的情况下加以利用的内部测试,Opus 5 在识别方面与 Mythos 5 持平,但在 漏洞利用开发 上仍然远远落后——而这一步才会把一个 bug 转化为实际的网络安全威胁。
这些防护措施究竟如何运作
Opus 5 的网络安全分类器允许 源代码中的漏洞发现,但会拦截 基于二进制文件的漏洞扫描——Anthropic 将其与恶意行为者更相关联——以及渗透测试和漏洞利用生成。根据其自身测试,公司预计这些分类器触发干预的频率会比 Fable 5 低约 85%。在 Claude.ai、Claude Code 和 Claude Cowork 中,被标记的请求会 默认回退到 Opus 4.8,API 上也可以启用同样的回退。已经在 Anthropic Cyber Verification Program 中的企业和研究人员可立即获得一个限制更少的版本。
在生物领域,方向则相反。由于 Opus 5 配备的大致是 Opus 4.8 级别的防护套件,而非 Fable 5 的那套,它如今是 Anthropic 对科学研究最有能力的通用可用模型——而在 Fable 5 上会被拦截的生物请求,现在会路由到 Opus 5,而不是 Opus 4.8。公司仍然标记了对长时间自主研究的限制;它认为这一领域风险最高,并表示 Mythos 5 仍然更强。
开发者需要改什么
这并不是一个直接替换模型字符串就能完成的升级。有两项改动会破坏现有集成:
- 自适应思考默认开启。 Opus 4.8 默认不进行思考,除非显式要求;Opus 5 则默认会思考,除非另行指定——而且由于
max_tokens对思考和可见文本合计构成硬上限,现有预算需要重新评估。 - 思考只能在
high或更低投入下禁用。 将thinking: {"type": "disabled"}与xhigh或max结合,如今会返回 400 错误。
除此之外,最小可缓存提示词长度从 1,024 token 降至 512 token,因此此前无法缓存的短提示词现在无需改代码也能缓存。还有两项功能以 beta 形式推出:会话中途工具变更,允许开发者在轮次之间添加或移除工具,而不会使提示词缓存失效(header mid-conversation-tool-changes-2026-07-01);以及 自动回退,将被安全标记的请求重新路由到另一模型,而不是直接返回拒绝(fallbacks: "default",header server-side-fallback-2026-07-01)。
有两项能力不会沿用:web fetch 工具在 Opus 5 上不可用,且不支持 Priority Tier。assistant 消息预填充,以及非默认的 temperature、top_p 或 top_k 值,仍会像在 Opus 4.8 上一样返回 400。Anthropic 还警告称,默认响应会比 Opus 4.8 更长,而降低投入虽然会减少思考,但并不可靠地缩短可见输出——想要简短就直接提示简洁。关于投入级别,它的建议是重新做一轮新的调参,而不是沿用 Opus 4.8 的设置,因为这一代的 low 和 medium 明显更强。
规格表
Opus 5 保持 100 万 token 的上下文窗口和 128k 的最大输出——通过 Batch API 的扩展输出 beta 版本最高可达 300k——并支持全部五档投入级别:low、medium、high(默认)、xhigh 和 max。其训练数据截至 2026 年 5 月,比 Fable 5 的 2026 年 1 月截点新四个月。Fast mode 可在 Claude Platform 上以及 Claude Code 的使用额度中,以约 2.5 倍默认速度运行,基础价格翻倍。在 Claude API 上,开发者可通过 claude-opus-5 调用;它也提供于 Amazon Bedrock、AWS 上的 Claude Platform、Google Cloud 和 Microsoft Foundry。与此前的 Opus 模型一样,通用访问 不要求数据保留。Anthropic 的文档现在也将已弃用的 Claude Opus 4.1 用户——其退役时间为 2026 年 8 月 5 日——指向 Opus 5 作为迁移目标。
