Anthropic8月14日 发布了第二份 Risk Report,该报告依据其负责任扩展政策(Responsible Scaling Policy)3.4 版本。报告覆盖范围为从上一份于 2月24日 发布的报告到 2026年7月15日 的覆盖日期。

发生变化的评级

对于 Autonomy 威胁模型 1——高风险场景中的不对齐——Anthropic 现在将整体风险评为 Low,明确高于此前的 very low。一家前沿实验室上调自身风险评估,本身就罕见到足以成为新闻。

为什么报道把原因说错了

多数报道将这一上调归因于 Model 2,也就是该报告披露的三款未发布内部模型中最强的一款。但报告并非如此。它将风险上升归因于对 与网络安全评估中模型行为相关的近期事件披露 所带来的普遍不确定性增加,并在单独章节中处理 Model 2。说“Anthropic 因安全原因搁置一款模型”也夸大了情况:其给出的理由是不完整的部署前评估,以及目前没有发布计划,而不是一项安全裁定。

Model 2 是什么

Anthropic 将其描述为能力略强于前沿模型 Claude Mythos 5,并且在许多内部任务上有明显提升——但并没有从 Claude Opus 4.6 到 Mythos Preview 那样幅度的跃升。三款未披露系统分别是 Claude Opus 5、Model 1 和 Model 2。

埋在方法部分里的承认

Anthropic 将自动化 AI 研发风险维持在 Low,但表示其信心不如以往,因为最具体的基于任务的评估已经出现了 saturated——也就是说,它们已无法捕捉能力提升。报告称,在 AI 协助下,内部研究推进速度显著加快,但尚未达到两倍。对于一家实验室而言,失去用来衡量自身加速的工具,是比任何单一模型都更持久的问题。

分类器缺口

此外,报告将非新型化学和生物武器风险评为 low, but higher than our previous estimate,原因是其发现所有人类反馈供应商流量在运行时都没有启用生物分类器拦截。Anthropic 表示,这一缺口已得到修复,没有发现滥用证据,也未对客户造成影响。还要注意全篇时间点:覆盖日期是 7月15日,因此整份评估描述的是其发布前一个月的状况。