Anthropic于2026年7月1日将其Claude Fable 5模型重新面向全球用户开放。此前,美国政府实施出口管制,导致该模型——以及更专用的 Mythos 5——从公开可用状态下架,持续时间接近三周。随着恢复上线,Anthropic还提出了一套拟供行业采用的框架,用于衡量一次 AI “jailbreak”到底有多严重。
暂停如何展开
Fable 5 和 Mythos 5 于6月9日发布。6月12日,美国政府实施出口管制;6月26日,其批准 Mythos 5 面向美国组织开放;6月30日,管制解除;而到7月1日,Fable 5 已在全球重新部署。Anthropic 对两款模型作出区分:Fable 5 面向通用用途并配备强力安全防护,而 Mythos 5 的防护较少,仅用于防御性网络安全工作。
争议核心的越狱事件
上述管制源于Amazon研究人员的一份报告。报告称,Fable 5 在被提示先识别若干软件漏洞后,会生成演示如何利用其中一个漏洞的代码。Anthropic 表示,其自身测试显示,这一弱点并非本模型独有:Claude Opus 4.8、GPT-5.5 和 Kimi K2.7都能识别出相同漏洞,而且所有受测模型都能生成同样的利用演示。该公司称,此后已训练出改进后的安全分类器,可在超过99%的案例中阻止这一特定行为。
为越狱严重程度建立评分框架
为避免类似事件被过度解读,Anthropic 提出应从四个标准来评判一次越狱:能力增量(它让用户超出既有工具多远)、覆盖面(同一技术解锁了多少种不同的攻击任务)、武器化难度(将其转化为真实攻击需要多少人为努力)以及可发现性(他人获取该技术有多容易)。公司称,这一方法由其与 Amazon、Microsoft、Google 及其他合作伙伴,以及美国商务部下属的人工智能标准与创新中心(CAISI)共同开发。
与政府的联系更紧密
此次恢复还伴随着新的政府合作承诺:在前沿模型发布前提供访问和评估、就安全防护更快共享信息、为联合研究投入专门资源,并推动形成统一的行业安全标准。Fable 5 现已重新在 Claude Platform、Claude.ai、Claude Code 和 Claude Cowork 上提供,借助 AWS、Google Cloud 和 Microsoft Foundry 的访问将尽快恢复。
