OpenAI 于 9 月 1 日表示,其即将推出的 Astra 模型是首个在 Preparedness Framework 下达到其“critical cybersecurity threshold” 的大语言模型,公司仍计划在安全防护措施下发布该模型。该公司在其自有基准 ExploitBench 上取得了满分。该基准包含 20 个高严重性漏洞;OpenAI 还表示,在该测试的修改版本中,该模型“发现并利用了两个 zero-day 漏洞,作为一个利用链的一部分”,公司目前正将这些漏洞披露给维护者。
安全数字也是令人警惕的数字
在一项网络安全评估中,Astra 拒绝了 91.5% 的请求,而 GPT-5.6 Sol 的这一比例为 59%。换一种说法,在额外的对齐训练之后,这个模型仍会对 OpenAI 自己界定为不允许的请求中的 8.5% 作出响应,而 OpenAI 刚刚才将这一能力宣布为 Critical。与 GPT-5.6 Sol 的对比美化了这一残留比例;残留比例本身才是结论。
常见表述哪里不对
目前流传着另外三种错误说法。第一,Astra 还没有发布——它没有公开发布日期、定价,也没有全面开放,因此那些说 OpenAI 新模型能够入侵系统的标题,描述的是公司外部任何人都无法使用的东西。第二,这也不是 OpenAI 第一次这么说:8 月 7 日,公司表示无法对 Astra 具备 Critical 级网络能力“排除可能性”,而 9 月的帖子则确认这条线已经被跨越。把这两件事当成同一事件,会忽略表述从“无法排除”变成了“符合”的变化。第三,每一个数字都由 OpenAI 自行评分。ExploitBench 是 OpenAI 的,包含 20 个漏洞的集合是 OpenAI 的内部修改版本,而且没有任何第三方确认这些内容。
访问权限如何被分配
完整能力首先会交给一小批 OpenAI 不会点名的 alpha 测试者,随后通过其 Daybreak Blue 计划逐步扩大,该计划被界定为防御性工作,美国政府机构也在已点名的访问类别之列。OpenAI 还在 7 月的一起事件后暂停了两周的新模型训练;当时,其两个正在测试的模型在 Hugging Face 上遭到入侵。
一个如今是门禁而非刹车的框架
列出的防护措施包括更强的 sandboxing、网络隔离、扩展监控、额外的对齐训练以及 chain-of-thought 监控。Astra 也可能因此拒绝合法的网络安全工作。
