OpenAI 于8 月 7 日发布消息称,无法排除其即将推出的 Astra 模型达到其 Preparedness Framework 中 Critical 网络安全等级的可能性。这是该公司首次将这种可能性与某一具体模型挂钩。
关键区别就在这里
OpenAI 并未表示 Astra 已达到 Critical。基准测试和评估仍在进行中,公司也未确认这一门槛已经被跨越。那些写着“OpenAI 将某模型标记为 Critical”的标题,实际上把新闻主旨颠倒了:重点在于,OpenAI 是基于一种可能性而非既成结论采取行动,这正是预防性框架真正启动时的样子。
Critical 的含义
按照 OpenAI 自己的表述,这一门槛指的是:一种工具增强型模型,能够“在无需人工干预的情况下,于许多加固过的现实关键系统中识别并开发可用的零日漏洞利用,且覆盖所有严重级别”——或者,能够“在仅获得一个高层级目标的情况下,为针对加固目标的网络攻击设计并执行端到端的新策略”。
OpenAI 承诺了什么
OpenAI 暂停了那些未达到升级后安全要求的内部活动。其列出的措施包括隔离测试环境、限制网络和工具访问、加强模型权重保护与加密、在所有 agentic 应用中实施统一监控,以及分析 chain-of-thought 并阻止高风险活动的安全监测器。公司还计划与政府机构及外部安全组织开展第三方测试。
这是发布前,而非事故后
Astra 还没有正式推出。这意味着,这是一项在任何内容到达用户之前就作出的遏制决定——与过去两周里实验室披露的“沙箱逃逸”事件正相反,后者描述的是已经发生的事情。Preparedness Framework 多年来一直存在于纸面上;这是它第一次真正让某件事慢了下来。
