OpenAI 于 10 August 宣布,将把其 Daybreak 安全项目拆分为 BlueRed 两个层级,并向 Red 层客户推出专为进攻性安全工作调校的 GPT-5.6-Cyber

两层之间的差距

Blue 覆盖事件响应、恶意软件分析、安全代码审查和补丁验证。Red 覆盖 漏洞研究、漏洞利用验证和安全测试——这些都是通用模型会拒绝的工作。在 OpenAI 的 Advanced Cybersecurity Completion Rate 评测中,GPT-5.6-Cyber 可完成 95.0% 的请求;通用的 GPT-5.6 Sol 为 1.5%,Blue 访问权限下为 2.0%,上一代 GPT-5.5-Cyber 为 57.3%

真正守住防线的是什么

现在的保障不再是模型的拒绝行为——这项能力已被有意移除——而是 客户审查。分发范围仅限可信合作伙伴,自 1 September 起,所有个人 Daybreak 账户,无论 Blue 还是 Red,均必须使用 硬件安全密钥进行身份验证。

这些数字由其自行披露

这些完成率来自 OpenAI 的内部基准,尚未经过第三方复现,而且该评测衡量的是模型是否会 尝试并完成 任务,而非输出是否真正可用。报道中流传的合作伙伴名称来自媒体报道,而非 OpenAI 的公告。

有限访问并不等于全面开放

GPT-5.6-Cyber 并未上线公共 API。这个项目的模式——模型负责完成工作,再配上一份获批名单——如今正在成为其他实验室将被拿来衡量的模板。

支持这一做法的理由

OpenAI 的说法是,防守方的窗口正在关闭:攻击者已经在使用模型完成这类工作,因此如果拒绝构建足够强大的防御工具,就等于承认这种不对称。反对意见则认为,获批名单比拒绝机制更弱,因为一旦账户被攻破,它就会默认放行——而这大概也是硬件密钥要求与其一同推出的原因。