英国的 AI Security Institute (AISI)7月17日 发布的一项测量结果,应该让安全团队高度重视:在进攻性网络任务上,免费可下载的 open-weight 模型与最强的 closed frontier 系统之间的差距,已缩小至大约 4至7个月,而一年前这一差距还是 6至10个月

The finding

AISI 将领先的开放模型——尤其是 GLM-5.2DeepSeek V4-Pro——与闭源前沿系统进行对比,并提出一个简单问题:按时间衡量,开放生态究竟落后多少?答案是,防御方曾经依赖的缓冲期正在迅速缩短。

How they measured it

在一个名为 "Narrow Cyber Tasks" 的基准上,AISI 评估了 70项任务、覆盖 四个难度层级、从非专家到专家的表现,其中 GLM-5.2 达到了大约 4个月前的闭源模型水平,而 DeepSeek V4-Pro 则相当于大约 5个月前的闭源模型。AISI 还进行了完整的攻击模拟,而不只是孤立任务测试。

The end-to-end test

在名为 "The Last Ones""Cyber Ranges" 场景中——一次针对模拟企业网络的 32步 攻击——GLM-5.2 的表现与 Claude Opus 4.5 相当,后者大约在 7个月前发布。将几十个步骤串联成一次连贯入侵,才是真正难点,而开放模型在这方面正越来越接近。

The open-model dilemma

这种滞后,实际上就是防御方和监管机构在前沿进攻能力变得无法限制之前所拥有的领先时间。如今,这一时间从约10个月下降到4个月左右,凸显出 AISI 所属政府正在面对的政策问题:开源权重发布是否应设置能力门槛,以及由谁来决定。AISI 点名的两款模型——GLM-5.2DeepSeek V4-Pro——都是中国的 open-weight 系统,这也增加了地缘政治意味:以免费下载安装形式传播的能力,无法像先进芯片那样通过出口管制来围堵。