Microsoft Security于7月27日宣布推出其首个专为安全打造的模型MAI-Cyber-1-Flash,并同时发布Project Perception,相关消息由执行副总裁Hayete Gallot署名发布。Project Perception是一个协调运作的红队、蓝队和绿队代理系统,将于8月3日进入公开预览。Microsoft还宣布了由副总裁Taesoo Kim领导的FORGE Labs,以及一个外部红队联盟,为横跨六大洲的18个大学实验室提供资金支持。

声称的结果

Microsoft称其整体系统在CyberGym上取得95.95%的成绩——四舍五入后为96%——并表示这比Mythos高12个百分点。其公布的对比组包括:GPT-5.5 Cyber为85.6%,Mythos 5为83.8%,GPT-5.6 Sol为83.6%,Gemini 3.5 Flash Cyber为83.2%。它还声称,“与当今市场上的当前MDASH配置相比,成本节省接近50%。”Mustafa Suleyman称这“确实是一个相当了不起的结果”。

这个数字的三个问题

首先,这一基准测试完全由其自身报告:没有独立验证,没有运行次数,没有误差范围。其次,更关键的是,这96%来自一个编排式双模型系统——Flash处理约90%的任务,其余任务转交给GPT-5.4——而竞争对手比较的是单一模型。第三,这一成本说法是拿Microsoft自己此前的配置作比较,而不是对手;至少一家媒体将其表述为“只有其他领先模型一半的成本”,这在实质上是不同的说法,而且没有得到支持。

CyberGym衡量什么

衡量的是漏洞复现,而不是现实世界中的利用。一个模型如果复现了基准测试中96%的已知漏洞,并不意味着它解决了96%的安全问题,而Microsoft也没有这样声称——但流传在报道中的简略说法却是如此。

其下的战略动作

两年来,Microsoft一直在销售基于合作伙伴模型构建的安全产品。如今,它开始推出自己的权重模型,并在其最大规模的企业拓展路径中,拿这些合作伙伴来定价对比。而就在同一天,它还将MDASH捐赠给了Nvidia的新开放模型联盟。自建模型、压低其转售供应商的价格,同时又支持开放权重阵营,这不是三个动作,而是一个动作。