一篇于 9 月 3 日发布的基准论文,直指业界衡量其旗舰安全主张的方式。如果某个 AI agent 修补了漏洞,标准检查就是重新运行导致崩溃的 PoC,看看它是否仍会崩溃。作者发现,这一道关口的门槛远比应有的宽松。

头条级指标

“在11 个最先进的 agent中,包括AIxCC 三强 agent在内,最初仅基于 PoC 的验证,平均将 agent 的修补任务解决率抬高了1.83 倍。”这项研究涵盖 C 和 C++ 漏洞修补,且比较的是两种验证机制,而不是两组 agent。

这项基准如何构建

它“选择那些真实修复位于崩溃调用栈之外的漏洞”,然后应用漏洞移植和代码变异。这一构造对理解该数字至关重要:这些案例之所以被选中,正是因为补丁可以让崩溃消失,却未必解决缺陷本身。

记忆化发现

此外,“平均来看,25% 的 agent 补丁与历史开发者补丁存在显著相似性。”这是相似性指标,并不能证明训练数据污染——因为正确修复往往会与开发者的修复相似,毕竟通常只有一种明显正确的修复方式——但这一比例占样本的四分之一,确实关系到这些基准究竟在衡量什么。

常见解读的问题所在

这条消息最容易引发的标题会是 AI 修补 agent 有 45% 都是假的。但 1.83 倍并不是这个意思。这个比值比较的是作者专门为削弱较弱验证方式而构建的基准上的两种评分方法,因此这一差距是被设计得足以显现出来的,而不是从真实世界中抽样得来。更稳妥的解读是方向性的:仅基于 PoC 的验证系统性高估了结果,在这些经对抗性挑选的案例中,大约会高估到这个程度。摘要也没有公布各 agent 的分项得分,因此无法据此点名任何供应商。需要说明的是,这项研究的局限也很明确——仅来自一个团队、一个语言对、一个由作者自行构建的基准,且尚无独立复现。