一家意大利进攻性安全公司将 Anthropic 和 OpenAI 的前沿模型用于 GlobaLeaks 的源代码。GlobaLeaks 是一个开源举报平台,已接受了大约十年的独立人工审计;该公司公布了模型的结果:29 个已确认漏洞、12 个拒绝服务问题和42 项加固建议。
目标并不脆弱
这一点比数量更重要。GlobaLeaks 被新闻编辑室和反腐机构使用,并且已被付费“找茬”的人反复审查。在这样的代码库里发现任何问题,都比在未经审视的代码库里发现漏洞更能说明问题。
标题掩盖的比例
这些模型共给出了110 个候选发现。人工筛查确认了其中 29 个。也就是说,精确率约为26%——大约四分之三的模型发现未能通过审查。被广泛转引的标题——AI 能识别真实的软件漏洞——是成立的,但它忽略了这项工作的代价。
77 美元之外的内容
这项研究称,按约 77 美元/个已确认发现计算,总支出约为3,140 美元,对应12,000 次请求和12.4 亿个 token。研究文本本身说明,这一数字是在人工验证之前得出的。把 110 个猜测变成 29 个发现的专家筛查,才是生成这些确认结果的步骤,而这一部分并未计入数字之中。研究所给出的结论也承认,专家仍然扮演决定性角色。
看成本拆分,不要只看总额
有一个数字比其他所有数字都更能说明问题:那款高级推理模型在处理7%的 token 时,却消耗了62%的预算。这里才是推理模型用于审查工作的真实经济学——开销集中在工作中很小的一部分。不过,关于来源有两点需要说明:这是由一家正是靠此类服务盈利的公司给出的供应商自述。此外,29 这一数字没有公开的严重程度细分,因此不应被理解为 29 个严重漏洞;剩余的 54 项是拒绝服务和加固建议,而不是可被利用的漏洞。
