ARC Prize 在 9 月 3 日 GPT-6 Astra 发布后的数小时内,公布了对该模型的自有评估,而其头条数字并不成立。按照 ARC Prize 与供应商无关的 Standard 基准运行,Astra 在 ARC-AGI-3 Semi-Private 上得分为 62.7%。OpenAI 发布材料中居于首位的 99.9%,则是由另一种运行方式得出的。

两种基准,两组数字

ARC Prize 两种结果都予以公布。Standard 基准允许模型保留其选择保留的笔记。ARC Prize 自己对 Provider Adapter 基准的表述是:“在请求之间保留不透明的推理状态,并使用压缩来支持更长的对话,从而让模型能够复用先前的工作。”在公布的结果表中,Standard 侧的最高分为在最高推理强度下的 62.7%,成本为 26,098 美元。而 99.9% 则出现在 adapter 侧的 high 强度下,成本为 18,817 美元。在最高强度下,adapter 的得分为 98.6%,成本为 17,332 美元。

并不成立的对比

这一点对发布当天出现的每一张图表都至关重要。OpenAI 的表格将 Astra 的 adapter 得分与 Claude Opus 5 的 30.2% 以及 GPT-5.6 Sol 的 7.8% 相比——而后两项数字是在 Standard 基准上测得的。若三者都按同一种方式运行,那么相对于 Anthropic 这款模型的约 69 个百分点优势,就会变成大约 32 个百分点。这依然是领先,而且幅度不小;但不是当时展示出来的那个结果。

更便宜,也更高,这才是关键

adapter 运行在每个推理等级上的成本都低于 Standard 运行——在高强度下是 18,817 美元,对比 40,705 美元。由此可以排除通常的解释,即更高分数只是买来了更多算力。adapter 带来的是跨调用的状态复用,因此被测量的部分内容其实是 OpenAI 的推理基础设施,而不仅仅是模型本身的推理能力。ARC Prize 也直言不讳地指出,测试者没有代码解释器或 scratchpad,因此结果“应被理解为模型与其工具的综合表现”。

接收到的叙事错在何处

“ARC-AGI-3 已经饱和”在 9 月 3 日被广泛传播。事实并非如此。在与供应商无关的运行方式下,该基准仍有三分之一未解。adapter 也并非把戏——保留推理状态确实是客户能获得的一项真实能力。但它产出的是一个 系统 结果,而不是模型结果;把两者当作可互换来报道,才是错误所在。还有一个细节削弱了那种整齐的扩展叙事:在 Standard 基准上,分数并不单调。推理强度设为 “none” 时得分为 35.2%,大约是“low”档返回的 17.5% 的两倍。