Artificial Analysis 于 9 月 4 日发布了其 Intelligence Index 4.2 版,而由此得出的排名已经开始在新闻中流传:Claude Fable 5.1 位居第一,GPT-6 Astra 位列第二,且“较 GPT-5.6 Sol 提升了 4 分”,Google 在各实验室中排第七。那并不是两天前任何人所引用的那把标尺上的分数。
综合指数中发生了什么变化
更新日志原文如下:“+ AA-Briefcase,我们的代理式知识工作评测,使用私有测试集 + Surge's GDP.pdf,跨 4,592 页 PDF 的长上下文文档推理 − GPQA Diamond,一项出色的科学推理评测,现已饱和……此外还提高了对留出测试集的权重以防止刷分”。以及:“我们现在有 40% 的指数权重来自私有留出测试集——是 v4.1 的两倍。” 评分方式也变了:AA-LCR v1.1“新增了评分系统提示词,并纠正了答案键中的错误和歧义”,而对 GDPval-AA v2 和 AA-Briefcase,“我们改进了采样,并重新锚定了 Elo 量表”。
标尺确实变了的最清楚证据
证据来自 Artificial Analysis 自己相隔两天的页面。9 月 2 日:“Gemini 3.8 Flash 在 Artificial Analysis Intelligence Index 上得分 59……与 GPT-5.6 Sol(xhigh,59)和 Grok 4.6(medium,59)的次最高推理表现持平。”到了 9 月 4 日,实时的 v4.2 排行榜显示:Claude Fable 5.1“以 57 分位居最高,随后是 GPT-6 Astra(max),得分 55”。其间 Gemini 本身并没有变化。周二,一个中游模型得了 59 分;到了周五,整个指数的天花板只有 57 分。
常见解读错在什么地方
“GPT-6 Astra 较 GPT-5.6 Sol 提升了 4 分”是 v4.2 对 v4.2 的比较,却被解读成相对于已不复存在的 v4.1 基线的进步。本周发布的每一条前后对比——包括把发布当天的分数与 v4.2 排名并列的说法——比较的都是两个不同的综合指数。维护者当然有权退役一项已经饱和的评测;问题在于,变更前后的数字却被放在同一句话里引用。
值得点出的巧合
被移除的评测正是那项“出色的科学推理”评测,而在新综合指数中,Google 在各实验室中滑落到第七位。单凭这一点并不能证明什么,而将私有留出权重翻倍也确实是一种反刷分措施。但这类巧合本就应当是基准维护者预料到会被追问的,而且该指数在发布帖和采购材料中被引用时,往往被当作一条稳定量表来使用。
