Artificial Analysis publicou a versão 4.2 do seu Intelligence Index em 4 de setembro, e as classificações dela já circulam como notícia: Claude Fable 5.1 em primeiro, GPT-6 Astra em segundo, com "um ganho de 4 pontos sobre GPT-5.6 Sol", Google em sétimo entre os laboratórios. Essas não são pontuações na régua que todos citavam dois dias antes.

O que mudou no índice composto

O changelog, literalmente: "+ AA-Briefcase, our agentic knowledge work evaluation with a private test set + Surge's GDP.pdf, long context document reasoning across 4,592 PDF pages − GPQA Diamond, an exceptional scientific reasoning evaluation that has now been saturated … plus greater weighting on held-out test sets to prevent gaming". E: "40% of our Index weighting is now private, held-out test sets - double the figure from v4.1." A avaliação também mudou: AA-LCR v1.1 "added a grading system prompt and corrected errors and ambiguities in answer keys", e para GDPval-AA v2 e AA-Briefcase, "we have improved our sampling and re-anchored the Elo scale".

A prova mais clara de que a régua mudou

Ela vem das próprias páginas da Artificial Analysis, com dois dias de diferença. Em 2 de setembro: "Gemini 3.8 Flash scores 59 on the Artificial Analysis Intelligence Index … on par with sub-maximum reasoning efforts of GPT-5.6 Sol (xhigh, 59) and Grok 4.6 (medium, 59)." Em 4 de setembro, o placar ao vivo da v4.2: Claude Fable 5.1 "scores the highest … with a score of 57, followed by GPT-6 Astra (max) with a score of 55". Nada mudou no Gemini nesse intervalo. Um modelo de faixa intermediária marcou 59 na terça; na sexta, o teto de todo o índice é 57.

O que a leitura corrente erra

"GPT-6 Astra shows a 4pt gain over GPT-5.6 Sol" é uma comparação entre v4.2 e v4.2 que está sendo lida como progresso em relação a uma base v4.1 que já não existe. Toda afirmação de antes e depois publicada nesta semana — inclusive qualquer uma que combine um número do dia do lançamento com uma posição da v4.2 — está comparando dois compostos diferentes. Um mantenedor tem o direito de aposentar uma avaliação saturada; o problema é que os números de ambos os lados da mudança estão sendo citados na mesma frase.

A coincidência que vale nomear

A avaliação removida era a de "exceptional scientific reasoning", e no novo composto o Google cai para sétimo entre os laboratórios. Isso, por si só, não prova nada, e a duplicação da ponderação privada de held-out é uma medida genuína contra manipulação. Mas é o tipo de coincidência sobre a qual se espera que um mantenedor de benchmark seja questionado, e o índice é citado em posts de lançamento e apresentações de compras como se fosse uma escala estável.