Artificial Analysis a publié la version 4.2 de son Intelligence Index le 4 septembre, et les classements qui en découlent circulent déjà comme une information : Claude Fable 5.1 en tête, GPT-6 Astra en deuxième position avec « un gain de 4 points sur GPT-5.6 Sol », Google septième parmi les laboratoires. Ce ne sont pas les scores sur la règle que tout le monde citait deux jours plus tôt.
Ce qui a changé dans le score composite
Le changelog, mot pour mot : "+ AA-Briefcase, our agentic knowledge work evaluation with a private test set + Surge's GDP.pdf, long context document reasoning across 4,592 PDF pages − GPQA Diamond, an exceptional scientific reasoning evaluation that has now been saturated … plus greater weighting on held-out test sets to prevent gaming". Et : "40% of our Index weighting is now private, held-out test sets - double the figure from v4.1." La notation a aussi changé : AA-LCR v1.1 a « added a grading system prompt and corrected errors and ambiguities in answer keys », et pour GDPval-AA v2 et AA-Briefcase, « we have improved our sampling and re-anchored the Elo scale ».
La preuve la plus nette que la règle a changé
Elle vient des propres pages d’Artificial Analysis, à deux jours d’intervalle. Le 2 septembre : « Gemini 3.8 Flash scores 59 on the Artificial Analysis Intelligence Index … on par with sub-maximum reasoning efforts of GPT-5.6 Sol (xhigh, 59) and Grok 4.6 (medium, 59). » Le 4 septembre, le classement en direct de la v4.2 : Claude Fable 5.1 « scores the highest … with a score of 57, followed by GPT-6 Astra (max) with a score of 55 ». Gemini n’a pas changé entre-temps. Un modèle de milieu de tableau a obtenu 59 mardi ; vendredi, le plafond de l’indice entier est à 57.
Ce que la lecture courante interprète mal
« GPT-6 Astra shows a 4pt gain over GPT-5.6 Sol » est une comparaison v4.2 contre v4.2, lue comme une progression par rapport à une base v4.1 qui n’existe plus. Toute affirmation « avant/après » publiée cette semaine — y compris celles qui associent un chiffre de lancement à un classement v4.2 — compare deux composites différents. Un mainteneur est en droit de retirer une évaluation saturée ; le problème est que les chiffres de part et d’autre du changement sont cités dans la même phrase.
La coïncidence à relever
L’évaluation supprimée était celle du « exceptional scientific reasoning », et dans le nouveau composite Google passe septième parmi les laboratoires. Cela ne prouve rien à lui seul, et le doublement de la pondération des jeux de test privés est bien une mesure anti-triche. Mais c’est le genre de coïncidence qu’un mainteneur de benchmark doit s’attendre à voir questionnée, alors que l’indice est cité dans des annonces de lancement et des dossiers d’achat comme s’il s’agissait d’une échelle stable.
