ARC Prize a publié sa propre évaluation de GPT-6 Astra dans les heures qui ont suivi le lancement du modèle, le 3 septembre, et le chiffre vedette ne résiste pas à l’examen. Exécuté sur le banc d’essai Standard neutre vis-à-vis des fournisseurs d’ARC Prize, Astra obtient 62,7 % sur ARC-AGI-3 Semi-Private. Le 99,9 % mis en avant dans les documents de lancement d’OpenAI a été produit par un autre exécuteur.

Deux bancs d’essai, deux chiffres

ARC Prize publie les deux. Le banc Standard permet à un modèle de conserver les notes qu’il choisit de garder. Le banc Provider Adapter permet, selon les propres termes d’ARC Prize, de « préserver un état de raisonnement opaque entre les requêtes et d’utiliser la compaction pour les conversations plus longues, ce qui permet au modèle de réutiliser les travaux antérieurs ». Dans le tableau des résultats publié, le meilleur score Standard est de 62,7 % pour 26 098 $, au niveau d’effort de raisonnement maximal. Le 99,9 % figure du côté de l’adaptateur, au niveau d’effort élevé, pour 18 817 $. À effort maximal, l’adaptateur renvoie 98,6 % pour 17 332 $.

La comparaison qui ne tient pas

C’est l’élément qui compte pour tous les graphiques publiés le jour du lancement. Le tableau d’OpenAI opposait le score de l’adaptateur d’Astra à Claude Opus 5 à 30,2 % et à GPT-5.6 Sol à 7,8 % — des chiffres mesurés sur le banc Standard. Si l’on exécute les trois de la même manière, l’écart d’environ 69 points avec le modèle d’Anthropic devient d’environ 32 points. Il y a toujours une avance, et elle est importante ; pas celle qui a été montrée.

Moins cher et plus élevé, ce qui est révélateur

L’exécution via l’adaptateur a coûté moins cher que l’exécution Standard à chaque niveau de raisonnement — 18 817 $ contre 40 705 $ à effort élevé. Cela écarte l’explication habituelle selon laquelle un meilleur score aurait simplement acheté plus de calcul. Ce que l’adaptateur ajoute, c’est la réutilisation de l’état entre les appels ; une partie de ce qui est mesuré relève donc de l’infrastructure d’inférence d’OpenAI plutôt que du raisonnement du modèle. ARC Prize l’indique explicitement, en précisant que ses testeurs ne disposaient ni d’un interpréteur de code ni d’un scratchpad, et que les résultats « doivent être compris comme la performance combinée du modèle et de ses outils ».

Ce que le cadrage retenu passe à côté

« ARC-AGI-3 est saturé » a circulé largement le 3 septembre. Ce n’est pas le cas. Un tiers du benchmark reste non résolu sous l’exécuteur neutre vis-à-vis des fournisseurs. Et l’adaptateur n’est pas une astuce — la préservation de l’état de raisonnement est une capacité réelle dont bénéficient les clients. Mais cela produit un résultat de système, pas un résultat de modèle, et présenter les deux comme interchangeables est l’erreur. Un autre détail fragilise le récit lisse de la montée en puissance : sur le banc Standard, les scores ne sont pas monotones. L’effort de raisonnement réglé sur « none » atteint 35,2 %, soit environ le double des 17,5 % obtenus avec « low ».