Artificial Analysis ha pubblicato la versione 4.2 del suo Intelligence Index il 4 settembre, e le classifiche che ne derivano stanno già circolando come notizia: Claude Fable 5.1 primo, GPT-6 Astra secondo con "un guadagno di 4 punti su GPT-5.6 Sol", Google settima tra i laboratori. Non sono punteggi sulla stessa scala che tutti citavano due giorni prima.

Cosa è cambiato nel composito

Il changelog, testuale: "+ AA-Briefcase, our agentic knowledge work evaluation with a private test set + Surge's GDP.pdf, long context document reasoning across 4,592 PDF pages − GPQA Diamond, an exceptional scientific reasoning evaluation that has now been saturated … plus greater weighting on held-out test sets to prevent gaming". E ancora: "40% of our Index weighting is now private, held-out test sets - double the figure from v4.1." È cambiato anche il giudizio: AA-LCR v1.1 ha "added a grading system prompt and corrected errors and ambiguities in answer keys", e per GDPval-AA v2 e AA-Briefcase, "we have improved our sampling and re-anchored the Elo scale".

La prova più chiara che la scala è cambiata

Arriva dalle stesse pagine di Artificial Analysis, a due giorni di distanza. Il 2 settembre: "Gemini 3.8 Flash scores 59 on the Artificial Analysis Intelligence Index … on par with sub-maximum reasoning efforts of GPT-5.6 Sol (xhigh, 59) and Grok 4.6 (medium, 59)." Il 4 settembre, la classifica live v4.2: Claude Fable 5.1 "scores the highest … with a score of 57, followed by GPT-6 Astra (max) with a score of 55". Nel frattempo, Gemini non è cambiato. Un modello di fascia media ha segnato 59 martedì; venerdì il tetto dell'intero indice è 57.

Perché la lettura diffusa è sbagliata

"GPT-6 Astra shows a 4pt gain over GPT-5.6 Sol" è un confronto v4.2 contro v4.2 letto come progresso rispetto a una base v4.1 che non esiste più. Ogni affermazione prima/dopo pubblicata questa settimana — comprese quelle che accostano un numero del giorno del lancio a un ranking v4.2 — sta confrontando due compositi diversi. Chi gestisce il benchmark ha il diritto di ritirare una valutazione ormai saturata; il problema è che i numeri ai due lati della modifica vengono citati nella stessa frase.

La coincidenza da segnalare

La valutazione rimossa era quella sul "exceptional scientific reasoning", e nel nuovo composito Google scende al settimo posto tra i laboratori. Da sola, non è la prova di nulla, e il raddoppio del peso dei test privati lasciati in sospeso è una vera misura anti-gaming. Ma è il tipo di coincidenza su cui un gestore di benchmark dovrebbe aspettarsi domande, e l'indice viene citato nei post di lancio e nei documenti di procurement come se fosse una scala stabile.