Artificial Analysis publicó la versión 4.2 de su Intelligence Index el 4 de septiembre, y las clasificaciones derivadas ya circulan como noticia: Claude Fable 5.1 en primer lugar, GPT-6 Astra en segundo con "a 4pt gain over GPT-5.6 Sol", Google en séptimo entre los laboratorios. Esas no son puntuaciones sobre la misma regla que se citaba hace dos días.
Qué cambió en el índice compuesto
El registro de cambios, literalmente: "+ AA-Briefcase, our agentic knowledge work evaluation with a private test set + Surge's GDP.pdf, long context document reasoning across 4,592 PDF pages − GPQA Diamond, an exceptional scientific reasoning evaluation that has now been saturated … plus greater weighting on held-out test sets to prevent gaming". Y: "40% of our Index weighting is now private, held-out test sets - double the figure from v4.1." La calificación también cambió: AA-LCR v1.1 "added a grading system prompt and corrected errors and ambiguities in answer keys", y para GDPval-AA v2 y AA-Briefcase, "we have improved our sampling and re-anchored the Elo scale".
La prueba más clara de que la regla cambió
Está en las propias páginas de Artificial Analysis, con dos días de diferencia. El 2 de septiembre: "Gemini 3.8 Flash scores 59 on the Artificial Analysis Intelligence Index … on par with sub-maximum reasoning efforts of GPT-5.6 Sol (xhigh, 59) and Grok 4.6 (medium, 59)." El 4 de septiembre, la clasificación en vivo de v4.2: Claude Fable 5.1 "scores the highest … with a score of 57, followed by GPT-6 Astra (max) with a score of 55". Gemini no cambió entre medias. Un modelo de gama media obtuvo 59 el martes; el viernes, el techo de todo el índice es 57.
Qué falla en el encuadre recibido
"GPT-6 Astra shows a 4pt gain over GPT-5.6 Sol" es una comparación entre v4.2 y v4.2 que se está leyendo como un avance frente a una base v4.1 que ya no existe. Todas las afirmaciones de antes y después publicadas esta semana —incluidas las que emparejan una cifra del día de lanzamiento con una posición de v4.2— comparan dos compuestos distintos. Un mantenedor tiene derecho a retirar una evaluación saturada; el problema es que los números a ambos lados del cambio se están citando en la misma frase.
La coincidencia que merece ser nombrada
La evaluación eliminada era la de "exceptional scientific reasoning", y en el nuevo índice Google cae al séptimo puesto entre los laboratorios. Eso no demuestra nada por sí solo, y la duplicación de la ponderación privada sobre conjuntos reservados es una auténtica medida contra la manipulación. Pero es el tipo de coincidencia por la que cabe esperar que pregunte quien mantenga un benchmark, y el índice se cita en notas de lanzamiento y presentaciones de compras como si fuera una escala estable.
