ARC Prize publicó su propia evaluación de GPT-6 Astra a las pocas horas del lanzamiento del modelo, el 3 de septiembre, y la cifra principal no resiste la prueba. Ejecutado en el sistema Standard neutral respecto al proveedor de ARC Prize, Astra obtiene un 62,7% en ARC-AGI-3 Semi-Private. El 99,9% que encabezó los materiales de lanzamiento de OpenAI fue producido por un ejecutor distinto.
Dos sistemas, dos cifras
ARC Prize publica ambos. El sistema Standard permite que un modelo conserve las notas que decida mantener. El sistema Provider Adapter —en palabras de ARC Prize— "preserva el estado de razonamiento opaco entre solicitudes y utiliza compactación para conversaciones más largas, lo que permite al modelo reutilizar el trabajo previo". En la tabla de resultados publicada, la mejor puntuación en Standard es 62,7% con 26.098 dólares, con el máximo esfuerzo de razonamiento. El 99,9% figura del lado del adaptador, con esfuerzo high, a 18.817 dólares. Con esfuerzo máximo, el adaptador devuelve un 98,6% por 17.332 dólares.
La comparación que no se sostiene
Esta es la parte que importa para cada gráfico publicado el día del lanzamiento. La tabla de OpenAI enfrentó la puntuación del adaptador de Astra con Claude Opus 5 al 30,2% y GPT-5.6 Sol al 7,8%, cifras medidas en el sistema Standard. Si se ejecutan los tres de la misma manera, la ventaja de unos 69 puntos sobre el modelo de Anthropic pasa a ser de unos 32 puntos. Sigue siendo una ventaja, y amplia; no era la que se mostró.
Más barato además de mejor, lo que lo delata
La ejecución con adaptador costó menos que la Standard en todos los niveles de razonamiento: 18.817 dólares frente a 40.705 dólares con esfuerzo alto. Eso descarta la explicación habitual de que una mejor puntuación simplemente compró más computación. Lo que añade el adaptador es reutilización de estado entre llamadas, así que parte de lo que se mide es la infraestructura de inferencia de OpenAI y no el razonamiento del modelo. ARC Prize lo dice de forma directa, al señalar que sus evaluadores no tenían intérprete de código ni scratchpad, por lo que los resultados "deben entenderse como el rendimiento combinado del modelo y sus herramientas".
Qué falla en el encuadre recibido
"ARC-AGI-3 está saturado" circuló ampliamente el 3 de septiembre. No lo está. Un tercio del benchmark sigue sin resolverse con el ejecutor neutral respecto al proveedor. Y el adaptador no es un truco: preservar el estado de razonamiento es una capacidad real que obtienen los clientes. Pero produce un resultado de sistema, no un resultado del modelo, y presentar ambos como intercambiables es el error. Un detalle más desbarata la limpia historia del escalado: en el sistema Standard las puntuaciones no son monótonas. El esfuerzo de razonamiento fijado en "none" obtiene un 35,2%, aproximadamente el doble del 17,5% que devuelve en "low".
