A ARC Prize publicou sua própria avaliação do GPT-6 Astra poucas horas após o lançamento do modelo em 3 de setembro, e o número principal não se sustenta. Executado no harness Standard, neutro em relação ao provedor, da ARC Prize, o Astra obtém 62,7% no ARC-AGI-3 Semi-Private. Os 99,9% que lideraram o material de lançamento da OpenAI foram produzidos por um runner diferente.

Dois harnesses, dois números

A ARC Prize publica ambos. O harness Standard permite que um modelo leve adiante anotações que escolher manter. O harness Provider Adapter, nas próprias palavras da ARC Prize, "preserva o estado opaco de raciocínio entre requisições e usa compactação para conversas mais longas, permitindo que o modelo reutilize trabalho anterior". Na tabela de resultados publicada, a melhor pontuação no Standard é 62,7% a US$ 26.098, no esforço máximo de raciocínio. Os 99,9% ficam do lado do adapter, em esforço alto, a US$ 18.817. No esforço máximo, o adapter retorna 98,6% por US$ 17.332.

A comparação que não se sustenta

É isso que importa para todos os gráficos publicados no dia do lançamento. A tabela da OpenAI colocou a pontuação do adapter de Astra contra Claude Opus 5 a 30,2% e GPT-5.6 Sol a 7,8% — números medidos no harness Standard. Ao rodar os três da mesma forma, a diferença de cerca de 69 pontos sobre o modelo da Anthropic cai para cerca de 32 pontos. Ainda é uma liderança, e grande; não a que foi mostrada.

Mais barato e também mais alto, o que denuncia o problema

A execução no adapter custou menos do que a Standard em todos os níveis de raciocínio — US$ 18.817 contra US$ 40.705 no esforço alto. Isso descarta a explicação usual de que uma pontuação melhor simplesmente comprou mais compute. O que o adapter adiciona é reutilização de estado entre chamadas, de modo que parte do que está sendo medido é o plumbing de inferência da OpenAI, e não o raciocínio do modelo. A ARC Prize diz isso diretamente, observando que seus testadores não tinham interpretador de código nem scratchpad, portanto os resultados "devem ser entendidos como o desempenho combinado do modelo e de suas ferramentas".

O que a leitura recebida erra

"ARC-AGI-3 está saturado" circulou amplamente em 3 de setembro. Não está. Um terço do benchmark segue sem solução sob o runner neutro em relação ao provedor. E o adapter não é um truque — preservar o estado de raciocínio é uma capacidade real que os clientes obtêm. Mas ele produz um resultado de sistema, não um resultado de modelo, e tratar os dois como intercambiáveis é o erro. Um detalhe adicional enfraquece a narrativa elegante de escala: no harness Standard, as pontuações não são monotônicas. O esforço de raciocínio definido como "none" marca 35,2%, cerca do dobro dos 17,5% obtidos em "low".