ARC Prize ha pubblicato la propria valutazione di GPT-6 Astra entro poche ore dal lancio del modello il 3 settembre, e il numero in evidenza non regge alla verifica. Eseguito sull'harness Standard provider-neutral di ARC Prize, Astra ottiene il 62,7% su ARC-AGI-3 Semi-Private. Il 99,9% che apriva il materiale di lancio di OpenAI è stato prodotto da un runner diverso.
Due harness, due numeri
ARC Prize li pubblica entrambi. L'harness Standard consente a un modello di portare avanti appunti che sceglie di conservare. L'harness Provider Adapter, nelle parole di ARC Prize, "preserves opaque reasoning state between requests and uses compaction for longer conversations, allowing the model to reuse prior work." Nella tabella dei risultati pubblicata, il punteggio Standard più alto è 62,7% a $26.098, al massimo sforzo di ragionamento. Il 99,9% si trova sul lato adapter a sforzo high, a $18.817. Al massimo sforzo, l'adapter restituisce il 98,6% per $17.332.
Il confronto che non regge
Questa è la parte che conta per ogni grafico pubblicato il giorno del lancio. La tabella di OpenAI metteva il punteggio dell'adapter di Astra a confronto con Claude Opus 5 al 30,2% e GPT-5.6 Sol al 7,8% — valori misurati sull'harness Standard. Se si eseguono tutti e tre nello stesso modo, il divario di circa 69 punti rispetto al modello di Anthropic scende a circa 32 punti. Rimane comunque un vantaggio, e ampio; non quello mostrato.
Più economico oltre che più alto, ed è questo il segnale
La corsa sull'adapter è costata meno di quella Standard a ogni livello di ragionamento — $18.817 contro $40.705 a sforzo elevato. Questo esclude la spiegazione abituale secondo cui un punteggio migliore avrebbe semplicemente richiesto più compute. Ciò che l'adapter aggiunge è il riuso dello stato tra una chiamata e l'altra, quindi parte di ciò che viene misurato è l'infrastruttura di inference di OpenAI piuttosto che il ragionamento del modello. ARC Prize lo dice esplicitamente, rilevando che i propri tester non avevano né code interpreter né scratchpad, quindi i risultati "should be understood as the combined performance of the model and its tools."
Cosa sbaglia la cornice così com'è stata recepita
"ARC-AGI-3 is saturated" ha circolato ampiamente il 3 settembre. Non è così. Un terzo del benchmark resta irrisolto con il runner provider-neutral. E l'adapter non è un trucco — preservare lo stato del ragionamento è una capacità reale che i clienti ricevono. Ma produce un risultato di sistema, non un risultato del modello, e presentare le due cose come intercambiabili è l'errore. Un ulteriore dettaglio incrina la narrazione pulita della scalabilità: sull'harness Standard i punteggi non sono monotoni. Con lo sforzo di ragionamento impostato su "none" il punteggio è 35,2%, circa il doppio del 17,5% restituito con "low".
