ARC Prize는 3일 GPT-6 Astra의 출시 후 몇 시간 만에 자체 평가를 공개했으며, 헤드라인 수치는 이를 견디지 못했다. ARC Prize의 provider-neutral Standard 하니스에서 Astra는 ARC-AGI-3 Semi-Private에서 62.7%를 기록했다. OpenAI의 출시 자료를 이끈 99.9%는 다른 실행 방식에서 나온 수치였다.

두 하니스, 두 수치

ARC Prize는 두 수치를 모두 공개한다. Standard 하니스는 모델이 유지하기로 선택한 메모를 이어갈 수 있게 한다. ARC Prize의 표현에 따르면 Provider Adapter 하니스는 "요청 사이에 불투명한 추론 상태를 보존하고, 더 긴 대화에서는 압축을 사용해 모델이 이전 작업을 재사용할 수 있게 한다." 공개 결과표에서 최고 Standard 점수는 최대 추론 노력에서 62.7%에 26,098달러다. 99.9%는 high 노력의 어댑터 쪽에 있으며, 18,817달러다. 최대 노력에서 어댑터는 17,332달러에 98.6%를 반환한다.

성립하지 않는 비교

이 대목은 출시일에 공개된 모든 차트에 중요하다. OpenAI의 표는 Astra의 어댑터 점수를 Claude Opus 5의 30.2%, 그리고 GPT-5.6 Sol의 7.8%와 비교했다. 두 수치는 Standard 하니스에서 측정된 것이다. 세 모델을 모두 같은 방식으로 돌리면 Anthropic 모델에 대한 약 69포인트 격차는 약 32포인트로 줄어든다. 여전히 우세이자 큰 격차지만, 보여진 것과는 다르다.

더 높을 뿐 아니라 더 저렴했다는 점이 핵심

어댑터 실행은 모든 추론 수준에서 Standard 실행보다 더 저렴했다. high 노력 기준 18,817달러 대 40,705달러였다. 더 나은 점수를 얻기 위해 단순히 더 많은 연산을 썼다는 통상적 설명은 성립하지 않는다. 어댑터가 더하는 것은 호출 간 상태 재사용이며, 따라서 측정되는 것의 일부는 모델의 추론이 아니라 OpenAI의 추론 인프라다. ARC Prize도 이를 직접 밝히며, 시험 환경에는 코드 인터프리터나 스크래치패드가 없었으므로 결과는 "모델과 그 도구들의 결합 성능으로 이해해야 한다"고 적었다.

받아들여진 프레이밍의 문제

"ARC-AGI-3 is saturated"라는 문구는 9월 3일 널리 퍼졌다. 그러나 사실이 아니다. provider-neutral 실행기에서는 벤치마크의 3분의 1이 아직 풀리지 않았다. 또한 어댑터는 속임수가 아니다. 추론 상태를 보존하는 것은 고객이 실제로 얻는 기능이다. 다만 이는 모델 결과가 아니라 시스템 결과이며, 둘을 같은 것으로 보고 서술하는 것이 오류다. 또 다른 세부사항은 깔끔한 스케일업 서사를 흔든다. Standard 하니스에서는 점수가 비단조적이다. 추론 노력 옵션이 "none"일 때 35.2%로, "low"의 17.5%보다 약 두 배 높다.