ARC Prize опубликовал собственную оценку GPT-6 Astra всего через несколько часов после запуска модели 3 сентября, и главный показатель не выдерживает проверки. На стандартном стенде ARC Prize, независимом от провайдера, Astra набирает 62,7% на ARC-AGI-3 Semi-Private. 99,9%, которым OpenAI открывала свои материалы к запуску, был получен на другом раннере.

Два стенда, два результата

ARC Prize публикует оба. Стандартный стенд позволяет модели сохранять заметки, которые она решает удержать. Стенд Provider Adapter, по собственному описанию ARC Prize, «сохраняет скрытое состояние рассуждения между запросами и использует компактизацию для более длинных разговоров, позволяя модели повторно использовать предыдущую работу». В опубликованной таблице результатов лучший показатель на Standard — 62,7% при $26,098, при максимальной интенсивности рассуждений. Показатель 99,9% находится на стороне адаптера при high-режиме и составляет $18,817. При максимальной интенсивности адаптер показывает 98,6% при $17,332.

Сравнение, которое не выдерживает проверки

Именно это важно для каждой таблицы, опубликованной в день запуска. В таблице OpenAI результат Astra в адаптере сравнивался с Claude Opus 5 на уровне 30,2% и GPT-5.6 Sol на 7,8% — цифрами, измеренными на стандартном стенде. Если прогнать все три модели одинаковым способом, разрыв примерно в 69 пунктов над моделью Anthropic превращается примерно в 32 пункта. Это по-прежнему лидерство, и большое; но не то, которое было показано.

И выше, и дешевле — это и выдает подмену

Прогон через адаптер стоил меньше, чем стандартный, на каждом уровне рассуждений — $18,817 против $40,705 при высокой интенсивности. Это исключает обычное объяснение, будто более высокий результат просто купил больше вычислений. Адаптер добавляет повторное использование состояния между запросами, так что часть того, что измеряется, — это инференсная инфраструктура OpenAI, а не способность модели к рассуждению. ARC Prize прямо указывает на это, отмечая, что у тестировщиков не было ни code interpreter, ни scratchpad, поэтому результаты «следует понимать как совокупную производительность модели и ее инструментов».

Что не так с распространенной подачей

Фраза «ARC-AGI-3 исчерпан» широко разошлась 3 сентября. Это не так. Треть бенчмарка остается нерешенной при прогоне на независимом от провайдера стенде. И адаптер — не уловка: сохранение состояния рассуждения — реальная возможность, которую получают пользователи. Но он дает результат системы, а не только модели, и считать эти вещи взаимозаменяемыми — ошибка. Еще одна деталь подрывает аккуратный нарратив о масштабировании: на Standard результаты не монотонны. При уровне рассуждений "none" показатель составляет 35,2%, то есть примерно вдвое выше, чем 17,5% при "low".