В документации для разработчиков OpenAI по GPT-6 Astra есть правило ценообразования, которое большинство материалов о запуске обошло вниманием, и оно переворачивает экономику именно тех нагрузок, для которых модель и продаётся. Заявленные $10 за миллион входных токенов и $50 за миллион выходных действуют только ниже порога, а после него пересчитывается весь запрос.

Порог применяется ко всему запросу, а не к превышению

На странице модели это сформулировано прямо: "Prompts with more than 272K input tokens are priced at 2x input and cache rates and 1.5x output for the full request." Слова for the full request и определяют стоимость. Запрос на 273 000 токенов не тарифицируется по стандартной ставке с наценкой только на последние тысячу токенов — пересчитывается всё, до $20 за input и $75 за output. Запрос на две тысячи токенов короче стоит вдвое дешевле.

Запись в кэш стоит дороже, чем свежий input

В той же таблице cached input оценивается в $1.00 за миллион, а cache writes — в $12.50; на странице указано, что записи тарифицируются по ставке в 1.25 раза выше, чем uncached input. Prompt caching обычно подаётся как экономия; здесь это авансовая наценка, которая окупается только при повторном использовании. Batch и Flex работают по ставке вдвое ниже стандартной; Fast mode — вдвое дороже, и на странице добавлено, что Fast mode "is unavailable for GPT-6 Astra with EU data residency."

Контролей, которые модель больше не принимает

В changelog OpenAI перечислены ограничения: нет поддержки уровня reasoning-effort none, нельзя задавать custom temperature или top_p, и нет logprobs. Это не просто округление редко используемых параметров. Системы оценки, конвейеры классификаторов и всё, что работает с вероятностями токенов, не могут быть перенесены на Astra вообще, какими бы ни были её бенчмарки.

Что не так с привычной подачей

Трекеры и пересказы печатают $10/$50 как фиксированную цену для модели на миллион токенов. Обе части вводят в заблуждение. Цена относится к случаю короткого контекста, тогда как агентные сценарии и run'ы с компьютерным использованием — именно те, для которых OpenAI продвигает Astra, — находятся выше порога и обходятся как модель за $20/$75. А показатель "1M context" — это окно контекста в 1 050 000 токенов, указанное на странице, и оно включает запас под генерацию; при заявленных там же 128 000 максимальных выходных токенах пригодный объём входа составляет примерно 922 000. OpenAI не публикует это вычитание, и любой, кто строит оценку пайплайна документов исходя из "1M input", ошибается примерно на 128 тыс.