A documentação para desenvolvedores da OpenAI para o GPT-6 Astra traz uma regra de precificação que a maior parte da cobertura de lançamento ignorou, e ela inverte a economia justamente das cargas de trabalho para as quais o modelo é vendido. O anunciado US$ 10 por milhão de tokens de entrada e US$ 50 por milhão de saída vale apenas abaixo de um limite; além dele, a solicitação inteira é reprecificada.

O limite vale para tudo, não para o excedente

A página do modelo afirma de forma explícita: "Prompts com mais de 272 mil tokens de entrada são cobrados a 2x as taxas de entrada e cache e 1,5x a de saída para a solicitação completa." As palavras para a solicitação completa definem o custo. Um prompt de 273 mil tokens não é cobrado pela taxa padrão com um acréscimo apenas nos últimos mil tokens — tudo é reprecificado, para US$ 20 de entrada e US$ 75 de saída. Um prompt dois mil tokens mais curto custa metade.

Gravações em cache custam mais que entrada nova

A mesma tabela precifica a entrada em cache em US$ 1,00 por milhão e as gravações em cache em US$ 12,50 — a página observa que as gravações são cobradas a 1,25x a taxa de entrada sem cache. O cache de prompts normalmente é apresentado como economia; aqui, trata-se de um prêmio inicial que só compensa com reutilização. Batch e Flex operam pela metade da taxa padrão; o modo Fast opera em dobro, e a página acrescenta que o modo Fast "não está disponível para GPT-6 Astra com residência de dados na UE."

Controles que o modelo não aceita mais

O changelog da OpenAI lista as limitações: sem suporte ao nível de esforço de raciocínio none, sem temperature ou top_p personalizados e sem logprobs. Isso não é uma pequena redução de parâmetros raramente usados. Estruturas de avaliação, pipelines de classificação e qualquer coisa que faça uso de probabilidades de tokens não podem ser portadas para Astra, independentemente do que digam seus resultados de benchmark.

O que a leitura recebida erra

Rastreadores e textos repetem US$ 10/US$ 50 fixos para um modelo de um milhão de tokens. Ambas as metades induzem ao erro. O preço se aplica ao caso de contexto curto, enquanto execuções agenticas e de uso do computador — as para as quais a OpenAI comercializa o Astra — ficam acima do limite e são um modelo de US$ 20/US$ 75. E o número de "1M de contexto" é a janela de contexto de 1.050.000 tokens informada na página, que inclui margem para geração; com 128.000 tokens máximos de saída também informados ali, a entrada utilizável fica em torno de 922.000. A OpenAI não publica essa subtração, e quem dimensionar um pipeline de documentos com base em "1M de entrada" ficará acima por cerca de 128 mil.