La documentation développeur d'OpenAI pour GPT-6 Astra comporte une règle tarifaire que la plupart des comptes rendus de lancement ont passée sous silence, et elle inverse l'économie précisément des charges de travail pour lesquelles le modèle est vendu. Le tarif annoncé de 10 $ par million de tokens d'entrée et 50 $ par million de sortie ne s'applique qu'en dessous d'un seuil, et au-delà, c'est toute la requête qui est re-tarifée.
Le seuil s'applique à tout, pas seulement à l'excédent
La page du modèle l'indique clairement : « Les prompts de plus de 272K tokens d'entrée sont facturés à 2x les taux d'entrée et de cache, et à 1,5x pour la sortie, pour la requête complète. » Les mots pour la requête complète portent le coût. Un prompt de 273 000 tokens n'est pas facturé au tarif standard avec un supplément sur les mille derniers tokens — tout est re-tarifé, à 20 $ pour l'entrée et 75 $ pour la sortie. Un prompt deux mille tokens plus court coûte deux fois moins cher.
Les écritures en cache coûtent plus que l'entrée nouvelle
Le même tableau facture l'entrée mise en cache à 1,00 $ par million et les écritures de cache à 12,50 $ — la page précise que les écritures sont facturées à 1,25x le tarif d'entrée hors cache. Le cache de prompts est généralement présenté comme une économie ; ici, il s'agit d'une prime initiale qui ne se rentabilise qu'à la réutilisation. Batch et Flex sont facturés à moitié du tarif standard ; le mode Fast est facturé au double, et la page ajoute que le mode Fast « n'est pas disponible pour GPT-6 Astra avec résidence des données dans l'UE. »
Des contrôles que le modèle n'accepte plus
Le changelog d'OpenAI liste les limitations : pas de prise en charge du niveau d'effort de raisonnement none, pas de temperature ni de top_p personnalisés, et pas de logprobs. Ce n'est pas une simple réduction à la marge de paramètres rarement utilisés. Les bancs d'évaluation, les pipelines de classification et tout ce qui travaille sur les probabilités de tokens ne peuvent pas du tout être portés sur Astra, quels que soient ses scores de benchmark.
Ce que le cadrage repris se trompe à présenter
Les trackers et les articles affichent un prix fixe de 10 $/50 $ pour un modèle à un million de tokens. Les deux moitiés induisent en erreur. Le prix s'applique au cas à contexte court, tandis que les exécutions agentiques et de computer use — celles pour lesquelles OpenAI commercialise Astra — vivent au-dessus du seuil et correspondent à un modèle à 20 $/75 $. Et le chiffre de « contexte 1M » est la fenêtre de contexte de 1 050 000 tokens indiquée sur la page, qui inclut une marge pour la génération ; avec 128 000 tokens de sortie maximum également mentionnés, l'entrée exploitable ressort à environ 922 000. OpenAI ne publie pas cette soustraction, et quiconque dimensionne un pipeline documentaire à partir de « 1M input » se trompe d'environ 128K.
