OpenAI 的开发者文档中关于 GPT-6 Astra 的定价规则,恰恰是多数发布报道忽略的一项,而它颠覆的正是这款模型所主打的工作负载的经济性。页面标示的 每百万输入 token 10 美元、每百万输出 token 50 美元 只在阈值以下适用,一旦越过阈值,整笔请求就会重新计价。

阈值作用于全部请求,而不是超出部分

模型页面写得很明确:"超过 272K 输入 token 的提示词,将对整笔请求按 2 倍输入和缓存费率、1.5 倍输出费率计价。" 关键就在于 对整笔请求 这几个字。一个 273,000 token 的提示词,不是按标准费率外加最后一千个 token 的附加费,而是全部重定价为 输入 20 美元、输出 75 美元。少 2,000 个 token 的提示词,成本却只有一半。

缓存写入比新鲜输入更贵

同一张表将缓存输入定为每百万 1.00 美元,缓存写入定为 12.50 美元——页面注明,写入按未缓存输入费率的 1.25 倍计费。提示词缓存通常被宣传为节省成本;在这里,它是需要先付出的溢价,只有在重复使用时才会回本。Batch 和 Flex 的费率为标准的一半;Fast 模式为两倍,页面还补充称,Fast 模式“在启用欧盟数据驻留的 GPT-6 Astra 上不可用”。

模型不再接受的控制项

OpenAI 的更新日志列出了这些限制:不支持 none reasoning-effort 级别,不支持自定义 temperature 或 top_p,也不支持 logprobs。这绝不是在删去那些很少使用的参数。无论基准分数如何,评测框架、分类器流水线以及任何需要 token 概率工作的系统,都无法迁移到 Astra 上。

现有表述错在何处

各类追踪和解读文章都把它写成每百万 token 统一 10 美元/50 美元。这两部分都具有误导性。这个价格只适用于短上下文场景,而 OpenAI 推广 Astra 所针对的 agentic 和 computer-use 运行——恰恰处于阈值之上——实际上是一个 20 美元/75 美元的模型。至于“1M context”这一说法,指的是页面上写明的 1,050,000 token 上下文窗口,其中包含生成余量;页面同时写明 最大输出 token 为 128,000,因此可用输入量约为 922,000。OpenAI 并未公布这一扣减过程,而任何根据“1M input”来规划文档流水线的人,都会大约多算 128K。