OpenAI 周一与 AWS 联合发布了一篇关于 GPT-5.6 在 Kiro 中运行 的价格性能文章。Kiro 是 Amazon 的规范驱动型编码 IDE,标题突出显示其在 Terminal-Bench 2.1 上完成任务的成本约降低 82%。业内报道将其解读为一次上线——“自 2026 年 8 月 24 日起可在 Kiro 中使用。”但 Kiro 自己的模型更新日志把 GPT-5.6 的到达时间记为 2026 年 7 月 14 日,且对 8 月 24 日或 25 日完全没有任何记录。

常规叙事哪里出了错

这里叠了三层错误。首先,这并不是一次上线。GPT-5.6 在 Kiro 中已存在六周;周一发布的内容只是一篇联合营销帖。其次,这个 82% 是由供应商运行的基准测试成本差异,不是客户账单,也不是准确率结果。文中没有给出 Kiro 配置下的准确率数据,也没有区分模型节省了多少、测试框架节省了多少。第三点——也正是最值得买家警惕的一点——定价杠杆在三周前就已经被调整。7 月 31 日,Kiro 将 Luna 的 credit multiplier 从 0.6x 下调至 0.1x,并将 Terra 的从 1.2x 调整为 1.0x。读者如果在看到“便宜 82%”时又没看到这项变更,很容易把一次计费决定归功于模型本身。

来自双方各自记录的日期

Kiro 7 月 14 日的条目宣布 GPT-5.6 Sol、Terra 和 Luna 上线,配备 272K 上下文窗口,credit multiplier 分别为 2.4x、1.2x 和 0.6x,并称其为在 两个区域——us-east-1 和 eu-central-1——向 Pro、Pro+、Pro Max 和 Power 客户“experimental support ... rolling out”。当时公布的 Terminal-Bench 2.1 成绩为:Sol 88.8%、Terra 87.4%、Luna 84.7%。其状态至今仍是实验性,仍面向指定付费层级,仍仅覆盖两个区域。周一并未改变这些内容。

这种模式为何还会反复出现

如今,模型供应商正在合作伙伴的测试框架中发布“每完成一项任务的成本”主张,而模型、支撑层和 credit multiplier 都在独立变化,且没有任何一项保持恒定。买家若拿“便宜 82%”去比较编码工具,就无法判断这部分节省究竟该归因于哪一项。归因问题并非这类公告的附带缺陷;它正是这类公告得以成立的原因。

要让这个数字可核查,需要什么

需要同时给出准确率和成本数据,固定测试框架版本,并注明运行期间实际使用了哪些 credit multiplier。三项都没有出现。