OpenAI 于 8 月 13 日推出了 Ultrafast 的有限预览版,这是一种面向 GPT-5.6 Sol 的加速服务模式。该公司表示,其运行速度最高可达标准推理的 14 倍,每秒最多可生成 750 个输出 token。
新增之处
这一提速来自与 Cerebras 的合作。OpenAI 的服务集群其他部分仍基于 Nvidia,而这也是该公司首次公开在生产规模上,将前沿模型运行在另一家厂商的加速器上。Cerebras 打造的是晶圆级处理器,可将模型权重保存在芯片内存中,这也是其推理表现一向很快的原因——悬而未决的问题在于,前沿实验室是否会在这类芯片上交付产品。
每秒 750 个 token 意味着什么
在标准的前沿模型速度下,一条较长的 agent 执行路径以分钟计。按这一速度,模型完成一个段落的时间比人阅读它还短,这会让整个产品类别从异步转向交互式。OpenAI 点名了事件响应、客户服务、金融分析和电子商务——这些场景的瓶颈是等待,而不是答案本身。
官方给出的限制
这只是面向 少数客户 的预览版,OpenAI 表示,将会在“容量增加后”扩大访问范围——这等于承认,设定上限的不是需求,而是 Cerebras 的产能。目前尚未公布定价,而且 14 倍 和 750 这两个数字指的是上限,而非持续吞吐量。
超越延迟之外的重要性
过去两年,所有大型推理采购方都在努力建立第二供应来源。如今,一家前沿实验室把自家旗舰模型部署在非 Nvidia 硬件上,是迄今最有力的存在性证明,说明替代芯片不仅能跑基准测试。
