OpenAI 选择在首次亮相 Hot Chips 时,用数字来说明其自研推理 ASIC Jalapeño,并表示这款芯片已经在为 Codex 提供服务。演讲于 8 月 25 日周二晚些时候在 Stanford 举行。这是该公司首次公开展示自家芯片并附带具体数据。

实际披露了什么

单芯片参数:基于 MXFP4-by-MXFP4 的 13.4 PFLOP/s 矩阵计算能力,15.4 TB/s 的 HBM4 带宽,容量为 216 GiB,封装功耗为 700 瓦。其互连采用基于 Broadcom Tomahawk 6 交换机的半扁平双层 Clos 架构——在由 128 颗 ASIC 组成的集群内形成 600 GB/s 的本地域,在整个系统内形成 200 GB/s 的全局域。Broadcom 和 Celestica 被列为合作伙伴。

时间表才是最令人印象深刻的部分

OpenAI 直接给出了时间线:2024 年末完成架构概念,2025 年冻结 RTL,2025 年末流片,2026 年初在芯片上运行 Codex,随后是 ChatGPT。从空白页到承载生产工作负载,耗时大约两年,这对一款首版加速器来说速度很快。

常见解读哪里错了

这里有三个错误,而且彼此叠加。第一,27 EFLOP/s 是系统级数字——13.4 PFLOP/s 乘以 2,048 颗芯片,再加上 432 TiB 的总内存。它会被拿去和 Nvidia 的单 GPU 指标并列比较,但那样毫无意义。第二,MXFP4 是目前可用的最小、最有利的精度。4 位微缩矩阵运算不能与密集型 FP8 或 BF16 数字相提并论,而且 OpenAI 并未公布任何密集型指标,因此任何跨精度计算得出的“胜过 Nvidia”都不成立。第三,700 W 与 GB200 的 1.2 kW 以及 GB300 的 1.4 kW 的比较是封装功耗对比,而不是每瓦性能结果——这些 Nvidia 芯片是具备训练能力的 CPU 加 GPU 超级芯片,而 Jalapeño 仅用于推理,且未展示任何共同基准测试。

而且,这只是首批硅片

在 A0 返回实验室之后到演讲举行之前,软件栈已经完成启动。这是一个从实验室走向有限服务的故事。关于制程节点、晶圆产量、良率或部署规模,OpenAI 都没有披露——而这些正是把一颗可工作的芯片与一条供应链区分开来的那组关键信息。