周二在 Hot Chips 的 AI 1 场次上,两名 Nvidia 工程师介绍了 Groq 3 LPU——随后又解释说,Nvidia 并不制造这款产品。进入 Vera Rubin 代际机架的部件是从 Groq 采购的,而 Nvidia 正在吸收 Groq,演讲将此描述为更广泛的 acquihire。

这些数字,以及它们真正的分母

一整机架 256 颗 LPU 可提供 315 PFLOPS 的 FP8 算力,配备 128 GB SRAM,并可维持 40 PB/s 的 SRAM 总带宽,在一款 310 亿参数模型上实现 每秒 11,000 个解码 token。单颗 LPU 的 TDP 和制程节点均未披露。

常见说法哪里出了错

这里的每一个头条数字都属于 机架级,却会被解读成芯片级。"128 GB SRAM" 听起来像是巨大的片上缓存;除以 256 后,实际上每颗 LPU 约为半个 GB,且根本没有 HBM——这正是 Groq 已知的取舍,并不意外,但这意味着模型必须拆分到数百颗芯片上才能装下。128 GB 的机架无法像一颗 216 GiB HBM4 芯片那样,同时容纳大模型和 KV cache。"40 PB/s" 也是同样的算法应用于带宽:256 个独立 SRAM 阵列之和,并未说明数据在 芯片之间 的传输速度,而这恰恰是纯 SRAM 设计中的关键瓶颈。315 PFLOPS 则是峰值 FP8,且该 token 速率演示使用的是 310 亿参数模型——按 2026 年的标准并不大,尺寸也正好适合 SRAM 预算。

第二层失真是公司关系

不是“Nvidia 的 LPU”。 演讲明确表示,Nvidia 目前并不生产 LPU,自己也在开发相关产品,并且正在从 Groq 采购这些芯片。把这篇报道写成 Nvidia 的产品发布,会把台上真正说法完全倒转。

Nvidia 为什么要这么做

高密度 GPU 并不适合低延迟解码:这项工作受内存带宽限制,批量大小很小,而且 HBM 延迟占主导。纯 SRAM 架构正是针对这一点。Nvidia 站在大会舞台上介绍竞争对手的答案——同时买它的芯片、挖它的团队——比任何路线图幻灯片都更清楚地说明了这种差距。