На сессии AI 1 на Hot Chips во вторник два инженера Nvidia представили Groq 3 LPU — а затем пояснили, что Nvidia его не разрабатывает. Компоненты для стоек поколения Vera Rubin компания покупает у Groq, которого Nvidia поглощает в рамках того, что в докладе было названо более широкой acquihire-сделкой.

Цифры и их настоящий знаменатель

Стойка из 256 LPU обеспечивает 315 PFLOPS FP8, располагает 128 ГБ SRAM и поддерживает 40 ПБ/с суммарной пропускной способности SRAM, выполняя 11 000 токенов декодирования в секунду на модели с 31 миллиардом параметров. TDP на один LPU и техпроцесс не раскрывались.

Что неверно в привычной трактовке

Каждая из этих заголовочных цифр относится к масштабу стойки, но будет прочитана как показатель одного чипа. Фраза «128 ГБ SRAM» звучит как огромный кэш на кристалле; если разделить на 256, получается примерно полгигабайта на LPU, при этом без HBM вообще — это известный компромисс Groq, не сюрприз, но он означает, что модель нужно распределять по сотням чипов, чтобы она поместилась. В стойку на 128 ГБ нельзя загрузить большую модель вместе с KV-кэшем так же, как в один чип на 216 ГиБ HBM4. «40 ПБ/с» — та же арифметика, примененная к пропускной способности: сумма 256 отдельных массивов SRAM, которая ничего не говорит о том, как быстро данные проходят между чипами, а именно это и является ограничивающим фактором в архитектуре только на SRAM. И 315 PFLOPS — это пик FP8, при том что демо по скорости токенов было проведено на модели с 31 млрд параметров — небольшой по стандартам 2026 года и подобранной так, чтобы вписаться в бюджет SRAM.

Вторая искажающая деталь — корпоративная

Это не «LPU от Nvidia». В докладе прямо говорится, что Nvidia сейчас не производит такие чипы, что у компании есть собственная разработка, и что она покупает их у Groq. Описывать это как запуск продукта Nvidia — значит переворачивать смысл того, что было сказано со сцены.

Зачем Nvidia это вообще нужно

Плотные GPU плохо подходят для низколатентного декодирования: работа упирается в память, размеры батчей малы, а задержки HBM доминируют. Архитектура только на SRAM бьет ровно по этой проблеме. То, что Nvidia вышла на сцену конференции и представила ответ конкурента — одновременно покупая эти чипы и нанимая команду, — куда более ясное признание разрыва, чем любой слайд с дорожной картой.