En la sesión AI 1 de Hot Chips, el martes, dos ingenieros de Nvidia presentaron la Groq 3 LPU —y luego explicaron que Nvidia no la fabrica. Las unidades que van a los racks de la generación Vera Rubin se compran a Groq, a quien Nvidia está absorbiendo en lo que la charla describió como un acquihire más amplio.

Las cifras y su verdadero denominador

Un rack de 256 LPUs ofrece 315 PFLOPS de FP8, cuenta con 128 GB de SRAM y mantiene 40 PB/s de ancho de banda agregado de SRAM, ejecutando 11.000 tokens de decodificación por segundo en un modelo de 31.000 millones de parámetros. No se revelaron el TDP por LPU ni el nodo de proceso.

Qué falla en el encuadre habitual

Toda cifra destacada aquí es a escala de rack y se leerá como si fuera a escala de chip. "128 GB de SRAM" suena como una enorme caché en el propio chip; dividido entre 256 equivale a aproximadamente medio gigabyte por LPU, sin HBM en absoluto —que es la compensación conocida de Groq, no una sorpresa, pero implica que un modelo debe repartirse entre cientos de chips para caber. Un rack de 128 GB no puede albergar un modelo grande más la caché KV del modo en que sí puede hacerlo una única pieza de 216 GiB de HBM4. "40 PB/s" es la misma aritmética aplicada al ancho de banda: la suma de 256 matrices SRAM separadas, sin decir nada sobre la velocidad a la que circulan los datos entre chips, que es la restricción decisiva en un diseño solo con SRAM. Y 315 PFLOPS es el pico de FP8, con la demostración de tasa de tokens ejecutada sobre un modelo de 31.000 millones de parámetros —pequeño para los estándares de 2026 y dimensionado para ajustarse al presupuesto de SRAM.

La segunda distorsión es corporativa

Esto no es "la LPU de Nvidia". La charla dice expresamente que Nvidia no las produce actualmente, que la suya está todavía en desarrollo y que estas se están comprando a Groq. Redactarlo como si fuera un lanzamiento de producto de Nvidia invierte lo que realmente se dijo desde el escenario.

Por qué Nvidia haría esto en absoluto

Las GPU densas no son la forma adecuada para la decodificación de baja latencia: el trabajo está limitado por la memoria, los tamaños de lote son pequeños y la latencia de HBM domina. Una arquitectura solo con SRAM ataca exactamente eso. Que Nvidia se suba a un escenario de una conferencia para presentar la respuesta de un competidor —mientras compra las piezas y contrata al equipo— es una admisión más clara de la brecha que cualquier diapositiva de hoja de ruta.