Nella sessione AI 1 di Hot Chips, martedì, due ingegneri Nvidia hanno presentato il Groq 3 LPU — e poi hanno spiegato che Nvidia non lo costruisce. I componenti che entreranno nei rack di generazione Vera Rubin vengono acquistati da Groq, che Nvidia sta assorbendo in quello che il talk ha descritto come un più ampio acquihire.

I numeri, e il loro vero denominatore

Un rack di 256 LPUs offre 315 PFLOPS di FP8, dispone di 128 GB di SRAM e sostiene 40 PB/s di larghezza di banda SRAM aggregata, eseguendo 11.000 token di decode al secondo su un modello da 31 miliardi di parametri. TDP per LPU e nodo di processo non sono stati resi noti.

Che cosa sbaglia la lettura comune

Ogni cifra principale qui è su scala rack e verrà letta come se fosse su scala chip. "128 GB di SRAM" suona come un’enorme cache on-die; divisi per 256 equivalgono a circa mezzo gigabyte per LPU, senza alcuna HBM — che è il compromesso noto di Groq, non una sorpresa, ma significa che un modello deve essere shardato su centinaia di chip per poterci stare. Un rack da 128 GB non può contenere un modello grande più la KV cache come può fare un singolo componente da 216 GiB di HBM4. "40 PB/s" è la stessa aritmetica applicata alla banda: la somma di 256 array SRAM separati, senza dire nulla su quanto velocemente i dati passino tra i chip, che è il vincolo decisivo in un design basato solo su SRAM. E 315 PFLOPS è il picco FP8, con la demo del token-rate eseguita su un modello da 31B — piccolo secondo gli standard del 2026, e dimensionato per rientrare nel budget di SRAM.

La seconda distorsione è societaria

Questo non è "l'LPU di Nvidia". Il talk afferma ufficialmente che Nvidia al momento non li produce, che ne ha uno proprio in sviluppo e che sta acquistando questi da Groq. Raccontarlo come il lancio di un prodotto Nvidia ribalta ciò che è stato effettivamente detto dal palco.

Perché Nvidia dovrebbe farlo

Le GPU dense sono la forma sbagliata per il decode a bassa latenza: il lavoro è memory-bound, i batch sono piccoli e la latenza HBM domina. Un’architettura solo SRAM attacca esattamente quel problema. Nvidia, sul palco di una conferenza, a presentare la risposta di un concorrente — mentre compra i componenti e assume il team — è un’ammissione del divario molto più chiara di qualsiasi slide di roadmap.