Nvidia ha fornito la prima rivelazione architetturale della GPU Rubin all’Hot Chips lunedì sera: due die delle dimensioni di un reticolo su TSMC a 3nm, 336 miliardi di transistor, circa 1,6 volte Blackwell, con fino a 288 GB di HBM4 a 22 TB/s — circa 2,8x la larghezza di banda HBM3e di Blackwell.
Il rack, e l’edificio
A livello di rack, NVLink 6 offre 3,6 TB/s all-to-all per GPU con 130 TFLOPS di calcolo in rete, su distribuzione 800 VDC e un ingresso liquido a 45°C. Nvidia sostiene il 40% in più di GPU per watt provisioned grazie al power smoothing. Poi c’è un secondo livello di numeri — 2 ZFLOPS di inferenza NVFP4, 1,4 ZFLOPS di training, 11 PB di HBM4, 800 PB/s — e questi sono dichiarati a scala di AI factory da 100 MW.
Ciò che la cornice convenzionale fraintende
Tre errori, e si sommano. Primo, 11 PB di HBM4 è un edificio, non un rack e non un sistema; è la memoria installata in una struttura da 100 megawatt. I 2 ZFLOPS hanno lo stesso denominatore. Entrambi verranno ristampati come cifre da rack entro la settimana. Secondo — ed è questo il punto che rovescia la storia — 288 GB non sono più memoria di quanta se ne possa comprare oggi. È la stessa capacità di Blackwell Ultra. Chiunque legga "HBM4" come "ora modelli più grandi entrano su una sola GPU" la sta interpretando al contrario; ciò che è migliorato è la velocità con cui i pesi si muovono, non quanti ne stanno lì. Terzo, la cifra del "fino a 30x" non è un incremento di velocità. È il numero di token per megawatt ad alta interattività, misurato su un workload agentico scelto dal vendor — DeepSeek-v4-PRO con contesto oltre 140K — e 10x è la stessa curva in un punto diverso.
La metrica è la chiave
Nvidia ha smesso di aprire con i FLOPS e ha iniziato ad aprire con i token per watt a una data latenza. Non è una deriva di marketing. È una lettura accurata di ciò che oggi vincola i suoi clienti: non il prezzo del silicio, ma quanta potenza può essere collegata a un sito, e quanti token si possono estrarre da ogni megawatt una volta fatto. Un vendor che cita la produttività per watt ti sta dicendo quale vincolo ritiene che tu stia davvero valutando.
Una cosa che non è
Vera Rubin era già stata dichiarata in produzione al Computex all’inizio di quest’anno. Questa è una divulgazione tecnica su un prodotto in spedizione, non un’anteprima di uno non ancora rilasciato — il che rende la cornice a scala di fabbrica dei numeri del titolo una scelta, non una necessità.
