A Nvidia fez a primeira divulgação arquitetural da GPU Rubin na Hot Chips, na noite de segunda-feira: dois dies do tamanho de um retículo em TSMC 3nm, 336 bilhões de transistores, cerca de 1,6 vez o Blackwell, com até 288 GB de HBM4 a 22 TB/s — cerca de 2,8x a largura de banda de HBM3e do Blackwell.
O rack, e o prédio
No nível do rack, o NVLink 6 movimenta 3,6 TB/s all-to-all por GPU com 130 TFLOPS de computação in-network, em distribuição de 800 VDC e com entrada líquida de 45°C. A Nvidia afirma 40% mais GPUs por watt provisionado por meio de suavização de energia. Depois há um segundo conjunto de números — 2 ZFLOPS de inferência NVFP4, 1,4 ZFLOPS de treinamento, 11 PB de HBM4, 800 PB/s — e esses são apresentados em escala de fábrica de IA de 100 MW.
O que a leitura convencional interpreta errado
Três erros, e eles se somam. Primeiro, 11 PB de HBM4 é um prédio, não um rack e não um sistema; trata-se da memória instalada em uma instalação de 100 megawatts. Os 2 ZFLOPS usam o mesmo denominador. Ambos serão reproduzidos como números de rack ainda esta semana. Segundo — e este é o ponto que inverte a história — 288 GB não é mais memória do que se pode comprar hoje. É a mesma capacidade do Blackwell Ultra. Quem ler "HBM4" como "agora cabem modelos maiores em uma única GPU" estará entendendo ao contrário; o que melhorou foi a rapidez com que os pesos se movem, não quantos deles ficam ali. Terceiro, o número de "até 30x" não é um ganho de velocidade. Trata-se de tokens por megawatt em alta interatividade, medidos em uma carga de trabalho agentic escolhida pela própria empresa — DeepSeek-v4-PRO com contexto acima de 140K — e 10x é a mesma curva em outro ponto dela.
A métrica entrega a mensagem
A Nvidia deixou de liderar com FLOPS e passou a liderar com tokens por watt em uma latência específica. Isso não é desvio de marketing. É uma leitura precisa do que hoje limita seus clientes: não o preço do silício, mas quanta energia um site consegue conectar e quantos tokens podem ser extraídos de cada megawatt depois disso. Uma empresa que cita throughput por watt está dizendo qual restrição considera que você realmente está comprando.
O que isso não é
Vera Rubin já havia sido declarada em produção na Computex no início deste ano. Esta é uma divulgação técnica sobre um produto já em envio, não uma prévia de um produto ainda não lançado — o que torna o enquadramento da matéria em escala de fábrica uma escolha, e não uma necessidade.
