Nvidia впервые раскрыла архитектуру GPU Rubin на Hot Chips в понедельник вечером: два кристалла размером с ретикул на TSMC 3nm, 336 billion transistors, примерно в 1.6 раза больше Blackwell, с up to 288 GB of HBM4 при 22 TB/s — примерно в 2.8x больше пропускной способности HBM3e у Blackwell.

Стойка и здание

На уровне стойки NVLink 6 обеспечивает 3.6 TB/s all-to-all per GPU с 130 TFLOPS of in-network compute, при распределении 800 VDC и 45°C liquid inlet. Nvidia утверждает, что благодаря сглаживанию энергопотребления можно разместить 40% more GPUs per provisioned watt. Затем идет второй уровень цифр — 2 ZFLOPS NVFP4 inference, 1.4 ZFLOPS training, 11 PB HBM4, 800 PB/s — и все это заявлено для масштаба 100 MW AI-factory scale.

Что неверно в привычной трактовке

Три ошибки, и они складываются. Во-первых, 11 PB of HBM4 is a building, а не стойка и не система; это память, установленная в объекте мощностью 100 мегаватт. Показатель 2 ZFLOPS — с тем же знаменателем. В течение недели обе цифры будут перепечатывать как параметры стойки. Во-вторых — и именно здесь история переворачивается — 288 GB is not more memory than you can buy today. Это та же емкость, что и у Blackwell Ultra. Тот, кто читает "HBM4" как "теперь в один GPU помещаются более крупные модели", понимает все наоборот; улучшилась скорость перемещения весов, а не их количество. В-третьих, показатель "up to 30x" — это не ускорение. Это tokens per megawatt при высокой интерактивности, измеренные на одной выбранной вендором агентной нагрузке — DeepSeek-v4-PRO с контекстом более 140K — а 10x это та же кривая в другой точке.

Показатель выдает смысл

Nvidia перестала делать упор на FLOPS и начала делать упор на tokens per watt at a given latency. Это не маркетинговый сдвиг. Это точное отражение того, что теперь ограничивает ее клиентов: не цена кремния, а то, сколько мощности может подключить площадка и сколько токенов можно выжать из каждого мегаватта после этого. Вендор, который цитирует пропускную способность на ватт, показывает, против какого ограничения, по его мнению, вы на самом деле выбираете.

Чем это не является

Vera Rubin уже была объявлена в производстве на Computex ранее в этом году. Это техническое раскрытие о поставляемом продукте, а не анонс еще не выпущенного, — что делает фабричный масштаб в заголовочных цифрах выбором, а не необходимостью.