Nvidia a publié le 21 juillet une analyse technique approfondie et un livre blanc détaillant la microarchitecture des cœurs Olympus dans son CPU Vera — la moitié processeur de la plateforme Vera Rubin — ainsi que ses premiers résultats SPEC CPU 2026.

Ce qui est vraiment nouveau

Les spécifications phares — 88 cœurs, 176 threads, 164MB de L3 unifié et 1.2 TB/s de bande passante mémoire — avaient été dévoilées dès GTC en mars. Ce qui a été publié le 21 juillet, ce sont les entrailles : un décodeur 10-wide alimenté par un fetch de 16 instructions et une file de décodage de 48 instructions, un prédicteur de branchement neuronal gérant deux branchements par cycle, 18 voies d’exécution (huit entières, six vectorielles/FP, quatre de chargement, deux de stockage) et un renommage à 10 micro-opérations par cycle.

Le cache et la mémoire

Chaque cœur dispose de 64KB de cache d’instructions L1 4-way, de 96KB de cache de données L1 6-way et de 2MB de L2, en plus des 164MB de L3 partagés et d’un TLB L2 de 3 000 entrées. Nvidia décrit aussi un graph prefetcher destiné aux structures de données riches en pointeurs, ainsi que le memory renaming et la value prediction. La puce est une puce monolithique — la manière assumée par Nvidia d’éviter la « chiplet tax » — alimentée par de la LPDDR5X, qu’elle dit offrir 40 % de latence en moins et un débit par watt 5 fois supérieur à celui de la DDR5.

Le benchmark, à lire attentivement

Nvidia annonce un Vera à deux sockets à 925 SPECrate2026_int_base contre 898 pour un AMD EPYC 9755 à deux sockets — soit environ 3%. Mais ces chiffres sont des estimations issues d’un système de préproduction, compilées en interne avec GNU 15.2, et non des soumissions officielles à SPEC. Officiellement, les systèmes EPYC à deux sockets soumis dépassent déjà les 1,000, et les versions Turin Dense dépassent les 1,200.

La suite

Les premiers échantillons silicium ont été remis à OpenAI, Anthropic, Oracle Cloud et SpaceX AI ; le ProLiant Compute DL394 Gen12 de HPE doit être commercialisé à l’automne 2026. Nvidia affirme jusqu’à 1.8x sur les charges de travail agentiques par rapport à x86.