Nvidia는 7월 21일, Vera Rubin 플랫폼의 프로세서 절반인 Vera CPU 안에 들어가는 Olympus 코어 마이크로아키텍처와 첫 SPEC CPU 2026 결과를 담은 기술 심층 분석과 백서를 공개했다.
진정으로 새로 공개된 내용
핵심 사양인 88코어, 176스레드, 164MB의 통합 L3, 1.2 TB/s 메모리 대역폭은 이미 3월 GTC에서 공개된 바 있다. 7월 21일 공개된 것은 내부 구조다. 16개 명령어 페치와 48개 명령어 디코드 큐로 공급되는 10-wide 디코더, 사이클당 두 개의 분기를 처리하는 신경망 분기 예측기, 18개 실행 파이프(정수 8개, 벡터/FP 6개, 로드 4개, 스토어 2개), 그리고 사이클당 10개의 마이크로옵으로 리네임하는 구조다.
캐시와 메모리의 내용
각 코어에는 64KB의 4-way L1 명령 캐시, 96KB의 6-way L1 데이터 캐시, 2MB의 L2가 제공되며, 여기에 공유 164MB L3와 3,000 엔트리의 L2 TLB가 더해진다. Nvidia는 포인터 중심 데이터 구조를 겨냥한 그래프 프리페처와 메모리 리네이밍, 값 예측도 설명한다. 이 칩은 모놀리식 다이로, Nvidia는 이를 통해 "칩렛 세금"을 피한다고 밝힌다. 또한 LPDDR5X를 사용하며, DDR5 대비 지연 시간을 40% 줄이고 와트당 대역폭은 5배라고 주장한다.
벤치마크, 주의 깊게 해석해야 한다
Nvidia는 듀얼소켓 Vera가 925 SPECrate2026_int_base를 기록해, 듀얼소켓 AMD EPYC 9755의 898보다 약 3% 앞섰다고 보고했다. 그러나 이 수치는 프리프로덕션 시스템에서 나온 추정치이며, GNU 15.2로 자체 컴파일한 결과로서 공식 SPEC 제출본은 아니다. 공식 제출된 듀얼소켓 EPYC 시스템은 이미 1,000을 넘었고, Turin Dense 제품은 1,200을 상회한다.
향후 방향
초기 실리콘은 OpenAI, Anthropic, Oracle Cloud와 SpaceX AI에 제공됐으며, HPE의 ProLiant Compute DL394 Gen12는 2026년 가을 출하된다. Nvidia는 에이전틱 워크로드에서 x86 대비 최대 1.8배를 주장한다.
