화요일 Hot Chips의 AI 1 세션에서 Nvidia 엔지니어 두 명은 Groq 3 LPU를 소개한 뒤, Nvidia가 이를 만들지 않는다고 설명했다. Vera Rubin 세대 랙에 들어가는 부품은 Groq에서 구매하는 것이며, 발표에서는 이를 더 큰 acquihire의 일환이라고 설명했다.
수치와 그 진짜 분모
256개 LPU로 구성된 랙은 315 PFLOPS의 FP8 성능을 제공하고, 128 GB의 SRAM을 탑재하며, 40 PB/s의 총 SRAM 대역폭을 유지한다. 또한 31억 개 파라미터 모델에서 초당 11,000개 디코드 토큰을 처리한다. LPU당 TDP와 공정 노드는 공개되지 않았다.
일반적인 해석이 놓치는 점
여기서 나온 모든 헤드라인 수치는 칩 규모가 아니라 랙 규모이며, 칩 규모로 읽히기 쉽다. "128 GB의 SRAM"은 거대한 온다이 캐시처럼 들리지만, 256으로 나누면 LPU당 약 0.5 GB에 불과하며 HBM은 전혀 없다. 이는 알려진 Groq의 절충점으로, 놀라운 일은 아니지만 모델을 수백 개 칩에 걸쳐 분할해야 한다는 뜻이다. 128 GB 랙은 단일 216 GiB HBM4 부품처럼 대형 모델과 KV 캐시를 함께 담을 수 없다. "40 PB/s"도 같은 방식으로 대역폭에 적용한 수치로, 256개의 별도 SRAM 배열을 합친 값일 뿐 칩 사이에서 데이터가 얼마나 빠르게 오가는지는 말해주지 않는다. 이는 SRAM 전용 설계에서 병목이 되는 지점이다. 315 PFLOPS 역시 최대 FP8 성능이며, 토큰 속도 시연은 31B 모델에서 이뤄졌다. 2026년 기준으로는 작은 규모이며, SRAM 용량에 맞춰 설계된 것이다.
두 번째 왜곡은 기업 차원이다
이것은 "Nvidia의 LPU"가 아니다. 발표에서는 Nvidia가 현재 이를 생산하지 않으며, 자체 개발품이 따로 있고, 이 칩들은 Groq에서 구매한다고 명시했다. 이를 Nvidia 제품 출시로 적는다면 무대에서 실제로 말한 내용과 정반대로 전달하는 셈이다.
Nvidia가 왜 이런 선택을 했는가
고밀도 GPU는 낮은 지연시간의 디코드 작업에 맞지 않는다. 작업은 메모리 병목이 심하고, 배치 크기는 작으며, HBM 지연시간이 지배적이기 때문이다. SRAM 전용 아키텍처는 바로 그 지점을 겨냥한다. Nvidia가 콘퍼런스 무대에서 경쟁사의 해법을 소개하면서도, 부품을 구매하고 팀까지 영입하는 모습은 어떤 로드맵 슬라이드보다도 격차를 분명하게 인정하는 신호다.
