Google은 자사의 Gemini 모델 아키텍처를 실리콘에 직접 담는 특수 서버 칩을 개발하고 있다고 The Information이 Reuters를 통해 전했다고 합니다. 코드명 "Frozen v2,"인 이 칩은 범용 가속기보다 Google의 모델을 훨씬 더 효율적으로 구동하도록 설계됐습니다.

모델을 하드웨어에 고정하는 방식

핵심 아이디어는 AI 칩이 보통 만들어지는 방식과는 다릅니다. 가속기를 어떤 모델이든 실행할 수 있을 만큼 유연하게 유지하는 대신, Frozen v2는 Gemini 아키텍처의 일부를 하드웨어 자체에 고정해 Google이 가장 중요하게 여기는 특정 워크로드에서 범용성 대신 효율을 택합니다. 이는 하드웨어와 소프트웨어를 함께 설계하는 베팅으로, 모델에 맞춰 칩을 조정하는 대신 칩에 맞춰 모델을 조정하는 접근입니다.

2028년 목표

보도에 따르면 이 칩의 목표 시점은 2028년입니다. 이는 출하 시점이 아니라 목표일 뿐이며, 설계는 그 전에 바뀔 수 있을 만큼 여유가 있습니다. 2차 보도에 따르면 Frozen v2는 Google의 기존 TPU 라인을 대체하기보다 보완하는 역할을 할 가능성이 있어, 범용 가속기를 전면 교체하는 것이 아니라 전용 옵션을 추가하는 셈입니다.

경제성이 이 방향을 밀어붙이는 이유

이 움직임은 추론 비용이 어디로 향하고 있는지를 보여줍니다. 모델이 막대한 질의량을 처리할수록 각 추론의 한계 비용이 중요해지고, 하나의 아키텍처에 맞춰 설계된 실리콘에서 효율을 더 짜내는 것이 같은 작업을 수행하는 유연한 칩보다 유리해질 수 있습니다. 이미 자체 TPU를 설계해온 Google은 다음 효율 개선이 모델과 하드웨어의 결합을 더욱 강화하는 데서 나온다고 보고 있다는 신호를 보내고 있습니다.

시그널로 읽어야 합니다

세부 내용이 단일 보도, 즉 여기서는 Reuters가 전한 The Information 보도에 기반한 만큼, 구체 사항은 확정된 제품 계획이 아니라 보도로 받아들여야 합니다. 그러나 방향성은 분명합니다. 최전선의 연구소가 모델 세대를 칩에 하드와이어링하겠다고 나서는 것은, 그 아키텍처가 실리콘으로 주조할 만큼 오래 유지될 것이라는 장기 베팅을 하고 있다는 뜻입니다.