Google 正在开发一款专用服务器芯片,将其 Gemini 模型架构直接写入硅片,据 The Information 通过 Reuters 转述的报道。该芯片代号为 “Frozen v2”,旨在比通用加速器更高效地运行 Google 的模型。
将模型固化到硬件中
这一核心思路不同于 AI 芯片通常的设计方式。与其让加速器保持足够灵活、以便运行任何模型,Frozen v2 将把 Gemini 架构的部分内容固化进硬件本身——以通用性换取 Google 最看重的特定工作负载效率。这是一场软硬件协同设计的押注:围绕模型塑造芯片,而不是让模型去适配芯片。
2028 年的目标
据报道,这款芯片的目标时间是 2028 年——这只是一个目标,并非发货日期,而且时间还很远,设计仍可能变化。二手报道显示,Frozen v2 将与而非取代 Google 现有的 TPU 产品线,让 Google 在通用加速器之外再拥有一款专门打造的选项,而不是全面转向。
为什么经济性会把方向推向这里
这一举措反映出推理成本的走势。随着模型处理海量查询,每次推理的边际成本变得主导一切,而为某一种架构量身定制的硅片所带来的效率提升,可能胜过运行同样任务的灵活芯片。Google 已经在设计自己的 TPU,如今释放出的信号是,它相信下一轮效率提升来自进一步收紧模型与硬件之间的耦合。
应将其视为一个信号
由于这些细节都基于单一报道——此处为 The Information 通过 Reuters 转述——具体内容应被视为新闻报道,而非已确认的产品计划。但方向本身值得关注:一家前沿实验室愿意将某一代模型“硬编码”进芯片,意味着它在做一场长期押注,相信自己的架构足够稳定,值得被铸进硅片。