Google está desarrollando un chip especializado para servidores que integraría directamente en el silicio la arquitectura de su modelo Gemini, según un informe de The Information difundido por Reuters. Con el nombre en clave "Frozen v2," el chip está diseñado para ejecutar los modelos de Google de forma mucho más eficiente que los aceleradores de propósito general.
Congelar el modelo en el hardware
La idea central supone una ruptura con la forma en que suelen construirse los chips de IA. En lugar de mantener el acelerador lo bastante flexible para ejecutar cualquier modelo, Frozen v2 congelaría aspectos de la arquitectura de Gemini dentro del propio hardware, a cambio de sacrificar generalidad en favor de eficiencia en las cargas de trabajo concretas que más le importan a Google. Es una apuesta de diseño conjunto entre hardware y software: moldear el chip en torno al modelo en lugar de adaptar el modelo al chip.
Un objetivo para 2028
Según el informe, el chip apunta a 2028; se trata de un objetivo, no de una fecha de lanzamiento, y aún queda lo bastante lejos como para que el diseño pueda cambiar. La cobertura secundaria sugiere que Frozen v2 complementaría, en lugar de sustituir, la línea actual de TPU de Google, ofreciendo a la compañía una opción diseñada a medida junto a sus aceleradores de propósito general, en vez de un cambio total.
Por qué la economía empuja en esta dirección
El movimiento refleja hacia dónde se dirigen los costes de inferencia. A medida que los modelos atienden volúmenes enormes de consultas, el coste marginal de cada inferencia pasa a dominar, y exprimir eficiencia de un silicio adaptado a una sola arquitectura puede superar a la de un chip flexible haciendo el mismo trabajo. Google, que ya diseña sus propios TPU, está señalando que cree que las próximas ganancias de eficiencia vendrán de estrechar el vínculo entre el modelo y el hardware.
Hay que leerlo como una señal
Como los detalles se apoyan en un único informe —atribuido aquí a The Information, tal como lo recoge Reuters—, las especificaciones deben considerarse información publicada y no planes de producto confirmados. Pero la dirección es notable: un laboratorio puntero dispuesto a grabar una generación de modelos en un chip está haciendo una apuesta a largo plazo de que su arquitectura es lo bastante estable como para merecer ser plasmada en silicio.