Google développe une puce serveur spécialisée qui intégrerait directement dans le silicium l'architecture de son modèle Gemini, selon un rapport de The Information relayé par Reuters. Codée « Frozen v2 », la puce est conçue pour exécuter les modèles de Google de manière bien plus efficace que les accélérateurs à usage général.

Figer le modèle dans le matériel

L'idée centrale marque une rupture avec la manière dont les puces IA sont généralement conçues. Plutôt que de conserver un accélérateur suffisamment flexible pour exécuter n'importe quel modèle, Frozen v2 figerait certains aspects de l'architecture de Gemini dans le matériel lui-même — sacrifiant la généralité au profit de l'efficacité sur les charges de travail spécifiques qui importent le plus à Google. Il s'agit d'un pari de co-conception matériel-logiciel : façonner la puce autour du modèle plutôt qu'adapter le modèle à la puce.

Un objectif fixé à 2028

La puce vise 2028, selon le rapport — une cible, et non une date de commercialisation, suffisamment lointaine pour que la conception puisse encore évoluer. Des éléments de couverture secondaire suggèrent que Frozen v2 viendrait compléter, et non remplacer, la gamme TPU existante de Google, offrant à Google une option sur mesure aux côtés de ses accélérateurs à usage général plutôt qu'un changement total.

Pourquoi l'économie pousse dans cette direction

Ce mouvement reflète l'évolution des coûts de l'inférence. À mesure que les modèles traitent d'énormes volumes de requêtes, le coût marginal de chaque inférence devient déterminant, et gratter des gains d'efficacité à partir d'un silicium adapté à une seule architecture peut surpasser une puce flexible exécutant la même tâche. Google, qui conçoit déjà ses propres TPU, indique ainsi qu'il estime que les prochains gains d'efficacité viendront d'un resserrement du lien entre le modèle et le silicium.

À lire comme un signal

Comme les détails reposent sur un seul rapport — attribué ici à The Information, relayé par Reuters —, il convient de considérer ces éléments comme des informations rapportées et non comme des projets de produit confirmés. Mais la direction est notable : un laboratoire à la pointe prêt à graver une génération de modèle dans une puce fait un pari de long terme sur le fait que son architecture est suffisamment stable pour mériter d'être coulée dans le silicium.