OpenAI a utilisé sa première apparition à Hot Chips pour chiffrer son ASIC d’inférence interne, Jalapeño, et pour préciser que la puce sert déjà Codex. La présentation s’est tenue mardi 25 août, en soirée, à Stanford. C’est la première fois que l’entreprise montre publiquement son propre silicium avec des chiffres à l’appui.
Ce qui a réellement été divulgué
Par puce : 13,4 PFLOP/s de calcul matriciel MXFP4-sur-MXFP4, une bande passante HBM4 de 15,4 TB/s sur 216 Gio, le tout dans un boîtier de 700 watts. L’interconnexion repose sur un Clos à deux niveaux partiellement aplati, basé sur des commutateurs Broadcom Tomahawk 6 — un domaine local de 600 GB/s sur un cluster de 128 ASIC, et un domaine global de 200 GB/s sur l’ensemble du système. Broadcom et Celestica ont été citées comme partenaires.
Le calendrier est l’élément impressionnant
OpenAI a donné le calendrier mot pour mot : concept d’architecture fin 2024, gel RTL en 2025, tape-out fin 2025, Codex exécuté sur la puce début 2026, puis ChatGPT dans un second temps. Passer d’une page blanche à une charge de production en un peu plus de deux ans est rapide pour un accélérateur de première génération.
Ce que le cadrage habituel omet
Trois erreurs, et elles se cumulent. D’abord, 27 EFLOP/s est un chiffre système — 13,4 PFLOP/s multipliés par 2 048 puces, avec 432 TiB de mémoire agrégée. Il sera cité à côté des chiffres par GPU de Nvidia, où il ne signifie rien. Ensuite, MXFP4 est la précision la plus petite et la plus favorable disponible. Une mathématique matricielle microscalée en quatre bits n’est pas comparable à un chiffre dense en FP8 ou BF16, et OpenAI n’a publié aucun chiffre dense, si bien que tout calcul de type « bat Nvidia » qui franchit les précisions est nul. Enfin, la comparaison entre 700 W et 1,2 kW pour le GB200 ou 1,4 kW pour le GB300 est une comparaison de puissance de boîtier, pas un résultat de performance par watt — ces puces Nvidia sont des superchips CPU+GPU dotées de capacités d’entraînement, tandis que Jalapeño est réservé à l’inférence, et aucun benchmark commun n’a été présenté.
Et il s’agit bien du premier silicium
La pile logicielle a été mise en route entre le retour de A0 au laboratoire et la présentation. C’est l’histoire d’un passage du labo à un service limité. Rien n’a été divulgué sur le nœud de gravure, les volumes de wafers, le rendement ou la taille du parc — précisément l’ensemble des faits qui distingue une puce fonctionnelle d’une chaîne d’approvisionnement.
