OpenAI utilizó su primera aparición en Hot Chips para poner cifras a la diapositiva de su ASIC de inferencia desarrollado internamente, Jalapeño, y para decir que el chip ya está dando servicio a Codex. La charla tuvo lugar el martes 25 de agosto en Stanford. Es la primera vez que la compañía muestra públicamente su propio silicio con cifras concretas.

Lo que realmente se reveló

Por chip: 13,4 PFLOP/s de computación matricial MXFP4-by-MXFP4, 15,4 TB/s de ancho de banda HBM4 a través de 216 GiB, dentro de un encapsulado de 700 vatios. La interconexión es un Clos de dos niveles parcialmente aplanado, basado en switches Broadcom Tomahawk 6: un dominio local de 600 GB/s a lo largo de un clúster de 128 ASIC y un dominio global de 200 GB/s en todo el sistema. Se reconoció a Broadcom y Celestica como socios.

Lo impresionante es el calendario

OpenAI dio la cronología de forma literal: concepto de arquitectura a finales de 2024, congelación del RTL en 2025, tape-out a finales de 2025, Codex en funcionamiento sobre el chip a principios de 2026, seguido de ChatGPT. Pasar de una página en blanco a servir una carga de trabajo de producción en unos dos años es rápido para un acelerador de primera iteración.

Lo que falla en el encuadre habitual

Tres errores, y se acumulan. Primero, 27 EFLOP/s es una cifra de sistema — 13,4 PFLOP/s multiplicados por 2.048 chips, junto con 432 TiB de memoria agregada. Se citará junto a las cifras por GPU de Nvidia, donde no significa nada. Segundo, MXFP4 es la precisión más pequeña y más favorable disponible. La matemática matricial microscalada de cuatro bits no es comparable a una cifra FP8 o BF16 densa, y OpenAI no publicó ninguna cifra densa, así que cualquier aritmética de “supera a Nvidia” que cruce precisiones queda invalidada. Tercero, los 700 W frente a los 1,2 kW de GB200 y los 1,4 kW de GB300 constituyen una comparación de potencia de encapsulado, no un resultado de rendimiento por vatio: esas piezas de Nvidia son superchips CPU+GPU con capacidad de entrenamiento, mientras que Jalapeño es solo para inferencia, y no se mostró ningún benchmark común.

Y es silicio de primera tanda

La pila de software se puso en marcha entre el retorno de A0 al laboratorio y la charla. Es una historia que va del laboratorio a un servicio limitado. No se reveló nada sobre el nodo de proceso, el volumen de obleas, el rendimiento ni el tamaño de la flota, que es exactamente el conjunto de datos que separa un chip funcional de una línea de suministro.