OpenAI ha usato la sua prima apparizione a Hot Chips per mettere dei numeri sulla slide del suo ASIC di inferenza sviluppato in casa, Jalapeño, e per dire che il chip sta già servendo Codex. L'intervento si è svolto in ritardo martedì 25 agosto a Stanford. È la prima volta che l'azienda mostra in pubblico il proprio silicio con cifre annesse.
Ciò che è stato effettivamente reso noto
Per chip: 13,4 PFLOP/s di calcolo matriciale MXFP4-by-MXFP4, 15,4 TB/s di banda HBM4 su 216 GiB, in un package da 700 watt. L'interconnessione è un Clos a due livelli semi-appiattito costruito su switch Broadcom Tomahawk 6 — un dominio locale da 600 GB/s su un cluster da 128 ASIC, un dominio globale da 200 GB/s sull'intero sistema. Broadcom e Celestica sono state citate come partner.
La parte impressionante è la tempistica
OpenAI ha fornito la cronologia testualmente: concetto architetturale alla fine del 2024, freeze RTL nel 2025, tape-out alla fine del 2025, Codex in esecuzione sul chip all'inizio del 2026, con ChatGPT a seguire. Circa due anni da una pagina bianca a un carico di lavoro in produzione sono un ritmo rapido per un acceleratore di prima iterazione.
Dove sbaglia l'inquadramento comune
Tre errori, che si sommano. Primo, 27 EFLOP/s è un dato di sistema — 13,4 PFLOP/s moltiplicati per 2.048 chip, insieme a 432 TiB di memoria aggregata. Verrà citato accanto alle cifre per GPU di Nvidia, dove non significa nulla. Secondo, MXFP4 è la precisione più piccola e più favorevole disponibile. La matematica matriciale microscalata a 4 bit non è paragonabile a un valore FP8 o BF16 denso, e OpenAI non ha pubblicato alcun dato denso, quindi qualsiasi aritmetica del tipo "batte Nvidia" che attraversi precisioni diverse è nulla. Terzo, il confronto tra i 700 W e gli 1,2 kW del GB200 e gli 1,4 kW del GB300 è un confronto di potenza del package, non un risultato di performance per watt — quei componenti Nvidia sono superchip CPU-plus-GPU con capacità di training, mentre Jalapeño è solo inferenza, e non è stato mostrato alcun benchmark comune.
E si tratta di primo silicio
Lo stack software è stato avviato tra il rientro dell'A0 in laboratorio e la presentazione. È una storia da laboratorio a servizio limitato. Non è stato rivelato nulla su nodo di processo, volume di wafer, resa o dimensione della flotta — che è esattamente l'insieme di fatti che separa un chip funzionante da una filiera di fornitura.
