OpenAI usou sua primeira participação no Hot Chips para colocar números no slide de seu ASIC de inferência desenvolvido internamente, Jalapeño, e dizer que o chip já está atendendo o Codex. A apresentação ocorreu na terça-feira, 25 de agosto, em Stanford, já no fim do evento. É a primeira vez que a empresa mostra publicamente seu próprio silício com dados associados.

O que foi efetivamente divulgado

Por chip: 13,4 PFLOP/s de computação matricial MXFP4-by-MXFP4, 15,4 TB/s de largura de banda de HBM4 em 216 GiB, dentro de um pacote de 700 watts. A interconexão é uma Clos de dois níveis parcialmente achatada, construída sobre switches Broadcom Tomahawk 6 — um domínio local de 600 GB/s em um cluster de 128 ASICs, e um domínio global de 200 GB/s em todo o sistema. Broadcom e Celestica foram citadas como parceiras.

O cronograma é a parte impressionante

A OpenAI apresentou a linha do tempo literalmente: conceito de arquitetura no fim de 2024, freeze de RTL em 2025, tape-out no fim de 2025, Codex rodando no chip no início de 2026, com o ChatGPT a seguir. Cerca de dois anos de uma página em branco até atender uma carga de produção é rápido para um acelerador de primeira versão.

O que a interpretação comum erra

Três erros, e eles se somam. Primeiro, 27 EFLOP/s é um número de sistema — 13,4 PFLOP/s multiplicados por 2.048 chips, além de 432 TiB de memória agregada. Ele será citado ao lado de números por GPU da Nvidia, onde não significa nada. Segundo, MXFP4 é a menor e mais favorável precisão disponível. Matemática matricial microescalada de quatro bits não é comparável a um número denso em FP8 ou BF16, e a OpenAI não publicou nenhum número denso; portanto, qualquer aritmética do tipo “supera a Nvidia” que atravesse precisões é inválida. Terceiro, a comparação entre 700 W e 1,2 kW do GB200 e 1,4 kW do GB300 é uma comparação de potência de pacote, não um resultado de desempenho por watt — esses chips da Nvidia são superchips CPU+GPU com capacidade de treinamento, enquanto Jalapeño é apenas de inferência, e nenhum benchmark comum foi mostrado.

E é o primeiro silício

A pilha de software foi ativada entre o retorno do A0 ao laboratório e a apresentação. Essa é uma história de laboratório para serviço limitado. Nada foi divulgado sobre nó de processo, volume de wafers, rendimento ou tamanho da frota — exatamente o conjunto de fatos que separa um chip funcional de uma linha de suprimento.