OpenAI использовала свое первое в истории выступление на Hot Chips, чтобы назвать цифры для своего собственного inference ASIC Jalapeño и сообщить, что этот чип уже обслуживает Codex. Доклад состоялся поздно вечером во вторник, 25 августа, в Stanford. Впервые компания публично показала свой собственный кремний с привязанными к нему показателями.

Что именно было раскрыто

На один чип: 13,4 PFLOP/s матричных вычислений MXFP4-by-MXFP4, 15,4 TB/s пропускной способности HBM4 при объеме 216 ГиБ, в корпусе мощностью 700 ватт. Межсоединение — полу-сплющенный двухуровневый Clos, построенный на коммутаторах Broadcom Tomahawk 6: локальный домен на 600 GB/s в кластере из 128 ASIC, глобальный домен на 200 GB/s во всей системе. Broadcom и Celestica были названы в числе партнеров.

Самое впечатляющее — график

OpenAI дословно обозначила сроки: концепция архитектуры — в конце 2024 года, заморозка RTL — в 2025-м, tape-out — в конце 2025-го, Codex заработает на чипе в начале 2026 года, а затем последует ChatGPT. Примерно два года от пустого листа до обслуживания production workload — это быстро для accelerator первой итерации.

Что не так с распространенной трактовкой

Ошибок три, и они усиливают друг друга. Во-первых, 27 EFLOP/s — это системный показатель: 13,4 PFLOP/s, умноженные на 2 048 чипов, плюс 432 TiB суммарной памяти. Его будут сопоставлять с per-GPU цифрами Nvidia, где он ничего не значит. Во-вторых, MXFP4 — это самая маленькая и наиболее выгодная доступная точность. Четырехбитная microscaled matrix math не сопоставима с dense FP8 или BF16, а OpenAI вообще не публиковала dense-метрику, так что любые арифметические сравнения в духе "обгоняет Nvidia", которые пересекают разные точности, невалидны. В-третьих, сравнение 700 Вт с 1,2 кВт у GB200 и 1,4 кВт у GB300 — это сравнение мощности корпуса, а не результат по производительности на ватт: эти решения Nvidia — это superchip с CPU и GPU, рассчитанные на обучение, тогда как Jalapeño предназначен только для inference, и общего бенчмарка не показали.

И это первый кремний

Программный стек поднимали уже после того, как A0 вернулся в лабораторию, и до самого доклада. Это история от лаборатории до ограниченного сервиса. Не было раскрыто ничего о техпроцессе, объеме wafer, yield или размере парка — а именно эти факты отделяют работающий чип от цепочки поставок.