Microsoft впервые полностью раскрыла архитектуру Maia 200 на Hot Chips во вторник днем: кристалл площадью 820 мм² с 140 миллиардами транзисторов на TSMC 3 nm, потребляющий 750 Вт, с заявленной производительностью 10 000 TFLOPS FP4, и продемонстрированный в конфигурации из 128 стоек и примерно 6 000 чипов.
Действительно крупный кусок кремния
820 мм² — это класс ретикла, почти предел для одного кристалла. Сетевая архитектура необычна и продумана: кастомный NIC и единый Ethernet без отдельной fabric для scale-out, по восемь Ethernet-линий на SoC, разделенных на четыре сетевых плоскости. Microsoft делает ставку на то, что одна сеть на базе Ethernet сможет обслуживать и scale-up, и scale-out трафик.
Что упускает распространенная трактовка
Две вещи. Во-первых, показатель вычислений — это FP4: 10 PFLOPS четырехбитной математики примерно сопоставимы с 13,4 PFLOP/s MXFP4 у OpenAI и не сопоставимы ни с какими значениями FP8 или BF16. Показатель плотности не раскрывался. Но главный скрытый акцент — память, и для Microsoft он указывает не в лучшую сторону. Maia 200 использует HBM3e, тогда как части, с которыми его показали в тот же день, используют HBM4. Microsoft раскрыла пропускную способность — 7 ТБ/с, — но не емкость, лишь число стеков. Упоминать 7 ТБ/с рядом с 15,4 ТБ/с у OpenAI, не отмечая поколение памяти, — ошибка: шесть стеков HBM3e — это подсистема памяти уровня 2024 года на ускорителе 2026 года, а именно емкость определяет, какие модели помещаются.
«Готовится к развёртыванию» — это не «развернуто»
Microsoft охарактеризовала чип как готовящийся к использованию в Azure. Это не то же самое, что утверждение OpenAI, сделанное несколькими часами позже, о том, что Codex уже работает на Jalapeño. Цифра в 128 стоек и 6 000 чипов — это показанная конфигурация, а не развернутый парк.
И преемник, возможно, уже в разработке
Ранее в августе сообщалось, что Microsoft переходит к Maia 300 с ориентиром на сентябрь. Если это подтвердится, Maia 200 станет недолговечным поколением: он выходит с памятью старше, чем у конкурентов, все еще до этапа развертывания, в то время как для арендатора, под которого его частично создавали, уже работает собственный кремний.
