OpenAI открыла ограниченный предварительный доступ к Ultrafast 13 августа — ускоренному режиму обслуживания для GPT-5.6 Sol, который, по словам компании, работает до 14x быстрее стандартного инференса и достигает до 750 выходных токенов в секунду.
Что нового
Ускорение стало возможным благодаря партнерству с Cerebras. Серверный флот OpenAI в остальном построен на Nvidia, и это первый случай, когда компания публично запустила frontier-модель на ускорителе другого производителя в промышленном масштабе. Cerebras создает wafer-scale процессоры, которые хранят веса модели в памяти на кристалле, поэтому ее показатели инференса всегда были высокими — открытым оставался вопрос, решится ли frontier-лаборатория выпускать модель на таком железе.
Что меняют 750 токенов в секунду
При стандартной скорости frontier-моделей длинная агентная траектория измеряется минутами. При таком темпе модель завершает абзац быстрее, чем человек успевает его прочитать, и это переводит целые продуктовые категории из асинхронного режима в интерактивный. OpenAI назвала реагирование на инциденты, поддержку клиентов, финансовый анализ и e-commerce — то есть сценарии, где ограничение задает ожидание, а не ответ.
Обозначенные ограничения
Это предварительный доступ для ограниченного круга клиентов, и OpenAI заявила, что расширит доступ «по мере роста мощности» — фактически признавая, что потолок задает не спрос, а доступная емкость Cerebras. Цены не опубликованы, а показатели 14x и 750 — это верхние пределы, а не устойчивый пропускной режим.
Почему это важно не только для задержек
За последние два года каждый крупный покупатель инференса пытался обеспечить себе второй источник поставок. То, что frontier-лаборатория обслуживает собственную флагманскую модель на оборудовании не от Nvidia, — самое убедительное на сегодня доказательство, что альтернативный кремний подходит не только для бенчмарков.
