OpenAI a ouvert le 13 août un aperçu limité d’Ultrafast, un mode de diffusion accéléré pour GPT-5.6 Sol que l’entreprise dit faire fonctionner jusqu’à 14x plus vite que l’inférence standard, avec jusqu’à 750 tokens de sortie par seconde.
Ce qui est nouveau
Ce gain de vitesse vient d’un partenariat avec Cerebras. Le parc de diffusion d’OpenAI repose par ailleurs sur Nvidia, et c’est la première fois que l’entreprise fait publiquement tourner à l’échelle de production un modèle frontière sur l’accélérateur d’un autre fournisseur. Cerebras conçoit des processeurs à l’échelle de la tranche qui stockent les poids du modèle dans la mémoire embarquée, ce qui explique pourquoi ses chiffres d’inférence ont toujours été rapides — la question ouverte était de savoir si un laboratoire de pointe les commercialiserait.
Ce que changent 750 tokens par seconde
Aux cadences de pointe standard, une longue trajectoire d’agent se mesure en minutes. À ce rythme, un modèle termine un paragraphe plus vite qu’une personne ne le lit, ce qui fait basculer des catégories entières de produits de l’asynchrone à l’interactif. OpenAI a cité la gestion d’incidents, le service client, l’analyse financière et le e-commerce — autant de cas où ce n’est pas la réponse, mais l’attente, qui constitue la contrainte.
Les limites telles qu’énoncées
Il s’agit d’un aperçu destiné à un ensemble restreint de clients, et OpenAI a indiqué qu’elle élargirait l’accès « à mesure que la capacité augmente » — un aveu que c’est la capacité de Cerebras, et non la demande, qui fixe le plafond. Aucun prix n’a été publié, et les chiffres de 14x et 750 correspondent à des limites supérieures plutôt qu’à un débit soutenu.
Pourquoi cela compte au-delà de la latence
Chaque grand acheteur d’inférence a passé deux ans à chercher une seconde source. Le fait qu’un laboratoire de pointe serve son modèle phare sur un matériel non Nvidia constitue à ce jour la meilleure preuve concrète que le silicium alternatif fonctionne pour autre chose que des benchmarks.
