OpenAI lanzó el 13 de agosto una vista previa limitada de Ultrafast, un modo de servicio acelerado para GPT-5.6 Sol que, según la compañía, funciona hasta 14x más rápido que la inferencia estándar y alcanza hasta 750 tokens de salida por segundo.

Lo nuevo

La mejora de velocidad llega a través de una asociación con Cerebras. La flota de servicio de OpenAI, por lo demás, se basa en Nvidia, y esta es la primera vez que la compañía ejecuta públicamente un modelo de frontera en el acelerador de otro proveedor a escala de producción. Cerebras fabrica procesadores a escala de oblea que guardan los pesos del modelo en memoria integrada en el chip, razón por la que sus cifras de inferencia siempre han sido rápidas; la incógnita era si un laboratorio de frontera los pondría en producción.

Qué cambia 750 tokens por segundo

A velocidades estándar de frontera, una trayectoria larga de agente se mide en minutos. A este ritmo, un modelo termina un párrafo más rápido de lo que una persona lo lee, lo que desplaza categorías enteras de producto de asincrónicas a interactivas. OpenAI mencionó respuesta a incidentes, atención al cliente, análisis financiero y comercio electrónico: todos son casos en los que la espera, y no la respuesta, es la restricción.

Los límites, tal como se indican

Se trata de una vista previa para un conjunto selecto de clientes, y OpenAI ha dicho que ampliará el acceso "a medida que crezca la capacidad"; una admisión de que es la capacidad de Cerebras, y no la demanda, la que marca el techo. No se ha publicado ningún precio, y las cifras de 14x y 750 son límites superiores, no rendimiento sostenido.

Por qué importa más allá de la latencia

Todo gran comprador de inferencia ha pasado dos años tratando de asegurarse una segunda fuente. Que un laboratorio de frontera sirva su propio producto estrella sobre hardware que no es de Nvidia es la prueba de existencia más sólida hasta ahora de que el silicio alternativo funciona para algo más que benchmarks.