Cerebras presentó el CS-4 en su conferencia Supernova, con un lanzamiento programado para las 20:00 ET del 18 de agosto — 00:00 UTC del 19 de agosto. El sistema está valorado en 750 PFLOPS y 129,6 petabytes por segundo de ancho de banda de memoria, y Cerebras afirma velocidades de hasta treinta veces superiores a las de las soluciones basadas en GPU en determinadas configuraciones.

Qué incluye el paquete

Tres procesadores WSE-3 Turbo, cada uno con cuatro billones de transistores y 900.000 núcleos optimizados para IA, fabricados por TSMC mediante un proceso de 5 nm. Cerebras describe el sistema como el doble de rápido que el CS-3. Las primeras entregas están previstas para el tercer trimestre de 2026, y no se reveló el precio.

En qué se equivoca la explicación habitual

El primer error es tratar 750 PFLOPS como una especificación de un chip. Son tres obleas combinadas. Quien lo compare directamente con un predecesor de una sola oblea, o informe de un salto de seis veces respecto al CS-3, está multiplicando una mejora por oblea por el número de paquetes.

El segundo es asumir que se trata de nuevo silicio. El nodo de proceso no ha cambiado. Electronics Weekly es explícita al señalar que Cerebras "aumenta el rendimiento de su silicio existente haciendo pasar más potencia a través de él," logrado mediante "la creación de un sistema de refrigeración más eficaz." Se trata de un resultado térmico y de suministro de energía en un chip que ya existía, no de un avance de fabricación.

El tercer aspecto es la métrica de comparación. "Hasta 30 veces más rápido que las GPU" se refiere a tokens por segundo por usuario — la rapidez con que una única secuencia interactiva devuelve resultados, demostrada a más de 4.400 tokens por segundo por usuario en GPT-OSS-120B. No se trata del rendimiento por rack ni por dólar, que es donde se optimizan las flotas de GPU, y el propio proveedor señala que los resultados varían según la arquitectura del modelo, la longitud del contexto y la configuración.

La implicación interesante

Si una oblea de dos años puede duplicar su rendimiento solo con refrigeración y suministro de energía, la restricción que pesa sobre el silicio de inferencia se ha desplazado de la litografía hacia la gestión térmica y la conversión de potencia, el mismo punto en el que ya está constreñida la expansión de los centros de datos. Aún no se ha enviado nada, lo que convierte esto en un lanzamiento y no en ingresos.