OpenAI abriu uma prévia limitada do Ultrafast em 13 de agosto, um modo de serving acelerado para o GPT-5.6 Sol que, segundo a empresa, roda até 14x mais rápido que a inferência padrão, alcançando até 750 tokens de saída por segundo.
O que há de novo
O ganho de velocidade vem de uma parceria com a Cerebras. A infraestrutura de serving da OpenAI, de outro modo, é baseada em Nvidia, e esta é a primeira vez que a empresa executa publicamente um modelo de fronteira em um acelerador de outro fornecedor em escala de produção. A Cerebras constrói processadores em escala de wafer que mantêm os pesos do modelo na memória on-chip, razão pela qual seus números de inferência sempre foram rápidos — a questão em aberto era se um laboratório de fronteira colocaria um modelo nesses chips.
O que 750 tokens por segundo muda
Nas velocidades padrão de fronteira, uma longa trajetória de agente é medida em minutos. Nessa taxa, um modelo conclui um parágrafo mais rápido do que uma pessoa o lê, o que desloca categorias inteiras de produto de assíncronas para interativas. A OpenAI citou resposta a incidentes, atendimento ao cliente, análise financeira e comércio eletrônico — todos casos em que a espera, e não a resposta, é a restrição.
Os limites, segundo a empresa
Esta é uma prévia para um conjunto selecionado de clientes, e a OpenAI disse que ampliará o acesso "à medida que a capacidade crescer" — uma admissão de que a capacidade da Cerebras, e não a demanda, define o teto. Não há preços publicados, e os números de 14x e 750 são limites superiores, não taxa de transferência sustentada.
Por que isso importa além da latência
Todo grande comprador de inferência passou dois anos tentando estabelecer uma segunda fonte. Um laboratório de fronteira servindo seu principal modelo em hardware que não é da Nvidia é a prova mais forte até agora de que o silício alternativo funciona para algo além de benchmarks.
