O AI Security Institute (AISI) do Reino Unido publicou em 17 de julho uma medição que deve chamar a atenção das equipes de segurança: a diferença entre modelos open-weight de livre download e os melhores sistemas closed frontier em tarefas de cibersegurança ofensiva encolheu para cerca de quatro a sete meses, ante seis a dez meses um ano antes.

A constatação

O AISI avaliou modelos abertos líderes — notavelmente GLM-5.2 e DeepSeek V4-Pro — contra sistemas closed frontier e fez uma pergunta simples: quão atrás está o ecossistema aberto, medido em tempo? A resposta é que a margem da qual os defensores antes dependiam está encolhendo rapidamente.

Como isso foi medido

Em um benchmark "Narrow Cyber Tasks" de 70 tarefas em quatro níveis de dificuldade, do não especialista ao especialista, o GLM-5.2 igualou modelos fechados de cerca de quatro meses antes, e o DeepSeek V4-Pro igualou os de cerca de cinco meses antes. O AISI também realizou simulações completas de ataque, e não apenas tarefas isoladas.

O teste de ponta a ponta

Em um cenário "Cyber Ranges" chamado "The Last Ones" — um ataque de 32 etapas contra uma rede corporativa simulada — o GLM-5.2 teve desempenho comparável ao do Claude Opus 4.5, um modelo lançado cerca de sete meses antes. Encadear dezenas de etapas em uma intrusão coerente é a parte difícil, e os modelos abertos estão se aproximando disso.

O dilema dos modelos abertos

Esse atraso é, na prática, a vantagem de tempo que defensores e reguladores têm antes que capacidades ofensivas de ponta se tornem impossíveis de conter. Ver essa margem cair de cerca de dez meses para quatro afia uma questão de política que o próprio governo do AISI está debatendo: se lançamentos open-weight devem enfrentar limites de capacidade, e quem decide isso. Ambos os modelos destacados pelo AISI — GLM-5.2 e DeepSeek V4-Pro — são sistemas open-weight chineses, o que adiciona um elemento geopolítico: uma capacidade que chega como download gratuito não pode ser contida por controles de exportação da mesma forma que chips avançados podem.