Uma empresa italiana de segurança ofensiva colocou modelos de fronteira da Anthropic e da OpenAI sobre o código-fonte da GlobaLeaks, uma plataforma de denúncia anônima de código aberto que passou por cerca de uma década de auditorias humanas independentes, e publicou o que obteve: 29 vulnerabilidades confirmadas, 12 problemas de negação de serviço e 42 observações de endurecimento.

O alvo não era fraco

Isso importa mais do que a contagem. A GlobaLeaks é usada por redações e órgãos anticorrupção e foi revisada repetidamente por pessoas pagas para quebrá-la. Encontrar qualquer coisa ali é uma afirmação mais forte do que achar bugs em uma base de código sem exame prévio.

A proporção que a manchete esconde

Os modelos produziram 110 achados candidatos. A triagem humana confirmou 29. Isso representa uma precisão de cerca de 26% — aproximadamente três quartos do que os modelos levantaram não resistiram à revisão. A manchete distribuída, de que a IA pode identificar vulnerabilidades reais em software, é verdadeira e omite o custo.

O que os US$ 77 omitem

O estudo informa cerca de US$ 77 por achado confirmado, a partir de um gasto total de aproximadamente US$ 3.140 ao longo de 12.000 requisições e 1,24 bilhão de tokens. O próprio texto afirma que esse valor é antes da validação humana. A triagem especializada que transformou 110 palpites em 29 achados é a etapa que produziu as confirmações, e ela não está no número. A conclusão declarada do estudo reconhece que os especialistas mantêm o papel decisivo.

Leia a divisão de custos, não o total

Uma cifra vale mais do que as demais: o modelo de raciocínio avançado consumiu 62% do orçamento enquanto processava 7% dos tokens. Essa é a verdadeira economia dos modelos de raciocínio no trabalho de revisão — o gasto se concentra em uma fatia estreita da tarefa. Duas ressalvas sobre a procedência. Trata-se de um relato próprio do fornecedor, de uma empresa que vende exatamente esse serviço. E a cifra de 29 não traz uma distribuição pública de severidade, portanto não deve ser lida como 29 críticas; os 54 itens restantes são sugestões de negação de serviço e de endurecimento, não falhas exploráveis.