Anthropic publicou seu segundo Risk Report em 14 de agosto, sob a versão 3.4 de sua Responsible Scaling Policy. Ele cobre o período desde o relatório anterior, em 24 de fevereiro, até a data de cobertura de 15 de julho de 2026.

A classificação que mudou

Para o modelo de ameaça de autonomia 1 — desalinhamento em cenários de alto risco — a Anthropic agora classifica o risco geral como Baixo, explicitamente uma alta em relação a muito baixo. Uma fronteira lab revisando sua própria avaliação de risco para cima é raro o suficiente para ser a notícia por si só.

Por que a cobertura erra a causa

A maioria das matérias atribui o aumento ao Model 2, o mais forte entre três modelos internos não lançados que o relatório revela. O relatório não o faz. Ele atribui a alta a um aumento geral da incerteza em torno de divulgações recentes de incidentes relacionadas ao comportamento do modelo em avaliações de cibersegurança, e trata o Model 2 em uma seção separada. Dizer que "Anthropic arquiva um modelo por segurança" exagera: os motivos declarados são avaliação pré-implantação incompleta e ausência de plano de lançamento no momento, não uma condenação por segurança.

O que é o Model 2

A Anthropic o descreve como um pouco mais capaz do que o modelo de fronteira Claude Mythos 5 e uma melhora perceptível em muitas tarefas internas — mas não um salto do tamanho visto de Claude Opus 4.6 para Mythos Preview. Os três sistemas não divulgados são Claude Opus 5, Model 1 e Model 2.

A admissão enterrada na metodologia

A Anthropic mantém o risco automatizado de P&D em IA em Baixo, mas diz estar menos confiante do que antes, porque suas avaliações baseadas em tarefas mais concretas saturaram — elas já não capturam aumentos de capacidade. A empresa relata que a pesquisa interna está avançando significativamente mais rápido com assistência de IA, embora ainda não no dobro da velocidade. Uma lab perdendo o instrumento que usa para medir sua própria aceleração é um problema mais duradouro do que qualquer modelo isolado.

A lacuna do classificador

Separadamente, o relatório classifica o risco de armas químicas e biológicas não novas como baixo, mas mais alto do que nossa estimativa anterior, após descobrir que todo o tráfego de fornecedores com feedback humano vinha operando sem bloqueio de classificadores biológicos. A Anthropic diz que a falha foi corrigida, sem evidência de uso indevido e sem impacto para clientes. Observe o timing em todo o texto: a data de cobertura é 15 de julho, então toda a avaliação descreve uma posição de um mês antes de sua publicação.