Anthropic ha pubblicato il suo secondo Risk Report il 14 agosto, nell'ambito della versione 3.4 della sua Responsible Scaling Policy. Il rapporto copre il periodo dal precedente report del 24 febbraio fino alla data di copertura del 15 luglio 2026.
Il rating che è cambiato
Per il threat model 1 di Autonomy — il disallineamento in contesti ad alto impatto — Anthropic valuta ora il rischio complessivo come Low, esplicitamente in aumento rispetto a very low. Che un laboratorio di frontiera riveda al rialzo la propria valutazione del rischio è abbastanza raro da costituire, da solo, la notizia.
Perché la copertura sbaglia la causa
La maggior parte degli articoli collega l'aumento a Model 2, il più forte dei tre modelli interni non rilasciati che il report rende noti. Il report non lo fa. Attribuisce il rialzo a un aumento generale dell'incertezza legato a recent incident disclosures relating to model behaviour in cybersecurity evaluations, e tratta Model 2 in una sezione separata. Anche dire che "Anthropic accantona un modello per motivi di sicurezza" è eccessivo: le ragioni dichiarate sono una valutazione pre-deployment incompleta e l'assenza di un piano di rilascio attuale, non un verdetto di sicurezza.
Cos'è Model 2
Anthropic lo descrive come leggermente più capace del frontier model Claude Mythos 5 e come un miglioramento evidente in molti compiti interni — ma non un salto paragonabile a quello osservato da Claude Opus 4.6 a Mythos Preview. I tre sistemi non divulgati sono Claude Opus 5, Model 1 e Model 2.
L'ammissione nascosta nella metodologia
Anthropic mantiene il rischio automatizzato di AI R&D a Low, ma afferma di esserne meno sicura rispetto a prima, perché le sue valutazioni più concrete basate su compiti hanno saturated — non riescono più a cogliere gli aumenti di capacità. Il rapporto indica che la ricerca interna sta procedendo molto più rapidamente con l'aiuto dell'AI, anche se non ancora al doppio della velocità. Un laboratorio che perde lo strumento con cui misura la propria accelerazione ha un problema più duraturo di qualsiasi singolo modello.
Il divario nei classificatori
Separatamente, il report assegna al rischio non nuovo di armi chimiche e biologiche un livello low, but higher than our previous estimate, dopo aver scoperto che tutto il traffico dei vendor con feedback umano era stato eseguito senza bloccare i classificatori biologici. Anthropic afferma che il problema è stato rimediato, senza alcuna evidenza di abuso e senza impatto sui clienti. Da notare il tempismo: la data di copertura è il 15 luglio, quindi l'intera valutazione descrive una posizione di un mese prima della pubblicazione.
