Anthropic publicó su segundo Risk Report el 14 de agosto, bajo la versión 3.4 de su Responsible Scaling Policy. Cubre el periodo transcurrido desde el informe anterior, del 24 de febrero, hasta una fecha de cobertura del 15 de julio de 2026.
La calificación que cambió
Para el modelo de amenaza de autonomía 1 — desalineación en contextos de alto riesgo — Anthropic sitúa ahora el riesgo general en Low, explícitamente un aumento desde very low. Que un laboratorio fronterizo revise al alza su propia evaluación de riesgo es algo suficientemente raro como para ser la historia en sí misma.
Por qué la cobertura se equivoca sobre la causa
La mayoría de las crónicas vinculan el aumento a Model 2, el más potente de los tres modelos internos no publicados que revela el informe. El informe no lo hace. Atribuye la subida a una mayor incertidumbre general en torno a divulgaciones recientes de incidentes relacionadas con el comportamiento del modelo en evaluaciones de ciberseguridad, y trata Model 2 en una sección aparte. Decir que "Anthropic aparta un modelo por motivos de seguridad" también exagera: las razones declaradas son una evaluación previa al despliegue incompleta y la ausencia de un plan de lanzamiento actual, no un veredicto de seguridad.
Qué es Model 2
Anthropic lo describe como algo más capaz que el modelo fronterizo Claude Mythos 5 y como una mejora notable en muchas tareas internas, pero no como un salto del tamaño observado entre Claude Opus 4.6 y Mythos Preview. Los tres sistemas no revelados son Claude Opus 5, Model 1 y Model 2.
La admisión escondida en la metodología
Anthropic mantiene el riesgo automatizado de I+D en IA en Low, pero dice que tiene menos confianza que antes, porque sus evaluaciones más concretas basadas en tareas han saturado: ya no captan aumentos de capacidad. Informa de que la investigación interna avanza significativamente más rápido con ayuda de la IA, aunque todavía no al doble de ritmo. Que un laboratorio pierda el instrumento que usa para medir su propia aceleración es un problema más duradero que cualquier modelo concreto.
La brecha del clasificador
Por separado, el informe califica el riesgo de armas químicas y biológicas no novedosas como low, but higher than our previous estimate, después de descubrir que todo el tráfico de proveedores con retroalimentación humana había estado funcionando sin bloquear los clasificadores biológicos. Anthropic afirma que la brecha ha sido subsanada, sin indicios de uso indebido y sin impacto para los clientes. Hay que fijarse en la cronología en todo momento: la fecha de cobertura es el 15 de julio, así que toda la evaluación describe una situación de un mes antes de su publicación.
