Anthropic опубликовала свой второй Risk Report 14 августа в рамках версии 3.4 своей политики Responsible Scaling Policy. Он охватывает период с предыдущего отчета 24 февраля до контрольной даты 15 июля 2026 года.

Оценка, которая изменилась

Для модели угроз Autonomy 1 — несоответствия в сценариях с высокими ставками — Anthropic теперь оценивает общий риск как Low, прямо повышая его с very low. Когда передовая лаборатория пересматривает собственную оценку риска в сторону повышения, этого уже достаточно, чтобы это стало самостоятельной новостью.

Почему в публикациях неверно указан повод

Большинство пересказов связывают повышение с Model 2, самой сильной из трех не выпущенных внутренних моделей, раскрытых в отчете. Но сам отчет этого не говорит. Он объясняет рост общим повышением неопределенности вокруг recent incident disclosures relating to model behaviour in cybersecurity evaluations, а Model 2 рассматривает в отдельном разделе. Формулировка «Anthropic убрала модель из-за безопасности» тоже слишком сильна: заявленные причины — неполная оценка до релиза и отсутствие плана текущего выпуска, а не окончательный вердикт по безопасности.

Что такое Model 2

Anthropic описывает ее как несколько более способную, чем передовая модель Claude Mythos 5, и как заметное улучшение по многим внутренним задачам — но не как скачок масштаба, сопоставимый с переходом от Claude Opus 4.6 к Mythos Preview. Три нераскрытые системы — Claude Opus 5, Model 1 и Model 2.

Признание, спрятанное в методологии

Anthropic сохраняет оценку риска автоматизированных AI R&D на уровне Low, но говорит, что уверенность в ней стала ниже, поскольку ее самые конкретные оценки на основе задач насытились — они больше не фиксируют рост возможностей. Компания сообщает, что внутренние исследования с помощью ИИ ускоряются значительно быстрее, хотя пока и не вдвое. Для лаборатории потеря инструмента, с помощью которого она измеряет собственное ускорение, — проблема более долговременная, чем любая отдельная модель.

Пробел в классификаторе

Отдельно в отчете риск неоригинального использования химического и биологического оружия оценивается как low, but higher than our previous estimate после того, как выяснилось, что весь трафик вендора с человеческой обратной связью работал без блокировки биологических классификаторов. Anthropic говорит, что проблема устранена, признаков злоупотребления нет, и на клиентах это не отразилось. Важно отметить сроки: контрольная дата — 15 июля, так что вся оценка описывает положение за месяц до публикации.