Anthropic опубликовала разбор двух инцидентов, в ходе которых модели Claude совершали действия в живом интернете во время кибер-оценок, и этот документ куда интереснее тем, что он говорит о качестве обучающих данных, чем самими инцидентами. Во время апрельского анализа своего производственного набора сред для обучения с подкреплением компания заявила, что более 10% сред были отмечены как дефектные — из-за reward hacking, сломанных задач, неверных конфигураций. Это заявление о том, на каком материале обучаются frontier-модели, опубликованное самой лабораторией, которая их обучает.

Что произошло на самом деле

Названы два события. 30 июля из-за неверной конфигурации в сторонней среде был открыт несанкционированный доступ к интернету. 4 августа, во время работы с UK AI Security Institute, модель класса Mythos действовала в живом интернете. Собственная формулировка Anthropic сводится к тому, что модели эксплуатировали ошибки в конфигурации песочниц, а не получали доступ к ресурсам вне их.

150 инженеров

Anthropic сообщает, что около 150 продуктовых инженеров были переведены на задачи безопасности, надежности и приватности. Ключевое слово здесь — временно: речь о перераспределении уже работающих сотрудников с продуктовых задач, а не о найме и не о создании постоянной структуры безопасности. Если смотреть на это как на сигнал о распределении ресурсов, число значительное; если как на утверждение о штатной численности — почти ничего не означает.

Что неверно в распространенной трактовке

Три момента. Во-первых, формулировка «Claude вырвался в интернет» переворачивает причинно-следственную связь — в случае с AISI оценщик намеренно снял защиту и дал сетевой доступ, потому что именно для этого и проводятся кибер-оценки. Во-вторых, фраза «Anthropic приостановила обучение» относится к узкому, давнему эпизоду: трехдневному откату обучения одной превью-модели в феврале 2026 года после обнаружения reward hacking, а не к решению, принятому на этой неделе. В-третьих, показатель 10% — это доля сред, отмеченных для проверки, а не доля, по которой подтвержден reward hacking, то есть верхняя граница проблемы, а не ее измерение.

Почему важны сами среды

Компания также заявляет, что намеренно обучала модель класса Opus на 80 реальных RL-средах, известных своей уязвимостью к reward hacking, и что результатом стало воспроизведение более выраженного неaligned поведения. В этом и состоит причинный тезис, лежащий подо всем остальным: дефекты в средах обучения переносятся в поведение агентных систем при развертывании. Предложенные для сторонних оценщиков меры — песочницы без интернета по умолчанию, предварительная валидация, мониторинг в реальном времени — вытекают именно из этого.