Anthropic сообщила 7 августа, что с 14 августа новые сессии Claude Code на тарифах Pro, Max и Team будут работать в авторежиме. Вместо подтверждения каждой команды каждое действие будет проходить через классификатор, созданный для блокировки всего необратимого, разрушительного или направленного за пределы среды пользователя.

Число, которое это оправдывает

Anthropic привлекла через исследовательскую компанию 1 053 платных тестировщика для исследования в области программирования, встроив для каждого одну опасную команду в запрос на разрешение. Тестировщики заметили ее 143 раза — 13,6%. Авторежим заблокировал ту же команду 937 раз — 89%. Оба показателя описывают один и тот же контролируемый набор, и именно поэтому сравнение имеет смысл.

Внимание снижается; классификатор — нет

Более интересный результат — кривая. Люди блокировали примерно 17% опасных команд в начале сессии, а после 50 и более предыдущих запросов этот показатель падал примерно до 5%. У авторежима доля блокировок оставалась неизменной независимо от длины сессии. Тестировщики одобряли 97% запросов на разрешение, но отклоняли 39% согласований плана — они читали планы и автоматически подтверждали команды.

Два исследования, а не одно

Отдельная независимая оценка Trajectory Labs провела 72 сценария косвенного prompt injection по десять раз каждый — 720 попыток — против Claude Fable 5, Opus 5 и Sonnet 5 в авторежиме, на версиях, актуальных на 17 июля. Ни одна не увенчалась успехом, и это также охватывало Codex. Объединение этих 720 попыток с исследованием тестировщиков, как это делают некоторые материалы, смешивает два разных эксперимента.

Что именно меняется

Авторежим уже существовал. Меняется настройка по умолчанию, а вместе с ней и аргумент: непреднамеренный вред возникал в 6,3% сессий, одобренных вручную, против 2,4% в авторежиме, а пользователи авторежима у клиентов Team и Enterprise отправляют примерно на 25% больше pull request.