Anthropic 于8月7日表示,从8月14日起,Pro、Max 和 Team订阅方案中的新 Claude Code 会话将运行在自动模式下。与其逐条批准每个命令,不如让每项操作都先经过一个分类器;该分类器的设计目标是拦截任何不可逆、具有破坏性,或指向用户环境之外的操作。

支撑这一做法的数字

Anthropic 通过一家研究供应商招募了1,053名付费测试者,开展了一项编程研究,并在每个人的权限提示中嵌入一条危险命令。测试者有143次——13.6%——发现了它。自动模式拦截了同一命令937次——89%。这两个数字描述的是同一组受控样本,这正是这种比较具有意义的原因。

注意力会衰减;分类器不会

更有意思的发现是那条曲线。人类在会话开始阶段拦截了约17%的危险命令,在先前提示达到50个或更多后,这一比例降至约5%。自动模式的拦截率则不随会话长度变化而变化。测试者对97%的权限提示点了批准,却拒绝了39%的计划批准——他们在阅读计划,却在对命令机械通过。

不是一项研究,而是两项

另一项由第三方Trajectory Labs进行的评估,对 Claude Fable 5、Opus 5 和 Sonnet 5 在自动模式下进行了72个间接提示注入场景,每个场景重复十次——共720次尝试——测试版本截至7月17日。没有一次成功,这项评估也覆盖了 Codex。正如一些报道所做的那样,把这 720 次尝试并入测试者研究,会把两项不同的实验混为一谈。

真正改变了什么

自动模式本就已存在。真正改变的是默认设置,也随之改变了争论焦点:在手动批准的会话中,意外伤害出现在6.3%的会话里,而自动模式下为2.4%;而 Team 和 Enterprise 客户中的自动模式用户,提交的拉取请求数量大约多出25%