Anthropic a indiqué le 7 août qu’à partir du 14 août, les nouvelles sessions Claude Code sur les offres Pro, Max et Team fonctionneront en mode auto. Au lieu d’approuver chaque commande, chaque action passera par un classifieur conçu pour bloquer tout ce qui est irréversible, destructeur ou dirigé hors de l’environnement de l’utilisateur.
Le chiffre qui le justifie
Anthropic a recruté 1 053 testeurs rémunérés via un prestataire de recherche pour une étude de codage, en insérant une commande dangereuse dans une invite d’autorisation pour chacun. Les testeurs l’ont interceptée 143 fois — 13,6 %. Le mode auto a bloqué la même commande 937 fois — 89 %. Ces deux chiffres décrivent le même ensemble contrôlé, ce qui donne du sens à la comparaison.
L’attention décroît ; le classifieur non
La conclusion la plus intéressante est la courbe. Les humains ont bloqué environ 17 % des commandes dangereuses en début de session, avant de tomber à quelque 5 % après 50 invites ou plus précédentes. Le taux de blocage du mode auto est resté stable quelle que soit la durée de la session. Les testeurs ont approuvé 97 % des invites d’autorisation tout en rejetant 39 % des approbations de plan — ils lisaient les plans et validaient les commandes sans les examiner.
Deux études, pas une
Une évaluation distincte menée par un tiers, Trajectory Labs, a testé 72 scénarios d’injection indirecte d’invite dix fois chacun — soit 720 tentatives — contre Claude Fable 5, Opus 5 et Sonnet 5 en mode auto, sur des versions à jour au 17 juillet. Aucune n’a abouti, et Codex était également couvert. Intégrer ces 720 tentatives à l’étude des testeurs, comme le font plusieurs articles, revient à fusionner deux expériences différentes.
Ce qui change vraiment
Le mode auto existait déjà. Ce qui change, c’est le réglage par défaut, et avec lui l’argument : des dommages involontaires sont apparus dans 6,3 % des sessions approuvées manuellement contre 2,4 % en mode auto, et les utilisateurs du mode auto chez les clients Team et Enterprise livrent environ 25 % de pull requests en plus.
