Un article soumis à 15:57 UTC le 17 août 2026 par Adam Karvonen, Euan Ong, Subhash Kantamneni et Samuel Marks présente CHIVE — Counterfactual Hypothesis Investigation Via Edits —, un pipeline agentique qui identifie des comportements inattendus de modèles de langage observés dans la nature et les examine en modifiant le prompt pour voir ce qui change. Son principal résultat est négatif, et il renvoie à la boîte à outils même du domaine.

Le test et le résultat

Les auteurs posent une question précise et falsifiable : les techniques courantes d'interprétabilité aident-elles un agent à prévoir comment un modèle se comportera sur des entrées contrefactuelles liées ? Ils évaluent des autoencodeurs parcimonieux, des autoencodeurs en langage naturel et des oracles d'activation. Le constat, selon les propres termes du résumé : « Étonnamment, nous ne trouvons aucun gain apporté par les techniques d'interprétabilité étudiées. » La comparaison est faite avec un agent qui se contente de lire la transcription de la conversation.

Ce que le cadrage courant comprend mal

Le titre évident serait de dire que les autoencodeurs parcimonieux sont morts. Ce serait exagéré, et l'article ne dit pas cela. L'affirmation est plus étroite et plus précise : sur cette tâche, les outils fondés sur les activations n'apportent rien au-delà de ce que la lecture de la transcription fournit déjà. Il s'agit d'une mesure de l'information marginale par rapport à une base textuelle solide, et non d'une affirmation selon laquelle les caractéristiques SAE ne correspondraient à rien de réel à l'intérieur du modèle. Un outil peut décrire une véritable structure interne tout en échouant à révéler quelque chose que le texte visible ne montrait pas.

L'autre moitié est la moitié utile

La deuxième application est plus constructive et attire moins l'attention. Les auteurs utilisent CHIVE pour générer des données d'entraînement, et indiquent que les modèles entraînés à prédire les résultats d'expériences contrefactuelles générées par CHIVE se généralisent à des contextes hors distribution. Ainsi, le pipeline qui a produit le résultat négatif a aussi produit une méthode qui fonctionne — l'explication d'un comportement s'avère apprise à partir de preuves contrefactuelles, là où la lecture des activations n'a pas aidé.

Pourquoi la paternité de l'article compte

L'interprétabilité est le principal pilier technique que les laboratoires de pointe invoquent lorsqu'on leur demande comment les systèmes futurs seront surveillés. Deux des quatre auteurs appartiennent à l'équipe alignment d'Anthropic. Le fait qu'un laboratoire publie un résultat nul mesuré contre son propre pari stratégique, avec un benchmark concret à l'appui, est un signal plus sain qu'une nouvelle démonstration de capacités — et cela donne au domaine une définition du succès à laquelle il peut réellement être tenu : faire mieux que la transcription.