Un article soumis à arXiv à 17:20 UTC le 17 août 2026 par Enric Boix-Adsera et Benedict Tessler décrit un phénomène que les auteurs appellent model hypnosis : des indices faibles et apparemment sans rapport dans un prompt — une faute de frappe, une paraphrase, une remarque hors sujet — peuvent être combinés de manière systématique pour contrôler fortement ce qu’un modèle dit.

L’affirmation centrale

Selon les auteurs, l’effet « se produit à travers des familles et des échelles de modèles, y compris dans des modèles de raisonnement de pointe, et des prompts hypnotiques peuvent se transférer entre modèles ». C’est ce transfert qui compte le plus : un prompt mis au point pour orienter un modèle conserve son effet directionnel sur un modèle différent, construit par une autre organisation, contre lequel les auteurs n’ont jamais optimisé. Le contrôle ne vient pas d’une instruction unique et puissante, mais de l’accumulation de nombreux choix textuels discrets, dont chacun, pris isolément, ressemblerait à du bruit.

Ce que le cadrage courant ne comprend pas

Cela sera présenté comme un nouveau jailbreak. Ce n’en est pas un, et la distinction compte. Un jailbreak contourne un refus — il pousse un modèle à produire un contenu qu’il a été entraîné à retenir. Le model hypnosis consiste à orienter : il modifie la réponse qu’un modèle donne à des questions ouvertes et à des questions d’auto-évaluation. Rien ici n’est décrit comme un contournement d’une barrière de sécurité. La deuxième erreur probable consiste à traiter l’effet comme uniformément écrasant. Une forte modification de la préférence interne d’un modèle ne change la réponse visible que lorsque le modèle était d’emblée presque indécis ; sur les questions où il a une position ferme, les mêmes indices déplacent la marge sans changer la sortie.

Pourquoi les chercheurs en interprétabilité devraient surtout s’en préoccuper

Les auteurs désignent l’interprétabilité comme le domaine le plus concerné, et leur raisonnement est inconfortable. Une grande partie des travaux publiés interrogent les modèles sur eux-mêmes — avez-vous un objectif, êtes-vous conscient, pourquoi avez-vous répondu ainsi — et considèrent la réponse comme une mesure du modèle. Si des choix au niveau de la simple faute de frappe dans la formulation de la question peuvent être combinés pour contrôler la réponse, alors une évaluation à gabarit unique mesure autant le gabarit que le modèle. Tout résultat fondé sur une seule formulation d’une seule question reste impossible à falsifier tant qu’il n’a pas été testé sur une distribution de paraphrases.

La conséquence pratique

La méthodologie des benchmarks a généralement supposé que le wording incidentel des prompts est du bruit qui s’annule en moyenne. Cet article soutient qu’il s’agit d’un signal qui s’accumule. Cela n’invalide pas les évaluations existantes, mais cela signifie que les différences rapportées entre modèles peuvent être plus faibles que la variation qu’un auteur de prompts déterminé peut fabriquer au sein d’un même modèle.