Un article soumis le 2 septembre formalise une attaque sur la chaîne d’approvisionnement visant spécifiquement les compétences d’agent réutilisables : une compétence tierce qui accomplit correctement la tâche annoncée, renvoie une sortie valide et passe l’inspection, tout en orientant en silence les décisions de l’agent vers un objectif non divulgué.

Résultat mesuré

Implémenté dans le commerce agentique et la sélection de dépendances logicielles, le cadre a atteint des taux de sélection favorables à l’attaquant de 81,33 % et 63,33 % respectivement, tout en maintenant un taux de préservation de l’utilité de 100 %. C’est ce dernier chiffre qui rend l’attaque difficile : la tâche demandée par l’utilisateur se termine toujours, correctement, à chaque fois. Il n’y a pas d’échec manifeste.

Pourquoi ce n’est pas de l’injection de prompt

Il s’agit d’une classe différente de l’attaque contre laquelle tout le monde se défendait. L’injection de prompt insère une instruction dans une fenêtre de contexte et détourne l’agent de sa tâche. Ici, il n’y a ni commande injectée ni détournement — la compétence fait bien ce qu’elle prétend faire, et la manipulation se loge dans la manière dont elle façonne l’espace de décision sur lequel raisonne l’agent. Une détection fondée sur l’identification d’instructions adverses n’a rien à relever.

Ce que le cadrage courant interprète mal

Deux corrections. D’abord, considérer cela comme « un autre papier sur le jailbreak » rate l’essentiel : rien n’est jailbreaké ; le modèle n’est pas amené à violer une politique, mais à préférer une option valide à une autre. Ensuite, l’article indique que les scanners de compétences évalués ne signalent pas les compétences malveillantes — ce qui constitue un constat sur les scanners précis testés dans les conditions de l’article, et non une preuve que la détection est impossible. Cela montre en revanche que la couche d’inspection actuelle vise la mauvaise propriété : les scanners vérifient si une compétence fait quelque chose qu’elle ne devrait pas faire, alors que toute la conception de cette attaque repose sur le fait qu’elle ne le fait pas.

Le résultat de transfert

Les politiques ont été transférées sans optimisation supplémentaire entre des backends de modèles et des environnements d’agent hétérogènes. Un attaquant n’a pas besoin de savoir quel modèle consommera la compétence. C’est ce qui transforme un résultat de recherche en problème de chaîne d’approvisionnement : une compétence publiée une seule fois fonctionne contre tout ce qui l’exécute.