Um artigo submetido em 2 de setembro formaliza um ataque à cadeia de suprimentos voltado especificamente para habilidades reutilizáveis de agentes: uma habilidade de terceiros que executa corretamente sua tarefa anunciada, retorna uma saída válida e passa na inspeção, enquanto direciona discretamente as decisões do agente para um objetivo não revelado.
O resultado medido
Instanciado em comércio agentivo e na seleção de dependências de software, o framework alcançou taxas de seleção favoráveis ao atacante de 81,33% e 63,33%, respectivamente, mantendo uma taxa de preservação de utilidade de 100%. Este último número é o que torna o ataque difícil: a tarefa solicitada pelo usuário ainda é concluída corretamente, sempre. Não há falha a notar.
Por que isso não é prompt injection
Esta é uma classe diferente daquela contra a qual todos vinham se defendendo. A prompt injection contrabandeia uma instrução para dentro de uma janela de contexto e sequestra o agente para longe da sua tarefa. Aqui, não há comando injetado nem sequestro — a habilidade faz o que diz, e a manipulação está em como ela molda o espaço de निर्णयisão sobre o qual o agente raciocina. Detecções baseadas em identificar instruções adversárias não têm o que corresponder.
O que a formulação comum interpreta mal
Duas correções. Primeiro, tratar isso como "apenas mais um artigo sobre jailbreak" ignora que nada foi desbloqueado: o modelo não é induzido a violar uma política, mas a preferir uma opção válida em vez de outra. Segundo, o artigo informa que os scanners de habilidades avaliados não sinalizam as habilidades maliciosas — o que é um achado sobre os scanners específicos testados nas condições do artigo, não uma prova de que a detecção é impossível. Isso estabelece, porém, que a camada de inspeção atual mira a propriedade errada: os scanners verificam se uma habilidade faz algo que não deveria, e toda a lógica deste ataque é justamente que ela não faz.
O resultado de transferência
As políticas foram transferidas sem otimização adicional entre backends de modelos e ambientes de agentes heterogêneos. Um atacante não precisa saber qual modelo consumirá a habilidade. É isso que transforma um resultado de pesquisa em um problema de cadeia de suprimentos: uma habilidade publicada uma vez funciona contra qualquer sistema que a execute.
