Работа, поданная 2 сентября, формализует атаку на цепочку поставок, нацеленную именно на переиспользуемые навыки агентов: сторонний навык, который корректно выполняет заявленную задачу, возвращает валидный результат и проходит проверку, при этом незаметно направляя решения агента к нераскрытой цели.

Измеренный результат

В сценариях агентной коммерции и выбора программных зависимостей предложенная схема достигла доли выбора в пользу атакующего на уровне 81,33% и 63,33% соответственно, сохраняя при этом 100% показатель сохранения полезности. Именно последнее делает атаку трудной для обнаружения: задача, которую запросил пользователь, по-прежнему выполняется правильно каждый раз. Никакого сбоя, который можно заметить, нет.

Почему это не prompt injection

Это не тот же класс атак, против которого все привыкли защищаться. Prompt injection незаметно внедряет инструкцию в контекстное окно и уводит агента от его задачи. Здесь нет ни внедрённой команды, ни перехвата управления — навык делает то, что заявлено, а манипуляция скрывается в том, как он формирует пространство решений, которое агент использует для рассуждений. Детекторы, основанные на поиске враждебных инструкций, здесь не находят за что зацепиться.

Что неверно в распространённой трактовке

Две поправки. Во-первых, рассматривать это как «очередную статью про jailbreak» значит упускать главное: никакого jailbreak нет. Модель не побуждают нарушать политику; её побуждают предпочесть один допустимый вариант другому. Во-вторых, в статье говорится, что испытанные сканеры навыков не помечают вредоносные навыки — это вывод о конкретных сканерах, протестированных в условиях статьи, а не доказательство того, что обнаружение невозможно. Но это действительно показывает, что нынешний слой проверки нацелен не на то свойство: сканеры проверяют, не делает ли навык то, чего он делать не должен, а вся идея этой атаки в том, что он этого не делает.

Результат переноса

Политики переносились без дополнительной оптимизации между разнородными модельными бэкендами и агентными средами. Атакующему не нужно знать, какая именно модель будет использовать навык. Именно это превращает исследовательский результат в проблему цепочки поставок: один раз опубликованный навык работает против любой системы, которая его запускает.