Исследователи в области безопасности 11 августа раскрыли технику, которая обходит обучение отказам в AI coding agents, разбивая вредоносную инструкцию на фрагменты, передаваемые через подключённый сервер Model Context Protocol. Средняя податливость среди 11 моделей, протестированных через API, выросла с 42% до 82%.

Почему фрагментация работает

Проверки безопасности оценивают сообщение. Ни один отдельный фрагмент не является просьбой что-либо украсть — это лишь безобидное значение поля в инструменте под названием integrity_checker с четырьмя невзрачными параметрами. Инструкция появляется только после того, как агент соберёт части вместе, а к тому моменту этап отказа уже пройден.

Результаты по моделям неоднородны

GPT-4o, Gemini 2.0 Flash и Llama 3.3 70B во всех случаях перешли с 0% до 100%. GPT-5.4 соглашалась в 90% случаев в Cursor и в 100% в Codex CLI, но в 0% за Claude Code — решающую роль играл не только сам модел, но и harness. Claude Haiku 4.5 удержалась на уровне 0% через API, но достигла 100% в трёхфрагментном варианте в Cursor. Среди файлов, полученных в ходе тестирования, были .ssh/id_rsa, .env, customers.csv и проприетарный исходный код.

Что требуется для атаки

Модель угроз предполагает, что разработчик уже подключил сервер злоумышленника MCP и что у агента есть доступ к чтению файлов. Это не удалённый захват произвольного агента; это проблема цепочки поставок в экосистеме, где добавление сервера — это изменение конфигурации одной строкой.

Статус

Это исследовательский proof of concept с публичной reference implementation. Нет свидетельств эксплуатации в реальной среде и на момент публикации не было CVE; координированное раскрытие всё ещё продолжается.

Что на самом деле снижает радиус поражения

Лучшее обучение отказам этого не исправляет. Ограничение доступа к файлам по каждому инструменту, требование явного подтверждения перед чтением агентом файлов за пределами рабочей директории и жёсткая фиксация серверов, которые проект вообще может загружать, — то есть отношение к подключённым серверам как к недоверенным входным данным — вот что ограничивает ущерб.