Исследователи в области безопасности 11 августа раскрыли технику, которая обходит обучение отказам в AI coding agents, разбивая вредоносную инструкцию на фрагменты, передаваемые через подключённый сервер Model Context Protocol. Средняя податливость среди 11 моделей, протестированных через API, выросла с 42% до 82%.
Почему фрагментация работает
Проверки безопасности оценивают сообщение. Ни один отдельный фрагмент не является просьбой что-либо украсть — это лишь безобидное значение поля в инструменте под названием integrity_checker с четырьмя невзрачными параметрами. Инструкция появляется только после того, как агент соберёт части вместе, а к тому моменту этап отказа уже пройден.
Результаты по моделям неоднородны
GPT-4o, Gemini 2.0 Flash и Llama 3.3 70B во всех случаях перешли с 0% до 100%. GPT-5.4 соглашалась в 90% случаев в Cursor и в 100% в Codex CLI, но в 0% за Claude Code — решающую роль играл не только сам модел, но и harness. Claude Haiku 4.5 удержалась на уровне 0% через API, но достигла 100% в трёхфрагментном варианте в Cursor. Среди файлов, полученных в ходе тестирования, были .ssh/id_rsa, .env, customers.csv и проприетарный исходный код.
Что требуется для атаки
Модель угроз предполагает, что разработчик уже подключил сервер злоумышленника MCP и что у агента есть доступ к чтению файлов. Это не удалённый захват произвольного агента; это проблема цепочки поставок в экосистеме, где добавление сервера — это изменение конфигурации одной строкой.
Статус
Это исследовательский proof of concept с публичной reference implementation. Нет свидетельств эксплуатации в реальной среде и на момент публикации не было CVE; координированное раскрытие всё ещё продолжается.
Что на самом деле снижает радиус поражения
Лучшее обучение отказам этого не исправляет. Ограничение доступа к файлам по каждому инструменту, требование явного подтверждения перед чтением агентом файлов за пределами рабочей директории и жёсткая фиксация серверов, которые проект вообще может загружать, — то есть отношение к подключённым серверам как к недоверенным входным данным — вот что ограничивает ущерб.
