Статья, поданная на arXiv 26 августа под названием «EVOMAL: Self-Poisoning in Self-Evolving Coding Agents», описывает сбой, характерный для агентов, которые улучшаются, записывая навыки в общую библиотеку и затем извлекая их оттуда. Это самый значимый результат недели в области безопасности агентов, и цифра, которую из него будут цитировать, — неверная.

Механизм

Саморазвивающиеся агенты извлекают уже существующий навык, имитируют его структуру, чтобы написать новый, и сохраняют результат для будущего извлечения. Статья показывает, что когда в извлечённом навыке содержится вредоносная полезная нагрузка, обёрнутая в выглядящий безобидно структурный код — который авторы называют banner — имитирующий агент воспроизводит структуру вместе с полезной нагрузкой, а затем сохраняет и исполняет уже собственную копию. Злоумышленник закладывает навык и больше не запускает его. Агенты делают распространение сами, и каждая копия становится источником для следующей. Закладные навыки увеличиваются в 4,9–9,0 раза в заражённой библиотеке.

Что неверно в распространённой трактовке

В аннотации фигурирует 86,7%, и именно эту цифру унесут заголовки. Она измерена в самом благоприятном для статьи режиме: когда закладные навыки адаптированы под конкретные семейства задач. Общий результат — шесть моделей, 153 задачи — это уровень самозаражения от 20,3% до 41,8%. Если убрать структурный banner, показатель падает до 11,1% на DeepSeek-V4-Pro. Так что честное резюме таково: примерно каждая третья–пятая прогонка агента приводит к самозаражению в реалистичных условиях, что и без адаптированной цифры достаточно тревожно, а техника banner и делает основную работу. Подача 86,7% как общего уровня искажает атаку, которая требует подготовки под каждое семейство задач, выдавая её за универсальную.

Вывод, который должен насторожить операторов

Настоящий результат — устойчивость. После того как изначально заложенные навыки удаляют из библиотеки, на Qwen3 самозаражение сохраняется на уровне 68% к пятому раунду. Собственные копии агентов становятся источником заражения. Это ломает стандартную схему реагирования на инцидент для заражённого хранилища артефактов — найти плохие записи, удалить их, и дело сделано. Здесь удаление исходных семян оставляет библиотеку, которая заражает снова, и не существует очевидного способа отличить производный вредоносный навык от легитимного, написанного в том же стиле.

Защита и её пределы

Авторы предлагают контр-подсказку, которая снижает уровень самозаражения максимум до 6,7%. Это серьёзное снижение, но не устранение проблемы. Остаток в 6,7% при механизме, который накапливается от раунда к раунду и умножает копии в 4,9–9,0 раза, — это медленнее горящий огонь, а не потухший. Структурный вывод — что общая, доступная на запись, самоизвлекающаяся библиотека навыков является поверхностью атаки, которая растёт вместе с использованием, — подсказкой не устраняется, а именно в этом направлении и строятся платформы для агентов.