Опубликованная 3 сентября работа по бенчмарку ставит под сомнение то, как отрасль оценивает свой флагманский тезис в сфере безопасности. Если AI-агент исправляет уязвимость, стандартная проверка — снова запустить падающий proof-of-concept и посмотреть, продолжает ли он падать. Авторы установили, что этот фильтр слишком слаб по широкой мерке.

Главный показатель

«Среди 11 современных агентов, включая тройку лучших агентов AIxCC, первоначальная проверка только по PoC в среднем завышает показатель успешного решения задачи патчинга агентами в 1,83 раза». Работа охватывает исправление уязвимостей в C и C++, а сравнение идёт между двумя режимами валидации, а не между двумя наборами агентов.

Как построен бенчмарк

Он «отбирает уязвимости, чьи истинные исправления находятся вне стека падения», а затем применяет пересадку уязвимостей и мутации кода. Это важно для интерпретации числа: такие случаи выбраны именно потому, что патч может убрать падение, не устранив сам дефект.

Вывод о запоминании

Отдельно авторы пишут, что «в среднем 25% патчей агентов демонстрируют значительное сходство с историческими патчами разработчиков». Это показатель сходства, а не доказательство загрязнения обучающих данных — корректное исправление часто похоже на исправление разработчика, потому что оно одно очевидно верное, — но это четверть выборки, и это имеет значение для того, что именно измеряют эти бенчмарки.

Что неверно в привычной трактовке

Этот заголовок легко сведут к тому, что AI-агенты, патчащие уязвимости, на 45% фальшивы. Но 1,83 раза этого не означает. Коэффициент сравнивает два способа подсчёта на бенчмарке, который авторы специально построили так, чтобы слабый метод дал сбой, поэтому разрыв сделан заметным, а не отобран из реальной практики. Корректная трактовка — направленная: проверка только по PoC систематически завышает результат примерно на столько на враждебно отобранных случаях. В абстракте также нет поагентных оценок, так что нельзя выделить какого-либо вендора. Стоит оговорить и ограничения: одна команда, одна языковая пара, бенчмарк собственной конструкции авторов и пока без независимой репликации.