Итальянская фирма, специализирующаяся на offensive security, направила фронтирные модели Anthropic и OpenAI на исходный код GlobaLeaks — открытой платформы для сообщений о нарушениях, которую на протяжении примерно десятилетия независимо проверяли люди, — и опубликовала результат: 29 подтверждённых уязвимостей, 12 проблем, приводящих к отказу в обслуживании, и 42 наблюдения по усилению защиты.
Цель была непростой
Именно это важнее самого количества. GlobaLeaks используют редакции и антикоррупционные структуры, а также неоднократно проверяли специалисты, которым платят за поиск слабых мест. Найти что-то в таком коде — более серьёзное утверждение, чем обнаружить баги в непроверенной кодовой базе.
Соотношение, которое скрывает заголовок
Модели выдали 110 кандидатных находок. Ручная проверка подтвердила 29. Это точность примерно 26 процентов — около трёх четвертей того, что подняли модели, не пережили ревью. Распространённый заголовок о том, что ИИ способен выявлять реальные уязвимости в ПО, верен, но не учитывает издержки.
Что не включает цифра $77
В исследовании говорится о примерно $77 за одну подтверждённую находку при общем расходе около $3,140 на 12,000 запросов и 1,24 млрд токенов. В самом тексте указано, что эта сумма приводится до ручной валидации. Экспертная триажная проверка, превратившая 110 предположений в 29 находок, и дала эти подтверждения — но в число она не входит. Вывод исследования прямо признаёт, что решающая роль по-прежнему остаётся за экспертами.
Смотрите на структуру затрат, а не на итог
Одна цифра заметнее остальных: продвинутая reasoning-модель израсходовала 62 процента бюджета, обрабатывая 7 процентов токенов. В этом и заключается реальная экономика reasoning-моделей в задачах ревью — расходы концентрируются в узком участке работы. Два замечания о происхождении данных. Это саморепорт вендора от компании, которая продаёт именно такую услугу. И цифра 29 не сопровождается опубликованной разбивкой по тяжести, так что её не следует читать как 29 критических уязвимостей; оставшиеся 54 пункта — это проблемы отказа в обслуживании и предложения по усилению защиты, а не эксплуатируемые дыры.
