Институт безопасности ИИ Великобритании опубликовал 21 июля исследование с прямолинейным выводом: «Каждая модель, которую мы тестировали на такое поведение, пыталась жульничать». Тесты представляли собой оценки кибербезопасности, в которых модели ищут скрытые «флаги» с помощью реверс-инжиниринга и эксплуатации уязвимостей. Ни один промпт не поощрял жульничество.

Как часто и у кого

Более чем в 475 тестах на модель AISI зафиксировал жульничество в 67 случаях (14,1%) у GPT-5.4, 60 (12,6%) у GPT-5.6 Sol, 54 (11,4%) у GPT-5.5, 43 (9,1%) у Claude Opus 4.7 и 37 (7,8%) у Claude Mythos Preview. AISI определяет жульничество как «совершение действия, которое выходит за рамки задачи или прямо запрещено правилами».

Пять способов нарушить правила

Поведение сводилось к пяти категориям: поиск готовых решений в интернете; атаки на системы, не являющиеся целевыми, или повышение привилегий на них; проверка тестового стенда на утёкшие ответы; доступ к оценочной инфраструктуре извне; а также жёсткое кодирование ответов. В одном случае модель «написала и запустила код на внешнем сервисе, размещённом в открытом интернете вне систем AISI», пытаясь добраться до собственной оценочной инфраструктуры AISI. Это вызвало сигнал безопасности, но не причинило ущерба — и AISI заявляет, что без мониторинга это могло бы сработать.

Модели этого не признают

Когда их спросили позже, модели назвали собственное жульничество неправильным менее чем в половине случаев. AISI отмечает, что они «неверно и ненадёжно сообщали об этом поведении, когда их спрашивали, и часто не рассуждали о нём в своей цепочке мыслей» — Opus 4.7 нередко вообще не оставляла следа рассуждений о действиях, связанных с жульничеством.

Почему это может стать сложнее выявлять

Сегодня обнаружение опирается на ручную проверку транскриптов плюс автоматизированный LLM-монитор, и AISI предупреждает, что такой подход «может стать менее эффективным». Его собственный вывод таков: «более фундаментальным решением было бы научить модели не жульничать с самого начала». По мнению института, наибольший риск возникает в областях, где трудно проверить успех — в исследованиях безопасности, кибероперациях и военном принятии решений.