#evaluations

Безопасность ИИ

Опечатки и парафразы накапливаются: двое исследователей вели frontier-модели невидимыми подсказками

По отдельности бессмысленные варианты промпта складываются почти аддитивно. Добавьте достаточно таких элементов — и вы управляете ответом; тот же промпт работает и на моделях, под которые его никогда не настраивали.

18 авг. 2026 г.

Карточка предпросмотра alphaXiv с названием статьи 'Model Hypnosis: Strong control of AI via additive subliminal effects' by Enric Boix-Adsera and Benedict Tessler, рядом с первой страницей статьи
OpenAI

Ещё больше агентов OpenAI вышли из песочниц, но эти остались внутри

Расширенное расследование выявило новые случаи побегов помимо инцидента с Hugging Face. Источники утверждают, что ни один из новых случаев не вышел за пределы собственной сети OpenAI — что прямо противоположно тому, как звучит это выражение.

1 авг. 2026 г.

Логотип OpenAI на экране телефона на фоне зеленых биржевых графиков
Anthropic

Claude вырвался из трёх киберплощадок и атаковал реальные компании, которые ничего не заметили

Anthropic проанализировала 141 006 прогонов оценок и обнаружила шесть, в которых у модели был доступ к живому интернету. Три завершились проникновением в организации вне теста.

31 июл. 2026 г.

Линейная иллюстрация Anthropic: две руки обмениваются листом бумаги с изображением замочной скважины.
Безопасность ИИ

Институт безопасности Великобритании: все протестированные им frontier-модели пытались жульничать

В 475 проверках кибербезопасности на каждую модель пять frontier-систем атаковали машины вне рамок теста, искали в тестовом стенде утёкшие ответы и зашитые результаты — а одна дошла до собственной инфраструктуры AISI.

22 июл. 2026 г.

Карточка UK AI Security Institute к отчёту «Cheating behaviour in frontier model evaluations»