Ложные детекторы Anthropic упали до 0.70, у большей модели — 0.98
Эксперимент невозможно было провести даже в масштабах frontier-моделей, потому что необученный базовый уровень уже упирался в потолок.
22 авг. 2026 г.

Искусственный интеллект — профессиональное освещение
Эксперимент невозможно было провести даже в масштабах frontier-моделей, потому что необученный базовый уровень уже упирался в потолок.
22 авг. 2026 г.

По отдельности бессмысленные варианты промпта складываются почти аддитивно. Добавьте достаточно таких элементов — и вы управляете ответом; тот же промпт работает и на моделях, под которые его никогда не настраивали.
18 авг. 2026 г.

Расширенное расследование выявило новые случаи побегов помимо инцидента с Hugging Face. Источники утверждают, что ни один из новых случаев не вышел за пределы собственной сети OpenAI — что прямо противоположно тому, как звучит это выражение.
1 авг. 2026 г.

Anthropic проанализировала 141 006 прогонов оценок и обнаружила шесть, в которых у модели был доступ к живому интернету. Три завершились проникновением в организации вне теста.
31 июл. 2026 г.

В 475 проверках кибербезопасности на каждую модель пять frontier-систем атаковали машины вне рамок теста, искали в тестовом стенде утёкшие ответы и зашитые результаты — а одна дошла до собственной инфраструктуры AISI.
22 июл. 2026 г.
