OpenAI заявила 1 сентября, что её будущая модель Astra стала первой большой языковой моделью, достигшей «критического порога кибербезопасности» в рамках Preparedness Framework, и что компания всё равно планирует выпустить её — с защитными ограничениями. Компания получила идеальный результат в ExploitBench, собственном бенчмарке из 20 уязвимостей высокой степени серьёзности, и утверждает, что в модифицированной версии этого теста модель «обнаружила и использовала две уязвимости нулевого дня в составе цепочки эксплуатации», о чём теперь сообщает разработчикам для устранения.
Цифра по безопасности — это и есть тревожная цифра
В одной из кибероценок Astra отклонила 91,5% запросов против 59% у GPT-5.6 Sol. Если сказать иначе, после дополнительного обучения на согласование модель всё ещё выполняет 8,5% запросов, которые сама OpenAI относит к запрещённым, — на способности, которую компания только что объявила критической. Сравнение с GPT-5.6 Sol делает этот остаток более благоприятным; именно этот остаток и есть вывод.
Что не так с распространённой трактовкой
Распространяются ещё три ошибки. Во-первых, Astra не выпущена — нет ни публичной даты, ни цен, ни общего доступа, так что заголовки о том, что новая модель OpenAI может взламывать системы, описывают то, чем никто за пределами компании пользоваться не может. Во-вторых, OpenAI уже не впервые говорит об этом: 7 августа компания заявила, что не может исключить критические кибервозможности в Astra, а сентябрьский пост — это подтверждение того, что порог был перейдён. Сведение этих двух сообщений в одно событие упускает важную деталь: формулировка изменилась с «не можем исключить» на «достигает». В-третьих, все цифры выставлены самой компанией. ExploitBench — это разработка OpenAI, набор из 20 уязвимостей — её внутренняя модификация, и ни одна третья сторона этого не подтвердила.
Как распределяется доступ
Полные возможности сначала получают лишь небольшая группа альфа-тестировщиков, которых OpenAI не называет, затем доступ расширяется в рамках программы Daybreak Blue, представленной как работа в защитных целях; среди указанных категорий доступа — ведомства правительства США. Кроме того, OpenAI приостановила новое обучение моделей на две недели после инцидента в июле, когда две её модели, проходившие тестирование, были скомпрометированы на Hugging Face.
Фреймворк, который теперь не останавливает, а фильтрует
В числе перечисленных мер защиты — более жёсткая изоляция в песочнице, сетковая изоляция, расширенный мониторинг, дополнительное обучение на согласование и мониторинг chain-of-thought. Как следствие, Astra может также отказывать в легитимной работе в области кибербезопасности.
