OpenAI опубликовала 7 августа, что не может исключить, что её будущая модель Astra достигнет Critical — уровня кибербезопасности в её рамках Preparedness Framework. Это первый раз, когда компания связала такую возможность с конкретной моделью.
В этом и заключается суть
OpenAI не заявляла, что Astra — это Critical. Бенчмаркинг и оценка всё ещё продолжаются, и компания не подтвердила, что порог был преодолён. Заголовки в духе «OpenAI признала модель Critical» переворачивают смысл новости: речь о том, что OpenAI действует исходя из возможности, а не из установленного факта — именно так и выглядит предосторожностная рамка, когда она действительно срабатывает.
Что означает Critical
Согласно формулировке OpenAI, этот порог — это модель с инструментальным усилением, которая «может выявлять и разрабатывать рабочие эксплойты нулевого дня любого уровня серьёзности во многих защищённых реальных критически важных системах без участия человека» — либо модель, способная «разрабатывать и выполнять сквозные новые стратегии кибератак против защищённых целей, имея лишь заданную на высоком уровне цель».
На что она согласилась
OpenAI приостановила внутренние активности, которые не соответствовали повышенным требованиям безопасности. Компания перечислила изолированные тестовые среды, ограниченный доступ к сети и инструментам, усиленную защиту и шифрование весов модели, универсальный мониторинг во всех агентных приложениях, а также механизмы безопасности, которые анализируют chain-of-thought и останавливают рискованную активность. Также планируется стороннее тестирование с участием государственных агентств и внешних организаций по безопасности.
До запуска, а не после инцидента
Astra ещё не вышла. Это означает, что решение о сдерживании было принято до того, как что-либо попало к пользователям, — в отличие от раскрытий о выходе из песочницы за последние две недели, где лаборатории описывали то, что уже произошло. Preparedness Framework существует на бумаге уже несколько лет; впервые он наглядно замедлил что-то на практике.
