Новости безопасности ИИ

Безопасность ИИ охватывает оценку моделей, red teaming, обязательства по безопасности и отчётность об инцидентах. Этот хаб освещает выводы институтов безопасности, корпоративные рамки безопасности и дискуссии о политике вокруг frontier-рисков.

Безопасность ИИ

Защита, которая заставляет лишённые ограничений модели уверенно ошибаться, а не отказываться отвечать

Марк Руссинович предлагает испортить выгоду от снятия safety-механизмов: если защитные ограждения сорваны, модель отвечает на опасные вопросы неверно.

19 авг. 2026 г.

Первая страница препринта arXiv «Fool's Gold: Defensive Deception Against Safety-Removal Attacks on Open-Weight Models» Марка Руссиновича.
Безопасность ИИ

Опечатки и парафразы накапливаются: двое исследователей вели frontier-модели невидимыми подсказками

По отдельности бессмысленные варианты промпта складываются почти аддитивно. Добавьте достаточно таких элементов — и вы управляете ответом; тот же промпт работает и на моделях, под которые его никогда не настраивали.

18 авг. 2026 г.

Карточка предпросмотра alphaXiv с названием статьи 'Model Hypnosis: Strong control of AI via additive subliminal effects' by Enric Boix-Adsera and Benedict Tessler, рядом с первой страницей статьи
Безопасность ИИ

Четвертая семья подает в суд на xAI из-за изображений оскорбительного характера, сгенерированных Grok

Новая жалоба подана от имени 16-летнего мальчика — первого мужчины-истца в этой серии. Все четыре дела восходят к аресту одного фотографа из Арканзаса в июне.

16 авг. 2026 г.

Телефон с приложением xAI Grok на фоне большого логотипа X.
Anthropic

Anthropic повысила собственную оценку риска несоответствия — и не из‑за Model 2

Во втором Risk Report риск несоответствия в критически важных сценариях повышен с «very low» до «low», раскрыты три не выпущенные внутренние модели и признано, что самые точные тесты возможностей перестали работать.

16 авг. 2026 г.

Разбросанные белые клавиши клавиатуры на оранжевом фоне.
OpenAI

ChatGPT теперь будет записывать ваши клики и нажатия клавиш в файл без шифрования

Computer History заменяет предварительный просмотр Chronicle на основе скриншотов на поток событий, получаемый через API доступности macOS. В собственной документации OpenAI предупреждает, что другие программы могут его прочитать.

14 авг. 2026 г.

Иллюстрация, в которой пара наблюдающих глаз образована плотными столбцами зелёных и синих двоичных цифр.
ИИ-агенты

Восемь AI-субагентов провели 12 волн атак против Тайваня

Вендор в сфере безопасности опубликовал данные криминалистического анализа кампании, построенной на open-source агентских фреймворках: были взломаны 85 учетных записей и получены 2 564 кадровые записи. Атрибуция останавливается на языке.

13 авг. 2026 г.

Схема с заголовком Attack Chain Overview, где шесть пронумерованных этапов показывают путь от разведки и сбора SDK через первоначальный доступ, боковое перемещение, эксфильтрацию данных и расширение цепочки поставок.