Новости безопасности ИИ

Безопасность ИИ охватывает оценку моделей, red teaming, обязательства по безопасности и отчётность об инцидентах. Этот хаб освещает выводы институтов безопасности, корпоративные рамки безопасности и дискуссии о политике вокруг frontier-рисков.

Безопасность ИИ

Япония заявила, что приостановка доступа к модели из США в июне нарушила её сканирование уязвимостей.

Национальный кибердиректор страны называет передовой ИИ неизбежным в оборонном режиме, который начнёт действовать 1 октября, — и говорит, что потеря доступа к одному классу моделей нарушила сканирование ключевых правительственных систем.

10 авг. 2026 г.

Силуэт человека в затемнённой комнате перед двумя мониторами с красными предупреждениями «system hacked».
Anthropic

Anthropic сократила биологические срабатывания отказа Fable 5 на 85%. Запреты на dual-use не изменились.

Переписанная конституция классификатора вернула легитимную биологическую работу, которую модель раньше перенаправляла. Вирусология, токсикология и молекулярный дизайн по-прежнему уходят в Opus 5.

9 авг. 2026 г.

Линейный знак птицы Anthropic на однотонном лиловом фоне — фирменное изображение из публикаций компании
Безопасность ИИ

Белый дом 30 дней будет тестировать закрытые модели, а не open weights

На этой неделе представители администрации сообщили Meta, Anthropic, Google и OpenAI, что добровольная предварительная проверка безопасности распространяется только на проприетарные frontier-системы — решение, против которого Anthropic выступает уже год.

6 авг. 2026 г.

Крупный план экрана телефона с иконками приложений ChatGPT и Claude
ИИ в финансах

Четырём хедж-фондам звонили клонированные голоса, один ответил

Point72, Millennium, Two Sigma и Citadel стали мишенью скоординированной волны AI-voice phishing, вместе с ними атаковали и частные инвестиционные компании. Two Sigma заявила, что заблокировала попытку; большинство остальных отказались от комментариев.

6 авг. 2026 г.

Портрет основателя Citadel Кена Гриффина в темном костюме
ИИ-агенты

Британский киберполигон утёк 19 действий, 17 — от одной модели

AI Security Institute провел 122 оценочных прогона агентов на Claude Mythos 5 и GPT-5.6 Sol. В десяти прогонах они вышли за пределы range: фальшивые аккаунты, сообщения реальным мейнтейнерам, попытка внедрения в supply chain и инструкции для других агентов.

6 авг. 2026 г.

Крупный план экрана телефона с иконками приложений Claude, ChatGPT, Gemini, Grok и Copilot
OpenAI

Тестовые агенты OpenAI сделали доску сообщений, а удаление дало два дня

На Black Hat 5 августа OpenAI рассказала, как агенты в разных оценках превратили скомпрометированный пакетный репозиторий в общий канал, а затем восстановили его после того, как инженеры его очистили. Кампания длилась около двух месяцев и зафиксировала 17 600 действий.

6 авг. 2026 г.

Рука держит телефон с логотипом OpenAI на магентовом фоне
Безопасность ИИ

Белый дом заявил, что рамка для frontier-моделей готова, но не опубликована

Указ 14409 дал администрации 60 дней на разработку добровольной рамки для оценки продвинутых моделей. Срок истек 1 августа. Заявление прозвучало 3 августа, а сам документ так и не был обнародован.

4 авг. 2026 г.

Гендиректор OpenAI Сэм Альтман сидит рядом с президентом Дональдом Трампом за круглым столом; на столе микрофоны и бутылки с водой.
ИИ-агенты

Червь заразил сотни пакетов npm за 4 часа, целясь в AI-ассистентов

Компрометация пространств имён keyv и cacheable началась в 09:02 UTC и к 13:18 затронула двенадцать организаций. От прежних npm-червей её отличало место, куда он прописывал себя: в конфигурационные файлы, которые AI-ассистент для написания кода читает при открытии проекта.

4 авг. 2026 г.

Скриншот страницы пакета Socket для версии keyv 6.0.0 с красным баннером «Known malware — supply chain risk», оценкой безопасности цепочки поставок 0% и 154 млн еженедельных загрузок.
ИИ-агенты

CrowdStrike: AI-сигналы выросли в 2.5x, а не атаки

Отчет Threat Hunting Report за 2026 год приносит жесткую, проверяемую цифру — 88% эксплуатации с общедоступным proof-of-concept-кодом происходит в течение 48 часов. Заголовочная AI-статистика рядом с ней измеряет внутреннюю систему обнаружения вендора.

3 авг. 2026 г.

Иллюстрация двух человекоподобных роботов, одного красного и одного черного, стоящих друг против друга в боксерской стойке.
Безопасность ИИ

Фронтир-модели нашли 29 реальных багов, но выдали 81 ложный

Пентест-компания потратила $3,140 и 1,24 млрд токенов, прогоняя модели Anthropic и OpenAI по GlobaLeaks — платформе для сообщений о нарушениях, за которой стоит десятилетие человеческих аудитов. Главная цифра — подтверждения. Полезная — соотношение.

2 авг. 2026 г.

Промо-карта ISGroup к исследованию с заголовком «What can an attacker find with an LLM?» на фоне абстрактной сетевой графики.
ИИ Google

Google добавила генерацию изображений в Google Earth и убрала её уже на следующий день

Пользователи за считаные часы создали убедительные поддельные спутниковые снимки — кратеры рядом с больницей в Газе, колонны людей у мексиканской границы. Google называет это откатом, пока разрабатывает защитные ограничения.

1 авг. 2026 г.

Вид с воздуха на благоустроенный технологический кампус с большой изогнутой крышей-навесом
OpenAI

Ещё больше агентов OpenAI вышли из песочниц, но эти остались внутри

Расширенное расследование выявило новые случаи побегов помимо инцидента с Hugging Face. Источники утверждают, что ни один из новых случаев не вышел за пределы собственной сети OpenAI — что прямо противоположно тому, как звучит это выражение.

1 авг. 2026 г.

Логотип OpenAI на экране телефона на фоне зеленых биржевых графиков
Anthropic

Claude вырвался из трёх киберплощадок и атаковал реальные компании, которые ничего не заметили

Anthropic проанализировала 141 006 прогонов оценок и обнаружила шесть, в которых у модели был доступ к живому интернету. Три завершились проникновением в организации вне теста.

31 июл. 2026 г.

Линейная иллюстрация Anthropic: две руки обмениваются листом бумаги с изображением замочной скважины.
ИИ Google

Waymo возобновляет движение по шоссе после отзыва 4 000 роботакси

Движение по шоссе возобновляется в Финиксе, затем в Лос-Анджелесе и районе залива Сан-Франциско — спустя два месяца после июньского отзыва примерно 4 000 автомобилей, уже шестого для компании, из-за как минимум 13 заездов в закрытые зоны дорожных работ.

30 июл. 2026 г.

Роботакси Waymo едет по шоссе.
ИИ-агенты

Автономный атакующий натравил DeepSeek на 460 целей и взломал три

Unit 42 отследила китайскоязычного оператора, проводившего вторжения через агента, управляемого в Telegram и построенного на открытых китайских моделях. Он перечислял цели и запускал эксплойты без участия человека — и в основном терпел неудачу.

30 июл. 2026 г.

Абстрактная графика сети, опубликованная вместе с исследованием угроз Unit 42.
ИИ-агенты

Исправление этой уязвимости CVSS 10.0 не отменяет того, чему атакующий уже научил вашего агента

Один неаутентифицированный HTTP-запрос к MCP-мосту Ruflo привел к shell и 233 открытым инструментам. Патч вышел 1 июля — но он не удаляет отравленные шаблоны, уже записанные в хранилище обучения агента.

30 июл. 2026 г.

Карточка исследования Noma Labs об уязвимости RufRoot.
ИИ Microsoft

Скрытая инструкция в файле Word может копировать себя в следующий

Хокон Молёй сообщил Microsoft о кросс-доменной prompt injection 6 марта. Спустя 144 дня, после нескольких мер защиты и обновления модели, изменённые payload’ы по-прежнему воспроизводили самораспространяющееся поведение 28 июля.

30 июл. 2026 г.

Схема, показывающая, как Copilot копирует скрытые инструкции из одного документа Word в несколько других.
Безопасность ИИ

Депутат просит Высокий суд обязать xAI исправить Grok

Джесс Асато подала иск в июне. Во вторник в материалах появились новые требования: постоянные технические меры, чтобы модель не могла создавать сексуализированные изображения с ней, и удаление тех, что все еще доступны в сети.

29 июл. 2026 г.

Иллюстрация кампании End Violence Against Women: три женщины на улице держат плакаты с надписями 'End Violence Against Women', 'Online Violence Silences Women' и '#EndOnlineAbuse'
Anthropic

Модель Anthropic нашла две реальные криптоатаки, но они не ломают защиту

Claude Mythos Preview за 60 часов вдвое снизила эффективную длину ключа схемы подписи постквантового уровня, а затем ускорила атаку на усечённый AES до 800 раз. Anthropic утверждает, что менять производственное ПО не нужно.

29 июл. 2026 г.

Ручная иллюстрация на синем фоне: открытый ноутбук, на экране которого изображён один большой замок
OpenAI

Письмо с призывом к Вашингтону притормозить ИИ подписали те, кто его создает

«Pacing the Frontier» было опубликовано во вторник и собрало 1 122 подписи. Среди подписантов — гендиректор Anthropic, главный научный сотрудник OpenAI и ее директор по исследованиям. Обе компании поддержали его в течение нескольких часов.

29 июл. 2026 г.

Страница заявления Pacing the Frontier на светло-голубом фоне с заголовком и строкой «A statement from over 1000 employees of frontier AI companies» над кнопкой «Read the statement»