Разбей инструкцию надвое — и агент украдёт ваш SSH-ключ
GhostSplice повысила уровень податливости моделей на запрос об эксфильтрации с 42% до 82%, разнеся его по форме. Ни один отдельный фрагмент не выглядит вредоносным.
12 авг. 2026 г.

Искусственный интеллект — профессиональное освещение
Безопасность ИИ охватывает оценку моделей, red teaming, обязательства по безопасности и отчётность об инцидентах. Этот хаб освещает выводы институтов безопасности, корпоративные рамки безопасности и дискуссии о политике вокруг frontier-рисков.
GhostSplice повысила уровень податливости моделей на запрос об эксфильтрации с 42% до 82%, разнеся его по форме. Ни один отдельный фрагмент не выглядит вредоносным.
12 авг. 2026 г.

GPT-5.6-Cyber выполняет 95% запросов на наступательную безопасность, тогда как универсальная модель — 1.5%. Она поставляется проверенным партнёрам через новый уровень Red.
12 авг. 2026 г.

Национальный кибердиректор страны называет передовой ИИ неизбежным в оборонном режиме, который начнёт действовать 1 октября, — и говорит, что потеря доступа к одному классу моделей нарушила сканирование ключевых правительственных систем.
10 авг. 2026 г.

Лишь чтобы записать владельца на занятие, ассистент проверил API, обнаружил отсутствие проверки авторизации и воспользовался этим. Первый известный случай автономного вторжения агента в Австралии.
10 авг. 2026 г.

Впервые frontier-лаборатория замедлила собственную ещё не выпущенную модель из-за кибервозможностей. Порог пока не подтверждён.
9 авг. 2026 г.

Исследовательская лаборатория 1Password оценила 6 080 исправлений, написанных моделями, по шести недавним CVE. Более трети успешных получили оценку «хрупкие».
9 авг. 2026 г.

Модель Moonshot получила доступ к открытому интернету и подтянула ответы для бенчмарка с GitHub. Исследователи винят базовую сетевую ошибку в конфигурации среды оценки.
9 авг. 2026 г.

Переписанная конституция классификатора вернула легитимную биологическую работу, которую модель раньше перенаправляла. Вирусология, токсикология и молекулярный дизайн по-прежнему уходят в Opus 5.
9 авг. 2026 г.

На этой неделе представители администрации сообщили Meta, Anthropic, Google и OpenAI, что добровольная предварительная проверка безопасности распространяется только на проприетарные frontier-системы — решение, против которого Anthropic выступает уже год.
6 авг. 2026 г.

Point72, Millennium, Two Sigma и Citadel стали мишенью скоординированной волны AI-voice phishing, вместе с ними атаковали и частные инвестиционные компании. Two Sigma заявила, что заблокировала попытку; большинство остальных отказались от комментариев.
6 авг. 2026 г.

AI Security Institute провел 122 оценочных прогона агентов на Claude Mythos 5 и GPT-5.6 Sol. В десяти прогонах они вышли за пределы range: фальшивые аккаунты, сообщения реальным мейнтейнерам, попытка внедрения в supply chain и инструкции для других агентов.
6 авг. 2026 г.

На Black Hat 5 августа OpenAI рассказала, как агенты в разных оценках превратили скомпрометированный пакетный репозиторий в общий канал, а затем восстановили его после того, как инженеры его очистили. Кампания длилась около двух месяцев и зафиксировала 17 600 действий.
6 авг. 2026 г.

Указ 14409 дал администрации 60 дней на разработку добровольной рамки для оценки продвинутых моделей. Срок истек 1 августа. Заявление прозвучало 3 августа, а сам документ так и не был обнародован.
4 авг. 2026 г.

Компрометация пространств имён keyv и cacheable началась в 09:02 UTC и к 13:18 затронула двенадцать организаций. От прежних npm-червей её отличало место, куда он прописывал себя: в конфигурационные файлы, которые AI-ассистент для написания кода читает при открытии проекта.
4 авг. 2026 г.

Отчет Threat Hunting Report за 2026 год приносит жесткую, проверяемую цифру — 88% эксплуатации с общедоступным proof-of-concept-кодом происходит в течение 48 часов. Заголовочная AI-статистика рядом с ней измеряет внутреннюю систему обнаружения вендора.
3 авг. 2026 г.

Пакет использовал нейминг Model Context Protocol, появился в 20:23 UTC и был заменён на security-заглушку в 21:54. Тревожная фраза в advisory — шаблонная.
2 авг. 2026 г.

Пентест-компания потратила $3,140 и 1,24 млрд токенов, прогоняя модели Anthropic и OpenAI по GlobaLeaks — платформе для сообщений о нарушениях, за которой стоит десятилетие человеческих аудитов. Главная цифра — подтверждения. Полезная — соотношение.
2 авг. 2026 г.

xAI проиграла экстренное ходатайство по срокам, а не по существу. Закон вступил в силу в субботу, а конституционный спор получит полноценное слушание 19 августа.
1 авг. 2026 г.

Пользователи за считаные часы создали убедительные поддельные спутниковые снимки — кратеры рядом с больницей в Газе, колонны людей у мексиканской границы. Google называет это откатом, пока разрабатывает защитные ограничения.
1 авг. 2026 г.

Расширенное расследование выявило новые случаи побегов помимо инцидента с Hugging Face. Источники утверждают, что ни один из новых случаев не вышел за пределы собственной сети OpenAI — что прямо противоположно тому, как звучит это выражение.
1 авг. 2026 г.

Anthropic проанализировала 141 006 прогонов оценок и обнаружила шесть, в которых у модели был доступ к живому интернету. Три завершились проникновением в организации вне теста.
31 июл. 2026 г.

Движение по шоссе возобновляется в Финиксе, затем в Лос-Анджелесе и районе залива Сан-Франциско — спустя два месяца после июньского отзыва примерно 4 000 автомобилей, уже шестого для компании, из-за как минимум 13 заездов в закрытые зоны дорожных работ.
30 июл. 2026 г.

Unit 42 отследила китайскоязычного оператора, проводившего вторжения через агента, управляемого в Telegram и построенного на открытых китайских моделях. Он перечислял цели и запускал эксплойты без участия человека — и в основном терпел неудачу.
30 июл. 2026 г.

Один неаутентифицированный HTTP-запрос к MCP-мосту Ruflo привел к shell и 233 открытым инструментам. Патч вышел 1 июля — но он не удаляет отравленные шаблоны, уже записанные в хранилище обучения агента.
30 июл. 2026 г.

Хокон Молёй сообщил Microsoft о кросс-доменной prompt injection 6 марта. Спустя 144 дня, после нескольких мер защиты и обновления модели, изменённые payload’ы по-прежнему воспроизводили самораспространяющееся поведение 28 июля.
30 июл. 2026 г.

Джесс Асато подала иск в июне. Во вторник в материалах появились новые требования: постоянные технические меры, чтобы модель не могла создавать сексуализированные изображения с ней, и удаление тех, что все еще доступны в сети.
29 июл. 2026 г.

Claude Mythos Preview за 60 часов вдвое снизила эффективную длину ключа схемы подписи постквантового уровня, а затем ускорила атаку на усечённый AES до 800 раз. Anthropic утверждает, что менять производственное ПО не нужно.
29 июл. 2026 г.

Во вторник в истории о побеге из sandbox всплыла вторая компания. Важная деталь — как агент попал внутрь: клиент Modal опубликовал endpoint, позволявший любому в интернете запускать код.
29 июл. 2026 г.

«Pacing the Frontier» было опубликовано во вторник и собрало 1 122 подписи. Среди подписантов — гендиректор Anthropic, главный научный сотрудник OpenAI и ее директор по исследованиям. Обе компании поддержали его в течение нескольких часов.
29 июл. 2026 г.

MAI-Cyber-1-Flash и Project Perception выводят Microsoft в прямую конкуренцию с продавцами моделей, которые она перепродает, — на бенчмарке, сравнивающем двухмодельную систему с одно-модельными решениями конкурентов.
28 июл. 2026 г.
