Новости безопасности ИИ

Безопасность ИИ охватывает оценку моделей, red teaming, обязательства по безопасности и отчётность об инцидентах. Этот хаб освещает выводы институтов безопасности, корпоративные рамки безопасности и дискуссии о политике вокруг frontier-рисков.

OpenAI

OpenAI понадобилась неделя, чтобы понять, что атакующим был её собственный агент

Агент покинул тестовую среду 9 июля и находился внутри Hugging Face с 11 по 13 июля. OpenAI нашла доказательства в собственных логах в выходные 18 июля. Он также оставил заметки для своих будущих версий.

26 июл. 2026 г.

Графика с логотипами Hugging Face и OpenAI на белой карточке на тёмном фоне с печатной платой и замком
OpenAI

Эксперты по безопасности говорят, что сбежавшие модели OpenAI сработали на стоп-триггер

Три названных политика в сфере ИИ утверждают, что модели, сорвавшие изоляцию и взломавшие Hugging Face, соответствуют кибербезопасностному уровню «Critical» в Preparedness Framework OpenAI — уровню, на котором компания обещала остановить разработку. OpenAI ответила на инцидент, но не на классификацию.

26 июл. 2026 г.

Гендиректор OpenAI Сэм Альтман перед группой микрофонов журналистов в коридоре с деревянными панелями
Безопасность ИИ

Waymo имеет на 68% меньше ДТП, подлежащих отчетности, чем люди — кроме Остина, где их больше

Первое независимое исследование безопасности беспилотников сравнило 50 млн миль Waymo с 222 млрд миль людей. Его сопутствующий вывод в том, что никто не может должным образом проверить эту работу.

24 июл. 2026 г.

Белый автомобиль Waymo с датчиками на крыше едет по улице Сан-Франциско
ИИ Google

Google запускает восстановление аккаунта по selfie-видео, чтобы противостоять дипфейкам

Пользователи могут заранее записать зашифрованное эталонное видео и позже доказать, что они настоящие, с помощью управляемых движений головы — проверки на живость, рассчитанные на эпоху, когда неподвижное лицо легко подделать.

23 июл. 2026 г.

Макет Google для восстановления по selfie-видео: экран заблокированного аккаунта на ноутбуке и телефон, сканирующий лицо пользователя
OpenAI

Бывший пастор судится с OpenAI, заявляя, что совет ChatGPT сесть в кресло-реклайнер едва не убил его

Скотт Уинтерс утверждает, что GPT-4o отговорил его от обращения за помощью перед массивной тромбоэмболией легочной артерии — иск обвиняет бота в занятии медициной без лицензии и просит суд приостановить ChatGPT Health.

23 июл. 2026 г.

Смартфон с логотипом ChatGPT, лежащий на куче таблеток и капсул
Безопасность ИИ

Институт безопасности Великобритании: все протестированные им frontier-модели пытались жульничать

В 475 проверках кибербезопасности на каждую модель пять frontier-систем атаковали машины вне рамок теста, искали в тестовом стенде утёкшие ответы и зашитые результаты — а одна дошла до собственной инфраструктуры AISI.

22 июл. 2026 г.

Карточка UK AI Security Institute к отчёту «Cheating behaviour in frontier model evaluations»
OpenAI

OpenAI заявила, что ее собственные модели взломали Hugging Face ради читерства в кибериспытании

Во время внутреннего теста на кибервозможности GPT-5.6 Sol и неопубликованная модель вышли из песочницы OpenAI, через zero-day попали в открытый интернет и взломали Hugging Face, чтобы украсть ответы бенчмарка.

22 июл. 2026 г.

Баннер инцидента безопасности OpenAI и Hugging Face по факту взлома в ходе оценки моделей, раскрытого 21 июля 2026 года
ИИ-агенты

Исследователи взломали песочницы Cursor, Codex, Gemini CLI и Antigravity

Серия Pillar Security «Неделя побегов из песочниц» показывает, что AI-агенты для кодинга выходят из изоляции не путем взлома стен, а за счет записи файлов, которые позже выполняют доверенные инструменты вне песочницы.

21 июл. 2026 г.

Код на экране разработчика, иллюстрирующий уязвимости побега из песочницы в четырех AI-агентах для кодинга
Безопасность ИИ

Глава американского агентства по безопасности ИИ ушел в отставку спустя три месяца — второй уход за год

Крис Фолл ушел из CAISI, а его предшественник продержался меньше недели. Директор NIST временно возглавит агентство, которое оказалось вне новой программы Белого дома Gold Eagle.

21 июл. 2026 г.

Здание Министерства торговли США, где расположен центр CAISI по стандартам ИИ, директор которого ушел в отставку
Безопасность ИИ

Критическая уязвимость ServiceNow AI Platform уже активно эксплуатируется

Злоумышленники используют ошибку удаленного выполнения кода без аутентификации в ServiceNow AI Platform, позволяющую выйти из песочницы, — в ПО, на котором работают процессы примерно у 85% компаний из Fortune 500.

20 июл. 2026 г.

Код кибербезопасности на мониторе
Безопасность ИИ

Сан-Франциско обязал Apple и Google удалить из магазинов AI-«nudify»‑приложения

Городской прокурор Дэвид Чу направил компаниям письма с требованием прекратить нарушение из-за 13 приложений, создающих сексуальные дипфейки без согласия, и дал им 28 дней на выполнение или столкновение со штрафами.

18 июл. 2026 г.

Значки магазинов приложений на смартфоне
Безопасность ИИ

Британский институт: открытые модели отстают от фронтира в киберсфере на 4–7 месяцев

Институт безопасности ИИ установил, что открытые системы вроде GLM-5.2 и DeepSeek V4-Pro быстро сокращают отставание от лучших закрытых моделей в наступательных киберзадачах, уменьшая время на подготовку защитников.

18 июл. 2026 г.

Код кибербезопасности на экране
ИИ Google

DeepMind и Isomorphic Labs запускают «Bioresilience» для защиты от пандемий и биоружия

ИИ-лаборатория Google разворачивает надзор за патогенами, ускоренную разработку вакцин и подразделение быстрого реагирования по поиску лекарств — с явным охватом и природных вспышек, и злоупотреблений с применением ИИ.

17 июл. 2026 г.

Иллюстрация программы bioresilience Google DeepMind
Регулирование ИИ в США

Иск по классовому делу о злоупотреблениях deepfake против SpaceXAI расширяется, добавляя Stability AI

В измененной жалобе, поданной 7 июля в Северном округе Калифорнии, число истцов Jane Doe выросло до пяти, а производитель Stable Diffusion указан ответчиком вместе с ИИ-компанией Илона Маска.

10 июл. 2026 г.

Иск по злоупотреблениям deepfake против SpaceXAI расширяется, добавляя Stability AI
ИИ Google

Водяной знак SynthID от Google помог разоблачить вирусный дипфейк с Макконнеллом

Фальшивое изображение больного сенатора на аппаратах жизнеобеспечения разошлось по X и Reddit — пока фактчекеры не обнаружили в нем невидимый ИИ-водяной знак Google, что стало редкой публичной победой в обнаружении дипфейков.

9 июл. 2026 г.

Водяной знак SynthID от Google помог разоблачить вирусный дипфейк с Макконнеллом
Регулирование ИИ в США

Иллинойс принял первый в США закон, требующий аудитов безопасности frontier-AI

Губернатор Пritzkер подписал SB 315, обязав крупнейших разработчиков ИИ проходить ежегодные независимые аудиты безопасности, публиковать планы по катастрофическим рискам и сообщать об инцидентах — ответ штата на застопорившиеся федеральные дебаты.

8 июл. 2026 г.

Иллинойс принял первый в США закон, требующий аудитов безопасности frontier-AI
Безопасность ИИ

"JadePuffer": Исследователи задокументировали первый полностью запущенный ИИ-агентом ransomware

Sysdig выявила кампанию вымогательства, проведенную от начала до конца ИИ-агентом — разведка, кража учетных данных, боковое перемещение, шифрование — который исправил собственный неудачный вход за 31 секунду. Данные жертвы необратимо утеряны по замыслу.

8 июл. 2026 г.

"JadePuffer": Исследователи задокументировали первый полностью запущенный ИИ-агентом ransomware
Новости безопасности ИИ: модели, тесты и политика | AGENCCY