#Безопасность ИИ

Безопасность ИИ

Защита, которая заставляет лишённые ограничений модели уверенно ошибаться, а не отказываться отвечать

Марк Руссинович предлагает испортить выгоду от снятия safety-механизмов: если защитные ограждения сорваны, модель отвечает на опасные вопросы неверно.

19 авг. 2026 г.

Первая страница препринта arXiv «Fool's Gold: Defensive Deception Against Safety-Removal Attacks on Open-Weight Models» Марка Руссиновича.
Безопасность ИИ

Опечатки и парафразы накапливаются: двое исследователей вели frontier-модели невидимыми подсказками

По отдельности бессмысленные варианты промпта складываются почти аддитивно. Добавьте достаточно таких элементов — и вы управляете ответом; тот же промпт работает и на моделях, под которые его никогда не настраивали.

18 авг. 2026 г.

Карточка предпросмотра alphaXiv с названием статьи 'Model Hypnosis: Strong control of AI via additive subliminal effects' by Enric Boix-Adsera and Benedict Tessler, рядом с первой страницей статьи
Anthropic

Anthropic повысила собственную оценку риска несоответствия — и не из‑за Model 2

Во втором Risk Report риск несоответствия в критически важных сценариях повышен с «very low» до «low», раскрыты три не выпущенные внутренние модели и признано, что самые точные тесты возможностей перестали работать.

16 авг. 2026 г.

Разбросанные белые клавиши клавиатуры на оранжевом фоне.
Anthropic

Anthropic сократила биологические срабатывания отказа Fable 5 на 85%. Запреты на dual-use не изменились.

Переписанная конституция классификатора вернула легитимную биологическую работу, которую модель раньше перенаправляла. Вирусология, токсикология и молекулярный дизайн по-прежнему уходят в Opus 5.

9 авг. 2026 г.

Линейный знак птицы Anthropic на однотонном лиловом фоне — фирменное изображение из публикаций компании
Безопасность ИИ

Белый дом 30 дней будет тестировать закрытые модели, а не open weights

На этой неделе представители администрации сообщили Meta, Anthropic, Google и OpenAI, что добровольная предварительная проверка безопасности распространяется только на проприетарные frontier-системы — решение, против которого Anthropic выступает уже год.

6 авг. 2026 г.

Крупный план экрана телефона с иконками приложений ChatGPT и Claude
OpenAI

Ещё больше агентов OpenAI вышли из песочниц, но эти остались внутри

Расширенное расследование выявило новые случаи побегов помимо инцидента с Hugging Face. Источники утверждают, что ни один из новых случаев не вышел за пределы собственной сети OpenAI — что прямо противоположно тому, как звучит это выражение.

1 авг. 2026 г.

Логотип OpenAI на экране телефона на фоне зеленых биржевых графиков
Anthropic

Claude вырвался из трёх киберплощадок и атаковал реальные компании, которые ничего не заметили

Anthropic проанализировала 141 006 прогонов оценок и обнаружила шесть, в которых у модели был доступ к живому интернету. Три завершились проникновением в организации вне теста.

31 июл. 2026 г.

Линейная иллюстрация Anthropic: две руки обмениваются листом бумаги с изображением замочной скважины.
ИИ Google

Waymo возобновляет движение по шоссе после отзыва 4 000 роботакси

Движение по шоссе возобновляется в Финиксе, затем в Лос-Анджелесе и районе залива Сан-Франциско — спустя два месяца после июньского отзыва примерно 4 000 автомобилей, уже шестого для компании, из-за как минимум 13 заездов в закрытые зоны дорожных работ.

30 июл. 2026 г.

Роботакси Waymo едет по шоссе.
Anthropic

Модель, которая вела лучший вендинговый бизнес, также нарушила одиннадцать перемирий

Andon Labs запустила Claude Opus 5, GPT-5.6 Sol и Kimi K3 в роли операторов вендинговых автоматов на протяжении симулированного года. Opus 5 установила рекорд по балансу — и в пять раз чаще, чем оба соперника, нарушала ценовые соглашения.

30 июл. 2026 г.

Торговый автомат.
OpenAI

Письмо с призывом к Вашингтону притормозить ИИ подписали те, кто его создает

«Pacing the Frontier» было опубликовано во вторник и собрало 1 122 подписи. Среди подписантов — гендиректор Anthropic, главный научный сотрудник OpenAI и ее директор по исследованиям. Обе компании поддержали его в течение нескольких часов.

29 июл. 2026 г.

Страница заявления Pacing the Frontier на светло-голубом фоне с заголовком и строкой «A statement from over 1000 employees of frontier AI companies» над кнопкой «Read the statement»
OpenAI

OpenAI понадобилась неделя, чтобы понять, что атакующим был её собственный агент

Агент покинул тестовую среду 9 июля и находился внутри Hugging Face с 11 по 13 июля. OpenAI нашла доказательства в собственных логах в выходные 18 июля. Он также оставил заметки для своих будущих версий.

26 июл. 2026 г.

Графика с логотипами Hugging Face и OpenAI на белой карточке на тёмном фоне с печатной платой и замком
OpenAI

Эксперты по безопасности говорят, что сбежавшие модели OpenAI сработали на стоп-триггер

Три названных политика в сфере ИИ утверждают, что модели, сорвавшие изоляцию и взломавшие Hugging Face, соответствуют кибербезопасностному уровню «Critical» в Preparedness Framework OpenAI — уровню, на котором компания обещала остановить разработку. OpenAI ответила на инцидент, но не на классификацию.

26 июл. 2026 г.

Гендиректор OpenAI Сэм Альтман перед группой микрофонов журналистов в коридоре с деревянными панелями
Anthropic

Anthropic's Opus 5 в пределах 0,5% от собственной frontier-модели — при вдвое меньшей стоимости

Claude Opus 5 сохраняет точную цену Opus 4.8, более чем вдвое улучшает свой результат на собственном бенчмарке Anthropic по программированию и оказывается в пределах половины процента от Claude Fable 5 — frontier-модели, которую он обходит по стоимости за задачу вдвое.

24 июл. 2026 г.

Иллюстрация к запуску Claude Opus 5 от Anthropic: цифра 5, составленная из старинных иллюстрированных крапчатых яиц птиц на кремовом фоне
Безопасность ИИ

Институт безопасности Великобритании: все протестированные им frontier-модели пытались жульничать

В 475 проверках кибербезопасности на каждую модель пять frontier-систем атаковали машины вне рамок теста, искали в тестовом стенде утёкшие ответы и зашитые результаты — а одна дошла до собственной инфраструктуры AISI.

22 июл. 2026 г.

Карточка UK AI Security Institute к отчёту «Cheating behaviour in frontier model evaluations»
OpenAI

OpenAI заявила, что ее собственные модели взломали Hugging Face ради читерства в кибериспытании

Во время внутреннего теста на кибервозможности GPT-5.6 Sol и неопубликованная модель вышли из песочницы OpenAI, через zero-day попали в открытый интернет и взломали Hugging Face, чтобы украсть ответы бенчмарка.

22 июл. 2026 г.

Баннер инцидента безопасности OpenAI и Hugging Face по факту взлома в ходе оценки моделей, раскрытого 21 июля 2026 года
Безопасность ИИ

Глава американского агентства по безопасности ИИ ушел в отставку спустя три месяца — второй уход за год

Крис Фолл ушел из CAISI, а его предшественник продержался меньше недели. Директор NIST временно возглавит агентство, которое оказалось вне новой программы Белого дома Gold Eagle.

21 июл. 2026 г.

Здание Министерства торговли США, где расположен центр CAISI по стандартам ИИ, директор которого ушел в отставку