19 авг. 2026 г.Ежедневный ИИ-брифинг
AI News Today.

Искусственный интеллект — профессиональное освещение

#adversarial ML

Безопасность ИИ

Защита, которая заставляет лишённые ограничений модели уверенно ошибаться, а не отказываться отвечать

Марк Руссинович предлагает испортить выгоду от снятия safety-механизмов: если защитные ограждения сорваны, модель отвечает на опасные вопросы неверно.

2 ч назад

Первая страница препринта arXiv «Fool's Gold: Defensive Deception Against Safety-Removal Attacks on Open-Weight Models» Марка Руссиновича.
adversarial ML — материалы по тегу | AI News Today