Одноавторский препринт технического директора Microsoft Azure Марка Руссиновича, опубликованный на arXiv 19 августа в 00:00 UTC, предлагает иной ответ на проблему open-weight-моделей, у которых снимают обучение безопасности. Вместо того чтобы пытаться сделать снятие сложнее, он делает его невыгодным.
Механизм
Abliteration-атаки удаляют поведение отказа из открытых весов, после чего модель отвечает на любой вопрос. «Decoy hardening» внедряет уверенные, правдоподобные и ложные ответы на опасные запросы, обученные внутри дифференцируемой симуляции атаки, так что они активируются только тогда, когда модель оказывается в скомпрометированном состоянии, не затрагивая нормальное поведение.
Цифры
На срезах бенчмарков, близких к CBRNE, защищённая модель 122B фатально ошибается в 0.82–0.86 сопоставимых по качеству ответов, против не более 0.10 у незащищённой. Шесть из семи моделей прошли предварительно зарегистрированный порог эффективности; седьмая, меньшая, не прошла как пограничный случай.
Что неверно в привычной трактовке
Это препринт, а не рецензированный результат, и независимого воспроизведения нет. Но ещё важнее другое: это не делает open-weight-модели безопасными. Это не так. Меняется ожидаемая ценность атаки на такую модель: злоумышленник, снявший защитные ограждения, больше не может доверять тому, что выдаётся на выходе, и модель становится ненадёжным инструментом, а не заблокированным. Достаточно компетентный атакующий, который может проверять ответы внешними средствами, не страдает — защита работает против тех, кому не хватает экспертизы для проверки, а это реальная группа, но не самый опасный хвост распределения.
Важно и то, на какой компромисс прямо идёт статья: защищённую модель намеренно делают неточной в опасных доменах. Это осознанное решение с издержками для добросовестных пользователей химии и биологии, а предварительно зарегистрированный порог нужен, чтобы измерить, сохраняются ли обычные возможности.
Почему такая рамка необычна
Почти вся работа по безопасности open-weight-моделей ставит вопрос так: как не допустить снятия защиты. Здесь же спрашивается, что должны делать веса после того, как снятие всё же удалось, — атака считается неизбежной, а награда за неё обесценивается. Это ближе к honeypot, чем к защитному барьеру, и это редкий опубликованный метод защиты, исходящий из предположения, что он проиграет первый бой.
