Microsoft Azure 首席技术官 Mark Russinovich 发布的一篇单作者预印本于 8 月 19 日 00:00 UTC 在 arXiv 上公布,提出了应对开源权重模型安全训练被移除问题的另一种思路。与其试图让移除更难,不如让移除无利可图

机制

abliteration 攻击会剥离开放权重中的拒答行为,随后模型会回答被问到的任何问题。“诱饵加固”会植入自信、看似合理但错误的危险请求答案,并在攻击的可微模拟中进行训练,使其只会在模型处于被攻破状态时被激活,同时保持正常行为不变。

数据

在与 CBRNE 相关的基准切片上,受防护的 122B 模型在0.82 至 0.86 的匹配质量答案上出现致命错误,而未防护模型最高仅为 0.107 个模型中有 6 个通过了预注册的效力门槛;第 7 个、规模更小的模型作为边界案例失败。

常见说法哪里错了

是一篇预印本,而非经过同行评审的结果,也没有独立复现。但更重要的误读是,它并没有让开源权重模型变得安全。它改变的是攻击一款模型的期望收益:攻击者一旦剥除护栏,就无法再相信输出内容,因此模型变成了不可靠的工具,而不是被阻断的工具。若攻击者能力足够强,能够通过外部方式核验答案,则这一防御无效——它针对的是缺乏核验能力的攻击者,这确实是一个真实人群,但并不是最危险的那部分。

同样需要准确看待论文接受的权衡,而不是掩盖的权衡:受防护模型在危险领域被刻意降低准确性。这是一项有代价的设计,会影响合法的化学和生物学用户,而预注册门槛的存在,就是为了衡量正常能力是否仍能保留。

为何这种表述不同寻常

几乎所有针对开放权重安全的研究都在问如何防止移除。这里问的是:一旦移除成功,权重应该做什么——把攻击视为不可避免,并让“战利品”变得不值钱。它更像诱捕系统而不是护栏,也是少见的已发表防御:它默认自己会输掉第一回合。