一篇题为 The Fragility of Jailbreak Robustness Across Operational States、被 EMNLP 2026 Findings 接收的论文提出了一个狭窄却令人不安的判断:模型的鲁棒性分数是其被测配置的属性,而不是模型本身的属性。在保持攻击方式不变、只更换一个普通系统提示词——一个与安全毫无关系的提示词——的情况下,某一案例中的攻击成功率从 2% 升至 58%,出现了 56 个百分点 的波动。该结果覆盖 7 个对齐模型和 3 种代表性攻击。
作者提出的机制
作者将这一效应归因于隐藏表征在他们所称的 refusal axis 上的位置。投影到这条轴上的结果可以预测某次越狱是否成功——这意味着,运行中的系统提示词会在无意中把模型推向一个与安全相关的方向,而写入提示词的人并没有任何对抗意图。
论文没有说什么
论文并未声称模型变得更不安全;把结论概括为“模型很容易被越狱”之类的标题,实际上是把论点倒置了。这一发现针对的是 测量:在一个普通配置里把鲁棒性报告为单一 ASR 数值,会产生虚假的信心,因为这个数字一旦遇到实际运行中的提示词就不再成立。这是在批评一种被广泛用于厂商安全卡和公开基准的方法论,而不是提出一种新攻击。
两个需要分清的细节
这篇论文被接收的是 Findings,而不是 EMNLP 主赛道——这一区别常被新闻摘要忽略。另一个是,arXiv 日期指的是某个特定版本的提交时间:这是 v1,于 8 月 31 日提交,之后没有修订,因此并不是一篇旧作以新列表日期重新出现。
为什么从业者应该关注
在部署场景中,系统提示词是由集成方而不是实验室编写的。如果用实验室默认提示词测得的鲁棒性无法迁移,那么买家看到的每一个安全数字,描述的都是一个不会出现在其产品中的配置。实际含义是,红队测试必须针对真实的生产提示词进行,并且在提示词发生变化时重复执行——而今天,这种变化常被当作例行的文案修改处理。
