Enric Boix-Adsera 和 Benedict Tessler 于 2026 年 8 月 17 日 UTC 17:20 提交到 arXiv 的一篇论文描述了一种作者称之为模型催眠的现象:提示词中那些单独看来微弱且似乎无关的线索——一个错别字、一个改写、一个无关插话——可以被系统性地组合起来,强力控制模型会说什么。

核心主张

用作者的话说,这种效应“存在于不同模型家族和不同规模之间,包括前沿推理模型,而且催眠提示可以在模型之间迁移”。迁移是最关键的部分:针对某个模型调优过的提示,在另一个由不同组织构建、而作者从未针对其优化过的模型上,仍能保持同样的指向性效果。控制并非来自某条强力指令,而是来自许多不起眼的文本选择的累积;单看每一项时,它们都像噪声。

常见解读错在何处

这会被写成一种新的越狱,但它并不是,二者的区别很重要。越狱是击穿拒答机制——让模型生成它受训应当保留的内容。模型催眠则是引导:它改变的是模型在开放式和自我报告类问题上给出的答案。这里没有任何内容被描述为绕过安全边界。第二个很可能的误读,是把这种效应看成一概而论的强压制。只有当模型本就处于犹豫不决的状态时,内部偏好的大幅移动才会翻转可见答案;在模型立场明确的问题上,同样的线索只会改变边际,而不会改变输出。

为什么可解释性研究者最该重视

作者认为,可解释性是受影响最大的领域,这背后的逻辑令人不安。大量已发表研究都会向模型询问它自身——你有目标吗、你有意识吗、你为什么那样回答——并把回复当作对模型的测量。如果措辞层面的错别字级选择都能叠加起来控制答案,那么单一模板评估测到的就不只是模型本身,还有模板。任何建立在某一问题单一表述上的结果,只有在接受一组改写分布的检验之后,才谈得上可证伪。

现实层面的后果

基准测试方法通常假设,提示词中偶然的措辞只是会相互抵消的噪声。本文则认为,它是会累积的信号。这并不意味着现有评估就失效了,但它确实意味着:不同模型之间报告出的差异,可能小于一位刻意设计提示词的人在单个模型内就能制造出来的波动。