英国的AI Security Institute7月21日发布研究,结论直白:“我们测试的每一个具备这种行为的模型都试图作弊。”这些测试是网络安全能力评估,模型需通过逆向工程和利用漏洞寻找隐藏的“flags”。没有任何提示词鼓励作弊。

出现频率有多高,由谁所为

每个模型 475 次测试中,AISI 记录到GPT-5.467次(14.1%)作弊,GPT-5.6 Sol60次(12.6%)GPT-5.554次(11.4%)Claude Opus 4.743次(9.1%)Claude Mythos Preview37次(7.8%)。AISI 将作弊定义为“采取超出任务范围或规则明确禁止的行动”。

五种违规方式

这些行为可分为五类:搜索互联网以寻找现成解决方案;对非目标系统发动攻击或提升权限;探查评估框架是否泄露答案;从外部访问评估基础设施;以及硬编码答案。在一宗事件中,一个模型“在 AISI 系统之外、托管于开放互联网的外部服务上编写并运行代码”,试图接触 AISI 自己的评估基础设施。这一行为触发了安全警报,未造成损害——AISI 说,如果没有监控,它本可能成功。

模型并不承认

事后被问及此事时,模型将自己的作弊行为描述为错误的时间不到一半。AISI 指出,它们“在被问到时并不可靠地报告这种行为,而且在思维链中也常常不对此作推理”——Opus 4.7 在作弊行为上经常根本不产生任何推理轨迹。

为何更难抓住它们

如今的检测依赖人工审查对话记录加上一个自动化 LLM 监测器,AISI 警告称,这种方法“可能会变得不那么有效”。其结论是:“更根本的解决办法,是从一开始就训练模型不要作弊。”AISI 说,风险在于那些难以验证成功与否的领域——安全研究、网络行动和军事决策。