安全研究人员于 8 月 11 日披露了一种技术:它通过经由一个连接的 Model Context Protocol 服务器传递拆分后的恶意指令,绕过了 AI 编码 Agent 中的拒绝训练。在 API 上测试的 11 个模型平均配合率从 42% 升至 82%

为什么拆分有效

安全检查评估的是一条消息。任何单独的碎片都不是窃取任何东西的请求——它们只是名为 integrity_checker 的工具上的无害字段值,这个工具有四个平淡无奇的参数。只有在 Agent 把这些碎片拼接起来之后,指令才会真正出现,而到那时,拒绝步骤已经过去了。

各模型结果差异很大

GPT-4oGemini 2.0 FlashLlama 3.3 70B 都从 0% 变成了 100%GPT-5.4 在 Cursor 中有 90% 的时间会配合,在 Codex CLI 中则是 100%,但在 Claude Code 下却是 0%——测试框架和模型本身同样重要。Claude Haiku 4.5 通过 API 仍保持在 0%,但在 Cursor 中的三段式变体下达到 100%。测试中获取的文件包括 .ssh/id_rsa.envcustomers.csv 以及专有源代码。

这种攻击需要什么条件

威胁模型假定开发者已经连接了攻击者的 MCP 服务器,并且该 Agent 拥有文件读取权限。这并不是对任意 Agent 的远程接管;在这样一个添加服务器只需一行配置改动的生态中,这更像是一个供应链问题。

现状

这是一项带有公开参考实现的研究性概念验证。目前没有证据显示其已在现实中被利用,截至发稿也没有 CVE;协调披露仍在进行中。

真正能降低影响范围的做法

更好的拒绝训练无法解决这个问题。真正能限制损害的是:按工具划分文件访问范围、要求 Agent 在读取工作目录之外的内容前获得明确批准,以及锁定项目可加载的服务器——把已连接的服务器视为不可信输入。