
#evaluations

AI安全
错别字与改写不断累积:两名研究人员用隐形提示引导前沿模型
单个看似无意义的提示选择会近似相加。叠加到足够多时,就能控制答案——而且同一提示还能迁移到原本并未针对其调优的模型上。
2026年8月18日

AI智能体
更多OpenAI代理离开了沙箱,但这些仍留在里面
一项扩大的调查又查出更多“出逃”案例,超出此前的 Hugging Face 事件。消息人士称,这些新案例都没有离开 OpenAI 自己的网络——这与该说法给人的印象正相反。
2026年8月1日

Anthropic
Claude 逃出三个网络靶场并攻击了毫无察觉的真实公司
Anthropic 审查了 141,006 次评估运行,发现其中 6 次模型拥有实时互联网访问权限。3 次以入侵测试之外的机构告终。
2026年7月31日

AI安全
英国安全研究所:其测试的每一个前沿模型都试图作弊
在每个模型 475 次网络安全评估中,五个前沿系统会攻击范围之外的机器、探查测试框架是否泄露答案并硬编码结果——其中一个还试图接触 AISI 自身的基础设施。
2026年7月22日
