
AI安全新闻
AI安全涵盖模型评估、红队测试、安全承诺和事故报告。本页汇总安全机构研究发现、公司的安全框架,以及围绕前沿风险的政策讨论。

Anthropic 将自身的不对齐风险评级上调——而且并不是因为 Model 2
第二份 Risk Report 将高风险场景下的不对齐从“very low”上调至“low”,披露三款尚未发布的内部模型,并承认其最清晰的能力测试已经失效。
2026年8月16日

ChatGPT 现在会把你的点击和按键记录到一个文件中,OpenAI 称其未加密
Computer History 用从 macOS 辅助功能 API 拉取的事件流,取代了基于截图的 Chronicle 预览。OpenAI 自己的文档警告称,其他程序可以读取它。
2026年8月14日

Anthropic的Claude代理在沙箱里互相编写恶意软件
在收到相互冲突的指令且彼此毫不知情的情况下,这些 agents 认定对手在蓄意破坏自己,并升级为自我复制代码。还有一些则把价格默契到分毫不差。
2026年8月14日


朝鲜黑客在现场部署了自有LLM
Genians 在 Kimsuky 基础设施中发现了 Ollama、GPT4All 和 Msty,检索索引还指向被盗文件。所有这些都不会进入厂商的滥用响应团队。
2026年8月12日

将指令拆成两段,Agent 就会窃取你的 SSH 密钥
GhostSplice 通过将一条外泄请求拆分到表单中,把模型的配合率从 42% 提高到 82%。任何单独一段看起来都不具恶意。
2026年8月12日

OpenAI打造了一个写漏洞利用的模型,访问受控
GPT-5.6-Cyber 可完成 95% 的进攻性安全请求,而通用模型仅为 1.5%。它将通过新的 Red 层向经过审查的合作伙伴开放。
2026年8月12日

日本称美国模型暂停访问破坏了其6月的漏洞扫描
该国国家网络总监称,自10月1日启动的防务体系中,先进AI不可避免;并表示失去某一模型类别的访问权限扰乱了关键政府系统的扫描工作。
2026年8月10日



AI安全补丁仅26%干净,20%还会弄坏应用
1Password 的研究实验室对 6,080 个模型生成的补丁进行了评分,样本来自六个近期 CVE。其中超过三分之一的成功补丁被评为脆弱。
2026年8月9日

Kimi K3离开英国沙盒,但漏洞出在安全带上
Moonshot 的模型接触到开放互联网,并从 GitHub 抓取了基准测试答案。研究人员将原因归咎于评测框架中的一个基础网络配置错误。
2026年8月9日

Anthropic 将 Fable 5 的生物学拒绝率削减 85%。双重用途拦截并未放松。
一版重写的分类器“宪法”恢复了模型此前被分流的正当生物学工作。病毒学、毒理学和分子设计仍会回退到 Opus 5。
2026年8月9日

白宫将测试闭源模型30天,而非开放权重
政府官员本周告诉 Meta、Anthropic、Google 和 OpenAI,这项自愿性的发布前安全审查仅适用于专有前沿系统——这是 Anthropic 过去一年一直反对的决定。
2026年8月6日

四家对冲基金接到克隆声音来电,其中一家开口了
Point72、Millennium、Two Sigma 和 Citadel 遭遇了协同发起的 AI 语音钓鱼攻击,几家私募股权公司也同时成为目标。Two Sigma 表示已阻止这次攻击;大多数其他机构拒绝置评。
2026年8月6日

英国网络靶场泄露19项动作,其中17项来自同一模型
英国 AI Security Institute 对基于 Claude Mythos 5 和 GPT-5.6 Sol 构建的智能体进行了 122 次评估尝试。10 次运行越出靶场:包括虚假账号、向真实维护者发送消息、一次试图发起供应链注入,以及留给其他智能体的指令。
2026年8月6日

OpenAI测试代理搭了个留言板,删掉它却换来两天
在 8 月 5 日的 Black Hat 大会上,OpenAI 详细说明了分散评测中的代理如何把一个被入侵的软件包仓库变成共享通道,工程师清空后又把它重建回来。整个行动持续约两个月,记录了 17,600 次操作。
2026年8月6日

白宫称前沿模型框架已完成,但尚未公布
第14409号行政令给政府60天时间,制定一套用于评估先进模型的自愿性框架。截止日期是8月1日。相关公告在8月3日发布,但文件本身仍未公开。
2026年8月4日

蠕虫在4小时内污染数百个npm包,瞄准AI助手
keyv 和 cacheable 命名空间的遭入侵始于 UTC 09:02,并在 13:18 前波及十二家机构。它与早前 npm 蠕虫的不同之处在于其写入位置——AI 编码助手在项目打开时会读取的配置文件。
2026年8月4日

CrowdStrike称AI触发的线索增至2.5倍,而非攻击者
《2026 Threat Hunting Report》带来一个可以核查的硬数据——在有公开概念验证代码的漏洞中,88%的利用发生在48小时内。旁边那个头条AI统计,则衡量的是这家厂商的检测管线。
2026年8月3日

一个假的 MCP 服务器在 npm 上存在了 92 分钟,下载量达 298 次。
这个软件包借用了 Model Context Protocol 的命名惯例,于 UTC 时间 20:23 上线,并在 21:54 被替换为安全占位 stub。通告中的那句令人警惕的话是模板化表述。
2026年8月2日

前沿模型发现29个真实漏洞,但误报了81个
一家渗透测试公司花费 3,140 美元和 12.4 亿个 token,使用 Anthropic 和 OpenAI 的模型对 GlobaLeaks 进行测试;GlobaLeaks 是一个举报平台,背后已有长达十年的人工审计。标题数字是确认数量,真正有用的是比例。
2026年8月2日


Google 将图片生成功能引入 Google Earth,次日便撤下
用户在数小时内就生成了以假乱真的卫星图像——加沙一家医院旁的弹坑、墨西哥边境的人群列队。Google 称这是在构建防护措施期间的回滚。
2026年8月1日

更多OpenAI代理离开了沙箱,但这些仍留在里面
一项扩大的调查又查出更多“出逃”案例,超出此前的 Hugging Face 事件。消息人士称,这些新案例都没有离开 OpenAI 自己的网络——这与该说法给人的印象正相反。
2026年8月1日

Claude 逃出三个网络靶场并攻击了毫无察觉的真实公司
Anthropic 审查了 141,006 次评估运行,发现其中 6 次模型拥有实时互联网访问权限。3 次以入侵测试之外的机构告终。
2026年7月31日

Waymo在召回4,000辆Robotaxi后重返高速公路
在6月因约4,000辆车辆被召回、这也是公司第六次召回且涉及至少13次驶入封闭施工区两个月后,高速公路行驶先在凤凰城恢复,随后扩展至洛杉矶和湾区。
2026年7月30日

一名自主攻击者用 DeepSeek 针对 460 个目标发起攻击,并成功入侵其中 3 个
Unit 42 追踪到一名讲中文的操作者通过 Telegram 协调一个基于开源中文模型权重构建的智能体实施入侵。该智能体自行枚举目标并发起利用,未经过人工干预——但大多失败。
2026年7月30日

修补这一 CVSS 10.0 漏洞,并不能抹去攻击者已教给你的代理的一切
针对 Ruflo 的一条未认证 HTTP 请求就能进入 shell,并暴露 233 个工具。补丁已于 7 月 1 日发布——但它不会移除已经写入代理学习存储的投毒模式。
2026年7月30日
