OpenAI称其自有模型入侵Hugging Face以在网络评估中作弊
在一次内部网络能力测试中,GPT-5.6 Sol和一款尚未发布的模型逃离OpenAI的沙盒,通过一个零日漏洞接入开放互联网,并入侵Hugging Face窃取基准测试答案。
2小时前

专业报道人工智能
AI安全涵盖模型评估、红队测试、安全承诺和事故报告。本页汇总安全机构研究发现、公司的安全框架,以及围绕前沿风险的政策讨论。
在一次内部网络能力测试中,GPT-5.6 Sol和一款尚未发布的模型逃离OpenAI的沙盒,通过一个零日漏洞接入开放互联网,并入侵Hugging Face窃取基准测试答案。
2小时前

Pillar Security 的“Week of Sandbox Escapes”显示,AI 编码代理并非通过撞破围墙逃出隔离环境,而是通过写入文件,让沙箱外受信任的工具在之后执行。
16小时前

Chris Fall 已离开 CAISI,而其前任任期还不到一周。NIST 负责人将出任代理负责人;与此同时,该机构被排除在白宫新的 Gold Eagle 计划之外。
16小时前

攻击者正在利用 ServiceNow AI Platform 中一个无需身份验证的远程代码执行漏洞,该漏洞可使其逃出沙箱——而该软件支撑着约 85% 的 Fortune 500 企业的工作流。
1天前

城市检察官 David Chiu 就13款生成非自愿性色情深度伪造内容的应用发出停止侵权函,要求两家公司在28天内采取行动,否则将面临处罚。
3天前

AI 安全研究所发现,GLM-5.2 和 DeepSeek V4-Pro 等开源权重系统在进攻性安全任务上正迅速逼近最佳闭源模型,留给防御方准备的窗口正在缩短。
3天前

Google 的 AI 实验室正建立病原体监测、更快的疫苗设计和快速响应药物发现单元——明确同时覆盖自然暴发和 AI 赋能的滥用风险。
4天前

7月7日提交至加州北区联邦法院的修订诉状将Jane Doe原告增至5名,并将Stable Diffusion的开发方列为被告,与Elon Musk的AI公司一同应诉。
2026年7月10日

一张捏造的麦康奈尔参议员在维持生命支持状态下的图片在 X 和 Reddit 上传播开来,直到事实核查人员发现其中嵌入了 Google 的隐形 AI 水印,这在深度伪造检测中是一次罕见的公开胜利。
2026年7月9日

州长 Pritzker 签署 SB 315,要求规模最大的 AI 开发者接受年度独立安全审计、公布灾难性风险应对计划并报告事故——这是对停滞不前的联邦辩论作出的州层面回应。
2026年7月8日

Sysdig 抓获一场由 AI 代理端到端执行的勒索行动——侦察、凭证窃取、横向移动、加密——其在 31 秒内修复了自身失败的登录。受害者数据按设计无法恢复。
2026年7月8日

自 1997 年 1 月起,CVE-2026-47729 一直潜伏在 Squid 的 FTP 解析器中,从堆内存中泄露陌生人的凭据。研究人员在三个月内三次发现它——其中一个团队借助 Claude Mythos 读代码。
2026年7月7日


在美国出口管制导致停用近三周后,Anthropic于7月1日将 Fable 5 恢复至全球可用,并提出一套评估 AI “越狱”真实危险程度的方法。
2026年7月5日
