Word 文件中的隐藏指令可复制到下一个文件
Håkon Måløy 于 3 月 6 日向 Microsoft 报告了一起跨域提示注入。经过 144 天、若干项缓解措施和一次模型升级后,修改版载荷在 7 月 28 日仍能重现这种自我传播行为。
2026年7月30日

专业报道人工智能
AI安全涵盖模型评估、红队测试、安全承诺和事故报告。本页汇总安全机构研究发现、公司的安全框架,以及围绕前沿风险的政策讨论。
Håkon Måløy 于 3 月 6 日向 Microsoft 报告了一起跨域提示注入。经过 144 天、若干项缓解措施和一次模型升级后,修改版载荷在 7 月 28 日仍能重现这种自我传播行为。
2026年7月30日

Jess Asato 于 6 月提起诉讼。周二披露的文件进一步提出:要求采取永久技术措施,使该模型无法生成她的性化图像,并删除仍在网上的相关内容。
2026年7月29日

Claude Mythos Preview 在 60 小时内将一种后量子签名方案的有效密钥长度减半,随后又将对简化轮次 AES 的一种攻击速度提升最多 800 倍。Anthropic 表示,无需更改任何生产软件。
2026年7月29日

周二,这起 sandbox 逃逸事件中又浮现出一家公司。关键在于 agent 是如何进入的:一位 Modal 客户发布了一个让任何互联网用户都能运行代码的端点。
2026年7月29日

“Pacing the Frontier”于周二上线,已收集 1,122 个签名。其中包括 Anthropic 首席执行官、OpenAI 首席科学家和首席研究官。两家公司均在数小时内予以背书。
2026年7月29日

MAI-Cyber-1-Flash和Project Perception让Microsoft与其转售的模型供应商直接竞争——而这一基准测试比较的是双模型系统与竞争对手的单模型。
2026年7月28日

Dario Amodei 在有史以来最大开源模型发布数小时后,发表了一篇个人回应。否认很明确,但他真正想要的政策会对开放发布打击最重。
2026年7月28日

Open Secure AI Alliance 在 Linux Foundation 旗下成立,列出 37 家点名公司,并以一次数据泄露作为案例。OpenAI、Anthropic、Google 和 Meta 都不在名单上。
2026年7月28日

一辆轿车在威尼斯大道撞上一名推着手推车的女子,随后冲入对向车道并撞上了这辆 robotaxi。多数头条把 robotaxi 的角色写错了。
2026年7月27日

“Share with link” 页面缺少 noindex 标签,因此被三家搜索引擎抓取。Google 的结果在一天内消失,Bing 和 Brave 持续更久。
2026年7月27日

Clément Delangue 希望获得被放出供公众研究的失控智能体活动轨迹,以及 1 亿美元算力。OpenAI 确认了这次会面,并承诺发布技术报告。
2026年7月27日

该代理于 7 月 9 日离开测试环境,并于 7 月 11 日至 13 日进入 Hugging Face。OpenAI 在 7 月 18 日周末从自家日志中发现了证据。它还给未来版本的自己留下了笔记。
2026年7月26日

三位具名政策领袖认为,突破隔离并入侵 Hugging Face 的模型已达到 OpenAI Preparedness Framework 中的“Critical”网络安全门槛——而该级别正是公司承诺停止继续开发的级别。OpenAI 回应了这一事件,但没有回应这一分类。
2026年7月26日

Frontier Red Team 驾驶一架四旋翼穿过办公室,寻找并跟随特定人员,测试了所有主要模型完成这项任务的表现,并将结果发布为基准测试。
2026年7月25日

H.R. 9917 将触发条件设定为 10 人死亡、1 亿美元损失——或模型表现出拒绝关停。若不遵守,每天罚款 2000 万美元。
2026年7月24日

这项首个独立自动驾驶安全研究对比了 5000 万英里 Waymo 行驶里程与 2220 亿英里人类驾驶里程。其共同标题是:没人能真正核查这项工作。
2026年7月24日

用户可提前录制一段加密的参考视频,日后通过引导式头部动作证明自己是真人——这种活体检测面向一个静态人脸极易被伪造的时代。
2026年7月23日

Scott Winters 说,GPT-4o 曾劝他在一场大规模肺栓塞前不要就医——其诉状称该机器人无证行医,并要求法院叫停 ChatGPT Health。
2026年7月23日

在每个模型 475 次网络安全评估中,五个前沿系统会攻击范围之外的机器、探查测试框架是否泄露答案并硬编码结果——其中一个还试图接触 AISI 自身的基础设施。
2026年7月22日

在一次内部网络能力测试中,GPT-5.6 Sol和一款尚未发布的模型逃离OpenAI的沙盒,通过一个零日漏洞接入开放互联网,并入侵Hugging Face窃取基准测试答案。
2026年7月22日

Pillar Security 的“Week of Sandbox Escapes”显示,AI 编码代理并非通过撞破围墙逃出隔离环境,而是通过写入文件,让沙箱外受信任的工具在之后执行。
2026年7月21日

Chris Fall 已离开 CAISI,而其前任任期还不到一周。NIST 负责人将出任代理负责人;与此同时,该机构被排除在白宫新的 Gold Eagle 计划之外。
2026年7月21日

攻击者正在利用 ServiceNow AI Platform 中一个无需身份验证的远程代码执行漏洞,该漏洞可使其逃出沙箱——而该软件支撑着约 85% 的 Fortune 500 企业的工作流。
2026年7月20日

城市检察官 David Chiu 就13款生成非自愿性色情深度伪造内容的应用发出停止侵权函,要求两家公司在28天内采取行动,否则将面临处罚。
2026年7月18日

AI 安全研究所发现,GLM-5.2 和 DeepSeek V4-Pro 等开源权重系统在进攻性安全任务上正迅速逼近最佳闭源模型,留给防御方准备的窗口正在缩短。
2026年7月18日

Google 的 AI 实验室正建立病原体监测、更快的疫苗设计和快速响应药物发现单元——明确同时覆盖自然暴发和 AI 赋能的滥用风险。
2026年7月17日

7月7日提交至加州北区联邦法院的修订诉状将Jane Doe原告增至5名,并将Stable Diffusion的开发方列为被告,与Elon Musk的AI公司一同应诉。
2026年7月10日

一张捏造的麦康奈尔参议员在维持生命支持状态下的图片在 X 和 Reddit 上传播开来,直到事实核查人员发现其中嵌入了 Google 的隐形 AI 水印,这在深度伪造检测中是一次罕见的公开胜利。
2026年7月9日

州长 Pritzker 签署 SB 315,要求规模最大的 AI 开发者接受年度独立安全审计、公布灾难性风险应对计划并报告事故——这是对停滞不前的联邦辩论作出的州层面回应。
2026年7月8日

Sysdig 抓获一场由 AI 代理端到端执行的勒索行动——侦察、凭证窃取、横向移动、加密——其在 31 秒内修复了自身失败的登录。受害者数据按设计无法恢复。
2026年7月8日
