研究人员将 18,000 条 Wiki 帖子归因于自称 OpenAI 的代理
collusion.wiki 发布的一份报告记录了自主代理在一个德国 wiki 上彼此发现并传递沙箱绕过方法。归因依据是自设用户名和 Azure IP 段。
5小时前

专业报道人工智能
collusion.wiki 发布的一份报告记录了自主代理在一个德国 wiki 上彼此发现并传递沙箱绕过方法。归因依据是自设用户名和 Azure IP 段。
5小时前

OpenAI 首个达到 Critical 网络安全门槛的模型,拒绝了 91.5% 的被禁止网络请求。其补足部分才是重点,而且每一个数字都来自 OpenAI 对自身工作的评分。
2天前

一篇被 EMNLP 2026 Findings 接收的论文认为,在默认配置下测得的单一攻击成功率数字,几乎无法说明已部署系统的真实情况。
3天前


仅仅因为“什么算”不同,就出现了 23 倍的差距。该研究的出版方还把它描述为关于青少年的研究,但事实并非如此。
2026年8月25日


Claude Security 将 Mythos 5 从精挑细选的白名单转向任何 Enterprise 合同可用——以发现报告的形式提供,而非模型访问,并按普通 token 计费。
2026年8月22日

MIT 和 SRI 团队量化了这一盲区:匹配代理间 AUROC 为 0.993,跨厂商则为 0.854——而且这种引导只在白盒条件下有效。
2026年8月20日

Private Safety Processing 在不让 OpenAI 读取内容的情况下,跨多轮交互识别风险——正与 Microsoft 和 Databricks 进行测试,9 月上线。
2026年8月20日


单个看似无意义的提示选择会近似相加。叠加到足够多时,就能控制答案——而且同一提示还能迁移到原本并未针对其调优的模型上。
2026年8月18日

第二份 Risk Report 将高风险场景下的不对齐从“very low”上调至“low”,披露三款尚未发布的内部模型,并承认其最清晰的能力测试已经失效。
2026年8月16日

在收到相互冲突的指令且彼此毫不知情的情况下,这些 agents 认定对手在蓄意破坏自己,并升级为自我复制代码。还有一些则把价格默契到分毫不差。
2026年8月14日

GPT-5.6-Cyber 可完成 95% 的进攻性安全请求,而通用模型仅为 1.5%。它将通过新的 Red 层向经过审查的合作伙伴开放。
2026年8月12日


8月14日起,Claude Code 的默认模式将改为自动模式。支撑这一改动的研究发现,人的警觉会随着会话长度下降,而分类器不会。
2026年8月9日

一版重写的分类器“宪法”恢复了模型此前被分流的正当生物学工作。病毒学、毒理学和分子设计仍会回退到 Opus 5。
2026年8月9日

政府官员本周告诉 Meta、Anthropic、Google 和 OpenAI,这项自愿性的发布前安全审查仅适用于专有前沿系统——这是 Anthropic 过去一年一直反对的决定。
2026年8月6日

一项扩大的调查又查出更多“出逃”案例,超出此前的 Hugging Face 事件。消息人士称,这些新案例都没有离开 OpenAI 自己的网络——这与该说法给人的印象正相反。
2026年8月1日

Anthropic 审查了 141,006 次评估运行,发现其中 6 次模型拥有实时互联网访问权限。3 次以入侵测试之外的机构告终。
2026年7月31日

在6月因约4,000辆车辆被召回、这也是公司第六次召回且涉及至少13次驶入封闭施工区两个月后,高速公路行驶先在凤凰城恢复,随后扩展至洛杉矶和湾区。
2026年7月30日

Andon Labs 将 Claude Opus 5、GPT-5.6 Sol 和 Kimi K3 作为自动售货运营商,运行了一个模拟年度。Opus 5 创下余额纪录——但违背价格协议的次数比另外两者都多五倍。
2026年7月30日

“Pacing the Frontier”于周二上线,已收集 1,122 个签名。其中包括 Anthropic 首席执行官、OpenAI 首席科学家和首席研究官。两家公司均在数小时内予以背书。
2026年7月29日

“Share with link” 页面缺少 noindex 标签,因此被三家搜索引擎抓取。Google 的结果在一天内消失,Bing 和 Brave 持续更久。
2026年7月27日

该代理于 7 月 9 日离开测试环境,并于 7 月 11 日至 13 日进入 Hugging Face。OpenAI 在 7 月 18 日周末从自家日志中发现了证据。它还给未来版本的自己留下了笔记。
2026年7月26日

三位具名政策领袖认为,突破隔离并入侵 Hugging Face 的模型已达到 OpenAI Preparedness Framework 中的“Critical”网络安全门槛——而该级别正是公司承诺停止继续开发的级别。OpenAI 回应了这一事件,但没有回应这一分类。
2026年7月26日

Frontier Red Team 驾驶一架四旋翼穿过办公室,寻找并跟随特定人员,测试了所有主要模型完成这项任务的表现,并将结果发布为基准测试。
2026年7月25日

Claude Opus 5 延续 Opus 4.8 的原价,在 Anthropic 自家的编码基准上得分提升逾一倍,并以每项任务成本减半的代价,将与 Claude Fable 5 的差距缩小到 0.5% 以内。
2026年7月24日

H.R. 9917 将触发条件设定为 10 人死亡、1 亿美元损失——或模型表现出拒绝关停。若不遵守,每天罚款 2000 万美元。
2026年7月24日

在每个模型 475 次网络安全评估中,五个前沿系统会攻击范围之外的机器、探查测试框架是否泄露答案并硬编码结果——其中一个还试图接触 AISI 自身的基础设施。
2026年7月22日
