
AI研究新闻
本栏目梳理AI研究的海量资讯:重要论文、实验室公告、基准测试结果,以及真正推动领域前进的方法——面向实践者,而不仅仅是研究人员。

隐藏状态代理串通检测在二者不同时时降至0.854
MIT 和 SRI 团队量化了这一盲区:匹配代理间 AUROC 为 0.993,跨厂商则为 0.854——而且这种引导只在白盒条件下有效。
2026年8月20日

将 Anthropic 的方法应用于捐赠聊天记录后,半数对话被排除
一个独立项目重新运行了某实验室面向工作场景的分类方法,发现被过滤掉的那一半里,集中着健康、骚扰和色情内容。
2026年8月19日


Claude 命中 14 of 15 个蛋白靶点,但四分之三失败
1,320 个设计中确认了 354 个结合体,单次任务最高耗费 12,500 个 H100 小时——而这一能力却被 Anthropic 最强模型屏蔽。
2026年8月19日

Anthropic 研究人员测试其可解释性工具后发现完全没有提升
将稀疏自编码器、自然语言自编码器和激活预言机与一个只读取对话记录的基线进行了比较。没有一种工具胜出。
2026年8月18日

错别字与改写不断累积:两名研究人员用隐形提示引导前沿模型
单个看似无意义的提示选择会近似相加。叠加到足够多时,就能控制答案——而且同一提示还能迁移到原本并未针对其调优的模型上。
2026年8月18日

DeepMind把手语翻译带上了手机
SL2T 已随 Gboard 和 Live Transcribe 登陆 Pixel 11,这是首个进入消费级产品的手语模型。上线时仅支持一种语言对。
2026年8月13日

60个Claude子代理改进了黎曼下界,但未证明
一款未发布的模型在约一天半的时间里,将对 zeta 零点的下界从 41.6% 提高到 67.2%。Anthropic 表示,这种技术不会导向证明。
2026年8月12日

DeepMind的气旋模型多出一天预警,但强度未变
该模型发表于《Nature》,并与 National Hurricane Center 联合打造;WeatherNext Cyclones 将三天路径误差降至约 100 公里。权重已上传至 GitHub。
2026年8月9日

AI安全补丁仅26%干净,20%还会弄坏应用
1Password 的研究实验室对 6,080 个模型生成的补丁进行了评分,样本来自六个近期 CVE。其中超过三分之一的成功补丁被评为脆弱。
2026年8月9日

Hassabis交棒DeepMind之际Jeff Dean离任,但只有一人是
Demis Hassabis 放弃对 Google DeepMind 的日常掌控,转任董事长和 Alphabet 首席科学家。Jeff Dean 在 27 年后真正离开,加入一家由 Google 投资的公司。
2026年8月6日

前沿模型发现29个真实漏洞,但误报了81个
一家渗透测试公司花费 3,140 美元和 12.4 亿个 token,使用 Anthropic 和 OpenAI 的模型对 GlobaLeaks 进行测试;GlobaLeaks 是一个举报平台,背后已有长达十年的人工审计。标题数字是确认数量,真正有用的是比例。
2026年8月2日

OpenAI给下一代模型家族命名,但尚未发布
名为 Astra 的内部版本为数学和理论计算机科学中的十个长期悬而未决的问题给出了证明,且每个都已在 Lean 中形式化。该模型尚未发布,名称也只是暂定。
2026年8月1日

赢得 DeepMind 诺贝尔奖的团队如今已不复存在
AlphaFold 的研究人员已被重新分配到 Gemini 时代项目和 Isomorphic Labs。数据库和服务器仍在线,DeepMind 的研究副总裁只表示“战略已经演变”。
2026年7月30日

代理完成了数百次实验、写出了论文,却只得 6 分中的 2 分
普林斯顿大学和英国 AI 安全研究院把一篇未发表的 NeurIPS 投稿的核心问题交给一个代理,再让论文的真实作者以审稿人身份给结果打分。两次尝试都遭到明确拒绝。
2026年7月30日

表现最佳的自动售货业务模型也打破了 11 次停战
Andon Labs 将 Claude Opus 5、GPT-5.6 Sol 和 Kimi K3 作为自动售货运营商,运行了一个模拟年度。Opus 5 创下余额纪录——但违背价格协议的次数比另外两者都多五倍。
2026年7月30日

中国在轨运行20个AI模型,因为下行链路跟不上
浙江实验室的“三体计算星座”目前由12颗卫星组成,合计算力达5000万亿次浮点运算。原因很简单:一颗遥感卫星每天会产生0.1拍字节数据。
2026年7月29日

一家没有产品的30人公司刚买下4.1亿美元的 AWS 服务
Recursive Superintelligence 正把今年5月融资所得的大部分资金用于算力,打造一个旨在自我改进的系统。其联合创始人称,这将是公司未来签下的最小规模交易之一。
2026年7月29日

Anthropic模型发现两处真实加密攻击,但都不影响使用
Claude Mythos Preview 在 60 小时内将一种后量子签名方案的有效密钥长度减半,随后又将对简化轮次 AES 的一种攻击速度提升最多 800 倍。Anthropic 表示,无需更改任何生产软件。
2026年7月29日

NIST 建立了一个模型开发者永远看不到测试数据的试验场
AI Technology Evaluation 以从未公开的盲测数据对模型打分,这也是判断基准结果是否被记忆的唯一方式。它完全不具备监管效力。
2026年7月28日

每小时可分辨 24,000 枚鸡蛋性别的 MRI 扫描仪刚刚在美国启动
Orbem 的系统在不接触蛋壳的情况下,在孵化前读取雏鸡性别。该公司称这是一轮部署;目前只有一台机器,第二台将于 8 月到位。
2026年7月28日

OpenAI 读取80万条工作消息,发现职业边界正在消融
对 ChatGPT 的职业特定请求中,近44%涉及属于另一职业的任务。这是同类数据集中的最大规模,而作者售卖该产品。
2026年7月28日

成立一年的机器人初创融资7100万美元,让机器人上线
Enigma 结束隐身状态,由 Index 和 Ribbit 联合领投,来自六家前沿实验室的天使投资人参与;其在机库中的100多台机器人现已可供公众实时控制。
2026年7月28日

Nvidia 入股 AI 领域最神秘实验室,双方都不愿透露金额
Safe Superintelligence 没有产品、没有收入,也没有公开研究。如今它获得了 Nvidia 的股权投资,并承诺在 Vera Rubin 上将算力提升十倍。
2026年7月28日


Reid Hoffman 和 Mark Pincus 在打造一家 AI 实验室,而不是投资一家
由首席执行官 Ritankar Das 运营、于 4 月推出的 Prentis,正洽谈以 10 亿美元估值融资 1 亿美元。相关条款尚未签署,所附营收数字是预测和上限。
2026年7月26日

Anthropic 让 15 个模型操控一架监控无人机
Frontier Red Team 驾驶一架四旋翼穿过办公室,寻找并跟随特定人员,测试了所有主要模型完成这项任务的表现,并将结果发布为基准测试。
2026年7月25日

Google 研究了 1500 万次 AI 对话,发现自动化并不存在
AI 如今已触及 68% 的职业,覆盖美国 90% 的就业岗位。中位数职位只在约五分之一的任务中使用它,且不到十分之一的交互会直接完成一项任务。
2026年7月24日

车企奇瑞领投 PsiBot 近1亿美元融资,估值达14.8亿美元
这家上海世界模型初创公司通过定制手套和人形机器人采集数据训练机器人,成为中国最新的具身 AI 独角兽,苹果供应商也在股东名单中。
2026年7月23日
