Anthropic 的 Frontier Red Team 与 Andon Labs 合作,让 15 个 AI 模型接管一架真实四旋翼无人机的控制权,并要求它们飞过办公室、找到某个特定的人并跟随其移动。相关结果和任务套件已于周五以 Drone-Bench 之名发布。
评分方式
这项任务被拆解为 五个子任务,其中包括 Reconstruct——将办公室视频转化为三维模型——以及 Localize,即将无人机视角与二维障碍物地图进行匹配。对照基准并不是没有辅助的人类:基准线由 使用编码代理的人机团队 设定。任何“模型与人类表现相当”的说法都曲解了实际测量的内容。
瓶颈在哪里
检测和跟随的表现已达到基准线的 近 100%。到 2026 年中,Reconstruction 仅达到约 47%,而这正是拖住整个任务的瓶颈。表现最强的模型除 reconstruction 外,在每一项子任务上都超过了基准;但即便如此,它平均也只在 五项中的三项上超过基准。
明确的限制
Anthropic 没有回避局限,而是直接公布了这些约束:无人机速度较慢、只有单一办公室平面布局、人员数量有限、没有户外测试,也没有人群场景。受测模型涵盖三家开发者在约两年进展中的 15 个版本。
涉及哪些模型
这 15 个模型跨越了三家开发者约两年的前沿进展,从 GPT-4o 和 o1,一直到 Gemini 2.5 Pro 以及后续的 Claude Opus 版本,再到当前一代。将它们作为时间序列来解读正是重点:检测和跟随已接近饱和,而 reconstruction 几乎没有进展。
治理层面的表态
该团队直接点明了风险:一旦可靠性门槛被跨过,现实中就会出现把人工监督视为成本而非安全保障的压力。
