arXiv 于 UTC 时间 9 月 1 日 17:58 发布的一篇预印本介绍了 Facet-0,作者将其称为一种机器人基础模型,能够“预测并评估其动作的接触后果”。在 五项亚毫米级计算机装配任务 中,这一经任务适配的系统实现了 82% 的平均成功率,而 最强基线为 15%,其 放置精度为 0.5 毫米,指令延迟为 50 毫秒。
该模型究竟预测什么
不是像素。该架构围绕一种联合的 action-wrench proposal 构建——wrench 指腕部的合力和扭矩。一个因果 wrench 历史会与视觉-语言语义和运动学状态对齐,flow matching 则生成每个动作片段,同时生成它预计会引发的未来腕部 wrench 曲线。随后,基于分布的 Action-Wrench Critic 会在部署回放数据上训练,用以区分那些看起来同样成功、但最终接触结果不同的动作。
常见叙事哪里说错了
2026 年的机器人基础模型故事通常被讲成视觉-语言-动作:把像素和文字给机器人,就能得到行为。但这一结果表明,在装配公差尺度上,视觉通道单独使用时几乎无效——最强的视觉主导基线只达到 15%。不过,在 82% 这一数字传播开来之前,有两点必须说清:其一,这一结果是在机器人上、针对具体零件、对轻量级有界 actor 进行自适应之后测得的,它并不是零样本通用模型的成绩;其二,它覆盖的是 同一实验室中的五项任务,尚未复现,而且只是未经同行评审的预印本。
“基础模型”这个说法承担了太多
训练语料 ManuFacet-1K 包含 1,000 小时 的力同步数据,覆盖 三种 embodiment 和多个制造单元。对于富接触操作而言,这已经是相当严肃的数据集;但与“基础模型”一词通常暗示的语料规模相比,这仍只是九牛一毛。更诚实的说法是:这是一款面向特定物理工况的专用模型,而不是通用模型。
为什么基准比赢家更重要
亚毫米级插入,正是人形机器人和工业机器人厂商不断向工厂承诺、却始终未能兑现的工作。无论如何看待 Facet-0 自己的数字,15% 的基线才是更有价值的数据:它公开量化了仅依赖视觉的策略,与真实装配所需公差之间的差距有多大。
