Google DeepMind 周四发布了 Gemini Robotics 2:三个模型首次以单一策略,而非拼接式的行走与操作系统,控制完整人形机器人的腿、躯干、手臂和多指手部。该公司同时公布了一份与其自身标题相矛盾的成绩表。

表格写了什么

在配备 Inspire 手的 Apptronik 的 Apollo 上:从货架取物 76.3%,从桌面取物 68.4%,从地面取物 45.7%。配备 Sharpa 手时:拧下灯泡 92%,系垃圾袋 44%,合上自封袋 40%,把灯泡拧回去 36%,扫入簸箕 32%。在双臂 Franka Duo 夹爪配置上,数据高得多——精确插入 89.6%,工具配套 78.9%

被传播的数字,是表格里最好看的那一格

几乎所有报道都以 92% 的灯泡项目开篇。而反向操作——把灯泡装回去——只有 36%。如果把这份成绩表当作灵巧能力突破来看,它描述的是一个在大约三分之二精细动作任务上都会失败的系统。DeepMind 公开这些数据本身就不寻常,也值得肯定;只引用其中最漂亮的那个数字,则并不妥当。

“可用”这个词分量很重

三个模型已经发布,但并非都真正开放。ER 2 这款具身推理模型已通过 Gemini API 和 AI Studio 进入公开预览——但它不会驱动机器人移动。生成电机指令的 VLA model 仅向早期访问合作伙伴开放。On-Device 2 则仅限 Trusted Testers。Google 的合作伙伴名单之外,没人能运行产生这些结果的那个系统。

能自主,但范围很窄

Google 表示,这段视频是实时且完全自主运行的,这与该领域占主导地位的遥操作人形机器人演示形成了鲜明对比——这一说法成立。但这些机器人是按各自演示任务分别训练出来的,训练过程使用了人工遥操作、视频和模拟,DeepMind 也承认该系统“在泛化到分布外任务方面有限”。这是一种针对特定训练任务的自主执行,而不是通用能力。另一个值得更正的地方是:与这则新闻相关的 Boston Dynamics 合作是在 2026 年 1 月 5 日的 CES 上宣布的。这里演示所用的硬件是 Apptronik 的。