2026年7月11日,中国金融科技巨头Ant Group旗下的具身AI部门Robbyant发布了LingBot-VA 2.0,这是一款机器人操控模型,Robbyant称其为首个“embodied-native”基础模型。该说法强调的是方法:Robbyant表示,其并非在现成的视频生成模型上做适配,而是从零开始预训练了一个因果diffusion transformer,专门用于物理控制。

为什么强调“从零开始”

公司认为,将视频模型微调用于机器人会带来一系列包袱——视觉潜变量更能保留外观、却难以体现物理结构;去噪速度太慢,不适合闭环控制;训练目标也从未教会模型动作如何重塑世界。Robbyant对 2.0 版本的回应是,它“原生预训练了一个因果 DiT”,为具身智能构建整套技术栈,而不是借用内容生成领域的模型。

数据

LingBot-VA 2.0 总参数量约为153亿,每个 token 约有25亿激活参数,采用 mixture-of-experts 设计,分为一个“video expert”(128个路由专家)和一个稠密的“action expert”。Robbyant称,该模型在 RoboTwin 2.0 仿真基准的50项任务上平均成功率达93.6%——高于其上一代版本的92.2%,也高于先前方法 Motus 的87.9%。一系列推理优化将每个 chunk 的时延从927毫秒降至142毫秒,使其能够以225 Hz进行异步控制,速度约提升六倍。

需要注意的限制

这里的每一项数据都来自厂商披露,出自 Robbyant 自身论文和项目页面,并由 MarkTechPost 汇总,尚无独立复现。基准结果仅限仿真;模型在真实机器人上的表现仅被定性描述(如空气曲棍球和传送带搬运等任务)。此外,与兄弟模型LingBot-VLA 2.0——一款独立的60亿参数模型,于7月8日以 Apache-2.0 许可发布——不同,VA 2.0 的开源权重或代码尚未得到确认发布,因此目前更适合被视为一则论文和页面公告。

中国具身AI竞赛

此次发布为密集的一周画上句号:Robbyant在短短几天内连续推出了深度、视觉、视觉-语言-动作策略和世界模型。整体来看,这一节奏表明 Ant Group 正在扩展一整套具身AI技术栈,也契合中国在机器人基础模型和开源发布上的更大范围推进。