Black Forest Labs 周四发布了 FLUX 3FLUX-mimic,将一款新的多模态基础模型与这家德国实验室首个用于控制物理机器的模型配对推出。对于这家公司而言,这是一次明显转向;它此前最为人所知的,是为欧洲相当大一部分生成式工具提供支撑的图像模型。

FLUX 3

其最引人注目的能力,是一次生成即可输出最长 20 秒、带原生音频的视频——不是先生成视频,再单独配音。它还支持多语言对话和关键帧转视频。该实验室发布的初步偏好评估显示,FLUX 3 对比 Runway Gen-4.5 的支持率为 77%,对比 Luma Ray 3.2 的支持率为 93%。在早期访问结束后,计划推出 FLUX 3 Dev 版本的开放权重。

FLUX-mimic

这款机器人模型是一个 video-action 系统——它会预测场景中接下来应该发生什么,并输出实现这一结果所需的动作。它由总部位于苏黎世的操作公司 Mimic Robotics 共同打造,目前正在 Audi 进行生产部署测试。这个被点名的工业部署案例,是它与大多数物理 AI 相关宣布的区别所在。

为什么视频实验室要做机器人

这一押注在于:如果模型已经学会预测物理世界的下一帧,那么它也就已经学到了机器人策略所需的大部分能力——物体恒常性、接触、后果。视频生成和机器人控制,最终成了同一个预测问题,只是输出头不同。这也是 Google 和 Nvidia 以 world models 进行的同一场赌注,只不过他们是从相反方向走来的。

欧洲视角

Black Forest Labs 是物理 AI 竞赛中最清晰的非美国参与者,其开放权重路线图也很重要:FLUX 图像模型之所以成为默认基础设施,部分原因就在于权重被发布。FLUX 3 Dev 是否会以同样条件推出,将决定视频和控制领域是否会重演这一局面。