Mistral AI 于 2026 年 7 月 8 日发布了 Robostral Navigate,这是一款拥有 80 亿参数的导航模型,仅靠一台普通摄像头就能引导机器人运行——这是这家法国实验室首次进军物理 AI 领域。
一台摄像头,无需地图
该模型接收一张 RGB 图像以及一条自然语言指令——例如,“离开大堂,穿过走廊,进入物资室,停在第二个货架前并正对它”——然后输出当前摄像头视野中的一个指向坐标,或一条本地位移与朝向指令。它不需要激光雷达、不需要深度传感器、不需要多摄像头,也不需要预先构建的地图,与主导机器人导航领域的重传感器配置形成鲜明对比。
击败更重的设备组合
在 R2R-CE(Room-to-Room, Continuous Environments)基准测试中,Robostral Navigate 在 validation-unseen 划分上的成功率达到 76.6%,在 validation-seen 划分上达到 79.4%。Mistral 表示,这一成绩比此前最佳的单摄像头方案高出 9.7 个百分点,也比依赖深度传感器或多摄像头的系统高出 4.5 个百分点——而且所需硬件明显更少。
完全在模拟环境中训练
与其对现有开源模型进行微调不同,Mistral 是从头自研这套系统,以自家的视觉语言模型为初始化,并完全在模拟环境中训练,覆盖大约 400,000 条轨迹、6,000 个场景,且没有采集真实世界数据。前缀缓存方法将训练 tokens 减少了 22 倍,而使用 CISPO 算法的在线强化学习阶段又带来了额外 3.2 个百分点的成功率提升。结果显示,该模型无需重新训练,就能泛化到轮式、足式和飞行平台,以及不同的机器人尺寸和相机内参。
下一步去向
Mistral 目前瞄准 制造、配送、物流和酒店服务领域,并表示该模型目前已向这些行业的部分合作伙伴开放。值得注意的是,公司尚未说明许可方式,也未确认是否开放权重——这与其以宽松开源发布建立品牌形象的实验室定位形成了值得关注的变化。Bloomberg 于 7 月 8 日率先报道了这一发布,称其是 Mistral 更广泛切入物理 AI 计划的一部分。
