AgiBot——上海的智元机器人——于7月28日宣布,其具身原生多模态模型 WITA-Omni Preview 在 DailyOmni 全模态理解排行榜上位居全球第一,综合得分为 85.21,并在 8项中的6项子指标上胜出。被它超越的模型包括来自 Qwen、Google Gemini、字节跳动 Doubao 和 Nvidia 的模型,AgiBot称其在音视频联合理解和时间推理方面优势明显。
Thinker、Talker、Actor
其架构上的主张才是关键。大多数全模态系统采用 Thinker-Talker 分工:一个组件负责推理,另一个负责发声。AgiBot 在此基础上增加了第三个角色——Actor——使物理动作和表情与语音一样,成为一等输出,而不是事后把聊天模型拼接到机器人身体上。对于一家产品是机器人而非助手的公司来说,这种排序才是重点。
训练方式
AgiBot表示,其使用数千万小时的开源和专有多模态数据,通过三阶段流程训练:先进行监督微调,再进行知识蒸馏,最后进行强化学习优化。
缺失了什么
几乎是读者想核实所需的一切。没有参数量,没有许可证,没有可用性说明。在 Hugging Face 或 GitHub 上,AgiBot的两个公开组织名下都没有权重文件。该分数由实验室报告,尚未经过独立复现——这是标准免责声明,但当这一说法是全球首个时,这一点仍值得明确指出。
时间点
这则消息发布于同一周:FCC 阻止新进口的外国制造类人机器人和四足机器人获得美国设备授权;而在几天前,一项专利排名还显示,中国企业占据全球十大最具创新力类人机器人初创公司中的六席。中国机器人硬件正被挡在一个市场之外,而其模型端则在发布基准测试胜绩。
