AgiBot — 상하이의 Zhiyuan Robotics — 는 7월 28일 자사의 체화형 네이티브 멀티모달 모델 WITA-Omni Preview가 DailyOmni 옴니 모달 이해 리더보드에서 전 세계 1위를 차지했으며, 종합 점수 85.21점과 8개 세부 지표 중 6개에서의 우승을 거뒀다고 발표했습니다. 이를 제친 출품작에는 Qwen, Google Gemini, ByteDance Doubao, Nvidia의 모델이 포함됐으며, 차이는 오디오-비주얼 공동 이해와 시간적 추론에서 주장됐습니다.
Thinker, Talker, Actor
핵심은 아키텍처 주장입니다. 대부분의 옴니 모달 시스템은 Thinker-Talker 분리를 사용합니다. 하나의 구성요소가 추론하고, 다른 구성요소가 말합니다. AgiBot은 여기에 세 번째인 Actor를 추가해, 대화형 모델을 나중에 로봇 몸체에 억지로 얹는 대신 물리적 동작과 표정을 음성과 함께 동등한 출력으로 생성하도록 했다고 설명합니다. 제품이 보조자가 아니라 로봇인 회사에 그 순서가 핵심이라는 것입니다.
학습 방식
AgiBot은 수천만 시간에 달하는 오픈소스 및 독점 멀티모달 데이터를 세 단계 파이프라인에 투입했다고 설명합니다. 순서대로 지도 미세조정, 지식 증류, 강화학습 최적화입니다.
빠진 내용
검증에 필요한 대부분이 빠져 있습니다. 파라미터 수도, 라이선스도, 제공 여부도 공개되지 않았습니다. AgiBot의 공개 조직 어느 곳에도 Hugging Face나 GitHub에 올라간 가중치는 없습니다. 점수는 실험실 보고 수치이며 독립적으로 재현되지 않았습니다. 세계 최초라는 주장이 나왔을 때 이는 통상적인 단서지만, 분명히 짚을 필요가 있습니다.
시점
이 발표는 FCC가 미국 장비 인증에서 새로 생산된 해외산 휴머노이드 및 사족보행 로봇을 차단한 같은 주에 나왔고, 중국 기업 6곳이 세계 10대 가장 혁신적인 휴머노이드 스타트업에 포함됐다는 특허 순위 발표가 나온 지 며칠 뒤에 이뤄졌습니다. 중국 로봇의 하드웨어 측은 한 시장에서 배제되는 반면, 모델 측은 벤치마크 승리를 내놓고 있습니다.
