2026년 7월 11일, 중국 핀테크 대기업 Ant Group 산하 embodied-AI 부문인 Robbyant는 로봇 조작 모델 LingBot-VA 2.0를 공개하며, 이를 최초의 "embodied-native" 기초 모델이라고 소개했습니다. 이 주장은 방법론에 관한 것입니다. Robbyant는 기성 비디오 생성기를 개조하는 대신, 물리적 제어를 위해 설계된 인과적 diffusion transformer를 처음부터 사전학습했다고 밝혔습니다.
‘처음부터’의 의미
회사는 로보틱스용 비디오 모델을 미세조정하면 외형은 유지하지만 물리적 구조는 거의 담지 못하는 시각 latent, 폐루프 제어에는 너무 느린 denoising, 그리고 행동이 세계를 어떻게 바꾸는지 학습시키지 못하는 훈련 목표 같은 부담이 따른다고 주장합니다. Robbyant의 표현에 따르면 2.0 버전의 해법은 "causal DiT를 네이티브하게 사전학습"하는 것으로, 콘텐츠 생성에서 빌려온 것이 아니라 embodiment를 위해 전체 스택을 구축했다는 것입니다.
수치
LingBot-VA 2.0은 총 153억개 안팎의 파라미터를 사용하며, 토큰당 약 25억개가 활성화됩니다. 구조는 mixture-of-experts 방식의 "video expert"(128개 라우팅 expert)와 밀집형 "action expert"로 나뉩니다. Robbyant는 RoboTwin 2.0 시뮬레이션 벤치마크의 50개 과제에서 평균 93.6%의 성공률을 기록했다고 밝혔습니다. 이는 자체 v1의 92.2%, 이전 방법인 Motus의 87.9%를 웃도는 수치입니다. 또 추론 최적화로 청크당 지연 시간은 927밀리초에서 142밀리초로 줄어들었고, 비동기 제어는 225 Hz까지 가능해져 약 6배 빨라졌다고 설명했습니다.
유의점
여기 나온 모든 수치는 벤더가 보고한 것으로, Robbyant의 자체 논문과 프로젝트 페이지를 바탕으로 하며 MarkTechPost가 이를 요약했을 뿐 독립적인 재현은 없었습니다. 벤치마크 결과는 시뮬레이션에 한정됐고, 실제 로봇 성능은 에어하키와 컨베이어벨트 처리 같은 과제로 정성적으로만 설명됩니다. 또한 7월 8일 Apache-2.0 라이선스로 공개된 별도의 6억 파라미터 모델 LingBot-VLA 2.0와 달리, VA 2.0의 오픈 웨이트나 코드는 공개 여부가 확인되지 않았습니다. 따라서 현재로서는 논문과 페이지 중심의 발표로 보는 것이 타당합니다.
중국 embodied-AI 경쟁
이번 출시는 이례적으로 밀도 높은 한 주를 마무리합니다. Robbyant는 며칠 사이 depth, vision, vision-language-action policy, world model을 연이어 내놨습니다. 이를 종합하면 Ant Group이 완전한 embodied-AI 스택을 확장하고 있다는 신호이며, 이는 로보틱스 기초 모델과 오픈 공개를 향한 중국의 광범위한 움직임과도 맞닿아 있습니다.
