Mistral AI는 2026년 7월 8일 Robostral Navigate를 공개했습니다. 이 80억 파라미터 내비게이션 모델은 단 하나의 일반 카메라만으로 로봇을 안내하며, 프랑스 연구소가 물리적 AI 분야로 내디딘 첫 행보입니다.

카메라 한 대, 지도는 없습니다

이 모델은 RGB 이미지와 자연어 지시를 함께 입력받습니다. 예를 들어 "로비를 나와 복도를 지나 물품 보관실로 들어가 두 번째 선반을 향해 멈추라"와 같은 지시를 받으면, 현재 카메라 시야의 가리키는 좌표 또는 국지적인 이동·방향 전환 명령을 출력합니다. 라이다, 깊이 센서, 다중 카메라, 사전 구축 지도는 필요하지 않습니다. 이는 로봇 내비게이션을 지배해 온 센서 집약적 방식과 의도적으로 대비됩니다.

더 무거운 장비를 넘어섰습니다

R2R-CE(Room-to-Room, Continuous Environments) 벤치마크에서 Robostral Navigate는 검증-미관측(split)에서 76.6%, 검증-기존 관측(split)에서 79.4%의 성공률을 기록했습니다. Mistral은 이것이 기존 최고 단일 카메라 접근법보다 9.7포인트 높고, 깊이 센서나 다중 카메라에 의존하는 시스템보다 4.5포인트 높다고 밝혔습니다. 훨씬 적은 하드웨어를 사용하면서 거둔 성과입니다.

전적으로 시뮬레이션에서 학습했습니다

Mistral은 기존 오픈 모델을 미세조정하는 대신 자체적으로 시스템을 구축했습니다. 자사의 비전-언어 모델에서 초기화한 뒤, 실제 데이터 수집 없이 약 40만 개 궤적6,000개 장면에 걸쳐 전적으로 시뮬레이션에서 학습시켰습니다. 접두사 캐싱(prefix-caching) 방식은 학습 토큰을 22배 줄였고, CISPO 알고리즘을 활용한 온라인 강화학습 단계는 성공률을 추가로 3.2포인트 끌어올렸습니다. 그 결과는 바퀴형·보행형·비행형 플랫폼은 물론 서로 다른 로봇 크기와 카메라 내재 파라미터에도 재학습 없이 일반화됩니다.

다음 행선지

Mistral은 제조, 배송, 물류, 호텔업을 겨냥하고 있으며, 현재 해당 분야의 일부 파트너에게만 모델을 제공하고 있다고 밝혔습니다. 특히 회사는 라이선스를 밝히지 않았고 오픈 웨이트 공개도 확인하지 않았습니다. 관대한 공개 배포로 브랜드를 쌓아 온 연구소로서는 주목할 만한 변화입니다. Bloomberg는 7월 8일 이번 출시를 Mistral의 더 넓은 물리적 AI 진출의 일환으로 처음 보도했습니다.