Black Forest Labs는 목요일 FLUX 3FLUX-mimic을 공개하며, 새로운 멀티모달 파운데이션 모델과 독일 연구소가 물리적 기계를 제어하도록 만든 첫 모델을 함께 선보였습니다. 이는 유럽 생성형 도구의 큰 부분을 떠받쳐 온 이미지 모델로 가장 잘 알려진 이 회사에겐 큰 방향 전환입니다.

FLUX 3

핵심 기능은 한 번의 생성으로 최대 20초 분량의 네이티브 오디오 포함 영상입니다. 영상 생성 뒤 별도의 사운드트랙 생성을 거치는 방식이 아닙니다. 또 다국어 대화와 키프레임-투-비디오도 지원합니다. 연구소가 공개한 예비 선호도 평가에서 이 모델은 Runway Gen-4.5를 상대로 77%, Luma Ray 3.2를 상대로 93%를 기록했습니다. FLUX 3 Dev 변형의 오픈 웨이트는 초기 접근이 종료된 뒤 공개될 예정입니다.

FLUX-mimic

이 로보틱스 모델은 비디오-액션 시스템으로, 장면에서 다음에 무엇이 일어나야 하는지 예측하고 이를 실현하기 위한 동작을 출력합니다. 취리히에 기반을 둔 조작 회사 Mimic Robotics와 함께 개발됐으며, 현재 Audi에서 생산 배포 테스트가 진행 중입니다. 이렇게 이름이 공개된 산업 배포 사례가 있다는 점이 대부분의 피지컬 AI 발표와 이 모델을 구분합니다.

비디오 연구소가 로봇을 하는 이유

이들의 베팅은 물리 세계의 다음 프레임을 예측하도록 훈련된 모델이 이미 로봇 정책에 필요한 대부분을 학습했을 것이라는 데 있습니다. 즉, 물체 지속성, 접촉, 결과입니다. 비디오 생성과 로봇 제어는 결국 출력 헤드만 다른 동일한 예측 문제로 수렴합니다. 이는 Google과 Nvidia가 월드 모델로 하고 있는 동일한 내기와도 같지만, 정반대의 방향에서 도달한 것입니다.

유럽의 관점

Black Forest Labs는 피지컬 AI 경쟁에서 미국이 아닌 가장 분명한 진입자이며, 오픈 웨이트 이력도 중요합니다. FLUX 이미지 모델은 가중치가 공개되면서 상당 부분 기본 인프라가 됐습니다. FLUX 3 Dev가 같은 조건으로 출시될지 여부가, 이 흐름이 비디오와 제어에서도 반복될지를 가를 것입니다.