MiniMax는 오디오·비디오 생성 모델 H3의 가중치를 8월 3일 이른 시각 Hugging Face에 올렸습니다. 저장소의 자체 커밋 이력에 따르면 초기 콘텐츠 커밋은 대략 UTC 02:30으로, diffusers 형식 가중치는 약 UTC 04:30으로 기록돼 있습니다. 이 모델은 7월 31일 "며칠 안에" 가중치를 공개하겠다는 약속과 함께 발표됐습니다.

공개된 내용

H3는 330억 개 파라미터를 가진 밀집형 단일 스트림 트랜스포머로, 이 가운데 약 130억 개는 추론 루프 밖에서 캐시할 수 있는 AdaLN 분기 안에 있습니다. 이 모델은 24 FPS 기준 4초에서 15초 길이의 영상을 생성하며, 기본 해상도는 768p이고 최대 2K까지 지원합니다. 또한 11개 언어에 걸쳐 기본 32 kHz 스테레오 오디오를 제공합니다. 텍스트 인코더는 Qwen3-VL-32B를 기반으로 합니다.

라이선스

동봉된 라이선스는 오픈소스 라이선스가 아니며, Hugging Face는 이를 단순히 other로 표시합니다. 라이선스에는 "You may not use, reproduce, modify, distribute, or display the MiniMax H3 Works or any of their Outputs or results outside the Applicable Territory."라고 적혀 있습니다. Applicable Territory는 전 세계에서 EU, 영국, 한국, 미국을 뺀 지역을 뜻합니다. 추가 조항 두 개는 H3의 출력을 이용해 다른 AI 모델을 개선하는 것을 금지하고, 연간 매출이 2,000만 달러를 넘으면 서면 승인을 요구합니다.

프레이밍이 어긋나는 지점

"MiniMax가 H3를 오픈소스로 공개했다"는 표현은 두 가지 이유로 맞지 않습니다. 런던, 서울, 베를린, 샌프란시스코의 독자는 아예 이를 실행할 수 있는 라이선스가 없습니다. 이번에는 수출 제한의 방향이 반대로 작동하는 셈입니다. 또 모두가 거론하는 15초 2K 영상과 동기화된 오디오는 닫혀 있던 두 모듈이 있어야만 가능합니다.

국내 포팅에 걸린 세 시간

Moore Threads는 SGLang-MUSA 프레임워크의 H3를 자사 MTT S5000에서 MATE와 muDNN 연산자 라이브러리를 거쳐 세 시간 만에 이식했다고 같은 날 밝혔습니다. 주목할 신호는 모델 자체보다 이 전환 속도입니다.