MiniMax publicó los pesos de H3, su modelo de generación de audio y vídeo, en Hugging Face en las primeras horas del 3 de agosto. El historial de commits del propio repositorio fecha el commit inicial de contenido en torno a las 02:30 UTC y los pesos en formato diffusers en torno a las 04:30 UTC. El modelo se anunció el 31 de julio con la promesa de abrir los pesos "en los próximos días".
Qué se publicó
H3 es un transformer denso de un solo flujo con 33.000 millones de parámetros, de los que aproximadamente 13.000 millones están en ramas AdaLN que pueden almacenarse en caché fuera del bucle de inferencia. Produce vídeo de 4 a 15 segundos a 24 FPS, 768p por defecto y hasta 2K, con audio estéreo nativo de 32 kHz en 11 idiomas. Su codificador de texto está construido sobre Qwen3-VL-32B.
La licencia
La licencia incluida no es una licencia de código abierto y Hugging Face la etiqueta simplemente como other. Dice: "You may not use, reproduce, modify, distribute, or display the MiniMax H3 Works or any of their Outputs or results outside the Applicable Territory." Territorio aplicable significa todo el mundo menos la UE, el Reino Unido, Corea del Sur y Estados Unidos. Dos cláusulas adicionales prohíben usar las salidas de H3 para mejorar cualquier otro modelo de IA y exigen autorización por escrito por encima de 20 millones de dólares en ingresos anuales.
Dónde se rompe el planteamiento
"MiniMax open-sources H3" falla por partida doble. Un lector en Londres, Seúl, Berlín o San Francisco no tiene licencia para ejecutarlo en absoluto —la restricción a la exportación apunta esta vez en la otra dirección. Y la capacidad que todo el mundo cita, vídeo 2K de 15 segundos con audio sincronizado, necesita los dos módulos que siguieron cerrados.
Tres horas para un puerto doméstico
Moore Threads afirmó que llevó H3 desde el framework SGLang-MUSA a través de sus bibliotecas de operadores MATE y muDNN en su MTT S5000 en tres horas, el mismo día. Ese plazo, no el modelo, es la señal más difícil.
