MiniMax a mis en ligne les poids de H3, son modèle de génération audio-vidéo, sur Hugging Face dans les premières heures du 3 août. L’historique de commits du dépôt date le premier commit de contenu d’environ 02:30 UTC et les poids au format diffusers d’environ 04:30 UTC. Le modèle avait été annoncé le 31 juillet avec la promesse d’ouvrir les poids « dans les prochains jours ».

Ce qui a été publié

H3 est un transformer dense à flux unique de 33 milliards de paramètres, dont environ 13 milliards se trouvent dans des branches AdaLN qui peuvent être mises en cache hors de la boucle d’inférence. Il génère des vidéos de 4 à 15 secondes à 24 FPS, en 768p par défaut et jusqu’à 2K, avec un audio stéréo natif à 32 kHz dans 11 langues. Son encodeur de texte repose sur Qwen3-VL-32B.

La licence

La licence fournie n’est pas une licence open source et Hugging Face la classe simplement comme other. Elle stipule : « Vous ne pouvez pas utiliser, reproduire, modifier, distribuer ou afficher les œuvres MiniMax H3 ni l’un quelconque de leurs résultats ou sorties en dehors du territoire applicable. » Le territoire applicable signifie le monde entier à l’exception de l’UE, du Royaume-Uni, de la Corée du Sud et des États-Unis. Deux autres clauses interdisent d’utiliser les sorties de H3 pour améliorer tout autre modèle d’IA, et exigent une autorisation écrite au-delà de 20 millions de dollars de chiffre d’affaires annuel.

Pourquoi ce cadrage ne tient pas

Dire que « MiniMax open-source H3 » ne tient pas à deux titres. Un lecteur à Londres, Séoul, Berlin ou San Francisco n’est tout simplement pas autorisé à l’exécuter — la restriction à l’exportation pointe cette fois dans l’autre sens. Et la capacité que tout le monde cite, des vidéos 2K de 15 secondes avec audio synchronisé, dépend des deux modules restés fermés.

Trois heures pour un portage domestique

Moore Threads a indiqué avoir porté H3 depuis le framework SGLang-MUSA vers ses bibliothèques d’opérateurs MATE et muDNN sur sa MTT S5000 en trois heures, le même jour. Ce délai, et non le modèle, est le signal le plus fort.