MiniMax ha caricato su Hugging Face i pesi di H3, il suo modello di generazione audio-video, nelle prime ore del 3 agosto. La cronologia dei commit del repository data il primo commit di contenuto a circa 02:30 UTC e i pesi in formato diffusers a circa 04:30 UTC. Il modello era stato annunciato il 31 luglio con la promessa di aprire i pesi «nei prossimi giorni».
Cosa è stato rilasciato
H3 è un transformer denso a flusso unico da 33 miliardi di parametri, di cui circa 13 miliardi si trovano in branche AdaLN che possono essere messe in cache fuori dal loop di inferenza. Produce video da 4 a 15 secondi a 24 FPS, in 768p per impostazione predefinita e fino a 2K, con audio stereo nativo a 32 kHz in 11 lingue. Il suo encoder testuale si basa su Qwen3-VL-32B.
La licenza
La licenza allegata non è una licenza open source e Hugging Face la classifica semplicemente come other. Recita: "You may not use, reproduce, modify, distribute, or display the MiniMax H3 Works or any of their Outputs or results outside the Applicable Territory." Per "Territorio applicabile" si intende il mondo intero meno UE, Regno Unito, Corea del Sud e Stati Uniti. Due ulteriori clausole vietano di usare gli output di H3 per migliorare qualsiasi altro modello di IA e richiedono un’autorizzazione scritta sopra i 20 milioni di dollari di fatturato annuo.
Dove la narrazione si incrina
Dire che "MiniMax open-source H3" non regge per due motivi. Un lettore a Londra, Seul, Berlino o San Francisco non è autorizzato a eseguirlo affatto — la restrizione all’esportazione, per una volta, va nella direzione opposta. E la funzionalità che tutti citano, video 2K da 15 secondi con audio sincronizzato, dipende dai due moduli rimasti chiusi.
Tre ore per un porting domestico
Moore Threads ha detto di aver portato H3 dal framework SGLang-MUSA alle proprie librerie di operatori MATE e muDNN sulla MTT S5000 in tre ore, nello stesso giorno. Quel tempo di risposta, non il modello, è il segnale più rilevante.
