A MiniMax publicou os pesos do H3, seu modelo de geração de áudio e vídeo, no Hugging Face nas primeiras horas de 3 de agosto. O próprio histórico de commits do repositório data o commit inicial de conteúdo por volta de 02:30 UTC e os pesos no formato diffusers de cerca de 04:30 UTC. O modelo foi anunciado em 31 de julho com a promessa de abrir os pesos "nos próximos dias".
O que foi lançado
H3 é um transformer denso de fluxo único com 33 bilhões de parâmetros, cerca de 13 bilhões deles em ramificações AdaLN que podem ser armazenadas em cache fora do loop de inferência. Ele produz vídeos de 4 a 15 segundos a 24 FPS, em 768p por padrão e até 2K, com áudio estéreo nativo de 32 kHz em 11 idiomas. Seu codificador de texto é baseado em Qwen3-VL-32B.
A licença
A licença incluída não é uma licença de código aberto e o Hugging Face a classifica simplesmente como other. Ela diz: "You may not use, reproduce, modify, distribute, or display the MiniMax H3 Works or any of their Outputs or results outside the Applicable Territory." Território Aplicável significa o mundo inteiro menos a UE, o Reino Unido, a Coreia do Sul e os Estados Unidos. Duas cláusulas adicionais proíbem usar as saídas do H3 para melhorar qualquer outro modelo de IA e exigem autorização por escrito acima de US$ 20 milhões em receita anual.
Onde a formulação falha
"A MiniMax libera o H3 em código aberto" falha em dois sentidos. Um leitor em Londres, Seul, Berlim ou São Francisco não está licenciado a executá-lo de forma alguma — pela primeira vez, a restrição de exportação aponta na direção oposta. E a capacidade que todos citam, vídeo de 15 segundos em 2K com áudio sincronizado, depende dos dois módulos que permaneceram fechados.
Três horas para uma porta doméstica
A Moore Threads disse ter levado o H3 da estrutura SGLang-MUSA por suas bibliotecas de operadores MATE e muDNN em sua MTT S5000 em três horas, no mesmo dia. Esse tempo de resposta, e não o modelo, é o sinal mais difícil.
