MiniMax 于 8月3日 凌晨将其音视频生成模型 H3 的权重上传至 Hugging Face。仓库自身的提交历史显示,最初内容提交时间约为 UTC 02:30,而 diffusers 格式权重的提交时间约为 UTC 04:30。该模型于 7 月 31 日公布,并承诺将在“未来几天”开放权重。
发布了什么
H3 是一款 330 亿参数的稠密单流 transformer,其中约 130 亿参数位于 AdaLN 分支中,可从推理循环中缓存移除。它可生成 4 至 15 秒、24 FPS 的视频,默认分辨率为 768p,最高可达 2K,并支持 11 种语言的原生 32 kHz 立体声音频。其文本编码器基于 Qwen3-VL-32B 构建。
许可
随附许可并非开源许可,Hugging Face 仅将其标记为 other。其中写道:“您不得在适用地区之外使用、复制、修改、分发或展示 MiniMax H3 Works 或其任何输出或结果。”适用地区指全球范围 减去 欧盟、英国、韩国和美国。另有两项条款禁止使用 H3 的输出改进任何其他 AI 模型,并要求年收入超过 2000 万美元者取得书面授权。
问题出在哪里
“MiniMax 开源 H3”这一说法有两处站不住脚。伦敦、首尔、柏林或旧金山的读者根本没有获准运行它——这一次,出口限制的方向恰好相反。而所有人都在引用的能力,即带同步音频的 15 秒 2K 视频,所需的两个模块并未开放。
三小时完成国内移植
Moore Threads 表示,它通过 MATE 和 muDNN 算子库,将 H3 从 SGLang-MUSA 框架移植到其 MTT S5000 上,耗时 三小时,且发生在同一天。比起模型本身,这种周转速度才是更值得关注的信号。
