Moonshot AI 于7月27日 UTC 13:31将 Kimi K3 的完整权重发布到 Hugging Face,比该模型作为托管 API 上线晚了十一天。仓库的提交历史显示,初始上传就发生在那一刻;随后五次提交都是对 README 的修改。该模型拥有2.8 万亿参数,是迄今公开下载的最大一组模型权重。

发布了什么

模型卡将其描述为一种混合专家架构:总参数量 2.8 万亿,每个 token 激活1040 亿参数,这些参数从896 个专家中选取——其中 16 个为路由专家、2 个为共享专家——分布在 93 层。上下文长度为1,048,576 个 token。权重以 MXFP4 形式发布,激活采用 MXFP8,并由量化感知训练生成,仓库总大小约为1.56 TB。一个拥有 4.01 亿参数的 MoonViT-V2 编码器负责视觉处理。模型卡上自报的成绩包括 GPQA Diamond 93.5、Terminal-Bench 2.1 88.3、BrowseComp 91.2 和 DeepSWE 67.5

许可证才是故事的核心

各家媒体都将该条款描述为“修改版 MIT 许可证”。但仓库中的 LICENSE 文件既不是 MIT,也不是对 MIT 的修改版。它是一个专门定制的 Kimi K3 License——Hugging Face 将其标记为license: other——并设有两道商业门槛。任何从事 model-as-a-service 业务、且其集团在任意连续 12 个月内收入超过2000 万美元的被许可方,在将该模型用于商业用途前,必须与 Moonshot 另行签署协议。任何基于该模型构建、月活用户超过1 亿,或月收入超过2000 万美元的产品,都必须在用户界面中显著展示“Kimi K3”。内部使用以及通过 Moonshot 自有产品访问则不受限制。

开放权重,不是开源

训练数据和训练代码都没有包含在内,因此这属于开放权重发布,而不是开源发布——在这里,这一区分比平常更重要,因为这些条款的设置恰好是为了让学生、初创公司和研究人员可以自由使用该模型,同时阻止大型竞争对手转售它。宽松是真实的。但它也带有明确指向性。

它落地的那一天

发布时间并不低调。上传前四小时,Nvidia 推出一个联盟,主张开放前沿模型对网络防御至关重要,而其中没有任何闭源模型实验室。上传后五小时,Anthropic 首席执行官发表声明,否认公司曾寻求禁止开放权重。华盛顿正在积极讨论是否限制中国开放模型;而如今,最大的一个已经以公开形式存在,并附带中国许可证。