DeepSeek 于 8 月 31 日 在 Hugging Face 上发布了 V4-Flash-Vision-Exp 的权重文件。仓库时间戳直接来自该平台的 API:创建时间为 UTC 06:16:18,分片从 UTC 06:57 起上传,模型卡片时间为 UTC 07:57。换算为中国标准时间是 14:16——中国的周一下午。
为什么日期才是故事重点
DeepSeek 于 8 月 21 日公布了这款模型,其官方文档将其描述为可通过 API 使用,并未提及权重文件。模型追踪器因此也将其日期记为 8 月 21 日,所以今天的发布被记录为一则已有十天历史内容的重复,而不是实际发生的事情——一个封闭模型变成了开放权重模型。对于无法向 API 发送数据的人来说,这两件事并不相同,且只有其中一件会改变他们能够部署什么。
这次发布包含什么
MIT 许可证。48 个分片,167,811,372,792 字节——约 167.8 GB。43 层,256 个路由专家加一个共享专家,每个 token 启用 6 个,1,048,576 token 的上下文长度,FP8 e4m3 权重、专家部分为 FP4,以及原生 32 层视觉塔。以 MIT 许可证发布这种规模的混合专家多模态模型,授权限制极少——没有可接受用途附录,没有收入门槛,也没有近年来中国开放权重许可证中常见的审查条款。
常见表述哪里说错了
关于多模态的头条数字需要谨慎看待。该模型被引用的旗舰提升,是相对于一个基线来衡量的,而 DeepSeek 自己的脚注说明该基线并不接收图像——因此,部分提升实际上是在与一个仅文本对比项进行比较,这更像是地板值而非竞争对手。模型卡片对此说明得很清楚;重复这一数字的摘要却没有。还有两点经常被省略:至少一个编码安全基准相较上一版本 出现了回退,而且该模型在与领先的西方前沿模型一对一比较时,大多数行都落后。“可比的文本性能”在这里承担了过多平均化的作用。
一个没有成立的说法
相关报道称其在 Hugging Face 和 ModelScope 上同步发布。但 ModelScope 返回的是该模型的 record not found。截至发稿,权重文件只在 Hugging Face 上可用。
