DeepSeek 于北京时间周五上午将 V4-Flash 从预览版转为正式版 API。真正耐人寻味的不是这次发布本身,而是公司自己的基准表显示,其廉价模型得分高于昂贵模型,而且昂贵模型至今仍未上线。

分数和价格

据 DeepSeek 的更新日志:Terminal Bench 2.1 82.7 分,Cybergym 76.7 分,Toolathlon verified 70.3 分,DSBench-FullStack 68.7 分,DeepSWE 54.4 分,NL2Repo 54.2 分。上下文窗口 1M,最大输出 384K,思考模式可切换。每百万 token 计费:Flash 输入 $0.14 / 输出 $0.28,而 Pro 为 $0.435 / $0.87。并发上限方面,Flash 为 2,500,Pro 为 500。公司还标注,预计将推出在北京时间营业时段使费率翻倍的高峰时段附加费。

报道中有三点被说错了

首先,“正式版”并不是一个新模型。DeepSeek 的更新日志写道,V4-Flash-0731“保持与预览版相同的模型架构和规模”,并且“只是重新进行了后训练”。架构和参数量都没有变化——这是一轮后训练更新,却被当作一次发布来报道。其次,它是仅 API 提供。没有释放权重,升级的也只有 V4-Flash 接口;应用、网页模型和 V4-Pro API 都没有变化。任何把它理解为开源权重发布的人都是错的。第三,这张基准表只代表 DeepSeek 自己的口径,而且比较对象的设定本身就有利于 DeepSeek:它拿来对比的是 DeepSeek 自己的 V4-Pro-Preview——一个预览版,而非已正式推出的产品——以及智谱的 GLM-5.2。表中并没有任何西方前沿模型。

为何这种反超值得关注

一个廉价档位在智能体任务上跑赢昂贵档位,而且价格大约只有三分之一,这释放出一个现实信号:当前智能体能力的提升更多来自后训练,而不是规模扩张。这也让 V4-Pro 处境尴尬:它仍在预览阶段,如今又在厂商自己的数据里输给了更小的兄弟模型。

有一个数字不要写

中国媒体援引的总参数量为 2840 亿、激活参数量为 130 亿。我们无法在任何可核实的 DeepSeek 页面上找到这一说法,因此不应将其当作事实重复。