DeepSeek 在 8 月 21 日发布的 API 变更日志中宣布推出 DeepSeek-V4-Flash-Vision-Exp,将其描述为“新的多模态视觉理解模型”,可在 DeepSeek API 平台上使用,并通过设置 model='deepseek-v4-flash-vision-exp' 访问。该条目明确表示,这是一款实验性模型。
公布的基准
Terminal Bench 2.1:83.9。NL2Repo:57.7。DeepSWE:59.3。DSBench-Hard:63.6。AutomationBench(Public):25.7。 页面上列出的就是这些数据。
常见解读的问题在哪里
这几项全部都是智能体、编程或数据科学基准。其中没有任何一项衡量视觉能力。视觉模型发布时通常会被拿来评估的标准多模态测试——MMMU、MathVista、DocVQA、OCR 套件、图表和示意图理解——完全缺席。一款被宣布为视觉模型的产品,却只在终端和代码仓库任务上得分,说明它真正面向的用途是什么:在智能体循环中读取截图,而不是描述图像。将其分数与前沿多模态模型进行对比的报道,比较的是从未在同一套测试中产生过的数字。其次,最值得注意的词是 Exp:这个平台上的实验性模型不承诺稳定性,也不等同于一个已发布的检查点。
权重与开源问题
这是一款仅 API 提供的发布版本,没有附带权重;模型库中出现的同名仓库是第三方衍生版本,基于更早的文本检查点改造而来,并非这款模型本身。DeepSeek 以发布权重建立声誉,而一项视觉能力以封闭端点的形式出现,值得特别标记——尤其考虑到该公司相当一部分国际声望都建立在开源权重的名声之上。
文档说明其用途是什么
DeepSeek 的视觉指南直接写明了使用场景:“描述图片、从截图中读取文字、分析图表等。”图像通过兼容 OpenAI 的 Chat Completions 格式传入,支持 JPEG、PNG、GIF 或 WebP,格式由文件内容而非文件名或声明的 MIME 类型自动识别,并受限于 48 MiB 的请求体上限。截图和图表都是智能体输入。这与基准选择是一致的,也与外界对这次发布的解读并不一致。
发布时间顺序的怪异之处
在任何 DeepSeek 模型能够处理图像之前一天,DeepSeek 自家的智能体命令行工具就已经增加了图像输入。支撑系统先于能力本身发布,这是一种合理的软件开发方式,却不是一种清晰的发布方式。
