Le changelog de l’API de DeepSeek daté du 21 août annonce DeepSeek-V4-Flash-Vision-Exp, décrit comme « le nouveau modèle multimodal de compréhension visuelle », disponible sur la plateforme API de DeepSeek et accessible en définissant model='deepseek-v4-flash-vision-exp'. L’entrée précise explicitement qu’il s’agit d’un modèle expérimental.
Les benchmarks publiés
Terminal Bench 2.1 : 83,9. NL2Repo : 57,7. DeepSWE : 59,3. DSBench-Hard : 63,6. AutomationBench (Public) : 25,7. Ce sont les chiffres affichés sur la page.
Ce que le cadrage habituel passe à côté
Tous ces benchmarks relèvent des agents, du codage ou de la data science. Aucun ne mesure la vision. Les évaluations multimodales standard sur lesquelles on juge une version vision — MMMU, MathVista, DocVQA, suites OCR, compréhension de graphiques et de diagrammes — sont entièrement absentes. Un modèle présenté comme un modèle de vision, évalué exclusivement sur des tâches de terminal et de dépôt, vous dit à quoi il sert réellement : lire des captures d’écran dans une boucle agentique, pas décrire des images. Comparer ses scores à ceux de modèles multimodaux de pointe revient à comparer des chiffres qui n’ont jamais été produits sur les mêmes tests. Deuxièmement, le mot qui compte le plus ici est Exp : les modèles expérimentaux sur cette plateforme n’offrent aucun engagement de stabilité et ne constituent pas le même artefact qu’un checkpoint publié.
Les poids et la question de l’open source
Il s’agit d’une version accessible uniquement via API. Aucun poids n’est fourni, et les dépôts sur des hubs de modèles portant des noms similaires sont des dérivés tiers greffés sur d’anciens checkpoints textuels, et non ce modèle. DeepSeek a bâti sa réputation sur la publication de poids, et l’arrivée d’une capacité de vision sous la forme d’un point de terminaison fermé constitue un changement notable — d’autant que la réputation internationale de l’entreprise repose en grande partie sur ses poids ouverts.
Ce que dit la documentation sur son usage
Le guide vision de DeepSeek décrit directement les cas d’usage : « décrire des images, lire du texte dans des captures d’écran, analyser des graphiques, et plus encore. » Les images transitent via un format compatible OpenAI Chat Completions, en JPEG, PNG, GIF ou WebP, le format étant détecté à partir du contenu du fichier plutôt que du nom de fichier ou du type MIME déclaré, dans une limite de corps de requête de 48 MiB. Les captures d’écran et les graphiques sont des entrées pour agent. Cela correspond au choix des benchmarks, et contredit la manière dont cette version est interprétée.
L’étrangeté de la séquence
L’outil de ligne de commande d’agent de DeepSeek a gagné l’entrée d’images un jour avant que le moindre modèle DeepSeek puisse traiter des images. Le harness a été publié avant la capacité, ce qui est une façon raisonnable de développer un logiciel et une façon déroutante de l’annoncer.
