O changelog da API da DeepSeek datado de 21 de agosto anuncia o DeepSeek-V4-Flash-Vision-Exp, descrito como "o novo modelo multimodal de compreensão visual", disponível na plataforma API da DeepSeek e acessado por meio da definição de model='deepseek-v4-flash-vision-exp'. O registro deixa explícito que se trata de um modelo experimental.
Os benchmarks publicados
Terminal Bench 2.1: 83.9. NL2Repo: 57.7. DeepSWE: 59.3. DSBench-Hard: 63.6. AutomationBench (Public): 25.7. Esses são os números na página.
O que a leitura comum entende errado
Todos eles são benchmarks agentic, de programação ou de ciência de dados. Nenhum mede visão. As avaliações multimodais padrão pelas quais um lançamento de visão é julgado — MMMU, MathVista, DocVQA, suítes de OCR, compreensão de gráficos e diagramas — estão totalmente ausentes. Um modelo anunciado como modelo de visão, com pontuação exclusivamente em tarefas de terminal e repositório, está dizendo para que ele realmente serve: ler capturas de tela dentro de um loop de agente, não descrever imagens. Comparar suas pontuações com as de modelos multimodais de ponta é comparar números que nunca foram produzidos nos mesmos testes. Em segundo lugar, a palavra que mais pesa aqui é Exp: modelos experimentais nessa plataforma não trazem compromisso de estabilidade e não são o mesmo artefato que um checkpoint lançado.
Pesos e a questão do open source
Este é um lançamento apenas via API. Não há pesos acompanhando o modelo, e repositórios em hubs de modelos com nomes semelhantes são derivados de terceiros, adaptados a checkpoints de texto mais antigos, e não este modelo. A DeepSeek construiu sua reputação ao divulgar pesos, e uma capacidade de visão que chega como endpoint fechado representa uma mudança relevante — especialmente considerando o quanto da projeção internacional da empresa repousa na reputação de open weights.
O que a documentação diz que ele faz
O guia de visão da DeepSeek descreve diretamente os casos de uso: "descrever imagens, ler texto de capturas de tela, analisar gráficos e mais". As imagens chegam por meio de um formato de Chat Completions compatível com OpenAI, em JPEG, PNG, GIF ou WebP, com o formato detectado pelo conteúdo do arquivo e não pelo nome do arquivo ou pelo tipo MIME declarado, dentro de um limite de 48 MiB para o corpo da requisição. Capturas de tela e gráficos são entradas de agentes. Isso é coerente com a seleção de benchmarks e incoerente com a forma como o lançamento está sendo interpretado.
A estranheza da sequência
A própria ferramenta de linha de comando de agente da DeepSeek ganhou entrada de imagem um dia antes de qualquer modelo da DeepSeek conseguir processar imagens. O harness foi lançado antes da capacidade, o que é uma forma razoável de construir software e uma forma confusa de anunciá-lo.
