El registro de cambios de la API de DeepSeek fechado el 21 de agosto anuncia DeepSeek-V4-Flash-Vision-Exp, descrito como "el nuevo modelo multimodal de comprensión visual", disponible en la plataforma API de DeepSeek y accesible configurando model='deepseek-v4-flash-vision-exp'. La entrada deja claro que se trata de un modelo experimental.
Los benchmarks publicados
Terminal Bench 2.1: 83.9. NL2Repo: 57.7. DeepSWE: 59.3. DSBench-Hard: 63.6. AutomationBench (Public): 25.7. Esas son las cifras que aparecen en la página.
Qué falla en la interpretación habitual
Todos ellos son benchmarks agénticos, de programación o de ciencia de datos. Ninguno mide visión. Las evaluaciones multimodales estándar con las que se juzga un lanzamiento de visión — MMMU, MathVista, DocVQA, suites de OCR, comprensión de gráficos y diagramas — brillan por su ausencia. Un modelo anunciado como modelo de visión, puntuado exclusivamente en tareas de terminal y repositorios, está indicando para qué sirve en realidad: leer capturas de pantalla dentro de un bucle agéntico, no describir imágenes. Comparar sus puntuaciones con las de modelos multimodales de vanguardia equivale a comparar cifras que nunca se produjeron en las mismas pruebas. En segundo lugar, la palabra que más pesa aquí es Exp: los modelos experimentales de esta plataforma no conllevan compromiso de estabilidad y no son el mismo artefacto que un checkpoint publicado.
Pesos y la cuestión del código abierto
Se trata de un lanzamiento solo API. No incluye pesos, y los repositorios en hubs de modelos que llevan nombres similares son derivados de terceros acoplados a checkpoints de texto anteriores, no a este modelo. DeepSeek construyó su reputación publicando pesos, y que una capacidad de visión llegue como un endpoint cerrado supone un cambio digno de señalar, sobre todo dado cuánto descansa la proyección internacional de la compañía en su reputación de open weights.
Lo que dice la documentación sobre su uso
La guía de visión de DeepSeek describe directamente los casos de uso: "describir imágenes, leer texto de capturas de pantalla, analizar gráficos y más". Las imágenes llegan mediante un formato de Chat Completions compatible con OpenAI, en JPEG, PNG, GIF o WebP, con el formato detectado a partir del contenido del archivo y no del nombre o del tipo MIME declarado, dentro de un límite de cuerpo de solicitud de 48 MiB. Las capturas de pantalla y los gráficos son entradas para agentes. Eso es coherente con la selección de benchmarks e incoherente con la forma en que se está leyendo el lanzamiento.
La rareza de la secuenciación
La propia herramienta de línea de comandos para agentes de DeepSeek incorporó entrada de imagen un día antes de que ningún modelo de DeepSeek pudiera procesar imágenes. El armazón se lanzó antes que la capacidad, una forma razonable de construir software y una forma confusa de anunciarlo.
