Журнал изменений API DeepSeek от 21 августа объявляет DeepSeek-V4-Flash-Vision-Exp, описанную как «новую мультимодальную модель понимания изображений», доступную на платформе DeepSeek API и вызываемую через установку model='deepseek-v4-flash-vision-exp'. В записи прямо сказано, что это экспериментальная модель.

Опубликованные бенчмарки

Terminal Bench 2.1: 83.9. NL2Repo: 57.7. DeepSWE: 59.3. DSBench-Hard: 63.6. AutomationBench (Public): 25.7. Именно такие цифры указаны на странице.

Что не так с распространенной трактовкой

Все эти тесты — агентные, кодовые или data science-бенчмарки. Ни один из них не измеряет зрение. Стандартные мультимодальные оценки, по которым судят о релизе для vision, — MMMU, MathVista, DocVQA, OCR-наборы, понимание графиков и диаграмм — полностью отсутствуют. Если модель объявлена как vision-модель, а оценивается исключительно на задачах с терминалом и репозиториями, это говорит о том, для чего она на самом деле предназначена: для чтения скриншотов внутри агентного цикла, а не для описания изображений. Сравнение ее результатов с показателями передовых мультимодальных моделей — это сравнение чисел, полученных на разных тестах. Во-вторых, ключевое слово здесь — Exp: экспериментальные модели на этой платформе не имеют обязательств по стабильности и не являются тем же артефактом, что и опубликованный чекпойнт.

Веса и вопрос open-source

Это релиз только через API. Веса к нему не прилагаются, а репозитории на модельных хабах с похожими названиями являются сторонними производными, наложенными на более старые текстовые чекпойнты, а не на эту модель. DeepSeek построила свою репутацию на выпуске весов, и появление визуальной возможности в виде закрытого эндпойнта — заметный отход от прежнего подхода, особенно с учетом того, насколько международный статус компании опирается на репутацию открытых весов.

Что, по документации, умеет модель

Руководство по vision DeepSeek прямо описывает сценарии использования: «описывать изображения, считывать текст со скриншотов, анализировать графики и многое другое». Изображения передаются в формате, совместимом с OpenAI Chat Completions, в JPEG, PNG, GIF или WebP; формат определяется по содержимому файла, а не по имени файла или заявленному MIME-типу, в рамках лимита тела запроса 48 MiB. Скриншоты и графики — это входные данные для агента. Это согласуется с выбором бенчмарков и не согласуется с тем, как интерпретируется релиз.

Странность в последовательности

Собственный командный инструмент DeepSeek для агентов получил поддержку ввода изображений на день раньше, чем любая модель DeepSeek смогла обрабатывать изображения. Каркас вышел раньше самой функции — это разумный способ разрабатывать ПО и запутанный способ объявлять о нем.