DeepSeek V4 Flash Vision Exp
Экспериментальная мультимодальная API-модель DeepSeek добавляет изображения к уровню V4-Flash по той же тарифной сетке.
Если искать DeepSeek V4 Flash Vision Exp, легко наткнуться на две ошибки. Одни статьи называют его генератором картинок, другие просто копируют описание обычного V4-Flash. На самом деле это экспериментальная мультимодальная модель для API: она сохраняет текстовые возможности V4-Flash и добавляет входные изображения.
Короткий ответ по состоянию на 21 августа 2026 года:
- точный ID модели:
deepseek-v4-flash-vision-exp; - модель понимает скриншоты, фотографии, документы и графики;
- текстовые возможности соответствуют V4-Flash, включая Agent и reasoning;
- цена API такая же, как у V4-Flash, с пиковыми и непиковыми часами;
- это Exp-версия, поэтому перед рабочим запуском её стоит проверить на своих данных.
Ниже разберём, сколько стоит DeepSeek V4 Flash Vision Exp, как пользоваться им через API, умеет ли он OCR и распознавание изображений, какие есть ограничения и чем он отличается от V4-Flash и V4-Pro.
Что такое DeepSeek V4 Flash Vision Exp?
DeepSeek-V4-Flash-Vision-Exp появился на API-платформе DeepSeek 21 августа 2026 года. Модель принимает текст вместе с изображением, а затем отвечает или продолжает сценарий Agent с инструментами.
DeepSeek заявляет, что по текстовым возможностям Vision Exp соответствует V4-Flash: сюда входят агенты, рассуждение и мировые знания. В мультимодальных Agent-бенчмарках компания сообщает о большом улучшении относительно V4-Flash и результате, близком к Opus-4.8.
Последнюю формулировку важно читать аккуратно. Это результат официального бенчмарка DeepSeek, а не универсальный рейтинг всех моделей. Он не доказывает, что Vision Exp лучше V4-Pro, GPT или Claude в любой задаче.
В официальной таблице указана длина контекста до 1M токенов и максимальный ответ до 384K токенов. Поддерживаются thinking и non-thinking режимы, JSON Output, Tool Calls, Responses API и Anthropic API. FIM Completion не поддерживается, поэтому обычная совместимость с coding-agent ещё не означает поддержку автодополнения кода через FIM.
В день релиза также вышел DeepSeek Harness 0.1.1 с готовой поддержкой новой модели. Для других Agent-фреймворков нужно отдельно проверить передачу блоков изображений и результатов инструментов.
Что умеет модель: реальные сценарии
Официальная документация перечисляет описание изображений, чтение текста на скриншотах и анализ графиков. На практике наиболее полезны следующие сценарии.
Скриншоты интерфейса и поиск ошибок
Можно передать скриншот браузера, текст ошибки и ожидаемое поведение. Модель сначала видит состояние интерфейса, а затем может подсказать, какие логи или инструменты проверить. Для UI-тестов и браузерных Agent это полезнее, чем модель, которая работает только с уже пересказанной человеком проблемой.
Распознавание изображений и OCR
Vision Exp умеет читать текст на скриншотах, сканах, чеках, формах и этикетках и возвращать поля в структурированном виде. Но это не детерминированный OCR-движок: мелкий шрифт, блики, наклон, низкое качество и сложные таблицы требуют проверки.
Для финансовых, медицинских и юридических документов модель лучше использовать как первый этап извлечения, а не как единственный источник решения.
Графики и дашборды
Модель может объяснить тренд на линейном или столбчатом графике, сравнить значения на скриншоте таблицы и найти визуальную аномалию. Если вывод влияет на деньги или операционные решения, сохраняйте исходные числа и проверяйте результат человеком.
Визуальные Agent-сценарии
Главная идея не в том, чтобы ещё раз спросить «что на картинке?». Агент получает визуальный контекст и может действовать на его основе: проверить страницу, найти элемент, сравнить макет с эталоном или продолжить цепочку вызовов инструментов.
Массовая обработка изображений
Один запрос может содержать до 600 изображений. Это пригодится для классификации товаров, сортировки медиатеки и генерации описаний. На практике лучше использовать небольшие партии: их легче повторить после ошибки и проверить вручную.
Может ли DeepSeek V4 Flash видеть изображения?
Обычная модель deepseek-v4-flash предназначена для текста. Для изображения нужно явно выбрать:
deepseek-v4-flash-vision-exp
Если отправить картинку в V4-Flash или V4-Pro, API вернёт ошибку о неподдерживаемом изображении. Нельзя делать вывод о поддержке vision только по названию V4: решает точный ID модели.
Может ли DeepSeek генерировать изображения?
Нет. DeepSeek V4 Flash Vision Exp анализирует изображения и возвращает текст или вызовы инструментов. Для создания постера, аватара, иллюстрации или рендера нужен отдельный image-generation сервис.
DeepSeek V4 Flash Vision Exp: цена API
Официальная англоязычная страница цен указывает стоимость за 1M токенов в долларах США. Для Vision Exp действует та же тарифная сетка, что и для V4-Flash.
| Тип списания | Непиковое время | Пиковое время |
|---|---|---|
| Вход, cache hit | $0.007 / 1M токенов | $0.014 / 1M токенов |
| Вход, cache miss | $0.22 / 1M токенов | $0.44 / 1M токенов |
| Выход | $0.66 / 1M токенов | $1.32 / 1M токенов |
Пиковые часы: 01:00-04:00 и 06:00-10:00 UTC. В остальное время действует непиковая ставка, в два раза ниже пиковой.
Если вы ищете «DeepSeek V4 Flash Vision Exp цена в рублях», важно не подменять официальный тариф фиксированной суммой в RUB. Списание у DeepSeek указано в USD, а итог в рублях зависит от курса и конкретного платёжного провайдера.
Сколько стоит одна картинка?
Изображение переводится в токены по размеру. Максимум для одной картинки — 384 токена. При cache miss только входная часть одной картинки будет стоить примерно:
- непиковое время:
384 / 1,000,000 x $0.22 = $0.00008448; - пиковое время:
384 / 1,000,000 x $0.44 = $0.00016896.
Это не полная стоимость запроса. Текстовый промпт, ответ, reasoning, история диалога и вызовы инструментов оплачиваются отдельно. В длинном Agent-сценарии основную сумму обычно создают ответ и повторные вызовы, а не сама картинка.
Files API можно бесплатно использовать для загрузки и повторного использования файла. Но бесплатная загрузка не означает бесплатный анализ: чтение изображения всё равно расходует оплачиваемые входные токены.
Как пользоваться DeepSeek V4 Flash Vision Exp через API?
Документация поддерживает три способа передать изображение:
- Base64 data URL для локального файла;
- публичный URL изображения;
- Files API для больших файлов или повторного использования одной картинки.
Минимальный пример OpenAI-совместимого Python-клиента:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DEEPSEEK_API_KEY"],
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model="deepseek-v4-flash-vision-exp",
messages=[
{
"role": "user",
"content": [
{"type": "text", "text": "Прочитай ошибку на скриншоте и предложи следующий шаг."},
{
"type": "image_url",
"image_url": {
"url": "https://example.com/screenshot.png",
"detail": "high",
},
},
],
}
],
)
print(response.choices[0].message.content)
Вместо адреса из примера нужен реально доступный URL или Base64 data URL. Те же три способа доступны в Responses API. В Anthropic-совместимом Messages API структура блока изображения другая, поэтому нельзя механически переносить один формат в другой.
Как выбрать detail
| Значение | Что происходит | Когда использовать |
|---|---|---|
low | Картинка уменьшается до 512 x 512 | Быстрая классификация без мелких деталей |
high | Исходный размер сохраняется | Мелкий текст, таблицы, интерфейс |
original | Исходный размер сохраняется | Нужен явный режим полного качества |
auto | Сейчас эквивалентен original | Если подходит текущий default |
Для повторного анализа одной картинки лучше один раз загрузить её через Files API и использовать file_id. Для небольшой разовой картинки проще URL или inline-вариант.
Ограничения DeepSeek Vision API
| Ограничение | Значение |
|---|---|
| Форматы | JPEG, PNG, GIF, WebP |
| Картинок в одном запросе | До 600 |
| Размер тела запроса | 48 MiB |
| Одна картинка через Base64 или URL | До 32 MiB |
| Одна картинка через Files API | До 64 MiB |
| Общий размер картинок | 64 MiB без file_id, до 200 MiB с file_id |
| Максимальная сторона | 8192 пикселя |
| При 15 и более картинках | 4096 пикселей на сторону |
| Длина внешнего URL | До 8192 символов |
| Скачивание внешней картинки | Должно завершиться за 60 секунд |
Перед инференсом изображения автоматически масштабируются. Большие картинки уменьшаются примерно до площади 800 x 800, поэтому ограничение в 384 токена не гарантирует сохранение каждой мелкой детали.
В обычных Chat Completions и Anthropic Messages картинка должна находиться в user-сообщении. В system или assistant она вызовет ошибку 400. В Responses API правила для user, developer и tool output описаны отдельно.
PDF не входит в список поддерживаемых форматов изображений. Для PDF нужно извлечь текст или преобразовать нужные страницы в JPEG/PNG и проверить качество на реальных страницах.
DeepSeek V4 Flash Vision Exp и V4-Pro: что выбрать?
| Задача | С чего начать | Причина |
|---|---|---|
| Только текст, массовые запросы | V4-Flash | Та же текстовая категория без обработки изображений |
| Скриншоты, фото, графики и visual Agent | V4-Flash-Vision-Exp | Добавляет изображения по цене V4-Flash |
| Сложное текстовое рассуждение и финальная проверка | V4-Pro | Больше запаса для трудных текстовых задач |
Vision Exp не является просто более дорогим V4-Flash: он сохраняет Flash-уровень текста и цены, добавляя изображения. Если в задаче нет визуальных данных, менять модель только из-за нового названия не нужно.
И V4-Pro он не заменяет автоматически. Формулировка о близости к Opus-4.8 относится к мультимодальным Agent-бенчмаркам. Для своего проекта лучше сравнить модели на одном наборе изображений, с одинаковыми промптами, инструментами, лимитом задержки и критериями приёмки.
Бесплатен ли DeepSeek V4 Flash Vision Exp? Можно ли запустить локально?
API платный. Оплачиваются текстовые входы, токены изображений, выход и вызовы инструментов. Files API бесплатен только в части загрузки и повторной ссылки на файл.
Официальный релиз подтверждает доступность на API-платформе. В нём нет обещания, что Vision Exp уже появился в потребительском веб-интерфейсе или приложении. Не стоит считать, что переключатель «Экспертный режим» для V4-Pro автоматически включает новую vision-модель.
Локальный запуск пока нельзя считать подтверждённым. Для текстовой линейки V4 публиковались материалы об открытых весах, но в объявлении Vision Exp открытые веса и лицензия не заявлены. «Доступен через API» и «можно скачать и запустить локально» — разные утверждения.
Частые вопросы
Поддерживает ли DeepSeek V4 Flash Vision OCR?
Он умеет читать текст на изображениях и скриншотах, но не является детерминированным OCR-движком. Для мелкого, наклонённого или важного текста нужна дополнительная проверка.
Может ли DeepSeek анализировать изображения?
Да. Это основное назначение deepseek-v4-flash-vision-exp: описание изображений, чтение текста, анализ графиков и visual Agent-сценарии.
Может ли DeepSeek генерировать изображения?
Нет. Vision Exp понимает изображения, но не создаёт новые картинки.
Можно ли использовать модель в Claude Code или Codex?
На уровне протоколов модель поддерживает Responses API, Anthropic API и tool calls. Реальная совместимость зависит от того, умеет ли конкретный клиент передавать image content и результаты инструментов. Это нужно проверить на самом клиенте.
Есть ли у Vision Exp открытые веса?
В текущем официальном объявлении подтверждён API-релиз, но не открытые веса для этой экспериментальной модели. Нельзя автоматически переносить информацию о текстовой V4-линейке на Vision Exp.
Что делать, если изображение не загружается или текст не распознаётся?
Проверьте формат JPEG, PNG, GIF или WebP, размер файла и доступность внешнего URL. Для мелкого текста попробуйте detail=original или high, а для повторной отправки большой картинки используйте Files API. Важные поля всё равно нужно сверять вручную.
Итог
DeepSeek-V4-Flash-Vision-Exp стоит пробовать, когда Agent должен увидеть браузерный экран, график, чек, скан или фотографию. Его практическая идея проста: текстовый уровень V4-Flash, входные изображения и тариф V4-Flash.
Это не универсальная замена V4-Pro, GPT, Claude, профессиональному OCR или генератору изображений. Начните с 20-50 реальных примеров, измерьте точность, задержку, успешность tool calls и стоимость, а затем решайте, расширять ли использование экспериментальной модели.
В своей работе я оставляю основные вызовы Claude, GPT и Gemini с видимой детализацией расходов в OmniAKey, а Vision Exp тестирую отдельно как специализированную модель для изображений. Так проще сравнивать результат и не переводить весь production-процесс на модель только потому, что она недавно вышла.