DeepSeek V4 Flash уже доступна · Наша цена GLM-5.2 снижена до 50% от официальной
Блог
Гайд

DeepSeek V4 Flash Vision Exp

Экспериментальная мультимодальная API-модель DeepSeek добавляет изображения к уровню V4-Flash по той же тарифной сетке.

12 мин чтенияOmniaKey
DeepSeek V4 Flash VisionVision APIOCRimage input

Если искать DeepSeek V4 Flash Vision Exp, легко наткнуться на две ошибки. Одни статьи называют его генератором картинок, другие просто копируют описание обычного V4-Flash. На самом деле это экспериментальная мультимодальная модель для API: она сохраняет текстовые возможности V4-Flash и добавляет входные изображения.

Короткий ответ по состоянию на 21 августа 2026 года:

  • точный ID модели: deepseek-v4-flash-vision-exp;
  • модель понимает скриншоты, фотографии, документы и графики;
  • текстовые возможности соответствуют V4-Flash, включая Agent и reasoning;
  • цена API такая же, как у V4-Flash, с пиковыми и непиковыми часами;
  • это Exp-версия, поэтому перед рабочим запуском её стоит проверить на своих данных.

Ниже разберём, сколько стоит DeepSeek V4 Flash Vision Exp, как пользоваться им через API, умеет ли он OCR и распознавание изображений, какие есть ограничения и чем он отличается от V4-Flash и V4-Pro.

Что такое DeepSeek V4 Flash Vision Exp?

DeepSeek-V4-Flash-Vision-Exp появился на API-платформе DeepSeek 21 августа 2026 года. Модель принимает текст вместе с изображением, а затем отвечает или продолжает сценарий Agent с инструментами.

DeepSeek заявляет, что по текстовым возможностям Vision Exp соответствует V4-Flash: сюда входят агенты, рассуждение и мировые знания. В мультимодальных Agent-бенчмарках компания сообщает о большом улучшении относительно V4-Flash и результате, близком к Opus-4.8.

Последнюю формулировку важно читать аккуратно. Это результат официального бенчмарка DeepSeek, а не универсальный рейтинг всех моделей. Он не доказывает, что Vision Exp лучше V4-Pro, GPT или Claude в любой задаче.

В официальной таблице указана длина контекста до 1M токенов и максимальный ответ до 384K токенов. Поддерживаются thinking и non-thinking режимы, JSON Output, Tool Calls, Responses API и Anthropic API. FIM Completion не поддерживается, поэтому обычная совместимость с coding-agent ещё не означает поддержку автодополнения кода через FIM.

В день релиза также вышел DeepSeek Harness 0.1.1 с готовой поддержкой новой модели. Для других Agent-фреймворков нужно отдельно проверить передачу блоков изображений и результатов инструментов.

Что умеет модель: реальные сценарии

Официальная документация перечисляет описание изображений, чтение текста на скриншотах и анализ графиков. На практике наиболее полезны следующие сценарии.

Скриншоты интерфейса и поиск ошибок

Можно передать скриншот браузера, текст ошибки и ожидаемое поведение. Модель сначала видит состояние интерфейса, а затем может подсказать, какие логи или инструменты проверить. Для UI-тестов и браузерных Agent это полезнее, чем модель, которая работает только с уже пересказанной человеком проблемой.

Распознавание изображений и OCR

Vision Exp умеет читать текст на скриншотах, сканах, чеках, формах и этикетках и возвращать поля в структурированном виде. Но это не детерминированный OCR-движок: мелкий шрифт, блики, наклон, низкое качество и сложные таблицы требуют проверки.

Для финансовых, медицинских и юридических документов модель лучше использовать как первый этап извлечения, а не как единственный источник решения.

Графики и дашборды

Модель может объяснить тренд на линейном или столбчатом графике, сравнить значения на скриншоте таблицы и найти визуальную аномалию. Если вывод влияет на деньги или операционные решения, сохраняйте исходные числа и проверяйте результат человеком.

Визуальные Agent-сценарии

Главная идея не в том, чтобы ещё раз спросить «что на картинке?». Агент получает визуальный контекст и может действовать на его основе: проверить страницу, найти элемент, сравнить макет с эталоном или продолжить цепочку вызовов инструментов.

Массовая обработка изображений

Один запрос может содержать до 600 изображений. Это пригодится для классификации товаров, сортировки медиатеки и генерации описаний. На практике лучше использовать небольшие партии: их легче повторить после ошибки и проверить вручную.

Может ли DeepSeek V4 Flash видеть изображения?

Обычная модель deepseek-v4-flash предназначена для текста. Для изображения нужно явно выбрать:

text
deepseek-v4-flash-vision-exp

Если отправить картинку в V4-Flash или V4-Pro, API вернёт ошибку о неподдерживаемом изображении. Нельзя делать вывод о поддержке vision только по названию V4: решает точный ID модели.

Может ли DeepSeek генерировать изображения?

Нет. DeepSeek V4 Flash Vision Exp анализирует изображения и возвращает текст или вызовы инструментов. Для создания постера, аватара, иллюстрации или рендера нужен отдельный image-generation сервис.

DeepSeek V4 Flash Vision Exp: цена API

Официальная англоязычная страница цен указывает стоимость за 1M токенов в долларах США. Для Vision Exp действует та же тарифная сетка, что и для V4-Flash.

Тип списанияНепиковое времяПиковое время
Вход, cache hit$0.007 / 1M токенов$0.014 / 1M токенов
Вход, cache miss$0.22 / 1M токенов$0.44 / 1M токенов
Выход$0.66 / 1M токенов$1.32 / 1M токенов

Пиковые часы: 01:00-04:00 и 06:00-10:00 UTC. В остальное время действует непиковая ставка, в два раза ниже пиковой.

Если вы ищете «DeepSeek V4 Flash Vision Exp цена в рублях», важно не подменять официальный тариф фиксированной суммой в RUB. Списание у DeepSeek указано в USD, а итог в рублях зависит от курса и конкретного платёжного провайдера.

Сколько стоит одна картинка?

Изображение переводится в токены по размеру. Максимум для одной картинки — 384 токена. При cache miss только входная часть одной картинки будет стоить примерно:

  • непиковое время: 384 / 1,000,000 x $0.22 = $0.00008448;
  • пиковое время: 384 / 1,000,000 x $0.44 = $0.00016896.

Это не полная стоимость запроса. Текстовый промпт, ответ, reasoning, история диалога и вызовы инструментов оплачиваются отдельно. В длинном Agent-сценарии основную сумму обычно создают ответ и повторные вызовы, а не сама картинка.

Files API можно бесплатно использовать для загрузки и повторного использования файла. Но бесплатная загрузка не означает бесплатный анализ: чтение изображения всё равно расходует оплачиваемые входные токены.

Как пользоваться DeepSeek V4 Flash Vision Exp через API?

Документация поддерживает три способа передать изображение:

  1. Base64 data URL для локального файла;
  2. публичный URL изображения;
  3. Files API для больших файлов или повторного использования одной картинки.

Минимальный пример OpenAI-совместимого Python-клиента:

python
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DEEPSEEK_API_KEY"],
    base_url="https://api.deepseek.com",
)

response = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[
        {
            "role": "user",
            "content": [
                {"type": "text", "text": "Прочитай ошибку на скриншоте и предложи следующий шаг."},
                {
                    "type": "image_url",
                    "image_url": {
                        "url": "https://example.com/screenshot.png",
                        "detail": "high",
                    },
                },
            ],
        }
    ],
)

print(response.choices[0].message.content)

Вместо адреса из примера нужен реально доступный URL или Base64 data URL. Те же три способа доступны в Responses API. В Anthropic-совместимом Messages API структура блока изображения другая, поэтому нельзя механически переносить один формат в другой.

Как выбрать detail

ЗначениеЧто происходитКогда использовать
lowКартинка уменьшается до 512 x 512Быстрая классификация без мелких деталей
highИсходный размер сохраняетсяМелкий текст, таблицы, интерфейс
originalИсходный размер сохраняетсяНужен явный режим полного качества
autoСейчас эквивалентен originalЕсли подходит текущий default

Для повторного анализа одной картинки лучше один раз загрузить её через Files API и использовать file_id. Для небольшой разовой картинки проще URL или inline-вариант.

Ограничения DeepSeek Vision API

ОграничениеЗначение
ФорматыJPEG, PNG, GIF, WebP
Картинок в одном запросеДо 600
Размер тела запроса48 MiB
Одна картинка через Base64 или URLДо 32 MiB
Одна картинка через Files APIДо 64 MiB
Общий размер картинок64 MiB без file_id, до 200 MiB с file_id
Максимальная сторона8192 пикселя
При 15 и более картинках4096 пикселей на сторону
Длина внешнего URLДо 8192 символов
Скачивание внешней картинкиДолжно завершиться за 60 секунд

Перед инференсом изображения автоматически масштабируются. Большие картинки уменьшаются примерно до площади 800 x 800, поэтому ограничение в 384 токена не гарантирует сохранение каждой мелкой детали.

В обычных Chat Completions и Anthropic Messages картинка должна находиться в user-сообщении. В system или assistant она вызовет ошибку 400. В Responses API правила для user, developer и tool output описаны отдельно.

PDF не входит в список поддерживаемых форматов изображений. Для PDF нужно извлечь текст или преобразовать нужные страницы в JPEG/PNG и проверить качество на реальных страницах.

DeepSeek V4 Flash Vision Exp и V4-Pro: что выбрать?

ЗадачаС чего начатьПричина
Только текст, массовые запросыV4-FlashТа же текстовая категория без обработки изображений
Скриншоты, фото, графики и visual AgentV4-Flash-Vision-ExpДобавляет изображения по цене V4-Flash
Сложное текстовое рассуждение и финальная проверкаV4-ProБольше запаса для трудных текстовых задач

Vision Exp не является просто более дорогим V4-Flash: он сохраняет Flash-уровень текста и цены, добавляя изображения. Если в задаче нет визуальных данных, менять модель только из-за нового названия не нужно.

И V4-Pro он не заменяет автоматически. Формулировка о близости к Opus-4.8 относится к мультимодальным Agent-бенчмаркам. Для своего проекта лучше сравнить модели на одном наборе изображений, с одинаковыми промптами, инструментами, лимитом задержки и критериями приёмки.

Бесплатен ли DeepSeek V4 Flash Vision Exp? Можно ли запустить локально?

API платный. Оплачиваются текстовые входы, токены изображений, выход и вызовы инструментов. Files API бесплатен только в части загрузки и повторной ссылки на файл.

Официальный релиз подтверждает доступность на API-платформе. В нём нет обещания, что Vision Exp уже появился в потребительском веб-интерфейсе или приложении. Не стоит считать, что переключатель «Экспертный режим» для V4-Pro автоматически включает новую vision-модель.

Локальный запуск пока нельзя считать подтверждённым. Для текстовой линейки V4 публиковались материалы об открытых весах, но в объявлении Vision Exp открытые веса и лицензия не заявлены. «Доступен через API» и «можно скачать и запустить локально» — разные утверждения.

Частые вопросы

Поддерживает ли DeepSeek V4 Flash Vision OCR?

Он умеет читать текст на изображениях и скриншотах, но не является детерминированным OCR-движком. Для мелкого, наклонённого или важного текста нужна дополнительная проверка.

Может ли DeepSeek анализировать изображения?

Да. Это основное назначение deepseek-v4-flash-vision-exp: описание изображений, чтение текста, анализ графиков и visual Agent-сценарии.

Может ли DeepSeek генерировать изображения?

Нет. Vision Exp понимает изображения, но не создаёт новые картинки.

Можно ли использовать модель в Claude Code или Codex?

На уровне протоколов модель поддерживает Responses API, Anthropic API и tool calls. Реальная совместимость зависит от того, умеет ли конкретный клиент передавать image content и результаты инструментов. Это нужно проверить на самом клиенте.

Есть ли у Vision Exp открытые веса?

В текущем официальном объявлении подтверждён API-релиз, но не открытые веса для этой экспериментальной модели. Нельзя автоматически переносить информацию о текстовой V4-линейке на Vision Exp.

Что делать, если изображение не загружается или текст не распознаётся?

Проверьте формат JPEG, PNG, GIF или WebP, размер файла и доступность внешнего URL. Для мелкого текста попробуйте detail=original или high, а для повторной отправки большой картинки используйте Files API. Важные поля всё равно нужно сверять вручную.

Итог

DeepSeek-V4-Flash-Vision-Exp стоит пробовать, когда Agent должен увидеть браузерный экран, график, чек, скан или фотографию. Его практическая идея проста: текстовый уровень V4-Flash, входные изображения и тариф V4-Flash.

Это не универсальная замена V4-Pro, GPT, Claude, профессиональному OCR или генератору изображений. Начните с 20-50 реальных примеров, измерьте точность, задержку, успешность tool calls и стоимость, а затем решайте, расширять ли использование экспериментальной модели.

В своей работе я оставляю основные вызовы Claude, GPT и Gemini с видимой детализацией расходов в OmniAKey, а Vision Exp тестирую отдельно как специализированную модель для изображений. Так проще сравнивать результат и не переводить весь production-процесс на модель только потому, что она недавно вышла.

Официальные источники