GPT-5.4 и GPT-5.4 Mini сняты с поддержки · Перейдите на другую доступную модель
Блог
Гайд

DeepSeek V4.1 Flash

Новый Flash дешевле и выше в нескольких агентных тестах, но официальная таблица не доказывает превосходство над V4 Pro для каждой задачи.

12 мин чтенияOmniaKey
DeepSeek V4.1 Flashобзор моделицены APIмультимодальностькодовый агент

Этот обзор DeepSeek V4.1 Flash отделяет устройство модели, опубликованные DeepSeek бенчмарки и API-контракт, который важен при реальной интеграции.

Краткий вывод: V4.1 Flash стоит первым проверить для кодовых агентов с длинным контекстом, инструментами, изображениями и большим потоком задач. В непиковое время прямая API DeepSeek берёт $0.15 за миллион не-кэшированных входных токенов и $0.60 за выходные. Это не означает, что модель автоматически заменяет V4 Pro во всех сценариях. В статье нет выдуманного личного опыта, независимого платного запуска или теста скорости.

Проверка фактов: 10 сентября 2026 года. Материал основан на релизе, ценах, API-гайдах и открытой model card DeepSeek. Все оценки бенчмарков имеют статус vendor-reported: их сообщил поставщик, а не независимо воспроизвёл OmniaKey.

Когда сначала тестировать V4.1 Flash

Подходящие первые задачи: кодовый агент с длинными промптами и повторными tool calls, отладка по скриншотам, OCR и извлечение документов с последующей проверкой, пакетная автоматизация, где важны throughput и цена токена.

Сначала запустите регрессию, если поток зависит от поведения V4 Pro, неизменного формата tool calls или фиксированной идентичности модели. DeepSeek объявил, что deepseek-v4-pro будет направляться на V4.1 Flash с 2026-09-14 04:00 UTC. Один и тот же ID перестанет означать ту же модель.

Подтверждённые данные запуска

ПунктПодтверждённая информация
Официальный выпуск2026-09-10
Канонический ID API DeepSeekdeepseek-flash
Старые совместимые IDdeepseek-v4-flash, deepseek-v4-flash-vision-exp
Переход Prodeepseek-v4-pro направляется на V4.1 Flash с 2026-09-14 04:00 UTC
Архитектурамультимодальный MoE на 552B параметров, Causal Encoder-Decoder
Активные параметры8B при prefill, 16B при decode
Лимитыконтекст 1M, максимум 384K на выходе
APIChat Completions, Responses API, Anthropic API
Лицензиявеса и репозиторий под MIT

V4 Flash и V4 Flash Vision Exp сняты с работы. deepseek-v4-flash и deepseek-v4-flash-vision-exp остаются временными маршрутами совместимости; в новом коде следует выбирать deepseek-flash.

DeepSeek указывает глобальный KV Cache размером 890 bytes на токен, примерно 1/4 от V4 Flash, а требующий постоянного хранения кэш - примерно 1/8. Это характеристика серверной памяти, а не обещание уменьшить число тарифицируемых токенов в четыре раза.

Стоимость прямого API

На англоязычной странице DeepSeek указаны следующие цены прямого API за миллион токенов:

Тип использованияНепиковое времяПик
Вход с cache hit$0.003$0.006
Вход без кэша$0.15$0.30
Выход$0.60$1.20

Пик действует с понедельника по пятницу в 01:00-04:00 и 06:00-10:00 UTC. В остальное время, включая выходные, действует непиковая цена. Это тарифы DeepSeek напрямую, а не расценки OmniAKey.

Для 100 000 не-кэшированных входных и 20 000 выходных токенов:

text
V4.1 Flash, непик = 0.1 x $0.15 + 0.02 x $0.60 = $0.027
V4.1 Flash, пик   = 0.1 x $0.30 + 0.02 x $1.20 = $0.054
V4 Pro, непик     = 0.1 x $0.66 + 0.02 x $1.98 = $0.1056
V4 Pro, пик       = 0.1 x $1.32 + 0.02 x $3.96 = $0.2112

При этой конкретной смеси V4.1 Flash примерно на 74% дешевле V4 Pro. Это расчёт цены, а не показатель качества: повторы и ручная доработка меняют стоимость принятой задачи. Августовская фотография Pro сохранена в гайде по ценам DeepSeek V4 Pro.

Что действительно показывают бенчмарки

В одной официальной таблице V4.1 Flash опережает V4 Pro в нескольких агентных задачах, но не во всех тестах знаний и рассуждений.

БенчмаркV4 FlashV4 ProV4.1 Flash
GPQA Diamond89.992.490.9
HLE, только текст37.842.739.1
Terminal-Bench 2.182.787.990.6
DeepSWE v1.154.462.774.2
CyberGym76.783.388.1
HLE с инструментами51.560.063.9
AutomationBench37.743.254.8

Корректный вывод: V4.1 Flash заметно улучшает заявленные сценарии кода, безопасности, автоматизации и инструментов, но не является универсальным победителем. В источниках есть и несоответствие: update log даёт 65.4 для NL2Repo-Bench, живая model card - 64.0. До пояснения DeepSeek этот показатель не используется в выводе.

Фреймворк агента тоже меняет результат

На той же V4.1 Flash DeepSWE v1.1 меняется от 65.5 в OpenCode до 74.2 в mini-SWE-agent, разница 8.7 пункта. Terminal-Bench 2.1 меняется от 84.1 в Codex до 90.6 в DeepSeek Harness Minimal, разница 6.5 пункта.

DeepSeek указывает N=8 запусков на задачу DeepSWE, N=3 для Terminal-Bench, Linux-контейнеры, максимум 500 шагов агента и максимальный reasoning effort. Формат промпта, цикл инструментов, retries и управление контекстом являются частью результата. Сравнивайте в том агенте, который будете использовать.

Зрение и границы интеграции

V4.1 Flash принимает JPEG, PNG, GIF и WebP через base64, публичный URL или Files API. Изображения поддерживаются в Chat Completions, Responses API и Anthropic API. После автоматического масштабирования одно изображение занимает не более 1,024 входных токенов.

Это понимание изображений, а не генерация. Мелкий текст, плотные таблицы и значимые договорные или финансовые поля требуют детерминированной проверки либо человека. В thinking-режиме с tools необходимо возвращать полный reasoning_content в следующие запросы, иначе документация описывает ошибку 400. FIM completion работает только без thinking.

Доступность через OmniAKey

На дату проверки 2026-09-10 публичный каталог моделей OmniAKey ещё не показывал канонический маршрут deepseek-flash. Поэтому статья не утверждает, что V4.1 Flash уже доступен через OmniAKey, и не публикует цену OmniAKey для него.

Когда точный ID появится в каталоге, создайте отдельный ключ с лимитом в API Keys, затем после smoke test проверьте модель, вход, кэш, выход и стоимость. Используйте также гайд по прозрачному биллингу и краткое руководство по API.

Чеклист миграции с V4 Pro

  1. Зафиксируйте 10-30 репрезентативных задач и критерии приёмки.
  2. Сохраните токены, задержку, retries и результат deepseek-v4-pro.
  3. Повторите ту же задачу через deepseek-flash с теми же tools и правами.
  4. Отдельно проверьте high и max, меняя за раз один параметр.
  5. Добавьте длинный tool loop и, если нужно, настоящую задачу с изображением.
  6. Сравните полную стоимость принятой задачи, а не только первую цену ответа.
  7. До 14 сентября обновите allowlist, мониторинг и метки аудита.

Частые вопросы

Какой новый ID модели?

Для прямого API DeepSeek это deepseek-flash. Старые ID V4 Flash служат только для совместимости.

V4.1 Flash всегда лучше V4 Pro?

Нет. Он лидирует в нескольких официальных агентных метриках, но V4 Pro выше в GPQA Diamond и HLE только с текстом. Решение зависит от задачи и фреймворка.

V4.1 Flash открыт?

Репозиторий и веса имеют лицензию MIT. Эксплуатация MoE на 552B всё равно требует специализированного оборудования, корректного prompt encoding и операционной проверки.

Первичные источники

Факты и расчёты проверены 10 сентября 2026 года. Независимый платный запуск, тест скорости и тест надёжности в production не выполнялись. Перед внедрением снова проверьте ID, цены, дату переключения и доступность gateway.