DeepSeek V4.1 Flash
Новый Flash дешевле и выше в нескольких агентных тестах, но официальная таблица не доказывает превосходство над V4 Pro для каждой задачи.
Этот обзор DeepSeek V4.1 Flash отделяет устройство модели, опубликованные DeepSeek бенчмарки и API-контракт, который важен при реальной интеграции.
Краткий вывод: V4.1 Flash стоит первым проверить для кодовых агентов с длинным контекстом, инструментами, изображениями и большим потоком задач. В непиковое время прямая API DeepSeek берёт $0.15 за миллион не-кэшированных входных токенов и $0.60 за выходные. Это не означает, что модель автоматически заменяет V4 Pro во всех сценариях. В статье нет выдуманного личного опыта, независимого платного запуска или теста скорости.
Проверка фактов: 10 сентября 2026 года. Материал основан на релизе, ценах, API-гайдах и открытой model card DeepSeek. Все оценки бенчмарков имеют статус vendor-reported: их сообщил поставщик, а не независимо воспроизвёл OmniaKey.
Когда сначала тестировать V4.1 Flash
Подходящие первые задачи: кодовый агент с длинными промптами и повторными tool calls, отладка по скриншотам, OCR и извлечение документов с последующей проверкой, пакетная автоматизация, где важны throughput и цена токена.
Сначала запустите регрессию, если поток зависит от поведения V4 Pro, неизменного формата tool calls или фиксированной идентичности модели. DeepSeek объявил, что deepseek-v4-pro будет направляться на V4.1 Flash с 2026-09-14 04:00 UTC. Один и тот же ID перестанет означать ту же модель.
Подтверждённые данные запуска
| Пункт | Подтверждённая информация |
|---|---|
| Официальный выпуск | 2026-09-10 |
| Канонический ID API DeepSeek | deepseek-flash |
| Старые совместимые ID | deepseek-v4-flash, deepseek-v4-flash-vision-exp |
| Переход Pro | deepseek-v4-pro направляется на V4.1 Flash с 2026-09-14 04:00 UTC |
| Архитектура | мультимодальный MoE на 552B параметров, Causal Encoder-Decoder |
| Активные параметры | 8B при prefill, 16B при decode |
| Лимиты | контекст 1M, максимум 384K на выходе |
| API | Chat Completions, Responses API, Anthropic API |
| Лицензия | веса и репозиторий под MIT |
V4 Flash и V4 Flash Vision Exp сняты с работы. deepseek-v4-flash и deepseek-v4-flash-vision-exp остаются временными маршрутами совместимости; в новом коде следует выбирать deepseek-flash.
DeepSeek указывает глобальный KV Cache размером 890 bytes на токен, примерно 1/4 от V4 Flash, а требующий постоянного хранения кэш - примерно 1/8. Это характеристика серверной памяти, а не обещание уменьшить число тарифицируемых токенов в четыре раза.
Стоимость прямого API
На англоязычной странице DeepSeek указаны следующие цены прямого API за миллион токенов:
| Тип использования | Непиковое время | Пик |
|---|---|---|
| Вход с cache hit | $0.003 | $0.006 |
| Вход без кэша | $0.15 | $0.30 |
| Выход | $0.60 | $1.20 |
Пик действует с понедельника по пятницу в 01:00-04:00 и 06:00-10:00 UTC. В остальное время, включая выходные, действует непиковая цена. Это тарифы DeepSeek напрямую, а не расценки OmniAKey.
Для 100 000 не-кэшированных входных и 20 000 выходных токенов:
V4.1 Flash, непик = 0.1 x $0.15 + 0.02 x $0.60 = $0.027
V4.1 Flash, пик = 0.1 x $0.30 + 0.02 x $1.20 = $0.054
V4 Pro, непик = 0.1 x $0.66 + 0.02 x $1.98 = $0.1056
V4 Pro, пик = 0.1 x $1.32 + 0.02 x $3.96 = $0.2112
При этой конкретной смеси V4.1 Flash примерно на 74% дешевле V4 Pro. Это расчёт цены, а не показатель качества: повторы и ручная доработка меняют стоимость принятой задачи. Августовская фотография Pro сохранена в гайде по ценам DeepSeek V4 Pro.
Что действительно показывают бенчмарки
В одной официальной таблице V4.1 Flash опережает V4 Pro в нескольких агентных задачах, но не во всех тестах знаний и рассуждений.
| Бенчмарк | V4 Flash | V4 Pro | V4.1 Flash |
|---|---|---|---|
| GPQA Diamond | 89.9 | 92.4 | 90.9 |
| HLE, только текст | 37.8 | 42.7 | 39.1 |
| Terminal-Bench 2.1 | 82.7 | 87.9 | 90.6 |
| DeepSWE v1.1 | 54.4 | 62.7 | 74.2 |
| CyberGym | 76.7 | 83.3 | 88.1 |
| HLE с инструментами | 51.5 | 60.0 | 63.9 |
| AutomationBench | 37.7 | 43.2 | 54.8 |
Корректный вывод: V4.1 Flash заметно улучшает заявленные сценарии кода, безопасности, автоматизации и инструментов, но не является универсальным победителем. В источниках есть и несоответствие: update log даёт 65.4 для NL2Repo-Bench, живая model card - 64.0. До пояснения DeepSeek этот показатель не используется в выводе.
Фреймворк агента тоже меняет результат
На той же V4.1 Flash DeepSWE v1.1 меняется от 65.5 в OpenCode до 74.2 в mini-SWE-agent, разница 8.7 пункта. Terminal-Bench 2.1 меняется от 84.1 в Codex до 90.6 в DeepSeek Harness Minimal, разница 6.5 пункта.
DeepSeek указывает N=8 запусков на задачу DeepSWE, N=3 для Terminal-Bench, Linux-контейнеры, максимум 500 шагов агента и максимальный reasoning effort. Формат промпта, цикл инструментов, retries и управление контекстом являются частью результата. Сравнивайте в том агенте, который будете использовать.
Зрение и границы интеграции
V4.1 Flash принимает JPEG, PNG, GIF и WebP через base64, публичный URL или Files API. Изображения поддерживаются в Chat Completions, Responses API и Anthropic API. После автоматического масштабирования одно изображение занимает не более 1,024 входных токенов.
Это понимание изображений, а не генерация. Мелкий текст, плотные таблицы и значимые договорные или финансовые поля требуют детерминированной проверки либо человека. В thinking-режиме с tools необходимо возвращать полный reasoning_content в следующие запросы, иначе документация описывает ошибку 400. FIM completion работает только без thinking.
Доступность через OmniAKey
На дату проверки 2026-09-10 публичный каталог моделей OmniAKey ещё не показывал канонический маршрут deepseek-flash. Поэтому статья не утверждает, что V4.1 Flash уже доступен через OmniAKey, и не публикует цену OmniAKey для него.
Когда точный ID появится в каталоге, создайте отдельный ключ с лимитом в API Keys, затем после smoke test проверьте модель, вход, кэш, выход и стоимость. Используйте также гайд по прозрачному биллингу и краткое руководство по API.
Чеклист миграции с V4 Pro
- Зафиксируйте 10-30 репрезентативных задач и критерии приёмки.
- Сохраните токены, задержку, retries и результат
deepseek-v4-pro. - Повторите ту же задачу через
deepseek-flashс теми же tools и правами. - Отдельно проверьте
highиmax, меняя за раз один параметр. - Добавьте длинный tool loop и, если нужно, настоящую задачу с изображением.
- Сравните полную стоимость принятой задачи, а не только первую цену ответа.
- До 14 сентября обновите allowlist, мониторинг и метки аудита.
Частые вопросы
Какой новый ID модели?
Для прямого API DeepSeek это deepseek-flash. Старые ID V4 Flash служат только для совместимости.
V4.1 Flash всегда лучше V4 Pro?
Нет. Он лидирует в нескольких официальных агентных метриках, но V4 Pro выше в GPQA Diamond и HLE только с текстом. Решение зависит от задачи и фреймворка.
V4.1 Flash открыт?
Репозиторий и веса имеют лицензию MIT. Эксплуатация MoE на 552B всё равно требует специализированного оборудования, корректного prompt encoding и операционной проверки.
Первичные источники
- Релиз DeepSeek V4.1 Flash
- Модели и цены DeepSeek
- Model card DeepSeek V4.1 Flash
- Технический отчёт DeepSeek V4.1
- Гайд по пониманию изображений
- Гайд по thinking mode
- Журнал обновлений DeepSeek
Факты и расчёты проверены 10 сентября 2026 года. Независимый платный запуск, тест скорости и тест надёжности в production не выполнялись. Перед внедрением снова проверьте ID, цены, дату переключения и доступность gateway.