GPT-5.4 et GPT-5.4 Mini sont retirés · Passez à un autre modèle disponible
Blogue
Guider

DeepSeek V4.1 Flash

Le nouveau Flash coûte moins cher et progresse sur plusieurs tests d'agents, mais les données officielles ne prouvent pas qu'il bat V4 Pro dans chaque tâche.

12 minutes de lectureOmniaKey
DeepSeek V4.1 Flashtest de modèleprix APImultimodalagent de code

Ce test DeepSeek V4.1 Flash distingue l'architecture, les scores publiés par DeepSeek et le contrat API utile pour une intégration réelle.

Le verdict est nuancé. V4.1 Flash est un bon premier candidat pour les agents à long contexte, les boucles d'outils, l'analyse d'images et les traitements à fort volume. L'API directe de DeepSeek facture hors pointe $0.15 par million de tokens d'entrée non mis en cache et $0.60 en sortie. Cela ne démontre pas qu'il remplace V4 Pro pour tous les travaux, et cet article ne prétend pas avoir réalisé un test payant indépendant de qualité ou de vitesse.

Vérification des faits : 10 septembre 2026. Cette analyse s'appuie sur la note de sortie, les tarifs, les guides API et la carte de modèle publics de DeepSeek. Les résultats de benchmark sont vendor-reported : ils viennent du fournisseur, pas d'une reproduction indépendante par OmniaKey.

Quand essayer V4.1 Flash en premier

Commencez par ce modèle pour un agent de code avec de longs prompts et plusieurs outils, le débogage assisté par capture d'écran, l'extraction OCR contrôlée et les tâches par lots où le débit et le coût token comptent.

Exécutez d'abord une régression si votre flux dépend d'un comportement propre à V4 Pro, d'appels d'outils très stables ou d'une identité de modèle figée. DeepSeek annonce que deepseek-v4-pro sera routé vers V4.1 Flash à partir du 2026-09-14 04:00 UTC. Le même ID ne désignera donc plus le même modèle.

Faits vérifiés au lancement

ÉlémentInformation vérifiée
Sortie officielle2026-09-10
ID officiel de l'API DeepSeekdeepseek-flash
IDs historiques compatiblesdeepseek-v4-flash, deepseek-v4-flash-vision-exp
Transition Prodeepseek-v4-pro bascule vers V4.1 Flash le 2026-09-14 04:00 UTC
ArchitectureMoE multimodal de 552B paramètres, Causal Encoder-Decoder
Paramètres actifs8B au prefill, 16B au decode
Capacité1M de contexte, 384K de sortie maximum
APIChat Completions, Responses API, Anthropic API
Licencepoids et dépôt sous MIT

V4 Flash et V4 Flash Vision Exp sont retirés. Les anciens deepseek-v4-flash et deepseek-v4-flash-vision-exp ne sont que des routes de compatibilité temporaires : une nouvelle intégration doit utiliser deepseek-flash.

DeepSeek annonce aussi un KV Cache global de 890 bytes par token, soit environ 1/4 de celui de V4 Flash, avec une partie persistante d'environ 1/8. C'est un gain mémoire côté service, pas une promesse de diviser automatiquement par quatre les tokens facturés.

Prix de l'API directe

La page anglaise de DeepSeek donne les tarifs suivants, par million de tokens, pour l'API directe.

UsageHors pointePointe
Entrée avec cache$0.003$0.006
Entrée sans cache$0.15$0.30
Sortie$0.60$1.20

Les heures de pointe sont du lundi au vendredi, de 01:00 à 04:00 et de 06:00 à 10:00 UTC. Le reste du temps, week-end inclus, est hors pointe. Ces montants sont ceux de DeepSeek, pas un prix OmniaKey.

Avec 100 000 tokens d'entrée non cachés et 20 000 tokens de sortie :

text
V4.1 Flash hors pointe = 0.1 x $0.15 + 0.02 x $0.60 = $0.027
V4.1 Flash pointe      = 0.1 x $0.30 + 0.02 x $1.20 = $0.054
V4 Pro hors pointe     = 0.1 x $0.66 + 0.02 x $1.98 = $0.1056
V4 Pro pointe          = 0.1 x $1.32 + 0.02 x $3.96 = $0.2112

Pour ce mélange précis, V4.1 Flash coûte environ 74% de moins que V4 Pro. Ce n'est pas un score de qualité : les relances et les corrections humaines peuvent changer le coût d'une tâche acceptée. La photographie tarifaire de Pro d'août est conservée dans le guide de prix DeepSeek V4 Pro (en anglais).

Ce que disent réellement les benchmarks

Dans le tableau officiel, V4.1 Flash dépasse V4 Pro sur plusieurs tâches d'agent, mais pas sur tous les tests de raisonnement et de connaissance.

BenchmarkV4 FlashV4 ProV4.1 Flash
GPQA Diamond89.992.490.9
HLE, sous-ensemble texte37.842.739.1
Terminal-Bench 2.182.787.990.6
DeepSWE v1.154.462.774.2
CyberGym76.783.388.1
HLE avec outils51.560.063.9
AutomationBench37.743.254.8

La conclusion défendable est donc une progression nette sur les scénarios de code, sécurité, automatisation et outils rapportés, pas une victoire universelle. Une autre limite est explicite : le changelog indique 65.4 pour NL2Repo-Bench tandis que la carte de modèle en direct indique 64.0. Cette valeur n'est pas utilisée dans le verdict tant que DeepSeek ne résout pas la divergence.

Le framework d'agent influence fortement le score

Pour le même V4.1 Flash, DeepSWE v1.1 va de 65.5 avec OpenCode à 74.2 avec mini-SWE-agent, soit 8.7 points. Terminal-Bench 2.1 va de 84.1 avec Codex à 90.6 avec DeepSeek Harness Minimal, soit 6.5 points.

DeepSeek documente N=8 essais par tâche DeepSWE, N=3 pour Terminal-Bench, des conteneurs Linux, 500 étapes d'agent au maximum et l'effort de raisonnement maximal. Prompt, boucle d'outils, politique de retry et gestion du contexte font donc partie du résultat. Testez dans votre propre agent.

Vision et pièges d'intégration

V4.1 Flash accepte JPEG, PNG, GIF et WebP via base64, URL publique ou Files API. L'entrée image fonctionne avec Chat Completions, Responses API et Anthropic API. Après redimensionnement, une image compte au plus 1,024 tokens d'entrée.

Il s'agit de compréhension visuelle, pas de génération d'images. Les petits caractères, tableaux denses et données contractuelles ou financières doivent être vérifiés par un contrôle déterministe ou humain. Avec des tools en mode thinking, la documentation demande de renvoyer tout reasoning_content aux requêtes suivantes, sinon l'API renvoie 400. La complétion FIM n'est disponible qu'en mode sans thinking.

Disponibilité chez OmniAKey

Lors de la vérification du 2026-09-10, le catalogue de modèles OmniAKey n'affichait pas encore la route canonique deepseek-flash. Cet article ne prétend donc ni que V4.1 Flash est actuellement disponible via OmniAKey ni qu'il existe un tarif OmniAKey pour ce modèle.

Lorsque l'ID exact apparaît dans le catalogue, créez seulement alors une clé limitée dans API Keys. Après le premier smoke test, vérifiez l'ID du modèle, l'entrée, le cache, la sortie et le coût. Consultez aussi le guide de facturation transparente (en anglais) et le démarrage rapide API (en anglais).

Checklist de migration depuis V4 Pro

  1. Figez 10 à 30 tâches représentatives et leurs critères d'acceptation.
  2. Conservez tokens, latence, relances et résultat de deepseek-v4-pro.
  3. Rejouez la même tâche avec deepseek-flash, les mêmes outils et autorisations.
  4. Testez high et max séparément, avec une seule variable modifiée à la fois.
  5. Ajoutez une longue boucle d'outils et, si nécessaire, une image réelle.
  6. Comparez le coût par tâche acceptée, pas seulement le prix de la première réponse.
  7. Mettez à jour allowlist, alertes et étiquettes d'audit avant le 14 septembre.

Questions fréquentes

Quel est le nouvel ID de modèle ?

Sur l'API directe DeepSeek, utilisez deepseek-flash. Les deux IDs V4 Flash historiques ne sont que des alias de compatibilité.

V4.1 Flash est-il toujours meilleur que V4 Pro ?

Non. Il dépasse Pro sur plusieurs métriques officielles d'agent, mais V4 Pro reste devant sur GPQA Diamond et HLE texte. La tâche et le framework d'agent doivent décider.

V4.1 Flash est-il open source ?

Le dépôt et les poids sont sous MIT. Faire fonctionner un MoE de 552B reste cependant un projet d'infrastructure avec matériel spécialisé, encodage de prompts et validation opérationnelle.

Sources primaires

Les faits et calculs ont été vérifiés le 10 septembre 2026. Aucun appel payant indépendant, test de vitesse ou essai de fiabilité en production n'a été réalisé. Vérifiez à nouveau les IDs, prix, date de bascule et disponibilité du gateway avant déploiement.