Prix API DeepSeek
Comparez tarifs, cache et horaires pour calculer le coût.
Le coût de l’API DeepSeek dépend du modèle, des entrées avec ou sans cache, des tokens de sortie et de l’horaire applicable. Au 28 septembre 2026, l’offre directe officielle indique deepseek-flash et deepseek-v4-pro. Flash a les tarifs les plus bas ; Pro doit justifier son surcoût sur vos tâches.
Les montants sont en USD par million de tokens sur l’API directe DeepSeek, vérifiés le 28 septembre 2026. Ce ne sont pas des prix OmniaKey. Les exemples sont des calculs, ni des factures mesurées ni des preuves de qualité.
Tarifs actuels de Flash et Pro
| Modèle API | Entrée sans cache : creux / pointe | Entrée avec cache : creux / pointe | Sortie : creux / pointe |
|---|---|---|---|
deepseek-flash | $0.15 / $0.30 | $0.003 / $0.006 | $0.60 / $1.20 |
deepseek-v4-pro | $0.66 / $1.32 | $0.022 / $0.044 | $1.98 / $3.96 |
Source : modèles et prix officiels. Une lecture de cache est une catégorie d’entrée ; son tarif ne s’applique pas à tout le prompt ni à la sortie.
deepseek-flash sert actuellement DeepSeek-V4.1-Flash, et deepseek-v4-pro sert DeepSeek-V4-Pro-0813. DeepSeek accepte encore les anciens noms directs deepseek-v4-flash et deepseek-v4-flash-vision-exp, mais ces requêtes sont désormais traitées par V4.1 Flash et facturées au tarif Flash. Chaque passerelle peut avoir sa propre correspondance de modèles.
Consultez notre analyse de V4.1 Flash pour ses capacités, et le guide tarifaire de V4 Pro pour son historique et ses particularités.
Les heures de pointe sont définies en UTC
La plage actuelle est 01:00–04:00 et 06:00–10:00 UTC, du lundi au vendredi, hors jours fériés chinois. Le reste du temps est en heures creuses. Les week-ends et jours fériés chinois sont entièrement en heures creuses, à la moitié des tarifs de pointe correspondants.
Convertissez ces horaires avec le fuseau réel de votre application, en tenant compte de l’heure d’été. Un lundi UTC peut recouvrir le dimanche soir ailleurs. Ne confondez pas UTC, heure de Pékin et heure du navigateur. Près d’une frontière horaire, vérifiez le calendrier et l’usage facturé ; ce guide ne suppose pas la règle applicable à une requête qui traverse cette frontière.
Calculer le coût d’une requête
coût = tokens_entrée_sans_cache / 1,000,000 × tarif_entrée
+ tokens_entrée_avec_cache / 1,000,000 × tarif_cache
+ tokens_sortie_facturée / 1,000,000 × tarif_sortie
La sortie facturée inclut le raisonnement facturable, pas seulement le texte visible. Utilisez les champs d’usage de l’API plutôt que le nombre de caractères ou la taille de la réponse finale.
| Même charge de tokens | Flash creux | Flash pointe | Pro creux | Pro pointe |
|---|---|---|---|---|
| 100K entrée sans cache + 20K sortie | $0.027 | $0.054 | $0.1056 | $0.2112 |
| 90K entrée avec cache + 10K sans cache + 20K sortie | $0.01377 | $0.02754 | $0.04818 | $0.09636 |
Le premier coût Flash vaut 0.1 × $0.15 + 0.02 × $0.60 = $0.027. Le second vaut 0.09 × $0.003 + 0.01 × $0.15 + 0.02 × $0.60 = $0.01377. Ce sont deux scénarios distincts, pas deux frais cumulés pour une requête.
Les calculs excluent reprises, frais supplémentaires d’outils ou de fournisseurs et conversion monétaire. Ils supposent des volumes identiques pour les deux modèles et des lectures de cache confirmées. En pratique, tokens consommés et nombre de tentatives peuvent varier.
Un cache utile commence par un préfixe réutilisable
Le cache de contexte DeepSeek réutilise les préfixes identiques. Si votre application le permet, placez les instructions et références stables avant la question variable. Répéter un sujet similaire ne prouve pas un succès du cache.
Lisez prompt_cache_hit_tokens et prompt_cache_miss_tokens. Sans preuve dans l’usage retourné, estimez le premier appel comme non mis en cache. Le cache n’est ni une mémoire applicative permanente ni une promesse de succès au prochain appel. Réduisez d’abord le contexte inutile, bornez la sortie et mesurez les reprises : un grand prompt mis en cache peut coûter plus qu’un petit prompt suffisant.
Flash ou Pro : raisonner par tâche acceptée
En heures creuses directes, Pro coûte 4.4× plus pour l’entrée sans cache, 3.3× pour la sortie et environ 7.33× pour une lecture de cache. Il n’existe donc pas un coefficient unique pour toutes les charges.
Comparez des tâches représentatives à outils, critères d’acceptation et budget de temps identiques. Relevez coût total, reprises, délai et corrections humaines, puis calculez coût facturé total / tâches acceptées. Un token moins cher peut perdre son avantage après plusieurs échecs. Un modèle plus cher n’est pas automatiquement mieux adapté. La table directe indique la vision pour Flash, mais pas pour Pro : le besoin fonctionnel peut trancher avant le prix.
Distinguer DeepSeek direct et OmniaKey
Une requête OmniaKey utilise une clé OmniaKey et le point d’accès du guide de démarrage (en anglais). Elle ne consomme pas le solde d’un compte DeepSeek séparé. Une clé DeepSeek appartient au service direct.
Comparez l’ID exact, les tarifs, le traitement du cache et l’usage de la route appelée. Horaires, alias et solde offert par DeepSeek ne s’appliquent pas automatiquement à un intermédiaire. Consultez les prix OmniaKey actuels et votre tableau de bord au lieu de supposer une remise fixe sur le tarif officiel.
Questions fréquentes
L’API DeepSeek est-elle gratuite ?
Elle est facturée à l’usage. La documentation prévoit un prélèvement sur le solde rechargé ou accordé, avec priorité au solde accordé s’il existe. Ce n’est pas une promesse de crédits gratuits pour chaque compte. Chat gratuit, promotion et solde API ont des conditions distinctes.
Faut-il payer un abonnement mensuel ?
Cette table décrit la facturation par tokens de l’API directe. Un abonnement de chat ou une offre « premium » tierce ne remplace pas ces tarifs ; lisez les conditions de toute offre séparée.
Le cache réduit-il aussi le prix de sortie ?
Non. Il change la composante d’entrée concernée. La sortie, y compris le raisonnement facturable, garde son propre tarif.
Les week-ends sont-ils toujours moins chers ?
La règle directe vérifiée les classe en heures creuses. Vérifiez UTC et les règles en vigueur ; cela ne garantit ni les horaires d’une passerelle ni les frontières de votre week-end local.
Puis-je conserver un ancien nom Flash ?
Les alias directs compatibles pointent désormais vers V4.1 Flash. Privilégiez le nom documenté et réévaluez le comportement après un changement. Vérifiez séparément le catalogue d’une passerelle.