DeepSeek-API-Kosten
Vergleiche Tokenpreise, Cache und zeitabhängige Kosten.
Die Kosten der DeepSeek-API hängen vom Modell, dem Cache-Anteil der Eingabe, der Ausgabe und dem Zeitfenster ab. Am 28. September 2026 listet die direkte API deepseek-flash und deepseek-v4-pro. Flash hat niedrigere Tokenpreise; Pro muss seinen Mehrpreis auf deinen Aufgaben rechtfertigen.
Preise in USD je Million Tokens für die direkte DeepSeek-API, geprüft am 28. September 2026. Dies ist kein OmniaKey-Angebot. Rechenbeispiele sind keine gemessenen Rechnungen und kein Nachweis für Modellqualität.
Aktuelle API-Preise
| API-Modell | Eingabe ohne Cache: Nebenzeit / Spitzenzeit | Eingabe mit Cache: Nebenzeit / Spitzenzeit | Ausgabe: Nebenzeit / Spitzenzeit |
|---|---|---|---|
deepseek-flash | $0.15 / $0.30 | $0.003 / $0.006 | $0.60 / $1.20 |
deepseek-v4-pro | $0.66 / $1.32 | $0.022 / $0.044 | $1.98 / $3.96 |
Quelle: offizielle Modell- und Preisseite. Cache-Treffer sind eine eigene Eingabekategorie, kein Rabatt auf die gesamte Anfrage oder Ausgabe.
deepseek-flash liefert derzeit DeepSeek-V4.1-Flash, deepseek-v4-pro DeepSeek-V4-Pro-0813. Die alten direkten Namen deepseek-v4-flash und deepseek-v4-flash-vision-exp bleiben laut DeepSeek zulässig, werden aber durch V4.1 Flash bedient und zu Flash-Preisen berechnet. Daraus folgt keine identische Zuordnung bei jedem Gateway.
Die V4.1-Flash-Besprechung behandelt Fähigkeiten und Umstellung. Der V4-Pro-Preisleitfaden erklärt die modellspezifischen Details.
Spitzenzeiten gelten in UTC
Die derzeitigen Spitzenzeiten sind 01:00–04:00 und 06:00–10:00 UTC, montags bis freitags, ausgenommen chinesische gesetzliche Feiertage. Sonst gilt die Nebenzeit, an Wochenenden und chinesischen Feiertagen ganztägig. Deren Preise betragen die Hälfte der jeweiligen Spitzenpreise.
Rechne mit der tatsächlichen Zeitzone und berücksichtige die Sommerzeit. Ein UTC-Montag kann andernorts noch Sonntagabend sein. UTC ist weder Pekinger Zeit noch automatisch die Browserzeit. Prüfe nahe der Grenze Kalender und abgerechneten Verbrauch; dieser Leitfaden unterstellt keine Regel für Anfragen, die die Zeitgrenze überschreiten.
Kosten pro Anfrage berechnen
Kosten = Eingabetokens_ohne_Cache / 1,000,000 × Eingabepreis
+ Eingabetokens_mit_Cache / 1,000,000 × Cachepreis
+ berechnete_Ausgabetokens / 1,000,000 × Ausgabepreis
Auch abgerechnete Reasoning-Tokens zählen zur Ausgabe. Ein kurzer sichtbarer Text kann deshalb einen größeren Ausgabeposten erzeugen. Maßgeblich sind die Usage-Felder, nicht Zeichenzahl oder Antwortlänge.
| Gleiche Tokenmenge | Flash Nebenzeit | Flash Spitze | Pro Nebenzeit | Pro Spitze |
|---|---|---|---|---|
| 100K Eingabe ohne Cache + 20K Ausgabe | $0.027 | $0.054 | $0.1056 | $0.2112 |
| 90K Cache-Eingabe + 10K ohne Cache + 20K Ausgabe | $0.01377 | $0.02754 | $0.04818 | $0.09636 |
Flash in Zeile eins: 0.1 × $0.15 + 0.02 × $0.60 = $0.027. In Zeile zwei: 0.09 × $0.003 + 0.01 × $0.15 + 0.02 × $0.60 = $0.01377. Das sind alternative Szenarien, keine zwei Gebühren derselben Anfrage.
Nicht enthalten sind Wiederholungen, zusätzliche Werkzeug- oder Anbietergebühren und Währungsumrechnung. Die Rechnung setzt gleiche Tokenmengen und bestätigte Cache-Treffer voraus. Reale Modelle können unterschiedlich viele Tokens und Versuche benötigen.
Cache-Treffer brauchen passende Präfixe
Das DeepSeek-Kontext-Caching nutzt übereinstimmende Präfixe. Wenn die Anwendung es erlaubt, stehen stabile Anweisungen und Referenzen vorn, wechselnde Fragen hinten. Ein ähnliches Thema oder ungefähr gleicher Text beweist keinen Treffer.
Lies prompt_cache_hit_tokens und prompt_cache_miss_tokens. Ohne bestätigten Treffer kalkulierst du den ersten Aufruf als Cache-Miss. Der Cache ist kein dauerhaftes Anwendungsgedächtnis und keine Trefferzusage für den nächsten Aufruf. Entferne zunächst irrelevante Eingabe, begrenze Ausgabe und miss Wiederholungen: Ein übergroßer gecachter Prompt kann teurer sein als ein kleiner ausreichender.
Flash oder Pro nach erfolgreich erledigter Aufgabe wählen
Zur direkten Nebenzeit kostet Pro bei ungecachter Eingabe 4.4×, bei Ausgabe 3.3× und bei Cache-Lesen ungefähr 7.33× so viel wie Flash. Ein einzelner Multiplikator beschreibt gemischte Aufgaben daher nicht.
Teste repräsentative Aufgaben mit identischen Werkzeugen, Abnahmekriterien und Zeitbudgets. Erfasse Gesamtkosten, Versuche, Latenz und menschliche Korrekturen. Berechne Gesamtkosten geteilt durch akzeptierte Aufgaben. Niedrige Tokenpreise können durch Fehlschläge aufgezehrt werden; ein teureres Modell ist nicht automatisch passender. Die aktuelle direkte Tabelle weist Bildverständnis für Flash, aber nicht für Pro aus: Fähigkeiten können die Auswahl vor dem Preis entscheiden.
Direkte Abrechnung und OmniaKey unterscheiden
Eine OmniaKey-Anfrage verwendet den OmniaKey-Key und den Endpunkt aus dem Schnellstart (Englisch). Sie belastet kein separates DeepSeek-Guthaben. Ein DeepSeek-Key gehört zum Direktdienst.
Vergleiche exakte Modell-ID, Preise, Cache-Behandlung und Nutzungsnachweis der tatsächlich aufgerufenen Route. DeepSeek-Zeitfenster, Aliase und gewährtes Guthaben gelten nicht automatisch für einen Vermittler. Nutze die aktuellen OmniaKey-Preise und dein Dashboard statt eines angenommenen Pauschalrabatts auf die offizielle Tabelle.
Häufige Fragen
Ist die DeepSeek-API kostenlos?
Sie wird nach Verbrauch abgerechnet. Laut Dokumentation wird zuerst gewährtes Guthaben und danach aufgeladenes Guthaben verwendet, wenn beide vorhanden sind. Das verspricht keinem Konto automatisch Gratisguthaben. Kostenloser Chat, Aktionen und API-Guthaben sind unterschiedliche Bedingungen.
Monatsgebühr oder Tokenabrechnung?
Die Tabelle behandelt direkte API-Tokens. Ein Chat-Abo oder ein fremdes „Premium“-Paket ersetzt diese Preise nicht; dafür gelten eigene Vertragsbedingungen.
Verbilligt der Cache auch die Ausgabe?
Nein. Er verändert den betreffenden Eingabeanteil. Ausgabe einschließlich berechneter Reasoning-Tokens hat einen eigenen Preis.
Sind Wochenenden immer günstiger?
Die geprüfte Direktregel behandelt Wochenenden als Nebenzeit. Prüfe UTC und aktuelle Bedingungen; das garantiert weder Gateway-Preise noch die Grenzen deines lokalen Wochenendes.
Darf ich einen alten Flash-Namen weiterverwenden?
Direkte Kompatibilitätsaliase führen inzwischen zu V4.1 Flash. Verwende möglichst den dokumentierten aktuellen Namen und prüfe Verhalten nach Modellwechseln erneut. Ein Gateway-Katalog ist separat zu prüfen.