GPT-5.4 und GPT-5.4 Mini wurden eingestellt · Bitte wechseln Sie zu einem anderen verfügbaren Modell
Blog
Leitfaden

DeepSeek V4.1 Flash

Das neue Flash ist günstiger und liegt in mehreren Agent-Tests vor V4 Pro. Die offizielle Tabelle belegt aber keinen Sieg bei jeder Aufgabe.

12 Min. LesezeitOmniaKey
DeepSeek V4.1 FlashModelltestAPI-PreisemultimodalCoding-Agent

Dieser DeepSeek V4.1 Flash Test trennt Modellarchitektur, die von DeepSeek veröffentlichten Benchmarks und die API-Verträge, die bei einer Integration tatsächlich zählen.

Das Ergebnis vorweg: Für lange Agent-Schleifen mit Werkzeugen, Bildkontext und hohem Durchsatz ist V4.1 Flash ein sinnvoller erster Kandidat. Die DeepSeek-Direkt-API berechnet im Off-Peak $0.15 für eine Million nicht gecachter Eingabe-Token und $0.60 für Ausgabe. Daraus folgt nicht, dass es V4 Pro in jeder Aufgabe ersetzt. Für diesen Artikel wurde kein unabhängiger kostenpflichtiger Qualitäts- oder Geschwindigkeitstest ausgeführt.

Faktencheck: 10. September 2026. Diese Recherche stützt sich auf DeepSeeks Release Note, Preis- und API-Dokumentation sowie die öffentliche Modellkarte. Alle Benchmark-Werte sind vendor-reported, also keine unabhängige Reproduktion durch OmniaKey.

Wann V4.1 Flash zuerst testen?

Der neue Flash passt besonders zu langen Coding-Agent-Aufgaben, Screenshot-gestütztem Debugging, Dokument- oder OCR-Extraktion mit nachgelagerter Prüfung sowie wiederholbaren Batch-Aufgaben mit hohem Token-Volumen.

Zuerst regressionsprüfen sollten Teams, deren Abläufe von V4-Pro-Verhalten, stabilen Tool-Calls oder auditierbarer Modellidentität abhängen. DeepSeek kündigt an, dass deepseek-v4-pro ab 2026-09-14 04:00 UTC auf V4.1 Flash geroutet und zu Flash-Preisen abgerechnet wird. Ein unveränderter Modellname bedeutet dann nicht mehr dieselbe Ausführung.

Bestätigte Startdaten

PunktBestätigte Information
Release2026-09-10
Kanonische DeepSeek-Modell-IDdeepseek-flash
Alte Kompatibilitäts-IDsdeepseek-v4-flash, deepseek-v4-flash-vision-exp
Pro-Umstellungdeepseek-v4-pro wird ab 2026-09-14 04:00 UTC auf V4.1 Flash geroutet
Architektur552B-Parameter-MoE, multimodal, Causal Encoder-Decoder
Aktive Parameter je Token8B beim Prefill, 16B beim Decode
Kapazität1M Kontext, maximal 384K Ausgabe
SchnittstellenChat Completions, Responses API, Anthropic API
LizenzGewichte und Repository unter MIT

V4 Flash und V4 Flash Vision Exp sind eingestellt. deepseek-v4-flash und deepseek-v4-flash-vision-exp bleiben nur vorübergehende Kompatibilitätsrouten; neue Integrationen sollten deepseek-flash verwenden.

DeepSeek beschreibt einen globalen KV Cache von 890 bytes pro Token, etwa 1/4 von V4 Flash. Der persistent zu speichernde Anteil soll etwa 1/8 betragen. Das ist eine Aussage über Serving-Speicher und keine Zusage, dass eine Anfrage nur ein Viertel der abrechenbaren Token erzeugt.

Direkte API-Preise

Die englische DeepSeek-Preisseite nennt diese Direktpreise je eine Million Token:

AbrechnungOff-PeakPeak
Cache-Hit-Eingabe$0.003$0.006
Nicht gecachte Eingabe$0.15$0.30
Ausgabe$0.60$1.20

Peak-Zeiten sind Montag bis Freitag von 01:00-04:00 und 06:00-10:00 UTC. Alle übrigen Zeiten einschließlich Wochenende sind Off-Peak. Das sind DeepSeek-Direktpreise, nicht die Preise eines Gateways.

Bei 100.000 nicht gecachten Eingabe-Token und 20.000 Ausgabe-Token ergibt sich:

text
V4.1 Flash Off-Peak = 0.1 x $0.15 + 0.02 x $0.60 = $0.027
V4.1 Flash Peak     = 0.1 x $0.30 + 0.02 x $1.20 = $0.054
V4 Pro Off-Peak     = 0.1 x $0.66 + 0.02 x $1.98 = $0.1056
V4 Pro Peak         = 0.1 x $1.32 + 0.02 x $3.96 = $0.2112

Für genau diese Token-Mischung ist V4.1 Flash rund 74% günstiger als V4 Pro. Das ist Rechenarithmetik, kein Qualitätsurteil: zusätzliche Versuche und Nacharbeit können den Vorteil aufzehren. Die ältere Preisaufnahme steht im DeepSeek V4 Pro API-Preisleitfaden (Englisch).

Was sagen die offiziellen Benchmarks?

Die Modellkarte führt V4.1 Flash bei mehreren Agent-Aufgaben vor V4 Pro, aber nicht in allen gemeldeten Wissens- und Reasoning-Tests.

BenchmarkV4 FlashV4 ProV4.1 Flash
GPQA Diamond89.992.490.9
HLE, nur Text37.842.739.1
Terminal-Bench 2.182.787.990.6
DeepSWE v1.154.462.774.2
CyberGym76.783.388.1
HLE mit Tools51.560.063.9
AutomationBench37.743.254.8

Der belastbare Schluss lautet daher: V4.1 Flash verbessert die berichteten Coding-, Sicherheits-, Automatisierungs- und Tool-Use-Szenarien deutlich, ohne jede V4-Pro-Stärke zu übertreffen. Zusätzlich widersprechen sich zwei offizielle Quellen bei NL2Repo-Bench: Das Update nennt 65.4, die aktuelle Modellkarte 64.0. Dieser Wert ist hier bewusst nicht Teil des Urteils.

Der Agent-Stack verändert das Ergebnis

Mit demselben V4.1 Flash reicht DeepSWE v1.1 von 65.5 in OpenCode bis 74.2 in mini-SWE-agent, ein Abstand von 8.7 Punkten. Terminal-Bench 2.1 reicht von 84.1 in Codex bis 90.6 in DeepSeek Harness Minimal, ein Abstand von 6.5 Punkten.

DeepSeek nennt N=8 je DeepSWE-Aufgabe und N=3 bei Terminal-Bench, Linux-Container, höchstens 500 Agent-Schritte und maximale Reasoning-Stärke. Prompt-Format, Tool-Schleife, Retry-Regeln und Kontextverwaltung sind daher Teil des Ergebnisses. Vergleichen Sie im eigenen Agenten, nicht nur die höchste Tabellenzelle.

Vision und Integrationsgrenzen

V4.1 Flash nimmt JPEG, PNG, GIF und WebP über base64, öffentliche URL oder Files API an. Bildinput funktioniert in Chat Completions, Responses API und Anthropic API. Nach automatischer Größenanpassung kostet ein Bild höchstens 1,024 Eingabe-Token.

Das ist Bildverständnis, keine Bildgenerierung. Kleine Schrift, dichte Tabellen und wichtige Vertrags- oder Finanzfelder benötigen deterministische Prüfung oder menschliche Kontrolle. Bei Tools im Thinking-Modus muss der vollständige reasoning_content in spätere Anfragen zurückgegeben werden, sonst dokumentiert DeepSeek HTTP 400. FIM-Vervollständigung ist nur ohne Thinking verfügbar.

Verfügbarkeit bei OmniAKey

Beim Faktencheck am 2026-09-10 listete der öffentliche OmniAKey-Modellkatalog noch nicht die kanonische Route deepseek-flash. Deshalb behauptet dieser Artikel weder aktuelle OmniAKey-Verfügbarkeit noch einen OmniAKey-Preis für V4.1 Flash.

Erst wenn die exakte ID im Katalog erscheint, sollte ein getrennt begrenzter Schlüssel über API Keys angelegt werden. Prüfen Sie nach dem Smoke-Test Modell-ID, Eingabe, Cache, Ausgabe und Kosten. Der Leitfaden zur transparenten Abrechnung (Englisch) und der API-Schnellstart (Englisch) ergänzen die Prüfung.

Migrationscheck für V4 Pro

  1. Definieren Sie 10 bis 30 repräsentative Aufgaben mit klaren Abnahmekriterien.
  2. Speichern Sie für deepseek-v4-pro Tokens, Latenz, Retries und das Abnahmeergebnis.
  3. Wiederholen Sie dieselbe Aufgabe mit deepseek-flash, denselben Tools und Berechtigungen.
  4. Testen Sie high und max getrennt und ändern Sie pro Durchlauf nur eine Variable.
  5. Fügen Sie eine lange Tool-Schleife und bei Bedarf eine echte Bildaufgabe hinzu.
  6. Vergleichen Sie Kosten pro akzeptierter Aufgabe statt nur den Preis der ersten Antwort.
  7. Aktualisieren Sie Allowlist, Monitoring und Audit-Labels vor dem 14. September.

Häufige Fragen

Welche Modell-ID ist neu?

Für die direkte DeepSeek-API ist es deepseek-flash. Die beiden V4-Flash-IDs sind nur Kompatibilitätsnamen.

Ist V4.1 Flash immer besser als V4 Pro?

Nein. Es liegt in mehreren offiziellen Agent-Werten vorn, V4 Pro liegt aber bei GPQA Diamond und text-only HLE vorn. Die eigene Aufgabe und der Agent entscheiden.

Ist V4.1 Flash Open Source?

Repository und Gewichte stehen unter MIT. Der Betrieb eines 552B MoE bleibt dennoch ein Infrastrukturprojekt mit Spezialhardware, passendem Prompt-Encoding und Betriebserprobung.

Primärquellen

Fakten und Rechnungen wurden am 10. September 2026 geprüft. Es gab keinen unabhängigen kostenpflichtigen Modelllauf, keinen Geschwindigkeitstest und keinen Produktionstest. Prüfen Sie vor dem Einsatz Modell-ID, Preise, Umstellungszeitpunkt und Gateway-Verfügbarkeit erneut.