DeepSeek V4.1 Flash
Das neue Flash ist günstiger und liegt in mehreren Agent-Tests vor V4 Pro. Die offizielle Tabelle belegt aber keinen Sieg bei jeder Aufgabe.
Dieser DeepSeek V4.1 Flash Test trennt Modellarchitektur, die von DeepSeek veröffentlichten Benchmarks und die API-Verträge, die bei einer Integration tatsächlich zählen.
Das Ergebnis vorweg: Für lange Agent-Schleifen mit Werkzeugen, Bildkontext und hohem Durchsatz ist V4.1 Flash ein sinnvoller erster Kandidat. Die DeepSeek-Direkt-API berechnet im Off-Peak $0.15 für eine Million nicht gecachter Eingabe-Token und $0.60 für Ausgabe. Daraus folgt nicht, dass es V4 Pro in jeder Aufgabe ersetzt. Für diesen Artikel wurde kein unabhängiger kostenpflichtiger Qualitäts- oder Geschwindigkeitstest ausgeführt.
Faktencheck: 10. September 2026. Diese Recherche stützt sich auf DeepSeeks Release Note, Preis- und API-Dokumentation sowie die öffentliche Modellkarte. Alle Benchmark-Werte sind vendor-reported, also keine unabhängige Reproduktion durch OmniaKey.
Wann V4.1 Flash zuerst testen?
Der neue Flash passt besonders zu langen Coding-Agent-Aufgaben, Screenshot-gestütztem Debugging, Dokument- oder OCR-Extraktion mit nachgelagerter Prüfung sowie wiederholbaren Batch-Aufgaben mit hohem Token-Volumen.
Zuerst regressionsprüfen sollten Teams, deren Abläufe von V4-Pro-Verhalten, stabilen Tool-Calls oder auditierbarer Modellidentität abhängen. DeepSeek kündigt an, dass deepseek-v4-pro ab 2026-09-14 04:00 UTC auf V4.1 Flash geroutet und zu Flash-Preisen abgerechnet wird. Ein unveränderter Modellname bedeutet dann nicht mehr dieselbe Ausführung.
Bestätigte Startdaten
| Punkt | Bestätigte Information |
|---|---|
| Release | 2026-09-10 |
| Kanonische DeepSeek-Modell-ID | deepseek-flash |
| Alte Kompatibilitäts-IDs | deepseek-v4-flash, deepseek-v4-flash-vision-exp |
| Pro-Umstellung | deepseek-v4-pro wird ab 2026-09-14 04:00 UTC auf V4.1 Flash geroutet |
| Architektur | 552B-Parameter-MoE, multimodal, Causal Encoder-Decoder |
| Aktive Parameter je Token | 8B beim Prefill, 16B beim Decode |
| Kapazität | 1M Kontext, maximal 384K Ausgabe |
| Schnittstellen | Chat Completions, Responses API, Anthropic API |
| Lizenz | Gewichte und Repository unter MIT |
V4 Flash und V4 Flash Vision Exp sind eingestellt. deepseek-v4-flash und deepseek-v4-flash-vision-exp bleiben nur vorübergehende Kompatibilitätsrouten; neue Integrationen sollten deepseek-flash verwenden.
DeepSeek beschreibt einen globalen KV Cache von 890 bytes pro Token, etwa 1/4 von V4 Flash. Der persistent zu speichernde Anteil soll etwa 1/8 betragen. Das ist eine Aussage über Serving-Speicher und keine Zusage, dass eine Anfrage nur ein Viertel der abrechenbaren Token erzeugt.
Direkte API-Preise
Die englische DeepSeek-Preisseite nennt diese Direktpreise je eine Million Token:
| Abrechnung | Off-Peak | Peak |
|---|---|---|
| Cache-Hit-Eingabe | $0.003 | $0.006 |
| Nicht gecachte Eingabe | $0.15 | $0.30 |
| Ausgabe | $0.60 | $1.20 |
Peak-Zeiten sind Montag bis Freitag von 01:00-04:00 und 06:00-10:00 UTC. Alle übrigen Zeiten einschließlich Wochenende sind Off-Peak. Das sind DeepSeek-Direktpreise, nicht die Preise eines Gateways.
Bei 100.000 nicht gecachten Eingabe-Token und 20.000 Ausgabe-Token ergibt sich:
V4.1 Flash Off-Peak = 0.1 x $0.15 + 0.02 x $0.60 = $0.027
V4.1 Flash Peak = 0.1 x $0.30 + 0.02 x $1.20 = $0.054
V4 Pro Off-Peak = 0.1 x $0.66 + 0.02 x $1.98 = $0.1056
V4 Pro Peak = 0.1 x $1.32 + 0.02 x $3.96 = $0.2112
Für genau diese Token-Mischung ist V4.1 Flash rund 74% günstiger als V4 Pro. Das ist Rechenarithmetik, kein Qualitätsurteil: zusätzliche Versuche und Nacharbeit können den Vorteil aufzehren. Die ältere Preisaufnahme steht im DeepSeek V4 Pro API-Preisleitfaden (Englisch).
Was sagen die offiziellen Benchmarks?
Die Modellkarte führt V4.1 Flash bei mehreren Agent-Aufgaben vor V4 Pro, aber nicht in allen gemeldeten Wissens- und Reasoning-Tests.
| Benchmark | V4 Flash | V4 Pro | V4.1 Flash |
|---|---|---|---|
| GPQA Diamond | 89.9 | 92.4 | 90.9 |
| HLE, nur Text | 37.8 | 42.7 | 39.1 |
| Terminal-Bench 2.1 | 82.7 | 87.9 | 90.6 |
| DeepSWE v1.1 | 54.4 | 62.7 | 74.2 |
| CyberGym | 76.7 | 83.3 | 88.1 |
| HLE mit Tools | 51.5 | 60.0 | 63.9 |
| AutomationBench | 37.7 | 43.2 | 54.8 |
Der belastbare Schluss lautet daher: V4.1 Flash verbessert die berichteten Coding-, Sicherheits-, Automatisierungs- und Tool-Use-Szenarien deutlich, ohne jede V4-Pro-Stärke zu übertreffen. Zusätzlich widersprechen sich zwei offizielle Quellen bei NL2Repo-Bench: Das Update nennt 65.4, die aktuelle Modellkarte 64.0. Dieser Wert ist hier bewusst nicht Teil des Urteils.
Der Agent-Stack verändert das Ergebnis
Mit demselben V4.1 Flash reicht DeepSWE v1.1 von 65.5 in OpenCode bis 74.2 in mini-SWE-agent, ein Abstand von 8.7 Punkten. Terminal-Bench 2.1 reicht von 84.1 in Codex bis 90.6 in DeepSeek Harness Minimal, ein Abstand von 6.5 Punkten.
DeepSeek nennt N=8 je DeepSWE-Aufgabe und N=3 bei Terminal-Bench, Linux-Container, höchstens 500 Agent-Schritte und maximale Reasoning-Stärke. Prompt-Format, Tool-Schleife, Retry-Regeln und Kontextverwaltung sind daher Teil des Ergebnisses. Vergleichen Sie im eigenen Agenten, nicht nur die höchste Tabellenzelle.
Vision und Integrationsgrenzen
V4.1 Flash nimmt JPEG, PNG, GIF und WebP über base64, öffentliche URL oder Files API an. Bildinput funktioniert in Chat Completions, Responses API und Anthropic API. Nach automatischer Größenanpassung kostet ein Bild höchstens 1,024 Eingabe-Token.
Das ist Bildverständnis, keine Bildgenerierung. Kleine Schrift, dichte Tabellen und wichtige Vertrags- oder Finanzfelder benötigen deterministische Prüfung oder menschliche Kontrolle. Bei Tools im Thinking-Modus muss der vollständige reasoning_content in spätere Anfragen zurückgegeben werden, sonst dokumentiert DeepSeek HTTP 400. FIM-Vervollständigung ist nur ohne Thinking verfügbar.
Verfügbarkeit bei OmniAKey
Beim Faktencheck am 2026-09-10 listete der öffentliche OmniAKey-Modellkatalog noch nicht die kanonische Route deepseek-flash. Deshalb behauptet dieser Artikel weder aktuelle OmniAKey-Verfügbarkeit noch einen OmniAKey-Preis für V4.1 Flash.
Erst wenn die exakte ID im Katalog erscheint, sollte ein getrennt begrenzter Schlüssel über API Keys angelegt werden. Prüfen Sie nach dem Smoke-Test Modell-ID, Eingabe, Cache, Ausgabe und Kosten. Der Leitfaden zur transparenten Abrechnung (Englisch) und der API-Schnellstart (Englisch) ergänzen die Prüfung.
Migrationscheck für V4 Pro
- Definieren Sie 10 bis 30 repräsentative Aufgaben mit klaren Abnahmekriterien.
- Speichern Sie für
deepseek-v4-proTokens, Latenz, Retries und das Abnahmeergebnis. - Wiederholen Sie dieselbe Aufgabe mit
deepseek-flash, denselben Tools und Berechtigungen. - Testen Sie
highundmaxgetrennt und ändern Sie pro Durchlauf nur eine Variable. - Fügen Sie eine lange Tool-Schleife und bei Bedarf eine echte Bildaufgabe hinzu.
- Vergleichen Sie Kosten pro akzeptierter Aufgabe statt nur den Preis der ersten Antwort.
- Aktualisieren Sie Allowlist, Monitoring und Audit-Labels vor dem 14. September.
Häufige Fragen
Welche Modell-ID ist neu?
Für die direkte DeepSeek-API ist es deepseek-flash. Die beiden V4-Flash-IDs sind nur Kompatibilitätsnamen.
Ist V4.1 Flash immer besser als V4 Pro?
Nein. Es liegt in mehreren offiziellen Agent-Werten vorn, V4 Pro liegt aber bei GPQA Diamond und text-only HLE vorn. Die eigene Aufgabe und der Agent entscheiden.
Ist V4.1 Flash Open Source?
Repository und Gewichte stehen unter MIT. Der Betrieb eines 552B MoE bleibt dennoch ein Infrastrukturprojekt mit Spezialhardware, passendem Prompt-Encoding und Betriebserprobung.
Primärquellen
- DeepSeek V4.1 Flash Release Note (Englisch)
- DeepSeek Modelle und Preise (Englisch)
- DeepSeek V4.1 Flash Modellkarte (Englisch)
- DeepSeek V4.1 Technical Report (Englisch)
- Guide zum Bildverständnis (Englisch)
- Guide zum Thinking-Modus (Englisch)
- DeepSeek-Update-Log (Englisch)
Fakten und Rechnungen wurden am 10. September 2026 geprüft. Es gab keinen unabhängigen kostenpflichtigen Modelllauf, keinen Geschwindigkeitstest und keinen Produktionstest. Prüfen Sie vor dem Einsatz Modell-ID, Preise, Umstellungszeitpunkt und Gateway-Verfügbarkeit erneut.