Gemini 3.8 Flash API-Preise und Agentenkosten
Google Standard kostet derzeit $0.75 je Million Eingabe- und $3.75 je Million Ausgabetoken; OmniaKey listet $0.45 und $2.25. Entscheidend sind jedoch Wiederholungen und akzeptierte Ergebnisse.
Die Gemini 3.8 Flash API-Preise betragen bei Googles kostenpflichtiger Standard API bis zum 31. Dezember 2026 $0.75 pro Million Eingabetoken und $3.75 pro Million Ausgabetoken. Ab dem 1. Januar 2027 nennt Google $1.50 und $7.50. Die OmniaKey-Modellseite führt derzeit ein separates Gateway-Angebot von $0.45 für Eingabe, $2.25 für Ausgabe und $0.045 für Cache-Eingabe.
Direktpreise und Termine stammen aus der aktuellen Google-Preistabelle für die Gemini API.
Der Tokenpreis allein reicht für ein Agentenbudget nicht aus. Relevant ist der Gesamtaufwand aller erfolgreichen und fehlgeschlagenen Versuche geteilt durch die Aufgaben, die die Abnahme bestehen. Zwei günstige Fehlschläge können teurer sein als ein kostspieligerer Versuch, der sofort gelingt.
Geprüft am 20. September 2026. Preise, Termine, Tokenlimits, Thinking-Stufen, Cache und Batch-Verhalten wurden anhand der aktuellen Google-Dokumentation verifiziert. Die OmniaKey-Werte stammen aus dem Live-Katalog und bilden einen separaten Gateway-Preis. Diese Analyse basiert auf Quellen; wir haben keinen eigenen Benchmark und keinen kostenpflichtigen Produktionstest durchgeführt und behaupten keine Erfolgsquote für das Modell.
Gemini 3.8 Flash: Preise im Überblick
Alle Werte sind US-Dollar pro Million Token. „Cache-Eingabe“ meint den günstigeren Lesevorgang, nicht Googles separat berechnete Cache-Speicherung.
| Abrechnungsweg | Eingabe | Cache-Eingabe | Ausgabe inklusive Thinking | Geltungsbereich |
|---|---|---|---|---|
| Google Standard bis 31.12.2026 | $0.75 | $0.075 | $3.75 | Direkte kostenpflichtige Gemini API |
| Google Batch oder Flex bis 31.12.2026 | $0.375 | $0.0375 | $1.875 | Direkte, verzögerbare oder flexible Arbeit |
| Google Priority bis 31.12.2026 | $1.35 | $0.135 | $6.75 | Direkte priorisierte Verarbeitung |
| Google Standard ab 01.01.2027 | $1.50 | $0.15 | $7.50 | Angekündigter direkter Standard-Tarif |
| Aktueller OmniaKey-Katalog | $0.45 | $0.045 | $2.25 | Aktuelles Standard-Angebot des Gateways |
Das aktuelle OmniaKey-Angebot liegt 40% unter Googles heutigem Standard-Tokenpreis. Das ist keine Zusage, nach dem 1. Januar dauerhaft 60% des Google-Preises zu betragen. Beide Kataloge werden unabhängig verwaltet. Prüfen Sie vor einer Budgetfreigabe erneut die Live-Preistabelle.
Google Batch und Flex sind derzeit günstiger als OmniaKey Standard, bilden aber nicht dieselbe Produktoberfläche ab. Batch ist asynchron, hat eine angestrebte Bearbeitungszeit von 24 Stunden und wird von Google für generateContent dokumentiert. Gehen Sie bei einem Gateway nicht von Batch, Flex oder Priority aus, wenn der jeweilige Weg dies nicht ausdrücklich anbietet.
Cache-Speicherung, Grounding, externe Tools, Browser, Datenbanken, Hosting, Steuern und menschliche Prüfung können weitere Kosten verursachen.
Kosten pro akzeptierter Agentenaufgabe berechnen
Rechnen Sie mit dem tatsächlich genutzten Weg:
Modellkosten je Versuch
= Eingabe in Millionen x Eingabepreis
+ Cache-Eingabe in Millionen x Cache-Preis
+ Ausgabe in Millionen x Ausgabepreis
Gesamtkosten je Versuch
= Modell + Tools + Grounding + Infrastruktur + Prüfung
beobachtete Kosten je akzeptierter Aufgabe
= Ausgaben aller erfolgreichen und fehlgeschlagenen Versuche
/ Aufgaben, die die Abnahme bestanden
Wenn jeder Versuch ungefähr gleich viel kostet und die Bestehenswahrscheinlichkeit unabhängig ist:
erwartete Kosten je akzeptierter Aufgabe = Versuchskosten / Bestehensquote
Die letzte Formel ist eine Näherung. Ein Fehlschlag kann früh enden, länger in einer Schleife bleiben, andere Tools auslösen oder manuelle Korrektur verlangen. In der Produktion gehört der gesamte beobachtete Aufwand in den Zähler.
Definieren Sie „akzeptiert“ vor dem Test: ein Patch besteht Unit Tests, JSON entspricht seinem Schema, eine Extraktion stimmt mit geprüften Labels überein oder eine Antwort erfüllt eine menschliche Rubrik. HTTP 200 ist keine Qualitätsabnahme.
Beispiel: 20K Eingabe, 5K Ausgabe, 70% Bestehensquote
Ein vollständiger Versuch nutze 20,000 nicht gecachte Eingabe- und 5,000 Ausgabetoken. Die Ausgabe enthält abrechenbare Thinking-Token. Tools, Speicherung, Steuern und Prüfung bleiben außen vor, damit die Rechnung reproduzierbar ist.
| Abrechnungsweg | Kosten je Versuch | Erwartete Kosten je akzeptierter Aufgabe bei 70% |
|---|---|---|
| Google Standard bis Ende 2026 | 0.02 x $0.75 + 0.005 x $3.75 = $0.03375 | $0.0482 |
| Google Standard ab 2027 | 0.02 x $1.50 + 0.005 x $7.50 = $0.06750 | $0.0964 |
| Google Batch/Flex bis Ende 2026 | 0.02 x $0.375 + 0.005 x $1.875 = $0.016875 | $0.0241 |
| Aktueller OmniaKey-Katalog | 0.02 x $0.45 + 0.005 x $2.25 = $0.02025 | $0.0289 |
Bei gleichem Tokenverbrauch verdoppelt sich der direkte Standard-Preis am 1. Januar 2027. Die OmniaKey-Zeile verwendet ausschließlich das aktuelle Angebot und prognostiziert keinen künftigen Gateway-Preis. Batch/Flex zeigt, warum der Verbrauchsmodus in den Vergleich gehört: Ein verzögerter Direktauftrag kann weniger kosten als eine interaktive Gateway-Anfrage.
Beim heutigen Google Standard kostet derselbe Versuch von $0.03375 je akzeptierter Aufgabe $0.0375 bei 90%, $0.0482 bei 70% und $0.0675 bei 50%. Eine bessere Bestehensquote kann wichtiger sein als ein leicht gekürzter Prompt.
Thinking-Token können die Ausgabekosten dominieren
Google unterstützt für gemini-3.8-flash low, medium und high; Standard ist medium. minimal wird nicht unterstützt und führt zu einem Fehler. Der Ausgabepreis umfasst sichtbare Antwort- und Thinking-Token.
Die aktuelle Modelldokumentation nennt 1,048,576 Eingabe- und 65,536 Ausgabetoken als Obergrenzen. Das sind Kapazitätsgrenzen, keine Freikontingente; abgerechnete Token bleiben Teil der Aufgabenkosten.
Daraus folgen drei Punkte:
- Eine kurze sichtbare Antwort kann wegen langer interner Überlegung eine hohe Ausgabe erzeugen.
- Ein zu kleines
max_output_tokenskann während des Denkens abbrechen, ein unvollständiges oder leeres Ergebnis liefern und bereits erzeugte Thinking-Token trotzdem berechnen. highlohnt sich nur, wenn die höhere Bestehensquote zusätzliche Ausgabe und Latenz überwiegt.
Testen Sie low, medium und high mit denselben Aufgaben. Halten Sie Prompt, Tools, Rechte, Wiederholungsregeln und Abnahmekommandos fest. Wählen Sie die günstigste Stufe, die die notwendige Quote erreicht, nicht die erste, die Text liefert.
Cache, Wiederholungen und Tools gemeinsam budgetieren
Google dokumentiert implizites Caching für Gemini 3.8 Flash ab einem geeigneten Präfix von 4,096 Token. Wenn der Client den Präfix beibehält, setzen Sie stabile Anweisungen und Tool-Schemas vor variable Aufgabendaten und kontrollieren Sie die gemeldete Cache-Nutzung. Ähnlicher Text beweist keinen Cache-Treffer.
Kennzeichnen Sie Wiederholungen nach Ursache: Transportfehler, ungültige Tool-Argumente, gescheiterte Abnahme und menschlich angeforderte Änderung sind verschieden. Eine unbegrenzte Schleife vergrößert den Zähler unbemerkt.
Für Tool-Agenten sollten mindestens erfasst werden:
- angeforderte und zurückgegebene Modell-ID;
- Eingabe, Cache, Thinking und sichtbare Ausgabe, soweit das Protokoll sie meldet;
- Tools, Toolkosten und Anzahl der Runden;
- Latenz, Fehlerkategorie und Wiederholungen;
- Abnahmeergebnis und der genaue Test;
- endgültiger Rechnungsbetrag des Weges.
Gemini native und OpenAI-kompatible Protokolle können andere usage-Feldnamen verwenden. Gleichen Sie die reale Antwort mit dem OmniaKey-Nutzungsdashboard ab, statt das Schema eines anderen Anbieters anzunehmen.
Google direkt oder OmniaKey?
| Anforderung | Zuerst testen | Grund |
|---|---|---|
| Niedrigster veröffentlichter Preis für verzögerbare Stapel | Google Batch | Direkter Batch kostet aktuell 50% von Standard und ist asynchron |
| Google-spezifisches Grounding oder Verbrauchssteuerung | Google direkt | Diese Oberflächen sind im Direktvertrag dokumentiert |
| Ein Schlüssel und OpenAI-kompatibler Weg | OmniaKey | gemini-3.8-flash steht mit separatem Gateway-Angebot im Katalog |
| Interaktiver Agent mit strikter Latenz | Beide messen | Tokenpreis belegt weder Warteschlange noch Zuverlässigkeit oder Quote |
| Produktion nach 01.01.2027 | Beide neu prüfen | Googles Änderung ist geplant, der künftige Gateway-Preis unbekannt |
Die Tabelle erklärt Startpunkte, keinen allgemeinen Sieger. Datenpolitik, Region, Limits, Support, Routing-Transparenz und Client-Protokoll können das Ergebnis ändern.
Gemini 3.8 Flash über OmniaKey aufrufen
Prüfen Sie gemini-3.8-flash im Live-Modellkatalog, erstellen Sie unter API-Schlüssel einen begrenzten Schlüssel und rufen Sie den OpenAI-kompatiblen Endpoint auf:
curl https://api.omniakey.com/v1/chat/completions \
-H "Authorization: Bearer $OMNIAKEY_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.8-flash",
"messages": [
{"role": "user", "content": "Return the riskiest assumption in this rollout plan."}
],
"stream": true
}'
Der englische API-Schnellstart erklärt Authentifizierung und Base URL. Legen Sie echte Schlüssel in Umgebungsvariablen ab, niemals in Quellcode, Prompts, Benchmark-Logs oder Screenshots.
Häufige Fragen
Was kostet die Gemini 3.8 Flash API?
Google Standard kostet bis Ende 2026 $0.75 je Million Eingabe- und $3.75 je Million Ausgabetoken. Ab 1. Januar 2027 gelten laut Tabelle $1.50 und $7.50. OmniaKey listet derzeit separat $0.45 und $2.25.
Werden Thinking-Token als Ausgabe berechnet?
Ja. Google schließt Thinking-Token in den Ausgabepreis ein. Verwenden Sie usage-Daten statt der sichtbaren Antwortlänge.
Ist OmniaKey immer günstiger als Google direkt?
Nein. OmniaKey Standard liegt aktuell unter Google Standard, Google Batch und Flex sind für geeignete Arbeit jedoch niedriger. Verfügbarkeit, Latenz, Protokoll und künftige Preise sind eigene Kriterien.
Warum durch die Bestehensquote teilen?
Fehlschläge kosten Geld, liefern aber keine akzeptierte Aufgabe. Bei stabilen Versuchskosten schätzt die Division durch die Wahrscheinlichkeit den Aufwand je Erfolg. Mit Produktionsdaten teilen Sie den Gesamtaufwand durch akzeptierte Aufgaben.
Welche Thinking-Stufe sollte ein Agent verwenden?
Beginnen Sie bei begrenzten, prüfbaren Aufgaben mit low und testen Sie medium und high, wenn Fehlschläge teuer sind. Gemini 3.8 Flash unterstützt minimal nicht. Richtig ist die günstigste Stufe, die dieselbe Abnahme zuverlässig besteht.
Primärquellen
- Google Gemini API Pricing (Englisch)
- Google Gemini 3.8 Flash Modelldokumentation (Englisch)
- Google Thinking-Dokumentation (Englisch)
- Google Context-Caching-Dokumentation (Englisch)
- Google Batch API Dokumentation (Englisch)
Quellen und Berechnungen wurden am 20. September 2026 geprüft. Preise, Grenzen und Verfügbarkeit können sich ändern. Prüfen Sie vor Produktionsausgaben die Primärquellen und den OmniaKey-Live-Katalog erneut.