Das Jev-Modell ist jetzt integriert und live · Herzlich willkommen
Blog
Kostenkontrolle

Gemini 3.8 Flash API-Preise und Agentenkosten

Google Standard kostet derzeit $0.75 je Million Eingabe- und $3.75 je Million Ausgabetoken; OmniaKey listet $0.45 und $2.25. Entscheidend sind jedoch Wiederholungen und akzeptierte Ergebnisse.

11 Min. LesezeitOmniaKey
Gemini 3.8 FlashAPI-PreiseAgentenkostenThinking-TokenKostenkontrolle

Die Gemini 3.8 Flash API-Preise betragen bei Googles kostenpflichtiger Standard API bis zum 31. Dezember 2026 $0.75 pro Million Eingabetoken und $3.75 pro Million Ausgabetoken. Ab dem 1. Januar 2027 nennt Google $1.50 und $7.50. Die OmniaKey-Modellseite führt derzeit ein separates Gateway-Angebot von $0.45 für Eingabe, $2.25 für Ausgabe und $0.045 für Cache-Eingabe.

Direktpreise und Termine stammen aus der aktuellen Google-Preistabelle für die Gemini API.

Der Tokenpreis allein reicht für ein Agentenbudget nicht aus. Relevant ist der Gesamtaufwand aller erfolgreichen und fehlgeschlagenen Versuche geteilt durch die Aufgaben, die die Abnahme bestehen. Zwei günstige Fehlschläge können teurer sein als ein kostspieligerer Versuch, der sofort gelingt.

Geprüft am 20. September 2026. Preise, Termine, Tokenlimits, Thinking-Stufen, Cache und Batch-Verhalten wurden anhand der aktuellen Google-Dokumentation verifiziert. Die OmniaKey-Werte stammen aus dem Live-Katalog und bilden einen separaten Gateway-Preis. Diese Analyse basiert auf Quellen; wir haben keinen eigenen Benchmark und keinen kostenpflichtigen Produktionstest durchgeführt und behaupten keine Erfolgsquote für das Modell.

Gemini 3.8 Flash: Preise im Überblick

Alle Werte sind US-Dollar pro Million Token. „Cache-Eingabe“ meint den günstigeren Lesevorgang, nicht Googles separat berechnete Cache-Speicherung.

AbrechnungswegEingabeCache-EingabeAusgabe inklusive ThinkingGeltungsbereich
Google Standard bis 31.12.2026$0.75$0.075$3.75Direkte kostenpflichtige Gemini API
Google Batch oder Flex bis 31.12.2026$0.375$0.0375$1.875Direkte, verzögerbare oder flexible Arbeit
Google Priority bis 31.12.2026$1.35$0.135$6.75Direkte priorisierte Verarbeitung
Google Standard ab 01.01.2027$1.50$0.15$7.50Angekündigter direkter Standard-Tarif
Aktueller OmniaKey-Katalog$0.45$0.045$2.25Aktuelles Standard-Angebot des Gateways

Das aktuelle OmniaKey-Angebot liegt 40% unter Googles heutigem Standard-Tokenpreis. Das ist keine Zusage, nach dem 1. Januar dauerhaft 60% des Google-Preises zu betragen. Beide Kataloge werden unabhängig verwaltet. Prüfen Sie vor einer Budgetfreigabe erneut die Live-Preistabelle.

Google Batch und Flex sind derzeit günstiger als OmniaKey Standard, bilden aber nicht dieselbe Produktoberfläche ab. Batch ist asynchron, hat eine angestrebte Bearbeitungszeit von 24 Stunden und wird von Google für generateContent dokumentiert. Gehen Sie bei einem Gateway nicht von Batch, Flex oder Priority aus, wenn der jeweilige Weg dies nicht ausdrücklich anbietet.

Cache-Speicherung, Grounding, externe Tools, Browser, Datenbanken, Hosting, Steuern und menschliche Prüfung können weitere Kosten verursachen.

Kosten pro akzeptierter Agentenaufgabe berechnen

Rechnen Sie mit dem tatsächlich genutzten Weg:

text
Modellkosten je Versuch
  = Eingabe in Millionen x Eingabepreis
  + Cache-Eingabe in Millionen x Cache-Preis
  + Ausgabe in Millionen x Ausgabepreis

Gesamtkosten je Versuch
  = Modell + Tools + Grounding + Infrastruktur + Prüfung

beobachtete Kosten je akzeptierter Aufgabe
  = Ausgaben aller erfolgreichen und fehlgeschlagenen Versuche
  / Aufgaben, die die Abnahme bestanden

Wenn jeder Versuch ungefähr gleich viel kostet und die Bestehenswahrscheinlichkeit unabhängig ist:

text
erwartete Kosten je akzeptierter Aufgabe = Versuchskosten / Bestehensquote

Die letzte Formel ist eine Näherung. Ein Fehlschlag kann früh enden, länger in einer Schleife bleiben, andere Tools auslösen oder manuelle Korrektur verlangen. In der Produktion gehört der gesamte beobachtete Aufwand in den Zähler.

Definieren Sie „akzeptiert“ vor dem Test: ein Patch besteht Unit Tests, JSON entspricht seinem Schema, eine Extraktion stimmt mit geprüften Labels überein oder eine Antwort erfüllt eine menschliche Rubrik. HTTP 200 ist keine Qualitätsabnahme.

Beispiel: 20K Eingabe, 5K Ausgabe, 70% Bestehensquote

Ein vollständiger Versuch nutze 20,000 nicht gecachte Eingabe- und 5,000 Ausgabetoken. Die Ausgabe enthält abrechenbare Thinking-Token. Tools, Speicherung, Steuern und Prüfung bleiben außen vor, damit die Rechnung reproduzierbar ist.

AbrechnungswegKosten je VersuchErwartete Kosten je akzeptierter Aufgabe bei 70%
Google Standard bis Ende 20260.02 x $0.75 + 0.005 x $3.75 = $0.03375$0.0482
Google Standard ab 20270.02 x $1.50 + 0.005 x $7.50 = $0.06750$0.0964
Google Batch/Flex bis Ende 20260.02 x $0.375 + 0.005 x $1.875 = $0.016875$0.0241
Aktueller OmniaKey-Katalog0.02 x $0.45 + 0.005 x $2.25 = $0.02025$0.0289

Bei gleichem Tokenverbrauch verdoppelt sich der direkte Standard-Preis am 1. Januar 2027. Die OmniaKey-Zeile verwendet ausschließlich das aktuelle Angebot und prognostiziert keinen künftigen Gateway-Preis. Batch/Flex zeigt, warum der Verbrauchsmodus in den Vergleich gehört: Ein verzögerter Direktauftrag kann weniger kosten als eine interaktive Gateway-Anfrage.

Beim heutigen Google Standard kostet derselbe Versuch von $0.03375 je akzeptierter Aufgabe $0.0375 bei 90%, $0.0482 bei 70% und $0.0675 bei 50%. Eine bessere Bestehensquote kann wichtiger sein als ein leicht gekürzter Prompt.

Thinking-Token können die Ausgabekosten dominieren

Google unterstützt für gemini-3.8-flash low, medium und high; Standard ist medium. minimal wird nicht unterstützt und führt zu einem Fehler. Der Ausgabepreis umfasst sichtbare Antwort- und Thinking-Token.

Die aktuelle Modelldokumentation nennt 1,048,576 Eingabe- und 65,536 Ausgabetoken als Obergrenzen. Das sind Kapazitätsgrenzen, keine Freikontingente; abgerechnete Token bleiben Teil der Aufgabenkosten.

Daraus folgen drei Punkte:

  1. Eine kurze sichtbare Antwort kann wegen langer interner Überlegung eine hohe Ausgabe erzeugen.
  2. Ein zu kleines max_output_tokens kann während des Denkens abbrechen, ein unvollständiges oder leeres Ergebnis liefern und bereits erzeugte Thinking-Token trotzdem berechnen.
  3. high lohnt sich nur, wenn die höhere Bestehensquote zusätzliche Ausgabe und Latenz überwiegt.

Testen Sie low, medium und high mit denselben Aufgaben. Halten Sie Prompt, Tools, Rechte, Wiederholungsregeln und Abnahmekommandos fest. Wählen Sie die günstigste Stufe, die die notwendige Quote erreicht, nicht die erste, die Text liefert.

Cache, Wiederholungen und Tools gemeinsam budgetieren

Google dokumentiert implizites Caching für Gemini 3.8 Flash ab einem geeigneten Präfix von 4,096 Token. Wenn der Client den Präfix beibehält, setzen Sie stabile Anweisungen und Tool-Schemas vor variable Aufgabendaten und kontrollieren Sie die gemeldete Cache-Nutzung. Ähnlicher Text beweist keinen Cache-Treffer.

Kennzeichnen Sie Wiederholungen nach Ursache: Transportfehler, ungültige Tool-Argumente, gescheiterte Abnahme und menschlich angeforderte Änderung sind verschieden. Eine unbegrenzte Schleife vergrößert den Zähler unbemerkt.

Für Tool-Agenten sollten mindestens erfasst werden:

  • angeforderte und zurückgegebene Modell-ID;
  • Eingabe, Cache, Thinking und sichtbare Ausgabe, soweit das Protokoll sie meldet;
  • Tools, Toolkosten und Anzahl der Runden;
  • Latenz, Fehlerkategorie und Wiederholungen;
  • Abnahmeergebnis und der genaue Test;
  • endgültiger Rechnungsbetrag des Weges.

Gemini native und OpenAI-kompatible Protokolle können andere usage-Feldnamen verwenden. Gleichen Sie die reale Antwort mit dem OmniaKey-Nutzungsdashboard ab, statt das Schema eines anderen Anbieters anzunehmen.

Google direkt oder OmniaKey?

AnforderungZuerst testenGrund
Niedrigster veröffentlichter Preis für verzögerbare StapelGoogle BatchDirekter Batch kostet aktuell 50% von Standard und ist asynchron
Google-spezifisches Grounding oder VerbrauchssteuerungGoogle direktDiese Oberflächen sind im Direktvertrag dokumentiert
Ein Schlüssel und OpenAI-kompatibler WegOmniaKeygemini-3.8-flash steht mit separatem Gateway-Angebot im Katalog
Interaktiver Agent mit strikter LatenzBeide messenTokenpreis belegt weder Warteschlange noch Zuverlässigkeit oder Quote
Produktion nach 01.01.2027Beide neu prüfenGoogles Änderung ist geplant, der künftige Gateway-Preis unbekannt

Die Tabelle erklärt Startpunkte, keinen allgemeinen Sieger. Datenpolitik, Region, Limits, Support, Routing-Transparenz und Client-Protokoll können das Ergebnis ändern.

Gemini 3.8 Flash über OmniaKey aufrufen

Prüfen Sie gemini-3.8-flash im Live-Modellkatalog, erstellen Sie unter API-Schlüssel einen begrenzten Schlüssel und rufen Sie den OpenAI-kompatiblen Endpoint auf:

bash
curl https://api.omniakey.com/v1/chat/completions \
  -H "Authorization: Bearer $OMNIAKEY_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-3.8-flash",
    "messages": [
      {"role": "user", "content": "Return the riskiest assumption in this rollout plan."}
    ],
    "stream": true
  }'

Der englische API-Schnellstart erklärt Authentifizierung und Base URL. Legen Sie echte Schlüssel in Umgebungsvariablen ab, niemals in Quellcode, Prompts, Benchmark-Logs oder Screenshots.

Häufige Fragen

Was kostet die Gemini 3.8 Flash API?

Google Standard kostet bis Ende 2026 $0.75 je Million Eingabe- und $3.75 je Million Ausgabetoken. Ab 1. Januar 2027 gelten laut Tabelle $1.50 und $7.50. OmniaKey listet derzeit separat $0.45 und $2.25.

Werden Thinking-Token als Ausgabe berechnet?

Ja. Google schließt Thinking-Token in den Ausgabepreis ein. Verwenden Sie usage-Daten statt der sichtbaren Antwortlänge.

Ist OmniaKey immer günstiger als Google direkt?

Nein. OmniaKey Standard liegt aktuell unter Google Standard, Google Batch und Flex sind für geeignete Arbeit jedoch niedriger. Verfügbarkeit, Latenz, Protokoll und künftige Preise sind eigene Kriterien.

Warum durch die Bestehensquote teilen?

Fehlschläge kosten Geld, liefern aber keine akzeptierte Aufgabe. Bei stabilen Versuchskosten schätzt die Division durch die Wahrscheinlichkeit den Aufwand je Erfolg. Mit Produktionsdaten teilen Sie den Gesamtaufwand durch akzeptierte Aufgaben.

Welche Thinking-Stufe sollte ein Agent verwenden?

Beginnen Sie bei begrenzten, prüfbaren Aufgaben mit low und testen Sie medium und high, wenn Fehlschläge teuer sind. Gemini 3.8 Flash unterstützt minimal nicht. Richtig ist die günstigste Stufe, die dieselbe Abnahme zuverlässig besteht.

Primärquellen

Quellen und Berechnungen wurden am 20. September 2026 geprüft. Preise, Grenzen und Verfügbarkeit können sich ändern. Prüfen Sie vor Produktionsausgaben die Primärquellen und den OmniaKey-Live-Katalog erneut.