Le modèle Jev est désormais intégré et disponible · Bienvenue
Blogue
Contrôle des coûts

Tarifs de l'API Gemini 3.8 Flash et coût agent

Google Standard facture aujourd'hui $0.75 le million de tokens d'entrée et $3.75 en sortie ; OmniaKey affiche $0.45 et $2.25, mais les relances et le taux de validation déterminent le coût réel.

11 minutes de lectureOmniaKey
Gemini 3.8 Flashtarifs APIcoût agentjetons de réflexionmaîtrise des coûts

Les tarifs de l'API Gemini 3.8 Flash sur l'API Standard payante de Google sont de $0.75 par million de tokens d'entrée et $3.75 par million de tokens de sortie jusqu'au 31 décembre 2026. Google annonce $1.50 et $7.50 à compter du 1er janvier 2027. La fiche OmniaKey du modèle affiche actuellement un tarif gateway distinct : $0.45 en entrée, $2.25 en sortie et $0.045 pour l'entrée en cache.

Les montants et dates du contrat direct viennent de la grille tarifaire Gemini API de Google.

Un tarif au token ne suffit pas pour budgéter un agent. La mesure utile est la dépense de toutes les tentatives, réussies ou non, divisée par les tâches qui passent le contrôle d'acceptation. Deux appels bon marché qui échouent peuvent coûter plus cher qu'un appel plus onéreux qui réussit immédiatement.

Vérifié le 20 septembre 2026. Les prix, dates, limites de tokens, niveaux de réflexion, cache et fonctionnement de Batch ont été contrôlés dans la documentation Google en vigueur. Les chiffres OmniaKey viennent du catalogue en direct et constituent un tarif gateway indépendant. Cette analyse repose sur des sources : nous n'avons réalisé ni benchmark direct ni test de production facturé, et nous n'attribuons aucun taux de réussite au modèle.

Tableau des tarifs Gemini 3.8 Flash

Tous les montants sont en dollars US par million de tokens. « Entrée en cache » désigne la lecture à tarif réduit, pas le stockage de cache facturé séparément par Google.

Circuit de facturationEntréeEntrée en cacheSortie, réflexion inclusePérimètre
Google Standard jusqu'au 31-12-2026$0.75$0.075$3.75API Gemini directe et payante
Google Batch ou Flex jusqu'au 31-12-2026$0.375$0.0375$1.875Tâches directes pouvant attendre ou utiliser une capacité flexible
Google Priority jusqu'au 31-12-2026$1.35$0.135$6.75Traitement direct prioritaire
Google Standard dès le 01-01-2027$1.50$0.15$7.50Tarif Standard direct annoncé
Catalogue OmniaKey actuel$0.45$0.045$2.25Tarif Standard actuel du gateway

Le tarif OmniaKey actuel est inférieur de 40% au tarif Standard actuel de Google. Cela ne garantit pas qu'il restera égal à 60% du prix Google après le 1er janvier. Chaque catalogue évolue indépendamment. Consultez à nouveau la grille tarifaire en direct avant de valider un budget de production.

Batch et Flex de Google sont aujourd'hui moins chers qu'OmniaKey Standard, mais il ne s'agit pas du même service. Batch est asynchrone, vise un délai de 24 heures et Google le documente pour generateContent. Ne présumez pas qu'un gateway propose Batch, Flex ou Priority sans documentation explicite.

Le stockage de cache, le grounding, les outils externes, le navigateur, la base de données, l'hébergement, les taxes et la revue humaine peuvent ajouter des coûts absents du tableau.

Calculer le coût par tâche agent validée

Partez du circuit réellement utilisé :

text
coût modèle par tentative
  = millions d'entrée x tarif d'entrée
  + millions d'entrée en cache x tarif cache
  + millions de sortie x tarif de sortie

coût complet par tentative
  = modèle + outils + grounding + infrastructure + revue

coût observé par tâche validée
  = dépense de toutes les tentatives réussies et échouées
  / nombre de tâches ayant passé le contrôle

Pour prévoir un ensemble de tentatives de coût similaire et de probabilité indépendante :

text
coût attendu par tâche validée = coût par tentative / taux de validation

Cette dernière formule reste une estimation. Un échec peut s'arrêter tôt, boucler plus longtemps, appeler d'autres outils ou exiger une correction humaine. En production, placez toute la dépense observée au numérateur.

Définissez « validée » avant l'essai : patch qui passe les tests, JSON conforme au schema, extraction cohérente avec des labels revus ou réponse acceptée par une grille humaine. Un statut HTTP 200 n'est pas un contrôle qualité.

Exemple : 20K en entrée, 5K en sortie, 70% de validation

Supposons qu'une tentative complète utilise 20,000 tokens d'entrée non mis en cache et 5,000 tokens de sortie. La sortie inclut les jetons de réflexion facturés. Nous excluons outils, stockage, taxes et revue afin de garder un calcul reproductible.

CircuitCoût par tentativeCoût attendu par tâche validée à 70%
Google Standard en 20260.02 x $0.75 + 0.005 x $3.75 = $0.03375$0.0482
Google Standard dès 20270.02 x $1.50 + 0.005 x $7.50 = $0.06750$0.0964
Google Batch/Flex en 20260.02 x $0.375 + 0.005 x $1.875 = $0.016875$0.0241
Catalogue OmniaKey actuel0.02 x $0.45 + 0.005 x $2.25 = $0.02025$0.0289

À consommation identique, le tarif Standard direct double le 1er janvier 2027. La ligne OmniaKey n'emploie que le tarif actuel et ne prédit pas le futur prix du gateway. Batch/Flex montre pourquoi le mode de consommation compte : une tâche directe différée peut avoir une facture token inférieure à une requête interactive via gateway.

Au tarif Standard Google actuel, la tentative à $0.03375 revient à $0.0375 par tâche validée à 90%, $0.0482 à 70% et $0.0675 à 50%. Améliorer le taux de validation peut compter davantage que réduire un petit prompt.

Les jetons de réflexion peuvent dominer la sortie

Google prend en charge low, medium et high pour gemini-3.8-flash, avec medium par défaut. minimal n'est pas accepté et renvoie une erreur. Le prix de sortie couvre la réponse visible et les jetons de réflexion.

La fiche actuelle indique une limite de 1,048,576 tokens en entrée et 65,536 en sortie. Ce sont des plafonds de capacité, pas des quotas gratuits ; chaque token facturé reste dans le coût de la tâche.

Trois conséquences :

  1. Une réponse visible courte peut coûter cher après un long raisonnement.
  2. Un max_output_tokens trop faible peut couper le raisonnement, produire un résultat incomplet ou vide et tout de même facturer les jetons de réflexion déjà générés.
  3. high n'est rentable que si le gain de validation compense la sortie et la latence supplémentaires.

Testez low, medium et high sur les mêmes tâches. Figez prompt, outils, droits, politique de relance et commandes de validation. Retenez le niveau le moins cher qui atteint le taux requis, pas seulement celui qui renvoie du texte.

Réunir cache, relances et outils dans le budget

Google documente un cache implicite pour Gemini 3.8 Flash à partir d'un préfixe éligible de 4,096 tokens. Si le client conserve ce préfixe, placez instructions stables et schemas d'outils avant les données variables, puis vérifiez l'usage de cache remonté. Un texte similaire ne prouve pas un cache hit.

Classez les relances : erreur de transport, arguments d'outil invalides, contrôle échoué et révision demandée par une personne. Une boucle sans limite augmente silencieusement le numérateur.

Pour un agent à outils, consignez au minimum :

  • ID demandé et ID retourné ;
  • entrée, cache, jetons de réflexion et sortie visible quand le protocole les expose ;
  • outils, coût des outils et nombre de tours ;
  • latence, catégorie d'erreur et relances ;
  • résultat et contrôle d'acceptation exact ;
  • montant final facturé pour le circuit.

Les protocoles Gemini natif et compatible OpenAI peuvent nommer différemment les champs usage. Rapprochez la réponse réelle du tableau de bord d'utilisation OmniaKey au lieu de supposer le schema d'un autre fournisseur.

Google direct ou OmniaKey : par où commencer ?

BesoinPoint de départPourquoi
Tarif publié le plus bas pour un lot différableGoogle BatchBatch direct coûte actuellement 50% de Standard et reste asynchrone
Grounding ou contrôle propre à GoogleGoogle directLe contrat direct documente ces fonctions
Une clé et une route compatible OpenAIOmniaKeyLe catalogue propose gemini-3.8-flash avec un tarif gateway séparé
Agent interactif à latence stricteMesurer les deuxLe prix token ne prouve ni file d'attente, ni fiabilité, ni validation
Production après le 01-01-2027Revérifier les deuxLe changement Google est prévu, le futur prix gateway est inconnu

Ce tableau ne désigne pas un vainqueur universel. Politique de données, région, limites, support, transparence du routage et protocole peuvent changer le choix.

Appeler Gemini 3.8 Flash avec OmniaKey

Vérifiez gemini-3.8-flash dans le catalogue de modèles en direct, créez un identifiant limité dans Clés API, puis appelez l'endpoint compatible OpenAI :

bash
curl https://api.omniakey.com/v1/chat/completions \
  -H "Authorization: Bearer $OMNIAKEY_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-3.8-flash",
    "messages": [
      {"role": "user", "content": "Return the riskiest assumption in this rollout plan."}
    ],
    "stream": true
  }'

Le guide de démarrage API en anglais couvre l'authentification et la base URL. Placez la vraie clé dans une variable d'environnement, jamais dans le code, les prompts, les logs ou les captures.

Questions fréquentes

Combien coûte l'API Gemini 3.8 Flash ?

Google Standard facture $0.75 par million de tokens d'entrée et $3.75 en sortie jusqu'à fin 2026, puis affiche $1.50 et $7.50 dès le 1er janvier 2027. OmniaKey affiche actuellement un tarif indépendant de $0.45 et $2.25.

Les jetons de réflexion sont-ils facturés en sortie ?

Oui. Google les inclut dans la sortie. Basez le budget sur les données usage du fournisseur, pas sur la longueur visible.

OmniaKey est-il toujours moins cher que Google direct ?

Non. OmniaKey Standard est actuellement inférieur à Google Standard, mais Batch et Flex de Google sont plus bas pour les tâches éligibles. Disponibilité, latence, protocole et futurs prix restent distincts.

Pourquoi diviser par le taux de validation ?

Un échec dépense de l'argent sans produire de tâche acceptée. Si le coût par tentative est stable, la division par la probabilité estime la dépense par succès. Avec des données réelles, divisez la dépense totale par les tâches validées.

Quel niveau de réflexion choisir pour un agent ?

Commencez par low pour un travail borné et vérifiable, puis testez medium et high si l'échec coûte cher. Gemini 3.8 Flash ne prend pas minimal en charge. Le bon niveau est le moins cher qui passe fiablement le même contrôle.

Sources primaires

Sources et calculs vérifiés le 20 septembre 2026. Prix, limites et disponibilité peuvent évoluer. Revérifiez les sources primaires et le catalogue OmniaKey avant toute dépense de production.