Prezzi API Gemini 3.8 Flash e costo per task
Google Standard costa oggi $0.75 per milione di token in input e $3.75 in output; OmniaKey indica $0.45 e $2.25, ma retry, ragionamento e tasso di accettazione determinano il costo reale.
I prezzi API Gemini 3.8 Flash sul piano Standard a pagamento di Google sono $0.75 per milione di token in input e $3.75 per milione di token in output fino al 31 dicembre 2026. Google indica $1.50 e $7.50 dal 1° gennaio 2027. La pagina modello di OmniaKey mostra oggi un'offerta gateway separata: $0.45 in input, $2.25 in output e $0.045 per input in cache.
Importi e date del contratto diretto provengono dal listino corrente della Gemini API di Google.
Il prezzo per token non basta per stimare un agente. La metrica utile è la spesa di tutti i tentativi riusciti e falliti divisa per i task che superano il controllo di accettazione. Due chiamate economiche fallite possono costare più di una chiamata più cara riuscita al primo colpo.
Dati verificati il 20 settembre 2026. Prezzi, date, limiti, livelli di ragionamento, cache e comportamento Batch sono stati controllati nella documentazione Google corrente. I valori OmniaKey provengono dal catalogo live e rappresentano un prezzo gateway indipendente. Questa è un'analisi basata su fonti: non abbiamo eseguito un benchmark diretto né un test di produzione a pagamento e non attribuiamo un tasso di successo al modello.
Tabella dei prezzi di Gemini 3.8 Flash
Tutti i valori sono dollari USA per un milione di token. “Input in cache” indica la lettura scontata, non l'archiviazione della cache che Google addebita a parte.
| Percorso di fatturazione | Input | Input in cache | Output, ragionamento incluso | Ambito |
|---|---|---|---|---|
| Google Standard fino al 31-12-2026 | $0.75 | $0.075 | $3.75 | Gemini API diretta a pagamento |
| Google Batch o Flex fino al 31-12-2026 | $0.375 | $0.0375 | $1.875 | Lavoro diretto che tollera attesa o capacità flessibile |
| Google Priority fino al 31-12-2026 | $1.35 | $0.135 | $6.75 | Elaborazione diretta prioritaria |
| Google Standard dal 01-01-2027 | $1.50 | $0.15 | $7.50 | Tariffa Standard diretta programmata |
| Catalogo OmniaKey attuale | $0.45 | $0.045 | $2.25 | Offerta Standard corrente del gateway |
L'offerta OmniaKey attuale è inferiore del 40% al prezzo Standard corrente di Google. Non è una garanzia che rimanga al 60% del prezzo Google dopo il 1° gennaio. I due cataloghi sono gestiti separatamente. Ricontrolla il listino live prima di approvare un budget di produzione.
Google Batch e Flex sono oggi più bassi di OmniaKey Standard, ma non sono lo stesso servizio. Batch è asincrono, ha un obiettivo di completamento di 24 ore ed è documentato da Google per generateContent. Non presumere che Batch, Flex o Priority di Google siano presenti su un gateway senza documentazione esplicita.
Archiviazione della cache, grounding, strumenti esterni, browser, database, infrastruttura, imposte e revisione umana possono aggiungere costi che la tabella token non mostra.
Calcolare il costo per task agente accettato
Parti dal percorso realmente usato:
costo modello per tentativo
= milioni in input x tariffa input
+ milioni di input in cache x tariffa cache
+ milioni in output x tariffa output
costo totale per tentativo
= modello + strumenti + grounding + infrastruttura + revisione
costo osservato per task accettato
= spesa di tutti i tentativi riusciti e falliti
/ task che superano il controllo
Per una previsione in cui ogni tentativo costa circa lo stesso e la probabilità di riuscita è indipendente:
costo atteso per task accettato = costo per tentativo / tasso di riuscita
L'ultima formula è un'approssimazione. Un fallimento può chiudersi presto, entrare in un loop più lungo, chiamare altri strumenti o richiedere correzione umana. In produzione usa tutta la spesa osservata al numeratore.
Definisci “accettato” prima del test: una patch supera gli unit test, un JSON è valido rispetto allo schema, un'estrazione coincide con etichette revisionate o una risposta supera una rubrica umana. HTTP 200 non è un controllo di qualità.
Esempio: 20K input, 5K output, 70% di riuscita
Supponiamo che un tentativo completo usi 20,000 token in input non in cache e 5,000 token in output. L'output comprende i token di ragionamento fatturati. Escludiamo strumenti, archiviazione, imposte e revisione per mantenere il calcolo riproducibile.
| Percorso | Costo per tentativo | Costo atteso per task accettato al 70% |
|---|---|---|
| Google Standard nel 2026 | 0.02 x $0.75 + 0.005 x $3.75 = $0.03375 | $0.0482 |
| Google Standard dal 2027 | 0.02 x $1.50 + 0.005 x $7.50 = $0.06750 | $0.0964 |
| Google Batch/Flex nel 2026 | 0.02 x $0.375 + 0.005 x $1.875 = $0.016875 | $0.0241 |
| Catalogo OmniaKey attuale | 0.02 x $0.45 + 0.005 x $2.25 = $0.02025 | $0.0289 |
A parità di token, Standard diretto raddoppia il 1° gennaio 2027. La riga OmniaKey usa soltanto il prezzo attuale e non prevede il futuro prezzo gateway. Batch/Flex mostra perché il modo di consumo va confrontato: un job diretto differibile può fatturare meno di una richiesta gateway interattiva.
Con il Google Standard corrente, lo stesso tentativo da $0.03375 costa $0.0375 per task accettato al 90%, $0.0482 al 70% e $0.0675 al 50%. Migliorare il tasso di riuscita può contare più che accorciare un prompt piccolo.
I token di ragionamento possono dominare l'output
Google supporta low, medium e high per gemini-3.8-flash; il valore predefinito è medium. minimal non è supportato e restituisce un errore. Il prezzo di output comprende risposta visibile e token di ragionamento.
La scheda attuale indica un limite di 1,048,576 token in input e 65,536 in output. Sono limiti di capacità, non quote gratuite; i token fatturati restano nel costo del task.
Tre conseguenze pratiche:
- Una risposta visibile breve può costare molto dopo un ragionamento lungo.
- Un
max_output_tokenstroppo basso può troncare il ragionamento, restituire un risultato incompleto o vuoto e fatturare comunque i token di ragionamento già generati. highconviene solo quando l'aumento del tasso di riuscita copre output e latenza aggiuntivi.
Prova low, medium e high sullo stesso set. Mantieni fissi prompt, strumenti, permessi, regola di retry e comandi di accettazione. Scegli il livello meno costoso che raggiunge il tasso richiesto, non semplicemente quello che produce testo.
Cache, retry e strumenti nello stesso budget
Google documenta la cache implicita di Gemini 3.8 Flash con un prefisso minimo idoneo di 4,096 token. Se il client conserva il prefisso, metti istruzioni stabili e schema degli strumenti prima dei dati variabili, poi controlla l'uso cache dichiarato. Testo simile non dimostra un cache hit.
Classifica i retry: errore di trasporto, argomento non valido, controllo fallito e revisione chiesta da una persona sono categorie diverse. Un loop illimitato aumenta silenziosamente il numeratore.
Per un agente con strumenti registra almeno:
- ID del modello richiesto e restituito;
- input, cache, token di ragionamento e output visibile quando il protocollo li espone;
- strumenti, relativo costo e numero di turni;
- latenza, categoria di errore e retry;
- risultato e controllo esatto di accettazione;
- importo finale fatturato per il percorso.
Gemini native e il protocollo compatibile OpenAI possono usare nomi diversi per i campi usage. Riconcilia la risposta reale con la dashboard di utilizzo OmniaKey, senza assumere lo schema di un altro provider.
Google diretto o OmniaKey: da dove partire
| Esigenza | Parti da | Motivo |
|---|---|---|
| Prezzo pubblicato più basso per batch differibili | Google Batch | Batch diretto costa oggi il 50% di Standard ed è asincrono |
| Grounding o controlli specifici Google | Google diretto | Il contratto diretto documenta queste funzioni |
| Una chiave e percorso compatibile OpenAI | OmniaKey | Il catalogo offre gemini-3.8-flash con prezzo gateway separato |
| Agente interattivo con latenza stretta | Misura entrambi | Il prezzo token non prova coda, affidabilità o riuscita |
| Produzione dopo il 01-01-2027 | Ricontrolla entrambi | La modifica Google è pianificata; il futuro prezzo gateway è ignoto |
Non è una classifica universale. Politica dei dati, regione, limiti, supporto, trasparenza del routing e protocollo possono cambiare la scelta.
Chiamare Gemini 3.8 Flash tramite OmniaKey
Verifica gemini-3.8-flash nel catalogo live, crea una credenziale limitata in Chiavi API e usa l'endpoint compatibile OpenAI:
curl https://api.omniakey.com/v1/chat/completions \
-H "Authorization: Bearer $OMNIAKEY_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.8-flash",
"messages": [
{"role": "user", "content": "Return the riskiest assumption in this rollout plan."}
],
"stream": true
}'
La guida rapida API in inglese spiega autenticazione e base URL. Conserva la chiave reale in una variabile d'ambiente, mai nel codice, nei prompt, nei log di benchmark o negli screenshot.
Domande frequenti
Quanto costa l'API Gemini 3.8 Flash?
Google Standard costa $0.75 per milione di token in input e $3.75 in output fino a fine 2026; dal 1° gennaio 2027 la tabella indica $1.50 e $7.50. OmniaKey mostra oggi $0.45 e $2.25 come prezzo separato.
I token di ragionamento sono fatturati come output?
Sì. Google li include nel prezzo di output. Usa i dati usage del provider, non la lunghezza visibile della risposta.
OmniaKey è sempre più economica di Google diretto?
No. OmniaKey Standard è oggi sotto Google Standard, ma Google Batch e Flex sono inferiori per i carichi idonei. Disponibilità, latenza, protocollo e prezzi futuri restano scelte separate.
Perché dividere per il tasso di riuscita?
I fallimenti spendono senza produrre un task accettato. Con un costo stabile, dividere per la probabilità stima la spesa dietro un successo. Con dati di produzione, dividi la spesa totale per i task accettati.
Quale livello di ragionamento dovrebbe usare un agente?
Parti da low per lavoro limitato e verificabile; prova medium e high quando fallire è costoso. Gemini 3.8 Flash non supporta minimal. Il livello giusto è il meno caro che supera in modo affidabile lo stesso controllo.
Fonti primarie
- Prezzi Gemini API di Google (inglese)
- Documentazione Gemini 3.8 Flash (inglese)
- Documentazione Google sul ragionamento (inglese)
- Documentazione Google sulla cache (inglese)
- Documentazione Google Batch API (inglese)
Fonti e calcoli verificati il 20 settembre 2026. Prezzi, limiti e disponibilità possono cambiare. Ricontrolla le fonti primarie e il catalogo live OmniaKey prima di impegnare spesa di produzione.