Il modello Jev è ora integrato e disponibile · Benvenuto
Blog
Controllo dei costi

Prezzi API Gemini 3.8 Flash e costo per task

Google Standard costa oggi $0.75 per milione di token in input e $3.75 in output; OmniaKey indica $0.45 e $2.25, ma retry, ragionamento e tasso di accettazione determinano il costo reale.

11 min di letturaOmniaKey
Gemini 3.8 Flashprezzi APIcosto agentitoken di ragionamentocontrollo costi

I prezzi API Gemini 3.8 Flash sul piano Standard a pagamento di Google sono $0.75 per milione di token in input e $3.75 per milione di token in output fino al 31 dicembre 2026. Google indica $1.50 e $7.50 dal 1° gennaio 2027. La pagina modello di OmniaKey mostra oggi un'offerta gateway separata: $0.45 in input, $2.25 in output e $0.045 per input in cache.

Importi e date del contratto diretto provengono dal listino corrente della Gemini API di Google.

Il prezzo per token non basta per stimare un agente. La metrica utile è la spesa di tutti i tentativi riusciti e falliti divisa per i task che superano il controllo di accettazione. Due chiamate economiche fallite possono costare più di una chiamata più cara riuscita al primo colpo.

Dati verificati il 20 settembre 2026. Prezzi, date, limiti, livelli di ragionamento, cache e comportamento Batch sono stati controllati nella documentazione Google corrente. I valori OmniaKey provengono dal catalogo live e rappresentano un prezzo gateway indipendente. Questa è un'analisi basata su fonti: non abbiamo eseguito un benchmark diretto né un test di produzione a pagamento e non attribuiamo un tasso di successo al modello.

Tabella dei prezzi di Gemini 3.8 Flash

Tutti i valori sono dollari USA per un milione di token. “Input in cache” indica la lettura scontata, non l'archiviazione della cache che Google addebita a parte.

Percorso di fatturazioneInputInput in cacheOutput, ragionamento inclusoAmbito
Google Standard fino al 31-12-2026$0.75$0.075$3.75Gemini API diretta a pagamento
Google Batch o Flex fino al 31-12-2026$0.375$0.0375$1.875Lavoro diretto che tollera attesa o capacità flessibile
Google Priority fino al 31-12-2026$1.35$0.135$6.75Elaborazione diretta prioritaria
Google Standard dal 01-01-2027$1.50$0.15$7.50Tariffa Standard diretta programmata
Catalogo OmniaKey attuale$0.45$0.045$2.25Offerta Standard corrente del gateway

L'offerta OmniaKey attuale è inferiore del 40% al prezzo Standard corrente di Google. Non è una garanzia che rimanga al 60% del prezzo Google dopo il 1° gennaio. I due cataloghi sono gestiti separatamente. Ricontrolla il listino live prima di approvare un budget di produzione.

Google Batch e Flex sono oggi più bassi di OmniaKey Standard, ma non sono lo stesso servizio. Batch è asincrono, ha un obiettivo di completamento di 24 ore ed è documentato da Google per generateContent. Non presumere che Batch, Flex o Priority di Google siano presenti su un gateway senza documentazione esplicita.

Archiviazione della cache, grounding, strumenti esterni, browser, database, infrastruttura, imposte e revisione umana possono aggiungere costi che la tabella token non mostra.

Calcolare il costo per task agente accettato

Parti dal percorso realmente usato:

text
costo modello per tentativo
  = milioni in input x tariffa input
  + milioni di input in cache x tariffa cache
  + milioni in output x tariffa output

costo totale per tentativo
  = modello + strumenti + grounding + infrastruttura + revisione

costo osservato per task accettato
  = spesa di tutti i tentativi riusciti e falliti
  / task che superano il controllo

Per una previsione in cui ogni tentativo costa circa lo stesso e la probabilità di riuscita è indipendente:

text
costo atteso per task accettato = costo per tentativo / tasso di riuscita

L'ultima formula è un'approssimazione. Un fallimento può chiudersi presto, entrare in un loop più lungo, chiamare altri strumenti o richiedere correzione umana. In produzione usa tutta la spesa osservata al numeratore.

Definisci “accettato” prima del test: una patch supera gli unit test, un JSON è valido rispetto allo schema, un'estrazione coincide con etichette revisionate o una risposta supera una rubrica umana. HTTP 200 non è un controllo di qualità.

Esempio: 20K input, 5K output, 70% di riuscita

Supponiamo che un tentativo completo usi 20,000 token in input non in cache e 5,000 token in output. L'output comprende i token di ragionamento fatturati. Escludiamo strumenti, archiviazione, imposte e revisione per mantenere il calcolo riproducibile.

PercorsoCosto per tentativoCosto atteso per task accettato al 70%
Google Standard nel 20260.02 x $0.75 + 0.005 x $3.75 = $0.03375$0.0482
Google Standard dal 20270.02 x $1.50 + 0.005 x $7.50 = $0.06750$0.0964
Google Batch/Flex nel 20260.02 x $0.375 + 0.005 x $1.875 = $0.016875$0.0241
Catalogo OmniaKey attuale0.02 x $0.45 + 0.005 x $2.25 = $0.02025$0.0289

A parità di token, Standard diretto raddoppia il 1° gennaio 2027. La riga OmniaKey usa soltanto il prezzo attuale e non prevede il futuro prezzo gateway. Batch/Flex mostra perché il modo di consumo va confrontato: un job diretto differibile può fatturare meno di una richiesta gateway interattiva.

Con il Google Standard corrente, lo stesso tentativo da $0.03375 costa $0.0375 per task accettato al 90%, $0.0482 al 70% e $0.0675 al 50%. Migliorare il tasso di riuscita può contare più che accorciare un prompt piccolo.

I token di ragionamento possono dominare l'output

Google supporta low, medium e high per gemini-3.8-flash; il valore predefinito è medium. minimal non è supportato e restituisce un errore. Il prezzo di output comprende risposta visibile e token di ragionamento.

La scheda attuale indica un limite di 1,048,576 token in input e 65,536 in output. Sono limiti di capacità, non quote gratuite; i token fatturati restano nel costo del task.

Tre conseguenze pratiche:

  1. Una risposta visibile breve può costare molto dopo un ragionamento lungo.
  2. Un max_output_tokens troppo basso può troncare il ragionamento, restituire un risultato incompleto o vuoto e fatturare comunque i token di ragionamento già generati.
  3. high conviene solo quando l'aumento del tasso di riuscita copre output e latenza aggiuntivi.

Prova low, medium e high sullo stesso set. Mantieni fissi prompt, strumenti, permessi, regola di retry e comandi di accettazione. Scegli il livello meno costoso che raggiunge il tasso richiesto, non semplicemente quello che produce testo.

Cache, retry e strumenti nello stesso budget

Google documenta la cache implicita di Gemini 3.8 Flash con un prefisso minimo idoneo di 4,096 token. Se il client conserva il prefisso, metti istruzioni stabili e schema degli strumenti prima dei dati variabili, poi controlla l'uso cache dichiarato. Testo simile non dimostra un cache hit.

Classifica i retry: errore di trasporto, argomento non valido, controllo fallito e revisione chiesta da una persona sono categorie diverse. Un loop illimitato aumenta silenziosamente il numeratore.

Per un agente con strumenti registra almeno:

  • ID del modello richiesto e restituito;
  • input, cache, token di ragionamento e output visibile quando il protocollo li espone;
  • strumenti, relativo costo e numero di turni;
  • latenza, categoria di errore e retry;
  • risultato e controllo esatto di accettazione;
  • importo finale fatturato per il percorso.

Gemini native e il protocollo compatibile OpenAI possono usare nomi diversi per i campi usage. Riconcilia la risposta reale con la dashboard di utilizzo OmniaKey, senza assumere lo schema di un altro provider.

Google diretto o OmniaKey: da dove partire

EsigenzaParti daMotivo
Prezzo pubblicato più basso per batch differibiliGoogle BatchBatch diretto costa oggi il 50% di Standard ed è asincrono
Grounding o controlli specifici GoogleGoogle direttoIl contratto diretto documenta queste funzioni
Una chiave e percorso compatibile OpenAIOmniaKeyIl catalogo offre gemini-3.8-flash con prezzo gateway separato
Agente interattivo con latenza strettaMisura entrambiIl prezzo token non prova coda, affidabilità o riuscita
Produzione dopo il 01-01-2027Ricontrolla entrambiLa modifica Google è pianificata; il futuro prezzo gateway è ignoto

Non è una classifica universale. Politica dei dati, regione, limiti, supporto, trasparenza del routing e protocollo possono cambiare la scelta.

Chiamare Gemini 3.8 Flash tramite OmniaKey

Verifica gemini-3.8-flash nel catalogo live, crea una credenziale limitata in Chiavi API e usa l'endpoint compatibile OpenAI:

bash
curl https://api.omniakey.com/v1/chat/completions \
  -H "Authorization: Bearer $OMNIAKEY_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-3.8-flash",
    "messages": [
      {"role": "user", "content": "Return the riskiest assumption in this rollout plan."}
    ],
    "stream": true
  }'

La guida rapida API in inglese spiega autenticazione e base URL. Conserva la chiave reale in una variabile d'ambiente, mai nel codice, nei prompt, nei log di benchmark o negli screenshot.

Domande frequenti

Quanto costa l'API Gemini 3.8 Flash?

Google Standard costa $0.75 per milione di token in input e $3.75 in output fino a fine 2026; dal 1° gennaio 2027 la tabella indica $1.50 e $7.50. OmniaKey mostra oggi $0.45 e $2.25 come prezzo separato.

I token di ragionamento sono fatturati come output?

Sì. Google li include nel prezzo di output. Usa i dati usage del provider, non la lunghezza visibile della risposta.

OmniaKey è sempre più economica di Google diretto?

No. OmniaKey Standard è oggi sotto Google Standard, ma Google Batch e Flex sono inferiori per i carichi idonei. Disponibilità, latenza, protocollo e prezzi futuri restano scelte separate.

Perché dividere per il tasso di riuscita?

I fallimenti spendono senza produrre un task accettato. Con un costo stabile, dividere per la probabilità stima la spesa dietro un successo. Con dati di produzione, dividi la spesa totale per i task accettati.

Quale livello di ragionamento dovrebbe usare un agente?

Parti da low per lavoro limitato e verificabile; prova medium e high quando fallire è costoso. Gemini 3.8 Flash non supporta minimal. Il livello giusto è il meno caro che supera in modo affidabile lo stesso controllo.

Fonti primarie

Fonti e calcoli verificati il 20 settembre 2026. Prezzi, limiti e disponibilità possono cambiare. Ricontrolla le fonti primarie e il catalogo live OmniaKey prima di impegnare spesa di produzione.