Preço da API Gemini 3.8 Flash e custo por tarefa
O Google Standard cobra hoje $0.75 por milhão de tokens de entrada e $3.75 de saída; a OmniaKey lista $0.45 e $2.25, mas novas tentativas e a taxa de aprovação definem o custo real.
O preço da API Gemini 3.8 Flash no plano Standard pago do Google é de $0.75 por milhão de tokens de entrada e $3.75 por milhão de tokens de saída até 31 de dezembro de 2026. A tabela do Google passa para $1.50 e $7.50 em 1º de janeiro de 2027. A página do modelo na OmniaKey mostra hoje uma cotação separada do gateway: $0.45 para entrada, $2.25 para saída e $0.045 para entrada em cache.
Os valores e as datas do contrato direto vêm da tabela atual de preços da API Gemini do Google.
Preço por token não basta para orçar um agente. A métrica útil é todo o gasto de tentativas bem-sucedidas e fracassadas dividido pelas tarefas que passam no critério de aceite. Duas chamadas baratas que falham podem custar mais do que uma chamada mais cara que passa de primeira.
Informações verificadas em 20 de setembro de 2026. Conferimos preços, datas, limites, níveis de pensamento, cache e Batch na documentação atual do Google. Os números da OmniaKey vêm do catálogo ao vivo e representam outra relação de cobrança. Esta é uma análise baseada em pesquisa: não executamos benchmark próprio nem teste de produção faturado e não atribuímos uma taxa de sucesso ao modelo.
Tabela de preços do Gemini 3.8 Flash
Todos os valores estão em dólares por milhão de tokens. “Entrada em cache” é a leitura com desconto, não o armazenamento de cache que o Google cobra separadamente.
| Caminho de cobrança | Entrada | Entrada em cache | Saída, incluindo pensamento | Escopo |
|---|---|---|---|---|
| Google Standard até 31/12/2026 | $0.75 | $0.075 | $3.75 | API Gemini direta e paga |
| Google Batch ou Flex até 31/12/2026 | $0.375 | $0.0375 | $1.875 | Trabalho direto que aceita espera ou capacidade flexível |
| Google Priority até 31/12/2026 | $1.35 | $0.135 | $6.75 | Processamento direto prioritário |
| Google Standard a partir de 01/01/2027 | $1.50 | $0.15 | $7.50 | Tarifa Standard direta programada |
| Catálogo atual da OmniaKey | $0.45 | $0.045 | $2.25 | Cotação Standard atual do gateway |
A cotação atual da OmniaKey está 40% abaixo do Standard atual do Google. Isso não garante que ela continuará em 60% do preço do Google após 1º de janeiro. Cada catálogo é controlado de forma independente. Reveja a tabela de preços ao vivo antes de aprovar um orçamento de produção.
Batch e Flex do Google estão hoje abaixo do OmniaKey Standard, mas não são o mesmo produto. Batch é assíncrono, tem meta de conclusão em 24 horas e é documentado pelo Google para generateContent. Não presuma que Batch, Flex ou Priority do Google existem em um gateway sem documentação explícita da rota.
Armazenamento de cache, grounding, ferramentas externas, navegador, banco de dados, infraestrutura, impostos e revisão humana podem somar custos ausentes da tabela.
Fórmula do custo por tarefa de agente aprovada
Comece pelo caminho realmente usado:
custo do modelo por tentativa
= milhões de entrada x preço de entrada
+ milhões de entrada em cache x preço de cache
+ milhões de saída x preço de saída
custo total por tentativa
= modelo + ferramentas + grounding + infraestrutura + revisão
custo observado por tarefa aprovada
= gasto de todas as tentativas, aprovadas e fracassadas
/ tarefas que passaram no critério de aceite
Para uma previsão em que cada tentativa custa aproximadamente o mesmo e tem chance independente de passar:
custo esperado por tarefa aprovada = custo por tentativa / taxa de aprovação
A última equação é uma aproximação. Uma falha pode terminar cedo, entrar em um loop maior, chamar outras ferramentas ou exigir correção humana. Em produção, use todo o gasto observado no numerador.
Defina “aprovada” antes do teste: patch que passa nos testes, JSON válido no schema, extração que coincide com rótulos revisados ou resposta aprovada por uma rubrica humana. HTTP 200 não é um critério de qualidade.
Exemplo: 20K de entrada, 5K de saída e 70% de aprovação
Considere 20,000 tokens de entrada sem cache e 5,000 tokens de saída em cada tentativa completa. A saída já inclui os tokens de pensamento cobrados. Ferramentas, armazenamento, impostos e revisão ficam fora para manter a conta reproduzível.
| Caminho de cobrança | Custo por tentativa | Custo esperado por tarefa aprovada a 70% |
|---|---|---|
| Google Standard em 2026 | 0.02 x $0.75 + 0.005 x $3.75 = $0.03375 | $0.0482 |
| Google Standard a partir de 2027 | 0.02 x $1.50 + 0.005 x $7.50 = $0.06750 | $0.0964 |
| Google Batch/Flex em 2026 | 0.02 x $0.375 + 0.005 x $1.875 = $0.016875 | $0.0241 |
| Catálogo atual da OmniaKey | 0.02 x $0.45 + 0.005 x $2.25 = $0.02025 | $0.0289 |
Com o mesmo uso de tokens, o Standard direto dobra em 1º de janeiro de 2027. A linha da OmniaKey usa somente a cotação atual; ela não prevê o preço futuro do gateway. A linha Batch/Flex mostra por que o modo de consumo deve entrar na comparação: uma tarefa direta e adiada pode ter cobrança menor do que uma chamada interativa pelo gateway.
No Google Standard atual, a tentativa de $0.03375 custa $0.0375 por tarefa aprovada a 90%, $0.0482 a 70% e $0.0675 a 50%. Aumentar a aprovação pode valer mais do que encurtar um prompt pequeno.
Tokens de pensamento podem dominar a saída
O Google oferece low, medium e high para gemini-3.8-flash; o padrão é medium. minimal não é aceito e retorna erro. O preço de saída inclui tanto a resposta visível quanto os tokens de pensamento.
A ficha atual lista limite de 1,048,576 tokens de entrada e 65,536 de saída. São tetos de capacidade, não franquias gratuitas; tokens cobrados continuam no custo da tarefa.
Três consequências importam:
- Uma resposta visível curta pode custar caro após raciocínio longo.
- Um
max_output_tokensbaixo demais pode interromper o raciocínio, devolver resultado incompleto ou vazio e ainda cobrar os tokens de pensamento gerados. highsó é econômico quando a melhora na aprovação compensa saída e latência adicionais.
Teste low, medium e high no mesmo conjunto. Mantenha prompt, ferramentas, permissões, política de repetição e comandos de aceite fixos. Escolha o nível mais barato que atinge a aprovação necessária, não apenas o primeiro que devolve texto.
Cache, novas tentativas e ferramentas no mesmo orçamento
O Google documenta cache implícito para Gemini 3.8 Flash a partir de um prefixo elegível de 4,096 tokens. Se o cliente preserva o prefixo, coloque instruções estáveis e schemas de ferramentas antes dos dados variáveis e confira o uso de cache informado pelo provedor. Texto parecido não comprova cache hit.
Classifique as novas tentativas: erro de transporte, argumento de ferramenta inválido, falha no aceite e revisão pedida por uma pessoa são casos diferentes. Um loop ilimitado aumenta silenciosamente o numerador.
Para um agente com ferramentas, registre ao menos:
- ID de modelo solicitado e devolvido;
- entrada, cache, tokens de pensamento e saída visível quando o protocolo informar;
- ferramentas, custo das ferramentas e número de turnos;
- latência, categoria de erro e quantidade de tentativas;
- resultado e verificação exata do aceite;
- valor final cobrado pela rota.
Gemini nativo e o protocolo compatível com OpenAI podem usar nomes diferentes para usage. Concilie a resposta da rota real com o painel de uso da OmniaKey, sem presumir o schema de outro provedor.
Google direto ou OmniaKey: onde começar
| Necessidade | Comece por | Motivo |
|---|---|---|
| Menor preço publicado para lote que pode esperar | Google Batch | Batch direto custa hoje 50% do Standard e é assíncrono |
| Grounding ou controles próprios do Google | Google direto | O contrato direto documenta essas superfícies |
| Uma chave e rota compatível com OpenAI | OmniaKey | O catálogo oferece gemini-3.8-flash com cotação própria do gateway |
| Agente interativo com latência rigorosa | Meça ambos | Preço por token não prova fila, confiabilidade ou aprovação |
| Produção após 01/01/2027 | Verifique ambos de novo | A mudança do Google está programada; o preço futuro do gateway é desconhecido |
Esta não é uma classificação universal. Política de dados, região, limites, suporte, transparência de roteamento e protocolo podem mudar a decisão.
Chamar Gemini 3.8 Flash pela OmniaKey
Confirme gemini-3.8-flash no catálogo ao vivo, crie uma credencial limitada em Chaves de API e use o endpoint compatível com OpenAI:
curl https://api.omniakey.com/v1/chat/completions \
-H "Authorization: Bearer $OMNIAKEY_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.8-flash",
"messages": [
{"role": "user", "content": "Return the riskiest assumption in this rollout plan."}
],
"stream": true
}'
O guia rápido da API em inglês explica autenticação e base URL. Guarde a chave real em variável de ambiente, nunca no código, prompt, log de benchmark ou captura de tela.
Perguntas frequentes
Quanto custa a API Gemini 3.8 Flash?
Google Standard custa $0.75 por milhão de tokens de entrada e $3.75 de saída até o fim de 2026; a tabela passa a $1.50 e $7.50 em 1º de janeiro de 2027. A OmniaKey lista hoje $0.45 e $2.25 separadamente.
Tokens de pensamento entram no preço de saída?
Sim. O Google os inclui na saída. Use os dados de usage do provedor, não o tamanho visível da resposta.
A OmniaKey é sempre mais barata que o Google direto?
Não. OmniaKey Standard está hoje abaixo de Google Standard, mas Google Batch e Flex são menores para cargas elegíveis. Disponibilidade, latência, protocolo e preços futuros são decisões separadas.
Por que dividir pela taxa de aprovação?
Falhas gastam sem produzir tarefa aprovada. Com custo estável por tentativa, dividir pela probabilidade estima o gasto de uma aprovação. Com dados reais, divida o gasto total pelas tarefas aprovadas.
Qual nível de pensamento um agente deve usar?
Comece com low em trabalho limitado e verificável; teste medium e high quando falhar for caro. Gemini 3.8 Flash não aceita minimal. O nível certo é o mais barato que passa de forma confiável no mesmo critério.
Fontes primárias
- Preços da API Gemini do Google (inglês)
- Documentação do Gemini 3.8 Flash (inglês)
- Documentação de pensamento do Google (inglês)
- Documentação de cache do Google (inglês)
- Documentação da Batch API do Google (inglês)
Fontes e cálculos verificados em 20 de setembro de 2026. Preços, limites e disponibilidade podem mudar. Confira as fontes e o catálogo ao vivo da OmniaKey antes de assumir gasto de produção.