O modelo Jev agora está integrado e disponível · Boas-vindas
Blogue
Controle de custos

Preço da API Gemini 3.8 Flash e custo por tarefa

O Google Standard cobra hoje $0.75 por milhão de tokens de entrada e $3.75 de saída; a OmniaKey lista $0.45 e $2.25, mas novas tentativas e a taxa de aprovação definem o custo real.

11 min de leituraOmniaKey
Gemini 3.8 Flashpreço de APIcusto de agentetokens de pensamentocontrole de custos

O preço da API Gemini 3.8 Flash no plano Standard pago do Google é de $0.75 por milhão de tokens de entrada e $3.75 por milhão de tokens de saída até 31 de dezembro de 2026. A tabela do Google passa para $1.50 e $7.50 em 1º de janeiro de 2027. A página do modelo na OmniaKey mostra hoje uma cotação separada do gateway: $0.45 para entrada, $2.25 para saída e $0.045 para entrada em cache.

Os valores e as datas do contrato direto vêm da tabela atual de preços da API Gemini do Google.

Preço por token não basta para orçar um agente. A métrica útil é todo o gasto de tentativas bem-sucedidas e fracassadas dividido pelas tarefas que passam no critério de aceite. Duas chamadas baratas que falham podem custar mais do que uma chamada mais cara que passa de primeira.

Informações verificadas em 20 de setembro de 2026. Conferimos preços, datas, limites, níveis de pensamento, cache e Batch na documentação atual do Google. Os números da OmniaKey vêm do catálogo ao vivo e representam outra relação de cobrança. Esta é uma análise baseada em pesquisa: não executamos benchmark próprio nem teste de produção faturado e não atribuímos uma taxa de sucesso ao modelo.

Tabela de preços do Gemini 3.8 Flash

Todos os valores estão em dólares por milhão de tokens. “Entrada em cache” é a leitura com desconto, não o armazenamento de cache que o Google cobra separadamente.

Caminho de cobrançaEntradaEntrada em cacheSaída, incluindo pensamentoEscopo
Google Standard até 31/12/2026$0.75$0.075$3.75API Gemini direta e paga
Google Batch ou Flex até 31/12/2026$0.375$0.0375$1.875Trabalho direto que aceita espera ou capacidade flexível
Google Priority até 31/12/2026$1.35$0.135$6.75Processamento direto prioritário
Google Standard a partir de 01/01/2027$1.50$0.15$7.50Tarifa Standard direta programada
Catálogo atual da OmniaKey$0.45$0.045$2.25Cotação Standard atual do gateway

A cotação atual da OmniaKey está 40% abaixo do Standard atual do Google. Isso não garante que ela continuará em 60% do preço do Google após 1º de janeiro. Cada catálogo é controlado de forma independente. Reveja a tabela de preços ao vivo antes de aprovar um orçamento de produção.

Batch e Flex do Google estão hoje abaixo do OmniaKey Standard, mas não são o mesmo produto. Batch é assíncrono, tem meta de conclusão em 24 horas e é documentado pelo Google para generateContent. Não presuma que Batch, Flex ou Priority do Google existem em um gateway sem documentação explícita da rota.

Armazenamento de cache, grounding, ferramentas externas, navegador, banco de dados, infraestrutura, impostos e revisão humana podem somar custos ausentes da tabela.

Fórmula do custo por tarefa de agente aprovada

Comece pelo caminho realmente usado:

text
custo do modelo por tentativa
  = milhões de entrada x preço de entrada
  + milhões de entrada em cache x preço de cache
  + milhões de saída x preço de saída

custo total por tentativa
  = modelo + ferramentas + grounding + infraestrutura + revisão

custo observado por tarefa aprovada
  = gasto de todas as tentativas, aprovadas e fracassadas
  / tarefas que passaram no critério de aceite

Para uma previsão em que cada tentativa custa aproximadamente o mesmo e tem chance independente de passar:

text
custo esperado por tarefa aprovada = custo por tentativa / taxa de aprovação

A última equação é uma aproximação. Uma falha pode terminar cedo, entrar em um loop maior, chamar outras ferramentas ou exigir correção humana. Em produção, use todo o gasto observado no numerador.

Defina “aprovada” antes do teste: patch que passa nos testes, JSON válido no schema, extração que coincide com rótulos revisados ou resposta aprovada por uma rubrica humana. HTTP 200 não é um critério de qualidade.

Exemplo: 20K de entrada, 5K de saída e 70% de aprovação

Considere 20,000 tokens de entrada sem cache e 5,000 tokens de saída em cada tentativa completa. A saída já inclui os tokens de pensamento cobrados. Ferramentas, armazenamento, impostos e revisão ficam fora para manter a conta reproduzível.

Caminho de cobrançaCusto por tentativaCusto esperado por tarefa aprovada a 70%
Google Standard em 20260.02 x $0.75 + 0.005 x $3.75 = $0.03375$0.0482
Google Standard a partir de 20270.02 x $1.50 + 0.005 x $7.50 = $0.06750$0.0964
Google Batch/Flex em 20260.02 x $0.375 + 0.005 x $1.875 = $0.016875$0.0241
Catálogo atual da OmniaKey0.02 x $0.45 + 0.005 x $2.25 = $0.02025$0.0289

Com o mesmo uso de tokens, o Standard direto dobra em 1º de janeiro de 2027. A linha da OmniaKey usa somente a cotação atual; ela não prevê o preço futuro do gateway. A linha Batch/Flex mostra por que o modo de consumo deve entrar na comparação: uma tarefa direta e adiada pode ter cobrança menor do que uma chamada interativa pelo gateway.

No Google Standard atual, a tentativa de $0.03375 custa $0.0375 por tarefa aprovada a 90%, $0.0482 a 70% e $0.0675 a 50%. Aumentar a aprovação pode valer mais do que encurtar um prompt pequeno.

Tokens de pensamento podem dominar a saída

O Google oferece low, medium e high para gemini-3.8-flash; o padrão é medium. minimal não é aceito e retorna erro. O preço de saída inclui tanto a resposta visível quanto os tokens de pensamento.

A ficha atual lista limite de 1,048,576 tokens de entrada e 65,536 de saída. São tetos de capacidade, não franquias gratuitas; tokens cobrados continuam no custo da tarefa.

Três consequências importam:

  1. Uma resposta visível curta pode custar caro após raciocínio longo.
  2. Um max_output_tokens baixo demais pode interromper o raciocínio, devolver resultado incompleto ou vazio e ainda cobrar os tokens de pensamento gerados.
  3. high só é econômico quando a melhora na aprovação compensa saída e latência adicionais.

Teste low, medium e high no mesmo conjunto. Mantenha prompt, ferramentas, permissões, política de repetição e comandos de aceite fixos. Escolha o nível mais barato que atinge a aprovação necessária, não apenas o primeiro que devolve texto.

Cache, novas tentativas e ferramentas no mesmo orçamento

O Google documenta cache implícito para Gemini 3.8 Flash a partir de um prefixo elegível de 4,096 tokens. Se o cliente preserva o prefixo, coloque instruções estáveis e schemas de ferramentas antes dos dados variáveis e confira o uso de cache informado pelo provedor. Texto parecido não comprova cache hit.

Classifique as novas tentativas: erro de transporte, argumento de ferramenta inválido, falha no aceite e revisão pedida por uma pessoa são casos diferentes. Um loop ilimitado aumenta silenciosamente o numerador.

Para um agente com ferramentas, registre ao menos:

  • ID de modelo solicitado e devolvido;
  • entrada, cache, tokens de pensamento e saída visível quando o protocolo informar;
  • ferramentas, custo das ferramentas e número de turnos;
  • latência, categoria de erro e quantidade de tentativas;
  • resultado e verificação exata do aceite;
  • valor final cobrado pela rota.

Gemini nativo e o protocolo compatível com OpenAI podem usar nomes diferentes para usage. Concilie a resposta da rota real com o painel de uso da OmniaKey, sem presumir o schema de outro provedor.

Google direto ou OmniaKey: onde começar

NecessidadeComece porMotivo
Menor preço publicado para lote que pode esperarGoogle BatchBatch direto custa hoje 50% do Standard e é assíncrono
Grounding ou controles próprios do GoogleGoogle diretoO contrato direto documenta essas superfícies
Uma chave e rota compatível com OpenAIOmniaKeyO catálogo oferece gemini-3.8-flash com cotação própria do gateway
Agente interativo com latência rigorosaMeça ambosPreço por token não prova fila, confiabilidade ou aprovação
Produção após 01/01/2027Verifique ambos de novoA mudança do Google está programada; o preço futuro do gateway é desconhecido

Esta não é uma classificação universal. Política de dados, região, limites, suporte, transparência de roteamento e protocolo podem mudar a decisão.

Chamar Gemini 3.8 Flash pela OmniaKey

Confirme gemini-3.8-flash no catálogo ao vivo, crie uma credencial limitada em Chaves de API e use o endpoint compatível com OpenAI:

bash
curl https://api.omniakey.com/v1/chat/completions \
  -H "Authorization: Bearer $OMNIAKEY_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-3.8-flash",
    "messages": [
      {"role": "user", "content": "Return the riskiest assumption in this rollout plan."}
    ],
    "stream": true
  }'

O guia rápido da API em inglês explica autenticação e base URL. Guarde a chave real em variável de ambiente, nunca no código, prompt, log de benchmark ou captura de tela.

Perguntas frequentes

Quanto custa a API Gemini 3.8 Flash?

Google Standard custa $0.75 por milhão de tokens de entrada e $3.75 de saída até o fim de 2026; a tabela passa a $1.50 e $7.50 em 1º de janeiro de 2027. A OmniaKey lista hoje $0.45 e $2.25 separadamente.

Tokens de pensamento entram no preço de saída?

Sim. O Google os inclui na saída. Use os dados de usage do provedor, não o tamanho visível da resposta.

A OmniaKey é sempre mais barata que o Google direto?

Não. OmniaKey Standard está hoje abaixo de Google Standard, mas Google Batch e Flex são menores para cargas elegíveis. Disponibilidade, latência, protocolo e preços futuros são decisões separadas.

Por que dividir pela taxa de aprovação?

Falhas gastam sem produzir tarefa aprovada. Com custo estável por tentativa, dividir pela probabilidade estima o gasto de uma aprovação. Com dados reais, divida o gasto total pelas tarefas aprovadas.

Qual nível de pensamento um agente deve usar?

Comece com low em trabalho limitado e verificável; teste medium e high quando falhar for caro. Gemini 3.8 Flash não aceita minimal. O nível certo é o mais barato que passa de forma confiável no mesmo critério.

Fontes primárias

Fontes e cálculos verificados em 20 de setembro de 2026. Preços, limites e disponibilidade podem mudar. Confira as fontes e o catálogo ao vivo da OmniaKey antes de assumir gasto de produção.