El modelo Jev ya está integrado y disponible · Te damos la bienvenida
Blog
Control de costos

Precio de la API de Gemini 3.8 Flash y coste por tarea

Google cobra ahora $0.75 por millón de tokens de entrada y $3.75 de salida; OmniaKey publica $0.45 y $2.25, pero el presupuesto real depende de los reintentos y de la tasa de aceptación.

11 min de lecturaOmniaKey
Gemini 3.8 Flashprecio de APIcoste de agentestokens de razonamientocontrol de costes

El precio de la API de Gemini 3.8 Flash en la modalidad Standard de pago de Google es de $0.75 por millón de tokens de entrada y $3.75 por millón de tokens de salida hasta el 31 de diciembre de 2026. Google publica $1.50 y $7.50 a partir del 1 de enero de 2027. La página del modelo en OmniaKey muestra ahora una tarifa independiente de $0.45 para entrada, $2.25 para salida y $0.045 para entrada en caché.

Las cifras y fechas directas proceden de la tabla de precios vigente de la API Gemini de Google.

La tarifa por token no basta para presupuestar un agente. La métrica útil es el gasto total de intentos aprobados y fallidos dividido entre las tareas que superan la validación. Dos llamadas baratas que fallan pueden costar más que una llamada más cara que funciona a la primera.

Datos comprobados el 20 de septiembre de 2026. Verificamos precios, fechas, límites, niveles de razonamiento, caché y Batch en la documentación actual de Google. La cifra de OmniaKey procede del catálogo en vivo y representa otro contrato de facturación. Este análisis se basa en fuentes: no realizamos un benchmark propio ni una prueba de producción facturable, y no atribuimos al modelo ninguna tasa de éxito.

Tabla de precios de Gemini 3.8 Flash

Todas las cifras son USD por un millón de tokens. “Entrada en caché” es la lectura con descuento y no incluye el almacenamiento de caché que Google cobra aparte.

Ruta de facturaciónEntradaEntrada en cachéSalida, incluido el razonamientoAlcance
Google Standard hasta el 31-12-2026$0.75$0.075$3.75API de Gemini directa y de pago
Google Batch o Flex hasta el 31-12-2026$0.375$0.0375$1.875Trabajo directo que admite demora o capacidad flexible
Google Priority hasta el 31-12-2026$1.35$0.135$6.75Procesamiento directo prioritario
Google Standard desde el 01-01-2027$1.50$0.15$7.50Tarifa Standard directa programada
Catálogo actual de OmniaKey$0.45$0.045$2.25Tarifa Standard actual del gateway

La tarifa actual de OmniaKey está un 40% por debajo del precio Standard vigente de Google. Eso no garantiza que siga siendo el 60% del precio de Google después del 1 de enero. Cada empresa controla su propio catálogo. Consulta de nuevo la tabla de precios en vivo antes de aprobar un presupuesto.

Batch y Flex de Google son ahora más baratos que la tarifa Standard de OmniaKey, pero no ofrecen la misma experiencia. Batch es asíncrono, tiene un objetivo de entrega de 24 horas y Google lo documenta para generateContent. No des por hecho que Batch, Flex o Priority de Google existen en un gateway si la ruta no lo indica.

El almacenamiento de caché, el grounding, las herramientas externas, el navegador, la base de datos, la infraestructura, los impuestos y la revisión humana pueden sumar costes que no aparecen en esta tabla.

Fórmula del coste por tarea de agente aceptada

Calcula primero la ruta que realmente utilizas:

text
coste del modelo por intento
  = millones de entrada x tarifa de entrada
  + millones de entrada en caché x tarifa de caché
  + millones de salida x tarifa de salida

coste total por intento
  = modelo + herramientas + grounding + infraestructura + revisión

coste observado por tarea aceptada
  = gasto de todos los intentos, aprobados y fallidos
  / tareas que superaron la validación

Para una previsión en la que cada intento cuesta aproximadamente lo mismo y tiene una probabilidad independiente de aprobar:

text
coste esperado por tarea aceptada = coste por intento / tasa de aprobación

La última fórmula es una aproximación. Un fallo puede terminar pronto, entrar en un bucle, usar otras herramientas o necesitar reparación humana. En producción conviene usar todo el gasto observado en el numerador.

Define “aceptada” antes de probar: un parche que supera tests, un JSON válido según su schema, una extracción que coincide con etiquetas revisadas o una respuesta aprobada con una rúbrica. Un HTTP 200 no es una validación de calidad.

Ejemplo: 20K de entrada, 5K de salida y 70% de aprobación

Supón 20,000 tokens de entrada sin caché y 5,000 tokens de salida por intento completo. La salida incluye los tokens de razonamiento facturados. Excluimos herramientas, almacenamiento, impuestos y revisión para que el cálculo sea reproducible.

Ruta de facturaciónCoste por intentoCoste esperado por tarea aceptada al 70%
Google Standard durante 20260.02 x $0.75 + 0.005 x $3.75 = $0.03375$0.0482
Google Standard desde 20270.02 x $1.50 + 0.005 x $7.50 = $0.06750$0.0964
Google Batch/Flex durante 20260.02 x $0.375 + 0.005 x $1.875 = $0.016875$0.0241
Catálogo actual de OmniaKey0.02 x $0.45 + 0.005 x $2.25 = $0.02025$0.0289

Con el mismo consumo, el precio Standard directo se duplica el 1 de enero de 2027. La fila de OmniaKey usa únicamente la tarifa actual: no proyecta el precio futuro del gateway. Batch/Flex demuestra por qué hay que comparar también el modo de consumo; un trabajo directo y diferido puede facturar menos tokens que una solicitud interactiva al gateway.

Con la tarifa Standard actual de Google, el intento de $0.03375 cuesta $0.0375 por tarea aceptada al 90%, $0.0482 al 70% y $0.0675 al 50%. Mejorar la tasa de aprobación puede ahorrar más que recortar un prompt pequeño.

Los tokens de razonamiento pueden dominar la salida

Google admite low, medium y high en gemini-3.8-flash; el valor predeterminado es medium. minimal no es compatible y devuelve un error. La tarifa de salida incluye tanto la respuesta visible como los tokens de razonamiento.

La ficha oficial fija un máximo de 1,048,576 tokens de entrada y 65,536 de salida. Son límites de capacidad, no cuotas gratuitas: los tokens facturados siguen contando en el coste de la tarea.

Esto tiene tres consecuencias:

  1. Una respuesta visible breve puede llevar una factura alta si el razonamiento fue largo.
  2. Un max_output_tokens demasiado bajo puede cortar el razonamiento, devolver un resultado incompleto o vacío y aun así cobrar los tokens ya generados.
  3. high solo compensa cuando mejora la aprobación lo suficiente para cubrir la salida y la latencia adicionales.

Prueba low, medium y high sobre el mismo conjunto. Mantén fijos el prompt, las herramientas, los permisos, los reintentos y la validación. Elige el nivel más barato que alcance la tasa requerida, no el primero que produzca texto.

Caché, reintentos y herramientas en una sola cuenta

Google documenta caché implícita para Gemini 3.8 Flash a partir de un prefijo elegible de 4,096 tokens. Coloca instrucciones estables y schemas de herramientas antes de los datos variables cuando el cliente conserve ese prefijo, y comprueba el uso de caché informado. Un texto parecido no demuestra un acierto de caché.

Clasifica los reintentos: error de transporte, argumentos de herramienta inválidos, validación fallida y revisión solicitada por una persona. Un bucle sin límite mejora artificialmente el denominador mientras aumenta el gasto.

Registra como mínimo:

  • ID de modelo solicitado y devuelto;
  • entrada, caché, razonamiento y salida visible cuando el protocolo los exponga;
  • herramientas, coste de herramientas y número de turnos;
  • latencia, categoría del error y reintentos;
  • resultado de la validación y la prueba exacta;
  • importe final facturado para esa ruta.

Gemini nativo y la interfaz compatible con OpenAI pueden usar nombres de campos distintos. Concilia los campos de la ruta real con el panel de uso de OmniaKey y no presupongas el schema de otro proveedor.

Google directo u OmniaKey: punto de partida

NecesidadEmpieza porMotivo
Menor tarifa publicada para lotes que admiten demoraGoogle BatchBatch directo cuesta ahora el 50% de Standard y es asíncrono
Grounding o controles propios de GoogleGoogle directoEl contrato directo documenta esas superficies
Una clave y una ruta compatible con OpenAIOmniaKeyEl catálogo ofrece gemini-3.8-flash con otra tarifa de gateway
Agente interactivo con latencia estrictaMide ambosEl precio por token no prueba cola, fiabilidad ni aprobación
Producción después del 01-01-2027Revisa ambosGoogle ha programado el cambio; el precio futuro del gateway se desconoce

No es una clasificación universal. Política de datos, región, límites, soporte, transparencia de enrutamiento y protocolo pueden cambiar la decisión.

Llamar a Gemini 3.8 Flash mediante OmniaKey

Comprueba gemini-3.8-flash en el catálogo en vivo, crea una credencial limitada en Claves API y usa el endpoint compatible con OpenAI:

bash
curl https://api.omniakey.com/v1/chat/completions \
  -H "Authorization: Bearer $OMNIAKEY_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-3.8-flash",
    "messages": [
      {"role": "user", "content": "Return the riskiest assumption in this rollout plan."}
    ],
    "stream": true
  }'

La guía de inicio de la API explica autenticación y URL base. Guarda la clave real en una variable de entorno, nunca en código, prompts, logs o capturas.

Preguntas frecuentes

¿Cuánto cuesta la API de Gemini 3.8 Flash?

Google Standard cuesta $0.75 por millón de tokens de entrada y $3.75 de salida hasta el 31 de diciembre de 2026; publica $1.50 y $7.50 desde el 1 de enero de 2027. OmniaKey muestra actualmente $0.45 y $2.25 como tarifa independiente.

¿Los tokens de razonamiento se cobran como salida?

Sí. Google incluye los tokens de razonamiento en la salida. Presupuesta con el uso informado, no con la longitud visible.

¿OmniaKey siempre es más barato que Google directo?

No. Su tarifa Standard actual es inferior a Google Standard, pero Batch y Flex de Google son más bajos para cargas elegibles. Disponibilidad, latencia, protocolo y precios futuros son decisiones distintas.

¿Por qué dividir por la tasa de aprobación?

Los fallos gastan dinero sin sumar una tarea aceptada. Si el coste por intento es estable, dividir por la probabilidad estima el gasto de una aceptación. Con datos reales, usa gasto total dividido por tareas aceptadas.

¿Qué nivel de razonamiento debería usar un agente?

Empieza con low para trabajo acotado y verificable; prueba medium y high cuando fallar sea caro. Gemini 3.8 Flash no admite minimal. El nivel correcto es el más barato que supera de forma fiable la misma validación.

Fuentes primarias

Evidencia y cálculos comprobados el 20 de septiembre de 2026. Los precios, límites y rutas pueden cambiar. Revisa las fuentes y el catálogo de OmniaKey antes de comprometer gasto de producción.