Precio de la API de Gemini 3.8 Flash y coste por tarea
Google cobra ahora $0.75 por millón de tokens de entrada y $3.75 de salida; OmniaKey publica $0.45 y $2.25, pero el presupuesto real depende de los reintentos y de la tasa de aceptación.
El precio de la API de Gemini 3.8 Flash en la modalidad Standard de pago de Google es de $0.75 por millón de tokens de entrada y $3.75 por millón de tokens de salida hasta el 31 de diciembre de 2026. Google publica $1.50 y $7.50 a partir del 1 de enero de 2027. La página del modelo en OmniaKey muestra ahora una tarifa independiente de $0.45 para entrada, $2.25 para salida y $0.045 para entrada en caché.
Las cifras y fechas directas proceden de la tabla de precios vigente de la API Gemini de Google.
La tarifa por token no basta para presupuestar un agente. La métrica útil es el gasto total de intentos aprobados y fallidos dividido entre las tareas que superan la validación. Dos llamadas baratas que fallan pueden costar más que una llamada más cara que funciona a la primera.
Datos comprobados el 20 de septiembre de 2026. Verificamos precios, fechas, límites, niveles de razonamiento, caché y Batch en la documentación actual de Google. La cifra de OmniaKey procede del catálogo en vivo y representa otro contrato de facturación. Este análisis se basa en fuentes: no realizamos un benchmark propio ni una prueba de producción facturable, y no atribuimos al modelo ninguna tasa de éxito.
Tabla de precios de Gemini 3.8 Flash
Todas las cifras son USD por un millón de tokens. “Entrada en caché” es la lectura con descuento y no incluye el almacenamiento de caché que Google cobra aparte.
| Ruta de facturación | Entrada | Entrada en caché | Salida, incluido el razonamiento | Alcance |
|---|---|---|---|---|
| Google Standard hasta el 31-12-2026 | $0.75 | $0.075 | $3.75 | API de Gemini directa y de pago |
| Google Batch o Flex hasta el 31-12-2026 | $0.375 | $0.0375 | $1.875 | Trabajo directo que admite demora o capacidad flexible |
| Google Priority hasta el 31-12-2026 | $1.35 | $0.135 | $6.75 | Procesamiento directo prioritario |
| Google Standard desde el 01-01-2027 | $1.50 | $0.15 | $7.50 | Tarifa Standard directa programada |
| Catálogo actual de OmniaKey | $0.45 | $0.045 | $2.25 | Tarifa Standard actual del gateway |
La tarifa actual de OmniaKey está un 40% por debajo del precio Standard vigente de Google. Eso no garantiza que siga siendo el 60% del precio de Google después del 1 de enero. Cada empresa controla su propio catálogo. Consulta de nuevo la tabla de precios en vivo antes de aprobar un presupuesto.
Batch y Flex de Google son ahora más baratos que la tarifa Standard de OmniaKey, pero no ofrecen la misma experiencia. Batch es asíncrono, tiene un objetivo de entrega de 24 horas y Google lo documenta para generateContent. No des por hecho que Batch, Flex o Priority de Google existen en un gateway si la ruta no lo indica.
El almacenamiento de caché, el grounding, las herramientas externas, el navegador, la base de datos, la infraestructura, los impuestos y la revisión humana pueden sumar costes que no aparecen en esta tabla.
Fórmula del coste por tarea de agente aceptada
Calcula primero la ruta que realmente utilizas:
coste del modelo por intento
= millones de entrada x tarifa de entrada
+ millones de entrada en caché x tarifa de caché
+ millones de salida x tarifa de salida
coste total por intento
= modelo + herramientas + grounding + infraestructura + revisión
coste observado por tarea aceptada
= gasto de todos los intentos, aprobados y fallidos
/ tareas que superaron la validación
Para una previsión en la que cada intento cuesta aproximadamente lo mismo y tiene una probabilidad independiente de aprobar:
coste esperado por tarea aceptada = coste por intento / tasa de aprobación
La última fórmula es una aproximación. Un fallo puede terminar pronto, entrar en un bucle, usar otras herramientas o necesitar reparación humana. En producción conviene usar todo el gasto observado en el numerador.
Define “aceptada” antes de probar: un parche que supera tests, un JSON válido según su schema, una extracción que coincide con etiquetas revisadas o una respuesta aprobada con una rúbrica. Un HTTP 200 no es una validación de calidad.
Ejemplo: 20K de entrada, 5K de salida y 70% de aprobación
Supón 20,000 tokens de entrada sin caché y 5,000 tokens de salida por intento completo. La salida incluye los tokens de razonamiento facturados. Excluimos herramientas, almacenamiento, impuestos y revisión para que el cálculo sea reproducible.
| Ruta de facturación | Coste por intento | Coste esperado por tarea aceptada al 70% |
|---|---|---|
| Google Standard durante 2026 | 0.02 x $0.75 + 0.005 x $3.75 = $0.03375 | $0.0482 |
| Google Standard desde 2027 | 0.02 x $1.50 + 0.005 x $7.50 = $0.06750 | $0.0964 |
| Google Batch/Flex durante 2026 | 0.02 x $0.375 + 0.005 x $1.875 = $0.016875 | $0.0241 |
| Catálogo actual de OmniaKey | 0.02 x $0.45 + 0.005 x $2.25 = $0.02025 | $0.0289 |
Con el mismo consumo, el precio Standard directo se duplica el 1 de enero de 2027. La fila de OmniaKey usa únicamente la tarifa actual: no proyecta el precio futuro del gateway. Batch/Flex demuestra por qué hay que comparar también el modo de consumo; un trabajo directo y diferido puede facturar menos tokens que una solicitud interactiva al gateway.
Con la tarifa Standard actual de Google, el intento de $0.03375 cuesta $0.0375 por tarea aceptada al 90%, $0.0482 al 70% y $0.0675 al 50%. Mejorar la tasa de aprobación puede ahorrar más que recortar un prompt pequeño.
Los tokens de razonamiento pueden dominar la salida
Google admite low, medium y high en gemini-3.8-flash; el valor predeterminado es medium. minimal no es compatible y devuelve un error. La tarifa de salida incluye tanto la respuesta visible como los tokens de razonamiento.
La ficha oficial fija un máximo de 1,048,576 tokens de entrada y 65,536 de salida. Son límites de capacidad, no cuotas gratuitas: los tokens facturados siguen contando en el coste de la tarea.
Esto tiene tres consecuencias:
- Una respuesta visible breve puede llevar una factura alta si el razonamiento fue largo.
- Un
max_output_tokensdemasiado bajo puede cortar el razonamiento, devolver un resultado incompleto o vacío y aun así cobrar los tokens ya generados. highsolo compensa cuando mejora la aprobación lo suficiente para cubrir la salida y la latencia adicionales.
Prueba low, medium y high sobre el mismo conjunto. Mantén fijos el prompt, las herramientas, los permisos, los reintentos y la validación. Elige el nivel más barato que alcance la tasa requerida, no el primero que produzca texto.
Caché, reintentos y herramientas en una sola cuenta
Google documenta caché implícita para Gemini 3.8 Flash a partir de un prefijo elegible de 4,096 tokens. Coloca instrucciones estables y schemas de herramientas antes de los datos variables cuando el cliente conserve ese prefijo, y comprueba el uso de caché informado. Un texto parecido no demuestra un acierto de caché.
Clasifica los reintentos: error de transporte, argumentos de herramienta inválidos, validación fallida y revisión solicitada por una persona. Un bucle sin límite mejora artificialmente el denominador mientras aumenta el gasto.
Registra como mínimo:
- ID de modelo solicitado y devuelto;
- entrada, caché, razonamiento y salida visible cuando el protocolo los exponga;
- herramientas, coste de herramientas y número de turnos;
- latencia, categoría del error y reintentos;
- resultado de la validación y la prueba exacta;
- importe final facturado para esa ruta.
Gemini nativo y la interfaz compatible con OpenAI pueden usar nombres de campos distintos. Concilia los campos de la ruta real con el panel de uso de OmniaKey y no presupongas el schema de otro proveedor.
Google directo u OmniaKey: punto de partida
| Necesidad | Empieza por | Motivo |
|---|---|---|
| Menor tarifa publicada para lotes que admiten demora | Google Batch | Batch directo cuesta ahora el 50% de Standard y es asíncrono |
| Grounding o controles propios de Google | Google directo | El contrato directo documenta esas superficies |
| Una clave y una ruta compatible con OpenAI | OmniaKey | El catálogo ofrece gemini-3.8-flash con otra tarifa de gateway |
| Agente interactivo con latencia estricta | Mide ambos | El precio por token no prueba cola, fiabilidad ni aprobación |
| Producción después del 01-01-2027 | Revisa ambos | Google ha programado el cambio; el precio futuro del gateway se desconoce |
No es una clasificación universal. Política de datos, región, límites, soporte, transparencia de enrutamiento y protocolo pueden cambiar la decisión.
Llamar a Gemini 3.8 Flash mediante OmniaKey
Comprueba gemini-3.8-flash en el catálogo en vivo, crea una credencial limitada en Claves API y usa el endpoint compatible con OpenAI:
curl https://api.omniakey.com/v1/chat/completions \
-H "Authorization: Bearer $OMNIAKEY_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.8-flash",
"messages": [
{"role": "user", "content": "Return the riskiest assumption in this rollout plan."}
],
"stream": true
}'
La guía de inicio de la API explica autenticación y URL base. Guarda la clave real en una variable de entorno, nunca en código, prompts, logs o capturas.
Preguntas frecuentes
¿Cuánto cuesta la API de Gemini 3.8 Flash?
Google Standard cuesta $0.75 por millón de tokens de entrada y $3.75 de salida hasta el 31 de diciembre de 2026; publica $1.50 y $7.50 desde el 1 de enero de 2027. OmniaKey muestra actualmente $0.45 y $2.25 como tarifa independiente.
¿Los tokens de razonamiento se cobran como salida?
Sí. Google incluye los tokens de razonamiento en la salida. Presupuesta con el uso informado, no con la longitud visible.
¿OmniaKey siempre es más barato que Google directo?
No. Su tarifa Standard actual es inferior a Google Standard, pero Batch y Flex de Google son más bajos para cargas elegibles. Disponibilidad, latencia, protocolo y precios futuros son decisiones distintas.
¿Por qué dividir por la tasa de aprobación?
Los fallos gastan dinero sin sumar una tarea aceptada. Si el coste por intento es estable, dividir por la probabilidad estima el gasto de una aceptación. Con datos reales, usa gasto total dividido por tareas aceptadas.
¿Qué nivel de razonamiento debería usar un agente?
Empieza con low para trabajo acotado y verificable; prueba medium y high cuando fallar sea caro. Gemini 3.8 Flash no admite minimal. El nivel correcto es el más barato que supera de forma fiable la misma validación.
Fuentes primarias
- Precios de la API de Gemini de Google (inglés)
- Documentación de Gemini 3.8 Flash (inglés)
- Documentación de thinking de Google (inglés)
- Documentación de caché de Google (inglés)
- Documentación de Batch API de Google (inglés)
Evidencia y cálculos comprobados el 20 de septiembre de 2026. Los precios, límites y rutas pueden cambiar. Revisa las fuentes y el catálogo de OmniaKey antes de comprometer gasto de producción.