Precios de la API de Grok 4.6
xAI publica $2 de entrada y $6 de salida por millón de tokens hasta 200K; al superar 200K, ambas tarifas se duplican.
Los precios de la API de Grok 4.6 tienen dos niveles según el tamaño del prompt. xAI publica $2 por millón de tokens de entrada y $6 por millón de salida cuando el prompt no supera 200K tokens. Al superar 200K, el precio pasa a $4 de entrada y $12 de salida por millón. La lectura de caché cuesta $0.50 y $1.00 por millón en esos dos niveles.
El catálogo actual de OmniaKey muestra Grok 4.6 con el nivel de contexto largo: $3.20 de entrada, $9.60 de salida y $0.80 de lectura de caché por millón de tokens. Es una cotización de la plataforma OmniaKey, no un nuevo precio oficial de xAI. Mantén ambas relaciones de facturación separadas.
Precios y datos comprobados el 22 de agosto de 2026. La página oficial de xAI identifica grok-4.6 como su modelo insignia más reciente, con 500K de contexto y facturación por uso. Las cifras de OmniaKey proceden del catálogo actual y aplican un ratio del 80% al nivel largo. Comprueba ambas páginas antes de comprar para producción.
Precios de la API de Grok 4.6 de un vistazo
Todos los valores son USD por millón de tokens. El nivel largo se aplica cuando el prompt supera 200K; los primeros 200K no son gratuitos.
| Uso | xAI hasta 200K | xAI por encima de 200K | Cotización actual de OmniaKey* |
|---|---|---|---|
| Entrada | $2.00 | $4.00 | $3.20 |
| Lectura de caché | $0.50 | $1.00 | $0.80 |
| Salida | $6.00 | $12.00 | $9.60 |
* El catálogo de OmniaKey muestra actualmente el nivel de contexto largo. Es un precio del gateway y puede cambiar de forma independiente al precio directo de xAI.
La fórmula general es:
La página del modelo Grok 4.6 conserva la cotización actual de OmniaKey, el ID, el contexto, las capacidades y el ejemplo de petición. Consulta el catálogo vivo de modelos antes de copiar un precio a un presupuesto.
Esta tabla cubre solo los cargos por tokens del modelo. No incluye impuestos, conversión de moneda, cargos separados de archivos o herramientas, endpoints de generación de imágenes o voz/vídeo, ni condiciones de contratos empresariales. Los metadatos actuales de xAI no muestran descuento de Batch para Grok 4.6, así que no supongas que pasar un trabajo a Batch reduce automáticamente sus tarifas por token.
Qué cambia después de 200K tokens de prompt
El umbral se mide sobre el prompt enviado al modelo. No es lo mismo que la ventana máxima de 500K ni que una cuota mensual. Los archivos del repositorio, los esquemas de herramientas, el historial y las instrucciones del agente pueden cruzarlo aunque la respuesta final sea corta.
Consecuencias prácticas:
- 500K es capacidad, no tokens incluidos;
- repetir un prefijo grande del repositorio puede cruzar el umbral en cada turno;
- la salida se factura aparte, así que el razonamiento y los reintentos importan;
- la lectura de caché baja la línea de entrada, pero no hace gratuita la salida;
- OmniaKey tiene su propia relación de facturación y no debes aplicar automáticamente el cambio de nivel de xAI a un saldo del gateway.
Si tu cliente muestra tokens, registra el tamaño del prompt antes de llamar y compáralo con el usage devuelto después. El tamaño del archivo o el número de caracteres no sustituyen el conteo de tokens.
En el límite, lee los niveles publicados así:
| Tamaño del prompt | Nivel de xAI | Entrada / lectura de caché / salida |
|---|---|---|
| Exactamente 200.000 tokens | Estándar | $2 / $0.50 / $6 por 1M |
| De 200.001 a 500.000 tokens | Contexto largo | $4 / $1 / $12 por 1M |
| Por encima del límite de prompt de 500K | No compatible según estos metadatos | Consulta la página actual del modelo |
Los metadatos actuales del modelo indican 500K como longitud máxima del prompt; no prometen que un prompt de 500K pueda producir además una respuesta sin límite. Cerca de cualquiera de los dos límites, usa los campos de tokens del proveedor y la factura final, no una estimación por caracteres.
Tres ejemplos reproducibles de coste
Estos ejemplos usan los precios publicados por xAI y excluyen impuestos, conversión de moneda, cargos de media y cambios futuros.
Ejemplo 1: petición normal de programación
Supón 100.000 tokens de entrada sin caché y 20.000 tokens de salida, por debajo de 200K.
| Ruta | Cálculo | Total |
|---|---|---|
| xAI estándar | 0.1 × $2 + 0.02 × $6 | $0.32 |
| Cotización de OmniaKey | 0.1 × $3.20 + 0.02 × $9.60 | $0.512 |
La cifra de OmniaKey usa la cotización larga que aparece en el catálogo, aunque el ejemplo esté por debajo de 200K. Confirma la tarifa viva antes de tratarla como contrato.
Ejemplo 2: contexto de un repositorio
Supón 300.000 tokens de entrada sin caché y 40.000 tokens de salida.
| Ruta | Cálculo | Total |
|---|---|---|
| xAI contexto largo | 0.3 × $4 + 0.04 × $12 | $1.68 |
| Cotización de OmniaKey | 0.3 × $3.20 + 0.04 × $9.60 | $1.344 |
El contexto largo encarece el mismo modelo. Antes de bajar la calidad, elimina resultados de herramientas repetidos, historial obsoleto y archivos sin relación.
Ejemplo 3: contexto repetido en caché
Supón que el proveedor registra 300.000 tokens como lecturas de caché y la salida tiene 40.000 tokens.
| Ruta | Cálculo | Total |
|---|---|---|
| Caché larga de xAI | 0.3 × $1 + 0.04 × $12 | $0.78 |
| Cotización de OmniaKey | 0.3 × $0.80 + 0.04 × $9.60 | $0.624 |
Solo es válido si el proveedor informa realmente esas lecturas. Texto parecido o un prefijo modificado puede convertirse en cache miss.
Leer caché no significa tener un prompt gratis
La tarifa de caché de xAI es un precio menor para entradas repetidas elegibles. No convierte la ventana de contexto en una cuota de suscripción. El cliente y el proveedor deciden si se reutiliza el prefijo, y el usage es la fuente de verdad.
Para un agente de código, las instrucciones de sistema estables, los esquemas de herramientas, las reglas del repositorio y una introducción fija son buenos candidatos. Coloca los detalles cambiantes después del prefijo estable cuando el cliente permita controlar el orden.
Registra por separado:
- tokens de entrada sin caché;
- tokens de lectura de caché;
- tokens de salida, incluido el razonamiento que informe la API;
- reintentos y turnos de herramientas fallidos;
- resultado de la tarea aceptada.
Una estrategia que ahorra entrada pero provoca instrucciones obsoletas y más reintentos puede encarecer la tarea terminada.
Para qué está diseñado Grok 4.6
xAI describe Grok 4.6 como su modelo insignia más reciente para programación, agentes de larga duración, uso de herramientas y trabajo interactivo o visual. La página oficial de API enumera:
- ID
grok-4.6; - ventana de contexto de 500K;
- visión y uso estructurado de herramientas;
- rutas OpenAI-compatible y nativa de xAI;
- facturación por uso, créditos prepago y facturación empresarial.
Son capacidades documentadas, no un benchmark independiente de este artículo. Fiabilidad, latencia, rechazos y coste por tarea aceptada dependen del cliente, permisos, prompt, herramientas y carga.
Para elegir entre familias, consulta la guía de modelos para agentes de código. Aquí solo resolvemos el presupuesto de Grok 4.6 API.
Grok 4.6 y Grok 4.5 al preparar un presupuesto
Ambos IDs aparecen en el catálogo de OmniaKey y ambos muestran 500K de contexto. La comparación actual en contexto largo es:
| Modelo | Entrada / lectura de caché / salida xAI | Cotización actual de OmniaKey* |
|---|---|---|
grok-4.6 | $4 / $1 / $12 | $3.20 / $0.80 / $9.60 |
grok-4.5 | $4 / $0.60 / $12 | $3.20 / $0.48 / $9.60 |
- La columna de OmniaKey aplica el ratio actual del 80% del catálogo y puede cambiar de forma independiente. Solo por precio de tokens, la diferencia está en la lectura de caché: Grok 4.5 es más barato cuando el proveedor informa realmente lecturas de caché. No concluyas por eso que su coste por tarea aceptada es menor; compara el ID exacto, el comportamiento, los reintentos y el catálogo vivo.
En una comparación controlada fija la revisión del repositorio, el system prompt, los permisos, las pruebas de aceptación y el máximo de salida. Registra:
- ID solicitado y devuelto;
- tokens de prompt, caché y salida;
- latencia y reintentos;
- si las pruebas pasan sin reparación manual;
- total facturado.
La métrica útil es el coste por tarea aceptada:
coste por tarea aceptada = cargos de la ejecución correcta
+ reintentos fallidos
+ tiempo de corrección humana
+ riesgo de remediación
Llamar a Grok 4.6 por una ruta OpenAI-compatible
Crea una clave limitada en el panel de API keys, confirma grok-4.6 en el catálogo y llama al endpoint compatible:
curl https://api.omniakey.com/v1/chat/completions \
-H "Authorization: Bearer $OMNIAKEY_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "grok-4.6",
"messages": [{"role": "user", "content": "Revisa este plan de despliegue en busca de fallos ocultos."}],
"stream": true
}'
Usa el ID exacto. La guía rápida de API explica endpoint y autenticación. Después de una tarea representativa, compara tu estimación con el panel de uso.
Controles de presupuesto para agentes de código
Usa claves distintas para experimentos locales, CI y automatizaciones compartidas. Así puedes atribuir, limitar y revocar cada flujo.
Secuencia recomendada:
- Ejecuta una tarea con una prueba de aceptación clara.
- Registra prompt, caché, salida, reintentos y coste total.
- Elimina contexto obsoleto y salida de herramientas sin límite.
- Fija un límite por encima de la variación normal.
- Alerta sobre fallos repetidos o un ID inesperado.
- Sube el límite solo después de revisar el coste aceptado.
La guía de facturación transparente explica cómo reconciliar modelo, tokens y cargos del gateway. Un límite reduce la exposición; no reduce por sí mismo los tokens consumidos.
Errores habituales con los precios de Grok 4.6
Tratar 500K como una cuota gratuita
Es la capacidad máxima de contexto. Los tokens siguen facturándose.
Aplicar $2 a un prompt de 300K
Ese prompt ya está en el nivel largo de xAI.
Suponer que el gateway copia el nivel de xAI
OmniaKey tiene su propia relación de facturación; consulta su catálogo vivo.
Contar cada prefijo repetido como cache hit
Solo las lecturas informadas por el proveedor reciben la tarifa baja.
Comparar solo el precio por token
Reintentos, latencia, fallos de herramientas y reparación humana pueden dominar el coste.
Publicar una clave real
Usa variables de entorno y claves limitadas. Nunca pegues el valor real en un repositorio, issue o log de benchmark.
Preguntas frecuentes
¿Cuánto cuesta la API de Grok 4.6?
xAI publica $2 de entrada y $6 de salida por millón hasta 200K; después publica $4 y $12. La lectura de caché es $0.50 y $1.00 respectivamente.
¿Cuál es el ID de modelo de la API de Grok 4.6?
Usa grok-4.6. Fijar el ID exacto hace reproducibles las pruebas y presupuestos.
¿Grok 4.6 incluye 500K tokens gratis?
No. 500K es capacidad de contexto, no saldo gratuito.
¿Cuánto cuesta Grok 4.6 mediante OmniaKey?
El catálogo actual muestra $3.20 de entrada, $0.80 de lectura de caché y $9.60 de salida por millón en la cotización de contexto largo. Comprueba la página viva antes de comprar.
¿Grok 4.6 siempre es más barato que Claude o GPT?
No. Compara modelo, nivel de prompt, caché, reintentos y coste por tarea aceptada. El marco amplio está en la comparación de precios de APIs.
¿Puedo usar Grok 4.6 en un agente de código?
Sí, si el cliente admite el protocolo OpenAI-compatible o nativo de xAI y el catálogo expone grok-4.6. Comprueba la configuración exacta antes de producción.
Fuentes comprobadas
- xAI API y precios
- Documentación de precios de xAI
- Documentación de modelos de xAI
- Quickstart para desarrolladores de xAI
- Página de Grok 4.6 de OmniaKey
- Quickstart de API de OmniaKey
Verificado el 22 de agosto de 2026. Las tarifas de xAI, las condiciones de caché, los umbrales, la disponibilidad del gateway y las cotizaciones de plataforma pueden cambiar. Comprueba las fuentes primarias y el catálogo vivo antes de fijar un presupuesto de producción.