Precios de la API de GLM-5.2
Z.ai publica $1.40 de entrada, $0.26 de entrada en caché y $4.40 de salida por millón de tokens de GLM-5.2. OmniaKey cobra actualmente el 50% de esas tarifas.
Los precios de la API de GLM-5.2 oficiales son $1.40 por millón de tokens de entrada, $0.26 por millón de tokens de entrada en caché y $4.40 por millón de tokens de salida. OmniaKey muestra actualmente el mismo modelo a $0.70 de entrada, $0.13 de entrada en caché y $2.20 de salida.
La proporción es sencilla, pero no todas las peticiones cuestan la mitad del precio de entrada multiplicado por el total. Una llamada puede incluir entrada sin caché, entrada en caché y salida generada, cada una con su propia tarifa.
Precios verificados el 9 de agosto de 2026. La columna de Z.ai procede de su página internacional para desarrolladores. La columna de OmniaKey es la tarifa actual de la plataforma, no un nuevo precio oficial de Z.ai. Las tarifas y promociones pueden cambiar; revisa ambas páginas antes de comprometer un presupuesto de producción.
Actualización de GLM-5.3: Z.ai lanzó GLM-5.3 para usuarios de Coding Plan el 14 de agosto, pero la página de developer API sigue diciendo coming soon y la tabla oficial no tiene una fila 5.3. Usa la comparación GLM-5.3 vs GLM-5.2 para decidir la actualización; las tarifas siguientes siguen siendo exclusivas de GLM-5.2.
Precios de la API de GLM-5.2 de un vistazo
Todos los valores son dólares por un millón de tokens.
| Tipo de uso | Tarifa oficial de Z.ai | Tarifa actual de OmniaKey | Diferencia actual |
|---|---|---|---|
| Entrada sin caché | $1.40 | $0.70 | 50% menos |
| Entrada en caché | $0.26 | $0.13 | 50% menos |
| Salida | $4.40 | $2.20 | 50% menos |
La página del modelo GLM-5.2 muestra la tarifa actual de OmniaKey, el contexto, las capacidades y un ejemplo de petición. Usa el catálogo de modelos para compararlo con otras opciones.
La ecuación general es:
coste = millones_entrada_sin_caché × tarifa_entrada
+ millones_entrada_en_caché × tarifa_caché
+ millones_salida × tarifa_salida
El sistema de facturación cuenta tokens, no caracteres ni tamaño de archivo. Un millón de caracteres no equivale necesariamente a un millón de tokens.
Qué significa cada precio de GLM-5.2
Entrada sin caché
La entrada sin caché incluye contenido que no obtiene un cache hit: instrucciones, historial, archivos, definiciones de herramientas y demás contexto. Un millón de tokens cuesta $1.40 a tarifa oficial o $0.70 con la tarifa actual de OmniaKey, antes de generar salida.
Entrada en caché
La entrada en caché es contexto repetido elegible que se sirve a la tarifa de lectura reducida. Z.ai publica $0.26 por millón de tokens en caché; OmniaKey, $0.13.
Que exista una tarifa de caché no garantiza que cada token repetido la reciba. Importan la estructura de la petición, la caducidad y el comportamiento del proveedor. Comprueba los registros reales en vez de valorar cualquier Prompt repetido a precio de caché.
Almacenamiento de entrada en caché
La tabla de Z.ai muestra por separado el almacenamiento cached-input como “Limited-time Free”. No es la misma partida que la lectura a $0.26. La duración y las condiciones de una promoción de almacenamiento pueden cambiar independientemente; no lo trates como gratuito para siempre.
Salida
La salida incluye los tokens generados de respuesta y reasoning que aparecen en la facturación. Un millón cuesta $4.40 a tarifa oficial o $2.20 en OmniaKey. Es la partida más cara por token.
Respuestas largas, bucles verbosos de herramientas, correcciones repetidas y límites de salida altos pueden pesar más que un pequeño cambio en el Prompt. Limita la respuesta según la tarea en vez de pedir siempre el máximo.
Tres ejemplos de coste reproducibles
Los ejemplos aplican directamente las tarifas publicadas. Excluyen cargos separados por herramientas, impuestos, cambio de moneda y futuros cambios de precio.
Ejemplo 1: leer un repositorio grande
Supón que una tarea usa un millón de tokens de entrada sin caché y produce 100 000 tokens de salida.
| Cálculo | Z.ai oficial | OmniaKey actual |
|---|---|---|
| Entrada | 1 × $1.40 = $1.40 | 1 × $0.70 = $0.70 |
| Salida | 0.1 × $4.40 = $0.44 | 0.1 × $2.20 = $0.22 |
| Total | $1.84 | $0.92 |
La ventana de un millón de tokens es capacidad, no uso incluido. Llenarla con entrada sin caché genera un cargo aunque el modelo responda brevemente.
Ejemplo 2: una carga de ingeniería larga
Supón que varias llamadas suman diez millones de tokens de entrada sin caché y dos millones de salida.
Z.ai: 10 × $1.40 + 2 × $4.40 = $22.80
OmniaKey: 10 × $0.70 + 2 × $2.20 = $11.40
Es el total de una carga, no una estimación de Benchmark. El consumo real depende del cliente, Prompt, repositorio, herramientas, reintentos y comportamiento del modelo.
Ejemplo 3: contexto repetido en caché
Supón que diez millones de tokens se facturan como entrada en caché y el modelo produce un millón de tokens de salida.
Z.ai: 10 × $0.26 + 1 × $4.40 = $7.00
OmniaKey: 10 × $0.13 + 1 × $2.20 = $3.50
El ejemplo solo vale cuando el proveedor informa esos diez millones como cache hits. Un Prompt visualmente idéntico no garantiza el mismo tratamiento.
Por qué el precio de OmniaKey difiere del de Z.ai
Z.ai publica las tarifas internacionales de su API upstream. OmniaKey publica el precio cobrado mediante su gateway prepago. En la fecha de verificación, OmniaKey aplica un factor de 0.5 a la entrada sin caché, entrada en caché y salida de GLM-5.2.
Las columnas describen relaciones de facturación distintas:
- usa Z.ai al presupuestar una cuenta directa de Z.ai;
- usa OmniaKey cuando el consumo se descuenta de un saldo de OmniaKey;
- no combines la entrada de una plataforma con la salida de otra;
- no supongas que la diferencia actual del 50% es permanente.
OmniaKey no cambia el model id solicitado para crear esta diferencia. La petición sigue nombrando glm-5.2; si no está disponible, falla en vez de sustituirlo silenciosamente.
Para el criterio contable general, consulta cómo debe funcionar una facturación API transparente.
Qué ofrece GLM-5.2 por ese precio
Z.ai posiciona GLM-5.2 como su modelo insignia para tareas largas. Su página oficial enumera:
- ventana de contexto de un millón de tokens;
- hasta 128 000 tokens de salida;
- modos de thinking y reasoning effort configurable;
- respuestas en streaming;
- function calling e integración MCP;
- structured output;
- context caching.
Son hechos de capacidad e interfaz, no una garantía de que cada cliente exponga cada opción. Una ruta compatible mediante gateway tampoco equivale a soporte nativo en cualquier producto de programación.
No deduzcas un ganador universal de calidad a partir de precios. Z.ai publica Benchmarks y afirmaciones de producto, pero este artículo no los reproduce de forma independiente.
Cuándo puede tener sentido económico GLM-5.2
GLM-5.2 es candidata razonable cuando necesitas:
- contexto de proyecto con código, pruebas, documentación y restricciones;
- implementación o refactorización larga y multietapa;
- llamadas estructuradas a herramientas y salida legible por máquinas;
- contexto repetido que pueda optar a facturación en caché;
- límite de salida alto para artefactos grandes.
Puede ser una mala opción para clasificación pequeña, extracción corta o edición mecánica que un modelo menor complete con fiabilidad. Importa más el modelo exitoso más barato para cada clase que el mayor porcentaje de descuento.
La guía para elegir modelos de programación explica por qué debes enrutar según trabajo aceptado y no por una tarifa aislada.
Mide el coste por tarea aceptada
Para comparar GLM-5.2 con otro modelo, mantén constantes el estado del repositorio, Prompt, herramientas, permisos y prueba de aceptación. Registra:
- tokens sin caché, en caché y de salida;
- turnos del modelo y llamadas a herramientas;
- latencia e intentos fallidos;
- tiempo de corrección humana;
- pruebas y criterios de aceptación superados;
- coste final facturado.
Un modelo con tarifa menor puede costar más si provoca reintentos. Uno más caro puede ser económico cuando resuelve trabajo difícil en menos intentos. Repite cada tarea porque los resultados de agentes varían.
Llama a GLM-5.2 mediante OmniaKey
Crea una clave acotada en el panel de API Keys y usa la ruta Chat Completions compatible con OpenAI:
curl https://api.omniakey.com/v1/chat/completions \
-H "Authorization: Bearer $OMNIAKEY_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.2",
"messages": [{"role": "user", "content": "Review this migration plan"}],
"stream": true
}'
Usa el id exacto glm-5.2. La guía rápida de la API documenta endpoint y autenticación.
Tras una tarea representativa, compara el reporte del cliente con el dashboard de uso. La guía de saldo y uso explica registros por llamada y topes de claves.
Controla el presupuesto sin confundir topes con ahorro
Un tope de gasto limita exposición financiera; no reduce tokens por debajo de él. Usa claves distintas para trabajo local, CI y automatización compartida para separar atribución y revocación.
Una secuencia práctica:
- ejecuta una tarea representativa;
- inspecciona entrada sin caché, en caché y salida reales;
- elimina contexto y reintentos evitables;
- fija un tope por encima de la variación normal;
- revisa el uso antes de aumentarlo.
Para optimización de contexto, consulta la guía para reducir consumo de tokens. Sus comandos son específicos de Claude Code, pero los principios sirven para otros agentes.
Errores habituales de precios
Tratar el contexto 1M como cuota gratuita
La ventana es capacidad máxima. La entrada que colocas dentro sigue siendo medible.
Confundir lectura de caché y almacenamiento
Z.ai enumera una tarifa por cache hit y una promoción temporal de storage por separado. No son intercambiables.
Valorar cualquier Prompt repetido como caché
Solo los cache hits informados por el proveedor reciben la tarifa. Comprueba el detalle real.
Comparar sin medir volumen de salida
La salida cuesta más por token. Reasoning excesivo y parches repetidos pueden borrar el ahorro del Prompt.
Tratar el descuento actual como contrato permanente
El factor del 50% de OmniaKey es actual a 9 de agosto de 2026. Revisa el catálogo antes de presupuestar o comprar.
Llamar victoria de Benchmark a una tarifa baja
El precio mide facturación, no corrección, latencia, fiabilidad de herramientas o finalización. Prueba la carga real.
Preguntas frecuentes
¿Cuánto cuesta la API de GLM-5.2?
Z.ai publica $1.40 por millón de tokens de entrada sin caché, $0.26 por millón en caché y $4.40 por millón de salida. OmniaKey muestra actualmente $0.70, $0.13 y $2.20.
¿Es más barato GLM-5.2 mediante OmniaKey?
En la verificación del 9 de agosto de 2026, sí: las tarifas de OmniaKey son el 50% de las internacionales de Z.ai. Es un precio actual de plataforma, no un cambio permanente de Z.ai.
¿Cuánto cuesta un Prompt GLM-5.2 de un millón de tokens?
Un millón de tokens de entrada sin caché cuesta $1.40 en Z.ai o $0.70 en OmniaKey antes de la salida. Si el millón completo figura como entrada en caché, las lecturas cuestan $0.26 y $0.13.
¿Tiene GLM-5.2 contexto de 1M?
Sí. Z.ai indica un millón de tokens de contexto y máximo de salida de 128 000. La capacidad no significa que la ventana sea gratis o siempre necesaria.
¿Admite GLM-5.2 herramientas y structured output?
Z.ai enumera function calling, MCP, structured output, streaming, thinking modes y context caching. Verifica qué expone el cliente y la ruta exactos antes de producción.
Fuentes
- Z.ai: precios de API
- Z.ai: modelo GLM-5.2
- Z.ai: API Chat Completions
- Página GLM-5.2 de OmniaKey
- Documentación de saldo y uso de OmniaKey
Datos verificados el 9 de agosto de 2026. Las tarifas, descuentos, condiciones de caché y funciones admitidas pueden cambiar. Revisa la documentación primaria y el catálogo vivo de OmniaKey antes de comprometer un presupuesto de producción.