Ya están disponibles los principales modelos de imagen · GPT-Image, Nano Banana, Seedream y más
Blog
Guía

Reseña de GLM-5.3-FlashX

FlashX vende menos espera, no un nuevo nivel de inteligencia ya demostrado; su prima aproximada de 2,5 veces solo encaja en rutas sensibles a la latencia.

12 min de lecturaOmniaKey
GLM-5.3-FlashXGLM-5.3-Flashlatencia APIprecios APIreseña de modelo

Esta reseña de GLM-5.3-FlashX separa una ruta alojada más rápida de un modelo más capaz. Z.ai anuncia 200 tokens/s, pero no ha publicado una comparación de calidad Flash contra FlashX en igualdad de condiciones, una distribución de latencia ni la metodología de esa cifra.

El veredicto práctico es sencillo: prueba FlashX cuando una persona espera una respuesta larga en streaming o un bucle interactivo de herramientas. Mantén Flash para lotes, agentes en segundo plano y evaluaciones, donde pagar cerca de 2,5 veces por token rara vez crea valor medible.

Datos verificados el 19 de septiembre de 2026. Consultamos la documentación, los precios API, el informe de lanzamiento y la ficha abierta de Z.ai, además de los datos de Artificial Analysis para GLM-5.3-Flash normal. No dispusimos de credenciales FlashX facturables, no ejecutamos una prueba directa de latencia y no presentamos 200 tokens/s como resultado independiente.

Veredicto de la reseña

  • Prueba primero FlashX: programación interactiva, investigación en vivo, Computer Use, asistentes para clientes y salidas largas en streaming.
  • Conserva Flash como opción de valor: colas, extracción de documentos, revisión nocturna, datos sintéticos y automatización de gran volumen.
  • No cambies solo por calidad: Z.ai no publica un checkpoint FlashX separado ni una prueba emparejada de que responda mejor.

FlashX frente a Flash

CriterioGLM-5.3-FlashXGLM-5.3-Flash
ID del modelo APIglm-5.3-flashxglm-5.3-flash
Función documentadaRuta alojada más rápidaRuta económica y modelo de pesos abiertos
Evidencia de velocidadZ.ai anuncia 200 tokens/s sin método públicoArtificial Analysis midió una mediana de 98.6 tokens/s
Entrada / caché / salida$0.37 / $0.075 / $1.25 por 1M tokens$0.15 / $0.03 / $0.50
Contexto / salida máxima1M / 128K tokens1M / 128K tokens
EntradasVídeo, imagen, texto y archivosVídeo, imagen, texto y archivos
ThinkingObligatorio; no puede desactivarseObligatorio; no puede desactivarse
GLM Coding PlanNo incluido al verificarIncluido con 3 veces la cuota de GLM-5.3
Pesos públicosSin checkpoint propio documentadozai-org/GLM-5.3-Flash, licencia MIT

La documentación compartida respalda un mismo contrato público de capacidades, pero no demuestra que el serving interno, la consistencia, las tool calls o la fiabilidad sean idénticos.

La página de GLM-5.3-Flash mantiene el precio y estado actuales en OmniaKey. Que Z.ai ofrezca glm-5.3-flashx no implica que ese ID esté disponible en cualquier gateway; consulta el catálogo de modelos en vivo antes de cambiar el cliente.

Qué demuestra realmente 200 tokens/s

Z.ai no aclara si 200 es un pico, promedio o mediana, ni la región, prompt, longitud de salida, concurrencia, cómputo de reasoning tokens o p95. Tampoco publica el tiempo hasta el primer token.

text
latencia de extremo a extremo
  = espera en cola
  + procesamiento del prompt y primer token
  + tokens generados / velocidad de decodificación
  + tiempo de herramientas y red

A 200 tokens/s sostenidos, 100 tokens tardarían 0.5 segundos en decodificarse, 1,000 tardarían 5 y 4,000 tardarían 20. Es aritmética, no una medición de FlashX, y excluye todos los demás términos. Las respuestas cortas pueden depender del primer token y los prompts largos del prefill.

Hay datos independientes de Flash, no de FlashX

Artificial Analysis informa estos resultados para Flash normal mediante la API de Z.ai:

MétricaResultado de FlashAlcance
Intelligence Index41.9Evaluación independiente
Velocidad de salida mediana98.6 tokens/sMuestras de la API de Z.ai
Tiempo mediano al primer chunk2.43 segundosMuestras de la API de Z.ai
Coste por tarea de evaluación$0.253Mezcla de tareas del evaluador

Esto no es una prueba de FlashX. Dividir el titular 200 de Z.ai por la mediana independiente 98.6 y afirmar “2.03 veces más rápido” mezclaría métodos, fechas, cargas y condiciones distintas.

Z.ai también comunica para la familia Flash 84.3 en Terminal-Bench 2.1, 63.4 en DeepSWE v1.1, 56.3 en NL2Repo y 48.8 en AutomationBench. Son resultados de proveedor para GLM-5.3-Flash, no evidencia de una mejora de calidad de FlashX. La comparación de GLM-5.3 y GLM-5.2 para programación cubre la decisión generacional.

Precio de la API y ejemplo de coste

Z.ai publica estos precios de API directa en USD por millón de tokens:

ModeloEntradaEntrada en cachéAlmacenamiento de cachéSalida
GLM-5.3-Flash$0.15$0.03Gratis por tiempo limitado$0.50
GLM-5.3-FlashX$0.37$0.075Gratis por tiempo limitado$1.25
GLM-5.3$1.40$0.26Gratis por tiempo limitado$4.40

FlashX cuesta 2.47 veces más en entrada sin caché y 2.5 veces más en entrada almacenada y salida. “Gratis por tiempo limitado” se refiere al almacenamiento de caché, no elimina el cargo de lectura de entrada en caché.

Con 100K tokens de entrada sin caché y 20K de salida, Flash cuesta $0.0250, FlashX $0.0620 y GLM-5.3 completo $0.2280. Si 80K están en caché y 20K no, cuestan $0.0154 / $0.0384 / $0.1368. Ejecutar 1,000 veces el caso sin caché cuesta $25.00 / $62.00 / $228.00.

FlashX añade $0.037 por ejecución. Con un coste laboral de $30 por hora, equivale a unos 4.4 segundos. Es un umbral útil, no una medición que pruebe que FlashX ahorra 4.4 segundos.

Arquitectura y límites de integración

GLM-5.3-Flash tiene 320B parámetros totales y 18B activos por token, 45 capas y entrenamiento multimodal de 30T tokens. Combina atención sparse y linear. Z.ai afirma 3.01 veces menos cálculo de atención y 4.44 veces menos KV Cache que GLM-5.3. Son propiedades de la familia Flash, no cambios exclusivos de FlashX.

Los pesos de Flash normal tienen licencia MIT; en las fuentes revisadas, FlashX solo aparece como ID alojado. Thinking no puede desactivarse. Z.ai recomienda temperature: 1, top_p: 0.95, reasoning_effort: max, clear_thinking: false, stream: true y tool_stream: true para uso interactivo.

Un cliente que envíe thinking.type: "disabled" debe migrar antes. reasoning_effort: max puede aumentar los reasoning tokens y el tiempo total, aunque la decodificación sea rápida. Las entradas multimodales siguen necesitando controles de tamaño, formato, privacidad y retención.

Qué ruta elegir

Carga de trabajoEmpieza conMotivo
Programación o depuración interactivaFlashXUna persona espera razonamiento, herramientas y salida
Asistente con respuestas largasFlashX tras medir p95La latencia de cola afecta la experiencia
Computer Use o Browser UseFlashX tras medir éxitoCada turno bloquea la siguiente acción
Revisión nocturna o análisis CIFlashNadie suele esperar cada token
Extracción, clasificación o datos sintéticosFlashLa prima de 2.5 veces se acumula sin beneficio interactivo
Tarea difícil con fallo costosoCompara Flash, FlashX y GLM-5.3La tasa de aceptación puede importar más que velocidad y tarifa
Flujo de GLM Coding PlanFlashFlashX no está incluido actualmente

Un router de producción puede usar ambos: FlashX solo en el camino interactivo crítico y Flash para reintentos, indexación, resúmenes y posprocesado.

Cómo comparar FlashX correctamente

  1. Fija tareas cortas, largas, con herramientas y multimodales, más sus criterios de aceptación.
  2. Envía el mismo prompt inmutable y política de herramientas a los dos ID exactos.
  3. Aleatoriza el orden y mantén iguales región y franjas horarias.
  4. Registra primer chunk, velocidad, tiempo total y p50/p95.
  5. Registra entrada, caché, reasoning, salida y coste facturado.
  6. Evalúa resultados aceptados, tool calls, reintentos, errores y corrección humana.
  7. Repite con la concurrencia real para observar la variación.

La métrica principal debe ser coste por tarea aceptada dentro del presupuesto de latencia. La guía de modelos para agentes de programación explica por qué modelo y harness deben probarse juntos.

Veredicto final

GLM-5.3-FlashX se entiende mejor como un carril rápido de pago para la familia Flash. El titular de 200 tokens/s es prometedor y el coste adicional absoluto puede ser pequeño en solicitudes interactivas. La evidencia pública no demuestra un nuevo nivel de inteligencia, una mejora garantizada de 2 veces ni un SLA de extremo a extremo.

Usa FlashX donde esperar tenga valor medible y conserva Flash como referencia de coste en el resto.

Preguntas frecuentes

¿FlashX es más inteligente que Flash?

No hay evidencia pública que lo demuestre. Hay capacidades compartidas y benchmarks de la familia, pero no una comparación de calidad emparejada ni un checkpoint FlashX separado.

¿Alcanza realmente 200 tokens/s?

Es el titular oficial de Z.ai. No se publican método, percentil, región, concurrencia, forma del prompt o primer token, y esta reseña no lo reprodujo.

¿Cuánto cuesta FlashX?

$0.37 por millón de tokens de entrada sin caché, $0.075 por entrada almacenada y $1.25 por salida, alrededor de 2.5 veces el precio de Flash.

¿Admite contexto de 1M e imágenes?

Sí. La página compartida documenta 1M de contexto, hasta 128K de salida y entradas de vídeo, imagen, texto y archivos. El contexto largo no garantiza baja latencia.

Fuentes primarias

Evidencia y cálculos verificados el 19 de septiembre de 2026. Los ID, precios, acceso al Plan, latencia y disponibilidad en gateways pueden cambiar; revisa las fuentes y repite una prueba emparejada antes de mover producción.