GLM-5.3 vs GLM-5.2 para programar
GLM-5.3 conserva el modelo base de GLM-5.2, pero cambia la decisión mediante más post-training, nuevos niveles de esfuerzo y una migración incompatible de thinking.
GLM-5.3 vs GLM-5.2 para programar es ante todo una comparación de post-training, no de dos modelos base distintos. Z.ai afirma que ambas versiones usan la misma base. GLM-5.3 añade entrenamiento sobre entornos de ingeniería ejecutables y de largo horizonte, y reporta mejoras en coding, agents y seguridad.
La respuesta práctica depende del acceso. GLM-5.3 merece ser el primer candidato para trabajo difícil y prolongado, pero todavía no es un reemplazo directo de API en todas partes. El 14 de agosto de 2026 Z.ai lo habilitó para usuarios de GLM Coding Plan, mientras su página para desarrolladores seguía indicando "The GLM-5.3 API is coming soon." OmniaKey lista actualmente glm-5.2, no glm-5.3.
Verificado el 14 de agosto de 2026. Las especificaciones, benchmarks, parámetros de razonamiento, acceso de Coding Plan, estado de API y calendario de pesos se comprobaron en el anuncio y la documentación de Z.ai. Los resultados son cifras publicadas por Z.ai, no un benchmark independiente de OmniaKey. No indicamos precio de GLM-5.3 porque la tabla oficial aún no lo incluye.
GLM-5.3 vs GLM-5.2 de un vistazo
| Decisión | GLM-5.3 | GLM-5.2 |
|---|---|---|
| Modelo base | El mismo que 5.2 | Base compartida por ambas versiones |
| Cambio principal | Más post-training con flujos expertos largos | Stack anterior y punto de referencia |
| Ventana de contexto | 1M tokens | 1M tokens |
| Salida máxima | 128K tokens | 128K tokens |
| Thinking | Siempre activo | Puede activarse o desactivarse |
| Reasoning effort | low, high, max; por defecto max | Controles configurables existentes |
| Coding Plan | Disponible desde el lanzamiento | Disponible |
| API para desarrolladores | La página oficial dice coming soon | Disponible |
| Pesos abiertos | Anunciados para unas dos semanas después | Disponibles por la ruta actual |
| Catálogo OmniaKey | No listado todavía | Disponible como glm-5.2 |
Hay que separar dos preguntas:
- ¿Merece GLM-5.3 una evaluación? Sí, especialmente en coding de largo horizonte.
- ¿Conviene cambiar hoy todo el tráfico productivo? No, hasta verificar acceso, precio, cliente y migración.
La página de GLM-5.2 mantiene precio, ejemplo y disponibilidad en OmniaKey. La guía de precios de GLM-5.2 conserva el cálculo detallado. Esta página responde la decisión de actualización.
¿Qué cambió realmente en GLM-5.3?
Z.ai dice que GLM-5.3 usa exactamente el mismo modelo base que GLM-5.2. La mejora reportada procede de ampliar el sistema de post-training sobre tareas largas.
Esto importa: un número de versión nuevo no implica necesariamente más contexto, otra arquitectura o un corpus distinto. En este caso la ventaja reclamada es el comportamiento después de entrenar con más entornos, tareas diversas y flujos profesionales largos.
Z.ai describe unidades completas de ingeniería, no ejercicios aislados. El modelo puede tener que leer código y documentación, usar sistemas de cómputo y almacenamiento, diagnosticar un cuello de botella, implementar, experimentar y conservar la corrección hasta entregar.
La diferencia debe probarse en una cadena completa:
entender el objetivo
-> inspeccionar el entorno
-> planificar y editar
-> ejecutar herramientas y tests
-> diagnosticar fallos
-> verificar la entrega
Un prompt corto de autocomplete no mide la principal mejora que Z.ai atribuye a la versión.
Comparación oficial de benchmarks de coding
El informe publica estos resultados:
| Benchmark | GLM-5.3 | GLM-5.2 | Cambio reportado |
|---|---|---|---|
| Terminal-Bench 2.1 | 88.2 | 81.0 | +7.2 puntos |
| Terminal-Bench 3.0 | 28.3 | 4.6 | +23.7 puntos |
| DeepSWE v1.1 | 66.9 | 46.2 | +20.7 puntos |
| NL2Repo | 58.0 | 48.9 | +9.1 puntos |
| FrontierSWE | 78.1 | 67.5 | +10.6 puntos |
| SWE-Marathon v1.1 | 42.5 | 19.4 | +23.1 puntos |
| PostTrainBench | 39.8 | 31.7 | +8.1 puntos |
| Agents' Last Exam CLI | 28.5 | 23.8 | +4.7 puntos |
Z.ai también declara una mejora del 50% sobre GLM-5.2 en su Z.ai Code Bench privado. A esfuerzo Max, el gráfico muestra 34.5% con unos 75K tokens de salida por tarea para 5.3, frente a 23.4% con 96K para 5.2.
Estas cifras justifican evaluar 5.3, pero no demuestran una mejora universal del 50%. El benchmark privado no se puede reproducir desde el anuncio y los públicos dependen de harness, timeout, límites, muestreo y evaluación específicos.
Por ejemplo, Terminal-Bench 3.0 usó Claude Code 2.1.207, reasoning_effort=max, 400K de contexto, hasta 128K de salida, 600 turnos, diez horas y tres ejecuciones por tarea. Un smoke test local de cinco minutos es otro experimento.
También cambia el límite de seguridad
Z.ai añadió entornos de descubrimiento de vulnerabilidades y reporta:
| Benchmark de seguridad | GLM-5.3 | GLM-5.2 |
|---|---|---|
| CyberGym | 84.5 | 77.2 |
| ExploitBench | 54.4 | 24.4 |
| ExploitGym, dos horas | 105 tareas | 29 tareas |
| ExploitGym, seis horas | 130 tareas | 39 tareas |
Es evidencia útil para revisión defensiva autorizada, pero requiere controles más estrictos: permisos mínimos, ejecución aislada, red restringida, registro de herramientas y revisión humana de cambios sensibles.
La capacidad de un benchmark no concede autorización. Encontrar un exploit plausible no permite probarlo contra sistemas de terceros.
La migración de API rompe una opción de thinking
GLM-5.3 admite tres niveles:
{
"model": "glm-5.3",
"thinking": { "type": "enabled" },
"reasoning_effort": "max"
}
Los valores son low, high y max; Z.ai pone max como predeterminado y lo recomienda para coding.
GLM-5.3 ya no admite:
"thinking": { "type": "disabled" }
Z.ai indica que esa petición fallará. Antes de cambiar el ID, actualiza a:
{
"thinking": { "type": "enabled" },
"reasoning_effort": "low"
}
low es el reemplazo inicial más cercano para una ruta sin thinking. Después compara high y max con tareas reales. No cambies modelo y política de esfuerzo sin medir latencia, salida y aceptación.
Coding Plan no equivale a disponibilidad de API
En el lanzamiento existen tres estados:
- GLM Coding Plan: disponible para todos sus usuarios.
- API para desarrolladores: la página oficial dice coming soon.
- Pesos abiertos: previstos unas dos semanas después, tras evaluación y hardening.
No son intercambiables. Funcionar en ZCode o una suscripción no prueba que una API key acepte model: "glm-5.3". Anunciar pesos tampoco crea hoy un despliegue self-hosted listo para producción.
En la fecha comprobada, el catálogo de OmniaKey solo incluye glm-5.2 bajo Z.ai. Un modelo no listado debe fallar, no hacer fallback silencioso.
El precio de API de GLM-5.3 no está publicado
La tabla de Z.ai muestra GLM-5.2 a $1.40 por millón de tokens de entrada sin caché, $0.26 en caché y $4.40 de salida. Aún no contiene una fila para GLM-5.3.
No reutilices los precios de 5.2, no conviertas puntos de Coding Plan en un precio inventado y no llames precio oficial a la tarifa de un gateway externo.
Antes de migrar producción deben existir:
- tarifas oficiales de entrada, caché y salida;
- condiciones de almacenamiento o escritura de caché;
- disponibilidad regional del modelo y la API;
- límites y concurrencia;
- consumo real en cada reasoning effort.
Mientras tanto, GLM-5.2 sigue siendo la opción API medible. Consulta la guía de precios.
¿Debes actualizar desde GLM-5.2?
Evalúa GLM-5.3 cuando
- la tarea cruza muchos archivos, sistemas o verificaciones;
- GLM-5.2 pierde el plan durante secuencias largas de herramientas;
- predominan debugging difícil y cambios de repositorio;
- haces revisión de seguridad autorizada;
- puedes ejecutar pruebas parejas por una ruta soportada.
Mantén GLM-5.2 por ahora cuando
- necesitas hoy una API medida y disponible;
- producción ya es estable y el precio es conocido;
- tu cliente depende de
thinking.type: "disabled"; - la tarea es corta y ya pasa de forma fiable;
- aún no puedes igualar permisos, herramientas y aceptación en 5.3.
El número de versión no decide. Actualiza cuando mejore el coste por tarea aceptada o la fiabilidad de tu carga.
Cómo ejecutar una prueba justa
Mantén constantes:
| Control | Condición idéntica |
|---|---|
| Repositorio | Mismo commit y dependencias |
| Prompt | Mismo objetivo, límites y definición de terminado |
| Harness | Misma versión y gestión de contexto |
| Permisos | Mismo filesystem, shell, red y aprobaciones |
| Herramientas | Mismo conjunto y servicios externos |
| Presupuesto | Timeout, turnos y esfuerzo comparables |
| Verificación | Mismos tests, lint, build y revisión |
Registra pass rate, tiempo, input, caché, output, reintentos, fallos de herramientas, corrección humana y coste. Repite porque los agents largos varían.
La guía de modelos de coding explica cómo enrutar clases de tareas sin declarar un ganador universal.
Veredicto final
GLM-5.3 es una versión de coding con cambios sustanciales, no un nuevo número cosmético. Las mejoras reportadas justifican ponerlo primero en evaluaciones difíciles.
Todavía es pronto para sustituir universalmente GLM-5.2: la API está coming soon, no hay precio por token, los pesos llegarán después y la configuración de thinking exige migración.
Usa GLM-5.2 si hoy necesitas una API conocida y medida. Evalúa GLM-5.3 para trabajo largo y cambia solo cuando existan pruebas parejas y economía real de API.
Preguntas frecuentes
¿GLM-5.3 es mejor que GLM-5.2 para programar?
Z.ai reporta mejores resultados en su Code Bench y en varios benchmarks públicos. Es el candidato más fuerte para evaluar, no una garantía universal.
¿GLM-5.3 usa un modelo base nuevo?
No. Z.ai afirma que comparte la misma base con GLM-5.2; la mejora procede del post-training.
¿Está disponible la API de GLM-5.3?
Está disponible para Coding Plan desde el 14 de agosto de 2026, pero la página para desarrolladores todavía dice API coming soon.
¿Cuánto cuesta la API de GLM-5.3?
La tabla oficial aún no lista GLM-5.3. No existe un precio oficial por token que podamos citar y el de 5.2 no sirve como marcador.
¿Qué se rompe al migrar?
GLM-5.3 no admite thinking.type: "disabled". Hay que activar thinking y poner reasoning_effort en low antes de cambiar el modelo.
¿Puedo usar GLM-5.3 con OmniaKey ahora?
No en la fecha de verificación. OmniaKey lista glm-5.2 y no sustituye silenciosamente modelos no disponibles.
Fuentes comprobadas
- Z.ai: anuncio de GLM-5.3
- Z.ai: página para desarrolladores de GLM-5.3
- Z.ai: precios de API
- Z.ai: página de GLM-5.2
- Catálogo activo de OmniaKey
Datos comprobados el 14 de agosto de 2026. Acceso, disponibilidad, precios, pesos, documentación de benchmarks y soporte de clientes pueden cambiar. Verifica las fuentes antes de migrar producción.