Test de GLM-5.3-FlashX
FlashX vend moins d'attente, pas un nouveau niveau d'intelligence déjà démontré. Son tarif environ 2,5 fois supérieur ne vise que les parcours sensibles à la latence.
Ce test de GLM-5.3-FlashX distingue une route hébergée plus rapide d'un modèle plus performant. Z.ai annonce 200 tokens/s, mais ne publie ni comparaison de qualité Flash contre FlashX à conditions égales, ni distribution de latence, ni méthode de mesure de ce chiffre.
Le verdict pratique est simple : testez FlashX lorsqu'une personne attend une longue réponse en streaming ou une boucle d'outils interactive. Gardez Flash pour le batch, les agents en arrière-plan et les évaluations, où payer environ 2,5 fois plus par token crée rarement une valeur mesurable.
Faits vérifiés le 19 septembre 2026. Nous avons consulté la documentation, les tarifs API, l'article de lancement et la fiche ouverte de Z.ai, ainsi que les données d'Artificial Analysis pour GLM-5.3-Flash standard. Sans identifiants FlashX facturables, nous n'avons pas réalisé de test de latence direct et ne présentons pas 200 tokens/s comme un résultat indépendant.
Le verdict en bref
- Tester FlashX d'abord : code interactif, recherche en direct, Computer Use, assistants client et longues sorties en streaming.
- Garder Flash comme choix économique : files d'attente, extraction, revue nocturne, données synthétiques et automatisation massive.
- Ne pas migrer pour la qualité seule : Z.ai ne fournit ni checkpoint FlashX distinct ni preuve appariée d'une meilleure réponse.
FlashX face à Flash
| Critère | GLM-5.3-FlashX | GLM-5.3-Flash |
|---|---|---|
| ID de modèle API | glm-5.3-flashx | glm-5.3-flash |
| Rôle documenté | Route hébergée plus rapide | Route économique et modèle open-weight |
| Preuve de vitesse | Z.ai annonce 200 tokens/s, méthode non publiée | Médiane Artificial Analysis de 98.6 tokens/s |
| Entrée / cache / sortie | $0.37 / $0.075 / $1.25 par 1M tokens | $0.15 / $0.03 / $0.50 |
| Contexte / sortie maximale | 1M / 128K tokens | 1M / 128K tokens |
| Entrées | Vidéo, image, texte et fichiers | Vidéo, image, texte et fichiers |
| Thinking | Obligatoire, impossible à désactiver | Obligatoire, impossible à désactiver |
| GLM Coding Plan | Non inclus à la date de vérification | Inclus avec 3 fois le quota GLM-5.3 |
| Poids publics | Aucun checkpoint séparé documenté | zai-org/GLM-5.3-Flash, licence MIT |
La documentation commune confirme le même contrat public de capacités. Elle ne prouve pas que le serving interne, la régularité des sorties, les tool calls ou la fiabilité sont identiques.
La page du modèle GLM-5.3-Flash reste la référence pour le tarif et l'état de la route chez OmniaKey. L'existence de glm-5.3-flashx chez Z.ai ne garantit pas sa présence dans chaque gateway ; vérifiez le catalogue de modèles en direct avant toute modification.
Ce que prouvent réellement 200 tokens/s
Z.ai ne précise pas si 200 est un pic, une moyenne ou une médiane. La région, le prompt, la longueur de sortie, la concurrence, le comptage des reasoning tokens et le p95 ne sont pas publiés. Le temps jusqu'au premier token manque aussi.
latence de bout en bout
= attente en file
+ traitement du prompt et premier token
+ tokens générés / débit de décodage
+ temps des outils et du réseau
À 200 tokens/s parfaitement soutenus, 100 tokens prennent 0.5 seconde à décoder, 1,000 en prennent 5 et 4,000 en prennent 20. C'est un calcul, pas une mesure FlashX. Le premier token peut dominer une réponse courte, et le prefill un long prompt.
Les données indépendantes concernent Flash
Artificial Analysis publie ces résultats pour Flash standard via l'API Z.ai :
| Mesure | Flash standard | Portée |
|---|---|---|
| Intelligence Index | 41.9 | Évaluation indépendante |
| Débit de sortie médian | 98.6 tokens/s | Échantillons de l'API Z.ai |
| Temps médian jusqu'au premier chunk | 2.43 secondes | Échantillons de l'API Z.ai |
| Coût par tâche d'évaluation | $0.253 | Mélange de tâches de l'évaluateur |
Ce n'est pas un test de FlashX. Diviser les 200 de Z.ai par la médiane indépendante 98.6 pour annoncer « 2.03 fois plus rapide » mélangerait méthodes, dates, charges et conditions de trafic.
Z.ai rapporte aussi 84.3 sur Terminal-Bench 2.1, 63.4 sur DeepSWE v1.1, 56.3 sur NL2Repo et 48.8 sur AutomationBench pour la famille Flash. Ces résultats vendor-run de GLM-5.3-Flash ne prouvent aucun gain qualitatif de FlashX. Le comparatif GLM-5.3 contre GLM-5.2 pour le code traite le choix de génération.
Prix API et exemple de coût
Z.ai affiche les tarifs directs suivants en USD par million de tokens :
| Modèle | Entrée | Entrée en cache | Stockage cache | Sortie |
|---|---|---|---|---|
| GLM-5.3-Flash | $0.15 | $0.03 | Gratuit pour une durée limitée | $0.50 |
| GLM-5.3-FlashX | $0.37 | $0.075 | Gratuit pour une durée limitée | $1.25 |
| GLM-5.3 | $1.40 | $0.26 | Gratuit pour une durée limitée | $4.40 |
FlashX coûte 2.47 fois plus pour l'entrée non mise en cache et exactement 2.5 fois plus pour l'entrée en cache et la sortie. La gratuité temporaire concerne le stockage du cache, pas les lectures d'entrée en cache.
Avec 100K tokens d'entrée non cachée et 20K de sortie, Flash coûte $0.0250, FlashX $0.0620 et GLM-5.3 complet $0.2280. Avec 80K en cache et 20K non cachés, les coûts sont $0.0154 / $0.0384 / $0.1368. Mille exécutions du cas non caché coûtent $25.00 / $62.00 / $228.00.
Le surcoût de FlashX est de $0.037 par exécution. À $30 de coût horaire, cela représente environ 4.4 secondes de travail humain. C'est un seuil de décision, pas la preuve de 4.4 secondes gagnées.
Architecture et limites d'intégration
GLM-5.3-Flash compte 320B paramètres au total et 18B actifs par token, sur 45 couches, avec un entraînement multimodal de 30T tokens. Il combine sparse attention et linear attention. Z.ai annonce 3.01 fois moins de calcul d'attention et 4.44 fois moins de KV Cache que GLM-5.3. Ce sont des propriétés de la famille Flash, pas des changements propres à FlashX.
Les poids de Flash standard sont sous licence MIT. Dans les sources vérifiées, FlashX n'existe que comme ID hébergé. Thinking ne peut pas être désactivé ; Z.ai recommande temperature: 1, top_p: 0.95, reasoning_effort: max, clear_thinking: false, stream: true et tool_stream: true en interactif.
Un client qui envoie thinking.type: "disabled" doit d'abord migrer. reasoning_effort: max peut augmenter les reasoning tokens et la durée totale même si le décodage est rapide. Les entrées multimodales exigent toujours des contrôles de taille, format, confidentialité et conservation.
Quelle route choisir ?
| Charge | Commencer par | Pourquoi |
|---|---|---|
| Code ou débogage interactif | FlashX | Une personne attend le raisonnement, les outils et la sortie |
| Assistant client à réponse longue | FlashX après test p95 | La latence de queue affecte l'expérience |
| Computer Use ou Browser Use | FlashX après test de réussite | Chaque tour bloque l'action suivante |
| Revue nocturne ou analyse CI | Flash | Personne n'attend chaque token |
| Extraction, classification, données synthétiques | Flash | Le prix 2.5 fois supérieur s'accumule sans gain interactif |
| Tâche difficile où l'échec coûte cher | Comparer Flash, FlashX et GLM-5.3 | Le taux d'acceptation peut primer sur vitesse et tarif |
| Flux GLM Coding Plan | Flash | FlashX n'est pas inclus actuellement |
Un routeur de production peut employer les deux ID : FlashX sur le chemin interactif critique, Flash pour les relances, l'indexation, les résumés et le post-traitement.
Comment comparer FlashX correctement
- Figer des tâches courtes, longues, tool-heavy et multimodales avec leurs critères d'acceptation.
- Envoyer le même prompt immuable et la même politique d'outils aux deux ID exacts.
- Aléatoiriser l'ordre et conserver la même région et les mêmes créneaux.
- Mesurer premier chunk, débit, temps total et p50/p95.
- Enregistrer entrée, cache, reasoning, sortie et coût facturé.
- Noter acceptation, tool calls, relances, erreurs et correction humaine.
- Répéter avec une concurrence réaliste pour voir la variance.
La métrique principale doit être le coût par tâche acceptée dans le budget de latence. Le guide des modèles pour agents de code (en anglais) explique pourquoi modèle et harness doivent être testés ensemble.
Verdict final
GLM-5.3-FlashX est avant tout une voie rapide payante de la famille Flash. Les 200 tokens/s sont prometteurs et le surcoût absolu peut être faible pour une requête interactive. Les preuves publiques n'établissent ni un nouveau niveau d'intelligence, ni une vitesse garantie doublée, ni un SLA de bout en bout.
Utilisez FlashX lorsque l'attente a une valeur mesurable et gardez Flash comme référence de coût ailleurs.
Questions fréquentes
FlashX est-il plus intelligent que Flash ?
Aucune preuve publique ne l'établit. Les capacités et benchmarks de famille sont communs, sans comparaison qualitative appariée ni checkpoint FlashX séparé.
Atteint-il vraiment 200 tokens/s ?
C'est l'annonce officielle de Z.ai. Méthode, percentile, région, concurrence, forme du prompt et premier token ne sont pas publiés, et ce test ne l'a pas reproduite.
Combien coûte FlashX ?
$0.37 par million de tokens d'entrée non cachée, $0.075 pour l'entrée en cache et $1.25 pour la sortie, soit environ 2.5 fois Flash.
Prend-il en charge 1M de contexte et les images ?
Oui. La page commune documente 1M de contexte, jusqu'à 128K de sortie et les entrées vidéo, image, texte et fichier. Un long contexte ne garantit pas une faible latence.
Sources primaires
- Documentation Z.ai de GLM-5.3-Flash et FlashX (anglais)
- Tarifs API Z.ai (anglais)
- Article de lancement GLM-5.3-Flash (anglais)
- Fiche ouverte GLM-5.3-Flash (anglais)
- Résultats Artificial Analysis (anglais)
Preuves et calculs vérifiés le 19 septembre 2026. ID, prix, accès au Plan, latence et disponibilité gateway peuvent changer ; revérifiez les sources et lancez un test apparié avant de déplacer le trafic de production.