Les principaux modèles d’image sont disponibles · GPT-Image, Nano Banana, Seedream et plus
Blogue
Guider

Test de GLM-5.3-FlashX

FlashX vend moins d'attente, pas un nouveau niveau d'intelligence déjà démontré. Son tarif environ 2,5 fois supérieur ne vise que les parcours sensibles à la latence.

12 minutes de lectureOmniaKey
GLM-5.3-FlashXGLM-5.3-Flashlatence APIprix APItest de modèle

Ce test de GLM-5.3-FlashX distingue une route hébergée plus rapide d'un modèle plus performant. Z.ai annonce 200 tokens/s, mais ne publie ni comparaison de qualité Flash contre FlashX à conditions égales, ni distribution de latence, ni méthode de mesure de ce chiffre.

Le verdict pratique est simple : testez FlashX lorsqu'une personne attend une longue réponse en streaming ou une boucle d'outils interactive. Gardez Flash pour le batch, les agents en arrière-plan et les évaluations, où payer environ 2,5 fois plus par token crée rarement une valeur mesurable.

Faits vérifiés le 19 septembre 2026. Nous avons consulté la documentation, les tarifs API, l'article de lancement et la fiche ouverte de Z.ai, ainsi que les données d'Artificial Analysis pour GLM-5.3-Flash standard. Sans identifiants FlashX facturables, nous n'avons pas réalisé de test de latence direct et ne présentons pas 200 tokens/s comme un résultat indépendant.

Le verdict en bref

  • Tester FlashX d'abord : code interactif, recherche en direct, Computer Use, assistants client et longues sorties en streaming.
  • Garder Flash comme choix économique : files d'attente, extraction, revue nocturne, données synthétiques et automatisation massive.
  • Ne pas migrer pour la qualité seule : Z.ai ne fournit ni checkpoint FlashX distinct ni preuve appariée d'une meilleure réponse.

FlashX face à Flash

CritèreGLM-5.3-FlashXGLM-5.3-Flash
ID de modèle APIglm-5.3-flashxglm-5.3-flash
Rôle documentéRoute hébergée plus rapideRoute économique et modèle open-weight
Preuve de vitesseZ.ai annonce 200 tokens/s, méthode non publiéeMédiane Artificial Analysis de 98.6 tokens/s
Entrée / cache / sortie$0.37 / $0.075 / $1.25 par 1M tokens$0.15 / $0.03 / $0.50
Contexte / sortie maximale1M / 128K tokens1M / 128K tokens
EntréesVidéo, image, texte et fichiersVidéo, image, texte et fichiers
ThinkingObligatoire, impossible à désactiverObligatoire, impossible à désactiver
GLM Coding PlanNon inclus à la date de vérificationInclus avec 3 fois le quota GLM-5.3
Poids publicsAucun checkpoint séparé documentézai-org/GLM-5.3-Flash, licence MIT

La documentation commune confirme le même contrat public de capacités. Elle ne prouve pas que le serving interne, la régularité des sorties, les tool calls ou la fiabilité sont identiques.

La page du modèle GLM-5.3-Flash reste la référence pour le tarif et l'état de la route chez OmniaKey. L'existence de glm-5.3-flashx chez Z.ai ne garantit pas sa présence dans chaque gateway ; vérifiez le catalogue de modèles en direct avant toute modification.

Ce que prouvent réellement 200 tokens/s

Z.ai ne précise pas si 200 est un pic, une moyenne ou une médiane. La région, le prompt, la longueur de sortie, la concurrence, le comptage des reasoning tokens et le p95 ne sont pas publiés. Le temps jusqu'au premier token manque aussi.

text
latence de bout en bout
  = attente en file
  + traitement du prompt et premier token
  + tokens générés / débit de décodage
  + temps des outils et du réseau

À 200 tokens/s parfaitement soutenus, 100 tokens prennent 0.5 seconde à décoder, 1,000 en prennent 5 et 4,000 en prennent 20. C'est un calcul, pas une mesure FlashX. Le premier token peut dominer une réponse courte, et le prefill un long prompt.

Les données indépendantes concernent Flash

Artificial Analysis publie ces résultats pour Flash standard via l'API Z.ai :

MesureFlash standardPortée
Intelligence Index41.9Évaluation indépendante
Débit de sortie médian98.6 tokens/sÉchantillons de l'API Z.ai
Temps médian jusqu'au premier chunk2.43 secondesÉchantillons de l'API Z.ai
Coût par tâche d'évaluation$0.253Mélange de tâches de l'évaluateur

Ce n'est pas un test de FlashX. Diviser les 200 de Z.ai par la médiane indépendante 98.6 pour annoncer « 2.03 fois plus rapide » mélangerait méthodes, dates, charges et conditions de trafic.

Z.ai rapporte aussi 84.3 sur Terminal-Bench 2.1, 63.4 sur DeepSWE v1.1, 56.3 sur NL2Repo et 48.8 sur AutomationBench pour la famille Flash. Ces résultats vendor-run de GLM-5.3-Flash ne prouvent aucun gain qualitatif de FlashX. Le comparatif GLM-5.3 contre GLM-5.2 pour le code traite le choix de génération.

Prix API et exemple de coût

Z.ai affiche les tarifs directs suivants en USD par million de tokens :

ModèleEntréeEntrée en cacheStockage cacheSortie
GLM-5.3-Flash$0.15$0.03Gratuit pour une durée limitée$0.50
GLM-5.3-FlashX$0.37$0.075Gratuit pour une durée limitée$1.25
GLM-5.3$1.40$0.26Gratuit pour une durée limitée$4.40

FlashX coûte 2.47 fois plus pour l'entrée non mise en cache et exactement 2.5 fois plus pour l'entrée en cache et la sortie. La gratuité temporaire concerne le stockage du cache, pas les lectures d'entrée en cache.

Avec 100K tokens d'entrée non cachée et 20K de sortie, Flash coûte $0.0250, FlashX $0.0620 et GLM-5.3 complet $0.2280. Avec 80K en cache et 20K non cachés, les coûts sont $0.0154 / $0.0384 / $0.1368. Mille exécutions du cas non caché coûtent $25.00 / $62.00 / $228.00.

Le surcoût de FlashX est de $0.037 par exécution. À $30 de coût horaire, cela représente environ 4.4 secondes de travail humain. C'est un seuil de décision, pas la preuve de 4.4 secondes gagnées.

Architecture et limites d'intégration

GLM-5.3-Flash compte 320B paramètres au total et 18B actifs par token, sur 45 couches, avec un entraînement multimodal de 30T tokens. Il combine sparse attention et linear attention. Z.ai annonce 3.01 fois moins de calcul d'attention et 4.44 fois moins de KV Cache que GLM-5.3. Ce sont des propriétés de la famille Flash, pas des changements propres à FlashX.

Les poids de Flash standard sont sous licence MIT. Dans les sources vérifiées, FlashX n'existe que comme ID hébergé. Thinking ne peut pas être désactivé ; Z.ai recommande temperature: 1, top_p: 0.95, reasoning_effort: max, clear_thinking: false, stream: true et tool_stream: true en interactif.

Un client qui envoie thinking.type: "disabled" doit d'abord migrer. reasoning_effort: max peut augmenter les reasoning tokens et la durée totale même si le décodage est rapide. Les entrées multimodales exigent toujours des contrôles de taille, format, confidentialité et conservation.

Quelle route choisir ?

ChargeCommencer parPourquoi
Code ou débogage interactifFlashXUne personne attend le raisonnement, les outils et la sortie
Assistant client à réponse longueFlashX après test p95La latence de queue affecte l'expérience
Computer Use ou Browser UseFlashX après test de réussiteChaque tour bloque l'action suivante
Revue nocturne ou analyse CIFlashPersonne n'attend chaque token
Extraction, classification, données synthétiquesFlashLe prix 2.5 fois supérieur s'accumule sans gain interactif
Tâche difficile où l'échec coûte cherComparer Flash, FlashX et GLM-5.3Le taux d'acceptation peut primer sur vitesse et tarif
Flux GLM Coding PlanFlashFlashX n'est pas inclus actuellement

Un routeur de production peut employer les deux ID : FlashX sur le chemin interactif critique, Flash pour les relances, l'indexation, les résumés et le post-traitement.

Comment comparer FlashX correctement

  1. Figer des tâches courtes, longues, tool-heavy et multimodales avec leurs critères d'acceptation.
  2. Envoyer le même prompt immuable et la même politique d'outils aux deux ID exacts.
  3. Aléatoiriser l'ordre et conserver la même région et les mêmes créneaux.
  4. Mesurer premier chunk, débit, temps total et p50/p95.
  5. Enregistrer entrée, cache, reasoning, sortie et coût facturé.
  6. Noter acceptation, tool calls, relances, erreurs et correction humaine.
  7. Répéter avec une concurrence réaliste pour voir la variance.

La métrique principale doit être le coût par tâche acceptée dans le budget de latence. Le guide des modèles pour agents de code (en anglais) explique pourquoi modèle et harness doivent être testés ensemble.

Verdict final

GLM-5.3-FlashX est avant tout une voie rapide payante de la famille Flash. Les 200 tokens/s sont prometteurs et le surcoût absolu peut être faible pour une requête interactive. Les preuves publiques n'établissent ni un nouveau niveau d'intelligence, ni une vitesse garantie doublée, ni un SLA de bout en bout.

Utilisez FlashX lorsque l'attente a une valeur mesurable et gardez Flash comme référence de coût ailleurs.

Questions fréquentes

FlashX est-il plus intelligent que Flash ?

Aucune preuve publique ne l'établit. Les capacités et benchmarks de famille sont communs, sans comparaison qualitative appariée ni checkpoint FlashX séparé.

Atteint-il vraiment 200 tokens/s ?

C'est l'annonce officielle de Z.ai. Méthode, percentile, région, concurrence, forme du prompt et premier token ne sont pas publiés, et ce test ne l'a pas reproduite.

Combien coûte FlashX ?

$0.37 par million de tokens d'entrée non cachée, $0.075 pour l'entrée en cache et $1.25 pour la sortie, soit environ 2.5 fois Flash.

Prend-il en charge 1M de contexte et les images ?

Oui. La page commune documente 1M de contexte, jusqu'à 128K de sortie et les entrées vidéo, image, texte et fichier. Un long contexte ne garantit pas une faible latence.

Sources primaires

Preuves et calculs vérifiés le 19 septembre 2026. ID, prix, accès au Plan, latence et disponibilité gateway peuvent changer ; revérifiez les sources et lancez un test apparié avant de déplacer le trafic de production.