Führende Bildmodelle sind jetzt verfügbar · GPT-Image, Nano Banana, Seedream und mehr
Blog
Leitfaden

GLM-5.3-FlashX Test

FlashX verkauft kürzere Wartezeit, keine nachgewiesene neue Intelligenzstufe. Der rund 2,5-fache Preis passt daher nur zu latenzkritischen Pfaden.

12 Min. LesezeitOmniaKey
GLM-5.3-FlashXGLM-5.3-FlashAPI-LatenzAPI-PreiseModelltest

Dieser GLM-5.3-FlashX Test trennt eine schnellere gehostete Route von einem besseren Modell. Z.ai wirbt mit 200 tokens/s, veröffentlicht aber weder einen kontrollierten Qualitätsvergleich von Flash und FlashX noch eine Latenzverteilung oder die Messmethode hinter dieser Zahl.

Das praktische Urteil: FlashX sollte getestet werden, wenn Menschen auf lange Streaming-Antworten oder interaktive Tool-Schleifen warten. Für Batch-Jobs, Hintergrund-Agenten und Offline-Evaluationen bleibt Flash die sinnvolle Vorgabe, weil ein rund 2,5-facher Tokenpreis dort selten messbaren Mehrwert erzeugt.

Fakten geprüft am 19. September 2026. Grundlage sind Z.ai-Modellunterlagen, API-Preise, Launch-Bericht und offene Modellkarte sowie Artificial-Analysis-Daten für reguläres GLM-5.3-Flash. Wir hatten keinen abrechenbaren FlashX-Zugang, haben keinen eigenen Latenztest durchgeführt und behandeln 200 tokens/s nicht als unabhängig bestätigtes Ergebnis.

Das Urteil in Kürze

  • FlashX zuerst testen: interaktives Coding, Live-Recherche, Computer Use, Kundenassistenten und lange Streaming-Ausgaben.
  • Flash als Preis-Leistungs-Standard: Warteschlangen, Dokumentextraktion, nächtliche Reviews, synthetische Daten und Massenautomatisierung.
  • Nicht allein wegen Qualität wechseln: Z.ai zeigt weder einen eigenen FlashX-Checkpoint noch einen kontrollierten Qualitätsvorteil.

FlashX und Flash im Vergleich

EntscheidungspunktGLM-5.3-FlashXGLM-5.3-Flash
API-Modell-IDglm-5.3-flashxglm-5.3-flash
Dokumentierte RolleSchnellere gehostete RouteGünstige Route und Open-Weight-Modell
GeschwindigkeitsbelegZ.ai nennt 200 tokens/s ohne MethodeArtificial Analysis misst im Median 98.6 tokens/s
Input / Cache-Input / Output$0.37 / $0.075 / $1.25 je 1M Tokens$0.15 / $0.03 / $0.50
Kontext / maximaler Output1M / 128K Tokens1M / 128K Tokens
EingabenVideo, Bild, Text und DateienVideo, Bild, Text und Dateien
ThinkingPflicht; nicht abschaltbarPflicht; nicht abschaltbar
GLM Coding PlanZum Prüfzeitpunkt nicht enthaltenMit 3-fachem GLM-5.3-Kontingent enthalten
Öffentliche GewichteKein eigener Checkpoint dokumentiertzai-org/GLM-5.3-Flash, MIT

Die gemeinsame Dokumentation belegt denselben öffentlichen Funktionsvertrag. Sie beweist nicht, dass internes Serving, Ausgabekonsistenz, Tool Calls und Zuverlässigkeit identisch sind.

Die Modellseite zu GLM-5.3-Flash führt den aktuellen OmniaKey-Preis und Routenstatus. Ein Z.ai-Modell namens glm-5.3-flashx ist nicht automatisch bei jedem Gateway verfügbar; prüfen Sie vor einer Umstellung den Live-Modellkatalog.

Was 200 tokens/s tatsächlich belegen

Z.ai erklärt nicht, ob 200 ein Spitzenwert, Mittelwert oder Median ist. Region, Prompt, Ausgabelänge, Parallelität, Behandlung von Reasoning Tokens und p95 fehlen ebenfalls. Auch Time to First Token ist unbekannt.

text
End-to-End-Latenz
  = Warteschlange
  + Prompt-Verarbeitung und erstes Token
  + erzeugte Tokens / Decode-Durchsatz
  + Tool- und Netzwerkzeit

Bei konstanten 200 tokens/s dauern 100 Tokens rechnerisch 0.5 Sekunden, 1,000 Tokens 5 Sekunden und 4,000 Tokens 20 Sekunden. Das ist Mathematik, keine FlashX-Messung. Bei kurzen Antworten kann das erste Token dominieren, bei langen Prompts das Prefill.

Unabhängige Daten gibt es nur für Flash

Artificial Analysis meldet für reguläres Flash über die Z.ai-API:

KennzahlReguläres FlashUmfang
Intelligence Index41.9Unabhängige Evaluation
Medianer Output-Durchsatz98.6 tokens/sZ.ai-API-Samples
Mediane Zeit bis zum ersten Chunk2.43 SekundenZ.ai-API-Samples
Kosten je Intelligence-Evaluation$0.253Task-Mix des Evaluators

Das ist kein FlashX-Test. Z.ai 200 durch den unabhängigen Median 98.6 zu teilen und „2.03-mal schneller“ zu behaupten, vermischt Methoden, Zeitpunkte, Workloads und Verkehrsbedingungen.

Z.ai berichtet für die Flash-Familie außerdem 84.3 in Terminal-Bench 2.1, 63.4 in DeepSWE v1.1, 56.3 in NL2Repo und 48.8 in AutomationBench. Diese herstellerseitigen GLM-5.3-Flash-Werte belegen keinen Qualitätsgewinn durch FlashX. Der Coding-Vergleich von GLM-5.3 und GLM-5.2 behandelt die Generationenentscheidung.

API-Preise und Kostenbeispiel

Z.ai nennt für die direkte API folgende USD-Preise je eine Million Tokens:

ModellInputCache-InputCache-SpeicherOutput
GLM-5.3-Flash$0.15$0.03Zeitlich begrenzt kostenlos$0.50
GLM-5.3-FlashX$0.37$0.075Zeitlich begrenzt kostenlos$1.25
GLM-5.3$1.40$0.26Zeitlich begrenzt kostenlos$4.40

FlashX kostet beim nicht gecachten Input 2.47-mal und bei Cache-Input und Output genau 2.5-mal so viel wie Flash. Der zeitlich kostenlose Cache-Speicher ist eine Aktion und erlässt nicht die Lesegebühr für Cache-Input.

100K nicht gecachte Input-Tokens plus 20K Output kosten mit Flash $0.0250, FlashX $0.0620 und vollem GLM-5.3 $0.2280. Bei 80K Cache-Input und 20K nicht gecachtem Input sind es $0.0154 / $0.0384 / $0.1368. 1,000 Durchläufe des ersten Beispiels kosten $25.00 / $62.00 / $228.00.

FlashX kostet pro Lauf $0.037 mehr. Bei Vollkosten von $30 pro Arbeitsstunde entspricht das rund 4.4 Sekunden. Das ist ein Entscheidungsschwellenwert, kein Beleg für 4.4 Sekunden Ersparnis.

Architektur und Integrationsgrenzen

GLM-5.3-Flash besitzt 320B Parameter insgesamt und aktiviert 18B je Token. Das 45-Schichten-Modell kombiniert sparse und linear attention und wurde auf einem multimodalen 30T-Token-Korpus trainiert. Z.ai nennt 3.01-mal weniger Attention-Rechenaufwand und 4.44-mal weniger KV Cache als GLM-5.3. Das sind Eigenschaften der Flash-Familie, nicht exklusive FlashX-Änderungen.

Die regulären Flash-Gewichte stehen unter MIT. In den geprüften Quellen erscheint FlashX nur als gehostete ID. Thinking lässt sich nicht abschalten; für Interaktion empfiehlt Z.ai temperature: 1, top_p: 0.95, reasoning_effort: max, clear_thinking: false, stream: true und tool_stream: true.

Clients mit thinking.type: "disabled" müssen zuerst angepasst werden. reasoning_effort: max kann Reasoning Tokens und Gesamtzeit erhöhen, selbst wenn das Decoding schnell ist. Multimodale Eingaben brauchen weiterhin Prüfungen für Größe, Format, Datenschutz und Aufbewahrung.

Welche Route passt?

WorkloadStart mitWarum
Interaktives Coding oder DebuggingFlashXMenschen warten auf Reasoning, Tools und Ausgabe
Kundenassistent mit langen AntwortenFlashX nach p95-TestTail-Latenz prägt die Erfahrung
Computer Use oder Browser UseFlashX nach ErfolgsratentestJeder Turn blockiert die nächste Aktion
Nächtliches Review oder CI-AnalyseFlashNiemand wartet üblicherweise Token für Token
Massenextraktion, Klassifikation, synthetische DatenFlash2.5-facher Preis ohne Interaktionsnutzen
Schwierige Aufgabe mit teurem FehlerFlash, FlashX und GLM-5.3 vergleichenAkzeptanzrate kann wichtiger sein als Tempo und Preis
GLM Coding PlanFlashFlashX ist derzeit nicht enthalten

Ein Produktionsrouter kann beide IDs einsetzen: FlashX nur im interaktiven kritischen Pfad, Flash für Retries, Indexierung, Zusammenfassungen und Nachbearbeitung.

So wird FlashX sauber verglichen

  1. Kurze, lange, tool-lastige und multimodale Aufgaben samt Akzeptanzkriterien einfrieren.
  2. Identischen Prompt und dieselbe Tool Policy an beide exakten IDs senden.
  3. Reihenfolge randomisieren sowie Region und Zeitfenster angleichen.
  4. First Chunk, Decode-Durchsatz, End-to-End-Zeit und p50/p95 erfassen.
  5. Input, Cache, Reasoning, Output und tatsächliche Rechnung speichern.
  6. Akzeptanz, Tool Calls, Retries, Fehler und menschliche Korrektur bewerten.
  7. Mit realistischer Parallelität oft genug wiederholen.

Die Hauptkennzahl lautet Kosten je akzeptierter Aufgabe innerhalb des Latenzbudgets. Warum Modell und Agent Harness gemeinsam geprüft werden müssen, erklärt der Leitfaden zu Coding-Agent-Modellen (Englisch).

Fazit

GLM-5.3-FlashX ist am besten als bezahlte Schnellspur der Flash-Familie zu verstehen. 200 tokens/s sind vielversprechend, und der absolute Aufpreis kann bei interaktiven Anfragen klein sein. Öffentliche Belege zeigen aber weder eine neue Intelligenzstufe noch garantierte doppelte Geschwindigkeit oder ein End-to-End-SLA.

Nutzen Sie FlashX dort, wo Wartezeit messbaren Wert hat, und behalten Sie Flash sonst als Kostenbasis.

Häufige Fragen

Ist FlashX intelligenter als Flash?

Dafür gibt es keinen öffentlichen Beleg. Es gibt gemeinsame Fähigkeiten und Benchmarks der Flash-Familie, aber keinen kontrollierten Qualitätsvergleich und keinen eigenen FlashX-Checkpoint.

Erreicht FlashX wirklich 200 tokens/s?

Das ist Z.ai offizielle Angabe. Methode, Perzentil, Region, Parallelität, Prompt-Form und erstes Token sind nicht veröffentlicht; dieser Test hat sie nicht reproduziert.

Was kostet FlashX?

$0.37 je Million nicht gecachter Input-Tokens, $0.075 für Cache-Input und $1.25 für Output, also etwa 2.5-mal so viel wie Flash.

Unterstützt FlashX 1M Kontext und Bilder?

Ja. Dokumentiert sind 1M Kontext, bis zu 128K Output sowie Video-, Bild-, Text- und Dateieingaben. Langer Kontext garantiert keine niedrige Latenz.

Primärquellen

Belege und Berechnungen wurden am 19. September 2026 geprüft. IDs, Preise, Plan-Zugang, Latenz und Gateway-Verfügbarkeit können sich ändern; prüfen Sie vor Produktionsverkehr die Primärquellen und führen Sie einen kontrollierten Vergleich durch.