GLM-5.3-FlashX Test
FlashX verkauft kürzere Wartezeit, keine nachgewiesene neue Intelligenzstufe. Der rund 2,5-fache Preis passt daher nur zu latenzkritischen Pfaden.
Dieser GLM-5.3-FlashX Test trennt eine schnellere gehostete Route von einem besseren Modell. Z.ai wirbt mit 200 tokens/s, veröffentlicht aber weder einen kontrollierten Qualitätsvergleich von Flash und FlashX noch eine Latenzverteilung oder die Messmethode hinter dieser Zahl.
Das praktische Urteil: FlashX sollte getestet werden, wenn Menschen auf lange Streaming-Antworten oder interaktive Tool-Schleifen warten. Für Batch-Jobs, Hintergrund-Agenten und Offline-Evaluationen bleibt Flash die sinnvolle Vorgabe, weil ein rund 2,5-facher Tokenpreis dort selten messbaren Mehrwert erzeugt.
Fakten geprüft am 19. September 2026. Grundlage sind Z.ai-Modellunterlagen, API-Preise, Launch-Bericht und offene Modellkarte sowie Artificial-Analysis-Daten für reguläres GLM-5.3-Flash. Wir hatten keinen abrechenbaren FlashX-Zugang, haben keinen eigenen Latenztest durchgeführt und behandeln 200 tokens/s nicht als unabhängig bestätigtes Ergebnis.
Das Urteil in Kürze
- FlashX zuerst testen: interaktives Coding, Live-Recherche, Computer Use, Kundenassistenten und lange Streaming-Ausgaben.
- Flash als Preis-Leistungs-Standard: Warteschlangen, Dokumentextraktion, nächtliche Reviews, synthetische Daten und Massenautomatisierung.
- Nicht allein wegen Qualität wechseln: Z.ai zeigt weder einen eigenen FlashX-Checkpoint noch einen kontrollierten Qualitätsvorteil.
FlashX und Flash im Vergleich
| Entscheidungspunkt | GLM-5.3-FlashX | GLM-5.3-Flash |
|---|---|---|
| API-Modell-ID | glm-5.3-flashx | glm-5.3-flash |
| Dokumentierte Rolle | Schnellere gehostete Route | Günstige Route und Open-Weight-Modell |
| Geschwindigkeitsbeleg | Z.ai nennt 200 tokens/s ohne Methode | Artificial Analysis misst im Median 98.6 tokens/s |
| Input / Cache-Input / Output | $0.37 / $0.075 / $1.25 je 1M Tokens | $0.15 / $0.03 / $0.50 |
| Kontext / maximaler Output | 1M / 128K Tokens | 1M / 128K Tokens |
| Eingaben | Video, Bild, Text und Dateien | Video, Bild, Text und Dateien |
| Thinking | Pflicht; nicht abschaltbar | Pflicht; nicht abschaltbar |
| GLM Coding Plan | Zum Prüfzeitpunkt nicht enthalten | Mit 3-fachem GLM-5.3-Kontingent enthalten |
| Öffentliche Gewichte | Kein eigener Checkpoint dokumentiert | zai-org/GLM-5.3-Flash, MIT |
Die gemeinsame Dokumentation belegt denselben öffentlichen Funktionsvertrag. Sie beweist nicht, dass internes Serving, Ausgabekonsistenz, Tool Calls und Zuverlässigkeit identisch sind.
Die Modellseite zu GLM-5.3-Flash führt den aktuellen OmniaKey-Preis und Routenstatus. Ein Z.ai-Modell namens glm-5.3-flashx ist nicht automatisch bei jedem Gateway verfügbar; prüfen Sie vor einer Umstellung den Live-Modellkatalog.
Was 200 tokens/s tatsächlich belegen
Z.ai erklärt nicht, ob 200 ein Spitzenwert, Mittelwert oder Median ist. Region, Prompt, Ausgabelänge, Parallelität, Behandlung von Reasoning Tokens und p95 fehlen ebenfalls. Auch Time to First Token ist unbekannt.
End-to-End-Latenz
= Warteschlange
+ Prompt-Verarbeitung und erstes Token
+ erzeugte Tokens / Decode-Durchsatz
+ Tool- und Netzwerkzeit
Bei konstanten 200 tokens/s dauern 100 Tokens rechnerisch 0.5 Sekunden, 1,000 Tokens 5 Sekunden und 4,000 Tokens 20 Sekunden. Das ist Mathematik, keine FlashX-Messung. Bei kurzen Antworten kann das erste Token dominieren, bei langen Prompts das Prefill.
Unabhängige Daten gibt es nur für Flash
Artificial Analysis meldet für reguläres Flash über die Z.ai-API:
| Kennzahl | Reguläres Flash | Umfang |
|---|---|---|
| Intelligence Index | 41.9 | Unabhängige Evaluation |
| Medianer Output-Durchsatz | 98.6 tokens/s | Z.ai-API-Samples |
| Mediane Zeit bis zum ersten Chunk | 2.43 Sekunden | Z.ai-API-Samples |
| Kosten je Intelligence-Evaluation | $0.253 | Task-Mix des Evaluators |
Das ist kein FlashX-Test. Z.ai 200 durch den unabhängigen Median 98.6 zu teilen und „2.03-mal schneller“ zu behaupten, vermischt Methoden, Zeitpunkte, Workloads und Verkehrsbedingungen.
Z.ai berichtet für die Flash-Familie außerdem 84.3 in Terminal-Bench 2.1, 63.4 in DeepSWE v1.1, 56.3 in NL2Repo und 48.8 in AutomationBench. Diese herstellerseitigen GLM-5.3-Flash-Werte belegen keinen Qualitätsgewinn durch FlashX. Der Coding-Vergleich von GLM-5.3 und GLM-5.2 behandelt die Generationenentscheidung.
API-Preise und Kostenbeispiel
Z.ai nennt für die direkte API folgende USD-Preise je eine Million Tokens:
| Modell | Input | Cache-Input | Cache-Speicher | Output |
|---|---|---|---|---|
| GLM-5.3-Flash | $0.15 | $0.03 | Zeitlich begrenzt kostenlos | $0.50 |
| GLM-5.3-FlashX | $0.37 | $0.075 | Zeitlich begrenzt kostenlos | $1.25 |
| GLM-5.3 | $1.40 | $0.26 | Zeitlich begrenzt kostenlos | $4.40 |
FlashX kostet beim nicht gecachten Input 2.47-mal und bei Cache-Input und Output genau 2.5-mal so viel wie Flash. Der zeitlich kostenlose Cache-Speicher ist eine Aktion und erlässt nicht die Lesegebühr für Cache-Input.
100K nicht gecachte Input-Tokens plus 20K Output kosten mit Flash $0.0250, FlashX $0.0620 und vollem GLM-5.3 $0.2280. Bei 80K Cache-Input und 20K nicht gecachtem Input sind es $0.0154 / $0.0384 / $0.1368. 1,000 Durchläufe des ersten Beispiels kosten $25.00 / $62.00 / $228.00.
FlashX kostet pro Lauf $0.037 mehr. Bei Vollkosten von $30 pro Arbeitsstunde entspricht das rund 4.4 Sekunden. Das ist ein Entscheidungsschwellenwert, kein Beleg für 4.4 Sekunden Ersparnis.
Architektur und Integrationsgrenzen
GLM-5.3-Flash besitzt 320B Parameter insgesamt und aktiviert 18B je Token. Das 45-Schichten-Modell kombiniert sparse und linear attention und wurde auf einem multimodalen 30T-Token-Korpus trainiert. Z.ai nennt 3.01-mal weniger Attention-Rechenaufwand und 4.44-mal weniger KV Cache als GLM-5.3. Das sind Eigenschaften der Flash-Familie, nicht exklusive FlashX-Änderungen.
Die regulären Flash-Gewichte stehen unter MIT. In den geprüften Quellen erscheint FlashX nur als gehostete ID. Thinking lässt sich nicht abschalten; für Interaktion empfiehlt Z.ai temperature: 1, top_p: 0.95, reasoning_effort: max, clear_thinking: false, stream: true und tool_stream: true.
Clients mit thinking.type: "disabled" müssen zuerst angepasst werden. reasoning_effort: max kann Reasoning Tokens und Gesamtzeit erhöhen, selbst wenn das Decoding schnell ist. Multimodale Eingaben brauchen weiterhin Prüfungen für Größe, Format, Datenschutz und Aufbewahrung.
Welche Route passt?
| Workload | Start mit | Warum |
|---|---|---|
| Interaktives Coding oder Debugging | FlashX | Menschen warten auf Reasoning, Tools und Ausgabe |
| Kundenassistent mit langen Antworten | FlashX nach p95-Test | Tail-Latenz prägt die Erfahrung |
| Computer Use oder Browser Use | FlashX nach Erfolgsratentest | Jeder Turn blockiert die nächste Aktion |
| Nächtliches Review oder CI-Analyse | Flash | Niemand wartet üblicherweise Token für Token |
| Massenextraktion, Klassifikation, synthetische Daten | Flash | 2.5-facher Preis ohne Interaktionsnutzen |
| Schwierige Aufgabe mit teurem Fehler | Flash, FlashX und GLM-5.3 vergleichen | Akzeptanzrate kann wichtiger sein als Tempo und Preis |
| GLM Coding Plan | Flash | FlashX ist derzeit nicht enthalten |
Ein Produktionsrouter kann beide IDs einsetzen: FlashX nur im interaktiven kritischen Pfad, Flash für Retries, Indexierung, Zusammenfassungen und Nachbearbeitung.
So wird FlashX sauber verglichen
- Kurze, lange, tool-lastige und multimodale Aufgaben samt Akzeptanzkriterien einfrieren.
- Identischen Prompt und dieselbe Tool Policy an beide exakten IDs senden.
- Reihenfolge randomisieren sowie Region und Zeitfenster angleichen.
- First Chunk, Decode-Durchsatz, End-to-End-Zeit und p50/p95 erfassen.
- Input, Cache, Reasoning, Output und tatsächliche Rechnung speichern.
- Akzeptanz, Tool Calls, Retries, Fehler und menschliche Korrektur bewerten.
- Mit realistischer Parallelität oft genug wiederholen.
Die Hauptkennzahl lautet Kosten je akzeptierter Aufgabe innerhalb des Latenzbudgets. Warum Modell und Agent Harness gemeinsam geprüft werden müssen, erklärt der Leitfaden zu Coding-Agent-Modellen (Englisch).
Fazit
GLM-5.3-FlashX ist am besten als bezahlte Schnellspur der Flash-Familie zu verstehen. 200 tokens/s sind vielversprechend, und der absolute Aufpreis kann bei interaktiven Anfragen klein sein. Öffentliche Belege zeigen aber weder eine neue Intelligenzstufe noch garantierte doppelte Geschwindigkeit oder ein End-to-End-SLA.
Nutzen Sie FlashX dort, wo Wartezeit messbaren Wert hat, und behalten Sie Flash sonst als Kostenbasis.
Häufige Fragen
Ist FlashX intelligenter als Flash?
Dafür gibt es keinen öffentlichen Beleg. Es gibt gemeinsame Fähigkeiten und Benchmarks der Flash-Familie, aber keinen kontrollierten Qualitätsvergleich und keinen eigenen FlashX-Checkpoint.
Erreicht FlashX wirklich 200 tokens/s?
Das ist Z.ai offizielle Angabe. Methode, Perzentil, Region, Parallelität, Prompt-Form und erstes Token sind nicht veröffentlicht; dieser Test hat sie nicht reproduziert.
Was kostet FlashX?
$0.37 je Million nicht gecachter Input-Tokens, $0.075 für Cache-Input und $1.25 für Output, also etwa 2.5-mal so viel wie Flash.
Unterstützt FlashX 1M Kontext und Bilder?
Ja. Dokumentiert sind 1M Kontext, bis zu 128K Output sowie Video-, Bild-, Text- und Dateieingaben. Langer Kontext garantiert keine niedrige Latenz.
Primärquellen
- Z.ai-Dokumentation zu GLM-5.3-Flash und FlashX (Englisch)
- Z.ai API-Preise (Englisch)
- Z.ai Launch-Bericht zu GLM-5.3-Flash (Englisch)
- Offene GLM-5.3-Flash-Modellkarte (Englisch)
- Artificial Analysis zu GLM-5.3-Flash (Englisch)
Belege und Berechnungen wurden am 19. September 2026 geprüft. IDs, Preise, Plan-Zugang, Latenz und Gateway-Verfügbarkeit können sich ändern; prüfen Sie vor Produktionsverkehr die Primärquellen und führen Sie einen kontrollierten Vergleich durch.