I principali modelli di immagini sono ora disponibili · GPT-Image, Nano Banana, Seedream e altri
Blog
Guida

Recensione GLM-5.3-FlashX

FlashX vende meno attesa, non un nuovo livello di intelligenza già dimostrato. Il prezzo circa 2,5 volte superiore ha senso solo nei percorsi sensibili alla latenza.

12 min di letturaOmniaKey
GLM-5.3-FlashXGLM-5.3-Flashlatenza APIprezzi APIrecensione modello

Questa recensione GLM-5.3-FlashX distingue una route hosted più veloce da un modello migliore. Z.ai pubblicizza 200 tokens/s, ma non ha pubblicato un confronto di qualità Flash contro FlashX a parità di condizioni, una distribuzione della latenza o il metodo di misurazione di quel numero.

Il verdetto pratico è semplice: provate FlashX quando una persona attende una lunga risposta in streaming o un ciclo di tool interattivo. Mantenete Flash per batch, agent in background e valutazioni offline, dove pagare circa 2,5 volte per token raramente produce valore misurabile.

Dati verificati il 19 settembre 2026. Abbiamo consultato documentazione, prezzi API, rapporto di lancio e model card aperta di Z.ai, oltre ai dati di Artificial Analysis per GLM-5.3-Flash normale. Non disponevamo di credenziali FlashX fatturabili, non abbiamo eseguito un test diretto della latenza e non presentiamo 200 tokens/s come risultato indipendente.

Il verdetto in breve

  • Provare prima FlashX: coding interattivo, ricerca dal vivo, Computer Use, assistenti clienti e output lunghi in streaming.
  • Tenere Flash come scelta di valore: code, estrazione documenti, review notturne, dati sintetici e automazione ad alto volume.
  • Non migrare solo per qualità: Z.ai non pubblica un checkpoint FlashX separato né un test abbinato che dimostri risposte migliori.

FlashX rispetto a Flash

CriterioGLM-5.3-FlashXGLM-5.3-Flash
ID modello APIglm-5.3-flashxglm-5.3-flash
Ruolo documentatoRoute hosted più veloceRoute economica e modello open-weight
Evidenza di velocitàZ.ai dichiara 200 tokens/s senza metodoMediana Artificial Analysis di 98.6 tokens/s
Input / cache / output$0.37 / $0.075 / $1.25 per 1M token$0.15 / $0.03 / $0.50
Contesto / output massimo1M / 128K token1M / 128K token
InputVideo, immagini, testo e fileVideo, immagini, testo e file
ThinkingObbligatorio, non disattivabileObbligatorio, non disattivabile
GLM Coding PlanNon incluso alla data di verificaIncluso con 3 volte la quota GLM-5.3
Pesi pubbliciNessun checkpoint dedicato documentatozai-org/GLM-5.3-Flash, MIT

La documentazione condivisa conferma lo stesso contratto pubblico di funzionalità. Non prova che serving interno, coerenza dell'output, tool call e affidabilità siano identici.

La pagina del modello GLM-5.3-Flash mantiene prezzo e stato correnti su OmniaKey. La presenza di glm-5.3-flashx presso Z.ai non garantisce lo stesso ID su ogni gateway; controllate il catalogo modelli live prima di cambiare il client.

Cosa dimostrano davvero 200 tokens/s

Z.ai non chiarisce se 200 sia picco, media o mediana, né regione, prompt, lunghezza dell'output, concorrenza, conteggio dei reasoning token o p95. Manca anche il tempo al primo token.

text
latenza end-to-end
  = attesa in coda
  + elaborazione prompt e primo token
  + token generati / throughput di decodifica
  + tempo di tool e rete

A 200 tokens/s perfettamente sostenuti, 100 token richiedono 0.5 secondi per il decode, 1,000 ne richiedono 5 e 4,000 ne richiedono 20. È aritmetica, non una misura FlashX. Le risposte brevi possono dipendere dal primo token e i prompt lunghi dal prefill.

I dati indipendenti riguardano Flash

Artificial Analysis riporta questi risultati per Flash normale tramite l'API Z.ai:

MetricaFlash normaleAmbito
Intelligence Index41.9Valutazione indipendente
Velocità mediana di output98.6 tokens/sCampioni API Z.ai
Tempo mediano al primo chunk2.43 secondiCampioni API Z.ai
Costo per task di valutazione$0.253Mix di task del valutatore

Questo non è un test FlashX. Dividere i 200 di Z.ai per la mediana indipendente 98.6 e dichiarare “2.03 volte più veloce” mescolerebbe metodi, date, workload e condizioni di traffico diversi.

Z.ai riporta inoltre 84.3 su Terminal-Bench 2.1, 63.4 su DeepSWE v1.1, 56.3 su NL2Repo e 48.8 su AutomationBench per la famiglia Flash. Sono risultati vendor-run di GLM-5.3-Flash, non prove di un guadagno qualitativo di FlashX. Il confronto GLM-5.3 e GLM-5.2 per il coding tratta la scelta generazionale.

Prezzi API ed esempio di costo

Z.ai elenca questi prezzi API diretti in USD per milione di token:

ModelloInputInput in cacheArchiviazione cacheOutput
GLM-5.3-Flash$0.15$0.03Gratis per un periodo limitato$0.50
GLM-5.3-FlashX$0.37$0.075Gratis per un periodo limitato$1.25
GLM-5.3$1.40$0.26Gratis per un periodo limitato$4.40

FlashX costa 2.47 volte Flash per l'input non in cache e 2.5 volte per input in cache e output. La gratuità temporanea riguarda l'archiviazione della cache, non elimina il costo di lettura dell'input in cache.

Con 100K token di input non in cache e 20K di output, Flash costa $0.0250, FlashX $0.0620 e GLM-5.3 completo $0.2280. Con 80K in cache e 20K non in cache, costano $0.0154 / $0.0384 / $0.1368. Mille esecuzioni del caso non in cache costano $25.00 / $62.00 / $228.00.

FlashX aggiunge $0.037 per esecuzione. Con un costo del lavoro di $30 l'ora, equivalgono a circa 4.4 secondi. È una soglia decisionale, non una misura che provi 4.4 secondi risparmiati.

Architettura e limiti di integrazione

GLM-5.3-Flash ha 320B parametri totali e 18B attivi per token, 45 layer e addestramento multimodale su 30T token. Combina sparse attention e linear attention. Z.ai dichiara 3.01 volte meno calcolo di attention e 4.44 volte meno KV Cache rispetto a GLM-5.3. Sono proprietà della famiglia Flash, non modifiche esclusive di FlashX.

I pesi di Flash normale sono disponibili con licenza MIT. Nelle fonti verificate, FlashX appare solo come ID hosted. Thinking non può essere disattivato; Z.ai raccomanda temperature: 1, top_p: 0.95, reasoning_effort: max, clear_thinking: false, stream: true e tool_stream: true per l'uso interattivo.

Un client che invia thinking.type: "disabled" deve migrare prima. reasoning_effort: max può aumentare reasoning token e tempo totale anche con decode rapido. Gli input multimodali richiedono ancora controlli su dimensione, formato, privacy e conservazione.

Quale route scegliere

WorkloadIniziare conMotivo
Coding o debugging interattivoFlashXUna persona attende reasoning, tool e output
Assistente clienti con risposte lungheFlashX dopo test p95La tail latency influenza l'esperienza
Computer Use o Browser UseFlashX dopo test di successoOgni turno blocca l'azione successiva
Review notturna o analisi CIFlashDi solito nessuno attende ogni token
Estrazione, classificazione, dati sinteticiFlashIl prezzo 2.5 volte maggiore si accumula senza vantaggio interattivo
Task difficile con errore costosoConfrontare Flash, FlashX e GLM-5.3Il tasso di accettazione può contare più di velocità e tariffa
Flusso GLM Coding PlanFlashFlashX non è incluso attualmente

Un router di produzione può usare entrambi gli ID: FlashX solo nel percorso interattivo critico, Flash per retry, indicizzazione, riassunti e post-processing.

Come confrontare FlashX correttamente

  1. Fissare task brevi, lunghi, tool-heavy e multimodali con criteri di accettazione.
  2. Inviare lo stesso prompt immutabile e la stessa tool policy ai due ID esatti.
  3. Randomizzare l'ordine mantenendo regione e finestre temporali uguali.
  4. Registrare primo chunk, velocità di decode, tempo totale e p50/p95.
  5. Registrare input, cache, reasoning, output e costo fatturato.
  6. Valutare risultati accettati, tool call, retry, errori e correzione umana.
  7. Ripetere con concorrenza realistica per osservare la variabilità.

La metrica principale dovrebbe essere costo per task accettato entro il budget di latenza. La guida ai modelli per coding agent (in inglese) spiega perché modello e Agent harness vanno provati insieme.

Verdetto finale

GLM-5.3-FlashX va inteso come corsia veloce a pagamento della famiglia Flash. I 200 tokens/s sono promettenti e il sovrapprezzo assoluto può essere piccolo per una richiesta interattiva. Le prove pubbliche non dimostrano un nuovo livello di intelligenza, una velocità 2 volte garantita o uno SLA end-to-end.

Usate FlashX dove l'attesa ha un valore misurabile e mantenete Flash come base di costo altrove.

Domande frequenti

FlashX è più intelligente di Flash?

Non esistono prove pubbliche. Ci sono capacità condivise e benchmark della famiglia, ma nessun confronto qualitativo abbinato né checkpoint FlashX separato.

Raggiunge davvero 200 tokens/s?

È il dato ufficiale di Z.ai. Metodo, percentile, regione, concorrenza, forma del prompt e primo token non sono pubblicati; questa recensione non lo ha riprodotto.

Quanto costa FlashX?

$0.37 per milione di token di input non in cache, $0.075 per input in cache e $1.25 per output, circa 2.5 volte Flash.

Supporta contesto 1M e immagini?

Sì. La pagina condivisa documenta contesto 1M, output fino a 128K e input video, immagini, testo e file. Un contesto lungo non garantisce bassa latenza.

Fonti primarie

Prove e calcoli verificati il 19 settembre 2026. ID, prezzi, accesso al Plan, latenza e disponibilità gateway possono cambiare; ricontrollate le fonti ed eseguite un test abbinato prima di spostare traffico di produzione.