Model gambar terkemuka kini tersedia · GPT-Image, Nano Banana, Seedream, dan lainnya
blog
Panduan

Ulasan GLM-5.3-FlashX

FlashX menjual waktu tunggu yang lebih singkat, bukan tingkat kecerdasan baru yang sudah terbukti. Harga sekitar 2,5 kali lipat hanya cocok untuk jalur sensitif latensi.

12 menit bacaOmniaKey
GLM-5.3-FlashXGLM-5.3-Flashlatensi APIharga APIulasan model

Ulasan GLM-5.3-FlashX ini memisahkan rute hosted yang lebih cepat dari model yang lebih baik. Z.ai mengiklankan 200 tokens/s, tetapi belum menerbitkan uji kualitas Flash versus FlashX dengan kondisi sama, distribusi latensi, atau metode pengukuran angka tersebut.

Kesimpulan praktisnya sederhana: uji FlashX ketika seseorang menunggu jawaban streaming panjang atau loop alat interaktif. Pertahankan Flash untuk batch, agent latar belakang, dan evaluasi offline, karena membayar sekitar 2,5 kali per token jarang menghasilkan nilai terukur di sana.

Fakta diperiksa pada 19 September 2026. Kami memakai dokumentasi model, harga API, laporan peluncuran, dan model card terbuka Z.ai, serta data Artificial Analysis untuk GLM-5.3-Flash reguler. Kami tidak memiliki kredensial FlashX yang dapat ditagih, tidak menjalankan pengujian latensi sendiri, dan tidak menyajikan 200 tokens/s sebagai hasil independen.

Kesimpulan singkat

  • Uji FlashX lebih dulu: coding interaktif, riset langsung, Computer Use, asisten pelanggan, dan keluaran streaming panjang.
  • Pertahankan Flash sebagai pilihan hemat: antrean, ekstraksi dokumen, review malam, data sintetis, dan otomatisasi bervolume tinggi.
  • Jangan pindah hanya demi kualitas: Z.ai tidak menerbitkan checkpoint FlashX terpisah atau hasil berpasangan yang membuktikan jawaban lebih baik.

FlashX dibanding Flash

PertimbanganGLM-5.3-FlashXGLM-5.3-Flash
ID model APIglm-5.3-flashxglm-5.3-flash
Peran terdokumentasiRute hosted lebih cepatRute hemat dan model open-weight
Bukti kecepatanZ.ai mengiklankan 200 tokens/s tanpa metodeMedian Artificial Analysis 98.6 tokens/s
Input / cache / output$0.37 / $0.075 / $1.25 per 1M token$0.15 / $0.03 / $0.50
Konteks / output maksimum1M / 128K token1M / 128K token
InputVideo, gambar, teks, dan fileVideo, gambar, teks, dan file
ThinkingWajib; tidak dapat dimatikanWajib; tidak dapat dimatikan
GLM Coding PlanBelum termasuk saat diperiksaTermasuk dengan kuota 3 kali GLM-5.3
Bobot publikTidak ada checkpoint khususzai-org/GLM-5.3-Flash, MIT

Dokumentasi bersama mendukung kontrak kemampuan publik yang sama. Itu tidak membuktikan bahwa serving internal, konsistensi keluaran, tool call, atau keandalannya identik.

Halaman model GLM-5.3-Flash memegang harga dan status rute OmniaKey terkini. Adanya glm-5.3-flashx di Z.ai tidak berarti ID yang sama tersedia di setiap gateway; periksa katalog model langsung sebelum mengubah client.

Apa yang benar-benar dibuktikan oleh 200 tokens/s?

Z.ai tidak menjelaskan apakah 200 adalah peak, mean, atau median; wilayah, prompt, panjang output, concurrency, perhitungan reasoning token, dan p95 juga tidak diberikan. Waktu menuju token pertama pun tidak tersedia.

text
latensi ujung ke ujung
  = waktu antre
  + pemrosesan prompt dan token pertama
  + token yang dihasilkan / throughput decode
  + waktu alat dan jaringan

Jika 200 tokens/s bertahan sempurna, 100 token membutuhkan 0.5 detik untuk decode, 1,000 membutuhkan 5 detik, dan 4,000 membutuhkan 20 detik. Ini aritmetika, bukan pengukuran FlashX. Jawaban pendek bisa didominasi token pertama, sedangkan prompt panjang oleh prefill.

Data independen hanya tersedia untuk Flash

Artificial Analysis melaporkan hasil berikut untuk Flash reguler melalui API Z.ai:

MetrikFlash regulerCakupan
Intelligence Index41.9Evaluasi independen
Median kecepatan output98.6 tokens/sSampel API Z.ai
Median waktu ke chunk pertama2.43 detikSampel API Z.ai
Biaya per tugas evaluasi$0.253Campuran tugas evaluator

Ini bukan pengujian FlashX. Membagi angka promosi 200 milik Z.ai dengan median independen 98.6 lalu menyebutnya “2.03 kali lebih cepat” akan mencampur metode, tanggal, workload, dan kondisi lalu lintas yang berbeda.

Z.ai juga melaporkan 84.3 pada Terminal-Bench 2.1, 63.4 pada DeepSWE v1.1, 56.3 pada NL2Repo, dan 48.8 pada AutomationBench untuk keluarga Flash. Hasil vendor-run GLM-5.3-Flash ini bukan bukti peningkatan kualitas FlashX. Perbandingan coding GLM-5.3 dan GLM-5.2 membahas keputusan antargenerasi.

Harga API dan contoh biaya

Z.ai mencantumkan harga API langsung berikut dalam USD per satu juta token:

ModelInputInput cachePenyimpanan cacheOutput
GLM-5.3-Flash$0.15$0.03Gratis untuk waktu terbatas$0.50
GLM-5.3-FlashX$0.37$0.075Gratis untuk waktu terbatas$1.25
GLM-5.3$1.40$0.26Gratis untuk waktu terbatas$4.40

FlashX berharga 2.47 kali Flash untuk input tanpa cache dan tepat 2.5 kali untuk input cache serta output. Penyimpanan cache gratis bersifat promosi dan tidak menghapus biaya baca input cache.

Untuk 100K input tanpa cache dan 20K output, Flash berbiaya $0.0250, FlashX $0.0620, dan GLM-5.3 penuh $0.2280. Jika 80K sudah di-cache dan 20K tidak, biayanya $0.0154 / $0.0384 / $0.1368. Seribu eksekusi kasus tanpa cache berbiaya $25.00 / $62.00 / $228.00.

FlashX menambah $0.037 per eksekusi. Dengan biaya tenaga kerja $30 per jam, itu setara sekitar 4.4 detik. Ini ambang keputusan, bukan pengukuran bahwa FlashX menghemat 4.4 detik.

Arsitektur dan batas integrasi

GLM-5.3-Flash memiliki 320B parameter total dan 18B aktif per token, 45 layer, serta pelatihan multimodal 30T-token. Model menggabungkan sparse attention dan linear attention. Z.ai menyatakan komputasi attention 3.01 kali lebih rendah dan KV Cache 4.44 kali lebih kecil dibanding GLM-5.3. Ini sifat keluarga Flash, bukan perubahan khusus FlashX.

Bobot Flash reguler tersedia dengan lisensi MIT. Dalam sumber yang diperiksa, FlashX hanya tampil sebagai ID hosted. Thinking tidak dapat dimatikan; Z.ai merekomendasikan temperature: 1, top_p: 0.95, reasoning_effort: max, clear_thinking: false, stream: true, dan tool_stream: true untuk penggunaan interaktif.

Client yang mengirim thinking.type: "disabled" harus diubah lebih dulu. reasoning_effort: max dapat menambah reasoning token dan waktu total walau decode cepat. Input multimodal tetap memerlukan pemeriksaan ukuran, format, privasi, dan retensi.

Rute mana yang dipilih?

WorkloadMulai denganAlasan
Coding atau debugging interaktifFlashXSeseorang menunggu reasoning, alat, dan output
Asisten pelanggan dengan jawaban panjangFlashX setelah uji p95Tail latency memengaruhi pengalaman
Computer Use atau Browser UseFlashX setelah uji keberhasilanSetiap giliran menghambat aksi berikutnya
Review malam atau analisis CIFlashBiasanya tidak ada orang menunggu tiap token
Ekstraksi, klasifikasi, data sintetis massalFlashHarga 2.5 kali menumpuk tanpa manfaat interaktif
Tugas sulit dengan kegagalan mahalBandingkan Flash, FlashX, dan GLM-5.3Tingkat penerimaan bisa lebih penting dari kecepatan dan tarif
Alur GLM Coding PlanFlashFlashX saat ini tidak termasuk

Router produksi dapat memakai kedua ID: FlashX hanya untuk jalur interaktif kritis, sedangkan retry, indexing, ringkasan, dan pascaproses tetap di Flash.

Cara membandingkan FlashX dengan benar

  1. Bekukan tugas pendek, panjang, tool-heavy, dan multimodal beserta kriteria penerimaannya.
  2. Kirim prompt tetap dan kebijakan alat yang sama ke kedua ID persis.
  3. Acak urutan serta samakan wilayah dan jendela waktu.
  4. Catat chunk pertama, kecepatan decode, waktu total, serta p50/p95.
  5. Catat input, cache, reasoning, output, dan biaya tertagih.
  6. Nilai hasil diterima, tool call, retry, error, dan koreksi manusia.
  7. Ulangi pada concurrency realistis agar variasi terlihat.

Metrik utama harus biaya per tugas yang diterima dalam anggaran latensi. Panduan model untuk coding agent (bahasa Inggris) menjelaskan mengapa model dan Agent harness harus diuji bersama.

Kesimpulan akhir

GLM-5.3-FlashX paling tepat dipahami sebagai jalur cepat berbayar untuk keluarga Flash. Klaim 200 tokens/s menjanjikan, dan tambahan biaya absolut bisa kecil untuk permintaan interaktif. Bukti publik tidak menunjukkan tingkat kecerdasan baru, kecepatan 2 kali yang dijamin, atau SLA ujung ke ujung.

Gunakan FlashX ketika waktu tunggu punya nilai terukur; pertahankan Flash sebagai dasar biaya di tempat lain.

Pertanyaan umum

Apakah FlashX lebih pintar dari Flash?

Tidak ada bukti publik. Ada kemampuan bersama dan benchmark keluarga, tetapi tidak ada perbandingan kualitas berpasangan atau checkpoint FlashX terpisah.

Benarkah mencapai 200 tokens/s?

Itu klaim resmi Z.ai. Metode, persentil, wilayah, concurrency, bentuk prompt, dan token pertama tidak dipublikasikan; ulasan ini juga tidak mereproduksinya.

Berapa harga FlashX?

$0.37 per juta token input tanpa cache, $0.075 untuk input cache, dan $1.25 untuk output, sekitar 2.5 kali harga Flash.

Apakah mendukung konteks 1M dan gambar?

Ya. Halaman bersama mendokumentasikan konteks 1M, output hingga 128K, serta input video, gambar, teks, dan file. Konteks panjang bukan jaminan latensi rendah.

Sumber utama

Bukti dan perhitungan diperiksa pada 19 September 2026. ID, harga, akses Plan, latensi, dan ketersediaan gateway dapat berubah; periksa ulang sumber dan jalankan uji berpasangan sebelum memindahkan trafik produksi.